ByteDance hat kürzlich ein neues Tool zur Musikproduktion namens Seed-Music veröffentlicht. Dieses erstaunliche Musikgenerierungsmodell ermöglicht es Ihnen, mithilfe verschiedener Eingabemethoden (z. B. Textbeschreibungen, Audioreferenzen, Noten oder sogar Sprachbefehle) mühelos Musik zu erstellen – wie mit einem musikalischen Zauberer!
Seed-Music kombiniert autoregressive Sprachmodelle und Diffusionsmodelle. Es generiert nicht nur hochwertige Musikstücke, sondern ermöglicht auch eine präzise Steuerung der Musikdetails. Egal, ob Sie eine Melodie zu einem Text komponieren oder eine Melodie bearbeiten möchten, hier ist alles möglich. Sie können sogar ein kurzes Sprachfragment hochladen, das das System automatisch in einen vollständigen Gesang umwandelt – einfach und effizient.
Das leistungsstarke Seed-Music unterstützt nicht nur die Generierung von Gesang und Instrumentalstimmen, sondern bietet auch Funktionen wie Gesangssynthese, Gesangsumwandlung und Musikbearbeitung, um die Bedürfnisse verschiedener Benutzer zu erfüllen. Sie können mit einfachen Textbeschreibungen Popmusik generieren oder mit Audiohinweisen den Musikstil anpassen – wirklich beeindruckend.
Noch interessanter ist, dass die Architektur von Seed-Music aus drei Modulen besteht: einem Repräsentationslernmodul, einem Generierungsmodul und einem Rendermodul. Diese Module arbeiten wie eine Band zusammen und erzeugen mithilfe multimodaler Eingaben hochwertige Musik.

Das Repräsentationslernmodul komprimiert die ursprünglichen Audiosignale in drei Zwischenrepräsentationen, die für verschiedene Musikgenerierungs- und Bearbeitungsaufgaben geeignet sind. Das Generierungsmodul wandelt die Benutzereingaben mithilfe autoregressiver Modelle und Diffusionsmodelle in Musikrepräsentationen um. Das letzte Rendermodul wandelt diese Zwischenrepräsentationen in hochwertiges, hörbares Audio um.
Um die Musikqualität zu gewährleisten, verwendet Seed-Music verschiedene Technologien: Autoregressive Sprachmodelle generieren schrittweise Audiosymbole, Diffusionsmodelle verbessern die Klarheit der Musik durch Entrauschung, und ein Vocoder übersetzt diesen Musik-"Code" in hochauflösenden, abspielbaren Sound.
Der Trainingsprozess von Seed-Music ist ebenfalls interessant und umfasst drei Phasen: Pretraining, Feinabstimmung und Nachtraining. Durch massive Musikdaten erwirbt das Modell grundlegende Fähigkeiten, die Feinabstimmung verbessert die Leistung bei bestimmten Aufgaben, und schließlich optimiert das Reinforcement Learning die Ergebnisse kontinuierlich.
Projektseite: https://team.doubao.com/en/special/seed-music





