Suno spricht jetzt – und bringt seinen eigenen Soundtrack mit

Am 1. Oktober öffnete Suno Speech als öffentliche Beta für alle Nutzer im Web, auf iOS und Android. Man tippt eine Idee, ein Gedicht oder ein bereits geschriebenes Skript ein und beschreibt dann die Stimme und die musikalische Stimmung, die darunter liegen soll. Speech liefert beides als einen einzigen Track zurück.
Suno-Chief-Product-Officer Jack Brody beschrieb es in der Ankündigung als das erste Audiomodell, das Stimme und Musik gemeinsam als einen zusammenhängenden Track erzeugt. Diese Rahmung ist das ganze Produkt. Zahlreiche Tools erzeugen eine synthetische Stimme, und ebenso viele erzeugen Musik. Das Versprechen hier ist, dass Rhythmus und Stimmung auf die Bedeutung abgestimmt werden, während beides generiert wird, statt danach in einem Editor zusammengeschraubt zu werden – wo jedes Amateur-Podcast-Intro elendiglich verendet.
Die Mechanik ist bewusst einfach. Der einfache Modus nimmt einen natürlichsprachlichen Prompt, etwa „ein Kapitän, der seine Crew vor einem Sturm um sich schart“, und erzeugt sowohl die Sprache als auch die Musik. Der erweiterte Modus nimmt ein exaktes Skript und bietet Regler für Stimmgeschlecht, Gesangsstil, Tempo und den Grad an Variation, den jede Generierung haben soll. Es gibt einen Schalter, um die Musik ganz wegzulassen, wenn nur eine saubere Erzählung gewünscht ist. Die Beta begrenzt eine Generierung auf ungefähr acht Minuten.
Was Beta hier bedeutet
Suno ist ungewöhnlich offen über den Zustand der Sache. Brodys Notiz sagt, ein britischer Akzent könne gelegentlich nach Australien abschweifen und zurück, und dramatische Pausen könnten sehr dramatisch sein. Diese Art von Offenlegung ist in Launch-Posts seltener, als sie sein sollte, und sie verrät etwas darüber, wo die Stimmmodellierung noch steht.
Das Unternehmen nannte außerdem keine unterstützten Sprachen, was bedeutet, dass die Leistung außerhalb des Englischen unbestätigt ist, bis man sie ausprobiert. Angesichts der Tatsache, dass Sunos bestehendes Publikum global ist, ist das Fehlen einer Sprachliste bei einem Speech-Launch eher ein Signal als ein Versehen. Voice-Cloning ist im Englischen schwierig und in Sprachen mit reicheren Tonsystemen noch schwieriger, und Suno liefert aus, bevor es viel versprechen kann.
Auch zu Preisstufen, Generierungslimits oder kommerziellen Rechten an den Audiodaten wurde nichts gesagt. Diese finden sich in den Plandetails, und wer Speech für Kundenarbeit nutzen will, sollte sie angesichts von Sunos Geschichte sorgfältig lesen.
Die Lizenzwende
Sunos letztes Jahr war ein langsamer Wandel vom Scraping zum Signieren. Am 9. September veröffentlichte es v6, eine Generation von Musikmodellen, die mit Warner Music Group, BMG und Believe entwickelt wurde. Die Familie hat drei Teile: das Flaggschiff v6 und ein explorationsorientiertes v6-wild für Pro- und Premier-Abonnenten sowie v6-mini für alle. Suno sagt, v6 könne einen Teil eines bestehenden Songs mit einfacher Sprache bearbeiten, aus mehreren Quellen in einer Anfrage einen Mashup bauen, Audio isolieren, um einen neuen Beat zu bauen, Musik aus Text, Audio, Bildern und Video erstellen und eine einzelne Songzeile neu schreiben, ohne den ganzen Song neu aufzubauen. Während v6 ausgerollt wird, plant das Unternehmen, seine älteren Modelle auszumustern und die Plattform vollständig auf die neue Generation umzustellen.
Das ist ein echtes Fähigkeits-Upgrade und zugleich eine Rechtsstrategie. Die Lizenzdeals verwandeln Suno von einem Beklagten in einen Partner, und die Opt-in-Künstlererfahrungen, die das Unternehmen nach eigenen Angaben aufbaut, bei denen Künstler sich entscheiden können mitzumachen und bezahlt zu werden, sind die Form eines Geschäfts, das nicht mehr verklagt werden will.
Die Klagen haben nicht aufgehört. Sony Music und Universal Music Group verklagten Suno wegen Urheberrechtsverletzung, und im September 2026 erweiterten die Labels den Fall um den Vorwurf des Model Laundering: ältere, angeblich rechtsverletzende Modelle zu nutzen, um synthetisches Audio für das Training neuerer Modelle zu erzeugen. Das ist ein schärferer Vorwurf als das Training mit gescrapten Songs, denn er beschreibt eine Kette von Rechtsverletzungen, die weitergeht, nachdem ein Unternehmen erklärt hat, es habe aufgeräumt.
Unterdessen sagte CEO Mikey Shulman am selben Tag wie der Speech-Launch gegenüber Bloomberg, Suno liege deutlich über den 2 Millionen Abonnenten und 300 Millionen Dollar Umsatz, die es zuletzt gemeldet hatte. Ein so großes Unternehmen, das in Sprache expandiert, tut mehr, als nur ein Feature hinzuzufügen. Es baut ein Portfolio generativer Audio-Tools unter einem Abonnement auf, damit Kunden weniger Grund haben zu gehen.
Für wen dies Arbeit verdichtet
Die richtige Frage bei einem neuen Tool ist nicht, was es tut, sondern wessen Arbeit es ersetzt. Nach den Nutzungen zu urteilen, die Suno aus seinem Monat privater Tests berichtete, spüren vier Gruppen es sofort.
Kurzvideo-Creator sind die offensichtlichste Passung. Ein musikalisches Signature-Intro, Übergänge zwischen Segmenten, ein abschließender Sting: Assets, die früher einen Komponisten und eine Session erforderten, kommen jetzt aus einer Generierung. Die Verdichtung ist real, denn die alte Pipeline hatte einen harten Schritt, bei dem ein Mensch einen Track auf ein Skript abstimmte, und dieser Schritt liegt jetzt im Modell.
Podcaster bekommen ebenfalls eine Version davon. Ein erzähltes Segment mit Originalmusik darunter ist ein zweiteiliges Problem, das gerade zu einem wurde, und der Schalter zum Ausschalten der Musik bedeutet, dass eine saubere Lesung verfügbar ist, wenn ein Kunde sie braucht.
Die dritte Gruppe ist weniger offensichtlich und wahrscheinlich größer. Die von Suno berichteten Testfälle setzen stark auf persönliche und halbpersönliche Inhalte: dramatische Lesungen von Textnachrichten von Freunden, Sprachnotizen mit epischen Scores, geführte Meditationen, Motivationsreden und Gutenachtgeschichten für die eigenen Kinder des Teams. Das ist dasselbe Muster, dem Sunos Songgenerator folgte. Er wurde zu einem festen Bestandteil von Geburtstagen und Insiderwitzen, bevor er ein Produktionswerkzeug wurde, und das Unternehmen positioniert Speech in derselben Spur und nennt die Kategorie Creative Entertainment.
Wettbewerber sind bereits im Raum. ElevenLabs dominiert die Sprachsynthese seit 2023, Adobe hat ein Text-to-Speech-Tool, und Google DeepMind arbeitet seit einem Jahrzehnt an Sprache. Sunos Vorteil ist nicht die Stimmqualität, die laut den Beta-Einschränkungen hinter den Marktführern liegt. Es ist die Paarung: ein Prompt, ein Take, gesprochene Worte und Originalmusik, die bereits zueinander passen.
Der ungeklärte Teil
Die Lücke zwischen Sunos Produktgeschichte und seiner Rechtsgeschichte ist der Punkt, an dem es interessant wird. Speech erweitert, was die Plattform herstellen kann, und es erweitert auch, wessen die Plattform beschuldigt werden kann. Ein Stimmwerkzeug, das Erzählungen im vom Nutzer gewählten Stil erzeugt, steht nahe an Imitation, und ein Modell, das Musik zusammen mit Sprache generiert, erbt jede Frage zu Trainingsdaten, über die die Musikseite bereits streitet.
Sunos Antwort ist bisher Deals und Offenlegung. Es hat die Labels unter Vertrag genommen, Prüfungen für hochgeladenes Audio und Lyrics hinzugefügt und Opt-ins für Künstler mit Bezahlung versprochen. Das ist mehr, als die meisten generativen Audio-Unternehmen getan haben. Es ist auch keine endgültige Antwort, denn der Vorwurf des Model Laundering beschreibt, falls er standhält, ein Problem innerhalb von Sunos eigener Trainingsgeschichte und nicht an deren Rändern.
Was Speech gut macht, ist, einen Schritt zu entfernen, der früher zwei Spezialisten und eine Session-Buchung erforderte. Was es nicht tut, ist zu klären, ob die dahinterstehenden Modelle so gebaut wurden, wie das Unternehmen heute sagt, dass es sie baut. Diese beiden Fragen werden parallel weiterlaufen, und nur eine von ihnen wird durch die Nutzung des Produkts beantwortet.
Verwandte Artikel
Agility Digit 5 kommt mit einem Sicherheitsnachweis, nicht nur mit einem Datenblatt
Eine Lagerhalle ist kein Labor. Die Zertifizierung ist die Hürde, nicht die Demo.
Frontier-Agenten schlossen 30 Prozent eines Forschungs-Workflows ab. Das ist die Zahl.
Agenten können Forschung ausführen. Das Erfinden der Prozedur ist noch außer Reichweite.
Figure AI sichert sich 3,5 Milliarden Dollar Compute, bevor es ein Produkt zu verkaufen gibt
Die Wette lautet, dass Generalisierung ein Compute-Problem ist. Das Feld hat das nicht abschließend geklärt.
OpenAI integriert endlich transparente Hintergründe in die Image API
Ein kleines Feature, das einen ganzen Schritt aus der Pipeline streicht.