ElevenLabs löste die Stimme – und erhöhte dann den Preis dafür, gehört zu werden

Am 28. September veröffentlichte ElevenLabs zwei Sprachmodelle. Eleven v4 ist für Narration und vorbereiteten Dialog ausgelegt. Eleven v4 Turbo ist für Live-Konversation gebaut, mit einer medianen Inferenzlatenz von knapp 100 Millisekunden und rund 150 Millisekunden bis zur ersten Sprachausgabe. Zwei Tage später schloss das Unternehmen ein Mitarbeiter-Tenderangebot ab, das es mit 22 Milliarden Dollar bewertete – doppelt so viel wie die 11 Milliarden Dollar vom Februar.
Diese beiden Ankündigungen sind ein und dieselbe. Sobald ein Sprachmodell schnell genug ist, dass Menschen die Verzögerung nicht mehr bemerken, bleibt die Frage, wer echt klingt – und das ist eine Produktfrage mit angehängtem Preisschild.
Latenz war die letzte technische Ausrede
Sprachagenten haben seit Jahren einen hartnäckigen Fehlermodus. Die Worte stimmen, das Timing nicht. Eine Pause, die einen Schlag zu lang dauert, verwandelt einen hilfreichen Assistenten in etwas, bei dem Nutzer einfach auflegen, und die Lösung war immer mehr Hardware oder ein kürzerer Satz. Turbos Werte liegen unter der Schwelle, ab der Menschen es wahrnehmen. Rund 100 Millisekunden entsprechen ungefähr der Länge einer normalen Gesprächspause, was bedeutet, dass die Verzögerung nicht mehr als denkende Maschine gelesen wird, sondern als ein Mensch, der überlegt.
Die neue Architektur deckt zudem über 90 Sprachen ab, gegenüber mehr als 70 in v3, mit einem Detail, das wichtiger ist als die Zahl. Eine aus einer englischen Aufnahme geklonte Stimme spricht Japanisch mit natürlichem japanischem Akzent, statt den Quellakzent mitzuschleppen. Marken, die einen einzigen Sprecher über mehrere Märkte lokalisieren, erhalten ein saubereres Ergebnis, und Fiktion, die auf dem Akzent einer Figur beruht, braucht eine bewusste Entscheidung statt einer Voreinstellung.
Anfragen akzeptieren jetzt bis zu 10.000 Zeichen, doppelt so viel wie das bisherige Limit. Inline-Delivery-Tags wie [laughs], [whispers] und [said angrily] funktionieren weiterhin und lassen sich stapeln. Instant Voice Clones benötigen weiterhin etwa 10 Sekunden Audio.
Der Sprung von rund 70 Sprachen auf über 90 ist kleiner als der Sprung darin, wie eine geklonte Stimme über sie hinweg trägt. Eine einzige Aufnahme kann jetzt ein Produkt in einem Dutzend Märkte vertreten, ohne dass jede Version wie dieselbe Person klingt, die sich an einem lokalen Akzent abmüht. Für ein Unternehmen, das einen Sprecher lokalisiert, entfällt damit ein Schritt, der früher eine zweite Aufnahmesession pro Sprache erforderte.
Ausdruckskraft ist dort, wo das Geld liegt
Artificial Analysis bewertete v4 auf Platz eins für Ausdruckskraft, und ElevenLabs berichtet, dass etwa 75 Prozent der Zuhörer es in Blindtests bevorzugten. Beide Zahlen stammen vom Unternehmen oder seinen Partnern, also sollten sie als Marketing gelten, bis jemand den Test wiederholt. Die Richtung ist dennoch aussagekräftig. Jedes große Labor kann inzwischen verständliche Sprache erzeugen. Das Unterscheidungsmerkmal hat sich darauf verlagert, ob die Sprache Ton, Tempo und eine erkennbare Persönlichkeit über eine lange Aufnahme tragen kann, ohne dass die Stimme zwischen Kapiteln driftet.
Das kommerzielle Bild sagt dasselbe aus einem anderen Blickwinkel. ElevenAgents, die Plattform für Konversationsagenten, macht inzwischen 55 Prozent des Umsatzes von ElevenLabs aus. Voice wird nicht hauptsächlich als Narration für Hörbücher verkauft. Es wird als die Interface-Schicht für Software verkauft, die spricht.
Diese Verschiebung erklärt die Preisstruktur. Eleven v4 kostet 0,08 US-Dollar pro 1.000 Zeichen über die API, Turbo kostet 0,04 US-Dollar. Beide sind bis zum 12. Oktober rabattiert, auf 0,022 bzw. 0,011 US-Dollar. Die Referenzpreise sind die, mit denen man kalkulieren sollte, denn der Einführungsrabatt ist temporär und Korrekturen fügen Zeichen hinzu. Turbo ist zudem auf eine bestimmte Weise eingeschränkt, die leicht zu übersehen ist: Der Text to Dialogue WebSocket akzeptiert bis zu zehn registrierte Stimmen pro Verbindung bei v4, aber nur eine bei Turbo.
Der Rest des Marktes steht nicht still
ElevenLabs ist nicht allein damit, Voice als Agenten-Interface zu behandeln. Am 30. September startete Inception Labs Mercury Voice, ein Diffusions-Sprachmodell, das speziell für latenzarme Sprachagenten gebaut wurde, mit einer medianen Zeit bis zum ersten Antwort-Token von 320 Millisekunden und einem Preis von rund neun Zehntel Cent pro Gesprächsminute zum Start. Suno lieferte ein Sprachmodell in der Beta aus. Vercel fügte Microsofts Audiomodelle mit Null-Datenaufbewahrung zu seinem AI Gateway hinzu.
Die Ansätze unterscheiden sich darin, wo sie das Schwierige verorten. ElevenLabs behandelt die Synthese als das Produkt und modelliert die Worte separat. Inception rechnet das Sprachmodell ins Latenzbudget ein und argumentiert, dass eine schnelle Synthese-Schicht nutzlos ist, wenn das dahinterliegende Modell zwei Sekunden zum Denken braucht. Beides ist schlüssig, und beide werden weiter kollidieren, denn ein Nutzer, der einen Sprachagenten erlebt, kann nicht erkennen, welche Komponente langsam war.
Die unangenehmen Teile
Cloning ist durch obligatorische Identitätsprüfung des Eigentümers und Filter geschützt, die unbefugte Klone prominenter öffentlicher Personen blockieren. Das ist ein vernünftiger Mindeststandard, keine Lösung. Ein zehnsekündiges Sample reicht inzwischen für einen hochauflösenden Klon, und die Zahl der Menschen, die zehn Sekunden Audio von jemandem besitzen, ist praktisch jeder.
Es gibt ein Problem zweiter Ordnung, das kein Filter adressiert. Je besser ausdrucksstarke Modelle darin werden, wie eine bestimmte Person zu klingen, desto stärker kollabiert der Wert der Stimme als Verifikationssignal. Ein Stimmabdruck war früher schwacher Beweis und ist heute nahezu kein Beweis mehr. Banken und Callcenter, die ihre Identitätsprüfung auf „wir erkennen die Stimme des Kunden“ aufgebaut haben, haben diese Annahme seit zwei Jahren still und leise verabschiedet, und dieses Release macht die Verabschiedung überfällig.
Auch der Latenzwert ist enger, als er klingt. Er wird nach dem eigenen Benchmark-Protokoll von ElevenLabs gemessen, ohne Netzwerklatenz. Ein tatsächlicher Assistent muss weiterhin die Anfrage erkennen, eine Antwort entscheiden und sie über ein Netzwerk ausliefern. Turbo entfernt eine Verzögerungsquelle aus einer Kette, die mehrere hat.

Was die Bewertung wirklich aussagt
Eine Bewertung in acht Monaten zu verdoppeln, über einen Sekundärverkauf von 300 Millionen Dollar statt über neues Primärkapital, ist eine Aussage über Retention und über eine Kategorie, die noch nicht zur Commodity geworden ist. Sprachmodelle sind das seltene KI-Produkt, bei dem Nutzer Qualität sofort bemerken und deswegen wechseln. Hyperscaler und spezialisierte Wettbewerber liefern alle aus, und die Qualitätslücke ist enger geworden.
Die Wette hinter der Zahl von 22 Milliarden Dollar ist, dass die Lücke breit genug bleibt, um dafür Geld zu verlangen, und dass die Agentenplattform weiter schneller wächst, als der reine Synthesepreis fällt. Dass Turbo zum Start auf 0,011 US-Dollar pro 1.000 Zeichen geht, deutet darauf hin, dass die zweite Hälfte dieser Wette die schwierigere ist. Wenn die Grenzkosten einer Stimme gegen null gehen, ist das, was man noch verkaufen kann, die Stimme, die sonst niemand hat.
Es gibt auch einen strukturellen Grund, warum ein Voice-Unternehmen eine solche Bewertung halten kann, während Bild- und Videounternehmen damit kämpfen. Ein Sprachagent läuft kontinuierlich, in jedem Anruf und jeder Session, sodass die Nutzung mit dem Erfolg des Produkts skaliert statt mit einer einmaligen Generierung. Narration und Agenten haben unterschiedliche Ökonomien: Das eine ist ein Projekt, das andere ein Zähler, der nie aufhört zu laufen. ElevenLabs hat auf das Zweite hingebaut, und 55 Prozent des Umsatzes sagen, dass die Strategie funktioniert hat. Die Frage, die das nächste Jahr beantwortet, ist, ob der Qualitätsvorsprung lange genug überlebt, damit der Zähler weiterläuft.
Auch die eigene Darstellung des Unternehmens weist in dieselbe Richtung. Das Launch-Material führt mit Ausdruckskraft statt mit Genauigkeit oder Geschwindigkeit, weil diese beiden vor mehreren Releases aufgehört haben, Unterscheidungsmerkmale zu sein. Was ein Sprachagent tun muss, um echt zu wirken, ist, Zögern, Betonung und eine konsistente Identität über eine vierzigminütige Session zu tragen, und das ist ein schwierigeres Ziel als die Produktion eines sauberen Absatzes. Das Modell, das es gewinnt, wird nicht unbedingt das günstigste pro Zeichen sein. Es wird dasjenige sein, dessen Output Menschen nicht von einer Person unterscheiden können, mit der sie schon gesprochen haben – eine Messlatte, die jedes Mal höher gelegt wird, wenn sie überschritten wird.
Verwandte Artikel
Agility Digit 5 kommt mit einem Sicherheitsnachweis, nicht nur mit einem Datenblatt
Eine Lagerhalle ist kein Labor. Die Zertifizierung ist die Hürde, nicht die Demo.
Frontier-Agenten schlossen 30 Prozent eines Forschungs-Workflows ab. Das ist die Zahl.
Agenten können Forschung ausführen. Das Erfinden der Prozedur ist noch außer Reichweite.
Figure AI sichert sich 3,5 Milliarden Dollar Compute, bevor es ein Produkt zu verkaufen gibt
Die Wette lautet, dass Generalisierung ein Compute-Problem ist. Das Feld hat das nicht abschließend geklärt.
OpenAI integriert endlich transparente Hintergründe in die Image API
Ein kleines Feature, das einen ganzen Schritt aus der Pipeline streicht.