Synthesia hat ein Jahrzehnt lang Avatare aufgezeichnet. Jetzt sollen sie zurücksprechen.

Synthesia hat sein Geschäft auf einer einfachen Schleife aufgebaut. Man schreibt ein Skript, wählt einen Avatar aus und bekommt ein Präsentator-Video zurück. Das Unternehmen sagt, diese Schleife laufe seit fast einem Jahrzehnt durch die größte Unternehmensvideoplattform der Welt und habe Synthesia bis 2025 zu einer berichteten Bewertung von 4 Milliarden US-Dollar bei mehr als 100 Millionen US-Dollar jährlich wiederkehrendem Umsatz verholfen.
Am 1. Oktober 2026 änderte die Schleife ihre Richtung. Synthesia startete Sessions, eine Plattform für bidirektionale Gespräche mit einem lebensechten Avatar. Zwei Sitzungstypen gingen am selben Tag live, ein dritter wurde als in Kürze verfügbar angekündigt.
Roleplay Sessions versetzt den Nutzer in ein Gespräch, das schwierig sein soll. Der Avatar spielt einen Kunden, einen Bewerber oder einen direkt unterstellten Mitarbeiter und kontert. Vertriebsteams üben Bedarfsermittlung und den Umgang mit Einwänden. Führungskräfte proben das Gespräch, das sie mit einem Mitarbeiter vermieden haben. Support-Teams simulieren eine Eskalation. Nach jedem Versuch coached und bewertet das System den Teilnehmer. Neue Funktionen ermöglichen es, ein Szenario vor dem Üben an die eigene Situation anzupassen, und Unternehmen können eigene Rollenspiele für ihre wiederkehrenden Gespräche erstellen.

Survey Sessions verwandelt ein Formular in ein Interview. Der Avatar stellt die Fragen des Unternehmens im Einzelgespräch, hakt bei dem nach, was er hört, und liefert strukturierte Erkenntnisse zurück. Synthesia nennt Mitarbeiterfeedback, Kundeninsights, Exit- und Churn-Interviews, NPS-Nachfassung und Produktforschung als vorgesehene Einsatzbereiche. Antworten kommen als Themen und Stimmungen über die Befragten hinweg zurück, wobei jede einzelne Antwort als Transkript, Audiodatei oder CSV geöffnet werden kann.
Expert Sessions steht noch auf der Roadmap: ein Avatar, der mit den Produktdokumentationen und internen Prozessen eines Unternehmens trainiert wurde, jemanden Schritt für Schritt durch eine Aufgabe führt und Fragen beantwortet, während die Person arbeitet.
Das Argument für diese Produktform
Synthesias CTO Peter Hill schrieb den Launch-Beitrag. Seine Einordnung ist ein Personalengpass und keine Technologiegeschichte. Es gibt nie genug von der richtigen Person, egal ob es sich um eine Führungskraft handelt, die jeden Vertriebsmitarbeiter vor einem schwierigen Anruf coacht, eine Forscherin, die jeden Kunden interviewt, oder einen Produktexperten, der jeden Nutzer unterstützt, der nicht weiterkommt. Die üblichen Ersatzlösungen sind Aufzeichnungen statt Proben, Formulare statt Interviews und Hilfedokumentation statt praktischer Anleitung.
Hills Biografie macht das Argument leichter ernst zu nehmen als bei einem durchschnittlichen Launch-Beitrag. Er verbrachte fast 25 Jahre bei Amazon und AWS und leitete Teams hinter Kindle, Fire, Alexa und Diensten wie Amazon Connect und WorkSpaces, bevor er CEO und CPO bei Wildlife Studios war. Er hat bereits Dialogsysteme in großem Maßstab auf den Markt gebracht.
Die frühen Daten, die Synthesia zu veröffentlichen bereit ist, sind dünn, aber aussagekräftig. In frühen Einsätzen versuchten 78 Prozent der Lernenden ein Rollenspiel mehr als einmal, und von denen, die zurückkamen, verbesserten 83 Prozent ihre Punktzahl bei einem späteren Versuch. Lesen Sie das genau. Die Zahl, die zählt, ist nicht die Verbesserungsrate, die an der Teilmenge gemessen wird, die sich für eine Rückkehr entschieden hat. Es ist die Rückkehrquote von 78 Prozent. Ein Trainingswerkzeug, das Menschen freiwillig wiederholen, ist ein anderes Produkt als eines, das sie abschließen, weil es ihnen zugewiesen wurde.
Synthesia sagt außerdem, thematische Erkenntnisse sollen zeigen, welche Fähigkeiten die Leistung treiben, statt nur, wer am höchsten abgeschnitten hat, und jeder Mitarbeiter erhalte vorgeschlagene Rollenspiele, um die eigenen Lücken zu schließen. Das ist eine Verschiebung vom Berichten zur Diagnose, und es ist der Teil des Pitches, den Learning-and-Development-Teams tatsächlich bewerten werden.
Zwei Wege – und warum die Aufteilung wichtig ist
Synthesia verkauft dieselbe Fähigkeit auf zwei Wegen. Die Interactive Avatar API richtet sich an Unternehmen, die ihr eigenes Avatar-Produkt bauen und den Stack kontrollieren wollen. Sessions ist die fertige Plattform für die Gespräche, aus denen der normale Arbeitsalltag besteht. Das Unternehmen beschreibt die API als gehostete Pipeline, was bedeutet, dass ein Team sein eigenes Sprachmodell, Speech-to-Text und Text-to-Speech mitbringen kann, statt den Rendering-Stack selbst zu betreiben.
Diese Aufteilung ist interessanter, als sie aussieht. Unternehmen, die bereits einen bevorzugten Modellanbieter haben, wollen nicht vorgeschrieben bekommen, welchen sie verwenden sollen, und Unternehmen, die weder die Lust noch die Mitarbeiter für Integrationsarbeit haben, wollen gar nichts bauen. Beides anzubieten erspart es Synthesia, sich für ein einziges Kundenprofil entscheiden zu müssen. Die Integration auf Sitzungsebene öffnet die Full-Stack-API am selben Tag, was darauf hindeutet, dass das Unternehmen die API langfristig als das leisere, größere Geschäft sieht.
Compliance-Details sind erwähnenswert, weil dieses Produkt Mitarbeitergespräche und Kundeninterviews berührt, was Aufzeichnungen, Transkripte und personenbezogene Daten bedeutet. Synthesia nennt SOC 2 Type II, ISO 27001, 27701 und 42001 sowie DSGVO-Konformität.
Was der Launch nicht klärt
Drei Fragen liegen unter der Oberfläche dieser Veröffentlichung.
Die erste ist, ob die Interaktionsqualität außerhalb einer Demo standhält. Ein Rollenspiel erzeugt nur dann Kompetenztransfer, wenn der Widerspruch des Avatars realistisch und abwechslungsreich ist. Ein Avatar, der zu schnell zustimmt, lehrt nichts, und einer, der nach Schema F argumentiert, wird innerhalb von zwei Versuchen durchschaut. Synthesia hat keine unabhängige Evaluierung veröffentlicht, wie sich die Gegenüber in seinen Rollenspielen über verschiedene Szenarien hinweg verhalten, und seine Einsatzzahlen beschreiben wiederholte Nutzung statt Lernergebnisse.
Die zweite ist die Frage der Aufzeichnung. Eine Punktzahl, die an den Übungsversuch eines Mitarbeiters geknüpft ist, ist ein Datenpunkt über eine Person, der von einer KI erstellt, in einem Unternehmenssystem gespeichert und möglicherweise für eine Führungskraft sichtbar ist. Dass 78 Prozent der Lernenden zurückkommen, sieht in einer Pressemitteilung gesund aus. Es bedeutet aber auch, dass die meisten Teilnehmer einen bewerteten Datensatz eines Gesprächs erzeugt haben, das sie schlecht geführt haben. Wo dieser Datensatz liegt, wer ihn sehen kann und wie lange er aufbewahrt wird, sind Richtlinienentscheidungen, die jeder Käufer treffen muss, und die Antworten unterscheiden sich stark zwischen beispielsweise einem Sales-Enablement-Team und einer HR-Abteilung.
Die dritte ist, was mit den menschlichen Spezialisten geschieht, deren Knappheit die ganze Prämisse ist. Wenn Synthesia recht hat, dass ein trainierter Avatar die repetitiven Gespräche zu einem Bruchteil der Kosten eines menschlichen Gesprächs übernehmen kann, dann wird der Coaching-Moment, der eine echte Person braucht, der teure. Das ist ein vernünftiger Tausch für die Kunden des Unternehmens. Es ist unvermeidlich auch eine Geschichte darüber, welche Teile einer Aufgabe zuerst automatisiert werden.
Was das für Unternehmens-KI bedeutet
Sessions ist ein nützlicher Marker, weil es ein Avatar-Produkt von der Content-Generierung in den Workflow verschiebt. Ein unidirektionales Avatar-Video konkurriert mit einer Kamera, einem Studio und einem Termin. Ein bidirektionaler Avatar konkurriert mit dem Kalender einer Führungskraft, und der Vergleich dreht sich nicht mehr um Produktionskosten. Es geht darum, ob eine Organisation tausend Übungsgespräche pro Tag durchführen und die Ergebnisse behalten kann.
Synthesias Wette ist, dass die meisten Organisationen das nicht können und dass der Avatar, der zurückspricht, eine billigere Antwort ist als Neueinstellungen. Ob die Interaktionsqualität die Substitution rechtfertigt, wird das nächste Jahr der Einsätze zeigen. Die Zahl der wiederholten Nutzungen ist ein vielversprechendes erstes Signal. Sie ist noch kein Beleg dafür, dass die Übung irgendjemanden besser in seinem Job gemacht hat.
Verwandte Artikel
Step 5 übersprang vier Versionsnummern, landete auf Platz zwei unter offenen Modellen – und niemand ruft es ab
Die Benchmark-Position ist ein Signal, das Produzenten nutzen, um ein Modell zu beurteilen. Das Aufrufvolumen ist ein Signal, das Nutzer durch seine Nutzung erzeugen.
Gemini Omni 1.1 Flash verkettete vier Anfragen zu einer 40-Sekunden-Aufnahme. Der Workflow ist das Produkt.
Google hat eine Produktionspipeline ausgeliefert, bei der ein Review-Gate in die Preisgestaltung eingebaut ist.
Microsoft senkt die Latenz für Teiltranskripte auf 100 Millisekunden. Das verändert, wofür Transkription da ist.
Unterhalb von 100 Millisekunden kann ein Transkriptionsprodukt reagieren, während jemand noch spricht.
Ein Modell, das sich weigert, Sätze zu schreiben, verarbeitet jetzt eine Billion Token pro Tag
Ein Klassifikator mit einer viel besseren Schnittstelle, ausgerichtet auf die Arbeit, die Software schon immer strukturiert haben wollte.