ElevenLabs a résolu la voix, puis a fait grimper le prix du droit d'être entendu

Le 28 septembre, ElevenLabs a publié deux modèles de synthèse vocale. Eleven v4 est conçu pour la narration et le dialogue préparé. Eleven v4 Turbo est conçu pour la conversation en direct, avec une latence d'inférence médiane proche de 100 millisecondes et environ 150 millisecondes jusqu'au premier son. Deux jours plus tard, l'entreprise clôturait une offre de rachat d'actions réservée à ses employés, qui la valorisait à 22 milliards de dollars, soit le double de ses 11 milliards de février.
Ces deux annonces n'en font qu'une. Dès qu'un modèle vocal est assez rapide pour que les gens cessent de remarquer le délai, la question qui reste est de savoir qui sonne vrai — et c'est une question de produit, avec un prix attaché.
La latence était la dernière excuse technique
Depuis des années, les agents vocaux souffrent d'un mode de défaillance tenace. Les mots sont justes, le rythme est faux. Une pause qui dure un temps de trop transforme un assistant utile en quelque chose que l'on raccroche au nez, et la solution consistait toujours à ajouter du matériel ou à raccourcir la phrase. Les chiffres de Turbo se situent sous le seuil de perception humaine. Environ 100 millisecondes, c'est à peu près la durée d'un silence normal dans une conversation : le délai cesse donc d'être perçu comme une machine qui réfléchit pour devenir une personne qui réfléchit.
La nouvelle architecture couvre par ailleurs plus de 90 langues, contre plus de 70 pour la v3, avec un détail qui compte davantage que le nombre. Une voix clonée à partir d'un enregistrement en anglais parlera japonais avec un accent japonais naturel, sans traîner l'accent d'origine derrière elle. Les marques qui déclinent un même porte-parole sur plusieurs marchés obtiennent un résultat plus propre, et une fiction qui repose sur l'accent d'un personnage exige désormais un choix délibéré plutôt qu'un réglage par défaut.
Les requêtes acceptent désormais jusqu'à 10 000 caractères, soit le double de la limite précédente. Les balises d'interprétation intégrées comme [laughs], [whispers] et [said angrily] fonctionnent toujours et peuvent être cumulées. Les clones vocaux instantanés nécessitent toujours environ 10 secondes d'audio.
Le passage de 70 et quelques langues à plus de 90 est moins important que le saut accompli dans la façon dont une voix clonée traverse ces langues. Un seul enregistrement peut désormais porter un produit sur une douzaine de marchés sans que chaque version donne l'impression d'une même personne s'efforçant d'imiter un accent local. Pour une entreprise qui localise un seul porte-parole, cela supprime une étape qui exigeait autrefois une seconde session d'enregistrement par langue.
L'expressivité, c'est là qu'est l'argent
Artificial Analysis a classé v4 en tête pour l'expressivité, et ElevenLabs indique qu'environ 75 % des auditeurs l'ont préféré lors de tests à l'aveugle. Ces deux chiffres viennent de l'entreprise ou de ses partenaires : à prendre pour du marketing tant que personne n'aura refait le test. La tendance reste révélatrice. Tous les grands laboratoires savent désormais produire une parole intelligible. Le facteur différenciant s'est déplacé vers la capacité de cette parole à porter un ton, un rythme et une personnalité reconnaissable sur un long enregistrement, sans que la voix dérive d'un chapitre à l'autre.
Le tableau commercial dit la même chose sous un autre angle. ElevenAgents, la plateforme dédiée aux agents conversationnels, représente désormais 55 % du chiffre d'affaires d'ElevenLabs. La voix n'est pas vendue principalement comme narration pour livres audio. Elle est vendue comme la couche d'interface d'un logiciel qui parle.
Ce basculement explique la structure tarifaire. Eleven v4 coûte 0,08 $ pour 1 000 caractères via l'API, et Turbo 0,04 $. Les deux sont remisés jusqu'au 12 octobre, à 0,022 $ et 0,011 $ respectivement. Ce sont les tarifs de référence qu'il faut retenir pour bâtir un budget, car la remise de lancement est temporaire et les corrections ajoutent des caractères. Turbo présente aussi une restriction précise et facile à manquer : le WebSocket Text to Dialogue accepte jusqu'à dix voix enregistrées par connexion sur v4, mais une seule sur Turbo.
Le reste du marché ne reste pas immobile
ElevenLabs n'est pas le seul à traiter la voix comme l'interface des agents. Le 30 septembre, Inception Labs a lancé Mercury Voice, un modèle de langage à diffusion conçu spécifiquement pour les agents vocaux à faible latence, avec un temps médian jusqu'au premier token de réponse de 320 millisecondes et un tarif d'environ neuf dixièmes de centime par minute de conversation au lancement. Suno a livré un modèle de parole en bêta. Vercel a ajouté les modèles audio de Microsoft à son AI Gateway, avec zéro rétention de données.
Les approches diffèrent par l'endroit où elles placent la difficulté. ElevenLabs traite la synthèse comme le produit et modélise les mots séparément. Inception intègre le modèle de langage dans le budget de latence, en faisant valoir qu'une couche de synthèse rapide ne sert à rien si le modèle derrière met deux secondes à réfléchir. Les deux sont cohérentes, et elles continueront de s'affronter, car un utilisateur qui fait l'expérience d'un agent vocal ne peut pas dire quel composant a été lent.
Les aspects qui dérangent
Le clonage est protégé par une vérification obligatoire de l'identité du propriétaire et par des filtres qui bloquent les clones non autorisés de personnalités publiques. C'est un plancher raisonnable, pas une solution. Un échantillon de dix secondes suffit désormais à obtenir un clone haute fidélité, et le nombre de personnes qui possèdent dix secondes de l'audio de quelqu'un est en pratique tout le monde.
Il existe un problème de second ordre qu'aucun filtre ne traite. À mesure que les modèles expressifs s'améliorent pour imiter une personne précise, la valeur de la voix comme signal de vérification s'effondre. Une empreinte vocale était une preuve faible ; elle n'est plus guère une preuve du tout. Les banques et les centres d'appels qui avaient bâti leurs contrôles d'identité sur le principe « nous reconnaissons la voix du client » abandonnent discrètement cette hypothèse depuis deux ans, et cette sortie rend cet abandon plus qu'urgent.
Le chiffre de latence est aussi plus étroit qu'il n'y paraît. Il est mesuré selon le protocole d'évaluation propre à ElevenLabs, latence réseau exclue. Un assistant réel doit encore reconnaître la demande, décider d'une réponse et la transmettre à travers un réseau. Turbo supprime une source de délai dans une chaîne qui en compte plusieurs.

Ce que dit vraiment la valorisation
Doubler une valorisation en huit mois, via une cession secondaire de 300 millions de dollars plutôt que du capital primaire nouveau, est un message sur la rétention et sur une catégorie qui ne s'est pas encore banalisée. Les modèles vocaux sont l'un des rares produits d'IA où les utilisateurs perçoivent immédiatement la qualité et changent de fournisseur pour elle. Les hyperscalers comme les concurrents spécialisés livrent tous des produits, et l'écart de qualité n'a cessé de se réduire.
Le pari derrière les 22 milliards, c'est que l'écart reste suffisamment large pour être monétisé, et que la plateforme d'agents croît plus vite que ne baisse le prix de la synthèse brute. Le passage de Turbo à 0,011 $ pour 1 000 caractères pendant le lancement suggère que la seconde moitié de ce pari est la plus difficile. Quand le coût marginal d'une voix tend vers zéro, ce qu'on peut encore vendre, c'est la voix que personne d'autre ne possède.
Il existe aussi une raison structurelle pour qu'une entreprise de la voix puisse soutenir une telle valorisation, là où les entreprises d'image et de vidéo y parviennent difficilement. Un agent vocal tourne en continu, à chaque appel et à chaque session : l'usage évolue donc avec le succès du produit, et non avec des générations ponctuelles. La narration et les agents obéissent à des économies différentes : l'une est un projet, l'autre un compteur qui ne s'arrête jamais. ElevenLabs s'est construite en direction du second, et 55 % de son chiffre d'affaires indique que la stratégie a fonctionné. La question à laquelle répondra l'année à venir est de savoir si cet avantage de qualité survit assez longtemps pour que le compteur continue de tourner.
La présentation qu'en fait l'entreprise va dans le même sens. Le matériel de lancement met en avant l'expressivité plutôt que la précision ou la vitesse, car ces deux dernières ont cessé d'être différenciantes il y a plusieurs versions. Pour paraître réel, un agent vocal doit porter l'hésitation, l'emphase et une identité cohérente tout au long d'une session de quarante minutes, ce qui est un objectif plus difficile que produire un paragraphe propre. Le modèle qui y parviendra ne sera pas forcément le moins cher au caractère. Ce sera celui dont la production est indiscernable de celle d'une personne à qui l'on a déjà parlé, un seuil qui se relève chaque fois qu'il est franchi.
Articles associés
Un semi-humanoïde à roues a terminé une heure de lessive sans aide
Des tâches individuelles peuvent réussir alors qu'un flux de travail échoue encore. Dyna a changé la métrique.
LTX 2.5 veut transformer votre brouillon Blender en un plan finalisé
En texte-vidéo, vous ne contrôlez pas ce qui se passe. Cet outil tente d'y remédier.
ServiceNow transforme les échecs des agents en données d'entraînement
La génération sans vérification est du bruit. Les portes sont le produit.
Un seul cadre pour le langage et la vision : le modèle ouvert 1,6B d’Horizon
Un pari : les ponts entre le langage et la vision n’ont jamais été nécessaires.