← Volver al blog
Aiaprox. 8 min de lectura

ElevenLabs resolvió la voz y luego subió el precio de hacerse oír

Publicado 3 oct 2026
ElevenLabs resolvió la voz y luego subió el precio de hacerse oír

El 28 de septiembre, ElevenLabs lanzó dos modelos de voz. Eleven v4 está diseñado para narración y diálogo preparado. Eleven v4 Turbo está diseñado para conversación en vivo, con una latencia de inferencia mediana cercana a los 100 milisegundos y unos 150 milisegundos hasta la primera locución. Dos días después, la empresa cerró una oferta de compra de acciones a empleados que la valoró en 22.000 millones de dólares, el doble de los 11.000 millones de febrero.

Esos dos anuncios son el mismo anuncio. Una vez que un modelo de voz es lo bastante rápido para que la gente deje de notar el retraso, la pregunta que queda es quién suena real, y esa es una pregunta de producto con un precio asociado.

La latencia era la última excusa técnica

Los agentes de voz han tenido durante años un modo de fallo obstinado. Las palabras son correctas, el ritmo es erróneo. Una pausa que se alarga un compás de más convierte a un asistente útil en algo que hace que los usuarios cuelguen, y la solución siempre era más hardware o una frase más corta. Las cifras de Turbo se sitúan por debajo del umbral en el que los humanos lo notan. Alrededor de 100 milisegundos es más o menos la duración de una pausa conversacional normal, lo que significa que el retraso deja de leerse como una máquina pensando y empieza a leerse como una persona que está considerando.

La nueva arquitectura también admite más de 90 idiomas, frente a más de 70 en v3, con un detalle que importa más que la cifra. Una voz clonada a partir de una grabación en inglés hablará japonés con un acento japonés natural en lugar de arrastrar el acento de origen. Las marcas que localizan a un único portavoz en varios mercados obtienen un resultado más limpio, y la ficción que depende del acento de un personaje necesita una decisión deliberada en lugar de un valor por defecto.

Ahora las solicitudes aceptan hasta 10.000 caracteres, el doble del límite anterior. Las etiquetas de interpretación en línea como [laughs], [whispers] y [said angrily] siguen funcionando y se pueden combinar. Los Instant Voice Clones siguen necesitando unos 10 segundos de audio.

El salto de unos 70 idiomas a más de 90 es menor que el salto en cómo se comporta una voz clonada entre ellos. Una única grabación ahora puede representar a un producto en una docena de mercados sin que cada versión suene como la misma persona esforzándose por imitar un acento local. Para una empresa que localiza a un único portavoz, eso elimina un paso que antes requería una segunda sesión de grabación por idioma.

La expresividad es donde está el dinero

Artificial Analysis clasificó a v4 en primer lugar en expresividad, y ElevenLabs informa de que alrededor del 75 por ciento de los oyentes lo prefirió en pruebas a ciegas. Ambas cifras proceden de la empresa o de sus socios, así que trátalas como marketing hasta que alguien repita la prueba. Aun así, la dirección es reveladora. Todos los grandes laboratorios ya pueden producir habla inteligible. El factor diferenciador ha pasado a ser si el habla puede transmitir tono, ritmo y una personalidad reconocible a lo largo de una grabación extensa sin que la voz se desvíe entre capítulos.

El panorama comercial plantea la misma idea desde otro ángulo. ElevenAgents, la plataforma para agentes conversacionales, representa ahora el 55 por ciento de los ingresos de ElevenLabs. La voz no se vende principalmente como narración para audiolibros. Se vende como la capa de interfaz para software que habla.

Ese cambio explica la estructura de precios. Eleven v4 cuesta 0,08 dólares por 1.000 caracteres a través de la API, y Turbo cuesta 0,04. Ambos tienen descuento hasta el 12 de octubre, a 0,022 y 0,011 respectivamente. Las tarifas de referencia son las que hay que presupuestar, porque el descuento de lanzamiento es temporal y las correcciones añaden caracteres. Turbo también tiene una restricción concreta fácil de pasar por alto: el WebSocket de Text to Dialogue acepta hasta diez voces registradas por conexión en v4, pero solo una en Turbo.

El resto del mercado no se queda quieto

ElevenLabs no es la única que trata la voz como la interfaz de los agentes. El 30 de septiembre, Inception Labs lanzó Mercury Voice, un modelo de lenguaje de difusión creado específicamente para agentes de voz de baja latencia, con un tiempo mediano hasta el primer token de respuesta de 320 milisegundos y un precio de alrededor de nueve décimas de centavo por minuto de conversación en el lanzamiento. Suno lanzó un modelo de habla en beta. Vercel añadió los modelos de audio de Microsoft a su AI Gateway con retención de datos cero.

Los enfoques difieren en dónde colocan la parte difícil. ElevenLabs trata la síntesis como el producto y modela las palabras por separado. Inception integra el modelo de lenguaje en el presupuesto de latencia, argumentando que una capa de síntesis rápida es inútil si el modelo que tiene detrás tarda dos segundos en pensar. Ambas propuestas son coherentes y seguirán chocando, porque un usuario que experimenta un agente de voz no puede saber qué componente fue lento.

Las partes incómodas

La clonación está protegida por una verificación obligatoria de la identidad del propietario y filtros que bloquean clones no autorizados de figuras públicas prominentes. Eso es un mínimo razonable, no una solución. Ahora una muestra de diez segundos basta para un clon de alta fidelidad, y el número de personas que tienen diez segundos del audio de alguien es, en la práctica, todo el mundo.

Hay un problema de segundo orden que ningún filtro aborda. A medida que los modelos expresivos mejoran a la hora de sonar como una persona concreta, el valor de la voz como señal de verificación se derrumba. Una huella de voz solía ser una prueba débil y ahora está cerca de no ser prueba alguna. Los bancos y centros de llamadas que basaron sus comprobaciones de identidad en "reconocemos la voz del cliente" llevan dos años retirando discretamente esa suposición, y este lanzamiento hace que el retiro llegue tarde.

La cifra de latencia también es más limitada de lo que parece. Se mide con el protocolo de benchmark propio de ElevenLabs y sin la latencia de red. Un asistente real todavía tiene que reconocer la solicitud, decidir una respuesta y entregarla a través de una red. Turbo elimina una fuente de retraso de una cadena que tiene varias.

Una suave onda de luz que viaja a través de un tubo de vidrio curvo sobre una superficie oscura y pulida, verde azulado con reflejos ámbar cálidos

Qué está diciendo realmente la valoración

Duplicar una valoración en ocho meses, sobre una venta secundaria de 300 millones de dólares en lugar de capital primario nuevo, es una declaración sobre la retención y sobre una categoría que aún no se ha convertido en commodity. Los modelos de voz son el raro producto de IA en el que los usuarios notan la calidad de inmediato y cambian por ella. Los hiperescaladores y los competidores especializados están lanzando productos, y la brecha de calidad se ha ido estrechando.

La apuesta detrás de la cifra de 22.000 millones de dólares es que la brecha siga siendo lo bastante amplia como para cobrar por ella, y que la plataforma de agentes siga creciendo más rápido de lo que cae el precio de la síntesis bruta. Que Turbo baje a 0,011 dólares por 1.000 caracteres durante el lanzamiento sugiere que la segunda mitad de esa apuesta es la más difícil. Cuando el coste marginal de una voz se acerca a cero, lo que aún se puede vender es la voz que nadie más tiene.

También hay una razón estructural por la que una empresa de voz puede sostener una valoración así mientras las empresas de imagen y vídeo luchan por hacerlo. Un agente de voz se ejecuta de forma continua, en cada llamada y cada sesión, así que el uso escala con el éxito del producto en lugar de con una generación puntual. La narración y los agentes tienen economías distintas: una es un proyecto, el otro es un contador que nunca se detiene. ElevenLabs construyó hacia lo segundo, y el 55 por ciento de los ingresos dice que la estrategia funcionó. La pregunta que responderá el próximo año es si la ventaja de calidad sobrevive el tiempo suficiente para que el contador siga funcionando.

El propio enfoque de la empresa apunta en la misma dirección. El material de lanzamiento destaca la expresividad por encima de la precisión o la velocidad, porque esas dos dejaron de ser diferenciadores hace varias versiones. Lo que un agente de voz tiene que hacer para sentirse real es transmitir vacilación, énfasis y una identidad coherente a lo largo de una sesión de cuarenta minutos, y ese es un objetivo más difícil que producir un párrafo limpio. El modelo que lo logre no será necesariamente el más barato por carácter. Será el que consiga que la gente no distinga su salida de una persona con la que ya ha hablado, un listón que sube cada vez que se supera.

Artículos relacionados