A ElevenLabs resolveu a questão da voz e então elevou o preço de ser ouvido

Em 28 de setembro, a ElevenLabs lançou dois modelos de fala. O Eleven v4 foi construído para narração e diálogo preparado. O Eleven v4 Turbo foi construído para conversa ao vivo, com latência mediana de inferência próxima de 100 milissegundos e cerca de 150 milissegundos até a primeira fala. Dois dias depois, a empresa concluiu uma oferta de compra de ações de funcionários que a avaliou em US$ 22 bilhões, o dobro da marca de US$ 11 bilhões registrada em fevereiro.
Esses dois anúncios são o mesmo anúncio. Quando um modelo de voz fica rápido o suficiente para que as pessoas parem de notar o atraso, a questão que resta é quem soa real — e essa é uma questão de produto com um preço atrelado.
A latência era a última desculpa técnica
Os agentes de voz têm um modo de falha persistente há anos. As palavras estão corretas, o timing está errado. Uma pausa que dura um instante a mais transforma um assistente útil em algo que o usuário desliga na cara, e a solução sempre foi mais hardware ou uma frase mais curta. Os números do Turbo ficam abaixo do limiar em que os humanos percebem a diferença. Cerca de 100 milissegundos é mais ou menos a duração de uma pausa normal de conversa, o que significa que o atraso deixa de soar como uma máquina pensando e passa a soar como uma pessoa ponderando.
A nova arquitetura também abrange mais de 90 idiomas, ante mais de 70 na v3, com um detalhe que importa mais do que a contagem. Uma voz clonada a partir de uma gravação em inglês falará japonês com um sotaque japonês natural, em vez de arrastar consigo o sotaque de origem. Marcas que localizam um único porta-voz em vários mercados obtêm um resultado mais limpo, e obras de ficção que dependem do sotaque de um personagem exigem uma decisão deliberada, e não um padrão automático.
As requisições agora aceitam até 10.000 caracteres, o dobro do limite anterior. Tags de entonação embutidas como [laughs], [whispers] e [said angrily] continuam funcionando e podem ser empilhadas. Os Instant Voice Clones ainda precisam de cerca de 10 segundos de áudio.
O salto de pouco mais de 70 idiomas para mais de 90 é menor do que o salto na forma como uma voz clonada se comporta entre eles. Uma única gravação agora pode representar um produto em uma dúzia de mercados sem que cada versão soe como a mesma pessoa se esforçando para imitar um sotaque local. Para uma empresa que localiza um único porta-voz, isso elimina uma etapa que antes exigia uma segunda sessão de gravação por idioma.
A expressividade é onde está o dinheiro
A Artificial Analysis classificou a v4 em primeiro lugar em expressividade, e a ElevenLabs informa que cerca de 75% dos ouvintes a preferiram em testes cegos. Os dois números vêm da empresa ou de seus parceiros, então trate-os como marketing até que alguém refaça o teste. Ainda assim, a direção é reveladora. Todo grande laboratório já consegue produzir fala inteligível. O diferencial passou a ser se a fala consegue carregar tom, ritmo e uma personalidade reconhecível ao longo de uma gravação longa sem que a voz se desvie entre os capítulos.
O quadro comercial faz o mesmo ponto sob outro ângulo. A ElevenAgents, plataforma para agentes conversacionais, agora responde por 55% da receita da ElevenLabs. A voz não está sendo vendida principalmente como narração para audiolivros. Está sendo vendida como a camada de interface para softwares que falam.
Essa mudança explica a estrutura de preços. O Eleven v4 custa US$ 0,08 por 1.000 caracteres via API, e o Turbo custa US$ 0,04. Ambos estão com desconto até 12 de outubro, caindo para US$ 0,022 e US$ 0,011, respectivamente. As tarifas de referência são as que devem entrar no orçamento, porque o desconto de lançamento é temporário e correções acrescentam caracteres. O Turbo também tem uma restrição específica fácil de passar despercebida: o WebSocket de Text to Dialogue aceita até dez vozes registradas por conexão na v4, mas apenas uma no Turbo.
O restante do mercado não está parado
A ElevenLabs não está sozinha em tratar a voz como a interface do agente. Em 30 de setembro, a Inception Labs lançou o Mercury Voice, um modelo de linguagem por difusão criado especificamente para agentes de voz de baixa latência, com tempo mediano até o primeiro token de resposta de 320 milissegundos e preço em torno de nove décimos de centavo por minuto de conversa no lançamento. A Suno lançou um modelo de fala em beta. A Vercel adicionou os modelos de áudio da Microsoft ao seu AI Gateway com retenção zero de dados.
As abordagens diferem em onde colocam a parte difícil. A ElevenLabs trata a síntese como o produto e modela as palavras separadamente. A Inception inclui o modelo de linguagem no orçamento de latência, argumentando que uma camada de síntese rápida é inútil se o modelo por trás dela leva dois segundos para pensar. Ambas são coerentes, e vão continuar se chocando, porque um usuário que experimenta um agente de voz não consegue dizer qual componente foi lento.
As partes desconfortáveis
A clonagem é protegida por verificação obrigatória da identidade do proprietário e por filtros que bloqueiam clones não autorizados de figuras públicas proeminentes. Isso é um piso razoável, não uma solução. Uma amostra de dez segundos agora basta para um clone de alta fidelidade, e o número de pessoas que têm dez segundos do áudio de alguém é, na prática, todo mundo.
Há um problema de segunda ordem que nenhum filtro resolve. À medida que modelos expressivos ficam melhores em soar como uma pessoa específica, o valor da voz como sinal de verificação entra em colapso. Uma impressão vocal costumava ser evidência fraca e agora está perto de não ser evidência nenhuma. Bancos e call centers que construíram verificações de identidade com base em "reconhecemos a voz do cliente" vêm aposentando essa premissa discretamente há dois anos, e este lançamento deixa claro que essa aposentadoria já passou da hora.
O número de latência também é mais restrito do que parece. Ele é medido no protocolo de benchmark da própria ElevenLabs, com a latência de rede removida. Um assistente real ainda precisa reconhecer o pedido, decidir uma resposta e entregá-la pela rede. O Turbo elimina uma fonte de atraso em uma cadeia que tem várias.

O que a avaliação realmente diz
Dobrar uma avaliação em oito meses, com base em uma venda secundária de US$ 300 milhões em vez de novo capital primário, é uma declaração sobre retenção e sobre uma categoria que ainda não se tornou commodity. Modelos de voz são o raro produto de IA em que os usuários percebem a qualidade imediatamente e trocam de solução por causa dela. Hyperscalers e concorrentes especializados estão todos lançando produtos, e a diferença de qualidade vem diminuindo.
A aposta por trás do número de US$ 22 bilhões é que a diferença continue ampla o suficiente para justificar cobrança, e que a plataforma de agentes continue crescendo mais rápido do que cai o preço bruto da síntese. O Turbo caindo para US$ 0,011 por 1.000 caracteres durante o lançamento sugere que a segunda metade dessa aposta é a mais difícil. Quando o custo marginal de uma voz se aproxima de zero, o que você ainda consegue vender é a voz que ninguém mais tem.
Há também uma razão estrutural para uma empresa de voz sustentar uma avaliação como essa, enquanto empresas de imagem e vídeo penam para conseguir o mesmo. Um agente de voz roda continuamente, em cada ligação e em cada sessão, então o uso escala com o sucesso do produto, e não com gerações pontuais. Narração e agentes têm economias diferentes: um é um projeto, o outro é um medidor que nunca para. A ElevenLabs construiu na direção do segundo, e 55% da receita mostram que a estratégia funcionou. A pergunta que o próximo ano responde é se a vantagem de qualidade sobrevive tempo suficiente para o medidor continuar rodando.
O próprio enquadramento da empresa aponta na mesma direção. O material de lançamento destaca a expressividade, e não a precisão ou a velocidade, porque essas duas deixaram de ser diferenciais há vários lançamentos. O que um agente de voz precisa fazer para parecer real é carregar hesitação, ênfase e uma identidade consistente ao longo de uma sessão de quarenta minutos, e esse é um alvo mais difícil do que produzir um parágrafo limpo. O modelo que vencer isso não será necessariamente o mais barato por caractere. Será aquele cuja saída as pessoas não conseguem distinguir de uma pessoa com quem já falaram, uma régua que sobe toda vez que é superada.
Artigos relacionados
Ferramentas de vídeo com IA recebem nota 9 de 10 em facilidade de uso. A pontuação de conformidade é outra história.
Os usuários adoram geradores de vídeo com IA. Os departamentos jurídicos ainda não foram consultados.
InternLumina-U2 coloca texto, imagens, vídeo e 3D em um único modelo de 16B e ainda entrega dois conjuntos de pesos
A lista de tarefas é ambiciosa. O formato de lançamento carrega mais sinal.
HappyOyster Vende um Mundo no Qual Você Pode Entrar, Não um Clipe para Assistir
A maioria dos modelos de vídeo entrega a você um arquivo. Este entrega uma sala com uma porta.
Luma Ray3 Modify preserva a atuação e renegocia o mundo ao seu redor
O problema mais difícil na edição de vídeo com IA não é o efeito. É não destruir a tomada pela qual você já pagou.