VibeVoice solo liberó la mitad: la mitad que falta es la lección

El repositorio de VibeVoice de Microsoft lleva una licencia MIT, unas 55.000 estrellas y una descripción que suena a promesa: IA de voz de frontera de código abierto. Lo que realmente contiene es una lección sobre qué significa «código abierto» cuando un modelo llega a ser lo bastante potente como para preocupar.
La historia corre en dos direcciones. En una, el repositorio no deja de crecer y las partes que quedan son genuinamente útiles. En la otra, la pieza más capaz desapareció. En septiembre de 2025, Microsoft retiró del repositorio el código de inferencia de VibeVoice-TTS tras descubrir que se estaba usando de formas que, según la empresa, eran incompatibles con la intención del proyecto. Los pesos de ese modelo siguen en Hugging Face. El código que los ejecuta, no. Quien quiera ese modelo concreto hoy está por su cuenta.
Esa decisión marca todo lo relativo a cómo se usa el repositorio en 2026, y es más instructiva que cualquier benchmark.
Qué hay realmente en la caja
La pieza central hoy es VibeVoice-ASR, un modelo de reconocimiento de voz de 7.000 millones de parámetros que transcribe hasta 60 minutos de audio en una sola pasada. No se limita a escribir palabras. Devuelve quién habló, cuándo habló y qué dijo, generando una salida estructurada con etiquetas de hablante y marcas de tiempo. Maneja más de 50 idiomas sin indicar el idioma, y acepta hotwords personalizadas, así que puedes darle los nombres y términos técnicos que esperas y dejar que deje de deformarlos.
Alrededor de ese núcleo hay varias variantes recortadas. Hay una versión de ASR en streaming que emite texto trozo a trozo mientras el audio aún está llegando, útil cuando no puedes esperar a la grabación completa. Hay una compilación BitNet que se ejecuta en una CPU sin GPU alguna, comprimida a unos 1,58 GB, lo cual es notable para un modelo de este tamaño. Y está VibeVoice-Realtime-0.5B, un pequeño modelo de texto a voz en streaming que alcanza su primer audio en unos 200 a 300 milisegundos, con voces predefinidas y, notablemente, sin clonación de voz.

El truco de los 7,5 Hz
La idea técnica que une a la familia es un tokenizador de voz que funciona a una tasa de fotogramas inusualmente baja: 7,5 fotogramas por segundo. La mayoría de los tokenizadores de voz funcionan a 50 Hz o más. La tasa más baja importa porque encaja mucho más audio en la misma ventana de contexto. Eso es lo que permite que una sola pasada cubra una hora entera de conversación, porque menos tokens por segundo significa que caben más segundos en la memoria del modelo.
Las tasas de fotogramas bajas suelen costar fidelidad, y VibeVoice lo resuelve con un diseño de dos etapas. Un modelo de lenguaje se encarga de la semántica, decidiendo qué se dice y quién lo dice, y una cabeza de difusión genera el detalle acústico fino. El tokenizador solo necesita preservar suficiente calidad de audio para que la cabeza de difusión haga su parte. Es una división del trabajo limpia, y es la razón por la que el modelo puede ser a la vez de ventana larga y detallado.
Qué puedes y qué no puedes construir
Para cualquiera que trabaje con voz, la mitad utilizable de VibeVoice es sustancial. Transcripción de reuniones con etiquetas de hablante, diarización de pódcast, flujos de entrevistas que necesitan saber quién dijo qué y cuándo, reconocimiento en streaming para aplicaciones en vivo y una voz ligera para un asistente que funciona en hardware modesto: todo eso está al alcance hoy. La compilación para CPU, en particular, abre la puerta a ejecutar reconocimiento en máquinas sin GPU dedicada, algo que importa para el coste y para el despliegue en lugares donde las GPU escasean.
La mitad inutilizable es la que hizo famoso a VibeVoice. El VibeVoice-TTS original podía sintetizar hasta 90 minutos de habla con hasta cuatro hablantes distintos, un auténtico avance de investigación que fue aceptado como artículo oral en ICLR 2026. Esa capacidad es exactamente la que no puedes ejecutar hoy desde el repositorio. La versión famosa era, en la práctica, la retirada.
El código abierto como espectro
El caso de VibeVoice complica una narrativa ordenada que a la industria le gusta contar. Por un lado están los modelos que se dicen abiertos, es decir, que los pesos se pueden descargar. Por otro están los que se dicen cerrados. VibeVoice se sitúa en medio. Los pesos están abiertos, la licencia es permisiva y el código necesario para usar de verdad el modelo más prometedor ya no está. Publicar los pesos sin el código de inferencia es una vía intermedia, y puede que sea donde acaben más modelos capaces a medida que suba lo que está en juego.
También hay aristas prácticas. El repositorio se describe a sí mismo como un marco de investigación más que como un producto acabado, así que las expectativas deben ajustarse. No hay un paquete oficial de Python que puedas instalar desde PyPI con ese nombre, y el paquete que comparte el nombre no es el proyecto de Microsoft. Microsoft también advierte de que los modelos son para investigación y no se recomiendan para uso comercial sin más pruebas, aunque la licencia en sí sea permisiva, que es el tipo de brecha que sorprende a los equipos que leen la licencia y se saltan el README.
Nada de esto convierte el lanzamiento en un fracaso. El modelo ASR es sólido, la variante en streaming es útil y la compilación para CPU es genuinamente ingeniosa. Pero es un recordatorio de que «código abierto» abarca ahora una amplia gama de acuerdos, y el acuerdo concreto importa más que la etiqueta. Un equipo que necesite la capacidad de TTS debería saberlo antes de planificar un proyecto, no después.
La pregunta que merece la pena hacerse
La pregunta honesta que plantea VibeVoice es si eliminar código es la respuesta adecuada al uso indebido. Los pesos siguen ahí fuera, así que quien esté decidido a ejecutar el modelo encontrará la manera. Mientras tanto, quienes podrían haber usado el código de forma responsable, bajo la licencia que se les dio, perdieron el acceso a él. Esa es la tensión que afronta todo laboratorio a medida que se difunden modelos capaces: si restringes la herramienta, perjudicas más a los usuarios cuidadosos que a los descuidados; si la dejas abierta, aceptas que habrá cierto uso indebido.
Microsoft eligió el término medio. Mantuvo abierto el útil trabajo de reconocimiento de voz y retiró el código de síntesis, que conllevaba más riesgo. Otros laboratorios tomarán decisiones distintas, y los usuarios tendrán que seguir leyendo la letra pequeña en lugar de fiarse del titular. VibeVoice merece estudiarse no porque sea inusual, sino porque es un anticipo de cómo se estructurarán más lanzamientos a medida que madure la tecnología.
La lección para quien construye sobre modelos abiertos es verificar antes de comprometerse. Comprueba que los pesos que quieres vengan con el código que los ejecuta. Lee la licencia y el README, porque pueden contradecirse. Confirma que la versión de la que piensas depender seguirá siendo mantenible dentro de un año. Nada de eso es emocionante, y todo ello es más barato que descubrir seis meses después de empezar un proyecto que la mitad del modelo que necesitabas nunca se publicó. VibeVoice le hizo un favor al campo al hacer imposible pasar por alto la distinción entre «pesos abiertos» y «utilizable».
Artículos relacionados
El protocolo PACT de Decagon quiere que el consentimiento sea un estandar
Decagon abrio un protocolo para verificar la identidad de un agente personal y los permisos que un cliente le concedio. Es fontaneria, y decide si la economia de los agentes funciona.
La ola de reencuentros con IA: un debate que China aun no sabe como sentir
Peliculas homenaje hechas con IA devolvieron a figuras fallecidas a las pantallas chinas y reunieron cientos de miles de me gusta. Luego llego la reaccion, y era sobre el consentimiento.
Apple publico un modelo multimodal abierto y casi no lo conto
Este lanzamiento centrado en la investigacion paso desapercibido, pero su anclaje visual de grano fino dice mucho de hacia donde va la pila de IA de Apple.
OpenCut y el momento del CapCut de codigo abierto
Un editor de video gratuito con licencia MIT sigue subiendo en las tendencias de GitHub, y su hoja de ruta incluye un servidor MCP para agentes de IA. Las herramientas en torno a los medios con IA alcanzan a los modelos.