← Volver al blog
Aiaprox. 6 min de lectura

Taobao TaoMate-H3, código abierto: reduce la generación continua de audio y video a nivel de minutos a solo tres pasos de eliminación de ruido por segmento

Publicado 7 oct 2026
Taobao TaoMate-H3, código abierto: reduce la generación continua de audio y video a nivel de minutos a solo tres pasos de eliminación de ruido por segmento

El equipo de AIGC de TaoLive, de Alibaba, ha publicado en GitHub y Hugging Face el código de inferencia y los pesos LoRA de TaoMate-H3. Lo que hace este modelo no es nuevo: que imagen y sonido salgan en el mismo proceso de generación. Pero su forma de medirse ha cambiado: no compite por quién tiene la calidad visual más impactante en un solo segmento, sino por cuánto hay que esperar desde que se introduce el prompt hasta que se ve el primer segmento terminado.

El tiempo de espera del primer segmento, una métrica que antes a nadie le importaba

La lógica de generación de los modelos de video predominantes es eliminar el ruido de todo el segmento. Escribes una descripción de treinta segundos y el modelo mete todos los fotogramas de esos treinta segundos juntos en el proceso de difusión, iterando una y otra vez, sin darte nada por el camino, hasta que termina de calcular todo el segmento y lo entrega de una sola vez. El problema de este método es evidente: el tiempo de espera es directamente proporcional a la duración del video. Si quieres algo más largo, tienes que esperar más.

TaoMate-H3 avanza segmento a segmento. Divide la generación en fragmentos pequeños, y cada fragmento solo necesita tres pasos de eliminación de ruido; el modelo primero resuelve bien el fragmento actual y luego continúa generando el contenido posterior. Técnicamente, conecta la inferencia LoRA de tres pasos con la generación autorregresiva, de modo que los personajes, el sonido y la escena del segmento anterior se trasladan al siguiente como contexto.

La diferencia real que aporta este cambio está en “cuándo se puede ver algo”. En escenarios de explicación en directo, actuación de personajes virtuales o cualquier situación que requiera retroalimentación inmediata, el usuario no tiene que esperar a que se genere todo el video para ver imagen por primera vez. El tiempo de producción del primer segmento se reduce, una métrica que hasta ahora pocos modelos han utilizado como argumento de venta principal. En su reportaje, Machine Heart menciona que TaoMate-H3 promociona precisamente el “tiempo de generación del primer segmento”.

Cómo participa el sonido en la generación

En la generación conjunta de audio y video, la industria sigue dos enfoques. Uno consiste en generar primero la imagen y luego hacer que otro modelo le añada el sonido, alineando ambas partes en la posproducción; el otro consiste en que el sonido participe durante el propio proceso de generación, imponiendo restricciones temporales al lip-sync, las expresiones y los movimientos.

Dos pequeñas placas de latón en forma de onda sonora, en blanco, erguidas sobre una mesa de madera clara, con una luz cálida incidiendo de través sobre sus superficies lisas y sin marcas

TaoMate-H3 pertenece al segundo enfoque. En el mismo proceso de generación se procesan a la vez sonido e imagen: el habla de los personajes, el canto y los diálogos de los personajes entran en este marco, y también efectos ambientales y de acción como olas del mar, movimiento de vehículos o explosiones. La sincronización temporal entre diálogo e imagen no necesita corregirse en la posproducción.

En cuanto a las especificaciones de salida, admite tres niveles: 480p, 768p y 1080p, y puede generar tanto en horizontal como en vertical. La descripción de la escena puede escribirse como un único prompt completo, o bien organizar por segmentos los diálogos, las acciones y la trama, y el modelo continúa a partir del contexto histórico conservado. La generación continua a escala de minutos es su rango objetivo.

No tiene muchos parámetros, pero solo se entiende al ponerlo en un flujo de trabajo real

TaoMate-H3 realiza un post-entrenamiento sobre MiniMax H3. La base es un modelo fundamental que otros ya habían liberado como código abierto, y el equipo de TaoMate le añadió la capacidad de generación en streaming. Esa es también la razón por la que los pesos se han publicado tan rápido: no hace falta entrenar un modelo grande desde cero; la clave está en el pipeline de inferencia y en LoRA.

Para los desarrolladores, el valor práctico tiene varios niveles. El más directo es que se puede ejecutar en su propio hardware, sin depender de una API en la nube para investigar la generación en streaming. En segundo lugar, la propia generación en streaming abre escenarios que antes resultaban poco prácticos: reproducir mientras se genera, actuaciones continuas de personajes durante largos periodos y videos interactivos que necesitan ajustar el contenido posterior según la reacción del público.

Hay una limitación que conviene dejar clara. Los tres pasos de eliminación de ruido implican que el coste computacional de cada segmento se reduce mucho, a costa del techo de calidad visual de cada segmento. El resultado de las demostraciones oficiales es una cosa, y otra es meterlo en una entrega final que exige alta calidad de imagen. Este modelo se parece más a ofrecer una base de código abierto utilizable para la necesidad de “generación continua”, no a competir con los mejores modelos cerrados en calidad por fotograma.

La trayectoria del video open source chino este año

Si situamos TaoMate-H3 en la línea temporal de este año, se aprecia una trayectoria bastante clara. A principios de año, todos competían por parámetros y puntuaciones en los rankings; en la segunda mitad, el foco pasó a meter los modelos en flujos de trabajo reales: menos memoria de GPU, un primer fotograma más rápido y un coste por segundo más barato.

MiniMax H3 liberó el modelo base como código abierto, TaoLive construyó sobre él la transmisión en streaming de audio y video, y Alibaba PAI publicó además una rama de ControlNet-Union que admite ocho tipos de condiciones de control y reparación de video. Cuando aparece un modelo, pronto hay quien continúa desarrollando capacidades de capa superior. Esta división del trabajo avanza más rápido en la comunidad open source que en el ecosistema cerrado, porque nadie tiene que esperar a que otro abra una interfaz.

Para quienes crean contenido, estos cambios acaban concretándose en cosas muy específicas: para hacer un video que requiere una actuación continua, antes quizá había que generar diez fragmentos por separado y luego empalmarlos; ahora se puede escribir por segmentos y el modelo avanza por su cuenta llevando el contexto consigo. Y si al terminar algo no queda bien, todavía se puede modificar solo ese segmento.

Para terminar

Lo más memorable de este lanzamiento de TaoMate-H3 es que pone sobre la mesa la “espera del primer segmento”. Durante los últimos años, la generación de video ha estado resolviendo “si se puede generar” y “si se genera bien”; ahora empieza a haber quien calcula en serio “cuándo se puede ver el primer fotograma”. La respuesta a esta pregunta determina si los modelos de video pueden pasar del escenario de demostración a un flujo de trabajo de publicación diaria.

Los pesos y el código de inferencia ya están abiertos; ahora queda ver si la comunidad hará crecer más cosas sobre él, sobre todo en escenarios que necesitan una salida continua durante mucho tiempo y no pueden permitirse esperar a que se renderice todo el segmento.

Artículos relacionados