← Voltar ao blog
Aicerca de 6 min de leitura

TaoMate-H3, do Taobao, em código aberto: geração contínua de áudio e vídeo em escala de minutos comprimida a apenas três etapas de denoising por trecho

Publicado 7 de out. de 2026
TaoMate-H3, do Taobao, em código aberto: geração contínua de áudio e vídeo em escala de minutos comprimida a apenas três etapas de denoising por trecho

A equipe TaoLive AIGC da Alibaba disponibilizou no GitHub e no Hugging Face o código de inferência e os pesos LoRA do TaoMate-H3. O que esse modelo faz não é exatamente novo: fazer imagem e som surgirem na mesma geração. Mas a forma como ele se avalia mudou: não compara quem tem a qualidade visual mais impressionante em um único trecho, e sim quanto tempo se espera desde inserir o prompt até ver o primeiro trecho pronto.

Tempo de espera do primeiro trecho, uma métrica com a qual ninguém se importava antes

A lógica de geração dos principais modelos de vídeo é o denoising do trecho inteiro. Você escreve uma descrição de trinta segundos, e o modelo joga todos os quadros desses trinta segundos juntos no processo de difusão, iterando repetidamente, sem entregar nada no meio, até o trecho inteiro ser calculado e só então ser entregue de uma vez. O problema desse método é direto: o tempo de espera é proporcional à duração do vídeo. Quer algo mais longo, tem de esperar mais.

O TaoMate-H3 segue uma abordagem de avanço por segmentos. Ele divide a geração em pequenos trechos, e cada trecho precisa de apenas três etapas de denoising; o modelo primeiro resolve bem o trecho atual e depois continua gerando o conteúdo seguinte. Tecnicamente, ele conecta inferência LoRA em três etapas à geração autorregressiva, e os personagens, sons e cenários do trecho anterior são levados como contexto para o próximo trecho.

A diferença prática trazida por essa mudança está em “quando é possível ver algo”. Em transmissões ao vivo explicativas, performances de personagens virtuais ou qualquer cenário que exija feedback imediato, o usuário não precisa esperar a geração do vídeo inteiro para ver a imagem pela primeira vez. O tempo de produção do primeiro trecho diminuiu, e poucos modelos costumavam usar essa métrica como principal argumento de venda. O Machine Heart mencionou em reportagem que o TaoMate-H3 promove justamente o “tempo de geração do primeiro trecho”.

Como o som participa da geração

Na geração conjunta de áudio e vídeo, há duas abordagens no setor. Uma é gerar primeiro a imagem e depois usar outro modelo para adicionar o som, alinhando as duas partes na pós-produção; a outra é fazer o som participar desde o processo de geração, oferecendo restrições temporais para a sincronia labial, as expressões e os movimentos.

Duas pequenas placas de latão em formato de onda sonora, em branco, eretas sobre uma mesa de madeira clara, com luz quente incidindo de lado sobre suas superfícies lisas e sem marcações

O TaoMate-H3 é a segunda abordagem. No mesmo processo de geração, som e imagem são processados simultaneamente; falas de personagens, canto e diálogos de personagens estão nesse framework, assim como efeitos sonoros ambientais e de ação, como ondas do mar, movimento de veículos e explosões. A sincronização temporal entre diálogo e imagem não precisa ser corrigida depois, na pós-produção.

Em termos de especificações de saída, ele suporta três níveis: 480p, 768p e 1080p, com saída tanto em paisagem quanto em retrato. A descrição de cena pode ser escrita como um prompt completo ou organizada por segmentos, com falas, ações e enredo; o modelo continua a partir do contexto histórico preservado. A geração contínua em escala de minutos é seu intervalo-alvo.

O número de parâmetros não é grande, mas só dá para entendê-lo de verdade ao inseri-lo em um fluxo de trabalho real

O TaoMate-H3 é pós-treinado com base no MiniMax H3. A base é um modelo fundamental já aberto por outros, e a equipe do TaoMate adicionou a ele a capacidade de geração em streaming. É também por isso que os pesos puderam ser liberados tão rapidamente: não é preciso treinar um modelo grande do zero; o foco está no pipeline de inferência e no LoRA.

Para desenvolvedores, o valor prático tem vários níveis. O mais direto é poder rodar no próprio hardware, sem depender de API em nuvem para pesquisar geração em streaming. Em segundo lugar, a própria geração em streaming abre alguns cenários que antes eram pouco práticos: gerar e reproduzir ao mesmo tempo, performances contínuas de personagens por longos períodos e vídeos interativos que precisam ajustar o conteúdo seguinte conforme a reação do público.

Há uma limitação que vale deixar clara. Três etapas de denoising significam que o custo computacional de cada trecho é reduzido a um nível muito baixo, e o preço disso é o teto de qualidade visual de cada trecho. O efeito nas demonstrações oficiais é uma coisa; colocá-lo em entregas finais que exigem alta qualidade visual é outra. Esse modelo se parece mais com uma base de código aberto utilizável para a demanda de “geração contínua”, e não com algo que venha competir com modelos fechados de ponta em qualidade de quadro único.

O caminho do vídeo de código aberto nacional neste ano

Se colocarmos o TaoMate-H3 de volta na linha do tempo deste ano, percebemos um caminho relativamente claro. No início do ano, todos comparavam parâmetros e pontuações em rankings; no segundo semestre, o foco passou a ser comprimir os modelos para dentro de fluxos de trabalho reais: menor uso de VRAM, primeiro quadro mais rápido e custo por segundo mais baixo.

O MiniMax H3 abriu o modelo base, a TaoLive construiu sobre ele a geração de áudio e vídeo em streaming, e a Alibaba PAI lançou ainda um ramo ControlNet-Union com suporte a oito tipos de condições de controle e reparo de vídeo. Quando um modelo aparece, logo há quem continue desenvolvendo capacidades de camada superior. Essa divisão de trabalho avança mais rápido na comunidade open source do que no ecossistema fechado, porque ninguém precisa esperar que alguém abra uma interface.

Para quem produz conteúdo, essas mudanças acabam se concretizando em pontos bem específicos: para fazer um vídeo que exige atuação contínua, antes talvez fosse preciso gerar dez trechos separadamente e depois juntá-los; agora é possível escrever por segmentos, e o modelo segue adiante carregando o contexto. Se algo ficar errado depois de pronto, ainda dá para alterar apenas aquele trecho.

Considerações finais

O mais digno de nota neste lançamento do TaoMate-H3 é que ele colocou a “espera pelo primeiro trecho” em pauta. Nos últimos anos, a geração de vídeo vem resolvendo “é possível gerar?” e “gera bem?”; agora começa a haver quem calcule seriamente “quando será possível ver o primeiro quadro”. A resposta a essa pergunta determina se os modelos de vídeo conseguirão sair do palco de demonstração e entrar em fluxos de trabalho de produção diária.

Os pesos e o código de inferência já estão abertos; agora resta ver se a comunidade fará crescer mais coisas sobre ele, especialmente em cenários que exigem saída contínua por longos períodos e que não podem esperar a renderização do trecho inteiro.

Artigos relacionados