← Voltar ao blog
Aicerca de 9 min de leitura

A stack de anúncios em vídeo se dividiu em especialistas, e o Boreal-H3 mostra por quê

Publicado 7 de out. de 2026
A stack de anúncios em vídeo se dividiu em especialistas, e o Boreal-H3 mostra por quê

A Creatify Labs lançou o Boreal-H3 em 2 de outubro, um modelo de vídeo construído por pós-treinamento do MiniMax H3, em parceria com a MiniMax, e voltado para uma única função: produzir clipes publicitários. A parte interessante está no benchmark que a Creatify inventou para vendê-lo, e no que esse benchmark implica sobre para onde a geração de vídeo está caminhando.

O argumento de venda, em números

O Boreal-H3 pontua 133,3 no Índice de Qualidade de Anúncios da Creatify, no qual o MiniMax H3 é normalizado para 100. O conjunto de comparação o colocou à frente do Gemini Omni 1.1 Flash, com 122,2, do Seedance 2.5, com 118,1, e do Wan 3.0 Prime, com 111,1.

Em fidelidade de referência (medida em um limiar mais rigoroso de 7 de 10), o Boreal-H3 alcançou 85,3%, à frente do MiniMax H3, com 82,4%, do Wan 3.0 Prime, com 79,4%, do Seedance 2.5, com 71,9%, e do Omni 1.1 Flash, com 70,6%.

Em relação à sua própria base, o ciclo de pós-treinamento elevou a consistência do sujeito de 83,3% para 94,4%, aumentou a conclusão do briefing de 27,8% para 50,0% em um conjunto de briefings de produção difíceis, e reduziu defeitos visíveis de 1,11 para 0,33 por clipe, uma redução de 70%.

Os números de custo e velocidade são onde o argumento de venda fica mais afiado. Em 768p, o Boreal-H3 gera a 1,1 segundo por segundo de vídeo, então um clipe de 10 segundos leva cerca de 11 segundos e custa US$ 0,40. O Seedance 2.5 roda a 46,5 segundos por segundo de vídeo e aproximadamente US$ 0,47 por segundo. Em uma demonstração de produto de 15 segundos, o Boreal-H3 renderizou em 84 segundos, contra 411 segundos do Seedance 2.5.

Por que o benchmark importa mais que o modelo

O Índice de Qualidade de Anúncios mede algo específico: com que frequência um modelo produz um clipe que funciona como anúncio. Um clipe só é aprovado quando o cumprimento do prompt, a consistência da referência e o realismo visual obtêm, cada um, nota 6 de 10 ou mais. A taxa de aprovação de cada modelo é então indexada em relação ao MiniMax H3.

Essa é uma pergunta diferente da que a maioria dos benchmarks de vídeo faz. O Artificial Analysis e leaderboards similares classificam as saídas por qualidade geral e apelo estético. Se um clipe mantém o rótulo de um produto legível, sustenta a silhueta da embalagem de forma estável e preserva o rosto do criador do primeiro ao último quadro não é o que esses rankings medem, e é o que um anunciante verifica primeiro.

A ressalva honesta é que a Creatify criou o índice, o opera e está vendendo o modelo que vence nele. A empresa diz que seus juízes automatizados foram validados em relação a preferências humanas e que estudos humanos usaram saídas anonimizadas e randomizadas. Essa é uma alegação metodológica razoável, e ainda é uma alegação da própria fornecedora sobre o próprio produto. Ainda não existe replicação independente.

Há também um detalhe mais discreto: a comparação inclui Seedance 2.5 e Wan 3.0 Prime, ambos modelos de vídeo generalistas fortes que estão sendo avaliados por critérios específicos de publicidade. Perder um benchmark especializado para um modelo especializado é esperado. O número que seria alarmante é se o Boreal-H3 perdesse para um modelo generalista em seu próprio terreno.

A divisão em especialistas é real e é estrutural

Onde o Boreal-H3 se encaixa é mais interessante do que se ele vence.

A geração de vídeo em 2026 se dividiu visivelmente. De um lado estão os generalistas cinematográficos (Veo, do Google, Kling, Gen-4.5, da Runway) que vendem qualidade, controle de câmera e áudio nativo para qualquer pessoa com uma história para contar. Do outro estão os especialistas em publicidade: Creatify, Arcads, HeyGen, todos construídos em torno de vídeos de criadores no estilo UGC e demonstrações de produto, vendidos para profissionais de marketing de performance que precisam de volume e velocidade de iteração, não de um hero shot.

A economia explica a divisão. Uma campanha de anúncios de performance precisa de dezenas de variações para encontrar o gancho que funciona. Se cada variação custa US$ 5, a matemática não fecha. Se cada uma custa 40 centavos e renderiza em 11 segundos, você pode testar uma dúzia de ganchos antes do almoço. Qualidade cinematográfica e capacidade de iteração são produtos diferentes, e tentar vender os dois a partir de um único modelo significa comprometer aquilo com que o comprador se importa mais.

A HeyGen seguiu um caminho semelhante na mesma semana, lançando um modelo de vídeo universal a um centavo por segundo, também pós-treinado no MiniMax H3. Duas empresas decidiram independentemente que a base do MiniMax era o substrato certo no qual se especializar, o que diz algo sobre onde está a fronteira dos pesos abertos.

O que o modelo ainda não consegue fazer

A seção que a maioria dos fornecedores pula: deformação de produto.

A forma de uma garrafa pode mudar sutilmente entre quadros, ou entre variações geradas separadamente do mesmo produto. Elementos de marca são renderizados de forma aparentemente plausível, mas tecnicamente errada: um logotipo com proporções incorretas, um wordmark em relevo com uma letra que quase não existe. A consistência de embalagem entre gerações é comum o suficiente para que fluxos de trabalho sérios fixem uma imagem de referência para restringi-la, em vez de confiar em uma descrição textual.

A Creatify afirma ter resolvido isso e publicado uma redução na taxa de defeitos. O que a afirmação não cobre é o modo de falha que mais importa em uma campanha paga: um defeito que sobrevive à revisão porque parece certo em tamanho de miniatura e errado em tamanho real. Juízes automatizados que dão nota 6 de 10 para realismo visual não vão detectar de forma confiável um logotipo desenhado incorretamente. Um humano comparando o resultado com o produto físico vai.

O conselho de fluxo de trabalho que se segue é pouco glamouroso. Comece cada foto de produto a partir de uma fotografia do produto real, em vez de uma descrição textual, porque um prompt só de texto faz o modelo inventar o rótulo junto com o objeto. Escreva prompts para o movimento (o que se move, como a câmera se move, o que a luz faz), porque a foto já carrega o produto. Coloque cada clipe ao lado do objeto físico antes de publicá-lo.

O que a especialização traz, e o que ela custa

O argumento a favor de um modelo como o Boreal-H3 é direto: se o seu resultado é publicidade, um modelo ajustado para publicidade vai economizar ciclos de iteração que um modelo generalista gasta em capacidade da qual você não precisa.

O argumento contra é o lock-in de um tipo específico. Um modelo pós-treinado no ciclo de avaliação de uma empresa é otimizado para a definição dessa empresa do que é um bom anúncio, e essa definição não é publicada em um formato que qualquer outra pessoa possa auditar. O Índice de Qualidade de Anúncios é um proxy razoável para “isso funciona como um comercial?”. Se ele se correlaciona com “esta campanha tem desempenho?” é uma pergunta que só compradores de mídia podem responder, e eles responderão com seus orçamentos nos próximos dois trimestres.

Há um efeito de segunda ordem que vale antecipar. Quando um modelo é pós-treinado para um objetivo comercial específico, ele tende a melhorar nos padrões que esse objetivo recompensa e a piorar naqueles que ele não mede. Um modelo focado em anúncios que foi otimizado para fidelidade de produto e consistência de criador pode se afastar da inventividade visual que torna uma campanha memorável. O Índice de Qualidade de Anúncios não tem nenhum componente que meça se um clipe é interessante, e essa é uma escolha deliberada de escopo com consequências.

A exigência de material de referência é a outra restrição prática. O controle de keyframe e o controle de múltiplas referências exigem que o anunciante forneça bons insumos: uma foto limpa do produto, um criador consistente, um estilo visual estabelecido. Isso é bom para marcas que já têm uma biblioteca de fotografias e um sistema de design. Para um pequeno vendedor gerando criativos do zero, a especialização é menos útil, porque os insumos de que o modelo precisa são os insumos que o vendedor não tem.

O que o Boreal-H3 realmente demonstra é que o mercado de geração de vídeo amadureceu além do ponto em que um único leaderboard resolve alguma coisa. A pergunta relevante para um comprador no final de 2026 não é mais qual modelo é o melhor. É qual modelo é melhor na coisa específica que você está produzindo, e se você consegue medir isso por conta própria em vez de confiar no índice do fornecedor.

Essa última frase é a que mais importa. Os fornecedores que criam modelos de publicidade também são os fornecedores que vendem os benchmarks que os classificam. A única avaliação confiável é um teste controlado no seu próprio conjunto de produtos, com seus próprios critérios de revisão, e um humano comparando cada resultado com o objeto físico. É mais lento do que ler um leaderboard e consideravelmente mais útil.

Artigos relacionados