← Voltar ao blog
Aicerca de 8 min de leitura

A Ai2 Tornou Open Source o Stack de Treinamento, e Não Mais um Conjunto de Pesos

Publicado 5 de out. de 2026
A Ai2 Tornou Open Source o Stack de Treinamento, e Não Mais um Conjunto de Pesos

O Allen Institute for AI lançou o Olmo-core 3, uma infraestrutura de treinamento aberta para modelos de mistura de especialistas na escala de trilhões de parâmetros. O benchmark de destaque é um MoE de 47 bilhões de parâmetros alcançando cerca de 2,7 vezes a vazão da configuração anterior em oito GPUs B300. Esse número é respeitável. Também não é o motivo pelo qual o lançamento importa.

Pesos são fáceis de distribuir e difíceis de aprender com eles. Baixe um conjunto de pesos e você pode executar um modelo. Você não pode reproduzi-lo, auditá-lo ou retreiná-lo com seus próprios dados sem, essencialmente, reconstruir o pipeline de treinamento do zero. O Olmo-core 3 é o lançamento do pipeline.

A distinção que sempre reaparece

Pesos abertos e treinamento aberto são produtos diferentes, e a lacuna entre eles é onde vive a maior parte da informação útil.

Um modelo lançado diz o que uma equipe alcançou. Um stack de treinamento diz como, que é o que você precisa se quiser fazer você mesmo. O segundo é muito mais útil para qualquer pessoa fora da organização que o lançou, e muito mais raro, porque o código de treinamento, o pipeline de dados e os detalhes de configuração são as partes que levaram mais tempo para acertar.

A mistura de especialistas torna isso mais importante, não menos. Um modelo MoE encaminha cada token para um subconjunto de especialistas, então um modelo com trilhões de parâmetros totais pode ativar uma pequena fração por token. Esse design reduz o custo de inferência, mas introduz decisões de roteamento, balanceamento de carga entre especialistas e padrões de comunicação entre dispositivos que são genuinamente difíceis de ajustar. Duas equipes podem ter arquiteturas de modelo idênticas e vazões muito diferentes por causa de escolhas no loop de treinamento.

Lançar a infraestrutura de treinamento significa que essas escolhas ficam visíveis. É isso que torna um número de 2,7 vezes de vazão significativo, porque ele está atrelado a um código que outra pessoa pode executar e verificar.

Uma placa aceleradora gráfica deitada sobre uma mesa escura ao lado de um cartão em branco

Por que o treinamento de MoE é a parte difícil

Modelos densos escalam de forma previsível. Você adiciona parâmetros, adiciona compute, e obtém uma curva suave. Modelos MoE introduzem um problema de agendamento. Se o roteador envia a maioria dos tokens para poucos especialistas, esses especialistas se tornam o gargalo e o restante do hardware fica ocioso. Se ele distribui os tokens de forma uniforme demais, o modelo perde a especialização que tornava a arquitetura atraente.

Acertar isso exige fatores de capacidade, perdas auxiliares e camadas de comunicação que a maioria dos laboratórios trata como proprietárias. Também exige checkpointing que sobreviva a falhas de hardware, porque uma execução de treinamento nessa escala vai encontrar falhas e reiniciar do começo não é uma opção.

O ganho de vazão que a Ai2 relata em oito GPUs B300 é um resultado em pequena escala, e deve ser lido assim. Mostrar que um loop de treinamento é eficiente em um único nó não é o mesmo que mostrar que ele se mantém em centenas de nós, onde a comunicação entre nós domina. Mas é o primeiro resultado certo, porque problemas de eficiência costumam aparecer primeiro na pequena escala e pioram conforme você escala.

Por que a vazão em oito GPUs é o primeiro número certo

Um resultado de vazão em pequena escala parece modesto ao lado do enquadramento de trilhões de parâmetros, e merece uma defesa. Problemas de eficiência de treinamento tendem a aparecer cedo e piorar. Se um loop de treinamento desperdiça um terço do seu compute em um único nó, o mesmo loop desperdiçará mais quando a comunicação entre nós for adicionada, porque a ineficiência se acumula a cada camada de coordenação.

Publicar um número em pequena escala primeiro é uma forma de dizer que os fundamentos são sólidos antes de fazer afirmações sobre um cluster grande. Também é o lugar certo para começar. Uma equipe que relata um número de grande escala antes de um pequeno geralmente está relatando um pico, e não uma taxa sustentada.

Há um segundo motivo pelo qual o número importa. A vazão de MoE é sensível ao tamanho do batch e ao comprimento da sequência de formas que modelos densos não são, e a configuração que maximiza a eficiência em oito GPUs frequentemente se generaliza para clusters maiores com ajustes. Uma melhoria de 2,7 vezes é grande o suficiente para refletir uma mudança estrutural, e não um detalhe de ajuste, o que a torna digna de atenção.

O público para isso é menor que o público para pesos

A maioria das pessoas que fala sobre modelos abertos quer pesos. Elas querem executar inferência, fazer fine-tuning em um domínio ou construir um produto. Esse grupo é atendido por todo lançamento de pesos abertos.

O grupo que precisa de um stack de treinamento é muito menor: laboratórios de pesquisa, programas nacionais de compute, universidades com acesso a clusters e empresas em setores regulados que precisam documentar como um modelo foi produzido. Esses usuários têm sido mal atendidos, porque a escolha tem sido entre construir um pipeline do zero e usar algo que só funciona com o hardware de um fornecedor específico.

Um stack de treinamento aberto muda a segunda opção. Ele dá a um laboratório um ponto de partida que ele pode modificar, e dá a um programa governamental um caminho para modelos soberanos que não depende da disposição de um fornecedor estrangeiro em compartilhar detalhes de implementação.

Isso é algo estratégico de se lançar, e a Ai2 tem sido consistente nisso. Os modelos do instituto têm sido publicados com dados, código e logs de treinamento, o que é um padrão mais difícil do que lançar pesos e um artigo.

A discussão silenciosa sobre treinamento aberto

Há um debate dentro da comunidade de modelos abertos sobre o que a abertura deveria significar, e lançamentos como este o impulsionam.

Uma posição sustenta que os pesos são o que importa, porque os pesos são o que as pessoas usam. Sob essa visão, publicar um modelo é um presente e os detalhes de treinamento são negócios privados de uma empresa. A outra posição sustenta que um modelo sem seu stack de treinamento não pode ser auditado, reproduzido ou melhorado por ninguém fora da equipe original, e que chamar esse lançamento de aberto exagera o que ele oferece.

A segunda posição vem ganhando terreno por uma razão prática. Reguladores em várias jurisdições começaram a exigir que desenvolvedores de modelos documentem os dados de treinamento e sua proveniência. Uma equipe que treinou com um pipeline lançado pode responder a essas perguntas. Uma equipe que fez fine-tuning em pesos emprestados não pode, porque não sabe o que entrou neles.

Para um instituto de pesquisa, o cálculo é simples. Lançar um stack custa tempo de engenharia e não abre mão de nada comercialmente, porque o instituto não vende chamadas de API. Para um laboratório comercial, fazer o mesmo daria aos concorrentes uma vantagem inicial. Essa assimetria é a razão pela qual stacks de treinamento abertos vêm de institutos e universidades muito mais frequentemente do que de empresas, e por que cada um que aparece vale a pena examinar.

O que observar

Se o resultado de vazão se mantém em escala. O teste interessante não são oito GPUs, mas algumas centenas, onde os padrões de comunicação que o Olmo-core 3 codifica funcionam ou não.

Se laboratórios externos de fato o adotam. Um stack de treinamento se difunde quando outra pessoa treina um modelo com ele e publica o resultado. A primeira reprodução crível seria mais informativa do que qualquer tabela de benchmark.

Se o treinamento aberto muda as compras. Organizações que precisam documentar a proveniência de seus modelos tiveram opções limitadas. Se um pipeline de treinamento completo estiver disponível sob uma licença permissiva, algumas dessas organizações construirão sobre ele em vez de pagar por uma alternativa fechada.

Os lançamentos de pesos recebem a atenção porque qualquer um pode baixá-los e testá-los. Os lançamentos de treinamento são onde o conhecimento real da área é transferido, e eles acontecem com muito menos frequência. Este vale uma leitura atenta, já que a parte transferível de um modelo é o processo por trás dele.

Artigos relacionados