DeepSeek libera em código aberto a experiência de engenharia de rodar modelos de trilhões de parâmetros: desta vez, a capacidade computacional nacional preenche a camada de software

Em 30 de setembro, a DeepSeek divulgou um conjunto de códigos em sua conta oficial no WeChat e tornou código aberto seis módulos para a plataforma Huawei Ascend: TileLang, DeepGEMM-Ascend, DeepEP-Ascend, TileKernels, FlashMLA e DeepSelect. Os nomes parecem dispersos, mas o escopo coberto é bastante coeso: uma linguagem de programação, um conjunto de kernels de computação e, ainda, comunicação distribuída.
Isso não se parece muito com um código aberto convencional. O que foi aberto não é o modelo, mas a camada de fundação necessária para colocar o modelo em execução.
Depois que os chips passam a bastar, o que trava é outra coisa
Nos últimos anos, o que mais se discute sobre a capacidade computacional nacional são os números de poder de computação. As tabelas de especificações ficam mais atraentes a cada ano, mas engenheiros que já migraram modelos na prática sabem que os problemas raramente estão no pico de desempenho computacional.
O ecossistema CUDA da Nvidia foi construído ao longo de mais de vinte anos. Compiladores, bibliotecas matemáticas e bibliotecas de comunicação, camada sobre camada; o desenvolvedor pega a placa e já pode usar, com documentação, comunidade e relatos de problemas prontos. Ao mudar para outro conjunto de hardware, o mesmo operador pode precisar ser escrito do zero, o escalonamento precisa ser ajustado manualmente e as bibliotecas de comunicação multi-máquina e multi-GPU ainda precisam ser implementadas por conta própria. A pontuação do chip não é baixa, mas o simples ato de levar o modelo para ele tem um custo absurdo.
Há ainda uma camada dessa diferença que não é muito mencionada. O hardware pode ser comprado com um investimento único, mas o ecossistema de software só pode ser polido pelas pessoas ano após ano. Comprar placas é uma questão de compras; completar a cadeia de ferramentas é uma questão de tempo, e o tempo só se ganha com projetos reais. Quem primeiro fizer um modelo rodar, se estabilizar e atingir escala em uma plataforma é quem poderá acumular experiência reutilizável. É por isso que este código aberto merece ser discutido separadamente: não é que algo tenha sido comprado, mas que alguém entregou o que acumulou.
Portanto, a verdadeira deficiência de longo prazo da capacidade computacional nacional é o software. O chip consegue calcular, mas não é fácil de usar. O que a DeepSeek abriu desta vez cai exatamente nessa lacuna.
Entre os seis módulos, o que mais vale a pena ver é o TileLang
Dos seis módulos, o mais importante é o TileLang. Trata-se de uma linguagem de programação de alto nível desenvolvida pela própria DeepSeek, antes voltada principalmente para backends Nvidia; desta vez, passou a oferecer suporte oficial ao Ascend 950, com geração de código nativo, escalonamento automático e sincronização. O posicionamento que a DeepSeek dá a ela é direto: uma alternativa ao CUDA, e com um “modelo de programação mais simples”.
O TileKernels, que o acompanha, resolve outro problema antigo. Ele pode selecionar automaticamente o backend Nvidia ou Huawei e expõe a mesma API Python para a camada superior. Em outras palavras, o mesmo código roda nas duas plataformas de hardware, e o custo de troca fica reduzido ao nível da configuração, em vez de reescrever o kernel inteiro.
Os dados públicos de testes internos também não são vagos. Alguns kernels no Ascend 950DT atingiram uma proporção muito alta do limite nominal do hardware: multiplicação de matrizes densas em BF16 com 99,8%, FP8 com cerca de 99,5%; a implementação de atenção esparsa voltada ao DeepSeek V4.1 alcançou 410 TFLOPS na fase de prefill, cerca de 95% do valor teórico. As duas empresas também otimizaram em conjunto uma solução de supernode baseada em 128 chips Ascend 950, dedicada a equilibrar computação e movimentação de dados.
O valor desses números está em provar que esse caminho é viável. Antes, quando se falava de capacidade computacional nacional, a pergunta era se dava para usar; agora, começa a haver equipes dispostas a tornar público o próprio conhecimento de extrair o máximo do hardware, o que mostra que pelo menos alguém já chegou a um nível que pode ser compartilhado.
Uma única API conectada a dois backends ao mesmo tempo: qual é o valor?
Vistos em conjunto, TileLang e TileKernels deixam a utilidade mais clara. O TileKernels consegue selecionar automaticamente o backend Nvidia ou Huawei e expõe a mesma API Python para a camada superior. Isso significa que a equipe mantém um único código, e não dois.
Na prática, um serviço de inferência minimamente decente normalmente precisa rodar em vários tipos de hardware ao mesmo tempo. Na nuvem, talvez ainda seja Nvidia; em ambientes próprios ou de inovação tecnológica nacional, são placas nacionais; em dispositivos de borda, é outro conjunto. Se cada troca de hardware exigir reescrever o kernel, a equipe terá de manter várias implementações paralelas e testar cada uma separadamente. A mesma API rebaixa essa tarefa de “reescrever” para “alterar a configuração”, e o que se economiza não é apenas mão de obra, mas também chances de erro.

Para uma equipe que só quer colocar o produto no mercado, esse tipo de mudança não entra em nenhum comunicado de lançamento, mas determina se ela estará disposta a testar hardware nacional.
A verdadeira mudança acontece no custo de migração
Para um desenvolvedor comum, o impacto mais prático deste código aberto é o custo de migração.
No passado, migrar treinamento ou inferência para o Ascend exigia complementar operadores de baixo nível por conta própria e adaptar as ferramentas sozinho; não era raro um projeto consumir meses nisso. Agora, essas cadeias de ferramentas são abertas diretamente, e muitas armadilhas já foram encontradas e corrigidas por outras pessoas, podendo ser reutilizadas de imediato. A barreira caiu de “ter uma equipe dedicada à adaptação de operadores” para “ter alguém na equipe que entenda esse conjunto de ferramentas”.
Isso também explica por que o lançamento teve uma repercussão considerável na comunidade de desenvolvedores. Ultimamente já surgiram modelos mais que suficientes; o que é realmente escasso é economizar um trecho do caminho.
A seguir, o que importa é ver se os outros usam
Para avaliar o peso deste código aberto, não basta ver o que a própria DeepSeek disse; é preciso ver o que os outros farão nos próximos seis meses.
Se uma cadeia de ferramentas se sustenta depende de haver terceiros dispostos a investir nela. Se o TileLang servir apenas aos modelos da própria DeepSeek, seu significado fica restrito ao interior da empresa; se outras equipes o usarem para escrever operadores, abrir issues e expandir backends de hardware, ele começará a se tornar uma infraestrutura pública. Por mais bonitos que sejam os números, eles só valem depois de passarem pelo teste de meses de carga real.
Outra variável é se outros chips nacionais também serão integrados. Atualmente, as informações públicas concentram-se no Ascend; se essa linguagem de alto nível puder ser migrada para mais plataformas seguindo a mesma lógica, seu valor subirá mais um degrau. Essa questão ainda não tem resposta.
Abrir a fundação em código aberto é mais lento do que abrir modelos
Nos últimos dois anos, o principal campo de batalha do código aberto nacional sempre foram os pesos dos modelos. Parâmetros, rankings e número de downloads são coisas visíveis de imediato. A cadeia de ferramentas de baixo nível é diferente: não aparece nos rankings nem gera assunto no curto prazo. Mas, sem essa camada, por mais modelos que se empilhem por cima, tudo fica suspenso.
Ao entregar sua própria experiência de engenharia de fazer modelos de escala de trilhões rodarem no Ascend, a DeepSeek faz exatamente esse tipo de trabalho de base pouco visível, mas que determina se a indústria consegue avançar.
Se vale a pena migrar agora os projetos em Nvidia para o Ascend, a resposta ainda depende do cenário específico e também de haver alguém na equipe disposto a dedicar tempo à camada de baixo nível. Mas, pelo menos a partir deste dia, o motivo de “o ecossistema não é fácil de usar” começa a perder força. E, uma vez que o ecossistema comece a ser utilizável, o que acontece depois costuma ser mais rápido do que o esperado.
Artigos relacionados
Claude Sonnet 5.5 é 30% mais barato. Isso é uma história de compras, não uma história de modelo.
Alegações de desconto de fornecedores costumam ser medidas em relação a uma carga de trabalho representativa, e a sua não é representativa.
A HPE acabou de vender US$ 1,2 bilhão em hardware porque a rede virou o ponto central
Um pedido de US$ 1,2 bilhão com divisão não divulgada entre cinco categorias não é o mesmo que US$ 1,2 bilhão de margem.
O malware que submete seu próximo passo a uma votação de quatro modelos
A infraestrutura de comando e controle é um punhado de APIs públicas e um webhook do Discord.
A Shopify deixou agentes de IA clicar em Comprar. O lojista ainda arca com a disputa.
A plataforma do agente intermedeia a intenção. O lojista carrega o risco.