← Voltar ao blog
Aicerca de 6 min de leitura

Kimi K3 entra no sistema de pagamento empresarial da OpenAI: a rota de internacionalização dos grandes modelos open source chineses está sendo reescrita

Publicado 5 de out. de 2026
Kimi K3 entra no sistema de pagamento empresarial da OpenAI: a rota de internacionalização dos grandes modelos open source chineses está sendo reescrita

Em 1º de outubro, a Baseten, empresa norte-americana de infraestrutura de IA, confirmou publicamente uma coisa: desenvolvedores corporativos podem chamar diretamente o Kimi K3, da Moonshot AI, dentro do Codex, a ferramenta de programação da OpenAI, e os custos gerados entram direto na cota de compras da OpenAI que a empresa já possui. Não é preciso cadastrar um novo fornecedor nem passar de novo pelo processo de aprovação de compras. É a primeira vez que um grande modelo open source chinês entra no sistema de faturamento e liquidação empresarial da OpenAI.

O peso disso não está nos parâmetros nem nos rankings, mas no fato de que altera a dependência de caminho das compras corporativas.

O próprio processo de compras já é uma barreira

Para uma grande empresa integrar um novo fornecedor de modelos, o difícil nunca é a integração técnica, e sim os processos de conformidade e financeiros. Um novo fornecedor precisa passar por auditoria de homologação, montar do zero um sistema próprio de cobrança e liquidação, e refazer todo o trâmite jurídico e de compras. Para uma equipe que só quer verificar se determinado modelo funciona bem, o custo desse processo costuma ser muito maior do que o do próprio modelo.

Que o Kimi K3 use a liquidação por cota da OpenAI equivale a contornar todo esse atrito. O orçamento de IA já aprovado dentro da empresa pode ser gasto diretamente com o Kimi K3, e o que o financeiro vê continua sendo uma fatura da OpenAI. A Baseten, como porta de entrada na camada de base, conectou a capacidade de modelo da Moonshot AI ao canal de ecossistema da OpenAI.

Antes disso, o Kimi K3 já havia chegado à plataforma Amazon Bedrock, da AWS, o que fez da Moonshot AI a primeira empresa chinesa de IA a firmar parceria com um dos principais provedores de nuvem do mundo no modelo de compartilhamento de receita. Um caminho é o compartilhamento de receita em plataformas de nuvem; o outro, o abatimento em cotas de ferramentas de desenvolvedor. Os dois apontam para o mesmo resultado: os grandes modelos chineses começam a sair da fase de demonstração técnica para entrar na fase de implantação comercial em escala.

Qual é o nível do modelo em si

O Kimi K3 foi lançado em julho deste ano, com 2,8 trilhões de parâmetros, e era, no momento do lançamento, o maior modelo open source do mundo em volume. Ele suporta uma janela de contexto de 1 milhão de tokens, tem capacidade nativa de compreensão visual e recebeu otimizações específicas para desenvolvimento de código, pesquisa aprofundada e processamento de conhecimento complexo.

No dia do lançamento, o Kimi K3 alcançou o primeiro lugar no ranking internacional de avaliação de código Arena, sendo o primeiro grande modelo chinês a liderar essa lista. O CEO da Tesla, Elon Musk, também avaliou publicamente o resultado como impressionante.

Mais digno de nota ainda é o raciocínio por trás de sua arquitetura. O Kimi K3 usa Kimi Delta Attention e Attention Residuals para melhorar o fluxo de informação em sequências longas, e adota a estrutura Stable LatentMoE, ativando apenas 16 de 896 especialistas; segundo a empresa, isso eleva a eficiência de escalonamento em cerca de 2,5 vezes em relação à geração anterior. Essa direção de design acompanha o movimento coletivo dos laboratórios chineses nos últimos meses: não se trata de disputar quem tem mais parâmetros, mas quanta capacidade utilizável cada unidade de computação rende.

Um design de chip autônomo em 48 horas

Se entrar no Codex é uma questão do campo comercial, outro avanço está mais próximo da própria tecnologia.

De acordo com informações públicas, o Kimi K3 já concluiu uma prova de conceito de design de chip autônomo por IA. Em um teste de agente com 48 horas ininterruptas, ele usou ferramentas EDA open source e uma biblioteca de processo de 45 nm para concluir de forma independente o design, a iteração e a verificação de todo o fluxo de um chip adaptado. O resultado é um chip leve de 4 milímetros quadrados, com 1,46 milhão de células padrão e 0,277 MB de SRAM, que atinge convergência de timing estável a 100 MHz e alcança throughput de decodificação de mais de 8.700 tokens por segundo no pico.

Pinça segurando um wafer quadrado de silício com reflexos iridescentes, suspenso sobre uma bancada de laboratório em tons quentes

Resultados como esse exigem cautela. Uma prova de conceito não equivale a um chip fabricável em escala, e 45 nm não é um processo de fabricação avançado. Mas o que ela valida é o ciclo fechado do processo: se um modelo consegue, sem intervenção humana passo a passo, levar do início ao fim uma tarefa de engenharia que exige várias rodadas de tentativa e erro. Para quem trabalha com agentes, isso diz muito mais do que se uma única imagem ficou bonita ou não.

Para onde está caminhando a camada de competição

A investida internacional do Kimi K3 corre em paralelo a outra linha.

Na mesma semana, a Zhipu lançou o modelo open source GLM-4.6, com foco no upgrade da capacidade de codificação agêntica, e concluiu a adaptação a chips chineses como Cambricon e Moore Threads, viabilizando a implantação estável de inferência com quantização mista FP8+Int4 em hardware nacional. A DeepSeek também abriu, em 2 de outubro, o framework de execução de agentes para desktop Harness v0.2, com arquitetura de \"tudo é plugin\", recursos integrados de organização de arquivos, análise de dados, redação de documentos e modificação de código, sob licença MIT.

Vistos em conjunto, esses movimentos deixam clara uma direção: o modelo em si está se tornando infraestrutura, e a diferenciação real começa a migrar para dois lugares. Um é o framework de execução, ou seja, a camada que fica fora do modelo: quem consegue fazer com que desenvolvedores e empresas integrem o modelo ao seu fluxo de trabalho a baixo custo. O outro é a adaptação de hardware: quem consegue rodar a inferência em capacidade computacional mais barata e mais autônoma e controlável.

O Kimi K3 já anunciou o K3.1, com suporte a contexto de 1 milhão de tokens e três níveis de intensidade de raciocínio — Low, High e Max —, que o usuário escolhe conforme a complexidade da tarefa. Texto longo e níveis de raciocínio selecionáveis estão se tornando itens obrigatórios na disputa dos modelos open source chineses pelos desenvolvedores.

No passado, a internacionalização dos grandes modelos chineses se dava em grande parte por meio de contatos individuais com clientes no exterior; para uma grande empresa adotar o modelo, era preciso incluir uma nova homologação de fornecedor, o que elevava muito a barreira de entrada. Esses dois passos do Kimi K3 baixaram a barreira um bom tanto. Se as empresas estarão dispostas a pagar por ele, os próximos trimestres darão a resposta.

Artigos relacionados