← Voltar ao blog
Aicerca de 7 min de leitura

Xiaomi lançou um modelo omnimodal que iguala a fronteira, além da receita de treino

Publicado 4 de out. de 2026
Xiaomi lançou um modelo omnimodal que iguala a fronteira, além da receita de treino

Uma empresa de celulares lançou um modelo de IA em 22 de setembro e o número principal foi 46. Essa é a pontuação da Xiaomi para o MiMo-V2.6 Pro no Artificial Analysis Intelligence Index, que a empresa diz ser a mais alta registrada por um modelo de código aberto na época do lançamento.

O MiMo-V2.6 vem em duas versões. Pro é a grande, Flash é a rápida. A Xiaomi diz que o Pro tem desempenho equivalente ao Claude Opus 5 e ao GPT-5.6 Sol na maioria dos benchmarks de agentes, e aponta melhorias em programação, uso de computador, raciocínio 3D e tarefas criativas. Os modelos são omnimodais, ou seja, aceitam texto, imagens e outras entradas por meio de um único conjunto de pesos, e foram treinados com aprendizado por reforço em escala, que é a parte que explica tanto as capacidades quanto o formato de lançamento.

O que realmente veio no download

A maioria dos lançamentos com pesos abertos entrega os pesos e para por aí. O MiMo-V2.6 disponibiliza pesos, um relatório técnico, os ambientes de aprendizado por reforço e o código de treinamento. A Xiaomi publicou todos os quatro em seu próprio site, em vez de encaminhar os desenvolvedores por um hub de modelos com página de licença e lista de espera.

A inclusão dos ambientes de RL é a diferença significativa. Os pesos permitem executar um modelo. Os ambientes permitem retreiná-lo. Quando um laboratório lança os ambientes nos quais treinou, está dizendo como obteve o comportamento, em vez de apenas qual é o comportamento. Para quem quer reproduzir o resultado, ou ajustar o modelo com seu próprio sinal de recompensa, os ambientes são o artefato real.

Isso também aumenta o custo do lançamento para a empresa que o fez. Publicar ambientes expõe o formato do sinal de treinamento, que está mais próximo de uma receita do que de um checkpoint. Um concorrente pode lê-lo e pular um ano de tentativa e erro. A Xiaomi parece ter decidido que os benefícios de recrutamento e credibilidade superam isso.

Por que uma empresa de dispositivos está fazendo pesquisa de fronteira

A Xiaomi não é um laboratório de pesquisa que por acaso vende celulares. É o contrário, e essa orientação aparece naquilo para que um modelo omnimodal é bom.

Um celular é o lar natural para um assistente que consegue ler uma tela, entender uma fotografia, operar uma interface e responder em uma conversa falada. Uso de computador, raciocínio 3D e geração criativa não são benchmarks abstratos desse ponto de vista. São os componentes de um sistema que precisa rodar em um dispositivo que alguém está segurando, muitas vezes com conexão lenta e uma bateria para preservar. Uma família de modelos dividida em uma linha Pro para capacidade e uma linha Flash para latência é uma decisão de roadmap de dispositivo tanto quanto de pesquisa.

Lançar os pesos serve a dois propósitos. Recruta pesquisadores que vão melhorar o modelo publicamente, e estabelece um piso para a posição da empresa em um mercado onde as alegações de capacidade, de outra forma, são aceitas com base na confiança. Um modelo que você pode baixar e avaliar por conta própria precisa de menos marketing, e a Xiaomi está competindo pela atenção dos desenvolvedores com laboratórios cuja reputação inteira se baseia em resultados publicados.

O que omnimodal significa na prática

O rótulo cobre uma alegação de engenharia específica: um modelo lida com vários tipos de entrada por meio de uma representação compartilhada, em vez de encaminhar cada tipo de entrada para um especialista separado. Para um celular, isso importa porque a alternativa é executar vários modelos e juntar suas saídas, e memória e latência são escassas em um aparelho. A linha Flash da Xiaomi existe pelo mesmo motivo. Um modelo que responde em um segundo em um topo de linha pode ser inutilizável em um dispositivo intermediário ou em um carro, então a família é, na verdade, dois pontos em uma curva de capacidade e latência, e não um único lançamento.

Uma lente de vidro transparente com refração arco-íris apoiada em um anel escuro

O método de treinamento explica o resto. O aprendizado por reforço em escala significa que o modelo é otimizado em relação a um sinal de recompensa, em vez de apenas treinado para prever o próximo token, e é a abordagem por trás do salto recente no desempenho agêntico em toda a indústria. É também a razão pela qual os ambientes importam tanto quanto os pesos. Um sinal de recompensa só é tão bom quanto o ambiente que o produz, então publicar o ambiente está mais próximo de publicar um método do que de publicar um resultado.

O dispositivo é o canal de distribuição

A vantagem da Xiaomi é que ela não precisa de um ecossistema de desenvolvedores para alcançar usuários. Ela entrega hardware para dezenas de milhões de pessoas, e um modelo que roda dentro de um assistente de celular alcança mais pessoas em um trimestre do que um hub de modelos alcança em um ano. É por isso que o formato de lançamento é generoso. Os pesos e a receita custam relativamente pouco para a empresa em receita de licenciamento perdida, e compram credibilidade com a comunidade de pesquisa, que de outra forma julgaria o modelo por uma captura de tela de benchmark.

O risco é o mesmo que a vantagem. Um assistente de celular é julgado por funcionar sempre, e um agente que falha em uma tarefa a cada vinte é um incômodo em uma janela de chat e um passivo dentro de um dispositivo que também lida com pagamentos, fotografias e mensagens. Benchmarks de capacidade não medem essa lacuna, e uma pontuação composta de 46 também não.

A mesma terça-feira, três outros lançamentos

O momento é instrutivo. Em 22 de setembro, o modelo da Xiaomi apareceu ao lado do Qwen-Image-2.1, da Alibaba, que a Alibaba abriu os pesos em 20 de setembro e apresentou em sua conferência Yunqi no mesmo dia, e da prévia do Hy Image 3.5, da Tencent, um modelo de imagem profissional com preço de 0,15 yuan por imagem 2K na API Tencent Cloud. A Unitree usou a mesma janela para anunciar o Dex5-S, uma mão robótica hábil com 22 graus de liberdade a partir de 6.500 dólares.

A Alibaba também usou a conferência para reivindicar o primeiro lugar no ranking agêntico do Artificial Analysis com o Qwen3.8-Max e o primeiro lugar no CodeArena para programação frontend, e para dizer que o Qwen4 está em treinamento, com modelos sucessores planejados com cinco a dez trilhões de parâmetros. Seu chefe do Qwen-Image observou que o objetivo da equipe é reduzir o custo de concluir uma tarefa, em vez de maximizar a contagem de parâmetros, que é o mesmo trade-off que a estrutura de dois níveis do MiMo está fazendo.

Nenhum desses anúncios foi coordenado, e todos apontavam na mesma direção. A questão competitiva na IA chinesa neste outono não é se existe um modelo de classe de fronteira. É quanto dele você tem permissão para possuir.

A ressalva dos benchmarks

Um número como 46 depende inteiramente do índice por trás dele, e o Intelligence Index do Artificial Analysis é um composto entre vários. A comparação com Claude Opus 5 e GPT-5.6 Sol é feita pela Xiaomi, com base na escolha de benchmarks da Xiaomi, e a frase "a maioria dos benchmarks de agentes" está fazendo um trabalho que uma tabela de resultados faria melhor. Benchmarks de agentes, em particular, são sensíveis ao scaffolding: o mesmo modelo pode pontuar de forma muito diferente dependendo do que o cerca.

O que torna a alegação mais do que marketing é o download. Qualquer um que duvide do 46 pode executar o modelo, ler o relatório e retreiná-lo nos ambientes que a Xiaomi disponibilizou. Esse é um teste mais difícil do que uma captura de tela de ranking, e só está disponível porque a empresa escolheu publicar a receita junto com o resultado.

Artigos relacionados