← Torna al blog
Aicirca 6 min di lettura

Xiaomi ha rilasciato un modello omnimodale che eguaglia la frontiera, più la ricetta di addestramento

Pubblicato 4 ott 2026
Xiaomi ha rilasciato un modello omnimodale che eguaglia la frontiera, più la ricetta di addestramento

Un'azienda di telefonia ha rilasciato un modello AI il 22 settembre e il numero in evidenza era 46. È il punteggio di Xiaomi per MiMo-V2.6 Pro sull'Artificial Analysis Intelligence Index, che secondo l'azienda è il più alto registrato da un modello open source al momento del rilascio.

MiMo-V2.6 è disponibile in due versioni. Pro è quella grande, Flash è quella veloce. Xiaomi afferma che Pro si comporta allo stesso livello di Claude Opus 5 e GPT-5.6 Sol sulla maggior parte dei benchmark per agenti, e indica miglioramenti nella programmazione, nell'uso del computer, nel ragionamento 3D e nei compiti creativi. I modelli sono omnimodali, il che significa che accettano testo, immagini e altri input attraverso un unico insieme di pesi, e sono stati addestrati con reinforcement learning scalato, la parte che spiega sia le capacità sia il formato di rilascio.

Cosa c'era realmente nel download

La maggior parte dei rilasci open-weight consegna i pesi e si ferma lì. MiMo-V2.6 include pesi, un report tecnico, gli ambienti di reinforcement learning e il codice di addestramento. Xiaomi ha pubblicato tutti e quattro sul proprio sito invece di indirizzare gli sviluppatori verso un model hub con una pagina di licenza e una lista d'attesa.

L'inclusione degli ambienti RL è la differenza significativa. I pesi ti permettono di eseguire un modello. Gli ambienti ti permettono di riaddestrarlo. Quando un laboratorio rilascia gli ambienti su cui ha addestrato, ti dice come ha ottenuto quel comportamento, non solo quale sia il comportamento. Per chiunque voglia riprodurre il risultato, o fare fine-tuning del modello rispetto al proprio segnale di ricompensa, gli ambienti sono il vero artefatto.

Aumenta anche il costo del rilascio per l'azienda che l'ha realizzato. Pubblicare gli ambienti espone la forma del segnale di addestramento, che è più vicino a una ricetta che a un checkpoint. Un concorrente può leggerlo e saltare un anno di tentativi ed errori. Xiaomi sembra aver deciso che i benefici in termini di reclutamento e credibilità superano questo costo.

Perché un'azienda di dispositivi fa ricerca di frontiera

Xiaomi non è un laboratorio di ricerca che per caso vende telefoni. È il contrario, e questo orientamento si riflette in ciò per cui un modello omnimodale è adatto.

Un telefono è la sede naturale per un assistente che sa leggere uno schermo, comprendere una fotografia, usare un'interfaccia e rispondere in una conversazione vocale. Uso del computer, ragionamento 3D e generazione creativa non sono benchmark astratti da quella prospettiva. Sono i componenti di un sistema che deve funzionare su un dispositivo che qualcuno tiene in mano, spesso con una connessione lenta e una batteria da preservare. Una famiglia di modelli divisa in un livello Pro per le capacità e un livello Flash per la latenza è una decisione di roadmap dei dispositivi tanto quanto di ricerca.

Rilasciare i pesi serve a due scopi. Recluta ricercatori che miglioreranno il modello pubblicamente, e consolida la posizione dell'azienda in un mercato in cui le dichiarazioni sulle capacità altrimenti vanno prese sulla fiducia. Un modello che puoi scaricare e valutare da solo ha bisogno di meno marketing, e Xiaomi compete per l'attenzione degli sviluppatori contro laboratori la cui intera reputazione si basa su risultati pubblicati.

Cosa significa omnimodale in pratica

L'etichetta copre una precisa affermazione ingegneristica: un unico modello gestisce diversi tipi di input attraverso una rappresentazione condivisa, invece di instradare ogni tipo di input verso uno specialista separato. Per un telefono, questo conta perché l'alternativa è eseguire diversi modelli e ricucire i loro output, mentre memoria e latenza scarseggiano entrambe su un dispositivo portatile. Il livello Flash di Xiaomi esiste per la stessa ragione. Un modello che risponde in un secondo su un modello di punta può essere inutilizzabile su un dispositivo di fascia media o in un'auto, quindi la famiglia è in realtà due punti su una curva di capacità e latenza più che un singolo rilascio.

Una lente di vetro trasparente con rifrazione arcobaleno appoggiata su un anello scuro

Il metodo di addestramento spiega il resto. Il reinforcement learning scalato significa che il modello viene ottimizzato rispetto a un segnale di ricompensa, invece di essere solo addestrato a prevedere il token successivo, ed è l'approccio dietro il recente salto nelle prestazioni agentiche in tutto il settore. È anche il motivo per cui gli ambienti contano quanto i pesi. Un segnale di ricompensa è valido solo quanto l'ambiente che lo produce, quindi pubblicare l'ambiente è più vicino a pubblicare un metodo che a pubblicare un risultato.

Il dispositivo è il canale di distribuzione

Il vantaggio di Xiaomi è che non ha bisogno di un ecosistema di sviluppatori per raggiungere gli utenti. Distribuisce hardware a decine di milioni di persone, e un modello che gira dentro un assistente telefonico raggiunge più persone in un trimestre di quante ne raggiunga un model hub in un anno. Ecco perché il formato di rilascio è generoso. I pesi e la ricetta costano all'azienda relativamente poco in termini di mancati ricavi da licenze, e acquistano credibilità presso la comunità di ricerca che altrimenti giudicherebbe il modello da uno screenshot di benchmark.

Il rischio è lo stesso del vantaggio. Un assistente telefonico viene giudicato in base al fatto che funzioni ogni volta, e un agente che fallisce un compito su venti è un fastidio in una finestra di chat e un rischio all'interno di un dispositivo che gestisce anche pagamenti, fotografie e messaggi. I benchmark di capacità non misurano quel divario, e nemmeno un punteggio composito di 46 lo fa.

Lo stesso martedì, altri tre rilasci

Il tempismo è istruttivo. Il 22 settembre, il modello di Xiaomi è apparso insieme a Qwen-Image-2.1 di Alibaba, che Alibaba ha reso open-weight il 20 settembre e presentato alla sua conferenza Yunqi lo stesso giorno, e all'anteprima di Hy Image 3.5 di Tencent, un modello professionale per immagini al prezzo di 0,15 yuan per immagine 2K sull'API Tencent Cloud. Unitree ha usato la stessa finestra per annunciare Dex5-S, una mano robotica abile con 22 gradi di libertà a partire da 6.500 dollari.

Alibaba ha anche approfittato della conferenza per rivendicare il primo posto nella classifica agentica di Artificial Analysis con Qwen3.8-Max e il primo posto su CodeArena per la programmazione frontend, e per dire che Qwen4 è in addestramento con modelli successori previsti da cinque a dieci trilioni di parametri. Il suo responsabile di Qwen-Image ha osservato che l'obiettivo del team è ridurre il costo di completamento di un'attività piuttosto che massimizzare il numero di parametri, lo stesso compromesso che sta facendo la struttura a due livelli di MiMo.

Nessuno di quegli annunci è stato coordinato e tutti puntavano nella stessa direzione. La domanda competitiva nell'AI cinese questo autunno non è se esista un modello di classe frontiera. È quanto di esso ti è consentito tenere.

Il caveat sui benchmark

Un numero come 46 dipende interamente dall'indice che gli sta dietro, e l'Intelligence Index di Artificial Analysis è un composito tra diversi. Il confronto con Claude Opus 5 e GPT-5.6 Sol è fatto da Xiaomi, sulla scelta di benchmark di Xiaomi, e la frase "maggior parte dei benchmark per agenti" sta facendo un lavoro che una tabella di risultati farebbe meglio. I benchmark per agenti in particolare sono sensibili allo scaffolding: lo stesso modello può ottenere punteggi molto diversi a seconda di ciò che lo circonda.

Ciò che rende l'affermazione più che marketing è il download. Chiunque dubiti del 46 può eseguire il modello, leggere il report e riaddestrarlo negli ambienti che Xiaomi ha rilasciato. È un test più difficile di uno screenshot di classifica, ed è disponibile solo perché l'azienda ha scelto di pubblicare la ricetta insieme al risultato.

Articoli correlati