← Torna al blog
Aicirca 7 min di lettura

I nuovi modelli aperti cinesi vengono addestrati per essere substrati per agenti

Pubblicato 3 ott 2026
I nuovi modelli aperti cinesi vengono addestrati per essere substrati per agenti

Tre modelli pubblicati da laboratori cinesi nell'ultima settimana condividono un istinto progettuale facile da lasciarsi sfuggire se li si legge come un elenco di conteggi di parametri. Nessuno di essi è stato costruito per essere bravo nella conversazione.

Sono stati costruiti per essere la cosa su cui gira un agente. È un obiettivo diverso, e le scelte di addestramento che ne derivano appaiono strane se si presume che lo scopo sia un chatbot migliore.

Addestrare il compito e il mondo che lo circonda

L'esempio più chiaro è IQuest-Q1, rilasciato dallo ZhiZhi Innovation Research Institute il 29 settembre. È un modello sparse mixture-of-experts con 320 miliardi di parametri totali, 15 miliardi attivi e una finestra di contesto di 524.288 token. L'architettura non ha nulla di notevole rispetto al suo metodo di addestramento.

Anziché fare fine-tuning su trascrizioni di conversazioni umane o su set di istruzioni statici, il team ha sintetizzato insieme i compiti e gli ambienti in cui questi si svolgono. Il modello è stato poi addestrato su diversi scaffold di agenti differenti. Ha mantenuto intatti gli strumenti nativi e la gestione del contesto di ogni scaffold, e ha trattato come segnale di apprendimento soltanto gli errori del modello stesso. All'harness non è stato permesso di diventare la lezione. In seguito, quattro modelli specialisti sono stati fusi in uno tramite distillazione on-policy multi-teacher.

Questo conta per via di un problema che chiunque costruisca agenti ha incontrato. Un modello che ottiene buoni punteggi su un benchmark può crollare quando lo si avvolge nei propri strumenti, perché ha imparato le stranezze dell'harness di qualcun altro. Addestrare su più scaffold mantenendo costante l'harness attacca proprio quel tipo di fallimento. Il risultato dichiarato è un modello che si colloca appena dietro Claude Opus 5 nei compiti da linguaggio naturale a repository, una cosa strana in cui essere bravi ed esattamente ciò di cui un agente di coding ha bisogno.

Vedere e decidere nello stesso passo

Il secondo rilascio prende una strada diversa verso lo stesso obiettivo. Lo stesso giorno, lo Shanghai AI Laboratory ha presentato un modello decisionale chiamato Shusheng Mingjue, in tre dimensioni: 0,8B, 2B e 4B. È piccolo di proposito.

Il principio di progettazione è che percezione e decisione non dovrebbero essere fasi separate. La maggior parte degli stack di agenti fa uno screenshot, lo passa a un modello di visione, ottiene una descrizione, passa la descrizione a un planner e agisce. Ogni passaggio aggiunge latenza e perde dettaglio. Mingjue fonde la percezione visiva nativa con l'instruction following, così il modello guarda uno schermo e prende una decisione in un'unica passata. Il laboratorio riferisce che batte Jev e modelli aperti comparabili sulla qualità delle decisioni. Per un agente che deve agire all'interno di un ambiente dinamico, la dimensione è il punto: un modello da 4B può girare vicino al loop, uno da 320B no.

Eliminare il layer di attenzione per raggiungere un milione di token

Il terzo rilascio è il più aggressivo dal punto di vista architetturale. Naive N0.5 Flash, del laboratorio di Pechino NaiveAI, è un modello mixture-of-experts da 309 miliardi di parametri con 15,5 miliardi di parametri attivi, costruito su MiMo-V2.5 di Xiaomi. Supporta nativamente un contesto di un milione di token ed è distribuito con licenza MIT.

La parte interessante è ciò che ha rimosso. Il modello usa un ibrido di sliding-window attention e della sparse attention di DeepSeek, e non ha alcun layer di full attention. L'attenzione standard dei transformer scala in modo quadratico con la lunghezza della sequenza, ed è per questo che il contesto lungo è stato storicamente costoso. Rimuovere la full attention è una scommessa sul fatto che le informazioni utili in una sequenza lunga siano raggiungibili tramite sparsità strutturata, e se la cosa regge cambia ciò che un agente può tenere sott'occhio in una volta sola. Un milione di token è all'incirca un grande repository, o la cronologia di una lunga sessione di lavoro, mantenuta senza troncamenti.

I rilasci più piccoli puntano nella stessa direzione

Lo schema emerge anche al di là di questi tre. Puro-2B di Tsinghua è stato addestrato con circa 4.400 dollari e batte in media un modello Qwen più grande su quindici task. Un laboratorio di telecomunicazioni ha rilasciato TeleOCR, un modello di parsing di documenti da 1,2B che ha primeggiato in un benchmark di comprensione dei documenti. Stanford e NVIDIA hanno rilasciato un verificatore contrastivo che sceglie la migliore azione candidata tramite allineamento di embedding anziché tramite ragionamento, e riporta forti accelerazioni rispetto a un modello giudice comparabile.

Ognuno di questi è un componente di un agente, non una destinazione per un utente. Un verificatore che classifica a basso costo le azioni candidate, un modello piccolo che fa il parsing dei documenti, un modello minuscolo che decide cosa cliccare. I pezzi stanno diventando specializzati e piccoli, mentre l'unico modello che contiene il contesto dell'intera sessione diventa molto grande.

Il problema di valutazione che nessuno ha risolto

C'è un buco che attraversa tutto questo. I benchmark per i modelli base degli agenti sono ancora per lo più presi in prestito dalla valutazione dei chatbot, che misura le cose sbagliate. Un modello può ottenere un buon punteggio in un test di ragionamento ed essere comunque un substrato scarso per un agente, perché le proprietà che contano emergono solo lungo una sessione: quanti turni passano prima che il contesto degradi, se una chiamata a uno strumento che fallisce viene ritentata in modo sensato, se il modello si accorge di aver perso di vista l'obiettivo originale.

La maggior parte dei numeri riportati qui proviene dai laboratori stessi, su benchmark che hanno contribuito a definire. IQuest-Q1 \"appena dietro Claude Opus 5\" nei compiti da linguaggio naturale a repository è un confronto di un fornitore. Mingjue \"che batte Jev\" è un'affermazione di un fornitore. L'assenza di full attention in Naive N0.5 Flash è un fatto architetturale facile da verificare e le cui conseguenze pratiche non sono ancora misurate su larga scala. Nulla di tutto ciò rende sbagliata la direzione. Significa che lo stato delle cose, onestamente, è che abbiamo tre progetti interessanti e pochissime prove indipendenti su quale di essi regga quando un agente gira per sei ore.

Il divario comincia a essere riconosciuto. Gruppi indipendenti hanno costruito benchmark pensati per il serving in produzione anziché per la generazione di codice, e per l'agent hijacking anziché per la sicurezza dei modelli, il che suggerisce che il settore sa di aver misurato il layer sbagliato. Finché non maturano, il segnale utile di un rilascio come questo non è il punteggio. È il metodo di addestramento, perché un metodo che affronta una modalità di fallimento nota degli agenti ha più probabilità di essere reale di un numero che affronta una classifica.

C'è un'ulteriore conseguenza di questo spostamento che è facile trascurare. Se i modelli importanti diventano piccoli componenti anziché grandi destinazioni, allora il vantaggio di un laboratorio smette di derivare dall'avere il modello più grande e comincia a derivare dal sapere come i pezzi stanno insieme. Un team capace di addestrare un modello decisionale veloce, un parser di documenti economico e un verificatore, e di collegarli in un loop che gira su hardware modesto, ha qualcosa che un singolo checkpoint gigantesco non può eguagliare. È un tipo diverso di competizione, più vicina all'ingegneria dei sistemi che allo scaling, e i rilasci di questo mese suggeriscono che almeno alcuni team cinesi si sono già riorientati in quella direzione.

Per due anni, la corsa ai pesi aperti è stata misurata da quanto un modello gratuito riuscisse ad avvicinarsi a un chatbot di frontiera. Quella impostazione sta perdendo presa. La qualità della chat è diventata una baseline, e le domande che decidono se un software funziona si sono spostate su un terreno diverso: quanti turni prima che il contesto degradi, quanto velocemente il modello può agire dentro un loop, quanto bene tollera di essere calato negli strumenti di qualcun altro.

I modelli che rispondono a queste domande non vinceranno molte classifiche. Vinceranno la competizione meno visibile: quella su quale modello uno sviluppatore sceglie quando il chatbot ha già fatto il suo lavoro e il lavoro deve succedere davvero. Quella competizione si è svolta in silenzio questa settimana, in tre rilasci che non cercavano di impressionare nessuno con la conversazione.

Articoli correlati