Ling 3.1 Flash di Ant Group attiva 25B su 560B parametri e arriva a 41

--- title: Ling 3.1 Flash di Ant Group attiva 25B su 560B parametri e arriva a 41 meta_title: Ling 3.1 Flash mette 560B parametri dietro un conto da 25B meta_description: Ling 3.1 Flash di Ant Group ottiene 41 sull'Intelligence Index con 25B parametri attivi su 560B totali, mostrando quanto può spingersi l'MoE sparso. ---
AntLingAGI di Ant Group ha rilasciato Ling 3.1 Flash il 6 ottobre. Il dato che salta all'occhio sono i 25 miliardi di parametri che si attivano effettivamente quando il modello viene eseguito, su 560 miliardi totali.
Il modello ha ottenuto 41 sull'Artificial Analysis Intelligence Index, un netto passo avanti rispetto al predecessore. La valutazione ha individuato nelle capacità agentiche l'area di miglioramento più netto, la categoria a cui gli acquirenti enterprise hanno iniziato a dare il peso maggiore.
L'architettura è la tesi
Ling 3.1 Flash è un modello mixture-of-experts. Porta 560 miliardi di parametri in totale ma ne attiva circa 25 miliardi per token, e supporta una finestra di contesto fino a un milione di token.
Quel rapporto è tutta la proposta. Un modello denso di capacità comparabile dovrebbe muovere ogni parametro per ogni token generato. Instradando ogni token attraverso un piccolo sottoinsieme di esperti, un modello sparso offre un output simile toccando molta meno computazione. Il compromesso è la memoria: tutti i 560 miliardi di parametri devono comunque risiedere da qualche parte, anche se la maggior parte resta inattiva a ogni singolo forward pass.

La conseguenza pratica è un modello che può essere servito a una frazione del costo di un equivalente denso allo stesso livello di qualità, a condizione che un team abbia l'hardware per tenere i pesi. È la stessa storia ingegneristica che ha guidato gran parte dei rilasci open-weight di frontiera quest'anno, ed è il motivo per cui la metrica interessante si è spostata dai parametri totali ai parametri attivi.
Cosa coprono i benchmark
Ant Group ha pubblicato risultati su una serie di valutazioni: GDPVal-AA v2.1 a 1673 Elo, FrontierSWE a 75,16, HealthBench a 65,35 e Design Arena, dove si classifica vicino ai primi posti per applicazioni mobile e generazione SVG.
Il punteggio di 41 all'Intelligence Index è il titolo principale, e colloca il modello in compagnia di rilasci di laboratori molto più grandi. Ant Group afferma che il modello completo sarà open source, con documentazione già pubblicata. Nel frattempo è attiva una prova gratuita di due settimane.
Le dimostrazioni ingegneristiche sono più rivelatrici dei punteggi
Ant Group ha anche descritto tre esempi concreti, e questi dicono più sull'uso previsto di quanto faccia una classifica.
Il primo: costruire da zero un compilatore da Lua a x86, superando 178 dei 182 test. È un compito in cui il modello deve tenere a mente una specifica ampia, produrre codice coerente al proprio interno attraverso molti file e tenere traccia dei casi limite per tutto il tempo. Il lavoro penalizza i modelli con una gestione debole del contesto lungo.
Il secondo: accelerare il controllo dei tipi su una grande base di codice Python. Questo è un compito di manutenzione più che greenfield, ed è lì che va in realtà la maggior parte del tempo di ingegneria reale. Un modello in grado di ragionare sulle relazioni di tipo di un repository esistente è utile in un modo in cui un modello che scrive nuove funzioni non lo è.
Il terzo: costruire un agente desktop che coordina un browser, file locali e strumenti da terminale. L'orchestrazione multi-strumento è l'attuale frontiera del lavoro agentico, ed è la capacità a cui punta il salto nei benchmark.
Tutti e tre sono dichiarati dall'azienda e non sono stati riprodotti in modo indipendente. La dichiarazione del compilatore con 182 test in particolare richiederebbe verifica esterna, poiché superare i test è significativo solo se i test sono rappresentativi. Un compilatore che gestisce la sintassi comune e fallisce sui casi insoliti può comunque ottenere un buon punteggio su una suite scritta la stessa settimana del modello.
C'è anche un pattern più ampio da notare. I laboratori cinesi hanno sempre più usato dimostrazioni ingegneristiche anziché punteggi di benchmark come marketing principale, perché i benchmark sono diventati ambigui e le dimostrazioni sono concrete. Il compromesso è che una dimostrazione mostra una sola traiettoria attraverso lo spazio del problema, e nulla sulla distribuzione dei risultati.
L'arco più lungo: cosa continuano a fare i pesi aperti cinesi
Ling 3.1 Flash rientra in un pattern che è rimasto valido tutto l'anno. I laboratori cinesi rilasciano pesi aperti su scala di frontiera con licenze permissive a un ritmo che nessun laboratorio occidentale ha eguagliato, e competono sull'efficienza più che sulla scala grezza.
Il contesto vale la pena di essere detto chiaramente. Uno sviluppatore che esegue uno di questi modelli possiede lo stack di inferenza, il che significa nessun costo API per token, nessun dato che esce dall'azienda e nessuna terza parte che decide quando il modello cambia. Per team con vincoli di privacy o carichi di lavoro prevedibili ma pesanti, questo vale soldi veri.
Victor Taelin ha notato questo mese che nessun modello aperto rimane nella top 25 delle classifiche di Artificial Analysis, con il migliore, MiMo di Xiaomi, al 26° posto. Ling 3.1 Flash a 41 sull'Intelligence Index è un punteggio di intelligenza, non una posizione in classifica, quindi le due cifre misurano cose diverse, e il divario tra il miglior modello aperto e il miglior modello chiuso è ancora reale. Quello che è cambiato è che il divario ora si misura in punti, non nel fatto che un modello aperto possa o meno fare il lavoro.
Cosa significa per chi sceglie un modello
Tre considerazioni contano più del rapporto tra parametri.
Licenza e termini di distribuzione. Ant Group afferma che il modello sarà aperto, ma la licenza specifica determina se l'uso commerciale è senza restrizioni. Dato quanto spesso "pesi aperti" e "licenza permissiva" vengano usati in modo intercambiabile quando non sono la stessa cosa, i termini meritano una lettura attenta prima di qualsiasi dipendenza in produzione. La stessa cautela vale per la documentazione pubblicata prima del rilascio, che descrive capacità più che obblighi.
La dichiarazione sulla finestra di contesto. Un milione di token è un numero grande, ma il contesto utilizzabile è di solito più corto di quanto pubblicizzato. Se il modello mantiene la qualità per tutta la finestra, o degrada molto prima, è la domanda che determina l'utilità per lavori su documenti lunghi e repository grandi. Le stesse dimostrazioni di contesto lungo di Ant Group suggeriscono che il modello gestisca input grandi, ma anche in questo caso sono test del fornitore.
Il requisito di memoria. Un modello sparso da 560B non è una distribuzione su laptop. La storia dei parametri attivi riduce la computazione per token, non l'occupazione dei pesi, e chiunque pianifichi il self-hosting dovrebbe dimensionare l'hardware sul totale, non sul numero di attivi. Questa distinzione fa spesso inciampare le persone. Un modello descritto come attivante 25B parametri sembra piccolo finché non provi a caricarlo, e a quel punto i 560B completi devono stare da qualche parte.
C'è anche una questione pratica di supporto. Un modello di un laboratorio che rilascia spesso sarà superato, e i team dovrebbero pianificare un percorso di migrazione. La cadenza di rilascio di Ant Group suggerisce che Ling 3.2 o Ling 4 siano questione di mesi, il che è positivo per le capacità e scomodo per chiunque abbia costruito un fine-tuning o uno script di distribuzione attorno a una versione.
Ling 3.1 Flash è un rilascio capace da un laboratorio che ha spedito con costanza. La vera notizia è strutturale: un modello con 25B attivi può ora stare credibilmente nella stessa conversazione di sistemi densi molto più grandi. È l'argomento che l'intera linea di lavoro sull'MoE sparso ha portato avanti, e i benchmark stanno finalmente iniziando a supportarlo.
Articoli correlati
Google Flow e Adobe Firefly portano il video AI fuori dalla chat
La qualità dei modelli di base si è sufficientemente uniformata che il fattore differenziante si è spostato su ciò che circonda il modello.
Google ha dimezzato il prezzo di output di Nano Banana 2.1 e ha corretto i suoi punti deboli
Il dettaglio più rilevante sta fuori dall'elenco delle funzionalità, ed è il prezzo.
Vida vuole fatturare gli agenti AI in base ai risultati anziché all'utilizzo
La fatturazione basata sull'utilizzo allinea i ricavi del fornitore con un agente che impiega più tempo. Il prezzo basato sui risultati ribalta tutto questo.
Voice 3 e PACT di Decagon preparano il supporto clienti per gli agenti dall'altra parte
I sistemi di supporto hanno passato decenni a modellare il comportamento umano. Ora una parte delle richieste in arrivo è costituita da macchine che agiscono per conto delle persone.