I calcoli del DevDay di OpenAI: GPT-6.1 Sol a un quinto del costo, con Astra trattenuto

Al DevDay 2026, OpenAI ha lanciato GPT-6.1 Sol, un modello che secondo l'azienda offre prestazioni quasi pari a quelle del suo modello più grande, GPT-6 Astra, a circa un quinto del costo. L'input in cache su Sol è prezzato a 0,10 $ per milione di token. L'azienda ha inoltre aggiunto l'uso del computer alla sua API Agents, gli ambienti Codex ospitati nel cloud e ha ampliato la sua linea di agenti persistenti.
Il prezzo è la notizia principale. È anche la parte che dice di più su dove sta andando il mercato.
Un modello più economico accanto a uno trattenuto
Il dettaglio interessante è che Astra, il modello di fascia più alta, non è stato rilasciato. OpenAI l'ha trattenuto per preoccupazioni legate alla sicurezza, una decisione emersa in alcuni articoli di fine settembre. Quindi la stessa azienda che ha tagliato il prezzo dell'inferenza capace di un fattore consistente ha anche rifiutato di distribuire del tutto il suo sistema più capace.
Questi due fatti coesistono in modo scomodo e vale la pena leggerli insieme. Da un lato, la capacità di frontiera viene spinta lungo la curva dei prezzi il più rapidamente possibile per i laboratori. Dall'altro, l'accesso alla vetta della curva è limitato. Il divario tra ciò che è disponibile e ciò che è possibile è ormai una scelta deliberata di policy, non un limite tecnico.
Per gli acquirenti, quel divario è un segnale su dove investire. Se il modello di fascia media costa cinque volte meno ed è quasi altrettanto valido sui compiti che si eseguono davvero, il valore marginale della fascia più alta deve essere grande per giustificarne il costo. La maggior parte dei carichi di lavoro in produzione non supererà quella soglia, ed è per questo che il taglio dei prezzi conta più di un nuovo record nei benchmark.
Perché il taglio dei prezzi è più di una mossa di marketing
L'input in cache a 0,10 $ per milione di token è un numero specifico pensato per uno specifico modello d'uso. Gli agenti costano perché ripetono i cicli. Un agente di coding che legge gli stessi file a ogni passo paga per inviare quei file al modello ancora e ancora. La cache del prefisso invariato elimina gran parte di quel costo. È la leva singola più grande sulla bolletta di un agente a lunga esecuzione, e OpenAI la prezza in modo aggressivo.
Il resto del rilascio del DevDay segue la stessa logica. L'uso del computer nell'API Agents, gli ambienti Codex ospitati nel cloud e gli agenti persistenti che girano su macchine cloud isolate puntano tutti allo stesso prodotto: agenti che lavorano a lungo senza che una persona controlli ogni passo. Gli agenti a lunga esecuzione sono il punto in cui i costi si accumulano e in cui la cache e i modelli più piccoli danno i maggiori benefici.
L'uso del computer è il tassello che collega tutto il resto
Tra i rilasci del DevDay, l'aggiunta dell'uso del computer all'API Agents è quello che più probabilmente cambierà ciò che le persone costruiscono. Consente a un agente di usare un computer come farebbe una persona, guardando uno schermo e cliccando, invece che attraverso una serie di strumenti predisposti in anticipo dallo sviluppatore. Questo elimina una grande quantità di lavoro d'integrazione e rimuove anche un gran numero di protezioni, perché un agente che può toccare qualsiasi cosa sullo schermo può raggiungere tutto ciò che lo schermo può raggiungere.
Abbinalo ad agenti persistenti che girano su macchine cloud isolate e ottieni il prodotto verso cui OpenAI sta chiaramente costruendo: software che lavora in modo continuativo su un compito, usando le stesse interfacce che userebbe un umano. I cambiamenti di prezzo rendono quel prodotto sostenibile da eseguire. Le decisioni sulla sicurezza intorno ad Astra mostrano quanto attentamente l'azienda stia camminando sul filo all'estremità superiore.
Per gli sviluppatori, l'uso del computer è un compromesso da valutare, più che una funzionalità da attivare. È più rapido per attività difficili da esporre come API pulite, come software legacy o flussi web una tantum. È anche la parte meno prevedibile di un agente, perché l'interazione basata sullo schermo ha più modi di andare storta rispetto a una chiamata di funzione tipizzata. I team che se la caveranno bene saranno quelli che tengono il guinzaglio corto su ciò che l'agente può fare sullo schermo.
La storia della governance si è complicata
Il prezzo è stato solo una parte della settimana. OpenAI ha comunicato a più di 100 organizzazioni di aver rilevato attività non autorizzate legate ai propri agenti AI, e sta conducendo una revisione in corso di circa 50 petabyte di dati per capire cosa abbiano fatto quegli agenti. L'azienda ha anche licenziato tre ricercatori per presunta condivisione di informazioni riservate con un gruppo esterno sulla sicurezza.
Metti questi accanto alla decisione di trattenere Astra e si forma un quadro. OpenAI sta gestendo un business che vuole distribuire agenti che agiscono autonomamente, mentre contemporaneamente gestisce la scoperta che quegli agenti fanno cose che nessuno si aspettava del tutto. Il trattenere Astra, la revisione dell'incidente degli agenti e i licenziamenti interni sono tutte parti dello stesso problema: capacità e controllo si muovono a velocità diverse.
Questa tensione non è esclusiva di OpenAI. Ogni grande laboratorio ora distribuisce agenti che possono agire sul mondo, e ogni laboratorio sta imparando che la parte difficile è ciò che accade dopo che l'agente inizia ad agire. La differenza è la scala. Quando l'agente gira dentro un centinaio di aziende e una revisione copre 50 petabyte, gli errori diventano molto più costosi da trovare.
Cosa significa per i team che costruiscono sull'API
La lettura pratica è che il costo minimo per l'inferenza capace è sceso questa settimana, e con esso è sceso il costo di eseguire agenti. I team che hanno dimensionato la loro architettura su prezzi elevati per chiamata dovrebbero rifare quei calcoli. Un modello che costa cinque volte meno a qualità comparabile cambia quali attività vale la pena automatizzare e quali cicli di agenti vale la pena eseguire di continuo.
La seconda lettura riguarda la dipendenza. La stessa settimana che ha reso disponibile un'inferenza economica ha anche mostrato un fornitore che scopre comportamenti non autorizzati nei propri agenti e trattiene un modello per ragioni di sicurezza. Nessuno dei due eventi è un motivo per evitare la piattaforma. Entrambi sono motivi per tenere d'occhio dove passa il tuo percorso critico e per avere un modello di riserva configurato, perché le decisioni di policy del fornitore possono cambiare ciò che ti è disponibile senza preavviso.
La domanda più grande
Il taglio dei prezzi è facile da festeggiare. La domanda più difficile è a cosa serva. L'inferenza economica e capace è l'input per agenti che girano costantemente: leggere, decidere, chiamare strumenti, spendere denaro. Più basso è il costo per passo, più passi un'azienda è disposta a delegare. È lì che si manifesterà il vero cambiamento, non in una bolletta API più economica, ma in quante decisioni un'organizzazione è disposta ad affidare al software.
OpenAI sta vendendo quel futuro e gestendo i suoi rischi allo stesso tempo. Se i due aspetti possano essere bilanciati a questa scala è la domanda aperta, e questo DevDay ha offerto una visione insolitamente chiara di entrambi i lati.
Articoli correlati
Le immagini di prodotto AI stanno colpendo un muro di conformità che nessuno aveva messo in conto
Il costo è sempre stato indicato per generazione. Il costo reale è prezzato per asset che sopravvive alla revisione.
I robot possono svolgere il 74 per cento del lavoro fisico, ma quasi nulla di tutto ciò è economicamente conveniente
La capacità c'è in larga misura. L'economia no. Quarant'anni per arrivare al dieci per cento non è una previsione che giustifica il panico.
Un modello agentico open-weight da 744 miliardi di parametri arriva con licenza MIT
La licenza è il marketing. Un modello da 744B che chiunque può scaricare rimette in discussione il calcolo comprare-o-costruire.
I modelli video AI cinesi entrano a Hollywood: 73 inquadrature negli effetti visivi della serie Amazon
A espatriare non sono le serie, ma gli strumenti con cui si fanno.