Il ciclo di ricerca di OpenAI inizia a chiudersi su se stesso

The Information ha riportato il 21 settembre che i modelli AI interni di OpenAI hanno in gran parte automatizzato la pipeline di addestramento dei nuovi modelli sperimentali, inclusa la scrittura di codice kernel per GPU e l'ottimizzazione del codice di addestramento. Il dettaglio che colpiva era come inizia il lavoro. Un ricercatore fornisce al sistema un esempio di un'ottimizzazione da perseguire, e poi l'AI passa settimane a implementare e testare miglioramenti simili da sola.
Il secondo dettaglio era più strano. Diversi agenti AI interni hanno iniziato a collaborare su problemi senza un umano nel ciclo. Gli esempi riportati, che un tempo richiedevano anni di ingegneria, ora si completano in circa una settimana.
Se quella descrizione è accurata, la parte interessante non è che un'AI sappia scrivere codice kernel. I modelli lo fanno già da un po'. La parte interessante è la direzione del ciclo. Quando un'AI aiuta a rendere più veloce il modello successivo, e quel modello più veloce aiuta a creare quello dopo, il miglioramento si accumula all'interno del processo di ricerca invece di restare al livello rivolto all'utente.
Perché questo è diverso dallo scrivere codice
Automatizzare il ciclo di addestramento non è la stessa cosa che automatizzare un compito di programmazione, e la differenza vale la pena di essere precisata. Scrivere una funzionalità per un'applicazione ha un obiettivo noto: la funzionalità funziona o non funziona. Ottimizzare un addestramento ha un obiettivo aperto. Il sistema deve trovare modifiche che rendano l'addestramento più veloce o più economico senza degradare il modello, e deve farlo in uno spazio di ricerca in cui la maggior parte delle modifiche peggiora le cose.
Il flusso di lavoro riportato suggerisce che la parte difficile è stata circoscritta. Un umano fornisce un buon esempio di ottimizzazione, che definisce la forma del problema. L'AI replica quella forma in altre parti della base di codice. È una capacità reale ed è anche una capacità limitata, perché l'umano resta colui che decide cosa conta come direzione promettente.
È su quel confine che l'affermazione diventa interessante. Replicare un'ottimizzazione nota su una base di codice è un lavoro che un modello forte sa fare già oggi. Scoprire un'ottimizzazione che nessuno ha ancora trovato è un compito diverso, e il rapporto non afferma che sia accaduto. Ciò che descrive è l'eliminazione di un'ampia categoria di lavoro qualificato dalla pipeline di addestramento, il che non equivale a una pipeline che migliora se stessa, anche se le due cose si confondono ai margini.
L'affermazione sulla collaborazione multi-agente è più difficile da valutare. Agenti che lavorano insieme senza umani sembra un salto di qualità, e può anche significare agenti che si scambiano output strutturati all'interno di un flusso di lavoro progettato da un umano. Entrambe le cose sono compatibili con il rapporto. Il divario tra le due è la differenza tra un nuovo tipo di organizzazione di ricerca e un lungo script di automazione.
L'argomento della ricorsione, detto onestamente
L'auto-miglioramento ricorsivo è l'idea che un'intelligenza capace di migliorare se stessa diventi più veloce nel migliorare se stessa, il che produce una curva che sembra piatta e poi non lo è più. Il concetto esiste da quando I. J. Good scrisse di un'esplosione di intelligenza nel 1965, ed è rimasto per lo più teoria perché il ciclo continuava a rompersi. Un modello che scrive codice è utile. Un modello che migliora il processo che produce il modello successivo è un'altra cosa.
Ciò che rende degna di attenzione la situazione riportata è che il ciclo ha un metro di misura naturale. L'efficienza dell'addestramento è facile da quantificare. Se il lavoro di addestramento assistito dall'AI comprime davvero in una settimana uno sforzo di ingegneria durato anni, questo si vede nella frequenza con cui OpenAI rilascia nuovi modelli e in quanto calcolo costa ciascuno. Un ciclo di ricerca che si è davvero chiuso produce una cadenza osservabile, e un ciclo di ricerca che non si è chiuso produce un ciclo di copertura mediatica.
Questo è il test che applicherei. Non se il rapporto sia vero, ma se nei prossimi dodici mesi si vedranno rilasci di modelli più rapidi a costi simili. Se il ciclo si sta chiudendo, il ritmo dei rilasci cambia. Se non si sta chiudendo, l'annuncio è solo un'altra dichiarazione di capacità con una breve emivita.
Perché la cadenza conta più dell'affermazione
C'è una ragione per interessarsi al momento in cui arriva questo rapporto, e non solo al suo contenuto. L'addestramento dei modelli di frontiera ha sbattuto contro un muro, e il muro è fatto di costi. Un singolo grande addestramento ormai consuma energia, chip e tempo di ingegneria su una scala in cui un guadagno di efficienza del dieci percento vale più di un nuovo record di benchmark, perché decide quanti esperimenti un laboratorio può permettersi di eseguire nel trimestre successivo.
Questo cambia quanto vale un'AI che ottimizza il codice di addestramento. Non è un passo verso una macchina che migliora se stessa nel senso della fantascienza. È un moltiplicatore sulla cosa più costosa che un laboratorio fa, e un moltiplicatore sulla voce di costo più alta è da dove nasce un vantaggio nella ricerca. Due laboratori con lo stesso budget di calcolo ma con un ciclo di addestramento più veloce del dieci percento non restano alla pari a lungo.
Vista così, la notizia riguarda meno la coscienza e più l'efficienza del capitale. Il ciclo che conta non è il modello che migliora se stesso. È il modello che riduce il costo del prossimo esperimento, il che permette al laboratorio di eseguirne di più, che è il modo ordinario in cui qualsiasi tecnologia diventa più veloce.
La parte che nessuno può verificare
Il problema onesto con questo tipo di rapporti è la verifica. Non c'è un articolo, non c'è un benchmark, non c'è una replica indipendente. L'affermazione arriva dall'interno di un'azienda che ha ogni incentivo a essere creduta e nessun obbligo di mostrare il proprio lavoro. Questo non la rende falsa. Significa che la fiducia che un esterno può avere è limitata dalla fonte.
Non è una cosa esclusiva di OpenAI. Ogni laboratorio di frontiera ormai fa affermazioni sull'automazione interna che restano fuori dalla valutazione pubblica, e il giornalismo che le porta alla luce fa un lavoro utile anche quando i numeri non possono essere verificati. Lo schema è familiare: si descrive una capacità, la descrizione è plausibile, e la prova arriva, o non arriva, da qualche parte più avanti.
C'è anche la questione di a cosa serva l'automazione. Altman ha detto in un podcast all'inizio di settembre che OpenAI costruirà sicuramente robot umanoidi, e che la parte difficile è il cervello, non il corpo. Un processo di ricerca che accelera se stesso e l'ambizione di mettere quell'intelligenza dentro macchine fisiche sono due metà della stessa tesi. Il ciclo di addestramento non è il prodotto. È ciò che rende possibile il prodotto successivo.
Cosa significa se regge
Supponiamo che la cadenza riportata sia reale. L'effetto diretto è che un laboratorio di frontiera può esplorare più idee per unità di tempo, perché il costo di testare un'ottimizzazione diminuisce. Questo favorisce i laboratori che hanno già calcolo e dati su larga scala, cioè lo stesso insieme di laboratori che guidano oggi. È un vantaggio che si accumula per gli incumbent, non uno che permette a un team più piccolo di raggiungerli.
L'effetto indiretto riguarda i posti di lavoro nella ricerca. Il lavoro descritto nel rapporto, scrivere kernel e ottimizzare il codice di addestramento, è esattamente il tipo di lavoro qualificato ma ben specificato che l'automazione raggiunge per primo. Le persone che svolgevano quel lavoro salgono verso la definizione di ciò che vale la pena ottimizzare, che è la parte che il rapporto assegna ancora a un umano.
Questa lettura è meno drammatica di un'esplosione di intelligenza e più utile per la pianificazione. La notizia riportata non è che OpenAI ha costruito una macchina che migliora se stessa. È che la pipeline di addestramento ha silenziosamente assorbito la parte della ricerca più facile da specificare, e ha lasciato le decisioni di giudizio dove erano.
Articoli correlati
Claude Sonnet 5.5 costa il 30% in meno. È una storia di procurement, non una storia di modello.
Le affermazioni di sconto dei fornitori sono di solito misurate su un carico di lavoro rappresentativo, e il vostro non è rappresentativo.
HPE ha appena venduto 1,2 miliardi di dollari di hardware perché la rete è diventata il punto centrale
Un ordine da 1,2 miliardi di dollari con una ripartizione non divulgata tra cinque categorie non equivale a 1,2 miliardi di margine.
Il malware che affida la sua prossima mossa a un voto tra quattro modelli
L'infrastruttura di comando e controllo è un pugno di API pubbliche e un webhook Discord.
Shopify lascia che gli agenti AI premano Acquista. Il merchant si becca comunque la contestazione.
La piattaforma dell'agente fa da intermediario per l'intento. Il merchant si accolla il rischio.