La boucle de recherche d'OpenAI commence à se refermer sur elle-même

The Information a rapporté le 21 septembre que les modèles d'IA internes d'OpenAI ont largement automatisé le pipeline d'entraînement des nouveaux modèles expérimentaux, notamment l'écriture de code de kernel GPU et l'optimisation du code d'entraînement. Le détail qui a retenu l'attention était la manière dont le travail démarre. Un chercheur fournit au système un exemple d'optimisation à poursuivre, et l'IA passe ensuite des semaines à implémenter et à tester des améliorations similaires de façon autonome.
Le deuxième détail était plus étrange. Plusieurs agents d'IA internes ont commencé à collaborer sur des problèmes sans qu'un humain intervienne dans la boucle. Des exemples rapportés qui demandaient autrefois des années d'ingénierie s'exécutent désormais en une semaine environ.
Si cette description est exacte, l'élément intéressant n'est pas qu'une IA sache écrire du code de kernel. Les modèles le font depuis un moment. L'élément intéressant, c'est la direction de la boucle. Quand une IA contribue à rendre le modèle suivant plus rapide, et que ce modèle plus rapide contribue à produire celui d'après, l'amélioration se cumule à l'intérieur du processus de recherche plutôt que de rester à la couche visible par l'utilisateur.
Pourquoi c'est différent d'écrire du code
Automatiser la boucle d'entraînement n'est pas la même chose qu'automatiser une tâche de codage, et la différence mérite d'être énoncée précisément. Écrire une fonctionnalité pour une application a une cible connue : la fonctionnalité marche ou elle ne marche pas. Optimiser un entraînement a une cible ouverte. Le système doit trouver des changements qui rendent l'entraînement plus rapide ou moins coûteux sans dégrader le modèle, et il doit le faire dans un espace de recherche où la plupart des changements empirent les choses.
Le flux de travail rapporté suggère que la partie difficile a été circonscrite. Un humain fournit un bon exemple d'optimisation, ce qui définit la forme du problème. L'IA reproduit cette forme sur d'autres parties de la base de code. C'est une capacité réelle, et elle est aussi délimitée, car c'est toujours l'humain qui décide de ce qui constitue une direction prometteuse.
C'est à cette frontière que l'affirmation devient intéressante. Répliquer une optimisation connue dans toute une base de code est un travail qu'un modèle puissant peut accomplir aujourd'hui. Découvrir une optimisation que personne n'a trouvée est une tâche différente, et le rapport ne prétend pas que cela s'est produit. Ce qu'il décrit, c'est l'élimination d'une grande catégorie de travail qualifié du pipeline d'entraînement, ce qui n'est pas la même chose que le pipeline qui s'améliore lui-même, même si les deux se confondent sur les bords.
L'affirmation sur la collaboration multi-agents est plus difficile à évaluer. Des agents qui travaillent ensemble sans humains, cela ressemble à un changement d'échelle, et cela peut aussi signifier des agents qui se transmettent des sorties structurées au sein d'un flux de travail conçu par un humain. Les deux sont compatibles avec le rapport. L'écart entre les deux correspond à la différence entre un nouveau type d'organisation de recherche et un long script d'automatisation.
L'argument de la récursion, énoncé honnêtement
L'auto-amélioration récursive est l'idée qu'une intelligence capable de s'améliorer elle-même devient plus rapide à s'améliorer, ce qui produit une courbe qui semble plate puis ne l'est plus. Le concept existe depuis qu'I. J. Good a écrit sur une explosion de l'intelligence en 1965, et il est resté largement théorique parce que la boucle n'arrêtait pas de se briser. Un modèle qui écrit du code est utile. Un modèle qui améliore le processus qui produit le modèle suivant, c'est autre chose.
Ce qui rend la situation rapportée digne d'attention, c'est que la boucle dispose d'un étalon naturel. L'efficacité de l'entraînement est facile à quantifier. Si le travail d'entraînement assisté par IA comprime réellement un effort d'ingénierie de plusieurs années en une semaine, cela se voit dans la fréquence à laquelle OpenAI publie de nouveaux modèles et dans le coût en calcul de chacun. Une boucle de recherche réellement refermée produit une cadence observable, et une boucle de recherche qui ne l'est pas produit un cycle médiatique.
C'est le test que j'appliquerais. Non pas de savoir si le rapport est vrai, mais si les douze prochains mois montrent des sorties de modèles plus rapides à coût comparable. Si la boucle se referme, le rythme des sorties change. Sinon, l'annonce n'est qu'une revendication de capacité de plus, à la demi-vie courte.
Pourquoi la cadence compte plus que l'affirmation
Il y a une raison de s'intéresser au moment de ce rapport, et pas seulement à son contenu. L'entraînement des modèles de pointe s'est heurté à un mur, et ce mur est fait de coûts. Un seul grand entraînement consomme aujourd'hui de l'électricité, des puces et du temps d'ingénierie à une échelle où un gain d'efficacité de dix pour cent vaut plus qu'un nouveau record sur un benchmark, parce qu'il détermine combien d'expériences un laboratoire pourra se permettre de lancer le trimestre suivant.
Cela change la valeur d'une IA qui optimise le code d'entraînement. Ce n'est pas un pas vers une machine qui s'améliore elle-même au sens de la science-fiction. C'est un multiplicateur appliqué à ce que fait de plus cher un laboratoire, et c'est sur le poste de dépense le plus coûteux que naît un avantage de recherche. Deux laboratoires disposant du même budget de calcul mais avec une boucle d'entraînement dix pour cent plus rapide ne restent pas longtemps à égalité.
Vu ainsi, le rapport porte moins sur la conscience que sur l'efficacité capitalistique. La boucle qui compte n'est pas le modèle qui s'améliore lui-même. C'est le modèle qui réduit le coût de la prochaine expérience, ce qui permet au laboratoire d'en lancer davantage, et c'est la manière ordinaire dont toute technologie progresse.
La partie que personne ne peut vérifier
Le problème honnête avec ce type de rapport, c'est la vérification. Il n'y a ni article, ni benchmark, ni réplication indépendante. L'affirmation vient de l'intérieur d'une entreprise qui a tout intérêt à être crue et aucune obligation de montrer son travail. Cela ne la rend pas fausse. Cela signifie que la confiance qu'un observateur extérieur peut lui accorder est bornée par la source.
Cela n'est pas propre à OpenAI. Chaque laboratoire de pointe avance désormais des affirmations sur son automatisation interne qui échappent à l'évaluation publique, et le travail journalistique qui les met au jour fait œuvre utile même quand les chiffres ne peuvent pas être vérifiés. Le schéma est familier : une capacité est décrite, la description est plausible, et la preuve arrive, ou n'arrive pas, quelque part en aval.
Il y a aussi la question de la finalité de cette automatisation. Altman a déclaré début septembre dans un podcast qu'OpenAI construira certainement des robots humanoïdes, et que le cerveau, et non le corps, est la partie difficile. Un processus de recherche qui s'accélère lui-même et l'ambition de mettre cette intelligence dans des machines physiques sont les deux moitiés d'une même thèse. La boucle d'entraînement n'est pas le produit. C'est ce qui rend possible le produit suivant.
Ce que cela signifie si cela se vérifie
Supposons que la cadence rapportée soit réelle. L'effet direct est qu'un laboratoire de pointe peut explorer plus d'idées par unité de temps, parce que le coût de test d'une optimisation baisse. Cela favorise les laboratoires qui disposent déjà de calcul et de données à grande échelle, soit le même ensemble de laboratoires qui mènent aujourd'hui. C'est un avantage qui se cumule pour les acteurs en place plutôt qu'un avantage qui permettrait à une équipe plus petite de rattraper son retard.
L'effet indirect concerne les emplois de la recherche. Le travail décrit dans le rapport — écrire des kernels et ajuster du code d'entraînement — est exactement le type de travail qualifié mais bien spécifié que l'automatisation atteint en premier. Les personnes qui faisaient ce travail remontent vers la définition de ce qui mérite d'être optimisé, la partie que le rapport confie encore à un humain.
Cette lecture est moins spectaculaire qu'une explosion de l'intelligence, et plus utile pour planifier. La nouvelle rapportée n'est pas qu'OpenAI a construit une machine qui s'améliore elle-même. C'est que le pipeline d'entraînement a discrètement absorbé la partie de la recherche la plus facile à spécifier, et a laissé les jugements là où ils étaient.
Articles associés
Claude Sonnet 5.5 est 30 % moins cher. C'est une histoire d'achats, pas une histoire de modèle.
Les affirmations de remise des fournisseurs sont généralement mesurées sur une charge de travail représentative, et la vôtre ne l'est pas.
HPE vient de vendre 1,2 milliard de dollars de matériel parce que le réseau est devenu l'essentiel
Une commande de 1,2 milliard de dollars dont la répartition entre cinq catégories n'est pas divulguée n'équivaut pas à 1,2 milliard de marge.
Le malware qui soumet sa prochaine action au vote de quatre modèles
L'infrastructure de commande et contrôle se résume à une poignée d'API publiques et à un webhook Discord.
Shopify laisse les agents IA cliquer sur Acheter. Le marchand encaisse toujours le litige.
La plateforme d'agents négocie l'intention. Le marchand porte le risque.