← Retour au blog
AiEnviron 8 min de lecture

OpenAI publie 722 résultats mathématiques issus de l'IA. Les mathématiciens demandent à qui revient le mérite.

Publié le 7 oct. 2026
OpenAI publie 722 résultats mathématiques issus de l'IA. Les mathématiciens demandent à qui revient le mérite.

OpenAI a publié une collection de résultats mathématiques produits par un modèle de frontière interne, en mettant en ligne un dépôt accompagné de formalisations Lean pour un grand nombre des preuves, ainsi que de protocoles de révision et de citation. Cette publication décrit 722 résultats, dont 162 vérifiés par machine.

L'accueil réservé à cette annonce porte moins sur l'exactitude des mathématiques que sur ce que la vérification apporte réellement, et sur la question de savoir à qui ces résultats appartiennent.

Ce que Lean vérifie, et ce qu'il ne vérifie pas

Lean est un assistant de preuve. Il vérifie mécaniquement chaque étape d'un raisonnement formel par rapport à des axiomes énoncés, ce qui signifie qu'une preuve vérifiée ne peut pas contenir de faille logique. Si elle compile, le raisonnement découle des prémisses.

C'est une garantie forte, et étroite. Un assistant de preuve vérifie que l'énoncé formel découle bien. Il ne vérifie pas que cet énoncé formel dit ce que le texte d'accompagnement prétend. Un humain doit encore lire chacun des 162 résultats vérifiés par machine et confirmer que le fichier Lean encode bien le théorème que l'on croit qu'il encode. La formalisation est une étape de traduction, et les traductions dérivent.

Une longue rangée de carreaux de verre dépoli identiques et sans étiquette, dressés sur une surface de béton pâle, s'estompant dans un flou doux

Les 560 résultats restants ne bénéficient pas de cette vérification, ce qui signifie que la collection publiée mélange deux catégories de preuves très différentes. Annoncer « 722 résultats, 162 vérifiés » est plus honnête que d'annoncer le total agrégé, mais cela signifie aussi que le chiffre mis en avant surestime d'environ quatre fois et demie le sous-ensemble vérifié.

Le problème de l'attribution prend une nouvelle forme

Les mathématiciens débattent de la répartition du mérite depuis que la discipline existe, et ces débats portent généralement sur celui qui a posé la question, celui qui a trouvé l'étape clé et celui qui a rédigé l'ensemble. Les résultats générés par IA introduisent une variante de ce problème sans précédent.

Si un modèle produit la preuve d'un problème ouvert de longue date, qui en est l'auteur ? Le modèle, qui ne peut pas non plus être un auteur au sens juridique dans les cadres actuels du droit d'auteur ? Les chercheurs qui l'ont sollicité ? L'équipe qui a constitué la liste de problèmes ? L'organisation qui a entraîné le modèle, et qui ne publie pas les poids ?

OpenAI affirme travailler à une publication responsable du modèle sous-jacent. D'ici là, la communauté ne peut ni reproduire les résultats sur le même système, ni inspecter les données d'entraînement, ni évaluer si le succès du modèle dépendait du fait d'avoir vu des problèmes similaires pendant l'entraînement. Publication et reproductibilité sont deux promesses distinctes, et cette publication tient la première sans la seconde.

Une complication supplémentaire est propre aux mathématiques : dans cette discipline, l'attribution repose sur la compréhension. Une preuve est créditée en partie pour l'idée qu'elle introduit, et une idée mathématique se diffuse parce que des gens la lisent, la trouvent utile et l'étendent. Une preuve générée par machine que personne ne comprend pleinement est un résultat qui ne peut pas se propager de cette manière. On peut la citer. On peut difficilement s'appuyer dessus.

Il existe aussi une asymétrie pratique qui compliquera l'évaluation par les pairs pendant des années. Un mathématicien humain qui publie une preuve erronée est généralement considéré comme ayant commis une erreur de bonne foi. La conséquence en termes de réputation est proportionnée. Un modèle qui publie 722 résultats, certains justes et d'autres non, produit un corpus où le rapport entre résultats justes et erronés est lui-même inconnu, et où aucun individu ne peut être tenu responsable des mauvais. Les revues ne sont pas conçues pour traiter des soumissions dont l'auctorialité est diffuse et dont le taux d'erreur est une distribution plutôt qu'un incident.

Le problème de la citation en découle directement. Le progrès mathématique dépend de la connaissance des résultats antérieurs sur lesquels on peut s'appuyer. Un résultat vérifié par machine dans Lean est un bon candidat. Un résultat affirmé par un modèle et relu par personne ne l'est pas, et mélanger les deux catégories dans une même publication rend plus difficile de s'appuyer sur l'une comme sur l'autre.

L'autre actualité du même jour

La publication mathématique d'OpenAI est arrivée au cours d'une semaine marquée par plusieurs affirmations émanant des entreprises elles-mêmes et par peu de vérifications indépendantes.

Mistral a lancé Large 4, un modèle à mille milliards de paramètres présenté comme la meilleure réponse occidentale aux systèmes chinois à poids ouverts, avec des comparaisons de benchmarks qu'un fil de discussion a vérifiées ligne par ligne face aux scores publiés par Artificial Analysis et jugées insuffisantes, notamment une accusation de sélection biaisée de la variante d'un concurrent et de présentation erronée d'un chiffre publié par un tiers.

Reflection a publié Beam, un modèle à poids ouverts visant le même combat, dont les poids doivent être mis en ligne plus tard dans le mois.

Et Anthropic a élargi l'accès à un modèle qui détecte des vulnérabilités logicielles, avec ses propres chiffres internes.

Le schéma qui traverse la semaine est que les affirmations de capacités arrivent plus vite que la capacité à les vérifier. arXiv a répondu à une autre manifestation de la même pression en limitant les soumissionnaires à deux articles par mois, après avoir reçu un record de 40 363 soumissions en septembre, soit le double du chiffre de deux ans plus tôt.

La compétition porte sur l'usage que l'on peut faire des affirmations

Il existe une version du récit sur l'IA et les mathématiques qui se présente comme un tableau de scores : combien de problèmes ouverts un modèle peut-il résoudre. Le cadrage plus utile consiste à se demander ce qui rend un résultat utilisable par une communauté de recherche, et cela implique plusieurs éléments qu'une publication de modèle ne fournit pas à elle seule.

Il faut que les relecteurs comprennent le raisonnement. Il faut que l'attribution soit traçable. Il faut que d'autres chercheurs puissent s'appuyer sur le résultat sans le redémontrer. Et il faut que la communauté au sens large ait suffisamment accès au système générateur pour mener ses propres tests.

C'est sur ce dernier point que la publication reste en deçà. Une collection de résultats produits par un système que personne d'autre ne peut exécuter relève davantage de la démonstration que de la contribution. Elle montre ce qui est possible. Elle ne donne à la discipline rien sur quoi elle puisse s'appuyer de manière indépendante.

Les mathématiques ne sont pas la partie difficile de cette transition. La partie difficile, c'est que les capacités de l'IA dépassent désormais les institutions qui existent pour les vérifier (évaluation par les pairs, réplication des benchmarks, normes d'auctorialité, pratiques de citation), et que ces institutions fonctionnent à l'échelle de temps humaine. Un modèle peut produire 722 résultats en un seul entraînement. Déterminer lesquels comptent, à qui en revient le mérite et ce qui en découle se compte encore en années.

Il existe une thèse concurrente qu'il vaut la peine d'énoncer, car elle n'est pas déraisonnable. Une preuve formelle qui compile est une preuve, peu importe qui ou quoi l'a produite. Les mathématiques ont toujours accepté les résultats pour leur valeur et non pour leur provenance, et si Lean vérifie un raisonnement, ce raisonnement tient. Selon cette conception, le débat sur l'attribution est un problème sociologique que la discipline devrait résoudre de manière ordinaire, et l'insistance sur la reproductibilité est une exigence d'accès que l'on n'a jamais imposée aux mathématiciens humains. Personne ne demande à un auteur humain de publier son processus de pensée.

L'objection est que l'on peut demander à un auteur humain d'expliquer son travail, et que c'est dans l'explication que réside la compréhension. Une preuve qui arrive sans explication est une boîte noire dont la sortie se trouve être vérifiée. La discipline peut la citer mais ne peut pas l'enseigner, ce qui est une perte réelle même si le théorème est vrai.

Le conseil pratique qui ressort de cette semaine vaut pour quiconque achète des capacités d'IA, et pas seulement des mathématiques : demandez à voir les preuves, les autorisations et le chemin qui mène d'une démonstration réussie à un travail reproductible. Un résultat de benchmark et un système opérationnel sont deux artefacts différents, et c'est dans l'écart entre les deux que se logent les surprises.

Articles associés