AI News

OpenAI affirme qu’une version interne de son prochain modèle majeur, Astra, a produit de nouveaux résultats sur dix problèmes de longue date en mathématiques et en informatique théorique. L’entreprise indique que ce travail couvre la géométrie, la théorie du codage, la théorie des groupes, la complexité, la cryptographie et la combinatoire, chaque argument ayant ensuite été formalisé dans Lean.

L’annonce compte moins comme une affirmation selon laquelle l’IA aurait résolu de manière indépendante un large ensemble de problèmes célèbres que comme un test visant à savoir si les modèles de langage peuvent générer des arguments mathématiques de niveau recherche que des experts peuvent examiner et vérifier. OpenAI a indiqué que les problèmes n’avaient connu aucun progrès sur leurs principaux résultats depuis au moins une décennie, et dans de nombreux cas depuis bien plus longtemps. L’entreprise a également reconnu que ce travail reste soumis à l’engagement et à l’examen des communautés mathématiques concernées.

Dix problèmes, dans plusieurs domaines

La liste d’OpenAI comprend de nouvelles bornes supérieures pour le pavage de sphères en grande dimension, atteignant le seuil de Cohn–Elkies, ainsi que de meilleures bornes pour la taille de codes binaires et sphériques à des distances minimales spécifiées. Il s’agit de questions centrales en géométrie de haute dimension et en théorie du codage.

En théorie des groupes et en algèbres d’opérateurs, l’entreprise rapporte une construction montrant l’existence de groupes non soficiques et affirme avoir réfuté la conjecture de rigidité de Connes. Cette conjecture concerne la question de savoir si certains groupes sont déterminés de manière unique par leurs algèbres de von Neumann.

Les résultats incluent également de nouvelles bornes inférieures pour des circuits arithmétiques et des formules calculant le permanent. OpenAI donne une borne inférieure pour les formules arithmétiques d’ordre n^4/log n. En théorie de la complexité, l’entreprise rapporte un théorème de répétition parallèle exponentielle pour des jeux quantiques généraux à deux joueurs, étendant un principe mieux établi dans les cadres classiques.

D’autres résultats signalés concernent le problème du vecteur le plus proche, un problème de réseaux lié à la cryptographie post-quantique ; la conjecture de volume d’Ehrhart sur des corps convexes ayant un seul point de réseau intérieur ; les nombres de Ramsey pour triangles multicolores ; et des questions de compacité et de dégénérescence en théorie extrémale des graphes. OpenAI indique que ces derniers résultats résolvent les problèmes 146 et 180 d’Erdős, tandis que le résultat de Ramsey résout le problème 183 d’Erdős.

Cette annonce fait suite à la divulgation précédente par OpenAI d’une réfutation générée par IA de la conjecture de la distance unitaire d’Erdős. L’entreprise dit que ce résultat a contribué à susciter des recherches ultérieures de mathématiciens externes sur des problèmes connexes en combinatoire additive, en géométrie algorithmique et en complexité.

Comment les résultats ont été produits

Selon OpenAI, les dix résultats ont été générés par une version interne d’Astra plutôt que par un modèle accessible au public. L’entreprise indique que l’utilisation totale de tokens nécessaire pour trouver les solutions aurait coûté environ 2 000 dollars aux tarifs de l’API Sol. Il s’agit d’une estimation du fournisseur, et non d’une mesure auditéе de manière indépendante du coût de reproduction de la recherche.

Des humains ont ensuite préparé les arguments sous forme de manuscrits avec le même modèle, a indiqué OpenAI. Le modèle a ensuite formalisé chaque argument dans un certificat Lean. OpenAI publie également une narration générée par le modèle du processus de pensée du système pour chaque solution, bien qu’une telle narration ne doive pas être automatiquement considérée comme un enregistrement complet ou fidèle du calcul interne du modèle.

Les formalismes Lean sont importants car ils fournissent une représentation des preuves vérifiable par machine. Ils n’établissent pas, à eux seuls, que les affirmations sous-jacentes sont mathématiquement importantes, nouvelles dans tous leurs détails ou correctement interprétées dans leur contexte de recherche plus large. Ces questions nécessitent encore l’examen de spécialistes et une comparaison avec la littérature existante.

Preuves, attribution et incertitude

Les éléments de preuve disponibles pour ces affirmations proviennent de l’annonce officielle d’OpenAI. Un autre résumé de style agence porte le même titre, mais le matériel fourni n’inclut pas de reportage indépendant ni le texte complet d’un article tiers. En conséquence, les affirmations les plus solides sur les performances du modèle, son coût et son impact sur la recherche sont celles rapportées par OpenAI.

OpenAI affirme assumer la responsabilité de l’exactitude des manuscrits préparés et des preuves formalisées, tout en attribuant les arguments mathématiques eux-mêmes au système. Cette distinction est inhabituellement explicite pour une annonce de recherche en IA. Elle reflète un débat croissant sur la manière d’attribuer la paternité et le crédit lorsqu’un modèle propose un argument, que des humains l’éditent et que des systèmes formels vérifient une partie du résultat.

L’entreprise ne présente pas cette annonce comme un substitut à l’évaluation par les pairs. Elle demande plutôt aux mathématiciens de replacer les résultats dans leur contexte et de développer les idées par des recherches ultérieures. Tant que ce processus n’aura pas eu lieu, l’annonce doit être lue comme un rapport d’arguments potentiellement significatifs générés par machine, et non comme une preuve définitive qu’Astra a remplacé la recherche mathématique experte.

OpenAI lie également ces travaux à ChatGPT for Academic Researchers, une initiative qui, selon elle, offrira à 100 000 scientifiques et mathématiciens un accès gratuit à ses meilleurs modèles ChatGPT. Ce programme d’accès est distinct des résultats d’Astra, et l’annonce ne montre pas que les avancées rapportées puissent être reproduites avec les outils distribués publiquement.

Ce que cela signifie pour les équipes de recherche et les constructeurs d’IA

Pour les chercheurs en mathématiques, le signal le plus pratique est la combinaison de la génération et de la vérification formelle. Un modèle capable de suggérer une preuve plausible mais incapable de l’exprimer dans un système comme Lean reste difficile à faire confiance à grande échelle. La formalisation crée un chemin plus étroit pour vérifier la correction, même si elle n’élimine pas la nécessité du jugement humain sur les définitions, la nouveauté et l’importance.

Pour les constructeurs d’IA, l’annonce pointe vers des suites d’évaluation fondées sur des problèmes de recherche ouverts plutôt que sur des benchmarks classiques de questions-réponses. OpenAI dit avoir évalué des modèles sur de tels problèmes pendant le développement. Cette approche teste la capacité d’un système à soutenir un raisonnement en plusieurs étapes, à identifier des structures intermédiaires utiles et à produire des artefacts que d’autres outils peuvent vérifier.

L’économie compte également. Le coût d’inférence estimé par OpenAI à 2 000 dollars pour dix résultats suggère qu’une utilisation de modèles au niveau recherche peut être envisageable pour des équipes bien financées, mais cette estimation ne peut pas encore être généralisée. Elle exclut la valeur de l’examen par des experts, de la préparation des manuscrits, du travail de formalisation et de l’infrastructure nécessaire pour reproduire ou prolonger les résultats. Les acheteurs en entreprise devraient donc distinguer le coût brut du modèle et du calcul du coût total d’un flux de travail de recherche fiable.

Pour les fondateurs et les équipes produit, l’opportunité à court terme se situe probablement dans des systèmes étroits et connectés aux outils plutôt que dans des mathématiciens automatisés à usage général. Les flux de travail qui combinent modèles, prouveurs de théorèmes, exécution de code, recherche bibliographique et revue spécialisée peuvent être plus fiables que des systèmes jugés uniquement sur la fluidité des explications.

Ce qu’il faut surveiller ensuite

Le premier signal sera la vérification externe des dix affirmations, en particulier la réfutation rapportée de la conjecture de rigidité de Connes, la construction de groupes non soficiques et le résultat de répétition parallèle quantique. La publication, les vérifications formelles indépendantes et les réponses détaillées des spécialistes montreront si les arguments résistent à l’examen et dans quelle mesure ils sont réellement nouveaux.

Les chercheurs devraient aussi surveiller si les certificats Lean sont complets, accessibles et utilisables par d’autres, plutôt que de simplement accompagner des manuscrits soignés. Une reproduction par des équipes n’ayant pas accès au système interne Astra d’OpenAI offrirait un test plus solide de la valeur pratique du travail.

Une autre question est de savoir si des résultats similaires émergent de modèles disponibles publiquement à un coût nettement inférieur. Cela indiquerait que la capacité se diffuse dans le domaine plutôt que de rester un avantage interne lié à un seul système non publié.

Perspective de Creati.ai

L’annonce d’OpenAI est importante parce qu’elle présente l’IA comme génératrice de candidats à la recherche mathématique, tout en exposant les limites de cette affirmation. L’élément le plus crédible du flux de travail n’est pas le récit du modèle ni l’ampleur de la liste ; c’est la tentative de convertir chaque argument en un certificat Lean vérifiable par machine et d’indiquer ouvertement comment la responsabilité est répartie.

L’étape suivante sera décidée en dehors d’OpenAI. Si des mathématiciens indépendants valident, simplifient et prolongent les résultats, l’annonce pourrait marquer un changement significatif dans les outils de recherche. Si les affirmations s’avèrent difficiles à reproduire ou à replacer dans leur contexte, elles montreront au contraire pourquoi la sortie du modèle, la vérification formelle et le jugement mathématique humain doivent rester des couches distinctes d’un même processus.

Vedettes

OpenAI fait état de dix avancées générées par IA en mathématiques et en informatique théorique

OpenAI affirme que son modèle Astra a produit dix avancées sur des problèmes de longue date en mathématiques et en informatique théorique, avec formalisation Lean pour examen.