AI News

OpenAI a publié une note de benchmark très suivie, avançant que les performances d’un modèle sur des tests d’agents difficiles peuvent dépendre autant de la conception du harness que du modèle lui-même. Dans un billet sur ARC-AGI-3, l’entreprise a indiqué que l’activation de deux réglages dans son Responses API — retained reasoning et compaction — avait fait passer le score de GPT-5.6 Sol sur le jeu de tâches public de 13,3 % à 38,3 %, tout en réduisant les tokens de sortie d’environ un facteur six.

Ce résultat compte au-delà d’un simple benchmark de puzzle. ARC-AGI-3 est conçu pour tester si des agents d’IA peuvent apprendre des jeux 2D inconnus par interaction plutôt que par instruction explicite. La thèse d’OpenAI est que la configuration par défaut du benchmark supprimait des performances en jetant le raisonnement interne entre les actions et en rognant l’ancien contexte à mesure que les sessions s’allongeaient. Pour les développeurs et les acheteurs d’IA, cela transforme une histoire de benchmark en histoire de déploiement : la manière dont un modèle est encapsulé, prompté et autorisé à gérer sa mémoire peut modifier de façon matérielle ce qu’il peut faire.

Ce qu’OpenAI a changé dans la configuration d’ARC-AGI-3

Selon OpenAI, l’entreprise a d’abord observé des résultats étonnamment faibles de GPT-5.6 Sol sur ARC-AGI-3. Le modèle a obtenu 7,8 % dans un cadrage antérieur évoqué par l’entreprise, et OpenAI a indiqué que GPT-5.5 était encore plus bas. Sur l’ensemble public utilisant le harness officiel, OpenAI rapporte désormais un score de 13,3 % pour GPT-5.6 Sol.

L’entreprise dit avoir cherché pourquoi un modèle ayant montré de fortes performances dans d’autres tâches de type jeu semblait inefficace ici. Sa conclusion a été que le harness ARC-AGI-3 par défaut ne conservait pas le raisonnement privé du modèle d’un tour à l’autre et utilisait un schéma de troncature glissant qui supprimait progressivement les interactions anciennes du champ de vision.

L’implémentation alternative d’OpenAI a utilisé l’Responses API d’une manière qui, selon elle, reflète la façon dont les modèles sont déployés dans ChatGPT et Codex. Le premier réglage, retained reasoning, conserve le raisonnement privé précédent disponible à travers les appels d’outils et les tours lorsque l’ID de réponse précédent est transmis. Le second, compaction, résume et compresse l’historique au lieu de simplement supprimer l’ancien contexte lorsque les limites sont atteintes.

Avec ces deux changements activés, OpenAI dit que GPT-5.6 Sol a atteint 38,3 % sur l’ensemble public d’ARC-AGI-3. L’entreprise affirme aussi que l’usage de tokens de sortie a chuté d’un facteur 6, ce qu’elle attribue au fait que le modèle passait moins de temps à redériver l’état du jeu à chaque coup.

Pourquoi ARC-AGI-3 a mis en évidence un problème plus large des benchmarks

ARC-AGI-3 est censé mesurer le raisonnement adaptatif dans des environnements inconnus. Les modèles reçoivent des représentations textuelles d’images du jeu et des informations de niveau, puis doivent inférer des règles par essais et erreurs. OpenAI note que les responsables du benchmark ont volontairement choisi un harness générique, afin de rendre les faiblesses des modèles plus visibles et les comparaisons entre systèmes plus équitables.

Cet objectif de conception crée une tension devenue courante dans l’évaluation de l’IA. Un harness générique peut standardiser les tests, mais il peut aussi diverger de la façon dont les principaux fournisseurs de modèles entraînent et servent réellement leurs systèmes. L’argument d’OpenAI est qu’ARC-AGI-3 testait en réalité non seulement le modèle, mais un schéma d’interaction contraint par la mémoire, différent de l’usage en production dans ChatGPT et Codex.

Ce n’est pas une distinction triviale. Beaucoup d’agents d’IA actuels dépendent d’un état persistant, d’une planification à long terme et de la gestion du contexte pour fonctionner de manière fiable. Si un benchmark retire ces capacités à tous les participants, il peut améliorer la comparabilité. Mais si une famille de modèles est explicitement entraînée à utiliser retained reasoning et un contexte résumé, le benchmark peut sous-estimer la manière dont ce système se comporte dans de vrais outils.

En même temps, le billet d’OpenAI souligne aussi le risque inverse : les améliorations de benchmark obtenues grâce à des choix de harness peuvent brouiller la frontière entre mesurer le modèle et mesurer la pile logicielle environnante. Pour les entreprises qui comparent des modèles, cela signifie que les chiffres du classement peuvent être moins éloquents qu’attendu si les conditions d’évaluation ne correspondent pas au déploiement visé.

Preuves, réserves et ce qui est rapporté par le fournisseur

Les affirmations les plus fortes dans cette histoire sont rapportées par le fournisseur. OpenAI est la source principale de l’augmentation du score de 13,3 % à 38,3 %, de la réduction d’un facteur 6 des tokens de sortie, et de l’explication selon laquelle retained reasoning et compaction ont causé le gain.

OpenAI indique également que les scores ARC-AGI-3 sont mesurés à l’aide du Relative Human Action Efficiency, ou RHAE, et cite des journaux de jeu officiels pour estimer que l’utilisateur humain moyen a obtenu 48 %. Cette estimation humaine est présentée par OpenAI comme une estimation et non comme un nouveau résultat de benchmark.

L’entreprise soutient en outre qu’avec son harness, GPT-5.6 Sol résout les six niveaux d’un jeu montré sur le classement, tandis qu’« aucun modèle frontier » ne résout un niveau au-delà du premier dans le cadrage par défaut du leaderboard. Comme l’article est l’analyse d’OpenAI elle-même du benchmark et du harness, les lecteurs devraient considérer ces comparaisons comme des affirmations du fournisseur sauf reproduction indépendante.

Il existe d’autres limites. L’article ne fournit pas de réplication externe, ni de re-notation neutre dans plusieurs laboratoires, ni de comparaison directe montrant si des changements similaires de préservation de la mémoire relèveraient aussi des modèles rivaux dans des proportions comparables. Il ne tranche pas non plus la question normative de ce qu’ARC-AGI-3 devrait mesurer : le comportement brut du modèle dans une interface générique contrainte, ou les performances dans une pile d’agents optimisée par le fournisseur.

Malgré ces réserves, le point de fond reste crédible et de plus en plus important. Les réglages d’API, la conservation du contexte, la politique de troncature et l’orchestration des outils peuvent chacun modifier de manière mesurable le comportement des agents. OpenAI est surtout inhabituel ici parce qu’il a quantifié l’effet dans une note publique de benchmark.

Ce que cela signifie pour les développeurs d’IA et les équipes d’entreprise

Pour les équipes produit qui construisent des agents d’IA, la leçon pratique est que l’architecture mémoire n’est plus un simple détail d’implémentation de back-office. Si un système perd à répétition ses plans, observations ou hypothèses antérieures, les performances peuvent s’effondrer sur des tâches en plusieurs étapes, même si le modèle de base est puissant. Le texte d’OpenAI suggère que retained reasoning est particulièrement important lorsque les actions se déroulent sur de longues séquences et que le modèle doit apprendre des essais précédents.

Pour les équipes utilisant la Responses API, OpenAI avance en substance un argument produit : l’entreprise dit que ces réglages ne sont pas des ajustements exotiques, mais une partie du mode de fonctionnement normal derrière ChatGPT et Codex. Si c’est vrai, les développeurs qui benchmarkent des modèles dans des boucles simplifiées testent peut-être une configuration que le fournisseur ne considère pas comme représentative.

L’affirmation sur l’efficacité des tokens peut compter autant que le gain de score. Une réduction d’un facteur 6 des tokens de sortie, si elle était reproductible dans d’autres charges de travail d’agents, aurait un impact à la fois sur la latence et sur le coût. Dans les déploiements d’IA d’entreprise, les workflows longs échouent souvent non seulement à cause de la qualité du raisonnement, mais aussi parce qu’ils deviennent lents, coûteux ou fragiles à mesure que le contexte grandit. Dans la lecture d’OpenAI, compaction améliore à la fois la continuité et l’efficacité en évitant la perte brutale du troncage glissant.

L’histoire a aussi des implications pour la pratique de l’évaluation. Les acheteurs qui comparent des systèmes pour un usage en IA d’entreprise devraient demander aux fournisseurs non seulement quel modèle a été testé, mais aussi quel harness, quels réglages mémoire, quel protocole d’outils et quelle politique de contexte ont été utilisés. Les benchmarks qui ne spécifient pas clairement ces couches peuvent être moins transposables aux vraies décisions d’achat qu’ils n’en ont l’air.

Concurrence et politique des benchmarks derrière le billet

Le billet d’OpenAI arrive alors que la pression s’intensifie sur les laboratoires de modèles frontier pour expliquer non seulement leurs scores, mais aussi pourquoi ils obtiennent ces scores. Les benchmarks façonnent de plus en plus les récits autour du leadership des modèles, mais beaucoup de benchmarks d’agents dépendent de wrappers et de choix opérationnels extérieurs au modèle central.

En mettant en avant retained reasoning et compaction, OpenAI défend aussi une position plus large : la performance moderne de l’IA devrait être évaluée comme une propriété du système, et pas seulement comme une propriété des poids. Ce cadrage favorise les fournisseurs proposant des produits étroitement intégrés comme ChatGPT, Codex et des piles de serving propriétaires, car ils peuvent soutenir que le client achète un comportement de bout en bout, et non un modèle de base abstrait.

Cette position ne sera pas universellement acceptée. Certains chercheurs préfèrent des benchmarks austères précisément parce qu’ils exposent des faiblesses que l’ajustement produit peut masquer. D’autres soutiendront que si les utilisateurs déploient des modèles avec mémoire, résumés et boucles d’outils, les évaluations devraient refléter cette réalité. Le débat ARC-AGI-3 sera probablement l’un des plusieurs points de friction où ces philosophies s’entrechoqueront.

Ce qu’il faut surveiller ensuite

Le signal de suivi le plus important est une réplication indépendante. Si des tiers reproduisent les gains d’OpenAI sur ARC-AGI-3 avec les mêmes réglages de Responses API, le résultat ressemblera moins à un billet ponctuel de fournisseur et davantage à une leçon de méthodologie de benchmark.

Un deuxième signal est de savoir si les responsables d’ARC-AGI-3 réagissent en ajoutant des parcours de harness alternatifs, comme une base générique et un parcours d’agent optimisé pour la production. Cela préserverait des comparaisons équitables tout en reconnaissant que les systèmes réels dépendent de la gestion de la mémoire.

Troisièmement, il faut surveiller si OpenAI étend le même argument à d’autres évaluations. Si retained reasoning et compaction améliorent matériellement d’autres tâches à long horizon, les implications pour les agents d’IA, les produits d’assistant de codage et l’automatisation du travail pourraient être plus larges que ce seul benchmark.

Enfin, les équipes d’entreprise devraient surveiller une documentation plus claire des fournisseurs sur la gestion du contexte. Si les fournisseurs de modèles commencent à publier des recettes de benchmark standard pour ChatGPT, Codex, GPT-5.6 Sol et des systèmes apparentés, il pourrait devenir plus facile de comparer le comportement de l’IA d’entreprise d’une manière qui corresponde au déploiement.

Point de vue de Creati.ai

Le billet d’OpenAI est intéressé, mais il met en lumière un vrai problème de l’évaluation de l’IA : les scores de benchmark sont souvent traités comme s’ils provenaient du modèle seul alors qu’ils reflètent en réalité une série de choix de conception. Pour quiconque construit des agents d’IA, la leçon est simple. La conservation de la mémoire, la politique de résumé et la structure de boucle d’outils peuvent être des décisions produit de premier ordre, et non un simple ornement d’implémentation.

La leçon la plus stratégique concerne les acheteurs d’IA d’entreprise. N’achetez pas sur la base d’un score de modèle en gros titre sans comprendre le harness qui se cache derrière. Si OpenAI a raison, un wrapper mal adapté peut faire paraître faible un modèle pourtant capable, et un wrapper bien adapté peut débloquer d’importants gains de fiabilité et de coût. Cela déplace l’avantage concurrentiel vers les fournisseurs et les équipes capables d’aligner le comportement du modèle, l’infrastructure de serving et la conception de l’application en un système cohérent.

Vedettes

OpenAI affirme que deux réglages de l’API Responses ont nettement amélioré GPT-5.6 Sol sur ARC-AGI-3

OpenAI affirme que le raisonnement conservé et la compaction ont presque triplé le score de GPT-5.6 Sol sur ARC-AGI-3, soulignant à quel point la conception du harness façonne les benchmarks d’IA.