
OpenAI опубликовала внимательно отслеживаемую заметку о бенчмарке, в которой утверждает, что производительность модели в сложных агентных тестах может зависеть от конструкции harness не меньше, чем от самой модели. В посте про ARC-AGI-3 компания заявила, что включение двух параметров в Responses API — retained reasoning и compaction — подняло результат GPT-5.6 Sol на публичном наборе задач с 13,3 % до 38,3 %, одновременно сократив число выходных токенов примерно в шесть раз.
Этот результат важен не только для одного пазл-бенчмарка. ARC-AGI-3 создан для проверки того, могут ли AI-агенты учиться незнакомым 2D-играм через взаимодействие, а не через явные инструкции. Утверждение OpenAI состоит в том, что стандартная настройка бенчмарка подавляла производительность, выбрасывая внутренние рассуждения между действиями и обрезая старый контекст по мере роста сессий. Для разработчиков и покупателей ИИ это превращает историю о бенчмарке в историю о внедрении: то, как модель упакована, промптится и получает управление памятью, может существенно менять её возможности.
По данным OpenAI, первоначально компания получила неожиданно слабые результаты GPT-5.6 Sol на ARC-AGI-3. В одном более раннем варианте, который обсуждала компания, модель набрала 7,8 %, а OpenAI сказала, что GPT-5.5 был ещё ниже. На публичном наборе с использованием официального harness OpenAI теперь сообщает для GPT-5.6 Sol 13,3 %.
Компания говорит, что расследовала, почему модель, показавшая сильные результаты в других игровых задачах, здесь выглядела неэффективной. Её вывод заключался в том, что стандартный harness ARC-AGI-3 не сохранял приватные рассуждения модели между ходами и использовал схему скользящей усечки, постепенно удалявшую старые взаимодействия из поля зрения.
Альтернативная реализация OpenAI использовала Responses API таким образом, который, как утверждает компания, повторяет способ развертывания моделей в ChatGPT и Codex. Первый параметр, retained reasoning, сохраняет доступ к предыдущим приватным рассуждениям между вызовами инструментов и ходами, если передаётся ID предыдущего ответа. Второй, compaction, суммирует и сжимает историю вместо того, чтобы просто отбрасывать старый контекст при достижении лимитов.
При включении этих двух изменений OpenAI говорит, что GPT-5.6 Sol достиг 38,3 % на публичном наборе ARC-AGI-3. Компания также утверждает, что использование выходных токенов сократилось в 6 раз, что она связывает с тем, что модель меньше времени тратила на повторный вывод состояния игры на каждом ходе.
ARC-AGI-3 предназначен для измерения адаптивного рассуждения в незнакомых средах. Модели получают текстовые представления кадров игры и информации об уровне, а затем должны выводить правила методом проб и ошибок. OpenAI отмечает, что разработчики бенчмарка намеренно выбрали общий harness, стремясь сделать слабые стороны моделей более заметными и сравнения между системами — более справедливыми.
Эта цель создаёт напряжение, которое уже стало обычным в оценке ИИ. Общий harness может стандартизировать тестирование, но он также может расходиться с тем, как ведущие поставщики моделей реально обучают и обслуживают свои системы. Аргумент OpenAI состоит в том, что ARC-AGI-3 по сути тестировал не только модель, но и шаблон взаимодействия с ограниченной памятью, который отличается от продакшн-использования в ChatGPT и Codex.
Это не тривиальное различие. Многие современные AI-агенты зависят от постоянного состояния, долгосрочного планирования и управления контекстом, чтобы работать надёжно. Если бенчмарк убирает эти возможности у всех участников, это может улучшить сопоставимость. Но если целое семейство моделей специально обучено использовать retained reasoning и сжатый контекст, бенчмарк может недооценивать, как эта система ведёт себя в реальных инструментах.
В то же время пост OpenAI подчёркивает и противоположный риск: улучшения бенчмарков, достигнутые за счёт выбора harness, могут размывать границу между измерением модели и измерением окружающего программного стека. Для компаний, сравнивающих модели, это означает, что цифры в лидерборде могут говорить меньше, чем ожидается, если условия оценки не совпадают с предполагаемым развертыванием.
Самые сильные заявления в этой истории сообщены поставщиком. OpenAI является основным источником роста результата с 13,3 % до 38,3 %, шестикратного снижения выходных токенов и объяснения, что именно retained reasoning и compaction дали прирост.
OpenAI также говорит, что оценки ARC-AGI-3 измеряются с помощью Relative Human Action Efficiency, или RHAE, и ссылается на официальные логи игрового процесса, чтобы оценить, что средний человек-тестер набрал 48 %. Эта оценка человеческого результата представлена OpenAI как оценка, а не как свежий результат бенчмарка.
Компания дополнительно утверждает, что с её harness GPT-5.6 Sol решает все шесть уровней в игре, показанной на лидерборде, тогда как «ни одна frontier-модель» не решает ни одного уровня дальше первого в стандартном лидерборд-фрейминге. Поскольку статья является собственным анализом OpenAI бенчмарка и harness, читателям следует воспринимать эти сравнительные заявления как утверждения поставщика, если они не воспроизведены независимо.
Есть и другие ограничения. В статье нет внешней репликации, нейтрального пересчёта в нескольких лабораториях или очного сравнения, показывающего, дали бы похожие изменения с сохранением памяти сопоставимый прирост и моделям конкурентов. Она также не решает нормативный вопрос о том, что должен измерять ARC-AGI-3: сырое поведение модели в ограниченном общем интерфейсе или производительность в оптимизированном поставщиком агентном стеке.
Тем не менее, даже с этими оговорками, базовая мысль выглядит правдоподобной и всё более важной. Параметры API, сохранение контекста, политика усечки и оркестрация инструментов — всё это может измеримо менять поведение агентов. OpenAI здесь необычна главным образом тем, что количественно показала эффект в публичной заметке о бенчмарке.
Для продуктовых команд, создающих AI-агентов, практический урок состоит в том, что архитектура памяти больше не является второстепенной деталью реализации. Если система постоянно теряет планы, наблюдения или прошлые гипотезы, производительность может рушиться на многошаговых задачах даже при сильной базовой модели. Текст OpenAI предполагает, что retained reasoning особенно важен, когда действия разворачиваются в длинных последовательностях и модель должна учиться на предыдущих попытках.
Для команд, использующих Responses API, OpenAI фактически выдвигает продуктовый аргумент: компания говорит, что эти параметры — не экзотические настройки, а часть нормального режима работы, лежащего в основе ChatGPT и Codex. Если это так, то разработчики, оценивающие модели в упрощённых циклах, могут тестировать конфигурацию, которую поставщик не считает репрезентативной.
Утверждение об эффективности токенов может оказаться не менее важным, чем рост оценки. Шестикратное сокращение выходных токенов, если оно воспроизводимо в других агентных нагрузках, повлияет и на задержку, и на стоимость. В развёртываниях корпоративного ИИ долгие рабочие процессы часто ломаются не только из-за качества рассуждений, но и потому, что становятся медленными, дорогими или хрупкими по мере роста контекста. В изложении OpenAI compaction улучшает и непрерывность, и эффективность, избегая грубой потери данных, характерной для скользящей усечки.
Эта история также влияет на практику оценки. Покупателям, сравнивающим системы для корпоративного ИИ, следует спрашивать поставщиков не только о том, какая модель тестировалась, но и о том, какой harness, какие настройки памяти, какой протокол инструментов и какая политика контекста использовались. Бенчмарки, которые не указывают эти слои ясно, могут быть менее переносимыми в реальные решения о закупке, чем кажется.
Пост OpenAI выходит на фоне растущего давления на лаборатории frontier-моделей: им нужно объяснять не только, как модели набирают баллы, но и почему они набирают их именно так. Бенчмарки всё сильнее формируют нарратив о лидерстве моделей, однако многие агентные бенчмарки зависят от обвязок и операционных решений вне ядра модели.
Подчёркивая retained reasoning и compaction, OpenAI также занимает более широкую позицию: современную производительность ИИ следует оценивать как свойство системы, а не только как свойство весов. Такой взгляд выгоден поставщикам с тесно интегрированными продуктами, такими как ChatGPT, Codex и проприетарные serving-стэки, поскольку они могут утверждать, что клиент покупает поведение end-to-end, а не абстрактную базовую модель.
Эта позиция не будет принята повсеместно. Некоторые исследователи предпочитают аскетичные бенчмарки именно потому, что они выявляют слабости, которые может скрыть продуктовая донастройка. Другие будут утверждать, что если пользователи разворачивают модели с памятью, сводками и циклами инструментов, то оценки должны отражать эту реальность. Спор вокруг ARC-AGI-3, вероятно, станет одним из нескольких очагов, где эти философии столкнутся.
Самый важный сигнал — независимая репликация. Если третьи стороны воспроизведут прирост OpenAI на ARC-AGI-3 с теми же настройками Responses API, это будет выглядеть уже не как единичный пост поставщика, а как урок по методологии бенчмарков.
Второй сигнал — ответят ли сопровождающие ARC-AGI-3 добавлением альтернативных harness-треков, например общего базового варианта и продакшн-оптимизированного агентного трека. Это сохранило бы сопоставимость «яблоко к яблоку», одновременно признавая, что реальные системы зависят от управления памятью.
В-третьих, стоит посмотреть, распространит ли OpenAI этот аргумент на другие оценки. Если retained reasoning и compaction существенно улучшат и другие долгосрочные задачи, последствия для AI-агентов, продуктов помощников для кодинга и автоматизации работы могут оказаться шире, чем один этот бенчмарк.
Наконец, корпоративным командам следует следить за более чёткой документацией поставщиков по работе с контекстом. Если поставщики моделей начнут публиковать стандартные рецепты бенчмарков для ChatGPT, Codex, GPT-5.6 Sol и связанных систем, сравнивать поведение корпоративного ИИ в соответствии с реальным развертыванием станет проще.
Пост OpenAI не лишён собственной выгоды, но он высвечивает реальную проблему в оценке ИИ: баллы бенчмарков часто воспринимаются так, будто они принадлежат только модели, хотя на самом деле отражают набор проектных решений. Для всех, кто создаёт AI-агентов, вывод прост. Сохранение памяти, политика суммаризации и структура цикла инструментов могут быть первоочередными продуктовыми решениями, а не декоративной частью реализации.
Более стратегический вывод относится к покупателям корпоративного ИИ. Не закупайте решение, ориентируясь на заголовочный результат модели, не понимая, какой harness стоит за ним. Если OpenAI права, плохо подобранная обвязка может заставить способную модель выглядеть слабой, а хорошо подобранная — раскрыть крупный прирост и в надёжности, и в стоимости. Это смещает конкурентное преимущество к тем поставщикам и командам, которые могут согласовать поведение модели, serving-инфраструктуру и дизайн приложения в единую систему.
OpenAI утверждает, что retained reasoning и compaction почти утроили результат GPT-5.6 Sol на ARC-AGI-3, показывая, как конструкция harness влияет на AI-бенчмарки.