
OpenAI 發布了一則備受關注的基準測試說明,主張模型在困難的代理測試上的表現,可能同樣取決於 harness 設計與模型本身。在一篇關於 ARC-AGI-3 的文章中,該公司表示,在 Responses API 中啟用兩個設定——retained reasoning 與 compaction——後,GPT-5.6 Sol 在公開任務集上的分數從 13.3% 提升到 38.3%,同時輸出 token 數量約減少了 6 倍。
這個結果的意義不只在於一個解謎型基準測試。ARC-AGI-3 的設計目標,是測試 AI 代理能否透過互動,而不是明確指令,來學習陌生的 2D 遊戲。OpenAI 的說法是,該基準的預設設定因為在行動之間丟棄內部推理、並隨著對話變長而裁剪舊上下文,因此壓抑了模型表現。對 AI 開發者與採購者來說,這把一個基準故事變成了部署故事:模型如何被包裝、如何被提示、以及如何被允許管理記憶,會實質改變它能做什麼。
根據 OpenAI 的說法,公司最初在 ARC-AGI-3 上看到 GPT-5.6 Sol 意外疲弱的結果。公司先前討論的某種框架下,該模型只拿到 7.8%,而 OpenAI 表示 GPT-5.5 甚至更低。如今在使用官方 harness 的公開測試集上,OpenAI 回報 GPT-5.6 Sol 為 13.3%。
公司表示,他們調查了為何一個在其他類遊戲任務上表現強勁的模型,在這裡卻顯得無效。結論是,預設的 ARC-AGI-3 harness 並沒有在輪次之間保留模型的私有推理,且使用了滾動式截斷方案,逐漸將較早的互動從視野中移除。
OpenAI 的替代實作使用了 Responses API,其方式據稱與 ChatGPT 和 Codex 中模型的部署方式相似。第一個設定 retained reasoning,會在傳遞前一個回應 ID 時,讓之前的私有推理在工具呼叫與輪次之間持續可用。第二個設定 compaction,則是摘要並壓縮歷史,而不是在達到上限時直接丟棄舊上下文。
在啟用這兩項變更後,OpenAI 表示 GPT-5.6 Sol 在 ARC-AGI-3 公開測試集上達到 38.3%。公司也指出,輸出 token 使用量下降了 6 倍,並將其歸因於模型在每一步中花較少時間重新推導遊戲狀態。
ARC-AGI-3 的目的是衡量在陌生環境中的適應性推理。模型會收到遊戲畫面與關卡資訊的文字表示,接著必須透過試錯推斷規則。OpenAI 指出,基準維護者是刻意選擇一般化的 harness,目的是讓模型弱點更容易被看見,也讓系統之間的比較更公平。
這個設計目標帶來了如今在 AI 評估中常見的張力。一般化的 harness 可以標準化測試,但也可能與領先模型供應商實際訓練與提供系統的方式有所偏離。OpenAI 的說法是,ARC-AGI-3 實際上測的不只是模型,還包括一種受記憶限制的互動模式,而這與 ChatGPT 和 Codex 的生產環境不同。
這不是小差異。許多現今的 AI 代理 依賴持久狀態、長期規劃與上下文管理,才能穩定運作。如果基準測試對所有參與者都移除這些能力,或許能提高可比性。但如果某個模型家族被明確訓練成使用 retained reasoning 與摘要過的上下文,該基準就可能低估這套系統在真實工具中的表現。
同時,OpenAI 的文章也強調了相反的風險:透過 harness 選擇所獲得的基準提升,可能模糊了「測量模型」與「測量周邊軟體堆疊」之間的界線。對於比較模型的企業而言,這意味著如果評估條件不符合預期部署,排行榜數字可能沒有想像中那麼有說服力。
這則故事中最強的主張,都是來自供應商報告。OpenAI 是 13.3% 到 38.3% 分數提升、輸出 token 減少 6 倍,以及 retained reasoning 與 compaction 造成這項增幅的主要來源。
OpenAI 也表示,ARC-AGI-3 的分數是以 Relative Human Action Efficiency,簡稱 RHAE,來衡量,並引用官方遊戲記錄估計平均人類測試者得分為 48%。這項人類估計是以估算的方式呈現,而不是新的基準測試結果。
公司還主張,在其 harness 下,GPT-5.6 Sol 能解出排行榜中展示的遊戲全部六個關卡;而在預設排行榜框架下,「沒有任何 frontier 模型」能解出第一關以外的任何關卡。由於這篇文章是 OpenAI 對該基準與 harness 的自我分析,讀者應將這些比較視為供應商主張,除非有獨立重現。
還有其他限制。文章沒有提供外部複現、跨多個實驗室的中立重評,也沒有直接對照顯示類似的記憶保留變更是否也能讓競爭模型以相近幅度提升。它也沒有解決 ARC-AGI-3 應該衡量什麼的規範性問題:是在受限的一般介面中量測原始模型行為,還是量測供應商最佳化的代理堆疊表現。
不過,即使有這些保留,核心觀點仍然可信,而且愈來愈重要。API 設定、上下文保留、截斷策略與工具協調,都能可測地改變代理行為。OpenAI 在這裡之所以特別,是因為它在公開的基準說明中量化了這個效果。
對於建立 AI 代理的產品團隊來說,實務上的教訓是:記憶架構不再只是後端實作細節。如果系統反覆遺失計畫、觀察或先前假設,即使基礎模型很強,多步驟任務的表現也可能崩潰。OpenAI 的說明顯示,當行動會跨越長序列展開,且模型必須從早期嘗試中學習時,retained reasoning 特別重要。
對使用 Responses API 的團隊來說,OpenAI 幾乎是在提出一個產品論點:這些設定並不是奇特調整,而是 ChatGPT 與 Codex 背後正常運作模式的一部分。如果屬實,那麼在簡化迴圈中做模型基準測試的開發者,可能測到的是供應商不認為具代表性的配置。
token 效率的主張,或許和分數提升一樣重要。如果 6 倍的輸出 token 降幅能在其他代理工作負載中重現,將同時影響延遲與成本。在 企業 AI 部署中,長時間工作流程常常失敗,不只是因為推理品質,也因為隨著上下文成長而變得緩慢、昂貴或脆弱。依 OpenAI 的說法,compaction 透過避免滾動截斷那種粗暴的丟失,改善了連續性與效率。
這則故事對評估實務也有影響。比較企業 AI 系統的買家,不僅應該詢問供應商測試的是哪個模型,還要問清楚使用了哪個 harness、哪些記憶設定、哪種工具協定與哪種上下文政策。若 benchmark 沒有清楚說明這些層次,它們可能比看起來更不適合直接用於真實採購決策。
OpenAI 的貼文出現在前沿模型實驗室壓力日增之際,外界不只要求他們說明模型得分如何,更要說明為什麼會是那個分數。基準測試愈來愈塑造模型領先敘事,但許多代理基準仰賴核心模型以外的包裝器與操作選擇。
透過強調 retained reasoning 與 compaction,OpenAI 也在提出更廣泛的立場:現代 AI 表現應該被視為系統屬性,而不只是權重屬性。這種框架有利於擁有高度整合產品的供應商,例如 ChatGPT、Codex 與專有 serving 堆疊,因為他們可以主張客戶買到的是端到端行為,而不是抽象的基礎模型。
這個立場不會被普遍接受。有些研究者偏好嚴格簡樸的基準,正因為它們能揭露產品調校可能掩蓋的弱點。另一些人則會主張,如果使用者部署的是帶有記憶、摘要與工具迴圈的模型,評估就應該反映那個現實。ARC-AGI-3 的爭論很可能只是幾個這類哲學碰撞點之一。
最重要的後續訊號,是獨立複現。如果第三方用相同的 Responses API 設定重現 OpenAI 在 ARC-AGI-3 上的提升,這個發現就會更像一堂基準方法論的課,而不只是單一供應商部落格。
第二個訊號,是 ARC-AGI-3 維護者是否會回應並加入替代 harness 路徑,例如一般基準線與生產最佳化的代理路徑。這樣可以保留蘋果對蘋果的比較,同時承認真實世界系統確實依賴記憶管理。
第三,請留意 OpenAI 是否把同樣的論點延伸到其他評估。如果 retained reasoning 與 compaction 也能實質改善其他長時程任務,那麼對 AI 代理、程式碼助理產品與工作流程自動化的影響,可能比這單一基準更廣。
最後,企業團隊應留意供應商是否提供更清楚的上下文處理文件。如果模型供應商開始針對 ChatGPT、Codex、GPT-5.6 Sol 及相關系統發布標準基準配方,就可能更容易以貼近部署的方式比較企業 AI 行為。
OpenAI 的文章帶有自利色彩,但它點出了 AI 評估中的真實問題:基準分數常被視為只來自模型本身,然而它們其實反映的是一整套設計選擇。對任何在打造 AI 代理的人來說,結論都很直接。記憶保留、摘要政策與工具迴圈結構,都可能是第一級的產品決策,而不是單純的實作點綴。
更具策略性的結論則是給企業 AI 的買家。不要只看一個標題式的模型分數就下採購決定,必須理解其背後的 harness。若 OpenAI 的說法正確,不合適的包裝器會讓能力很強的模型顯得弱,而合適的包裝器則能在可靠性與成本上同時釋放巨大收益。這會把競爭優勢轉向那些能將模型行為、服務基礎設施與應用設計整合成一致系統的供應商與團隊。
OpenAI 指出,保留推理與壓縮讓 GPT-5.6 Sol 的 ARC-AGI-3 分數幾乎提升 3 倍,凸顯 harness 設計如何塑造 AI 基準測試。