OpenAI 表示,Responses API 的兩個設定大幅改善了 GPT-5.6 Sol 在 ARC-AGI-3 的表現
OpenAI 指出,保留推理與壓縮讓 GPT-5.6 Sol 的 ARC-AGI-3 分數幾乎提升 3 倍,凸顯 harness 設計如何塑造 AI 基準測試。
OpenAI 指出,保留推理與壓縮讓 GPT-5.6 Sol 的 ARC-AGI-3 分數幾乎提升 3 倍,凸顯 harness 設計如何塑造 AI 基準測試。
NVIDIA 表示,經 LangChain 調校的 Nemotron 3 Ultra 在開放模型代理基準中取得領先表現,凸顯企業 AI 可採用更便宜的開放堆疊。
Arena這家來自柏克萊的初創公司,背後是目前最受關注的群眾外包AI模型排行榜之一。該公司告訴TechCrunch,在推出商業評估產品約八個月後,其年化營收已達1億美元。這一里程碑顯示,AI基準測試與訓練後回饋正逐漸成為一門獨立生意,而不只是研究活動;不過公司表示,其營收是按使用量計費,而非簽約式經常性ARR。
AI 效能 的最新新聞與分析