OpenAI, Responses API의 두 설정이 GPT-5.6 Sol의 ARC-AGI-3 성능을 크게 개선했다고 밝히다
OpenAI는 retained reasoning과 compaction이 GPT-5.6 Sol의 ARC-AGI-3 점수를 거의 3배 끌어올렸다고 말하며, 하네스 설계가 AI 벤치마크를 어떻게 좌우하는지 강조했다.
OpenAI는 retained reasoning과 compaction이 GPT-5.6 Sol의 ARC-AGI-3 점수를 거의 3배 끌어올렸다고 말하며, 하네스 설계가 AI 벤치마크를 어떻게 좌우하는지 강조했다.
NVIDIA는 LangChain으로 튜닝한 Nemotron 3 Ultra가 오픈 모델 에이전트 벤치마크에서 최고 수준의 결과를 냈다고 밝히며, 기업용 AI를 위한 더 저렴한 오픈 스택의 가능성을 강조했습니다.
가장 널리 주목받는 크라우드소싱 AI 모델 리더보드 중 하나를 만든 버클리 출신 스타트업 Arena는 상용 평가 제품을 출시한 지 약 8개월 만에 연간 환산 매출이 1억 달러에 도달했다고 TechCrunch에 밝혔다. 이번 이정표는 AI 벤치마킹과 사후 학습 피드백이 단순한 연구 활동을 넘어 그 자체로 하나의 사업이 되고 있음을 시사하지만, 회사는 매출이 계약 기반의 반복 ARR이 아니라 사용량 기반이라고 설명했다.
AI 성능에 대한 최신 뉴스 및 분석