
OpenAI는 차세대 주요 모델의 내부 버전인 Astra가 수학과 이론 컴퓨터 과학의 10개 오랜 문제에서 새로운 결과를 만들어냈다고 말한다. 회사는 이 작업이 기하학, 부호 이론, 군론, 복잡도 이론, 암호학, 조합론 전반에 걸쳐 있으며, 각 논증은 이후 Lean으로 형식화됐다고 밝혔다.
이번 발표의 의미는 AI가 유명한 광범위한 문제들을 독립적으로 해결했다는 주장이라기보다, 언어 모델이 전문가가 검토하고 검증할 수 있는 연구 수준의 수학적 논증을 생성할 수 있는지 시험하는 데 있다. OpenAI는 해당 문제들에서 핵심 결과에 대해 최소 10년, 많은 경우 그보다 훨씬 오랫동안 진전이 없었다고 말했다. 회사는 또한 이 작업이 관련 수학 공동체의 참여와 검증 대상임을 인정했다.
OpenAI의 목록에는 고차원 구체 포장에 대한 새로운 상한이 포함되어 있으며, Cohn–Elkies 임계값까지 도달한다. 또한 특정 최소 거리에서 이진 및 구면 코드의 크기에 대한 개선된 상한도 제시했다. 이는 고차원 기하학과 부호 이론의 핵심 질문들이다.
군론과 연산자 대수학에서 회사는 비-sofic 군이 존재함을 보이는 구성 결과를 보고하며 Connes의 강직성 추측을 반증했다고 말한다. 그 추측은 특정 군들이 자기 자신만의 von Neumann 대수로 유일하게 결정되는지에 관한 것이다.
결과에는 permanent를 계산하는 산술 회로와 공식에 대한 새로운 하한도 포함된다. OpenAI는 산술 공식 하한을 n^4/log n 차수로 제시한다. 복잡도 이론에서는 일반적인 두 플레이어 양자 게임에 대한 지수적 병렬 반복 정리를 보고했으며, 이는 고전적 설정에서 더 잘 확립된 원리를 확장한 것이다.
그 밖의 보고된 결과는 최단 벡터 문제, 즉 양자내성 암호와 연결된 격자 문제; 내부 격자점이 하나인 볼록체에 대한 Ehrhart의 부피 추측; 다색 삼각형 Ramsey 수; 그리고 극값 그래프 이론의 콤팩트성 및 퇴화 문제를 다룬다. OpenAI는 후자의 결과가 Erdős 문제 146과 180을 해결했고, Ramsey 결과는 Erdős 문제 183을 해결했다고 말한다.
이번 발표는 앞서 OpenAI가 Erdős 단위거리 추측에 대한 AI 생성 반증을 공개한 데 이어 나온 것이다. 회사는 그 결과가 덧셈 조합론, 계산 기하학, 복잡도와 관련된 문제들에 대해 외부 수학자들의 후속 연구를 촉발하는 데 도움이 됐다고 말한다.
OpenAI에 따르면, 10개 결과는 공개 모델이 아니라 Astra의 내부 버전에 의해 생성됐다. 회사는 해답을 찾는 데 필요한 총 토큰 사용량이 Sol API 요금 기준 약 2,000달러였을 것이라고 말한다. 이는 공급업체 추정치일 뿐, 연구 재현 비용에 대한 독립적 감사 측정치는 아니다.
OpenAI는 이후 인간이 같은 모델을 사용해 논증을 원고 형태로 정리했다고 밝혔다. 그 후 모델은 각 논증을 Lean 인증서로 형식화했다. OpenAI는 또한 각 해법에 대한 시스템의 사고 과정을 모델이 생성한 서술로 공개하고 있지만, 그러한 서술은 모델의 내부 계산을 완전하거나 충실하게 기록한 것으로 자동 간주되어서는 안 된다.
Lean 형식화가 중요한 이유는 증명의 기계 검증 가능한 표현을 제공하기 때문이다. 그러나 그것만으로는 기초 주장들이 수학적으로 중요하다거나, 모든 세부에서 새롭다거나, 더 넓은 연구 맥락에서 올바르게 해석된다는 것을 입증하지는 않는다. 그런 질문들은 여전히 전문가의 검토와 기존 문헌과의 비교를 필요로 한다.
주장에 대한 이용 가능한 증거는 OpenAI의 공식 발표에서 나온다. 별도의 통신사식 목록에는 같은 제목이 실려 있지만, 제공된 자료에는 독립 보도나 제3자 기사의 전체 본문이 포함되어 있지 않다. 따라서 모델의 성능, 비용, 연구 영향에 대한 가장 강한 주장은 OpenAI의 보고에 기반한다.
OpenAI는 준비된 원고와 형식화된 증명의 정확성에 대해서는 책임을 진다고 말하는 반면, 수학적 논증 자체는 시스템에 귀속시킨다. 이러한 구분은 AI 연구 발표에서 이례적으로 명시적이다. 이는 모델이 논증을 제안하고 인간이 이를 편집하며 형식 시스템이 결과의 일부를 검사할 때, 저자성과 공로를 어떻게 배분해야 하는지를 둘러싼 커지는 논쟁을 반영한다.
회사는 이번 발표를 동료 심사(peer review)를 대체하는 것으로 제시하지 않는다. 대신 수학자들이 결과를 맥락 속에 놓고 추가 연구를 통해 아이디어를 발전시키길 요청한다. 그 과정이 이루어지기 전까지 이번 발표는 잠재적으로 중요한 기계 생성 논증의 보고로 읽어야 하며, Astra가 전문가 수학 연구를 대체했다는 확정된 증거로 읽어서는 안 된다.
OpenAI는 또한 이 작업을 ChatGPT for Academic Researchers와 연결한다. 이 이니셔티브는 10만 명의 과학자와 수학자에게 자사의 최고 ChatGPT 모델을 무료로 제공하겠다고 밝힌 바 있다. 이 접근 프로그램은 Astra 결과와 별개이며, 발표는 보고된 진전이 공개 배포 도구로 재현될 수 있음을 보여주지는 않는다.
수학 연구자들에게 가장 실질적인 신호는 생성과 형식 검증의 결합이다. 그럴듯한 증명을 제안할 수는 있지만 Lean 같은 시스템으로 표현할 수 없는 모델은 대규모로 신뢰하기 어렵다. 형식화는 정당성을 확인하기 위한 더 좁은 경로를 만들어 주지만, 정의, 새로움, 중요성에 대한 인간의 판단 필요성을 없애지는 못한다.
AI 개발자들에게 이번 발표는 전통적인 질의응답 벤치마크가 아니라 공개 연구 문제에 기반한 평가 세트를 가리킨다. OpenAI는 개발 중 이러한 문제들로 모델을 평가해 왔다고 말한다. 이 접근법은 시스템이 다단계 추론을 지속하고, 유용한 중간 구조를 식별하며, 다른 도구가 검증할 수 있는 산출물을 만들 수 있는지를 시험한다.
경제성도 중요하다. OpenAI가 추정한 10개 결과에 대한 2,000달러의 추론 비용은 자금력이 있는 팀들에게 연구 수준 모델 사용이 가능할 수 있음을 시사하지만, 이 수치는 아직 일반화할 수 없다. 여기에는 전문가 검토, 원고 준비, 형식화 작업, 그리고 결과를 재현하거나 확장하는 데 필요한 인프라의 가치는 포함되지 않는다. 따라서 기업 구매자는 원시 모델-컴퓨트 비용과 신뢰할 수 있는 연구 워크플로우의 전체 비용을 구분해야 한다.
창업자와 제품팀에게 단기적 기회는 범용 자동 수학자보다 도구와 연결된 협소한 시스템일 가능성이 크다. 모델과 정리 증명기, 코드 실행, 문헌 검색, 전문가 검토를 결합한 워크플로우가 유창한 설명만으로 평가되는 시스템보다 더 신뢰할 수 있다.
첫 번째 신호는 10개 주장에 대한 외부 검증이며, 특히 보고된 Connes의 강직성 추측 반증, 비-sofic 군 구성, 양자 병렬 반복 결과가 중요하다. 출판, 독립적 형식 검증, 전문가들의 상세한 반응은 논증이 검토를 통과하는지와 실제로 얼마나 새로운지를 보여줄 것이다.
연구자들은 또한 Lean 인증서가 단지 세련된 원고를 동반하는 수준이 아니라, 완전하고 접근 가능하며 다른 이들이 사용할 수 있는지 지켜봐야 한다. OpenAI의 내부 Astra 시스템에 접근하지 못한 팀들의 재현은 작업의 실질적 가치를 더 강하게 시험할 것이다.
추가적인 질문은 실질적으로 더 낮은 비용으로 공개 모델에서도 유사한 결과가 나오는지 여부다. 그렇다면 그 능력이 하나의 공개되지 않은 시스템에 묶인 내부적 우위가 아니라 분야 전반으로 확산되고 있음을 의미한다.
OpenAI의 발표가 중요한 이유는 AI를 수학 연구 후보를 생성하는 도구로 제시하면서도, 그 주장에 따르는 한계를 드러내기 때문이다. 이 워크플로우에서 가장 신뢰할 수 있는 부분은 모델의 서술이나 목록의 폭이 아니라, 각 논증을 기계 검증 가능한 Lean 인증서로 바꾸고 책임 분담을 공개적으로 밝히려는 시도다.
다음 단계는 OpenAI 밖에서 결정될 것이다. 독립적인 수학자들이 결과를 검증하고, 단순화하며, 확장한다면 이번 발표는 연구 도구에서 의미 있는 전환점이 될 수 있다. 반대로 주장이 재현하거나 맥락에 배치하기 어렵다면, 모델 출력, 형식 검증, 인간의 수학적 판단이 같은 과정의 서로 다른 층으로 남아 있어야 하는 이유를 보여주는 사례가 될 것이다.
OpenAI는 Astra 모델이 오랜 수학 및 이론 컴퓨터 과학 문제에서 10개의 진전을 만들어냈으며, 검토를 위해 Lean 형식화가 이뤄졌다고 말한다.