AI News

OpenAI 表示,其下一代主模型 Astra 的內部版本,在數學與理論電腦科學的十個長期未解問題上產生了新的結果。公司稱,這些工作涵蓋幾何、編碼理論、群論、複雜度、密碼學與組合數學,而每個論證之後都以 Lean 進行了形式化。

這項宣布的意義,與其說是在主張 AI 已經獨立解決了一大批著名問題,不如說是在測試語言模型是否能生成研究等級、可供專家檢視與驗證的數學論證。OpenAI 表示,這些問題的主要結果至少十年沒有進展,在許多情況下更久。公司也承認,這些工作仍須接受相關數學社群的參與與審視。

十個問題,橫跨多個領域

OpenAI 的清單包含高維球體填充的新上界,已逼近 Cohn–Elkies 臨界值;也包括在特定最小距離下,二元與球面碼大小的改良上界。這些都是高維幾何與編碼理論中的核心問題。

在群論與算子代數中,公司報告了一項構造,顯示非 sofic 群確實存在,並稱已證明 Connes 剛性猜想不成立。該猜想關注某些群是否能由其 von Neumann 代數唯一決定。

這些結果還包括對計算 permanent 的算術電路與公式的新下界。OpenAI 給出的算術公式下界為 n^4/log n 等級。在複雜度理論方面,公司報告了一個針對一般雙人量子遊戲的指數式平行重複定理,將在經典情境中更為成熟的一項原理加以延伸。

其他報告中的結果涉及最近向量問題,這是一個與後量子密碼學相關的格子問題;Ehrhart 對只有一個內部格點的凸體之體積猜想;多色三角形 Ramsey 數;以及極值圖論中的緊緻性與退化問題。OpenAI 表示,後兩項結果解決了 Erdős 問題 146 與 180,而 Ramsey 結果則解決了 Erdős 問題 183。

這項宣布接續 OpenAI 先前公開的一項由 AI 生成的 Erdős 單位距離猜想反證。公司表示,該結果促使外部數學家在加法組合、計算幾何與複雜度相關問題上展開後續研究。

這些結果是如何產生的

根據 OpenAI,這十項結果是由 Astra 的內部版本生成,而非公開可用的模型。公司表示,尋找解答所需的總 token 用量,若按 Sol API 費率計算,約需 2,000 美元。這是供應商估算值,而非對重現研究成本的獨立稽核數字。

OpenAI 表示,之後由人員使用同一模型將論證整理成稿件。接著模型將每個論證形式化為 Lean 證明證書。OpenAI 也正在釋出每個解答的模型生成敘述,描述系統的思考過程,但這類敘述不應自動被視為模型內部運算的完整或忠實紀錄。

Lean 形式化之所以重要,是因為它提供了可由機器檢查的證明表示。然而,僅憑這一點,並不能證明其背後主張在數學上重要、每個細節都具有新意,或在更廣的研究脈絡中被正確詮釋。這些問題仍需要專家檢視,並與既有文獻比對。

證據、歸屬與不確定性

目前可用來支持這些主張的證據來自 OpenAI 的官方公告。另一份新聞通訊式清單也有相同標題,但所提供的材料並不包含獨立報導或第三方文章全文。因此,關於模型表現、成本與研究影響的最強主張,皆來自 OpenAI 的說法。

OpenAI 表示,對於已準備好的稿件與形式化證明的正確性,公司負責;而數學論證本身則歸屬於系統。對一則 AI 研究公告而言,這樣的區分相當明確,也不同尋常。它反映出一場日益升高的爭論:當模型提出論證、人類編修論證,形式系統再檢查部分結果時,作者與功勞應如何分配。

公司並未將這項公告包裝成同儕審查的替代品。相反地,它請求數學家將這些結果放入脈絡中,並透過進一步研究發展其想法。在此過程完成之前,這項公告應被視為一則關於潛在重要的機器生成論證的報告,而非 Astra 已取代專家數學研究的定論證據。

OpenAI 也將這項工作與 ChatGPT for Academic Researchers 連結,該計畫據稱將為 10 萬名科學家與數學家提供其最佳 ChatGPT 模型的免費存取。這個存取方案與 Astra 的結果是分開的,而公告也未顯示這些報告中的進展可用公開發佈的工具重現。

這對研究團隊與 AI 開發者意味著什麼

對數學研究者而言,最實際的訊號是生成與形式驗證的結合。一個能提出合理證明、卻無法在 Lean 這類系統中表達的模型,仍然難以在大規模場景中被信任。形式化為驗證正確性建立了一條更窄的路徑,但並未消除人類對定義、新穎性與重要性的判斷需求。

對 AI 開發者而言,這項公告指向的是以開放研究問題為基礎的評測套件,而非傳統問答基準。OpenAI 表示,在開發過程中一直以此類問題評估模型。這種方法測試系統是否能維持多步推理、辨識有用的中間結構,並產出可由其他工具驗證的成果。

經濟面也同樣重要。OpenAI 估計十項結果的推理成本為 2,000 美元,這顯示研究等級的模型使用對資金充足的團隊可能可行,但這個數字目前仍不能被一般化。它不包含專家審查、稿件準備、形式化工作,以及重現或延伸結果所需的基礎設施價值。因此,企業採購方應區分模型原始運算成本與可靠研究工作流程的完整成本。

對創辦人與產品團隊來說,短期機會可能不在通用型自動數學家,而在與工具連結的狹義系統。將模型與定理證明器、程式碼執行、文獻搜尋與專家審查結合的工作流程,可能比只憑流暢解釋來評估的系統更可靠。

接下來值得關注什麼

第一個訊號將是對這十項主張的外部驗證,特別是據稱對 Connes 剛性猜想的反證、非 sofic 群的構造,以及量子平行重複結果。發表、獨立形式檢查,以及專家們的詳細回應,將顯示這些論證是否能通過審視,以及其新意究竟有多大。

研究者也應關注 Lean 證明證書是否完整、可存取且可供他人使用,而不只是附在精修過的稿件旁。沒有 OpenAI 內部 Astra 系統權限的團隊若能重現結果,將更有力地驗證這項工作的實用價值。

另一個問題是,是否會有類似結果以明顯更低的成本在公開可用模型上出現。若是如此,將表示這種能力正在擴散到整個領域,而不是仍然侷限於某個尚未發布系統所帶來的內部優勢。

Creati.ai 觀點

OpenAI 的公告之所以重要,是因為它把 AI 呈現為數學研究候選論證的生成器,同時也暴露了這種主張的侷限。這個流程中最可信的部分不是模型的敘述或清單的廣度;而是試圖把每個論證轉換成可由機器檢查的 Lean 證明證書,並公開說明責任如何分工。

下一階段將由 OpenAI 之外的力量決定。若獨立數學家驗證、簡化並延伸這些結果,這項公告可能標誌著研究工具的一個重要轉折。若這些主張難以重現或難以置於脈絡之中,則它會說明為何模型輸出、形式驗證與人類數學判斷,必須繼續作為同一流程中的不同層次存在。

精選

OpenAI 報告十項由 AI 生成的數學與理論電腦科學進展

OpenAI 表示,其 Astra 模型在長期未解的數學與理論電腦科學問題上產生了十項進展,並以 Lean 形式化供審查。