
OpenAI 推出 GeneBench-Pro,這是一項新的基準,旨在測試 AI 系統是否能做的不只是執行計算生物學中的腳本化分析。根據該公司說法,這項基準是用來衡量模型在處理歧義、修正假設、選擇方法,以及判斷某個答案是否已經可靠到足以支援下游科學決策方面的表現。
這項發布之所以重要,是因為它鎖定了許多現有 AI 評估並未充分涵蓋的一個缺口:那就是反覆迭代、雜亂無章、且只在部分程度上事先指定的研究工作。OpenAI 表示,GeneBench-Pro 將其先前的 GeneBench 擴展到更困難的任務,涵蓋基因體學、定量生物學與轉譯醫學,並使用旨在反映真實科學分析中那些需要判斷的資料集與提示。對於在生命科學領域工作的 AI 開發者與企業團隊來說,這則消息與其說是一次花俏的模型發布,不如說是又一次嘗試定義在基準條件下,「有用」的科學推理應該長什麼樣子。
在 OpenAI 的描述中,GeneBench-Pro 是一項研究等級的基準,包含 129 道涵蓋計算生物學使用情境的題目。每個問題都會給 AI agent 一段簡短提示、資料檔案,以及可使用 Python、科學計算函式庫與 PLINK 2.0 等基因體工具的標準分析環境。接著,模型必須探索資料、選擇分析路徑、在早期假設失敗時反覆調整,並回傳最終答案。
這種框架正是 OpenAI 訴求的核心。該公司主張,許多科學任務受限的不是事實記憶或遵循清單的能力,而是它所稱的「research taste」——也就是一連串相互連結的判斷:資料能支持什麼、診斷結果是否推翻了最初方案,以及如何在不同估計量或方法之間取捨。GeneBench-Pro 的目標是衡量這些系統層級的決策,而不只是最終輸出結果。
OpenAI 也發布了一個配套的案例研究頁面〈Inside Genebench-Pro〉,收錄 10 個代表性例子。這些例子展示了該公司想評估的任務風格:在合成腫瘤登錄資料中進行治療效果估計、解讀 pooled CRISPRi 與 CasRx 實驗以區分轉錄本特異性效應與鄰近位點假訊號、cis multivariable Mendelian randomization,以及生殖帶因風險估計。在若干案例中,TXR1、TXR1i、LINC473、KIN1、PROTA 和 PROTB 等標籤被明確描述為合成基準標籤,而非真實的生物學標的。
OpenAI 的核心論點是,標準生物學基準往往會在兩種方式之一上失效。一方面,歷史上的真實世界資料集可能容許多種合理做法,讓人難以判斷模型究竟是因為推理薄弱而失敗,還是因為基準建立者偏好另一條同樣帶有主觀性的路徑。另一方面,數值上容錯度高的問題,則可能讓模型即使存在重要的方法論錯誤,仍能得到可接受的答案。
為了解決這個問題,OpenAI 表示 GeneBench-Pro 的題目是以合成方式構建,並採用受控的資料生成過程。該公司稱,這讓它能對已知目標進行確定性評分、調整任務難度,並透過消融研究驗證看似合理但實際錯誤的分析應該會失敗。OpenAI 也表示,已審查草稿中的捷徑路徑與資訊洩漏問題。
這是一個值得注意的設計選擇。在基準開發中,合成構建能提升控制性與評分清晰度,但也會帶來另一種風險:基準反映的可能更多是其創建者的假設與偏好,而不是實際研究環境那種開放式的複雜性。OpenAI 顯然意識到這項疑慮,並表示已將 129 道題目中的 82 道交由外部審查者評估,包括研究生、博士後研究員、產業科學家與教授,由他們評估真實性、可辨識性與方法論適切性。
不過,買家與研究人員仍應注意,現有證據主要來自 OpenAI 自身材料。這套基準設計或許嚴謹,但它與實際藥物研發或轉譯工作流程的對應程度,公開證據仍屬早期階段。
OpenAI 最強的表現主張是,其模型 GPT-5.6 Sol 在 GeneBench-Pro 的最高推理等級下達到 28.7% 的通過率,開啟「Pro mode」後提升至 31.5%。該公司並將這一表現與 GPT-5 在最初的 GeneBench 努力開始時低於 5% 的分數做對比。
OpenAI 也表示,測試時運算量的擴大非常關鍵。根據該公司說法,GPT-5.6 Sol 在最低推理等級下只達到個位數的通過率,而在最高推理等級下,它解出的題目數幾乎是 GPT-5.2 的六倍,且使用的 token 數量約少了三分之二。
這些訊號對模型開發者來說很有意思,因為它們顯示提升不只來自更強的基礎能力,也來自推理時的配置。就實務而言,這支持許多 AI 產品團隊已在測試的一種策略:把更多算力與更長的思考時間保留給高價值分析任務,而非對所有情況都套用一致的推理預算。
但結果也凸顯了當前限制。即使使用 OpenAI 自家的基準與最強報告設定,大約仍有 10 題中的 7 題未通過。OpenAI 也承認,AI agents 仍然不夠可靠,無法取代人類專家。該公司補充了一項成本比較——指出審查者估計每道題通常需要人類專家 20 到 40 小時,而每題的推理成本僅是幾美元——但這種經濟論點應被視為供應商報告的敘事,而非可直接部署自主性的證明。
這則報導的事實基礎來自 OpenAI 的公告與案例研究材料。這些來源支持幾個具體點:GeneBench-Pro 確實存在、它包含 129 道題目、其中 10 道代表性題目正在 Hugging Face 上開源,以及 OpenAI 計畫向 Artificial Analysis 提供一個 50 題子集,用於第三方基準測試。
同樣的來源也支持這項基準的預期範圍涵蓋基因體學、定量生物學與轉譯醫學,以及其包含 Python 與 PLINK 2.0 的標準生物資訊環境。
然而,基準分數、與 GPT-5 的比較、GPT 模型在這類科學推理上優於 GLM 5.2 等領先開源模型的說法,以及這項基準可能在年底前被飽和的暗示,全部都是 OpenAI 自行報告的主張。這些資訊很有參考價值,但在此提供的材料中,尚未經獨立重現。
OpenAI 也揭露了一項重要的方法論注意事項:在開發過程中曾使用前沿 GPT 模型來評估並加強題目。該公司表示,它曾懷疑這可能會讓 GeneBench-Pro 對 GPT 模型相較於其他模型家族產生偏差,但報告稱,競爭模型在發布時只達到與相對應 GPT 模型相同或更差的表現。這種透明度是有幫助的,但這項主張仍然來自基準創建者。若買家或研究人員希望得到可信賴的跨模型比較,透過 Artificial Analysis 進行獨立測試將非常重要。
對 AI 開發者而言,GeneBench-Pro 是一個訊號,代表評估重點正在超越程式撰寫與教科書式科學題目。如果一個團隊想打造用於 bioinformatics、轉譯醫學或內部研發支援的 agents,這項基準凸顯了部署時真正重要的失誤模式:選錯估計目標、誤讀混雜結構、在診斷後未能更新方案,或回傳一個看似精美但對決策不安全的答案。
對於製藥、生技與健康研究領域的 enterprise AI 團隊來說,訊息則更為保守。能通過部分 GeneBench-Pro 題目的模型,可能適合作為分析助理、分流工具或假設生成助手,尤其當推理成本相對於科學家時間很低時。但 OpenAI 自己的結果並不支持在高風險工作流程中採取無監督自主運作。即使這項基準設計得很好,31.5% 的通過率也只能證明模型具備部分能力,而不是可靠執行。
不過,這項基準在實務上仍可能有價值。內部評估 AI agents 的團隊,往往缺乏針對高判斷負荷工作的硬性測試。像 GeneBench-Pro 這樣的基準,可能比通用程式競賽套件或選擇題式生物學考試更接近真實,特別是在比較提示策略、工具使用、路由政策與升級門檻時。
競爭面向同樣值得關注。OpenAI 將 GeneBench-Pro 描述為證據,說明在軟體任務上表現強的模型,並不會自動在定量不確定性下的科學推理也同樣強。如果這點在第三方評估下成立,可能會重塑企業如何比較前沿閉源模型、開源模型與特定領域系統,用於生命科學中的 enterprise AI。
最重要的下一個訊號,是來自 Artificial Analysis 的獨立基準測試。如果那個 50 題子集真的可用,並且被拿來在多個模型家族上執行,市場就能更清楚地看出 OpenAI 對 GPT-5.6 Sol、GPT-5.5 與 GLM 5.2 的內部排序是否站得住腳。
第二,觀察 GeneBench-Pro 有多少內容能實際重複使用。OpenAI 表示有 10 題會在 Hugging Face 上開源,但更廣泛的採用將取決於外部實驗室與產品團隊是否覺得這些任務夠真實,能納入評估流程。
第三,值得追蹤的是各家廠商是否開始針對這種基準風格進行優化。如果分數如 OpenAI 所暗示的那樣快速提升,問題就會變成:模型是在學到廣泛可轉移的科學判斷,還是在適應某一類基準。
最後,還要觀察產品化進展。如果 OpenAI 或其他廠商開始把 GeneBench-Pro 風格的推理整合進生醫分析的 agent 產品,採購團隊將不只想看到通過率,也會要求校準性、可重現性、審計軌跡與安全的人類交接機制。
GeneBench-Pro 不只是另一個排行榜發布。它是在嘗試把 AI 面臨的一個更困難問題形式化:當工作流程未充分定義、且資料雜訊很高時,模型能否做出有正當性的選擇?這比回答生物學冷知識或生成程式碼片段,更接近應用研究中的真實挑戰。
但關鍵在於,基準進展不應與部署準備度混為一談。OpenAI 自己的數字顯示出有意義的進步,特別是 GPT-5.6 Sol,但也顯示模型距離計算生物學中值得信賴的自主性仍有很大差距。對創業者與產品團隊來說,實際的做法是圍繞「部分勝任」來設計:讓 AI agents 幫忙縮小搜尋空間、提出分析方案、減少例行迭代的人力負擔,同時仍由人類負責高影響性的解讀。如果 Artificial Analysis 與外部研究者驗證了這項基準的實用性,GeneBench-Pro 可能會成為檢驗這個中間地帶的重要測試。
OpenAI 釋出 GeneBench-Pro,一項基因體學基準,旨在衡量 AI agent 是否能在生物學工作流程中做出研究等級的判斷。