
Arena 這家新創公司以其公開排行榜而聞名,許多 AI 實驗室都使用該榜單來比較模型效能。該公司表示,在其付費產品推出僅八個月後,按年度營收運作率計算,它已成為一家價值 1 億美元的企業。據 TechCrunch 報導,該公司在 9 月推出商業服務後達到了這一里程碑,該服務將使用者評估數據和社群測試轉化為針對模型開發者和企業客戶的分析。
這項聲明的重要性超出了單一家新創公司的成長故事。Arena 最初是加州大學柏克萊分校(UC Berkeley)在 2023 年的一項研究計畫,並因提供了一種開放、眾包的方式來並排比較模型,而在 AI 生態系統中變得廣為人知。如果該公司報告的營收準確,這表明評估本身正在成為生成式 AI(Generative AI)技術堆疊中的關鍵層:它不僅是模型愛好者的公開記分牌,更是實驗室和企業在追求訓練後及部署階段的品質提升時,願意付費使用的工作流程。
Arena 建立其聲譽的基礎是一個簡單的互動模型。在其消費者網站上,使用者提交一個提示詞(Prompt),系統將其發送給兩個 AI 模型,然後由使用者選擇哪一個結果更好。隨著時間推移,這些成對判斷會匯入一個排行榜,據 TechCrunch 報導,該排行榜是根據超過 1,000 萬次使用者評估生成的。
據報導,該公開排名系統仍然免費。商業轉型發生在 9 月,當時 Arena 推出了 AI Evaluations,這是一項針對模型實驗室和企業的服務。TechCrunch 將該產品描述為提供基於從 Arena 評估者社群收集到的數據所產生的更深入的效能分析。
這種定位非常重要。Arena 並未銷售基礎模型、推理存取權限或應用層產品。它銷售的是回饋、基準測試和比較效能分析;在當前時期,實驗室正試圖透過訓練後(Post-training)、強化學習方法、安全調整和特定任務優化來榨取模型潛力。
TechCrunch 報導稱,Arena 涵蓋文字、程式碼、視覺和圖像生成的模型評估,最近還增加了專注於複雜、長週期工作流程的「代理模式(Agent Mode)」。這種擴展很重要,因為簡單的聊天機器人比較已無法涵蓋企業關心的所有任務範圍。買家越來越希望在程式碼任務、多模態輸入以及涉及多個步驟和工具的代理鏈(Agentic chains)方面獲得可靠性證據。
時機有助於解釋為何投資者和客戶如此關注。Arena 在 1 月以 17 億美元的投後估值完成了 1.5 億美元的 A 輪融資。當時,TechCrunch 指出該公司的年度營收為 3,000 萬美元。同一媒體現在報導,幾個月後,這一數字已攀升至 1 億美元的年度營收運作率。
即使考慮到運作率計算方式的寬鬆性,這也是一次急劇的加速。這表明對評估和訓練後支援的需求正隨著模型市場本身的擴張而成長。隨著模型發布更加頻繁且效能差距縮小,可信的比較測試價值隨之上升。如果客戶關心特定領域的效能、回歸風險或模型在真實使用者提示詞中的行為表現,實驗室就不能再僅僅依賴廣泛的基準測試勝利。
Arena 的成長也反映了 AI 領域更廣泛的商業現實:隨著模型變得更容易存取,競爭差異化轉向了數據、調整(Tuning)、工作流程效能和信任。公開排行榜可以吸引社群互動,但如果客戶認為這些信號有價值,付費分析層就可以將相同的底層評估活動變現。
這還有另一個戰略角度。Arena 的公共服務使其在市場中處於罕見的地位:它靠近模型發布的前線,並經常受益於使用者對測試新發布甚至未發布模型的興趣。這賦予了該公司一種數據收集和可見性優勢,這種優勢很難從零開始快速複製。
TechCrunch 報告中更值得注意的細節之一是,Arena 的執行長 Anastasios Angelopoulos 據稱澄清了該公司使用消費定價(Consumption pricing)。換句話說,1 億美元的數字並非基於訂閱或合約式經常性支出(ARR)的傳統年度經常性營收。
對於任何試圖評估該業務的人來說,這種區別都很重要。消費型營收的擴展速度可能比基於座位的 SaaS 更快,尤其是當客戶快速增加使用量時。但它也可能更不穩定。如果模型實驗室減少測試、整合供應商或內部化部分評估工作,支出表現可能不像黏性高的軟體訂閱那樣穩定。
TechCrunch 表示,Arena 將該數字稱為 ARR,同時也承認這些營收並非慣例意義上的經常性營收。因此,讀者應將該數字視為基於當前用量的年度運作率,而非完全合約化的經常性營收基礎。
這並非意味著該里程碑不重要,只是意味著其業務構成看起來可能與傳統的企業軟體不同。對於開發者和投資者而言,真正的問題不在於是否符合這個縮寫,而在於評估的使用是否已足夠深入地嵌入開發週期中,從而產生持續的需求。
儘管直接的類比對象似乎有限,但 Arena 仍取得了報導中的成功。TechCrunch 指出,另一家眾包 AI 模型評選新創公司 Yupp 已於 3 月倒閉。Angelopoulos 向該媒體表示,Arena 競爭的對象是人工標註和訓練後服務提供商(如 Mercor、Surge 和 Scale AI)的相同預算。
這種比較很有啟發性。它將 Arena 定位為模型改進的基礎設施,而非單純的媒體資產或基準測試網站。人工評估者、偏好數據、排名系統和深入分析都匯向同一個目標:使模型在開發者關心的任務上表現更好。
TechCrunch 將 Arena 的成長與訓練後市場正在快速擴張的更廣泛跡象聯繫起來。該報導引用了 The Information 先前的報導,稱 Handshake 的 AI 訓練總年度營收在 1 月至 4 月間從 5.5 億美元躍升至近 10 億美元;而 Mercor 的年度營收在去年 9 月約為 5 億美元後,今年早些時候已突破 10 億美元。這些數字雖然是二級市場的背景資訊,而非 Arena 自身報告中的新披露,但它們支持了 AI 評估、標註和訓練運作正成為龐大支出的類別。
對於市場而言,這意味著主戰場正在轉移。模型供應商仍在前沿發布上展開競爭,但價值份額越來越多地流向了那些能告知客戶「哪個模型更好」、「為什麼更好」以及「如何改進」的層級。
該報導的核心新聞來自 TechCrunch 的報導,包括歸功於 Arena 執行長 Anastasios Angelopoulos 的聲明。因此,Arena 的 1 億美元數字是公司報告的營收里程碑,而非所提供來源素材中經過獨立審計的財務披露。
其他幾個重要細節也來自 TechCrunch 的敘述:Arena 源於加州大學柏克萊分校在 2023 年的一項計畫;其於 9 月推出了商業化的 AI Evaluations 產品;公開排行榜反映了超過 1,000 萬次的使用者評估;該公司在 1 月報告的年度營收額為 3,000 萬美元;以及它已從包括 Felicis、Andreessen Horowitz、Kleiner Perkins、Lightspeed 等投資者處累計籌集了 2.5 億美元。
該報告還指出 Arena 的共同創辦人為 Angelopoulos、技術長 Wei-Lin Chiang,以及加州大學柏克萊分校教授兼 Databricks 共同創辦人 Ion Stoica(他在公司於 2025 年 4 月註冊成立前為該項目提供諮詢)。
目前不確定的是 1 億美元運作率的確切構成。提供的來源並未細分客戶數量、平均支出、留存率、毛利率,或底層模型實驗室與企業買家之間的比例。它也沒有提供第三方驗證,說明 Arena 的公開排行榜對真實生產環境結果的預測能力如何。這些空白很重要,因為許多企業現在需要的是特定領域的評估,而非僅僅是廣泛的流行度或社群偏好信號。
對於模型開發者來說,Arena 的崛起突顯了一個實務真理:僅僅交付一個強大的模型已遠遠不夠。團隊需要在不同的發布版本、任務類型和工作流程長度上進行持續評估。一種能夠快速浮現偏好數據、比較分析和回歸測試的服務,可以縮短迭代週期並降低推廣較弱檢查點(Checkpoint)的風險。
對於應用團隊來說,情況略有不同。公開排行榜是很有用的探索工具,但生產環境的決策通常需要更嚴格的測試,這些測試需與公司自身的提示詞、政策和失敗閾值掛鉤。Arena 的商業化推動表明市場對外部評估基礎設施存有需求,但買家仍應審慎評估測試集是否反映了其用例、判斷是否可重現,以及供應商在模型更新後能在多快時間內偵測到回歸測試結果。
對企業而言,更大的影響在於採購。評估正在從臨時的研究職能轉變為與模型存取、護欄(Guardrails)、可觀測性(Observability)和數據標註並列的項目。這可以改善部署的精確度,但也會造成提供基準測試、人類回饋、紅隊測試(Red-teaming)和訓練後支援的供應商之間的功能重疊。買家將需要區分廣泛有用的信號與昂貴且通用的儀表板。
接下來值得觀察的信號是,Arena 是否能將目前的運作率成長轉化為持久的企業合約,還是在很大程度上仍是一種與模型發布節奏掛鉤的使用驅動型服務。更多關於客戶組合和留存率的細節將有助於釐清這一點。
第二個問題是,大型實驗室是會加深對第三方評估平台的依賴,還是會在內部構建更多此類技術堆疊。如果外部平台持續贏得預算,評估可能會成為一個大型的軟體與服務類別。如果實驗室傾向於內化這些工作,獨立提供商可能需要進一步深化專業。
第三,觀察 Arena 的「代理模式」如何發展。如果客戶越來越多地評估長週期工作流程而非單輪提示詞,該公司相對於部署代理的企業買家(而不僅僅是追求排行榜排名的模型開發者)來說,將更具相關性。
最後,關注圍繞基準測試和透明度的審查。隨著評估轉變為業務關鍵型基礎設施,客戶將要求在方法論、抽樣偏差、可重現性以及公開排名是否符合私人生產環境結果等方面獲得更多清晰度。
Arena 報告的成長是 AI 支出走向的一個有益指標。模型層仍然受到市場大部分關注,但這個故事表明,市場正日益重視模型周邊的運作機制:排名、回饋、調優和品質證明。這一點在模型差異變得細微、更迭迅速且高度依賴工作流程設計的當下顯得尤為真實。
需要警惕的是,並非所有的評估信號都等價。眾包偏好數據可能很強大,但企業需要證據證明排行榜能轉化為其自身任務的真實執行效能。如果 Arena 能夠橋接這一落差——即在保持其影響力的開放性的同時,在付費部屬中證明其嚴謹價值——它或許能定義一個介於基準測試實驗室、數據平台和訓練後供應商之間的獨特類別。
Arena這家來自柏克萊的初創公司,背後是目前最受關注的群眾外包AI模型排行榜之一。該公司告訴TechCrunch,在推出商業評估產品約八個月後,其年化營收已達1億美元。這一里程碑顯示,AI基準測試與訓練後回饋正逐漸成為一門獨立生意,而不只是研究活動;不過公司表示,其營收是按使用量計費,而非簽約式經常性ARR。