MiniMax 將 M3 打造成編碼競爭者,但關鍵基準主張仍缺乏充分來源
MiniMax 在外電報導中被引述聲稱其新款 M3 模型在 SWE-bench 上拿到 59%,並有報導將該結果解讀為領先 GPT-5.5。根據目前可得證據,這個核心效能數字屬於廠商自述,而底層測試條件並未公開。這使得該公告在編碼模型競爭定位上值得關注,但對開發者與企業買家而言,仍難以驗證。
MiniMax 在外電報導中被引述聲稱其新款 M3 模型在 SWE-bench 上拿到 59%,並有報導將該結果解讀為領先 GPT-5.5。根據目前可得證據,這個核心效能數字屬於廠商自述,而底層測試條件並未公開。這使得該公告在編碼模型競爭定位上值得關注,但對開發者與企業買家而言,仍難以驗證。
模型可靠性 的最新新聞與分析