
NVIDIA 在企業 AI 代理競賽中提出了一個新論點:圍繞模型的系統工程,可能和訓練更大的模型一樣重要,甚至更重要。NVIDIA 在兩篇公司部落格文章中表示,LangChain 為 NVIDIA Nemotron 3 Ultra 調校了其 Deep Agents harness,並且在 LangChain 自己的基準測試中,將這個開放模型推升到 NVIDIA 所描述的開放模型領先的基準表現,以及在商業任務上與最高分的封閉模型達到相當水準。
這項公告之所以重要,是因為它將注意力從單純的模型發布,轉向包裹模型的軟體層:提示詞、工具說明、中介軟體、記憶與評估迴圈。根據 NVIDIA 的說法,這些變更讓團隊能使用開放式堆疊,而不必只依賴昂貴的專有前沿模型來處理代理工作流程。對建構者與企業買家而言,實際訊息是:代理品質越來越可能透過 harness 調校與執行時控制來贏得,而不只是透過選擇最強的模型端點。
核心消息不是一個新的基礎模型。相反地,NVIDIA 與 LangChain 正在提供一個為 NVIDIA Nemotron 3 Ultra 調校過的 LangChain Deep Agents 設定檔,以及 NVIDIA 所稱的適用於 LangChain Deep Agents 的 NVIDIA NemoClaw 藍圖。NVIDIA 表示,這把調校過的 harness 與 NVIDIA OpenShell 打包在一起,NVIDIA OpenShell 是一個安全執行環境,旨在讓企業環境中的代理行動更安全地執行。
根據 NVIDIA 的說法,這個調校後的設定檔可直接透過 LangChain 使用,開發者也可以把 NemoClaw 藍圖作為建立專門代理的起點。NVIDIA 進一步表示,開發者可透過 Baseten、Crusoe Cloud、DeepInfra、Fireworks、Nebius,以及 Together AI 等代管供應商存取 NVIDIA Nemotron 3 Ultra。
兩篇來源貼文都強調,這些提升是在沒有重新訓練模型的情況下完成的。NVIDIA 表示,LangChain 讓模型對自己的公開 Deep Agents 基準套件進行測試,檢查系統失分的執行追蹤,然後不是改變模型權重,而是調整模型周邊的 harness。這個區別正是 NVIDIA 主張的核心:開放模型可以透過針對工作流程的工程改善得很明顯,同時保有廣泛的部署選項。
LangChain 執行長 Harrison Chase 在 NVIDIA 的部落格中表示,這項工作證明企業可以在保有代理系統控制權的同時,從開放堆疊獲得強大效能。這雖然是供應商控制來源中的高層評論,但與 NVIDIA 開發者教學中的實作細節相符。
更有用的細節來自 NVIDIA Developer Blog,文章解釋了「harness tuning」在實務上代表什麼。貼文描述了一個可重複的流程:執行評估基準、檢視失敗、提出設定檔變更、驗證修正,並重新執行測試套件以檢查回歸。該部落格表示,LangChain 的 harness 設定檔為開發者提供了一個正式位置,可針對特定代理工作流程客製化模型行為。
在這個說法中,變更並非抽象最佳化,而是包括系統提示詞、提示詞後綴與工具說明的編輯,以及旨在攔截常見失敗模式的中介軟體新增。教學中提到一個具體範例,涉及內建的 read_file 工具。在一項基準任務中,模型需要持續讀取分頁檔案,才能找到最後一行非空白行;但它卻只根據第一頁作答。提議的修正增加了中介軟體行為,以偵測檔案讀取被截斷的情況,並幫助代理正確繼續。
這個例子很重要,因為它反映了許多 AI 代理的真實失敗模式:不是語言流暢度不足,而是與工具和狀態互動不佳。NVIDIA 所宣傳的基準提升,看起來來自於讓 NVIDIA Nemotron 3 Ultra 在 LangChain Deep Agents 的編排環境中更可靠地運作,而不是把它變成一個更通用能力的模型。
開發者貼文也主張,這個流程可以部分自動化。它提到 LangSmith Engine 與一個「ralph loop」,作為可提出 harness 變更、驗證重複測試通過、並嘗試避免過度擬合的代理式提議者範例。這仍然是以教學形式描述,而非產品發布,但它指向一個更廣泛的趨勢:以評估驅動的代理最佳化,成為一個獨立的軟體類別。
這則故事中最強的主張來自 NVIDIA 自己的部落格,因此在沒有獨立重現之前,應被視為供應商報導。NVIDIA 表示,經調校的 NVIDIA Nemotron 3 Ultra 設定在 LangChain 的 Deep Agents 基準上,達到開放模型中的最高準確度,以更高吞吐量完成更多任務,且每次執行的推論成本僅為領先封閉模型的十分之一。NVIDIA 也表示,這個模型在該基準上與得分最高的封閉模型達到「商業任務相當」的水準。
如果這些主張成立,確實很重要,但目前可用的證據並未提供完整的基準表、精確的競爭對手清單、執行條件、token 定價假設或信賴區間。開發者貼文也指出,基準與測試具有隨機性,應該重複執行多次。這個提醒很重要。在代理評估中,提示詞或中介軟體的細微變化,可能在有限次執行裡看起來很驚人,卻無法在不同工作負載間泛化。
同時也值得注意的是,這個基準是 LangChain 自己的 Deep Agents,而調校也特別針對 LangChain Deep Agents。這不會使結果無效,但會縮小其適用範圍。買家應將其視為在特定 harness 與基準環境中的效能證據,而不是 NVIDIA Nemotron 3 Ultra 在各種情境下都普遍等同頂尖專有模型的宣告。
NVIDIA 也提到圍繞這個堆疊的生態系活動。它表示 Abridge、Amdocs 與 Box 正在把專門代理嵌入各自的平台,而 EY 正在擴大圍繞 NVIDIA NemoClaw 藍圖、用於 LangChain Deep Agents 的導入能力。根據此處的來源材料,這些內容應視為供應商所稱的合作夥伴活動範例,而非經獨立驗證的部署案例。
對於正在打造代理的產品團隊來說,這項公告強化了一個實務教訓:模型選擇只是代理品質的一部分。如果組織已經在使用 LangChain,能取得一個為 NVIDIA Nemotron 3 Ultra 調校的設定檔,便可降低測試開放模型路徑所需的努力。這對於程式撰寫、文件工作流程、資料分析或操作型任務特別有吸引力,因為這類場景要求代理一致地呼叫工具,且推論成本很重要。
對企業而言,更大的吸引力在於控制權。NVIDIA 明確推動一個由開放模型、開放 harness 與安全執行環境組成的完整開放堆疊。從採購角度看,這對應到熟悉的關切:系統在哪裡執行、編排邏輯歸誰所有、工具執行如何治理,以及能否在不等待模型供應商的情況下客製化堆疊。
如果「十分之一成本」的大致數字在真實部署中成立,成本論點對於希望持續評估而非偶爾展示的團隊尤其有說服力。這會改變團隊測試代理更新、比較設定檔與專門化工作流程的頻率。價值不只在於更低的生產成本,也在於更便宜的迭代。這往往就是試點與正式生產系統的分界。
不過,這個堆疊最有吸引力的情境,仍是那些具備調校與治理能力的團隊。使用 LangChain Deep Agents、NVIDIA Nemotron 3 Ultra 與 NVIDIA OpenShell 的開放式設定,可以提供彈性,但也讓買家承擔比單一即用型專有 API 更多的實作責任。可用性並不代表可靠性工作、安全邊界與評估紀律會自行消失。
這次發布的戰略訊號是:競爭正從模型排行榜,轉向代理基礎架構。NVIDIA 在這裡不只是賣晶片或端點;它想為企業 AI 代理定義一個參考架構。透過把 NVIDIA Nemotron 3 Ultra 與 NVIDIA NemoClaw 結合,並經由 Baseten、Together AI 這類雲端主機分發,NVIDIA 正把自己定位為整個代理堆疊的平台供應商。
這也強化了 LangChain 的角色。該公司的基準、harness 設定檔與編排環境,都成為模型競爭力如何被衡量與改進的一部分。NVIDIA 強調 LangChain 每月下載量超過 2 億次,這是 NVIDIA 根據 LangChain 的平台地位所引述的數字。即使這個數字在此無法獨立驗證,更大的重點仍然可信:編排層具有槓桿作用。一個單獨看起來只是勉強夠用的模型,若能針對熱門 harness 緊密調整,會變得實用得多。
對封閉模型供應商而言,挑戰很明確。它們仍在許多廣泛的智慧基準上領先,但當開放替代方案與任務特定工程以及企業友善的執行環境結合時,會越來越可行。這不會在所有地方都消除差距,尤其是在新型推理任務上,但它確實提高了在工具與控制主導的代理使用場景中,收取高價的門檻。
下一個要關注的信號是獨立重現。如果第三方開發者針對 NVIDIA Nemotron 3 Ultra 發布自己的 LangChain Deep Agents 結果,尤其是在 NVIDIA 範例之外的工作負載上,對其效能主張的信心將會提升。
第二個指標是 NVIDIA 或 LangChain 是否會發布更完整的基準揭露,包括精確的基線、執行次數、變異性,以及相對於特定封閉競爭對手的成本假設。若沒有這些,關於「相當」與「成本低 10 倍」的說法仍具有方向性的意義,但很難直接比較。
第三,要觀察像 EY 這樣的系統整合商是否會把這個藍圖轉化為可重複的企業交付模式。參考架構只有在成為可採購的部署、並內建治理、記錄與政策控制時,才更具意義。
最後,值得追蹤 harness 工程是否會成為標準化的產品層。像 LangSmith Engine、基於基準的調校迴圈,以及中介軟體函式庫,可能會像雲端軟體中的可觀測性一樣,成為代理營運的標準組成部分。
這項公告與其說是在談單一模型的勝利,不如說是在談企業 AI 的價值正累積在哪裡。NVIDIA 與 LangChain 的論點是:代理的持久優勢,可能來自 harness 工程、評估紀律與執行時安全,而非純粹的模型新鮮度。這個觀點與許多生產團隊已經看到的情況相符:工具使用與工作流程可靠性,通常會比文字生成品質更早出問題。
需要注意的是,這篇報導中幾乎所有標題級指標都來自供應商控制的來源,以及與正在推廣的同一套編排堆疊綁定的基準。即便如此,更廣泛的市場方向看起來仍然可信。對建構者來說,重要的結論不是 NVIDIA Nemotron 3 Ultra 已經明確彌平了與所有專有模型的差距,而是開放模型加上強大的編排,現在已經具備足夠競爭力,值得認真評估,特別是對重視成本、控制,以及能依自己的條件運行 AI 代理的企業而言。
NVIDIA 表示,經 LangChain 調校的 Nemotron 3 Ultra 在開放模型代理基準中取得領先表現,凸顯企業 AI 可採用更便宜的開放堆疊。