何夕2077AI Agent

英偉達開源Molt框架

2026年8月3日 00:00

重點摘要

Home Uncategorized NVIDIA AI Releases Molt: A PyTorch-Native Agentic Reinforcement Learning Framework Uncategorized Agentic reinforcement learning research is constant algorithm modification.

站內 AI 整理稿

NVIDIA 旗下 NeMo 團隊正式開源一套名為 Molt 的強化學習框架,鎖定近年快速發展的 agentic reinforcement learning 研究場景。這類研究最大的痛點在於演算法迭代頻繁,新的估計器、新的管線階段、新的 rollout 方案不斷出現;但在主流框架中,任何一項改動都必須穿透 trainer、分散式後端與 rollout 膠水層,成本最後都落在研究者身上。Molt 的定位就是直接針對這項成本提出解方,以 PyTorch 原生架構打造,並設定了一個相當特別的設計目標:程式碼庫必須緊湊到研究者能整包放進腦中理解,同時也能讓 AI 程式設計助手完整閱讀與推理。 這項目標反映在具體的程式碼規模上。根據該團隊以框架 RL 進入點追蹤 import graph 的測量方式,Molt 的 RL 核心程式碼約為 8.6K 行;同樣方式計算,verl 約為 62K 行,slime 約為 25K 行,OpenRLHF 約為 7.2K 行。換句話說,Molt 的程式碼體積約為 verl 的七分之一,卻涵蓋了可運行的 agentic RL 訓練能力。 Molt 並非只是研究原型,它具備實際部署條件。框架以 Apache 2.0 授權釋出,內附 launch codes、Slurm 腳本以及預先建置好的容器。不過研究論文將它定位為研究基礎設施,而非生產級訓練服務,真正的門檻在於硬體。官方提供的 recipes 預設使用 2 個節點、每節點 8 張 H100 GPU,其中 8 張負責訓練、8 張負責 rollout。這樣的規格將 Molt 的使用者圈在具備前沿或接近前沿算力的機構,包括資金充裕、正在做 post-training 的 AI 新創,金融、醫療與機器人領域中需要針對自有環境訓練 agent 的企業研究團隊,以及擁有跨節點 H100/H200 資源的學術實驗室。 Molt 的架構由三個元件組成,並以組合而非改寫的方式串接:Ray 負責資源放置與非同步佇列,vLLM 負責 rollout 推論,NVIDIA AutoModel 搭配 FSDP2 負責訓練。這三個元件都沒有被 fork,因此上游更新不需要歷經痛苦的 rebase 過程,只需更新容器 pin 版本即可跟進。 在執行時期,Molt 的運作核心是一個 agent pool,也就是一組放在請求路由器後方的 vLLM 引擎,搭配單一可訓練的策略 actor。系統採用 streaming pool 設計,讓 prompt groups 持續在 flight 狀態中,即使 actor 正在訓練,引擎也不會進入空轉狀態。當發生部分 rollout 時,系統會暫停引擎,透過 NCCL 直接將 actor 的模型分片廣播到每一顆引擎,然後恢復先前保留的請求,而不是將已經產生的軌跡丟棄重來。 Molt 對 agent 的定義相當輕量:一次 RL 執行只需要指定一個匯出 AgentRunner 的 Python 模組,其餘所有程式碼都是普通程式,包含 reward 函式在內。框架支援兩種 agent 形式。第一種是 Env,由框架本身在 Gymnasium 對齊的 step() 介面中掌控 LLM 迴圈;第二種是 ChatAgent,由使用者透過標準的 OpenAI 或 Anthropic SDK 自主掌控迴圈。Molt 會啟動一個 loopback server,同時支援這兩種 wire protocol,每個請求都會在伺服器端以逐 token 精確的方式累積,確保訓練資料不會因通訊協定轉換而失真。當長程 agent 需要壓縮上下文或改寫 prefix 時,伺服器會自動封存目前區段,並開啟一個新的區段,因此不會污染已經產生的軌跡。 為了確保正確性,Molt 以三個不變量貫穿整體設計。第一是 token identity:軌跡由實際被取樣的 token id 定義,而不是由重新 tokenize 後的轉錄文字定義。第二是 policy-version semantics:可訓練 token 保留行為策略下的 log-probabilities,非同步使用情境則在序列級門控後進行逐 token 修正。第三是 forward consistency:rollout 與 actor 必須對模型語義有完全一致的解讀。 第三個不變量在 mixture-of-experts 策略中尤為關鍵。MoE 模型的 rollout 與訓練路由器各自獨立選擇 expert,微小的數值差異就有可能翻轉 top-k 選擇,導致訓練訊號失真。Molt 為此實作 rollout routing replay:vLLM 會回傳每個 token 的 expert ids,訓練端在 forward 階段直接重放這些選擇,避免因路由不一致而產生的偏差。 效能方面,Molt 在吞吐量上與基於 Megatron 的既有技術堆疊達到統計上相當的水準,團隊也如實揭露了 MoE 情境中可能出現的不匹配限制。此外,規模擴展對 Molt 來說只是一個旗標參數:同一套程式迴圈可以訓練 dense 4B 模型,也能以 --fsdp.ep_size 256 的設定訓練 700B MoE 模型,不需要為不同規模改寫架構。 就應用場景而言,Molt 可涵蓋多輪工具使用 agent、程式碼執行 agent、視覺語言環境(內附 geo3k recipe)、以 LLM 作為評審的獎勵迴圈,以及將行為策略蒸餾到較小學生模型的 on-policy distillation。整體而言,Molt 以極簡核心、不 fork 外部元件、逐 token 精確的資料路徑,加上可從 4B 一路擴展到 700B 的規模彈性,為 agentic RL 研究提供了一個更輕量、更透明的實驗基底。目前論文與開源程式碼皆已公開,供研究社群直接取用。

Related

相關文章

AIBaseAI Agent

三星智能電視應用被曝含住宅代理代碼,數百萬設備面臨安全風險

AI資訊AI新閒資訊正文三星智能電視應用被曝含住宅代理代碼,數百萬設備面臨安全風險發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘據最新安全研究顯示,多款熱門三星智能電視應用程序被發現包含住宅代理網絡(resproxies)相關代碼,可能導致用戶家庭或辦公網絡連接被共享給陌生第三方,使數百萬臺三星智能電視面臨潛在劫持風險。

1 小時前5400
何夕2077AI Agent

智能體狀態化分詞方案

智能體狀態化分詞方案。 研究者在智能體運行⏱️中發現了分詞瓶頸。詳情查閱狀態化分詞推理服務論文成果介紹。新方案在測試中提升了推理速度。該服務能大幅度降低首詞的等待延遲。

3 小時前
何夕2077AI Agent

實時語音智能體框架

AI資訊日報|實時語音智能體框架 實時語音智能體框架。 開發者近期推出了實時語音🎙️新框架。詳見實時語音智能體框架開源項目源碼。目前該框架在社區擁有(11.9k)贊。它能顯著緩解實時開發痛點。

3 小時前
IT之家AI Agent

Hugging Face CEO 德朗格:AI 企業應主動披露安全入侵事件

Hugging Face 執行長德朗格認為,限制企業發布前沿 AI 模型無法阻止類似 OpenAI 智能體逃逸事件,呼籲應讓更多人存取模型以提升防護能力。他主張強制實施智能體網路攻擊披露制度,主動公開入侵事件,以便分析問題根源並防範再發生。

12 小時前