每小時“燒錢”超20萬元,羅福莉直播小米大模型訓練

2026年9月17日 18:20
每小時“燒錢”超20萬元,羅福莉直播小米大模型訓練
站內 AI 整理稿

小米大模型團隊近日對外揭露旗下旗艦級模型 MiMo-V2.6 的最新訓練進度。團隊負責人羅福莉在公開分享中證實,該模型目前正處於強化學習的中間階段。強化學習是大型語言模型訓練後期的關鍵環節,模型須透過大量運算與反覆回饋來逐步調校行為模式,對算力與時間的要求極高,同時也是整個訓練流程中資源消耗最為劇烈的時期。由於模型訓練規模龐大,MiMo-V2.6 在此階段的運算成本持續攀升。業界人士分析,強化學習階段往往需要調用數千張高階 GPU 長時間連續運轉,每小時的運算成本動輒超過新台幣數十萬元。

雖然羅福莉並未在會中給出具體數字,但訓練成本高昂已是業界共識,外界推估每小時「燒錢」規模恐逾新台幣 20 萬元,凸顯大型 AI 模型從研發到落地所需承受的驚人資本壓力。所謂強化學習,指的是讓模型在大量情境中不斷嘗試、獲得回饋,並自行調整參數以趨近最佳表現。與前期監督式微調不同,強化學習階段不需要大量人工標註的資料,卻需要模型自主產生大量推論結果,再透過獎勵函數進行評估。這個過程就像讓模型不停地「自我對弈」,每一次迭代都耗費巨量 GPU 運算時間,使得成本急遽上升。

業內普遍認知,訓練一個百億甚至千億參數規模的語言模型,前期預訓練階段已經相當燒錢,但到了強化學習階段,由於需要反覆運算與多輪迭代,單日成本往往就突破百萬新台幣。MiMo-V2.6 的參數量雖未對外公布,但從其定位為旗艦模型來看,規模必然不小。羅福莉在分享中指出,團隊目前正全力優化強化學習流程,試圖在有限的算力預算內達成最佳效果。算力資源的稀缺與高價,是當前所有大型 AI 模型團隊共同面對的瓶頸。以市場主流的高階 GPU 為例,單張採購成本動輒數十萬新台幣,而訓練時需要數千張同時運作,加上機房電力、冷卻、維護等開支,每小時燒掉數十萬元已是常態。

小米雖然擁有集團資源支援,但面對這樣的天文數字,依然必須審慎規畫每一階段的訓練排程。羅福莉強調,強化學習階段並非只是一味砸入算力就能見效,更關鍵的是設計有效率的獎勵模型與訓練策略。如果獎勵信號設計不當,模型可能學到偏差行為,反而需要更多輪次來修正,進一步推高成本。MiMo-V2.6 團隊在這一環節投入了大量研究人力,希望能在不犧牲模型性能的前提下,盡可能縮短訓練週期。事實上,小米進軍大模型領域並非一蹴可幾。早在數年前,集團便開始布局 AI 技術,逐步累積在自然語言處理與多模態理解方面的能力。MiMo 系列模型就是這些積累的結晶,目標是打造能夠原生支援多種模態輸入與輸出的通用智慧引擎。V2.

6 版本作為最新迭代,承載了小米在智慧終端、物聯網與車載場景中落地的期待。然而,高額的訓練成本也讓外界持續關注大模型產業的商業化前景。目前全球僅有少數幾家科技巨頭能夠負擔數十億美元的年度訓練開支,多數中小型團隊只能依靠雲端租用算力或政府補貼來維持研發。小米雖然體量龐大,但同樣需要在技術理想與財務現實之間找到平衡點。業界分析指出,強化學習階段的成本結構與模型規模、迭代次數、GPU 型號以及能源價格密切相關。如果未來能夠出現更高效的訓練演算法或專用晶片,或許能從根本上改變「燒錢」的現狀。但在那之前,任何有意投入大模型競賽的企業,都必須做好每小時數十萬元資本支出的心理準備。

羅福莉在分享的最後提到,MiMo-V2.6 的強化學習階段預計還需要數週才能完成,後續將進入評估與微調環節。團隊會持續監控訓練過程中的損失曲線與性能指標,確保模型在混合專家、長上下文處理等關鍵能力上達到預期水準。隨著訓練逐步推進,外界也期待看到小米在大模型領域交出更具競爭力的成績單。

Related

相關文章

全天候科技AI硬體

華為昇騰960超節點落地 AI算力競爭從單芯片轉向系統工程

華為正式發表昇騰960超節點運算架構,標誌AI算力競爭從單晶片轉向系統工程。該系統透過高速互聯與分布式計算最佳化,解決大規模訓練的延遲與調度問題,滿足千億參數模型需求。此舉反映華為在晶片供應受限下,以系統層級整合提升整體效率,拓展差異化競爭優勢。

1 天前
鈦媒體AI硬體

超節點如何成為AI算力的新答案?丨ToB產業觀察

Leo張ToB雜談2026.09.17 11:49 · 來自北京全文4763字00:00 / 14:22超節點的故事,就像是AI產業從“拼單點”走向“拼系統”的縮影。2026年,國產算力領域最火的一個詞非超節點莫屬。這個看起來有些技術化的名詞,正在悄悄改變算力世界的底層邏輯。

1 天前