深度解讀:智譜為什麼要在 Infra 層搞 RSI?

本文作者: 高允毅 2026-09-18 14:48 導語:電話會揭秘智譜策略,以遞歸式優化跑贏300億算力成本戰。電話會揭秘智譜策略,以遞歸式優化跑贏300億算力成本戰。作者丨高允毅 編輯丨岑 峰 9月17日,唐傑罕見的發了一條長推,這次他聊的是最近最火的話題之一:RSI。智譜也在暗暗發力RSI,他們已經把RSI放到了Infra層面,做出一套由GLM-5.3驅動的推理基礎設施。正是這套Infra系統,讓 GLM-5.3-Flash,即前段時間火遍全球的匿名模型 Ox-Alpha,在發佈一週內,就迅速成為了全網使用最廣泛的模型之一,短短六天內處理了超過 62萬億個 Token。
更具有里程碑意義的是,這一切,全是在十萬張國產芯片上跑出來的。要知道,我們過去一直難以擺脫對英偉達的依賴,正在於國產芯片底層軟件生態的薄弱,這中間有無數難以想象的算子兼容與通信難題。再加十萬張芯片這個量級,難度是呈指數級上升的,在這樣的集群裡,每天都可能有幾百張卡發生硬件故障、網絡掉線或數據丟包。而唐傑透露,從第一次全量跑通到把全部的真實生產流量切過去,智譜居然只用了短短兩週。這在以往,需要一支經驗豐富的基礎設施工程師團隊花費數週甚至數月才能完成。面對硬件生態的不完美,智譜用軟件給硬件“打補丁”並做到了極致優化。不僅讓大模型順利跑通,更使端到端吞吐量直接提升了 3.2 倍。
這背後體現了智譜的一個核心判斷:在算力受到外部嚴格限制的情況下,中國 AGI 能否取得突破,關鍵除了擁有多少芯片,而在於能否通過軟件更高效地調動和利用算力。智譜此舉,實質上是希望藉助 RSI 建立一種“底層解耦”的能力,使 AI 能夠自主適配不同硬件生態,跨越硬件之間的兼容障礙。也就是說,智譜正試圖把“國產算力不好用”這一行業難題,轉變為“由 AI 自動挖掘硬件極限”的技術主動權。國產芯片集群、由 AI 深度參與的 Infra 系統、全球出圈模型,這三件事組合在一起,連唐傑忍不住感慨:我們距離RSI的終局還相差甚遠,但那個 “模型優化系統、系統反哺模型” 的最小循環,已經真實地轉動了起來。
01十萬張國產芯片集群:一場沒有參考答案的部署硬仗唐傑表示要在十萬張國產芯片,把一個大模型真正跑通、部署好,這並非易事。這個事至少有三個坎,每個都足以拖垮一支經驗豐富的工程團隊。首先,國產芯片的內存和數據傳輸速度天生就有限,不能直接照搬英偉達那套成熟經驗。其次是軟件棧極不成熟,很多底層組件缺失。這裡缺乏現成的運維手冊,很多關鍵算子沒有現成實現,大量底層文檔甚至常常只能靠“猜”去推測和驗證。此外,還要考慮模型本身的負載極限。GLM-5.3-Flash 是全新架構,既要同時處理文字和圖像,還要處理 100 萬 token 的超長上下文。這意味著 KV 緩存的容量壓力會呈幾何級暴漲。
智譜的解法是用 GLM-5.3 驅動的Infra Agent,把幾個關鍵技術融合一處,用軟件工程能力補硬件短板。比如,用通信換內存。採用“節點內張量並行”與“層分割”,把模型按層拆分,同時在單個服務器內讓多張芯片共同分擔最核心的注意力和輸出計算。用計算換內存。開啟 ReplaySSM 策略,內存裝不下時先把數據丟掉,等用到的時候再讓芯片當場現算,用極短的計算時間換取寶貴的內存空間。用精度換容量。
採用 W8A8 量化,把模型權重和激活都壓縮到 8 位,直接砍掉一半以上的存儲和帶寬佔用;再把最佔空間的 KV 緩存,根據數據重要程度混用 INT8、FP8、BF16 三種精度進行動態壓縮,把每一卡顯存都利用到極致。在此基礎上,他們進一步把編碼、預填充、解碼三個階段徹底解耦,用解耦換調度自由度。再加上 Infra Agent 的快速迭代,使得國產芯片利用率、單 Token 成本逼近英偉達的水平。但最重要的問題在於,當 Infra Agent 陷入停滯時,往往不是因為寫不出代碼,而是它不知道 “為什麼情況變得更糟了”。
真實的推理系統不是一段靜態的代碼,而是從底層芯片、網絡通信、內存分配到上層服務動態交織的“複雜生態”,任何一個微小的環節偏差都會引發連鎖反應。在系統工程裡,這被稱為“稀疏反饋”。系統只會甩出一個結果,“吞吐量下降 20%”。但你並不知道,問題究竟出在底層代碼、內存調度,還是數據傳輸?是哪一次改動引發了崩潰?下一步又該往哪走?如果讓AI去找問題,每次都要耗費數小時跑一遍完整的測試,極高的試錯成本讓 AI 的探索過程極其漫長。傳統的系統優化其實不缺工具,日誌、測試、性能分析滿天飛,但它們全都分散在不同的工程階段裡。如果是有經驗的Infra工程師,他們會有“工程直覺”判斷問題所在。
智譜想做的,就是把這個“工程直覺”邏輯量化,做成一套反饋機制,讓AI可以追蹤溯源問題所在。這個定位要足夠精準,成本低廉且及時,還經得起驗證。在智譜看來,未來大廠之間的代際差距,將由“模型參與構建自身系統的深度”來決定。誰能率先跑通“模型訓練 Infra”的閉環,誰就能獲得智力增長的複利,從而在物理算力受限的情況下實現非線性的超車。對此,智譜給出的答案,是一套叫“密集反饋”(Dense Feedback)的分層驗證體系。02密集反饋:AI版Infra工程師智譜把“密集反饋”拆成三部分,分別是正確性反饋、系統行為反饋、性能反饋。
它們對應的是Infra系統中三個底層問題,“算得對不對”、“卡在哪一步” 以及 “哪種解法最優”。這就像一個資深的推理工程師,突然遇到告警,他會腦中自動彈出一條排查路徑。要想理解智譜這套體系,我們不妨跟著三個真實的工程案例,看看人類工程師的工程直覺,是怎麼被編碼成 AI 的能力的。▎案例一:長上下文精度漂移(正確性反饋)在處理長上下文時,為了讓多張芯片同時幹活,系統會把長文字切成好幾段,每張芯片算一段,最後再把各段的結果“拼接”起來。這種情況容易出現“長上下文精度漂移”,模型輸出的結果偏差越大。
如果是資深Infra工程師,會順著執行鏈路一步步去抓中間結果、拉誤差曲線,排查到底是哪一次“拼接”汙染了數據。智譜把這套排查邏輯,沉澱成了正確性反饋體系。AI 像拿著顯微鏡一樣,一眼看到是 KDA 內核在底層默認採用的計算精度,導致了舍入誤差“滾雪球”累積。鎖定問題後,AI 自動從開源經驗庫中匹配方案,把計算顯式升級為更高精度的組合算法,從而解決問題。▎案例二:KV 傳輸併發瓶頸(系統行為反饋)系統在做大模型推理時,有一步叫“Prefill(預填充)”,就是先把用戶的提示詞理解一遍,並生成需要的緩存。理想情況下,系統應該“一邊用 GPU 計算,一邊跨節點搬運緩存數據”。
然而結果顯示,兩者加起來的總時間,比單獨做計算慢了整整 20%。這意味著搬運基本是在“排隊等”,沒有和計算同步進行。面對這種問題,傳統的排查方式極其痛苦。工程師需要拉出一張巨幅的“全鏈路時序圖”去人眼檢查時間線,甚至得跨語言去翻看底層通信庫(DeepEP)的 C++ 源碼,盲猜是不是全局解釋器鎖(GIL)忘了釋放,導致負責搬運的 Python 線程被卡死。智譜把這套排查邏輯做成了“系統行為反饋體系”,相當於給 AI 裝了一臺“全鏈路 X 光機”:它會自動拉取執行時序,看計算和通信有沒有重疊。一旦發現該重疊的沒重疊,直接在時序圖上把異常時間片標紅。
發現異常後,AI 會順著調用鏈一路往下追,跨過 Python 和 C++ 的語言邊界,直接鑽到最底層的接口實現裡去檢查鎖的狀態。定位到問題後,它會自動給出修復方案,並且用“時序 + 性能”兩個標準一起驗證:既要看時間片有沒有真的重疊起來,也要看端到端性能有沒有真的提上去。這樣原本需要數天才能解決併發問題,AI幾秒內就能快速解決。▎案例三:解碼內核冗餘計算(性能反饋)模型在生成文字時,會調用一個核心計算模塊(解碼內核)。如果這個模塊跑得不夠快,會拖慢整體速度。資深的Infra工程師會去肉眼翻看底層的彙編或算子代碼。
為了讓多張芯片同時以最高速幹活,系統通常會採用“分塊(Tiling)”策略,把一個龐大的計算任務切成四個小塊同時推進。這會導致一些本來只需要算一次的公共步驟,可能會重複計算四次。這是典型的“為了並行而並行”。智譜把大量內核優化裡的通用套路,變成了可複用的“優化模板庫”,再配合性能反饋體系,讓 AI 擁有了一套自動化搜索引擎:首先,性能反饋會先判斷瓶頸在哪。然後,AI 會去“優化模板庫”裡找匹配的套路。這個庫是 AI 讀遍了 SGLang、Flash Linear Attention、DeepGEMM 這些項目裡高手手寫的內核,提煉出來的通用優化骨架。
當匹配到對應場景後,AI 直接套用這個思路重構代碼,跑個小規模測試驗證效果,把有效的保留下來,並反哺回模板庫,讓它變得越來越強。從定位問題、檢查問題到解決問題,在工程層面,AI 的排障能力已經深入算子精度層,跨越了語言邊界,而那些成功優化出的經驗,正在以前所未有的速度形成複利效應。Infra的RSI將是如此景象,AI工程師具備了資深系統工程師的診斷能力,可以在工程層面,更快更細緻地去執行。而人類工程師把關風險和業務決策,Infra系統進化成可以高速運轉流水線。
03 從“賣工具”到“賣效率”:被訂單倒逼出的 RSI智譜過去一直憑藉強悍的 Coding 能力被稱為 “國內版 Claude”,瓜分了國內大部分Coding市場。但今年以來,這家大模型公司明顯把大量精力砸向了底層 Infra。為什麼智譜今年會做出如此重大的戰略轉向?從9月16日,智譜面向投資者舉行電話溝通會中,我們可以窺見一二。智譜高層表示,今年 2 月 GLM-5 發佈後,市場需求迎來大井噴,調用量瞬間暴增 10 倍,導致發佈當週的算力儲備就被徹底耗盡。受限於極度緊缺的算力,智譜甚至被迫緊急停售了其主力賺錢產品 Coding Plan。
受限於算力緊缺,智譜只能選擇 “All-in-Infra” 策略,併火速收購了中科加禾,把整體算力使用效率提升了 2-3 倍。但即便如此,依然填不上 Coding 需求暴漲的缺口。智譜的核心增長約束就是算力,只要給它足夠的算力,它就能立刻把產品賣出去換成真金白銀。事實也很快驗證了市場的預判。7 月,智譜 40 億美元融資到位後,智譜立刻全面重啟 Coding Plan 銷售。這是停售半年後首次完全開放,銷量直接增長超過 15 倍,再次驗證了“有多少算力,就有多少收入”的邏輯。智譜高層算過“算力”這筆賬。
如果前期採取飽和投入,重金砸下 300億元 算力,其中40%用於模型訓練、60%用於推理服務。一旦這60%的推理算力全價打滿,憑藉 GLM-5.3 理論上高達 80% 的超高毛利率,年營收能直接衝上 400 億元。這意味著,僅需一年,智譜就能不僅收回全部算力成本,還能順便覆蓋掉訓練研發的費用。對比來看,如果只保守投入 100 億元,必然會導致研發受阻、訂單流失,陷入“兩頭落空”的窘境。因此,對大模型公司而言,必須堅定選擇算力的規模化擴張(Scaling),沒有退路。為此,智譜布了三層牌。
首先,智譜搭建 1GW 級的超大算力數據中心,解決算力“有沒有”的問題,另一方面用全國產芯片,控成本,解決自主可控的長期風險。其次,採用雲分成模式,把開源模型變成雲貨架上的商品。智譜已經和多家海外巨頭雲服務商、國內頭部雲廠商簽署了收入分成協議:GLM 系列開源模型以託管 API 的形式上架各大雲平臺,收入從 10 月起正式確認。這相當於把算力壓力、運維成本、全球分發全部外包出去,智譜自己輕資產變現。另外,在企業級 Co-work(協同工作)賽道上,GLM-5.3 最先跑通網絡安全場景。目前已有 100 家安全企業接入 GLM 模型,覆蓋主流安全廠商、互聯網大廠、研究機構、金融機構。
根據 Gartner 的預測,2026 年全球信息安全終端支出將達 2489 億美元,2030 年更將達到 3726 億美元,這給智譜留下了巨大的想象空間。說到底,智譜重投 Infra,正是 Coding 需求爆發後的必然延伸。參考鏈接:https://z.ai/blog/glm-built-its-inference-infrastructure上車,(公眾號:)帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。原創文章,未經授權禁止轉載。詳情見轉載須知。
0人收藏 分享: 相關文章 智譜 Infra RSI 在 AI「囤糧潮」裡,拆解智譜 50 億美元的「技術賬本 ...規模要追平智譜!DeepSeek今年將擴招到1000人;繼姚 ...商湯大裝置支撐智譜 GLM-5.3-Flash上線,國產異構助 ...像素級對標?智譜、Kimi 底層參數「撞衫」背後,藏著 ...高允毅 編輯 發私信 當月熱門文章 GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?深度解讀 DeepSeek V4.
1 Flash 全新架構,如何成為顯存殺手 Anthropic 再定統一標準:MHS,打通 AI 與物理世界的統一接口 Harness 神器 J-Space 造假案背後,思維鏈作者暴論,小模型 + 工具幹不掉頂級大模型 最新文章 工作流可以自我進化了,英偉達開源 SoL-Pi,每小時省13.5刀!深度解讀 DeepSeek V4.1 Flash 全新架構,如何成為顯存殺手 打穿 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?GPT-6 砍掉思考 Token,俄羅斯人砍掉通信 Token,Token 經濟開始崩了?
流沙之上:陳冕、景鯤、倪正民和中國 AI 應用創業者的三種選擇 我們拆了 1.1 萬個 DeepSeek Harness 插件,發現官方几乎沒有建立插件治理機制 熱門搜索 區塊鏈 DeepMind 天貓 AI芯片 量子計算 大眾 Galaxy S6 電信 李飛飛 數據科學 iPhone 7
Related
相關文章

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向
無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI, part of Elastic, has released jina-ocr-v1, an end-to-end visual document parser. It takes PDFs, scans, tables, charts or invoices and returns clean Markdown in 1 pass. The model has 3.

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作
作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

智譜 ZCode 被質疑“偷傳代碼”:官方回應稱問題已修復,將開源代碼庫、引入第三方審查
作者:清源 責編:清源 評論: 感謝網友 咩咩洋 的線索投遞!9 月 18 日消息,針對社區中有關代碼庫數據上傳的討論,智譜旗下編程產品 ZCode 今天(18 日)通過智譜官方群組向受影響用戶致歉,併發布回應稱已第一時間完成自查,相關問題目前已經修復。

月之暗面遞表之後,Kimi 的成色要被驗算三遍
舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"
這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。