剛剛,華為昇騰960超節點提前登場!韜定律立功性能翻倍,劍指英偉達

2026年9月17日 05:34
站內 AI 整理稿

作者 | 李水青 編輯 | 心緣 9月17日上海報道,昨日,華為監事會主席郭平關於“華為ICT與計算的目標是成為‘英偉達’”的內部訪談內容剛剛刷屏,今日,華為就對外放出了憋了一年的算力“大招”。在剛剛開幕的華為2026年全聯接大會上,華為靈衢互聯架構及超節點集群方案重磅亮相,華為推出了昇騰960DT芯片、昇騰960超節點、鯤鵬950超節點升級、OceanStor M900記憶存儲、靈衢全光交換設備等一系列AI基礎設施新品。華為副董事長、輪值董事長汪濤現場宣佈,昇騰960DT芯片將提前就緒。該芯片支持2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,相比上代實現翻倍性能。

汪濤稱,該芯片目前研發超預期,預計2027年一季度將就緒。華為昇騰系列芯片的提前就緒離不開韜定律。依託這一 “時間縮微” 替代 的創新方向,華為昇騰系列芯片將繼續堅持一年一代的演進節奏。在2028年和2029年,華為將陸續推出昇騰970和980芯片,來實現算力性能繼續翻倍。汪濤還透露,華為昇騰910C超節點已部署超過1000套,昇騰950超節點已經開始規模商用。本次發佈的更深層焦點——靈衢UnifiedBus,是華為整個算力底座的統一互聯總線協議。

華為常務董事、ICT BG CEO楊超斌在演講中提到,基於靈衢UnifiedBus的單集群可支持100萬顆AI處理器,10萬卡集群的模型浮點算力利用率(MFU)從20%提升至35%。汪濤談道:“AI變革的速度超過歷史上任何一次技術革命,智能世界正加速到來。”強大的AI基礎設施是智能世界的堅實底座,為此華為堅持聚焦打造智能世界的硅基黑土地,包括“AI戰略的核心是算力,堅持硬件變現”、“超節點+集群,打造中國堅實算力底座”等七大戰略。生態方面,汪濤宣佈華為昇騰已經跨越生態拐點,CANN社區月活開發者突破5000多名,外部開發者首次超越了內部開發者,佔總開發者數量的61%。

華為鯤鵬生態全球開發者超過了416萬,支持了560多個全球的開源項目;openEuler(開源歐拉)的裝機量也超過了2000萬套,成為中國服務器操作系統份額第一。一、打破10萬卡集群通信牆,華為憋了一年的大招來了 大模型邁向10T級參數規模,超節點是AI基礎設施建設的必然選擇。汪濤認為,10萬卡算力集群即將成為訓練SOTA模型的標準配置,但也面臨巨大挑戰:大規模跨節點通信開銷巨大,導致MFU(模型浮點算力利用率)提升困難,集群整體有效算力遠低於卡數簡單相加的理論值。因此,圍繞減少通信佔比來優化計算系統架構,是構建一套高效率的AI基礎設施的合理技術選擇。

華為的超節點設計的理念,是以一套協議平等連接超節點內所有組件,支持跨物理服務器的統一內存編址,並採用近銅遠光的這種互聯方式,從而使數萬顆芯片之間的通信有近乎線性的帶寬與時延。它像一臺計算機一樣工作,能夠有效提升MFU。為了打造這套複雜的系統,首先要有能夠平等連接集群內所有組件的互聯協議。這就是華為在去年HC大會上推出的靈衢UnifiedBus,相關技術規範已經全面開放。今天,以靈衢UnifiedBus為核心的全新超節點“全家桶”重磅登場。

二、靈衢一統、11芯撐起、昇騰960面世:華為超節點衝向百萬卡 汪濤繼續談道,基於靈衢UnifiedBus,華為目前已打造了超節點和超節點集群開發11顆關鍵芯片。1、11顆芯片撐起超節點,昇騰960DT來了 在所有芯片中,昇騰芯片是整個系統中的核心部件。汪濤現場宣佈推出昇騰960DT芯片。該芯片支持2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,片上HBM最大可支持288GB,帶寬可以支持到9.6TB每秒,能實現翻倍性能。該芯片目前研發超預期,比原計劃目標提前三季度,預計2027年一季度將就緒。

昇騰960PR將進一步支持8 PFLOPS的FP4算力,比原計劃提前一季度,預計2027年的三季度可以準備就緒。未來,華為昇騰系列芯片將繼續堅持一年一代的演進節奏。在2028年和2029年,華為將陸續推出昇騰970和980芯片,依託韜定律的創新方向來實現算力規格繼續翻倍,仿真帶寬、仿真容量、互聯帶寬等也會大幅提升。汪濤還現場展示了基於靈衢UnifiedBus的超節點集群11顆關鍵芯片,主要包括以下四類: (1)計算類芯片,包括鯤鵬CPU、昇騰NPU,它是關鍵的計算芯片,承擔著最重要的計算功能。

(2)互聯類芯片,它不僅有Scale-out平面,大容量的交換芯片,更要有Scale-up平面的低時延的交換芯片。同時它面向未來跨櫃的高速互聯,還必須要有能夠實現高速光互聯的芯片。(3)存儲類的芯片,除大家熟知熟知的介質控制控制器芯片。華為為AI的KV Cache專門打造了Smart Storage Unit,以實現平等的一跳直達的緩存系統。(4)還有各類管理功能的套片,來實現複雜系統中各方面的協調與管理。汪濤稱,正是有了這11顆關鍵芯片,華為才能夠為AI打造更有競爭力的超節點和集群。

2、推出業界首個量產NPO,昇騰960超節點衝上4096卡 電互聯無法支持跨櫃超節點,更大規模的超節點需要光互聯技術持續創新。為此,華為今日宣佈推出業界首個量產NPO(近封裝光學)光引擎——Hi-ONE,以“靈衢UnifiedBus+Hi-ONE”構建可規模擴展的超節點互聯繫統。汪濤宣佈,全球首個7.2Tbps NPO光引擎Hi-ONE實現規模量產,這是業界首個量產的NPO產品,是目前行業最大傳輸能力的NPO產品,也是唯一實現內置光源的NPO產品,它能把高帶寬、高可靠、低時延和低功耗完美的融為一體。今日,華為還正式推出業界首個採用NPO的超節點——昇騰960超節點。

單個昇騰960超節點可實現4096卡規模,最大可提供8 EFLOPS FP8的算力,實現高達1PB的HBM容量,系統無故障運行的時間提升1倍,系統可用度可以達到99.8%。昇騰960風冷超節點和液冷超節點分別將於2027年Q2和Q3上市。3、鯤鵬超節點:4096節點、256TB統一內存池,Agent啟動快30倍 海量Agent併發與交互,需要通算超節點,為此華為鯤鵬超節點全新升級。隨著Agent應用的深入,智算系統中CPU和NPU的計算負荷發生了較大的變化。一方面,多Agent交互需要秒級啟動、數十萬個沙箱,需要毫秒級的沙箱拉起的速度。

同時多Agent的海量信息檢索也需要與之匹配的向量檢索性能,單服務器需要數十萬的TPS(每秒事務處理數)。為此,華為將超節點的架構引入了通算系統,通過超節點的內存統一編制,把多臺通用算力的服務器的內存形成一個統一的共享內存池,可以顯著提升Agent沙箱啟動的速度和提升Agent向量檢索的性能,並提升整個AI Infer的資源利用效率。去年,華為發佈了全球首個通算超節點——泰山950 SuperPoD,很多客戶進行了規模部署。今天,鯤鵬超節點將全面升級,基於靈衢,最大支持4096節點,形成高達256TB的統一內存池。鯤鵬超節點可顯著加速Agent的性能。

10萬級別的沙箱啟動,相比傳統服務器方案提升30倍,沙箱密度進一步提升25%;在複雜的向量檢索場景下,實現檢索效率比傳統服務器性能倍增,達到30萬TPS。4、推出AI記憶存儲方案,KV Cache時延降超50% Agent與長序列需要多層次KV Cache架構,華為基於靈衢打造了AI記憶存儲OceanStor M900。華為OceanStor M900搭載靈衢UnifiedBus總線,支持直連華為L3.5層的PB級KV Cache解決方案。業界通常採用是PCIe加RoCE互聯的L3.

5層的存儲系統,其GPU或NPU訪問SSD池需要5次數據搬運,華為的OceanStor M900只需要1次數據搬運,I/O時延和首token時延可降低超過50%。同時華為的OceanStor M900可將SSD的讀寫壽命提升16倍,從底層來保障KV Cache的高命中率和常溫可靠。▲OceanStor M900液冷節點 5、靈衢+二層CLOS組網,華為打造100萬卡超大規模集群 基於靈衢UnifiedBus+二層CLOS靈活組網,華為打造了100萬卡的超大規模集群。超節點集群是由多個超節點通過Scale out網絡交換機互聯形成的一個大的集群。

昇騰960超節點最大規格為4096張NPU卡,多個NPU超節點通過華為的靈衢網絡來連接在一起,能構建一個更大規模的超節點集群。超節點集群支持多種組網模式:一是採用兩層CLOS單平面組網,華為可以實現3.2萬張昇騰960卡的高效互聯。二是採用兩層CLOS多平面組網,華為最大集群規模可達到51.2萬張昇騰960。華為要發揮“計算+通信”綜合優勢,打造Agentic時代的超節點集群,加速10萬億大模型訓練和推理。這樣的超節點集群具備三大特徵: (1)以靈衢UnifiedBus來統一互聯,把多種互聯協議統一為靈衢協議,來大幅度減少協議的轉換開銷。

(2)它將昇騰超節點、鯤鵬超節點以及KV Cache等子系統對等互聯。(3)華為能提供多層次高帶寬大容量的存儲系統,且各類KV Cache均可一跳直達,來滿足系統中各類熱溫冷的KV Cache需求,最大化來提升整個資源的利用效率。二、四大舉措推進AI入端、上車、進家,構築新一代通信網絡 輕量化終端,也會成為智能入口。過去,傳統的終端為用戶提供單體功能。未來,AI將重構終端和人機的關係,圍繞人來構建融合的智能空間。人和智能體要相互生,AI入端正在全面加速。

以手機為例,端側模型的參數從2026年到2030年將實現10倍的這樣的躍遷,從17B-30B將很快提升到70-100B,端側的算力也有望從20-80Tops提升到180-200Tops。華為將從四個方面來構建能力: 1、通過“麒麟+昇騰”組合,來實現端側算力的自給自足。2、通過“盤古+三方大模型”來實現端側智能,好用易用。最近,華為在全新發布的華為Mate X2非凡大師上,首先商用了原生的盤古MoE全國產大模型,參數量為30B,激活參數為2B,主打智能、安全、快速。

3、HarmonyOS不僅是萬物互聯的操作系統,也將是智能無處不在的Agent OS,華為將從系統底層架構、運行機制、交互邏輯方面全面重構,來支撐Agent和人共生共用。4、華為豐富的AI生態,是小藝系統智能體的枝繁葉茂的基礎。今年6月華為開發者大會上,華為發佈了鴻蒙智能體框架,將全面開放北向應用和南向設備AI接入的能力。華為將重點圍繞智能手機、AI PC、車和家庭場景來打造四大端側算力平臺,通過端端算力的協同和端雲算力的協同來,構築分佈式的群體智能,圍繞個人移動空間、辦公空間、車空間和家空間,提供一體的、連續的智能服務。物聯生態方面,開源鴻蒙生態規模已經超過13億。

汪濤稱,AI Coding大幅提升了華為終端的開發效率,輕智能終端的時代已經來臨。圍繞“用算”,汪濤最後還提出構築新一代通信網絡,將算力連接在一起,最終形成硅基黑土地。他提到。AI時代的通信網絡將圍繞運算,以及5G或6G、萬兆光網等新興通訊技術,從中心到邊緣、再到終端,面向不同用戶按需提供網絡的連接能力,保障智能觸達每一個人、家庭和企業。三、華為鯤鵬開發者超416萬,昇騰跨越生態拐點,私有云公有云兼顧 構建開源開放的算力生態,是華為的核心戰略。汪濤宣佈,截至目前,華為鯤鵬生態全球開發者超過了416萬,全球生態合作伙伴超過了7200家,支持了560多個全球的開源項目。

openEuler(歐拉)的裝機量也超過了2000萬套,成為中國服務器操作系統市場份額第一。同時,華為昇騰已經跨越生態拐點。CANN已成為中國最活躍的AI開源社區,社區月活開發者突破了5000多名,外部開發者首次超越了內部開發者,佔總開發者數量的61%;基於昇騰的原生訓練模型已超過40個。其生態已經覆蓋了90多個主流的三方社區,如PyTorch、Triton、vLLM、VRR等,在Linux基金會的大力支持下,昇騰已經成為繼英偉達、AMD和英特爾之後,在PyTorch官網上可以直接安裝的算力平臺。當前AI算力仍處於供不應求的狀態,如何提升算力利用率,是AI產業發展我們面臨的共同的挑戰。

不同的應用場景、不同的創新模式、不同的智能化階段,對算力供給的模式提出了多樣性的需求。汪濤稱,華為面向千行百業打造硅基黑土地,通過算力基礎設施和雲服務兩種方式,也就是兩套核心能力,以靈活的算力供給來滿足客戶的智能化需求。結語:靈衢破牆,華為要重做Agent時代的算力底座 從靈衢打破通信牆,到11顆芯片撐起超節點,再到百萬卡集群與開源生態跨越拐點,華為正以“計算+通信”的垂直整合能力,為10萬億級大模型時代構築算力底座。當算力供給從“賣卡”走向“賣集群”、從“硬件變現”走向“生態共贏”,AI基礎設施的競爭已升維為體系化能力的較量。華為的硅基黑土地,正試圖為智能世界提供另一種堅實選擇。

Related

相關文章

全天候科技AI硬體

華為昇騰960超節點落地 AI算力競爭從單芯片轉向系統工程

華為正式發表昇騰960超節點運算架構,標誌AI算力競爭從單晶片轉向系統工程。該系統透過高速互聯與分布式計算最佳化,解決大規模訓練的延遲與調度問題,滿足千億參數模型需求。此舉反映華為在晶片供應受限下,以系統層級整合提升整體效率,拓展差異化競爭優勢。

1 天前