微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換
重點摘要
AI資訊AI新閒資訊正文微軟首款自研全雙工 AI 語音模型曝光:聽說並行,16 種語言自由切換發布於AI新閒資訊時間 :Aug 4, 2026閱讀 :1分鐘科技媒體 TestingCatalog 報道,微軟正在測試其首款原生實時語音模型 MAI Realtime。
微軟首款原生全雙工語音模型「MAI Realtime」曝光,這款被視為打破傳統語音助手「對講機」模式的AI模型,正試圖讓機器與人之間的對話,從「輪流發言」進化為真正的「並行交流」。這項消息由科技媒體 TestingCatalog 率先披露,隨即引發業界高度關注,因為它不僅是微軟在語音AI領域的技術突破,更可能重新定義未來人機互動的樣貌。 長期以來,無論是智慧音箱、手機語音助理還是客服機器人,使用者都必須遵循一種固定的對話節奏:先等AI說完、再開口回應,彼此之間存在明顯的「話語權」交接。這種輪次交替(turn-taking)模式雖然成熟,卻也成了人機對話自然度的最大瓶頸。微軟此次曝光的 MAI Realtime 模型,則採用了雙向的全雙工(full-duplex)交互方式,意味著系統能在聆聽使用者說話的同時,即時產生並輸出語音回應,使用者無需等待AI把話講完就能打斷、插話,雙方的對話節奏將無限逼近真人互動。 這項技術突破的核心,在於一套精密的端點檢測(endpointing)機制。該系統能夠即時辨識語音信號中的開始、停頓與結束,當偵測到使用者中途插話時,模型會立刻調整當下的輸出內容,在「聽」與「說」之間達成近乎零延遲的同步切換。這也讓MAI Realtime成為微軟MAI語音模型家族中,首款具備雙向能力的原生模型——此前推出的 MAI-Voice-2 與 MAI-Transcribe-1.5,分別只能單向執行語音合成或語音識別任務,完全無法應付複雜的即時對話情境。 在語言支援方面,MAI Realtime 展現了頗具野心的全球化布局。據悉,該模型目前支援包含中文、英語、日語、韓語、法語、德語、阿拉伯語在內的16種語言。不僅如此,系統還提供兩種語言操作模式:使用者可以主動指定對話語言,也可以開啟自動檢測功能,讓模型在對話過程中即時識別語種,並於中途無縫切換。這項設計讓「中英夾雜」或「多語混用」的對話情境不再卡關,對跨國商務、旅行溝通與多語服務場景而言,具有相當實用的意義。 語音風格方面,測試版本目前提供 Victoria 與 Grant 兩種聲音。根據實際體驗者的描述,這兩款聲音的自然度與情感表現力,都比現行 Copilot 語音模式要來得更為流暢生動。不過,這款模型的定位仍被嚴格限制在「對話系統」範疇,它不會唱歌,也無法生成咳嗽、笑聲等非語音音效。換句話說,MAI Realtime 追求的是在人類真實交談的語境中,做到高度擬真的即時互動,而非打造成一個全能的聲音表演工具。 值得一提的是,MAI Realtime 的測試版本還配備了「調試面板」,可供開發者與測試人員即時查看包括延遲數據、模型內部思考內容與處理步驟在內的技術細節。這樣的設計,不僅有助於合作夥伴深入理解模型運作機制,也為後續優化提供了關鍵的數據支撐。官方也透露,樣本分享功能可望在測試範圍擴大後,向更多平台的用戶開放。 目前,微軟已經邀請部分合作夥伴,在自家的 MAI Playground 平台上進行內部測試。然而,關於何時正式上線 Azure AI Foundry、何時進一步整合至 Copilot 語音功能,官方並未給出明確時間表。外界普遍認為,這款模型的商用化路徑仍處於早期階段,但其所揭示的技術方向,已經讓AI語音市場的競爭進入新的層次。 將時間軸拉長來看,微軟這一連串動作,其實是其在AI戰略布局中的一環。從先前陸續推出的 MAI-Voice-2 與 MAI-Transcribe-1.5,到如今的 MAI Realtime,微軟正逐步搭建起從單向辨識、單向合成,到雙向即時對話的完整語音AI拼圖。而這背後,也反映出微軟執行長納德拉所強調的「多模型架構」思維,在自研模型之外,持續降低對單一AI實驗室的依賴,轉而走出一條更為自主的技術路線。 與此同時,微軟在雲端運算與AI投資上的雙線布局也正同步推進。據悉,微軟雲端年營收首度突破千億美元,而對 Anthropic 的投資更在單季貢獻了可觀收益。這些財務數據顯示,微軟正以「基礎設施+自研模型+多重夥伴」的組合拳,鞏固其在AI時代的關鍵地位。MAI Realtime 的出現,恰如其分地向業界傳遞出一個訊號:在語音互動領域,微軟不只滿足於追趕,而是準備好引領下一階段的變革。 過去幾年間,語音AI的發展歷經了從「聽得懂」到「說得好」的演進,如今則正式邁向「談得來」的全新階段。當機器不再只是被動等待指令,而是能以極其自然的節奏與人類同步「對話」,這對智慧客服、虛擬助理、教育訓練、醫療照護等場景都將帶來深遠影響。MAI Realtime 透過端點檢測、即時中斷回應與多語切換等技術,讓AI語音不再那麼像「機器」,而更像是真正能夠聆聽與回應的對話夥伴。 當然,從內部測試到全面商用,MAI Realtime 仍有諸多挑戰需要克服。語音的即時性對運算資源與延遲控制的要求極高,如何在多語言環境下維持穩定表現,以及在開放場景中避免誤判或對話混亂,都是後續必然要面對的課題。但可以肯定的是,微軟已用這款產品向市場宣示,語音AI的「對講機時代」並非不可撼動,一個近乎真人同步交流的嶄新篇章,正在悄然展開。
Related
相關文章

京東首次在校招流程中引入 AI 面試,面向 2027 年度本科、碩博研究生畢業生開啟網申
京東今日正式宣布開啟2027年度校園招聘,面向2027屆本科、碩博研究生畢業生開放網申通道。與往年相比,本年度校招最顯著的變化在於,京東首次在招聘流程中引入AI面試環節,這標誌著這家電商巨頭在人才選拔數字化轉型上邁出新的步伐。 據了解,本次校招崗位方向覆蓋採銷、物流、技術、產品、運營、設計、健康、工程、職能、保險與金融、市場與商務等多個領域,幾乎囊括了京東現有業務板塊的核心人才需求。無論是面向業務前線的採銷與物流崗位,還是面向技術底座的研發與產品崗位,都向2027屆畢業生敞開大門。

把學習筆記變為遊戲,谷歌 Gemini Notebook 新功能曝光
據外媒爆料,谷歌正在為 AI 筆記應用 Gemini Notebook 開發互動遊戲、可視化儀表等新功能,讓學習像玩遊戲一樣有趣。#谷歌Gemini# 未來可在筆記中直接創建閃卡、思維導圖等學習工具,所有內容與筆記本隔離。

訊飛 AI 眼鏡體驗:翻譯成熟完善,AI 助理近在眼前
AI 眼鏡賽道愈發火熱,科大訊飛今年 5 月推出了首款訊飛 AI 眼鏡,主打全場景翻譯功能。本文分享了實測體驗,這款眼鏡翻譯能力成熟,還加入了 AI 助理構建完整能力閉環。#科大訊飛AI眼鏡#

韓國國家 AI 計算中心動工,目標 2028 年建成
韓國國家 AI 計算中心(KOACC)於今日正式於全羅南道海南郡的 Solar City 數據中心園區舉行動土典禮,這座備受矚目的國家級人工智慧基礎設施,預計將在 2028 年完工並投入營運。根據韓媒《EtNews》報導,此項目的總投資金額高達 2.5 兆韓元,以當前匯率換算約合新台幣 590 億元、人民幣 118.38 億元,是韓國政府與民間企業聯手推動 AI 產業發展的關鍵一步。

閃極全新子品牌 loomos AI 眼鏡發佈會定檔 8 月 18 日
閃極宣布全新子品牌 loomos AI 眼鏡發布會將於 8 月 18 日舉行。該品牌先前已推出 loomos AI 拍攝眼鏡 L1 與 AI 顯示眼鏡 S1,售價分別為 2999 元與 3999 元,其中 S1 預計於 2026 年第三季開賣。

聯發科:第二款 AI ASIC 加速器有望 2028 年量產,英特爾代工 EMIB 進展良好
聯發科在財報會議上表示,第二款AI ASIC加速器開發順利,預計2028年進入量產階段,同時英特爾代工的EMIB先進封裝技術也穩步推進。首款AI ASIC加速器則預計於2026年第二季量產。聯發科也批准了50億美元資金以確保供應鏈並擴展系統級業務。