阿里發佈 Qwen3.8-Omni-Flash 全模態模型:音視頻能力提升,百萬 Token 圖文音視頻輸入 0.8 元

2026年9月18日 11:34
阿里發佈 Qwen3.8-Omni-Flash 全模態模型:音視頻能力提升,百萬 Token 圖文音視頻輸入 0.8 元
站內 AI 整理稿

阿里發布 Qwen3.8-Omni-Flash 全模態模型:音視頻能力躍升,百萬 Token 圖文音視頻輸入僅 0.8 元 阿里巴巴近日正式推出全新全模態模型 Qwen3.8-Omni-Flash,這款產品主打「全模態」能力,能夠在同一套模型架構下同時支援文字、圖片、音訊與影片等多種模態的輸入與分析,並且在音視頻處理能力上迎來顯著進化。相較於過去偏重文字或圖像的模型世代,此次發布被視為阿里在端到端全模態理解與生成領域的又一重要進展。所謂全模態,指的是模型不再將不同類型的資訊割裂處理,而是能在單一推理流程中,對文字、圖像、音訊、影片進行統一理解與交叉分析。

這意味著使用者可以一次丟入一段影片、搭配對應的語音與字幕文字,甚至加上截圖或參考圖片,讓模型綜合判斷內容,而不必分別調用不同的專用模型再自行拼接結果。在規格方面,官方數據顯示,Qwen3.8-Omni-Flash 具備高達 1M(百萬)Token 的上下文視窗。這一規模讓模型能夠一次處理大量圖文音視頻內容,對於需要長時間影片分析、長篇會議紀錄整理,或是跨多份素材比對的應用情境,提供了更充裕的處理空間,也減少了過去因上下文不足而必須分段處理的麻煩。阿里方面表示,這款新模型在整體全模態表現上較上一代產品大幅提升。其中最受關注的是音視頻能力,官方指出其水準已接近 Gemini 3.8 Flash。

音視頻同步理解一直是多模態模型公認的技術難點,因為模型不僅要辨識畫面內容,還要理解語音、語氣與時間軸上的對應關係,此次能力躍升顯示阿里在該領域的投入已見到成果。價格策略同樣是本次發布的焦點。Qwen3.8-Omni-Flash 的 API 調用成本降幅超過九成,百萬 Token 的圖文音視頻混合輸入僅需 0.8 元人民幣。對於需要大量調用多模態能力的開發者與企業而言,這樣的定價大幅降低了使用門檻,也讓過去因成本高昂而卻步的中小團隊,有機會將全模態能力納入自有產品。

從產業角度來看,如此激進的定價不僅反映出阿里在模型效率上的優化成果——包括架構設計、推理加速與資源調度等方面的進步,也進一步推升了市場上多模態 API 服務的價格競爭力。當頭部廠商持續壓低單位成本,整體生態的商業模式與應用邊界都可能隨之改寫。除了核心的多模態處理與低成本優勢,阿里千問團隊同時為該模型導入多項新功能,以滿足更多元的應用場景需求。雖然官方未逐一詳述每項功能的細節,但此舉顯示團隊並非只追求跑分與規格,而是同步強化實用性,試圖覆蓋從開發測試到正式上線的完整鏈路。在實際落地層面,全模態模型可望為多個領域提供更即時且經濟的解決方案。

以內容辨識為例,平台可透過模型同時分析影片畫面與語音內容,進行更精準的審核與分類;在智能客服場景中,模型能理解使用者上傳的圖片、語音甚至短片,提供更貼近需求的回應;而在多媒體分析方面,則可應用於影音摘要、素材檢索與跨模態搜尋等任務。值得注意的是,多模態能力與上下文視窗的同步擴張,正成為當前模型競爭的兩條主線。一方面,廠商比拚誰能處理更長、更複雜的混合輸入;另一方面,則比拚誰能把單位成本壓到最低,讓能力真正被規模化使用。Qwen3.8-Omni-Flash 在兩條線上都給出了明確答案,這也是其受到關注的原因。整體而言,Qwen3.

8-Omni-Flash 的推出,標誌著阿里在端到端全模態理解與生成領域的又一重要進展。它將音視頻理解、百萬級上下文與極低的調用成本結合在一起,對開發者生態與多模態應用市場都釋放出強烈訊號。隨著此類模型持續演進,內容辨識、智能客服與多媒體分析等領域,預料將迎來更多即時、經濟且規模化的創新應用。

Related

相關文章

IT之家模型更新

美國 AI 巨頭提議開發減速,歐洲同行和政界並不認同

作者:清源 責編:清源 評論: 9 月 18 日消息,據路透社今天(18 日)報道,此前,阿莫迪、奧爾特曼和馬斯克先後發出警告,能力不斷增強的 AI 系統可能帶來風險,故有必要控制其發展節奏,但歐洲企業和官員對此表現出明顯懷疑。法國初創企業 Mistral 在聲明中指出,這些風險早在幾個月前就已十分明確了。

1 小時前
IT之家模型更新

北京發佈“詞元經濟十條”:高標準建設詞元工廠,推動關鍵核心技術攻關

作者:浩渺 責編:浩渺 評論: 感謝網友 蛋殼兒 的線索投遞!9 月 18 日消息,北京市經濟和信息化局今日宣佈,北京市“詞元經濟十條”正式發佈。為貫徹落實《國務院關於深入實施“人工智能+”行動的意見》(國發〔2025〕11 號),率先培育智能經濟新形態,以詞元(Token)為抓手,發展詞元經濟新增量,制定《北京市加快詞元經濟發展的行動方案(2026—2028 年)》(注:以下簡稱《行動方案》)。

2 小時前
量子位模型更新

OpenAI剛曝光循環架構,這家公司更早將其用於世界模型

鍵詞只有一個:循環。 Astra採用了一種被稱為“循環深度”(Recurrent Depth)的架構,本質是讓同一組Transformer層被反覆複用,用更少的參數實現更深的計算。 這被外界視為OpenAI對傳統“堆參數、堆算力”路線的一次重大修正——不再只是把模型做大,而是讓模型學會“反覆思考”。 消息一齣,整個AI社區迅速升溫。

6 小時前

千問辦公接入高德門店經營專家套件 提升實體店選址與經營效率

此項新功能自9月18日起正式上線,用戶只需在千問辦公添加相應套件並完成高德賬號授權,即可實現從門店選址到日常經營分析的全鏈路工作。隨著實體商業的不斷發展,傳統的人工選址和經營分析方式顯得效率低下且容易出錯。個體創業者在開新店時,往往需要花費大量時間進行實地勘察,整體耗時可達一週,而商家在監測門店熱度變化及競爭對手動態時,也面臨數據整理繁瑣、分析結果不準確的問題。

7 小時前