谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏

谷歌 DeepMind 近日發表了一項名為 GenCeption 的創新模型,這項技術打破了傳統計算機視覺領域「一個任務一個專用模型」的格局,僅靠單一模型就能同時勝任深度估計、圖像分割、3D 姿態估計、表面法線預測與相機姿態估計等多項核心視覺任務。根據科技媒體 The Decoder 在昨日(7 月 20 日)的報導,GenCeption 的核心思路是將一個預先訓練好的影片生成模型,逆向改造成能夠理解世界視覺資訊的分析引擎,從而為計算機視覺帶來全新的發展路徑。在當前的人工智慧領域,大語言模型已經展現出極強的泛化能力。
這類模型在學習預測下一個 token 的過程中,會自然吸收語法規則、世界知識與上下文關係,因此能夠靈活應對多種語言任務。然而,計算機視覺領域的發展路徑卻截然不同。傳統的視覺模型大多採用專用架構,例如專門負責分割的「Segment Anything」以及專門負責深度估計的「Depth Anything」,每個模型都只針對單一任務進行最佳化,彼此之間無法共用知識或架構,導致開發與部署成本居高不下。Google DeepMind 團隊提出的 GenCeption 模型,正是為了解決這個瓶頸。他們選擇以阿里巴巴開源的影片生成模型「通義萬相 Wan2.
1」系列為基礎,利用其強大的生成能力,並將其反向應用於視覺理解任務。不同於傳統擴散模型需要透過多步去噪程序才能產生結果,GenCeption 僅需一次前向傳播(one forward pass)就能完成預測,大幅提升了視覺任務的處理速度,同時也降低了運算資源的需求。GenCeption 的操作方式相當直覺:使用者只需透過文字提示(text prompt)指定任務類型,模型便能自動輸出對應的視覺資訊。例如,它可以輸出深度圖(depth map)、表面法線圖(surface normal map)、分割掩碼(segmentation mask),甚至還能處理相機運動的表示。
這表示同一個模型可以同時擔任深度感測器、影像分割器與姿態估計器,不再需要為每個任務分別訓練與部署不同的專用模型。這項技術的突破在於,它打破了生成式模型與判别式模型之間的壁壘。過去,影片生成模型主要被用來創造新的視覺內容,例如根據文字描述生成動畫或影片片段;而 GenCeption 則證明,這些生成模型在訓練過程中其實已經學會了豐富的視覺結構與空間關係,只要適當地調整輸出方式,就能將這些內部知識轉化為精確的視覺分析結果。換句話說,生成影片的 AI 模型本身就具備理解世界的能力,只是過去沒有人想到要反向利用它。值得注意的是,GenCeption 採用的基礎模型是阿里巴巴的開源影片模型 Wan2.
1。這項選擇不僅展現了 Google DeepMind 對開源社群的重視,也凸顯了跨平台合作的可能性。Wan2.1 本身具備強大的影片生成能力,能夠處理複雜的動態場景與時序資訊,而 GenCeption 則進一步將這些能力延伸到靜態影像的深度理解上,使得模型在面對不同視覺任務時都能保持穩定的表現。從實際應用角度來看,GenCeption 的出現可能為機器人視覺、自動駕駛、擴增實境(AR)與醫療影像分析等領域帶來新的解決方案。
過去,這些領域往往需要同時搭載多個專用模型,才能完成環境感知、物體辨識與空間定位等工作;現在,一個 GenCeption 模型就能一體化處理這些任務,不僅簡化了系統架構,也降低了維護成本與能耗。特別是在邊緣運算裝置上,單一模型的優勢更加明顯,因為它不需要在記憶體中同時載入多個大型模型。此外,GenCeption 的一次前向傳播特性也讓它在即時應用中佔有優勢。傳統擴散模型為了達到高品質的生成結果,往往需要迭代數十步甚至上百步的去噪過程,這對即時性要求高的場景(如機器人導航或自動駕駛)來說並不實用。
GenCeption 跳過了這個冗長的流程,直接從輸入影像與文字提示中產生最終的視覺分析結果,使得反應時間大幅縮短,更接近人類視覺系統的即時感知能力。Google DeepMind 團隊在發表論文中詳細展示了 GenCeption 在多項標準基準測試中的表現,包括深度估計的準確度、分割的邊界清晰度以及姿態估計的誤差率。結果顯示,儘管 GenCeption 並非為單一任務專門設計,但在多數任務上都能達到與專用模型相當甚至更優的水準,尤其是在跨任務的泛化能力上表現突出。這也證明了「生成模型反轉為理解模型」這條路徑的可行性。
整體而言,GenCeption 的推出象徵著計算機視覺領域正從「專用模型時代」邁向「通用視覺模型時代」。未來,或許我們不再需要為每個視覺任務開發獨立的模型,而是像大語言模型一樣,用一個統一的架構處理所有視覺理解需求。這項技術不僅為研究人員提供了新的思考方向,也為產業界帶來了更高效、更經濟的部署選項。隨著開源生態的持續發展,類似 GenCeption 的跨界模型有望在更多場景中落地應用。
Related
相關文章

試圖擺脫“變態眼鏡”之名,Meta AI 眼鏡升級後擋住指示燈就立即停止拍攝
作者:清源 責編:清源 評論: 8 月 28 日消息,據外媒 The Verge 今天(28 日)報道,Meta 為旗下 AI 智能眼鏡推出了一項更新,旨在修補一個與拍攝指示燈有關的隱私漏洞。此前,佩戴者在開始錄像後再遮住正面的 LED 指示燈,攝像頭仍能繼續工作。

高德發佈首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,以12幀重建萬幀3D場景
阿里巴巴集團旗下高德發布首個無長程依賴的萬幀級流式3D重建模型ABot-Recon。該模型能以12幀輸入重建萬幀3D場景,為業界首見。此技術突破長程依賴限制,有助於提升3D重建的效能與即時性。

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。