打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。使用者只需輸入簡單的文字提示,例如描述場景或目標物體,模型便能精準輸出深度圖、分割掩碼以及相機運動軌跡等多種資訊。
這項設計讓 GenCeption 在實務應用上極具彈性,無論是自動駕駛、機器人導航、擴增實境還是影像後製,都能透過單一模型快速取得所需的視覺理解結果。值得注意的是,GenCeption 的訓練資料規模遠比外界想像的小。團隊僅使用約 7500 段由 Blender 渲染的單人合成視頻進行訓練,但模型展現出驚人的泛化能力。在實際測試中,它不僅能流暢處理真實世界中的多人視頻,還能輕鬆將分析能力遷移至動物與機器人類別。即便是細微的髮絲、動物的毛髮或機器人關節等細節,模型都能保留精確的輪廓與深度資訊,顯示其學習到的視覺特徵具有高度通用性。在處理速度方面,GenCeption 也交出亮眼成績。
根據團隊公布的數據,小模型處理 81 幀視頻僅需約 6 秒,而具備 140 億參數的大模型也只需要約 10 秒左右。這意味著即使在邊緣裝置或即時應用場景中,GenCeption 也能提供接近即時的視覺分析能力,大幅降低以往需要多個模型輪流運算所帶來的延遲與資源消耗。這項技術的誕生,源於 Google DeepMind 團隊對視頻生成模型潛力的重新思考。傳統上,視頻生成模型被視為創造內容的工具,但團隊發現,這些模型內部其實已內建對空間關係、物體邊界與運動軌跡的深刻理解。若能將這份理解反向提取出來,就能讓生成模型「看」懂世界,而非只是「畫」出世界。
GenCeption 正是這個概念的具體實現,它將生成過程中的中間表徵轉化為可用的視覺任務輸出,從而繞過傳統監督學習需要大量標註資料的瓶頸。對於機器人領域而言,GenCeption 的出現尤其具有意義。機器人需要在未知環境中即時感知深度、辨識物體、估計自身姿態,過去這些功能往往需要整合多個獨立模型,導致系統複雜且反應遲緩。如今單一模型便能同時提供深度圖、分割掩碼與相機軌跡,讓機器人能夠更快速且精準地理解周遭環境,有助於提升自主導航與操作的安全性。此外,GenCeption 的訓練方式也為未來視覺 AI 的發展提供了新方向。傳統的視覺模型仰賴大量人工標註的真實影像,成本高昂且難以涵蓋所有情境。
而 GenCeption 僅使用合成數據就能達到令人滿意的泛化表現,代表合成資料與生成模型的結合可能成為降低訓練門檻的有效途徑。這不僅能加速模型開發,也能讓更多資源有限的團隊投入視覺 AI 的創新。在實際應用層面,GenCeption 的潛力橫跨多個產業。例如在影視後製中,創作者可以透過文字描述快速獲得場景的深度圖與分割遮罩,大幅簡化合成特效的流程。在醫療影像分析中,模型能協助標註器官邊界與病灶位置。在自動駕駛領域,即時產生的深度圖與物體分割資訊可作為感知系統的備援輸入,提升決策的可靠性。而對於擴增實境開發者來說,一次性取得相機姿態與場景幾何資訊,能讓虛擬物體更自然地融入真實環境。
Google DeepMind 團隊表示,GenCeption 目前仍處於研究階段,但已開放部分技術細節供學術界與產業界參考。未來他們計劃進一步優化模型架構,探索更高效的訓練策略,並將任務範圍擴展至更多視覺理解領域。這項成果不僅挑戰了「專用模型才能做好專用任務」的傳統思維,也為多任務視覺 AI 的發展開闢了全新路徑。隨著 GenCeption 的問世,業界對於視覺 AI 的想像正在被重新定義。從單一任務的專用工具,到能夠同時處理深度、分割、姿態等多種資訊的通用引擎,這項技術有望加速許多垂直領域的智慧化進程。
而更令人期待的是,GenCeption 所採用的「逆向生成」策略,或許只是冰山一角,未來還有更多生成模型中的隱藏知識等待被挖掘。
Related
相關文章

試圖擺脫“變態眼鏡”之名,Meta AI 眼鏡升級後擋住指示燈就立即停止拍攝
作者:清源 責編:清源 評論: 8 月 28 日消息,據外媒 The Verge 今天(28 日)報道,Meta 為旗下 AI 智能眼鏡推出了一項更新,旨在修補一個與拍攝指示燈有關的隱私漏洞。此前,佩戴者在開始錄像後再遮住正面的 LED 指示燈,攝像頭仍能繼續工作。

高德發佈首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,以12幀重建萬幀3D場景
阿里巴巴集團旗下高德發布首個無長程依賴的萬幀級流式3D重建模型ABot-Recon。該模型能以12幀輸入重建萬幀3D場景,為業界首見。此技術突破長程依賴限制,有助於提升3D重建的效能與即時性。

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
作者:故淵 責編:故淵 評論: 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。