Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景

2026年8月5日 15:46
Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
站內 AI 整理稿

圍著桌上的小擺件隨手拍幾張照片,幾秒後,這些二維影像竟從螢幕中「立」了起來,變成一個可以自由旋轉、探索的三維場景。沒有複雜的掃描設備,也幾乎不需要等待,只要幾聲快門,就能把現實世界瞬間轉化為數位空間。這項技術來自一個名為「影溯」的開源模型,它正嘗試用Transformer架構打開三維內容生產的新入口,讓原本需要大量運算與專業軟體的工作,變得像拍照一樣簡單。影溯的核心突破在於,它不再依賴傳統的多視角重建或深度估計流程,而是直接從少量二維圖像中學習場景的立體結構。無論是桌上的小擺件、咖啡店的角落,還是家中的臥室,只要用手機從不同角度拍攝六張左右照片,模型就能在數秒內生成一個可自由探索的3D場景。

這項能力的背後,是從二維像素到三維場景查詢(Query)的技術架構轉變,讓Transformer能夠理解不同視角之間的空間關係,並即時補全視覺盲區。實際體驗令人印象深刻。記者用手機對著樓下咖啡店的外圍拍了六張照片,上傳到影溯模型後,幾乎沒有等待時間,一個立體的咖啡店場景便出現在畫面上。你可以拖曳視角,從側面觀察招牌的細節,或者繞到後方看看小巷的模樣。同樣的過程也應用在臥室中——幾張隨手拍下的床鋪、書桌與窗簾,立刻重組成一個可以走進去的虛擬空間,連光線的明暗與物品的相對位置都相當自然。這項技術的應用場景遠不止於此。

聚餐時記錄下歡樂的餐桌佈置,桌搭愛好者展示自己精心整理的電腦桌面,畢業生在校園角落留下最後的紀念,搬家前把舊房間的模樣保存下來,甚至婚禮現場的溫馨瞬間——這些原本只能以平面照片保存的回憶,現在都能轉化為可以自由探索的3D場景,並分享給遠方的朋友。影溯讓「把場景發給朋友」這件事,從一張靜態圖片升級為一個可互動的立體世界。從技術層面來看,影溯的開源特性意味著開發者與創作者都能自由使用這套模型,進一步推動三維內容的規模化生產。過去,建立一個高品質的3D場景往往需要專業掃描器、數十張照片與漫長的運算時間,而影溯將這個過程壓縮到秒級,同時保持場景的幾何結構與視覺真實度。

這對於電商展示、虛擬旅遊、遊戲資產製作、建築可視化等領域,都具有潛在的變革價值。Transformer架構的引入,是三維重建領域的一個重要轉折點。傳統方法通常依賴卷積神經網路或光流演算法,需要大量標註數據與顯式深度資訊。而Transformer的自注意力機制,讓模型能夠在缺乏先驗的情況下,從多張圖像中自動學習場景的全局結構與局部細節。影溯正是利用這種能力,在二維圖像與三維空間之間建立直接映射,從而實現「幾張照片生成可探索場景」的即時體驗。值得一提的是,影溯並非只是學術研究的成果,它已經以開源形式釋出,任何人都可以下載使用。

這意味著,即便沒有專業的電腦視覺背景,普通用戶也能透過簡單的拍照步驟,創造出屬於自己的3D內容。社群中也開始出現各種創意應用:有人用它記錄寵物的活動空間,有人用它製作虛擬展覽,甚至有人嘗試將多個場景拼接成一個連續的空間地圖。當然,目前的模型仍有其限制。例如,對於透明物體、鏡面反射或極度複雜的場景,影溯的重建效果可能不夠理想;另外,場景的探索範圍也受限於輸入照片的覆蓋角度。但隨著更多開發者參與調校與數據貢獻,這些問題有望在後續版本中得到改善。影溯的開源生態,正在為三維內容的民主化鋪平道路。從2D像素到3D場景查詢,影溯不僅是技術上的創新,更代表一種新的內容生產思維。

當每個人都能用手機輕鬆創造可探索的立體世界,社交分享、遠距協作、數位保存的方式都將隨之改變。未來,或許我們不再需要文字描述或平面照片來回憶一個地方,只要幾張照片,就能把那個瞬間完整地「打包」發送給任何人。這個由Transformer驅動的三維世界入口,剛剛打開。而影溯,正是那個讓一切變得簡單又神奇的開端。

Related

相關文章

何夕2077電腦視覺

聲學信號還原姿態

聲學信號還原姿態。 SoundMHPE嘗試只用聲音恢復多人三維姿態,聲學姿態估計構建6小時同步數據集。數據包含 432K幀 姿態與聲學信號。多人動作聲紋會疊加 🎧,反射延遲也會干擾時序關係。這條路線適合隱私敏感的人機交互和機器人感知。

1 週前
量子位電腦視覺

與AI共生:2026微信小程序開發大賽WAIC官宣啟動

2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

7月27日

​打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務

Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。

7月21日7700