Stream3D補全流式三維

2026年8月3日 00:00

重點摘要

Stream3D提出了一種無需訓練的串流機制,能將凍結的單視角3D生成器轉換為串流生成器,透過證據記憶機制快取歷史中最具資訊的幀來解決長時間單眼影像串流的時間不一致問題。該方法在真實與合成串流基準測試中,在光度與幾何指標上均優於現有基線方法。

站內 AI 整理稿

「Stream3D補全流式三維」——這項由Kaichen Zhou、Zeyang Bai、Xinhai Chang、Mengyu Wang、Paul Liang與Fangneng Zhan共同提出的研究,近日在電腦視覺領域引起關注。研究團隊來自多個學術機構,他們在arXiv上發表論文,詳細介紹了名為Stream3D的全新架構,目標是解決現有3D生成模型在處理連續影像串流時產生的嚴重時間不一致問題。 目前主流的單視角3D生成模型,如SAM 3D、TRELLIS與Hunyuan3D,能在單張影像輸入下產出高品質的物體重建結果。然而現實世界的視覺資訊往往是以長時間的單眼影片串流形式出現,並非靜態單張影像。若將這些模型直接套用在串流的每一幀,獨立進行3D生成,就會造成前後幀的生成結果在幾何與外觀上出現劇烈跳動,無法維持連貫性。 Stream3D的設計核心在於提出一種「無需訓練」的串流機制,可將已凍結的視角條件3D生成器轉變為真正的串流生成器,同時維持固定的跨區塊記憶體。研究人員引入了一個精簡的「證據記憶」(evidential memory)結構,其運作原理是基於一套新提出的「證據評分機制」,有選擇性地快取最具資訊量的歷史幀。 隨著串流持續前進,記憶內容會動態更新,始終保留固定數量的資訊幀,避免記憶體用量隨著序列長度線性增長。這項設計不僅防止了長時間序列導致的生成品質劣化,更讓底層的3D生成模型完全保持原樣,無需重新訓練、修改架構或添加輔助損失函數,真正實現了「即插即用」的便利性。 在評估階段,研究團隊分別在真實場景與合成資料的串流基準測試上進行驗證。結果顯示,Stream3D在光度指標與幾何指標兩方面,均優於潛在傳輸基準方法,包括KV-cache重用與基於流動的特徵編輯技術。這意味著在保持生成穩定性的同時,Stream3D也兼顧了視覺品質與形狀準確度。 論文作者強調,這項工作填補了現有3D生成模型在串流應用上的空白。過去許多研究專注於提升單張影像的3D重建品質,卻忽略了現實中觀測資料往往是連續變化的。Stream3D的出現,為自動駕駛、機器人視覺、擴增實境等需要即時處理視訊串流的領域,提供了更可靠的3D生成解決方案。 為了讓更多研究者能重現並應用這項成果,團隊已將論文全文、補充資料以及示範連結公開於arXiv。論文最初於2026年5月20日提交,經過多次修訂後,於6月11日發布第四版。有興趣的讀者可透過arXiv編號2605.21472查閱詳細內容,並在論文中找到對應的計畫網址。 整體而言,Stream3D以輕量且無需訓練的記憶機制,成功將凍結的3D生成器擴展至串流情境,並在實驗中展現出顯著優勢。這項技術不僅為後續的串流式3D生成研究樹立了新基準,也為實際應用打開了更多可能性。

Related

相關文章

京東外賣發佈智能頭盔

京東外賣發佈AI智能頭盔:支持語音接單、路線導航和訂單備註提醒AIbase基地發佈於AI新聞資訊 · 1 分鐘閱讀 · Aug 3, 202642京東外賣宣佈推出 AI 智能頭盔,並將於近期陸續投入使用。首批產品將免費發放給京東全職騎手,後續逐步覆蓋全體騎手。新設備集成 AI 語音助手、智能路線規劃、商戶環境核驗和訂單備註提醒等功能,旨在提升配送效率、騎手安全及用戶服務體驗。

3 小時前

深度搜索終端代理開源

深度搜索終端代理開源。 團隊把深度搜索帶進了命令行終端⚙️。項目提供了終端命令行搜索代理項目源碼。這個代碼庫目前已獲得(29.9k)贊。它主要依靠前綴緩存安定常駐終端。

3 小時前

京東首次在校招流程中引入 AI 面試,面向 2027 年度本科、碩博研究生畢業生開啟網申

京東今日正式宣布開啟2027年度校園招聘,面向2027屆本科、碩博研究生畢業生開放網申通道。與往年相比,本年度校招最顯著的變化在於,京東首次在招聘流程中引入AI面試環節,這標誌著這家電商巨頭在人才選拔數字化轉型上邁出新的步伐。 據了解,本次校招崗位方向覆蓋採銷、物流、技術、產品、運營、設計、健康、工程、職能、保險與金融、市場與商務等多個領域,幾乎囊括了京東現有業務板塊的核心人才需求。無論是面向業務前線的採銷與物流崗位,還是面向技術底座的研發與產品崗位,都向2027屆畢業生敞開大門。

8 小時前