通用視頻世界模型開發完成
重點摘要
通用視頻世界模型開發完成 近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。
通用視頻世界模型開發完成
近日,一款名為 Wonder 的通用視頻世界模型正式公開,迅速在人工智慧領域掀起討論。根據消息來源「何夕2077」指出,這項研究由 Jiacong Xu、Hanwen Jiang 等學者共同完成,實現了從靜態圖片或條件影片出發,即時生成可供使用者自由操控相機的動態三維世界。不同於傳統的影片生成工具,Wonder 讓使用者不再只是被動觀看,而是能像在遊戲中一樣主動探索場景,開創了影片生成的全新互動模式。 過去幾年間,影片生成模型雖然進步神速,但多數作品仍停留在「生成一段固定視角的短片」階段。使用者無法改變觀察角度,也無法與生成內容互動。Wonder 的突破在於首次將「世界模型」與「即時相機控制」深度結合。只要提供一張圖片或一段參考影片,模型便能瞬間建立一個連貫的虛擬環境,使用者可以移動相機前往未見過的區域,甚至回訪先前觀察過的位置,整個過程流暢自然,且幾何結構與外觀保持一致。 這項能力的背後,是研究團隊從系統層面重新設計了三大核心模組:相機控制、記憶機制與訓練策略。在相機控制方面,團隊提出「密集座標場」作為新的條件輸入。透過在生成過程中渲染含有密集座標的參考圖,模型能直接將相機運動解讀為視覺證據,從而精準理解使用者的操控指令。這項設計解決了傳統控制方法中訊號模糊、反應遲緩的痛點,讓相機移動與生成畫面高度同步。 為了支援長時間、大範圍的場景探索,Wonder 配備了基於稀疏注意力的高效記憶機制。隨著生成長度增加,模型不需要處理全部歷史資訊,而是透過稀疏選擇少量相關的上下文標記進行記憶提取,實現快速且精確的回訪。這項設計大幅降低了計算成本,使模型能夠在長時程生成中維持場景的一致性,避免因上下文過長而出現遺忘或混亂。 訓練流程同樣經過精心改進。研究團隊針對自蒸餾(self-distillation)管線進行了多項修正,確保學生模型既能忠實遵循控制訊號,又能保留教師模型的生成多樣性與長期記憶能力。這些最佳化讓 Wonder 在控制精準度與內容豐富度之間達成了良好平衡,生成的影片不僅符合使用者預期,還保留了令人驚喜的細節變化。 在實際性能上,Wonder 交出了亮眼的成績單。它能夠以每秒 16 幀的速度即時生成數分鐘長度的影片,且在長時間滾動生成中保持連貫的幾何結構、外觀與動態。這意味著使用者可以在互動過程中獲得近乎即時的回饋,體驗流暢且沉浸,彷彿置身於一個微型的可探索世界。 除了從圖片生成影片,Wonder 也原生支援「影片條件生成」。使用者可以輸入一段已有的動態場景,讓模型即時重繪或延伸該場景,達到類似「重新拍攝」的效果。這項功能對影視後製、遊戲場景編輯等應用極具吸引力,創作者能在既有素材上自由調整視角,大幅提升工作彈性。 論文在 arXiv 上發布後迅速吸引社群關注,在 Papers with Code 平台獲得 11 個推薦,並已被收錄至多個論文合集。研究者提供的示範影片展現了模型在室內、戶外及複雜動態場景下的穩定表現;無論是細微的光影變化還是物體的持續運動,Wonder 皆能妥善處理,顯示其強大的泛化能力。 該研究由約翰霍普金斯大學與 Adobe Research 等機構共同完成,作者群包括 Jiacong Xu、Hanwen Jiang、Zhixin Shu、Kalyan Sunkavalli、Vishal M. Patel 與 Yiqun Mei。論文編號為 arxiv:2607.26037,目前已開放預覽,雖未公開完整模型權重,但專案頁面已提供多支示範影片,讓外界得以一窺其技術實力。 業界分析認為,Wonder 的問世可能為影片生成帶來新典範。在虛擬實境內容創作、自動駕駛模擬、互動式遊戲場景等領域,這種「可操控的世界模型」皆能派上用場。隨著後續研究繼續優化效能,甚至可能出現消費級應用,讓一般使用者在個人電腦上打造屬於自己的虛擬世界。 從「生成內容」到「生成可探索的世界」,Wonder 跨出了關鍵一步。這項研究不僅推進了影片生成模型的技術邊界,也為人機互動開啟了更具想像力的未來。隨著更多細節陸續公布,我們將持續關注這款模型能否真正落地,改變我們創造與體驗虛擬環境的方式。
Related
相關文章

微軟測試其首款自研全雙工 AI 語音 MAI Realtime 模型:支持中文等 16 種語言、2 種風格
微軟正在測試其首款全雙工 AI 語音模型 MAI Realtime,支援中文等 16 種語言與兩種語音風格,可實現同步聆聽與回應。該模型目前僅開放給部分合作夥伴在 MAI Playground 進行測試,正式上線時間尚未公布。
迭代檢索超越理想證據
迭代檢索超越理想證據。 研究者在多跳問答���中測試了多款模型。發現迭代檢索能帶來更顯著的性能提升。詳見多跳問答迭代檢索對比論文的內容。分段檢索能有效(≧▽≦)降低後續推理失誤。
OpenAI數學突破引爭議
OpenAI數學突破引爭議。 OpenAI內部模型Astra���攻克了數學難題。數學證明可信討論(AI資訊)已展開。許多學者對該成果的復現性���提出質疑。這種機器證明使得科研機制發生轉變。

從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會
這篇消息聚焦「從實驗到產線——AI 工作流的規模化挑戰與協作生態 | 2026 ChinaJoy AI未來生態大會」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

Karpathy實測Opus 5:讀一段《魔戒》,10美元直出中土世界
這篇消息聚焦「Karpathy實測Opus 5:讀一段《魔戒》,10美元直出中土世界」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。

美國為何留不住楊植麟?專訪楊植麟美國博導:他毅然拒絕蘋果,選擇回國創業,Kimi K3最獨特優勢在開源,但判斷其實際能力還為時過早
楊植麟的美國博士導師Ruslan Salakhutdinov透露,楊植麟曾拒絕蘋果工作機會,選擇回中國創業,反映美國留不住頂尖人才。Salakhutdinov指出Kimi K3模型優勢在開源策略,但評估其實際能力仍為時過早。