創意任務解決率95%!讓視覺AI自己練習,還能把經驗帶到視頻

2026年9月18日 09:30
創意任務解決率95%!讓視覺AI自己練習,還能把經驗帶到視頻
站內 AI 整理稿

由北京航空航天大學、香港中文大學與新加坡國立大學組成的研究團隊,近日發表一款名為 OmniHarness 的視覺智能框架。這套系統的核心機制在於讓視覺 AI 不再僅僅被動接收指令,而是透過主動練習與自我檢查結果,逐步累積有效的決策流程,並進一步將這些經驗遷移到影片等動態場景中。根據研究團隊公布的數據,OmniHarness 在創意任務上的解決率達到 95%,展現出極高的執行準確度。長期以來,視覺 AI 模型在處理複雜任務時,往往高度依賴大量人工標註資料或固定的執行範本。這樣的設計不僅耗費人力與時間,也讓模型在面對未曾見過的場景或動態變化時,容易出現適應不良的情況。

OmniHarness 的出現,正是為了突破這項瓶頸,讓 AI 在練習過程中自行判斷哪些步驟能夠成功達成目標,並將這些有效流程保留下來,形成可重複使用的經驗庫。具體而言,OmniHarness 的運作方式類似於一個自主學習的循環。視覺智能體在接收到任務後,不會直接套用預設規則,而是嘗試多種可能的路徑,並在每一步執行後自我檢視結果是否符合預期。如果某個步驟導致了正確的輸出,該步驟就會被記錄下來;反之,失敗的嘗試則會被捨棄。經過多次練習,系統便會累積出一套由成功步驟組成的決策流程,這些流程被存入經驗庫,成為未來類似任務的參考依據。這項設計的關鍵突破,在於經驗庫的可遷移性。

當 OmniHarness 遇到全新的影片或動態任務時,智能體無須從零開始摸索,而是可以直接調用先前在靜態影像練習中學到的策略,快速適應變動的場景。例如,若系統已經在靜態圖片中學會如何辨識物體邊緣與追蹤軌跡,這套策略就能被直接套用到影片中的連續幀上,大幅縮短適應時間。研究團隊指出,傳統的視覺 AI 模型在跨媒體遷移時,通常需要重新訓練或人工調整參數,導致效率低落。相較之下,OmniHarness 的經驗庫具備跨任務、跨媒體的通用性,使得視覺智能體在真實場景中的適應能力獲得顯著提升。

測試結果顯示,OmniHarness 在創意任務上達到 95% 的解決率,這類任務常見於需要即興發想、組合元素或非固定流程的視覺應用,例如自動生成場景佈局、根據文字指令改編影片片段等。創意任務之所以對傳統 AI 構成挑戰,是因為它們沒有標準答案,也沒有明確的步驟指引。過去,模型往往只能依靠大量人工示範或預先定義的規則來運作,一旦規則失效,效能便大幅下降。OmniHarness 透過自主練習與經驗累積,讓 AI 學會從嘗試中歸納出有效模式,即使面對從未見過的創意指令,也能夠憑藉過去的成功經驗推導出合理的解決方案。

這項研究的三所成員機構——北京航空航天大學、香港中文大學與新加坡國立大學——在電腦視覺與人工智慧領域皆有深厚底蘊。OmniHarness 的誕生,不僅是學術合作的成果,也為後續視覺 AI 在跨媒體任務自動化的發展提供了更有效率的解決方案。研究團隊表示,未來將進一步優化經驗庫的結構,提升模型在即時影片處理、無人機視覺導航、自動剪輯等應用場景中的表現。從技術本質來看,OmniHarness 其實是將「練習」與「反思」的概念引入視覺 AI 的學習流程。傳統的監督式學習依賴標註資料來告訴模型「什麼是對的」,而 OmniHarness 則讓模型自己探索「什麼方式能達成目標」。

這種從被動接受到主動建構的轉變,使得 AI 的決策過程更具彈性,也更能適應真實世界中充滿變數的環境。可以預見,隨著 OmniHarness 這類框架的成熟,視覺 AI 將不再只是靜態圖像的分析工具,而能夠真正進入動態、互動的應用場景。從智慧監控系統的自動事件偵測,到教育領域的互動式教學影片製作,甚至到影視產業的快速預覽與特效生成,OmniHarness 所展現的自主學習與跨域遷移能力,都將為這些領域帶來全新的可能性。目前,研究團隊已公開部分技術細節與實驗數據,學界與業界對此反應熱烈。

許多專家認為,這項工作為解決視覺 AI 長期以來的「泛化難題」提供了一條務實的路徑——不需要海量標註,也不需要人工設計複雜規則,只需讓 AI 在練習中自我修正、累積經驗,便能逐步縮小與人類視覺推理能力之間的差距。95% 的創意任務解決率,正是這套方法潛力的具體證明。

Related

相關文章

IT之家AI Agent

長安汽車首席專家譚歡:未來要用機器人造車、賣車,讓機器人上車、造機器人

作者:清源 責編:清源 評論: 9 月 18 日消息,在今天(18 日)的第 22 屆中國汽車產業發展(泰達)國際論壇“新賽道生態專場:具身智能新賽道”活動中,長安汽車首席專家、長安天樞智能機器人公司總經理譚歡在演講中指出,AI 正推動以物理具身智能為核心的基礎設施革新,汽車未來形態是“汽車機器人”—— 自學習、自組織、自進化的組合智能體。

52 分鐘前
量子位AI Agent

具身智能技術路線尚未定型,基礎設施卻先收斂

具身智能技術路線尚未成形,但基礎設施需求已開始收斂,重點從製造機器人轉向持續迭代機器人能力。百度集團沈抖指出,智能體能力邊界快速擴展,進入規模化部署階段,但機器人學習新任務與跨環境適應性仍待突破。

1 小時前

88小時抵一個人思考4000年,OpenAI核心研究員:除了自我進化,更可怕的是AI正學會“隱藏自己”

AI正在把4000年的人類認知勞動壓縮進88小時,OpenAI研究員Noam Brown坦言連他自己也被進展速度持續震驚。AI正在把過去需要數千年完成的認知勞動壓縮到數天。真正的問題已經不只是模型能否變得更聰明,而是實驗能否跟上、人類能否在模型繼續自我改進前確認它仍然安全。

2 小時前
智東西AI Agent

Agent辦事、花式P圖、動嘴玩電腦……實測Wildcat Lake輕薄本玩AI有多爽

作者 | ZeR0 編輯 | 漠影 桂林依山傍水,連城市的輪廓,都是一座座山勾勒出來的。抬眼一望,便是翰墨丹青般的自然光景,既沉靜婉約,又意境悠遠。這種乾淨的留白之美,早已被古人融入山水畫藝中,幾筆山石,一帶煙雲,餘下的留給水色,也留給看畫的人。 淨,並非空無一物,而是通過剋制的取捨,讓真正重要的東西凸顯出來。這與今年推出的第三代英特爾酷睿處理器(代號Wildcat Lake)的設計理念不謀而合。

8 小時前
AIbaseAI Agent

吳恩達回應AI末日論:別被科幻敘事帶偏,應解決現實工程問題

吳恩達曾參與創辦Google Brain和Coursera。吳恩達稱,科技行業早期曾放大AI潛在災難性風險,以獲取關注並影響監管方向;近兩週相關討論再次升溫,也可能存在類似動機。他認為AI確實存在現實風險,尤其包括網絡安全等領域,但不認同將人類滅絕風險作為當前AI發展的核心判斷依據。

9 小時前
IT之家AI Agent

智譜 GLM-5.3-FlashX 模型上線,更快、更流暢

作者:汪淼 責編:汪淼 評論: 感謝網友 Agent 的線索投遞!9 月 18 日消息,智譜今日宣佈推出 GLM-5.3-FlashX(最高 200 tokens/s),為企業與開發者帶來更快、更流暢的模型體驗。智譜官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名與全球開發者見面,獲得海內外開發者的廣泛認可,調用量持續攀升。

10 小時前