分類頻道

電腦視覺

18 篇文章,依最新發布時間排序。

何夕2077電腦視覺

聲學信號還原姿態

聲學信號還原姿態。 SoundMHPE嘗試只用聲音恢復多人三維姿態,聲學姿態估計構建6小時同步數據集。數據包含 432K幀 姿態與聲學信號。多人動作聲紋會疊加 🎧,反射延遲也會干擾時序關係。這條路線適合隱私敏感的人機交互和機器人感知。

1 週前

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景

開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

8月5日
量子位電腦視覺

與AI共生:2026微信小程序開發大賽WAIC官宣啟動

2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

7月27日

​打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務

Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。

7月21日7700

大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分

西北工業大學與香港科技大學團隊提出IQA-T1框架,讓多模態大模型在評估圖像質量時,不再僅憑直覺,而是透過生成噪聲殘差圖、頻譜圖等視覺證據來進行判斷。此方法在七個圖像質量評估基準上取得綜合最優成績,平均PLCC/SRCC達到0.784,並使評估過程更具可解釋性。

7月20日

Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破

Google DeepMind 近日發表了一款名為 GenCeption 的全新模型,這項研究最大的特點在於利用預先訓練好的影片生成模型,來解決深度估計、影像分割、3D 姿態估計等經典電腦視覺任務。根據 DeepMind 公布的測試結果,GenCeption 在多項主流基準中表現接近甚至超越當前領域的頂尖水準,更值得關注的是,它所需要使用到的訓練資料規模遠低於傳統的專用視覺模型,為電腦視覺的發展帶來截然不同的路徑。

7月20日4200
智東西電腦視覺

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結

國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。

7月16日

Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉

Meta 旗下正在研發的全天候 AI 眼鏡原型機,近日經《金融時報》披露更多細節。這款設備被定位為具備「超級感知」(Super Sensing)能力的多模態智能穿戴裝置,能夠以每隔數秒的頻率自動錄製環境音訊並拍攝靜態照片,使用者可透過 Meta AI 即時對捕捉到的內容進行提問、辨識或分析。這項技術一旦量產,將使 AI 眼鏡從被動的資訊顯示器,轉變為主動且持續運作的感知終端。 根據知情人士透露,Meta 這款眼鏡的核心在於全天候運作的多模態感知架構。

7月9日6400

具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”

近年來,具身智能領域持續升溫,如何讓機器人像人類一樣精準地感知與理解物理空間,一直是學術界與產業界共同面對的核心挑戰。傳統的視覺模型大多擅長「辨識物體」,能夠回答畫面中有什麼,但對於機器人執行抓取、移動、避障等物理交互任務時至關重要的物體邊界、輪廓以及深度資訊,卻往往力有未逮。這種「空間感的缺失」成為限制機器人從實驗室走向真實場景的關鍵瓶頸。 就在近日,螞蟻集團旗下的具身智慧公司 Robbyant 正式對外開源了一款名為 LingBot-Vision 的模型家族,為這項難題帶來了全新的解方。

7月8日4500
智東西電腦視覺

機器人“空間感”迎來新解法:螞蟻靈波全新視覺模型,11億參數挑戰70億級能力

機器人前瞻(公眾號:robot_pro) 作者 | 李水青 編輯 | 漠影 機器人前瞻7月7日報道,今日,螞蟻靈波同時丟出兩顆“炸彈”:正式發佈空間感知模型LingBot-Depth 2.0,並同步開源其自研的視覺基座模型LingBot-Vision。一套從機器人視覺表徵底層到深度感知能力的完整技術方案的首次集中亮相。 ▲螞蟻靈波發文(圖源:社交媒體X) LingBot-Depth 2.

7月7日
量子位電腦視覺

CVPR 2026最熱方向,被一家杭州團隊率先跑進了端側!

response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。</think>: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。 response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。

6月27日

零代碼自主發現科學圖像處理算法,美阿貢國家實驗室提出CVEvolve,具備寫代碼/結果自查/策略優化等全棧能力

美國阿貢國家實驗室近期發表一款名為 CVEvolve 的系統,主打「零代碼」自主發現科學圖像處理算法。這項工具具備從撰寫程式碼、驗證結果到優化策略的全棧能力,目標是讓研究者無需手動編程即可解決複雜影像問題。 科學圖像處理向來依賴專業知識與反覆調參,尤其在顯微影像、天體觀測等領域,手動找出最佳演算法相當耗時。CVEvolve 自動探索演算法的設計模式,有望大幅降低這類工作的技術門檻。

5月25日