具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”
重點摘要
AI資訊AI新閒資訊正文具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”發布於AI新閒資訊時間 :Jul 8, 2026閱讀 :1分鐘在具身智能領域,如何讓機器人像人類一樣精準感知物理空間,一直是一個核心難題。近日,螞蟻集團旗下的具身智能公司Robbyant正式開源了LingBot-Vision模型家族。
近年來,具身智能領域持續升溫,如何讓機器人像人類一樣精準地感知與理解物理空間,一直是學術界與產業界共同面對的核心挑戰。傳統的視覺模型大多擅長「辨識物體」,能夠回答畫面中有什麼,但對於機器人執行抓取、移動、避障等物理交互任務時至關重要的物體邊界、輪廓以及深度資訊,卻往往力有未逮。這種「空間感的缺失」成為限制機器人從實驗室走向真實場景的關鍵瓶頸。 就在近日,螞蟻集團旗下的具身智慧公司 Robbyant 正式對外開源了一款名為 LingBot-Vision 的模型家族,為這項難題帶來了全新的解方。這一系列模型採用自監督視覺 Transformer 架構,並透過一種創新的「邊界建模」思路,在密集空間感知任務上展現出極其優異的性能,甚至在多項指標上超越了參數規模大出數倍的頂尖模型,引起業界廣泛關注。 LingBot-Vision 最核心的突破在於它從根本上扭轉了視覺模型的學習優先級。傳統的視覺基礎模型通常以分類或辨識為主要目標,模型會專注於學習物體的類別、顏色、紋理等語義特徵,但對於物體之間的幾何關係與邊界細節卻缺乏足夠的敏感度。Robbyant 團隊則反其道而行,將「邊界」作為模型的原生預訓練信號,讓模型在訓練初期就開始關注那些資訊量最豐富的邊緣區域。 具體來說,LingBot-Vision 引入了一種名為「掩碼邊界建模」的技術。在訓練過程中,模型會隨機遮蓋圖像中的部分區域,但並非像傳統遮罩自編碼器那樣隨機遮蓋整張圖像的像素塊,而是優先遮蓋那些位於物體邊界與輪廓附近的區域。這樣一來,模型必須學會從周圍的上下文資訊中推斷出被遮蓋邊界的形狀、位置與深度,從而同步湧現出極強的幾何空間感知能力。這種設計使得模型在學習語義理解的同時,也能夠精準掌握物體在物理空間中的實際位置與輪廓。 在性能表現上,LingBot-Vision 的旗艦模型 ViT-g/16 僅擁有 11 億參數,卻在 NYU-Depth v2 等深度估計任務中交出了最優異的成績單。更令人驚豔的是,這款模型的表現力不僅超越了參數規模高達 70 億的 DINOv3 模型,而且訓練所消耗的語料庫規模僅為 DINOv3 的三分之一左右。這意味著 LingBot-Vision 在效率與效能之間取得了極佳的平衡,為資源有限的團隊與場景提供了實際可行的解決方案。 除了旗艦版本之外,LingBot-Vision 系列還提供了從 3 億參數到更小規模的多個蒸餾版本,確保不同硬體規格的機器人平台都能夠部署這項技術。對於那些需要在嵌入式設備或邊緣端運行的機器人來說,輕量化的模型版本能夠在有限的算力下依然保持領先的密集預測性能,這對於推動具身智能技術的落地應用具有重要意義。 此次開源不僅展示了螞蟻集團在具身智能領域的技術積累,也體現了 Robbyant 團隊希望透過開放生態加速產業發展的意圖。過去,視覺基礎模型大多由大型研究機構或科技巨頭所主導,參數規模動輒數十億甚至上百億,一般的中小企業或學術團隊難以複製與使用。LingBot-Vision 的開源,讓更多開發者能夠以較低的成本獲得一流的空間感知能力,從而專注於上層的應用開發與場景落地。 從技術路線來看,LingBot-Vision 的「邊界建模」思路與人類視覺系統的運作方式有許多相似之處。人類在觀察環境時,往往會不自覺地先捕捉物體的輪廓與邊界,隨後才填充內部的細節資訊。這種由粗到細、由邊界到內部的處理方式,使得人類能夠在極短的時間內判斷物體的遠近、大小與形狀。LingBot-Vision 正是借鑒了這種生物學上的啟發,透過自監督學習讓模型在沒有大量人工標註的情況下,自行學會了類似的空間理解能力。 在應用場景方面,LingBot-Vision 的潛力相當廣泛。從工業機器人的精準抓取、物流倉儲中的自主搬運,到家庭服務機器人的避障導航,甚至是醫療手術機器人的輔助操作,都需要對物體邊界與深度有精確的掌握。過去這些任務往往需要依賴昂貴的深度相機或雷射雷達,而 LingBot-Vision 的出現,讓僅靠單一 RGB 攝像頭就能夠獲得高品質的空間感知資訊,大幅降低了硬體成本與系統複雜度。 值得注意的是,這項技術的開源時機也恰逢具身智能領域快速發展的關鍵階段。近年來,隨著大語言模型與多模態模型的進步,機器人開始具備更強的語義理解與對話能力,但在物理世界的交互層面,空間感知仍然是制約性能提升的主要短板。LingBot-Vision 填補了這一缺口,讓機器人不再只是「看得見」物體,更能夠「感受」到物體在空間中的位置與形狀,從而做出更精準的動作規劃。 業界分析人士指出,Robbyant 此次開源 LingBot-Vision,不僅為自身技術的生態擴散鋪平了道路,也可能帶動更多企業跟進,將視覺基礎模型從「辨識導向」轉向「感知導向」。未來,機器人或許不再需要依賴大量預先標註的資料庫,就能夠在陌生的環境中自主探索並建立空間認知,這將是具身智能走向通用化的重要一步。 總而言之,LingBot-Vision 的推出標誌著視覺基礎模型在密集空間感知領域的一次重要飛躍。透過以邊界為核心的預訓練策略,這一系列模型用更少的參數、更少的資料,達到了甚至超越業界頂尖模型的水平。對於機器人開發者而言,這項開源工作無疑提供了強大的工具,也為實現真正具有「空間感」的智慧機器人打下了堅實的基礎。
Related
相關文章

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
首頁 > 智能時代>人工智能 谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏 2026/7/21 15:00:10 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
AI資訊AI新閒資訊正文打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘谷歌 DeepMind 團隊近日推出了全新的 GenCeption 模型,嘗試將傳統的視頻生成 AI 逆向改造成能夠深度理解現實世界的視覺分析引擎。
Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結
國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。
Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉
AI資訊AI新閒資訊正文Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘據《金融時報》報道,Meta正研發一款具備全天候多模態感知能力的智能眼鏡原型機。該設備支持“超級感知”模式,能夠以“每隔幾秒”的頻率連續錄製音頻並拍攝照片,用戶可通過Meta AI對捕捉到的音視頻內容進行即時提問與交互。