具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”

2026年7月8日 06:024500 次瀏覽
站內 AI 整理稿

近年來,具身智能領域持續升溫,如何讓機器人像人類一樣精準地感知與理解物理空間,一直是學術界與產業界共同面對的核心挑戰。傳統的視覺模型大多擅長「辨識物體」,能夠回答畫面中有什麼,但對於機器人執行抓取、移動、避障等物理交互任務時至關重要的物體邊界、輪廓以及深度資訊,卻往往力有未逮。這種「空間感的缺失」成為限制機器人從實驗室走向真實場景的關鍵瓶頸。就在近日,螞蟻集團旗下的具身智慧公司 Robbyant 正式對外開源了一款名為 LingBot-Vision 的模型家族,為這項難題帶來了全新的解方。

這一系列模型採用自監督視覺 Transformer 架構,並透過一種創新的「邊界建模」思路,在密集空間感知任務上展現出極其優異的性能,甚至在多項指標上超越了參數規模大出數倍的頂尖模型,引起業界廣泛關注。LingBot-Vision 最核心的突破在於它從根本上扭轉了視覺模型的學習優先級。傳統的視覺基礎模型通常以分類或辨識為主要目標,模型會專注於學習物體的類別、顏色、紋理等語義特徵,但對於物體之間的幾何關係與邊界細節卻缺乏足夠的敏感度。Robbyant 團隊則反其道而行,將「邊界」作為模型的原生預訓練信號,讓模型在訓練初期就開始關注那些資訊量最豐富的邊緣區域。

具體來說,LingBot-Vision 引入了一種名為「掩碼邊界建模」的技術。在訓練過程中,模型會隨機遮蓋圖像中的部分區域,但並非像傳統遮罩自編碼器那樣隨機遮蓋整張圖像的像素塊,而是優先遮蓋那些位於物體邊界與輪廓附近的區域。這樣一來,模型必須學會從周圍的上下文資訊中推斷出被遮蓋邊界的形狀、位置與深度,從而同步湧現出極強的幾何空間感知能力。這種設計使得模型在學習語義理解的同時,也能夠精準掌握物體在物理空間中的實際位置與輪廓。在性能表現上,LingBot-Vision 的旗艦模型 ViT-g/16 僅擁有 11 億參數,卻在 NYU-Depth v2 等深度估計任務中交出了最優異的成績單。

更令人驚豔的是,這款模型的表現力不僅超越了參數規模高達 70 億的 DINOv3 模型,而且訓練所消耗的語料庫規模僅為 DINOv3 的三分之一左右。這意味著 LingBot-Vision 在效率與效能之間取得了極佳的平衡,為資源有限的團隊與場景提供了實際可行的解決方案。除了旗艦版本之外,LingBot-Vision 系列還提供了從 3 億參數到更小規模的多個蒸餾版本,確保不同硬體規格的機器人平台都能夠部署這項技術。對於那些需要在嵌入式設備或邊緣端運行的機器人來說,輕量化的模型版本能夠在有限的算力下依然保持領先的密集預測性能,這對於推動具身智能技術的落地應用具有重要意義。

此次開源不僅展示了螞蟻集團在具身智能領域的技術積累,也體現了 Robbyant 團隊希望透過開放生態加速產業發展的意圖。過去,視覺基礎模型大多由大型研究機構或科技巨頭所主導,參數規模動輒數十億甚至上百億,一般的中小企業或學術團隊難以複製與使用。LingBot-Vision 的開源,讓更多開發者能夠以較低的成本獲得一流的空間感知能力,從而專注於上層的應用開發與場景落地。從技術路線來看,LingBot-Vision 的「邊界建模」思路與人類視覺系統的運作方式有許多相似之處。人類在觀察環境時,往往會不自覺地先捕捉物體的輪廓與邊界,隨後才填充內部的細節資訊。

這種由粗到細、由邊界到內部的處理方式,使得人類能夠在極短的時間內判斷物體的遠近、大小與形狀。LingBot-Vision 正是借鑒了這種生物學上的啟發,透過自監督學習讓模型在沒有大量人工標註的情況下,自行學會了類似的空間理解能力。在應用場景方面,LingBot-Vision 的潛力相當廣泛。從工業機器人的精準抓取、物流倉儲中的自主搬運,到家庭服務機器人的避障導航,甚至是醫療手術機器人的輔助操作,都需要對物體邊界與深度有精確的掌握。

過去這些任務往往需要依賴昂貴的深度相機或雷射雷達,而 LingBot-Vision 的出現,讓僅靠單一 RGB 攝像頭就能夠獲得高品質的空間感知資訊,大幅降低了硬體成本與系統複雜度。值得注意的是,這項技術的開源時機也恰逢具身智能領域快速發展的關鍵階段。近年來,隨著大語言模型與多模態模型的進步,機器人開始具備更強的語義理解與對話能力,但在物理世界的交互層面,空間感知仍然是制約性能提升的主要短板。LingBot-Vision 填補了這一缺口,讓機器人不再只是「看得見」物體,更能夠「感受」到物體在空間中的位置與形狀,從而做出更精準的動作規劃。

業界分析人士指出,Robbyant 此次開源 LingBot-Vision,不僅為自身技術的生態擴散鋪平了道路,也可能帶動更多企業跟進,將視覺基礎模型從「辨識導向」轉向「感知導向」。未來,機器人或許不再需要依賴大量預先標註的資料庫,就能夠在陌生的環境中自主探索並建立空間認知,這將是具身智能走向通用化的重要一步。總而言之,LingBot-Vision 的推出標誌著視覺基礎模型在密集空間感知領域的一次重要飛躍。透過以邊界為核心的預訓練策略,這一系列模型用更少的參數、更少的資料,達到了甚至超越業界頂尖模型的水平。

對於機器人開發者而言,這項開源工作無疑提供了強大的工具,也為實現真正具有「空間感」的智慧機器人打下了堅實的基礎。

Related

相關文章

何夕2077電腦視覺

聲學信號還原姿態

聲學信號還原姿態。 SoundMHPE嘗試只用聲音恢復多人三維姿態,聲學姿態估計構建6小時同步數據集。數據包含 432K幀 姿態與聲學信號。多人動作聲紋會疊加 🎧,反射延遲也會干擾時序關係。這條路線適合隱私敏感的人機交互和機器人感知。

1 週前

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景

開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

8月5日
量子位電腦視覺

與AI共生:2026微信小程序開發大賽WAIC官宣啟動

2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

7月27日