何夕2077研究與前沿

輕量視覺語言動作模型面世

2026年7月30日 00:00

重點摘要

近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。

站內 AI 整理稿

近年來,視覺語言動作模型(Vision-Language-Action Model,簡稱 VLA)在機器人領域逐漸成為主流,這類模型能將自然語言指令直接轉換為機器人的動作序列,讓機器人更直觀地與人類互動。然而,目前性能領先的系統大多依賴三到七十億參數的大型骨幹模型,龐大的記憶體需求往往超出嵌入式機器人的硬體預算,限制了這項技術在輕量級邊緣裝置上的應用。為了解決這個問題,來自韓國的研究團隊提出了一款名為 CoTinyVLA 的全新模型,僅以不到十億參數的規模,便在業界公認的 LIBERO-Plus 強健性基準測試中創下多項最佳紀錄。 CoTinyVLA 的核心思路並非單純擴大模型尺寸,而是透過結構化的監督方式來提升強健性。這款模型僅有 0.9B 參數,骨幹採用 Qwen3.5-0.8B,卻能在各項考驗中超越參數量比自己大上數倍的對手。研究團隊設計了三項關鍵技術,分別針對不同層面的難題:雙視角時間輸入、層級式思維鏈蒸餾,以及指令同義擴增。 在雙視角時間輸入部分,CoTinyVLA 在每一步動作中同時納入兩個攝影機視角的畫面,並對每個視角保留過去 16 幀歷史影像,同時在文字層面加入攝影機標記與時間戳記,讓模型能充分掌握空間與時間脈絡。層級式思維鏈蒸餾則是從一個擁有 350 億參數的大型教師模型中,將高階的規劃能力提取出來,並轉化為「情節計畫」與「片段思考」兩個層次。前者涵蓋整個任務的階段性規劃,後者則聚焦於當前步驟的動作狀態、夾爪狀態以及下一步子動作,使模型在推理時能像人類一樣逐步思考。指令同義擴增則將原本僅 40 條的基礎指令,透過同義詞與句式變化擴展為 800 種不同表述,大幅提升模型對語言變異的容忍度。 這套設計在 LIBERO-Plus 基準測試上展現了驚人的效果。LIBERO-Plus 涵蓋 10,030 個經過擾動的任務,橫跨空間、物體、目標與長期四種維度,以及七種不同的擾動類型。在空間維度上,CoTinyVLA 達到 90.8% 的成功率,物體維度 87.3%,目標維度 86.6%,長期維度 80.7%,全面領先當時最強的 7B 參數基準模型,分別高出 4.7、2.8、15.9 與 3.0 個百分點,且所有差距的區間都不包含零,顯示統計上的顯著性。 尤其值得關注的是,在 LIBERO-Plus 中最困難的「機器人初始狀態」擾動軸線上,CoTinyVLA 的表現格外突出。該軸線測試機器人從不同起始位置執行任務的能力,以往所有已發表的基準模型在任一測試套件中,最高成功率僅有 53.2%。CoTinyVLA 則在目標維度上達到 73.6%,而最強的 7B 基準模型在同一測試中僅有 39.9%,差距高達 33.7 個百分點。這說明結構化監督不僅讓模型在一般情況下表現穩定,更能在極端變異的環境中維持高水準的執行能力。 研究團隊也進行了消融實驗,以分析各項技術的貢獻。結果顯示,雙視角時間輸入、層級式思維鏈蒸餾與指令同義擴增三個組件,在不同擾動軸線上的影響是可分離的。例如,在固定的影像處理預算下,如何將幀數分配給兩個攝影機以及時間軸,本身就決定了高達 8.6 個百分點的性能差異。此外,團隊還進行了閉環推理測試,CoTinyVLA 在推理過程中僅需 2.25 GiB 的 GPU 記憶體,遠低於數十億參數模型的需求,非常適合部署在記憶體受限的嵌入式系統上。 為了驗證層級式思維鏈中「情節計畫」的關鍵性,研究人員設計了干預實驗:將模型生成的計畫內容替換為空字串或與當前任務矛盾的錯誤描述,結果任務成功率直接下降 40 到 45 個百分點。這證明了情節計畫並非可有可無的裝飾,而是整個推理過程的承重結構,一旦缺失或錯誤,模型的執行能力便會大幅崩潰。 CoTinyVLA 的論文已於 2026 年 7 月 28 日提交至 arXiv,並在 GitHub 上開源相關程式碼。研究團隊表示,這項成果證明了透過精心設計的監督訊號,不到十億參數的輕量模型也能在具挑戰性的機器人操控任務中超越所有現有方法,為未來在資源受限的邊緣機器人裝置上部署先進 VLA 模型開闢了新的可能性。隨著機器人技術逐漸從實驗室走向真實場景,這類兼顧效能與效率的輕量級模型,將成為推動產業落地的關鍵一環。

Related

相關文章

何夕2077研究與前沿

迭代檢索超越理想證據

迭代檢索超越理想證據。 研究者在多跳問答���中測試了多款模型。發現迭代檢索能帶來更顯著的性能提升。詳見多跳問答迭代檢索對比論文的內容。分段檢索能有效(≧▽≦)降低後續推理失誤。

3 小時前
何夕2077研究與前沿

OpenAI數學突破引爭議

OpenAI數學突破引爭議。 OpenAI內部模型Astra���攻克了數學難題。數學證明可信討論(AI資訊)已展開。許多學者對該成果的復現性���提出質疑。這種機器證明使得科研機制發生轉變。

3 小時前