零樣本幹活!Figure 機器人走進 30 個陌生家庭,整理客廳、折毛巾、鋪床

AGI...智客Z...2026.09.18 15:08 · 來自北京全文3855字00:00 / 11:06美國人形機器人公司Figure發佈Helix 2.5,將其稱為最先進的神經網絡。人形機器人真正走向家庭,難點或許從來不是“會不會做家務”,而是換一個家庭之後,它還能不能繼續做。9月17日,美國人形機器人公司Figure發佈了Helix 2.5,將其稱為Figure 構建的最先進的神經網絡。這一次,Figure把測試場景從熟悉的實驗室搬到了30個此前沒有見過的家庭,讓機器人直接面對不同的房間佈局、傢俱和物品,並完成整理客廳、摺疊毛巾和鋪床三項任務。
Figure披露,在這30個家庭的測試中,機器人沒有提前採集環境數據,也沒有針對這些家庭進行微調。最終,經過其人類行為數據集Index預訓練的模型,在零樣本測試中的完整任務成功率達到56%;作為對照,從零開始訓練、其他條件保持一致的模型,成功率只有9%。這組數據背後,Figure真正想展示的並不是機器人又學會了幾個家務動作,而是機器人能否把從過去數據中學到的能力,遷移到一個此前從未見過的真實環境中。這也是Helix 2.5此次發佈最值得關注的地方。Figure把機器人帶進30個陌生家庭過去幾年,人形機器人最常見的能力展示,是在一個相對可控的環境中完成一系列預先設計好的任務。
機器人能夠走路、抓取、搬運,也可以折衣服、整理物品甚至操作廚房設備,但這些演示背後往往有一個容易被忽略的前提,機器人已經對所在環境進行了充分訓練。現實中的家庭顯然不是這樣。同樣是一張床,不同家庭的床墊高度、床架結構和房間空間都可能不同;同樣是一條毛巾,大小、厚度和材質也存在差異。對於人類來說,這些變化並不會改變我們對鋪床或者折毛巾這件事情的基本理解,但對機器人而言,每一種變化都可能意味著一個新的訓練變量。Figure選擇的三個看起來並不複雜場景:整理客廳、疊毛巾和鋪床。難點在於,Figure並沒有把測試條件設置得很規整。
客廳裡的玩具和小型物品,形狀、大小、硬度和材質各不相同;毛巾有不同的尺寸、顏色、厚度和紋理;床鋪則使用了不同材質、重量和顏色的床罩、被子和枕頭。不僅物體不同,環境也不同。每個家庭都有自己的傢俱、地面、燈光和操作空間,床的高度、床架結構和離地間隙也存在差異。甚至物品一開始怎麼擺放,Figure也沒有進行統一控制:玩具被隨意扔在地板、沙發和桌子上,毛巾被隨手丟在桌面,被子和枕頭則被故意弄亂。也就是說,Figure測試的並不是“機器人能不能把一條固定毛巾疊起來”,而是換一條沒見過的毛巾、換一個沒見過的桌面,它還能不能完成同一個動作。
整理客廳也是如此,機器人需要先在陌生房間裡找到13至15件物品,再從不同位置將它們收進籃子;鋪床則要求機器人圍繞床移動、放置枕頭,並整理和拉緊床罩。這些任務共同的特點是,它們並不存在一套完全固定的動作路徑,同時考驗視覺感知、移動、抓取、雙手協同以及全身控制能力,Figure將這種能力稱為whole-body intelligence,即全身智能。目前大多數關於機器人泛化能力的研究都是在圍繞機器構建的環境中進行的。桌面機械臂的工作空間是固定的;輪式機器人需要足夠的開放空間來容納和轉彎。而家庭環境則不具備這樣的條件。
人形機器人必須在家庭環境中移動,調整身體位置,才能觀察、夠到並操作其他外形尺寸的機器人無法進入的狹小、雜亂空間中的物體。Figure公佈的結果是,Helix 2.5在30個陌生家庭中,三個任務的完整任務成功率達到56%。作為對比,從零開始訓練、沒有經過Index預訓練的模型,成功率只有9%。Figure稱,使用Index進行預訓練後,模型的零樣本任務成功率提高了6倍以上。據報道,Helix 2.5 是首個在家庭環境中,面對從未接觸過的物體,零次嘗試就實現這一目標的系統。這組數據當然還不足以說明人形機器人已經真正實現了“開箱即用”。
30個家庭、3類任務仍然是一個有限的測試範圍,而且這些任務主要集中在家庭環境。但從實驗設計來看,Figure這次試圖回答的問題已經發生了變化,機器人不只是要學會某項技能,還要學會把技能帶到一個沒見過的地方。如果一個模型只能在訓練過的房間裡整理玩具,那麼它更像一個經過高度優化的自動化系統;如果它進入一個從未見過的家庭,面對不同的傢俱和物體依然能夠完成相同任務,那麼機器人基礎模型的價值才真正開始顯現。Helix 2.5此次發佈,Figure顯然更希望外界關注後一個問題。讓機器人學習“人類怎麼做事”Helix 2.
5之所以能夠在陌生環境中表現出一定的泛化能力,背後還有一個重要變化,Figure開始把人類行為數據放到了機器人預訓練的核心位置。今年8月,Figure推出了名為 Index 的數據平臺,並將其定義為全球規模的人類行為數據集。按照Figure此前公佈的信息,Index已經覆蓋108個國家,擁有超過4.4萬名周活躍數據貢獻者,累計上傳超過1600萬段視頻,數據來源覆蓋家庭、餐廳、物流、工廠和辦公室等真實環境。與傳統機器人數據集不同,Index並不是單純記錄“機器人完成某個任務”的數據,而是先大量收集人類在物理世界中的行為,再讓機器人從這些“人類經驗”中進行基礎預訓練。這背後的邏輯並不難理解。
一個人第一次走進陌生的房間,並不需要提前接受“這個房間應該怎麼走”的專門訓練。看到桌子、椅子、床和地面之後,人類已經擁有足夠多的生活經驗,可以根據具體環境決定下一步怎麼行動。即使沒有見過這張床,人也知道怎樣鋪床;即使沒有見過這條毛巾,也知道怎樣把它折起來。Figure希望機器人也能夠獲得類似的經驗。因此,Helix 2.5從隨機初始化開始,完全使用Index進行預訓練;之後再通過任務數據,讓同一個基礎模型分別適配整理客廳、摺疊毛巾和鋪床三個任務。這實際上改變了過去機器人訓練的一種常見思路。
傳統的機器人學習往往圍繞具體任務展開,想讓機器人學會疊毛巾,就採集大量疊毛巾的數據;想讓它學會整理房間,就繼續採集整理房間的數據。這樣做能夠快速提升特定任務的表現,但當機器人換到另一個環境,或者遇到沒有見過的物體時,往往又需要補充新的數據。Figure希望把這件事情前移。在具體學習“疊毛巾”之前,機器人先通過大量人類行為數據,學習人類如何觀察環境、移動身體、操作物體以及完成連續動作。這樣,當任務發生變化時,模型不需要從零開始理解整個物理世界,而只需要在已經形成的基礎能力上進行適應。Figure此次的對照實驗,正是為了驗證Index在其中發揮了多大作用。
Figure在 Index 數據集的嵌套子集上訓練了四個模型,預訓練數據規模擴大到原來的8倍,機器人動作預測的loss隨著數據增加持續下降,並且呈現出較為穩定的變化趨勢。Figure據此提出了所謂的“human-to-humanoid robot transfer scaling law”,試圖證明人類經驗向機器人能力的遷移,也可能存在類似大模型訓練中的規模效應。這並不能說明人類數據已經解決了機器人泛化問題,但至少說明了一件事情,對於機器人基礎模型而言,大規模的人類行為數據可能不僅是訓練數據的一種補充,而正在成為模型獲得通用能力的重要來源。
具身智能可能進入另一場競爭如果只看機器人完成鋪床、折毛巾這些任務,Helix 2.5並沒有改變行業的基本認知。真正值得關注的是Figure正在嘗試建立的這套訓練方法。過去幾年,大模型行業已經反覆驗證了一個邏輯,當數據、算力和模型規模達到一定程度之後,模型能力可以通過持續擴大訓練規模獲得提升。Figure現在正在嘗試把類似的方法引入機器人領域。這件事情如果未來得到更多實驗驗證,影響可能比一次機器人Demo更大。它意味著,具身智能公司未來的競爭不一定只是“誰的機器人動作更多”,而可能越來越像大模型公司之間的競爭,誰能夠獲得更大規模、更豐富、更真實的訓練數據,誰能夠把這些數據轉化成更強的基礎模型。
這也是為什麼Figure近期一直在擴大Index。對於機器人而言,真正稀缺的數據不是某個機器人在標準實驗室裡重複完成1000次同樣的動作,而是大量不同的人,在不同家庭、不同工廠、不同工作環境裡完成各種各樣任務時留下的行為軌跡。環境越豐富,人的行為方式越多樣,機器人接觸到的物理世界變化就越充分。如果這些數據能夠持續進入模型訓練,就可能形成一個類似大模型行業的數據飛輪,更多真實世界數據訓練出更強的模型,更強的模型進入更多真實場景,又能夠產生更多數據。這或許也是Figure願意持續投入鉅額算力的原因。Figure此前曾表示,未來12個月將投入超過10億美元用於數據和算力。在Helix 2.
5發佈時,公司又披露已經承諾投入35億美元算力用於Helix訓練,如果 Helix 2.5 的發展可以作為參考,那麼更多的數據和計算資源應該能夠直接轉化為機器人進入新家之前就能學習到的更多物理世界信息,進而行成“人類數據—基礎模型—機器人”的訓練體系。Figure Helix 2.5正在嘗試給出的一個新的解法。(本文首發APP,作者 | AGI-Signal,編輯|郭虹妘)
Related
相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究
作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

阿里達摩院開源全球首個專家級通用醫療影像 AI 模型 DAMO RADAR:可一次性識別超 146 種病症,成果登《科學》
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 files 的線索投遞!9 月 18 日消息,阿里達摩院今日宣佈,與浙江大學醫學院附屬第一醫院等機構研發出的通用醫療影像 AI 模型 DAMO RADAR,登上國際頂級學術期刊《科學》(Science)。

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線
。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線
我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”
Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

Google發佈Dream-RSI,人類製造的最後一個 AI
Google 推出最新 AI 系統 Dream-RSI,宣稱其將是最後一個由人類製造的 AI。該系統的核心痛點在於,當前循環中仍有部分環節依賴人工手動編寫,無法從經驗中學習,導致資源重複投入失敗方向。