henry 發自 凹非寺
量子位 | 公眾號 QbitAI
李飛飛老師的World Labs,補了塊關鍵拼圖。
(資料圖片)
剛剛,借助新收購機器人公司SceniX之力,World Labs發布了全新的機器人策略訓練與評估引擎——
Real-to-sim-to-real (R2S2R) 。
這套引擎將World Labs空間智能的版圖從生成可交互的虛擬世界,進一步延伸到了真實機器人的訓練、評估與部署,并首次打通了從仿真訓練到真實運行的閉環。
拆開來看,R2S2R包含Real-to-Sim和Sim-to-Real兩個部分。
其中,Real-to-Sim負責把現實中的機器人、傳感器、物體以及交互過程搬進仿真,構建與真實任務對齊的虛擬環境。
Sim-to-Real則讓機器人在這些虛擬環境中完成訓練和評估,再將策略直接部署回真實世界。
李飛飛老師在X上表示,基于這套方法訓練出來的策略,即使完全沒用過真實世界數據,也已經能夠連續自主運行1小時,無需人工干預。
不僅如此,R2S2R還讓機器人策略的評估變得更容易規模化。
通過對齊策略在仿真與現實中的運行過程,真實世界里的成功、失敗及其觸發條件,都可以在虛擬世界中被復現和分析。
可以說,R2S2R不僅打通了世界模型從生成世界,到訓練、評估和部署真實機器人的閉環,也推進了李飛飛此前提出的世界模型三分法中,最關鍵的一塊——
仿真器。
在她的經典劃分中,世界模型可以承擔三種功能:渲染器負責生成觀察,仿真器負責模擬世界狀態,規劃器則負責輸出行動。
而R2S2R所做的,正是讓World Labs生成的世界從“看起來真實”,進一步變成機器人真正能夠進入、交互和學習的訓練場。
想scale具身智能,先得scale機器人學習的世界
那么,為什么要擴展機器人的學習環境,而且還非得在仿真里?
在博客中,World Labs表示:
當前機器人發展的主要瓶頸,已經不只是模型架構,而是缺少能夠規模化獲取的經驗和評估。
一方面,真實世界中的物體位置、光照、物理屬性和交互過程都在不斷變化。
要讓機器人真正走出實驗室,就必須提前覆蓋足夠豐富的場景,并反復測試它在什么情況下會成功、又會在哪里失敗。
另一方面,與訓練大模型的互聯網數據不同,機器人的每一條經驗都需要真實發生。
每輪實驗都要占用硬件,人工重置物體、恢復失敗并維護系統。即便擁有海量人類視頻,也很難系統覆蓋不同環境、物體屬性、機器人狀態和失敗條件。
因此,仿真最大的價值,并不只是“省下采集數據的錢”,而是可以主動制造現實中昂貴、危險或難以重復的情況,讓機器人反復經歷成功與失敗。
但過去的仿真技術也存在著明顯短板。
它不僅需要為每項真實任務單獨搭建環境,成本高、速度慢,而且仿真與現實之間往往存在視覺、幾何和物理動態上的差距。
更重要的是,機器人在仿真中學會的策略,到了真實世界未必依然有效;仿真中的測試結果,也未必能反映真實表現。
基于上述背景,World Labs推出了從現實到仿真再到現實訓練(R2S2R)的仿真引擎,用于訓練和評估機器人策略。
其中,Real-to-Sim負責把現實中的機器人、傳感器、物體和交互過程重建成與任務對齊的虛擬世界。不僅要還原世界的外觀,還要盡可能保留機器人與物體交互時的運動和物理反饋。
Sim-to-Real則利用這些世界完成策略訓練與評估,找到模型容易失敗的狀態,并判斷仿真中的表現能否遷移到真實硬件。
兩者連接起來,便形成了一套閉環:
從現實中提取任務,在仿真中規模化生成經驗、訓練和尋找失敗,再把策略部署回現實;現實中的新結果,又會繼續修正世界模型、訓練數據和機器人策略。
也就是說,R2S2R不是簡單地用仿真替代真實數據,而是把一個真實任務擴展成大量可控制、可復用的學習世界,讓機器人能夠以更低的成本反復訓練、評估和迭代。
Real-to-sim-to-real
具體來說,這套方法首先從Real-to-Sim開始。
團隊先采集機器人、傳感器、環境、物體和任務演示等信息,再通過生成式世界建模系統,將其重建為一個可交互的虛擬世界。
這個世界不僅要還原外觀和幾何結構,還要盡可能復現物體的物理和動力學特性。
比如,在下面的雙機械臂裝箱任務中,仿真和現實環境會執行相同的動作序列,從而產生高度一致的觀察結果、物體運動情況以及最終效果。
這里的難點在于,真實環境并不會提供一套準確參數。
物體的重量、摩擦力可能難以測量,機器人和攝像頭也可能與標稱規格存在偏差,電纜、包裝等柔性物體的形變更難用簡單模型描述。
因此,R2S2R會根據不同任務的需要,組合使用不同的表示和建模方法。
完成重建后,團隊會讓機器人在現實與仿真中執行相同動作,直接比較視覺觀測、物體反應和最終結果,從而驗證兩邊是否真正對齊。
而在Sim-to-Real階段,對齊后的仿真世界會進一步變成一套可擴展的訓練與評估引擎。
具體的,機器人先在仿真中學習新策略,評估系統再主動尋找它容易失敗的狀態,并圍繞這些弱點生成新的交互經驗,形成“發現問題—補充數據—改進策略”的閉環,最后再部署回真實硬件。
此外,相比現實數據采集,仿真可以系統調整物體位置、機器人狀態、視角、外觀、物理屬性和任務難度,讓策略反復經歷現實中成本高、難復現甚至不安全的情況,并獲得物體狀態、接觸、受力等硬件上難以采集的監督信號。
而且,一個重建好的任務并不只服務于某個模型或某款機器人。同一套仿真環境可以繼續適配不同策略、傳感器和機器人平臺,從一次性實驗變成可復用的訓練基礎設施。
報告中顯示,在沒有真實世界數據參與,只在仿真里訓練的策略可以直接遷移到ALOHA、RB-Y1、YAM、Flexiv和xArm等機器人平臺,完成裝箱、繞線、試管轉移和雜亂環境中的單件抓取等任務。
其中,電源線繞行、線纜插拔、試管轉移,以及馬克筆和鉛筆抓取等任務,均連續自主運行1小時,期間沒有失敗,也沒有人工接管。
這說明,對齊后的仿真未來可能不只是現實數據的補充,而會成為機器人訓練經驗的重要來源。
最后,在評估方面。
由于機器人受制于物理世界的運行速度,每測試一個checkpoint,都要重新布置場景、運行機器人并處理失敗,成本高,能夠覆蓋的情況也十分有限。
相比之下,R2S2R則可以先在數千種受控條件下主動尋找失敗,提前篩掉表現不佳的checkpoint,只把最有希望的策略留給真實硬件測試。
這里的關鍵,并不是要求仿真與現實的成功率完全一致,而是兩邊能夠得出相同的判斷:
哪些策略更好、它們在哪里成功或失敗,以及訓練中的提升能否真正遷移到硬件。
在ALOHA雙臂方塊交接任務中,團隊測試了GR00T N1.6和π?.?兩種策略架構,以及不同訓練配置、ID和OOD場景。每個checkpoint分別進行了2000次仿真試驗和100次真機試驗。
結果顯示,仿真中表現更好的checkpoint,在真機上通常也表現更好。仿真不僅保持了不同策略之間的相對排名,也呈現出與現實相似的成功和失敗分布。
更重要的是,這種對齊不只是讓仿真畫面看起來像現實。
團隊會讓機器人在仿真和現實中執行完全相同的動作,再比較兩邊看到的畫面、物體的反應和最終結果是否一致。
即使是在線纜、關節物體等很難模擬的任務,也要盡可能復現真實的物理變化。
以方塊交接為例,當方塊放在機器人不太熟悉的位置時,機械臂會抓得更靠近邊緣,差一點就失手。這種“險些失敗”的過程,不僅出現在真機上,也在仿真中被復現了出來。
也就是說,仿真還原的不只是機器人最后成功了還是失敗了,還能還原它為什么會走向成功或失敗。
這也意味著,R2S2R可以成為機器人開發中的高通量評估層,用來篩選checkpoint、發現性能退化,并決定下一輪應該補充什么數據。
World labs收購SceniX
事實上,在正式發布R2S2R的前一周,World Labs就已經宣布收購SceniX。
SceniX是一家專注機器人仿真、訓練與評估的初創公司,他們的技術方向聚焦于把真實機器人任務搬進數字世界,讓原本昂貴、緩慢甚至危險的數據采集和模型評估,可以在仿真中規模化完成。
SceniX聯合創始人李昀燭目前是哥倫比亞大學助理教授,曾在MIT獲得博士學位,隨后在斯坦福跟隨李飛飛從事博士后研究。
有意思的是,這兩家公司的合作并不是從這段師生關系開始的。
最早,SceniX只是World Labs生成式世界模型Marble的客戶。直到李飛飛發現這家公司由李昀燭創辦,雙方才進一步意識到彼此技術上的互補,并展開了收購計劃。
World Labs擅長生成模型、計算機視覺和3D重建,可以從稀疏輸入中快速生成具有空間一致性的世界;
SceniX則更熟悉機器人、仿真、學習算法和硬件系統,知道怎樣讓這些世界真正用于策略訓練、評估和部署。
換句話說,就是前者解決“世界怎么生成”,后者解決“機器人怎么在里面學習”。
在a16z訪談中,李昀燭表示,這次收購并不意味著World Labs要親自造機器人。
它們真正想建設的,是一套與機器人形態和模型架構解耦的基礎設施:
無論客戶使用單臂、雙臂還是移動機器人,VLA還是World Action Model,都可以進入同一個數字世界訓練和測試。
在未來,雙方將圍繞仿真、基礎模型和動作條件模型逐步整合,并希望先在倉庫、實驗室和電子裝配等半結構化場景中,與客戶完成真實部署驗證。
參考鏈接
[1]https://www.worldlabs.ai/blog/real-to-sim-to-real
[2]https://www.worldlabs.ai/blog/taxonomy-of-world-models?utm_source=chatgpt.com
[3]https://x.com/drfeifei/status/2082137342824075357
關于我們| 聯系方式| 版權聲明| 供稿服務| 友情鏈接
咕嚕網 m.stlrota.com 版權所有,未經書面授權禁止使用
Copyright©2008-2023 By All Rights Reserved 皖ICP備2022009963號-10
聯系我們: 39 60 29 14 2@qq.com