核心概念
LeRobot v0.6.0 於 2026 年 7 月 7 日發布,以「想像(Imagine)、評估(Evaluate)、改善(Improve)」三個主軸為框架,大幅擴展了機器人學習的完整閉環——從想像未來狀態的世界模型策略,到六個新模擬基準,再到從部署中持續收集修正資料的 DAgger 工作流程。
世界模型策略:讓機器人「想像」未來
v0.6.0 的最大亮點是三個能預測未來狀態的策略架構:
VLA-JEPA 基於 Qwen3-VL-2B,在訓練時預測潛空間中的未來幀,但推論時世界模型消失(零推論成本)。提供三個開箱即用的 checkpoint,包括以 DROID 資料集預訓練的基礎版本。
LingBot-VA 是自迴歸視頻-動作模型,同時預測未來視頻與動作序列,並將真實觀測回饋以保持想像的接地性。可在單張 24-32GB GPU 上運行,支援儲存預測與實際視頻的對比記錄,便於分析策略行為。
FastWAM 採用「大視頻生成專家(~5B)+ 小動作專家」的配對架構。在推論時跳過「做夢」步驟,直接對動作塊做去雜訊,在計算效率與預測品質間取得平衡。
這三個架構代表不同的計算與精度取捨,共同回答了「策略如何在訓練時內化因果物理知識」的問題。
VLA 模型動物園擴張
版本同步引入四個新 VLA:
- GR00T N1.7:NVIDIA 整合升級,採用 Cosmos-Reason2-2B VLM 與 flow-matching 動作頭,已與 NVIDIA 官方實作進行對等測試。
- MolmoAct2(Allen Institute):支援完整生命週期(完整微調 / LoRA / 評估 / 部署),提供 SO-100/101 的零樣本 checkpoint,12GB bf16 即可推論,單張 24GB GPU 可做 LoRA 微調。
- EO-1:以 Qwen2.5-VL-3B 為骨幹,在交織的視覺-文字-動作資料上預訓練。
- EVO1:0.77B 參數(InternVL3-1B),支援兩階段微調與 Real-Time Chunking,適合算力有限的場景。
此外還有 Multitask DiT(~450M 擴散 transformer),以 CLIP 做視覺與語言條件化,同時支援擴散與 flow-matching 目標。
獎勵模型 API(lerobot.rewards)
統一的獎勵模型介面提供兩個選項:
Robometer-4B 是通用預訓練獎勵模型,基於 Qwen3-VL-4B,在 100 萬+ 機器人軌跡上訓練,能從視頻 + 語言指令直接評分任務進度與成功率,無需任務專屬訓練。
TOPReward 採零樣本方法,包裝現成 VLM(Qwen3-VL),讀取「True」token 的對數機率作為獎勵信號。
兩者都提供標記腳本,可生成逐幀進度曲線,供獎勵感知行為克隆(RA-BC)與資料集品質稽核使用。
六個新模擬基準
統一以 lerobot-eval CLI 執行:
| 基準 | 特色 |
|---|---|
| LIBERO-plus | ~10,000 個擾動變體,七軸隨機化(光線、視角、指令) |
| RoboTwin 2.0 | 50 個雙臂操作任務,100k+ 訓練軌跡 |
| RoboCasa365 | 365 個廚房任務,2,500 個程序生成廚房 |
| RoboCerebra | 長時程(3-6 子目標鏈),語言接地的中間指令 |
| RoboMME | 記憶測試:計數重複、追蹤隱藏物件、模仿程序 |
| VLABench | 知識與推理測試,從物理問題到複合任務 |
這六個基準覆蓋了「多樣化泛化性、長時程規劃、記憶能力、知識推理」四個維度,提供比單一基準更立體的評估框架。
資料集增強
自訂視頻編碼:可配置 codec、品質、GOP、presets,自動探測硬體編碼器(NVENC、VideoToolbox、VAAPI、QSV),支援重新編碼既有資料集。
端到端深度支援:Intel RealSense 採集,12-bit 深度視頻流壓縮,訓練時解碼為物理單位(mm)。
語言標注規模化:支援帶時間戳的子任務、計畫、記憶、修正、語音、逐攝影機 VQA 等豐富標注,透過 VLM 自動填充。
2x 更快的資料載入:多攝影機幀並行解碼,dataloader 使用 uint8(記憶體降低 4x),部分集載入從 275 秒降至 0.06 秒。
部署與訓練基礎設施
lerobot-rollout CLI 提供五種可插拔策略:base(直接運行)、sentry(持續錄製並自動上傳)、highlight(觸發時儲存最後 N 秒)、episodic(傳統回合/重置)、dagger(DAgger 人機協作修正)。
FSDP 訓練:參數、梯度、優化器狀態跨 GPU 分片,checkpoint 合併為單一 model.safetensors,支援更換 GPU 數量後繼續訓練。
HF Jobs 雲端訓練:一行指令提交雲端任務,T4 到 8x H200 按需計費,策略自動上傳至 Hub。
關鍵要點
- 世界模型零成本:VLA-JEPA 的世界模型僅在訓練時存在,推論時完全不增加計算負擔。
- DAgger 閉環:deploy → 收集人工修正 → 微調 → 重複,構成完整的持續改善迴圈。
- 安裝輕量化:基礎依賴減少 40%,功能拆分為
[training]、[evaluation]等 extras,開箱即用更容易。 - 獎勵即評估工具:Robometer-4B 和 TOPReward 不只是訓練信號,也可作為資料集品質稽核器。
- 基準多維化:六個新基準刻意覆蓋不同難度維度,避免單一指標造成模型選擇偏差。
實務應用
硬體門檻降低:MolmoAct2 在 12GB GPU 即可推論,EVO1 僅 0.77B 參數,使本地 / 嵌入式部署成為可能。
DAgger 修正工作流:對於需要在真實環境持續改善的場景,sentry 和 dagger 策略組合提供了從記錄到微調的完整閉環,無需手動整理資料集。
深度感知任務:端到端深度支援使夾取高度精確任務(如堆疊薄片、精細組裝)不再依賴點雲後處理,直接在訓練管線中處理物理深度。
評估選擇建議:泛化性測試優先 LIBERO-plus → 長時程推理用 RoboCerebra → 記憶能力用 RoboMME,依任務特性選擇基準而非全跑,節省計算成本。
延伸觀點
兩篇 2026 年的世界模型綜述(arXiv 2605.00080、2606.00113)共同指出:世界模型的定位正從「任務專屬動力學預測器」演進為機器人學習的通用「預測基礎設施」。這與 LeRobot v0.6.0 的設計哲學高度吻合——VLA-JEPA 在訓練時注入世界模型監督、Robometer-4B 提供通用獎勵信號,都是「預測能力下沉為基礎設施」的體現。
世界模型的五種角色(arXiv 2606.00113):合成訓練經驗、過濾候選動作、評估計畫品質、作為學習環境、驗證執行結果。LeRobot v0.6.0 的三個世界模型策略主要佔據前三個角色,而獎勵模型 API 則填補了第五個角色。「計畫評估」仍是尚未直接提供的功能,是未來版本值得補足的缺口。
VLA 持續學習的另一條路(arXiv 2602.10503):LifeLong-RFT 以強化微調取代監督微調,在 LIBERO 基準上達成 22% 的成功率提升,且僅需 20% 訓練數據。這條路徑與 LeRobot 的 DAgger 閉環形成互補——DAgger 依賴人工介入提供修正示範,RL 微調則可從稀疏的任務完成信號自主改善,兩者結合有望減少對高品質人類示範的依賴。
仍待解決的挑戰:兩篇綜述都點出接觸建模(contact modeling)、幻覺控制(世界模型預測偏離物理現實)與動作對齊(action alignment)是開放問題。LeRobot 的六個新基準中,RoboMME 和 VLABench 間接壓測了這些能力,但尚無專門的接觸動力學評估套件。
整體而言,v0.6.0 標誌著 LeRobot 從「工具集」轉型為「機器人學習閉環平台」。世界模型、獎勵信號、部署修正回路三者的整合,使得一個研究者或工程師可在不離開框架的情況下完成從訓練到部署再到改善的完整循環,這是此版本最具戰略意義的設計決策。
相關頁面:Strands × LeRobot:從模擬到實機的 AI Agent 機器人整合框架 | Google DeepMind 歐洲機器人加速器:Physical AI 的產業化賭注 | MolmoMotion:語言引導的 3D 運動預測框架 | FRAPPE:世界模型驅動的機器人通用策略對齊框架
反向連結
以下頁面引用了本頁: