核心概念
AI 在運動領域長期面臨一個根本不對稱:感知(辨識已發生的動作)比預測(推斷即將發生的動作)容易得多,但實務應用幾乎都需要後者。機器人要抓起桌上的杯子,必須在動作前就知道杯子的移動軌跡;視頻生成模型要產出物理合理的影片,必須預先建立連貫的運動路徑。
MolmoMotion 是 Allen AI(Ai2)推出的 4B 視覺語言模型,核心任務是:給定短片段的 RGB 畫面、使用者指定的 2D 查詢點(初始 3D 位置),以及自然語言動作描述,預測每個查詢點在未來約 2 秒內的 3D 軌跡。
運動表示的三個核心要求
MolmoMotion 選擇用物體依附的 3D 點在世界坐標系中表示運動,這個選擇並非偶然,而是為了同時滿足三個條件:
| 性質 | 說明 |
|---|---|
| 類別無關 | 不依賴人體骨架、手部 mesh 等固定模板,可處理任意物體 |
| 視角穩定 | 跨鏡頭角度保持一致的物理運動表示 |
| 直接可用 | 輸出可被機器人策略或視頻生成模型直接消費,無需二次轉換 |
模型架構:兩種預測策略
以 Molmo 2 多模態骨幹為主幹,MolmoMotion 提供兩種互補的預測變體:
- MolmoMotion-AR(自迴歸):以結構化文本格式逐步輸出坐標,適合明確路徑預測
- MolmoMotion-FM(流匹配):在連續 3D 空間將噪聲轉化為軌跡,適合表達不確定性與多個可能未來
MolmoMotion-1M 資料集
為了訓練這樣的模型,Ai2 建立了目前最大規模的 3D 點軌跡資料集,從 116 萬部影片中自動標注:覆蓋 736 種運動類型、5,600 種物體,每條資料均包含 3D 軌跡與配對的動作描述。
標注管道的關鍵在過濾:原始深度影片含有大量誤差(深度噪聲、追蹤漂移),管道透過物體級時空一致性篩除不可靠點,再裁切至物體實際運動的時間窗口,確保資料品質。
關鍵要點
-
PointMotionBench 基準:2,700 段人工驗證影片,涵蓋 111 個物體類別、61 種運動類型(室內操作、第一人稱手-物體交互、戶外動態場景),MolmoMotion 超越所有現有方法,包括參數化 3D 方法與視頻生成器基線
-
機器人規劃遷移:在模擬環境的 pick-and-place 任務中,MolmoMotion 達到 76.3% 成功率(vs. Molmo 2 基線 56.0%),且訓練效率大幅提升——2K 步達到對手 12K 步的誤差水準。關鍵洞察:無論是人手還是機器人夾爪抬起杯子,杯子的 3D 路徑本質相同,因此影片資料中的人類動作軌跡可直接遷移至機器人策略
-
視頻生成引導:以 MolmoMotion 預測的軌跡引導視頻生成,在 5 項運動相關指標中全部超越基礎模型,並在 4/5 項超越更大的 image-to-video 模型,對「文字難以精確描述的細粒度動作」效果最顯著
-
完整開源:模型權重、MolmoMotion-1M 資料集、PointMotionBench 基準、訓練程式碼全數開放
實務應用
對機器人開發者:MolmoMotion 提供了一條從網路影片到機器人策略的低成本遷移路徑。無需大量機器人收集資料,直接利用野外影片的人類動作軌跡做預訓練,再以少量機器人資料 fine-tune,可顯著壓縮資料成本。
對視頻生成工程師:將生成流程拆成「運動預測 → 條件生成」兩階段,能讓最終影片的物理合理性顯著提升,尤其適合需要精細動作控制的場景(廣告製作、遊戲動畫原型驗證)。
當前限制:每個物體目前僅支援 8 個查詢點,對複雜可變形物體(如布料、液體)的密集表面幾何描述不足,複雜形變動作的預測精度有限。
延伸觀點
MolmoMotion 的出現,與近期多個 arxiv 論文的趨勢高度吻合:
共同論點 1:語言作為運動空間的橋梁。「Flowing from Reasoning to Motion」(arxiv 2512.16907)與「This&That: Language-Gesture Controlled Video Generation for Robot Planning」均指出,從高層語言指令到低層 3D 運動之間需要明確的中間表示,純粹的文字-動作端對端模型在細粒度控制上存在瓶頸。MolmoMotion 的 3D 點軌跡正是此中間表示的一種實現。
共同論點 2:跨域數據遷移是降低機器人成本的關鍵。VLA 模型綜述(arxiv 2509.19012、2510.07077)均強調,現有機器人策略的瓶頸在於高品質動作資料的稀缺,而網路影片中的人類動作包含豐富的物理知識。MolmoMotion 的遷移實驗為這一方向提供了具體的量化驗證——這是 2 篇以上來源共同確認的方向。
單一來源觀點(來自 AlphaSignal 分析):MolmoMotion 將運動預測與感知並列,認為預測是「機器智能的基礎能力之一」,而非感知的附屬。這個視角值得關注,但目前還需更多實際部署案例支持。
相關頁面:功能感知機器人抓取:MLLM推理驅動框架 FRAPPE:世界模型驅動的機器人通用策略對齊框架
反向連結
以下頁面引用了本頁:
- FRAPPE:世界模型驅動的機器人通用策略對齊框架(研究速遞)
- 功能感知機器人抓取:MLLM推理驅動框架(研究速遞)
- LeRobot v0.6.0:世界模型、評估框架與端到端機器人學習閉環(文章精選)