LeRobot 文件
WALL-OSS
並獲得增強的文件體驗
開始使用
WALL-OSS
WALL-OSS 是一個由 XSquare Robot 團隊於 2025 年提出的具身智慧開源基礎模型。其 LeRobot 實作版本改編自他們的開源 WallX 程式庫。
X Square Robot 的 WALL-OSS 現已整合至 Hugging Face 的 LeRobot 生態系統。這是 LeRobot 與 X Square Robot 團隊之間一項令人振奮的合作專案。您現在可以直接透過 LeRobot 對 WALL-OSS 進行後續訓練(post-train)、評估與部署。我們致力於讓開源機器人社群能更輕鬆地自訂與部署 WALL-OSS 基礎模型。閱讀並探索 WALL-OSS 的論文與程式碼。
模型概覽
WALL-OSS 團隊打造此具身基礎模型,旨在擷取並壓縮世界上最有價值的數據:連續且高保真的物理交互流。透過在模型的決策與身體的實際體驗之間建立直接的反饋迴路,實現了真正具備泛化能力的智慧——不僅能理解世界運作的原理,還能知道如何在其中有效行動。
在技術上,WALL-OSS 引入了一種緊密耦合的多模態架構(緊密耦合的 MoE 結構),整合了離散與連續的動作建模策略。透過兩階段的訓練流程(Inspiration → Integration),該模型逐漸統一了語義推理與高頻動作生成。其核心創新包括:
- 具身感知增強的多模態預訓練:在統一的視覺-語言-動作數據上進行大規模訓練,以強化對空間、因果關係與操作的理解。
- 統一跨層思維鏈 (Uni-CoT):一個單一的可微分框架,統一了高層指令推理、子任務分解與細粒度動作合成,形成從「理解」到「執行」的連續鏈條。
- 專家混合 (MoE) 動作頭:根據任務階段動態激活專家,並在離散或連續空間中進行動作建模,以維持穩定的 VLM 先驗。
- 兩階段訓練範式:
- 啟發階段 (Inspiration stage):注入離散動作先驗,以增強空間理解與語義-動作對齊。
- 整合階段 (Integration stage):使用流匹配 (Flow Matching) 來實現高頻連續控制。
安裝需求
請遵循我們的安裝指南來安裝 LeRobot。
執行以下指令安裝 WallX 依賴套件:
pip install -e ".[wallx]"
使用方式
若要在 LeRobot 中使用 WallX,請將策略類型(policy type)指定為:
policy.type=wall_x訓練
若要訓練 WallX,您可以使用標準的 LeRobot 訓練腳本並搭配適當的設定:
lerobot-train \
--dataset.repo_id=your_dataset \
--policy.type=wall_x \
--output_dir=./outputs/wallx_training \
--job_name=wallx_training \
--policy.repo_id=your_repo_id \
--policy.pretrained_name_or_path=x-square-robot/wall-oss-flow \
--policy.prediction_mode=diffusion \
--policy.attn_implementation=eager \
--steps=3000 \
--policy.device=cuda \
--batch_size=32訓練參數 (Training Arguments)
| 參數 | 說明 |
|---|---|
--dataset.repo_id | 您的訓練數據集在 Hugging Face Hub 上的儲存庫 ID(例如:lerobot/aloha_sim_insertion_human) |
--policy.type | 指定使用 WallX 策略架構 |
--output_dir | 儲存訓練檢查點(checkpoints)與日誌的本地目錄 |
--job_name | 本次訓練任務的識別名稱(用於日誌紀錄與追蹤) |
--policy.repo_id | 您要推送到 Hugging Face Hub 的儲存庫 ID,訓練好的模型將存放於此 |
--policy.pretrained_path | 用於初始化的預訓練 WallX 權重路徑(官方 WALL-OSS 檢查點) |
--policy.prediction_mode | 動作預測策略:diffusion 或 fast - diffusion 使用迭代去噪進行動作生成,fast 則使用下一個 Token 預測 |
--policy.attn_implementation | 注意力機制實作後端 - eager 使用標準 PyTorch 注意力(其他選項包括 flash_attention_2 或 sdpa) |
--steps | 訓練執行的總步驟數 |
--policy.device | 訓練裝置(GPU 使用 cuda,CPU 使用 cpu) |
--batch_size | 每個訓練批次的樣本數 |
授權
本模型遵循 Apache 2.0 授權條款,與原始的 WallX 儲存庫一致。
在 GitHub 上更新