LeRobot 文件

WALL-OSS

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

WALL-OSS

WALL-OSS 是一個由 XSquare Robot 團隊於 2025 年提出的具身智慧開源基礎模型。其 LeRobot 實作版本改編自他們的開源 WallX 程式庫。

X Square Robot 的 WALL-OSS 現已整合至 Hugging Face 的 LeRobot 生態系統。這是 LeRobot 與 X Square Robot 團隊之間一項令人振奮的合作專案。您現在可以直接透過 LeRobot 對 WALL-OSS 進行後續訓練(post-train)、評估與部署。我們致力於讓開源機器人社群能更輕鬆地自訂與部署 WALL-OSS 基礎模型。閱讀並探索 WALL-OSS 的論文程式碼

模型概覽

WALL-OSS 團隊打造此具身基礎模型,旨在擷取並壓縮世界上最有價值的數據:連續且高保真的物理交互流。透過在模型的決策與身體的實際體驗之間建立直接的反饋迴路,實現了真正具備泛化能力的智慧——不僅能理解世界運作的原理,還能知道如何在其中有效行動。

An overview of WALL-OSS

在技術上,WALL-OSS 引入了一種緊密耦合的多模態架構(緊密耦合的 MoE 結構),整合了離散與連續的動作建模策略。透過兩階段的訓練流程(Inspiration → Integration),該模型逐漸統一了語義推理與高頻動作生成。其核心創新包括:

  • 具身感知增強的多模態預訓練:在統一的視覺-語言-動作數據上進行大規模訓練,以強化對空間、因果關係與操作的理解。
  • 統一跨層思維鏈 (Uni-CoT):一個單一的可微分框架,統一了高層指令推理、子任務分解與細粒度動作合成,形成從「理解」到「執行」的連續鏈條。
  • 專家混合 (MoE) 動作頭:根據任務階段動態激活專家,並在離散或連續空間中進行動作建模,以維持穩定的 VLM 先驗。
  • 兩階段訓練範式:
    • 啟發階段 (Inspiration stage):注入離散動作先驗,以增強空間理解與語義-動作對齊。
    • 整合階段 (Integration stage):使用流匹配 (Flow Matching) 來實現高頻連續控制。

安裝需求

  1. 請遵循我們的安裝指南來安裝 LeRobot。

  2. 執行以下指令安裝 WallX 依賴套件:

    pip install -e ".[wallx]"

使用方式

若要在 LeRobot 中使用 WallX,請將策略類型(policy type)指定為:

policy.type=wall_x

訓練

若要訓練 WallX,您可以使用標準的 LeRobot 訓練腳本並搭配適當的設定:

lerobot-train \
    --dataset.repo_id=your_dataset \
    --policy.type=wall_x \
    --output_dir=./outputs/wallx_training \
    --job_name=wallx_training \
    --policy.repo_id=your_repo_id \
    --policy.pretrained_name_or_path=x-square-robot/wall-oss-flow \
    --policy.prediction_mode=diffusion \
    --policy.attn_implementation=eager \
    --steps=3000 \
    --policy.device=cuda \
    --batch_size=32

訓練參數 (Training Arguments)

參數 說明
--dataset.repo_id 您的訓練數據集在 Hugging Face Hub 上的儲存庫 ID(例如:lerobot/aloha_sim_insertion_human
--policy.type 指定使用 WallX 策略架構
--output_dir 儲存訓練檢查點(checkpoints)與日誌的本地目錄
--job_name 本次訓練任務的識別名稱(用於日誌紀錄與追蹤)
--policy.repo_id 您要推送到 Hugging Face Hub 的儲存庫 ID,訓練好的模型將存放於此
--policy.pretrained_path 用於初始化的預訓練 WallX 權重路徑(官方 WALL-OSS 檢查點)
--policy.prediction_mode 動作預測策略:diffusionfast - diffusion 使用迭代去噪進行動作生成,fast 則使用下一個 Token 預測
--policy.attn_implementation 注意力機制實作後端 - eager 使用標準 PyTorch 注意力(其他選項包括 flash_attention_2sdpa
--steps 訓練執行的總步驟數
--policy.device 訓練裝置(GPU 使用 cuda,CPU 使用 cpu
--batch_size 每個訓練批次的樣本數

授權

本模型遵循 Apache 2.0 授權條款,與原始的 WallX 儲存庫一致。

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.