LeRobot 社群數據集:機器人學的「ImageNet」——何時以及如何實現?
🧭 TL;DR — 為什麼要寫這篇部落格文章?
在這篇文章中,我們將:
- 認可社群貢獻的 LeRobot 數據集日益增長的影響力
- 強調目前在機器人數據收集與策劃方面面臨的挑戰
- 分享實用步驟與最佳實踐,以最大化集體努力的影響力
我們的目標是將「泛化(Generalization)」定義為一個數據問題,並展示建立一個開放、多元的「機器人學 ImageNet」不僅是可能的——而且已經正在發生。
引言
視覺-語言-動作(VLA)模型的最新進展使機器人能夠執行廣泛的任務——從「抓取立方體」等簡單指令,到折疊衣物或清理桌面等更複雜的活動。這些模型的目標是實現泛化:即在新的環境中、使用未見過的物體,以及在不同條件下執行任務的能力。
「機器人學中最大的挑戰不是靈巧性,而是泛化——橫跨物理、視覺和語義層面的泛化。」
— Physical Intelligence
機器人必須「弄清楚如何在新的環境中或使用新的物體正確執行即使是簡單的任務」,這需要強大的技能以及對世界的常識性理解。然而,進展往往受到此類機器人系統缺乏多樣化數據的限制。
「泛化必須發生在許多層面上。在低層面,機器人必須知道如何拿起勺子(抓握手柄)或盤子(抓握邊緣),即使它以前沒見過這些特定的勺子或盤子,即使它們被放在一堆髒碗盤中。在更高層面,機器人必須理解每個任務的語義——該把衣服和鞋子放在哪裡(理想情況下是洗衣籃或衣櫃,而不是床上),以及什麼樣的工具適合擦拭溢出的液體。這種泛化需要強大的物理技能和對環境的常識性理解,以便機器人能同時在物理、視覺到語義的多個層面上進行泛化。而此類機器人系統缺乏多樣化數據,使這一點變得更加困難。」
— Physical Intelligence
從模型轉向數據:視角的轉換
簡單來說,通用策略的核心在於一個簡單的概念:在異構數據集上進行協同訓練(co-training)。透過讓 VLA 模型接觸各種環境、任務和機器人形態,我們不僅能教導模型如何採取行動,還能教導它們為何這樣做——即如何解讀場景、理解目標,並在不同情境下調整技能。
💡 「泛化不僅是一種模型屬性——它是一種數據現象。」
它源於訓練數據的多樣性、品質和抽象層次。
這將我們帶到了一個基本問題
鑑於目前的數據集,我們可以預期的泛化上限是什麼?
如果一個機器人在訓練期間從未遇到過類似的場景,它能有意義地回應一個全新的提示——例如「舉辦一場驚喜生日派對」嗎?特別是當大多數數據集都是在學術實驗室中、由有限的人員在受控良好的環境下收集時?
我們將泛化定義為一種數據中心視角:將其視為從數據中提取更廣泛模式的過程——本質上是「拉遠鏡頭」以揭示與任務無關的結構與原則。這種視角的轉變強調了數據集多樣性在驅動泛化方面,遠比僅靠模型架構重要。
為什麼機器人學還沒有迎來它的「ImageNet 時刻」?
到目前為止,大多數機器人數據集來自結構化的學術環境。即使我們擴展到數百萬次的演示,單一數據集往往會佔據主導地位,從而限制了多樣性。與聚合了網際網路規模數據並更全面地捕捉現實世界的 ImageNet 不同,機器人學缺乏一個類似的、社群驅動的多樣化基準。
這主要因為收集機器人數據需要物理硬體和大量的投入。
建立 LeRobot 社群
這就是為什麼我們在 LeRobot 致力於讓機器人數據收集變得更易於獲取——無論是在家中、學校還是任何地方。我們正在:
- 簡化錄製流程
- 簡化上傳至 Hugging Face Hub 的流程,以促進社群共享
- 降低硬體成本
我們已經看到了成果:Hub 上社群貢獻的數據集數量正在迅速成長。
Hugging Face Hub 上 lerobot 數據集的成長趨勢。
如果我們按機器人類型對上傳的數據集進行分類,會發現大多數貢獻集中於 So100 和 Koch,使得機器手臂和操作任務成為當前 LeRobot 數據集領域的核心。然而,重要的是要記住,其潛力遠不止於此。自動駕駛汽車、輔助機器人和移動導航等領域都能從共享數據中受益。這種動力讓我們距離一個數據集反映全球努力(而非僅僅單一實驗室或機構貢獻)的未來更近了一步。
lerobot 數據集按機器人類型的分佈。
以下是幾個引人注目的社群貢獻數據集,展示了機器人學可以多麼多樣且富有想像力:
lirislab/close_top_drawer_teabox:使用家用抽屜進行精確操作Chojins/chess_game_001_blue_stereo:從立體相機設置中捕捉的完整西洋棋對局pierfabre/chicken:沒錯——一個與彩色動物模型(包括一隻小雞 🐔)互動的機器人
您可以在 Hugging Face Hub 上透過 LeRobot 標籤探索更多創意數據集,並在 LeRobot 數據集視覺化工具中進行互動檢視。
負責任的擴展
隨著機器人數據收集變得更加普及,數據策劃成為下一個挑戰。儘管這些數據集仍是在受限環境中收集的,但它們是邁向經濟實惠、通用型機器人策略的關鍵一步。並非每個人都能獲得昂貴的硬體——但透過共享基礎設施與開放合作,我們可以建立遠比現在更偉大的事物。
🧠 「泛化不是在實驗室中解決的——它是透過世界來教導的。」
我們的數據越多元,模型的能力就越強。
更好的數據 = 更好的模型
為什麼數據品質很重要?低品質數據會導致下游性能不佳、輸出偏差,以及模型無法泛化。因此,高效且高品質的數據收集在推動通用機器人策略方面起著關鍵作用。
雖然視覺和語言的基礎模型在海量、網際網路規模的數據集上蓬勃發展,但機器人學卻缺乏一個「機器人網際網路」——一個龐大、多元的真實世界互動語料庫。相反地,機器人數據分散在不同的形態、感測器設置和控制模式中,形成了孤立的數據孤島。
為了克服這一點,像 Gr00t 這樣的最新方法將訓練數據組織為一個金字塔,其中:
- 大規模網路和影片數據構成基礎
- 合成數據增加了模擬的多樣性
- 頂層的真實世界機器人互動將模型錨定在物理執行上
在此框架內,高效的真實世界數據收集不可或缺——它將學到的行為錨定在實際的機器人硬體上,並縮小了模擬到現實的差距(sim-to-real gap),最終提高了機器人基礎模型的泛化性、適應性和性能。
透過擴大真實世界數據集的數量與多樣性,我們減少了異構數據源之間的碎片化。當數據集在環境、形態或任務分佈方面脫節時,模型很難在不同領域間進行知識遷移。
🔗 真實世界數據充當了結締組織——它將抽象的先驗知識與落地的動作對齊,並使模型能夠建立更具連貫性和可遷移性的表示。
因此,增加真實機器人互動的比例不僅僅是增強真實感——它還在結構上加強了金字塔各層之間的連結,從而產生更穩健、更強大的策略。
用於機器人基礎模型訓練的數據金字塔。改編自 Gr00t (Yang et al., 2025)。從底層到頂層,數據量減少,而形態特異性增加。
當前社群數據集面臨的挑戰
在 LeRobot,我們已開始開發自動化策劃管道來對社群數據集進行後處理。在後處理階段,我們確定了幾個領域,改進這些領域可以進一步提升數據集品質,並促進未來更有效的策劃:
1. 任務標註不完整或不一致
許多數據集缺乏任務描述,或任務描述細節缺失、模稜兩可。語義目前處於認知的核心,這意味著理解任務的背景和細節對機器人性能至關重要。詳細的說明不僅能確保機器人精確了解預期目標,還能為認知系統提供更廣泛的知識和詞彙量。歧義可能導致錯誤解釋,進而導致錯誤的動作。
任務說明可能是:
- 空的
- 太短(例如「Hold」、「Up」)
- 沒有任何具體意義(例如「task desc」、「desc」)
子任務級別的標註往往缺失,這使得難以對複雜的任務層次結構進行建模。
雖然這可以透過 VLM 處理,但最好還是由數據集的作者直接提供任務標註。
2. 特徵映射不一致
像 images.laptop 這樣的特徵標籤含糊不清
- 有時它是第三人稱視角
- 其他時候它更像是夾爪(手腕)相機
手動將數據集特徵映射到標準化名稱既費時又容易出錯。
我們或許可以利用 VLM 或電腦視覺模型來自動推斷特徵類型,以對相機視角進行分類。不過,記住這一點有助於保持數據集的整潔。
3. 品質低劣或不完整的片段
一些數據集包含:
- 僅有 1 幀或極少幀的片段
- 手動刪除的數據文件(例如,刪除了
.parquet文件而未重新索引),破壞了序列的一致性。
4. 動作/狀態維度不一致
不同的數據集使用不同的動作或狀態維度,即使是針對同一個機器人(例如 so100)。
一些數據集在動作/狀態格式上存在不一致。
什麼是好的數據集?
既然我們知道創建高品質數據集對於訓練可靠且具備泛化能力的機器人策略至關重要,我們整理了一份最佳實踐清單,以協助您收集有效的數據。
影像品質
- ✅ 建議使用兩個相機視角
- ✅ 確保穩定的影片捕捉(無晃動)
- ✅ 保持中性、穩定的光線(避免過度偏黃或偏藍的色調)
- ✅ 確保一致的曝光和清晰的對焦
- ✅ 領導臂(Leader arm)不應出現在畫面中
- ✅ 唯一移動的物體應為從動臂(Follower arm)及被操作的物品(避免人體肢體/身體)
- ✅ 使用靜態、無干擾的背景,或應用受控的變化
- ✅ 以高解析度錄製(至少 480x640 / 720p)
元數據與錄製規範
- ✅ 在元數據中選擇正確的機器人類型。如果您使用的是不在官方 LeRobot 配置註冊表中的自定義機器人,
我們建議查看 LeRobot Hub 上現有數據集中類似機器人的命名方式,以確保一致性。 - ✅ 以約 每秒 30 幀 (FPS) 的速率錄製影片
- ✅ 如果刪除片段,請務必相應地更新元數據文件(我們將提供用於編輯數據集的適當工具)
特徵命名慣例
為所有相機視角和觀測數據使用一致且具可解釋性的命名方案
格式:
<modality>.<location>
範例
images.topimages.frontimages.leftimages.right
避免使用設備特定的名稱:
- ❌
images.laptop - ❌
images.phone
對於手腕安裝的相機,請指定方向:
images.wrist.leftimages.wrist.rightimages.wrist.topimages.wrist.bottom
一致的命名提高了清晰度,並有助於下游模型更好地解釋空間配置和多視角輸入。
任務標註
- ✅ 使用
task欄位清晰描述機器人的目標- 範例:
Pick the yellow lego block and put it in the box(撿起黃色樂高積木並放入盒子中)
- 範例:
- ✅ 保持任務描述簡潔(介於 25–50 個字元之間)
- ✅ 避免使用
task1、demo2等模糊或通用的名稱。
我們在下方提供了一份檢查清單,作為錄製數據集的指南,概述了在數據收集過程中需要牢記的關鍵點。
圖 4: 數據集錄製檢查清單 – 一份確保一致且高品質真實世界數據收集的逐步指南。
您可以如何協助?
下一代通用機器人不會由單個人或實驗室構建 — 它們將由我們所有人共同構建。無論您是學生、研究人員,還是單純對機器人充滿好奇,以下是您可以加入的方式:
- 🎥 錄製您自己的數據集 — 使用 LeRobot 工具從您的機器人中捕捉並上傳高品質數據集。
- 🧠 提升數據集品質 — 遵循我們的檢查清單,整理您的錄製內容,並協助為機器人數據建立新標準。
- 📦 貢獻至 Hub — 上傳數據集、分享範例,並探索他人正在建構的內容。
- 💬 加入對話 — 透過參與我們的 LeRobot Discord 伺服器提供反饋、請求功能或協助塑造藍圖。
- 🌍 推動運動發展 — 將 LeRobot 介紹給您的社團、教室或實驗室。貢獻者越多 = 泛化效果越好。
開始錄製,開始貢獻——因為通用機器人的未來取決於我們今天所建立的數據。
