資料集文件
分享資料集至 Hub
並獲得增強的文件體驗
開始使用
將資料集分享至 Hub
Hub 擁有由社群策劃且廣受歡迎的豐富研究資料集。我們鼓勵您將資料集分享至 Hub,以協助機器學習社群成長並加速全人類的技術進步。我們歡迎所有的貢獻;新增資料集只需透過拖放即可完成!
如果您還沒有帳號,請先建立一個 Hugging Face Hub 帳號。
使用 Hub 網頁介面進行上傳
Hub 的網頁介面允許不具備開發經驗的使用者也能上傳資料集。
建立儲存庫
儲存庫 (Repository) 會託管您所有的資料集檔案,包括版本修訂記錄,這使得儲存多個資料集版本成為可能。
- 點擊您的個人資料並選擇 New Dataset (新增資料集) 以建立新的資料集儲存庫。
- 為您的資料集取個名字,並選擇它是公開 (public) 還是私人 (private) 資料集。公開資料集對任何人可見,而私人資料集僅能由您或您的組織成員查看。

上傳資料集
建立儲存庫後,導覽至 Files and versions (檔案與版本) 分頁來新增檔案。選擇 Add file (新增檔案) 以上傳您的資料集檔案。我們支援許多文字、音訊和影像資料副檔名,例如
.csv、.mp3和.jpg等。對於.csv、.json、.jsonl和.txt等文字資料副檔名,我們建議在上傳至 Hub 之前進行壓縮(例如轉為.zip或.gz副檔名)。Git LFS 預設不會追蹤文字檔案副檔名,如果檔案大於 10MB,它們將無法被 Commit 並上傳。請查看儲存庫中的
.gitattributes檔案以獲取完整的受追蹤副檔名清單。在本教學中,您可以使用以下範例.csv檔案,因為它們很小:train.csv, test.csv。

- 拖放您的資料集檔案,並加入簡短的描述性提交訊息 (commit message)。

- 上傳您的資料集檔案後,它們將會被儲存在您的資料集儲存庫中。

建立資料集說明卡 (Dataset Card)
新增資料集說明卡對於幫助使用者找到您的資料集,並了解如何負責任地使用它非常有價值。
- 點擊 Create Dataset Card (建立資料集說明卡) 以建立該說明卡。此按鈕會在您的儲存庫中建立一個
README.md檔案。

在頂部,您會看到 Metadata UI (元資料介面),其中包含諸如授權、語言和任務類別等多個欄位可供選擇。這些是協助使用者在 Hub 上搜尋並發現您資料集的最重要標籤。當您從每個欄位選擇一個選項時,它們將會自動加入到資料集說明卡的頂部。
您也可以查看 資料集說明卡規範 (Dataset Card specifications),其中包含一組完整的(非強制性的)標籤選項,例如
annotations_creators,以協助您選擇合適的標籤。

- 點擊編輯器頂部的 Import dataset card template (匯入資料集說明卡範本) 連結,以自動建立範本。填寫範本是向社群介紹您的資料集並協助使用者了解如何使用它的絕佳方式。若要查看優質資料集說明卡的詳細範例,請參考 CNN DailyMail 資料集說明卡。
載入資料集
一旦您的資料集儲存在 Hub 上,任何人都可以透過 load_dataset() 函數進行載入。
>>> from datasets import load_dataset
>>> dataset = load_dataset("stevhliu/demo")使用 Python 上傳
傾向以程式化方式上傳資料集的使用者,可以使用 huggingface_hub 函式庫。該函式庫允許使用者從 Python 與 Hub 進行互動。
- 首先安裝該函式庫:
pip install huggingface_hub
- 要在 Python 中將資料集上傳至 Hub,您需要登入您的 Hugging Face 帳號。
huggingface-cli login
- 使用
push_to_hub()函數協助您新增、Commit 並推送檔案到您的儲存庫。
>>> from datasets import load_dataset
>>> dataset = load_dataset("stevhliu/demo")
# dataset = dataset.map(...) # do all your processing here
>>> dataset.push_to_hub("stevhliu/processed_demo")若要將資料集設為私人,請將 private 參數設為 True。此參數僅在您首次建立儲存庫時有效。
>>> dataset.push_to_hub("stevhliu/private_processed_demo", private=True)若要為資料集新增新的配置(或子集),或是新增新的切分 (train/validation/test),請參閱 Dataset.push_to_hub() 的文件說明。
隱私權
私人資料集僅限您本人存取。同理,如果您在組織內分享資料集,則該組織的成員也可以存取該資料集。
透過將您的驗證權杖 (authentication token) 提供給 token 參數,即可載入私人資料集。
>>> from datasets import load_dataset
# Load a private individual dataset
>>> dataset = load_dataset("stevhliu/demo", token=True)
# Load a private organization dataset
>>> dataset = load_dataset("organization/dataset_name", token=True)接下來呢?
恭喜,您已完成這些教學課程!🥳
接下來,您可以:
- 進一步了解如何使用 🤗 Datasets 其他功能來 處理您的資料集。
- 串流大型資料集,無需將其下載至本地。
- 定義您的資料集切分與配置,並與社群分享您的資料集。
如果您對 🤗 Datasets 有任何疑問,歡迎加入並在我們的論壇向社群提問。
在 GitHub 上更新