Hub 文件
下載資料集
並獲得增強的文件體驗
開始使用
下載資料集
整合的函式庫
如果 Hub 上的資料集與受支援的函式庫綁定,則只需幾行程式碼即可載入資料集。若要了解如何存取資料集,您可以點擊資料集頁面上的「Use this dataset」按鈕來查看具體操作方式。例如,下方的 samsum 展示了如何使用 datasets 進行此操作。


使用 Hugging Face 用戶端函式庫
您可以使用 huggingface_hub 函式庫來建立、刪除、更新儲存庫並從中檢索資訊。例如,若要從命令列下載 HuggingFaceH4/ultrachat_200k 資料集,請執行
hf download HuggingFaceH4/ultrachat_200k --repo-type dataset
詳情請參閱 HF CLI 下載說明文件。
您也可以將此整合到您自己的函式庫中!例如,您可以使用 Pandas 透過幾行程式碼快速載入 CSV 資料集。
from huggingface_hub import hf_hub_download
import pandas as pd
REPO_ID = "YOUR_REPO_ID"
FILENAME = "data.csv"
dataset = pd.read_csv(
hf_hub_download(repo_id=REPO_ID, filename=FILENAME, repo_type="dataset")
)使用 Git
由於 Hub 上的所有資料集皆為以 Xet 為基礎的 Git 儲存庫,您可以透過安裝 git-xet 並執行以下指令,在本地端 clone 資料集:
git xet install
git lfs install
git clone git@hf.co:datasets/<dataset ID> # example: git clone git@hf.co:datasets/allenai/c4如果您擁有特定資料集儲存庫的寫入權限,您也將能夠提交 (commit) 並推送 (push) 修訂版本到該資料集。
請將您的 SSH 公開金鑰新增至您的使用者設定,以便推送變更和/或存取私人儲存庫。
更快速的下載
您可以在 fast.hf.co 測試從 Hugging Face CDN 下載的速度。這會針對距離最近的 HF 邊緣伺服器進行快速頻寬測試,協助您了解基準傳輸速率。您也可以使用 hf-speedtest CLI 擴充功能從終端機測量下載速度。
hf extensions install julien-c/hf-speedtest hf speedtest
為了實現更快的傳輸速度,Hub 使用了具有自適應併發性的 Xet 儲存後端,可根據網路狀況自動調整並行串流。請參閱模型加速下載以了解更多關於 HF_XET_HIGH_PERFORMANCE=1 等調整選項的詳細資訊。
使用 hf-mount
針對大型資料集,您可以使用 hf-mount 將儲存庫掛載為本地檔案系統,而不必下載整個儲存庫。檔案會以「延遲載入 (lazy loading)」方式取得 — 只有您的程式碼實際讀取的位元組才會經過網路傳輸。當您的工作流程需要本地檔案路徑(例如 tarfile、zipfile、imagefolder)而非 Python 迭代器時,此方法非常實用。
brew install hf-mount hf-mount start repo datasets/stanfordnlp/imdb /tmp/imdb
儲存庫以唯讀方式掛載。請參閱掛載為本地檔案系統以取得完整的設定細節、後端選項及快取資訊。
在 GitHub 上更新