Hub 文件

資料工作室 (Data Studio)

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

Data Studio

每個資料集頁面都包含一個呈現資料內容的表格,並以每頁 100 列進行排列。您可以使用表格底部的按鈕在頁面之間進行導覽。

檢查資料分佈

在欄位頂端,您可以看到代表其資料分佈的圖表。這能讓您快速了解類別的平衡程度、數值資料的範圍與分佈、文字長度,以及該欄位中資料缺失的比例。

依數值篩選

如果您點擊數值欄位直方圖中的長條,資料集檢視器會篩選資料,並僅顯示數值落在所選範圍內的資料列。同樣地,如果您從分類欄位中選擇一個類別,它將僅顯示屬於該所選類別的資料列。

在資料集中搜尋字詞

您可以透過在表格頂端的搜尋列輸入字詞,在資料集中進行搜尋。搜尋功能不區分大小寫,並會比對任何包含該字詞的資料列。即便值嵌套在字典或列表中,系統也會在 string 類型的欄位中進行文字搜尋。

對資料集執行 SQL 查詢

您可以透過 SQL 主控台(SQL Console)在瀏覽器中對資料集執行 SQL 查詢。此功能也運用了我們的自動轉換為 Parquet 技術。

如需更多資訊,請參閱我們的 SQL 主控台指南

分享特定資料列

您可以點擊特定資料列,然後複製瀏覽器網址列中的 URL 來分享該列。例如:https://huggingface.co/datasets/nyu-mll/glue/viewer/mrpc/test?p=2&row=241 將會開啟資料集工作室並定位到 MRPC 資料集的 test 分割區及其第 241 列。

代理程式追蹤(Agent Traces)

將來自 Claude Code、Codex 或 Pi 等工具的原始 JSONL 追蹤資料推送至資料集,即可在 Data Studio 中瀏覽,或將其同步至儲存區(Storage Bucket)並在該處開啟個別的 .jsonl 檔案。這兩種路徑都使用相同的追蹤檢視器來逐步檢查對話階段、輪次、工具呼叫及模型回應。如需支援的代理程式及其檢視方式,請參閱代理程式追蹤

大規模數據集

資料集檢視器支援大型資料集,但視資料格式而定,它可能僅顯示資料集的前 5GB。

  • 對於 Parquet 資料集:資料集檢視器會顯示完整的資料集,但排序、篩選及搜尋功能僅對前 5GB 有效。
  • 對於超過 5GB 且為其他格式(如 WebDataset 或 JSON Lines)的資料集:資料集檢視器僅會顯示前 5GB,且排序、篩選及搜尋功能也僅限於這前 5GB。

在此情況下,一則資訊訊息會告知您檢視器僅顯示部分資料。這應該足夠讓您以樣本代表完整資料集,如果您需要更大的樣本,請讓我們知道。

存取 Parquet 檔案

為了驅動資料集檢視器,每個資料集的前 5GB 會自動轉換為 Parquet 格式(除非它原本就是 Parquet 資料集)。在資料集檢視器中(例如參見 GLUE),您可以點擊 “Auto-converted to Parquet” 來存取 Parquet 檔案。請參考 資料集檢視器文件,了解如何使用 Polars、Pandas 或 DuckDB 等函式庫查詢資料集的 Parquet 檔案。

Parquet 是一種列式儲存格式,針對查詢和處理大型資料集進行了最佳化。Parquet 是大數據處理與分析的熱門選擇,並廣泛用於資料處理與機器學習。您可以在說明文件中進一步了解此格式的優勢。

轉換機器人(Conversion bot)

當您建立新的資料集時,parquet-converter 機器人會在將資料集轉換為 Parquet 後通知您。它在儲存庫中開啟的討論串會提供關於 Parquet 格式的詳細資訊,並連結至 Parquet 檔案。

程式化存取

您也可以使用 Hub API 以程式方式存取 Parquet 檔案列表;例如,端點 https://huggingface.co/api/datasets/nyu-mll/glue/parquet 列出了 nyu-mll/glue 資料集的 Parquet 檔案。

我們也針對 Dataset Viewer API 提供了專門的說明文件,您可以直接呼叫該 API。該 API 可讓您存取所有 Hugging Face Hub 資料集的內容、中繼資料及基本統計資訊,並為資料集檢視器前端提供支援。

資料集預覽

對於規模最大的資料集,頁面會顯示前 100 列的預覽,而非功能完整的檢視器。此限制僅適用於超過 5GB、非原生 Parquet 格式,且尚未自動轉換為 Parquet 的資料集。

將資料集檢視器嵌入網頁

您可以使用 iframe 將資料集檢視器嵌入您自己的網頁。使用的 URL 為 https://huggingface.co/datasets/<namespace>/<dataset-name>/embed/viewer,其中 <namespace> 是資料集的擁有者,<dataset-name> 是資料集名稱。您也可以傳入其他參數,如子集(subset)、分割區(split)、篩選、搜尋或所選列。

如需更多資訊,請參閱我們的指南:如何將資料集檢視器嵌入網頁

設定資料集檢視器

為了讓您的資料集正確運作資料集檢視器,請確保您的資料集採用支援的格式與結構。您也可以選擇使用 YAML 來設定您的資料集。

您可以透過在資料集的 README.md 檔案頂端新增 YAML 設定區塊,來指定要在資料集檢視器中顯示哪些檔案。例如,若要選擇哪個檔案屬於哪個分割區:

---
configs:
- config_name: default
  data_files:
  - split: train
    path: "data.csv"
  - split: test
    path: "holdout.csv"
---

您也可以為每個分割區選擇多個檔案,或使用 Glob 模式。

---
configs:
- config_name: default
  data_files:
  - split: train
    path:
    - "data/train_part1.csv"
    - "data/train_part2.csv"
  - split: test
    path: "data/*.csv"
---

對於私有資料集,資料集檢視器適用於 PRO 用戶以及 團隊或企業組織

如需更多資訊,請參閱我們的指南:如何設定資料集檢視器

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.