Hub 文件
資料工作室 (Data Studio)
並獲得增強的文件體驗
開始使用
Data Studio
每個資料集頁面都包含一個呈現資料內容的表格,並以每頁 100 列進行排列。您可以使用表格底部的按鈕在頁面之間進行導覽。

檢查資料分佈
在欄位頂端,您可以看到代表其資料分佈的圖表。這能讓您快速了解類別的平衡程度、數值資料的範圍與分佈、文字長度,以及該欄位中資料缺失的比例。
依數值篩選
如果您點擊數值欄位直方圖中的長條,資料集檢視器會篩選資料,並僅顯示數值落在所選範圍內的資料列。同樣地,如果您從分類欄位中選擇一個類別,它將僅顯示屬於該所選類別的資料列。

在資料集中搜尋字詞
您可以透過在表格頂端的搜尋列輸入字詞,在資料集中進行搜尋。搜尋功能不區分大小寫,並會比對任何包含該字詞的資料列。即便值嵌套在字典或列表中,系統也會在 string 類型的欄位中進行文字搜尋。
對資料集執行 SQL 查詢
您可以透過 SQL 主控台(SQL Console)在瀏覽器中對資料集執行 SQL 查詢。此功能也運用了我們的自動轉換為 Parquet 技術。

如需更多資訊,請參閱我們的 SQL 主控台指南。
分享特定資料列
您可以點擊特定資料列,然後複製瀏覽器網址列中的 URL 來分享該列。例如:https://huggingface.co/datasets/nyu-mll/glue/viewer/mrpc/test?p=2&row=241 將會開啟資料集工作室並定位到 MRPC 資料集的 test 分割區及其第 241 列。

代理程式追蹤(Agent Traces)
將來自 Claude Code、Codex 或 Pi 等工具的原始 JSONL 追蹤資料推送至資料集,即可在 Data Studio 中瀏覽,或將其同步至儲存區(Storage Bucket)並在該處開啟個別的 .jsonl 檔案。這兩種路徑都使用相同的追蹤檢視器來逐步檢查對話階段、輪次、工具呼叫及模型回應。如需支援的代理程式及其檢視方式,請參閱代理程式追蹤。
大規模數據集
資料集檢視器支援大型資料集,但視資料格式而定,它可能僅顯示資料集的前 5GB。
- 對於 Parquet 資料集:資料集檢視器會顯示完整的資料集,但排序、篩選及搜尋功能僅對前 5GB 有效。
- 對於超過 5GB 且為其他格式(如 WebDataset 或 JSON Lines)的資料集:資料集檢視器僅會顯示前 5GB,且排序、篩選及搜尋功能也僅限於這前 5GB。
在此情況下,一則資訊訊息會告知您檢視器僅顯示部分資料。這應該足夠讓您以樣本代表完整資料集,如果您需要更大的樣本,請讓我們知道。
存取 Parquet 檔案
為了驅動資料集檢視器,每個資料集的前 5GB 會自動轉換為 Parquet 格式(除非它原本就是 Parquet 資料集)。在資料集檢視器中(例如參見 GLUE),您可以點擊 “Auto-converted to Parquet” 來存取 Parquet 檔案。請參考 資料集檢視器文件,了解如何使用 Polars、Pandas 或 DuckDB 等函式庫查詢資料集的 Parquet 檔案。
Parquet 是一種列式儲存格式,針對查詢和處理大型資料集進行了最佳化。Parquet 是大數據處理與分析的熱門選擇,並廣泛用於資料處理與機器學習。您可以在說明文件中進一步了解此格式的優勢。
轉換機器人(Conversion bot)
當您建立新的資料集時,parquet-converter 機器人會在將資料集轉換為 Parquet 後通知您。它在儲存庫中開啟的討論串會提供關於 Parquet 格式的詳細資訊,並連結至 Parquet 檔案。

程式化存取
您也可以使用 Hub API 以程式方式存取 Parquet 檔案列表;例如,端點 https://huggingface.co/api/datasets/nyu-mll/glue/parquet 列出了 nyu-mll/glue 資料集的 Parquet 檔案。
我們也針對 Dataset Viewer API 提供了專門的說明文件,您可以直接呼叫該 API。該 API 可讓您存取所有 Hugging Face Hub 資料集的內容、中繼資料及基本統計資訊,並為資料集檢視器前端提供支援。
資料集預覽
對於規模最大的資料集,頁面會顯示前 100 列的預覽,而非功能完整的檢視器。此限制僅適用於超過 5GB、非原生 Parquet 格式,且尚未自動轉換為 Parquet 的資料集。

將資料集檢視器嵌入網頁
您可以使用 iframe 將資料集檢視器嵌入您自己的網頁。使用的 URL 為 https://huggingface.co/datasets/<namespace>/<dataset-name>/embed/viewer,其中 <namespace> 是資料集的擁有者,<dataset-name> 是資料集名稱。您也可以傳入其他參數,如子集(subset)、分割區(split)、篩選、搜尋或所選列。
如需更多資訊,請參閱我們的指南:如何將資料集檢視器嵌入網頁。
設定資料集檢視器
為了讓您的資料集正確運作資料集檢視器,請確保您的資料集採用支援的格式與結構。您也可以選擇使用 YAML 來設定您的資料集。
您可以透過在資料集的 README.md 檔案頂端新增 YAML 設定區塊,來指定要在資料集檢視器中顯示哪些檔案。例如,若要選擇哪個檔案屬於哪個分割區:
---
configs:
- config_name: default
data_files:
- split: train
path: "data.csv"
- split: test
path: "holdout.csv"
---您也可以為每個分割區選擇多個檔案,或使用 Glob 模式。
---
configs:
- config_name: default
data_files:
- split: train
path:
- "data/train_part1.csv"
- "data/train_part2.csv"
- split: test
path: "data/*.csv"
---對於私有資料集,資料集檢視器適用於 PRO 用戶以及 團隊或企業組織。
如需更多資訊,請參閱我們的指南:如何設定資料集檢視器。
在 GitHub 上更新