Hub 文件
資料檔案設定
並獲得增強的文件體驗
開始使用
資料檔案設定
對於如何建構資料集儲存庫(dataset repositories),沒有任何強制限制。
不過,若您希望「資料集檢視器」(Dataset Viewer)顯示特定的資料檔案,或是想將資料集拆分為訓練/驗證/測試等分割區(splits),則需要進行相應的結構設計。通常只需要依照分割區名稱來命名您的資料檔案即可,例如 train.csv 和 test.csv。
什麼是分割區(splits)與子集(subsets)?
機器學習資料集通常具有分割區,也可能包含子集。資料集通常由分割區(例如 train 和 test)組成,這些分割區用於模型訓練和評估的不同階段。子集(也稱為設定/組態,即 configuration)是包含在大型資料集中的子資料集。子集在多語言語音資料集中特別常見,每種語言可能會有不同的子集。如果您有興趣進一步了解分割區和子集,請查看 分割區與子集 指南!

自動偵測分割區
分割區會根據檔案和目錄名稱自動偵測。例如,這是一個包含 train、test 和 validation 分割區的資料集。
my_dataset_repository/
├── README.md
├── train.csv
├── test.csv
└── validation.csv若要透過根據分割區名稱命名資料檔案或目錄來建構資料集,請參閱 檔案名稱與分割區 文件,以及 範例資料集收藏集。
手動設定分割區與子集
您可以使用 YAML 選擇要在資料集檢視器中顯示的資料檔案。如果您想手動指定哪個檔案屬於哪個分割區,這將非常有用。
您還可以為資料集定義多個子集,並傳遞資料集建構參數(例如用於 CSV 檔案的分隔符號)。
以下是一個定義名為「benchmark」且包含 test 分割區之子集的設定範例。
configs:
- config_name: benchmark
data_files:
- split: test
path: benchmark.csv支援的檔案格式
請參閱 檔案格式 文件頁面,以取得支援格式的清單及資料集建議。如果您的資料集使用 CSV 或 TSV 檔案,可以在 範例資料集 中找到更多資訊。
資料集檢視器容量限制錯誤 ( TooBigContentError )
如果您看到 Error code: TooBigContentError,表示資料集檢視器無法在限制範圍內讀取預覽。常見的訊息包括 Parquet error: Scan size limit exceeded 和 The size of the content of the first rows exceeds the maximum supported size。
您可以採取的行動
- 對於 Parquet 檔案,請使用較小的列群組(row groups)並包含頁面索引(
write_page_index=True),以便檢視器僅讀取其所需的部分。 - 避免在首幾列使用過大的值(如極長的字串、大型 JSON 二進位檔、base64 負載)。若可能,請將大型負載移至獨立檔案。
- 將極大的檔案拆分為較小的分片(shards)或分割區,然後重新上傳。
- 如果問題仍然存在,請查看 設定資料集檢視器,並在您的資料集頁面上開啟討論區,附上完整的錯誤文字。
圖像、音訊與影片資料集
對於圖像/音訊/影片分類資料集,您也可以使用目錄來命名圖像/音訊/影片的類別。如果您的圖像/音訊/影片檔案具有後設資料(如標題、邊界框、轉錄檔等),您可以在它們旁邊放置後設資料檔案。
我們提供兩份指南供您參考:
在 GitHub 上更新