Hub 文件
存取基準測試排行榜資料
並獲得增強的文件體驗
開始使用
存取基準測試排行榜資料
Hub 上的 基準測試資料集 (Benchmark datasets) 包含根據評估分數對模型進行排名的排行榜。您可以透過程式設計方式存取這些資料,以進行分析、建立儀表板或開發相關工具。
探索官方基準測試
使用 huggingface_hub 尋找所有官方基準測試資料集
from huggingface_hub import HfApi
api = HfApi()
for ds in api.list_datasets(benchmark=True):
print(ds.id)或直接透過 REST API(適用於 Agent 與腳本編寫)
GET https://huggingface.co/api/datasets?filter=benchmark:official取得排行榜排名
排行榜 API 會回傳基準測試資料集中已排名的模型分數
GET https://huggingface.co/api/datasets/{dataset_id}/leaderboard使用 get_dataset_leaderboard 以取得類型化的 DatasetLeaderboardEntry 物件形式的模型分數
from huggingface_hub import HfApi
api = HfApi()
leaderboard = api.get_dataset_leaderboard("SWE-bench/SWE-bench_Verified")
for entry in leaderboard[:5]:
print(f"#{entry.rank} {entry.model_id}: {entry.value}")
huggingface_hub預設會使用您快取的 Token。對於有門檻限制(gated)的基準測試資料集,請確保您已登入 (huggingface-cli login) 或明確傳遞 Tokenleaderboard = api.get_dataset_leaderboard("gated/benchmark", token="hf_...")
提供快速存取的 Curl 指令(適用於 Agent 與腳本編寫)
curl https://huggingface.co/api/datasets/cais/hle/leaderboard \ --header "Authorization: Bearer $(cat ~/.cache/huggingface/token)" | jq .
回應欄位
每個 DatasetLeaderboardEntry 包含:
| 欄位 | 說明 |
|---|---|
rank | 排行榜上的名次 |
model_id | 完整模型 ID(例如 Qwen/Qwen3.5-397B-A17B) |
value | 基準測試分數 |
verified(已驗證) | 結果是否已通過獨立驗證 |
author(作者) | User 或 Organization 物件 |
來源 (source) | 結果提交的來源(模型卡、外部來源等) |
filename | 評估結果 YAML 檔案的路徑(例如 .eval_results/swe_bench_verified.yaml) |
pull_request | 該提交在基準測試資料集儲存庫中的 PR 編號 |
notes(備註) | 與該項目關聯的選擇性備註 |
預聚合多基準測試資料集
如果您需要從單一檔案取得多項基準測試的分數,OpenEvals/leaderboard-data 資料集將各項官方基準測試的分數聚合為一個 Parquet 檔案。
您可以直接使用 pandas 透過 hf:// 路徑載入它。
import pandas as pd
df = pd.read_parquet(
"hf://datasets/OpenEvals/leaderboard-data/data/train-00000-of-00001.parquet"
)
print(df[["model_name", "provider", "aime2026_score", "mmluPro_score"]].head())這是無需呼叫多個 API 端點即可獲得跨基準測試檢視的最快方式。
利用模型元資料豐富排行榜資料
使用 huggingface_hub,透過發布日期、參數數量及其他元資料來豐富排行榜資料。
from huggingface_hub import HfApi
api = HfApi()
info = api.model_info("Qwen/Qwen3.5-397B-A17B")
print(f"Released: {info.created_at}")
print(f"Parameters: {info.safetensors.total / 1e9:.1f}B" if info.safetensors else "")以模型為中心的檢視:每個模型的評估結果
排行榜 API 提供的是以資料集為中心的檢視(單一基準測試上的所有模型)。若要進行反向操作——取得單一模型的所有基準測試分數——請使用帶有 expand=["evalResults"] 的 model_info。
from huggingface_hub import HfApi
api = HfApi()
info = api.model_info("Qwen/Qwen3.5-397B-A17B", expand=["evalResults"])
for result in info.eval_results:
print(f"{result.dataset_id}: {result.value}")這會回傳從模型 .eval_results/ 檔案解析出的 EvalResultEntry 物件。
範例:基於排行榜資料進行開發
Benchmark Leaderboard Race Space 結合了這些資料來源,建立了一個動畫視覺化效果,展示模型排名如何隨時間演變。您可以基於這些資料建立自己的分析與視覺化圖表 —— 請查看原始程式碼以取得完整範例。
將排行榜嵌入網頁
您可以透過 iframe 將基準測試資料集的排行榜直接嵌入到您自己的網頁中。
使用的 URL 為 https://huggingface.co/datasets/<namespace>/<dataset-name>/embed/leaderboard,其中 <namespace> 是基準測試資料集的擁有者(使用者或組織),而 <dataset-name> 是資料集名稱。
<iframe
src="https://huggingface.co/datasets/cais/hle/embed/leaderboard"
frameborder="0"
width="100%"
height="560px"
></iframe>參數
您可以透過在 iframe URL 中傳遞查詢參數來設定嵌入的排行榜:
| 參數 | 說明 |
|---|---|
leaderboard_task_id | 要顯示的任務 ID,定義於基準測試的 eval.yaml 中(例如 gpqa_diamond)。預設為第一個任務。 |
eval_result | 要在排行榜上強調的模型 ID(例如 meta-llama/Llama-3.1-8B)。 |
leaderboard_max_params | 根據最大參數數量篩選列。接受下列其中一個值:1B、3B、6B、12B、32B、128B 或 500B。 |
leaderboard_is_expanded | 設為 true 以預設展開排行榜,而非摺疊顯示。 |
例如,要嵌入 HLE 排行榜並將表格展開,同時標記特定模型:
<iframe
src="https://huggingface.co/datasets/cais/hle/embed/leaderboard?leaderboard_is_expanded=true&eval_result=meta-llama/Llama-3.1-8B"
frameborder="0"
width="100%"
height="560px"
></iframe>此嵌入功能僅適用於擁有評估結果的官方基準測試資料集。
相關內容
- 評估結果 (Eval Results) — 如何提交評估結果並註冊基準測試
- 官方基準測試資料集 — 瀏覽所有官方基準測試