TRL 文件

TRL - Transformers Reinforcement Learning (變壓器強化學習)

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

TRL - Transformers Reinforcement Learning (變壓器強化學習)

TRL 是一個全端函式庫,我們提供了一套工具,用於透過監督式微調 (SFT)、群體相對策略優化 (GRPO)、直接偏好優化 (DPO)、獎勵建模 (Reward Modeling) 等方法來訓練變壓器 (Transformer) 語言模型。該函式庫與 🤗 transformers 深度整合。

🎉 最新消息

TRL v1:我們發布了 TRL v1 — 這是一個重要的里程碑,標誌著 TRL 本質上的重大轉變。閱讀 部落格文章 以了解更多資訊。

分類

以下是目前的 TRL 訓練器列表,按方法類型分組 (⚡️ = 支援 vLLM;🧪 = 實驗性功能)。

在線方法 (Online methods)

獎勵建模 (Reward modeling)

離線方法 (Offline methods)

知識蒸餾 (Knowledge distillation)

您也可以在 TRL Hugging Face 組織中探索與 TRL 相關的模型、資料集和示範。

學習

在 🤗 smol course 中學習使用 TRL 和其他函式庫進行訓練後調整 (Post-training)。

目錄

文件分為以下幾個部分:

  • 入門 (Getting Started):安裝與快速開始指南。
  • 概念指南 (Conceptual Guides):資料集格式、訓練常見問題解答,以及日誌解讀。
  • 操作指南 (How-to Guides):減少記憶體使用量、加速訓練、分佈式訓練等。
  • 整合 (Integrations):DeepSpeed、Liger Kernel、PEFT 等。
  • 範例 (Examples):範例總覽、社群教學等。
  • API:訓練器、工具函數等。

部落格文章

演講

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.