TRL 文件
TRL - Transformers Reinforcement Learning (變壓器強化學習)
並獲得增強的文件體驗
開始使用

TRL - Transformers Reinforcement Learning (變壓器強化學習)
TRL 是一個全端函式庫,我們提供了一套工具,用於透過監督式微調 (SFT)、群體相對策略優化 (GRPO)、直接偏好優化 (DPO)、獎勵建模 (Reward Modeling) 等方法來訓練變壓器 (Transformer) 語言模型。該函式庫與 🤗 transformers 深度整合。
🎉 最新消息
TRL v1:我們發布了 TRL v1 — 這是一個重要的里程碑,標誌著 TRL 本質上的重大轉變。閱讀 部落格文章 以了解更多資訊。
分類
以下是目前的 TRL 訓練器列表,按方法類型分組 (⚡️ = 支援 vLLM;🧪 = 實驗性功能)。
在線方法 (Online methods)
GRPOTrainer⚡️RLOOTrainer⚡️OnlineDPOTrainer🧪 ⚡️NashMDTrainer🧪 ⚡️PPOTrainer🧪XPOTrainer🧪 ⚡️
獎勵建模 (Reward modeling)
您也可以在 TRL Hugging Face 組織中探索與 TRL 相關的模型、資料集和示範。
學習
在 🤗 smol course 中學習使用 TRL 和其他函式庫進行訓練後調整 (Post-training)。
目錄
文件分為以下幾個部分:
- 入門 (Getting Started):安裝與快速開始指南。
- 概念指南 (Conceptual Guides):資料集格式、訓練常見問題解答,以及日誌解讀。
- 操作指南 (How-to Guides):減少記憶體使用量、加速訓練、分佈式訓練等。
- 整合 (Integrations):DeepSpeed、Liger Kernel、PEFT 等。
- 範例 (Examples):範例總覽、社群教學等。
- API:訓練器、工具函數等。
部落格文章
發布於 2026 年 3 月 27 日
TRL v1:當領域否定自身假設時,依然穩健的訓練後調整函式庫
發布於 2025 年 10 月 23 日
共同建構開放代理生態系統:OpenEnv 介紹
發布於 2025 年 8 月 7 日
TRL 中的視覺語言模型對齊 ⚡️
發布於 2025 年 6 月 3 日
不遺漏任何 GPU:透過 TRL 中的 vLLM 同機部署釋放效率
發布於 2025 年 5 月 25 日
🐯 Liger GRPO 與 TRL 的結合
發布於 2025 年 1 月 28 日
Open-R1:DeepSeek-R1 的完全開源復現
發布於 2024 年 7 月 10 日
使用 TRL 進行視覺語言模型的偏好優化
發布於 2024 年 6 月 12 日
將強化學習 (RL) 帶回 RLHF
發布於 2023 年 9 月 29 日
透過 TRL 使用 DDPO 微調 Stable Diffusion 模型
發布於 2023 年 8 月 8 日
使用 DPO 微調 Llama 2
發布於 2023 年 4 月 5 日
StackLLaMA:使用 RLHF 訓練 LLaMA 的實作指南
發布於 2023 年 3 月 9 日
在 24GB 消費級 GPU 上使用 RLHF 微調 20B LLM
發布於 2022 年 12 月 9 日
圖解來自人類回饋的強化學習 (RLHF)