Text Generation Inference 文件

準備模型

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

準備模型

Text Generation Inference 從多個方面優化了模型。

量化 (Quantization)

TGI 支援 bits-and-bytesGPT-QAWQMarlinEETQEXL2fp8 量化。若要透過量化加速推理,只需根據您希望使用的量化技術,將 quantize 旗標設定為 bitsandbytesgptqawqmarlinexl2eetqfp8。使用 GPT-Q 量化時,您需要指向此處的模型之一。同樣地,使用 AWQ 量化時,您需要指向這些模型之一。若要了解更多關於量化的資訊,請參閱量化指南

RoPE 縮放 (RoPE Scaling)

RoPE 縮放可用於在推理期間增加模型的序列長度,而無需進行微調。若要啟用 RoPE 縮放,只需在透過 CLI 執行時傳入 --rope-scaling--max-input-length--rope-factors 旗標。--rope-scaling 可以採用 lineardynamic 值。如果您的模型未針對更長的序列長度進行微調,請使用 dynamic--rope-factor 是預期最大序列長度與模型原始最大序列長度之間的比率。請務必傳入 --max-input-length 以提供擴展所需的最大輸入長度。

我們建議使用 dynamic RoPE 縮放。

Safetensors

Safetensors 是一種用於深度學習模型、快速且安全的持久化格式,對於張量並行處理 (tensor parallelism) 是必需的。TGI 在底層支援 safetensors 模型載入。預設情況下,如果儲存庫中同時存在 safetensorspytorch 權重,TGI 將始終載入 safetensors。如果沒有 pytorch 權重,TGI 會將權重轉換為 safetensors 格式。

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.