Text Generation Inference 文件
準備模型
並獲得增強的文件體驗
開始使用
準備模型
Text Generation Inference 從多個方面優化了模型。
量化 (Quantization)
TGI 支援 bits-and-bytes、GPT-Q、AWQ、Marlin、EETQ、EXL2 和 fp8 量化。若要透過量化加速推理,只需根據您希望使用的量化技術,將 quantize 旗標設定為 bitsandbytes、gptq、awq、marlin、exl2、eetq 或 fp8。使用 GPT-Q 量化時,您需要指向此處的模型之一。同樣地,使用 AWQ 量化時,您需要指向這些模型之一。若要了解更多關於量化的資訊,請參閱量化指南。
RoPE 縮放 (RoPE Scaling)
RoPE 縮放可用於在推理期間增加模型的序列長度,而無需進行微調。若要啟用 RoPE 縮放,只需在透過 CLI 執行時傳入 --rope-scaling、--max-input-length 和 --rope-factors 旗標。--rope-scaling 可以採用 linear 或 dynamic 值。如果您的模型未針對更長的序列長度進行微調,請使用 dynamic。--rope-factor 是預期最大序列長度與模型原始最大序列長度之間的比率。請務必傳入 --max-input-length 以提供擴展所需的最大輸入長度。
我們建議使用
dynamicRoPE 縮放。
Safetensors
Safetensors 是一種用於深度學習模型、快速且安全的持久化格式,對於張量並行處理 (tensor parallelism) 是必需的。TGI 在底層支援 safetensors 模型載入。預設情況下,如果儲存庫中同時存在 safetensors 和 pytorch 權重,TGI 將始終載入 safetensors。如果沒有 pytorch 權重,TGI 會將權重轉換為 safetensors 格式。