Text Generation Inference 文件
支援的模型
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
支援的模型
Text Generation Inference 支援部署經過優化的模型。以下章節列出了目前支援的模型(VLM 與 LLM)。
- Deepseek V2
- Deepseek V3
- Idefics 2 (多模態)
- Idefics 3 (多模態)
- Llava Next (1.6) (多模態)
- Llama
- Llama4
- Phi 3
- Granite
- Gemma
- PaliGemma
- Gemma2
- Gemma3
- Gemma3 Text
- Cohere
- Dbrx
- Mamba
- Mistral
- Mixtral
- Gpt Bigcode
- Phi
- PhiMoe
- Baichuan
- Falcon
- StarCoder 2
- Qwen 2
- Qwen 2 VL
- Qwen 2.5 VL
- Opt
- T5
- Galactica
- SantaCoder
- Bloom
- Mpt
- Gpt2
- Gpt Neox
- Gptj
- Idefics (多模態)
- Mllama (多模態)
如果上述清單中缺乏您想要部署的模型,您可以根據該模型的管線(pipeline)類型,嘗試初始化並部署該模型以觀察其效能表現,但對於未經優化的模型,我們無法保證其效能。
# for causal LMs/text-generation models
AutoModelForCausalLM.from_pretrained(<model>, device_map="auto")
# or, for text-to-text generation models
AutoModelForSeq2SeqLM.from_pretrained(<model>, device_map="auto")如果您希望部署已存在於本機資料夾中的受支援模型,只需指向該本機資料夾路徑即可。
text-generation-launcher --model-id <PATH-TO-LOCAL-BLOOM>