Text Generation Inference 文件
非核心模型推論服務
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
非核心模型服務
TGI 支援多種 LLM 架構(完整列表請見此處)。如果您希望服務的模型不在支援清單中,TGI 將會回退(fallback)使用該模型的 transformers 實作。這意味著您將無法使用 TGI 引進的部分功能,例如張量平行分片(tensor-parallel sharding)或 Flash Attention。不過,您仍然可以獲得 TGI 的許多優勢,例如連續批次處理(continuous batching)或串流輸出(streaming outputs)。
您可以使用與完全支援的模型相同的 Docker 指令列呼叫來服務這些模型 👇
docker run --gpus all --shm-size 1g -p 8080:80 -v $volume:/data ghcr.io/huggingface/text-generation-inference:latest --model-id gpt2如果您想服務的模型是自訂的 transformers 模型,且其權重與實作已上傳至 Hub,您仍然可以透過在 docker run 指令中傳入 --trust-remote-code 旗標來服務該模型,如下所示 👇
docker run --gpus all --shm-size 1g -p 8080:80 -v $volume:/data ghcr.io/huggingface/text-generation-inference:latest --model-id <CUSTOM_MODEL_ID> --trust-remote-code最後,如果模型不在 Hugging Face Hub 上而是位於您的本機,您可以傳入包含您模型的資料夾路徑,如下所示 👇
# Make sure your model is in the $volume directory
docker run --shm-size 1g -p 8080:80 -v $volume:/data ghcr.io/huggingface/text-generation-inference:latest --model-id /data/<PATH-TO-FOLDER>您可以參閱 transformers 關於自訂模型的文件以取得更多資訊。
在 GitHub 上更新