Text Generation Inference 文件
在 Nvidia GPU 上使用 TGI
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
在 Nvidia GPU 上使用 TGI
TGI 優化模型支援在安裝有 CUDA 12.2+ 的 NVIDIA H100、A100、A10G 和 T4 GPU 上執行。請注意,您必須安裝 NVIDIA Container Toolkit 才能使用它。
對於其他 NVIDIA GPU,仍會套用持續批次處理(continuous batching),但部分運算(如 flash attention 和 paged attention)將無法執行。
TGI 可以透過其官方 Docker 映像檔在 NVIDIA GPU 上使用。
model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run
docker run --gpus all --shm-size 64g -p 8080:80 -v $volume:/data \
ghcr.io/huggingface/text-generation-inference:3.3.5 \
--model-id $modelTGI 伺服器啟動後即可供用戶端查詢,請務必參閱「使用 TGI」指南。
在 GitHub 上更新