Text Generation Inference 文件
提供私有與受限(Gated)模型服務
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
部署私人與受限模型
若您希望部署的模型受權限控管(gated access),或是該模型儲存庫在 Hugging Face Hub 上為私人(private)狀態,且您擁有該模型的存取權限,則可以提供您的 Hugging Face Hub 存取權杖(access token)。您可以從 Hugging Face Hub 權杖頁面 產生並複製一個唯讀(read)權杖。
如果您使用的是 CLI,請設定 HF_TOKEN 環境變數。例如:
export HF_TOKEN=<YOUR READ TOKEN>如果您想透過 Docker 進行部署,可以如下所示,透過指定 HF_TOKEN 來提供您的權杖。
model=meta-llama/Llama-2-7b-chat-hf
volume=$PWD/data
token=<your READ token>
docker run --gpus all \
--shm-size 1g \
-e HF_TOKEN=$token \
-p 8080:80 \
-v $volume:/data ghcr.io/huggingface/text-generation-inference:3.3.5 \
--model-id $model