Text Generation Inference 文件
在 Intel GPU 上使用 TGI
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
在 Intel GPU 上使用 TGI
TGI 優化模型支援 Intel Data Center GPU Max1100 與 Max1550,建議透過 Docker 使用。
在搭載 Intel GPU 的伺服器上,可以透過以下指令啟動 TGI:
model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run
docker run --rm --privileged --cap-add=sys_nice \
--device=/dev/dri \
--ipc=host --shm-size 1g --net host -v $volume:/data \
ghcr.io/huggingface/text-generation-inference:3.3.5-intel-xpu \
--model-id $model --cuda-graphs 0在 Intel CPU 上使用 TGI
Intel® Extension for PyTorch (IPEX) 也針對 Intel CPU 提供了進一步的優化。IPEX 提供了諸如 Flash Attention、Paged Attention、Add + LayerNorm、ROPE 等優化運算。
在搭載 Intel CPU 的伺服器上,可以透過以下指令啟動 TGI:
model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run
docker run --rm --privileged --cap-add=sys_nice \
--device=/dev/dri \
--ipc=host --shm-size 1g --net host -v $volume:/data \
ghcr.io/huggingface/text-generation-inference:3.3.5-intel-cpu \
--model-id $model --cuda-graphs 0TGI 伺服器啟動後即可供用戶端查詢,請務必參閱「使用 TGI」指南。
在 GitHub 上更新