Text Generation Inference 文件

在 Nvidia GPU 上使用 TGI

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

在 Nvidia GPU 上使用 TGI

TGI 優化模型支援在安裝有 CUDA 12.2+ 的 NVIDIA H100A100A10GT4 GPU 上執行。請注意,您必須安裝 NVIDIA Container Toolkit 才能使用它。

對於其他 NVIDIA GPU,仍會套用持續批次處理(continuous batching),但部分運算(如 flash attention 和 paged attention)將無法執行。

TGI 可以透過其官方 Docker 映像檔在 NVIDIA GPU 上使用。

model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run

docker run --gpus all --shm-size 64g -p 8080:80 -v $volume:/data \
    ghcr.io/huggingface/text-generation-inference:3.3.5 \
    --model-id $model

TGI 伺服器啟動後即可供用戶端查詢,請務必參閱「使用 TGI」指南。

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.