Text Generation Inference 文件

在 Intel GPU 上使用 TGI

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

在 Intel GPU 上使用 TGI

TGI 優化模型支援 Intel Data Center GPU Max1100Max1550,建議透過 Docker 使用。

在搭載 Intel GPU 的伺服器上,可以透過以下指令啟動 TGI:

model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run

docker run --rm --privileged --cap-add=sys_nice \
    --device=/dev/dri \
    --ipc=host --shm-size 1g --net host -v $volume:/data \
    ghcr.io/huggingface/text-generation-inference:3.3.5-intel-xpu \
    --model-id $model --cuda-graphs 0

在 Intel CPU 上使用 TGI

Intel® Extension for PyTorch (IPEX) 也針對 Intel CPU 提供了進一步的優化。IPEX 提供了諸如 Flash Attention、Paged Attention、Add + LayerNorm、ROPE 等優化運算。

在搭載 Intel CPU 的伺服器上,可以透過以下指令啟動 TGI:

model=teknium/OpenHermes-2.5-Mistral-7B
volume=$PWD/data # share a volume with the Docker container to avoid downloading weights every run

docker run --rm --privileged --cap-add=sys_nice \
    --device=/dev/dri \
    --ipc=host --shm-size 1g --net host -v $volume:/data \
    ghcr.io/huggingface/text-generation-inference:3.3.5-intel-cpu \
    --model-id $model --cuda-graphs 0

TGI 伺服器啟動後即可供用戶端查詢,請務必參閱「使用 TGI」指南。

在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.