Text Generation Inference 文件

多後端支援

Hugging Face's logo
加入 Hugging Face 社群

並獲得增強的文件體驗

開始使用

多後端支援

TGI (Text Generation Inference) 透過支援多種後端來部署大型語言模型 (LLM),提供了高度的靈活性。藉由多後端支援,您可以選擇最符合您需求的後端,無論是優先考慮效能、易用性,還是與特定硬體的相容性。TGI 的 API 互動在不同後端間保持一致,讓您可以無縫地進行切換。

支援的後端

  • TGI CUDA 後端:此高效能後端專為 NVIDIA GPU 進行了優化,並作為 TGI 的預設選項。它是內部開發的,擁有眾多優化特性,並被包括 Hugging Face 在內的各種專案應用於生產環境中。
  • TGI TRTLLM 後端:此後端利用 NVIDIA 的 TensorRT 函式庫來加速 LLM 推論。它使用專業的優化技術與自定義核心 (custom kernels) 來提升效能。不過,它需要針對每一種 GPU 架構進行模型特定的編譯步驟。
  • TGI Llamacpp 後端:此後端透過整合 [llama.cpp][llama.cpp] 來簡化大型語言模型 (LLM) 的部署,這是一個針對 CPU 與 GPU 運算皆進行過優化的高階推論引擎。
  • TGI Neuron 後端:此後端利用 AWS Neuron SDK,讓大型語言模型 (LLM) 能夠部署在 AWS Trainium 與 Inferentia 晶片上。
在 GitHub 上更新

© . This site is unofficial and not affiliated with Hugging Face, Inc.