Text Generation Inference 文件
多後端支援
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
多後端支援
TGI (Text Generation Inference) 透過支援多種後端來部署大型語言模型 (LLM),提供了高度的靈活性。藉由多後端支援,您可以選擇最符合您需求的後端,無論是優先考慮效能、易用性,還是與特定硬體的相容性。TGI 的 API 互動在不同後端間保持一致,讓您可以無縫地進行切換。
支援的後端
- TGI CUDA 後端:此高效能後端專為 NVIDIA GPU 進行了優化,並作為 TGI 的預設選項。它是內部開發的,擁有眾多優化特性,並被包括 Hugging Face 在內的各種專案應用於生產環境中。
- TGI TRTLLM 後端:此後端利用 NVIDIA 的 TensorRT 函式庫來加速 LLM 推論。它使用專業的優化技術與自定義核心 (custom kernels) 來提升效能。不過,它需要針對每一種 GPU 架構進行模型特定的編譯步驟。
- TGI Llamacpp 後端:此後端透過整合 [llama.cpp][llama.cpp] 來簡化大型語言模型 (LLM) 的部署,這是一個針對 CPU 與 GPU 運算皆進行過優化的高階推論引擎。
- TGI Neuron 後端:此後端利用 AWS Neuron SDK,讓大型語言模型 (LLM) 能夠部署在 AWS Trainium 與 Inferentia 晶片上。