Text Generation Inference 文件
張量並行(Tensor Parallelism)
入門指南
Text Generation Inference快速導覽支援的模型在 Nvidia GPU 上使用 TGI在 AMD GPU 上使用 TGI在 Intel Gaudi 上使用 TGI在 AWS Trainium 與 Inferentia 上使用 TGI在 Google TPU 上使用 TGI在 Intel GPU 上使用 TGI從原始碼安裝多後端支援內部架構使用統計
教學課程
取用 TGI為推論服務準備模型提供私有與受限(Gated)模型服務使用 TGI CLI部署於 AWS (EC2 與 SageMaker)非核心模型推論服務安全性使用 Guidance、JSON 與工具視覺語言模型 (VLMs)使用 Prometheus 與 Grafana 監控 TGI訓練 Medusa
後端
參考
概念指南
加入 Hugging Face 社群
並獲得增強的文件體驗
開始使用
張量並行 (Tensor Parallelism)
張量並行是一種將大型模型容納於多個 GPU 中的技術。舉例來說,當輸入張量與第一個權重張量相乘時,該矩陣乘法等同於將權重張量按行(column-wise)分割,分別將每一行與輸入相乘,然後將各自的輸出進行串接。接著,這些輸出會從各個 GPU 傳輸出來並合併以獲得最終結果,如下所示 👇

張量並行僅適用於官方支援的模型,若回退至
transformers則無法運作。您可以點擊此處以獲取更多關於不支援模型的資訊。
您可以從 transformers 文件中了解更多關於張量並行的詳細資訊。