TensorRT-LLM量子化の基本:3つの場所を理解する
TensorRT-LLMの量子化を初めて学ぶ人向けに、weight・activation・KV cacheの違い、対応GPUとcheckpointの確認、公式LLM APIで読み込む最短手順、失敗時の戻し方を整理します。
TAG
TensorRT-LLMの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全4件。
TensorRT-LLMの量子化を初めて学ぶ人向けに、weight・activation・KV cacheの違い、対応GPUとcheckpointの確認、公式LLM APIで読み込む最短手順、失敗時の戻し方を整理します。
TensorRT-LLMのBF16・FP8・W4A16とFP8 KV cacheを、GPU世代、model revision、calibration、品質、memory、latencyの固定条件から比較する机上の検証設計です。
TensorRT engine backend削除後のTensorRT-LLMを初めて扱う人向けに、対応環境の確認、checkpointからtrtllm-serveを起動する最短手順、成功確認、失敗時の戻し方を解説します。
TensorRT-LLMの旧engine build経路からPyTorch backendへ移る際に、release、model、API入力、GPU条件を固定し、正しさ、latency、throughput、memory、観測性、rollbackを比較する机上検証計画です。