TensorRT-LLMのFP8比較設計:GPUと品質を固定する
TensorRT-LLMのBF16・FP8・W4A16とFP8 KV cacheを、GPU世代、model revision、calibration、品質、memory、latencyの固定条件から比較する机上の検証設計です。
TAG
LLM運用の導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全2件。
TensorRT-LLMのBF16・FP8・W4A16とFP8 KV cacheを、GPU世代、model revision、calibration、品質、memory、latencyの固定条件から比較する机上の検証設計です。
TensorRT-LLMの旧engine build経路からPyTorch backendへ移る際に、release、model、API入力、GPU条件を固定し、正しさ、latency、throughput、memory、観測性、rollbackを比較する机上検証計画です。