Llama 4 Scout・MaverickのH100適性比較
Llama 4 ScoutとMaverickを、static model revision、109B/400B total、Int4/BF16/FP8、H100 80GB/DGX host、10M/1M context、vLLM/Transformers条件へ固定し、未測定の性能と機器適性を分けます。
TAG
量子化の導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全8件。
Llama 4 ScoutとMaverickを、static model revision、109B/400B total、Int4/BF16/FP8、H100 80GB/DGX host、10M/1M context、vLLM/Transformers条件へ固定し、未測定の性能と機器適性を分けます。
TensorRT-LLMの量子化を初めて学ぶ人向けに、weight・activation・KV cacheの違い、対応GPUとcheckpointの確認、公式LLM APIで読み込む最短手順、失敗時の戻し方を整理します。
TensorRT-LLMのBF16・FP8・W4A16とFP8 KV cacheを、GPU世代、model revision、calibration、品質、memory、latencyの固定条件から比較する机上の検証設計です。
llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。
llama.cpp b10447を固定し、同じsource・calibration data・quant typeでimatrixの有無を比較する検証計画です。file size、peak RAM、変換時間、速度、perplexityと固定task品質を分け、再量子化や未検証hardwareを混ぜない条件を整理します。
Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。
Transformers v5.15.0とbitsandbytesを対象に、同一model revisionでweight bit、compute dtype、double quant、配置を分離し、VRAM、host RAM、時間、品質のtrade-offを測る机上検証計画です。
ローカルLLMに必要なVRAMを、GGUFの重み、KVキャッシュ、計算バッファ、並列数、余裕容量へ分けて見積もる方法を解説。量子化別の理論値とllama.cppの確認コマンドも掲載します。