TAG

#量子化

量子化の導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全8件。

Llama 4 Scout・MaverickのH100適性比較

Llama 4 ScoutとMaverickを、static model revision、109B/400B total、Int4/BF16/FP8、H100 80GB/DGX host、10M/1M context、vLLM/Transformers条件へ固定し、未測定の性能と機器適性を分けます。

入門

Hugging FaceモデルをGGUFへ変換して量子化する

llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。

技術解説

llama.cpp量子化でimatrixの効果を測る設計

llama.cpp b10447を固定し、同じsource・calibration data・quant typeでimatrixの有無を比較する検証計画です。file size、peak RAM、変換時間、速度、perplexityと固定task品質を分け、再量子化や未検証hardwareを混ぜない条件を整理します。

入門

Transformersの4-bit・8-bit量子化入門

Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。

AI

ローカルLLMに必要なVRAMの計算方法|量子化別

ローカルLLMに必要なVRAMを、GGUFの重み、KVキャッシュ、計算バッファ、並列数、余裕容量へ分けて見積もる方法を解説。量子化別の理論値とllama.cppの確認コマンドも掲載します。