llama.cpp Kimi-K3対応とOllama MLX更新
2026年8月16日に確認した公式releaseから、llama.cpp b10448のKimi-K3対応と、Ollama v0.32.14のMLX依存更新を整理します。対象者、今日の判断、未検証範囲を分けて記載します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
2026年8月16日に確認した公式releaseから、llama.cpp b10448のKimi-K3対応と、Ollama v0.32.14のMLX依存更新を整理します。対象者、今日の判断、未検証範囲を分けて記載します。
llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。
llama.cpp b10447を固定し、同じsource・calibration data・quant typeでimatrixの有無を比較する検証計画です。file size、peak RAM、変換時間、速度、perplexityと固定task品質を分け、再量子化や未検証hardwareを混ぜない条件を整理します。
2026年8月15日から16日に確認した公式releaseから、llama.cppのserver処理・依存更新と、Ollama v0.32.12のQwen 3.8 27B対応を整理します。対象者、今日の判断、未検証範囲を分けて記載します。
Transformers v5.15.0で小型GGUFをtokenizerとmodelへ読み込み、最初の生成を確認します。逆量子化後のmemory、失敗時の切り分け、元へ戻す方法まで解説します。
Transformers v5.15.0とllama.cpp b10418を固定し、GGUF読込時のpeak RAM、Hugging Face形式保存、再変換後のmetadata・tokenizer・出力差を監査する机上検証計画です。