ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

llama.cpp Kimi-K3対応とOllama MLX更新

2026年8月16日に確認した公式releaseから、llama.cpp b10448のKimi-K3対応と、Ollama v0.32.14のMLX依存更新を整理します。対象者、今日の判断、未検証範囲を分けて記載します。

入門

Hugging FaceモデルをGGUFへ変換して量子化する

llama.cpp b10447でHugging Faceの対応モデルを高精度GGUFへ変換し、Q4_K_Mへ量子化して読み込みを確認する手順を解説します。必要なRAM・disk、再量子化を避ける理由、未実行の検証範囲も明記します。

技術解説

llama.cpp量子化でimatrixの効果を測る設計

llama.cpp b10447を固定し、同じsource・calibration data・quant typeでimatrixの有無を比較する検証計画です。file size、peak RAM、変換時間、速度、perplexityと固定task品質を分け、再量子化や未検証hardwareを混ぜない条件を整理します。

llama.cpp更新とOllama新モデル対応

2026年8月15日から16日に確認した公式releaseから、llama.cppのserver処理・依存更新と、Ollama v0.32.12のQwen 3.8 27B対応を整理します。対象者、今日の判断、未検証範囲を分けて記載します。

入門

TransformersでGGUFを読み込む入門

Transformers v5.15.0で小型GGUFをtokenizerとmodelへ読み込み、最初の生成を確認します。逆量子化後のmemory、失敗時の切り分け、元へ戻す方法まで解説します。

技術解説

GGUF逆量子化とroundtripの監査設計

Transformers v5.15.0とllama.cpp b10418を固定し、GGUF読込時のpeak RAM、Hugging Face形式保存、再変換後のmetadata・tokenizer・出力差を監査する机上検証計画です。