llama.cppアップデートまとめ:2026年8月12日時点
2026年8月12日時点のllama.cpp b10375を、直前期のb9968、公式README、server仕様と照合し、更新時の確認点とともに整理します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
2026年8月12日時点のllama.cpp b10375を、直前期のb9968、公式README、server仕様と照合し、更新時の確認点とともに整理します。
MacとNVIDIA DGX Sparkを組み合わせ、LLM推論、クライアント利用、分散構成、役割分担を考えるための最適化ガイド。
MacとDGX Sparkを組み合わせ、SSH、vLLM、Ollama、RAGなどの役割分担でLLMハイブリッド環境を作るためのガイド。
Apple Silicon Macでllama.cppを導入し、GGUFモデル、Metal/GPU活用、基本コマンド、性能確認を行うためのガイド。
Qwen3.6とQwen3.8のpreserve_thinkingを比較。履歴保持の既定値、reasoning_effort、ローカルAPIとQwen Cloudでの指定方法を整理します。
llama.cppの仕組み、GGUF、量子化、CPU・GPUオフロード、ローカル推論の流れと主要機能を、初めて使う人向けに整理して解説します。