llama.cppでGGUFを動かす方法|導入から実行まで
llama.cppでGGUFモデルを動かす手順を、導入、モデル選択、固定リビジョンでのダウンロード、対話実行、API起動、ログ確認まで順番に解説します。2026年8月2日時点の公式情報に基づく机上調査です。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
llama.cppでGGUFモデルを動かす手順を、導入、モデル選択、固定リビジョンでのダウンロード、対話実行、API起動、ログ確認まで順番に解説します。2026年8月2日時点の公式情報に基づく机上調査です。
llama.cppでGGUFモデルを読み込めないときの確認順を、破損・分割ファイル・未対応アーキテクチャ・mmproj・メモリ不足などのエラー別に解説します。公式ソースに基づく机上調査です。
Apple Silicon Macのユニファイドメモリ容量別に、ローカルで試しやすいLLMの規模とGGUF量子化を整理。16GBから128GB超まで、モデル本体・KVキャッシュ・macOS用の余裕を含めた選び方を解説します。
llama.cppの実行コマンド例10選を2026年7月30日の公式情報で監査。ローカルGGUF、Hugging Face、CPU/GPU、長文脈、JSON、画像入力、複数GPU、OpenAI互換APIを用途別に解説します。検証は机上調査です。
UbuntuとNVIDIA GPUでllama-serverを運用する人向けに、--parallelと--cont-batchingの関係、コンテキスト配分、同時リクエストの確認手順と注意点を公式仕様に基づいて解説します。
LM Studio 0.4.20を基準に、Context Length、GPU Offload、Flash Attention、KVキャッシュの設定と、8〜128GBの搭載メモリ別おすすめモデルを解説します。