ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

技術解説

Transformers連続バッチングのKV予算設計

Transformers v5.14.1のcontinuous batchingを対象に、入力buffer、Paged KV cache、予約枠の競合を整理し、TTFT・生成latency・throughput・VRAMを再現可能に比較する設計を解説します。

入門

OllamaでJSON Schema出力を作る入門

OllamaのローカルAPIへ小さなJSON Schemaを渡し、非ストリーミング応答をJSONとして取り出して必須項目と型を確認するまでを、失敗時の戻し方とともに解説します。

技術解説

Ollama構造化出力の二重検証設計

Ollama v0.32.0のローカルAPIを基準に、生成制約とアプリ側型検証を分離し、schema複雑度・temperature・streaming・model差を再現可能に比較する設計を解説します。

AI

Ollamaとllama.cppはどちらがおすすめ?用途別比較

Ollamaとllama.cppの違いを、導入、GGUF管理、API、詳細設定、速度検証の観点で比較。初心者、アプリ開発、ベンチマーク、Mac利用など用途別にどちらを選ぶべきかを解説します。

AI

ローカルLLMに必要なVRAMの計算方法|量子化別

ローカルLLMに必要なVRAMを、GGUFの重み、KVキャッシュ、計算バッファ、並列数、余裕容量へ分けて見積もる方法を解説。量子化別の理論値とllama.cppの確認コマンドも掲載します。

AI

llama.cppが遅い原因と高速化設定|確認順に解説

llama.cppが遅い原因を、ロード、プロンプト処理、トークン生成に分けて診断。GPUオフロード、メモリ、スレッド、batch、Flash Attention、KV cacheを安全な確認順で調整します。2026年8月2日時点の机上調査です。