Transformers連続バッチングのKV予算設計
Transformers v5.14.1のcontinuous batchingを対象に、入力buffer、Paged KV cache、予約枠の競合を整理し、TTFT・生成latency・throughput・VRAMを再現可能に比較する設計を解説します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
Transformers v5.14.1のcontinuous batchingを対象に、入力buffer、Paged KV cache、予約枠の競合を整理し、TTFT・生成latency・throughput・VRAMを再現可能に比較する設計を解説します。
OllamaのローカルAPIへ小さなJSON Schemaを渡し、非ストリーミング応答をJSONとして取り出して必須項目と型を確認するまでを、失敗時の戻し方とともに解説します。
Ollama v0.32.0のローカルAPIを基準に、生成制約とアプリ側型検証を分離し、schema複雑度・temperature・streaming・model差を再現可能に比較する設計を解説します。
Ollamaとllama.cppの違いを、導入、GGUF管理、API、詳細設定、速度検証の観点で比較。初心者、アプリ開発、ベンチマーク、Mac利用など用途別にどちらを選ぶべきかを解説します。
ローカルLLMに必要なVRAMを、GGUFの重み、KVキャッシュ、計算バッファ、並列数、余裕容量へ分けて見積もる方法を解説。量子化別の理論値とllama.cppの確認コマンドも掲載します。
llama.cppが遅い原因を、ロード、プロンプト処理、トークン生成に分けて診断。GPUオフロード、メモリ、スレッド、batch、Flash Attention、KV cacheを安全な確認順で調整します。2026年8月2日時点の机上調査です。