vLLM V1入門|Prefix Cache・Prefill・投機的デコード
vLLM V1のscheduler、automatic prefix caching、chunked prefill、speculative decoding、KV cacheの関係と設定時の注意点を解説します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
vLLM V1のscheduler、automatic prefix caching、chunked prefill、speculative decoding、KV cacheの関係と設定時の注意点を解説します。
vLLM v0.25.0で導入されたModel Runner V2全denseモデル標準化、旧PagedAttention削除、Transformers backend高速化を、v0.27.1時点の公式リリースで再確認します。
Qwen3.6-27Bと35B-A3Bの公式性能、モデル構造、GGUF容量を比較し、llama.cppで再現可能な速度・品質ベンチマークを行う方法を解説します。
DeepSeek V4 Flashのllama.cpp本流対応を公式PRとリリースで確認し、モデル規模、GGUF準備、vLLMとの選択、再現可能な測定方法と未検証範囲を整理します。
llama.cppのMetal、CUDA、HIP/ROCm、Vulkan、SYCL、CPUを比較し、Mac・NVIDIA・AMD・Intel環境での選び方とベンチマーク方法を解説します。
llama.cppのllama-serverを本番運用する際の並列数、コンテキスト、ヘルスチェック、nginx、認証、ログと更新手順を解説します。