ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

入門

vLLMのPrefill/Decode分離を理解する入門

vLLMで長い入力を処理するPrefillと、応答を1 tokenずつ返すDecodeを分ける理由を解説します。公式demoを安全に読む順序、KV cache転送の確認点、単一構成へ戻す判断を学べます。

技術解説

vLLM Prefill/Decode分離の評価設計

vLLMの分離型Prefill/Decodeを導入判断するために、version、GPU、network、KV transferを固定し、TTFT、ITL、tail ITL、throughputを混同せず測る比較計画を解説します。

入門

Docker Model Runner入門:最初のAPI応答まで

Docker Model Runnerを初めて使う人向けに、対応版の確認、modelのpullとrun、localhostのOpenAI互換APIで最初の応答を確認する手順、失敗時の戻し方を解説します。