TAG

#推論サーバー

推論サーバーの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全1件。

入門

vLLMのPrefill/Decode分離を理解する入門

vLLMで長い入力を処理するPrefillと、応答を1 tokenずつ返すDecodeを分ける理由を解説します。公式demoを安全に読む順序、KV cache転送の確認点、単一構成へ戻す判断を学べます。