vLLM 0.28がKimi-K3とGPU対応を更新

DAILY NEWS公式情報アップデート

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

2026年8月26日公開のvLLM 0.28.0を公式releaseで確認し、Kimi-K3・DeepSeek V4・ROCm対応、KV offload、互換性変更、更新前に固定すべき条件を整理します。

vLLM 0.28の変更点を対象modelとGPUへ結び、更新前の条件固定へ導く図

先に結論

本日の読者判断を変える更新はvLLM 0.28.0です。Kimi-K3、DeepSeek V4、ROCm、KV cache offload、Model Runner V2を使う環境には検証価値があります。一方でbitsandbytesのplugin化、Transformers 5.15.0への更新、旧option削除を含むため、既存serviceへ即時上書きするreleaseではありません。対象model、container、driver、quantization、prompt、入出力長を固定した並行検証から始めます。

収集日時: 2026年8月27日 06:45(Asia/Tokyo)
対象期間: 2026年8月25日 18:45〜2026年8月27日 06:45
情報区分: 公式repository releaseと、そのreleaseから参照された公式PRを確認した机上調査です。
検証状況: KFBはvLLM 0.28.0をinstallせず、Kimi-K3、DeepSeek V4、CUDA、ROCm、CPU、XPUのいずれでも実行していません。model別の速度、実peak memory、driver互換性、既知のregressionは未検証です。

本日の要点

  • vLLM 0.28.0はKimi-K3の実装最適化、DeepSeek V4、ROCm、KV cache offload、Model Runner V2を広く更新しました。
  • release内の改善値は個別PRの条件に依存するため、手元のmodelやGPUへそのまま転用できません。
  • 今日の判断は、削除optionと依存関係を先に監査し、現行環境を残したまま対象workloadだけ比較することです。

ニュース一覧

1. vLLM 0.28.0がmodel・GPU・offloadを横断更新

  • 何が変わったか: vLLMは0.28.0を2026年8月26日に公開しました。Kimi-K3向けのdecode/prefill kernelやspeculative decoding、DeepSeek V4、diskを含むtiered KV cache offload、Model Runner V2、gRPC multimodal入力を更新しています。新modelとしてLing 3.0 Flash、Dots3 NOTE、Interns2mobiusなども追加されました。
  • 性能・動作環境への影響: NVIDIAではSM90/SM100/SM12x、AMDではROCm 7.2.2系、Intel XPU、CPU向けartifactが用意されています。Kimi-K3はROCm V2 runnerにも対応しました。ただしreleaseが示すKimi-K3のTTFT改善やGPU memory削減は個別PRのmodel、hardware、backend、parallelismに依存します。KFBは条件を同一化できていないため数値比較に採用しません。
  • どの読者・機器に向くか: Kimi-K3、DeepSeek V4、Qwen3.8、Gemma3n/Gemma4のmultimodal処理、ROCm、KV offloadを実際に使う推論server担当者が検証対象です。安定した旧modelだけをserveする環境や、bitsandbytesを組み込みで使う環境は更新理由と移行手順を先に確認します。
  • 今日対応すべきか: 本番は即時更新せず、0.28.0の公式containerを別環境で起動します。現行版と同じmodel revision、dtype/quantization、CUDAまたはROCm、input/output token、batch、concurrencyでcorrectness、TTFT、prefill、decode、peak VRAMを測り、rollback可能な状態で比較します。
  • 確認範囲: max_num_batched_tokensの既定値変更、Mambaのprefix caching既定化、bitsandbytesのout-of-tree plugin化、calculate_kv_scalesoverride_attention_dtypeの削除、Transformers 5.15.0への更新をrelease本文で確認しました。各modelの既知問題、全artifactの署名、費用、cloud提供範囲、長時間安定性は未確認です。
  • 公式情報: vLLM 0.28.0 release(2026年8月26日公開)/bitsandbytes plugin移行PR(互換性変更の一次情報)

関連する既存ガイド

E/P/DとKV transferを使う場合はPrefill/Decode分離ガイド、測定条件を作る場合はPrefill/Decode分離の評価設計、adapterをserveする場合はvLLM LoRA serving guideを先に確認してください。いずれも0.28.0の性能を保証する記事ではなく、変更点を検証項目へ落とすための基礎資料です。

情報の確認範囲

release本文、公開version、主要model対応、配布artifact、breaking change、security項目を確認しました。速度やmemoryの改善はrelease全体の一律効果ではありません。別model、別GPU、別driver、別quantization、別contextへ一般化せず、production採用は同じworkloadでのA/B結果とrollback確認後に判断します。

公式情報源