MLX LMのKV Cache再利用を評価する設計
MLX LMのPrompt Cacheとrotating KV cacheを混同せず、prefix一致、model、max-kv-size、memory、prefill時間を固定して再利用の適用範囲を評価する方法を解説します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
MLX LMのPrompt Cacheとrotating KV cacheを混同せず、prefix一致、model、max-kv-size、memory、prefill時間を固定して再利用の適用範囲を評価する方法を解説します。
OpenAIが次期モデルAstraについて、重大なサイバー能力を否定できないとの暫定評価を公表しました。評価の意味、強化された開発時の制御、利用者が誤解すべきでない点を一次情報から整理します。
vLLMで長い入力を処理するPrefillと、応答を1 tokenずつ返すDecodeを分ける理由を解説します。公式demoを安全に読む順序、KV cache転送の確認点、単一構成へ戻す判断を学べます。
vLLMの分離型Prefill/Decodeを導入判断するために、version、GPU、network、KV transferを固定し、TTFT、ITL、tail ITL、throughputを混同せず測る比較計画を解説します。
OpenAIが発表したChatGPT向けGPT-5.6 Solの更新と、無料・Go利用者向けGPT-5.6 Lunaの標準化を整理します。対象プラン、提供時期、APIやCodexへ及ばない範囲を確認します。
Docker Model Runnerを初めて使う人向けに、対応版の確認、modelのpullとrun、localhostのOpenAI互換APIで最初の応答を確認する手順、失敗時の戻し方を解説します。