Docker Model RunnerのOCI配布とAPI境界を検証
2026年8月6日時点のDocker Model Runnerを対象に、GGUFとSafetensorsのOCI packaging、llama.cppとvLLMの条件、未認証APIの到達範囲を固定し、再現可能な比較・運用設計を示します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
2026年8月6日時点のDocker Model Runnerを対象に、GGUFとSafetensorsのOCI packaging、llama.cppとvLLMの条件、未認証APIの到達範囲を固定し、再現可能な比較・運用設計を示します。
2026年8月6日に確認したOllama 0.32.6のAPI互換性・画像生成変更と、OpenAIが公表した第三者cyber評価事故を整理し、更新前と評価実施前に取るべき対応を解説します。
llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。
llama.cpp b9637のLoRAを対象に、base・prompt・samplingを固定してscaleと複数adapterを比較し、品質、load memory、batching、切替運用の適用範囲を評価する設計を解説します。
2026年8月5日に確認したllama.cppの公式更新から、Qwen3-TTS対応とllama-ttsの破壊的変更、既定ポート変更予告を整理し、今日確認すべき運用項目を解説します。
Transformers 5.14.1のgenerate_batchで長さの違う複数promptを処理し、requestごとの結果を確認するまでを、GPU前提、失敗時の戻し方とともに解説します。