vLLMでLoRAをリクエスト別に切り替える入門
vLLM v0.26.0で互換LoRA adapterを起動時に固定読込し、モデル一覧と同じAPIからbase/LoRAを切り替える最短手順、成功確認、失敗時の戻し方を解説します。
TAG
LoRAの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全4件。
vLLM v0.26.0で互換LoRA adapterを起動時に固定読込し、モデル一覧と同じAPIからbase/LoRAを切り替える最短手順、成功確認、失敗時の戻し方を解説します。
vLLM v0.26.0のMulti-LoRAを対象に、rank、同時adapter数、CPU保持数、request混在率を固定し、VRAM、TTFT、throughput、品質と動的loadの信頼境界を評価する机上検証計画です。
llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。
llama.cpp b9637のLoRAを対象に、base・prompt・samplingを固定してscaleと複数adapterを比較し、品質、load memory、batching、切替運用の適用範囲を評価する設計を解説します。