TAG

#LoRA

LoRAの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全4件。

技術解説

vLLM Multi-LoRAのメモリと信頼境界検証

vLLM v0.26.0のMulti-LoRAを対象に、rank、同時adapter数、CPU保持数、request混在率を固定し、VRAM、TTFT、throughput、品質と動的loadの信頼境界を評価する机上検証計画です。

入門

llama.cppでLoRAを非merge適用する入門

llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。

技術解説

llama.cpp LoRA scale比較の設計

llama.cpp b9637のLoRAを対象に、base・prompt・samplingを固定してscaleと複数adapterを比較し、品質、load memory、batching、切替運用の適用範囲を評価する設計を解説します。