ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

入門

llama.cppでLoRAを非merge適用する入門

llama.cpp b9637で対応するGGUF LoRA adapterをbase modelへ非mergeで読み込み、同じpromptでadapterなし・ありを確認する最短手順と失敗時の戻し方を解説します。

技術解説

llama.cpp LoRA scale比較の設計

llama.cpp b9637のLoRAを対象に、base・prompt・samplingを固定してscaleと複数adapterを比較し、品質、load memory、batching、切替運用の適用範囲を評価する設計を解説します。

入門

Transformers連続バッチング入門

Transformers 5.14.1のgenerate_batchで長さの違う複数promptを処理し、requestごとの結果を確認するまでを、GPU前提、失敗時の戻し方とともに解説します。