ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

技術解説

vLLM Multi-LoRAのメモリと信頼境界検証

vLLM v0.26.0のMulti-LoRAを対象に、rank、同時adapter数、CPU保持数、request混在率を固定し、VRAM、TTFT、throughput、品質と動的loadの信頼境界を評価する机上検証計画です。

入門

llama.cpp投機的decode入門

llama.cpp b10328を基準に、追加model不要のn-gram方式をbaselineから有効化し、応答完了、draft token、acceptanceを確認して元へ戻す最短手順を説明します。

技術解説

投機的decodeのAcceptance性能検証

llama.cpp b10328の投機的decodeを対象に、target/draft、prompt、sampling、同時数を固定し、acceptance、TTFT、総時間、memory、出力同等性を方式別に測る机上検証計画です。