TAG

#高速化

高速化の導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全1件。

AI

llama.cppが遅い原因と高速化設定|確認順に解説

llama.cppが遅い原因を、ロード、プロンプト処理、トークン生成に分けて診断。GPUオフロード、メモリ、スレッド、batch、Flash Attention、KV cacheを安全な確認順で調整します。2026年8月2日時点の机上調査です。