CATEGORY

技術解説

技術解説の導入、設定、活用方法を実例とともに解説する記事一覧です。 全36件。

技術解説

Responses APIの状態管理を比較する

Responses APIの手動履歴、previous_response_id、Conversations APIを、保存寿命、再開性、入力token課金、障害時の全履歴再送で比較します。公式仕様と推論を分け、実測していない範囲も明記します。

技術解説

llama.cpp量子化でimatrixの効果を測る設計

llama.cpp b10447を固定し、同じsource・calibration data・quant typeでimatrixの有無を比較する検証計画です。file size、peak RAM、変換時間、速度、perplexityと固定task品質を分け、再量子化や未検証hardwareを混ぜない条件を整理します。

技術解説

GGUF逆量子化とroundtripの監査設計

Transformers v5.15.0とllama.cpp b10418を固定し、GGUF読込時のpeak RAM、Hugging Face形式保存、再変換後のmetadata・tokenizer・出力差を監査する机上検証計画です。

技術解説

vLLM Multi-LoRAのメモリと信頼境界検証

vLLM v0.26.0のMulti-LoRAを対象に、rank、同時adapter数、CPU保持数、request混在率を固定し、VRAM、TTFT、throughput、品質と動的loadの信頼境界を評価する机上検証計画です。

技術解説

投機的decodeのAcceptance性能検証

llama.cpp b10328の投機的decodeを対象に、target/draft、prompt、sampling、同時数を固定し、acceptance、TTFT、総時間、memory、出力同等性を方式別に測る机上検証計画です。

技術解説

Ollama Embeddingsの検証設計

Ollama v0.32.6の埋め込みAPIを対象に、model digestと評価集合を固定し、batch size、dimensions、truncate、keep_aliveを一変数ずつ変えて、recall、時間、memory、error率を比較する机上検証計画です。

技術解説

TensorRT-LLM backend移行の検証設計

TensorRT-LLMの旧engine build経路からPyTorch backendへ移る際に、release、model、API入力、GPU条件を固定し、正しさ、latency、throughput、memory、観測性、rollbackを比較する机上検証計画です。

技術解説

vLLM Prefill/Decode分離の評価設計

vLLMの分離型Prefill/Decodeを導入判断するために、version、GPU、network、KV transferを固定し、TTFT、ITL、tail ITL、throughputを混同せず測る比較計画を解説します。

技術解説

llama.cpp LoRA scale比較の設計

llama.cpp b9637のLoRAを対象に、base・prompt・samplingを固定してscaleと複数adapterを比較し、品質、load memory、batching、切替運用の適用範囲を評価する設計を解説します。

技術解説

Transformers連続バッチングのKV予算設計

Transformers v5.14.1のcontinuous batchingを対象に、入力buffer、Paged KV cache、予約枠の競合を整理し、TTFT・生成latency・throughput・VRAMを再現可能に比較する設計を解説します。

技術解説

Ollama構造化出力の二重検証設計

Ollama v0.32.0のローカルAPIを基準に、生成制約とアプリ側型検証を分離し、schema複雑度・temperature・streaming・model差を再現可能に比較する設計を解説します。

AI

Ollamaとllama.cppはどちらがおすすめ?用途別比較

Ollamaとllama.cppの違いを、導入、GGUF管理、API、詳細設定、速度検証の観点で比較。初心者、アプリ開発、ベンチマーク、Mac利用など用途別にどちらを選ぶべきかを解説します。

AI

ローカルLLMに必要なVRAMの計算方法|量子化別

ローカルLLMに必要なVRAMを、GGUFの重み、KVキャッシュ、計算バッファ、並列数、余裕容量へ分けて見積もる方法を解説。量子化別の理論値とllama.cppの確認コマンドも掲載します。

AI

llama.cppが遅い原因と高速化設定|確認順に解説

llama.cppが遅い原因を、ロード、プロンプト処理、トークン生成に分けて診断。GPUオフロード、メモリ、スレッド、batch、Flash Attention、KV cacheを安全な確認順で調整します。2026年8月2日時点の机上調査です。

AI

llama.cppでGGUFを動かす方法|導入から実行まで

llama.cppでGGUFモデルを動かす手順を、導入、モデル選択、固定リビジョンでのダウンロード、対話実行、API起動、ログ確認まで順番に解説します。2026年8月2日時点の公式情報に基づく机上調査です。

AI

GGUFモデルが読み込めない原因と対処法|エラー別

llama.cppでGGUFモデルを読み込めないときの確認順を、破損・分割ファイル・未対応アーキテクチャ・mmproj・メモリ不足などのエラー別に解説します。公式ソースに基づく机上調査です。

AI

llama.cppコマンド例10選|llama-cli・llama-server用途別

llama.cppの実行コマンド例10選を2026年7月30日の公式情報で監査。ローカルGGUF、Hugging Face、CPU/GPU、長文脈、JSON、画像入力、複数GPU、OpenAI互換APIを用途別に解説します。検証は机上調査です。