ARTICLE ARCHIVE

記事一覧

ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。

llama.cpp、SpaceMiT修正とCUDA融合

2026年8月10日に確認したllama.cppの公式更新から、SpaceMiTでQ5_0出力が乱れる問題の修正と、CUDAの正規化・RoPE融合を整理し、影響範囲と今日の判断を一次情報だけで確認します。

入門

TensorRT-LLMのPyTorch移行入門

TensorRT engine backend削除後のTensorRT-LLMを初めて扱う人向けに、対応環境の確認、checkpointからtrtllm-serveを起動する最短手順、成功確認、失敗時の戻し方を解説します。

技術解説

TensorRT-LLM backend移行の検証設計

TensorRT-LLMの旧engine build経路からPyTorch backendへ移る際に、release、model、API入力、GPU条件を固定し、正しさ、latency、throughput、memory、観測性、rollbackを比較する机上検証計画です。

llama.cpp、Tool隔離とMetal計算修正

2026年8月9日に確認したllama.cppの公式更新から、DockerによるTool隔離の初期対応と、Metalの正規化計算を直す修正を整理します。影響範囲と今日の判断を一次情報だけで確認します。

入門

MLX LMのPrompt Cache入門:長文を再利用する

Apple Silicon MacでMLX LMの共通promptをcache fileへ保存し、別の質問で再利用する手順を解説します。確認方法、memoryとの関係、失敗したときの安全な戻し方も扱います。