llama.cpp、SpaceMiT修正とCUDA融合
2026年8月10日に確認したllama.cppの公式更新から、SpaceMiTでQ5_0出力が乱れる問題の修正と、CUDAの正規化・RoPE融合を整理し、影響範囲と今日の判断を一次情報だけで確認します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
2026年8月10日に確認したllama.cppの公式更新から、SpaceMiTでQ5_0出力が乱れる問題の修正と、CUDAの正規化・RoPE融合を整理し、影響範囲と今日の判断を一次情報だけで確認します。
TensorRT engine backend削除後のTensorRT-LLMを初めて扱う人向けに、対応環境の確認、checkpointからtrtllm-serveを起動する最短手順、成功確認、失敗時の戻し方を解説します。
TensorRT-LLMの旧engine build経路からPyTorch backendへ移る際に、release、model、API入力、GPU条件を固定し、正しさ、latency、throughput、memory、観測性、rollbackを比較する机上検証計画です。
2026年8月9日に確認したllama.cppの公式更新から、DockerによるTool隔離の初期対応と、Metalの正規化計算を直す修正を整理します。影響範囲と今日の判断を一次情報だけで確認します。
MiniMax H3をDGX Spark 1台・2台で動かした第三者の公開測定を検証。FP8化とSM121互換修正、公式範囲内の4秒動画、範囲外の2秒smoke test、メモリ余裕、ライセンス制約を整理します。
Apple Silicon MacでMLX LMの共通promptをcache fileへ保存し、別の質問で再利用する手順を解説します。確認方法、memoryとの関係、失敗したときの安全な戻し方も扱います。