ChatGPT広告が日本開始、vLLM 0.27更新
2026年8月12日に確認した公式更新から、ChatGPT広告の日本開始、vLLM 0.27.0の破壊的環境変更、llama.cppのEXAONE修正、Ollamaの新architecture対応を整理します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
2026年8月12日に確認した公式更新から、ChatGPT広告の日本開始、vLLM 0.27.0の破壊的環境変更、llama.cppのEXAONE修正、Ollamaの新architecture対応を整理します。
Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。
Transformers v5.15.0とbitsandbytesを対象に、同一model revisionでweight bit、compute dtype、double quant、配置を分離し、VRAM、host RAM、時間、品質のtrade-offを測る机上検証計画です。
2026年8月11日に確認した公式更新から、Transformers v5.15.0の破壊的変更、OllamaのMuse Glimmer初期対応、llama.cppのNemotron Nano MTP対応を整理します。
Ollamaの埋め込みを初めて使う人向けに、同じmodelで文書と質問をvector化し、件数・次元・単位長を確認して、cosine similarityで最も近い短文を選ぶ最短手順と戻し方を解説します。
Ollama v0.32.6の埋め込みAPIを対象に、model digestと評価集合を固定し、batch size、dimensions、truncate、keep_aliveを一変数ずつ変えて、recall、時間、memory、error率を比較する机上検証計画です。