GLM-5.3-FlashのGPU・API選び
GLM-5.3-Flashの320B総parameter・18B active、FP8/BF16、Transformers 5.16.1・vLLM・SGLang対応を確認し、複数GPUとAPIの分岐を判断します。
TAG
Transformersの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全11件。
GLM-5.3-Flashの320B総parameter・18B active、FP8/BF16、Transformers 5.16.1・vLLM・SGLang対応を確認し、複数GPUとAPIの分岐を判断します。
2026年8月26日公開のOllama 0.33.1とTransformers 5.16.1を公式releaseで確認し、Qwen3.8 Flash Next、GLM-5.3-Flash、互換性修正の対象と更新判断を整理します。
Gemma 4 12Bと26B-A4Bの現行revision、BF16・量子化artifact、MLX・Transformers・vLLM、公式load memoryを固定し、32GB Mac、24GB GPU、H100へ適用できる判断と未測定範囲を比較します。
2026年8月19日から20日に確認した公式AI更新を、ZDR互換の安全処理、llama.cppの署名artifact、Transformersの修正に分け、対象者、今日の判断、未検証範囲を整理します。
Transformers v5.15.0で小型GGUFをtokenizerとmodelへ読み込み、最初の生成を確認します。逆量子化後のmemory、失敗時の切り分け、元へ戻す方法まで解説します。
Transformers v5.15.0とllama.cpp b10418を固定し、GGUF読込時のpeak RAM、Hugging Face形式保存、再変換後のmetadata・tokenizer・出力差を監査する机上検証計画です。
Transformersとbitsandbytesを初めて使う人向けに、対応環境を確認して小型modelを8-bitまたは4-bitで読み込み、生成、配置、memory footprintを確かめる最短手順と戻し方を説明します。
Transformers v5.15.0とbitsandbytesを対象に、同一model revisionでweight bit、compute dtype、double quant、配置を分離し、VRAM、host RAM、時間、品質のtrade-offを測る机上検証計画です。
2026年8月11日に確認した公式更新から、Transformers v5.15.0の破壊的変更、OllamaのMuse Glimmer初期対応、llama.cppのNemotron Nano MTP対応を整理します。
Transformers 5.14.1のgenerate_batchで長さの違う複数promptを処理し、requestごとの結果を確認するまでを、GPU前提、失敗時の戻し方とともに解説します。
Transformers v5.14.1のcontinuous batchingを対象に、入力buffer、Paged KV cache、予約枠の競合を整理し、TTFT・生成latency・throughput・VRAMを再現可能に比較する設計を解説します。