DGX Spark 8台でGLM-5.2|ピーク66 tok/sを検証
8台のDGX Sparkで753B級GLM-5.2を動かし、v18でprefill 1,329 tok/s、平均decode 35〜42 tok/s、ピーク66 tok/sを記録した公開例を、条件と注意点まで検証します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
8台のDGX Sparkで753B級GLM-5.2を動かし、v18でprefill 1,329 tok/s、平均decode 35〜42 tok/s、ピーク66 tok/sを記録した公開例を、条件と注意点まで検証します。
PoolsideのLaguna S 2.1は117.6B総・8.5B activeのMoE。DGX Spark、RTX PRO 6000、128GB Macでの容量、速度、ベンチマークを検証します。
DwarfStarでDeepSeek-V4-Flashを128GB環境・45 TPSで動かし、Huihuiのabliterated版へ差し替えたX投稿を検証。1M文脈、KVキャッシュ、2bit量子化の注意点を解説します。
4台のDGX Sparkで動かした4bit版GLM-5.2が、クラウド版をSpark-Benchで91.5対86.8と上回ったX投稿を検証。スコア差の意味と注意点を解説します。
DGX Sparkを2〜4台接続し、DeepSeek-V4-Flash、GLM-5.2、MiniMax M3を動かした公開実例を調査。量子化、文脈長、tokens/s、構成、再現上の注意点を比較します。
DGX Spark 1〜4台でDeepSeek-V4-FlashとGLM-5.2の量子化モデルをどこまで動かせるか。GGUF・FP8の実サイズ、必要メモリ、200GbE接続を比較します。