
DGX Spark 2〜4台実例|DeepSeek V4・GLM-5.2
DGX Sparkを2〜4台接続し、DeepSeek-V4-Flash、GLM-5.2、MiniMax M3を動かした公開実例を調査。量子化、文脈長、tokens/s、構成、再現上の注意点を比較します。
記事を読むTAG
vLLMの導入、設定、ベンチマーク、活用方法に関する記事をまとめています。 全7件。

DGX Sparkを2〜4台接続し、DeepSeek-V4-Flash、GLM-5.2、MiniMax M3を動かした公開実例を調査。量子化、文脈長、tokens/s、構成、再現上の注意点を比較します。
記事を読む
Qwen3.6-27Bと35B-A3BをvLLMで比較し、公式品質スコア、denseとMoEの違い、FP8容量、TTFT・TPOT・throughputの測定方法を解説します。
記事を読む
DeepSeek V4 FlashをvLLMで起動する公式手順、284B MoEと1M contextの要件、v0.25.0の最適化、公式品質スコアと性能測定方法を解説します。
記事を読む
vLLMのOpenAI互換サーバーを安全に運用するため、起動、TLS、認証、Prometheus監視、vllm bench serve、更新と障害切り分けを解説します。
記事を読む
vLLM V1のscheduler、automatic prefix caching、chunked prefill、speculative decoding、KV cacheの関係と設定時の注意点を解説します。
記事を読む
2026年7月12日公開のvLLM v0.25.0について、Model Runner V2、PagedAttention削除、推論高速化、parser、KV offloadの最新状況を解説します。
記事を読む
NVIDIA DGX SparkでvLLM、DFlash、DDTreeを試すための環境要件、セットアップ手順、検証ポイントを整理した実践メモ。
記事を読む