Qwen3.6 27B vs 35B-A3BをvLLMで比較:品質・VRAM・速度の測り方

Qwen3.6-27Bと35B-A3BをvLLMで比較し、公式品質スコア、denseとMoEの違い、FP8容量、TTFT・TPOT・throughputの測定方法を解説します。

Qwen3.6 27B vs 35B-A3BをvLLMで比較:品質・VRAM・速度の測り方のイメージイラスト

結論

公式品質スコアではQwen3.6-27Bが35B-A3Bを上回る項目が多く、品質基準を作るモデルに向きます。35B-A3Bは総35Bの重みを保持しますが、約3Bだけを活性化するMoEで、配信速度と計算効率に可能性があります。

vLLMでの選択は「27B対3B」ではありません。重み容量、KV cache、attention/MoE kernel、同時実行時のTTFT・TPOTを同じ条件で測ります。

仕様比較

項目27B35B-A3B
構造DenseMoE
総パラメータ27B35B
活性パラメータ27B約3B
native context262,144262,144
最大拡張約1,010,000約1,010,000
vision対応対応

公式品質スコア

ベンチマーク27B35B-A3B
MMLU-Pro86.285.2
SWE-bench Verified77.273.4
SWE-bench Pro53.549.5
SWE-bench Multilingual71.3
Terminal-Bench 2.059.351.5
SkillsBench Avg548.228.7

数値はQwen公式モデルカードの公開値です。vLLMの速度比較や、自分のGPUで量子化した結果ではありません。品質表と配信性能表を混ぜないことが大切です。

重み容量の下限

精度27B35B
BF16約54GB約70GB
FP8約27GB約35GB
4bit相当約13.5GB約17.5GB

10進GBでの単純計算です。量子化メタデータ、KV cache、activation、CUDA graph、vision encoderを含みません。35B-A3Bは活性3Bでも、全expert重みの保存は必要です。

vLLM起動例

# 27B FP8
vllm serve Qwen/Qwen3.6-27B-FP8 \
  --tensor-parallel-size 2 \
  --max-model-len 32768 \
  --host 127.0.0.1 --port 8000
# 35B-A3B FP8
vllm serve Qwen/Qwen3.6-35B-A3B-FP8 \
  --tensor-parallel-size 2 \
  --max-model-len 32768 \
  --host 127.0.0.1 --port 8001

コマンドは比較の出発点です。checkpointが要求するvLLM version、GPU世代、quantization backendを公式モデルカードとrelease noteで確認してください。v0.25.0ではMRv2がdenseモデルの既定ですが、hybrid MoEでは使われる経路が異なる可能性があります。

オンライン性能を比較する

vllm bench serve \
  --backend openai-chat \
  --base-url http://127.0.0.1:8000 \
  --model Qwen/Qwen3.6-27B-FP8 \
  --dataset-name random \
  --num-prompts 500 \
  --request-rate 4

35B-A3Bも同じ入力・出力長とrequest rateで測ります。request rateを1、2、4、8と増やし、次を表にします。

  • 成功request/s
  • input/output tokens/s
  • TTFT p50・p95・p99
  • TPOT p50・p95・p99
  • peak VRAMとGPU utilization
  • queue time、OOM、timeout

品質を再測定する

同じsystem prompt、temperature、seed、thinking設定で、日本語要約、コード修正、長文検索、tool callを各10〜30問評価します。正解を採点できる問題と、人が比較する問題を分けます。

preserve_thinkingの使い方は既存のQwen3.6思考保持の解説も参照してください。

選択の目安

  • エージェント・コード品質: 27Bをbaselineにする
  • 大量配信: 35B-A3Bの実throughputを測って判断
  • VRAM制約: FP8/低bit checkpointとcontextを含む総使用量で比較
  • 単一ユーザーのローカル利用: llama.cpp版のGGUF比較も候補

まとめ

Qwen3.6-27Bは公式品質値で優勢、35B-A3BはMoEによる計算効率が魅力です。どちらが速いかはGPU、kernel、量子化、batch、contextで変わります。公式品質表を出発点にし、同じvLLM環境でtail latencyとVRAMを測って初めて運用上の結論が出ます。

公式資料