Qwen3.6 27B vs 35B-A3BをvLLMで比較:品質・VRAM・速度の測り方
Qwen3.6-27Bと35B-A3BをvLLMで比較し、公式品質スコア、denseとMoEの違い、FP8容量、TTFT・TPOT・throughputの測定方法を解説します。

結論
公式品質スコアではQwen3.6-27Bが35B-A3Bを上回る項目が多く、品質基準を作るモデルに向きます。35B-A3Bは総35Bの重みを保持しますが、約3Bだけを活性化するMoEで、配信速度と計算効率に可能性があります。
vLLMでの選択は「27B対3B」ではありません。重み容量、KV cache、attention/MoE kernel、同時実行時のTTFT・TPOTを同じ条件で測ります。
仕様比較
| 項目 | 27B | 35B-A3B |
|---|---|---|
| 構造 | Dense | MoE |
| 総パラメータ | 27B | 35B |
| 活性パラメータ | 27B | 約3B |
| native context | 262,144 | 262,144 |
| 最大拡張 | 約1,010,000 | 約1,010,000 |
| vision | 対応 | 対応 |
公式品質スコア
| ベンチマーク | 27B | 35B-A3B |
|---|---|---|
| MMLU-Pro | 86.2 | 85.2 |
| SWE-bench Verified | 77.2 | 73.4 |
| SWE-bench Pro | 53.5 | 49.5 |
| SWE-bench Multilingual | 71.3 | — |
| Terminal-Bench 2.0 | 59.3 | 51.5 |
| SkillsBench Avg5 | 48.2 | 28.7 |
数値はQwen公式モデルカードの公開値です。vLLMの速度比較や、自分のGPUで量子化した結果ではありません。品質表と配信性能表を混ぜないことが大切です。
重み容量の下限
| 精度 | 27B | 35B |
|---|---|---|
| BF16 | 約54GB | 約70GB |
| FP8 | 約27GB | 約35GB |
| 4bit相当 | 約13.5GB | 約17.5GB |
10進GBでの単純計算です。量子化メタデータ、KV cache、activation、CUDA graph、vision encoderを含みません。35B-A3Bは活性3Bでも、全expert重みの保存は必要です。
vLLM起動例
# 27B FP8
vllm serve Qwen/Qwen3.6-27B-FP8 \
--tensor-parallel-size 2 \
--max-model-len 32768 \
--host 127.0.0.1 --port 8000
# 35B-A3B FP8
vllm serve Qwen/Qwen3.6-35B-A3B-FP8 \
--tensor-parallel-size 2 \
--max-model-len 32768 \
--host 127.0.0.1 --port 8001
コマンドは比較の出発点です。checkpointが要求するvLLM version、GPU世代、quantization backendを公式モデルカードとrelease noteで確認してください。v0.25.0ではMRv2がdenseモデルの既定ですが、hybrid MoEでは使われる経路が異なる可能性があります。
オンライン性能を比較する
vllm bench serve \
--backend openai-chat \
--base-url http://127.0.0.1:8000 \
--model Qwen/Qwen3.6-27B-FP8 \
--dataset-name random \
--num-prompts 500 \
--request-rate 4
35B-A3Bも同じ入力・出力長とrequest rateで測ります。request rateを1、2、4、8と増やし、次を表にします。
- 成功request/s
- input/output tokens/s
- TTFT p50・p95・p99
- TPOT p50・p95・p99
- peak VRAMとGPU utilization
- queue time、OOM、timeout
品質を再測定する
同じsystem prompt、temperature、seed、thinking設定で、日本語要約、コード修正、長文検索、tool callを各10〜30問評価します。正解を採点できる問題と、人が比較する問題を分けます。
preserve_thinkingの使い方は既存のQwen3.6思考保持の解説も参照してください。
選択の目安
- エージェント・コード品質: 27Bをbaselineにする
- 大量配信: 35B-A3Bの実throughputを測って判断
- VRAM制約: FP8/低bit checkpointとcontextを含む総使用量で比較
- 単一ユーザーのローカル利用: llama.cpp版のGGUF比較も候補
まとめ
Qwen3.6-27Bは公式品質値で優勢、35B-A3BはMoEによる計算効率が魅力です。どちらが速いかはGPU、kernel、量子化、batch、contextで変わります。公式品質表を出発点にし、同じvLLM環境でtail latencyとVRAMを測って初めて運用上の結論が出ます。


