Qwen3 4B・8B・30B-A3B公式性能比較
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Qwen3 4B・8B・30B-A3BのBF16と公式4bit品質表を同一指標で照合し、32K/YaRN拡張context、H20公開memory値、DenseとMoEの違いを分離して機器別の適用範囲を示します。

先に結論
calendarの判断: 限られたVRAMでQwen3を試す読者は4B/8Bを小型候補、128K contextとMoEの容量を受け入れられる読者だけが30B-A3Bを候補にし、Qwen公表の品質比較は同じ公開表の条件内だけで読む。
公式thinking-mode表では4B、8B、30B-A3Bの順に今回採用した4指標すべてのBF16値が高くなります。ただしこれはQwenが報告した品質値で、速度や機器上の勝敗ではありません。量子化後も同じmodel card内の対応行だけを比べ、Dense 4B/8BとMoE 30B-A3Bのweight memoryをactive parameterだけで同一視しません。
対象model:
- Qwen/Qwen3-4B
- Qwen/Qwen3-8B
- Qwen/Qwen3-30B-A3B
対象機器:
- NVIDIA GPU 8GB VRAM / 4B quantized local runtime
- Apple Silicon Mac 16GB unified memory / MLX or llama.cpp
- NVIDIA GPU 24GB VRAM / 30B-A3B quantized capacity candidate
- NVIDIA H100 80GB / vLLM or SGLang serving
確認日: 2026年8月30日(Asia/Tokyo)
検証区分: 公式仕様と開発元測定を照合した机上調査です。KFB実測、独立測定、H100/Mac/24GB GPUでの起動確認はありません。
日付の扱い: 2025年のQwen model card・technical report・速度表は公開測定の歴史的根拠としてリンクし、現在の提供状態を示すsourceDatesには入れていません。現行runtime対応は2026年8月26日のvLLM v0.28.0と8月29日のllama.cpp b10684で再確認しました。
比較対象と測定条件
| 項目 | 固定/確認できた値 | 未確認・制約 |
|---|---|---|
| model/artifact | Qwen/Qwen3-4B BF16/AWQ-INT4、Qwen/Qwen3-8B BF16/AWQ-INT4、Qwen/Qwen3-30B-A3B BF16/GPTQ-INT4 | 取得時はrepositoryのcommit SHAを追加固定する必要あり |
| parameter構成 | 4B Dense 4.0B、8B Dense 8.2B、30B-A3B MoE 30.5B total/3.3B active | active parameterは保存weight容量ではない |
| quality protocol | Qwen model card/technical reportのthinking-mode表。LiveBench、GPQA、MMLU-Redux、AIME24 | 各benchmarkのhardware、全prompt、反復、分散は表に未掲載 |
| context | 3モデルとも32,768 native、131,072までstatic YaRNで検証 | 128K時のquality、KV cache、latencyを本稿では測定せず |
| 生成設定 | 公式推奨のthinking modeはtemperature 0.6、top-p 0.95、top-k 20、min-p 0 | 公開quality値の全harness設定をこの4項目だけでは再現できない |
| 公開speed環境 | NVIDIA H20 96GB、PyTorch 2.6、FlashAttention 2.7.4、Transformers 4.51.3またはSGLang 0.4.6.post1、batch 1、2,048 output tokens | OS/driver、warm-up、反復回数は公開表で未確認 |
| 現行availability | vLLM v0.28.0のQwen3ForCausalLM/Qwen3MoeForCausalLM、llama.cpp b10684系列のQwen3/Qwen3MoE loader | 現行版で本稿のquality/speed表を再測定していない |
calendarのbenchmark evidenceであるQwen3公式発表とQwen3-30B-A3B公式model cardを起点に、4B/8Bと各公式量子化model cardを照合しました。モデル名が同じでもQwen3-2507、Qwen3.6、別GGUF、別backend、別commitは今回の比較対象外です。
ベンチマーク結果
同じ公開品質表の範囲
| 開発元測定 | LiveBench | GPQA | MMLU-Redux | AIME24 |
|---|---|---|---|---|
| Qwen3-4B BF16 | 63.6 | 55.9 | 83.7 | 73.8 |
| Qwen3-4B AWQ-INT4 | 61.7 | 54.4 | 82.0 | 65.0 |
| Qwen3-8B BF16 | 67.1 | 62.0 | 87.5 | 76.0 |
| Qwen3-8B AWQ-INT4 | 65.5 | 59.0 | 86.4 | 71.3 |
| Qwen3-30B-A3B BF16 | 74.3 | 65.8 | 89.5 | 80.4 |
| Qwen3-30B-A3B GPTQ-INT4 | 71.5 | 60.1 | 88.8 | 79.5 |
確認できるのは、各model cardで報告された同名指標の点数です。BF16行では3モデルの順序が4指標で一致しますが、異なるtaskを平均せず、統計的有意差や手元用途の勝率とは呼びません。4bit行も量子化方式が4B/8BはAWQ、30B-A3BはGPTQで異なるため、量子化方式どうしの優劣には使えません。
H20公開表から分けて読めるmemory
| 開発元測定環境 | variant | GPU memory | 適用しないもの |
|---|---|---|---|
| H20 96GB/Transformers 4.51.3/入力1 token | 4B BF16/AWQ | 7,973MB/2,915MB | 8GB市販GPUの安定動作、Mac RAM |
| H20 96GB/Transformers 4.51.3/入力1 token | 8B BF16/AWQ | 15,947MB/6,177MB | 8GB GPUの余白、Mac RAM |
| H20 96GB/Transformers 4.51.3/入力1 token | 30B-A3B BF16/FP8 | 58,462MB/30,296MB | GPTQ-Int4、24GB GPU、H100 80GB |
このmemory値はQwenの公開H20測定です。weight file sizeとも、全機器共通のpeak VRAMとも扱いません。同じ表の「Speed」はprompt tokenと生成tokenの合計を経過時間で割る定義なので、prefill tok/s、TTFT、decode tok/s、inter-token latency、request throughputのどれにも置き換えません。powerとpriceも未公表です。
機器ごとの適性
| 機器/memory | 対象model | 判断段階 | 向く用途 | 避ける条件 |
|---|---|---|---|---|
| NVIDIA GPU 8GB VRAM / 4B quantized local runtime | 4B AWQまたはGGUF Q4_K_M | 公式artifactとH20公開値からみた容量候補 | 短いcontextで最初のローカル検証 | 8GBいっぱいの長context、同時要求、実測なしの速度断定 |
| Apple Silicon Mac 16GB unified memory / MLX or llama.cpp | 4B、次に8B量子化 | weight容量からみた候補 | GPUを別途用意せず小型modelを比較 | Mac上のpeak RAM/decode/電力をH20値から推定 |
| NVIDIA GPU 24GB VRAM / 30B-A3B quantized capacity candidate | 30B-A3B GPTQ-Int4 | 16.9GB artifactからみた容量候補 | 短いcontextでMoEを起動確認 | 128K、余白なし、active 3.3Bを4B相当とみなすこと |
| NVIDIA H100 80GB / vLLM or SGLang serving | 4B/8B Dense、30B-A3B MoE | 公式runtime対応からみたserving候補 | 別途TTFT・decode・throughputを測る配信検証 | H20公開表をH100の結果として使うこと |
4B/8Bの容量を先に選ぶ手順はQwen3 4B・8B・30B-A3Bの選び方にまとめました。Qwen3.6とは世代を分け、llama.cpp条件はQwen3.6 llama.cpp比較、vLLM条件はQwen3.6 vLLM比較を参照してください。機器費用を含む一般比較はGPU・VRAM費用比較で別に扱っています。
結果を適用できる範囲
- 確認済み事実: 公式ID、parameter構成、Apache 2.0、native 32,768/YaRN検証131,072、公式artifact容量、公開品質値、2026年8月時点のvLLM/llama.cpp側実装です。
- 測定者の主張: 品質値とH20 memory値はQwenの開発元測定です。KFBは同じ出力を再現していません。
- KFBの判断: 8GB GPUは4B、16GB Macは4B/8B、24GB GPUは30B-A3B量子化の容量候補です。起動・peak・速度・安定性の合格判定ではありません。
結果はQwen3-2507、Qwen3.6、非公式GGUF、別quantization、別prompt template、non-thinking mode、別context、別runtimeへ移せません。品質表にないTTFT、prefill、decode tok/s、inter-token latency、request throughput、peak RAM/VRAM、power、priceも補間しません。128Kはstatic YaRNを使う拡張条件であり、native 32Kの結果と同じlatencyや品質を仮定できません。
再測定する方法
再測定時は、model repositoryとcommit SHA、artifact名、runtime/backendの版、quantization/dtype、OS/driver、GPUとRAM/VRAM、nativeまたはYaRN context、入力/出力token数、chat template、thinking mode、temperature/top-p/top-k/min-p、batch/concurrency、warm-up回数、測定回数を固定します。
品質は公開harnessとdataset版を固定し、TTFT、prefill tok/s、decode tok/s、inter-token latency、request throughput、peak RAM/VRAM、powerを別列にします。Qwen表の混合Speedをdecode列へ入れません。KFBの実行logを保存できた時だけ「KFB実測」とし、それまでは本稿の値を公開結果の照合として扱います。
モデルと機器を先に選ぶ
候補を絞る場合は、同じテーマの実用ガイドから、8GB GPU、16GB Mac、24GB GPU、H100の順に容量条件を確認してください。
参考資料
- Qwen3公式発表・benchmark表(2025年4月29日、開発元測定)
- Qwen3 Technical Report(2025年5月、benchmark protocol)
- Qwen3-4B-AWQ公式model card(BF16/AWQ品質表)
- Qwen3-8B-AWQ公式model card(BF16/AWQ品質表)
- Qwen3-30B-A3B公式model card(公式仕様)
- Qwen3-30B-A3B GPTQ-Int4公式model card(BF16/GPTQ品質表)
- Qwen3公式speed benchmark(2025年、H20条件とmetric定義)
- vLLM v0.28.0 release(2026年8月26日)
- vLLM supported models(確認日2026年8月30日)
- llama.cpp b10684 release(2026年8月29日)
- llama.cpp Qwen3MoE loader(確認日2026年8月30日)


