Qwen3 4B・8B・30B-A3B公式性能比較

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Qwen3 4B・8B・30B-A3BのBF16と公式4bit品質表を同一指標で照合し、32K/YaRN拡張context、H20公開memory値、DenseとMoEの違いを分離して機器別の適用範囲を示します。

公開条件を固定し、DenseとMoEの品質表から機器別判断へ進む比較図

先に結論

calendarの判断: 限られたVRAMでQwen3を試す読者は4B/8Bを小型候補、128K contextとMoEの容量を受け入れられる読者だけが30B-A3Bを候補にし、Qwen公表の品質比較は同じ公開表の条件内だけで読む。

公式thinking-mode表では4B、8B、30B-A3Bの順に今回採用した4指標すべてのBF16値が高くなります。ただしこれはQwenが報告した品質値で、速度や機器上の勝敗ではありません。量子化後も同じmodel card内の対応行だけを比べ、Dense 4B/8BとMoE 30B-A3Bのweight memoryをactive parameterだけで同一視しません。

対象model:

  • Qwen/Qwen3-4B
  • Qwen/Qwen3-8B
  • Qwen/Qwen3-30B-A3B

対象機器:

  • NVIDIA GPU 8GB VRAM / 4B quantized local runtime
  • Apple Silicon Mac 16GB unified memory / MLX or llama.cpp
  • NVIDIA GPU 24GB VRAM / 30B-A3B quantized capacity candidate
  • NVIDIA H100 80GB / vLLM or SGLang serving

確認日: 2026年8月30日(Asia/Tokyo)
検証区分: 公式仕様と開発元測定を照合した机上調査です。KFB実測、独立測定、H100/Mac/24GB GPUでの起動確認はありません。
日付の扱い: 2025年のQwen model card・technical report・速度表は公開測定の歴史的根拠としてリンクし、現在の提供状態を示すsourceDatesには入れていません。現行runtime対応は2026年8月26日のvLLM v0.28.0と8月29日のllama.cpp b10684で再確認しました。

比較対象と測定条件

項目固定/確認できた値未確認・制約
model/artifactQwen/Qwen3-4B BF16/AWQ-INT4、Qwen/Qwen3-8B BF16/AWQ-INT4、Qwen/Qwen3-30B-A3B BF16/GPTQ-INT4取得時はrepositoryのcommit SHAを追加固定する必要あり
parameter構成4B Dense 4.0B、8B Dense 8.2B、30B-A3B MoE 30.5B total/3.3B activeactive parameterは保存weight容量ではない
quality protocolQwen model card/technical reportのthinking-mode表。LiveBench、GPQA、MMLU-Redux、AIME24各benchmarkのhardware、全prompt、反復、分散は表に未掲載
context3モデルとも32,768 native、131,072までstatic YaRNで検証128K時のquality、KV cache、latencyを本稿では測定せず
生成設定公式推奨のthinking modeはtemperature 0.6、top-p 0.95、top-k 20、min-p 0公開quality値の全harness設定をこの4項目だけでは再現できない
公開speed環境NVIDIA H20 96GB、PyTorch 2.6、FlashAttention 2.7.4、Transformers 4.51.3またはSGLang 0.4.6.post1、batch 1、2,048 output tokensOS/driver、warm-up、反復回数は公開表で未確認
現行availabilityvLLM v0.28.0のQwen3ForCausalLM/Qwen3MoeForCausalLM、llama.cpp b10684系列のQwen3/Qwen3MoE loader現行版で本稿のquality/speed表を再測定していない

calendarのbenchmark evidenceであるQwen3公式発表Qwen3-30B-A3B公式model cardを起点に、4B/8Bと各公式量子化model cardを照合しました。モデル名が同じでもQwen3-2507、Qwen3.6、別GGUF、別backend、別commitは今回の比較対象外です。

ベンチマーク結果

同じ公開品質表の範囲

開発元測定LiveBenchGPQAMMLU-ReduxAIME24
Qwen3-4B BF1663.655.983.773.8
Qwen3-4B AWQ-INT461.754.482.065.0
Qwen3-8B BF1667.162.087.576.0
Qwen3-8B AWQ-INT465.559.086.471.3
Qwen3-30B-A3B BF1674.365.889.580.4
Qwen3-30B-A3B GPTQ-INT471.560.188.879.5

確認できるのは、各model cardで報告された同名指標の点数です。BF16行では3モデルの順序が4指標で一致しますが、異なるtaskを平均せず、統計的有意差や手元用途の勝率とは呼びません。4bit行も量子化方式が4B/8BはAWQ、30B-A3BはGPTQで異なるため、量子化方式どうしの優劣には使えません。

H20公開表から分けて読めるmemory

開発元測定環境variantGPU memory適用しないもの
H20 96GB/Transformers 4.51.3/入力1 token4B BF16/AWQ7,973MB/2,915MB8GB市販GPUの安定動作、Mac RAM
H20 96GB/Transformers 4.51.3/入力1 token8B BF16/AWQ15,947MB/6,177MB8GB GPUの余白、Mac RAM
H20 96GB/Transformers 4.51.3/入力1 token30B-A3B BF16/FP858,462MB/30,296MBGPTQ-Int4、24GB GPU、H100 80GB

このmemory値はQwenの公開H20測定です。weight file sizeとも、全機器共通のpeak VRAMとも扱いません。同じ表の「Speed」はprompt tokenと生成tokenの合計を経過時間で割る定義なので、prefill tok/s、TTFT、decode tok/s、inter-token latency、request throughputのどれにも置き換えません。powerとpriceも未公表です。

機器ごとの適性

機器/memory対象model判断段階向く用途避ける条件
NVIDIA GPU 8GB VRAM / 4B quantized local runtime4B AWQまたはGGUF Q4_K_M公式artifactとH20公開値からみた容量候補短いcontextで最初のローカル検証8GBいっぱいの長context、同時要求、実測なしの速度断定
Apple Silicon Mac 16GB unified memory / MLX or llama.cpp4B、次に8B量子化weight容量からみた候補GPUを別途用意せず小型modelを比較Mac上のpeak RAM/decode/電力をH20値から推定
NVIDIA GPU 24GB VRAM / 30B-A3B quantized capacity candidate30B-A3B GPTQ-Int416.9GB artifactからみた容量候補短いcontextでMoEを起動確認128K、余白なし、active 3.3Bを4B相当とみなすこと
NVIDIA H100 80GB / vLLM or SGLang serving4B/8B Dense、30B-A3B MoE公式runtime対応からみたserving候補別途TTFT・decode・throughputを測る配信検証H20公開表をH100の結果として使うこと

4B/8Bの容量を先に選ぶ手順はQwen3 4B・8B・30B-A3Bの選び方にまとめました。Qwen3.6とは世代を分け、llama.cpp条件はQwen3.6 llama.cpp比較、vLLM条件はQwen3.6 vLLM比較を参照してください。機器費用を含む一般比較はGPU・VRAM費用比較で別に扱っています。

結果を適用できる範囲

  • 確認済み事実: 公式ID、parameter構成、Apache 2.0、native 32,768/YaRN検証131,072、公式artifact容量、公開品質値、2026年8月時点のvLLM/llama.cpp側実装です。
  • 測定者の主張: 品質値とH20 memory値はQwenの開発元測定です。KFBは同じ出力を再現していません。
  • KFBの判断: 8GB GPUは4B、16GB Macは4B/8B、24GB GPUは30B-A3B量子化の容量候補です。起動・peak・速度・安定性の合格判定ではありません。

結果はQwen3-2507、Qwen3.6、非公式GGUF、別quantization、別prompt template、non-thinking mode、別context、別runtimeへ移せません。品質表にないTTFT、prefill、decode tok/s、inter-token latency、request throughput、peak RAM/VRAM、power、priceも補間しません。128Kはstatic YaRNを使う拡張条件であり、native 32Kの結果と同じlatencyや品質を仮定できません。

再測定する方法

再測定時は、model repositoryとcommit SHA、artifact名、runtime/backendの版、quantization/dtype、OS/driver、GPUとRAM/VRAM、nativeまたはYaRN context、入力/出力token数、chat template、thinking mode、temperature/top-p/top-k/min-p、batch/concurrency、warm-up回数、測定回数を固定します。

品質は公開harnessとdataset版を固定し、TTFT、prefill tok/s、decode tok/s、inter-token latency、request throughput、peak RAM/VRAM、powerを別列にします。Qwen表の混合Speedをdecode列へ入れません。KFBの実行logを保存できた時だけ「KFB実測」とし、それまでは本稿の値を公開結果の照合として扱います。

モデルと機器を先に選ぶ

候補を絞る場合は、同じテーマの実用ガイドから、8GB GPU、16GB Mac、24GB GPU、H100の順に容量条件を確認してください。

参考資料