Qwen3 4B・8B・30B-A3Bの選び方

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Qwen3 4B・8B・30B-A3Bを公式品質表、32Kネイティブ/YaRN拡張context、量子化artifact容量から比較し、8GB GPU、16GB Mac、24GB GPU、H100で候補にできる範囲を判断します。

VRAMとcontext条件から4B・8B・30B-A3Bの候補を分ける選択図

先に結論

calendarの判断: 限られたVRAMでQwen3を試す読者は4B/8Bを小型候補、128K contextとMoEの容量を受け入れられる読者だけが30B-A3Bを候補にし、Qwen公表の品質比較は同じ公開表の条件内だけで読む。

迷ったら、8GB GPUでは公式4bit artifactが2.68GBの4B、16GB Macでは4Bか8Bから始めます。24GB GPUで30B-A3Bを選べるのは、16.9GBの公式GPTQ-Int4 weightに加えてKV cacheとruntime領域を収められるかを個別に確認できる場合だけです。30B-A3Bのactive parameterが3.3Bでも、全weightが3.3Bになるわけではありません。

対象model:

  • Qwen/Qwen3-4B
  • Qwen/Qwen3-8B
  • Qwen/Qwen3-30B-A3B

対象機器:

  • NVIDIA GPU 8GB VRAM / 4B quantized local runtime
  • Apple Silicon Mac 16GB unified memory / MLX or llama.cpp
  • NVIDIA GPU 24GB VRAM / 30B-A3B quantized capacity candidate
  • NVIDIA H100 80GB / vLLM or SGLang serving

確認日: 2026年8月30日(Asia/Tokyo)
検証区分: 公式仕様と開発元測定を照合した机上調査です。KFBでは各機器で起動・速度・品質を実測していません。
更新範囲: Qwenのmodel cardと公開品質表は2025年の資料です。現在のruntime対応は2026年8月26日のvLLM v0.28.0と8月29日のllama.cpp b10684で再確認し、古い資料の日付を監査日に置き換えていません。

今回比較するモデル

3モデルはすべてApache 2.0ですが、DenseとMoE、weight容量、公式量子化artifactが異なります。公式model cardがいう131,072 tokenはネイティブ長ではなく、32,768 tokenからstatic YaRNを設定して検証した拡張値です。「128K対応」をそのまま標準設定と読まないことが重要です。

公式ID構成context公式量子化artifactlicense/費用
Qwen/Qwen3-4BDense、4.0B(embedding除外3.6B)32,768 native/131,072 YaRN検証AWQ 4bit 2.68GB、GGUF Q4_K_M 2.5GBApache 2.0/利用環境の計算費用は別
Qwen/Qwen3-8BDense、8.2B(embedding除外6.95B)32,768 native/131,072 YaRN検証AWQ 4bit repository 6.11GBApache 2.0/利用環境の計算費用は別
Qwen/Qwen3-30B-A3BMoE、30.5B total/3.3B active、128 experts中8 active32,768 native/131,072 YaRN検証GPTQ-Int4 16.9GBApache 2.0/利用環境の計算費用は別

容量値はHugging Face上のQwen公式repository/file sizeであり、peak RAM/VRAMではありません。KV cache、context、backend、offload、allocatorの分が別に必要です。Qwen3-2507など別IDの更新版は今回の比較対象ではなく、取得時は対象repositoryのcommit SHAも固定してください。

機器ごとの適性

model/variantmemory根拠向く機器向く用途判断段階
Qwen3-4B GGUF Q4_K_M/AWQ公式artifact 2.5GB/2.68GB。QwenのH20測定ではAWQが入力1 token時2,915MB8GB NVIDIA GPU、16GB Apple Silicon Macまずローカルで対話・短い処理を試す容量上の候補。KFB実機未検証
Qwen3-8B AWQ公式repository 6.11GB。QwenのH20測定ではAWQが入力1 token時6,177MB16GB Apple Silicon Mac。8GB GPUは余白が小さい4Bより公式品質値を優先しつつ小型に保つ容量上の候補。Macでのpeak memory・速度は未測定
Qwen3-30B-A3B GPTQ-Int4公式artifact 16.9GB。active 3.3Bでもtotal weightは30.5B24GB NVIDIA GPUは短いcontextの容量候補、H100 80GBはserving候補同じ公式表内で高い品質値を優先容量上の候補。24GBでのpeak・安定性は未測定

Apple Silicon Mac 16GB / MLX or llama.cppについて、QwenはMLXとllama.cppをローカル利用先として案内しています。ただし今回の3カ月内の再確認はllama.cpp側で行い、MLXの現行版・速度・memoryは再測定していません。NVIDIA H100 80GB / vLLM or SGLang servingも、公式runtime対応からみた候補であり、ここに載せた品質表はH100 servingの速度測定ではありません。

性能データの見方

Qwenの公式model cardにあるthinking modeの同名benchmarkを、同じ公開表の行だけで読みます。いずれも開発元測定で、KFB実測ではありません。各指標は尺度が違うため、平均点や総合順位へ作り替えません。

model/dtypeLiveBenchGPQAMMLU-ReduxAIME24区分
4B BF1663.655.983.773.8開発元測定
4B AWQ-INT461.754.482.065.0開発元測定
8B BF1667.162.087.576.0開発元測定
8B AWQ-INT465.559.086.471.3開発元測定
30B-A3B BF1674.365.889.580.4開発元測定
30B-A3B GPTQ-INT471.560.188.879.5開発元測定

hardware、driver、消費電力、TTFT、prefill、decode tok/s、価格はこの品質表にありません。別のQwen速度表はH20 96GB、batch 1、2,048 token生成で、掲載する「Speed」がpromptと生成tokenの合計を時間で割った値です。decode tok/sとして転記せず、手元の機器の速さにも一般化しません。

どれを選ぶか

  • 8GB GPUで失敗余地を小さくする: 4BのQ4_K_MかAWQを短いcontextで始めます。
  • 16GB Macで品質側へ寄せる: 4Bの次に8Bを容量候補にします。長contextや他アプリ併用時は余白を実測してください。
  • 24GB GPUでMoEを試す: 30B-A3B GPTQ-Int4はweightだけで16.9GBです。短いcontextで起動・peak VRAMを確認できる人だけの候補です。
  • H100で配信する: vLLMは現行のDense/MoE実装を持ちますが、H100 80GBでのTTFT、decode、concurrencyは本稿では未検証です。
  • 128Kが必須: どのサイズでもYaRN設定とKV cacheの増加を受け入れられるかを先に確認します。標準の32Kで足りるなら拡張しません。

Qwen3.6をllama.cppで扱う既存記事はQwen3.6のllama.cpp比較、serving条件はQwen3.6のvLLM比較を参照してください。世代が異なるので本稿のQwen3品質値とは混ぜません。GPU費用から逆算する場合はローカルLLMのGPU・VRAM費用比較が次の判断材料です。

試す場合の最短手順

すでにllama.cpp b10684相当を用意している場合だけ、公式GGUFの4B Q4_K_Mを短いcontextで開始します。ソフトウェアの導入やdownloadはこの制作時には実行していません。

llama cli -hf Qwen/Qwen3-4B-GGUF:Q4_K_M -c 8192

応答が返り、起動ログのmodel名とcontextが意図どおりなら最初の確認は完了です。memory不足なら停止し、contextを短くするか4Bのまま量子化を見直します。8Bや30B-A3Bへ進む前に、取得artifact、runtime版、peak memory、入力/出力token数を記録してください。出力品質や速度が公式表と一致するとは限りません。

公開ベンチマークを詳しく見る

Qwen3 4B・8B・30B-A3Bの比較記事で、公開表の条件、量子化別の品質値、H20 memory表と機器別の適用範囲を分けて確認できます。

参考資料