Nemotron 3 NanoのH200 throughput比較
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Nemotron 3 Nano 30B-A3B、gpt-oss-20b、Qwen3-30B-A3BのNVIDIA公表値を、単一H200、8K入力、16K出力へ固定し、throughput倍率、quality、context、H100・NIMへの適用外を比較します。

先に結論
calendarの判断: H200で長い入力・出力を処理する読者は、NVIDIA公表の8K入力・16K出力条件に限ってNemotron 3 Nano 30B-A3Bを候補にし、別GPU・別contextでの速度判断は同じ条件の測定が出るまで保留する。
対象model: NVIDIA-Nemotron-3-Nano-30B-A3B-BF16、NVIDIA-Nemotron-3-Nano-30B-A3B-FP8、openai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507
対象機器: NVIDIA H200 141GB / NVIDIA reported inference setup、NVIDIA H100 80GB / BF16 or FP8 serving、NVIDIA NIM / supported container runtime
NVIDIAの公開結果では、単一H200、8K input、16K outputにおけるNemotron 3 Nanoのinference throughputはQwen3-30B-A3B比3.3倍、gpt-oss-20b比2.2倍です。ただし絶対output tokens/s、TTFT、prefill、runtime、dtype、batch、concurrencyは公開ページから確定できません。結論は「H200長文条件で候補」であり、「全GPUで最速」ではありません。
確認日: 2026年8月25日(Asia/Tokyo)
検証区分: NVIDIAによる開発元測定、NVIDIA NGC model card、公式repository、現行NIM support matrixを照合した公開結果の机上調査です。KFB実測ではありません。
比較上の制約: throughput倍率、quality score、RULER、weight容量、NIM対応は別の指標です。公開されていない条件を推測で補わず、H200以外へ倍率を移しません。
比較対象と測定条件
| 項目 | 固定した値 | 確認元・不足情報 |
|---|---|---|
| model/revision/artifact | Nemotron BF16 2d59de1を現行基準。FP8はf8dc1c0。比較名はopenai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507 | NVIDIA公式repository。throughput chartが使ったfull revisionは未公表 |
| runtime/backend/version | 未公表 | research pageはsingle H200とthroughput倍率を示すが、vLLM/TensorRT-LLM/NIMの別やversionを明記しない |
| quantization/dtype | throughput測定では未公表 | calendarはNemotron exact checkpointを要求。BF16/FP8のどちらかを推測しない |
| hardware/memory | single NVIDIA H200、141GB HBM3e級 | NVIDIA開発元測定。driver、CUDA、host CPU/RAMは未公表 |
| OS | 未公表 | model cardの一般的な対象はLinuxだが、測定OSとして代入しない |
| context/input・output token | 8K input、16K output | token化規則、prompt内容、thinking tokenの扱いは未公表 |
| prompt template/sampling | 未公表 | reasonerのthinking on/off、temperature、top-p、seedを補完しない |
| batch/concurrency | 未公表 | throughputがrequest throughputかtoken throughputかの詳細も絶対値も未公表 |
| warm-up/測定回数 | 未公表 | 分散、percentile、error barなし |
現在性は、2026年7月24日に先頭更新されたNVIDIA公式BF16 repositoryと、2026年8月21日更新のNVIDIA NIM support matrixで再確認しました。後者はNemotron 3 NanoについてBF16、FP8、NVFP4のvLLM profileと、H100 80GB HBM3、H200を含むverified GPUを列挙します。
一方、比較に使うthroughput自体はNVIDIA Nemotron 3 research pageの2025年12月公開値です。現行supportが続いていることと、同じbenchmarkを再測定したことは別です。2026年8月時点の新しい絶対値として扱いません。
ベンチマーク結果
Throughputは倍率だけを採用する
| 測定区分 | model/device | input→output | 公開結果 | TTFT | prefill | peak memory/power | 出典 |
|---|---|---|---|---|---|---|---|
| 開発元測定 | Nemotron 3 Nano/single H200 | 8K→16K | Qwen3-30B-A3B比3.3倍 | 未公表 | 未公表 | 未公表 | NVIDIA Research |
| 開発元測定 | Nemotron 3 Nano/single H200 | 8K→16K | gpt-oss-20b比2.2倍 | 未公表 | 未公表 | 未公表 | NVIDIA Research |
倍率から各modelのtokens/sを逆算しません。ratioの分母となるabsolute throughput、tokenizer、request数、parallelismがないためです。また、16K outputは一般chatより長い生成です。短い回答ではTTFTやprefillの比率が上がり、同じ順位になる保証がありません。
Qualityはtask別に読む
以下はNVIDIA NGCのBF16 model cardに掲載されたquality表です。すべてNVIDIAが提示する同表内の値で、KFB実測ではありません。
| 測定区分 | metric | Nemotron 3 Nano BF16 | Qwen3-30B-A3B Thinking-2507 | gpt-oss-20b | 読み方 |
|---|---|---|---|---|---|
| 開発元掲載 | MMLU-Pro | 78.3 | 80.9 | 75.0 | general knowledgeではQwen掲載値が高い |
| 開発元掲載 | AIME25 no-tools | 89.1 | 85.0 | 91.7 | mathではgpt-oss掲載値が高い |
| 開発元掲載 | GPQA no-tools | 73.0 | 73.4 | 71.5 | 差は小さく、誤差情報は未公表 |
| 開発元掲載 | SWE-Bench OpenHands | 38.8 | 22.0 | 34.0 | 特定agent harnessの結果 |
| 開発元掲載 | TauBench V2 average | 49.0 | 47.7 | 48.7 | 3 domain平均。個別domainでは順位が変わる |
Nemotronが全指標で勝っているわけではありません。MMLU-ProはQwen、AIME25 no-toolsはgpt-ossの掲載値が高く、用途別の再評価が必要です。throughput倍率をqualityの勝敗やprice-performanceへ掛け合わせた総合点は作りません。
長context qualityはRULERとして分離する
| 測定区分 | context metric | Nemotron 3 Nano BF16 | Qwen3-30B-A3B Thinking-2507 | gpt-oss-20b |
|---|---|---|---|---|
| 開発元掲載 | RULER-100@256K | 92.9 | 89.4 | 未掲載 |
| 開発元掲載 | RULER-100@512K | 91.3 | 84.0 | 未掲載 |
| 開発元掲載 | RULER-100@1M | 86.3 | 77.5 | 未掲載 |
RULERはcontext内の情報を扱うquality評価で、8K→16Kのthroughput測定とは別です。1M scoreがあることから1MをH100 80GBへ載せられるとは言えず、1M時のTTFT、decode、peak VRAMも未公表です。
機器ごとの適性
| 機器/memory | 対象model | revision・backend | 判断段階 | 向く用途 | 避ける条件 |
|---|---|---|---|---|---|
| NVIDIA H200 141GB / NVIDIA reported inference setup | Nemotron BF16/FP8 | artifactとbackendを再測定時に固定 | 8K→16Kの開発元測定あり | 長いagent出力、server候補の絞り込み | 短文、別concurrency、別runtimeへ3.3倍/2.2倍を転用 |
| NVIDIA H100 80GB / BF16 or FP8 serving | Nemotron BF16/FP8 | current NIM profile+full revision | 公式support・weight容量上の候補 | 短contextからの基準評価 | H200と同速、最大1M、余白十分と断定 |
| NVIDIA NIM / supported container runtime | Nemotron BF16/FP8 | NIM 2.0.11 support matrixのprofile | supported configuration | versionとprofileを固定した運用試験 | containerを固定せずbenchmark値だけ比較 |
BF16の30B weightは仕様からの概算で約60GB、FP8は約30GBです。これはweight-onlyで、quantization metadata、KV cache、runtime、CUDA graph、activationを含みません。H100 80GBにBF16が入る可能性から、8K→16K、高batch、1M contextのpeak memoryを推定しません。一般的な計算式はローカルLLMのVRAM計算方法を参照してください。
H200とH100は個人向けGPU比較ではありません。購入・cloud・workstationの境界を整理する場合はMac・DGX Spark・RTX PRO高級AIマシン比較を使い、本稿のrack-scale/datacenter条件と分けてください。
結果を適用できる範囲
確認済み事実は、Nemotron 3 Nanoが30B total/約3.5B active、BF16とFP8の公式artifactがあること、NIMの現行matrixがBF16/FP8 profileとH100/H200を列挙することです。NVIDIAの測定者主張は、single H200、8K input、16K outputでNemotron throughputがQwen比3.3倍、gpt-oss比2.2倍という範囲です。
KFBの判断は、H200で同じ長文条件を扱うreaderだけがNemotronを優先候補にし、H100ではsupportと容量を理由に評価を開始する、というものです。次の条件には適用しません。
- H100、B200、GB10、RTX、Mac、CPU、複数GPUなどsingle H200以外
- BF16/FP8/NVFP4のうち、公開throughputで使われたdtypeを特定できない比較
- 8K未満の短文、16K未満の短い回答、256K/512K/1M context
- 別chat template、thinking off、sampling、speculative decoding、MTP
- 別runtime/version、NIM profile、tensor/expert parallel、batch、concurrency
- TTFT、prefill tokens/s、inter-token latency、request throughput、peak VRAM、power、price
- 日本語実task、tool call成功率、長時間安定性、安全性
既存のQwen3.6 vLLM比較はTTFT、TPOT、request rateを測る設計を扱いますが、model revisionが異なります。その手順の列名は再利用できても、数値や順位は再利用できません。Qwen3.6 llama.cpp比較もlocal GGUFの別目的です。
原理の補足:active parameterは測定条件の代わりにならない
Nemotronは約3.5B active、gpt-oss-20bは約3.6B active、Qwen3-30B-A3Bは約3.3B activeですが、同じactive parameterなら同じ速度にはなりません。全weight容量、attention、state-space layer、expert routing、kernel、communication、KV cacheが異なります。active parameterはmodel構造の説明であり、H200測定の不足条件を埋める変数ではありません。
再測定する方法
- 3 modelのrepository、full revision、artifact filename、checksum、dtypeを固定します。Nemotron BF16とFP8は別runにします。
- single H200の型、利用可能141GB、host CPU/RAM、OS、driver、CUDA、runtime/container、backend、profileを保存します。
- 同じchat template、thinking設定、sampling、tokenizerで8K inputを作り、16K output上限、batch、concurrencyを固定します。実生成tokenが16K未満なら別runとして扱います。
- warm-up回数と本測定回数を事前に決め、TTFT、prefill tokens/s、decode output tokens/s、inter-token latency、request throughput、peak VRAM、power、errorを同時に記録します。
- medianだけでなくp95と分散を残し、qualityは同じevaluation harnessとconfigで別に再測定します。throughputとqualityを一つの総合scoreへ足しません。
KFBはこの測定を実行しておらず、command outputやlogを作っていません。NVIDIAの公開倍率を再現できなかった場合は、model名を入れ替えて結論を維持せず、公開条件との差を記録して判断を保留します。
モデルと機器を先に選ぶ
候補を先に絞る場合は同じテーマの実用ガイドで、BF16/FP8、H200/H100、NIMを選ぶ順序から確認してください。
参考資料
- NVIDIA Research:Nemotron 3 family(2025年12月15日公開。single H200、8K input、16K outputの開発元throughput)
- NVIDIA NGC:Nemotron 3 Nano model card(model ID、quality、RULER、license、runtime)
- NVIDIA公式BF16 repository(2026年7月24日の先頭更新を確認)
- NVIDIA公式FP8 repository(現行FP8 artifactを確認)
- NVIDIA NIM support matrix(2026年8月21日更新。profile、H100/H200 support)
- OpenAI公式gpt-oss-20b repository(比較modelのID、parameter、MXFP4、license)
- Qwen公式Thinking-2507 repository(比較modelのID、parameter、context、license)


