Nemotron 3 NanoのH200 throughput比較

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Nemotron 3 Nano 30B-A3B、gpt-oss-20b、Qwen3-30B-A3BのNVIDIA公表値を、単一H200、8K入力、16K出力へ固定し、throughput倍率、quality、context、H100・NIMへの適用外を比較します。

checkpoint、H200、入出力長を固定し、公開throughputの適用範囲を示す図

先に結論

calendarの判断: H200で長い入力・出力を処理する読者は、NVIDIA公表の8K入力・16K出力条件に限ってNemotron 3 Nano 30B-A3Bを候補にし、別GPU・別contextでの速度判断は同じ条件の測定が出るまで保留する。

対象model: NVIDIA-Nemotron-3-Nano-30B-A3B-BF16、NVIDIA-Nemotron-3-Nano-30B-A3B-FP8、openai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507
対象機器: NVIDIA H200 141GB / NVIDIA reported inference setup、NVIDIA H100 80GB / BF16 or FP8 serving、NVIDIA NIM / supported container runtime

NVIDIAの公開結果では、単一H200、8K input、16K outputにおけるNemotron 3 Nanoのinference throughputはQwen3-30B-A3B比3.3倍、gpt-oss-20b比2.2倍です。ただし絶対output tokens/s、TTFT、prefill、runtime、dtype、batch、concurrencyは公開ページから確定できません。結論は「H200長文条件で候補」であり、「全GPUで最速」ではありません。

確認日: 2026年8月25日(Asia/Tokyo)
検証区分: NVIDIAによる開発元測定、NVIDIA NGC model card、公式repository、現行NIM support matrixを照合した公開結果の机上調査です。KFB実測ではありません。
比較上の制約: throughput倍率、quality score、RULER、weight容量、NIM対応は別の指標です。公開されていない条件を推測で補わず、H200以外へ倍率を移しません。

比較対象と測定条件

項目固定した値確認元・不足情報
model/revision/artifactNemotron BF16 2d59de1を現行基準。FP8はf8dc1c0。比較名はopenai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507NVIDIA公式repository。throughput chartが使ったfull revisionは未公表
runtime/backend/version未公表research pageはsingle H200とthroughput倍率を示すが、vLLM/TensorRT-LLM/NIMの別やversionを明記しない
quantization/dtypethroughput測定では未公表calendarはNemotron exact checkpointを要求。BF16/FP8のどちらかを推測しない
hardware/memorysingle NVIDIA H200、141GB HBM3e級NVIDIA開発元測定。driver、CUDA、host CPU/RAMは未公表
OS未公表model cardの一般的な対象はLinuxだが、測定OSとして代入しない
context/input・output token8K input、16K outputtoken化規則、prompt内容、thinking tokenの扱いは未公表
prompt template/sampling未公表reasonerのthinking on/off、temperature、top-p、seedを補完しない
batch/concurrency未公表throughputがrequest throughputかtoken throughputかの詳細も絶対値も未公表
warm-up/測定回数未公表分散、percentile、error barなし

現在性は、2026年7月24日に先頭更新されたNVIDIA公式BF16 repositoryと、2026年8月21日更新のNVIDIA NIM support matrixで再確認しました。後者はNemotron 3 NanoについてBF16、FP8、NVFP4のvLLM profileと、H100 80GB HBM3、H200を含むverified GPUを列挙します。

一方、比較に使うthroughput自体はNVIDIA Nemotron 3 research pageの2025年12月公開値です。現行supportが続いていることと、同じbenchmarkを再測定したことは別です。2026年8月時点の新しい絶対値として扱いません。

ベンチマーク結果

Throughputは倍率だけを採用する

測定区分model/deviceinput→output公開結果TTFTprefillpeak memory/power出典
開発元測定Nemotron 3 Nano/single H2008K→16KQwen3-30B-A3B比3.3倍未公表未公表未公表NVIDIA Research
開発元測定Nemotron 3 Nano/single H2008K→16Kgpt-oss-20b比2.2倍未公表未公表未公表NVIDIA Research

倍率から各modelのtokens/sを逆算しません。ratioの分母となるabsolute throughput、tokenizer、request数、parallelismがないためです。また、16K outputは一般chatより長い生成です。短い回答ではTTFTやprefillの比率が上がり、同じ順位になる保証がありません。

Qualityはtask別に読む

以下はNVIDIA NGCのBF16 model cardに掲載されたquality表です。すべてNVIDIAが提示する同表内の値で、KFB実測ではありません。

測定区分metricNemotron 3 Nano BF16Qwen3-30B-A3B Thinking-2507gpt-oss-20b読み方
開発元掲載MMLU-Pro78.380.975.0general knowledgeではQwen掲載値が高い
開発元掲載AIME25 no-tools89.185.091.7mathではgpt-oss掲載値が高い
開発元掲載GPQA no-tools73.073.471.5差は小さく、誤差情報は未公表
開発元掲載SWE-Bench OpenHands38.822.034.0特定agent harnessの結果
開発元掲載TauBench V2 average49.047.748.73 domain平均。個別domainでは順位が変わる

Nemotronが全指標で勝っているわけではありません。MMLU-ProはQwen、AIME25 no-toolsはgpt-ossの掲載値が高く、用途別の再評価が必要です。throughput倍率をqualityの勝敗やprice-performanceへ掛け合わせた総合点は作りません。

長context qualityはRULERとして分離する

測定区分context metricNemotron 3 Nano BF16Qwen3-30B-A3B Thinking-2507gpt-oss-20b
開発元掲載RULER-100@256K92.989.4未掲載
開発元掲載RULER-100@512K91.384.0未掲載
開発元掲載RULER-100@1M86.377.5未掲載

RULERはcontext内の情報を扱うquality評価で、8K→16Kのthroughput測定とは別です。1M scoreがあることから1MをH100 80GBへ載せられるとは言えず、1M時のTTFT、decode、peak VRAMも未公表です。

機器ごとの適性

機器/memory対象modelrevision・backend判断段階向く用途避ける条件
NVIDIA H200 141GB / NVIDIA reported inference setupNemotron BF16/FP8artifactとbackendを再測定時に固定8K→16Kの開発元測定あり長いagent出力、server候補の絞り込み短文、別concurrency、別runtimeへ3.3倍/2.2倍を転用
NVIDIA H100 80GB / BF16 or FP8 servingNemotron BF16/FP8current NIM profile+full revision公式support・weight容量上の候補短contextからの基準評価H200と同速、最大1M、余白十分と断定
NVIDIA NIM / supported container runtimeNemotron BF16/FP8NIM 2.0.11 support matrixのprofilesupported configurationversionとprofileを固定した運用試験containerを固定せずbenchmark値だけ比較

BF16の30B weightは仕様からの概算で約60GB、FP8は約30GBです。これはweight-onlyで、quantization metadata、KV cache、runtime、CUDA graph、activationを含みません。H100 80GBにBF16が入る可能性から、8K→16K、高batch、1M contextのpeak memoryを推定しません。一般的な計算式はローカルLLMのVRAM計算方法を参照してください。

H200とH100は個人向けGPU比較ではありません。購入・cloud・workstationの境界を整理する場合はMac・DGX Spark・RTX PRO高級AIマシン比較を使い、本稿のrack-scale/datacenter条件と分けてください。

結果を適用できる範囲

確認済み事実は、Nemotron 3 Nanoが30B total/約3.5B active、BF16とFP8の公式artifactがあること、NIMの現行matrixがBF16/FP8 profileとH100/H200を列挙することです。NVIDIAの測定者主張は、single H200、8K input、16K outputでNemotron throughputがQwen比3.3倍、gpt-oss比2.2倍という範囲です。

KFBの判断は、H200で同じ長文条件を扱うreaderだけがNemotronを優先候補にし、H100ではsupportと容量を理由に評価を開始する、というものです。次の条件には適用しません。

  • H100、B200、GB10、RTX、Mac、CPU、複数GPUなどsingle H200以外
  • BF16/FP8/NVFP4のうち、公開throughputで使われたdtypeを特定できない比較
  • 8K未満の短文、16K未満の短い回答、256K/512K/1M context
  • 別chat template、thinking off、sampling、speculative decoding、MTP
  • 別runtime/version、NIM profile、tensor/expert parallel、batch、concurrency
  • TTFT、prefill tokens/s、inter-token latency、request throughput、peak VRAM、power、price
  • 日本語実task、tool call成功率、長時間安定性、安全性

既存のQwen3.6 vLLM比較はTTFT、TPOT、request rateを測る設計を扱いますが、model revisionが異なります。その手順の列名は再利用できても、数値や順位は再利用できません。Qwen3.6 llama.cpp比較もlocal GGUFの別目的です。

原理の補足:active parameterは測定条件の代わりにならない

Nemotronは約3.5B active、gpt-oss-20bは約3.6B active、Qwen3-30B-A3Bは約3.3B activeですが、同じactive parameterなら同じ速度にはなりません。全weight容量、attention、state-space layer、expert routing、kernel、communication、KV cacheが異なります。active parameterはmodel構造の説明であり、H200測定の不足条件を埋める変数ではありません。

再測定する方法

  1. 3 modelのrepository、full revision、artifact filename、checksum、dtypeを固定します。Nemotron BF16とFP8は別runにします。
  2. single H200の型、利用可能141GB、host CPU/RAM、OS、driver、CUDA、runtime/container、backend、profileを保存します。
  3. 同じchat template、thinking設定、sampling、tokenizerで8K inputを作り、16K output上限、batch、concurrencyを固定します。実生成tokenが16K未満なら別runとして扱います。
  4. warm-up回数と本測定回数を事前に決め、TTFT、prefill tokens/s、decode output tokens/s、inter-token latency、request throughput、peak VRAM、power、errorを同時に記録します。
  5. medianだけでなくp95と分散を残し、qualityは同じevaluation harnessとconfigで別に再測定します。throughputとqualityを一つの総合scoreへ足しません。

KFBはこの測定を実行しておらず、command outputやlogを作っていません。NVIDIAの公開倍率を再現できなかった場合は、model名を入れ替えて結論を維持せず、公開条件との差を記録して判断を保留します。

モデルと機器を先に選ぶ

候補を先に絞る場合は同じテーマの実用ガイドで、BF16/FP8、H200/H100、NIMを選ぶ順序から確認してください。

参考資料