Nemotron 3 NanoをH200で選ぶ実用ガイド
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。

先に結論
calendarの判断: H200で長い入力・出力を処理する読者は、NVIDIA公表の8K入力・16K出力条件に限ってNemotron 3 Nano 30B-A3Bを候補にし、別GPU・別contextでの速度判断は同じ条件の測定が出るまで保留する。
対象model: NVIDIA-Nemotron-3-Nano-30B-A3B-BF16、NVIDIA-Nemotron-3-Nano-30B-A3B-FP8、openai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507
対象機器: NVIDIA H200 141GB / NVIDIA reported inference setup、NVIDIA H100 80GB / BF16 or FP8 serving、NVIDIA NIM / supported container runtime
公開値が直接役立つのは、単一H200で長いpromptを大量に処理するserver用途です。H100や別GPUではNemotron 3 Nanoを容量・公式対応上の候補にはできますが、H200の速度倍率を移しません。
確認日: 2026年8月25日(Asia/Tokyo)
検証区分: NVIDIA公式model card、公式repository、NIM support matrix、NVIDIA開発元測定を照合した公開結果の机上調査です。KFB実測でも独立したH200再測定でもありません。
数値の読み方: throughput倍率は単一H200、8K入力、16K出力に限定します。quality score、weight容量の概算、NIM対応を速度値と混ぜません。
今回比較するモデル
Nemotron 3 Nanoは30B total、約3.5B activeのhybrid MoE modelです。現在のNVIDIA公式repositoryでは、BF16の先頭revisionを2d59de1として確認できます。FP8 repositoryの先頭revisionはf8dc1c0ですが、NVIDIAの2026年8月21日版NIM support matrixがNemotron 3 NanoのBF16、FP8、NVFP4 profileを現行のsupported configurationとして列挙しています。
| model/variant | parameter/active | dtype・quantization | context | license/費用 | 対応runtime | 選択上の役割 |
|---|---|---|---|---|---|---|
| NVIDIA-Nemotron-3-Nano-30B-A3B-BF16 | 30B/約3.5B active | BF16 | 最大1M、標準configは256K | NVIDIA Open Model License。重み利用条件とNIM費用は別確認 | Transformers 5.3.0以降、vLLM、TensorRT-LLM、SGLang、NIM | H200/H100で基準品質を評価する候補 |
| NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 | 30B/約3.5B active | FP8 | 最大1M、実用値はmemory次第 | 同上 | NIMのFP8 profile、vLLM等。version固定が必要 | BF16よりweight容量を抑えるserver候補 |
| openai/gpt-oss-20b | 20.9B/約3.6B active | 公式配布はMXFP4 | 128K | Apache 2.0。runtime・provider費用は別 | vLLM、NIM、Transformers等 | NVIDIA throughput比較の対象 |
| Qwen/Qwen3-30B-A3B-Thinking-2507 | 30.5B/約3.3B active | BF16公式artifact | 262K、設定により1M | Apache 2.0 | vLLM、SGLang、Transformers等 | NVIDIA throughput・quality比較の対象 |
Nemotronの最大1M contextは、1MをH100 80GBやH200 141GBへ必ず載せられるという意味ではありません。公式cardも通常のHugging Face configurationを256Kとし、1Mではより多いVRAMが必要だと注意しています。今回の公開速度は8K入力+16K出力で、最大context試験ではありません。
機器ごとの適性
| model/variant | 必要memoryの根拠 | 向く機器 | 向く用途 | 判断段階 |
|---|---|---|---|---|
| Nemotron BF16 | 30B×16bitからweightのみ約60GBという仕様からの概算。KV cache、runtime、activationを含まない | H200 141GB、H100 80GB | 長文reasoning、agent、RAGの基準評価 | H200は開発元測定あり。H100はNIM対応・容量上の候補 |
| Nemotron FP8 | 30B×8bitからweightのみ約30GBという仕様からの概算。実artifactはmetadata込み | H200/H100、対応NIM profile | BF16よりweight余白を取りたい配信 | 公式profileあり。H200公表倍率と同じかは未確認 |
| gpt-oss-20b MXFP4 | OpenAIが約16GB memoryのlocal候補として公開 | 16GB級以上からserver GPUまで | 小さいweight容量とopen licenseを優先 | 比較model。H200値をlocal速度へ転用不可 |
| Qwen3-30B-A3B Thinking BF16 | 30.5B×16bitからweightのみ約61GBという仕様からの概算 | 80GB級GPU以上を起点 | 長文thinkingとQwen系運用 | 比較model。別quantの速度は未測定 |
NVIDIA NIMの現行support matrixではNemotron 3 NanoのBF16/FP8をTP1、TP2、TP4、TP8で列挙し、H100 80GB HBM3とH200をverified GPUに含めています。これはprofileが検証対象である証拠で、8K→16Kのrequestを任意のconcurrencyで安定処理できる保証ではありません。
H100 80GBはBF16 weightだけなら容量上の候補ですが、約60GBという概算との差は約20GBです。そこへCUDA、runtime、KV cache、activation、batchが入ります。最大contextや高concurrencyから始めず、短い入力でloadを確認してから段階的に伸ばします。
性能データの見方
NVIDIA Nemotron 3 research pageは、単一H200、8K input、16K outputでNemotron 3 Nanoのinference throughputをQwen3-30B-A3B比3.3倍、gpt-oss-20b比2.2倍と報告しています。これはNVIDIAによる開発元測定で、KFB実測ではありません。絶対tokens/s、TTFT、prefill速度、batch、concurrency、warm-up、反復数はこの公開ページから確定できません。
NVIDIA NGC model cardのquality表では、たとえばMMLU-ProがNemotron 78.3、Qwen 80.9、gpt-oss 75.0、AIME25 no-toolsが89.1、85.0、91.7です。指標ごとに勝者が変わるため「Nemotronが常に高品質」とは読みません。H200のthroughput倍率とquality scoreは別表の別指標です。
weight容量の概算から、decode速度、peak memory、安定性、qualityは推定しません。GPU別の一般的な容量計算はローカルLLMのVRAM計算方法が担当し、本稿はNemotronの公表条件へ範囲を絞ります。
どれを選ぶか
| 読者の条件 | 最初の選択 | 理由 | 保留する判断 |
|---|---|---|---|
| H200 141GBで8K入力・16K出力を配信 | Nemotron BF16を基準、FP8を同条件で追加 | 公開throughputと最も近い機器・長さ | 別context、別concurrencyの倍率 |
| H100 80GBで品質基準を作る | Nemotron BF16を短context・TP1から | current NIM supportとweight容量の候補 | H200比、長文時のpeak VRAM、速度勝敗 |
| H100で余白を優先 | Nemotron FP8を候補 | current NIM FP8 profileがある | BF16とのquality差、実throughput |
| 16GB級local環境 | gpt-oss-20b MXFP4など別のlocal候補 | Nemotron BF16/FP8のH200結果は適用外 | Nemotronがlocalで速いという推定 |
| Qwenのthinking挙動が必要 | Qwen exact artifactを別試験 | quality表でQwenが上回る指標もある | Nemotronの3.3倍を別quantへ移植 |
高級GPUの調達全体を比較する場合はMac・DGX Spark・RTX PRO高級AIマシン比較を先に読み、H200を個人向けGPUと同列に置かないでください。vLLMでTTFT、TPOT、throughputを測る列の分け方はQwen3.6のvLLM比較手順が参考になりますが、同記事のQwen3.6数値を今回のmodelへ流用しません。
試す場合の最短手順
NVIDIA-Nemotron-3-Nano-30B-A3B-BF16またはNVIDIA-Nemotron-3-Nano-30B-A3B-FP8とfull revisionを記録します。NIMならcontainer versionとvllm-bf16-tp1-pp1またはvllm-fp8-tp1-pp1のprofile名も保存します。- H100/H200、driver、CUDA、NIMまたはbackend version、利用可能VRAMを記録し、まず短いtext prompt、batch 1、concurrency 1でloadと正常終了を確認します。
- 成功後だけ、同じartifactのままinputを8K、output上限を16Kへ伸ばします。実際のinput/output token、TTFT、prefill、decode output tokens/s、request throughput、peak VRAM、power、errorを別列で保存します。
- OOM、parser error、崩れたreasoning、timeoutが出たらprocessを停止し、直前に成功したcontext/profileへ戻します。dtype、model、backendを同時に変えません。
この手順は実行例を捏造したものではなく、公開測定へ近づけるための記録順です。KFBは当該containerを起動していません。NIMのlicense、container取得条件、企業support費用、地域別提供は導入前にNVIDIAの現行契約画面で確認してください。
公開ベンチマークを詳しく見る
同じテーマの比較記事では、H200、8K入力、16K出力、比較modelを固定し、throughput倍率とquality表を混ぜずに適用範囲を整理します。
参考資料
- NVIDIA Research:Nemotron 3 family(2025年12月15日公開。H200 throughput測定の歴史的根拠)
- NVIDIA NGC:Nemotron 3 Nano model card(model、license、quality、runtimeの公式仕様)
- NVIDIA公式BF16 repository(2026年7月24日の先頭更新を確認)
- NVIDIA公式FP8 repository(現行artifact名とmodel cardを確認)
- NVIDIA NIM support matrix(2026年8月21日更新。BF16/FP8 profileとverified GPU)
- OpenAI公式gpt-oss-20b repository(比較modelのID、MXFP4、license)
- Qwen公式Thinking-2507 repository(比較modelのID、parameter、context、license)


