Nemotron 3 NanoをH200で選ぶ実用ガイド

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。

H200と8K入力・16K出力を固定し、用途限定でNemotronを選ぶ判断図

先に結論

calendarの判断: H200で長い入力・出力を処理する読者は、NVIDIA公表の8K入力・16K出力条件に限ってNemotron 3 Nano 30B-A3Bを候補にし、別GPU・別contextでの速度判断は同じ条件の測定が出るまで保留する。

対象model: NVIDIA-Nemotron-3-Nano-30B-A3B-BF16、NVIDIA-Nemotron-3-Nano-30B-A3B-FP8、openai/gpt-oss-20b、Qwen/Qwen3-30B-A3B-Thinking-2507
対象機器: NVIDIA H200 141GB / NVIDIA reported inference setup、NVIDIA H100 80GB / BF16 or FP8 serving、NVIDIA NIM / supported container runtime

公開値が直接役立つのは、単一H200で長いpromptを大量に処理するserver用途です。H100や別GPUではNemotron 3 Nanoを容量・公式対応上の候補にはできますが、H200の速度倍率を移しません。

確認日: 2026年8月25日(Asia/Tokyo)
検証区分: NVIDIA公式model card、公式repository、NIM support matrix、NVIDIA開発元測定を照合した公開結果の机上調査です。KFB実測でも独立したH200再測定でもありません。
数値の読み方: throughput倍率は単一H200、8K入力、16K出力に限定します。quality score、weight容量の概算、NIM対応を速度値と混ぜません。

今回比較するモデル

Nemotron 3 Nanoは30B total、約3.5B activeのhybrid MoE modelです。現在のNVIDIA公式repositoryでは、BF16の先頭revisionを2d59de1として確認できます。FP8 repositoryの先頭revisionはf8dc1c0ですが、NVIDIAの2026年8月21日版NIM support matrixがNemotron 3 NanoのBF16、FP8、NVFP4 profileを現行のsupported configurationとして列挙しています。

model/variantparameter/activedtype・quantizationcontextlicense/費用対応runtime選択上の役割
NVIDIA-Nemotron-3-Nano-30B-A3B-BF1630B/約3.5B activeBF16最大1M、標準configは256KNVIDIA Open Model License。重み利用条件とNIM費用は別確認Transformers 5.3.0以降、vLLM、TensorRT-LLM、SGLang、NIMH200/H100で基準品質を評価する候補
NVIDIA-Nemotron-3-Nano-30B-A3B-FP830B/約3.5B activeFP8最大1M、実用値はmemory次第同上NIMのFP8 profile、vLLM等。version固定が必要BF16よりweight容量を抑えるserver候補
openai/gpt-oss-20b20.9B/約3.6B active公式配布はMXFP4128KApache 2.0。runtime・provider費用は別vLLM、NIM、Transformers等NVIDIA throughput比較の対象
Qwen/Qwen3-30B-A3B-Thinking-250730.5B/約3.3B activeBF16公式artifact262K、設定により1MApache 2.0vLLM、SGLang、Transformers等NVIDIA throughput・quality比較の対象

Nemotronの最大1M contextは、1MをH100 80GBやH200 141GBへ必ず載せられるという意味ではありません。公式cardも通常のHugging Face configurationを256Kとし、1Mではより多いVRAMが必要だと注意しています。今回の公開速度は8K入力+16K出力で、最大context試験ではありません。

機器ごとの適性

model/variant必要memoryの根拠向く機器向く用途判断段階
Nemotron BF1630B×16bitからweightのみ約60GBという仕様からの概算。KV cache、runtime、activationを含まないH200 141GB、H100 80GB長文reasoning、agent、RAGの基準評価H200は開発元測定あり。H100はNIM対応・容量上の候補
Nemotron FP830B×8bitからweightのみ約30GBという仕様からの概算。実artifactはmetadata込みH200/H100、対応NIM profileBF16よりweight余白を取りたい配信公式profileあり。H200公表倍率と同じかは未確認
gpt-oss-20b MXFP4OpenAIが約16GB memoryのlocal候補として公開16GB級以上からserver GPUまで小さいweight容量とopen licenseを優先比較model。H200値をlocal速度へ転用不可
Qwen3-30B-A3B Thinking BF1630.5B×16bitからweightのみ約61GBという仕様からの概算80GB級GPU以上を起点長文thinkingとQwen系運用比較model。別quantの速度は未測定

NVIDIA NIMの現行support matrixではNemotron 3 NanoのBF16/FP8をTP1、TP2、TP4、TP8で列挙し、H100 80GB HBM3とH200をverified GPUに含めています。これはprofileが検証対象である証拠で、8K→16Kのrequestを任意のconcurrencyで安定処理できる保証ではありません。

H100 80GBはBF16 weightだけなら容量上の候補ですが、約60GBという概算との差は約20GBです。そこへCUDA、runtime、KV cache、activation、batchが入ります。最大contextや高concurrencyから始めず、短い入力でloadを確認してから段階的に伸ばします。

性能データの見方

NVIDIA Nemotron 3 research pageは、単一H200、8K input、16K outputでNemotron 3 Nanoのinference throughputをQwen3-30B-A3B比3.3倍、gpt-oss-20b比2.2倍と報告しています。これはNVIDIAによる開発元測定で、KFB実測ではありません。絶対tokens/s、TTFT、prefill速度、batch、concurrency、warm-up、反復数はこの公開ページから確定できません。

NVIDIA NGC model cardのquality表では、たとえばMMLU-ProがNemotron 78.3、Qwen 80.9、gpt-oss 75.0、AIME25 no-toolsが89.1、85.0、91.7です。指標ごとに勝者が変わるため「Nemotronが常に高品質」とは読みません。H200のthroughput倍率とquality scoreは別表の別指標です。

weight容量の概算から、decode速度、peak memory、安定性、qualityは推定しません。GPU別の一般的な容量計算はローカルLLMのVRAM計算方法が担当し、本稿はNemotronの公表条件へ範囲を絞ります。

どれを選ぶか

読者の条件最初の選択理由保留する判断
H200 141GBで8K入力・16K出力を配信Nemotron BF16を基準、FP8を同条件で追加公開throughputと最も近い機器・長さ別context、別concurrencyの倍率
H100 80GBで品質基準を作るNemotron BF16を短context・TP1からcurrent NIM supportとweight容量の候補H200比、長文時のpeak VRAM、速度勝敗
H100で余白を優先Nemotron FP8を候補current NIM FP8 profileがあるBF16とのquality差、実throughput
16GB級local環境gpt-oss-20b MXFP4など別のlocal候補Nemotron BF16/FP8のH200結果は適用外Nemotronがlocalで速いという推定
Qwenのthinking挙動が必要Qwen exact artifactを別試験quality表でQwenが上回る指標もあるNemotronの3.3倍を別quantへ移植

高級GPUの調達全体を比較する場合はMac・DGX Spark・RTX PRO高級AIマシン比較を先に読み、H200を個人向けGPUと同列に置かないでください。vLLMでTTFT、TPOT、throughputを測る列の分け方はQwen3.6のvLLM比較手順が参考になりますが、同記事のQwen3.6数値を今回のmodelへ流用しません。

試す場合の最短手順

  1. NVIDIA-Nemotron-3-Nano-30B-A3B-BF16またはNVIDIA-Nemotron-3-Nano-30B-A3B-FP8とfull revisionを記録します。NIMならcontainer versionとvllm-bf16-tp1-pp1またはvllm-fp8-tp1-pp1のprofile名も保存します。
  2. H100/H200、driver、CUDA、NIMまたはbackend version、利用可能VRAMを記録し、まず短いtext prompt、batch 1、concurrency 1でloadと正常終了を確認します。
  3. 成功後だけ、同じartifactのままinputを8K、output上限を16Kへ伸ばします。実際のinput/output token、TTFT、prefill、decode output tokens/s、request throughput、peak VRAM、power、errorを別列で保存します。
  4. OOM、parser error、崩れたreasoning、timeoutが出たらprocessを停止し、直前に成功したcontext/profileへ戻します。dtype、model、backendを同時に変えません。

この手順は実行例を捏造したものではなく、公開測定へ近づけるための記録順です。KFBは当該containerを起動していません。NIMのlicense、container取得条件、企業support費用、地域別提供は導入前にNVIDIAの現行契約画面で確認してください。

公開ベンチマークを詳しく見る

同じテーマの比較記事では、H200、8K入力、16K出力、比較modelを固定し、throughput倍率とquality表を混ぜずに適用範囲を整理します。

参考資料