Nemotron 3 NanoをH200で選ぶ実用ガイド
Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。
ARTICLE ARCHIVE
ローカルAI、GPU、LLM、Dockerの実践記事を新しい順にまとめています。
Nemotron 3 Nano 30B-A3BのBF16・FP8、gpt-oss-20b、Qwen3-30B-A3Bを、NVIDIA公表の単一H200・8K入力・16K出力へ限定して読み、H200、H100、NIMで候補を選ぶ方法を解説します。
Nemotron 3 Nano 30B-A3B、gpt-oss-20b、Qwen3-30B-A3BのNVIDIA公表値を、単一H200、8K入力、16K出力へ固定し、throughput倍率、quality、context、H100・NIMへの適用外を比較します。
2026年8月25日に確認したGroq 3 LPXの100K長文decode、Vera RubinのAgentX電力性能、GPT-5.6のKiro提供を、測定条件と適用範囲に分けて整理します。
Gemma 4 12Bと26B-A4Bを、32GB Mac、24GB GPU、H100 80GBで選ぶ実用ガイドです。公式memory表、現行revision、対応runtime、未実測範囲を分けて判断できます。
Gemma 4 12Bと26B-A4Bの現行revision、BF16・量子化artifact、MLX・Transformers・vLLM、公式load memoryを固定し、32GB Mac、24GB GPU、H100へ適用できる判断と未測定範囲を比較します。
FlashMLのFreeTokenは、GPU・CPU・ホストRAM・PCIeを束ねて巨大MoEを既存PCで動かす新ランタイムです。DGX Sparkを買う前に試す価値、開発元ベンチマーク、Linux x86_64要件、ARM64未検証をFreeToken寄りに整理します。