gpt-oss 20b・120bのruntime機器適性比較
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
gpt-oss-20bと120bのMXFP4 weight、128K context、Harmony、Metal・vLLM・ONNX Runtimeを固定し、16GB、H100 80GB、Windowsへの適用範囲と未測定のpeak memory・速度を比較します。

先に結論
calendarの判断: 16GBからローカル推論を始める読者はMXFP4のgpt-oss-20bを容量上の候補とし、gpt-oss-120bは80GB GPUを確保でき、より大きいモデルを扱う理由がある場合だけ選ぶ。
対象model: openai/gpt-oss-20b、openai/gpt-oss-120b
対象機器: 16GB system memory / local MXFP4 capacity candidate、Apple Silicon Mac / OpenAI Metal reference implementation、NVIDIA H100 80GB / vLLM or compatible provider、Windows device / ONNX Runtime Foundry Local
比較できるのは、公式model ID、total/active parameter、MXFP4 artifact、128K context、Harmony format、runtimeの提供状態です。16GBと80GBはweight-fit guidanceであり、同じhardware・backend・contextで測ったpeak memory、TTFT、prefill、decode tok/sではありません。よって20b対120bの速度・品質・費用の勝敗は付けません。
確認日: 2026年8月26日(Asia/Tokyo)
検証区分: OpenAI公式仕様とmodel repository、OpenAI reference implementation、vLLM・ONNX Runtimeの公式releaseを照合した公開情報の机上調査です。KFB実測ではありません。
比較上の制約: OpenAIのmodel評価、Jalapeño測定、第三者providerの値は本稿の機器比較へ混ぜていません。OS、driver、runtime version、context、batch、concurrencyを揃えた公開測定がないため、容量上の候補までに限定します。
比較対象と測定条件
| 項目 | 固定した値 | 確認元 |
|---|---|---|
| model/revision/artifact | openai/gpt-oss-20b、openai/gpt-oss-120bの公式repository main、native MXFP4 | OpenAI model repository |
| runtime/backend/version | OpenAI Metal reference、vLLM現行release、ONNX Runtime GenAI 0.15系 | 各official repository/release |
| quantization/dtype | MoE weightのnative MXFP4。KV cache dtypeは未固定 | OpenAI公式仕様 |
| hardware/memory | 16GB system memory、Apple Silicon、NVIDIA H100 80GB、Windows device | calendarと公式提供範囲 |
| context/input・output token | model上限128K。測定用のinput/output長は未設定 | OpenAI公式仕様 |
| prompt template | Harmony response format | OpenAI model repository |
| OS/driver | release pageでartifactの存在だけ確認。個別versionは未固定 | runtime release |
| sampling/batch/concurrency/warm-up/反復 | 未測定のため設定なし | KFB判断 |
仕様根拠はOpenAIのgpt-oss発表と公式model cardです。現行性はOpenAI公式repositoryの2026年7月24日までの履歴、vLLM release、ONNX Runtime GenAI releaseで再確認しました。
ベンチマーク結果
benchmarkStatus: not-measuredです。公開仕様として並べられる項目だけを表にし、測定値がない欄を数値で補いません。
| 区分 | model/artifact | total/active parameter | context | 公式weight-fit guidance | TTFT・decode・peak memory | 出典 |
|---|---|---|---|---|---|---|
| 公式仕様 | openai/gpt-oss-20b MXFP4 | 21B/3.6B | 128K | 16GB memory内 | 未測定。OS・KV cache込みではない | OpenAI発表/model card |
| 公式仕様 | openai/gpt-oss-120b MXFP4 | 117B/5.1B | 128K | 単一80GB GPU内 | 未測定。OS・KV cache込みではない | OpenAI発表/model card |
「16GB内」「80GB内」はweight artifactを置けるというavailability/capacity情報です。peak RAM/VRAMはruntime buffer、KV cache、graph、temporary allocation、OS予約を含むため別metricです。128K contextを使えばKV cacheは伸びますが、本稿はhead数、dtype、backend allocationを固定していないため容量を概算しません。
active parameterの3.6B/5.1Bもdecode tok/sの代用ではありません。MoEで1 tokenあたりに使うparameter量を示しても、memory bandwidth、kernel、expert routing、batch、通信、speculative decodingが異なれば速度は決まりません。
機器ごとの適性
| 機器/memory | 対象model | 判断段階 | 向く用途 | 避ける条件 |
|---|---|---|---|---|
| 16GB system memory / local MXFP4 capacity candidate | 20b | 容量上の候補 | 短いcontext、batch 1でのfirst response確認 | 128K、複数session、強いswapを前提にする運用 |
| Apple Silicon Mac / OpenAI Metal reference implementation | 20bを優先 | reference実装あり | PyTorchとの正しさ比較、Metal実装調査 | production-ready、一般appより速いと仮定すること |
| NVIDIA H100 80GB / vLLM or compatible provider | 120bまたは20b | 120bの容量上の候補 | Harmony対応serverの事前検証 | 80GBなら必ずOOMなし・高throughputとみなすこと |
| Windows device / ONNX Runtime Foundry Local | 20b | 対応package候補 | Windows local inferenceの評価 | 全Windows GPU/NPUで同じartifactが動くとみなすこと |
20b公式repositoryと120b公式repositoryはTransformers、vLLM、Ollama等の入口を示しますが、表示されるinstall例が自分のdriver、GPU arch、runtime versionへ適合するかは別に固定します。
16GB system memory / local MXFP4 capacity candidateでは、20bのweight-fit後に残る余白が検査点です。runtime起動直後、短いprefill、decode中、会話継続後の順にmemoryを記録し、swapまたはOOMが出た時点でcontextを戻します。
Apple Silicon Mac / OpenAI Metal reference implementationはOpenAI自身がproduction-readyではないとしています。比較するなら同一converted weight、同一Harmony prompt、同一token数で正しさを確認した後、prefillとdecodeを分離します。
NVIDIA H100 80GB / vLLM or compatible providerでは、120bを選ぶ前に20bで満たせないquality要件を同一harnessで定義します。80GBは採用理由ではなく、120bを検証台へ載せる最低条件の一つです。
Windows device / ONNX Runtime Foundry Localはpackage、execution provider、GPU/NPU、Windows buildを記録します。ONNX Runtime GenAIの2026年8月releaseにはgpt-oss model builderとHarmony tool callingの更新がありますが、個々のdeviceでの速度・安定性は未検証です。
結果を適用できる範囲
確認済み事実: 20b/120bの正確なID、21B/117B total parameter、3.6B/5.1B active parameter、native MXFP4、128K context、Apache 2.0、Harmony format、16GB/80GBの公式容量目安、Metal/vLLM/ONNX系の提供または更新です。
開発元の主張: 20bはlocal/specialized use、120bはproduction/general-purpose/high-reasoning useに位置付けられます。これは用途説明であり、KFBが日本語taskでquality差を再測定した結果ではありません。
KFBの判断: 16GBでは20bを最初の容量候補にし、120bは80GB GPUと明確なquality要件が揃う場合だけ比較台へ載せます。別quantization、GGUF、別backend、長いcontext、複数GPU、provider APIへこの判断をそのまま転用しません。
一般的なmemory選択はMacのメモリ別model比較、GPU調達はVRAMコスト比較で先に絞れます。推論後のJSON Schema利用はOllama JSON Schemaガイドが別の検索意図を担当します。
再測定する方法
実機測定を行う場合は、次を1行のrun recordへ固定します。
- model ID、repository revision、artifact hash、MXFP4のままか別変換か
- runtime、backend、container/package、OS、driver、GPU、RAM/VRAM
- Harmony prompt、input/output token数、context上限、reasoning effort、sampling
- batch、concurrency、warm-up、測定回数
- prefill tokens/s、TTFT、decode tokens/s、inter-token latency、request throughput、peak RAM/VRAM、power
20bと120bの勝敗は同じhardwareへ無理に載せて作らず、目的別に同じservice-level objectiveを満たす構成で比較します。異なるproviderの公開値しかない場合は同一rankingを作りません。
モデルと機器を先に選ぶ
download前に候補を絞る場合は、同じテーマの実用ガイドで16GB、Apple Silicon、H100 80GB、Windowsの順に確認してください。
参考資料
- OpenAI: Introducing gpt-oss(2025年8月5日公開、公式仕様と容量目安)
- OpenAI: gpt-oss model card(2025年8月5日公開、license・提供範囲)
- OpenAI公式gpt-oss repository(2026年7月24日までの現行履歴を確認)
- OpenAI公式20b repository(2026年8月26日確認)
- OpenAI公式120b repository(2026年8月26日確認)
- vLLM releases(2026年7月11日の現行releaseを確認)
- ONNX Runtime GenAI releases(2026年8月7日のWindows artifactとgpt-oss修正を確認)


