gpt-oss 20b・120bのruntime機器適性比較

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

gpt-oss-20bと120bのMXFP4 weight、128K context、Harmony、Metal・vLLM・ONNX Runtimeを固定し、16GB、H100 80GB、Windowsへの適用範囲と未測定のpeak memory・速度を比較します。

weight容量、KV cache、backendを分け、16GBから80GB GPUまでの適用範囲を示す図

先に結論

calendarの判断: 16GBからローカル推論を始める読者はMXFP4のgpt-oss-20bを容量上の候補とし、gpt-oss-120bは80GB GPUを確保でき、より大きいモデルを扱う理由がある場合だけ選ぶ。

対象model: openai/gpt-oss-20b、openai/gpt-oss-120b
対象機器: 16GB system memory / local MXFP4 capacity candidate、Apple Silicon Mac / OpenAI Metal reference implementation、NVIDIA H100 80GB / vLLM or compatible provider、Windows device / ONNX Runtime Foundry Local

比較できるのは、公式model ID、total/active parameter、MXFP4 artifact、128K context、Harmony format、runtimeの提供状態です。16GBと80GBはweight-fit guidanceであり、同じhardware・backend・contextで測ったpeak memory、TTFT、prefill、decode tok/sではありません。よって20b対120bの速度・品質・費用の勝敗は付けません。

確認日: 2026年8月26日(Asia/Tokyo)
検証区分: OpenAI公式仕様とmodel repository、OpenAI reference implementation、vLLM・ONNX Runtimeの公式releaseを照合した公開情報の机上調査です。KFB実測ではありません。
比較上の制約: OpenAIのmodel評価、Jalapeño測定、第三者providerの値は本稿の機器比較へ混ぜていません。OS、driver、runtime version、context、batch、concurrencyを揃えた公開測定がないため、容量上の候補までに限定します。

比較対象と測定条件

項目固定した値確認元
model/revision/artifactopenai/gpt-oss-20bopenai/gpt-oss-120bの公式repository main、native MXFP4OpenAI model repository
runtime/backend/versionOpenAI Metal reference、vLLM現行release、ONNX Runtime GenAI 0.15系各official repository/release
quantization/dtypeMoE weightのnative MXFP4。KV cache dtypeは未固定OpenAI公式仕様
hardware/memory16GB system memory、Apple Silicon、NVIDIA H100 80GB、Windows devicecalendarと公式提供範囲
context/input・output tokenmodel上限128K。測定用のinput/output長は未設定OpenAI公式仕様
prompt templateHarmony response formatOpenAI model repository
OS/driverrelease pageでartifactの存在だけ確認。個別versionは未固定runtime release
sampling/batch/concurrency/warm-up/反復未測定のため設定なしKFB判断

仕様根拠はOpenAIのgpt-oss発表公式model cardです。現行性はOpenAI公式repositoryの2026年7月24日までの履歴、vLLM releaseONNX Runtime GenAI releaseで再確認しました。

ベンチマーク結果

benchmarkStatus: not-measuredです。公開仕様として並べられる項目だけを表にし、測定値がない欄を数値で補いません。

区分model/artifacttotal/active parametercontext公式weight-fit guidanceTTFT・decode・peak memory出典
公式仕様openai/gpt-oss-20b MXFP421B/3.6B128K16GB memory内未測定。OS・KV cache込みではないOpenAI発表/model card
公式仕様openai/gpt-oss-120b MXFP4117B/5.1B128K単一80GB GPU内未測定。OS・KV cache込みではないOpenAI発表/model card

「16GB内」「80GB内」はweight artifactを置けるというavailability/capacity情報です。peak RAM/VRAMはruntime buffer、KV cache、graph、temporary allocation、OS予約を含むため別metricです。128K contextを使えばKV cacheは伸びますが、本稿はhead数、dtype、backend allocationを固定していないため容量を概算しません。

active parameterの3.6B/5.1Bもdecode tok/sの代用ではありません。MoEで1 tokenあたりに使うparameter量を示しても、memory bandwidth、kernel、expert routing、batch、通信、speculative decodingが異なれば速度は決まりません。

機器ごとの適性

機器/memory対象model判断段階向く用途避ける条件
16GB system memory / local MXFP4 capacity candidate20b容量上の候補短いcontext、batch 1でのfirst response確認128K、複数session、強いswapを前提にする運用
Apple Silicon Mac / OpenAI Metal reference implementation20bを優先reference実装ありPyTorchとの正しさ比較、Metal実装調査production-ready、一般appより速いと仮定すること
NVIDIA H100 80GB / vLLM or compatible provider120bまたは20b120bの容量上の候補Harmony対応serverの事前検証80GBなら必ずOOMなし・高throughputとみなすこと
Windows device / ONNX Runtime Foundry Local20b対応package候補Windows local inferenceの評価全Windows GPU/NPUで同じartifactが動くとみなすこと

20b公式repository120b公式repositoryはTransformers、vLLM、Ollama等の入口を示しますが、表示されるinstall例が自分のdriver、GPU arch、runtime versionへ適合するかは別に固定します。

16GB system memory / local MXFP4 capacity candidateでは、20bのweight-fit後に残る余白が検査点です。runtime起動直後、短いprefill、decode中、会話継続後の順にmemoryを記録し、swapまたはOOMが出た時点でcontextを戻します。

Apple Silicon Mac / OpenAI Metal reference implementationはOpenAI自身がproduction-readyではないとしています。比較するなら同一converted weight、同一Harmony prompt、同一token数で正しさを確認した後、prefillとdecodeを分離します。

NVIDIA H100 80GB / vLLM or compatible providerでは、120bを選ぶ前に20bで満たせないquality要件を同一harnessで定義します。80GBは採用理由ではなく、120bを検証台へ載せる最低条件の一つです。

Windows device / ONNX Runtime Foundry Localはpackage、execution provider、GPU/NPU、Windows buildを記録します。ONNX Runtime GenAIの2026年8月releaseにはgpt-oss model builderとHarmony tool callingの更新がありますが、個々のdeviceでの速度・安定性は未検証です。

結果を適用できる範囲

確認済み事実: 20b/120bの正確なID、21B/117B total parameter、3.6B/5.1B active parameter、native MXFP4、128K context、Apache 2.0、Harmony format、16GB/80GBの公式容量目安、Metal/vLLM/ONNX系の提供または更新です。

開発元の主張: 20bはlocal/specialized use、120bはproduction/general-purpose/high-reasoning useに位置付けられます。これは用途説明であり、KFBが日本語taskでquality差を再測定した結果ではありません。

KFBの判断: 16GBでは20bを最初の容量候補にし、120bは80GB GPUと明確なquality要件が揃う場合だけ比較台へ載せます。別quantization、GGUF、別backend、長いcontext、複数GPU、provider APIへこの判断をそのまま転用しません。

一般的なmemory選択はMacのメモリ別model比較、GPU調達はVRAMコスト比較で先に絞れます。推論後のJSON Schema利用はOllama JSON Schemaガイドが別の検索意図を担当します。

再測定する方法

実機測定を行う場合は、次を1行のrun recordへ固定します。

  • model ID、repository revision、artifact hash、MXFP4のままか別変換か
  • runtime、backend、container/package、OS、driver、GPU、RAM/VRAM
  • Harmony prompt、input/output token数、context上限、reasoning effort、sampling
  • batch、concurrency、warm-up、測定回数
  • prefill tokens/s、TTFT、decode tokens/s、inter-token latency、request throughput、peak RAM/VRAM、power

20bと120bの勝敗は同じhardwareへ無理に載せて作らず、目的別に同じservice-level objectiveを満たす構成で比較します。異なるproviderの公開値しかない場合は同一rankingを作りません。

モデルと機器を先に選ぶ

download前に候補を絞る場合は、同じテーマの実用ガイドで16GB、Apple Silicon、H100 80GB、Windowsの順に確認してください。

参考資料