gpt-oss 20bと120bの機器別選び方
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
gpt-oss-20bと120bを、16GB memory、Apple Silicon、H100 80GB、Windowsで選ぶガイドです。MXFP4の公式容量目安、128K context、現行runtime、未測定範囲を分けて判断できます。

先に結論
calendarの判断: 16GBからローカル推論を始める読者はMXFP4のgpt-oss-20bを容量上の候補とし、gpt-oss-120bは80GB GPUを確保でき、より大きいモデルを扱う理由がある場合だけ選ぶ。
対象model: openai/gpt-oss-20b、openai/gpt-oss-120b
対象機器: 16GB system memory / local MXFP4 capacity candidate、Apple Silicon Mac / OpenAI Metal reference implementation、NVIDIA H100 80GB / vLLM or compatible provider、Windows device / ONNX Runtime Foundry Local
個人が最初にdownloadするならgpt-oss-20bです。OpenAIの16GB/80GBはMXFP4 weightを収める目安であり、OS、runtime、KV cache、128K context、batchの追加memoryを含むpeak RAM/VRAMの保証ではありません。120bは「active parameterが5.1Bだから小さい」と考えず、117B全weightを保持できる機器から選びます。
確認日: 2026年8月26日(Asia/Tokyo)
検証区分: OpenAI公式仕様、公式model repository、OpenAI reference implementation、vLLM・ONNX Runtimeの公式releaseを照合した机上調査です。KFBはmodelをdownloadせず、実機起動・速度・peak memoryを測定していません。
数値の読み方: parameter、context、MXFP4の容量目安は公式仕様です。TTFT、prefill、decode tok/s、消費電力、価格は比較可能な同条件測定がないため採用していません。
今回比較するモデル
両modelは2025年8月5日に公開されたtext-onlyのopen-weight reasoning modelです。初回発表日は歴史的事実として扱い、現在のruntime対応は2026年7〜8月のrepositoryとreleaseで再確認しました。Apache 2.0で提供され、Harmony response format、128K context、low/medium/highのreasoning effortを使います。
| model ID | total/active parameter | 配布weight | context | license・費用 | 対応runtimeの確認範囲 | 向く用途 | 避ける条件 |
|---|---|---|---|---|---|---|---|
openai/gpt-oss-20b | 21B/3.6B | native MXFP4 | 128K | Apache 2.0、weight自体は無償 | Transformers、vLLM、Ollama、OpenAI Metal reference、ONNX Runtime系 | localでtool useやstructured outputを試す入口 | 16GBで128K contextや並列実行まで保証されると考える場合 |
openai/gpt-oss-120b | 117B/5.1B | native MXFP4 | 128K | Apache 2.0、運用機器・電力・provider費用は別 | vLLM、compatible provider、OpenAI Triton/Metal reference等 | 80GB GPUを確保し、大きいmodelを使う理由があるserver用途 | active parameterだけでweight容量を見積もる場合 |
OpenAIの初回発表は20bを16GB、120bを単一80GB GPUで動かせると説明します。公式model cardはApache 2.0、text-only、tool use、reasoningなどの提供範囲を示します。これらは「そのmemoryなら常に快適」「128K contextでも収まる」というbenchmarkではありません。
機器ごとの適性
| model/variant | 必要memoryの根拠 | 向く機器 | 向く用途 | 判断段階 |
|---|---|---|---|---|
openai/gpt-oss-20b MXFP4 | OpenAIが16GB内のweight fitを案内。OS・KV cache・runtime overheadは別 | 16GB system memory | 小さいcontextで最初の応答を確認 | 容量上の候補 |
openai/gpt-oss-20b Metal変換 | official repositoryがApple Silicon用reference実装を提供 | Apple Silicon Mac | Metal referenceとPyTorch結果の整合確認 | reference実装あり、production-readyではない |
openai/gpt-oss-120b MXFP4 | OpenAIが単一80GB GPUを案内 | NVIDIA H100 80GB | vLLM等で単一modelをserveする事前検証 | 容量上の候補 |
openai/gpt-oss-20b ONNX package | ONNX Runtime GenAI 0.15系がWindows artifactとgpt-oss修正を継続 | Windows device | Foundry Local/ONNX系の対応packageを固定した検証 | runtime対応候補 |
16GB system memory / local MXFP4 capacity candidateでは、まず短いcontext、batch 1、他の大きなprocessを止めた状態で20bを候補にします。16GBちょうどの機器は余白が小さいため、起動できても長い会話やtool resultでmemory不足になる可能性があります。
Apple Silicon Mac / OpenAI Metal reference implementationは学習・照合用です。OpenAIのgpt-oss repositoryはMetal実装を「production-readyではない」と明記しています。Macだから無条件にこのbackendを選ばず、日常利用はOllamaや対応appを含めて更新状況を確認します。
NVIDIA H100 80GB / vLLM or compatible providerは120bのweight容量を満たす入口です。vLLMの現行releaseでruntime自体の変更が続いているため、model ID、container、driver、dtype、Harmony parserを固定してからserviceへ入れます。
Windows device / ONNX Runtime Foundry Localは20bのlocal候補です。ONNX Runtime GenAI 0.15系releaseではWindows artifactとgpt-oss model builder/Harmony tool callingの修正が確認できます。GPU/NPU、OS build、package variantごとの対応は個別に確認します。
性能データの見方
本稿の`benchmarkStatus`はnot-measuredです。確認したmetricはpeak-memoryではなくweightが入る容量目安、128K contextという仕様、runtime compatibility、artifact availabilityです。同じmodel、backend、quantization、context、input/output token、batch、warm-up、反復回数を揃えたTTFTやdecode tok/sはありません。
21Bと117Bはtotal parameter、3.6Bと5.1Bは1 tokenあたりのactive parameterです。active parameterは主に計算量の理解に使い、保存するweight容量、KV cache、peak memory、安定性の代わりにはしません。速度を選ぶときは、容量確認の後に自分のruntimeでprefillとdecodeを別々に測ります。
どれを選ぶか
- 16GBで初めて試す:
openai/gpt-oss-20b。最初は短いcontextとbatch 1に限定し、memory余白を確認します。 - Apple Siliconで実装を調べる: 20bとOpenAI Metal reference。production用途ではなく、正しさとbackend差を確認する入口です。
- H100 80GBでserveする: 120bを容量上の候補にできます。20bで満たせる用途なら、120bの運用費と遅延を増やす理由はありません。
- Windows local AIを組む: 20bとFoundry Local/ONNX Runtimeの対応packageを先に確認します。packageの存在を自分のdeviceでの速度保証とは扱いません。
Macのunified memory全般から候補を探す場合はMacのメモリ別ローカルLLM選択、GPUのVRAM単価を比べる場合はローカルLLM向けGPUのVRAM比較も先に確認してください。modelを選んだ後にstructured outputを使う場合はOllama JSON Schemaガイドへ進めます。
試す場合の最短手順
既にOllamaを導入済みの機器だけを対象に、公式model cardが案内する20bから始めます。新しいsoftwareのinstallは本稿の手順に含めません。
ollama pull gpt-oss:20bで20bだけを取得します。ollama run gpt-oss:20bを実行し、短い質問へfinal responseが返ることを確認します。- Activity Monitor、Task Manager、またはruntime logでmemory不足やswap急増がないことを確認してからcontextを伸ばします。
- 起動失敗、強いswap、異常終了があればprocessを止め、modelをunloadします。120bへ進まず、20bのcontextを戻すか、よりmemory余白のある機器へ移します。
Harmony formatを外した独自prompt、128K context、tool calling、長時間serviceは別の検証段階です。最初の一回答が返っても、本番用途の成功とはみなしません。
公開ベンチマークを詳しく見る
同じテーマの比較記事では、測定値がない状態を明示し、weight、KV cache、backendを分けて機器別の適用範囲を確認します。
参考資料
- OpenAI: Introducing gpt-oss(2025年8月5日公開、歴史的発表と公式容量目安)
- OpenAI: gpt-oss model card(2025年8月5日公開、license・提供範囲)
- OpenAI公式gpt-oss repository(2026年7月24日までの現行履歴を確認)
- OpenAI公式20b model repository(2026年8月26日確認)
- OpenAI公式120b model repository(2026年8月26日確認)
- vLLM releases(2026年7月11日の現行releaseを確認)
- ONNX Runtime GenAI releases(2026年8月7日のWindows artifactとgpt-oss修正を確認)


