gpt-oss 20bと120bの機器別選び方

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

gpt-oss-20bと120bを、16GB memory、Apple Silicon、H100 80GB、Windowsで選ぶガイドです。MXFP4の公式容量目安、128K context、現行runtime、未測定範囲を分けて判断できます。

16GBなら20bを入口にし、80GB GPUで理由がある場合だけ120bへ進む選択図

先に結論

calendarの判断: 16GBからローカル推論を始める読者はMXFP4のgpt-oss-20bを容量上の候補とし、gpt-oss-120bは80GB GPUを確保でき、より大きいモデルを扱う理由がある場合だけ選ぶ。

対象model: openai/gpt-oss-20b、openai/gpt-oss-120b
対象機器: 16GB system memory / local MXFP4 capacity candidate、Apple Silicon Mac / OpenAI Metal reference implementation、NVIDIA H100 80GB / vLLM or compatible provider、Windows device / ONNX Runtime Foundry Local

個人が最初にdownloadするならgpt-oss-20bです。OpenAIの16GB/80GBはMXFP4 weightを収める目安であり、OS、runtime、KV cache、128K context、batchの追加memoryを含むpeak RAM/VRAMの保証ではありません。120bは「active parameterが5.1Bだから小さい」と考えず、117B全weightを保持できる機器から選びます。

確認日: 2026年8月26日(Asia/Tokyo)
検証区分: OpenAI公式仕様、公式model repository、OpenAI reference implementation、vLLM・ONNX Runtimeの公式releaseを照合した机上調査です。KFBはmodelをdownloadせず、実機起動・速度・peak memoryを測定していません。
数値の読み方: parameter、context、MXFP4の容量目安は公式仕様です。TTFT、prefill、decode tok/s、消費電力、価格は比較可能な同条件測定がないため採用していません。

今回比較するモデル

両modelは2025年8月5日に公開されたtext-onlyのopen-weight reasoning modelです。初回発表日は歴史的事実として扱い、現在のruntime対応は2026年7〜8月のrepositoryとreleaseで再確認しました。Apache 2.0で提供され、Harmony response format、128K context、low/medium/highのreasoning effortを使います。

model IDtotal/active parameter配布weightcontextlicense・費用対応runtimeの確認範囲向く用途避ける条件
openai/gpt-oss-20b21B/3.6Bnative MXFP4128KApache 2.0、weight自体は無償Transformers、vLLM、Ollama、OpenAI Metal reference、ONNX Runtime系localでtool useやstructured outputを試す入口16GBで128K contextや並列実行まで保証されると考える場合
openai/gpt-oss-120b117B/5.1Bnative MXFP4128KApache 2.0、運用機器・電力・provider費用は別vLLM、compatible provider、OpenAI Triton/Metal reference等80GB GPUを確保し、大きいmodelを使う理由があるserver用途active parameterだけでweight容量を見積もる場合

OpenAIの初回発表は20bを16GB、120bを単一80GB GPUで動かせると説明します。公式model cardはApache 2.0、text-only、tool use、reasoningなどの提供範囲を示します。これらは「そのmemoryなら常に快適」「128K contextでも収まる」というbenchmarkではありません。

機器ごとの適性

model/variant必要memoryの根拠向く機器向く用途判断段階
openai/gpt-oss-20b MXFP4OpenAIが16GB内のweight fitを案内。OS・KV cache・runtime overheadは別16GB system memory小さいcontextで最初の応答を確認容量上の候補
openai/gpt-oss-20b Metal変換official repositoryがApple Silicon用reference実装を提供Apple Silicon MacMetal referenceとPyTorch結果の整合確認reference実装あり、production-readyではない
openai/gpt-oss-120b MXFP4OpenAIが単一80GB GPUを案内NVIDIA H100 80GBvLLM等で単一modelをserveする事前検証容量上の候補
openai/gpt-oss-20b ONNX packageONNX Runtime GenAI 0.15系がWindows artifactとgpt-oss修正を継続Windows deviceFoundry Local/ONNX系の対応packageを固定した検証runtime対応候補

16GB system memory / local MXFP4 capacity candidateでは、まず短いcontext、batch 1、他の大きなprocessを止めた状態で20bを候補にします。16GBちょうどの機器は余白が小さいため、起動できても長い会話やtool resultでmemory不足になる可能性があります。

Apple Silicon Mac / OpenAI Metal reference implementationは学習・照合用です。OpenAIのgpt-oss repositoryはMetal実装を「production-readyではない」と明記しています。Macだから無条件にこのbackendを選ばず、日常利用はOllamaや対応appを含めて更新状況を確認します。

NVIDIA H100 80GB / vLLM or compatible providerは120bのweight容量を満たす入口です。vLLMの現行releaseでruntime自体の変更が続いているため、model ID、container、driver、dtype、Harmony parserを固定してからserviceへ入れます。

Windows device / ONNX Runtime Foundry Localは20bのlocal候補です。ONNX Runtime GenAI 0.15系releaseではWindows artifactとgpt-oss model builder/Harmony tool callingの修正が確認できます。GPU/NPU、OS build、package variantごとの対応は個別に確認します。

性能データの見方

本稿の`benchmarkStatus`はnot-measuredです。確認したmetricはpeak-memoryではなくweightが入る容量目安、128K contextという仕様、runtime compatibility、artifact availabilityです。同じmodel、backend、quantization、context、input/output token、batch、warm-up、反復回数を揃えたTTFTやdecode tok/sはありません。

21Bと117Bはtotal parameter、3.6Bと5.1Bは1 tokenあたりのactive parameterです。active parameterは主に計算量の理解に使い、保存するweight容量、KV cache、peak memory、安定性の代わりにはしません。速度を選ぶときは、容量確認の後に自分のruntimeでprefillとdecodeを別々に測ります。

どれを選ぶか

  • 16GBで初めて試す: openai/gpt-oss-20b。最初は短いcontextとbatch 1に限定し、memory余白を確認します。
  • Apple Siliconで実装を調べる: 20bとOpenAI Metal reference。production用途ではなく、正しさとbackend差を確認する入口です。
  • H100 80GBでserveする: 120bを容量上の候補にできます。20bで満たせる用途なら、120bの運用費と遅延を増やす理由はありません。
  • Windows local AIを組む: 20bとFoundry Local/ONNX Runtimeの対応packageを先に確認します。packageの存在を自分のdeviceでの速度保証とは扱いません。

Macのunified memory全般から候補を探す場合はMacのメモリ別ローカルLLM選択、GPUのVRAM単価を比べる場合はローカルLLM向けGPUのVRAM比較も先に確認してください。modelを選んだ後にstructured outputを使う場合はOllama JSON Schemaガイドへ進めます。

試す場合の最短手順

既にOllamaを導入済みの機器だけを対象に、公式model cardが案内する20bから始めます。新しいsoftwareのinstallは本稿の手順に含めません。

  1. ollama pull gpt-oss:20bで20bだけを取得します。
  2. ollama run gpt-oss:20bを実行し、短い質問へfinal responseが返ることを確認します。
  3. Activity Monitor、Task Manager、またはruntime logでmemory不足やswap急増がないことを確認してからcontextを伸ばします。
  4. 起動失敗、強いswap、異常終了があればprocessを止め、modelをunloadします。120bへ進まず、20bのcontextを戻すか、よりmemory余白のある機器へ移します。

Harmony formatを外した独自prompt、128K context、tool calling、長時間serviceは別の検証段階です。最初の一回答が返っても、本番用途の成功とはみなしません。

公開ベンチマークを詳しく見る

同じテーマの比較記事では、測定値がない状態を明示し、weight、KV cache、backendを分けて機器別の適用範囲を確認します。

参考資料