Mistral Small 4のAPI・GPU選び

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Mistral Small 4のAPI、BF16、NVFP4、EAGLEを、119B、256K context、公式artifact容量、H100/H200/B200要件から選ぶ実用ガイドです。未測定の速度とpeak memoryも分けます。

少量利用はAPI、自己ホストは119Bと公式GPU要件の照合へ分ける選択図

先に結論

calendarの判断: Mistral Small 4を試す読者は少量利用ならmistral-small-2603 API、自己ホストは119BのBF16・NVFP4・EAGLE artifactと4x H100/2x H200/1x B200の公式要件を照合してから選ぶ。

対象model: mistralai/Mistral-Small-4-119B-2603、mistralai/Mistral-Small-4-119B-2603-NVFP4、mistralai/Mistral-Small-4-119B-2603-eagle
対象機器: Mistral API mistral-small-2603、4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLang、1x NVIDIA DGX B200 / NVIDIA NIM

少量の評価や機器購入前ならAPIから始めます。自己ホストはconsumer PCの119B activeだけを見て決めず、全weight、runtime、GPU構成を確認します。NVFP4は容量を抑える量子化artifact、EAGLEはbase modelと組み合わせる投機的decode用headで、互いの代替ではありません。

確認日: 2026年8月28日(Asia/Tokyo)
検証区分: Mistral公式発表・docs・公式model repository、NVIDIA NIM 1.7.0資料を照合した公開資料の机上調査です。KFBはAPIを呼び出さず、weightをdownloadせず、GPUで起動していません。
数値の読み方: 242GB、70.8GB、408MBはrepository表示のartifact容量で、実peak RAM/VRAMではありません。TTFT、prefill、decode tok/s、throughput、power、長context品質は未測定です。

今回比較するモデル

Mistral Small 4は119B total、tokenごとに6.5B active、256K context、text・image入力/text出力のApache 2.0 modelです。Mistralの公式発表は推論runtimeとしてvLLM、llama.cpp、SGLang、Transformersを挙げ、最低infrastructureを4x H100、2x H200、または1x DGX B200としています。公式model比較ではAPI ID mistral-small-2603、256K context、Apache 2.0、119B/6.5B activeを確認できます。

model/variantparameter・artifactquantization/容量対応runtimelicense/費用向く用途避ける条件
mistral-small-2603 APImanaged Mistral Small 4provider管理Mistral Chat APIusage-based。実行前に現行価格・地域を確認少量評価、機器購入前、運用を任せたいdata residency、固定latency、offlineが必須
mistralai/Mistral-Small-4-119B-2603119B total/6.5B active、約242GB repositoryBF16を中心とするbase artifactvLLM推奨、SGLang、Transformers等Apache 2.0、weight無償。GPU・運用費は別full artifactを固定した自己ホストactive 6.5Bだけでconsumer機へ収まると考える
mistralai/Mistral-Small-4-119B-2603-NVFP4baseからのpost-training activation quantized版、約70.8GBNVFP4vLLM推奨、対応kernel必須Apache 2.0、compute費用は別weight容量を抑えたBlackwell系検証BF16と同じ品質・runtime・GPUだと仮定する
mistralai/Mistral-Small-4-119B-2603-eaglebase用draft head、約408MBstandalone modelではないvLLM nightly記載、baseと組み合わせApache 2.0、base GPUが別途必要低concurrencyのdecode改善を測る検証head単体で動く、memory要件が消えると考える

現行性は、3つのMistral公式repositoryNVFP4EAGLE)と各commit履歴の2026年7月15日更新で再確認しました。取得時はmainの短縮hashではなくfull commit SHA、全shard、checksumを保存します。

機器ごとの適性

model/variant必要memoryの根拠向く機器向く用途判断段階
API mistral-small-2603local weight不要Mistral API mistral-small-2603少量のprompt・vision・tool利用確認公式提供中、地域・費用は実行前確認
BF16 baserepository約242GB+KV cache・runtime4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLangfull precisionに近い自己ホスト基準Mistral公式最低構成、KFB未起動
NVFP4repository約70.8GB+runtime overheadBlackwell系を含む対応GPU。NIMは別profile確認容量を抑えた自己ホスト候補公式artifactあり、実peak・品質未測定
BF16/FP8 NIM profileNVIDIA support matrixはFP8でH100 4枚、H200 2枚、B200 2枚を例示1x NVIDIA DGX B200 / NVIDIA NIMcontainerで条件を固定するNIM 1.7.0対応。DGX B200は1基のsystemで、B200 GPU 1枚の意味ではない
EAGLE+basebase model全体+約408MB head+draft用bufferbaseを起動できるvLLM環境speculative decodeを別試験する公式headあり、改善幅未測定

NVIDIA NIM 1.7.0 support matrixはMistral-Small-4-119B-2603をcompute capability 9.0以上、FP8の例としてH100 4枚、H200 2枚、B200 2枚とします。release noteは専用1.7.0-variant、ARM非対応、text・image入力だけという制限を示します。Mistral発表の「1x DGX B200」は1台のDGX systemであり、単一B200 GPUと読み替えません。

32〜128GBのMacやconsumer workstationを検討している場合、まずMacのmemory別local model表またはLM Studioのmemory別設定へ戻り、より小さいmodelを選びます。119Bのactive parameterだけを根拠にMacへ推しません。enterprise機器の費用と保守は高性能local LLM workstation比較と役割を分け、本稿ではMistral Small 4の公式要件だけを扱います。

性能データの見方

本稿のbenchmarkStatusnot-measuredです。公式発表にはMistral Small 3比のcompletion timeやrequest throughputの主張がありますが、記事の選択表に必要なartifact、GPU、runtime version、context、input/output token、batch、concurrency、warm-up、反復が完全には固定できません。したがって速度勝敗や増減率へ使いません。

確認できるのはweight repository容量、256K context仕様、runtime対応、API提供、最低GPU構成です。次は未測定です。

  • BF16対NVFP4の同一prompt品質、TTFT、prefill、decode tok/s、peak VRAM
  • EAGLEのacceptance、追加memory、低/高concurrencyでの効果
  • H100/H200/B200間の同一条件throughput、power、総費用
  • 256K利用時のKV cache、vision入力、長時間安定性

どれを選ぶか

読者の条件最初の選択理由次へ進む条件
少量の評価、GPU未購入API mistral-small-2603local artifactと運用を抱えずmodel適性を確認できる地域、費用、data policyを確認し用途が固まる
H100/H200 clusterがあり基準を作るBF16 basefull artifactを比較の基準にできる242GB+runtime/KV cacheの余裕を見積もる
対応GPUで容量を抑えるNVFP4公式quantized artifactがあるkernel対応と同一prompt品質をBF16と別測定
baseのdecode待ちを減らしたいEAGLEを追加draft headをbaseと組み合わせられるacceptance、latency、throughput、追加memoryを測定
128GB以下のMac/一般PC別の小型model公式最低構成とartifact容量から外れるsmaller modelで用途を満たせない根拠を得る

試す場合の最短手順

  1. Mistralのmodel一覧でmistral-small-2603の提供、地域、価格、contextを確認します。
  2. API consoleで短いtext promptを1件だけ送り、model ID、入力/出力token、終了理由を保存します。画像、tool、256K contextは別試験に分けます。
  3. 用途を満たす場合だけ、自己ホスト候補のfull commit SHA、artifact総容量、GPU、runtime、driverを表にします。download前に必要storageと契約費用を確認します。
  4. 自己ホスト検証は短いcontext、batch 1、concurrency 1から始め、load完了、peak memory、最初の出力を記録します。OOM、kernel error、崩れた出力が出たらprocessを停止し、base/NVFP4/EAGLEを混ぜず元のenvironmentへ戻します。

KFBはこの手順を実行しておらず、成功logを掲載しません。

公開ベンチマークを詳しく見る

同じテーマの比較記事では、BF16、NVFP4、EAGLE、NIMをartifact・backend・GPU条件へ分け、測定されていない結果を空欄のまま残します。

参考資料