Mistral Small 4のAPI・GPU選び
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Mistral Small 4のAPI、BF16、NVFP4、EAGLEを、119B、256K context、公式artifact容量、H100/H200/B200要件から選ぶ実用ガイドです。未測定の速度とpeak memoryも分けます。

先に結論
calendarの判断: Mistral Small 4を試す読者は少量利用ならmistral-small-2603 API、自己ホストは119BのBF16・NVFP4・EAGLE artifactと4x H100/2x H200/1x B200の公式要件を照合してから選ぶ。
対象model: mistralai/Mistral-Small-4-119B-2603、mistralai/Mistral-Small-4-119B-2603-NVFP4、mistralai/Mistral-Small-4-119B-2603-eagle
対象機器: Mistral API mistral-small-2603、4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLang、1x NVIDIA DGX B200 / NVIDIA NIM
少量の評価や機器購入前ならAPIから始めます。自己ホストはconsumer PCの119B activeだけを見て決めず、全weight、runtime、GPU構成を確認します。NVFP4は容量を抑える量子化artifact、EAGLEはbase modelと組み合わせる投機的decode用headで、互いの代替ではありません。
確認日: 2026年8月28日(Asia/Tokyo)
検証区分: Mistral公式発表・docs・公式model repository、NVIDIA NIM 1.7.0資料を照合した公開資料の机上調査です。KFBはAPIを呼び出さず、weightをdownloadせず、GPUで起動していません。
数値の読み方: 242GB、70.8GB、408MBはrepository表示のartifact容量で、実peak RAM/VRAMではありません。TTFT、prefill、decode tok/s、throughput、power、長context品質は未測定です。
今回比較するモデル
Mistral Small 4は119B total、tokenごとに6.5B active、256K context、text・image入力/text出力のApache 2.0 modelです。Mistralの公式発表は推論runtimeとしてvLLM、llama.cpp、SGLang、Transformersを挙げ、最低infrastructureを4x H100、2x H200、または1x DGX B200としています。公式model比較ではAPI ID mistral-small-2603、256K context、Apache 2.0、119B/6.5B activeを確認できます。
| model/variant | parameter・artifact | quantization/容量 | 対応runtime | license/費用 | 向く用途 | 避ける条件 |
|---|---|---|---|---|---|---|
mistral-small-2603 API | managed Mistral Small 4 | provider管理 | Mistral Chat API | usage-based。実行前に現行価格・地域を確認 | 少量評価、機器購入前、運用を任せたい | data residency、固定latency、offlineが必須 |
mistralai/Mistral-Small-4-119B-2603 | 119B total/6.5B active、約242GB repository | BF16を中心とするbase artifact | vLLM推奨、SGLang、Transformers等 | Apache 2.0、weight無償。GPU・運用費は別 | full artifactを固定した自己ホスト | active 6.5Bだけでconsumer機へ収まると考える |
mistralai/Mistral-Small-4-119B-2603-NVFP4 | baseからのpost-training activation quantized版、約70.8GB | NVFP4 | vLLM推奨、対応kernel必須 | Apache 2.0、compute費用は別 | weight容量を抑えたBlackwell系検証 | BF16と同じ品質・runtime・GPUだと仮定する |
mistralai/Mistral-Small-4-119B-2603-eagle | base用draft head、約408MB | standalone modelではない | vLLM nightly記載、baseと組み合わせ | Apache 2.0、base GPUが別途必要 | 低concurrencyのdecode改善を測る検証 | head単体で動く、memory要件が消えると考える |
現行性は、3つのMistral公式repository(NVFP4、EAGLE)と各commit履歴の2026年7月15日更新で再確認しました。取得時はmainの短縮hashではなくfull commit SHA、全shard、checksumを保存します。
機器ごとの適性
| model/variant | 必要memoryの根拠 | 向く機器 | 向く用途 | 判断段階 |
|---|---|---|---|---|
API mistral-small-2603 | local weight不要 | Mistral API mistral-small-2603 | 少量のprompt・vision・tool利用確認 | 公式提供中、地域・費用は実行前確認 |
| BF16 base | repository約242GB+KV cache・runtime | 4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLang | full precisionに近い自己ホスト基準 | Mistral公式最低構成、KFB未起動 |
| NVFP4 | repository約70.8GB+runtime overhead | Blackwell系を含む対応GPU。NIMは別profile確認 | 容量を抑えた自己ホスト候補 | 公式artifactあり、実peak・品質未測定 |
| BF16/FP8 NIM profile | NVIDIA support matrixはFP8でH100 4枚、H200 2枚、B200 2枚を例示 | 1x NVIDIA DGX B200 / NVIDIA NIM | containerで条件を固定する | NIM 1.7.0対応。DGX B200は1基のsystemで、B200 GPU 1枚の意味ではない |
| EAGLE+base | base model全体+約408MB head+draft用buffer | baseを起動できるvLLM環境 | speculative decodeを別試験する | 公式headあり、改善幅未測定 |
NVIDIA NIM 1.7.0 support matrixはMistral-Small-4-119B-2603をcompute capability 9.0以上、FP8の例としてH100 4枚、H200 2枚、B200 2枚とします。release noteは専用1.7.0-variant、ARM非対応、text・image入力だけという制限を示します。Mistral発表の「1x DGX B200」は1台のDGX systemであり、単一B200 GPUと読み替えません。
32〜128GBのMacやconsumer workstationを検討している場合、まずMacのmemory別local model表またはLM Studioのmemory別設定へ戻り、より小さいmodelを選びます。119Bのactive parameterだけを根拠にMacへ推しません。enterprise機器の費用と保守は高性能local LLM workstation比較と役割を分け、本稿ではMistral Small 4の公式要件だけを扱います。
性能データの見方
本稿のbenchmarkStatusはnot-measuredです。公式発表にはMistral Small 3比のcompletion timeやrequest throughputの主張がありますが、記事の選択表に必要なartifact、GPU、runtime version、context、input/output token、batch、concurrency、warm-up、反復が完全には固定できません。したがって速度勝敗や増減率へ使いません。
確認できるのはweight repository容量、256K context仕様、runtime対応、API提供、最低GPU構成です。次は未測定です。
- BF16対NVFP4の同一prompt品質、TTFT、prefill、decode tok/s、peak VRAM
- EAGLEのacceptance、追加memory、低/高concurrencyでの効果
- H100/H200/B200間の同一条件throughput、power、総費用
- 256K利用時のKV cache、vision入力、長時間安定性
どれを選ぶか
| 読者の条件 | 最初の選択 | 理由 | 次へ進む条件 |
|---|---|---|---|
| 少量の評価、GPU未購入 | API mistral-small-2603 | local artifactと運用を抱えずmodel適性を確認できる | 地域、費用、data policyを確認し用途が固まる |
| H100/H200 clusterがあり基準を作る | BF16 base | full artifactを比較の基準にできる | 242GB+runtime/KV cacheの余裕を見積もる |
| 対応GPUで容量を抑える | NVFP4 | 公式quantized artifactがある | kernel対応と同一prompt品質をBF16と別測定 |
| baseのdecode待ちを減らしたい | EAGLEを追加 | draft headをbaseと組み合わせられる | acceptance、latency、throughput、追加memoryを測定 |
| 128GB以下のMac/一般PC | 別の小型model | 公式最低構成とartifact容量から外れる | smaller modelで用途を満たせない根拠を得る |
試す場合の最短手順
- Mistralのmodel一覧で
mistral-small-2603の提供、地域、価格、contextを確認します。 - API consoleで短いtext promptを1件だけ送り、model ID、入力/出力token、終了理由を保存します。画像、tool、256K contextは別試験に分けます。
- 用途を満たす場合だけ、自己ホスト候補のfull commit SHA、artifact総容量、GPU、runtime、driverを表にします。download前に必要storageと契約費用を確認します。
- 自己ホスト検証は短いcontext、batch 1、concurrency 1から始め、load完了、peak memory、最初の出力を記録します。OOM、kernel error、崩れた出力が出たらprocessを停止し、base/NVFP4/EAGLEを混ぜず元のenvironmentへ戻します。
KFBはこの手順を実行しておらず、成功logを掲載しません。
公開ベンチマークを詳しく見る
同じテーマの比較記事では、BF16、NVFP4、EAGLE、NIMをartifact・backend・GPU条件へ分け、測定されていない結果を空欄のまま残します。
参考資料
- Mistral:Mistral Small 4公式発表(2026年3月16日。初回発表と最低infrastructureの歴史的根拠)
- Mistral Docs:Mistral Small 4 model比較(API ID、context、license、parameterの現行表)
- Mistral公式BF16 repository(2026年7月15日先頭revision)
- Mistral公式NVFP4 repository(2026年7月15日先頭revision)
- Mistral公式EAGLE repository(2026年7月15日先頭revision)
- NVIDIA NIM 1.7.0 support matrix(2026年8月確認)


