Mistral Small 4のartifact機器適性比較
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Mistral Small 4のBF16、NVFP4、EAGLEを、2026年7月15日revision、artifact容量、vLLM・SGLang・NIM、H100/H200/B200条件へ固定し、測定済み範囲と未測定結果を比較します。

先に結論
calendarの判断: Mistral Small 4を試す読者は少量利用ならmistral-small-2603 API、自己ホストは119BのBF16・NVFP4・EAGLE artifactと4x H100/2x H200/1x B200の公式要件を照合してから選ぶ。
対象model: mistralai/Mistral-Small-4-119B-2603、mistralai/Mistral-Small-4-119B-2603-NVFP4、mistralai/Mistral-Small-4-119B-2603-eagle
対象機器: Mistral API mistral-small-2603、4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLang、1x NVIDIA DGX B200 / NVIDIA NIM
BF16はbase比較軸、NVFP4は別quantized checkpoint、EAGLEはbaseへ追加するdraft headです。公式資料から確認できるのはartifact容量、context、runtime、最低GPU構成までで、同一条件のTTFT、decode、throughput、peak VRAM、quality差はありません。性能勝敗は保留します。
確認日: 2026年8月28日(Asia/Tokyo)
検証区分: Mistral公式仕様・公式repositoryとNVIDIA NIM 1.7.0を照合した公開資料の机上調査です。KFB実測、独立測定、条件を固定できる開発元throughput測定はありません。
比較上の制約: repository sizeはweight保管量で、runtime allocation、KV cache、vision encoder、CUDA graph、batch、concurrencyを含みません。active parameterやweight容量から速度・quality・stabilityを推定しません。
比較対象と測定条件
3つのartifactは2026年7月15日の公式commitを現行性の基準にします。再現時は短縮hashではなくfull commit SHAとchecksumを保存します。
| 項目 | BF16 base | NVFP4 | EAGLE | 確認元・不足条件 |
|---|---|---|---|---|
| model/revision | mistralai/Mistral-Small-4-119B-2603@a11f36b | mistralai/Mistral-Small-4-119B-2603-NVFP4@b1a9048 | mistralai/Mistral-Small-4-119B-2603-eagle@9a8ea22 | Mistral公式repository、2026年7月15日先頭commit。公開時のfull hashは取得時に保存 |
| artifact | 119B base、Safetensors shard | post-training activation quantized checkpoint | base用draft head | EAGLE単体は生成modelではない |
| dtype/quantization | BF16中心、repository約242GB | NVFP4、repository約70.8GB | head約408MB | file容量。実peak VRAMではない |
| runtime/backend | vLLMのFLASH_ATTN_MLA例、SGLang、Transformers | vLLMのTRITON_MLA例、対応compressed-tensors | vLLM nightly例、speculative config | version、kernel、driverは取得時に固定 |
| hardware | Mistral最低4x H100/2x H200/1x DGX B200 | quantized kernel対応GPUを別確認 | baseを起動できる同じGPU群 | NIM 1.7.0はFP8 profileを別定義 |
| context/token | model仕様256K。公式serve例max-model-len 262144 | 同左 | draft側例はmax_model_len 65536 | benchmark input/output token未固定 |
| prompt/sampling | reasoning noneまたはhigh、temperatureはmode依存 | 同左 | baseと同じpromptを使う必要 | 完全benchmark prompt未公表 |
| batch/concurrency/warm-up/反復 | 未固定 | 未固定 | 未固定 | throughput比較不可 |
Mistral公式発表は119B total、6B active、256K、最低infrastructureとruntimeを示します。Mistralの現行model比較はAPI ID mistral-small-2603、119B/6.5B active、Apache 2.0、256Kを示します。active parameter表記はembedding/output層を含むかで6Bと6.5Bが異なるため、資料の定義を併記し、片方を誤りと断定しません。
公式model cardはbaseのvLLM serve例でtensor parallel 2、FLASH_ATTN_MLA、gpu_memory_utilization 0.8を示し、NVFP4 cardはTRITON_MLAを示します。EAGLE cardはbaseに3 speculative tokensのheadを組み合わせる例です。これらは同じhardware上のbenchmark結果ではありません。
ベンチマーク結果
benchmarkStatus: not-measuredです。calendarのofficial sourceから同一hardware、runtime、quantization、prompt、input/output token、batch、concurrency、反復を固定したBF16対NVFP4対EAGLEの表は作れません。Mistralが公表するMistral Small 3比のlatency/throughput主張は、今回の3artifact間比較へ転用しません。
| 証拠区分 | BF16 | NVFP4 | EAGLE | 比較判断 |
|---|---|---|---|---|
| 公式仕様:repository容量 | 約242GB | 約70.8GB | 約408MB | 保管量の差だけ。peak VRAM、速度、品質ではない |
| 公式仕様:役割 | base model | quantized base checkpoint | baseに追加するdraft head | 3者は同じ役割ではない |
| TTFT/prefill | 未公表 | 未公表 | 未公表 | 勝敗なし |
| decode tok/s/ITL | 未公表 | 未公表 | 未公表 | EAGLEの改善幅も未確定 |
| request throughput | 未公表 | 未公表 | 未公表 | concurrency依存のため勝敗なし |
| peak RAM/VRAM/power | 未公表 | 未公表 | 未公表 | repository容量から概算しない |
| 同一prompt quality | 未公表 | 未公表 | base outputへ影響し得るが未測定 | NVFP4とBF16を同等とみなさない |
機器ごとの適性
| 機器/memory | 対象model | 判断段階 | 向く用途 | 避ける条件 |
|---|---|---|---|---|
| Mistral API mistral-small-2603 | managed model | 公式提供中 | 少量評価、機器購入前 | offline、固定data residencyが必要 |
| 4x NVIDIA HGX H100 / vLLM or SGLang | BF16または公式対応precision | Mistral公式最低構成、KFB未起動 | self-host baseline | 4枚で256K・高concurrencyまで保証すると解釈 |
| 2x NVIDIA HGX H200 / vLLM or SGLang | BF16/NVFP4候補 | Mistral公式最低構成、KFB未起動 | memory余裕を取りやすい検証 | H100との速度勝敗を仕様から推定 |
| 1x NVIDIA DGX B200 / NVIDIA NIM | NIM 1.7.0 profile | system単位の公式候補 | containerとsupport matrixを固定 | B200 GPU 1枚と読み替える、ARMで使う |
| 同じcluster+EAGLE | base+draft head | 実測待ち | 低concurrency decodeの検証候補 | throughputも必ず向上すると断定 |
| 128GB以下Mac/consumer PC | 3artifactとも非推奨 | 公式最低構成外 | より小さいmodelの比較へ戻る | active 6.5Bだけで収容を判断 |
NVIDIA NIM 1.7.0 support matrixはMistral-Small-4-119B-2603のFP8 profileにH100 4枚、H200 2枚、B200 2枚、compute capability 9.0以上を示します。release noteはARM非対応、専用container、text・image入力の制限を示します。Mistralの1x DGX B200はsystem、NVIDIA表のB200はGPU枚数なので単位を混ぜません。
enterprise GPU全体の費用とworkstation比較は高性能local LLM workstation比較へ分けます。consumer機の候補はMacのmemory別model表とLM Studioのmemory別設定が担当し、本稿の119B artifactを推しません。
結果を適用できる範囲
確認済み事実は、model ID、2026年7月15日先頭revision、repository容量、256K context仕様、Apache 2.0、runtime例、MistralとNVIDIAが示すGPU構成です。測定者の主張としてMistralは前世代比のlatency/throughput改善を示しますが、今回必要な条件が揃わないため数値表へ入れていません。KFBの判断は、少量ならAPI、自己ホストならBF16/NVFP4/EAGLEの役割を分け、公式GPU構成を満たしてから測ることです。
この判断は別revision、community GGUF、別NVFP4変換、別EAGLE head、llama.cpp変換、consumer GPU、別contextへ一般化できません。NVFP4の70.8GBがGPU memoryへそのまま収まる、EAGLEの408MB追加だけで高速化できる、256Kを実用速度で処理できるとは結論しません。
再測定する方法
同じ測定主体が次を固定した場合だけ、BF16とNVFP4の比較表を作ります。EAGLEは同じbase、同じconcurrencyでoff/onを一変数として別表にします。
- full commit SHA、artifact filename、checksum、license
- vLLM/SGLang/NIM version、container digest、CUDA、driver、kernel backend
- GPU型・枚数・VRAM、host RAM、interconnect、OS、storage
- dtype/quantization、context、input/output token、vision有無、chat template
- sampling、reasoning effort、batch、concurrency、warm-up、反復回数
- TTFT、prefill tokens/s、decode tokens/s、ITL、request throughput、peak VRAM、power、error率、task別quality
KFBが保存済み実行logを持たないため、この記事にcommand outputや成功値は作りません。
モデルと機器を先に選ぶ
候補を先に絞る場合は同じテーマの実用ガイドから確認してください。APIで用途を確認してから、BF16、NVFP4、EAGLEのどの証拠が必要かを決めます。
参考資料
- Mistral:Mistral Small 4公式発表(2026年3月16日。初回発表と最低infrastructureの歴史的根拠)
- Mistral Docs:Mistral Small 4 model比較(現行API ID、context、license、parameter)
- Mistral公式BF16 repositoryとcommit履歴(2026年7月15日先頭revision)
- Mistral公式NVFP4 repositoryとcommit履歴(2026年7月15日先頭revision)
- Mistral公式EAGLE repositoryとcommit履歴(2026年7月15日先頭revision)
- NVIDIA NIM 1.7.0 support matrix(Mistral Small 4の現行profile)
- NVIDIA NIM 1.7.0 release note(制限と提供状態)


