Mistral Small 4のartifact機器適性比較

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Mistral Small 4のBF16、NVFP4、EAGLEを、2026年7月15日revision、artifact容量、vLLM・SGLang・NIM、H100/H200/B200条件へ固定し、測定済み範囲と未測定結果を比較します。

artifactと実行条件を固定し、BF16・NVFP4・EAGLEの役割を分ける比較図

先に結論

calendarの判断: Mistral Small 4を試す読者は少量利用ならmistral-small-2603 API、自己ホストは119BのBF16・NVFP4・EAGLE artifactと4x H100/2x H200/1x B200の公式要件を照合してから選ぶ。

対象model: mistralai/Mistral-Small-4-119B-2603、mistralai/Mistral-Small-4-119B-2603-NVFP4、mistralai/Mistral-Small-4-119B-2603-eagle
対象機器: Mistral API mistral-small-2603、4x NVIDIA HGX H100 / vLLM or SGLang、2x NVIDIA HGX H200 / vLLM or SGLang、1x NVIDIA DGX B200 / NVIDIA NIM

BF16はbase比較軸、NVFP4は別quantized checkpoint、EAGLEはbaseへ追加するdraft headです。公式資料から確認できるのはartifact容量、context、runtime、最低GPU構成までで、同一条件のTTFT、decode、throughput、peak VRAM、quality差はありません。性能勝敗は保留します。

確認日: 2026年8月28日(Asia/Tokyo)
検証区分: Mistral公式仕様・公式repositoryとNVIDIA NIM 1.7.0を照合した公開資料の机上調査です。KFB実測、独立測定、条件を固定できる開発元throughput測定はありません。
比較上の制約: repository sizeはweight保管量で、runtime allocation、KV cache、vision encoder、CUDA graph、batch、concurrencyを含みません。active parameterやweight容量から速度・quality・stabilityを推定しません。

比較対象と測定条件

3つのartifactは2026年7月15日の公式commitを現行性の基準にします。再現時は短縮hashではなくfull commit SHAとchecksumを保存します。

項目BF16 baseNVFP4EAGLE確認元・不足条件
model/revisionmistralai/Mistral-Small-4-119B-2603@a11f36bmistralai/Mistral-Small-4-119B-2603-NVFP4@b1a9048mistralai/Mistral-Small-4-119B-2603-eagle@9a8ea22Mistral公式repository、2026年7月15日先頭commit。公開時のfull hashは取得時に保存
artifact119B base、Safetensors shardpost-training activation quantized checkpointbase用draft headEAGLE単体は生成modelではない
dtype/quantizationBF16中心、repository約242GBNVFP4、repository約70.8GBhead約408MBfile容量。実peak VRAMではない
runtime/backendvLLMのFLASH_ATTN_MLA例、SGLang、TransformersvLLMのTRITON_MLA例、対応compressed-tensorsvLLM nightly例、speculative configversion、kernel、driverは取得時に固定
hardwareMistral最低4x H100/2x H200/1x DGX B200quantized kernel対応GPUを別確認baseを起動できる同じGPU群NIM 1.7.0はFP8 profileを別定義
context/tokenmodel仕様256K。公式serve例max-model-len 262144同左draft側例はmax_model_len 65536benchmark input/output token未固定
prompt/samplingreasoning noneまたはhigh、temperatureはmode依存同左baseと同じpromptを使う必要完全benchmark prompt未公表
batch/concurrency/warm-up/反復未固定未固定未固定throughput比較不可

Mistral公式発表は119B total、6B active、256K、最低infrastructureとruntimeを示します。Mistralの現行model比較はAPI ID mistral-small-2603、119B/6.5B active、Apache 2.0、256Kを示します。active parameter表記はembedding/output層を含むかで6Bと6.5Bが異なるため、資料の定義を併記し、片方を誤りと断定しません。

公式model cardはbaseのvLLM serve例でtensor parallel 2、FLASH_ATTN_MLAgpu_memory_utilization 0.8を示し、NVFP4 cardTRITON_MLAを示します。EAGLE cardはbaseに3 speculative tokensのheadを組み合わせる例です。これらは同じhardware上のbenchmark結果ではありません。

ベンチマーク結果

benchmarkStatus: not-measuredです。calendarのofficial sourceから同一hardware、runtime、quantization、prompt、input/output token、batch、concurrency、反復を固定したBF16対NVFP4対EAGLEの表は作れません。Mistralが公表するMistral Small 3比のlatency/throughput主張は、今回の3artifact間比較へ転用しません。

証拠区分BF16NVFP4EAGLE比較判断
公式仕様:repository容量約242GB約70.8GB約408MB保管量の差だけ。peak VRAM、速度、品質ではない
公式仕様:役割base modelquantized base checkpointbaseに追加するdraft head3者は同じ役割ではない
TTFT/prefill未公表未公表未公表勝敗なし
decode tok/s/ITL未公表未公表未公表EAGLEの改善幅も未確定
request throughput未公表未公表未公表concurrency依存のため勝敗なし
peak RAM/VRAM/power未公表未公表未公表repository容量から概算しない
同一prompt quality未公表未公表base outputへ影響し得るが未測定NVFP4とBF16を同等とみなさない

機器ごとの適性

機器/memory対象model判断段階向く用途避ける条件
Mistral API mistral-small-2603managed model公式提供中少量評価、機器購入前offline、固定data residencyが必要
4x NVIDIA HGX H100 / vLLM or SGLangBF16または公式対応precisionMistral公式最低構成、KFB未起動self-host baseline4枚で256K・高concurrencyまで保証すると解釈
2x NVIDIA HGX H200 / vLLM or SGLangBF16/NVFP4候補Mistral公式最低構成、KFB未起動memory余裕を取りやすい検証H100との速度勝敗を仕様から推定
1x NVIDIA DGX B200 / NVIDIA NIMNIM 1.7.0 profilesystem単位の公式候補containerとsupport matrixを固定B200 GPU 1枚と読み替える、ARMで使う
同じcluster+EAGLEbase+draft head実測待ち低concurrency decodeの検証候補throughputも必ず向上すると断定
128GB以下Mac/consumer PC3artifactとも非推奨公式最低構成外より小さいmodelの比較へ戻るactive 6.5Bだけで収容を判断

NVIDIA NIM 1.7.0 support matrixはMistral-Small-4-119B-2603のFP8 profileにH100 4枚、H200 2枚、B200 2枚、compute capability 9.0以上を示します。release noteはARM非対応、専用container、text・image入力の制限を示します。Mistralの1x DGX B200はsystem、NVIDIA表のB200はGPU枚数なので単位を混ぜません。

enterprise GPU全体の費用とworkstation比較は高性能local LLM workstation比較へ分けます。consumer機の候補はMacのmemory別model表LM Studioのmemory別設定が担当し、本稿の119B artifactを推しません。

結果を適用できる範囲

確認済み事実は、model ID、2026年7月15日先頭revision、repository容量、256K context仕様、Apache 2.0、runtime例、MistralとNVIDIAが示すGPU構成です。測定者の主張としてMistralは前世代比のlatency/throughput改善を示しますが、今回必要な条件が揃わないため数値表へ入れていません。KFBの判断は、少量ならAPI、自己ホストならBF16/NVFP4/EAGLEの役割を分け、公式GPU構成を満たしてから測ることです。

この判断は別revision、community GGUF、別NVFP4変換、別EAGLE head、llama.cpp変換、consumer GPU、別contextへ一般化できません。NVFP4の70.8GBがGPU memoryへそのまま収まる、EAGLEの408MB追加だけで高速化できる、256Kを実用速度で処理できるとは結論しません。

再測定する方法

同じ測定主体が次を固定した場合だけ、BF16とNVFP4の比較表を作ります。EAGLEは同じbase、同じconcurrencyでoff/onを一変数として別表にします。

  1. full commit SHA、artifact filename、checksum、license
  2. vLLM/SGLang/NIM version、container digest、CUDA、driver、kernel backend
  3. GPU型・枚数・VRAM、host RAM、interconnect、OS、storage
  4. dtype/quantization、context、input/output token、vision有無、chat template
  5. sampling、reasoning effort、batch、concurrency、warm-up、反復回数
  6. TTFT、prefill tokens/s、decode tokens/s、ITL、request throughput、peak VRAM、power、error率、task別quality

KFBが保存済み実行logを持たないため、この記事にcommand outputや成功値は作りません。

モデルと機器を先に選ぶ

候補を先に絞る場合は同じテーマの実用ガイドから確認してください。APIで用途を確認してから、BF16、NVFP4、EAGLEのどの証拠が必要かを決めます。

参考資料