Llama 4 Scout・MaverickのH100適性比較
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Llama 4 ScoutとMaverickを、static model revision、109B/400B total、Int4/BF16/FP8、H100 80GB/DGX host、10M/1M context、vLLM/Transformers条件へ固定し、未測定の性能と機器適性を分けます。

先に結論
calendarの判断: 画像入力を含むLlama 4を自己ホストする読者は、10M contextのScoutをInt4かつ単一H100で扱う容量候補、1M contextのMaverickを単一H100 hostを準備できる用途だけの候補として選び、Llama 4 Community Licenseも先に確認する。
対象model: meta-llama/Llama-4-Scout-17B-16E-Instruct、meta-llama/Llama-4-Maverick-17B-128E-Instruct
対象機器: NVIDIA H100 80GB / Scout Int4 capacity candidate、NVIDIA H100 host / Maverick deployment candidate、NVIDIA GPU / vLLM serving、NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+
比較できるのはMetaが公表したmodel規模、最大context、artifact precision、H100容量候補と、現行runtimeの対応状態までです。Scout Int4がH100 80GB 1枚へ収まるという記述は10M context時のpeak VRAMや速度を含まず、Maverickの「single H100 DGX host」は単一GPUを意味しません。同条件の性能測定がないため、勝敗は作りません。
確認日: 2026年8月29日(Asia/Tokyo)
検証区分: Meta公式仕様、vLLM現行対応表、Transformers現行documentation/releaseを照合した公開資料の机上調査です。KFB実測、独立測定、現在のruntimeで条件を固定した開発元throughput測定はありません。
比較上の制約: active parameterはtokenごとの計算規模の一部で、全expert weightの保管量ではありません。最大context、weight精度、fit記述からTTFT、decode、quality、peak VRAM、power、priceを推定しません。
比較対象と測定条件
Model revisionはMetaが2025年4月5日に公開したstatic Llama 4 Scout/Maverick Instructです。配布repositoryのmainは取得時に変わり得るため、再現runではfull commit SHAをmanifestへ固定します。
| 項目 | Scout | Maverick | 確認元・不足条件 |
|---|---|---|---|
| model/artifact | meta-llama/Llama-4-Scout-17B-16E-Instruct | meta-llama/Llama-4-Maverick-17B-128E-Instruct | Meta公式model card。download時のfull SHA・checksumは未取得 |
| parameter | 109B total/17B active/16 experts | 400B total/17B active/128 experts | 公式仕様。activeだけでmemoryを見積もらない |
| modality | multilingual text+image入力、text+code出力 | 同左 | image understandingはmodel cardの範囲。video inputとは書かない |
| context | 最大10M | 最大1M | 仕様値。実用時のtoken、KV cache、TTFT、qualityは未測定 |
| dtype/quantization | BF16配布、on-the-fly Int4容量候補 | BF16配布、FP8 variant容量候補 | 公式fit記述。別community quantizationへ転用しない |
| runtime/backend | vLLM current、Transformers 4.51.0+、SGLang | 同左 | exact version、kernel、tensor parallelはrun時固定 |
| hardware/memory | NVIDIA H100 80GB / Scout Int4 capacity candidate | NVIDIA H100 host / Maverick deployment candidate | single GPU対DGX hostの単位を混ぜない |
| OS/driver | Linux/CUDA系を想定するが本文資料でversion未固定 | 同左 | production判断にはdriver、CUDA、container digestが必要 |
| input/output token | 初回検証は8K以下入力、短いoutputをKFB方針として提案 | 同左 | Meta benchmark条件ではなくKFBの安全な検証開始点 |
| prompt/sampling | 未固定 | 未固定 | model差のquality比較不可 |
| batch/concurrency/warm-up/反復 | 未固定 | 未固定 | TTFT・throughput・peak memory比較不可 |
Meta公式発表はScoutのon-the-fly Int4単一H100、Maverickのsingle H100 DGX hostを示します。Scout公式model cardはexact ID、109B/17B、10M、license、Transformers 4.51.0+を示します。Maverickのexact artifactと400B/1Mは公式Maverick cardで照合しました。
2026年8月26日更新のvLLM current supported-model tableには両IDとLlama4 architecture、text+imageが載っています。2026年8月10日のTransformers 5.15.0 releaseと現行Llama 4 documentationでcurrent runtime側の提供状態を再確認しました。これらは2025年のweightやbenchmarkを更新した証拠ではありません。
ベンチマーク結果
benchmarkStatus: not-measuredです。calendarのofficial sourceはmodel仕様を示しますが、現在のvLLM/Transformers、同じH100構成、同じquantization、同じprompt、同じinput/output tokenでScoutとMaverickを測った表ではありません。
| 証拠区分 | Scout | Maverick | 比較判断 |
|---|---|---|---|
| 公式仕様:model規模 | 109B total/17B active | 400B total/17B active | 保管すべき全weight規模が違う。速度勝敗ではない |
| 公式仕様:context | 最大10M | 最大1M | 上限仕様。最大時の実用性・memory・qualityは不明 |
| 公式仕様:H100条件 | on-the-fly Int4で単一H100 fit | FP8でsingle H100 DGX host fit | 1 GPUとhostを同じ列の容量として比べない |
| availability/compatibility | vLLM/Transformers current docsに対応 | 同左 | version・feature・parallelismをrunごとに固定 |
| TTFT/prefill | 未公表 | 未公表 | 勝敗なし |
| decode tok/s/ITL | 未公表 | 未公表 | 勝敗なし |
| request throughput | 未公表 | 未公表 | 勝敗なし |
| peak RAM/VRAM/power | 未公表 | 未公表 | fit記述から余裕やpowerを推定しない |
| 同一prompt quality | current Int4条件では未公表 | current FP8条件では未公表 | 古いBF16表をquantized runtimeへ転用しない |
Metaのmodel cardにはBF16で測った開発元quality表がありますが、量子化checkpointとH100機器適性を扱う本稿では使いません。BF16の順位をInt4/FP8の品質、10M/1M context、別runtimeの結果へ拡張できないためです。
機器ごとの適性
| 機器/memory | 対象model | 判断段階 | 向く用途 | 避ける条件 |
|---|---|---|---|---|
| NVIDIA H100 80GB / Scout Int4 capacity candidate | Scout on-the-fly Int4 | Metaの容量候補、KFB未起動 | 小さいcontextからimage・long-contextを段階評価 | 10M context、batch増加、quality維持まで保証すると解釈 |
| NVIDIA H100 host / Maverick deployment candidate | Maverick FP8を含むhost構成 | MetaのDGX host候補、GPU数・実peak未固定 | 400B total modelをserver単位で評価 | H100 80GB 1枚、consumer GPUへ縮小して同じ結論を使う |
| NVIDIA GPU / vLLM serving | Scout/Maverick exact IDs | current support tableあり | text+image API、parallel servingの検証 | latestのまま運用、model対応を性能保証とみなす |
| NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+ | Scout/Maverick BF16 | model cardの最低版とcurrent docsあり | reference implementation、processorの確認 | full BF16を1 GPUでload、device_map任せで再現性を失う |
| 128GB以下Mac/consumer PC | 対象外 | Meta公式H100条件外 | 小型multimodal modelへ戻る | community GGUFを同じrevision・modality・license条件とみなす |
機器購入の総費用は高性能ローカルLLMマシン比較、Mac容量候補はメモリ別ローカルLLM一覧、community backendの差はllama.cpp backend比較へ分けます。本稿はMeta公式H100条件の境界だけを扱います。
結果を適用できる範囲
確認済み事実は、両exact model ID、static release、109B/400B total、17B active、16/128 experts、text+image、10M/1M、Llama 4 Community License、MetaのInt4/FP8 fit記述、current vLLM/Transformers対応です。測定者の主張としてMetaはBF16 benchmarkやfitを公表していますが、本稿のcurrent quantized runtime条件と一致しない数値は表に入れていません。
KFBの判断は、H100 80GB 1枚で始めるならScout Int4を容量候補、H100 DGX host級を用意する明確な理由がある場合だけMaverickを候補にし、どちらもlicenseと短context試験を先に通すことです。次には適用しません。
- 別revision、base model、fine-tune、community GGUF/AWQ/GPTQ/bnb artifact
- Mac、CPU、consumer GPU、別H100 topology、別driver/CUDA/kernel
- 10M/1Mを実際に埋めたときのKV cache、peak VRAM、latency、quality
- image枚数・解像度・vision tokenが異なるworkload
- 日本語quality、tool calling、structured output、safety、production SLA
- Scout対Maverickの速度・price・power・総合ranking
原理の補足:active parameterはweight容量ではない
MoEはtokenごとに一部expertを使いますが、self-hostでは全expert weightを保存・配置する必要があります。ScoutとMaverickはいずれも17B activeでもtotalは109Bと400Bです。この差は機器選定に必要ですが、active/totalからdecode速度、quality、peak memory、安定性を導くことはできません。
再測定する方法
将来比較する場合は、Scout Int4とMaverick FP8を別の容量試験として扱い、同じGPU 1枚のrankingを作りません。各runで次を保存します。
- exact model ID、full commit SHA、artifact、checksum、license版
- vLLM/Transformers/SGLang version、container digest、CUDA、driver、kernel backend
- GPU型・枚数・VRAM、host RAM、interconnect、storage、OS
- dtype/quantization、context、text token、画像枚数・解像度、output token
- chat template、sampling、batch、concurrency、warm-up、反復回数
- load成否、TTFT、prefill tokens/s、decode tokens/s、ITL、request throughput、peak VRAM、power、task別quality
同じmodelのBF16対quantized比較はhardwareとpromptを揃え、Scout対Maverickの比較はhost単位と費用まで揃えられる場合だけ別表にします。KFBに保存済み実行logがないため、command outputや成功値は作りません。
モデルと機器を先に選ぶ
候補を先に絞る場合は同じテーマの実用ガイドから確認してください。H100 1枚かhostか、image入力が必要か、license条件を満たすかを決めてからruntime検証へ進みます。
参考資料
- Meta:Llama 4公式発表(2025年4月5日。H100条件とmodel差の歴史的な一次情報)
- Meta公式Scout model card(109B/17B、10M、license、Transformers最低版)
- Meta公式Maverick model card(400B/17B、1M、BF16 artifact)
- Meta公式llama-models repository(full BF16 multi-GPU例とdownload手順)
- vLLM Supported Models(2026年8月26日更新。current Llama 4 multimodal対応)
- Transformers Llama 4 documentation(current implementationとlong-context設定)
- Transformers releases(2026年8月10日v5.15.0 releaseを確認)


