Llama 4 Scout・MaverickのH100選び
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Llama 4 ScoutとMaverickを、正確なmodel ID、109B/400B total、10M/1M context、Int4/BF16/FP8、H100構成、画像入力、Community Licenseから選ぶ実用ガイドです。

先に結論
calendarの判断: 画像入力を含むLlama 4を自己ホストする読者は、10M contextのScoutをInt4かつ単一H100で扱う容量候補、1M contextのMaverickを単一H100 hostを準備できる用途だけの候補として選び、Llama 4 Community Licenseも先に確認する。
対象model: meta-llama/Llama-4-Scout-17B-16E-Instruct、meta-llama/Llama-4-Maverick-17B-128E-Instruct
対象機器: NVIDIA H100 80GB / Scout Int4 capacity candidate、NVIDIA H100 host / Maverick deployment candidate、NVIDIA GPU / vLLM serving、NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+
個人PCから始めるmodelではありません。ScoutはMetaがon-the-fly Int4で単一H100へ収まるとする入口、MaverickはFP8を含むH100 DGX host級の入口です。「17B active」だけを見て17B dense model相当のweight容量と考えず、全expert weight、vision encoder、KV cache、runtime bufferを含むhost計画から選びます。
確認日: 2026年8月29日(Asia/Tokyo)
検証区分: Meta公式発表・model card・license、Meta公式repository、vLLM現行対応表、Transformers現行documentation/releaseを照合した公開資料の机上調査です。KFBはweightをdownloadせず、H100で起動・推論していません。
数値の読み方: 109B/400B、17B active、10M/1Mは公式仕様です。単一H100/H100 hostはMetaの指定quantizationに結び付く容量上の主張で、任意contextのpeak VRAM、TTFT、decode tok/s、quality、安定性の測定ではありません。
今回比較するモデル
MetaのLlama 4公式発表とScout公式model cardは、Scoutを17B active/109B total/16 experts/10M context、Maverickを17B active/400B total/128 experts/1M contextとしています。両方ともmultilingual textとimageを入力し、textとcodeを出力するstatic modelで、releaseは2025年4月5日です。初回発表は3か月source windowより古いため、現在のruntime対応日は別資料で確認しました。
| model/variant | parameter・context | quantization/必要memoryの根拠 | 対応runtime | license/費用 | 向く用途 | 避ける条件 |
|---|---|---|---|---|---|---|
meta-llama/Llama-4-Scout-17B-16E-Instruct | 109B total/17B active、10M最大context | BF16 weight。Metaはon-the-fly Int4なら単一H100にfitと説明 | Transformers 4.51.0+、現行vLLM、SGLang | Llama 4 Community License。weight利用料とは別にH100・storage・運用費 | image理解と長contextを段階検証するserver | 80GBで10M contextまで保証されると解釈、consumer GPU、Macでの公式host条件外運用 |
meta-llama/Llama-4-Maverick-17B-128E-Instruct | 400B total/17B active、1M最大context | BF16とFP8。MetaはFP8が単一H100 DGX hostにfitと説明 | Transformers 4.51.0+、現行vLLM、SGLang | 同license。大規模host・storage費が必要 | より大きいmultimodal modelをH100 hostで評価 | 「単一host」をH100 80GB 1枚と読む、17B activeだけで収容判断 |
Metaの公式repository READMEはfull BF16のLlama 4 inferenceに少なくとも4 GPUを必要とする例を示します。Hugging Face repositoryはgatedで、licenseへの同意とaccess承認が必要です。mainは固定revisionではないため、取得時はexact model ID、full commit SHA、artifact名、checksum、license版を保存します。
現行性は2026年8月26日更新のvLLM Supported Modelsで両exact ID、text+image、Llama4 architectureの対応を、2026年8月10日のTransformers 5.15.0 releaseと現行Llama 4 documentationで実装が残ることを再確認しました。これはmodel weightのrevision更新を意味せず、runtimeの現行対応を示す証拠です。
機器ごとの適性
| model/variant | 必要memoryの根拠 | 向く機器 | 向く用途 | 判断段階 |
|---|---|---|---|---|
| Scout Int4 | Metaのon-the-fly Int4単一H100記述。KV cache・vision・runtime overheadは別 | NVIDIA H100 80GB / Scout Int4 capacity candidate | 短いtextからimage、contextを段階的に伸ばす | 容量上の候補、KFB未起動 |
| Maverick FP8 | Metaの「single H100 DGX host」記述 | NVIDIA H100 host / Maverick deployment candidate | 400B totalのmultimodal servingをhost単位で評価 | host候補、GPU枚数・実peak未確認 |
| Scout/Maverick | current supported model table | NVIDIA GPU / vLLM serving | OpenAI-compatible serving、text+imageの検証 | runtime対応表あり、versionとfeature制限を固定 |
| Scout/Maverick BF16 | model cardの4.51.0+とMeta repoのmulti-GPU例 | NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+ | reference実装、processorとmodelの挙動確認 | multi-GPU容量候補、KFB未起動 |
H100をまだ持っていない場合、高性能ローカルLLMマシン比較で完成品・GPU単体・総費用を先に比較します。Macやconsumer機の容量候補はMacのメモリ別model一覧へ戻してください。Llama 4のcommunity GGUFや別backendはllama.cpp backend比較の役割ですが、本稿のMeta公式Int4/FP8条件と同一視しません。
性能データの見方
本稿のbenchmarkStatusはnot-measuredです。Metaの古いmodel cardにはBF16 quality表がありますが、calendarの目的は現在のH100・runtime・quantization適性です。Int4/FP8、vLLM/Transformers、H100 80GB/H100 host、短い入力/10M・1M contextを同一条件で比較する公開測定がないため、quality rankingや速度差へ転用しません。
確認できる仕様はpeak-memory、context-length、compatibility、availabilityです。ただしpeak-memoryは実測値がなく、Metaのfit記述までです。次は未測定です。
- Int4 Scoutのquality、TTFT、prefill、decode tok/s、peak VRAM、power
- Maverick BF16/FP8の同一prompt qualityとH100 host内のGPU枚数別性能
- 10M/1M context時のKV cache、vision token、OOM、latency、長文品質
- vLLMとTransformersの同一artifact・同一GPU比較、price/request
どれを選ぶか
| 読者の条件 | 最初の選択 | 理由 | 次へ進む条件 |
|---|---|---|---|
| H100 80GB 1枚でLlama 4を試す | Scout Int4 | Metaが単一H100容量候補として明記 | exact Int4経路を確認し、8K以下・batch 1で起動する |
| H100 DGX hostを用意できる | Maverick FP8 | 400B totalをhost単位で扱う公式候補 | GPU topology、artifact、runtime、storageを固定する |
| text+image server APIが必要 | vLLM | 両exact IDが現行multimodal対応表にある | 使用versionでprocessor・LoRA・parallelism制限を確認する |
| reference Python実装を読む | Transformers | model cardが4.51.0+を指定し現行docsにも実装がある | full BF16はmulti-GPU容量とdownload時間を先に見積もる |
| 128GB以下のMac/consumer PC | より小さいmodel | Meta公式host条件から外れ、重量とKV cacheの余裕がない | community変換を別revision・別記事として検証する |
試す場合の最短手順
- Llama 4 Community LicenseとAcceptable Use Policyを読み、商用利用、再配布、月間active user条件、表示義務が用途に合うか確認します。
- ScoutまたはMaverickの一方だけを選び、full commit SHA、artifact、dtype/quantization、必要storage、H100構成、runtime versionをmanifestへ固定します。
- 隔離したcontainerで公式model card/runtime documentationの手順を使い、最初はtext 1件、8K以下、batch 1、concurrency 1、短いoutputでloadと生成を確認します。imageは次の別runにします。
- 成功確認は、意図したmodel revisionがloadされ、1件の応答が返り、GPU OOMやprocessor errorがないことです。ここでは速度やquality合格とはしません。
- 失敗時はprocessを停止し、作成したcontainerと未採用artifactを隔離し、固定していた旧runtimeへ戻します。context、quantization、GPU数を同時に変えません。
KFBはこの手順を実行しておらず、成功logや推論結果を掲載しません。
公開ベンチマークを詳しく見る
同じテーマの比較記事では、model ID、dtype、host、context、runtimeを表で固定し、未公表のTTFT、decode、peak memoryを空欄のままにして適用範囲を整理します。
参考資料
- Meta:Llama 4公式発表(2025年4月5日。model・H100条件の歴史的な一次情報)
- Meta公式Scout model card(static model仕様、license、Transformers 4.51.0+)
- Meta公式Maverick model card(400B total、1M、BF16 artifact)
- Meta公式llama-models repository(download、full BF16 multi-GPU例)
- vLLM Supported Models(2026年8月26日更新。両exact IDの現行対応)
- Transformers Llama 4 documentation(現行実装とlong-context注意)
- Transformers releases(2026年8月10日v5.15.0で現行releaseを確認)


