Llama 4 Scout・MaverickのH100選び

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Llama 4 ScoutとMaverickを、正確なmodel ID、109B/400B total、10M/1M context、Int4/BF16/FP8、H100構成、画像入力、Community Licenseから選ぶ実用ガイドです。

画像用途からScoutとMaverickを分け、H100条件とlicense確認へ進む選択図

先に結論

calendarの判断: 画像入力を含むLlama 4を自己ホストする読者は、10M contextのScoutをInt4かつ単一H100で扱う容量候補、1M contextのMaverickを単一H100 hostを準備できる用途だけの候補として選び、Llama 4 Community Licenseも先に確認する。

対象model: meta-llama/Llama-4-Scout-17B-16E-Instruct、meta-llama/Llama-4-Maverick-17B-128E-Instruct
対象機器: NVIDIA H100 80GB / Scout Int4 capacity candidate、NVIDIA H100 host / Maverick deployment candidate、NVIDIA GPU / vLLM serving、NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+

個人PCから始めるmodelではありません。ScoutはMetaがon-the-fly Int4で単一H100へ収まるとする入口、MaverickはFP8を含むH100 DGX host級の入口です。「17B active」だけを見て17B dense model相当のweight容量と考えず、全expert weight、vision encoder、KV cache、runtime bufferを含むhost計画から選びます。

確認日: 2026年8月29日(Asia/Tokyo)
検証区分: Meta公式発表・model card・license、Meta公式repository、vLLM現行対応表、Transformers現行documentation/releaseを照合した公開資料の机上調査です。KFBはweightをdownloadせず、H100で起動・推論していません。
数値の読み方: 109B/400B、17B active、10M/1Mは公式仕様です。単一H100/H100 hostはMetaの指定quantizationに結び付く容量上の主張で、任意contextのpeak VRAM、TTFT、decode tok/s、quality、安定性の測定ではありません。

今回比較するモデル

MetaのLlama 4公式発表Scout公式model cardは、Scoutを17B active/109B total/16 experts/10M context、Maverickを17B active/400B total/128 experts/1M contextとしています。両方ともmultilingual textとimageを入力し、textとcodeを出力するstatic modelで、releaseは2025年4月5日です。初回発表は3か月source windowより古いため、現在のruntime対応日は別資料で確認しました。

model/variantparameter・contextquantization/必要memoryの根拠対応runtimelicense/費用向く用途避ける条件
meta-llama/Llama-4-Scout-17B-16E-Instruct109B total/17B active、10M最大contextBF16 weight。Metaはon-the-fly Int4なら単一H100にfitと説明Transformers 4.51.0+、現行vLLM、SGLangLlama 4 Community License。weight利用料とは別にH100・storage・運用費image理解と長contextを段階検証するserver80GBで10M contextまで保証されると解釈、consumer GPU、Macでの公式host条件外運用
meta-llama/Llama-4-Maverick-17B-128E-Instruct400B total/17B active、1M最大contextBF16とFP8。MetaはFP8が単一H100 DGX hostにfitと説明Transformers 4.51.0+、現行vLLM、SGLang同license。大規模host・storage費が必要より大きいmultimodal modelをH100 hostで評価「単一host」をH100 80GB 1枚と読む、17B activeだけで収容判断

Metaの公式repository READMEはfull BF16のLlama 4 inferenceに少なくとも4 GPUを必要とする例を示します。Hugging Face repositoryはgatedで、licenseへの同意とaccess承認が必要です。mainは固定revisionではないため、取得時はexact model ID、full commit SHA、artifact名、checksum、license版を保存します。

現行性は2026年8月26日更新のvLLM Supported Modelsで両exact ID、text+image、Llama4 architectureの対応を、2026年8月10日のTransformers 5.15.0 releaseと現行Llama 4 documentationで実装が残ることを再確認しました。これはmodel weightのrevision更新を意味せず、runtimeの現行対応を示す証拠です。

機器ごとの適性

model/variant必要memoryの根拠向く機器向く用途判断段階
Scout Int4Metaのon-the-fly Int4単一H100記述。KV cache・vision・runtime overheadは別NVIDIA H100 80GB / Scout Int4 capacity candidate短いtextからimage、contextを段階的に伸ばす容量上の候補、KFB未起動
Maverick FP8Metaの「single H100 DGX host」記述NVIDIA H100 host / Maverick deployment candidate400B totalのmultimodal servingをhost単位で評価host候補、GPU枚数・実peak未確認
Scout/Maverickcurrent supported model tableNVIDIA GPU / vLLM servingOpenAI-compatible serving、text+imageの検証runtime対応表あり、versionとfeature制限を固定
Scout/Maverick BF16model cardの4.51.0+とMeta repoのmulti-GPU例NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+reference実装、processorとmodelの挙動確認multi-GPU容量候補、KFB未起動

H100をまだ持っていない場合、高性能ローカルLLMマシン比較で完成品・GPU単体・総費用を先に比較します。Macやconsumer機の容量候補はMacのメモリ別model一覧へ戻してください。Llama 4のcommunity GGUFや別backendはllama.cpp backend比較の役割ですが、本稿のMeta公式Int4/FP8条件と同一視しません。

性能データの見方

本稿のbenchmarkStatusnot-measuredです。Metaの古いmodel cardにはBF16 quality表がありますが、calendarの目的は現在のH100・runtime・quantization適性です。Int4/FP8、vLLM/Transformers、H100 80GB/H100 host、短い入力/10M・1M contextを同一条件で比較する公開測定がないため、quality rankingや速度差へ転用しません。

確認できる仕様はpeak-memory、context-length、compatibility、availabilityです。ただしpeak-memoryは実測値がなく、Metaのfit記述までです。次は未測定です。

  • Int4 Scoutのquality、TTFT、prefill、decode tok/s、peak VRAM、power
  • Maverick BF16/FP8の同一prompt qualityとH100 host内のGPU枚数別性能
  • 10M/1M context時のKV cache、vision token、OOM、latency、長文品質
  • vLLMとTransformersの同一artifact・同一GPU比較、price/request

どれを選ぶか

読者の条件最初の選択理由次へ進む条件
H100 80GB 1枚でLlama 4を試すScout Int4Metaが単一H100容量候補として明記exact Int4経路を確認し、8K以下・batch 1で起動する
H100 DGX hostを用意できるMaverick FP8400B totalをhost単位で扱う公式候補GPU topology、artifact、runtime、storageを固定する
text+image server APIが必要vLLM両exact IDが現行multimodal対応表にある使用versionでprocessor・LoRA・parallelism制限を確認する
reference Python実装を読むTransformersmodel cardが4.51.0+を指定し現行docsにも実装があるfull BF16はmulti-GPU容量とdownload時間を先に見積もる
128GB以下のMac/consumer PCより小さいmodelMeta公式host条件から外れ、重量とKV cacheの余裕がないcommunity変換を別revision・別記事として検証する

試す場合の最短手順

  1. Llama 4 Community LicenseとAcceptable Use Policyを読み、商用利用、再配布、月間active user条件、表示義務が用途に合うか確認します。
  2. ScoutまたはMaverickの一方だけを選び、full commit SHA、artifact、dtype/quantization、必要storage、H100構成、runtime versionをmanifestへ固定します。
  3. 隔離したcontainerで公式model card/runtime documentationの手順を使い、最初はtext 1件、8K以下、batch 1、concurrency 1、短いoutputでloadと生成を確認します。imageは次の別runにします。
  4. 成功確認は、意図したmodel revisionがloadされ、1件の応答が返り、GPU OOMやprocessor errorがないことです。ここでは速度やquality合格とはしません。
  5. 失敗時はprocessを停止し、作成したcontainerと未採用artifactを隔離し、固定していた旧runtimeへ戻します。context、quantization、GPU数を同時に変えません。

KFBはこの手順を実行しておらず、成功logや推論結果を掲載しません。

公開ベンチマークを詳しく見る

同じテーマの比較記事では、model ID、dtype、host、context、runtimeを表で固定し、未公表のTTFT、decode、peak memoryを空欄のままにして適用範囲を整理します。

参考資料