Llama 4 Scout・MaverickのH100適性比較

CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針

Llama 4 ScoutとMaverickを、static model revision、109B/400B total、Int4/BF16/FP8、H100 80GB/DGX host、10M/1M context、vLLM/Transformers条件へ固定し、未測定の性能と機器適性を分けます。

context・量子化・licenseを固定し、H100 1枚とhost候補の境界を示す比較図

先に結論

calendarの判断: 画像入力を含むLlama 4を自己ホストする読者は、10M contextのScoutをInt4かつ単一H100で扱う容量候補、1M contextのMaverickを単一H100 hostを準備できる用途だけの候補として選び、Llama 4 Community Licenseも先に確認する。

対象model: meta-llama/Llama-4-Scout-17B-16E-Instruct、meta-llama/Llama-4-Maverick-17B-128E-Instruct
対象機器: NVIDIA H100 80GB / Scout Int4 capacity candidate、NVIDIA H100 host / Maverick deployment candidate、NVIDIA GPU / vLLM serving、NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+

比較できるのはMetaが公表したmodel規模、最大context、artifact precision、H100容量候補と、現行runtimeの対応状態までです。Scout Int4がH100 80GB 1枚へ収まるという記述は10M context時のpeak VRAMや速度を含まず、Maverickの「single H100 DGX host」は単一GPUを意味しません。同条件の性能測定がないため、勝敗は作りません。

確認日: 2026年8月29日(Asia/Tokyo)
検証区分: Meta公式仕様、vLLM現行対応表、Transformers現行documentation/releaseを照合した公開資料の机上調査です。KFB実測、独立測定、現在のruntimeで条件を固定した開発元throughput測定はありません。
比較上の制約: active parameterはtokenごとの計算規模の一部で、全expert weightの保管量ではありません。最大context、weight精度、fit記述からTTFT、decode、quality、peak VRAM、power、priceを推定しません。

比較対象と測定条件

Model revisionはMetaが2025年4月5日に公開したstatic Llama 4 Scout/Maverick Instructです。配布repositoryのmainは取得時に変わり得るため、再現runではfull commit SHAをmanifestへ固定します。

項目ScoutMaverick確認元・不足条件
model/artifactmeta-llama/Llama-4-Scout-17B-16E-Instructmeta-llama/Llama-4-Maverick-17B-128E-InstructMeta公式model card。download時のfull SHA・checksumは未取得
parameter109B total/17B active/16 experts400B total/17B active/128 experts公式仕様。activeだけでmemoryを見積もらない
modalitymultilingual text+image入力、text+code出力同左image understandingはmodel cardの範囲。video inputとは書かない
context最大10M最大1M仕様値。実用時のtoken、KV cache、TTFT、qualityは未測定
dtype/quantizationBF16配布、on-the-fly Int4容量候補BF16配布、FP8 variant容量候補公式fit記述。別community quantizationへ転用しない
runtime/backendvLLM current、Transformers 4.51.0+、SGLang同左exact version、kernel、tensor parallelはrun時固定
hardware/memoryNVIDIA H100 80GB / Scout Int4 capacity candidateNVIDIA H100 host / Maverick deployment candidatesingle GPU対DGX hostの単位を混ぜない
OS/driverLinux/CUDA系を想定するが本文資料でversion未固定同左production判断にはdriver、CUDA、container digestが必要
input/output token初回検証は8K以下入力、短いoutputをKFB方針として提案同左Meta benchmark条件ではなくKFBの安全な検証開始点
prompt/sampling未固定未固定model差のquality比較不可
batch/concurrency/warm-up/反復未固定未固定TTFT・throughput・peak memory比較不可

Meta公式発表はScoutのon-the-fly Int4単一H100、Maverickのsingle H100 DGX hostを示します。Scout公式model cardはexact ID、109B/17B、10M、license、Transformers 4.51.0+を示します。Maverickのexact artifactと400B/1Mは公式Maverick cardで照合しました。

2026年8月26日更新のvLLM current supported-model tableには両IDとLlama4 architecture、text+imageが載っています。2026年8月10日のTransformers 5.15.0 releaseと現行Llama 4 documentationでcurrent runtime側の提供状態を再確認しました。これらは2025年のweightやbenchmarkを更新した証拠ではありません。

ベンチマーク結果

benchmarkStatus: not-measuredです。calendarのofficial sourceはmodel仕様を示しますが、現在のvLLM/Transformers、同じH100構成、同じquantization、同じprompt、同じinput/output tokenでScoutとMaverickを測った表ではありません。

証拠区分ScoutMaverick比較判断
公式仕様:model規模109B total/17B active400B total/17B active保管すべき全weight規模が違う。速度勝敗ではない
公式仕様:context最大10M最大1M上限仕様。最大時の実用性・memory・qualityは不明
公式仕様:H100条件on-the-fly Int4で単一H100 fitFP8でsingle H100 DGX host fit1 GPUとhostを同じ列の容量として比べない
availability/compatibilityvLLM/Transformers current docsに対応同左version・feature・parallelismをrunごとに固定
TTFT/prefill未公表未公表勝敗なし
decode tok/s/ITL未公表未公表勝敗なし
request throughput未公表未公表勝敗なし
peak RAM/VRAM/power未公表未公表fit記述から余裕やpowerを推定しない
同一prompt qualitycurrent Int4条件では未公表current FP8条件では未公表古いBF16表をquantized runtimeへ転用しない

Metaのmodel cardにはBF16で測った開発元quality表がありますが、量子化checkpointとH100機器適性を扱う本稿では使いません。BF16の順位をInt4/FP8の品質、10M/1M context、別runtimeの結果へ拡張できないためです。

機器ごとの適性

機器/memory対象model判断段階向く用途避ける条件
NVIDIA H100 80GB / Scout Int4 capacity candidateScout on-the-fly Int4Metaの容量候補、KFB未起動小さいcontextからimage・long-contextを段階評価10M context、batch増加、quality維持まで保証すると解釈
NVIDIA H100 host / Maverick deployment candidateMaverick FP8を含むhost構成MetaのDGX host候補、GPU数・実peak未固定400B total modelをserver単位で評価H100 80GB 1枚、consumer GPUへ縮小して同じ結論を使う
NVIDIA GPU / vLLM servingScout/Maverick exact IDscurrent support tableありtext+image API、parallel servingの検証latestのまま運用、model対応を性能保証とみなす
NVIDIA GPU / Transformers BF16 with Transformers 4.51.0+Scout/Maverick BF16model cardの最低版とcurrent docsありreference implementation、processorの確認full BF16を1 GPUでload、device_map任せで再現性を失う
128GB以下Mac/consumer PC対象外Meta公式H100条件外小型multimodal modelへ戻るcommunity GGUFを同じrevision・modality・license条件とみなす

機器購入の総費用は高性能ローカルLLMマシン比較、Mac容量候補はメモリ別ローカルLLM一覧、community backendの差はllama.cpp backend比較へ分けます。本稿はMeta公式H100条件の境界だけを扱います。

結果を適用できる範囲

確認済み事実は、両exact model ID、static release、109B/400B total、17B active、16/128 experts、text+image、10M/1M、Llama 4 Community License、MetaのInt4/FP8 fit記述、current vLLM/Transformers対応です。測定者の主張としてMetaはBF16 benchmarkやfitを公表していますが、本稿のcurrent quantized runtime条件と一致しない数値は表に入れていません。

KFBの判断は、H100 80GB 1枚で始めるならScout Int4を容量候補、H100 DGX host級を用意する明確な理由がある場合だけMaverickを候補にし、どちらもlicenseと短context試験を先に通すことです。次には適用しません。

  • 別revision、base model、fine-tune、community GGUF/AWQ/GPTQ/bnb artifact
  • Mac、CPU、consumer GPU、別H100 topology、別driver/CUDA/kernel
  • 10M/1Mを実際に埋めたときのKV cache、peak VRAM、latency、quality
  • image枚数・解像度・vision tokenが異なるworkload
  • 日本語quality、tool calling、structured output、safety、production SLA
  • Scout対Maverickの速度・price・power・総合ranking

原理の補足:active parameterはweight容量ではない

MoEはtokenごとに一部expertを使いますが、self-hostでは全expert weightを保存・配置する必要があります。ScoutとMaverickはいずれも17B activeでもtotalは109Bと400Bです。この差は機器選定に必要ですが、active/totalからdecode速度、quality、peak memory、安定性を導くことはできません。

再測定する方法

将来比較する場合は、Scout Int4とMaverick FP8を別の容量試験として扱い、同じGPU 1枚のrankingを作りません。各runで次を保存します。

  1. exact model ID、full commit SHA、artifact、checksum、license版
  2. vLLM/Transformers/SGLang version、container digest、CUDA、driver、kernel backend
  3. GPU型・枚数・VRAM、host RAM、interconnect、storage、OS
  4. dtype/quantization、context、text token、画像枚数・解像度、output token
  5. chat template、sampling、batch、concurrency、warm-up、反復回数
  6. load成否、TTFT、prefill tokens/s、decode tokens/s、ITL、request throughput、peak VRAM、power、task別quality

同じmodelのBF16対quantized比較はhardwareとpromptを揃え、Scout対Maverickの比較はhost単位と費用まで揃えられる場合だけ別表にします。KFBに保存済み実行logがないため、command outputや成功値は作りません。

モデルと機器を先に選ぶ

候補を先に絞る場合は同じテーマの実用ガイドから確認してください。H100 1枚かhostか、image入力が必要か、license条件を満たすかを決めてからruntime検証へ進みます。

参考資料