Gemma 3n E2BとE4Bの端末別選び方
CHATGPT / AIChatGPTなどの生成AIを活用して運営・記事制作・更新を行っています。制作方針
Gemma 3n E2B ITとE4B ITを、2GB/3GBの公式memory目安、32K context、画像・音声入力、Google公表品質から選ぶガイドです。速度未測定の範囲も分けて判断できます。

先に結論
calendarの判断: オフラインのテキスト・画像・音声入力を小型端末で扱う読者は、2GB級のE2Bを速度優先の候補、3GB級のE4Bを品質優先の候補として、Google公表の同一表の測定条件に限り選ぶ。
対象model: google/gemma-3n-E2B-it、google/gemma-3n-E4B-it
対象機器: mobile device with 2GB free model memory / Google AI Edge、mobile device with 3GB free model memory / Google AI Edge、laptop 16GB RAM / llama.cpp, MLX, or Ollama
空きmemoryが小さい端末ではE2B ITから始め、同じGoogle表で公表された品質を優先するならE4B ITを候補にします。ただし2GB/3GBは端末全体の必要RAMではなく、Googleが示したmodel memory footprintの下限目安です。またE2BがE4Bより速いという同一端末測定は今回の根拠にないため、「速度優先」は小さいvariantから測り始める選択順を意味します。
確認日: 2026年8月27日(Asia/Tokyo)
検証区分: Google公式model cardの開発元測定、Google公式developer guide、現行Gemma実行ガイド、LiteRT-LM資料を照合した公開結果の机上調査です。KFBはmodelをdownloadせず、端末での速度・peak memory・品質を測定していません。
数値の読み方: benchmark値はfull precisionで評価されたPT/IT、metric、n-shotを固定して読みます。2GB/3GBはmemory目安、32Kは総input context仕様であり、実機の速度や端末全体のpeak RAMではありません。
今回比較するモデル
Gemma 3nはtext、image、video、audioを入力し、textを出力するGoogleのopen-weight familyです。実用対象はinstruction-tunedのlaunch versionであるgoogle/gemma-3n-E2B-itとgoogle/gemma-3n-E4B-itです。再現時はmainのまま取得せず、取得時のfull commit SHA、artifact名、checksumを保存します。
| model/variant | total/effective parameter | 公式memory目安 | 入出力・context | quantization/runtime | license・費用 | 向く用途 | 避ける条件 |
|---|---|---|---|---|---|---|---|
google/gemma-3n-E2B-it launch version | 5B total/E2B | as little as 2GB | text・image・video・audio入力、text出力、総input 32K | Google AI Edge/LiteRT-LM、Transformers、llama.cpp、MLX、Ollama。artifactごとにdtypeを確認 | Gemma Terms、weight利用は条件への同意が必要。機器・運用費は別 | 空きmemoryを抑えてmultimodalを最初に試す | 2GBを端末全RAM、速度保証、長いaudio保証とみなす場合 |
google/gemma-3n-E4B-it launch version | 8B total/E4B | as little as 3GB | 同上 | 同上 | 同上 | 同じ公開表で品質側を優先する | 3GBだけでOS、encoder、KV cacheまで収まるとみなす場合 |
GoogleのGemma 3n model cardは、両modelがfull precisionで評価され、ITとPT、metric、n-shotを表で分けています。Googleのdeveloper guideは5B/8B total、2GB/3GBのmemory footprint、対応runtime、multimodal提供範囲を示します。どちらも手元のスマートフォンやMacでのdecode tok/sを示す資料ではありません。
現行性は、2026年7月2日更新のGemma実行ガイドがLiteRT-LM、llama.cpp、MLX、Ollama、Transformersを案内し、2026年8月12日更新のLiteRT-LM公式ページがAndroid、iOS、Web、desktopとvision/audio対応を示すことで再確認しました。Gemma Terms、model repositoryのgate、runtimeごとのartifactは取得直前にも確認が必要です。
機器ごとの適性
| model/variant | 必要memoryの根拠 | 向く機器 | 向く用途 | 判断段階 |
|---|---|---|---|---|
| E2B IT | Googleの「as little as 2GB」。OS・encoder・KV cacheは別 | mobile device with 2GB free model memory / Google AI Edge | 短いtextから画像・音声へ段階的に試す | 公式容量上の第一候補、実peak未測定 |
| E4B IT | Googleの「as little as 3GB」。OS・encoder・KV cacheは別 | mobile device with 3GB free model memory / Google AI Edge | 同一Google表のqualityを優先する | 公式容量上の品質側候補、実peak未測定 |
| E2B/E4Bの対応artifact | runtime別変換artifactの実file sizeと空きRAMを別確認 | laptop 16GB RAM / llama.cpp, MLX, or Ollama | localでtext中心に候補を比較 | 容量候補。multimodal対応と速度はruntime別検証 |
mobile device with 2GB free model memory / Google AI EdgeではE2Bを選びますが、2GBちょうどの端末全体で動くとは解釈しません。OS、app、vision/audio encoder、KV cache、入力データ、runtime bufferの余白を確保します。
mobile device with 3GB free model memory / Google AI Edgeでは、Google公表品質を優先する場合にE4Bを候補にできます。E4Bは多くの公表taskでE2Bを上回りますが、全taskで勝つわけではなく、端末上の速度・電力・温度は未測定です。
laptop 16GB RAM / llama.cpp, MLX, or Ollamaは両modelの検証余地があります。ただしGoogle本体のSafetensors、community GGUF、MLX変換、Ollama manifestは別artifactです。元modelのID、変換元revision、quantization、runtime versionを記録せずに結果を比較しません。
性能データの見方
本稿のbenchmarkStatusはsource-reportedです。Google model cardの同じ表から、instruction-tuned同士で比較できる例だけを抜き出します。
| 開発元測定 | metric・n-shot | E2B IT | E4B IT | 読み方 |
|---|---|---|---|---|
| MGSM | Accuracy、0-shot | 53.1 | 60.7 | multilingual数学の同一設定。日本語実利用品質の保証ではない |
| MMLU | Accuracy、0-shot | 60.1 | 64.9 | 知識taskの一例。会話全体のrankingではない |
| HumanEval | pass@1、0-shot | 66.5 | 75.0 | code生成task。端末速度とは無関係 |
| GPQA Diamond | RelaxedAccuracy/accuracy、0-shot | 24.8 | 23.7 | E2Bが上回る例もあり、E4Bの全task勝利ではない |
これらはGoogleによるfull-precision評価で、KFB実測や独立測定ではありません。quantized mobile artifact、Google AI Edge、llama.cpp、MLX、Ollamaの品質差へそのまま移せません。TTFT、prefill、decode tok/s、inter-token latency、request throughput、peak RAM、power、価格は同条件データがないため比較しません。
どれを選ぶか
- 空きmemoryが最優先: E2B IT。短いtextで起動し、画像、音声、contextを一つずつ追加します。
- Google表のqualityを優先: E4B IT。MGSM、MMLU、HumanEvalなどの条件が自分の用途に近いかを確認します。
- 音声や動画を使う: どちらでもmodel familyは対応しますが、runtime artifactが同じmodalityを実装しているか確認します。launch時のaudio clip条件を長時間streamingへ一般化しません。
- 16GB laptopで試す: まずE2Bの対応artifactで成功条件を作り、同じruntime・quantization class・promptでE4Bへ進みます。
Mac全体のmemoryから別modelも含めて候補を探す場合はMacのメモリ別ローカルLLM一覧、GUIの余白設定はLM Studioのメモリ別設定、backend差を理解する場合はllama.cpp backend比較を参照してください。これらはGemma 3n E2B/E4BのGoogle品質表とは別の検索意図です。
試す場合の最短手順
新しいsoftwareを入れず、既にGoogle AI Edge Galleryまたは対応runtimeがある端末だけを対象にします。
- Gemma Termsと、表示されたartifactが
google/gemma-3n-E2B-it由来かを確認します。 - E2Bの短いtext promptを1件だけ実行し、応答が完了すること、appが異常終了しないこと、端末memoryに余白があることを確認します。
- 必要な場合だけ画像1枚、短い音声、長いtextの順に入力を追加します。一度に複数条件を変えません。
- E4Bへ進む場合は、同じpromptとruntime設定で別artifactとして取得し、出力内容と待ち時間、memoryを記録します。
- 強いswap、発熱、異常終了、出力破損が出たらE4Bを外し、E2Bの短いtext条件へ戻します。modelを削除する前に取得元とrevisionを記録します。
成功は「最初の応答が返り、memory不足やcrashがない」までです。32K input、長いaudio、動画、連続運転、offline性、品質、速度は個別の合格条件にします。
公開ベンチマークを詳しく見る
同じテーマの比較記事では、PT/IT、n-shot、quality、2GB/3GB目安、32K contextを分け、測定結果を適用できる機器範囲を監査します。
参考資料
- Google:Gemma 3n model card(2025年6月17日更新。歴史的な開発元benchmarkと32K仕様)
- Google Developers Blog:Gemma 3n developer guide(2025年6月26日。2GB/3GB目安と初回runtime対応)
- Google公式repository:Gemma 3n E2B IT(2026年8月27日提供状態を確認)
- Google公式repository:Gemma 3n E4B IT(2026年8月27日提供状態を確認)
- Google:Gemma実行ガイド(2026年7月2日更新。現行framework案内)
- Google:LiteRT-LM(2026年8月12日更新。現行device・multimodal対応)


