Google は 2026 年 4 月 2 日、オープンウェイトのフラッグシップ モデル「Gemma 4」を発表しました。
MoE 26B と Dense 31B を含む計 4 サイズで提供され、Apache 2.0 ライセンスでの公開と LMArena 上位ランクという派手な数字が話題を集めています。
一方で、「オープン」と称しながらも実運用では考慮すべき制約があり、ベンチマーク至上主義への懸念を含めた冷静な見方も必要です。
本稿では、Gemma 4 のスペックと一緒に論点も整理します。
発表内容: 4 サイズ展開とベンチマーク数値
Gemma 4 は、Effective 2B(E2B)、Effective 4B(E4B)、26B Mixture of Experts(MoE)、31B Dense の 4 サイズで提供されます。
26B MoE は推論時に総パラメータの一部(およそ 3.8B)のみを活性化させるレイテンシ重視型、31B Dense は素の品質と微調整適性を重視した構成です。
出典: Google blog「Gemma 4: Byte for byte, the most capable open models」
ベンチマークでは、31B Dense モデルが LMArena テキストで推定 1452、26B MoE が約 1441 と報告され、それぞれ Arena AI のオープン モデル ランキングで第 3 位と第 6 位に位置づけられたとされています。MMLU Pro 85.2 パーセント、AIME 2026 で 89.2 パーセント、Codeforces で 2150 という数字も、オープン モデルとしては競争力のある水準です。
出典: Google DeepMind「Gemma 4」
ライセンスは Apache 2.0 が採用され、商用利用に対する月間アクティブ ユーザー上限や追加ポリシー同意が不要とされています。これは、Gemma 1〜3 系の独自ライセンスからの大きな転換点です。
評価軸の偏り: ベンチマーク先行の落とし穴
数字だけ見ると Gemma 4 は十分強力ですが、いくつかの注意点があります。
まず、LMArena は人間の好み投票に依存するため、出力スタイル(冗長さ、丁寧さ、Markdown の整い)に強く影響を受けるという批判が以前から指摘されています。
回答の質そのものより「好まれやすい体裁」を最適化したモデルが過大評価されがちで、ランキング上位だけを根拠に「最強」と語るのは早計かもしれません。
第 2 に、AIME や MMLU Pro のような問題セットは事前学習データへの混入リスクが議論されており、特定タスクでの高得点が、実務での総合的な信頼性を保証するわけではありません。
コーディングやエージェント運用のように、長いコンテキストでの誤り検出や自己訂正が問われる場面では、ベンチマーク値とユーザー体験のギャップが出やすい領域です。
出典: Google blog「Gemma 4: Byte for byte, the most capable open models」
「オープン」の実態と運用上の論点
Gemma シリーズには引き続き Google による「Gemma Prohibited Use Policy」が紐づくと従来から指摘されており、「Apache 2.0 だから完全自由」とするよりは、導入前にライセンス文書とポリシーの両方を確認することが重要です。
性能面でも、26B MoE はアクティブ パラメータが小さい一方、専門家ルーティングの安定性や日本語タスクでの挙動など、汎化が試されるのは運用フェーズです。
Gemma 4 は次世代 Gemini Nano の基盤になるとも案内されており、Google の競争戦略上、オンデバイス AI を Pixel など自社エコシステムへ囲い込む布石にもなります。
オープン モデルとして無償で配布しつつ、最終的に自社プロダクトの差別化要因として回収する構図には、AI コミュニティ全体としてのエコシステムバランスを慎重に見る必要があります。
出典: Google DeepMind「Gemma 4」
まとめ
Gemma 4 は 2026 年 4 月 2 日に発表されたオープンウェイト モデルで、4 サイズ展開と Apache 2.0 ライセンス、LMArena 上位ランクなどの数字面で目を引く存在です。
ベンチマーク中心の評価が抱える限界、付帯ポリシー、運用コストの実態などを踏まえると、「最強」「完全自由」といった単純化は早計と言えるかもしれず、導入を検討する際は、自社タスクでの検証とライセンス精読を必ず通すことをおすすめします。
