Googleが、生成メディア向けの新モデル2種を開発者に向けて同時公開しました[1]。1つは画像生成モデル「Nano Banana 2 Lite」で、Nano Bananaファミリーの中で最も高速かつ低コストをうたいます。もう1つは動画生成と会話形式の編集に対応する「Gemini Omni Flash」で、Google I/Oでの発表を経て今回はじめて開発者が使えるようになりました。いずれもGoogle AI Studio、Gemini API、Gemini Enterprise Agent Platformから利用でき、画像づくりから動画化までを一気通貫で組み立てられる構成です。

画像と動画、2つの新モデルを同時公開

今回の発表で示されたのは、生成メディアづくりの「速さ」と「反復のしやすさ」を底上げする2モデルです[1]。Nano Banana 2 Liteは、高スループットと低コストを重視した画像生成モデルで、公開と同時にGoogle AI Studio、Gemini API、Gemini Enterprise Agent Platformで利用できます。あわせて、検索の「AI Mode」やGeminiアプリなど、消費者向けのGoogle製サービスにも順次展開されます。

もう一方のGemini Omni Flashは、動画の生成と会話による編集を担うモデルです。Google I/Oで披露されていたものが、今回はじめてGemini APIとGoogle AI Studio経由で開発者に開放されました。Googleは、画像の高速生成と動画の作成・編集をつなぐことで、最初から最後まで一貫したマルチメディア体験を組み立てられる点を強調しています。数千枚規模の画像生成でも、複数回のやり取りを重ねる動画編集でも、用途に応じて2つのモデルを使い分けられる狙いです。

Nano Banana 2 Lite — 高速・低コストを突き詰めた画像モデル

Nano Banana 2 Lite(モデル名は gemini-3.1-flash-lite-image)は、速度とコストが最優先となる場面に向けて設計されています[1]。Googleは、初代Nano Banana(gemini-2.5-flash-image)を使っている開発者の置き換え先として本モデルを推奨しており、差し替えるだけで主要な性能指標で恩恵を受けられるとしています。

性能面の特徴は2点です。1つはレイテンシーの低さで、テキストからの画像生成を4秒で返します。試作やラフ案づくりを素早く回したい用途に向く速さです。もう1つはコスト効率で、1,000枚あたり0.034ドル(約5円)で生成できます。ドラフトの量産や運用予算を抑えたい場面に適した価格設定です。※1ドル162円換算(2026年6月30日時点)

速度を優先しつつも、プロンプトへの追従性、キャラクターの一貫性、画像内テキストの読みやすさといった品質は維持されているとGoogleは説明しています。

Nano Bananaファミリーは、用途に応じて次の4モデルで構成されます。最速の「Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)」は、超低レイテンシーが必要な大量処理向けです。汎用の主力となる「Nano Banana 2(Gemini 3.1 Flash Image)」は、品質と速度、コストのバランスに優れます。「Nano Banana Pro(Gemini 3 Pro Image)」は、速度よりも精度が重要な複雑かつ専門的な用途に向けた最上位です。そして初代の「Nano Banana(Gemini 2.5 Flash Image)」は旧モデルと位置づけられ、Nano Banana 2 Liteへの移行が推奨されています。

なお、Nano Banana 2 Liteは開発者向けプラットフォームに加え、検索のAI Mode、Geminiアプリ、NotebookLM、Google Photos、Stitch、Google Flow、Google Adsといった消費者向けのサービスにも展開されます。

Gemini Omni Flash — 会話で編集できる動画モデル

Gemini Omni Flash(モデル名は gemini-omni-flash-preview)は、Geminiのマルチモーダル推論と動画の生成・編集を結びつけたモデルです[1]。テキスト、画像、動画を組み合わせた入力から、高品質な動画生成と会話形式の編集に対応します。価格は動画出力1秒あたり0.10ドル(約16円)で、これはVeo 3.1 Fastと同水準です。

Omni Flashが得意とするのは、自然言語で動画を調整・編集する会話形式の編集、画像やテキスト、動画を組み合わせて場面の一貫性を保つマルチモーダル参照、歴史や生物学、物語の論理といったGeminiの知識を踏まえた構成、そしてテキストやグラフィックを動画内の動きと同期させる表現です。

一方で、公開時点ではいくつかの制限もあります。動画生成の長さは現状10秒までで、より長い尺は今後の対応予定です。音声リファレンスのアップロードやシーンの拡張は、現時点でGemini APIでは未対応です。また、3秒までの動画リファレンスはAPIのスキーマ上は受け付けるものの、現状では正しく処理されません。場面転換やパン(横移動)の際のキャラクターの一貫性にも課題が残るとされ、Googleは改善に取り組むとしています。Gemini Omniは、本日よりGoogle AI StudioとGemini APIでパブリックプレビューとして提供されます。

2つのモデルをつないで使う

Googleが想定する本領は、2モデルを連結する使い方にあります[1]。Nano Banana 2 Liteで高速に画像を生成し、その画像をリファレンスとしてGemini Omni Flashに渡せば、動画へと動かすことができます。さらにInteractions APIを使えば、複数回のやり取りでセッション履歴と文脈を保持でき、利用者は最大3回まで連続した編集を積み重ねられます。

Googleは、両モデルを組み合わせて体験できるデモアプリも用意しました。「Anywhere」は、自撮りや写真をアップロードするとNano Banana 2 Liteが世界各地の名所へ瞬時に移動させ、画像をタップするとOmni Flashがその場所のアニメーションクリップに変換します。「Space Lift」は部屋の写真から多様なデザイン案を生成するインテリアアプリで、気に入った案を動画でシネマティックに見せます。「Omni product studio」は、静止画をeコマース向けの動画に変換するデモで、マルチモーダル入力を組み合わせた制作の流れを示します。

安全性と透明性の面では、Gemini OmniとNano Banana 2 LiteはいずれもSynthIDによる電子透かしを採用しています。生成されたコンテンツは、Geminiアプリ、Gemini in Chrome、検索を通じて確認できます。

まとめ

Googleは、高速・低コストの画像モデル「Nano Banana 2 Lite」と、動画の生成・会話編集に対応する「Gemini Omni Flash」を開発者向けに公開しました。画像を素早く作り、その画像を動画化するという連携が前提になっており、生成メディアを使ったサービス開発の幅が広がりそうです。価格やレイテンシーの目安も明示されており、試作から量産までを見据えて選びやすくなっています。

出典:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/