Google 面向開發者同時推出了兩款生成媒體新模型[1]。一款是影像生成模型 Nano Banana 2 Lite,號稱是 Nano Banana 系列中速度最快、成本最低的模型。另一款是負責影片生成與對話式編輯的 Gemini Omni Flash,在 Google I/O 上亮相之後,這次首度向開發者開放。兩者皆可透過 Google AI Studio、Gemini API 以及 Gemini Enterprise Agent Platform 使用,能夠打通從影像生成到影片製作的完整流程。

影像與影片兩款新模型同時發表

這次發表的核心,是兩款提升生成媒體「速度」與「迭代便利性」的模型[1]。Nano Banana 2 Lite 是一款著重高吞吐量與低成本的影像生成模型,發表的同時即可在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 使用。此外,它還會陸續登上搜尋的「AI Mode」、Gemini 應用程式等面向消費者的 Google 產品。

另一款 Gemini Omni Flash 負責影片的生成與對話式編輯。曾在 Google I/O 上展示的它,這次首度透過 Gemini API 和 Google AI Studio 向開發者開放。Google 強調,透過將影像的高速生成與影片的製作、編輯銜接起來,開發者可以打造從頭到尾連貫一致的多媒體體驗。無論是數千張規模的影像生成,還是需要多輪往返的影片編輯,都可以依用途搭配使用這兩款模型。

Nano Banana 2 Lite——把速度與低成本做到極致的影像模型

Nano Banana 2 Lite(模型名稱為 gemini-3.1-flash-lite-image)專為速度與成本優先的場景而設計[1]。Google 建議正在使用初代 Nano Banana(gemini-2.5-flash-image)的開發者將其作為替代選擇,並表示只需替換即可在主要效能指標上受益。

效能方面有兩個特點。其一是低延遲,從文字生成影像僅需 4 秒,適合快速推進原型與草圖方案的場景。其二是成本效率,每 1,000 張影像的生成成本為 0.034 美元(約 5 日圓),適合大量生成草圖或控制營運預算的場合。※1 美元 = 162 日圓(截至 2026 年 6 月 30 日)

Google 表示,儘管以速度為先,模型在提示詞遵循度、角色一致性以及影像內文字可讀性等方面的品質仍得以維持。

Nano Banana 系列依用途由以下四款模型構成。最快的「Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)」面向需要超低延遲的大批量處理。通用主力「Nano Banana 2(Gemini 3.1 Flash Image)」在品質、速度與成本之間取得出色平衡。「Nano Banana Pro(Gemini 3 Pro Image)」是面向精度比速度更重要的複雜且專業用途的最高階機型。而初代「Nano Banana(Gemini 2.5 Flash Image)」被定位為舊款,建議移轉到 Nano Banana 2 Lite。

此外,除了開發者平台,Nano Banana 2 Lite 還將登上搜尋的 AI Mode、Gemini 應用程式、NotebookLM、Google Photos、Stitch、Google Flow 以及 Google Ads 等面向消費者的服務。

Gemini Omni Flash——可以用對話來編輯的影片模型

Gemini Omni Flash(模型名稱為 gemini-omni-flash-preview)是一款將 Gemini 的多模態推理與影片的生成、編輯結合在一起的模型[1]。它支援以文字、影像、影片組合作為輸入,進行高品質的影片生成與對話式編輯。價格為每秒影片輸出 0.10 美元(約 16 日圓),與 Veo 3.1 Fast 處於同一水準。

Omni Flash 擅長的方面包括:用自然語言調整、編輯影片的對話式編輯;將影像、文字、影片組合起來以維持場景一致性的多模態參照;基於歷史、生物學、敘事邏輯等 Gemini 知識來建構內容的能力;以及將文字與圖形同影片中的動作同步的表現。

另一方面,發表時也存在一些限制。影片生成長度目前最長為 10 秒,更長的時長將於今後支援。音訊參照的上傳與場景延伸,目前在 Gemini API 中尚未支援。此外,3 秒以內的影片參照雖然在 API 的 schema 上可以接受,但目前無法被正確處理。場景切換或平移(橫向移動)時的角色一致性也仍有課題,Google 表示正著手改進。Gemini Omni 自即日起在 Google AI Studio 和 Gemini API 以公開預覽的形式提供。

把兩款模型串連起來使用

Google 設想的真正價值在於將兩款模型串連使用[1]。用 Nano Banana 2 Lite 高速生成影像,再把該影像作為參照傳給 Gemini Omni Flash,就能將其動畫化為影片。進一步借助 Interactions API,還能在多輪往返中保持工作階段歷史與上下文,使用者最多可以疊加 3 次連續編輯。

Google 還準備了可以同時體驗兩款模型的示範應用程式。「Anywhere」在自拍或上傳照片後,由 Nano Banana 2 Lite 瞬間將你帶到世界各地的名勝,點擊影像後 Omni Flash 會將其轉換為該地點的動畫片段。「Space Lift」是一款根據房間照片生成多種設計方案的室內設計應用程式,並將中意的方案以電影般的方式用影片呈現。「Omni product studio」是一款將靜態影像轉換為電商影片的示範,展示了融合多模態輸入的製作流程。

在安全與透明性方面,Gemini Omni 與 Nano Banana 2 Lite 均採用 SynthID 數位浮水印。生成的內容可以透過 Gemini 應用程式、Gemini in Chrome 以及搜尋進行驗證。

總結

Google 面向開發者推出了高速、低成本的影像模型「Nano Banana 2 Lite」,以及支援影片生成與對話式編輯的「Gemini Omni Flash」。其前提是快速生成影像,再把影像動畫化為影片,這有望拓寬使用生成媒體進行服務開發的空間。價格與延遲的參考值也已明示,從原型設計到大量生產都更便於選擇。

出典:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/