重點一:Google推出Gemini 2.5 Flash Image模型,支援多圖融合、角色一致性及自然語言影像編輯。
重點二:目前開發者可即時透過Gemini API與Google AI Studio使用該模型。生圖一張約耗費 1290 個輸出代幣,換算下來單張圖片定價約新台幣1.2元。
重點三:Google強調,所有生成或編輯的圖片均嵌入SynthID隱形浮水印,確保AI創作可被識別。
Google於台灣時間8月27日推出全新一代AI影像生成與編輯模型Gemini 2.5 Flash Image(又稱nano-banana),主打多圖融合、角色一致性和自然語言精準編輯等功能,期望以更強大的技術能力,打破過往生成式AI在細節、語意理解上的瓶頸。
該模型目前已開放開發者透過Gemini API及Google AI Studio試用(經測試仍未在Gemini網頁版開放)。Google指出,單張圖片定價約為新台幣1.2元(以美元$0.039計),並全面導入SynthID隱形浮水印技術,保障AI生成內容可追溯來源。
生圖技術大突破!支援多圖融合與角色一致性
Gemini 2.5 Flash Image標榜可同時處理多張輸入圖片,融合成全新場景或物件,並維持主角或產品在多次生成、不同環境下的視覺一致性。白話來說,就是解決過以往AI難以跨場景重現同一角色外觀的痛點(例如下Prompt修改後,原本的角色長相就變了)。官方強調,而也讓品牌、商品型錄、教育互動等商業生圖應用更具可行性。
Google亦釋出多款範例App,包括角色一致性、房地產卡片、員工識別證等模板,開發者可直接在Google AI Studio以「vibe coding」方式,自行混搭、客製化功能,降低技術門檻。總結來說,本次的生圖新模型具備以下特色:
- 角色一致性
能在多個場景或不同角度下,維持同一角色或物件的外觀一致。適合用於故事敘述、品牌資產設計、產品多角度展示等。
- 提示式影像編輯
透過自然語言指令,精確地對影像進行局部或整體修改。 例如:模糊背景、去除污漬、移除人物、改變姿勢、為黑白照片上色等。
- 提示式影像編輯
- 多圖融合
能理解並合併多張輸入圖片,像是將物件放入新場景、重新設計房間色調、快速生成產品情境照等。 - 互動式教學與世界知識應用
利用 Gemini 的世界知識,能理解手繪圖、協助解答現實問題,並依據複雜指令進行影像處理,適合互動式教學應用。 - 視覺模板應用
可依據既有設計模板,批量生成如房地產卡片、員工證件、產品型錄等統一風格的影像。
慎防DeepFake!生圖將嵌入SynthID隱形浮水印
Google強調,所有經該模型生成或編輯的圖片,皆會嵌入SynthID隱形浮水印,確保AI創作可追溯、辨識,回應日益嚴峻的數位內容真實性與版權管理議題。
SynthID 是 Google DeepMind 推出的隱形浮水印技術,專為 AI 生成內容設計,會在 AI 生成的內容中嵌入人眼無法察覺的數位浮水印,其可被專用演算法偵測。即使內容經過裁切、壓縮、濾鏡等常見編輯,浮水印仍能被辨識。當媒體、平台或用戶懷疑某內容為 DeepFake,就可利用 SynthID 檢測工具判斷其是否為 AI 生成。
Google強調,未來將持續優化長篇文本渲染、角色一致性及細節表現,並邀請開發者社群參與回饋。
資料來源:Google、TechChurch
本文初稿為AI編撰,整理.編輯/ 李先泰