Google推出Gemini 2.5 Flash Image！AI修圖不再「走鐘」，還支援多圖融合：5大亮點一次看|數位時代 BusinessNext

Google推出Gemini 2.5 Flash Image！AI修圖不再「走鐘」，還支援多圖融合：5大亮點一次看

Google推Gemini 2.5 Flash Image，標榜可同時處理多張輸入圖片，融合成全新場景或物件，並維持主角或產品在多次生成的視覺一致性。

重點一：Google推出Gemini 2.5 Flash Image模型，支援多圖融合、角色一致性及自然語言影像編輯。

重點二：目前開發者可即時透過Gemini API與Google AI Studio使用該模型。生圖一張約耗費 1290 個輸出代幣，換算下來單張圖片定價約新台幣1.2元。

重點三：Google強調，所有生成或編輯的圖片均嵌入SynthID隱形浮水印，確保AI創作可被識別。

Google於台灣時間8月27日推出全新一代AI影像生成與編輯模型Gemini 2.5 Flash Image（又稱nano-banana），主打多圖融合、角色一致性和自然語言精準編輯等功能，期望以更強大的技術能力，打破過往生成式AI在細節、語意理解上的瓶頸。

該模型目前已開放開發者透過Gemini API及Google AI Studio試用（經測試仍未在Gemini網頁版開放）。Google指出，單張圖片定價約為新台幣1.2元（以美元$0.039計），並全面導入SynthID隱形浮水印技術，保障AI生成內容可追溯來源。

生圖技術大突破！支援多圖融合與角色一致性

Gemini 2.5 Flash Image標榜可同時處理多張輸入圖片，融合成全新場景或物件，並維持主角或產品在多次生成、不同環境下的視覺一致性。白話來說，就是解決過以往AI難以跨場景重現同一角色外觀的痛點（例如下Prompt修改後，原本的角色長相就變了）。官方強調，而也讓品牌、商品型錄、教育互動等商業生圖應用更具可行性。

Google亦釋出多款範例App，包括角色一致性、房地產卡片、員工識別證等模板，開發者可直接在Google AI Studio以「vibe coding」方式，自行混搭、客製化功能，降低技術門檻。總結來說，本次的生圖新模型具備以下特色：

角色一致性
能在多個場景或不同角度下，維持同一角色或物件的外觀一致。適合用於故事敘述、品牌資產設計、產品多角度展示等。
1. 提示式影像編輯
  透過自然語言指令，精確地對影像進行局部或整體修改。 例如：模糊背景、去除污漬、移除人物、改變姿勢、為黑白照片上色等。
多圖融合
能理解並合併多張輸入圖片，像是將物件放入新場景、重新設計房間色調、快速生成產品情境照等。
互動式教學與世界知識應用
利用 Gemini 的世界知識，能理解手繪圖、協助解答現實問題，並依據複雜指令進行影像處理，適合互動式教學應用。
視覺模板應用
可依據既有設計模板，批量生成如房地產卡片、員工證件、產品型錄等統一風格的影像。

慎防DeepFake！生圖將嵌入SynthID隱形浮水印

Google強調，所有經該模型生成或編輯的圖片，皆會嵌入SynthID隱形浮水印，確保AI創作可追溯、辨識，回應日益嚴峻的數位內容真實性與版權管理議題。

SynthID 是 Google DeepMind 推出的隱形浮水印技術，專為 AI 生成內容設計，會在 AI 生成的內容中嵌入人眼無法察覺的數位浮水印，其可被專用演算法偵測。即使內容經過裁切、壓縮、濾鏡等常見編輯，浮水印仍能被辨識。當媒體、平台或用戶懷疑某內容為 DeepFake，就可利用 SynthID 檢測工具判斷其是否為 AI 生成。

⁠Google強調，未來將持續優化長篇文本渲染、角色一致性及細節表現，並邀請開發者社群參與回饋。

延伸閱讀：GPT-4o生圖全網擠爆，免費版要等等了！如何生成「吉卜力風」？比Grok更厲害嗎？

使用AI有多耗能？Google官方給解答：詢問Gemini一次耗電約「運轉微波爐1分鐘」，並耗費5滴水

資料來源：Google、TechChurch

本文初稿為AI編撰，整理．編輯/ 李先泰