Google剛剛正式公布其在人工智慧圖像編輯領域的重大突破,推出Gemini 2.5 Flash Image模型,該模型在測試階段以「Nano Banana」之名風靡全球,現已正式整合至Gemini應用程式中。這款被譽為「世界頂級圖像編輯模型」的AI工具,正挑戰Adobe Photoshop等傳統編輯軟體的霸主地位。
病毒式傳播的「香蕉」模型震撼AI界
在正式發布前,這款神秘的AI模型在評測平台LMArena上以「nano-banana」的代號出現,立即引起用戶瘋狂討論。該模型在圖像編輯排行榜上以巨大優勢登上榜首,遠超排名第二的Flux-Kontext模型。Google副總裁Josh Woodward的一則充滿香蕉表情符號的推文,更是暗示了Google在背後的參與。
這種病毒式傳播效應讓AI社群為之瘋狂,Reddit用戶紛紛讚嘆其驚人的編輯能力。該模型的匿名測試方式不僅展現了Google的營銷智慧,更證明了其技術實力足以讓用戶在不知道開發商的情況下就愛上它。
突破性人像一致性技術重新定義編輯標準
Gemini 2.5 Flash Image最大的技術突破在於其卓越的人像一致性保持能力。Google DeepMind產品負責人Nicole Brichtova表示:「當編輯自己或熟悉的人的照片時,細微的瑕疵都很重要——’接近但不完全相同’的描繪並不合適。」
這項技術讓用戶可以為寵物穿上芭蕾舞裙、嘗試60年代蜂窩髮型,甚至將自己置身於世界任何角落,同時完美保持人物或動物的原始特徵。相較之下,ChatGPT或xAI的Grok在處理類似任務時,經常出現面部扭曲或背景改變等問題。
多重編輯與智能融合功能展現AI創作新境界
新模型支援多輪編輯功能,讓用戶能夠層層疊加修改,同時在整個編輯過程中保持一致性。模型還具備圖像融合能力,可以將多個元素巧妙結合,例如將雨靴的圖片與粉色玫瑰結合,創造出花卉圖案的靴子設計。
更令人印象深刻的是,該模型結合了多模態推理和世界知識,能在編輯過程中做出策略性選擇,比如為特定環境添加合適的植物。用戶可以上傳沙發圖片、客廳照片和色彩搭配,模型會將這些元素融合成一個協調的渲染圖。
開發者與企業級應用全面開放
Google同步在Gemini API、Google AI Studio和Vertex AI平台向開發者開放了這項技術。定價策略相當有競爭力,每百萬輸出代幣收費30美元,每張圖片僅需0.039美元,比OpenAI的gpt-image和BFL的Flux-Kontext模型更便宜。
Google AI Studio的「建構模式」也獲得重大更新,讓開發者能夠快速測試模型能力,並直接從平台部署應用程式或將代碼保存到GitHub。這種無縫的開發體驗將加速AI圖像編輯應用的普及。
Adobe面臨前所未有的競爭壓力
這項發布對Adobe構成了嚴重威脅,該公司股價在過去一年已下跌35%,部分原因正是分析師對AI衝擊傳統工具的擔憂。Google明確表示,Gemini 2.5 Flash既面向消費者,也針對專業用戶,並為付費和免費Gemini用戶都提供存取權限。
有趣的是,Adobe週二也宣布將立即在Adobe Firefly和Adobe Express中提供Google的新模型。Adobe辯稱其優勢在於將所有模型整合在一個平台上,讓用戶無需在不同平台間跳轉,並支援在不同Adobe應用程式間移動創作內容。
安全防護與深偽技術應對措施
考慮到AI生成圖像可能被濫用的風險,Google在模型中內建了多項安全防護措施。公司的生成式AI服務條款禁止用戶生成「非同意的親密圖像」,這類防護措施似乎並未在Grok等競爭對手的工具中實施,後者曾允許用戶創建類似泰勒·史威夫特等名人的明確圖像。
為應對深偽技術的興起,Google對AI生成的圖像加入視覺浮水印以及元數據識別符。不過,在社交媒體上滾動瀏覽的用戶可能不會注意到這些識別標記。






