返回行业动态
模型与产品

谷歌发布 Nano Banana 2.1:图像生成与对话式修图模型再升级

谷歌 DeepMind 于 10 月 6 日发布 Nano Banana 2.1,是 Gemini 3 系列中面向图像生成与对话式修图的高效率模型,底座为 Gemini 3.6 Flash。新版本在 1K、2K、4K 分辨率下提升画质与真实感,修复宽幅与全景比例下的拼接瑕疵,增强文字渲染与信息图排版准确性,支持最多 14 张参考图的多图融合(最多 4 个角色一致性、10 个物体保真),并可调用 Google 网页与图片搜索做接地。模型已在 Google AI Studio、Gemini 应用与 Gemini API 上线。

来源:Google DeepMind 模型卡:Nano Banana 2.1原标题:Nano Banana 2.1 — Model card查看原文
明亮创作工作室中,数位板与显示器上呈现抽象多彩的生成式图像,一旁摆放色卡与画笔,暗示图像生成与对话式修图升级。

图片来源:北京拓实科技原创(AI 生成封面)

发生了什么

谷歌 DeepMind 于 10 月 6 日发布 Nano Banana 2.1(模型代号 gemini-nano-banana-2.1),这是 Gemini 3 系列中面向图像生成与对话式修图的模型。官方称其为 Nano Banana 2(Gemini 3.1 Flash Image)的更新版本,技术底座是 Gemini 3.6 Flash,定位仍是「Flash 级速度与成本」的高频主力模型,而非能力上限更高的 Pro 档。模型已在 Google AI Studio、Gemini 应用与 Gemini API 上线。

关键更新

  • 在 1K、2K、4K 分辨率(默认 1K)下提升画质与真实感,并修复宽幅与全景比例(1:4、4:1、1:8、8:1)在 2K、4K 下的拼接瑕疵。
  • 增强文字渲染与信息图排版准确性;官方评估覆盖通用文生图、多语言文字渲染、事实性(世界知识、教育类)、工具调用与视觉设计等能力项。
  • 支持最多 14 张参考图的多图融合,最多保持 4 个角色的一致性与 10 个物体的保真度,面向多产品换景与多角色成图。
  • 可调用 Google 网页与图片搜索做接地,并提供 minimal、medium(默认)、high 三档思考等级。
  • 输入上限约 13.1 万 token、输出上限约 3.28 万 token,可接收文字、图像、视频与 PDF,输出图像与文字。

为什么重要

对以图片为主要交付物的团队,这次升级是高频主力模型的能力补齐:多图融合与搜索接地让商品换景、多角色成图、事实性配图这类任务不必再切换到更贵的 Pro 档;文字渲染与信息图排版的改进,直接影响营销素材与报表插图的可用率。定价层面,据媒体口径其图像输出约为每百万 token 30 美元,并被描述为较上一代下调约一半。

不确定之处

上述能力与基准均来自 Google 自评,第三方榜单复现尚未出现,模型卡也未给出与竞品逐项对比的分数。官方标注的支持「最高 100 万 token」输入与开发者文档中的 13.1 万 token 输入上限口径不一致,实际可用上下文需以 API 文档为准。价格与「效率提升」的表述来自媒体转述,尚未见 Google 官方定价页逐条确认。对已经在生产中使用上一代的团队而言,更稳妥的做法是先在自有素材上做小规模回归测试,再决定是否整体切换。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

谷歌发布 Nano Banana 2.1 图像模型:多图融合与文字渲染升级|北京拓实科技