返回行业动态
模型与产品

谷歌发布Gemini Omni 1.1 Flash,AI视频生成支持40秒场景延长与4K输出

谷歌DeepMind于8月27日发布视频生成模型Gemini Omni 1.1 Flash,通过Gemini API在Google AI Studio提供。新版本补强可控性与制作效率:场景延长可分析最多10秒前文、每次延长10秒累计最长40秒;支持指定首尾帧生成连续画面;新增360p草稿模式,比720p快最多60%、成本约三分之一,定稿后可放大至4K。定价按秒计费,360p每秒0.03美元、720p 0.10美元、1080p 0.15美元、4K 0.30美元。模型已上线Google AI Studio与Gemini Enterprise Agent Platform,Adobe Firefly、Figma Weave、Runway等已接入。对企业而言,广告素材、电商展示与影视预演等内容生产可借助自然语言描述镜头并批量迭代,生成式视频正从演示走向生产级工作流。

来源:Google DeepMind 官方博客原标题:Gemini Omni 1.1 Flash lets you build with more control查看原文
未来感科技插画:电影导演工作台悬浮着多块发光的视频画面片段,中央一台专业摄像机,周围环绕蓝色数据流与神经网络光点,深蓝紫色渐变背景

图片来源:北京拓实科技原创(生成式AI)

发生了什么

谷歌DeepMind于8月27日正式发布面向开发者的视频生成与编辑模型Gemini Omni 1.1 Flash,经Gemini API在Google AI Studio中提供。作为初代Gemini Omni的升级版本,官方称此次更新让AI视频生成达到可投入专业制作的水平,重点补强了控制力与制作效率两端。

关键更新

  • 场景延长:可在已有视频结尾继续生成画面,模型能分析最多10秒前文(初代仅参考最后1秒),每次延长10秒、累计最长40秒,画面一致性与叙事连贯性明显改善
  • 首尾帧插值:开发者可指定一组镜头的起始帧与结束帧,由模型在两个关键帧之间生成连续画面,适用于环绕运镜、缩放转场与无缝循环素材
  • 360p草稿模式:比标准720p生成快最多60%,成本约为后者三分之一,用于快速打样与分镜迭代,定稿后再放大至1080p或4K
  • 多模态引用:支持引用最多3秒的参考视频,以保持角色形象与画面上下文一致

定价与可用性

模型按秒计费:360p每秒0.03美元、720p 0.10美元、1080p 0.15美元、4K 0.30美元,其中4K价格与Veo 3.1 Fast一致。Omni 1.1已上线Google AI Studio与Gemini Enterprise Agent Platform;Google AI Plus、Pro、Ultra订阅用户即日起可在Google Flow中使用,场景延长功能已在Gemini应用中开放。Adobe已将模型集成进Firefly,Figma Weave、GMI Cloud与Runway也已接入。

为什么重要

视频生成正从能生成走向可导演。此前AI视频工具的主要短板在于不可控:画面一致性差、无法精确衔接、迭代成本高。Omni 1.1 Flash通过首尾帧约束、长上下文场景延长与低成本草稿模式,把生成式视频推进到接近生产级工作流的阶段。对企业而言,广告素材、电商展示、影视预演等内容生产环节,可直接用自然语言描述镜头语言并批量迭代,显著降低制作门槛与成本。

尚存的不确定

谷歌官方同时提示了局限:单次生成时长仍以10秒为主,更长时长将陆续支持;Gemini API中暂不支持上传音频参考,场景延长与视频参考能力在API内也尚不完整;角色一致性在场景切换或运镜时仍有短板。此外,视频生成涉及的版权、深度伪造与内容溯源(SynthID水印)问题,仍是企业规模化应用前需要评估的合规因素。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

谷歌发布Gemini Omni 1.1 Flash,AI视频生成支持40秒场景延长与4K输出|北京拓实科技