发生了什么
谷歌DeepMind于8月27日正式发布面向开发者的视频生成与编辑模型Gemini Omni 1.1 Flash,经Gemini API在Google AI Studio中提供。作为初代Gemini Omni的升级版本,官方称此次更新让AI视频生成达到可投入专业制作的水平,重点补强了控制力与制作效率两端。
关键更新
- 场景延长:可在已有视频结尾继续生成画面,模型能分析最多10秒前文(初代仅参考最后1秒),每次延长10秒、累计最长40秒,画面一致性与叙事连贯性明显改善
- 首尾帧插值:开发者可指定一组镜头的起始帧与结束帧,由模型在两个关键帧之间生成连续画面,适用于环绕运镜、缩放转场与无缝循环素材
- 360p草稿模式:比标准720p生成快最多60%,成本约为后者三分之一,用于快速打样与分镜迭代,定稿后再放大至1080p或4K
- 多模态引用:支持引用最多3秒的参考视频,以保持角色形象与画面上下文一致
定价与可用性
模型按秒计费:360p每秒0.03美元、720p 0.10美元、1080p 0.15美元、4K 0.30美元,其中4K价格与Veo 3.1 Fast一致。Omni 1.1已上线Google AI Studio与Gemini Enterprise Agent Platform;Google AI Plus、Pro、Ultra订阅用户即日起可在Google Flow中使用,场景延长功能已在Gemini应用中开放。Adobe已将模型集成进Firefly,Figma Weave、GMI Cloud与Runway也已接入。
为什么重要
视频生成正从能生成走向可导演。此前AI视频工具的主要短板在于不可控:画面一致性差、无法精确衔接、迭代成本高。Omni 1.1 Flash通过首尾帧约束、长上下文场景延长与低成本草稿模式,把生成式视频推进到接近生产级工作流的阶段。对企业而言,广告素材、电商展示、影视预演等内容生产环节,可直接用自然语言描述镜头语言并批量迭代,显著降低制作门槛与成本。
尚存的不确定
谷歌官方同时提示了局限:单次生成时长仍以10秒为主,更长时长将陆续支持;Gemini API中暂不支持上传音频参考,场景延长与视频参考能力在API内也尚不完整;角色一致性在场景切换或运镜时仍有短板。此外,视频生成涉及的版权、深度伪造与内容溯源(SynthID水印)问题,仍是企业规模化应用前需要评估的合规因素。

