Back to News

Google DeepMind launches Gemini Omni 1.1 Flash video model with scene extension, 4K upscaling

296 points · 233 comments#gemini-omni#video-generation#google-deepmind#multimodal

Google DeepMind announced Gemini Omni 1.1 Flash, a video production model with scene extension, first/last frame interpolation, and 4K upscaling. It reads up to 10 seconds of prior video context, extends scenes in 10-second increments up to 40 seconds total, and offers a 360p draft mode with up to 60% higher throughput and about one-third the cost of 720p.

Coverage timeline

  1. Google DeepMind Blog
  2. Techmeme

    Google : Google launches Gemini Omni 1.1 Flash, which it says delivers studio-quality video production, including the ability to extend a scene, 4K upscaling, and more — Omni now delivers studio-quality video production, including the ability to extend a scene, first and last frame interpolation …

  3. Hacker Newssaretup
  4. 机器之心机器之心

    前些天,牛来模型(Ox Alpha)显露真身之前,谷歌 DeepMind Gemini 团队在 𝕏 上甚是热闹,让人一度以为 Ox Alpha 是某个新版 Gemini。 事实证明,牛来是地道的中国模型 GLM-5.3-Flash。气氛一度有点尴尬。 随后,Logan Kilpatrick 专门出来澄清:此前那些引发猜测的评论,指向的是 Gemini 3.7 Flash 的发布。 这场乌龙刚过去没多久,今天凌晨,谷歌又发布了一个新的视频模型:Gemini Omni 1.1 Flash。 虽然似乎在孙割大瓜阴影下,Gemini Omni 1.1 Flash 热度一般,但从榜单成绩来看,这个模型还是挺牛的,值得一点关注。 总结起来,Omni 1.1 Flash 此次更新的重点集中在视频制作流程的 连续性、可控性和迭代效率。 首先是 场景延展能力 。Omni 1.1 Flash 现在可以读取最多 10 秒的前序视频上下文,并在此基础上继续生成后续画面。单次可扩展 10 秒,累计视频长度最高可达到 40 秒。 上下文长度提升后,模型可以获得更多人物状态、场景关系、镜头运动和剧情信息。对于连续对白、长镜头、叙事视频以及需要多段生成的视频项目,这项能力会直接影响成片的一致性。 Google 展示的案例中,同一个场景可以连续完成对话、镜头后拉、空间转换等动作,同时保持人物和环境关系相对稳定。创作者也可以从同一段素材继续生成不同镜头方案,例如推轨变焦、快速变焦以及环绕镜头。 其次,Omni 1.1 Flash 增加了 首帧和尾帧控制 。创作者可以指定一个镜头的起始画面与结束画面,由模型补全中间的连续运动。这项能力适用于环绕镜头、推拉镜头、快速转场以及循环视频等场景,也进一步提升了生成视频对镜头语言的可编排程度。 在制作效率方面,Google 为 Omni 1.1 Flash 提供了 360p 草稿模式 。官方数据显示,360p 模式的系统吞吐速度最高可比 720p 提升约 60%,生成成本约为 720p 的三分之一。 这一模式更适合创作前期。AI 视频制作通常需要反复尝试提示词、镜头运动、人物动作和构图。创作者可以先批量生成低分辨率版本,从多个方案中筛选方向,再进入高分辨率生产阶段。 Google 在演示中展示了一套类似「Draft Room」的工作流:一次生成多个 360p 版