
Gemini Omni 1.1 Flash 带来更强创作控制力 — 场景扩展、帧控制与 4K 到来
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Gemini Omni 1.1 Flash 于2026年8月27日作为多模态视频模型的生产更新发布,将原本只能生成10秒单镜头的生成器转变为更接近可控编辑工具的东西。头条数字很容易被忽略,因为价格没有变化:720p剪辑仍然每秒0.10美元。变化的是你可以决定画面的多少——该模型现在可以将场景延长至40秒,遵循指定的首帧和末帧,以360p分辨率生成预览,成本约为720p的三分之一,并以1080p或4K分辨率渲染最终输出。这是一次发布说明比发布本身更重要的更新。
该模型是Gemini Omni Flash预览版的继任者,该预览版于2026年6月30日向开发者开放,并保留了原版所有独特之处:多模态输入——一次调用即可处理文本、图像、音频和视频——以及对话式多轮编辑,通过讨论来完善片段,而不是从头重新生成。Gemini Omni 1.1 Flash新增的是边界控制和成本控制,这正是生产管线所需、而研究演示所不具备的。
这次更新实际上新增了什么内容
四项功能将1.1与六月预览版区分开来,每一项都回应了开发者对原版的具体抱怨。
• 场景扩展。现在,模型在延续片段时可以分析最多10秒的先前视频上下文——早期版本仅参考最后一秒。扩展以10秒为增量,累计可达40秒。你首次能制作出具有连续性的序列,而非一组彼此相邻的片段。
• 首尾帧控制。指定一个镜头的起始帧和结束帧,模型会在两个关键帧之间生成连续视频。这使得无需视频编辑器就能实现镜头环绕、变焦过渡和无缝循环,因为镜头的几何结构如今是一个约束,而非猜测。
• {{1}}360p 草稿模式。轻量预览的渲染速度最高可比标准 720p 快 60%,成本约为其三分之一。{{/1}} 这是一种分镜/迭代工具:{{2}}你可以低成本测试十几种变体,然后只以全分辨率渲染可行的那一个。{{/2}}
• 1080p 和 4K 输出。最终渲染可以从原始 720p 上限升级到 1080p 或 4K,这决定了内容是“可供社交媒体使用”还是“可供广播使用”。现在还可以将最长三秒的视频参考作为多模态输入,以保持跨镜头的角色和视觉一致性。

定价情况仍在确定中
大家引用的每秒0.10美元的价格是720p标准档位,与预览版相比没有变化。输入为每百万token 1.50美元,无论这些token是文本、图像、音频还是视频;文本输出为每百万token 9.00美元——结构与原来相同。谷歌尚未公布的是新的1080p和4K档位的每秒定价;第三方估计它们处于720p基础的1.5倍到3倍范围,但这些只是估计,不是谷歌的数字,因此在官方价格出现在Gemini API定价页面之前,请将任何高分辨率下的生产预算视为临时性的。
360p 草稿档位是刻意的成本杠杆:其价格约为 720p 的三分之一,速度最高可提升 60%,这改变了迭代的成本结构。一个团队以 360p 对一个镜头做十次草稿的开销,与以 720p 做三次草稿大致相当——这正是“充分探索”与“过早定稿”之间的差别。所有数据均由供应商报告,但吞吐量的计算只是基于 Google 自家公布数据的简单算术。

你可以实际调用它的地方
Gemini Omni 1.1 Flash 现已在 Google AI Studio 的 Gemini API 中推出,模型 ID 为 gemini-omni-1.1-flash,并已通过 Gemini Enterprise Agent Platform 面向生产工作负载开放——Adobe、Figma、GMI Cloud 和 Runway 都正在基于相同的接口构建其 Agent Platform 集成。消费者端同步上线:Google Flow 已面向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户推出完整功能集,场景扩展功能也已登陆 Gemini 应用。换言之,这并非一次纸上发布——API、Agent 平台和消费者端界面均在同一天上线。
这种广度值得花点时间琢磨。最初的 Gemini Omni Flash 于 6 月 30 日以公开预览标签向开发者发布,带有严格的 10 秒生成限制,明确不支持场景扩展,并且视频引用在模式中被接受但未被正确处理。1.1 在一次更新中解决了其中的大部分问题——40 秒的上限、可用的视频引用和适当的分辨率阶梯正是预览时代留下的空白。如果你因为预览版无法将场景保持超过十秒而放弃它,那么这个版本就是针对那个具体问题的答案。

什么没有改变
尽管有了所有这些新的控制功能,底层产品仍是同一模型系列,取舍也相同。输出仍然是带同步音频的短视频——这不是 Veo 3.1,即谷歌那个独立的单次生成高保真生成器,两者面向的任务不同。跨场景变换时的角色一致性通过更长的回溯窗口和参考视频输入得到了改善,但这仍然是一个生成方面的弱点,你应该去测试而不是想当然。此外,该模型在输出上带有 SynthID 水印,如果你在构建需要来源保证的工具,这一点很重要。
还有一点值得直接说明白:有些东西至今尚未得到证实——截至本文撰写之时,Gemini Omni 1.1 Flash 在公开的视频排行榜上还没有独立的基准测试成绩。谷歌宣称的360p提速60%、1080p/4K下的画质表现,均为厂商自报。这次发布的核心看点在于功能列表和价格,而非排行榜上的分数;任何跟你说法不同的人,所引用的数字都是实验室之外没人能得出的。
为什么“更多控制”才是关键
本次发布的主线是,Google 终于为构建者提供了控制手段:长度、构图、分辨率和成本现在都是输入,而非输出。正是这一点让生成式模型感觉像工具,而非老虎机;也是同样的原因,使得成本透明在基础设施端至关重要。我们接触过的每一个生成式模型团队都在与同样的两个问题作斗争——单位经济性和迭代速度——而一个迭代成本仅为此前三分之一的模型,能同时针对这两个问题发力。
成本控制正是路由层价值所在。OrcaRouter 以零加成透传提供商的列表价格,因此当某个模型的每秒或每 Token 费率发生变化时,你在我们这边看到的价格也会在同一天同步变化——你和 Google 公布的数字之间没有任何价差。一个 API 覆盖 200+ 个模型,如果提供商宕机,或刚上线一天的模型在生产中途返回错误,就会自动故障转移;对于昨天才发布的模型,故障转移就是无需把生产管道押注其上便可测试它的方式。Gemini Omni 1.1 Flash 本身尚不能通过我们进行路由——我们不会虚称自己托管了并未托管的模型——但定价纪律才是关键:当其 API 层级向第三方路由开放时,它会以 Google 的列表价格出现,届时集成只是配置变更,而非重写。
最重要的一点
Gemini Omni 1.1 Flash 此次更新让 Gemini 的视频模型从新奇玩具变成了可用的生产工具:场景时长扩展到 40 秒、支持首帧/末帧控制、新增 360p 草稿档位(成本仅为原来的三分之一),并支持 1080p/4K 输出。每秒 0.10 美元的 720p 价格保持不变,高分辨率定价仍未公布,且目前还没有独立的基准测试——在其他人运行该模型之前,请将 Google 的功能声明视为厂商自报数据。如果你之前因为十秒太短、720p 太小而一直在等待预览版,那么现在不用再等了。如果你需要在投入之前看到基准测试结果或官方 4K 定价,坦白说,目前还没有人掌握这些数据。
关注Gemini API定价页面的1080p/4K每秒费率,留意1.1更新的首批独立评估,并观察Google Flow的订阅用户推出情况,以此判断团队对模型大规模质量的信心程度。发布是真的,控制措施也是真的,唯一仍在变动的是定价差距。
