
Gemini Omni 1.1 Flash 进入生产就绪:40秒场景、帧控制与4K成片
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
把视频片段的最后一秒交给视频模型,让它接着拍下去,你就是在拿它的记忆做赌注。这正是 Gemini Omni 1.1 Flash——Google 于 2026 年 8 月 27 日发布的生产版更新——所要消除的问题:在延续场景时,它不再只回看一秒的镜头,而是最多读取十秒。与此同时,Google 将这款模型最受用户期待的控制选项移出了实验区:首帧和末帧条件控制、一个 360p 草稿档位(成本约为标准 720p 输出的三分之一),以及最高 4K 的最终渲染。主力档位的价格没有变动——720p 片段仍为每秒 0.10 美元——所以这次发布的主题是控制与成本,而非涨价带来的冲击。
Gemini Omni 1.1 Flash 是 Gemini Omni Flash 预览版的继任版本,该预览版于 2026 年 6 月 30 日面向开发者推出。1.1 继承了原版所有独特之处:单次调用即可接受文本、图像、音频和视频的多模态输入,每个片段都带有原生同步音频,以及对话式多轮编辑——你可以通过与模型对话来完善场景,而无需从头重新提示。1.1 新增的是此前缺失的工具:长度、取景、分辨率和迭代成本现在都成为构建者可以实际设置的输入参数。
回看问题,已解决。
最具决定性意义的变化在于上下文。早期版本的模型在续接片段时,仅参考片段的最后一秒,这正是扩展内容在角色、光照和镜头运动上出现漂移的原因。Gemini Omni 1.1 Flash 最多可分析此前10秒的视频,扩展以10秒为增量运行,累计最长可达40秒。实际区别在于“一组相邻片段”和“一个可视为单一场景的序列”之间。对于30秒的广告或循环品牌素材而言,这就是拼接与执导之间的差别。
• 场景扩展。以10秒为一段继续扩展现有片段,最长可至40秒,并利用最多10秒的回看上下文来保持续接的一致性。
• {{1}}首尾帧控制。{{/1}}指定一个镜头的起始帧和结束帧,模型即可在两个关键帧之间生成连续视频——这是摄像机环绕、缩放过渡和无缝循环背后的基础能力。
• 视频参考。多模态输入中可包含最多三秒的参考片段,以在多个镜头间保持角色、服装和动作风格的一致。
• 原生音频。生成的片段仍带有同步对话、音效和环境声,因此输出即为完成品短视频,而不是等待声音处理的无声素材。
Veo的控制,Omni的流水线
该公告借用了{{1}}“你最喜爱的 Veo 创意控制功能”{{/1}}这一说法,而这确实准确描述了这些功能的来源。Veo 3.1 是 Gogle 旗下独立的一次性高保真视频生成器,其工具集中早已包含关键帧式条件控制和超分辨率功能;Gemini Omni 1.1 Flash 将这套控制语言引入多模态 Omni 流水线——其中输入可以是图像、音频和参考视频,编辑以对话方式进行,而非每次全新生成。这两个模型在 Gogle 的产品阵容中并非对手;Gemini API 文档将 Gemini Omni Flash 定位为视频生成的首选默认模型,而 Veo 则是高保真度的专业选择。
这一点之所以重要,是出于实际原因:这些控件现在位于你最可能为日常视频工作调用的模型中,而不是位于一个需要学习第二个 API 才能使用的独立高级层级中。帧控制、草稿制作和放大共享同一个端点和同一种定价模式。
从草稿到定稿的工作流程
360p草稿档是这次公告中最不起眼的功能,却可能是最有价值的。360p预览的渲染速度比标准720p快达60%,成本约为后者的三分之一,这从根本上改变了迭代的经济性。按照人们常引用的每秒费率,一段10秒的360p草稿约需0.30美元,而720p则需1.00美元——相当于用一次正式渲染的价格,进行三轮探索。
预期的流程显而易见:在 360p 下制作分镜并迭代,然后以 720p、1080p 或 4K 渲染可行的那一个镜头。对于制作社交媒体剪辑版或广告变体的团队来说,草稿档将受成本约束的工作流转变为受探索约束的工作流。这里的速度和成本数据均为供应商自报——Gogle 自己的说法迄今未被复现——但基于这些数据的计算很简单。

定价情况
不断被引用的每秒0.10美元这个数字,是Gogle公布的720p标准层级价格,与预览版相比没有变化。输入费用为每百万token 1.50美元,无论这些token是文本、图像、音频还是视频,文本输出费用为每百万token 9.00美元——与原始版本的结构相同。360p层级折算下来约为每秒0.03美元,这正是Gogle所宣称的“约三分之一成本”的含义,也与经销商列表中目前显示的价格一致。
Google 尚未公布的是新的 1080p 和 4K 档位的每秒费率。转销商列表显示,1080p 为每秒 0.15 美元,4K 为每秒 0.30 美元,但这些是市场估计值,并非 Google 的数字——在 Gemini API 定价页面出现官方费率之前,请将任何高分辨率制作预算视为暂定。为了让你对规模有所了解,一个 40 秒的完整扩展场景在 720p 下最高可达 4.00 美元;按照转销商报价,一个 10 秒的 4K 成品大约 3.00 美元;而同样的 10 秒以 360p 草拟大约 0.30 美元。
按秒计费是卖点,但你实际支付的金额由你购买所用的平台决定——Gogle 按标价出售,转售商和 API 网关会在此基础上加价。这正是 0% 加价政策在基础设施层面的意义所在:OrcaRouter 将服务商标价原样传递,因此当模型费率变动时,我们这边的价格会在同一天更新,你和厂商公布的价格之间不存在任何加价层。我们尚未路由 Gemini Omni 1.1 Flash——Gogle 还没有向第三方路由开放 Omni 视频 API,我们也不会声称托管我们没有的模型——但定价纪律才是关键,当该 API 层级开放时,该模型将以标价出现。

在哪里可以呼叫它
Gemini Omni 1.1 Flash 现已上线,模型 ID 为gemini-omni-1.1-flash,可通过 Gemini API 在 Gogle AI Studio 中使用,定位为生产就绪而非预览版。它还通过 Gemini Enterprise Agent Platform 面向生产工作负载提供——根据公告,这正是 Adobe、Figma、GMI Cloud 和 Runway 已在集成的同一界面。在消费者端,Gogle Flow 面向全球所有 AI Plus、Pro 和 Ultra 订阅用户提供完整功能集,场景扩展功能已在 Gemini 应用中上线。这不是纸面发布:API、智能体平台和消费者界面都在同一天落地。
如果你试过六月预览版,被其严格的10秒时长上限或无法保持场景连贯的问题劝退,那么此版本恰好回应了这些抱怨——40秒的扩展时长、可用的视频参考,以及完善的分辨率阶梯。API的形态也值得了解:生成和编辑都通过Interactions API运行,这正是对话式、多轮编辑模型得以实现的基础,而response_format设置可以固定输出分辨率——草稿用360p,成片用全分辨率。

什么仍未被证实?
对于所有新的控制功能而言,定义原始版本的那些权衡取舍依然延续。输出仍然是带同步音频的短视频,而非Veo 3.1的替代品——这两个模型针对的是不同的任务。跨场景的角色一致性通过10秒回看和参考视频输入得到了改善,但它仍然是一个生成层面的弱点,值得用你自己的素材来测试,而不是想当然。每个生成的片段都带有SynthID水印,这对于需要溯源保证的工具来说至关重要。
而诚实的告诫是:截至本文撰写时,没有任何公共视频排行榜上有针对 Gemini Omni 1.1 Flash 的独立基准测试。360p 草稿的 60% 加速、1080p 和 4K 下的质量、首帧/末帧条件控制的可靠性——全部都是供应商自行报告的,没有任何第三方复现过。今天任何向你引用该模型质量分数的人,所引用的数字都是除 Gogle 实验室之外无人得出的。
现在谁应该行动?
三類群體能立即從此次發布中受益。已在 Omni API 上構建的團隊應切換模型 ID,並重新測試其擴展和幀控制路徑——此次升級是請求欄位的變更,而非重新架構。任何需要大量短影片的團隊——廣告變體、社群剪輯、循環品牌素材——都應評估 360p 從草稿到成品的流程成本,因為成本計算的創新正是在這裡。而一直等待預覽版的團隊現在就該嘗試此模型,因為先前使預覽版無法投入生產的兩大障礙——十秒短片和缺乏場景連續性——正是本次更新所移除的內容。
应该观望的群体也同样定义明确:如果你在投入预算之前需要第三方基准测试或官方的4K每秒费率,目前还没有人能提供这些,这一点值得直说,而不是含糊其辞。发布是真实的,控制是真实的,而价格差距是唯一仍在变动的部分。请关注Gemini API定价页面上的1080p和4K费率,并留意首批独立评估——一旦有其他人运行这个模型,本文中每项质量声明所附带的供应商报告告诫就会得到勾选或红旗。
