Gemini Omni 1.1 Flash 发布文章的主视觉标题卡。大号标题文字为「Gemini Omni 1.1 Flash — 对视频拥有更多控制力」。四个功能标签分别显示:「场景延长至40秒」、「首帧/末帧控制」、「360p草稿,成本约1/3」、「1080p与4K输出」。页脚文字为「2026年8月27日通过Gemini API发布。」OrcaRouter标志合成于右下角。
Guides & Insights

Gemini Omni 1.1 Flash 进入生产就绪:40秒场景、帧控制与4K成片

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把视频片段的最后一秒交给视频模型,让它接着拍下去,你就是在拿它的记忆做赌注。这正是 Gemini Omni 1.1 Flash——Google 于 2026 年 8 月 27 日发布的生产版更新——所要消除的问题:在延续场景时,它不再只回看一秒的镜头,而是最多读取十秒。与此同时,Google 将这款模型最受用户期待的控制选项移出了实验区:首帧和末帧条件控制、一个 360p 草稿档位(成本约为标准 720p 输出的三分之一),以及最高 4K 的最终渲染。主力档位的价格没有变动——720p 片段仍为每秒 0.10 美元——所以这次发布的主题是控制与成本,而非涨价带来的冲击。

Gemini Omni 1.1 Flash 是 Gemini Omni Flash 预览版的继任版本,该预览版于 2026 年 6 月 30 日面向开发者推出。1.1 继承了原版所有独特之处:单次调用即可接受文本、图像、音频和视频的多模态输入,每个片段都带有原生同步音频,以及对话式多轮编辑——你可以通过与模型对话来完善场景,而无需从头重新提示。1.1 新增的是此前缺失的工具:长度、取景、分辨率和迭代成本现在都成为构建者可以实际设置的输入参数。

回看问题,已解决。

最具决定性意义的变化在于上下文。早期版本的模型在续接片段时,仅参考片段的最后一秒,这正是扩展内容在角色、光照和镜头运动上出现漂移的原因。Gemini Omni 1.1 Flash 最多可分析此前10秒的视频,扩展以10秒为增量运行,累计最长可达40秒。实际区别在于“一组相邻片段”和“一个可视为单一场景的序列”之间。对于30秒的广告或循环品牌素材而言,这就是拼接与执导之间的差别。

• 场景扩展。以10秒为一段继续扩展现有片段,最长可至40秒,并利用最多10秒的回看上下文来保持续接的一致性。

• {{1}}首尾帧控制。{{/1}}指定一个镜头的起始帧和结束帧,模型即可在两个关键帧之间生成连续视频——这是摄像机环绕、缩放过渡和无缝循环背后的基础能力。

• 视频参考。多模态输入中可包含最多三秒的参考片段,以在多个镜头间保持角色、服装和动作风格的一致。

• 原生音频。生成的片段仍带有同步对话、音效和环境声,因此输出即为完成品短视频,而不是等待声音处理的无声素材。

Veo的控制,Omni的流水线

该公告借用了{{1}}“你最喜爱的 Veo 创意控制功能”{{/1}}这一说法,而这确实准确描述了这些功能的来源。Veo 3.1 是 Go​gle 旗下独立的一次性高保真视频生成器,其工具集中早已包含关键帧式条件控制和超分辨率功能;Gemini Omni 1.1 Flash 将这套控制语言引入多模态 Omni 流水线——其中输入可以是图像、音频和参考视频,编辑以对话方式进行,而非每次全新生成。这两个模型在 Go​gle 的产品阵容中并非对手;Gemini API 文档将 Gemini Omni Flash 定位为视频生成的首选默认模型,而 Veo 则是高保真度的专业选择。

这一点之所以重要,是出于实际原因:这些控件现在位于你最可能为日常视频工作调用的模型中,而不是位于一个需要学习第二个 API 才能使用的独立高级层级中。帧控制、草稿制作和放大共享同一个端点和同一种定价模式。

从草稿到定稿的工作流程

360p草稿档是这次公告中最不起眼的功能,却可能是最有价值的。360p预览的渲染速度比标准720p快达60%,成本约为后者的三分之一,这从根本上改变了迭代的经济性。按照人们常引用的每秒费率,一段10秒的360p草稿约需0.30美元,而720p则需1.00美元——相当于用一次正式渲染的价格,进行三轮探索。

预期的流程显而易见:在 360p 下制作分镜并迭代,然后以 720p、1080p 或 4K 渲染可行的那一个镜头。对于制作社交媒体剪辑版或广告变体的团队来说,草稿档将受成本约束的工作流转变为受探索约束的工作流。这里的速度和成本数据均为供应商自报——Go​gle 自己的说法迄今未被复现——但基于这些数据的计算很简单。

A generated scoreboard titled 'Gemini Omni 1.1 Flash — the scoreboard'. Six rows read 'Max scene length: 40s (10s increments)', 'Lookback context: 10s (was 1s)', 'Resolution: 720p, 1080p, 4K', 'Frame control: first/last frame', 'Draft tier: 360p, ~1/3 cost, ~60% faster', 'Independent benchmark: none yet'. A footer reads 'Vendor-reported; no independent scores yet. 720p $0.10/s per Google.' The OrcaRouter logo is composited in the bottom-right corner.

定价情况

不断被引用的每秒0.10美元这个数字,是Go​gle公布的720p标准层级价格,与预览版相比没有变化。输入费用为每百万token 1.50美元,无论这些token是文本、图像、音频还是视频,文本输出费用为每百万token 9.00美元——与原始版本的结构相同。360p层级折算下来约为每秒0.03美元,这正是Go​gle所宣称的“约三分之一成本”的含义,也与经销商列表中目前显示的价格一致。

Google 尚未公布的是新的 1080p 和 4K 档位的每秒费率。转销商列表显示,1080p 为每秒 0.15 美元,4K 为每秒 0.30 美元,但这些是市场估计值,并非 Google 的数字——在 Gemini API 定价页面出现官方费率之前,请将任何高分辨率制作预算视为暂定。为了让你对规模有所了解,一个 40 秒的完整扩展场景在 720p 下最高可达 4.00 美元;按照转销商报价,一个 10 秒的 4K 成品大约 3.00 美元;而同样的 10 秒以 360p 草拟大约 0.30 美元。

按秒计费是卖点,但你实际支付的金额由你购买所用的平台决定——Go​gle 按标价出售,转售商和 API 网关会在此基础上加价。这正是 0% 加价政策在基础设施层面的意义所在:OrcaRouter 将服务商标价原样传递,因此当模型费率变动时,我们这边的价格会在同一天更新,你和厂商公布的价格之间不存在任何加价层。我们尚未路由 Gemini Omni 1.1 Flash——Go​gle 还没有向第三方路由开放 Omni 视频 API,我们也不会声称托管我们没有的模型——但定价纪律才是关键,当该 API 层级开放时,该模型将以标价出现。

A screenshot of the Gemini API Pricing page (ai.google.dev, captured August 28, 2026) showing the developer-docs navigation (Models, Gemini Omni Flash, Veo, Nano Banana, Imagen), the 'Gemini Developer API pricing' heading, and the Free tier card for developers getting started with the Gemini API — Google's own page for the model family's pricing and availability tiers.

在哪里可以呼叫它

Gemini Omni 1.1 Flash 现已上线,模型 ID 为gemini-omni-1.1-flash,可通过 Gemini API 在 Go​gle AI Studio 中使用,定位为生产就绪而非预览版。它还通过 Gemini Enterprise Agent Platform 面向生产工作负载提供——根据公告,这正是 Adobe、Figma、GMI Cloud 和 Runway 已在集成的同一界面。在消费者端,Go​gle Flow 面向全球所有 AI Plus、Pro 和 Ultra 订阅用户提供完整功能集,场景扩展功能已在 Gemini 应用中上线。这不是纸面发布:API、智能体平台和消费者界面都在同一天落地。

如果你试过六月预览版,被其严格的10秒时长上限或无法保持场景连贯的问题劝退,那么此版本恰好回应了这些抱怨——40秒的扩展时长、可用的视频参考,以及完善的分辨率阶梯。API的形态也值得了解:生成和编辑都通过Interactions API运行,这正是对话式、多轮编辑模型得以实现的基础,而response_format设置可以固定输出分辨率——草稿用360p,成片用全分辨率。

A screenshot of the Gemini API developer documentation Models page (ai.google.dev, captured August 28, 2026) showing the docs navigation under 'Gemini API' — Models, Gemini Omni Flash, Nano Banana, Veo, Imagen — and the list of Gemini's generation models. It is the vendor's official developer page for the model family.

什么仍未被证实?

对于所有新的控制功能而言,定义原始版本的那些权衡取舍依然延续。输出仍然是带同步音频的短视频,而非Veo 3.1的替代品——这两个模型针对的是不同的任务。跨场景的角色一致性通过10秒回看和参考视频输入得到了改善,但它仍然是一个生成层面的弱点,值得用你自己的素材来测试,而不是想当然。每个生成的片段都带有SynthID水印,这对于需要溯源保证的工具来说至关重要。

而诚实的告诫是:截至本文撰写时,没有任何公共视频排行榜上有针对 Gemini Omni 1.1 Flash 的独立基准测试。360p 草稿的 60% 加速、1080p 和 4K 下的质量、首帧/末帧条件控制的可靠性——全部都是供应商自行报告的,没有任何第三方复现过。今天任何向你引用该模型质量分数的人,所引用的数字都是除 Go​gle 实验室之外无人得出的。

现在谁应该行动?

三類群體能立即從此次發布中受益。已在 Omni API 上構建的團隊應切換模型 ID,並重新測試其擴展和幀控制路徑——此次升級是請求欄位的變更,而非重新架構。任何需要大量短影片的團隊——廣告變體、社群剪輯、循環品牌素材——都應評估 360p 從草稿到成品的流程成本,因為成本計算的創新正是在這裡。而一直等待預覽版的團隊現在就該嘗試此模型,因為先前使預覽版無法投入生產的兩大障礙——十秒短片和缺乏場景連續性——正是本次更新所移除的內容。

应该观望的群体也同样定义明确:如果你在投入预算之前需要第三方基准测试或官方的4K每秒费率,目前还没有人能提供这些,这一点值得直说,而不是含糊其辞。发布是真实的,控制是真实的,而价格差距是唯一仍在变动的部分。请关注Gemini API定价页面上的1080p和4K费率,并留意首批独立评估——一旦有其他人运行这个模型,本文中每项质量声明所附带的供应商报告告诫就会得到勾选或红旗。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube