
Qwen3.8-Omni-Flash 对比 Gemini Omni 1.1 Flash:一个观看视频,一个制作视频
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
简短回答:这两者不能互相替代,只有当你不再把“omni”当作一个类别时,这种比较才有意义。Qwen3.8-Omni-Flash是厂商于2026年9月18日向API客户开放的一款模型,它接收文本、图像、音频和视频,返回文本——它是一款用来读完一小时的会议记录或素材,然后告诉你发生了什么事的模型。Gemini Omni 1.1 Flash则是厂商于2026年8月27日发布的一款模型,它接收文本或图像提示,返回带同步音频的视频——它是一款用来制作素材的模型。一个消费媒体,另一个生产媒体。如果你的流水线两者都需要,那你就两个都得用,而真正该问的问题不是哪个更胜一筹,而是你实际缺的是哪一个。
这两个模型都不是开放权重的,也都无法通过 OrcaRouter 路由,而且两者的定价维度无法相互换算——一边是 token,另一边是生成视频的秒数。它们真正重叠的范围比“omni vs omni”这一框架所暗示的更窄,而这种重叠值得在算价格之前先厘清,因为价格算术正是二者最常被错误比较的地方。
值得首先澄清的范畴错误
阿里巴巴的发布材料将Qwen3.8-Omni-Flash与Gemini 3.8 Flash进行了基准对比,而随后的大量报道将其压缩成“击败 Gemini”。那是与Gemini Omni 1.1 Flash不同的 Google 模型,二者并非可互换的参照点:Gemini 3.8 Flash 是通用多模态模型,而 Gemini Omni 1.1 Flash 是视频生成模型,有单独的价目表和单独的 API 接口。这次发布后流传的每一个 Qwen 对 Gemini 的数字——WildClawBench-MM 71.0 对 58.9,SpotSoundBench 67.2 对 39.7,AgenticVBench 36.8 对 45.0——都是与 Gemini 3.8 Flash 对比,而不是与 Omni 视频模型对比,况且无论如何,这些数字没有一个是独立的。如果你带着一块把本文中这两个模型放在同一轴上的记分牌来到这里,那么右列几乎肯定放错了 Google 模型。
每一个实际上是做什么的
• 输入能力——Qwen3.8-Omni-Flash 可接受文本、图像、音频和视频,包括立体声和四声道空间音频;Gemini Omni 1.1 Flash 可接受文本和图像提示词,以及最长三秒的参考视频。
• 它能带来什么 —— Qwen3.8-Omni-Flash 仅返回文本;Gemini Omni 1.1 Flash 则返回带原生同步音频的视频,其场景可按 10 秒为单位递增,最长可延长至 40 秒。
• 控制界面——Qwen3.8-Omni-Flash 提供上下文、采样以及一种会自行决定要看什么的智能体模式;Gemini Omni 1.1 Flash 提供首帧和末帧控制、用于保持连续性的十秒回溯窗口,以及一个 360p 草稿档位,Google 称其成本约为三分之一,速度约快 60%。
• 分辨率与成品效果——Qwen3.8-Omni-Flash 没有输出分辨率,因为它不生成任何媒体;Gemini Omni 1.1 Flash 的输出分辨率为 720p、1080p 和 4K。
• 上下文与时长 —— Qwen3.8-Omni-Flash 单次调用可承载一百万个 token 以及长达一小时的连续音视频;Gemini Omni 1.1 Flash 的边界在于它正在生成的片段,而非输入窗口。
• 付费方式——Qwen3.8-Omni-Flash 按 token 计费:国际价目表为每百万输入 0.15 美元、缓存 0.016 美元、输出 0.47 美元;Gemini Omni 1.1 Flash 按生成视频的秒数计费,Google 公布的 720p 费率为每秒 0.10 美元。
• 开放性——双方均闭源。两个模型均未公开权重,且目前都无法通过我们的 API 进行路由。

重叠之处在于视频理解,而且它是不对称的
买方能合理地将这两者放在一起比较的唯一场景,是一条既要理解素材又要生成素材的流水线——比如说,一个剪辑助手:读取一段长录像,找出值得保留的片段,并生成一个剪辑。在理解这一侧,Qwen3.8-Omni-Flash正是为此打造的:每次调用可处理连续一小时的音频和视频、进行说话人分离,并具备智能体模式,使厂商的 OmniVideoBench 准确率从 63.4 提升到 67.8,同时将每次查询的 token 数从 145,736 降至 79,117。在生成这一侧,Gemini Omni 1.1 Flash才是能够生成带有同步音频的结果片段的那一个,而 Qwen 的模型根本连一帧视频都生成不了。
这种不对称性反过来也成立,而且更容易被忽视。视频生成模型对理解力的掌握是工具性的——它需要足够的场景信息来保持一个镜头在十秒延伸中的一致性,这与回答会议第三小时说了什么的问题是不同的需求。Google的模型在生成质量上有着更长的记录,而在长格式分析上则较短;Alibaba的则相反。如果你的任务是“在这段录音中找出关键的三分钟”,那么生成模型不是合适的工具。如果你的任务是“制作一个符合这份简报的三十秒片段”,那么理解模型也不是合适的工具。
为什么价格比较总是出错
按秒计费与按 token 计费无法换算,而试图换算它们会产生主导这场对比的两个错误。第一个错误是把整个生成的片段与按 token 计的输入费率进行比较,并得出视频模型贵数百倍的结论——这虽然属实却毫无意义,因为它们卖的根本不是同一种东西。第二个错误是只比较输入价格,却忽略了 Alibaba 的 98% 音频降价适用于输入音频小时数,而 Google 的费率适用于输出视频秒数,所以这两种“降价”甚至不在计价器的同一侧。
可以如实说的是这样。按照阿里巴巴自己的方法——两分钟样本乘以三十,视频为 720p、每秒一帧——向 Qwen3.8-Omni-Flash输入一小时的音视频合计,报价约为 0.20 美元,相比上一代的 3.27 美元有所下降。用 Gemini Omni 1.1 Flash生成四十秒 720p 视频,按谷歌公布的每秒 0.10 美元计算,成本为 4.00 美元;而按谷歌的三分之一成本口径,起草同样的四十秒 360p 视频,成本接近 1.20 美元。两组数字均为厂商自报,且都没有经过独立复现。有用的结论不在于哪个数字更小,而在于分析一小时素材与生成其中四十秒处于同一数量级——这才是同时做这两件事的生产流程真正需要成本模型、而非需要分出赢家的原因。
这也是把两者放在同一个密钥下、而不是拆成两份合约的理由。目前两个 omni 模型都无法通过 OrcaRouter 路由:Qwen3.8-Omni-Flash 只在阿里巴巴自家的平台上运行,而 Google 尚未把 Omni 视频 API 开放给第三方路由,所以我们两者都不托管,也不会假装托管。我们目录里真正上线的是每个家族的同类模型——Qwen3.8-Flash 和 Gemini 3.8 Flash——如今两者都可以通过 一个端点按供应商标价、0% 加价调用,正因如此,要与任一厂商自家数据做 A/B 对比,只需改一下配置,而不必再做一次集成。

各自胜在何处,直截了当地说明
Qwen3.8-Omni-Flash在一切以输入小时数来衡量的项目上都占优:会议转写与说话人分离、长录音摘要、音频密集型智能体工具调用,以及每处理一小时媒体的成本。其厂商报告的音频结果很强劲,而它的短板恰恰落在该模型从未瞄准之处——那些偏重推理的榜单:在首批第三方测试中,它在推理上处于第28百分位,速度指标位于第21百分位,而样本量小到这些数字只应被当作提示你去亲自测试,而非最终定论。
Gemini Omni 1.1 Flash在输出上胜出:带同步音频的镜头生成、长场景的连贯性、帧级控制,以及交付流程可能恰恰需要的 4K 成片。它的优势不在于基准测试分数——而在于另一个模型根本做不了这项工作。它的弱项在于任何需要保持一小时上下文的任务,因为它并非为此而设计。
决定,以及值得关注的事
如果你要在两者之间做选择,问题就在于这条流水线的哪一半还没有被覆盖。一个已经能生成视频、又需要理解长录音的团队,这周就该用自家音频去测试 Qwen3.8-Omni-Flash;而一个分析媒体、又需要产出媒体的团队,则应该去测试 Gemini Omni 1.1 Flash。两者都需要的团队,面对的是两家供应商、两套计费模型和两套集成方案,而正是在这种情况下,单一路由层不再只是一种便利,而开始成为让成本模型保持清晰可读的关键所在。
有两件事会改变这一判断。对Qwen3.8-Omni-Flash进行独立评估,将用可比的数字取代上述所有厂商数据——目前尚无此类评估,而这一缺失正是本次对比中最大的单一空白。此外,Google若公布1080p和4K输出的费率,将使高端算账变得可核实;如今这些数字仅以市场估算的形式流传,而非Google自己的报价单。

关于表述框架,最后再说一点。“Omni”已不再精确指代任何东西——它现在既涵盖读取一小时会议音频的模型,也涵盖渲染出带声音的四十秒片段的模型,而把这个词当作一个类别,正是买家最终拿按 token 计费的价格与按秒计费的价格作比较,并据此得出结论的原因。这些模型是互补的,仅有狭窄的重叠;在它们各自发布五天后和四周后,对两者采取的正确姿态是一样的:用自己的材料来衡量它们,并保持第二条路径畅通。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
