
Qwen3.8-Omni-Flash 与 Qwen 3.8:专才款与旗舰款之争
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 196 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
如果你想要简短版:Qwen3.8-Omni-Flash大约每个 token 便宜十三倍比Qwen 3.8,并且是这两者中唯一一款为能承载长达一小时的音视频而不卡顿而打造的——而Qwen 3.8,作为 Qwen3.8 系列顶端的 2.4 万亿参数开放核心,则是当答案必须正确而非便宜时你会用的那个,也是两者中唯一一款你可以下载其权重的模型。它们共享上下文长度、家族名称以及 8 月至 9 月的发布窗口。它们并非彼此的替代品,而这项比较的全部价值,就在于弄清楚你实际问的是哪个问题。
先澄清一下命名,因为这个家族实在人丁兴旺。Qwen 3.8在这里指的是 2.4T-A95B 的混合专家开放核心——即 Qwen3.8-Max 接口背后的那个模型。阿里巴巴于 2026 年 8 月 3 日发布该模型,8 月 12 日公开权重,Artificial Analysis 给出的评分为40(Intelligence Index)。Qwen3.8-Omni-Flash是阿里巴巴于 2026 年 9 月 18 日投入 API 服务的原生全模态模型,基于 Qwen3.8-Flash 架构系列构建,可输入文本、图像、音频和视频,输出文本。如前所述,关于旗舰模型的一切信息要么来自厂商自述,要么由独立机构测评得出;而关于这款全模态模型的一切信息则仅来自厂商自述,因为它才刚发布数小时,阿里巴巴之外无人对其进行过实测。
两款型号,同一系列,截然相反的设计理念
人们很容易把它读成同一代的大模型与小模型,就像把 Qwen3.8-Max 对照 Qwen3.8-Flash 来读那样。但这种读法是错的,而且错得很费钱。Qwen 3.8 核心是一个恰好能接受图像和视频的推理引擎;它的吞吐量以解决难题时每秒处理的 token 数来衡量,其定价反映的是 950 亿激活参数前向传播所需的算力成本,而它的评测表是一串推理与编程榜单。Qwen3.8-Omni-Flash 则是一个恰好会推理的感知与行动引擎;它的定价对标的是摄取数小时媒体内容的成本,其评测表是一串音频、视频和工具调用榜单。前者针对每个 token 的深度进行优化,后者则针对每小时内内容所对应的 token 量进行优化。
这种差异在一个营销宣传不会提及的地方显现得最为鲜明。这两款模型都接受大约一百万 token,也都接受视频。但Qwen3.8-Omni-Flash明确围绕时长问题进行了工程设计——单次调用最多可处理长达一小时的连续音视频,并配备了 Agentic Understanding 模式;在该模式下,模型会自行选择采样内容,而不是处理每一帧,从而将每次查询的 token 数从 145,736 降至 79,117,同时把 OmniVideoBench 上的准确率从 63.4 提升至 67.8。Qwen 3.8则没有公布任何等效机制。从理论上说,给它输入两小时视频是可行的;但要以一个能扛得住财务团队审视的价格做到这一点,就是另一回事了,而这正是这款全模态模型被打造出来要回答的问题。
真正决定它的维度
• 价格 — Qwen3.8-Omni-Flash 每百万输入 $0.15、每百万输出 $0.47,而 Qwen 3.8 则为 $2.00 和 $6.00。缓存读取:$0.016,相比之下为 $0.25。
• 开放权重 — Qwen 3.8 于 2026 年 8 月 12 日依据自定义许可证发布了权重;Qwen3.8-Omni-Flash 仅提供 API,且 Alibaba 尚未表示会将其发布。
• 上下文 — 两端均为一百万 token;omni 模型的最大输入为 991K,最大输出为 131K,推理预算为 262K。
• 媒体时长——单次 omni 调用中最多支持一小时连续音视频;旗舰模型已记录支持视频输入,但未附带按小时计费的成本说明。
• 输出模态——两侧均为文本。尽管带有 omni 模型的血统,但两者都不生成语音。
• 独立评分——Qwen 3.8 在 Artificial Analysis 智能指数中得分为 40。Qwen3.8-Omni-Flash 目前尚无任何类型的独立评分。

为什么基准表无法解决这个问题
并不存在正面对比的榜单,短期内也不会有。阿里巴巴为Qwen3.8-Omni-Flash发布的材料中,只将其与Qwen3.5-Omni-Plus——它的直接前代——以及 Gemini 3.8 Flash 进行基准对比;而旗舰机型的数据则完全来自另一套推理与编程评测。两份表格没有一行是共通的。任何发布对照表、把它们放在同一条坐标轴上的人,那条坐标轴都是他们自己造出来的。
诚实地说,能说的只是方向性的。按照厂商自己的数据,omni 模型相比它所取代的 omni 产品线是一次大幅跨越——在大约三十项评测中平均提升超过 26%,其中 WildClawBench-MM 为 71.0,UniClawBench 为 69.6,LongAudioSpan 为 82.7——而面对 Gemini 3.8 Flash 时则是真实但局部的优势:它在以音频为核心的榜单上领先,例如 SpotSoundBench(67.2 对 39.7)和 MMAU(81.8 对 76.9),却在纯视频推理的 AgenticVBench(36.8 对 45.0)上落后。旗舰方面,Qwen 3.8 的 Index 得分 40 是一项独立测量,比上述任何一项都更有价值。这些是不同种类的证据,不应被平均在一起。

一个已演算的成本对比,并说明假设
以一项长文档与视频分析任务为例:300,000 个输入 token 和 20,000 个输出 token,这大致是一场带幻灯片的九十分钟录制会议的规模。对于 Qwen3.8-Omni-Flash,即 300,000 × 每百万 $0.15 = $0.045的输入,以及 20,000 × 每百万 $0.47 = $0.0094的输出,因此大约 5.4 美分。对于 Qwen 3.8,同样的调用为 300,000 × 每百万 $2.00 = $0.60,以及 20,000 × 每百万 $6.00 = $0.12,或大约 72 美分。同样的 token 数量,成本略高于十三倍。
改变决策的数字不是比率,而是用量。每天一百个这样的任务,就是每天约5美元对约72美元——这决定了一个功能是上线,还是缩减范围。但如果任务是从一份30万token的合同中做一次高难度提取,而一个错误答案要耗费一小时人工复核,那么13倍的溢价就无关紧要,更强的推理模型赢就赢在它没有犯的第一个错误上。要在看价格那一行之前就设定假设,而不是之后。
各自真正胜出的地方
Qwen3.8-Omni-Flash在任何以小时计量的任务上都胜出:带说话人分离与后续任务提取的会议转录、长视频摘要、音视频研究报告、字幕生成流水线,以及任何需要自行判断录音中哪一分钟重要的智能体。厂商报告的说话人分离改进——AliMeeting 说话人错误率从 88.11 降至 3.35——正是那种能把人工复核的流水线转变为自动化流水线的量级差异,不过一篇关于此次发布的中文技术分析认为,这一提升很大一部分来自围绕模型所做的前端与说话人分离工程,而非模型本身,所以在取消人工复核环节之前,请先用你自己的音频做基准测试。对于任何文本质量足够胜任的大批量文本工作负载,这款全模态模型在价格上也直接胜出;阿里巴巴声称其文本质量与同规模纯文本模型相当——这一说法尚未被复现,值得实测而非想当然。
Qwen 3.8在任何以评判而非计数来衡量输出的场景中都胜出:高难度推理、长时程智能体工作、大规模代码工作、以及百万级 token 的文档分析——在这些场景里,综合性结论本身就是交付成果。它还在一个与基准测试毫无关系的维度上胜出——它是开放权重的。如果你的约束条件是数据驻留、本地部署、微调,或者只是不想让供应商插手推理链路,那么全能模型根本不在候选之列,任何价格优势都填不平这道鸿沟。在真实部署中,这一个约束条件所决定的选择,比上面所有数字加起来还要多。
在没有两份合同的情况下运行它们
这类对比中的实际摩擦很少来自模型选择本身;而在于你最终要接入两家供应商、两套计费关系和两套客户端代码,才能弄清楚自己想要的到底是哪一个。Qwen3.8-Max——承载 2.4 万亿参数开放核心的端点——已在 OrcaRouter 上线,模型 ID 为 qwen/qwen3.8-max,每百万输入 token 收费 2.00 美元,每百万输出 token 收费 6.00 美元,支持一百万 token 的上下文以及文本、图像和视频输入,并且一个密钥即可访问 200 多个其他模型,均按供应商标价计费,0% 加价,并在某个端点性能下降时跨供应商自动故障转移。Qwen3.8-Omni-Flash并不在该目录中——它运行在阿里巴巴自己的平台上——因此,目前最诚实的配置是:旗舰模型走我们的路由,全模态模型直接调用;而路由层则为你提供了一个位置,在测试完成后放置落败的那一个。

裁决
选择Qwen3.8-Omni-Flash的情形是:输入很长、输出很短,且规模使单位价格成为决定性约束。选择Qwen 3.8的情形是:输入密集、输出即产品,且正确性或部署可控性不容妥协。二者重叠的区域——视频理解——是唯一真正存在正面交锋的地方;在该区域,全模态模型占据成本与时长方面的论据,而旗舰模型则占据推理与开放权重方面的论据。在做出承诺之前,请在你自己的数据上把两者都跑一遍;全模态模型尚无独立评估,而发布日的价格优势恰恰是那种应当用账单而非公告来确认的事情。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
