
Qwen3.8-Omni-Flash 来了:100万Token上下文,音频成本降低98%,仅输出文本
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
此次发布使 Qwen3.8-Omni-Flash于今天,即2026年9月18日,向API客户开放,而它最先亮出的数字是一笔账单,而不是一个得分。Qwen表示,按每小时音频输入计算,新模型的成本低98%,相比其前代Qwen3.5-Omni-Plus;按每小时音频与视频合计计算,低93%。公告中的其余内容都由此框架延伸而来。Qwen3.8-Omni-Flash是一款原生全模态模型——文本、图像、音频和视频输入,上下文长度达一百万个token,单次调用可处理长达整整一小时的连续音视频——而阿里巴巴在推销它时,不是把它说成更擅长描述媒体的模型,而是将其定位为首个旨在作用于其上的Qwen模型。口号是“全维感知。智能体交付。”同一批材料直言不讳地指出的问题在于,该模型只用文本作答:它能听能看,却不会说话。
以下内容均未经独立复现。该模型才发布数小时,尚无第三方对其进行评估,而发布材料中的每一项基准测试和价格数据都来自阿里巴巴自己。凡某个数字由厂商提供,本文会在包含该数字的句子中说明这一点;凡某项解读来自评论者而非厂商,则会注明出处。唯一可以在今天独立核实的事情——即该模型已在阿里巴巴的平台上上线,而不在任何其他人的产品目录中——恰恰是此次发布最不愿谈论的事情。
实际发布的内容
对于一次全模态发布来说,这份规格表干净得异乎寻常,而这本身就是关键所在:该家族上一代全模态模型,是把各自独立的感知编码器拼接到文本 LLM 上组装而成的,而这一代则直接构建在Qwen3.8-Flash架构系列之上,模态是原生处理的,而不是嫁接上去的。
• 输入——文本、图像、音频和视频,接受立体声和四声道空间音频;输出仅为文本。
• 上下文——100万 token,最大输入约为 991K(在思维模式下约为 983K),最大输出为 131K,推理预算最高可达 262K。
• 时长 — 每次调用支持长达一小时的连续音频或音视频,正是这一数字让会议与长视频用例无需分块即可实现。
• 语音覆盖范围——周边工具支持 74 种语言的识别和 29 种语言的语音生成;一篇中文报道称该版本支持 113 种语言和方言的音频输入。
• 可用性——通义千问 AI 平台和阿里云百炼(Model Studio),API ID 为 qwen3-8-omni-flash。模型权重不会公开。一个 Realtime 版本被描述为首个具备声源定位能力的全模态模型。

这个98%是一个成本主张,其背后的计算值得一看
一小时的音频成本下降 98%,这个数字远比一个 token 价格下降 98% 要大得多,而这两者之间的差距,正是这则公告发挥作用的地方。每小时的数字是这样得出的:为一段两分钟的样本定价,再乘以三十,而视频则按720p、每秒一帧采样。用这种方式报出一个生产工作负载的成本是合理的,但它同时也描述了模型被要求去看的东西:每秒一帧足以知道说了什么、屏幕上大致发生了什么,却远远不足以检查帧级别的操作、判断剪辑质量,或捕捉单帧瑕疵。这里有两个变化被乘在了一起——一次真实的单价下调,以及一套激进得多的采样策略——而其中只有前者才是模型本身的改进。
单价本身是具体的。国际定价报价为每百万输入token 0.15美元,每百万缓存输入token 0.016美元,以及每百万输出token 0.47美元。国内百炼定价报价为每百万0.8元多模态输入,较约18元有所下降。请注意,国际和中国大陆的计费系统是分开的,这些数字不可互换;任何直接比较它们的人都会得到错误的答案。
这是本次发布中,路由比平时更为关键的部分。OrcaRouter 以0% 加价转发供应商的标价,因此这类厂商降价在生效当天就能触达我们的客户,而不必等到下一次合同续签。我们的目录中已经有一个真正可验证的对比:Qwen3.8-Flash——与这款模型同期打造的多模态模型——如今已可路由,价格为每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,与阿里巴巴为这款全新 omni 模型给出的标价相同——而在本文撰写前的七天里,它通过我们的 API 承载了 24.7 亿 token 的流量,这足以衡量该档位目前已具备多大的需求。这款 omni 模型本身尚未进入我们的目录,在它进入之前,只在阿里巴巴自家平台上运行,别无他处。我们不打算假装不是这样。
在本次发布中,每项基准测试都只比较一件事
核心亮点是平均提升在约 30 项评测中超过 26%——而且每一项评测都是针对 Qwen3.5-Omni-Plus 进行的。对于一次发布来说,这是合适的基线,但也很狭窄:它只能说明这个系列有所进步,并不能说明它相对于你可能已经在付费使用的任何产品处于什么位置。
各项数据均由厂商报告:WildClawBench-MM 71.0,提升 36.5 分,是这组中单项涨幅最大的;UniClawBench 69.6;AgenticVBench提升 22.3 分至 36.8;LongAudioSpan 82.7,提升 8.3;OmniVideoBench 63.4,提升 9.6;OmniCap-IF 28.2。其中最引人注目的一组是 AliMeeting 上的说话人分离,其错误率从 88.11 降至 3.35,cpWER 从 89.61 降至 17.18——这一跃升幅度之大,值得审视而非喝彩。一篇针对此次发布的中文技术分析恰恰持此观点,认为这一改进在很大程度上应归功于围绕模型所做的前端与说话人分离工程,而非模型自身的推理能力,并提醒说该系统给人的印象是专精于听觉,而深度视频推理相对较弱。这是批评者的解读,并非实测复现,但差距之大,正是要将其记在心里的原因。

另一个值得记住的数字根本不是分数。在阿里巴巴所称的 Agentic Understanding 模式中,模型自行决定要看什么、听什么,而不是逐帧处理,并以由粗到细的多轮方式收集证据。在 OmniVideoBench 上,该模式将准确率从 63.4 提升到 67.8,同时将每次查询的 token 数从 145,736 降至 79,117——减少了 45.7%。准确率上升与成本下降同时实现,是本次发布中最有力的主张,也是最直接支撑其智能体卖点的一点。
Gemini 的对比范围比报道所暗示的要窄。
阿里巴巴的定位是:音视频能力“接近”Gemini 3.8 Flash,而整体音频表现则超越它。剥去包装话术,厂商自报的对比大致如下。WildClawBench-MM:71.0 对 58.9。SpotSoundBench:67.2 对 39.7。MMAU:81.8 对 76.9。DailyOmni:85.1 对 84.0。这些在音频和以音频为中心的工具使用上,都是真实的差距。但它们也是有选择性的。在AgenticVBench这一纯视频推理榜单上,排序发生了反转——Gemini 为 45.0,而 Qwen 为 36.8——而且阿里巴巴自己的说法也承认,Gemini 在多项视频理解测试中仍然领先。一个合理的总结是:Qwen 拿下了全模态中的音频那一半,在视频那一半仍然落后——这与那些标题所主张的并不是一回事。
“Qwen 的首个全模态模型”需要一个限定词
今天广泛流传着一种说法,即 Qwen3.8-Omni-Flash 是 Qwen 的首个全模态模型,这值得准确说明,因为该系列中还有一个更早的成员也完全有资格获得这一称号。Qwen2.5-Omni,一个于 2025 年 3 月发布的 7B 开放权重模型,采用 Thinker-Talker 架构,同样接受文本、图像、音频和视频作为输入——并且它既能生成语音,也能生成文本。这里真正属于首次的是原生全模态:一个构建在 Qwen3.8-Flash 基础之上的模型,而不是一个外挂感知编码器的文本 LLM,外加智能体优先的设计纲要。两种说法都成立;只是其中只有一种被反复传播。如果你在评估该模型时假设本周之前不存在任何 Qwen 全模态模型,你就会对从 Qwen2.5-Omni 的升级路径作出错误定价,而这是我们另行撰写的对比。
工具链才是"智能体"这一主张真正的落脚点
有两样东西随模型一同发布,它们的重要性比模型卡所暗示的更高,因为正是它们把感知转化为交付。Qwen-MM-Plugins是一套面向智能体框架(agent harness)的多模态插件套件,为外部智能体提供图像、音频、视频和文档理解能力,以及长视频记忆与视频编辑能力;它宣称支持 Codex、Claude Code、Qwen Code、Gemini CLI 等多款工具,并内置了具名工具,其中包括 Video2Note——它能把数小时的视频转化为配图 PDF 笔记。Qwen-Live Harness是一个开源的运行时,用于持续实时的全模态交互,充当调度层:用户可实时对话,并把更繁重的工作委派给后台智能体。发布当天的报道中有一处提醒:Gigazine 核查时,Qwen-Live Harness 的 GitHub 页面返回 404,因此在相关仓库可正常访问之前,应把这些工具视为“已宣布”而非“已验证”。
发布所掩埋的那句话:它不说话
对于一个前代产品能够生成语音的模型而言,Qwen3.8-Omni-Flash属于多模态输入、文本输出这一事实,是规格说明中最具决定性的一条,而在相关资料中,它却基本只是以脚注形式出现。这意味着该模型无法单独接入语音到语音的产品中。任何基于它构建的配音、语音智能体或实时对话,都需要一个外部的文本转语音环节,若涉及视频,还需要一个外部渲染器——这正是插件套件与实时测试框架存在的原因。实际后果便是:这条流水线比"单一全模态模型"包含更多活动部件,而延迟必须在所有这些部件之间进行统筹分配。
发布内容中藏着一个巧妙的演示,既说明了这一差距,也说明了这个模型的用武之地。在一项“模型优化模型”实验中,Qwen3.8-Omni-Flash 自主提升了Qwen2.5-Omni-3B的四川方言识别能力,将字符错误率从25.79% 降至 15.30%,并在十二小时内分四轮构建了 3,413 个训练样本。一个能够诊断并修复更小同门模型方言处理能力的模型,正在做转录 API 做不到的事。这一点,而不是基准测试表,才是对这里的“agentic”本应意味着什么的最清晰论证。

什么会改变我们的解读
诚实的现状是:这是一次规格明确的发布,配有极具吸引力的价格叙事,却没有独立评测,而且至少存在一处结构性局限,而公告对此轻描淡写。有三件事可以定论。Artificial Analysis 或 LMArena 上的收录会把厂商数据变成可比较的数据,而目前还没有这样的收录。对 45.7% token 缩减的第三方测试——即准确率上升而成本下降这一说法——将证实这份发布中最有用、也最不炫目的成果。而对 AliMeeting 说话人分离的独立测量则能表明,那 88 个百分点的下降究竟属于模型本身,还是属于它周边的流水线。
在那之前,明智的态度与对待任何刚问世第一天的模型一样:值得测试,但不值得把生产路径押在它上面。如果你已经在通过 OrcaRouter 进行路由,务实的做法是把工作负载继续留在你已经测量过的模型上,并把Qwen3.8-Omni-Flash视为一个候选对象,在你自己的音频和视频上让它与那些模型同台试演,而不是依据任何一方的基准测试表。如果你的用例是中文和英文的长篇会议或媒体分析,这里的 token 经济性足够可观,足以证明现在就进行测试是合理的。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
