
Qwen3.8-Omni-Flash 上线五天:一个入口,没有权重,以及首批并非出自阿里的评分
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
五天后,供应商开放Qwen3.8-Omni-Flash给 API 客户,这款模型仍然只有一个归宿。它运行在供应商自家的 Qianwen 平台及其 Bailian 云服务上;发布以来出现的第三方上架项只是这些相同端点前的代理,并不是该模型栖身的第二个地方。权重尚未发布。发布当日的数字——一小时音频成本降低 98%,相较 Qwen3.5-Omni-Plus 平均提升 26%,一百万个 token 的上下文,纯文本输出——仍然只是供应商自己的说法,且未被复现。五天内真正改变的不是模型,而是它周边的环境:薄薄的一层第三方评分已经出现,框架支持在首日落地,而所有人都在寻找的对比对象是 Gemini 3.8 Flash而不是Qwen3.8-Flash,这个模型正是与它一同打造的。上述每一点都值得比发布报道更仔细地审视。
这扇门是一扇好门,而且它是唯一的一扇。
可用范围扩大了,但并没有变成多个来源。该模型会原样应答 OpenAI 格式的请求,这意味着现有客户端代码大多能正常工作;真正出问题的是端点,因为国际站与中国大陆的主机是各自独立计费的不同服务。指向默认端点的代码要么直接失败,要么以错误的币种计费,而按小时计价的说法只在国际站那边成立。开源客户端库在模型发布首日就提供了支持,这确实很有用,但也不构成第二个供应商:与 Bailian 通信的库,不过是围绕同一个单一供给来源的便利封装而已。
这是一个值得点明的结构性风险。单一来源的模型没有故障转移路径。如果端点被限流、性能下降,或者某个区域彻底停摆,你就无处可去,再多的客户端库支持也改变不了这一点。这也是为什么我们直白地表明自己的立场,而不是暗示另一种情况:Qwen3.8-Omni-Flash并不在我们的目录中。我们不托管它,读者若抱着能够路由到它的期望来注册,就会受到误导。真正可路由的是该系列中的其他模型——Qwen3.8-Flash和Qwen3.8-Max目前都已上线于我们的 API——并且 OrcaRouter 以 0% 的加价率直接透传提供商标价,因此当阿里巴巴的 Omni 模型定价变动时,或者 Omni 模型可供路由的那一天到来时,变更会在当天就触达客户,而不必等到下一次合同续约。

第一批不属于 Alibaba 的评分很单薄,而且并不好看。
在 Artificial Analysis 上,这个模型没有任何数据,而发布五天后,这种缺失本身就是诚实的头条:大家为邻近模型引用的那些排行榜,还没有为这个全模态模型留出一行。这个空白已被别的东西填补。一个第三方评估平台已开始发布针对该模型的运行结果,而它的摘要值得一读,恰恰因为它没说的东西太多了。它报告邮件分类准确率为 99.0%(第 86 百分位),伦理为 95.0%(第 23 百分位),推理为 56.0%,并将其排在第 28 百分位,称其为明显短板;速度落在第 21 百分位,成本在第 58 百分位,整体成功率为 89%。
对这些数据要格外谨慎,不仅是因为样本量小。同一个页面把该模型的发布时间标为9月20日——比阿里巴巴实际发货晚了两天——没有给出任何结果的运行日期,并且在一段描述了表格中并不存在的数字的摘要下方,渲染出一张空白的基准测试表。这更像是一个早期、监管松散的测试框架的特征,而非一次经过严谨测量的评估;而诚实的解读是:这些是首批非厂商来源的数据点,而不是首批可靠的数据点。它们是让你亲自测试该模型的理由,而不是据此得出任何结论的理由。不过,其方向与厂商自身材料通过省略所暗示的情况一致:这是一个感知与长媒体模型,而那些偏重推理的榜单并非它的目标所在。
搜索结果里还埋着一个陷阱,接下来几周会坑到不少人。Qwen 3.8这个文本模型在 Artificial Analysis 智能指数上的得分是四十多,而这个数字已在不止一份摘要中被引用,仿佛它描述的是 omni 模型。事实并非如此。它们是各司其职的两种不同模型,而 omni 模型目前根本还没有指数评分。

基准测试表仍然只是一家厂商在与自己比较
发布数据——在约三十项评测中平均提升超过26%——完全是以Qwen3.5-Omni-Plus为基准衡量的。这说明该系列确实进步了。它并没有告诉你,这个模型与你可能已经在付费使用的任何东西相比处在什么位置,而随之一同流传的那些选择性对比也无法填补这一缺口。厂商报告的对阵Gemini 3.8 Flash的情况是:在音频榜单上取得真正的胜利,而在衡量智能体视频任务的榜单上则是失利——一边是 WildClawBench-MM 71.0 对 58.9、SpotSoundBench 67.2 对 39.7,另一边是 AgenticVBench 36.8 对 45.0、OmniGAIA 74.0 对 78.6。阿里巴巴自己的总结措辞——音视频性能“接近”Gemini,整体音频性能超过它——比它催生出的那些标题更谨慎,而谨慎的版本才是准确的。
• 上下文 — 100 万 tokens,最大输入约 99.1 万(思考模式下约 98.3 万),最大输出 13.1 万。
• 模态 — 输入支持文本、图像、音频和视频;仅输出文本。基础模型不生成语音。
• 时长——每次通话支持长达一小时的连续音频或音视频,这使得会议和长媒体工作无需分块处理即可进行。
• 语言覆盖范围——发布材料中宣称可识别 74 种语言以及 39 种汉语方言,而在其他地方为音频输入引用了更宽泛的数字(113 种语言和方言)。
• 输入细节——支持立体声和四声道空间音频,其中 Realtime 变体被描述为首个能够通过声音定位目标的全模态模型。
• 价格——国际侧每百万输入 token 为 $0.15,缓存为 $0.016,输出为 $0.47,另有单独的中国大陆价目表,两者不可直接比较。
98%是真的,而这不是你的账单
按照阿里巴巴自己给出的测算方法——将两分钟样本乘以三十,视频按 720p、每秒一帧采样——一小时的音频输入费用从 0.28 美元降至不到 0.01 美元,而一小时的音频加视频合计从 3.27 美元降至 0.20 美元。这些降幅很大、很具体,且由厂商自行报告,但它们只是针对一个单项成本。真正重要的算术是:这个单项在你的工作负载中占多大比重。如果一条流水线把大部分 token 花在输出、缓存上下文,或以高于每秒一帧的密度采样的视频帧上,那么账单上实际下降的百分比就会远小于宣传标题所承诺的幅度,而那个标题说的是输入音频,不是总成本。再加上纯文本输出,差距还会进一步拉大:任何需要回话的东西都需要第二个模型,而那个模型是单独计费的。
这正是路由发挥价值的那部分图景。直通式路由器的价值不在于折扣——而在于你支付的是供应商自己的价目表,并且工作负载可以分散到多个模型上,使单一来源模型成为一个组件,而不是一项依赖。一个全能模型,如果它是你唯一能调用的东西,那么在可用性和定价层面都是单点故障。

五天的生产究竟能告诉你什么
三件事可以解决这些悬而未决的问题。对 AliMeeting 说话人分离结果的独立测量——错误率从 88.11 降至 3.35,cpWER 从 89.61 降至 17.18——将表明这属于模型本身,还是属于围绕它的说话人分离与前端工程,至少有一份中文技术分析将大部分提升归因于此。对智能体模式 token 缩减的复现测试——在 OmniVideoBench 上准确率从 63.4 升至 67.8,而每次查询的 token 数从 145,736 降至 79,117——将证实这次发布中最有用的一个说法:模型可以同时变得更好、更便宜。而一个 Artificial Analysis 或 arena 排名,将把上述每一个厂商数字变成可比较的东西,这是模型被选用而非仅仅被尝试的前提。
在那之前,合理的处理方式,与对待任何仅有单一托管方、且没有独立评测的发布仅五天模型一样:值得在你自己的音频和视频上测一测,但不值得让它成为贯穿你整个流水线的唯一路径。如果你的工作负载是中文或英文的长时会议或媒体分析,且成本主要来自输入小时数而非输出 token,那么这里的经济性足够强,足以证明本周就该测试。如果你的工作负载需要语音输出,或者需要在提供商服务退化时有回退方案,那么该模型目前的状态不可能成为完整答案——再多首日框架支持也无法改变这一点。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
