生成的标题卡标题为“Union Alpha vs Qwen3.8 Flash”,副标题为“在唯一同时运行两者的测试中仅相差一分”,上方有三张圆角卡片,分别写着“Official A:136/157 vs 137/157”、“上下文:262,144 vs 1,000,000 tokens”和“首 token 时间:10.00 秒 vs 6.62 秒”。页脚写着 Official A 依据 SMF Clearinghouse,延迟依据 OrcaRouter 过去 7 天的数据。
Guides & Insights

Union Alpha vs Qwen3.8 Flash:一点便是全部

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Union Alpha 和 Qwen3.8 Flash 在唯一一个同时测量了两者的测试上仅相差一分。在 SMF Clearinghouse Official A 套件上——157 项测试,关闭推理——Union Alpha 得分 136,而 Qwen3.8-Flash-Next 的一次本地运行得分为 137。这是这两个模型最接近的正面对比结果,同时也是本次比较中最具误导性的数字,因为这两个条目并非在相同条件下运行,而且其中只有一个是你现在真正能租用的模型。

一分之差能告诉你什么,不能告诉你什么

先看它证明了什么。Union Alpha 在通常意义上并非虚张声势——一套涵盖 157 项测试的广泛测试集、零错误、完美推理(30/30)与完美工具使用(2/2),这不是一个空洞的端点所能产出的结果。其编码成绩 26/30、数学成绩 24/30,使它处于可信的区间;而写作得分 2/5,则让它远谈不上能胜任通用散文类工作。

现在来说说那些至关重要的注意事项。

Qwen3.8 Flash 那一项是本地运行的 Qwen3.8-Flash-Next——开放权重检查点——而不是托管的 Qwen3.8 Flash API。本地服务意味着用你自己的量化、你自己的推理栈、你自己的工具调用解析器。这些都不能保证与托管端点返回的结果一致,而运行该测试的人正是出于这个原因,把这一比较标记为非决定性的。

一个测试套件并不等于一份画像。Official A 覆盖面广,但每个类别都很浅:工具类只有 2 个测试。一个只有两项测试的工具类别拿到 2/2,是个好迹象,但并不能作为智能体可靠性的证据;而 Union Alpha 被明确地定位为智能体与编程模型。这个测评工具衡量的东西与所声称的能力只是相近,并非同一回事。

而那一个点本身,就落在 157 项测试套件的噪声范围之内。把 136 和 137 理解为“它们处于同一区间”,而不是一种排名。

并排

• 上下文窗口 — Union Alpha 262,144 个 token,对比 Qwen3.8 Flash 提供 1,000,000 个 token(原生 262,144,经由 YaRN 扩展)。

• 最大输出 — Union Alpha 131,072 tokens 对比 Qwen3.8 Flash 131,000 tokens。基本持平。

• 输入 — Union Alpha 支持文本和图像,而 Qwen3.8 Flash 支持文本、图像和视频。

• 定价 — Union Alpha 预览期间为 $0,而 Qwen3.8 Flash 为每百万输入 token $0.150、每百万输出 token $0.470、每百万缓存读取 $0.018、每百万缓存写入 $0.230。

• 推理控制——Union Alpha 上没有,而 Qwen3.8 Flash 上有一个默认开启且可禁用的思考模式。

• 首个 token 时间 —— Union Alpha 10.00 秒 p50 对比 Qwen3.8 Flash 6.62 秒 p50,两者均在我们的端点上,于相同的七天窗口内测量。原始解码速度比传闻所暗示的更接近:每秒 170 个 token,对比 103 个。

• 溯源——匿名运营方,无权重对比阿里巴巴/通义千问,通义千问3.8-Flash-Next的权重已在Hugging Face和ModelScope上开源。

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash:一场以 6B 激活参数押注效率的豪赌

Qwen3.8 Flash 于 2026 年 8 月 26 日发布,是开放权重检查点 Qwen3.8-Flash-Next 的生产级托管版本,阿里巴巴同时发布了该检查点。它是一个 125B 参数的混合专家模型,每个 token 激活约 6B 参数,另有 51B 的 N-gram 嵌入参数,构建于将 Gated DeltaNet 与稀疏注意力索引器相结合的混合注意力之上。

厂商的表述围绕训练经济性展开:阿里巴巴称其运行成本约为 Qwen3.7-Plus 的九分之一,并声称在缓存命中率高的 100 万 token 工作负载上,预填充最高可提速 7.6 倍、解码最高可提速 4.9 倍。这些都是厂商提供的数据,尚未经过独立复现。

它的基准测试表同样是厂商自行报告、未经复现的:SWE-bench Pro 62.5、DeepSWE v1.1 58.7、SWE-bench Multilingual 81.0、NL2Repo 48.1、CoWorkBench 73.9、JobBench 55.7、RealWorldQA 88.5、LVBench 76.6、AndroidWorld 84.5。真正值得拿来反诘营销话术的数字,是 Humanity's Last Exam 的 35.9——在同一项对比中,这一成绩低于 Claude Opus 4.6 的 40.0。

在我们自己的模型页面上,公开基准测试部分仍然显示“待定”——还没有第三方给它打过分。我们真正拥有的是自己的流量数据:6.62秒的中位首令牌时间、每秒103个token的输出速率,以及4.5%的错误率。这个错误率高得足以值得关注,而且这种数字只有在测量实时端点而非发布公告时才会出现。

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha:无主模型

Union Alpha 于 2026 年 9 月 16 日出现在第三方目录中,并通过OrcaRouter 的免费层提供服务。它没有具名实验室,没有权重,没有许可证,没有参数数量,也没有架构说明。其提供方字段显示为“Stealth”。

至少它的端点规格是清晰可读的:262,144 token 上下文,131,072 token 最大输出,支持文本和图像输入但仅输出文本,支持工具调用、JSON 输出、temperature、top_p 和 max_tokens,而且完全没有任何推理控制项。工具选择实际上只承认“auto”。其免费窗口被描述为大约一周,有速率限制,且未公布预览期后的定价。

所声称的——“在广泛通用任务上达到前沿水平的性能”——是由运营方报告且未经审计的。136/157 的 Official A 结果是目前唯一存在的独立测量结果。

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

速度,正是它们不再相似的地方

那些引人注目的吞吐量数字并没有像你预期的那样将它们区分开来,而其中的原因值得理解。

根据我们自己过去七天的路由遥测数据,Qwen3.8 Flash 的流式输出速度为每秒 103 个输出 token,首 token 时间的 p50 为 6.62 秒,错误率为 4.5%。以相同方式测量的 Union Alpha,流式输出速度为每秒 170 个 token。就原始解码速度而言,这个匿名模型是两者中更快的那个。

它做不到的一点是启动。Union Alpha 的 p50 和 p95 首 token 时间都卡在 10.00 秒,这意味着至少一半的请求在首个 token 出现前要等待十秒或更久,而同一时间窗口内的错误率为 7.7%——约为 Qwen 的 1.7 倍。前文几节所依赖的 157 项测试的 Official A 运行耗时 4.6 小时(墙上时钟),每次测试的中位延迟为 91.9 秒,平均值为 104.8 秒,且有四项测试触发了测试框架的 300 秒超时。在发布当天运行它的独立测试者报告的吞吐量远低于我们的端点所显示的水平,而对于一个仍在承受巨大首日负载的服务来说,这正是意料之中的情况。

因此,实际差异不在于解码速度,而在于首 token 时间和可靠性。Union Alpha 无法用于任何交互式场景——没有自动补全,没有内联辅助,也没有紧凑的智能体循环——因为十秒的静默与卡死毫无区别。它适合异步工作:通宵批处理任务、长文档处理、离线评估运行——在这些场景中,没有谁在等待首个 token,而 7.7% 的失败率可以靠重试来吸收。

Qwen3.8 Flash 每秒 103 个 token、首 token 延迟中位数为 6.62 秒,也算不上快。客观地说,两者都很慢,而且只有其中一个大约每十三个请求就会失败一次。

效率论,以及谁有资格提出它

阿里巴巴提出了一个训练成本上的论点:训练成本仅为 Qwen3.7-Plus 的九分之一,每个 token 激活六十亿参数,因而服务成本低廉。这是针对一个权重已然存在、谱系有据可查的模型所做出的说法。

Union Alpha 的效率叙事是暗示出来的,而非明说的——一个 256K 的匿名模型,可免费调用。免费并不等同于便宜。那些 GPU 总得有人买单,预览版有明确的结束时间,而运营方自己承认他们一直在为速度做调优,这表明服务经济性尚未定型。一个免费一周、之后却无法定价的模型,其效率论证会随着这个窗口期一同失效。

尝试未知,但不押注其中

这个特定对比之所以值得你记在脑子里,是因为它是对一个未经检验的模型所能做的最廉价的测试。Qwen3.8 Flash 是已知量:有具名的厂商、开放的权重、已发布的(尽管带有厂商色彩的)基准测试,以及真实的每 token 价格 $0.150/$0.470。Union Alpha 则是未知数,定价为零,其全部的竞争主张都依赖于一项 157 项测试的结果。

与其二选一,不如把那个未知的选项放在故障转移规则后面。OrcaRouter 以 0% 的加价率直接透传提供商的标价,并支持跨提供商的自动故障转移,因此当某个被限流或已消失的 Union Alpha 端点不可用时,请求会落到仍在正常响应的模型上,而不是在凌晨三点变成一个失败的任务。两个模型共用同一个密钥,所以这次试验的代价只是一次配置变更,而不是再做一次集成——而且两者都不必成为你需要为之辩解的决定,因为免费窗口关闭时,你可以随时切换路由。

判决

Qwen3.8 Flash 是值得在其上构建的模型。六十亿活跃参数、开源的同系列权重、100 万 token 窗口、视频输入、实际可达每秒 103 tokens,以及一个你可以预测的已公布价格。它的基准测试由厂商报告,其错误率值得关注,但它属于某方,而那一方正在交付。

Union Alpha 是值得衡量的模型。它在 Official A 上的一分差距确实很有意思——这表明无论这东西是什么,它都不是玩具——而且以 0 美元的价格、131K 的输出上限和视觉输入,它值得你花一周时间关注。但是,一个匿名操作者在某个测试套件上造成的一分差距,且错误率为 7.7%,这是值得调查的理由,而不是切换的理由。

真正需要关注的,和一直以来决定这件事的因素是同一个:名字。本系列的上一款 Ox Alpha,是在作为智谱的 GLM-5.3-Flash 出现六天后才揭晓的。如果 Union Alpha 也有了自己的名字,那这场比较的焦点就不再是一分之差,而是价格了。

已知项已有定价,也有文档记录:Qwen3.8 Flash 模型页面显示了每百万 token $0.150/$0.470 的费率、100 万 token 的服务上下文以及 131K 的输出上限,而公开基准测试结果仍有待公布。