一张生成的标题卡,上面写着“Boreal vs Qwen3.8 Max”,副标题为“每个厂商都希望你跳过的那一行”,配有视频播放框、一张其中一行被高亮显示的记分卡和一枚放大镜的扁平线性图标,右下角合成有 OrcaRouter 标志。
Guides & Insights

Boreal 对比 Qwen3.8 Max:每个厂商都希望你跳过的那一行

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

每一次模型发布都会公布一张数字卡片,而每张卡片上都有一行是厂商宁愿你别多看的东西。Qwen3.8 Max于2026年8月3日发布,其中那些好看的行很容易找:它以1,691分在CodeArena前端排行榜上拿下第一,在Artificial Analysis Agentic Index上达到58分,与高推理强度下的Claude Opus 5并列——这是中国实验室距离该榜单榜首最近的一次——并且取得1,739 Elo的GDPval-AA分数,领先于GPT-5.6 Sol。而它们下面的那一行就没那么好看了。在同一评测方的测试套件中,实测幻觉率从前一代的23%上升到40%,模型的长上下文检索分数还掉了两分。Boreal是Creatify的广告视频模型,于2026年9月15日发布,定价为每秒一美分,它自己的卡片上也有一行同类的数据——而且更为具体,因为这是厂商自己公布的。

两行都不构成取消资格。两者都比标题分数更具信息量,这就是为什么值得把它们并排放在一起,而不是去比较横幅。

Qwen3.8 Max 真正最擅长的是什么

这些胜利是真实的,而且并不小。

Qwen3.8 Max 是一个拥有 2.4 万亿参数的专家混合模型,每个 token 大约激活 950 亿参数,而它是阿里巴巴表示将以开放权重形式发布的首个 Max 级 Qwen——宣布于 2026 年 8 月 10 日当周发布,但没有许可证或确定日期,这一点值得注意,因为宣布并不等于发布。它带有 100 万 token 的上下文窗口,输出上限为 131,072 个 token,并且接受文本、图像和视频作为输入。最后一点在这一特定比较中值得强调:在本系列拿来与 Boreal 对标的四个前沿文本模型中,Qwen3.8 Max 是仅有的两个可以交给它一段现成视频片段并就其提问的模型之一。

定价激进,在某种程度上重塑了这一细分市场。输入每百万 2.00 美元、输出每百万 6.00 美元,缓存读取为 0.25 美元,这比上一代便宜约 20%,同时将最大输出长度翻倍。在我们的榜单上,这体现为 2.00 美元和 6.00 美元、100 万 token 上下文、10.00 秒的首 token 时间 p50——这是我们监测工具所报告的上限,所以应将其解读为“慢”,而非精确值——以及过去七天 1.83 亿 token 的流量。

以及下面那一行

这是没能成为发布帖标题的那部分。

Artificial Analysis 的独立评估记录了 Qwen3.7-Max 与 Qwen3.8 Max 之间的两项退步。其长上下文检索指标下降了两分。其全知性指标下降了十分,而评估方测得的幻觉率从 23% 升至 40%。与此同时,该模型在智能指数上的单任务成本从 0.53 美元升至 1.14 美元——它完成每个任务大约需要 64 轮,而其前代只需 14 轮。

把这些放在一起读,一幅连贯的图景便浮现出来。Qwen3.8 Max 这个模型,在那些只有唯一正确答案的基准测试所能衡量的方面变得更好了——代码、智能体任务完成、结构化问题求解——却在最难评分的那一点上退步了:知道自己不知道。一个思考得更多、也产生更多幻觉的模型,并不自相矛盾。更长的推理轨迹制造了更多机会,让它笃定地给出错误答案,而一个奖励任务完成的基准测试不会为此施加惩罚,除非任务中存在某个可被违反的隐藏不变式。

对买家而言,实际后果狭窄而具体。如果你对模型的使用是代码生成,或是错误答案会大声报错的智能体工作流——测试失败、构建中断——那么退步基本上不可见,提升就是全部。如果你的用途是检索、摘要,或任何流畅但错误的答案未经核查就到达人手中的场景,那么决定你评估的应当是 23 到 40 这一变化,而不是 CodeArena 的排名。

Boreal 自身最差的一行,由厂商发布

让这种搭配变得有用的对比在于,Creatify 做了大多数供应商不会做的事:它把最弱的结果和最强的结果放在了同一篇帖子里。

Boreal 在一项盲测中与其自身未经改动的基础模型进行了对比,提示词、分辨率、帧数和随机种子均保持不变,覆盖 40 个生产案例。Creatify 报告称对 Boreal 的偏好率为 81%——25 比 6,另有 9 次平局,符号检验 p<0.001——随后对这一平均值进行了细分。产品广告:83%。创作者和 UGC 场景:85%。单人出镜口播片段:60%。

最后那个数字就是这一行。口播是直效广告中最常见的格式之一,而正是在这种格式上,该模型相对于自身基线的优势最薄弱——与一个根本没人会发布的模型相比,几乎只比抛硬币好一点。渲染在 720p 级别下标称为与实时 1:1,细部细节保留率在 p=0.004 时提升了 11.3%,所以总体情况确实乐观。细分结果只是告诉你,这个模型是为该类别的哪一半调优的,而它并不是有人对着镜头说话的那一半。

还要注意这些条目各自属于哪一类证据。Qwen3.8 Max 的性能退步是由独立评测方用其自有的评测框架发现的。Boreal 表现不佳的那一行则是由厂商自己披露的,测试也由厂商设计并执行。作为事实陈述,后者更可信;作为比较,它的信息量却更小,因为 Boreal 的文件里根本没有任何独立数据。

A generated two-column scoreboard for Boreal vs Qwen3.8 Max sharing six dimension labels. Boreal reads output rendered video, input text or one image, meter $0.01 per second, context not published, latency 1:1 realtime, independent score none yet. Qwen3.8 Max reads output text 131K max, input text image video, meter $2 / $6 per 1M, context 1M tokens, latency p50 10.00s TTFT, independent score AA Index 58 with 2 regressions. Footer reads "Boreal figures vendor-run and unreproduced; Qwen3.8 Max per our catalogue and Artificial Analysis."

规格对比

• 输出 — Boreal:生成渲染视频,720p 级别,支持文生视频与图生视频。Qwen3.8 Max:仅支持文本,最高 131,072 tokens。

• 输入 — Boreal:文本提示词或静态图像。Qwen3.8 Max:文本、图像和视频。

• 价格——Boreal:成片视频每秒 $0.01。Qwen3.8 Max:每 100 万输入 $2.00 / 每 100 万输出 $6.00,缓存读取为 $0.25。

• 上下文 — Boreal:未发布。Qwen3.8 Max:输入 1M tokens,输出 131K。

• 延迟 — Boreal:报价为 1:1 实时。Qwen3.8 Max:在我们自己的测试中,首 token 时间的 p50 为 10.00 秒。

• 权重 — Boreal:专有,由 Creatify 拥有并提供服务。Qwen3.8 Max:发布时为专有;阿里巴巴已宣布将为首个 Max 级 Qwen 推出开放权重版本,但尚未确认许可证或日期。

• 证据 — Boreal:由供应商自行开展的 40 例盲测,无独立评估。Qwen3.8 Max:具备独立基准测试覆盖,包括两项实测到的性能回退,同时供应商数据行显示其在 OSWorld-Verified 上得 86.1 分、在 Terminal-Bench 2.1 上得 86.6 分。

一次回归对买家来说价值几何

排行榜上的退步通常被当作无关紧要的小事。其实它们更接近基准测试所发布的最具决策相关性的信息,因为只有这些条目才能告诉你,厂商究竟牺牲了什么。

有用的做法不是去读任何一张模型卡,而是用你自己的流量来跑这两个模型——而实际的阻碍在于,这通常意味着两份合同、两套 SDK 和两套计费关系,这种摩擦足以让大多数团队跳过测试,转而根据宣传中的分数来做购买决策。

这种摩擦正是路由层要消除的部分。Qwen3.8 Max 已在我们的目录中与上一代产品并列,因此在你自己的评测集上对二者进行比较,只需改一下模型字符串这一行代码,而无需走一轮采购流程;而当比较结果表明流水线不同阶段需要不同模型时,同一把密钥就能调用目录中的其余模型。它的定价处于供应商目录价,加价 0%,这一点在这里尤为重要,原因很具体:Qwen3.8 Max 比它所取代的那一代便宜约 20%,而这类供应商调价应当在其发生时就直接反映到你的账单上,而不是等到下一次续约。

Boreal 不在我们的产品目录中。OrcaRouter 不提供视频生成模型,这里的任何内容都不应被解读为相反的声称。我们提供的是其上层部分——文案、变体、合规检查、对表现效果的分析——而本系列中的两个模型,其中包括 Qwen3.8 Max,可以接收完成的视频片段进行审阅。

A screenshot of Creatify's own launch post for Boreal, dated September 15 2026 and headed "Introducing Boreal: frontier-quality AI video at a cent a second", showing the Boreal by Creatify Labs logo card and the opening paragraph stating that Boreal generates text-to-video and image-to-video at one cent per second, about $0.05 for a five-second clip, and renders in realtime.

如何读取任意一张卡

Qwen3.8 Max 是更值得入手的选择——如果你的工作是代码、智能体或结构化推理,而它的价格还低于自己的上一代;那两项独立的性能回退,正是你在把生产流量导过去之前,先用自己的检索和摘要流量测试它的理由。40% 的幻觉率并不是回避这个模型的理由;它是让你弄清哪些工作负载能容忍这一点的理由。

Boreal 是两者中唯一能产出本次对比名义上所指成果的那一个,而且按公开报价计算,它是短视频广告最便宜的可信选项。它的局限与特定格式相关,且由其自家供应商明确说明:在单人出镜口播类片段上的偏好度为 60%。要先于产品广告测试这种格式,因为那里的提升空间最小。

有两件事会改变这一局面。如果阿里巴巴将其为 Qwen3.8 Max 宣布的开放权重正式发布,那么该模型的定价和持久性都会发生变化,而它发布时所依据的许可证,其重要性将超过发布日期。而对 Boreal 而言,第一次独立评估——无论何种形式、由谁来做——都将取代一项仅含 40 个案例的厂商自测;在为这样一种业态供货的模型中,品牌对自家产品外观异常敏感,而目前全部证据支撑都压在这项自测上。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing Qwen3.8 Max by Qwen dated 2026-08-03 marked Featured, a 1M-token context, text + image + video input with text output, a p50 time to first token of 10.00 seconds, input $2.00 and output $6.00 per 1M tokens, and 183.0M tokens of traffic in the last 7 days.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新