一张生成的标题卡,上面写着“AREX-2 vs Qwen3.8-Max——一个基座,以及其上运行之物”,并带有两个面板。左侧面板标题为 Qwen3.8-Max,列出:自 2026 年 8 月 3 日起上线;100 万 token 上下文,多模态;每 100 万 token 输入 $2 / 输出 $6;今天即可调用。右侧面板标题为 AREX-2,列出:仓库创建于 2026 年 9 月 29 日;没有权重,没有模型卡;哪里都找不到费率卡;哪里都无法调用。页脚写着“第一代 AREX 是在 Qwen 基座上后训练而成的。”OrcaRouter 标志合成在右下角。
Guides & Insights

AREX-2 对比 Qwen 3.8:一个是基底,另一个很可能就构建在其上

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

关于AREX-2与Qwen3.8-Max之间的对决,看起来像是两家中国实验室旗舰系统之间的一场正面交锋,但事实并非如此——不是因为 AREX-2 未经检验(尽管它确实未经检验),而是因为二者处在同一技术栈的不同层级。Qwen3.8-Max 自 2026 年 8 月 3 日起已上线,价格为每百万输入 token 2 美元、每百万输出 token 6 美元,上下文窗口为 100 万 token;其开放权重的同门模型 Qwen3.8-27B和Qwen3.8-Flash分别于 8 月 13 日和 8 月 26 日发布,基准测试结果和价格均已公布。AREX-2 是 BAAI 于 2026 年 9 月 29 日 17:56 UTC 在 Hugging Face 上创建的一个仓库,其中只有一个 .gitattributes,别无他物。而两者之所以并非竞争对手,原因在于一个两家厂商都没有大力宣传的底层事实:BAAI 迄今发布的每一款 AREX 模型,都构建在 Qwen 主干之上。

那不是关于 AREX-2 的猜测。它是针对已经存在的这一代所记录的事实。AREX-Base 是一个基于 Qwen3.5-122B-A10B 构建的 1220 亿参数混合专家模型,拥有 100 亿活跃参数,而 AREX-Turbo 是基于 Qwen3.5-4B 构建的稠密 4B 模型;二者均于 2026 年 7 月 23 日在 Apache 2.0 下发布。因此,这一对比的真实形态并不是智能体对旗舰。而是:阿里巴巴基座今天能为你带来什么,BAAI 的智能体层在此基础上又增加了什么,以及在 BAAI 上传文件之前,第二个问题能回答到什么程度?

Qwen 这边已上线了什么,费用是多少

{{1}}Qwen3.8{{/1}}这一代产品异常易于推理,因为其规格与价格均已公开,且明确分为三个不同层级。

• Qwen3.8-Max—— 于 2026 年 8 月 3 日发布。具备 100 万 token 的上下文窗口,原生支持文本、图像和视频输入,支持思考模式、函数调用和结构化输出,并在五个区域提供三种通信格式(兼容 OpenAI、兼容 Anthropic 以及原生 DashScope)。每百万输入 token 收费 2.00 美元,每百万输出 token 收费 6.00 美元,缓存读取为 0.25 美元。

• Qwen3.8-27B——发布于 2026 年 8 月 13 日。稠密模型,270 亿参数,256K 上下文(262,144 个位置),支持文本、图像和视频输入,Apache 2.0 权重。Qwen 自家模型卡上公布的成绩为:LiveCodeBench v6 上 90.3,GPQA Diamond 上 89.2,OSWorld-Verified 上 84.3,QwenSWEBench 上 79.0——均为厂商自报,未经独立复现。独立测评显示,其 Artificial Analysis 智能指数为 33.7,AA 编程指数为 68.1。

• Qwen3.8-Flash——于 2026 年 8 月 26 日发布。同样的 100 万 token 上下文窗口,同样的多模态输入,输入每百万 token 0.15 美元,输出每百万 token 0.47 美元。它是该系列中的廉价档位,也正是它让高并发的智能体流量变得经济可行。

还有一个未标记的 Qwen3.8 条目:这个 2.4 万亿参数的旗舰模型,阿里巴巴已表示其权重即将推出,但目前仍无法在任何地方调用。如果你搜索的是“Qwe​n 3.8”并期待只有一个模型,那这就是为什么答案是一个由四个模型组成的系列,而不是一个。

A screenshot of the OrcaRouter model page for Qwen3.8-27B, showing the Featured badge, a 256K-token context window, text, image and video input with text output, badges for Vision, Tools, JSON and Reasoning, the provider line 'by Qwen - 2026-08-13', a pricing row of $0.33 input and $2.40 output per million tokens with measured latency and 120.2M tokens of traffic, and the beginning of the model description covering the 27B dense multimodal model's Apache-2.0 licence and 256K context.

与这一切形成对照的是,AREX-2 的规格说明只有一行:一个仓库、一个时间戳,以及一个名字——它暗示着这是 BAAI 曾经构建过一次的某个东西的第二代。

重新定义整个比较的那个细节

AREX 不是 Qwen 的竞争者;它是 Qwen 的使用者。两个初代 AREX 模型都在 Qwen3.5 基座上进行后训练,随后被封装进一个框架,使它们成为智能体而非聊天模型:内循环负责搜索、浏览,并将证据整合进一个带有置信度数值的候选答案;外循环则对照原始约束检查该答案,要么接受它,要么细化它,要么丢弃这条轨迹并重新开始。AREX 中有意思的工程不在于网络,而在于循环、上下文更新机制——它能在长时程中理清已验证的发现、待定候选与未解决的约束——以及工具接口,它把搜索和浏览作为一等操作暴露给模型。

这正是为什么该家族自己公布的数值——122B Base 在 BrowseComp 上为 82.5,在 GAIA 上为 85.4,在 xbench-2510 上为 71.0,在 DeepSearch QA 上为 89.9,在 WideSearch-en 上为 82.0,而 4B Turbo 则为 70.7 / 81.6 / 57.0 / 78.5 / 68.5——无法与 Qwen3.8-27B 的编程和智能体得分相提并论,尽管二者共享同一架构谱系。它们衡量的是不同的东西。QwenSWEBench 考察的是模型能否解决某个代码仓库中的问题。BrowseComp 考察的是智能体能否在多次搜索中找到一个刻意难以找到的事实,同时不丢失问题本身。原始 Qwen3.5 检查点在第二项上得分很差,在第一项上得分很好,而这正是 BAAI 的后训练与测试框架旨在弥合的那道差距。

A generated pricing card headed 'The Qwen3.8 family is priced. AREX-2 is not callable.' It lists Qwen3.8-Max at $2.00 in / $6.00 out with a 1M context released 3 Aug 2026, Qwen3.8-27B at $0.33 in / $2.40 out with 256K context and open weights released 13 Aug 2026, Qwen3.8-Flash at $0.15 in / $0.47 out with a 1M context released 26 Aug 2026, Qwen3.5-122B-A10B at $0.115 in / $0.917 out as the backbone AREX-Base post-trains up to 128K, and a highlighted AREX-2 row reading 'no rate card' because there are no weights, card or licence tag. A footer reads 'Qwen3.8-27B scores 33.7 on the AA Intelligence Index; AREX-2 does not exist to score.' The OrcaRouter logo is composited in the bottom-right corner.

第二代最有可能是什么样子

如果 AREX-2 延续这一模式,那么最可能的解读——这是推断,而非事实——是:一个第二代研究智能体,其微调所基于的 Qwen 基座比当前 AREX 模型所用的 3.5 代更新。Qwen3.8-27B 是稠密模型、多模态且采用 Apache 2.0 许可,这使它成为高质量档位智能体的天然候选;而 Qwen3.8-Flash 的每 token 成本低廉,当你的智能体每次查询要发起数十次调用、并在每一步都重新读取不断增长的上下文时,这一点至关重要。

这些都没有得到证实。这个名字不包含规模、骨干或日期信息,而产品线中的“2”是命名惯例,而不是规格说明。已确认的内容要窄得多,并且应当照此表述:BAAI 于 2026 年 9 月 29 日创建了该仓库,里面什么也没放,也没有宣布任何消息。没有权重,没有模型卡,没有参数数量,没有许可证标签,没有基准测试,也没有任何提供商在提供它。如果你本周在任何地方看到有人引用 AREX-2 的数字,那都不是实测数据。

今天下午你实际能买到什么

这两者之间实际的不对称并不在于质量,而在于一方手里有价目表,另一方手里只有一个名录条目。

如果你的工作是智能体式的,并且你想要 AREX 系列所构建于其上的底座,那么确切的骨干模型是可以直接调用的:Qwen3.5-122B-A10B 已在 OrcaRouter 的目录中,价格为每百万输入 token 0.115 美元、每百万输出 token 0.917 美元(最高 128K token),超过该长度后升至 0.287 美元 / 2.294 美元,并已启用视觉、工具调用与推理能力。这正是 AREX-Base 进行后训练所用的模型,无需等待任何东西即可使用。

如果你想用当前这一代,Qwen3.8 的两个开放层级都在产品目录中:Qwen3.8-27B 每百万输入 $0.33、输出 $2.40,运行在我们自己的基础设施上,因为权重是开放的,没有供应商的按 token 成本需要转嫁,以及Qwen3.8-Flash 在批量层级为 $0.15 / $0.47。一个 API 同时覆盖两者,按供应商标价透传,每个 token 不额外加价,所以当阿里巴巴调整价格时,这里的数字当天就会同步变化。

而当 AREX-2 真正发布时,它之所以应该位于同一层之后,原因在于结构,而非宣传。一个每次查询要发起二十次调用的智能体循环,会把每个提供商的失败率放大二十倍;一条带有自动故障转移、在运行时做出决策的路由规则决定了超时是触发一次重试,还是变成一个自信满满的错误答案。这个论点适用于任何研究型智能体,而只要存在可供路由的 AREX-2,它就同样适用于 AREX-2。

谁应该采取行动,针对什么?

如果你今天需要研究型智能体,AREX-Base 就是确实存在的 AREX 模型,它于 7 月以 Apache 2.0 许可发布,其智能体基准测试出自厂商自身,但至少它们附属于一个可下载的模型。如果你今天需要前沿多模态推理或高流量智能体请求,Qwen3.8 各层级已上线、已定价且部分获得独立评分,AREX-2 的存在丝毫不会改变这一决定。

AREX-2 对你本周要做的决定而言唯一有意义的场景,就是你要为一次微调挑选骨干网络。而在这个问题上,答案其实已经明明白白写在目录里了:AREX 所用的 3.5 代骨干网络依然便宜且随处可得,3.8 代更好,而且同样可得;至于第二代 AREX——无论它何时问世——几乎可以肯定只会成为一项证据,说明 BAAI 认为哪个 Qwen 基座值得在其之上继续构建,而不是它的替代品。

还有三件事就能把剩下的都定下来:文件树里的文件、一张带参数数量和基础模型字段的卡片,以及一个许可证标签。其中第一件才是关键,因为在它落地之前,这场比较不过是在一个有定价的模型家族和一个占位符之间进行。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新