用于 Qwen3.8-27B 与 Qwen 3.8 对决的主视觉标题卡,展示两张圆角芯片卡片——一张是拥有 262K 上下文和 Apache 2.0 许可的 27B 稠密模型,另一张是采用自定义许可的 2.4T / 95B 激活 MoE 核心——右下角为 OrcaRouter 标识。
Guides & Insights

Qwen3.8-27B vs Qwen 3.8:同一代,一块 GPU 对决一整个机架

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

本周,阿里巴巴将 Qwen3.8-27B 放上了 Cerebras 的快速推理通道——这是这个稠密 27B 模型首次拥有真正高速的托管选项——而 Artificial Analysis 也终于为这场对决的双方都建立了索引。Qwen3.8-27B 在 AA 智能指数上得分 34。而 Qwen 3.8——也就是大多数人在写这个不带后缀的名字时所指的那个开放核心模型——得分 40。这两个数字重置了一项比较:八月份发布时的报道只能完全依赖厂商的说法来完成这项比较。

“Qwen 3.8”作为一个独立名称,其背后的模型是 Qwen3.8-2.4T-A95B:这是阿里巴巴以自定义许可证发布的 2.4 万亿参数专家混合权重。Qwen3.8-27B 则是同代的稠密版本——约 270 亿参数,Apache 2.0 许可,规模适合单块 GPU。它们共享同一家族名称、原生 262K 上下文长度以及同一个发布窗口。除此之外,它们的一切都截然相反:一个你可以拥有,另一个你只能租用。既然两者如今都有了各自独立的数据,以下是它们各自的实际用途。

同一代,截然不同的形态

Qwen3.8-27B 是一个稠密模型——27B 参数(计入视觉编码器则为 28B),64 层,由 48 层 Gated DeltaNet 线性注意力层与 16 层全注意力层构成的混合注意力堆栈。正是这种混合结构,让一个 27B 模型能够承载 262,144 个 token 的原生上下文。Qwen3.8-2.4T-A95B 则是旗舰架构:总参数 2.4T,每个 token 约激活 95B,92 层、每层 512 个专家,其中 92 层里有 69 层采用线性注意力。同一套手法,体量却是九十倍。

• 架构 — Qwen3.8-27B:27B 稠密模型,每个 token 都会点亮其全部参数。Qwen3.8-2.4T-A95B:总计 2.4T / 约 95B 激活的 MoE。

• 上下文 — 两者原生均为 262K;27B 的 1M 扩展仅限托管版本,而 2.4T 实测可达约 984K。

• 输入 — Qwen3.8-27B:文本、图像和视频。Qwen3.8-2.4T-A95B:仅文本,思考模式锁定为开启。

• 许可证 — Qwen3.8-27B:Apache 2.0。Qwen3.8-2.4T-A95B:自定义 Qwen3.8-Max 许可证。

• 权重 — Qwen3.8-27B:BF16 下为 55.6GB,量化后约为 16GB 的 Q4 版本。Qwen3.8-2.4T-A95B:BF16 下约 2.4TB,需要一整个 GPU 机架,而非台式机。

• 你在哪儿见到它们——Qwen3.8-27B:自行托管,或者便宜地租用。Qwen3.8-2.4T-A95B:租用,因为但凡明智的人都不会自己拥有那台机架。

终于,独立的数字

每篇在8月发布的关于 Qwen3.8-27B 的对比文章都带着同样的限定说明:“尚无独立评分。”这已不再属实。截至本周,Artificial Analysis 已对这两个模型完成测量,而数据的形态确实很有意思。

在 Intelligence Index 上,Qwen3.8-2.4T-A95B 得分为 40,在其类别 113 个模型中排名第 4。Qwen3.8-27B 得分为 34——这使其在其开放权重 4–40B 规模类别中的 140 个模型里位列第一,对于一款密集 27B 模型而言是真正强劲的表现。独立测量显示两者都偏慢:27B 为每秒 39.0 个输出 token,2.4T 为 38.1 个,而该类别中位数约为 90。两者都较为冗长,27B 在各项指数运行中生成约 2 亿个输出 token,而该类别中位数为 6800 万。两者都不是备受瞩目的前沿模型;它们都是实干型选手,而该指数显示,2.4T 是明显更强的那一个。

A three-lane infographic titled 'Qwen3.8-27B — three ways to rent it': self-hosted lane on OrcaRouter at $0.33/$2.40 per 1M tokens with 262K context, vendor lane on Qwen Cloud at $0.50/$3.00 with 1M context and a 90% cache discount, and the fast lane on Cerebras PayGo at $0.99/$1.49 with rapid inference, plus the OrcaRouter logo in the bottom-right corner.

独立一方给出的定价,用美元讲述着同样的故事。Artificial Analysis 给出的价格是:在 Qwen Cloud 的托管版本上,27B 每百万输入为 $0.50,每百万输出为 $3.00(缓存折扣 90%),而 2.4T 为 $2.00 / $6.00(缓存折扣 88%)。每个 Intelligence Index 任务的成本:27B 为 $0.82,而 2.4T 为 $2.16。较小的模型按单位智能的运行成本更低——但相对于其速度档位,两者都算昂贵,因为二者都是会大量消耗输出 token 的推理模型。

其余所有数据——27B 的 SWE-bench Pro 61.7、DeepSWE 1.1 42.2、LiveCodeBench v6 90.3;2.4T 的 86.6 Terminal-Bench 2.1 和 67.7 SWE-bench Pro——仍为厂商报告、未经复现,并在本文全篇中如此标注。上文中的 AA 指数是这一切之下的独立底线。

Cerebras 的上市改变了什么

2026年9月12日,Qwen 账号宣布 Qwen3.8-27B 现已在 Cerebras 上运行,其目录条目以"Qwen 3.8 27B 现已在 Cerebras PayGo 上线"为标题正式上线。Cerebras 将其定价列为每百万输入 0.99 美元、每百万输出 1.49 美元,运行在让该公司以速度声名鹊起的 WSE 级硬件上。这让 27B 拥有了 2.4T 核心从未拥有过的东西:一条快车道。

A comparison scoreboard titled 'Qwen3.8-27B vs Qwen 3.8 — the matchup': the 27B shows 27B dense architecture, 262K native context, text/image/video input, Apache 2.0, AA Intelligence 34, and $0.33/$2.40 per 1M tokens; the 2.4T core shows 2.4T / 95B-active MoE, 984K measured context, text-only input, the Qwen3.8-Max custom license, AA Intelligence 40, and $2.00/$6.00 per 1M tokens, with a footer labeling the 27B price as the OrcaRouter self-hosted rate, the 2.4T price as the Qwen3.8-Max API rate, and the AA figures as of September 2026, plus the OrcaRouter logo in the bottom-right corner.

这一点很重要,因为又慢又啰嗦从一开始就是 27B 唯一真正的硬伤。在独立测试框架上,它能跑到 39 t/s;在我们自己的服务遥测中,它一直以约 154 个输出 token/秒的速度运行,首 token 延迟的 p50 为 4.48 秒——而现在第二家提供商又在同一维度上展开竞争。相比之下,2.4T 根本没有快车道:在 38 t/s 的速度下,你为中等水平的速度支付着前沿价格,而唯一的绕开办法就是租用 GPU 集群,自己运行开放权重。

为 27B 分配三条通道,为 2.4T 分配一条。

截至今天,dense 27B 可按三种方式租用,而在你做出选择之前,价格差距值得一看:

• 自托管通道 —— Qwen3.8-27B 已在 OrcaRouter 上线,价格为每百万 $0.33 / $2.40,运行于我们自有基础设施之上。这是市场上该模型最便宜的输入价格,输出约 154 tok/s,上下文长度 262K。

• 供应商通道 — Qwen Cloud 的托管构建版本,每百万 $0.50 / $3.00,具有 1M-token 上下文和 90% 缓存折扣。

• 快速通道 — Cerebras PayGo,每百万 $0.99 / $1.49,主打速度而非价格。

A screenshot of the OrcaRouter model page for Qwen3.8 27B (captured September 12, 2026) showing the input price of $0.33 per 1M tokens, output price of $2.40 per 1M tokens, a 262K token context window, text/image/video input support, and a p50 first-token latency of 4.48 seconds.

2.4T 的开源核心没有对应的价差。提供相同架构的旗舰 API——Qwen3.8-Max——价格为每百万 $2.00 / $6.00,而无论你称其为 Max 还是开源核心,这个数字都不会变。若改为自行运行权重,经济账就转向硬件:2.4T 需要约 2.4TB 的 BF16 权重以及一个多 GPU 节点,这是没人会随随便便做出的资本决策。而一块 24GB 的 GPU 运行 27B 的 Q4 版本,其边际成本四舍五入后趋近于零。

决定大多数团队的那个典型算例:每天 1 亿输入和 2000 万输出 token。按 2.4T 的 $2/$6 费率,这大约是每天 $320,一年约 $117,000。用 27B 按我们的 $0.33/$2.40,大约是每天 $81——而如果是自托管副本,那就是电费的价格。2.4T 为你买来实打实的质量优势,AA 40 对 34。这个优势是否值每月五位数的账单,正是这个组合要回答的全部问题。

在它们真正产生分歧的地方

除了索引之外,还有三个实际差异决定哪一个适合给定的工作负载。

多模态输入是最干净的筛选条件。Qwen3.8-27B 能读取文本、图像和视频——截图、图表、带配图的文档、视频帧,全都能进入同一个 262K 窗口。Qwen3.8-2.4T-A95B 则严格只支持文本。如果你的输入包含任何视觉内容,那么无论 2.4T 的指数有多高,它都会被排除。

思考控制是次要的。27B 的推理模式可以按请求关闭,这对于延迟敏感的提取很重要,因为思维链纯属额外开销;它还暴露了 reasoning_effort。2.4T 核心无法关闭思考——每个响应都以一个 think> 块开头,而且无论你是否想要,都要为这些 token 付费。旗舰 API 修复了这一点,但开放核心没有。

许可授权排在第三,而它在规模化时却悄然变得重要。27B 上的 Apache 2.0 是宽松许可的标杆:可修改、可再分发、可商业化,还附带专利授权。2.4T 则采用自定义的 Qwen3.8-Max 许可发布——精神上固然宽松,但那毕竟是阿里巴巴自己的条款,而非社区标准,所以在基于它构建产品之前,值得先把许可文件读一遍。

将决策路由

这场对比的两端都能通过一个 OrcaRouter 密钥访问,这正是"该选哪个"这个问题可以低成本地用实证来回答的原因。Qwen3.8-27B 已上线,模型标识为 qwen/qwen3.8-27b,按供应商标价提供,零加价,而基于同一 2.4T 核心构建的旗舰 API 也已上线,模型标识为 qwen/qwen3.8-max,价格为每百万 $2.00 / $6.00——即阿里巴巴自身的费率,直接透传,因此任何供应商的价格变动当天就会在这里同步生效。

同样的 2.4T 架构以可下载权重形式提供,这并不是我们提供的服务——如果你今天想通过 API 使用这个开放核心,旗舰通道是实际可达的途径,而 qwen/qwen3.8 已预置好,一旦有提供商提供开放权重即可启用。将视觉和延迟敏感型流量发送到 qwen/qwen3.8-27b、将高难度推理长尾流量发送到 qwen/qwen3.8-max 的路由规则,设置成本为零,并能在提供商之间自动故障转移。一个密钥,无需第二份合同,而且这种拆分只是配置变更,而非重新架构——这是测试 2.4T 多出的六个指数点对你而言是否值每百万输出 token 5.67 美元的最便宜方式。

谁应该选择哪个

• 如果你的输入包含图像或视频,如果你希望拥有可以随时关闭的思考模式,如果你已经拥有一块 24GB 的 GPU 或正打算入手,又或者你的每 token 花销规模大到 $0.33/$2.40 与 $2.00/$6.00 的对比本身就足以说明一切,那就选 Qwen3.8-27B。

• 如果你只处理文本、想要该系列中最强的独立推理成绩(AA 40),并且 $2/$6 的价格——或者运行一个 GPU 节点的成本——完全在预算之内,那就选 Qwen 3.8(2.4T 核心)。

• 如果你的流量横跨这两类画像,那就两个都选:经由网关路由,让路由器按模态和难度分流,并在任一模型的下一个检查点或价格落地时再改变主意。

裁决

Qwen 3.8 这个名字一直代表着两个假装属于同一家族的产品,而如今两者都有了各自独立、可供争论的数字。Qwen3.8-2.4T-A95B 是更强的大脑,纯文本、昂贵,并且以 $2/$6 的价格无可否认地具备租赁价值。Qwen3.8-27B 则是可部署的那一个——多模态、Apache 2.0、可自托管,而且截至本周,它终于也有了一条快车道。指数差距是真实存在的:40 对 34。价格差距同样如此:当你把 2.4T 作为 API 运行时,每 token 成本大约是其五倍。对大多数团队来说,决定并不在于那六个指数点,而在于你是在买 token 还是买硬件——而 27B 是两者中唯一能让你购买硬件的那个。