一张生成的主视觉标题卡,上面写着“Solar Mini 4 vs Qwen3.8-Max”,副标题为“最后二十个指数点实际花了多少代价”,还有两个徽章分别写着“指数上 24.1 对 45.4”和“每项任务 $0.36 对 $5.41”。
Guides & Insights

Solar Mini 4 对比 Qwen3.8-Max:最后二十个指数点究竟要付出什么代价

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Solar Mini 4 每百万输入 token 收费 0.10 美元,每百万输出 token 收费 0.40 美元。Qwen3.8-Max——大多数人输入“Qwen 3.8”并请求 API 时所指的模型——则分别收费 2.00 美元和 6.00 美元。在价目表上,这表现为输入价格二十倍的差距。在两个模型如今都已通过的独立评估中,老实说,Qwen3.8-Max 在 Artificial Analysis Intelligence Index 上得分 45.4,而 Solar Mini 4 为 24.1——约为其测得能力的两倍——但每完成一项任务的成本却约为其十五倍。关于这对组合,一切值得了解的信息都在那两个比率之间的差距里,也在这样一个事实中:Upstage 的模型以每秒 204 个 token 运行,而阿里巴巴的旗舰模型以 39 个运行。

在罗列数字之前,先说明一点命名问题,因为它会改变你实际买到的是什么。Qwen 3.8 是一个代际,而非单个模型:托管的旗舰是 Qwen3.8-Max,以带日期的 0902 快照形式更新;同一代中可下载的成员是 Qwen3.8-2.4T-A95B,即阿里巴巴于 2026 年 8 月 12 日发布的 2.4 万亿参数权重。Solar Mini 4 于 2026 年 9 月 22 日发布,是 Upstage 的 350 亿参数稀疏混合专家模型,每个 token 约激活 30 亿参数,且无论出多少钱都不提供开放权重。

这两列,就决定采购的维度而言

• Intelligence Index — Qwen3.8-Max(0902)为 45.4,而 Solar Mini 4 为 24.1,两者均为 Intelligence Index v4.3.2。

• 每完成一项任务的成本——Qwen3.8-Max 为 5.41 美元,而 Solar Mini 4 为 0.36 美元。大约是十五比一,而这个比例却无人提及。

• 价目表——Qwen3.8-Max 为每百万 token 2.00 美元 / 6.00 美元,缓存输入 0.25 美元,而 Solar Mini 4 为每百万 token 0.10 美元 / 0.40 美元,缓存输入 0.01 美元。

• 上下文 — 两者均为 1,000,000 tokens,而这是廉价模型唯一不落下风的维度。Artificial Analysis 列出的 Qwen3.8-Max 为 983,616,Solar Mini 4 为 1,048,576;Upstage 自家文档写的是 512K,因此小模型的上限是两者中较不确定的一个。

• 权重 — Qwen3.8-Max 是专有托管模型;其开源同级版本 Qwen3.8-2.4T-A95B 可在自定义许可下下载,并在相同指数上以 262,000 个上下文 token 取得 39.9 分。Solar Mini 4 为专有模型,没有开源同级版本。

• 吞吐量——根据同一实验室的测量,Solar Mini 4 每秒可输出 204 个 token,而 Qwen3.8-Max 为 39.5 个。每项任务成本仅为其十五分之一的模型,完成速度却是它的五倍。

二十一个指数点能买到什么

A two-column comparison scoreboard titled 'Solar Mini 4 vs Qwen3.8-Max', subtitled 'Roughly twice the capability at about fifteen times the task cost'. Solar Mini 4: Intelligence Index 24.05; cost per index task $0.36; rate card per 1M $0.10 in / $0.40 out; cached input $0.01 per 1M; context 1.05M listed and 512K claimed; output speed 204 tokens per second; output per task 88,300 tokens; long-context reasoning 83.3% on AA-LCR v1.1. Qwen3.8-Max: Intelligence Index 45.42; cost per index task $5.41; rate card per 1M $2.00 in / $6.00 out; cached input $0.25 per 1M; context 983,616; output speed 39.5 tokens per second; output per task 107,700 tokens; long-context reasoning 80.3% on AA-LCR v1.1.

他们买的是分布中困难的那一端。在 Humanity's Last Exam 上,Qwen3.8-Max 在 43.1% 的题目上回答正确,而 Solar Mini 4 为 25.8%。在科学编程方面,这一比例是 52.1% 对 47.6%。在智能体知识工作上,差距扩大到了另一个类别:Qwen3.8-Max 在 GDPval-AA 上达到 1663 Elo,而 Solar Mini 4 只有 1072——接近六百个 Elo 点,这不是舍入误差,而是模型在无人值守时能被信任去做什么的转变。

唯一一个小模型不仅不落下风、反而胜出的评测,是长上下文推理。Solar Mini 4 在 AA-LCR v1.1 上得分 83.3%,Qwen3.8-Max 得分 80.3%。这是整场对比中最有力的支持 Solar Mini 4 的论据:在专为测试“阅读一份极长文档并跨整篇文档进行推理”而构建的基准上,每任务十五倍的价格,换来的结果却差了三个百分点。

两个模型都不适合的领域是自主终端工作。Solar Mini 4 在 Terminal-Bench 4.0 上得分 1%;Qwen3.8-Max 得分 38.9%。一个能完成二十项高难度终端任务中八项的模型在那里确实可用,而另一个则不行,这是本次对比中最能说明问题的一点:二者之间的差距是性质上的,而非程度上的。

为什么旗舰模型的每任务账单比其 token 价格所暗示的要糟糕得多

Qwen3.8-Max 每项任务的输出量比 Solar Mini 4 更多——107,700 个 token 对 88,300 个——而且它产出这些 token 的价格是每百万 6.00 美元,而非 0.40 美元。还没算上缓存行为的影响,差距的大部分就已经在这里了。阿里巴巴确实提供了每百万 0.25 美元的缓存输入价格,相对于其 2.00 美元的输入价格,这是实打实的折扣;而且该系列的开源同门 Qwen3.8-2.4T-A95B 是一个 2.4 万亿参数的稀疏模型,约有 950 亿参数处于激活状态,因此它产出的每一个 token 都是由一台规模大得多的机器产出的。这一切都不是批评。它正是每任务十五倍乘数存在的原因,也正是对这两个模型进行每 token 价格比较在两个方向上都具有误导性的原因。

实际结果就是:Solar Mini 4 并不是“廉价版 Qwen 3.8”。它是一个专才,恰好便宜、快速,并且在唯一一个维度上表现强劲——长文档——却在出错代价最高的那个维度上表现薄弱,那就是智能体可靠性。Qwen3.8-Max 则是通才,它的优势恰恰出现在错误答案代价高昂的地方。

同时运行两者,而非在它们之间做出选择

这是 Solar Mini 4 系列中并不常见的情况:对比的双方都是我们确实能卖给你的路由。Qwen3.8-Max 及其带日期标记的 0902 快照托管在 OrcaRouter 上,采用厂商自家的 $2.00 / $6.00 标价,与 $0.15 / $0.47 的 Qwen3.8-Flash以及 $0.33 / $2.40 的 Qwen3.8-27B 并列——同一代的三档,一个密钥,无需第二份合同,除了模型字符串之外无需改动任何代码。截至 2026 年 10 月 1 日,我们自家 playground 的测量显示,在过去七天里 Qwen3.8-Max 的 p50 为 2.5 秒,输出速度为每秒 87.7 个 token;该时间窗口会滚动更新,所以请以实时模型卡为准,而不是这句话。Upstage 的模型无法通过我们获取,Solar Mini 4 必须通过 Upstage 自家的 API 访问。

A screenshot of the OrcaRouter model page for Qwen3.8-Max, showing the model id qwen/qwen3.8-max at $2.00 input and $6.00 output per million tokens, text, image and video input with text output, vision, tools, JSON and reasoning capability flags, a 2.5-second median time to first token from our own playground, and the description of Alibaba's newest flagship model in the Qwen line.

这让这场对比所主张的拆分成为可能:把长文档、韩语提取流量发到便宜的地方,将推理密集型和工具使用型请求路由到旗舰模型,并让故障转移兜住那个出了状况的提供商。这也正是路由 DSL 证明自身价值之处——将模型组合进单次调用,意味着一次廉价的首轮处理和一次昂贵的验证处理可以是对同一个端点的一次请求,而不是两个必须保持同步的集成。

简短版本

A screenshot of the Artificial Analysis model page headed 'Qwen3.8 Max (0902) Intelligence, Performance & Price Analysis', marked as an Alibaba proprietary model released September 2026, ranked 32nd of 223 on intelligence, 172nd on speed and 101st on cost, with $2.00 input, $6.00 output and cached pricing rows, 39.5 output tokens per second, a $5.41 cost figure and a verbosity readout.

如果你的工作负载是长上下文、固定的输出形态以及可接受的延迟预算,那么 Solar Mini 4 能以十五分之一的任务成本和五倍的吞吐量,为你带来 83% 的长上下文结果,而那缺失的二十一个指数点永远不会出现在你的仪表盘上。如果你的工作负载涉及工具调用、多步智能体,或者涉及那种一个自信的错误答案比没有答案更糟的问题,那么那些缺失的分数就是产品的全部,而 Qwen3.8-Max 值这十五倍的价格。上文归因于 Artificial Analysis 的每一个数字都是该机构的独立测量结果;Qwen3.8 的命名和发布日期属于阿里巴巴,而 OrcaRouter 的服务数据则是我们自己在滚动七天窗口内的试验场测量结果。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新