一张生成的标题卡,上面写着“Intern-Decision-2B vs Qwen 3.8”,副标题为“同一个骨干,两种截然不同的任务”,并配有徽章“2.2B 评分器,33 ms”和“2.4T 旗舰,1M 上下文”,角落里还合成了 OrcaRouter 标志。
Guides & Insights

Intern-Decision-2B vs Qwen 3.8:同一个骨干网络,两种截然不同的任务

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

打开 internlm/Intern-Decision-2B 的配置,以及 Qwen/Qwen3.5-2B 的配置,将两者并排放在一起,几乎没有任何差别。同样是 24 层,同样是 2,048 隐藏维度,8 个查询头对 2 个键值头,同样是 256 的头维度,同样是 262,144 位置的嵌入上限,同样是 248,320 词表,同样是三层线性注意力接一层全注意力的重复模式。Intern-Decision-2B 不是一种新架构。它就是那副骨干,只是去掉了生成文本的能力,并对置信度做了校准——而正是这一处减法,让与 Qwen3.8-Max——这个 2.4 万亿参数的旗舰型号,也正是“Qwe​n 3”这一家族名称在顶端所指的对象——的对比,比单纯倒数参数量更有价值。

这两者不是竞争对手,这场对比也不是一场较量。Intern-Decision-2B 是 Qwen3.5-2B 的一个拥有 2,213,241,664 个参数的微调版本,于 2026 年 9 月 26 日 05:36 UTC 上传到 Hugging Face,与另外三个未公布的同类模型一同发布;它不生成任何 token:它接收一个状态和带类型的问题,运行一次因果前向传播,在固定的占位符位置读取 logits,并针对每个字段返回一个校准后的分布。Qwen3.8-Max 是阿里巴巴的托管旗舰模型,一个稀疏专家混合模型,每个 token 大约激活 950 亿个参数,具有 100 万 token 的多模态上下文窗口,标价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元。一个是组件。另一个是服务。有用的问题是,在一条你已经在付费的流水线中,它们之间的衔接处应该位于哪里。

减法,确切地说

决策调优究竟改变了什么,值得被精确说明,因为它厘清了基础模型原本就已经承载的内容。

该任务在仓库中被称为自回归掩码语言建模。助手输入包含一个完整的 JSON 骨架,每个字段有一个 <decision> token;真实答案符号只出现在标签中,从不出现在输入里。训练使用普通的因果下一 token 对齐,即紧邻某个标记之前的 logit 预测该字段的答案,并且所有字段共享一次前向传播。推理时,logits 被限制在合法的单 token 答案符号内——A–Z、a–z、0–9,这就是 62 个选项上限的来源——然后做 softmax 并映射回你的标签。

所以基座模型的下一 token 机制完好无损且未被修改。被训练进去的是一种偏好:占据少数几个答案位置之一,而不是继续一个句子;再加上一个特定于检查点的温度 2.100509348278,它是在 1,728 个指定校准案例上通过负对数似然拟合得到的,另有 1,693 个留出案例。模型卡明确表示,生成不在考虑范围之内:API“执行结构化候选评分。它不会调用 generate() 或采样自由形式文本。”

该仓库还记录了调优未触及的部分:它“微调了 Qwen3.5 的语言主干,同时冻结了视觉塔和投影器。”2B 上 612,517,440 字节的视觉分片与 4B 决策检查点上的字节数相同,这与组件是继承而来而非训练而来的情况相符。图像路径可以工作;只不过决策阶段并没有把预算花在它上面。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

22亿参数做不到什么,而2.4万亿参数又能取而代之做什么

一切都沿一个维度划分:你的答案是否已经以列表的形式存在。

Intern-Decision-2B 回答一个封闭集合。一到十六个问题,每个最多 62 个选项,最多八张图像,全部处于 8,192 token 的预算之内——超出时引擎会直接拒绝,而不是截断。以概率形式返回。在单张 RTX 4090 上,每次请求平均耗时 33.28 毫秒,P95 为 33.55 毫秒,并且由于没有可供计费的输出,每次调用都不计费。

Qwen3.8-Max 具备写作能力。它拥有 100 万 token 上下文,支持文本、图像和视频输入,可通过思考模式进行推理,支持原生工具调用、结构化输出,在标注日期为 0902 的构建版本上最多可输出 131,000 个 token。原则上,它还可以做出与 Intern-Decision-2B 相同的路由决策——你可以提示它在多个选项中做出选择并返回 JSON。一旦你这样做,就会有三件事出问题。你需要为它花在决策上的 token 付费。你拿到的字符串,解析可能成功,也可能失败。而那个字符串里的数字只是采样器产出的结果,而不是一个你可以把阈值设为 0.8 并据此采取行动的 softmax。

两种说法都成立,彼此并不相互抵消。2.4 万亿参数的旗舰模型之所以存在,是因为大多数问题并非封闭集合。22 亿参数的评分器之所以存在,是因为其中确实属于封闭集合的那一子集,值得用更廉价的工具来处理。

记分板

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• 参数——Intern-Decision-2B 在 BF16 下为 2,213,241,664 参数,外加一个视觉塔和投影器,磁盘上约 4.46 GB;Qwen3.8-Max 总计约 2.4 万亿,每个 token 约 950 亿激活,以服务方式提供,而非下载。

• 上下文 — 8,192 个 token,超出即被拒绝;在 0902 构建上为 1,000,000 个 token,最大输出 131,000 个 token。

• 输出 — 校准概率和一个 argmax,无生成文本;生成文本包括推理轨迹。

• 输入模态 — 文本加最多八张图像;文本、图像和视频。

• 成本 — 无按次收费,且 GPU 归你所有;每百万输入 token 2.00 美元,每百万输出 token 6.00 美元,缓存读取为 0.25 美元,缓存写入为 2.50 美元。

• 已发布的证据——一张七套件供应商表格,在 10,751 条测试行上平均为 84.68、Brier 0.437 和 ECE 0.100,除 InternLM 外无人复现,且基于一个仅有一个点赞、零下载的检查点;Artificial Analysis Intelligence Index 为 45.4,在 145 个中排名第 15,AA Coding 指数为 76.2,在 138 个中排名第 9,两者均为独立测量。

• 延迟 — 在单块 RTX 4090 上,每个请求平均为 33.28 毫秒,并随着批处理的加入而下降;按照目录所报告,首个 token 的 P50 为 2.655 秒,并随负载增加而上升。

这些证据行并不等价,不应被当作等价物来呈现。阿里巴巴的旗舰模型背后有一项独立的指数评分。InternLM 的检查点则只有一张由其作者自己制作的表格,尤其是其中的校准数值,在遇到他人的数据之前,应当被理解为一种有充分记录的良好意愿——在这里更是如此,因为这个特定规模的版本在 InternLM 发布的三个版本中给出了最差的期望校准误差,0.100,而规模为其一半的模型是 0.066,规模接近其两倍的模型是 0.065。

接缝,以及如何运行它

真正合理的流水线并不是在这两者之间做选择,而是一种拆分:评分器处理那些可枚举的决策,前沿模型处理所有答案不是列表的情况。一个把工单路由到六支团队之一、并按三点量表评定紧急程度的支持分流,并不需要 950 亿个活跃参数;它需要的只是一个概率和一个阈值。而最终要为客户写出回复的那条升级路径才需要。

这种分工有一种运营层面的体现。Intern-Decision-2B 并不在 OrcaRouter 上——我们为它准备的模型页面返回 404,而且我们找遍各处都没有找到任何托管路由——所以它运行在你自己的硬件上,这意味着它是一个由你运维和监控的组件。Qwen3.8-Max 则是一条路由:一个密钥即可访问 200 多个模型,按供应商标价透传、不加价,这意味着旗舰模型一旦发生供应商调价,当天就会反映在你的账单上。把管道的托管环节放在这单一入口之后,正是让那条更便宜的环节保持便宜的关键:打分器压住了调用量,只有真正需要的前沿模型才会被调用。

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

如果你仍在评估哪个评分器该放进那个位置——这个评分器没有任何独立评估,而且它的校准在其所属系列中是最弱的——自动故障转移跨提供商,是在一条背后已有可用备选方案的路径上试用它的方式,而不是直接替换掉那个备选方案。

诚实的裁决

如果你的问题是在一组你可以枚举的答案上做决策,并且状态能装进八千个 token 内,那么 Intern-Decision-2B 会在三十三毫秒内完成,而且每次调用都免费;无论你租用多少参数,也没有任何前沿模型能在这一维度上击败它。在依赖它报告的置信度之前,先对它进行你自己的校准。

如果你的问题是其他任何情况——推理、长上下文、工具使用、视频、一份百万 token 的文档,或者仅仅是一个尚未被写出的答案——Qwen3.8-Max 就不只是更好了。它是两者中唯一能够胜任这项工作的那个。

而如果你还无法说出自己拥有的是这两者中的哪一种,答案很可能是:你两者都有,并且在同一条流水线里,而这正是参数数量一直在悄悄告诉你的架构。