比较文章的标题卡,标题为 Intern-Decision-0.8B vs Qwen 3.8,副标题为 8.53 亿参数、1.71 GB 和一组封闭的答案,另有三张扁平线条卡片,分别写着:主体:Intern-Decision-0.8B 于 2026 年 9 月 26 日发布,没有任何公告;对手:Qwen 3.8,一个 2.4T 稀疏核心,Qwen3.8-Max 定价为 $2.00 和 $6.00;关键发现:2B 版本速度更快、更准确,而只有占用空间对 0.8B 有利。
Engineering & Research

Intern-Decision-0.8B 对比 Qwen 3.8:8.53 亿参数与封闭答案集

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Intern-Decision-0.8B 是 InternLM 于 2026 年 9 月 26 日上午推送到 Hugging Face 的三个决策模型中最小的一个,而且它并不是其中最快的。这是首先值得知道的一点。按照该实验室自己的测量,2B 的同门版本运行略快——33.28 毫秒对 33.98 毫秒——并且在相同的七套件平均值上高出六分,因此,选择十亿参数以下检查点的通常理由,即原始速度,在这里并不适用。适用的是规模:852,985,920 个参数,1.71 GB 的 bf16 权重,小到可以永久驻留在一台还有其他任务的机器的边角余量中。把它与 Qwen3.8-Max 相比——这是该厂商 8 月发布的 2.4 万亿参数稀疏混合专家核心的托管交付版本,定价为每百万 token 2.00 美元和 6.00 美元——两者并不是在竞争同一项工作。一个返回对预先提供的选项的概率分布。另一个则负责写作。

简短的回答:如果你需要的是在已有硬件上评分的闭集决策,并且 1.71 GB 而非 4.43 GB 正是能否交付的分水岭,那么 Intern-Decision-0.8B 就值得拥有。如果你想要的是 InternLM 本周发布的最准确的小型评分器——也就是那个 4B——那它就不值得拥有;又或者,如果你的答案尚未在提示词中逐一列出,那么这两者都不是合适的工具,而这对组合中只有 Qwen 3.8 能胜任这项工作。

仓库所说的,以及没有其他任何东西会说的

从证据说起,因为证据少得可怜。InternLM 并未针对这个模型发布任何公告。没有发布帖,没有论文,没有仓库说明。Hugging Face 模型卡上链接了一个演示 Space 和一个 GitHub 仓库,而截至本文写作时,该 Space 返回 401,GitHub 链接返回 404——模型卡指给你获取更多信息的这两个地方都是关闭的。三个检查点在 9 月 26 日 UTC 时间约 05:36 的四十秒内相继出现:Intern-Decision-0.8B、Intern-Decision-2B 和 Intern-Decision-4B,全都带有相同的标签——决策制定、多模态、结构化预测——并且全都是 Qwen 检查点的微调版本,此处为 Qwen3.5-0.8B。

对于一个尚未公布的发布而言,从代码仓库中能获知的信息精确得异乎寻常,因为该实验室在发布权重的同时一并提供了自家的推理模块。0.8B 通过模型目录中一个 16 KB 的 inference.py 加载,要求 Python 3.12 或更高版本,以及 torch 2.9.1 搭配 transformers 5.14.1,并暴露一个 DecisionEngine 类,你只需实例化一次便可反复使用。传入一个 Python dict,出来一个响应 dict。无法得知的是:这是一次已完成的正式发布,还是一次早期推送;是否会推出托管端点;以及它所处的两个检查点究竟是指同一产品在不同规模下的版本,还是三个恰好同名的不同产品。InternLM 之外还没有人运行过其中任何一个。

The Hugging Face model card for InternLM's Intern-Decision-0.8B, showing the internlm organisation, a 0.9B params label, tags for image-text-to-text, transformers, safetensors, qwen3_5, decision-making, multimodal, structured-prediction and conversational, an opening line stating the model is a multimodal structured decision model fine-tuned from Qwen3.5-0.8B, and a Checkpoint and docs section that also reports 0.9B params.

同门问题:2B 更快且更好

以下是 InternLM 自己发布的表格中让 0.8B 难以定位的那部分。沿同样的七个测试套件纵向看这三个规模:

• 速度 — 0.8B:平均 33.98 毫秒,中位数 33.44 毫秒,p95 为 37.50 毫秒。2B:33.28 毫秒,33.15 毫秒,33.55 毫秒。4B:44.16 毫秒,44.03 毫秒,44.60 毫秒。所有数值均在单张 RTX 4090 上通过本地 Hugging Face 路径按每次查询测得。

• 七套件平均值——0.8B:79.38。2B:84.68。4B:90.02。

• 校准 — 0.8B:Brier 0.530,ECE 0.066。2B:Brier 0.437,ECE 0.100。4B:Brier 0.347,ECE 0.065。

• bf16 下的磁盘占用 — 0.8B:1.71 GB。2B:4.43 GB。4B:9.08 GB。

2B 在均值上更快,在尾部延迟上显著更紧,而且准确率更高——三者同时做到。因此,“越小越快”在这个系列中并不成立——而且是双重不成立,因为 4B 比两者都慢。0.8B 唯一完胜的维度,恰恰是没人拿来做基准测试的那一个:1.71 GB,对比 2B 的 4.43 GB 和 4B 的 9.08 GB。如果你要在固定内存预算内放置一个评分器——一台小型常开设备、一块与他人共享的 GPU、一个边缘节点,而上面已有一个语言模型占用了大部分显卡——那就是全部理由,而且这个理由完全站得住脚。

表格的其余部分探究的是小型模型在哪些方面表现出不均衡的短板。0.8B 的 Typed Decision 得分为 77.35,而 4B 为 80.55——在参数量仅为五分之一的情况下,两者仅差三分。但 Jevbench-Original 从 98.61 降至 80.56,WildJailBreak 从 89.86 暴跌至 64.48。无论这两个测试套件衡量的是什么——卡片没有说明,而且卡片完全没有给出套件定义——它们是对小型检查点惩罚最严重的。一个在一个维度上表现稳健、却在另外两个维度上断崖式下跌的模型,并不是一个均匀变弱的模型。它是一个具有特定能力边界的模型,在将整个机群投入之前,你会想知道你的工作负载处于什么位置。

关于校准这一行,再提醒一点。0.8B 的 ECE 为 0.066,这是它最好的数字——在同一套测试上优于 Jev 的 0.095——而它的 Brier 分数为 0.530,却比 Jev 的 0.358 更差。校准误差与概率均方误差不是同一种度量,而一张表如果显示其中一个表现强、另一个表现弱,那是在告诉你:该分布在其置信度峰值附近形状良好,但在中间区域比应有的更肥厚。如果你的系统按置信度设阈值,这一区别比平均值更重要。

1.71 GB 实际能换来什么

此模型中的推理路径是评分器,而非生成器,二者在成本上的差异是结构性的,而非增量性的。你向它提供共享状态、命名问题的模式,以及可选的最多八张图像。每个问题属于三种类型之一:choice(有序选项集中的一个),score(序数标度,以概率加权期望值返回),或 noul(二元否/是)。状态、模式和完整的助手 JSON 骨架会被渲染,每个字段一个占位符;模型运行单次因果前向传播,并在紧邻每个占位符之前的位置读取 logits。仅对该字段允许的候选符号进行 softmax,应用检查点拟合的校准,符号再映射回你的选项值。

由此产生三个后果。没有输出 token,因此也没有输出价格——一百万次决策在 token 上不花任何成本。没有解码循环,也没有会忘记的花括号,因此格式错误的 JSON 不是一种失败模式。而且,由于每个字段的答案空间都是按请求组装的,你今天下午临时想出的 schema 无需重新训练:添加一个问题,它的选项就会成为该字段的候选符号。

这些限制同样说得一清二楚。一到十六个问题,每个最多 62 个选项,最多八张图片,默认上限 8,192 个 token——超过上限的输入会被拒绝,而非被截断。最后这一条是值得细细琢磨的设计决策,因为静默截断正是分类器悄悄开始回答另一个问题(而非你实际所问的那个问题)的方式。InternLM 则选择大声报错,这既是正确做法,也是一个运维陷阱:一段冗长的工单串,加上一个 schema,再加上图片,会比你预想中更快地冲破 8,192 的上限,而一旦超限,并没有任何优雅的退路。

而这 1.71 GB 换来的是你可以算出来的运行时经济性。按每次决策 33.98 毫秒计算,一百万次就是一块 RTX 4090 的 9.44 小时。4B 完成同样的一百万次需要 12.3 小时,并且为了换来你本来没有的 7.37 GB,牺牲了 10.5 个百分点的准确率。这两个数字都不包括机器的成本,也都不包括人们会忘掉的那部分:你是在运营一项服务,而仓库里并没有服务器。

The OrcaRouter model page for Qwen3.8 Max, showing the model name, family and tier badges, a 1,000,000-token context window, pricing of $2.00 per million input tokens and $6.00 per million output tokens, an output speed of 63.71 tokens per second, an error rate of 0.69 percent, an Artificial Analysis index of 45.4 at rank 15 of 145, and a side panel listing Qwen 3.8 27B at an Artificial Analysis intelligence index of 33.65 with $0.33 and $2.40 per million tokens.

Qwen 3.8 不是单一模型,值得注意的则是廉价的那一端。

Qwen 3.8作为一个独立名称,指的是Qwen3.8-2.4T-A95B:这是阿里巴巴于2026年8月12日以开放权重形式发布的2.4万亿参数稀疏混合专家核心模型,每个token约激活950亿参数,采用自定义许可证而非Apache 2.0。同一核心的托管交付版本则是Qwen3.8-Max,自8月3日起通过付费API正式可用,并更新为标注日期为9月2日的快照版本。它们是同一个大脑的两种售卖方式,而大多数人实际会调用的,是第二种交付形式。

根据独立数据,Artificial Analysis 测得 Qwen3.8-Max 的九月快照在 Intelligence Index 上为 45.4——在 145 个已索引模型中排名第 15——AA Coding 得分为 76.2,在 138 个中排名第九,GPQA Diamond 为 92.8,Humanity's Last Exam 为 43.1,长上下文召回分数为 80.3。该开放检查点得分为 39.9,落后于其蒸馏来源的 API。在我们自己的七天 playground 窗口内,Qwen3.8-Max 的 p50 为 2,578 毫秒,p95 为 9,539 毫秒,输出速度为每秒 55.5 个 token,错误率为 1.57%。Qwen3.8-Max 可在 OrcaRouter 上调用,价格为供应商标价、0% 加价,因此阿里巴巴的价格变动会在我们这边当天生效,而不是等到下一个计费周期。

稠密版本才是应当与 1.71 GB 本地检查点相权衡的那个,因为它是这个系列中最便宜地获取通用能力的方式。Qwen3.8-27B 采用 Apache 2.0 许可,原生支持 262,144 token 的上下文,在我们的目录中价格为每百万 token 0.33 美元和 2.40 美元。其 Artificial Analysis 智能指数为 33.7。它的参数量大约是 Intern-Decision-0.8B 的三十二倍,仍然是生成式的,对于大规模闭集决策而言仍然是错误的工具——但它是诚实的折中选项,也是本次比较中唯一真正既便宜又真正通用的成员。

直白地说,评分器对生成器

• 上下文 —— Qwen3.8-Max 拥有 1,000,000 token 的上下文窗口。Intern-Decision-0.8B 则拒绝任何超过 8,192 的内容。相差 122 倍,是硬性拒绝,而非截断。

• 输入 — Qwen3.8-Max 接受文本、图像和视频。Intern-Decision-0.8B 接受文本以及最多八张图像,而图像 token 也计入同样的 8,192 预算。

• 输出——Qwen3.8-Max 会写作、推理、调用工具,并能按请求输出 JSON。Intern-Decision-0.8B 无法生成一个段落、一段理由或一份计划。它只能对你已经想到要列出的选项进行评分。

• 单次调用成本——一次真实的分流调用包含 800 个输入 token 和 150 个输出 token,在 Qwen3.8-Max 上大约花费 0.0025 美元,这还没算上任何推理 token,而且它的输出端估算偏乐观,因为它是一个推理模型。一百万次这样的调用大约是 2,500 美元。Intern-Decision-0.8B 则完全没有 token 价格:一百万次决策相当于 9.44 小时的 4090 运行时间,无论这台 4090 是你自有的还是租来的。

• 延迟——过去七天内,Qwen3.8-Max 的中位数延迟为 2,578 毫秒,其中包含网络与排队时间。Intern-Decision-0.8B 的 33.98 毫秒只是本地显卡上的一次裸前向传播,并非同一种测量;诚实的比较是一个数量级的差距,而不是八十倍。

• 证据——这里的每一个 Intern-Decision-0.8B 数据都是厂商在 InternLM 自有测试框架上报告的,且没有任何人复现过,包括延迟数据。每一个 Qwen 3.8 数据要么来自阿里巴巴自己,要么来自 Artificial Analysis 的测量,并且在上文中已分别标注。

• 独立评分——Qwen3.8-Max 有。Intern-Decision-0.8B 则完全没有,任何形式的都没有,且没有任何推理服务商部署它。

A two-column scoreboard comparing Intern-Decision-0.8B and Qwen 3.8. The Intern-Decision-0.8B column reads Parameters 853M, Seven-suite average 79.38, Context 8,192 tokens, Output scores only no text, Cost no token price 1.71 GB local, Latency 33.98 ms local pass. The Qwen 3.8 Max column reads Parameters 2.4T sparse, AA Intelligence Index 45.4, Context 1,000,000 tokens, Output text image video tools, Cost $2.00 and $6.00 per million, Latency 2,578 ms p50 hosted. A footer reads Intern-Decision-0.8B figures are vendor-reported and unreproduced; Qwen3.8-Max figures per Artificial Analysis and our own seven-day window.

运行此流水线的两种方式

运营上的岔路比基准测试上的岔路更尖锐。Intern-Decision-0.8B 是一个模块,不是一项服务。没有 OpenAI 兼容的端点,没有批处理服务器,没有健康检查,没有重试策略,也没有第二个副本——除非你自己去构建一个。它在一个进程中加载,一次只应答一个 dict;如果你需要故障转移,那你自己就是故障转移机制。对于一个在没有发布说明的情况下发布的 8.53 亿参数研究检查点来说,这是公允的描述,因此在做决策时应相应地将其计入考量。

同一流水线的生成部分是一次网络调用,而网络调用正是路由器存在的意义。Qwen3.8-Max 和 Qwen3.8-27B 都可以通过一个 OpenAI 兼容密钥访问,自动故障转移意味着上游降级不会变成你的事故——这里值得一提,是因为 Qwen3.8-Max 在我们这边的实时七日错误率是 1.57%,这个数字看似很低,直到它落在你自己的请求上。合理的模式正是这种搭配一直在悄然描述的:在本地运行廉价的闭集评分器,因为它速度快且每次调用零成本;而对推理步骤进行路由,因为降价、模型更迭和故障实际上都发生在那里。

有两件事我们不会宣称。Intern-Decision-0.8B 不是我们的路由之一,在 InternLM 将其托管在某个地方之前也不会是——我们不会暗示并非如此。而且我们今天根本没有托管任何 InternLM 模型,所以本文中没有任何内容是在推销通过我们来运行该对象。

什么会改变答案

三个开放问题,都能在几天内得到答案。InternLM 会发布它自己的模型卡所链接的 GitHub 仓库,并随之一同发布关于这些权重是如何调优的说明吗?是否会有一篇发布文章紧随这批检查点之后,把一次悄无声息的推送变成有文档记录、并明确说明部署情况的发布?还有,是否会有任何独立方在并非 InternLM 的硬件上复现 79.38 的平均分或 0.066 的校准误差?

在其中任何一个落地之前,对 Intern-Decision-0.8B 的诚实解读是狭窄而具体的:它在一个三成员系列中是最便宜的闭集评分器,其占用空间使其能够适配自家更快、更准确的同门模型所无法适配的场景,发布时没有公告,也没有那个能告诉你它针对什么进行调优的产物。如果你的决策是闭集的,你的答案可以在一个提示中枚举,并且 1.71 GB 是你的部署真正看重的数字,那么它就是正确的选择,在那个规模上没有任何其他东西能与之相比。如果你的答案无法提前枚举,或者你的状态超过 8,192 个 token,或者你需要一个能向人类展示的理由,那么这种比较从来就不接近——而你想要的那个模型也从来不是那个 8.53 亿参数的模型。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新