
Intern-Decision-0.8B 对比 Qwen 3.8:8.53 亿参数与封闭答案集
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Intern-Decision-0.8B 是 InternLM 于 2026 年 9 月 26 日上午推送到 Hugging Face 的三个决策模型中最小的一个,而且它并不是其中最快的。这是首先值得知道的一点。按照该实验室自己的测量,2B 的同门版本运行略快——33.28 毫秒对 33.98 毫秒——并且在相同的七套件平均值上高出六分,因此,选择十亿参数以下检查点的通常理由,即原始速度,在这里并不适用。适用的是规模:852,985,920 个参数,1.71 GB 的 bf16 权重,小到可以永久驻留在一台还有其他任务的机器的边角余量中。把它与 Qwen3.8-Max 相比——这是该厂商 8 月发布的 2.4 万亿参数稀疏混合专家核心的托管交付版本,定价为每百万 token 2.00 美元和 6.00 美元——两者并不是在竞争同一项工作。一个返回对预先提供的选项的概率分布。另一个则负责写作。
简短的回答:如果你需要的是在已有硬件上评分的闭集决策,并且 1.71 GB 而非 4.43 GB 正是能否交付的分水岭,那么 Intern-Decision-0.8B 就值得拥有。如果你想要的是 InternLM 本周发布的最准确的小型评分器——也就是那个 4B——那它就不值得拥有;又或者,如果你的答案尚未在提示词中逐一列出,那么这两者都不是合适的工具,而这对组合中只有 Qwen 3.8 能胜任这项工作。
仓库所说的,以及没有其他任何东西会说的
从证据说起,因为证据少得可怜。InternLM 并未针对这个模型发布任何公告。没有发布帖,没有论文,没有仓库说明。Hugging Face 模型卡上链接了一个演示 Space 和一个 GitHub 仓库,而截至本文写作时,该 Space 返回 401,GitHub 链接返回 404——模型卡指给你获取更多信息的这两个地方都是关闭的。三个检查点在 9 月 26 日 UTC 时间约 05:36 的四十秒内相继出现:Intern-Decision-0.8B、Intern-Decision-2B 和 Intern-Decision-4B,全都带有相同的标签——决策制定、多模态、结构化预测——并且全都是 Qwen 检查点的微调版本,此处为 Qwen3.5-0.8B。
对于一个尚未公布的发布而言,从代码仓库中能获知的信息精确得异乎寻常,因为该实验室在发布权重的同时一并提供了自家的推理模块。0.8B 通过模型目录中一个 16 KB 的 inference.py 加载,要求 Python 3.12 或更高版本,以及 torch 2.9.1 搭配 transformers 5.14.1,并暴露一个 DecisionEngine 类,你只需实例化一次便可反复使用。传入一个 Python dict,出来一个响应 dict。无法得知的是:这是一次已完成的正式发布,还是一次早期推送;是否会推出托管端点;以及它所处的两个检查点究竟是指同一产品在不同规模下的版本,还是三个恰好同名的不同产品。InternLM 之外还没有人运行过其中任何一个。

同门问题:2B 更快且更好
以下是 InternLM 自己发布的表格中让 0.8B 难以定位的那部分。沿同样的七个测试套件纵向看这三个规模:
• 速度 — 0.8B:平均 33.98 毫秒,中位数 33.44 毫秒,p95 为 37.50 毫秒。2B:33.28 毫秒,33.15 毫秒,33.55 毫秒。4B:44.16 毫秒,44.03 毫秒,44.60 毫秒。所有数值均在单张 RTX 4090 上通过本地 Hugging Face 路径按每次查询测得。
• 七套件平均值——0.8B:79.38。2B:84.68。4B:90.02。
• 校准 — 0.8B:Brier 0.530,ECE 0.066。2B:Brier 0.437,ECE 0.100。4B:Brier 0.347,ECE 0.065。
• bf16 下的磁盘占用 — 0.8B:1.71 GB。2B:4.43 GB。4B:9.08 GB。
2B 在均值上更快,在尾部延迟上显著更紧,而且准确率更高——三者同时做到。因此,“越小越快”在这个系列中并不成立——而且是双重不成立,因为 4B 比两者都慢。0.8B 唯一完胜的维度,恰恰是没人拿来做基准测试的那一个:1.71 GB,对比 2B 的 4.43 GB 和 4B 的 9.08 GB。如果你要在固定内存预算内放置一个评分器——一台小型常开设备、一块与他人共享的 GPU、一个边缘节点,而上面已有一个语言模型占用了大部分显卡——那就是全部理由,而且这个理由完全站得住脚。
表格的其余部分探究的是小型模型在哪些方面表现出不均衡的短板。0.8B 的 Typed Decision 得分为 77.35,而 4B 为 80.55——在参数量仅为五分之一的情况下,两者仅差三分。但 Jevbench-Original 从 98.61 降至 80.56,WildJailBreak 从 89.86 暴跌至 64.48。无论这两个测试套件衡量的是什么——卡片没有说明,而且卡片完全没有给出套件定义——它们是对小型检查点惩罚最严重的。一个在一个维度上表现稳健、却在另外两个维度上断崖式下跌的模型,并不是一个均匀变弱的模型。它是一个具有特定能力边界的模型,在将整个机群投入之前,你会想知道你的工作负载处于什么位置。
关于校准这一行,再提醒一点。0.8B 的 ECE 为 0.066,这是它最好的数字——在同一套测试上优于 Jev 的 0.095——而它的 Brier 分数为 0.530,却比 Jev 的 0.358 更差。校准误差与概率均方误差不是同一种度量,而一张表如果显示其中一个表现强、另一个表现弱,那是在告诉你:该分布在其置信度峰值附近形状良好,但在中间区域比应有的更肥厚。如果你的系统按置信度设阈值,这一区别比平均值更重要。
1.71 GB 实际能换来什么
此模型中的推理路径是评分器,而非生成器,二者在成本上的差异是结构性的,而非增量性的。你向它提供共享状态、命名问题的模式,以及可选的最多八张图像。每个问题属于三种类型之一:choice(有序选项集中的一个),score(序数标度,以概率加权期望值返回),或 noul(二元否/是)。状态、模式和完整的助手 JSON 骨架会被渲染,每个字段一个占位符;模型运行单次因果前向传播,并在紧邻每个占位符之前的位置读取 logits。仅对该字段允许的候选符号进行 softmax,应用检查点拟合的校准,符号再映射回你的选项值。
由此产生三个后果。没有输出 token,因此也没有输出价格——一百万次决策在 token 上不花任何成本。没有解码循环,也没有会忘记的花括号,因此格式错误的 JSON 不是一种失败模式。而且,由于每个字段的答案空间都是按请求组装的,你今天下午临时想出的 schema 无需重新训练:添加一个问题,它的选项就会成为该字段的候选符号。
这些限制同样说得一清二楚。一到十六个问题,每个最多 62 个选项,最多八张图片,默认上限 8,192 个 token——超过上限的输入会被拒绝,而非被截断。最后这一条是值得细细琢磨的设计决策,因为静默截断正是分类器悄悄开始回答另一个问题(而非你实际所问的那个问题)的方式。InternLM 则选择大声报错,这既是正确做法,也是一个运维陷阱:一段冗长的工单串,加上一个 schema,再加上图片,会比你预想中更快地冲破 8,192 的上限,而一旦超限,并没有任何优雅的退路。
而这 1.71 GB 换来的是你可以算出来的运行时经济性。按每次决策 33.98 毫秒计算,一百万次就是一块 RTX 4090 的 9.44 小时。4B 完成同样的一百万次需要 12.3 小时,并且为了换来你本来没有的 7.37 GB,牺牲了 10.5 个百分点的准确率。这两个数字都不包括机器的成本,也都不包括人们会忘掉的那部分:你是在运营一项服务,而仓库里并没有服务器。

Qwen 3.8 不是单一模型,值得注意的则是廉价的那一端。
Qwen 3.8作为一个独立名称,指的是Qwen3.8-2.4T-A95B:这是阿里巴巴于2026年8月12日以开放权重形式发布的2.4万亿参数稀疏混合专家核心模型,每个token约激活950亿参数,采用自定义许可证而非Apache 2.0。同一核心的托管交付版本则是Qwen3.8-Max,自8月3日起通过付费API正式可用,并更新为标注日期为9月2日的快照版本。它们是同一个大脑的两种售卖方式,而大多数人实际会调用的,是第二种交付形式。
根据独立数据,Artificial Analysis 测得 Qwen3.8-Max 的九月快照在 Intelligence Index 上为 45.4——在 145 个已索引模型中排名第 15——AA Coding 得分为 76.2,在 138 个中排名第九,GPQA Diamond 为 92.8,Humanity's Last Exam 为 43.1,长上下文召回分数为 80.3。该开放检查点得分为 39.9,落后于其蒸馏来源的 API。在我们自己的七天 playground 窗口内,Qwen3.8-Max 的 p50 为 2,578 毫秒,p95 为 9,539 毫秒,输出速度为每秒 55.5 个 token,错误率为 1.57%。Qwen3.8-Max 可在 OrcaRouter 上调用,价格为供应商标价、0% 加价,因此阿里巴巴的价格变动会在我们这边当天生效,而不是等到下一个计费周期。
稠密版本才是应当与 1.71 GB 本地检查点相权衡的那个,因为它是这个系列中最便宜地获取通用能力的方式。Qwen3.8-27B 采用 Apache 2.0 许可,原生支持 262,144 token 的上下文,在我们的目录中价格为每百万 token 0.33 美元和 2.40 美元。其 Artificial Analysis 智能指数为 33.7。它的参数量大约是 Intern-Decision-0.8B 的三十二倍,仍然是生成式的,对于大规模闭集决策而言仍然是错误的工具——但它是诚实的折中选项,也是本次比较中唯一真正既便宜又真正通用的成员。
直白地说,评分器对生成器
• 上下文 —— Qwen3.8-Max 拥有 1,000,000 token 的上下文窗口。Intern-Decision-0.8B 则拒绝任何超过 8,192 的内容。相差 122 倍,是硬性拒绝,而非截断。
• 输入 — Qwen3.8-Max 接受文本、图像和视频。Intern-Decision-0.8B 接受文本以及最多八张图像,而图像 token 也计入同样的 8,192 预算。
• 输出——Qwen3.8-Max 会写作、推理、调用工具,并能按请求输出 JSON。Intern-Decision-0.8B 无法生成一个段落、一段理由或一份计划。它只能对你已经想到要列出的选项进行评分。
• 单次调用成本——一次真实的分流调用包含 800 个输入 token 和 150 个输出 token,在 Qwen3.8-Max 上大约花费 0.0025 美元,这还没算上任何推理 token,而且它的输出端估算偏乐观,因为它是一个推理模型。一百万次这样的调用大约是 2,500 美元。Intern-Decision-0.8B 则完全没有 token 价格:一百万次决策相当于 9.44 小时的 4090 运行时间,无论这台 4090 是你自有的还是租来的。
• 延迟——过去七天内,Qwen3.8-Max 的中位数延迟为 2,578 毫秒,其中包含网络与排队时间。Intern-Decision-0.8B 的 33.98 毫秒只是本地显卡上的一次裸前向传播,并非同一种测量;诚实的比较是一个数量级的差距,而不是八十倍。
• 证据——这里的每一个 Intern-Decision-0.8B 数据都是厂商在 InternLM 自有测试框架上报告的,且没有任何人复现过,包括延迟数据。每一个 Qwen 3.8 数据要么来自阿里巴巴自己,要么来自 Artificial Analysis 的测量,并且在上文中已分别标注。
• 独立评分——Qwen3.8-Max 有。Intern-Decision-0.8B 则完全没有,任何形式的都没有,且没有任何推理服务商部署它。

运行此流水线的两种方式
运营上的岔路比基准测试上的岔路更尖锐。Intern-Decision-0.8B 是一个模块,不是一项服务。没有 OpenAI 兼容的端点,没有批处理服务器,没有健康检查,没有重试策略,也没有第二个副本——除非你自己去构建一个。它在一个进程中加载,一次只应答一个 dict;如果你需要故障转移,那你自己就是故障转移机制。对于一个在没有发布说明的情况下发布的 8.53 亿参数研究检查点来说,这是公允的描述,因此在做决策时应相应地将其计入考量。
同一流水线的生成部分是一次网络调用,而网络调用正是路由器存在的意义。Qwen3.8-Max 和 Qwen3.8-27B 都可以通过一个 OpenAI 兼容密钥访问,自动故障转移意味着上游降级不会变成你的事故——这里值得一提,是因为 Qwen3.8-Max 在我们这边的实时七日错误率是 1.57%,这个数字看似很低,直到它落在你自己的请求上。合理的模式正是这种搭配一直在悄然描述的:在本地运行廉价的闭集评分器,因为它速度快且每次调用零成本;而对推理步骤进行路由,因为降价、模型更迭和故障实际上都发生在那里。
有两件事我们不会宣称。Intern-Decision-0.8B 不是我们的路由之一,在 InternLM 将其托管在某个地方之前也不会是——我们不会暗示并非如此。而且我们今天根本没有托管任何 InternLM 模型,所以本文中没有任何内容是在推销通过我们来运行该对象。
什么会改变答案
三个开放问题,都能在几天内得到答案。InternLM 会发布它自己的模型卡所链接的 GitHub 仓库,并随之一同发布关于这些权重是如何调优的说明吗?是否会有一篇发布文章紧随这批检查点之后,把一次悄无声息的推送变成有文档记录、并明确说明部署情况的发布?还有,是否会有任何独立方在并非 InternLM 的硬件上复现 79.38 的平均分或 0.066 的校准误差?
在其中任何一个落地之前,对 Intern-Decision-0.8B 的诚实解读是狭窄而具体的:它在一个三成员系列中是最便宜的闭集评分器,其占用空间使其能够适配自家更快、更准确的同门模型所无法适配的场景,发布时没有公告,也没有那个能告诉你它针对什么进行调优的产物。如果你的决策是闭集的,你的答案可以在一个提示中枚举,并且 1.71 GB 是你的部署真正看重的数字,那么它就是正确的选择,在那个规模上没有任何其他东西能与之相比。如果你的答案无法提前枚举,或者你的状态超过 8,192 个 token,或者你需要一个能向人类展示的理由,那么这种比较从来就不接近——而你想要的那个模型也从来不是那个 8.53 亿参数的模型。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
