
Intern-Decision-4B 对比 Qwen 3.8:44 毫秒的前向传播,对决 2.4 万亿参数
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
InternLM 于 2026 年 9 月 26 日上午在 Hugging Face 上发布了 Intern-Decision-4B——没有发布帖,没有博客文章,其自身模型卡上的一个 GitHub 链接返回 404,一个演示 Space 返回 401。权重是真实且可下载的;公告却不在那里。而它们底层的模型是 Qwen3.5-4B 的微调版本,这正是让它与托管旗舰模型的对比比一纸规格参数更有价值的原因。这两者并非竞争对手。它们是同一条流水线的两端,而全部问题在于它们之间的界线落在何处。底层核心是该厂商于 8 月发布的 2.4 万亿参数模型,现在以 Qwen3.8-Max 提供服务,按每百万 token 2.00 美元和 6.00 美元计费;Intern-Decision-4B 则是对那个七个月前的基础模型进行 45.4 亿参数重建的版本,它完全不输出 token,在一次前向传播中回答最多十六个带类型的问题,并且每次调用零成本,因为没有输出可供计费。
一句话的回答:如果你的任务是一个答案集合封闭的决策,Intern-Decision-4B 每项决策大约快五十倍,而且在结构上更便宜,在这个狭窄的维度上没有任何前沿模型能胜过它。如果你的任务属于其他任何情况——推理、长上下文、工具使用,任何答案未在你的提示中预先枚举的情况——Qwen 3.8 不只是更好,它是两者中唯一能真正胜任这项工作的模型。下面所有内容都是为了精确地找到这条分界线。
究竟哪些是已经确认的,哪些不是
从证据开始,因为叙事框架很重要。Intern-Decision-4B 没有厂商公告。没有新闻稿,没有论文,没有可阅读的仓库描述。今天存在的是今早发布在 internlm 组织下的一个 Hugging Face 仓库——Intern Large Models,上海人工智能实验室团队——采用 Apache 2.0 许可证,并在其旁边保留了上游 Qwen 许可证,即 LICENSE-QWEN。两个同级检查点在四十秒内相继出现:Intern-Decision-0.8B 有 8.53 亿参数,Intern-Decision-2B 有 22.1 亿参数。三者都带有相同标签——决策制定、多模态、结构化预测——并且三者都位于一个尚未公开解析的模型集合下。
尚未确认的是:这究竟是正式发布,还是一次提前推送。该仓库创建于 05:36 UTC,并在同日 08:00 UTC 之前再次被修改,而姊妹检查点上的进一步公开活动一直持续到 09:00 之后。InternLM 没有说明其预期的部署方案是什么,没有发布它所链接到的仓库,也没有说明是否会推出托管端点。请将本文中的每一项基准测试数据都视为厂商自报且未经复现——因为截至本文撰写时,关于这个模型,其他任何地方实际上都没有任何相关内容。用这个名称进行三种不同的搜索,均一无所获。

架构上的赌注:评分器,而非生成器
Intern-Decision-4B 自家文档中最重要的一句话是个否定句:推理路径“不调用 generate(),也不采样自由形式的文本”。这不是什么实现细节,而是整个设计的核心,也正是它区别于“给 Qwen3.8-Max 塞一个 JSON schema,然后祈祷大括号能闭合”这种做法的地方。
以下是该卡片所描述的机制。你向模型提供一个共享状态、一个命名问题的模式,以及可选的至多八张图像。每个问题都属于以下三种类型之一:选择(从一组有序选项中选一个),评分(在序数量表上评分,返回概率加权值),或 noul(二元否/是)。系统提示、状态、模式以及完整的助手 JSON 骨架都会以每个字段一个占位符的形式渲染出来。然后——这就是关键——模型会运行一次因果前向传播,并在每个占位符之前的位置读取 logits。对该字段允许的符号执行 softmax,应用检查点的校准,然后将这些符号映射回你原来的选项值。
这些后果是实实在在的。由于每个字段的答案空间是按请求组装的,而不是固化在词表头中,你下午才设计出的模式无需重新训练——添加一个问题,选项就会成为该字段的候选符号。由于没有解码循环,也就没有输出词元,没有会忘记的花括号,也没有针对格式错误 JSON 的重试逻辑。而且,由于所有问题都基于对状态的同一次读取来评分,十六个问题只需一次前向传播,而不是十六次。
这些限制同样具体,卡片在陈述它们时也毫不含糊。1 到 16 个问题,每个问题最多 62 个选项,最多八张图片。默认上限为 8,192 个 token——而超出该上限的输入会被直接拒绝,而不做截断。最后这一条值得细细琢磨:静默截断,正是分类器悄悄开始回答另一个问题的方式,而 InternLM 选择的是大声失败。这是正确的决定,同时也是一个运维陷阱,因为一段冗长的工单记录加上一个 schema 再加上图片,会比你预想得更快突破 8,192,而且没有优雅的出路——你只会得到一个错误。
Intern-Decision-4B 在哪些方面胜出,而且赢得毫无悬念
两条轴线,且两者都是结构性的,而非渐进式的。
• 每次决策的延迟——平均 44.16 毫秒,中位数 44.03 毫秒,p95 为 44.60 毫秒,基于单块 RTX 4090 通过本地 Hugging Face 路径测得。相比之下,Qwen3.8-Max 在我们自己的 playground 上实时七天窗口显示 p50 为 2,474 毫秒,p95 为 9,789 毫秒,输出速度为每秒 55.4 个 token。中位数上大约相差 56 倍,而这种比较与其说是不公平,不如说是两种不同操作之间的比较:一个模型进行分类,另一个先推理再写作。差距确实存在,其原因也确实存在。
每次决策的成本——而这是算术问题,不是观点问题。以一个真实的支持工单分类调用为例:800 个输入 token 的状态和 schema,以及 150 个输出 token 的结构化 JSON。在 Qwen3.8-Max 上,这是 800 × $2.00/M 加上 150 × $6.00/M,约合每次决策 $0.0025,还没算上任何一个推理 token——而 Qwen3.8-Max 是一个推理模型,所以输出侧的这个数字还是乐观偏小的。一百万次决策大约花费 $2,500。同样的百万次决策在 Intern-Decision-4B 上,token 成本为零,大约需要 12.3 小时的 RTX 4090 时间。Intern-Decision-4B 没有输出价格,因为它没有输出。
这笔交易诚实且显而易见:4B 需要一块你拥有或租用的 GPU,它会占用那块 GPU,而且它永远只能做一件事。但如果那一件事正是你的产品每天要做上百万次的事,那么上面的算术就是整个商业论证,再多的前沿模型能力也改变不了它。
Qwen 3.8 未公布的数字:校准
这是一个不易察觉的差异化因素,而大多数对比都会忽略它,因为它看起来并不像一个基准。
Intern-Decision-4B 会在你的选项取值上返回一个分布,而不只是一个标签——还包括一个置信度,并且对于noul问题,返回校准后的“是”的概率。InternLM 在其自有测试套件上报出的 Brier 分数为 0.347,期望校准误差为 0.065,并在检查点中附带了拟合出的温度:1.99241824;该温度是针对这一规模单独拟合的,方法是在 1,728 个指定校准用例上做负对数似然最小化,另有 1,693 个留出的验证用例。测试套件的标签并未用于选择它。卡片中还有一项独立的 96 用例诊断,使用的是精确参考分布而非采样标签,它显示总体 Brier/ECE 从校准前的 0.628 / 0.213 变为校准后的 0.550 / 0.089——校准这一步把期望误差削减了远超过一半。
现在去看看 Qwen 3.8 那边有没有同样的数值。那里没有。阿里巴巴公布了 Artificial Analysis Index 分数、GPQA Diamond、terminal-bench、SciCode、tau-banking 和长上下文召回率——全都是能力指标。它没有为任何 Qwen 3.8 系列成员公布校准指标,因为生成式模型的置信度并不是厂商会交付的一种量。如果你的系统需要的是一个可以据以设定阈值或进行路由的概率,而不是一个必须信任的答案,那么这种差别不是程度上的差别。一个模型给你一个带有记录在案错误率的数字;另一个给你文本,而你得围绕它自己建立置信度估计。
Qwen 3.8 在哪些方面胜出,而且差距还不小
将二者在它们可以被要求做什么这一点上并排对照,界限就不再微妙了。
• 背景说明——Qwen3.8-Max 拥有 1,000,000 个 token 的上下文窗口。Intern-Decision-4B 则会拒绝任何超过 8,192 的输入。两者相差 122 倍,而且没有任何变通办法,因为这一输入上限是被强制执行,而非截断处理。
• 输入模态 — Qwen3.8-Max 可接受文本、图像和视频。Intern-Decision-4B 可接受文本和图像,最多八张,且图像 token 也计入相同的 8,192 预算。
• 推理与工具——Qwen3.8-Max 在其公布的能力中包含工具使用、JSON 模式和推理,并在 Artificial Analysis 智能指数中获得 45.4 分,在已收录的 145 个模型中位列第十五,其 AA 编码得分为 76.2,在 138 个模型中位列第九。这些是 Artificial Analysis 发布的独立数据,并非厂商自述。Intern-Decision-4B 在 Artificial Analysis 中没有收录条目,没有任何形式的独立评分,也不具备推理、规划或调用任何工具的能力。
• 开放式输出——Qwen3.8-Max 会撰写。Intern-Decision-4B 无法生成段落、理由说明或计划。它只能对你已经想到要列出的选项进行评分。
同样值得在开放权重阵营一提:如果你想要的是 Qwen 3.8 核心本身,而不是托管路线,那么 Qwen3.8-27B 就是它的稠密同门版本——278 亿参数、Apache 2.0、262,144 token 上下文,并且在提供服务的地方价格约为每百万 token $0.33 / $2.40。它在 AA Intelligence Index 上得分 33.7。它仍然比 Intern-Decision-4B 大一个数量级,仍然是生成式的,而且对于大批量下的封闭集决策来说仍然是错误的工具——但它是诚实的中间选项,也是三者中唯一一个既真正便宜又真正有能力的选择。

诚实地阅读 InternLM 自己的基准测试表
Intern-Decision-4B 的模型卡上附有一张对比表,而缺失的东西,比表里有的东西更能说明问题。表中所列的行是 Jev、Laya、SemIf、Kev、JevK5,以及 InternLM 自家的 0.8B 和 2B。这些无一例外都是另一个 System One 或决策模型条目——Jev 来自 TypeSafe AI,Laya 来自 Convai Innovations,另外还有三个。所有数字都是厂商在 InternLM 自家评测框架上自行报告的。表里根本没有任何前沿模型。
这不是疏忽。这是该宣称的诚实范围。Intern-Decision-4B 在七个套件上的头条平均分为 90.02——Jevbench-Easy 100.00、Jevbench-Original 98.61、Jevbench-Hard 73.87、Typed Decision 80.55、ToolACE 96.45、AG News 90.82、WildJailBreak 89.86——这是对领跑决策模型类别的宣称,而在这张表上它确实做到了,击败了 Jev 的 88.74 和 Laya 的 57.77。它不是在宣称与 Qwen 3.8 竞争,InternLM 也没有在任何地方做出这种宣称。模型卡的范围限定在其自身类别内,而把类别胜利解读为能力胜利,正是本节旨在防止的错误。
还有两点需要提醒。延迟数据——在 4090 上平均 44 ms——是由厂商测得的,会随工作负载和硬件而变化,而且单 GPU 前向传播与包含网络往返和排队的托管 API 调用并不是同一种测量。而校准试点只有 96 个案例:它是诊断,不是基准测试,卡片上也是这么写的。
部署问题,这才是真正的分岔点
暂时忘掉基准测试,问问每一项在操作层面上要求你做什么。
Intern-Decision-4B 以 bf16 格式在磁盘上约为 9.1 GB——两个语言分片分别为 4.26 GB 和 4.15 GB,一个 612 MB 的视觉塔,以及一个 54 MB 的投影器。它通过仓库中自带的 16 KB inference.py 加载,并带有一个 DecisionEngine 类,你只需实例化一次即可重复使用。输入一个 Python 字典,输出一个响应字典,要求 Python 3.12+。它在 4090 上运行耗时 44 毫秒,而 0.8B 的小兄弟体量足够小,用少得多的算力就能推理。但模块本身就是接口——没有服务器,没有兼容 OpenAI 的端点,也没有托管 API。你是在围绕它构建服务,而如果你需要两个实例来做故障转移,那也得你自己来搭。
同一管线的生成侧则完全是另一个决策,而这正是路由器真正要处理的事。Qwen3.8-Max 和 Qwen3.8-27B 都能在 OrcaRouter 上通过同一个 OpenAI 兼容密钥调用,价格按供应商标价、0% 加价透传——因此当阿里巴巴调整某个 Qwen 价格时,我们这边当天就会生效,而不是等到下一个计费周期。Intern-Decision-4B 不是我们的路由之一,在 InternLM 将其托管到某个地方之前也不会是;我们不会假装不是这样。我们覆盖的是这条管线中属于网络调用的那一半:一个密钥访问 200+ 个模型,Qwen3.8-Max 性能下降时自动故障转移——其实时七日错误率为 1.78%——以及在你最终选定之前,能在同一请求路径中对两个 Qwen 3.8 层级进行相互 A/B 对比的能力。
这才是值得记住的模式。在本地运行评分器,因为它便宜、快,而且能把一件范围很窄的事做好。把推理环节路由出去,因为供应商更替、降价和故障实际上都发生在那里。

你究竟该选哪一个
如果你的决策属于封闭集合、答案可以在提示词中一一列举、你会大规模重复执行同一决策,并且你对概率和标签同样看重,那就选 Intern-Decision-4B。工单路由、基于固定分类体系的内容审核、按你自己掌控的模式做结构化抽取、评分细则、二值门控——凡是人类能够事先写好选项清单的场景,都算在内。45.4 亿参数对自身的上限毫不讳言:卡片上就写着,4B 在 Jevbench-Hard 上是 73.87,而在 Easy 上是 100.00,也就是说决策形态越难,这个小模型放弃的东西就越多。
选择 Qwen 3.8——如果你想要托管核心,意思就是 Qwen3.8-Max;如果你想要自己能握在手里的权重,那就是 Qwen3.8-27B——如果答案无法事先枚举,如果输入超过 8,192 个 token,如果你需要一套能向人展示的推理依据,如果你需要工具调用,或者如果你需要视频,那就选它。如果你只是不想自己操作 GPU,也选它:每百万次决策消耗 12.3 小时的 4090 时间,只有当你已经拥有 4090,并且在另外 363 天里有别的事情可以用它来做时,才算便宜。
如果你们的流水线正是大多数流水线实际呈现的形态——前端是廉价的闭集分类器,后端是前沿模型,用来处理分类器不确定的情况——那就两者都选。这正是 Intern-Decision-4B 的校准置信度所为之构建的配置,也正是上述 ECE 数值比总体平均更重要的原因。
看什么
三个悬而未决的问题,全都能在几天内得到解答。InternLM 会公布它自家模型卡所链接的 GitHub 仓库——目前是 404——并随之给出训练说明吗?权重发布之后会有公告跟进,把一次悄然的推送变成一次有据可查的发布吗?还有,会有任何独立方在并非 InternLM 的硬件上复现出 90.02 的平均分,或 0.347 的 Brier 分数吗?
在你等待期间,有一点小不一致值得注意,因为当你评估部署规模时,这类事情很重要。这个模型名叫 4B。参数数量为 4,539,265,536——45.4 亿。0.8B 的同系列模型是 8.53 亿,2B 的同系列模型是 22.1 亿,二者无论向上还是向下舍入,都只差毫厘。只有 4B 向下舍入的幅度超过 5 亿。这不是问题。它提醒你,在未公布的发布中,文档是你唯一拥有的规格说明,而且就连这份文档也仍在被编辑。
