
Intern-Decision-4B:InternLM 发布了一款无需生成任何 token 即可作答的决策模型
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
2026年9月26日,四十秒内,InternLM 的 Hugging Face 页面上出现了三个模型仓库:Intern-Decision-0.8B 于 05:35:57 UTC,Intern-Decision-2B 于 05:36:19,以及 internlm/Intern-Decision-4B 于 05:36:37。4B 才是值得关注的那个。它是基于 Qwen3.5-4B 微调得到的,接受一个共享状态、一个命名问题模式以及可选图像,并在单次前向传播中为每个问题返回校准后的答案分布。它从不生成文本。其发布说明直言不讳:“此 API 执行结构化候选评分。它不调用 generate(),也不采样自由形式文本。”四十秒的上传,却没有任何地方有一行公告——没有博客文章,没有推文,没有更新日志,没有发布页。存在的是一份模型卡、一个 inference.py,以及四个 safetensors 分片。

已交付的内容与未交付的内容
家族本身是首先要做对的事,因为 4B 的模型卡悄悄承载着它。它的基准测试表既列出了自己的行,也列出了 Intern-Decision-0.8B 和 Intern-Decision-2B 的行,而这三个检查点在同一分钟内就都上线到了 Hub。2B 的仓库从未在 4B 的模型卡中被链接——你得通过该组织的上传动态流才能找到它。
没有发布出去的,几乎是一次发布通常会带来的一切:
• 没有任何公告——网上零报道,也找不到任何语言的厂商声明。
• 无演示 —— 该卡片链接到一个 Space,地址为 huggingface.co/spaces/internlm/intern-decision;该端点返回 HTTP 401,说明它并非公开,而非已损坏。
• 没有该集合——所宣传的模型集合位于 huggingface.co/collections/internlm/intern-decision也返回 401。
• 无代码仓库——该卡片的 GitHub 链接,github.com/internlm/Intern-Decision返回 404,且 InternLM 组织的仓库列表中不存在该项目。
• 无人采用——截至本文撰写时,4B 仅有一个点赞,下载量为零。
这就是可知的全貌。把下面每一个数字都当作厂商自己给出的数据,因为还没有其他人运行过这个东西。

推理契约就是产品
这张卡的大部分内容都花在一个五步流程上,它告诉你工程实现花在了哪里。问题和选项保持其顺序。每个问题的选项都映射到单 token 符号—— A 到 Z,然后是 a 到 z,然后是 0 到 9。这就是 62 个符号,也正因如此,卡片将一个问题的选项上限设为 62 个。提示词由原始系统提示词、状态、决策模式以及一个完整的助手 JSON 骨架渲染而成,每个字段带有一个 <decision> 占位符,并保留检查点的聊天模板和一个空的思考块。然后进行一次因果前向传播。在每个占位符紧前面的位置读取 logits,仅对该字段允许的候选符号 logits 运行 softmax,应用校准,最后将符号映射回你的选项值。
其结果是固定的形态:没有解码循环、没有采样、没有解析器、没有产生幻觉的余地,并且每轮每个问题都有一个硬性上限——只能做出一个决策。支持三种问题类型——choice,带有有序标准映射,score,带有列表或以数字为键的映射,以及noul,即一种二元的否/是。
规格表中最重要的细节
该卡片明确指出,超过 DecisionEngine(max_length=8192) 的输入会被“拒绝且不截断”。把它与配置对照来看,就会浮现出某种古怪之处:底层文本塔声明的 max_position_embeddings 为 262,144。主干网络能够寻址二十五万个 token;而发布的封装层却拒绝任何超过 8,192 的内容。这并不是一个带有保守默认值的长上下文模型——而是一个决策评分模型,其自带的评测框架给你所能提交的证据量设了上限。如果你的路由问题依赖于超过大约八千个 token 的状态,那么这个按原样发布的检查点将无法回答它,而且它会直接拒绝,而不是把你的输入裁剪缩减。
最多允许使用八张图片,卡片说明指出,图像 token 也计入相同的 8,192 上限。

在权重内部
四个分片、45.4 亿个 BF16 参数,以及一份解释了规模名称的配置:其中有一个文本塔、一个约二十多层、patch 大小为 16 像素的视觉塔,还有夹在两者之间的一个投影器。文本侧是 32 层、隐藏维度 2,560,16 个注意力头对应 4 个键/值头,词表规模为 248,320 个 token,并采用绑定嵌入。层类型按固定间隔交替——三个线性注意力层,然后一个全注意力层,如此重复。只有全注意力层承载全局注意力,而旋转嵌入是部分式的,因子为 0.25。加载它需要 Python 3.12 或更新版本、PyTorch 2.9.1 和 Transformers 5.14.1,并且文件列表中仍然带有 tokenizer、merges 和词表文件,而不是依赖 hub 端的 tokenizer。
这些数字,以及它们是由谁产生的
本节中的所有内容均由 InternLM 测量,并发布在模型卡上。其中没有任何一项经过第三方复现,而且该模型在任何地方都没有 Artificial Analysis 条目、没有竞技场评分,也没有排行榜行。
在七个评估集上,4B 平均得分为 90.02,布里尔分数为 0.347,期望校准误差为 0.065。同一张表中还列出了 Intern-Decision-0.8B 的 79.38 和 Intern-Decision-2B 的 84.68,可见该系列随规模增大而呈上升曲线——从 0.8B 到 2B 提升了 4.7 分,再到 4B 又提升了 5.3 分。表中还包含五行厂商并未训练的模型:Jev 为 88.74,JevK5 为 85.16,SemIf 为 84.23,Kev 为 79.56,Laya 为 57.77。这些是 InternLM 在 InternLM 自己的评测框架上、针对 InternLM 自己的检查点跑出来的结果。它们并非那些项目自身给出的数字,而把它们当作后者来解读,是这里最容易犯的错误。
延迟是在单张 RTX 4090 上通过本地 Hugging Face 路径测得的,该显卡提示这些数值取决于工作负载和硬件。4B 的平均值为 44.16 毫秒,中位数为 44.03 毫秒,P95 为 44.60 毫秒——中位数与尾延迟之间的差距远低于一毫秒,这正是固定形状前向传播应有的表现。两个较小的检查点都在 33 毫秒左右,其中 2B 在平均值和中位数上略领先于 0.8B,这一点值得注意,而不应被抹平:这两者足够接近,彼此之间的差异处于测量噪声范围内。
校准,以及其中坦诚的注意事项
该检查点自带默认温度 1.99241824,该温度通过负对数似然最小化,在 1,728 个指定校准案例上针对此模型单独拟合,并留出 1,693 个案例用于验证。模型卡指出,选择该温度时未使用测试套件标签。该实现是候选概率校准,而不是采样温度:它会改变置信度、二元概率和期望分数,同时不改变 argmax 决策。
随后,一项独立的 96 例诊断报告了这一效应。在 InternLM 自身的前后对比列中,4B 的总体 Brier 和 ECE 从 0.628 / 0.213 变为 0.550 / 0.089,而 Jev 为 0.595 / 0.130。对这张表有两种诚实的解读:校准显然有效,而“之前”那一列并不是任何用户会看到的结果,因为发布的默认值就是拟合出的温度。同样值得指出的是——六个诊断类别中有两个对 4B 而言比 Jev 更差,其中最差的一个,即日常证据与观察偏差,改善至 0.575 / 0.210,却仍不及 Jev 的 0.603 / 0.114。在这一切片上,校准缩小了差距,但并未将其消除。
路由器适合用在何处,以及何处尚不适合
使用这一模型的实际障碍不在准确性,而在打包方式。该版本发布的是一个 Python 类,你需要先下载四个分片再导入,而不是一个可以直接调用的 HTTP 端点。这恰恰是路由层存在的意义——一个密钥即可调用 200 多个模型,按供应商标价透传、0% 加价,以及 当某家供应商出现波动时自动故障转移——但我们必须直言,OrcaRouter 目前并未收录 Intern-Decision-4B 或任何同类模型。我们的目录中没有列出它,此处的任何内容都不应被解读为可用性声明。我们所能提供的,是一个更省钱的决策:如果你想在生产路径前试用一个 45 亿参数的决策评分器,可以把它构建进路由器,并设置回退到通用模型,这样即便某天校准不佳,代价也只是一次重试,而不是一次服务中断。
什么会改变局面
三件事,按重要性排序。InternLM 之外的人需要复现 90.02 的平均值和 0.065 的期望校准误差——从未在外部测试集上验证过的校准声明,是机器学习中最不可迁移的数字。模型卡自身的足迹必须出现:Space、collection、GitHub 仓库。而且厂商需要说明这是产品还是论文产物,因为仅限研究的许可证和 Apache-2.0 许可证不是同一种承诺,而 4B 选择了 Apache-2.0,同时保留了 Qwen 许可证。在此之前,正确的框定正是上传本身所暗示的:这是一个真实的 checkpoint,有真实的推理契约,以及一份完全未经核实的记分卡,在无人知情的情况下被发布出来。
就目前而言,诚实的总结是范围狭窄但有用。如果你的问题是“从五个路由标签中选一个,并告诉我你有多确定”,那么一个输出 62 个 logits、不生成任何成篇文字的 4.5B 模型,是一种站得住脚的待评估形态。如果你的问题涉及长文档、超过八张图像,或者任何需要用文字解释答案的需求,那么这个按发布状态交付的检查点就是错误的工具,再多的厂商基准测试修饰也改变不了这一点。
