为 Intern-Decision-2B 生成的标题卡,内容为「悄然上线,未作公告」,配有「GitHub 链接今日上线」和「2,213,241,664 个参数」两个徽章,角落处叠加了 OrcaRouter 标志。
Engineering & Research

Intern-Decision-2B 悄然发布至 Hugging Face。其卡片上的 GitHub 链接刚刚不再 404 了

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

今天早些时候,internlm/Intern-Decision-2B的模型卡指向了三处可获取更多信息的地方,其中两处已经失效:demo Space 返回 HTTP 401,而 github.com/internlm/Intern-Decision对任何点击它的人都返回 404。截至 UTC 08:58,第二个链接背后的仓库已经存在——公开可见,已有三次提交,包含训练代码、两个推理后端、一个带 10,751 行测试数据的评测包、一个 96 个用例的校准基准以及复现指南。这是该模型自 2026 年 9 月 26 日 05:36 UTC 出现在 Hugging Face 以来唯一发生变化的地方,而它足以让 Intern-Decision-2B 从“一个 README 无法访问的检查点”变成“一个你真正可以检视、可以对照复现、也可以与之争论的检查点。”

权重本身没有变化,也毫无歧义。Intern-Decision-2B 是一个拥有 2,213,241,664 个参数的多模态结构化决策模型,微调自 Qwen/Qwen3.5-2B——2026 年 2 月 28 日的 Alibaba 基础模型——以 Apache-2.0 发布,并将上游 Qwen 许可证作为 LICENSE-QWEN 保留在其旁。这是 InternLM 在四十秒内推出的三种规模中的中间一款:Intern-Decision-0.8B 于 05:35:57,这一款于 05:36:19,Intern-Decision-4B 于 05:36:37。它们背后仍然没有任何形式的公告。

让中等规模版本值得单独成篇的原因在于,正是在这里,这个家族开始不再表现得可预测。根据 InternLM 自己给出的数据,它是三者中最快的,也是三者中校准最差的;在你下载任何 4.5 GB 的东西之前,这两个事实都值得弄明白。

哪些是已确认的,哪些只是厂商的一面之词?

两个类别,需要将它们区分开来。

已确认,因为它是一份文件列表或一个 HTTP 响应:参数数量(2,592 个 F32 加上 2,213,239,072 个 BF16 权重);分片映射(一个 3.76 GB 的语言分片、一个 612.5 MB 的视觉塔、一个 50.3 MB 的投影器、约 4.43 GB 的张量以及大约 4.46 GB 的仓库);许可证配对;基础模型;其底层架构(一个 Qwen3_5ForConditionalGeneration,具有 24 层、隐藏大小为 2,048、8 个查询头对应 2 个键值头、头维度为 256、三个线性注意力层对一个全注意力层的重复模式、一个保留的多 token 预测层,以及 262,144 个位置的嵌入上限);该仓库的存在;以及这样一个事实:huggingface.co/collections/internlm/intern-decision 上的模型合集现在可以正常解析并列出全部三个检查点。

厂商报告且未能复现:每一个准确率数字、每一个延迟数值,以及校准温度。没有论文,没有 arXiv 条目,没有发布帖,没有更新日志,也没有独立评估——搜索字符串 "Intern-Decision" 不会返回任何关于这个模型的结果。这个演示 Space 仍然返回 401,这意味着它并未公开,而不是它坏了。这个 2B 检查点有一个点赞和零次下载。InternLM 之外没有人运行过它。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal, the Demo, Model Weights and GitHub links, and the card text stating the model is 'a multimodal structured decision model fine-tuned from Qwen3.5-2B' that 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by the five-step 'How inference works' list.

推理契约,按其发生的顺序

仓库里信息量最大的文件并不是那张卡片,而是src/inference/engine.py,以及 Hub 上随附的inference.py,因为这两者共同记录的是契约,而非提示词。

• 你提供 状态——被评判的材料——一个 问题模式,以及可选的、最多八张图片。问题数量为一到十六个,每个问题最多 62 个选项。

• 每个问题的选项都会映射到单 token 符号上:A–Z,然后是 a–z,再是 0–9。62 个选项的上限并非设计偏好,而恰好是该合约能够寻址的单 token 符号数量。

• 系统提示词、状态、schema 以及完整的助手 JSON 骨架,均按每个字段渲染一个 <decision>占位符。检查点的聊天模板和空思考块保持原样。

• 只运行一次因果前向传播。Logits 在每个占位符紧邻之前的位置读取——而不是之后,也不是在生成的 token 处。

• 仅对该字段的合法候选符号进行 softmax 运算,应用检查点的校准,再将符号映射回您原始的选项值。

模型卡直言不讳地说明了这是什么:“此 API 执行结构化的候选评分。它不会调用 generate() 或采样自由形式的文本。”一个 DecisionEngine(max_length=8192) 会拒绝过大的输入,而不是将其截断,因此放不下的请求会大声报错,而不是悄悄丢失最后一段。后端列表也很诚实—— backend="hf" 是默认值,也是 Hugging Face 仓库中唯一实现的选项,这一点值得了解,因为 GitHub 发布版还附带了一个 XTuner 后端,而两者在数值上并不完全相同。InternLM 自己的评估指南也这么说:“内核和 BF16 的差异可能会改变概率,偶尔也会改变标签。”

中间的异常

把这三个检查点并排放在 InternLM 自己的表格上,其形状之怪异本身就足以成为故事。

• 七个套件的平均值——Intern-Decision-0.8B 79.38,Intern-Decision-2B 84.68,Intern-Decision-4B 90.02。呈有序排列,正如权重增长所预期的那样。

• 单块 RTX 4090 上的延迟——0.8B 的平均延迟为 33.98 ms,2B 为 33.28 ms,4B 为 44.16 ms。中间规模是三者中最快的,其领先幅度小到在单块 GPU 上可能是噪声,但在均值、中位数(33.15 ms)和 P95(33.55 ms)上均保持一致。

• 布赖尔分数,越低越好——0.530、0.437、0.347。随规模单调变化,正如恰当的评分规则通常表现的那样。

• 期望校准误差,越低越好——0.8B 为 0.066,这个 2B 为 0.100,4B 为 0.065。中间尺寸的表现最差,而且比它一半大小的模型还差。

最后一行才是有意思的地方,而拟合出的温度是在佐证它,而不是解释它。每个检查点都有自己的 NLL 拟合温度:0.8B 为 2.747760550703,2B 为 2.100509348278,4B 为 1.992418。每一个都是在 1,728 个指定的校准案例上拟合的,另有 1,693 个留出;拟合方法是在 [0.01, 100] 范围内搜索逆温度并最小化负对数似然,同时刻意将测试套件标签排除在拟合之外。2B 的温度介于它的两个同系列模型之间,如果这一异常是拟合伪影,这恰恰是你会预期的情况。但事实并非如此:拟合值随模型规模单调变化,而校准后误差却不是。按照 InternLM 自己的测量结果,这个 22 亿参数的检查点在告诉你它有多自信时,是三者中最不可信的。

在据此下结论之前,有两点需要注意。在这张表所用的小型测试套件上,采用十个等宽分箱和最大概率置信度的 ECE 是一个噪声很大的统计量——Jevbench-Hard,111 个条目,因此整个 ECE 列都建立在百来个问题和一种分箱选择之上。而且internlm/Intern-Decision-2B是三张卡片中唯一不带 4B 卡片所具备的额外校准部分的那一张,所以这里的文档更少,而不是更多。请把 0.100 理解为应当自行拟合温度参数的依据,而不是对权重本身的判定。

A rendered comparison card titled 'Three checkpoints, forty seconds' listing the Intern-Decision 0.8B, 2B and 4B columns against seven rows: upload timestamps 05:35:57 / 05:36:19 / 05:36:37 UTC; parameters 852,985,920 / 2,213,241,664 / 4,539,265,536; seven-suite average 79.38 / 84.68 / 90.02; Brier 0.530 / 0.437 / 0.347; ECE 0.066 / 0.100 / 0.065; fitted temperature 2.747761 / 2.100509 / 1.992418; and RTX 4090 mean latency 33.98 ms / 33.28 ms / 44.16 ms, with a footer noting every figure is vendor-reported and unreproduced.

代码库新增了什么,又仍然保留了什么

GitHub 发布版比模型卡更完整,而模型卡本身也颇具信息量——一个原本只打算做论文产物的实验室,通常不会在训练启动器之外,还一并提供确定性校准生成器和带哈希校验的评估包。

现已公开的内容包括:训练代码与掩码下一词元目标(真实答案符号只出现在标签中,从不出现在输入里;每个字段的答案由其标记紧邻之前的 logit 预测,且所有字段共享同一次前向传播);七个准确率套件及其经 SHA-256 校验的哈希值与行数;评分代码;温度拟合与回放脚本,其中断言回放改变 零个决策;96 用例分布校准基准及其生成器与离线评分器;以及一个在回环地址上提供的浏览器演示,接口为 POST /v1/decisions(别名为 /v1/jev)。

用仓库自己的话说,明确排除了什么:“训练数据、私有校准/验证记录、图像、准备流水线以及模型权重均不包含在内。”该仓库根本没有许可证文件,因此尽管权重是 Apache-2.0,代码的条款也未声明。而校准拆分的构成——具体是哪 1,728 个案例、来自哪里——仍未披露,而这是唯一一处限制 ECE 数值可核查范围的遗漏。

我们实际路由的尺寸,以及我们不路由的那一个

Intern-Decision-2B 不在 OrcaRouter 上。我们为其提供的模型页面返回 404,我们找不到任何为它托管的端点,并且这里的任何内容都不应被解读为可用性声明。目前调用它的唯一方式是下载检查点,然后inference.py在权重文件旁

这对本文真正要谈的决策至关重要,因为一个没人提供服务的评分器,就是必须由你自己运维的评分器。如果你要做的闭集决策在形态上与该系列所做的事情相近——一个状态、带类型的问题、经过校准的概率——那么可供对比的托管方案就是 TypeSafe 的 Jev 1.13,这正是 InternLM 特意选来对标的模型,它已在 OrcaRouter 上线,每百万输入 token 收费 0.042 美元,上下文为 65K,首 token 时间的 P50 为 178 毫秒。

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

在本地运行一个 22 亿参数的检查点,与调用一个托管式分类器,并不是同一笔采购,但它们面对的是同一个问题;而能用同一把密钥同时调用两者、并以 0% 加价透传提供商标价,正是应当让这种对比保持开放,而不是把架构押注在二者之一上的理由。

什么会改变这张图?

三件事,按顺序。

InternLM 之外的人需要复现 84.68 的平均分和 0.100 的 ECE,而现在正是这个仓库让这成为可能——这才是这里真正的新闻。考试是公开且经过哈希验证的;只缺答案卡,而答案卡就是现在任何人都能下载的检查点。

厂商需要说明这是做什么用的。一个拥有可用训练栈、已发布评估套件,却没有公告、其代码没有许可证、也没有托管端点的模型,读起来像是一次尚未被拍板做成产品的研究发布。Apache-2.0 权重指向一种解读;缺失的代码许可证和 401 Space 则指向另一种。

而中间那个尺寸需要一个存在的理由。如果 2B 相对 0.8B 的速度优势确实存在但很有限,而它在 InternLM 公布的每一项指标上都是三者中校准最差的,那么对大多数读者来说,诚实的建议就是:要么为 4B 付出 2.6 倍的磁盘空间,要么接受更小模型更弱的准确率。2B 的卖点在于它恰好是“快”这一档里最快的那个——而这个理由,比这一系列那套营销腔调所暗示的要单薄得多。