一张主视觉标题卡,标题为“Intern-Decision-0.8B”,副标题为“悄然上线,未作公告”,并带有“没有论文,没有代码仓库,没有发布帖”和“852,985,920 个参数,磁盘占用 1.73 GB”两枚徽标,角落处合成了 OrcaRouter 标志。
Guides & Insights

Intern-Decision-0.8B 悄无声息地来了:InternLM 悄悄在 Hugging Face 上放了什么

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

模型卡上的 GitHub 链接返回 404。演示 Space 返回 401。没有任何合辑、博客文章、技术报告,也搜不到任何不是实习招聘信息的 “Intern-Decision” 字符串——然而 Intern-Decision-0.8B 现在就躺在 Hugging Face 上,是一个完整的、可下载的 Apache-2.0 检查点,基于 Qwen3.5-0.8B 微调,于 2026 年 9 月 26 日凌晨上传,还有两个更大的同门模型在同一三分钟内出现:Intern-Decision-2B 和 Intern-Decision-4B。InternLM 以前就这样发布过,这也是为什么下文的一切都是从仓库本身拼凑而来,而不是来自一篇发布帖。这一区别在这里比平时更重要:仓库告诉你有什么存在,而只有厂商才能告诉你它是用来做什么的。

该仓库详细说明的内容确实不同寻常,值得一读。这些不是聊天模型,也不是通常意义上的小型语言模型。Intern-Decision-0.8B 接收一段状态、一个由你预先编写的命名问题模式,以及可选的至多八张图像,并在一次前向传播中为每个问题返回答案分布。它从不调用 generate()。它从不采样。没有需要解析的文本输出,没有需要修复的 JSON,也没有围绕一个始终没有闭合的大括号反复重试的循环。这种窄化正是整个架构所在,也让它与 TypeSafe 的 Jev 1.13 和 Convai 的 Laya 归入同一小众类别——InternLM 显然有意将其作为基准对比,因为 Jevbench 正是 TypeSafe 自家的基准,而且是表格的第一列。

以下是从检查点可以了解到的内容、只有该检查点声称的内容,以及 InternLM 之外的任何人目前都完全无法说明的内容。

仓库里实际有什么?

模型卡简短,且对血统坦诚。Intern-Decision-0.8B 被描述为“一个多模态结构化决策模型,基于 Qwen3.5-0.8B 微调”——Qwen 基础模型发布于 2026 年 2 月 28 日——仓库在 Apache-2.0 条款之外还带有第二个许可证文件 LICENSE-QWEN,这正是衍生模型应该做的,本身也是一个微小的诚实信号。Hugging Face 的索引报告了跨三个分片的 852,985,920 个参数:一个 1.50 GB 的语言分片、一个 176 MB 的视觉分片,以及一个 25 MB 的投影器。包括分词器文件在内,仓库总存储约为 1.73 GB,这让整个模型可以轻松放在单块消费级 GPU 或配置良好的笔记本电脑上。

该配置揭示的是一种 Qwen 在 3.5 世代中一直沿用的架构,而非专门定制的决策网络。它是一个 Qwen3_5ForConditionalGeneration,24 层按三个线性注意力层对一个全注意力层的重复模式排列,隐藏维度为 1,024,8 个注意力头对应 2 个键值头,头维度为 256,最大位置嵌入为 262,144 个 token。其中保留了一个单一的多 token 预测层。视觉通路是真实存在的:模型卡的文字描述了图像处理,处理器接收图像,检查点还附带了视觉塔和投影器来支撑它——因此该仓库上的多模态标签背后是权重,而不只是标签。

这个家族图景值得注意,因为它决定了如何解读其余的一切。InternLM 在 40 秒内上传了三个规模:0.8B,然后 2B,然后 4B。参数量分别是 852,985,920、2,213,241,664 和 4,539,265,536。4B 模型的卡片多了一个部分——一项包含 96 个用例、带有前后评分的已知分布校准试点——而 0.8B 的卡片没有。这种不对称并不是小模型存在缺陷的证据;它表明小模型的文档是在更短的预算下写成的,而这正是悄然发布所呈现的样子。

推理路径实际上是如何工作的

随附的 inference.py 是仓库中信息量最大的文件,因为它记录的是约定,而不是提示词。序列是这样运行的:

• 你提供一个请求,其中包含 state(被评判的对象)、questions(一个 schema),以及可选的图像。

• 每个问题的选项都映射到单 token 符号——从 A 到 Z,然后是小写字母,然后是数字,每个问题最多 62 个选项。

• 系统提示、状态、模式和完整的助手 JSON 骨架都会被渲染,其中每个字段对应一个 <decision> 占位符。

• 运行一次因果前向传播。在每个占位符紧前面的位置读取 logits。

• 仅对该字段允许的候选符号执行 softmax,应用检查点的校准,再将符号映射回你原始的选项值。

该引擎提供三种问题类型。choice 接受一个有序对象,将选项值映射到描述。score 接受一个列表——它会变成字符串值 "0"、"1"、"2" 等——或一个带有有限数字字符串键的有序对象,让模型返回按概率加权的期望值,而不仅仅是一个类别。noul 是一种二元决策,其中“否”在“是”之前。响应会按字段返回校准后的概率分布、等于最大候选概率的置信度、带词典序平局规则的 argmax 决策,对于 score 问题还会返回期望数值和图例。限制是明确的:每个请求一到十六个问题,每个问题最多 62 个选项,默认输入上限为 8,192 个 token,超出会被拒绝而不是截断,并且最多八张图像,其 token 计入该上限。

该列表中有两个细节值得注意,因为它们决定了你是否能信任输出。第一个是,提示中不会插入任何金标准答案——模型在对它尚未见过答案的候选进行评分。第二个是,usage.output_tokens 不是文本 token 计数;它统计的是已评分字段的数量。任何将其接入现有 token 预算计算的人都会对此感到意外,而卡片明确说明了这一点,而不是留待人们自行发现。

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

基准测试表,以及其中有多少可信

读者注意本节内容:以下所有数字均由厂商自行报告,未经复现。InternLM 自行选定了基准测试、选定了对比模型、执行了评估,并发布了表格。在任何公开排行榜上都没有对 Intern-Decision-0.8B 的独立运行结果,而在 Artificial Analysis 上搜索该模型也完全查不到任何信息。这并不表示该表格是虚假的。它表示该表格未经审计,也意味着这些列最适合用来判断结果的形态,而非其水平。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench 的三个子集 —— Intern-Decision-0.8B 在 Easy 上取得 97.92,在 Original 上取得 80.56,在 Hard 上取得 52.25。TypeSafe 的 Jev 在相同子集上分别为 100.00、98.61 和 72.07。

• Typed Decision —— 0.8B 得分为 77.35,而 Jev 为 73.35。这是唯一一列,该领域最小的模型击败了基准测试以其命名的模型。

• ToolACE — 0.8B 获得 94.52,而 Jev 为 91.29。ToolACE 是一个函数调用基准,而一个在工具选择上优于 Jev 的决策头是表中最具实质性的主张。

• AG News —— 88.61,对比 Jev 的 89.57。在四类主题分类上,实际上已与该类别的前沿持平。

• WildJailBreak —— 64.48,对比 Jev 的 96.29。这就是崩溃。可以说,对于会拿来处理不可信输入的模型而言,这是最重要的一栏,也是 0.8B 与参考值差距最大的一栏。

• 平均 — 0.8B 为 79.38,自家的 2B 同级型号为 84.68,4B 为 90.02。这一系列攀升陡峭,这正是你所预期的,而本身也构成一个温和的论据:这张表并非为了讨好旗舰而逆向工程出来。

• 校准 —— 0.8B 的 Brier 为 0.530,期望校准误差为 0.066。Jev 报告的是 0.358 和 0.095。把这两个数字放在一起读,会比单看任何一个数字浮现出更清晰的图景:在 ECE 意义上,0.8B 的校准优于 Jev——它声称的置信度与其准确率贴合得更紧——但整体准确率却明显更低。对于一个刻意拟合了温度参数的小模型来说,这是一种说得通的画像,而且这不是一个会无意中发布出来还显得体面的组合。

这个对比集有一个引人注目的特点:它由决策模型主导。Jev、Laya、SemIf、Kev 和 JevK5 都出现了;表格自身的基准是 TypeSafe 的。InternLM 选择在竞争对手的地盘上接受衡量,使用竞争对手的测试框架,然后公布了其最小模型落败的那些列。这是团队在不打算围绕发布做营销宣传时才会做出的那种决定——这与它这次发布方式的其他方方面面都一致。

校准温度是最有趣的数字

Intern-Decision-0.8B 拟合出的默认温度为 2.747760550703,其依据是在 1,728 个指定的校准案例上进行 NLL 最小化,并使用 1,693 个独立的验证案例。模型卡明确说明,未使用测试套件标签来选择该温度。所应用的变换为 p = softmax(candidate_logits.float()),随后是 calibrated_p = softmax(log(p) / T)。

那是候选概率校准,而不是采样温度,而且这种区分并非吹毛求疵。因为该变换是在 softmax 之后应用的,并且保持顺序,所以它根本无法改变 argmax 决策。它会改变置信度、noul 的 yes 概率,以及评分问题的期望值——而主要决策保持不变。如果你的工作流读取的是标签,那么温度参数就是个空操作。如果你的工作流读取的是概率——对其设置阈值、按其排序,或将其送入下游的期望值计算——那么温度就是有意义的数字与无意义的数字之间的区别。传入 temperature=1 会返回未校准的分布,对于任何想在此基础上应用自己的校准的人来说,这都是一个有用的逃生出口。

温度是按每个检查点单独拟合的,而不是共享的。4B 模型使用一个不同的值,1.99241824,而模型卡指示你使用随所下载规模一同提供的推理模块,以便其默认校准能够匹配。任何把推理封装从一个同级模型复制到另一个同级模型的人,都会在不知不觉中应用错误的温度。

三十四毫秒,以及一个本不可能出现的结果

InternLM 在单块 RTX 4090 上使用本地 Hugging Face 路径测量了每次查询的端到端延迟——这是一次真实测量,但也是可能的最慢服务配置,因为生产部署会使用编译或批处理运行时。Jev 的平均值为 109.70 ms,中位数为 106.30 ms,p95 为 146.70 ms。Intern-Decision-0.8B 则为 33.98 / 33.44 / 37.50 ms。

值得停下来看的数字是 2B 这个同系列型号:均值 33.28 毫秒,中位数 33.15 毫秒。2B 快于 0.8B,差距小到可能只是噪声,但其方向并不符合参数量所预测的方向。这不是表格里的错误,也并非真的与模型有关。决策模型只对提示进行一次前向传播,而提示长度由状态、模式和选项描述决定——不是由模型写出的任何内容决定,因为它什么都不写。对于处于这种情形下的提示,提示处理占主导地位,而参数量是次要成本。实际后果是,通常要选用最小检查点的理由——你按 token 付费——在这里并不适用。选择 0.8B 而非 2B 的真正原因是内存占用,以及它的整个仓库仅占 1.73 GB,而不是吞吐量。

尚无法确定的事项

这是发布帖本会回答、而代码仓库无法回答的部分。

没有公布发布日期,没有公告,InternLM 的公开渠道上也没有任何描述该系列的内容。模型卡上印的 GitHub URL 无法访问。卡中引用的演示 Space 不可公开读取。没有合集汇集这三个检查点,这意味着要找到 2B 或 4B,唯一的方法就是查看该组织的模型列表。没有论文,因此训练数据、调优配方、训练步数,以及“decision tuning”在权重中修改了什么,均未说明。没有独立评估,没有第三方延迟复现,也尚无证据表明 InternLM 之外的任何人运行过该检查点。

卡片还提出了两个问题,却没有给出答案。第一个是 WildJailBreak 差距在实践中意味着什么:如此规模的拒答稳健性缺口是微调本身的属性,而它究竟反映的是基础模型、决策调优目标,还是参数规模偏小,仓库并没有告诉你。第二个是输入上限处会发生什么。超过 8,192 个 token 的请求会被拒绝,而不是被截断,这对评分模型来说是正确行为,但这意味着实际的上下文窗口并不是配置所宣称的 262,144——而是状态、模式、选项和图像块合计能塞进 8,192 个 token 的量。对于带有丰富模式的 long documents,这个上限会比架构图所暗示的更早到来。

它处在什么位置,以及如何在不押注它的情况下试用它

诚实的说法是,Intern-Decision-0.8B 是一个已发布的检查点,其宣称未经审计,也没有支持性文档。这种组合并不是忽视它的理由——一个可以下载并在一个下午内完成测量的 Apache-2.0 权重发布,比一个需要排队等待的 API 情况更好——但这确实意味着验证的负担在你身上。该引擎从本地目录加载,可在 4090 级或更小的 GPU 上运行,而卡片提供了一个可直接粘贴的完整请求示例。用你自己的标注案例评估一天,会比厂商表格更能告诉你 WildJailBreak 那一列的情况。

如果你要评估的正是决策层,那么有用的对比对象就是托管式方案。TypeSafe 的 Jev 1.13 正是 InternLM 用来做基准对比的模型,而且它如今就能通过一个兼容 OpenAI 的端点调用,每百万输入 token 收费 $0.042,输出计费为零——与厂商公布的价格完全一致,因为OrcaRouter 按供应商标价原样透传,不加任何加价,而不是在其之上再叠加利润。把自托管的 0.8B 决策头和托管的决策 API 放进同一个密钥、在同一个下午跑起来,比起为了回答同一个问题而去对接两份独立合同,是便宜得多的实验。

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

改变这一局面的不会是某个基准测试。而是GitHub仓库的出现,或是InternLM公布调优配方,或是该检查点首次独立运行并登上排行榜。在其中任何一件事发生之前,对Intern-Decision-0.8B的准确描述范围狭窄、并不光鲜,却完全对它有利:权重是真实的,推理契约的文档记录比大多数已发布的模型都要好,而营销尚未开始。