
Intern-Decision-0.8B 悄无声息地来了:InternLM 悄悄在 Hugging Face 上放了什么
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
模型卡上的 GitHub 链接返回 404。演示 Space 返回 401。没有任何合辑、博客文章、技术报告,也搜不到任何不是实习招聘信息的 “Intern-Decision” 字符串——然而 Intern-Decision-0.8B 现在就躺在 Hugging Face 上,是一个完整的、可下载的 Apache-2.0 检查点,基于 Qwen3.5-0.8B 微调,于 2026 年 9 月 26 日凌晨上传,还有两个更大的同门模型在同一三分钟内出现:Intern-Decision-2B 和 Intern-Decision-4B。InternLM 以前就这样发布过,这也是为什么下文的一切都是从仓库本身拼凑而来,而不是来自一篇发布帖。这一区别在这里比平时更重要:仓库告诉你有什么存在,而只有厂商才能告诉你它是用来做什么的。
该仓库详细说明的内容确实不同寻常,值得一读。这些不是聊天模型,也不是通常意义上的小型语言模型。Intern-Decision-0.8B 接收一段状态、一个由你预先编写的命名问题模式,以及可选的至多八张图像,并在一次前向传播中为每个问题返回答案分布。它从不调用 generate()。它从不采样。没有需要解析的文本输出,没有需要修复的 JSON,也没有围绕一个始终没有闭合的大括号反复重试的循环。这种窄化正是整个架构所在,也让它与 TypeSafe 的 Jev 1.13 和 Convai 的 Laya 归入同一小众类别——InternLM 显然有意将其作为基准对比,因为 Jevbench 正是 TypeSafe 自家的基准,而且是表格的第一列。
以下是从检查点可以了解到的内容、只有该检查点声称的内容,以及 InternLM 之外的任何人目前都完全无法说明的内容。
仓库里实际有什么?
模型卡简短,且对血统坦诚。Intern-Decision-0.8B 被描述为“一个多模态结构化决策模型,基于 Qwen3.5-0.8B 微调”——Qwen 基础模型发布于 2026 年 2 月 28 日——仓库在 Apache-2.0 条款之外还带有第二个许可证文件 LICENSE-QWEN,这正是衍生模型应该做的,本身也是一个微小的诚实信号。Hugging Face 的索引报告了跨三个分片的 852,985,920 个参数:一个 1.50 GB 的语言分片、一个 176 MB 的视觉分片,以及一个 25 MB 的投影器。包括分词器文件在内,仓库总存储约为 1.73 GB,这让整个模型可以轻松放在单块消费级 GPU 或配置良好的笔记本电脑上。
该配置揭示的是一种 Qwen 在 3.5 世代中一直沿用的架构,而非专门定制的决策网络。它是一个 Qwen3_5ForConditionalGeneration,24 层按三个线性注意力层对一个全注意力层的重复模式排列,隐藏维度为 1,024,8 个注意力头对应 2 个键值头,头维度为 256,最大位置嵌入为 262,144 个 token。其中保留了一个单一的多 token 预测层。视觉通路是真实存在的:模型卡的文字描述了图像处理,处理器接收图像,检查点还附带了视觉塔和投影器来支撑它——因此该仓库上的多模态标签背后是权重,而不只是标签。
这个家族图景值得注意,因为它决定了如何解读其余的一切。InternLM 在 40 秒内上传了三个规模:0.8B,然后 2B,然后 4B。参数量分别是 852,985,920、2,213,241,664 和 4,539,265,536。4B 模型的卡片多了一个部分——一项包含 96 个用例、带有前后评分的已知分布校准试点——而 0.8B 的卡片没有。这种不对称并不是小模型存在缺陷的证据;它表明小模型的文档是在更短的预算下写成的,而这正是悄然发布所呈现的样子。
推理路径实际上是如何工作的
随附的 inference.py 是仓库中信息量最大的文件,因为它记录的是约定,而不是提示词。序列是这样运行的:
• 你提供一个请求,其中包含 state(被评判的对象)、questions(一个 schema),以及可选的图像。
• 每个问题的选项都映射到单 token 符号——从 A 到 Z,然后是小写字母,然后是数字,每个问题最多 62 个选项。
• 系统提示、状态、模式和完整的助手 JSON 骨架都会被渲染,其中每个字段对应一个 <decision> 占位符。
• 运行一次因果前向传播。在每个占位符紧前面的位置读取 logits。
• 仅对该字段允许的候选符号执行 softmax,应用检查点的校准,再将符号映射回你原始的选项值。
该引擎提供三种问题类型。choice 接受一个有序对象,将选项值映射到描述。score 接受一个列表——它会变成字符串值 "0"、"1"、"2" 等——或一个带有有限数字字符串键的有序对象,让模型返回按概率加权的期望值,而不仅仅是一个类别。noul 是一种二元决策,其中“否”在“是”之前。响应会按字段返回校准后的概率分布、等于最大候选概率的置信度、带词典序平局规则的 argmax 决策,对于 score 问题还会返回期望数值和图例。限制是明确的:每个请求一到十六个问题,每个问题最多 62 个选项,默认输入上限为 8,192 个 token,超出会被拒绝而不是截断,并且最多八张图像,其 token 计入该上限。
该列表中有两个细节值得注意,因为它们决定了你是否能信任输出。第一个是,提示中不会插入任何金标准答案——模型在对它尚未见过答案的候选进行评分。第二个是,usage.output_tokens 不是文本 token 计数;它统计的是已评分字段的数量。任何将其接入现有 token 预算计算的人都会对此感到意外,而卡片明确说明了这一点,而不是留待人们自行发现。

基准测试表,以及其中有多少可信
读者注意本节内容:以下所有数字均由厂商自行报告,未经复现。InternLM 自行选定了基准测试、选定了对比模型、执行了评估,并发布了表格。在任何公开排行榜上都没有对 Intern-Decision-0.8B 的独立运行结果,而在 Artificial Analysis 上搜索该模型也完全查不到任何信息。这并不表示该表格是虚假的。它表示该表格未经审计,也意味着这些列最适合用来判断结果的形态,而非其水平。

• Jevbench 的三个子集 —— Intern-Decision-0.8B 在 Easy 上取得 97.92,在 Original 上取得 80.56,在 Hard 上取得 52.25。TypeSafe 的 Jev 在相同子集上分别为 100.00、98.61 和 72.07。
• Typed Decision —— 0.8B 得分为 77.35,而 Jev 为 73.35。这是唯一一列,该领域最小的模型击败了基准测试以其命名的模型。
• ToolACE — 0.8B 获得 94.52,而 Jev 为 91.29。ToolACE 是一个函数调用基准,而一个在工具选择上优于 Jev 的决策头是表中最具实质性的主张。
• AG News —— 88.61,对比 Jev 的 89.57。在四类主题分类上,实际上已与该类别的前沿持平。
• WildJailBreak —— 64.48,对比 Jev 的 96.29。这就是崩溃。可以说,对于会拿来处理不可信输入的模型而言,这是最重要的一栏,也是 0.8B 与参考值差距最大的一栏。
• 平均 — 0.8B 为 79.38,自家的 2B 同级型号为 84.68,4B 为 90.02。这一系列攀升陡峭,这正是你所预期的,而本身也构成一个温和的论据:这张表并非为了讨好旗舰而逆向工程出来。
• 校准 —— 0.8B 的 Brier 为 0.530,期望校准误差为 0.066。Jev 报告的是 0.358 和 0.095。把这两个数字放在一起读,会比单看任何一个数字浮现出更清晰的图景:在 ECE 意义上,0.8B 的校准优于 Jev——它声称的置信度与其准确率贴合得更紧——但整体准确率却明显更低。对于一个刻意拟合了温度参数的小模型来说,这是一种说得通的画像,而且这不是一个会无意中发布出来还显得体面的组合。
这个对比集有一个引人注目的特点:它由决策模型主导。Jev、Laya、SemIf、Kev 和 JevK5 都出现了;表格自身的基准是 TypeSafe 的。InternLM 选择在竞争对手的地盘上接受衡量,使用竞争对手的测试框架,然后公布了其最小模型落败的那些列。这是团队在不打算围绕发布做营销宣传时才会做出的那种决定——这与它这次发布方式的其他方方面面都一致。
校准温度是最有趣的数字
Intern-Decision-0.8B 拟合出的默认温度为 2.747760550703,其依据是在 1,728 个指定的校准案例上进行 NLL 最小化,并使用 1,693 个独立的验证案例。模型卡明确说明,未使用测试套件标签来选择该温度。所应用的变换为 p = softmax(candidate_logits.float()),随后是 calibrated_p = softmax(log(p) / T)。
那是候选概率校准,而不是采样温度,而且这种区分并非吹毛求疵。因为该变换是在 softmax 之后应用的,并且保持顺序,所以它根本无法改变 argmax 决策。它会改变置信度、noul 的 yes 概率,以及评分问题的期望值——而主要决策保持不变。如果你的工作流读取的是标签,那么温度参数就是个空操作。如果你的工作流读取的是概率——对其设置阈值、按其排序,或将其送入下游的期望值计算——那么温度就是有意义的数字与无意义的数字之间的区别。传入 temperature=1 会返回未校准的分布,对于任何想在此基础上应用自己的校准的人来说,这都是一个有用的逃生出口。
温度是按每个检查点单独拟合的,而不是共享的。4B 模型使用一个不同的值,1.99241824,而模型卡指示你使用随所下载规模一同提供的推理模块,以便其默认校准能够匹配。任何把推理封装从一个同级模型复制到另一个同级模型的人,都会在不知不觉中应用错误的温度。
三十四毫秒,以及一个本不可能出现的结果
InternLM 在单块 RTX 4090 上使用本地 Hugging Face 路径测量了每次查询的端到端延迟——这是一次真实测量,但也是可能的最慢服务配置,因为生产部署会使用编译或批处理运行时。Jev 的平均值为 109.70 ms,中位数为 106.30 ms,p95 为 146.70 ms。Intern-Decision-0.8B 则为 33.98 / 33.44 / 37.50 ms。
值得停下来看的数字是 2B 这个同系列型号:均值 33.28 毫秒,中位数 33.15 毫秒。2B 快于 0.8B,差距小到可能只是噪声,但其方向并不符合参数量所预测的方向。这不是表格里的错误,也并非真的与模型有关。决策模型只对提示进行一次前向传播,而提示长度由状态、模式和选项描述决定——不是由模型写出的任何内容决定,因为它什么都不写。对于处于这种情形下的提示,提示处理占主导地位,而参数量是次要成本。实际后果是,通常要选用最小检查点的理由——你按 token 付费——在这里并不适用。选择 0.8B 而非 2B 的真正原因是内存占用,以及它的整个仓库仅占 1.73 GB,而不是吞吐量。
尚无法确定的事项
这是发布帖本会回答、而代码仓库无法回答的部分。
没有公布发布日期,没有公告,InternLM 的公开渠道上也没有任何描述该系列的内容。模型卡上印的 GitHub URL 无法访问。卡中引用的演示 Space 不可公开读取。没有合集汇集这三个检查点,这意味着要找到 2B 或 4B,唯一的方法就是查看该组织的模型列表。没有论文,因此训练数据、调优配方、训练步数,以及“decision tuning”在权重中修改了什么,均未说明。没有独立评估,没有第三方延迟复现,也尚无证据表明 InternLM 之外的任何人运行过该检查点。
卡片还提出了两个问题,却没有给出答案。第一个是 WildJailBreak 差距在实践中意味着什么:如此规模的拒答稳健性缺口是微调本身的属性,而它究竟反映的是基础模型、决策调优目标,还是参数规模偏小,仓库并没有告诉你。第二个是输入上限处会发生什么。超过 8,192 个 token 的请求会被拒绝,而不是被截断,这对评分模型来说是正确行为,但这意味着实际的上下文窗口并不是配置所宣称的 262,144——而是状态、模式、选项和图像块合计能塞进 8,192 个 token 的量。对于带有丰富模式的 long documents,这个上限会比架构图所暗示的更早到来。
它处在什么位置,以及如何在不押注它的情况下试用它
诚实的说法是,Intern-Decision-0.8B 是一个已发布的检查点,其宣称未经审计,也没有支持性文档。这种组合并不是忽视它的理由——一个可以下载并在一个下午内完成测量的 Apache-2.0 权重发布,比一个需要排队等待的 API 情况更好——但这确实意味着验证的负担在你身上。该引擎从本地目录加载,可在 4090 级或更小的 GPU 上运行,而卡片提供了一个可直接粘贴的完整请求示例。用你自己的标注案例评估一天,会比厂商表格更能告诉你 WildJailBreak 那一列的情况。
如果你要评估的正是决策层,那么有用的对比对象就是托管式方案。TypeSafe 的 Jev 1.13 正是 InternLM 用来做基准对比的模型,而且它如今就能通过一个兼容 OpenAI 的端点调用,每百万输入 token 收费 $0.042,输出计费为零——与厂商公布的价格完全一致,因为OrcaRouter 按供应商标价原样透传,不加任何加价,而不是在其之上再叠加利润。把自托管的 0.8B 决策头和托管的决策 API 放进同一个密钥、在同一个下午跑起来,比起为了回答同一个问题而去对接两份独立合同,是便宜得多的实验。

改变这一局面的不会是某个基准测试。而是GitHub仓库的出现,或是InternLM公布调优配方,或是该检查点首次独立运行并登上排行榜。在其中任何一件事发生之前,对Intern-Decision-0.8B的准确描述范围狭窄、并不光鲜,却完全对它有利:权重是真实的,推理契约的文档记录比大多数已发布的模型都要好,而营销尚未开始。
