一张生成的标题卡,写着"Intern-Decision-2B vs Laya",副标题为"2.21B 对 421M,两者都不写一个 token",带有徽章"一个发布了 pip 包"和"一个发布了复现工具包",OrcaRouter 的标志合成在角落。
Guides & Insights

Intern-Decision-2B 对比 Laya:22 亿参数对 4.21 亿参数,两者都拒绝写出答案

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

internlm/Intern-Decision-2B和convaiinnovations/laya是小型决策模型这一细分领域中最相似的两个模型,而这一比较中最有用的一点是:它们是通过截然相反的路径走到这一步的。InternLM 那个拥有 2,213,241,664 个参数的检查点,会读取占位符之前某一固定位置的 logit,从不调用 generate()。Convai 那个 4.21 亿参数的检查点,则在 ModernBERT-large 主干之上把带类型的问题送入决策头,并在单次前向传播中返回校准后的概率。两者都不生成 token,都承诺给出概率,输入上限都在八千 token 左右,而体量较小的那个只有对方的五分之一大,受欢迎程度却大约是其一千倍。真正区分它们的与其说是能力,不如说是包装,而包装上的差距决定了大多数读者的购买选择。

Intern-Decision-2B 于 2026 年 9 月 26 日 05:36 UTC 出现在 Hugging Face 上,是 InternLM 在四十秒内毫无预告地上传的三个规模中的中间那个,基于 Qwen/Qwen3.5-2B 在 Apache-2.0 下微调而来。Laya 于 2026 年 9 月 18 日首次推送,此后累计获得 3700 多个赞、一个 pip 包、一个兼容 Jev 的 HTTP 服务器、ONNX 与 LangChain 集成,以及一个微调 notebook。成熟度上的反差正是这篇文章要讲的。

它们共有的前提,以及不同的机制

两张卡片都主张,如果你的问题是在已知答案中做选择,那么生成散文就是错误的操作。Laya 的措辞是:“它从不生成文本,因此没有什么需要解析,也不会产生幻觉。”Intern-Decision-2B 的措辞则是,其 API“执行结构化的候选评分。它不会调用 generate() 或对自由形式文本进行采样。”

机制正是它们分离之处。

Laya 是一个分类器。一个 ModernBERT-large 编码器(395M,双向,完全微调)为一个从头训练的决定头提供输入——两个 transformer 层、一个选项标记打分器,以及一个 act/escalate 头——总计 421M。选项共享固定的 token 预算(head_max_len,英文检查点上为 192 个 token,多语言上为 256 个),而路由器在前向传递之前不到半毫秒内检测书写系统和语言。

Intern-Decision-2B 是一个下一 token 模型,被禁止成为生成器。它把每个问题的选项映射到单 token 符号 A–Z、a–z、0–9 上;渲染出一个完整的助手 JSON 骨架,每个字段对应一个 <decision> 占位符;执行一次因果前向传播;在每个占位符之前立即读取 logits;对该字段的合法符号执行 softmax;并应用拟合温度 2.100509348278。底层是一个标准的 Qwen3_5ForConditionalGeneration——24 层,每三个线性注意力层对应一个全注意力层,一个保留的多 token 预测层,262,144 位置的嵌入上限——外加一个视觉塔和投影器。

这种差异的实际后果是选项容量。Laya 固定的每选项预算在宽标签空间下会崩溃;它自己的模型卡记录了一个 77 标签问题在同一任务上得分为 0.425,而 TypeSafe Jev 为 0.870,因为 77 个选项每个大约只能分到三到四个 token。Intern-Decision-2B 每个问题最多接受 62 个选项,最多十六个问题,而 62 不是一种偏好,而是其契约能够寻址的单 token 符号的确切数量。一旦超过几十个选项,两者都不轻松;只是失败形态不同。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

记分板

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• 参数 — Intern-Decision-2B 在 BF16 下为 2,213,241,664,外加一个视觉塔和投影器,磁盘占用约 4.46 GB;Laya 421M,单个 842 MB 的 safetensors 文件,另有一个单独的 644 MB 多语言检查点。

• 输入上限 — 两者均为 8,192 个 token,二者都会拒绝而非截断;请注意,Laya 的 8,192 适用于 laya-multilingual,并且需要 max_len=8192,因为出厂默认值是 1,024。

• 图像 — Intern-Decision-2B 最多八张,计入相同的 token 预算;Laya 没有多模态路径。

• 速度 — 在单块 RTX 4090 上,Intern-Decision-2B 每次请求平均耗时 33.28 毫秒,P50 为 33.15 毫秒,P95 为 33.55 毫秒;Laya 报告称,在单块 T4 上每次请求约为 33 毫秒,批量处理时每秒可处理 103–332 个问题。

• 语言 — Intern-Decision-2B 完全未声称具备多语言能力;Laya 可跨 100 多种语言进行路由,报告称在 51 种基准测试语言中有 45 种可用,效果超过随机水平的 3 倍,并且在 13 种非英语语言上的 MASSIVE 意图任务得分为 0.451,而其仅英语检查点为 0.306。

零样本准确率——Intern-Decision-2B 在七个供应商套件上平均取得 84.68,Brier 为 0.437,ECE 为 0.100,均未复现;Laya 的基础英语检查点在 2,000 条决策的类型化决策基准上得分为 0.362,其自身的模型卡将其标注为低于 0.461 的多数类基线。

• 打包 — 一份检查点、一个 inference.py,以及一个新公开的 GitHub 仓库(内含训练与评估代码),对比 pip install laya、一个兼容 Jev 的 HTTP 服务器、ONNX Runtime 与 TileLang 快速路径、MCP 与 LangChain 集成,以及一个可在免费套餐 GPU 上运行的微调 notebook。

最公平的比较,并不是规格表所设定的那一种

把84.68和0.362并列摆在一起几乎可以说是欺人之举,与其任由这两个数字摆在那里,不如说清楚其中的缘由。

Laya 的 0.362 是在一个它并未针对其调优的基准上以零样本方式测得的基座检查点。它自己的模型卡已明确给出结论:“Laya 是一个便于快速专用的基座,而非零样本决策引擎。”在该基准自身的训练划分上微调后,它达到 0.766,突破了 0.735 的教师上限,并在同样的决策上超过了 TypeSafe Jev 公布的 0.727。而 Intern-Decision-2B 的 84.68,则是一个七大套件的厂商平均值,其测试集并非 Laya 所引用的那些,由构建该模型的实验室自行产出,且没有任何第三方运行过——该检查点只有一个点赞、零次下载。把微调结果与零样本结果相比,或把厂商平均值与独立榜单相比,都不是比较。这是两个共用同一字体的不同测量。

真正具有可比性的是:两者都很小,运行成本都低,而且都无法针对你的领域进行微调。InternLM 今天早上发布的仓库让最后一点比昨天容易得多,因为它附带了训练启动器、掩码下一词元目标、一个经哈希校验的捆绑包——涵盖七个套件中的 10,751 条测试行——以及温度拟合与回放脚本。一个实验室如果发布了确定性的校准生成器,并断言回放不会改变任何决策,那它正是在招引 Laya 的卡片所推荐的那种适配。

你实际上会如何称呼其中任何一个

这两个模型都不在 OrcaRouter 上。OrcaRouter 上 Intern-Decision-2B 的模型页面返回 404,Laya 路由也不存在;这里没有任何内容构成可用性声明。Intern-Decision-2B 意味着下载检查点,并在你自己的 GPU 上运行其捆绑的引擎。Laya 意味着 pip install laya,并且,如果你想要 Jev 兼容接口,就通过 POST /v1/systemone 使用 laya-serve。

这背后那个编排器形态的问题是:你是否想为评分器再开一个运维面。Laya 的设计目标就是可嵌入——请求与响应结构与 TypeSafe Jev 完全一致,因此现有客户端只需改一个基础 URL,别的什么都不用动。Intern-Decision-2B 的设计目标是可复现,而如今要等第一个决策回来,大约得先做一天的环境工作。如果你正在做的闭集决策在形态上与这两者中的任何一个相近,那么这两张卡片都以之为基准对比的托管替代方案就是TypeSafe Jev 1.13,它确实有一条现成路径:每百万输入 token 0.042 美元,65K 上下文,首 token 时间 P50 为 178 毫秒,可用与另外 200 多个模型相同的密钥访问,并且按提供商标价 0% 加价透传。

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

每个的优势所在

Laya 在实际运营的方方面面都胜出。一个是 pip 软件包,另一个是检查点下载。一个是覆盖一百多种语言的路由器,另一个则没有任何多语言声明。一个是以每秒数百个问题衡量的批处理吞吐量,另一个只是单请求数字,且没有批处理方案。一边是两年的生态积累——ONNX、TileLang、LangChain、MCP——另一边是仅公开了两小时的代码库。

Intern-Decision-2B 在三个很有限的地方胜出。它能处理图像,而 Laya 不能。它没有微调欠账:其 84.68 是供应商宣称的零样本成绩,而 Laya 那醒目的 0.766 属于一个在该基准自身训练划分上微调过的检查点。并且它有复现工具包作为文档支撑——一个可验证的评估包和一套公开的训练技术栈——对于任何必须向别人解释这个模型的人来说,这比排行榜上的一行更有价值。

并列是前提。两者都拒绝生成,都会给出你可以设定阈值的概率,而且两者都低于大多数真实文档所处的输入长度。如果你的状态是一张工单、一封电子邮件或一份表单,两者都行,而 Laya 会让你更快达到目标。如果你的状态附带了截图,或者你的组织需要复现过程可审计,InternLM 的中间检查点正是能回应这一具体反对意见的那个——而且按照 InternLM 自己给出的数字,在它的三个同门中,它是校准最差的,ECE 为 0.100,而另外两个分别为 0.066 和 0.065,所以在信任它报告的置信度之前,请自行拟合温度参数。