
Intern-Decision-4B 与 Laya:两个拒绝写出答案的模型,规模相差十倍
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
Intern-Decision-4B 模型卡中有一行写着“Laya — 57.77”。任何读过 Laya 自己文档的人都会认出这个数字的含义:convaiinnovations/laya是一个拥有 4.21 亿参数的非自回归决策模型,而 57.77 是它在别人的基准上零样本使用时取得的平均分。它自己的模型卡说得更直白——基础检查点在类型化决策基准上低于多数类基线,为 0.362,而基线是 0.461。与此同时,internlm/Intern-Decision-4B是一个为完全相同任务打造的 45.4 亿参数模型:接收一个状态和一组类型化问题,做一次前向传播,返回校准后的概率,绝不生成 token。相同的架构赌注,相同的输出形态,相同的 Apache-2.0 许可证,参数量是十倍——而且其中一个是可供微调的基础模型,另一个则声称是已完成的零样本引擎。
他们在前提上达成了一致,而这正是罕见之处。
两张卡片主张的是同一件事,而这一点值得明说,因为业内大多数人的主张恰恰相反。如果你的问题是在一组已知答案中做选择,那么生成散文就是错误的操作:你要为最终丢弃的 token 付费,还需要一个解析器,而且得到的是自己并未要求的解释,而不是一个可以设定阈值的概率。Laya 的卡片将其表述为“它从不生成文本,所以没有什么要解析,也不会产生幻觉。”Intern-Decision-4B 的卡片称其 API“执行结构化候选评分。它不会调用 generate() 或采样自由形式的文本。”
这些机制以富有启发性的方式有所不同。Laya 将带类型标注的问题送入分类头,并在单次前向传播中返回带类型标注的答案及校准概率;同时在这次传播之前,由路由层在不到半毫秒内检测书写系统和语言。Intern-Decision-4B 将每个问题的选项映射到单 token 符号上,渲染出一个助手 JSON 骨架,每个字段对应一个占位符,读取每个占位符紧前面的 logits,并仅在该字段允许的符号上做 softmax。Laya 处理的是分类问题;InternLM 处理的是下一 token 预测问题,而它拒绝让这个问题变成生成问题。

尺寸差距,以及它带来了什么
让两个模型分别以 421M 和 4.54B 参数完成同一任务,得到的结果先是如你所料,紧接着却出人意料。
预测的部分是应对难题的能力。Intern-Decision-4B 在七个评估集上的平均值为 90.02,在 InternLM 自己的测量中,其 Brier 分数为 0.347,预期校准误差为 0.065,并且在单块 RTX 4090 上每次查询平均运行 44.16 毫秒。Laya 的基础英文检查点在包含 2,000 个决策的 typed-decisions 基准测试上准确率为 0.362,其自己的模型卡将其标记为低于 0.461 的多数类基准线,仅略高于 0.318 的随机基线。当同一个检查点在该基准测试自己的训练集划分上微调时,这一数字跃升至 0.766。Laya 的模型卡自己得出了结论:“Laya 是一个能快速专门化的基座,而不是一个零样本决策引擎。”
令人意外的是,较小的模型在两个维度上直接取胜。速度:在单块 T4 上批量处理时,Laya 每秒可回答 103 到 332 个问题,而其资料卡宣称,根据其引用的独立测得的 236–276 毫秒 p50 数值,它比 TypeSafe Jev 快约六到八倍。参数多十倍,并不能在另一个方向上换来十倍的吞吐量——Intern-Decision-4B 的 44.16 毫秒是在 4090 上每次查询的延迟,且未公布任何批处理方案。语言方面:Laya 报告称,在 51 种基准测试语言中,有 45 种可用性超过随机水平三倍;在十三种非英语语言的 MASSIVE 意图任务上,路由后达到 0.451,而其仅英语检查点为 0.306。Intern-Decision-4B 则完全没有多语言方面的声明。
记分板
• 参数量 — Intern-Decision-4B 为 4.54B BF16,包含文本塔、视觉塔和投影器;Laya 为 421M,是一个单一的紧凑编码器。
• 输入上限——两者均为 8,192 个 token,且两者都会拒绝而非截断;请注意,Laya 的 8,192 适用于多语言检查点,其出厂默认值为 1,024。
• 多重性——Intern-Decision-4B 可接收 1 到 16 个问题,每个问题最多 62 个选项,而 62 并非随意选取:它恰好是其推理契约所能寻址的单 token 符号数量。Laya 同样接收多个带类型的问题,但其卡片记录了在超过约 50 个选项后出现的急剧崩溃,此时一个 77 标签的问题每个标签只有三到四个 token 的预算,准确率降至 0.425。
• 图像 — Intern-Decision-4B 最多支持八张,计入 8,192-token 预算;Laya 无多模态路径。
• 校准 — Intern-Decision-4B 附带一个通过在 1,728 个案例上进行 NLL 最小化选出的拟合温度 1.99241824,并在其自有套件上报告 ECE 为 0.065;Laya 发布时过度自信,其模型卡称,按每种问题类型和选项数量分别重新拟合一个温度,可将平均 ECE 从 0.466 变为 0.081。
• 零样本姿态——一个已完成的检查点宣称在某个有据可查的基线上取得 90.02 的平均值,而该基线的得分低于多数类基线。
• 延迟 — 单块 RTX 4090 上平均 44.16 ms、中位数 44.03 ms,相比之下,单块 T4 上批处理时每秒可处理 103 到 332 个问题。
• 语言——对于路由时可用的51种语言中的45种,没有公开声明。
• 许可证 — Apache-2.0,保留上游 Qwen 许可证,同时将 Apache-2.0 明确标注为可供商业使用。

两张卡片,两种截然不同的披露理念
到这里,比较就不再是查阅规格表,而变成了一种主观判断,因为这两家厂商对各自模型的说明风格截然相反。
Laya 的模型卡详细公开自身的失败之处。它报告称,英语检查点在高棉语上的准确率为 0.000、置信度为 0.952——自信却出错,这让置信度门控在那里形同虚设。它还报告称,action.act_probability 不携带任何可用信号,对几乎所有输入都读出 1.0,在 396 个已标注决策上的 AUROC 为 0.30,并告诉你要改为基于 置信度进行门控,后者在同一批项目上达到 0.77。它把序数评分问题称为“最弱的原语”,并引用 SST-5 上的 0.372 作为依据。一张告诉你应忽略自身哪些输出的模型卡,正在做大多数供应商不会尝试的事。
Intern-Decision-4B 的模型卡公布了一张干净整洁的表格,而且没有任何失败案例。它的注意事项真实且至关重要——校准部分异常明确地指出,其试点中的“before”列并不是任何用户会看到的内容,并且测试套件标签没有被用来选择温度——但评估部分却是七项胜出、零项承认。它还列出了五个竞争系统的行,这些系统是 InternLM 在 InternLM 自己的测试框架上运行的,其中包括本文开头提到的 Laya 那一行。那些并不是这些项目自己的数字,把它们当作这些项目自己的数字来读,会是个错误。
所以这场对垒在取材来源上是不对称的,而这种不对称恰恰对更小的那个模型有利:Laya 的证据里包含了它自己记录在案的缺陷,而 Intern-Decision-4B 的证据则从未遇到过不是其作者亲自挑选的测试集。
每一个分别适合哪种形态的问题
给定一个简短的英文结构化状态、一组封闭的答案,以及对可信概率的需求,Intern-Decision-4B 在纸面上是能力更强的对象,在实践中则是更昂贵的对象——四个 safetensors 分片、在 Python 3.12 下的 PyTorch 2.9.1 和 Transformers 5.14.1、一个常驻引擎,以及如果你想提供 HTTP 端点就得自己编写的包装器。对于跨数十种语言的高流量路由或护栏决策,若吞吐量是约束瓶颈,Laya 是更合适的形态:pip install laya、一个 421M 模型,以及一张已经告诉过你,在信任这些概率之前要先进行微调的模型卡。
两份模型卡都认同的一点是:在没有用你自己的数据检查校准之前,不应零样本信任任何一个模型——Laya 是因为其基础检查点在陌生决策类型上接近随机水平,Intern-Decision-4B 是因为其 0.065 的 ECE 来自其作者自己搭建的测试套件。
路由器在此处会改变什么、不会改变什么
这两款模型都不在 OrcaRouter 目录中,而且值得直说,而不是暗示并非如此:我们的模型页面对于 Intern-Decision-4B 和 Laya 都返回 404,而且两者都不是你今天可以调用的路由。这对两个项目意味着什么并不相同。Laya 的 Apache-2.0 许可证带有商业使用标签,意味着障碍纯粹是打包——它是一个本地 Python 包,占用很小,属于有可能被提供服务的类型。Intern-Decision-4B 的障碍同样是打包,但其 4.54B BF16 权重和 8,192 token 的拒答上限使其成为一个组件,而非一项服务。
OrcaRouter 真正能帮上忙的地方,在决策的另一端。如果你的结构化决策问题到头来还是需要一步推理,那么能做这件事的通用模型就在一个密钥即可调用 200 多个模型,供应商标价原价透传、零加价,并且在供应商之间自动故障转移——所以你与评分器搭配的那个模型近在一个端点之外,而不是要再签一份合同。
简短版本
这两个项目就决策应如何做出得出了相同结论,然后在几乎其他所有方面都不同。Laya 押注的是:421M 参数、紧凑的语言路由,以及对其自身缺陷的毫不留情,构成一个可让你做专门化的快速基座。Intern-Decision-4B 押注的是:十倍参数,加上精心设计的单 token 评分契约,构成一个成品级的零样本引擎。决定性实验是两者都未公开做过的那一个:取一组答案可计算的决策,把两者都跑一遍,然后检查那些概率是否有意义。Laya 已经半公开了那个实验,并向你展示了它在哪里失败。Intern-Decision-4B 则完全没有公开该实验。

