
RSI-Jev vs Laya:两种开放决策模型,截然相反的押注
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
截至 2026 年 10 月,如果你想要类型化决策——是/否、从 k 个中选一个、按评分标准打分——而无需在链路中使用托管端点,那么有两个开放权重模型值得考虑。它们是RSI-Jev v6.1-VL 4B,由第三方 Shanghua-Gao/RSI-Jev 研究循环于 2026-10-07 发布,以及Laya,由 Convai Innovations 于 2026-09-18 发布。两者都在单次前向传播中作答,不生成文本;都为每个选项返回经过校准的概率;都以 Apache-2.0 权重发布,并附带一个使用 TypeSafe 决策 API 的服务器,因此为商业模型编写的客户端只需更改基础 URL,就能对任意一个运行。它们还建立在相反的下注之上,而区分两者的两个数字是每个标签 3 到 4 个 token,以及 4.21 亿参数。
第一个赌注关乎规模。Laya 的英文检查点是 4.21 亿参数的 ModernBERT-large,上下文长度为 512 个 token;其多语言检查点是 3.22 亿参数的 mmBERT-base,窗口为 1,024 个 token,在编码器全开时可达到 8,192。RSI-Jev v6.1-VL 运行一整个 Qwen3.5-4B-Base 塔——46.9 亿参数,其中 35.7 亿位于 32 个解码器层中,外加一个视觉塔和位于第 16、20、32 层的三个决策头。Laya 是一个你可以在几 GB 内预加载三个的模型;RSI-Jev 则是一个 9.7 GB 的 bf16 检查点。第二个赌注源于第一个:Laya 每次调用几乎不花什么成本,并期望你来教它你的领域,而 RSI-Jev 则动用四十五亿参数,试图在完全没有任何训练的情况下回答你的问题。
每个到底是用来做什么的?
Laya 自己的模型卡中包含一句话,比任何评测者都更能界定这一比较:“Laya 是一个可快速专门化的基座,而不是零样本决策引擎。”在 typed-decisions 基准上——涵盖四个工作流的 2,000 项决策——基础英语检查点得分为 0.362,而随机猜测为 0.318,始终选择多数类为 0.461。在同样的决策上,Convai 在该基准自身训练划分上微调得到的检查点得分为 0.766,超过了 0.735 的教师一致率上限。这个差距就是产品本身:Laya 是一个 421M 编码器,你在一个狭窄的分类体系上对其进行微调;而 Convai 提供了一个 Kaggle notebook,能在两块免费 T4 上跑完整个循环——构建数据集、训练、拟合校准温度、评估。
RSI-Jev 是另一种选择。其 v6.1-VL 版本在自己的公开 Decision Index 0.3 上得分 50.98,这是在默认配置下进行 140,178 次请求的运行结果;在项目日期为 2026-10-06 的榜单上,它与那里最好的 4B 模型并列,并在总共 113 个中排名第 27。它的十五项基准套件得分为 0.793,其留出集为 0.729。这些是零样本数据——不过项目谨慎地指出,十五项基准中有十项以某种形式贡献了训练数据,因此“零样本”适用于该版本的搜索,而不是页面上的每一个数字。这些数字真正能给你带来的,是一个能够回答关于你从未展示给它的文档的问题、并且无需先进行训练运行的模型。
• 规模 — Laya 421M 英语 / 322M 多语言,对比 RSI-Jev 4.69B,运行整个 Qwen3.5-4B-Base 主干。
• 零样本准确率——Laya 在 typed-decisions 上为 0.362,低于 0.461 的多数基线;而 RSI-Jev 在其自身的 Decision Index 0.3 上为 50.98,与那里最好的 4B 成绩持平。
• 微调后的准确率——Laya 为 0.766,使用的是在该基准自身划分上训练的检查点;相比之下,RSI-Jev 的数据是发布级别的,而非按领域划分的。
• 语言 — Laya 在 51 种语言中有 45 种可用,相较 RSI-Jev 以英语为中心的文本,在随机服务器端路由下高出三倍以上。
• 模态——Laya 仅文本,而 RSI-Jev 为文本加每次请求最多四张图像。
• 上下文 — Laya 英语为 512 个 token,多语言为 1,024 个,长文档最高可达 8,192 个;而 RSI-Jev 为 32,768 个 token,超出时会拒绝处理而非截断。
• 延迟—— 在 T4 上,Laya 的 p50 为 32.8 毫秒,批量为十时每题 7.2 毫秒;而 RSI-Jev 在低推理强度下为 22.5 毫秒,在 H200 上全深度时约为 40 毫秒。
选项数量断崖是最显著的差异
两个模型都在请求时定义答案空间,因此新的 schema 无需重新训练——这是整个系列共有的结构性优势。但它们对答案空间的分配方式不同,而这种差异恰恰体现在企业路由常见的那些任务上。Laya 在每个选项各自的掩码 token 上为其打分,而各选项共享固定的 head 预算:英文 checkpoint 上为 192 个 token,多语言上为 256 个。在 Banking77 上,77 个意图意味着每个标签大约只有三到四个 token,准确率降至 0.425。Convai 自己的模型卡记录了这一断崖,并给出了修复方法——将head_max_len提高到 512,并将上下文提高到 1,024 或更多,好让每个标签都有空间,或者将大型选项集拆分为由粗到细的两步选择。
RSI-Jev 的服务路径每题最多支持 5,120 个选项。这并非与 Laya 的 0.425 进行同类对比的基准——两者是在不同的测试框架上测量的,而选项上限是配置限制,不是得分。它说明的是,当你的分类体系有上百个条目时,哪个模型不会崩溃。如果你的选择题是“账单 / 技术 / 销售 / 其他”,两者都行。如果它们是一百多个意图标签,那么这两者中有一个在可用之前需要调优,而另一个则不需要。

延迟、语言问题以及图像
Laya 的延迟宣称是它最响亮的卖点,而且确有其事:在 Tesla T4 上单个问题 p50 为 32.8 ms,十个一批为 72.3 ms,五十个为 337 ms——在一块不算强的 GPU 上每秒 103 到 332 个问题。RSI-Jev 自己的数据是在 H200 上测得的:在努力程度为 低时是 22.5 ms,在 中等时是 26.8 ms,默认 39.9 ms,全深度 40.4 ms。二者处于同一数量级,而且都是本地前向传播而非网络调用;一旦排除托管端点,这才是真正重要的比较。注意两者如何利用时间:RSI-Jev 可以有意在第 16 层停止,以换取那 22.5 ms,并在问题很难时跑完所有 32 层;Laya 则没有这种调节旋钮——它总是运行完整的(小型)编码器。
语言方面的情况则恰恰相反,而且对英语以外的人来说具有决定性。Laya 自带一个路由器,能在远不到一毫秒内检测书写系统并派发到多语言检查点;其公布的表格显示,51 种语言中有 45 种可用性超过随机水平的三倍,而仅靠英语检查点只有 23 种。它的模型卡也坦率说明了这一点为何重要:英语检查点在非拉丁书写系统上会崩溃——高棉语的准确率为 0.000,置信度为 0.952——因此置信度门控无法挽救错误的路由。RSI-Jev 没有这类语言方面的表现;它是一个以英语为中心的文本模型,只是恰好能读图像。
图像方面则是镜像对照。RSI-Jev 每次请求接收一至四张,以 base64 数据 URL 的形式传入,并在本次发布中于其留出图像集上取得了 0.834 的分数;Laya 发布的检查点都是文本分类器,虽然 Hub 上有像 laya-vision 这样的社区移植版本,但它们并非厂商的产品。如果你的判断是针对一张照片、一张图表或一张截图做出的,那属于其中一个模型的那一栏,而不是另一个的。
两者都没有与对方进行过基准测试
这正是逐项规格对比悄然掩盖的部分:这两个模型之间没有正面较量。存在的是它们各自与同一个闭源模型——TypeSafe 的 Jev 1.13——之间的正面较量,而两者都无法被并排放在一起。
Convai 发布了一个:在 typed-decisions 上,Jev 1.13.0 为 0.727,而 Laya 的路由结果为 0.766;在 Banking77 上,Jev 为 0.870,而 Laya 为 0.425;在校准上,Jev 为 0.246,而 Laya 在温度修正后为 0.081。Convai 在同一张表中指出了自身的局限——Jev 的数字是第三方发布的,他们从未获得 API 访问权限来测量它,而且样本量和提示词各不相同。RSI-Jev 的对比对象是 Decision Index,而这是 RSI-Jev 自己的公开榜单,其中根本没有 Jev 的条目。因此,唯一同时涉及这两个模型的外部数字,都来自销售它们的各方所构建的评测框架,而对上述任何单一数字的合理解读都是:"这是制作者测得的,是在制作者的任务上。"
这两个项目都做得很好、且很少见的一点,是公开自身的弱点。RSI-Jev 列出了其视觉版本发布背后的五个非商业图像来源,并直言,基于这些来源训练的权重是否继承这些条款,尚未有定论;它报告了其最新版本中的一次校准退化,并称其默认退出阈值尚未确认。Laya 记录道,其基础检查点低于多数基线,其序数评分问题是最弱的原语,其 noul 可能遵循自己的选项标签而不是状态,并且其响应字段之一不携带任何可用信号。这种坦诚是从这两个项目中最值得继承的东西:在基于它们进行自动化之前,先检查你自己标注案例上的置信度值。

他们复制的合同实际上存放在哪里
这两个模型之所以存在,是因为有一种线格式值得复制。TypeSafe 的 Jev 定义了请求形态——状态、问题、三个类型化原语——以及应答形态,Laya 和 RSI-Jev 都实现了它,因此现有客户端只需更改基础 URL 即可工作。那个参考模型,typesafe/jev-1.13,是我们所提供的三者中的那一个:它已收录在我们的目录中,位于专用的 systemone 端点,向 /v1/systemone 发送 POST,非流式,针对 65,536 个 token 的上下文,价格为每百万输入 token $0.042,输出计费为零。Laya 和 RSI-Jev 都不在我们的目录中——两者都是下载项,而这正是它们的意义所在。
这件事在实际操作中的版本,比对比本身更重要。决策层几乎从不孤立地存在于一个技术栈中;它们会紧挨着一个生成模型,由后者来写回复、摘要或代码。让参考契约与 200+ 其他模型共用同一个密钥,按供应商目录价原样传递,0% 加价,意味着供应商费率变更当天就能传达到你这里,而自动故障转移意味着这对组合中负责生成的那一半不是单点故障,同时你可以判断决策侧那低成本的一半是否足够好。如果你认定自托管的 421M 编码器或 4.69B 检查点才是正确选择,你仍然会希望它所对接的契约能从同一处访问到——而如果你宁愿这两者都不运行,那么它们二者所复制的模型只需一次请求即可获得。
要下载哪一个
如果拥有标注数据、分类体系相对稳定、且语言组合并非仅限英语,就选择 Laya。它足够小,可以并行运行许多实例;足够快,可以置于每个请求之前;并且从底层设计上就为微调而生——微调后 0.766 对比零样本 0.362 的分数就是全部理由。请为训练运行、标注以及按问题类型重新拟合温度预留预算,这一步能将其校准误差从 0.466 降至 0.081;同时,在信任大规模分类结果之前,请将选项集控制在约二十个标签以内,否则就提高分类头的预算。
如果你希望决策在无需任何训练的情况下就能先跑起来,如果你的问题有时与图像有关,如果你的选项集很大,或者你想用延迟换取每次请求的深度,那就选择 RSI-Jev v6.1-VL。预计你要运行的是 9.7 GB 的检查点,而不是 400M 的,预计这是一个十三天内已发布八个版本、并且可能在你评估这一版时再发一版的项目,还预计你得自己去检查它的校准——这一版自己的模型卡上说它变得更差了,而不是更好。
无论你选哪一个,同样有两件事成立。两个模型都不生成文本,因此两者都不会因输出格式错误的字段而失败;两者都返回概率,而概率恰恰是需要针对每次部署加以验证、而不是从模型卡上照搬的那部分。而且两者都把决策层这个有趣的问题从“谁的 API”转移到了“谁的权重”——这是一个更值得问的问题,而这对模型给出的回答截然不同。

