一根高大的半透明立柱矗立在浅色地板上,柱内堆满了叠放的代币卡,一道小虎鲸剪影从柱底滑过,一块盾形面板斜靠在立柱上。
Guides & Insights

OrcaCyber Zero 1.0 与 150,000 美元储备金:OrcaRouter 以杰出企业赞助人身份加入 Omacom Foundation

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

OrcaRouter 已作为杰出企业赞助者加入 Omacom 基金会,并向基金会的战略代币储备捐赠了价值 150,000 美元的代币。该储备用于安全工作,首先面向基金会的安全团队和内核团队,而不是通用推理。这些团队将首先使用的模型是 OrcaCyber Zero 1.0,这是我们针对漏洞分析、复现和安全研究进行后训练的编码模型,目前处于封闭测试阶段。这就是公告内容,而本页其余部分则是其背后的推理。

推理始于流量。在这一公告发布前的 30 天里,我们的模型在 Hugging Face 上的下载量突破了 150 万次,而经由路由器分发的流量形态也随之改变。

“为这份摘要选最便宜的模型”不再是唯一冒出来的问题;“这里有什么能读懂这次崩溃、这个补丁或这份报告,并告诉我它到底是什么吗”也成了常见问题。路由器不适合回答那个问题,却很适合让人注意到它。所以,我们不是在压低通用推理的投入——它本来就已经很便宜,而且还在变得更便宜——而是在为工作中错误答案代价最高的那部分买单。

OrcaRouter 接入了什么,以及令牌流向何处

杰出企业赞助人是 Omacom Foundation 的企业层级。该赞助是一次性捐赠而非订阅,捐赠金额为 150,000 美元的代币,支付至 Strategic Token Reserves,这是一个供基金会自己的团队为自身工作从中提取资金的资金池。

钱的去向比数额更重要。预留额度不是优惠券,这些东西也不会以免费套餐或折扣码的形式发放。只有当基金会的工程师通过 OrcaRouter跑一个真实任务时,这些 token 才会被消耗——那正是其他所有用户所接触的同一个路由层。我们更愿意为某个具体工程问题背后的算力买单(这个 bug 能否复现,这个补丁是否站得住),而不是去兜底一个没有边界的聊天池子。

为什么这笔捐赠被指定用于安全工作,而不是通用推理

通用推理是这个市场中已经解决的那一半。一个称职的通用模型可以廉价获得,将请求路由到它已近乎商品化,而额外投入15万美元的通用算力,能给团队带来的、此前无法获得的东西微乎其微。在那里的边际token,其价值大致就等于它的成本。

安全工作在三个方面表现不同,而这三点对任何买单的人来说都很重要。

• 这些任务耗时较长。阅读报告、构建复现用例和验证修复都不是单轮就能完成的工作,而且它们消耗 token 的方式与摘要截然不同。

• 那些能出色完成这些任务的模型是专门化的,而非通用的。

• 这项工作有一个可验证的答案:漏洞要么能复现,要么不能。

最后这一点,正是这笔支出站得住脚的原因。我们资助的不是关于安全性的观点,而是那些最终能拿出某种成果、让内核团队可以审视并决定接受或拒绝的尝试。

OrcaCyber Zero 1.0 被训练来做什么?

三项工作,全都是安全工作:漏洞分析、漏洞复现和安全研究。

分析是阅读任务:给定一份报告、一个差异或一个组件,弄清楚缺陷是什么以及它在哪里。复现是构建任务,它将安全模型与附带了严厉系统提示的通用编码模型区分开来:产生一个实际触发该条件的输入,而不是对它的描述。安全研究是开放式的部分,没有人会给你一张整齐的工单,必须先找到目标。

我们掌握的实测结果覆盖了复现工作。在 CyberGym Level 1 上——一个取自 188 个开源项目的基准——OrcaCyber Zero 1.0 首次尝试就复现了 1,507 个真实世界漏洞中的 1,478 个,通过率为 98.07%。首次尝试这个数字值得读两遍。这次测量不提供第二次机会,发布窗口同样不提供。这个模型是什么,以及它在目录中的位置,见 OrcaCyber Zero 1.0页面。

A scoreboard graphic labelled CyberGym Level 1, showing the fraction 1,478 / 1,507 beside a circular gauge reading 98.07%.A screenshot of the OrcaCyber Zero 1.0 model page showing the model name at the top and the opening description of what the model is trained for.

边界实际上在哪里:模型所发起的调用

Zero 1.0 能读取并复现代码中的缺陷。但对于大多数团队如今围绕它构建的那一层,它却只字不提。一旦模型被交到工具手中,那些真正耐人寻味的失败便不再是文本,而变成了调用:它选择了哪个工具、传入了什么参数、返回的结果是否被允许改变它接下来的动作。一个能出色读懂 C 语言的模型,并不能保护这样一条流水线:其中的智能体可能被诱导着用错误的参数去调用错误的端点。

这是这里安全工作的另一半,也正是为什么我们目录中的“security”一词并非始于、也并非止于漏洞研究。针对内部系统运行智能体的团队必须把调用层视为攻击面,而这正是面向工具调用与 MCP 调用的智能体防火墙旨在解决的问题。内核工作与安全工作都看到了这一问题的两个方面,而储备也同时覆盖了两者。

A screenshot of the agent firewall page on orcarouter.ai, showing the page title and the opening paragraph about protecting tool and MCP calls.

封闭测试对于想要获得访问权限的团队意味着什么?

访问权限按用例授予,而不是对所有人开放。OrcaCyber Zero 1.0 处于封闭测试阶段,其范围是有意划定得很窄的:可信安全研究、漏洞分析与复现,以及红队工作流。“封闭”才是关键所在,访问权限仅限定于这些工作,而非一般的模型调用流量。

实际上,推进最快的,是那种带着明确目标而来的申请:一个你维护的组件、一类你追踪的漏洞、一项你本季度正在推进的工作。如果你想加入,就说明你打算让模型针对什么。一般聊天用途的请求不会排在持有真实测试用例的安全团队前面,也不应该如此。随着评估经得起检验,测试版会逐步扩大;我们不会以超出我们判断反馈能力的速度开放它。

储备是如何被使用的

储备中的代币并不会被分配给单一模型,其运作机制值得用一段话来说明,因为它们解释了这笔捐赠的形态。请求到达路由器,随后自适应路由决定每个请求的去向。在实践中,这种拆分情况如下所示。

• 补丁审查、崩溃分类、复现尝试 —— 去向 安全调优路线:OrcaCyber Zero 1.0 对比 为什么 它很长,它很专门,而且答案是可核验的

• 发行说明、变更日志摘要、测试名称、脚本的文档字符串 —— 它该放在哪里 诸如 GLM 5.3 Flash 之类的通用模型 vs 为什么它成本更低,也更适合这项工作

这就是为什么捐赠的是 token,而不是某个模型的免费额度。基金会的团队会得到与其他人相同的路由决策:当任务值得时,可以使用安全路由;当任务不需要时,也不会向他们计费。以这种方式使用的储备,比花在单一模型上的储备更持久,而且把模型的选择权留给真正了解任务的人。

要点

安全工作才是这笔钱该去的地方,而理由并非出于情感。通用推理是一种价格不断下跌的大宗商品;漏洞复现则是一项答案可验证、每次尝试成本高昂的任务,只有在这里,一枚捐赠的 token 才能做出可衡量的贡献。内核团队不在乎模型听起来如何,只在乎复现程序能不能跑起来。

如果你已经在通过我们进行路由,本周你的流量不会有任何变化。变化发生在我们这一侧:我们认为迄今为止最重要的成果——那个模型,如今迎来了第一位高要求的用户,一个面对难题、且对听起来合理却错误的答案毫无耐心的人。这比任何发布文章都更能检验我们,而我们也更愿意以此被衡量。

来源说明:供应商报告的数字是向 Omacom Foundation 的 Strategic Token Reserves 捐赠的 $150,000 代币、该储备所面向的范围,以及 OrcaCyber Zero 1.0 的封闭测试状态和访问条件。我们自己的测量结果是 CyberGym Level 1 的结果:在取自 188 个开源项目的基准测试上,首次尝试复现 1,507 次中有 1,478 次成功,通过率为 98.07%,该基准测试由我们自行运行。平台报告的是本次公告前 30 天内我们的模型在 Hugging Face 上的 150 万次下载,数据取自平台自己的计数器。本文没有任何数字是引用第三方得出的,也没有任何发现被归功于外部方。发布于 2026-09-19,数字已于同日与我们自己的记录核对。