Hero:一张仪表盘卡片,显示 354 条记录 · 593 个来源,并带有严重程度标签和一张 22 个月的柱状图
Guides & Insights

Orca AI 事件档案:354 起真实 AI 智能体事件,每起均附有凭证

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

安全团队能精确告诉你,模型在测试框架内抵抗提示注入的能力到底有多强。但几乎没人能告诉你,上个月究竟有多少家组织真的被智能体攻破,其中哪些事件有已确认的受害者,以及报告中引用的那些数字里,哪些来自厂商而非监管机构。这道鸿沟——介于模型可能做出什么与已经发生了什么之间——正是a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> 旨在弥合的那道鸿沟。它于2026年9月23日上线,截至其9月22日的数据截止日,共收录354条记录,取自593个独立来源。

准确性说明:下文中的每一个数字均读取自该档案自身发布的 code>dist/stats.json/code>(版本为 2026-09-22),以及实时页面。9 月 23 日的发布公告援引的是 340 条记录、548 个来源以及 126 条已确认受到伤害;那是发布那一刻的数字,而该档案会持续更新,因此两组数据相差大约一天的收录量。在开发过程中,若该档案的 README 与其实时页面在某个徽章数字上出现不一致,应以实时页面和 JSON 导出为准。

档案究竟包含什么内容

它不是新闻源,也不是 CVE 列表。每一条记录都是一个带有结构化 frontmatter 的 Markdown 文件,按事件发生的月份归档,并且每条记录至少包含一个来源。该数据集以 CC BY 4.0 许可发布,并镜像在一个公共仓库中,因此整个数据集可以被克隆、比较差异和引用,而不只是被截图。

覆盖窗口为 22 个月,从 2024 年 12 月的一个前兆事件一直延伸到 2026 年 9 月 22 日,而其中真正有意思的部分是分布情况。严重程度划分为 45 个严重、139 个高、77 个中、8 个低和 85 个信息性。来源置信度划分为 302 个 A 级、47 个 B 级、2 个 C 级和 3 个 D 级。已确认造成现实世界危害的记录有 127 条,明确排除的有 142 条,留空未定的有 85 条。

最后三个数字正是这份档案值得仔细阅读、而非匆匆略过的原因。354条记录的计数,并不等于354起事件的计数。其中只有138条被归类为事件;其余的是漏洞披露、研究演示、威胁报告和政策举措。把五类加在一起统计,恰恰是标题数字出错的方式,所以这份档案将它们分开,并让你可以筛选。

为什么“越狱不是事件”才是关键所在

大多数 AI 安全事件汇编都抹掉了这样一个区分:真正造成了损害的智能体,与证明其可能造成损害的研究者,并不是一回事。正是这种混为一谈,把一场会议演示变成了入侵头条;而这一档案库的建立,正是为了拒绝这种混淆。

A diagram splitting CAPABILITY, what a model might do, from CONSEQUENCE, what actually happened, with EVIDENCE on the divider

有三个字段承担着这一重任。 code>real_harm/code> 记录受害者是否已得到确认。 code>ai_involvement/code> 记录是否有主要来源——供应商、受害者、执法部门或官方报告——确认了 AI 所起的作用,存在争议的归因会保留在数据集中,但会被标注出来。 code>kind/code> 记录该条目属于何种文档。没有来源的记录不会被收录。证据相互冲突的记录会被标记为存在争议,而不是朝着读起来更顺的方向去裁定。当新证据出现时,记录会被更新,变更会被写入其修订历史,而不是被悄悄覆盖。

该档案库已将那条规则应用于自身。在它自己的核查轮次中,它删除了两条无法证实的条目,更正了一个关于某次入侵推进速度的广为流传的说法,并在第三个条目的依据证据被发现是二手信息后,下调了其置信等级。一个从未删除过任何内容的事件数据库,就是一个尚未被核查过的数据库。

它据以分类的十二个攻击面

每条记录都被标记为十二种类型中的一种或多种,每种类型都有各自的逐月计数。治理与政策是最大的类别,有 65 条记录,但其中只有一条确认存在危害——对于监管活动而言,这才是正确的形态,而把它当作事件数量来引用则会产生误导。凭据滥用紧随其后,有 55 条记录,其中 40 条已确认受害者,是整组数据中危害密度最高的。将智能体作为武器有 51 条记录,其中 28 条已确认。间接提示注入有 45 条记录,但只有 5 条确认存在危害,这是整个数据集中能力与后果脱节最清晰的例证:它是被研究得最充分的攻击类别,却也是在现实环境中收效最少的类别之一。供应链投毒有 36 条记录,其中 27 条已确认受害者——是榜单上比例最差的。

2026年9月,就是那个说明一切的月份

仅 2026 年 9 月就录得 51 条记录,是该时间窗口内此前任何月份的两倍以上。这并非安全性的突然崩盘,而是记录工作终于追上了一整年累积的事件,而其构成才是关键所在:针对恶意的 code>.git/config/code> 的严重条目,它会在模型被调用之前就在七个编码智能体中执行攻击者代码;还有一条在野被利用的 Langflow 漏洞、一场针对某打印管理厂商的 AI 智能体集群攻击活动,以及一条从上游进入供应链的 npm 蠕虫。与这些并列的还有一些信息性条目:OWASP 智能体控制标准、一次点名智能体逃逸的欧盟国情咨文演讲,以及一份将某起事件视为失控警告的联合国专家小组简报。

韩语条目,以及地区字段不意味着什么

该归档文件的 code>region/code> 字段标记的是事件实际发生的位置,而非供应商总部所在地——跨境供应商披露一律按全球归档,这正是 354 条记录中有 291 条不带任何单一国家标签的原因。有两条记录带有 KR 标签,均为 A 级来源的政策条目,且无已确认危害:一是韩国于 2025 年 4 月将 DeepSeek 从国内应用商店下架,二是 Naver、Kakao 和 Karrot 于 2026 年 2 月实施的全公司范围 OpenClaw 禁令。

这种克制是有意为之。某个地区的计数为 2,并不是在声称韩国发生过两起 AI 安全事件。它是在说,在该时间窗口内,有两起事件落在韩国,且其一手来源足够可靠,可以收录——而档案库宁愿发布一个虽小却诚实的数字,也不愿用发生在别处、某家韩国公司客户身上的事件来充塞某个国家的页面。

如何在你引用其中一个之前读懂置信度等级

可信度关乎来源质量,而非严重程度;D 级并不意味着虚假——它意味着各方存在分歧,你不应只引用其中一方。A 级意味着第一手来源:供应商、受害者、执法部门或官方报告。B 级意味着研究实验室或具有可核查细节的大型媒体机构。C 级意味着仅有二手信息。D 级意味着事实或归因存在争议。在 354 条记录中有 302 条为 A 级,占数据集的 85%,这对事件报告而言异常之高,并且是“无来源不录入”规则的直接结果。

诚实的提醒值得直白说明,因为档案本身就是这样记载的。有两条记录仍为 C 级,三条为 D 级。八十五条记录带有"信息性"严重级别,因为它们是出于时间线连续性而保留的政策或威胁报告条目,而非事件。该仓库仅有三周历史,没有星标、没有发布版本,也没有对其自身方法的外部审计——它是公开发布的数据集,而非经过同行评审的研究。

The Orca AI Incident Archive repository on GitHub, showing the README badges and the file tree

为什么这比又一个基准测试更重要

当智能体获得浏览器、shell、凭据、代码执行能力和生产环境访问权限时,安全问题就不再是模型能做什么,而变成了已经有人用模型做了什么。基准测试很好地回答了第一个问题,却完全没有回答第二个。一个事件档案——按来源质量分级,并根据是否真的有人受到伤害来筛选——是唯一能回答第二个问题的工具,而它只有当其中的条目可追溯、可更正且可自由复用时才会奏效。

这就是现在公开的内容。数据集位于a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>,原始 Markdown、JSON 和 CSV 导出文件以及 schema 都在a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">公开代码库/a>中,更正则通过该记录的修订历史进行。如果你知道有某个事件应当收录其中,贡献路径就是一个 Markdown 文件加上至少一个来源。没有来源,就不予收录。

The live Orca AI Incident Archive page at orcarouter.ai

OrcaRouter 发布该归档,它通过一个兼容 OpenAI 的单一端点覆盖 200 多个模型,不对提供商定价加价,并在它们之间自动故障转移——正是同一路由层让智能体能够把简单调用指向更便宜的模型,把困难调用指向更强的模型,而这正是上述大多数事件所在的架构。