主視覺:一張儀表板卡片顯示 354 筆記錄 · 593 個來源,附有嚴重程度標籤與 22 個月的長條圖
Guides & Insights

Orca AI 事故檔案庫:354 起真實 AI 代理事故,每起皆附有憑證

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

資安團隊能精確告訴你,模型在測試框架內抵抗提示注入的能力有多強。但幾乎沒有人能告訴你的是,上個月究竟有多少組織真的被 AI 代理入侵,其中哪些入侵事件有已確認的受害者,以及報告中引用的數字有哪些來自供應商,而非來自監管機關。那道落差——存在於模型可能做出什麼與已經發生什麼之間——正是 a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> 所建立來彌補的落差。它於 2026 年 9 月 23 日上線,截至其 9 月 22 日的資料截止點,共收錄 354 筆紀錄,取材自 593 個獨特來源。

準確度說明:以下每一項數字皆讀取自存檔本身所發布的code>dist/stats.json/code>,版本為 2026-09-22,並取自即時頁面。9 月 23 日的發布公告引用了 340 筆紀錄、548 個來源,以及 126 筆已確認有損害;那些是發文當下的數字,而存檔會持續更新,因此兩組數字相差約莫一天的收錄量。若開發期間存檔的 README 與其即時頁面在徽章數字上出現不一致,應以即時頁面與 JSON 匯出檔為準。

檔案實際上包含的內容

這不是新聞摘要,也不是 CVE 清單。每一筆條目都是一個帶有結構化 frontmatter 的 Markdown 檔案,依事件發生的月份歸檔,而且每筆條目至少附有一個來源。這個資料集以 CC BY 4.0 授權發布,並鏡像於公開儲存庫,因此整個內容可以被複製、比對差異並引用,而不是只能截圖。

涵蓋期間為 22 個月,從 2024 年 12 月的前導事件一路延伸到 2026 年 9 月 22 日,而分布才是有趣的部分。嚴重性分布為 45 個重大、139 個高、77 個中、8 個低,以及 85 個資訊性。來源可信度分布為 302 個 A 級、47 個 B 級、2 個 C 級,以及 3 個 D 級。已確認的現實世界危害記錄有 127 筆,明確排除的有 142 筆,另有 85 筆留為空值。

最後那三個數字,正是這個檔案庫值得細讀而非略讀的原因。354 筆紀錄的數量,並不等於 354 起事件。其中只有 138 筆真的被歸類為事件;其餘則是漏洞披露、研究演示、威脅報告與政策舉措。把這五類全部合併計算,正是標題數字出錯的典型方式,這也是為什麼檔案庫將它們分開,並讓你得以篩選。

為什麼「越獄不是資安事件」才是重點

多數 AI 安全事件彙編都會抹平一項區別:實際造成損害的代理,並不等同於研究人員證明它可能造成損害。正是這種混為一談,把一場會議演示變成資料外洩的頭條新聞;而這正是這個檔案庫旨在拒絕的事。

A diagram splitting CAPABILITY, what a model might do, from CONSEQUENCE, what actually happened, with EVIDENCE on the divider

有三個欄位承載這份重量。code>real_harm/code> 記錄受害者是否已獲確認。code>ai_involvement/code> 記錄是否由主要來源——廠商、受害者、執法機關或官方報告——確認 AI 所扮演的角色,有爭議的歸因會保留在資料集中但加以標記。code>kind/code> 記錄該條目屬於哪一種文件。沒有來源的紀錄不會收錄。證據相互衝突的紀錄會標記為有爭議,而不是朝讀起來較順的方向解決。當有新證據出現時,該紀錄會更新,且變更會寫入其修訂歷史,而不是被默默覆寫。

檔案庫已將那條規則套用於自身。在其自身的驗證回合中,它刪除了兩筆無法證實的條目,更正了一項廣為流傳、關於某次入侵進展速度的說法,並在第三筆條目的基礎證據被發現其實是二手資訊時,調降了該條目的信心評級。一個從未刪除任何內容的事件資料庫,就是一個尚未經過查核的資料庫。

它據以排序的十二個攻擊面

每一筆紀錄都被標記為十二種類型中的一種或多種,而每一種類型都有自己的逐月計數。治理與政策是最大的類別,有 65 筆紀錄,但其中只有一筆已確認造成損害——這對法規活動而言是正確的樣態,但若拿來當作事件數量引用則會造成誤導。憑證濫用緊追在後,有 55 筆,其中 40 名已確認受害者,是整組資料中損害密度最高的。代理程式即武器(Agent-as-a-weapon)有 51 筆,其中 28 筆已確認。間接提示注入有 45 筆紀錄,但只有 5 筆已確認造成損害,這是整份資料集中能力與後果落差最清楚的例證:它是被研究得最透徹的攻擊類別,卻也是實際環境中成效最差的類別之一。供應鏈下毒有 36 筆紀錄,其中 27 名已確認受害者——是整張表上比例最糟的。

2026 年 9 月正是能證明這一切的月份

光是 2026 年 9 月就登錄了五十一筆記錄,是該區間內任何先前月份的兩倍以上。這並非安全態勢突然崩潰,而是記錄終於趕上了一年累積事件的月份,而真正重要的是這些記錄的組成:針對惡意 code>.git/config 的重大等級項目,該檔案會在模型被聯繫之前,於七個程式開發代理中執行攻擊者的程式碼;針對一個已遭實際濫用的 Langflow 漏洞;針對某列印管理廠商遭遇的 AI 代理叢集攻擊行動;以及針對一隻從上游進入供應鏈的 npm 蠕蟲。與這些並列的還有若干資訊性項目:OWASP 代理控制標準、一場點名代理逃逸的歐盟盟情咨文演說,以及一份將某起事件視為失控警訊的聯合國小組簡報。

韓國條目,以及地區欄位不代表什麼

該檔案庫的 code>region/code> 欄位標示的是事件實際落地的地點,而非供應商總部所在地——跨境供應商的揭露資料一律申報為全球,這也是為什麼 354 筆紀錄中有 291 筆不帶單一國家標籤。有兩筆紀錄帶有 KR 標籤,兩者皆為政策條目,具 A 級來源且無已確認的損害:南韓於 2025 年 4 月將 DeepSeek 從國內應用程式商店下架,以及 Naver、Kakao 和 Karrot 於 2026 年 2 月採納的全公司 OpenClaw 禁令。

這種克制是刻意的。地區計數為二,並不是在宣稱韓國曾發生過兩起 AI 安全事件。它宣稱的是:在該時間區間內有兩起事件落在韓國,且其一手來源足夠可靠而得以收錄——而這個檔案庫寧可發布一個小而誠實的數字,也不願用那些其實發生在韓國企業位於他處的客戶身上的事件,來灌水一個國家頁面。

引用之前,如何解讀信心評級

信心關乎來源品質,而非嚴重程度;D 級並不代表虛假——它代表各方說法不一致,你不應只引用單一方的說法。A 級代表第一手來源:廠商、受害者、執法機關或官方報告。B 級代表研究實驗室,或提供可查證細節的大型媒體。C 級代表僅有二手資訊。D 級代表事實或歸因存在爭議。在 354 筆紀錄中有 302 筆,A 級佔資料集的 85%,這對事件通報而言異常地高,而這正是「無來源即不登錄」規則的直接結果。

這些坦誠的警告值得直白說明,因為檔案本身就載明了這些事項。有兩筆紀錄仍為 C 級,三筆為 D 級。八十五筆紀錄的嚴重性為資訊性,因為它們是為了時間軸連續性而保留的政策或威脅報告條目,而非事件。該儲存庫只有三週大,沒有任何星號、沒有發行版本,也沒有對其自身方法論的外部稽核——它是一份公開發布的資料集,而非經同儕審查的研究。

The Orca AI Incident Archive repository on GitHub, showing the README badges and the file tree

為什麼這比另一個基準測試更重要

當代理取得瀏覽器、shell、憑證、程式碼執行與正式環境存取權時,安全問題就不再是模型有能力做什麼,而是已經有人用它做了什麼。基準測試能妥善回答第一個問題,卻完全無法回答第二個。一個事件檔案庫,依來源品質分級,並依是否真的有人受害來篩選,是唯一能回答第二個問題的工具——而且唯有當條目可追溯、可更正且可自由重複使用時,它才行得通。

這就是現在公開的內容。資料集位於 a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>,原始 Markdown、JSON 和 CSV 匯出檔以及結構描述都在 a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">公開儲存庫/a>,更正會透過該紀錄的修訂歷史進行。如果你知道有應該收錄其中的事件,貢獻方式就是一個 Markdown 檔案和至少一個來源。沒有來源,就沒有條目。

The live Orca AI Incident Archive page at orcarouter.ai

OrcaRouter 發布了該檔案庫,提供一個與 OpenAI 相容的單一端點,涵蓋超過 200 個模型,對供應商定價不加價,並在它們之間自動容錯移轉——同一個路由層讓你能夠把代理指向較便宜的模型來處理簡單呼叫,並指向更強大的模型來處理困難呼叫,而這正是上述大多數事件被發現所在的架構。