
Orca AI 사고 아카이브: 354건의 실제 AI 에이전트 사고, 각각 영수증 포함
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
보안 팀은 모델이 테스트 하네스 안에서 프롬프트 인젝션에 얼마나 잘 저항하는지 정확히 알려줄 수 있습니다. 하지만 거의 아무도 알려줄 수 없는 것은, 지난달에 실제로 몇 개 조직이 에이전트로 인해 침해를 당했는지, 그중 어느 침해에 확인된 피해자가 있었는지, 그리고 보고서에 인용된 수치 중 어느 것이 규제기관이 아니라 벤더에서 나온 것인지입니다. 모델이 할 수 있는 일과 이미 일어난 일 사이의 이 간극이 바로 a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a>가 메우기 위해 만들어진 간극입니다. 이 아카이브는 2026년 9월 23일에 공개되었으며, 9월 22일 기준 데이터 컷을 기준으로 593개의 고유 출처에서 수집한 354건의 기록을 보유하고 있습니다.
정확도 참고: 아래의 모든 수치는 아카이브 자체가 공개한 code>dist/stats.json/code> 버전 2026-09-22 기준 및 라이브 페이지에서 읽은 값입니다. 9월 23일의 출시 발표에서는 레코드 340건, 출처 548개, 피해가 확인된 사례 126건을 인용했습니다. 이는 게시 시점의 수치였고 아카이브는 지속적으로 갱신되므로, 두 수치 세트는 약 하루치 접수 분량만큼 차이가 납니다. 개발 중에 아카이브의 README와 라이브 페이지가 배지 숫자에 대해 서로 어긋난 경우에는 라이브 페이지와 JSON 내보내기를 신뢰해야 합니다.
아카이브가 실제로 포함하고 있는 것
이것은 뉴스 피드도 아니고 CVE 목록도 아닙니다. 모든 항목은 구조화된 frontmatter를 갖춘 단일 Markdown 파일이며, 사건이 발생한 달 아래에 분류되고, 각 항목은 최소 하나의 출처를 담고 있습니다. 이 데이터셋은 CC BY 4.0에 따라 공개되고 공개 저장소에 미러링되어 있으므로, 전체를 스크린샷으로 찍는 대신 복제하고 diff하고 인용할 수 있습니다.
커버리지 기간은 22개월이며, 2024년 12월의 전조 사례부터 2026년 9월 22일까지 이어지는데, 흥미로운 부분은 그 분포입니다. 심각도는 심각 45건, 높음 139건, 중간 77건, 낮음 8건, 정보성 85건으로 나뉩니다. 출처 신뢰도는 A등급 302건, B등급 47건, C등급 2건, D등급 3건으로 나뉩니다. 실제 피해가 확인된 기록은 127건, 명시적으로 배제된 기록은 142건, null로 남겨진 기록은 85건입니다.
그 마지막 세 숫자는 아카이브를 대충 훑어보기보다 꼼꼼히 읽을 가치가 있는 이유다. 기록 354건이라는 수는 사건 354건이라는 수가 아니다. 그중 사건으로 분류되는 것은 138건뿐이고, 나머지는 취약점 공개, 연구 시연, 위협 보고서, 정책 조치다. 이 다섯 가지를 모두 합쳐 세는 것이 바로 헤드라인 숫자가 틀어지는 방식이며, 그래서 아카이브는 이들을 따로 보관하고 필터링할 수 있게 한다.
왜 "탈옥은 사건이 아니다"라는 말이 바로 핵심인가
AI 보안 사건을 모은 대부분의 컬렉션은 한 가지 구분을 뭉갠다: 실제로 피해를 입힌 에이전트는 피해를 입힐 수 있음을 보여준 연구자와 같은 것이 아니다. 그 단일한 혼동이 컨퍼런스 데모를 침해 헤드라인으로 둔갑시키며, 이 아카이브가 거부하도록 만들어진 것도 바로 그것이다.

세 가지 필드가 그 무게를 감당한다. code>real_harm/code>는 피해자가 확인되었는지 기록한다. code>ai_involvement/code>는 1차 출처—공급업체, 피해자, 법 집행 기관 또는 공식 보고서—가 AI의 역할을 확인했는지 기록하며, 논란이 있는 귀속은 데이터셋에 남겨 두되 라벨을 붙인다. code>kind/code>는 해당 항목이 어떤 종류의 문서인지 기록한다. 출처가 없는 레코드는 들어오지 않는다. 증거가 상충하는 레코드는 어느 방향으로 해석하는 것이 더 낫게 읽히더라도 해결되지 않고 분쟁 중으로 표시된다. 새 증거가 도착하면 해당 레코드는 갱신되고, 변경 사항은 조용히 덮어쓰이지 않고 수정 이력에 기록된다.
아카이브는 그 규칙을 스스로에게 적용해 왔다. 자체 검증 과정에서 입증할 수 없는 항목 두 개를 삭제했고, 한 침입이 얼마나 빠르게 진행되었는지에 관한 널리 반복된 주장을 바로잡았으며, 세 번째 항목은 뒷받침하는 증거가 2차 자료로 드러나자 신뢰도 등급을 하향 조정했다. 아무것도 삭제한 적 없는 사고 데이터베이스는 점검되지 않은 데이터베이스다.
그것이 기준으로 정렬하는 열두 개의 공격 표면
모든 기록은 열두 가지 유형 중 하나 이상으로 태그되며, 각 유형은 고유한 월별 건수를 갖는다. 거버넌스 및 정책은 65건으로 가장 큰 범주이지만, 그중 피해가 확인된 것은 단 한 건뿐이다. 이는 규제 활동에 맞는 형태이며, 사건 건수로 인용하기에는 오해를 낳는 형태다. 자격 증명 악용이 55건으로 뒤를 잇고, 확인된 피해자가 40명으로 이 집합에서 피해 밀도가 가장 높다. Agent-as-a-weapon은 51건이며 28건이 확인되었다. 간접 프롬프트 인젝션은 45건이지만 피해가 확인된 것은 5건뿐인데, 이는 전체 데이터셋에서 역량 대 결과의 격차를 가장 명확히 보여준다. 가장 많이 연구된 공격 유형이면서 실제 환경에서는 가장 성과가 적은 유형 중 하나다. 공급망 오염은 36건으로 확인된 피해자가 27명이며, 전체에서 가장 나쁜 비율이다.
2026년 9월은 그 주장을 입증하는 달이다
2026년 9월 한 달에만 51건의 기록이 등록되었는데, 이는 이 기간의 이전 어느 달보다 두 배 이상 많은 수치입니다. 이는 보안이 갑자기 붕괴한 것이 아닙니다. 기록 관리가 마침내 1년간 누적된 사건들을 따라잡은 달이며, 중요한 것은 그 구성입니다. 악성 code>.git/config/code>에 대한 치명적 항목 — 이는 모델에 접촉하기도 전에 일곱 개의 코딩 에이전트에서 공격자 코드를 실행합니다 — 과 함께, 야생에서 악용된 Langflow 취약점, 인쇄 관리 업체에서 벌어진 AI 에이전트 스웜 캠페인, 그리고 체인 상류로 침투하는 npm 웜에 대한 항목들이 있습니다. 그 옆에는 OWASP 에이전트 통제 표준, 에이전트 이탈을 언급한 EU 국정 연설, 그리고 한 사건을 통제 상실 경고로 다룬 유엔 패널 브리핑에 관한 정보성 항목들이 자리합니다.
한국어 항목, 그리고 지역 필드가 의미하지 않는 것
아카이브의 code>region/code> 필드는 이벤트가 실제로 어디에 귀속되었는지를 표시하는 것이지, 공급업체의 본사가 어디에 있는지를 나타내는 것이 아니다 — 국경을 넘는 공급업체 공개는 항상 글로벌로 제출되며, 그래서 354개 레코드 중 291개에 단일 국가 태그가 없다. KR 태그가 붙은 레코드는 두 개이며, 둘 다 등급 A 출처의 정책 항목이고 확인된 피해는 없다: 2025년 4월 한국의 국내 앱스토어에서의 DeepSeek 퇴출과, 2026년 2월 Naver, Kakao, Karrot이 채택한 OpenClaw 전사적 금지다.
그 절제는 의도적이다. 지역 집계가 2라는 것은 한국이 두 건의 AI 보안 사건을 겪었다는 주장이 아니다. 그것은 해당 기간 내 두 사건이 기록할 만큼 강력한 1차 출처를 갖춘 채 한국 사례로 분류됐다는 주장이다 — 그리고 아카이브는 한국 기업의 고객들에게 다른 곳에서 일어난 사건들로 국가 페이지를 채우기보다는, 적더라도 정직한 숫자를 게재하는 편을 택한다.
신뢰도 등급을 인용하기 전에 읽는 방법
신뢰도는 심각성이 아니라 출처 품질에 관한 것이며, D 등급이 거짓을 의미하지는 않습니다 — 이는 당사자들이 서로 의견을 달리한다는 뜻이고, 어느 한쪽만 인용해서는 안 된다는 의미입니다. A 등급은 1차 출처, 즉 공급업체, 피해자, 법 집행 기관 또는 공식 보고서를 의미합니다. B 등급은 검증 가능한 세부 정보를 갖춘 연구소나 주요 매체를 의미합니다. C 등급은 오직 2차 자료만을 의미합니다. D 등급은 사실 또는 출처 표기에 논란이 있음을 의미합니다. 354개 레코드 중 302개에서 A 등급은 데이터셋의 85%를 차지하는데, 이는 사건 보고에서 이례적으로 높은 비율이며 출처 없으면 등재 없음 규칙의 직접적인 결과입니다.
솔직한 단서들은 분명히 밝힐 가치가 있습니다. 아카이브가 그렇게 명시하고 있기 때문입니다. 두 개의 기록은 여전히 C등급이고, 세 개는 D등급입니다. 85개의 기록은 정보성 심각도를 지니는데, 이는 사건이 아니라 타임라인 연속성을 위해 유지된 정책 또는 위협 보고 항목이기 때문입니다. 이 리포지토리는 만들어진 지 3주 되었고, 스타도 없고 릴리스도 없으며 자체 방법론에 대한 외부 감사도 없습니다. 이는 공개적으로 게시된 데이터셋이지, 동료 검토를 거친 연구가 아닙니다.

이것이 또 다른 벤치마크보다 더 중요한 이유
에이전트가 브라우저, 셸, 자격 증명, 코드 실행, 프로덕션 접근 권한을 갖추게 되면서, 보안 질문은 모델이 무엇을 할 수 있는지가 아니라 이미 모델로 무엇이 행해졌는지가 된다. 벤치마크는 첫 번째 질문에는 잘 답하지만 두 번째 질문에는 전혀 답하지 못한다. 출처 품질에 따라 등급이 매겨지고 실제로 누군가 피해를 입었는지 여부로 필터링되는 사건 아카이브만이 두 번째 질문에 답하는 유일한 종류의 도구이며, 그것은 항목이 추적 가능하고 정정 가능하며 자유롭게 재사용할 수 있을 때에만 작동한다.
그것이 이제 공개되었습니다. 데이터셋은 a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>에 있으며, 원시 Markdown, JSON 및 CSV 내보내기와 스키마는 a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">공개 저장소/a>에 있고, 수정은 레코드의 개정 이력을 통해 이루어집니다. 여기에 포함되어야 할 사건을 알고 있다면, 기여 경로는 Markdown 파일 하나와 최소 하나의 출처입니다. 출처가 없으면 등재도 없습니다.

아카이브를 공개하는 OrcaRouter는 200개 넘는 모델에 걸쳐 단일 OpenAI 호환 엔드포인트를 운영하며, 제공업체 가격에 마크업을 붙이지 않고 이들 사이에서 자동 장애 조치를 수행합니다 — 바로 이 동일한 라우팅 계층 덕분에 에이전트가 쉬운 호출에는 더 저렴한 모델을, 어려운 호출에는 더 강력한 모델을 사용하도록 지정할 수 있으며, 이는 위에서 언급한 대부분의 인시던트가 발견된 바로 그 아키텍처입니다.
