Hero: ett instrumentpanelskort som visar 354, poster · 593 källor, med allvarlighetschips och ett stapeldiagram över 22 månader
Guides & Insights

Orca AI:s incidentarkiv: 354 verkliga AI-agentincidenter, alla med ett kvitto

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ett säkerhetsteam kan berätta exakt hur väl en modell står emot prompt-injektion i en testrigg. Vad nästan ingen kan berätta är hur många organisationer som faktiskt drabbades av intrång av en agent förra månaden, vilka av dessa intrång som hade ett bekräftat offer, och vilka av siffrorna som citerades i rapporten som kom från leverantören snarare än från en tillsynsmyndighet. Det gapet – mellan vad modeller kan göra och vad som redan har hänt – är gapet som a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> byggdes för att täppa till. Det lanserades den 23 september 2026 och innehåller, vid dataavgränsningen den 22 september, 354 poster hämtade från 593 unika källor.

Noggrannhetsnotis: varje siffra nedan är hämtad från arkivets egna publicerade code>dist/stats.json/code> i version 2026-09-22 och från live-sidan. Lanseringstillkännagivandet den 23 september angav 340 poster, 548 källor och 126 med bekräftad skada; det var siffrorna i publiceringsögonblicket, och arkivet uppdateras kontinuerligt, så de två uppsättningarna skiljer sig med ungefär en dags inflöde. Där arkivets README och dess live-sida har varit oense om ett badge-nummer under utvecklingen är det live-sidan och JSON-exporten man bör lita på.

Vad arkivet faktiskt innehåller

Det är inte ett nyhetsflöde och det är inte en CVE-lista. Varje post är en enda Markdown-fil med strukturerad frontmatter, arkiverad under månaden då händelsen inträffade, och varje post har minst en källa. Datamängden publiceras under CC BY 4.0 och speglas i ett offentligt repo, så hela materialet kan klonas, diffas och citeras i stället för att skärmdumpas.

Täckningsfönstret sträcker sig över 22 månader, från en föregångare i december 2024 fram till den 22 september 2026, och det intressanta är fördelningen. Allvarlighetsgraden fördelar sig på 45 kritiska, 139 höga, 77 medel, 8 låga och 85 informativa. Källtillförlitligheten fördelar sig på 302 av grad A, 47 av grad B, 2 av grad C och 3 av grad D. Bekräftad verklig skada är registrerad för 127 poster, uttryckligen utesluten för 142 och lämnad som null för 85.

De sista tre siffrorna är anledningen till att arkivet är värt att läsa noggrant i stället för att skumma. En räkning på 354 poster är inte en räkning på 354 incidenter. Endast 138 av dem klassas överhuvudtaget som en incident; resten är sårbarhetsavslöjanden, forskningsdemonstrationer, hotrapporter och politiska åtgärder. Att räkna alla fem tillsammans är precis hur en rubriksiffra blir fel, vilket är anledningen till att arkivet håller dem åtskilda och låter dig filtrera.

Varför "ett jailbreak är inte en incident" är hela poängen

De flesta samlingar av AI-säkerhetshändelser suddar ut en åtskillnad: en agent som faktiskt har orsakat skada är inte samma sak som en forskare som visar att den skulle kunna göra det. Just den sammanblandningen är det som förvandlar en konferensdemo till en rubrik om intrång, och det är vad arkivet är byggt för att vägra.

A diagram splitting CAPABILITY, what a model might do, from CONSEQUENCE, what actually happened, with EVIDENCE on the divider

Tre fält bär den vikten. code>real_harm/code> registrerar huruvida ett offer bekräftades. code>ai_involvement/code> registrerar huruvida en primärkälla — leverantören, offret, brottsbekämpande myndigheter eller en officiell rapport — bekräftade AI:ns roll, med omtvistade tillskrivningar bevarade i datasetet men märkta. code>kind/code> registrerar vilken sorts dokument posten är. En post utan källa tas inte med. En post med motstridiga bevis markeras som omtvistad i stället för att avgöras i den riktning som låter bättre. När nya bevis tillkommer uppdateras posten och ändringen skrivs in i dess revisionshistorik i stället för att tyst skrivas över.

Arkivet har tillämpat den regeln på sig självt. Under sina egna verifieringsomgångar raderade det två poster som inte kunde styrkas, korrigerade ett vitt spritt påstående om hur snabbt ett intrång fortskred och nedgraderade en tredje posts konfidensgrad när det underliggande beviset visade sig vara andrahandsinformation. En incidentdatabas som aldrig har tagit bort någonting är en databas som inte har kontrollerats.

De tolv attackytorna som den sorterar efter

Varje post är märkt med en eller flera av tolv typer, och varje typ har sitt eget månad-för-månad-antal. Styrning och policy är den största gruppen med 65 poster, men endast en av dem har bekräftad skada – vilket är rätt form för tillsynsverksamhet och missvisande att ange som ett incidentantal. Missbruk av autentiseringsuppgifter följer med 55, varav 40 bekräftade offer, den högsta skadetätheten i uppsättningen. Agent som vapen ligger på 51 med 28 bekräftade. Indirekt promptinjektion har 45 poster men endast 5 med bekräftad skada, vilket är den tydligaste illustrationen av klyftan mellan förmåga och konsekvens i hela datamängden: det är den mest studerade attackklassen och en av de minst produktiva i verkligheten. Förgiftning av leveranskedjan, med 36 poster, har 27 bekräftade offer – det sämsta förhållandet i sammanställningen.

September 2026 är månaden som styrker argumentet.

Femtioen poster registrerades enbart i september 2026, mer än dubbelt så många som någon tidigare månad i perioden. Det är inte en plötslig kollaps av säkerheten. Det är en månad då dokumentationen äntligen hann ikapp ett år av ackumulerade händelser, och det är sammansättningen som spelar roll: kritiska poster för en skadlig code>.git/config/code> som kör angriparkod i sju kodningsagenter innan modellen ens kontaktas, för en Langflow-sårbarhet som utnyttjas i det vilda, för en kampanj med AI-agent-svärmar hos en leverantör av utskriftshantering och för en npm-mask som tar sig in i kedjan uppströms. Vid sidan av dem finns informativa poster om OWASP Agent Control Standard, ett EU-tal om tillståndet i unionen som nämnde agentrymningar, och en rapport från en FN-panel som behandlade en incident som en varning om förlorad kontroll.

De koreanska posterna, och vad ett regionfält inte betyder

Arkivets code>region/code>-fältet anger var en händelse faktiskt hamnade, inte var leverantören har sitt huvudkontor — gränsöverskridande leverantörsupplysningar registreras alltid som globala, vilket är varför 291 av 354 poster saknar en enskild landstagg. Två poster har KR-taggen, båda policyposter med A-klassad källa och ingen bekräftad skada: Sydkoreas borttagning av DeepSeek från inhemska appbutiker i april 2025, och det företagsövergripande förbudet mot OpenClaw som antogs av Naver, Kakao och Karrot i februari 2026.

Den återhållsamheten är avsiktlig. Ett regionantal på två är inte ett påstående att Korea har haft två AI-säkerhetshändelser. Det är ett påstående att två händelser inom tidsfönstret hamnade i Korea med en primärkälla som är tillräckligt stark för att registreras – och arkivet föredrar att publicera ett litet ärligt antal framför att fylla ut en landssida med händelser som inträffade för ett koreanskt företags kunder någon annanstans.

Så här läser du konfidensgraderna innan du citerar en

Tillförlitlighet handlar om källkvalitet, inte om allvarlighetsgrad, och betyget D betyder inte falskt — det betyder att parterna är oense och att man inte bör citera bara en sida. Betyg A innebär en primärkälla: leverantören, offret, brottsbekämpande myndigheter eller en officiell rapport. Betyg B innebär ett forskningslaboratorium eller ett större nyhetsmedium med verifierbara detaljer. Betyg C innebär endast andrahandsuppgifter. Betyg D innebär att fakta eller attribueringen är omtvistad. Vid 302 av 354 poster utgör betyg A 85 % av datamängden, vilket är ovanligt högt för incidentrapportering och är en direkt följd av regeln ”ingen källa, ingen post”.

De ärliga förbehållen är värda att uttrycka klart, eftersom arkivet anger dem. Två poster kvarstår i grad C och tre i grad D. Åttiofem poster har informativ allvarlighetsgrad eftersom de är poster för policyer eller hotrapporter som behålls för tidslinjens kontinuitet, inte incidenter. Repositoriet är tre veckor gammalt och har inga stjärnor, inga utgåvor och ingen extern granskning av sin egen metodik – det är en datauppsättning som publicerats öppet, inte en peer-review-granskad studie.

The Orca AI Incident Archive repository on GitHub, showing the README badges and the file tree

Varför detta är viktigare än ännu ett benchmark

I takt med att agenter får tillgång till webbläsare, skal, autentiseringsuppgifter, kodkörning och produktionsmiljöer slutar säkerhetsfrågan att handla om vad en modell är kapabel till och blir i stället vad som redan har gjorts med en. Benchmarks besvarar den första frågan väl och den andra inte alls. Ett arkiv över incidenter, graderat efter källkvalitet och filtrerat utifrån huruvida någon faktiskt kom till skada, är den enda typen av instrument som besvarar den andra — och det fungerar bara om posterna är spårbara, rättningsbara och fria att återanvända.

Det är vad som nu är öppet. Datauppsättningen finns på a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, den råa Markdown-filen, JSON- och CSV-exporterna och schemat finns i det a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">offentliga arkivet/a>, och rättelser går via postens revisionshistorik. Om du känner till en händelse som hör dit, är bidragsvägen en Markdown-fil och minst en källa. Ingen källa, ingen post.

The live Orca AI Incident Archive page at orcarouter.ai

OrcaRouter, som publicerar arkivet, driver en enda OpenAI-kompatibel endpoint över fler än 200 modeller utan påslag på leverantörspriser och med automatisk failover mellan dem – samma routningslager som gör det möjligt att rikta en agent mot en billigare modell för de enkla anropen och en starkare för de svåra, vilket är precis den arkitektur som de flesta av incidenterna ovan återfanns i.