Hero: een dashboardkaart met 354 records · 593 bronnen, met ernstchips en een staafdiagram van 22 maanden
Guides & Insights

Het Orca AI Incidentenarchief: 354 echte AI-agent-incidenten, elk met een bewijs

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een beveiligingsteam kan je precies vertellen hoe goed een model bestand is tegen prompt-injectie binnen een testomgeving. Wat bijna niemand je kan vertellen, is hoeveel organisaties vorige maand daadwerkelijk door een agent zijn gecompromitteerd, welke van die inbreuken een bevestigd slachtoffer hadden, en welke van de cijfers die in het verslag worden genoemd, afkomstig waren van de leverancier in plaats van van een toezichthouder. Die kloof — tussen wat modellen zouden kunnen doen en wat al is gebeurd — is de kloof die het a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> is gebouwd om te dichten. Het ging live op 23 september 2026 en bevat, met de gegevensafsluiting van 22 september, 354 records uit 593 unieke bronnen.

Nauwkeurigheidsopmerking: elk cijfer hieronder is afkomstig uit het eigen gepubliceerde code>dist/stats.json/code> op versie 2026-09-22 en van de livepagina. De aankondiging van de lancering op 23 september vermeldde 340 records, 548 bronnen en 126 met bevestigde schade; dat waren de cijfers op het moment van plaatsing, en het archief wordt continu bijgewerkt, dus de twee sets verschillen ongeveer een dag aan invoer. Waar de README van het archief en de livepagina het tijdens de ontwikkeling oneens waren over een getal op een badge, zijn het de livepagina en de JSON-export die je moet vertrouwen.

Wat het archief daadwerkelijk bevat

Het is geen nieuwsfeed en het is geen CVE-lijst. Elke vermelding is één Markdown-bestand met gestructureerde frontmatter, opgeslagen onder de maand waarin de gebeurtenis plaatsvond, en elke vermelding bevat ten minste één bron. De dataset is gepubliceerd onder CC BY 4.0 en gespiegeld in een openbare repository, zodat het geheel kan worden gekloond, gediffd en geciteerd in plaats van er screenshots van te maken.

Het dekkingsvenster beslaat 22 maanden, van een voorloper in december 2024 tot en met 22 september 2026, en de verdeling is het interessante deel. De ernst valt uiteen in 45 kritiek, 139 hoog, 77 middel, 8 laag en 85 informatief. De bronbetrouwbaarheid valt uiteen in 302 graad A, 47 graad B, 2 graad C en 3 graad D. Bevestigde schade in de praktijk is geregistreerd voor 127 records, expliciet uitgesloten voor 142, en op null gelaten voor 85.

Die laatste drie getallen zijn de reden dat het archief het waard is om zorgvuldig te lezen in plaats van snel door te bladeren. Een telling van 354 records is geen telling van 354 incidenten. Slechts 138 ervan worden überhaupt als incident geclassificeerd; de rest zijn bekendmakingen van kwetsbaarheden, onderzoeksdemonstraties, dreigingsrapporten en beleidsstappen. Alle vijf samen meetellen is precies hoe een getal in een krantenkop misleidend wordt, en daarom houdt het archief ze apart en kun je filteren.

Waarom "een jailbreak is geen incident" het hele punt is

De meeste verzamelingen van AI-beveiligingsincidenten maken één onderscheid niet: een agent die daadwerkelijk schade heeft veroorzaakt is niet hetzelfde als een onderzoeker die aantoont dat het zou kunnen. Die ene gelijkstelling is wat van een conferentiedemo een krantenkop over een datalek maakt, en het is precies wat het archief gebouwd is om te weigeren.

A diagram splitting CAPABILITY, what a model might do, from CONSEQUENCE, what actually happened, with EVIDENCE on the divider

Drie velden dragen dat gewicht. code>real_harm/code> registreert of een slachtoffer bevestigd werd. code>ai_involvement/code> registreert of een primaire bron — de leverancier, het slachtoffer, wetshandhaving of een officieel rapport — de rol van de AI bevestigde, waarbij betwiste toeschrijvingen in de dataset behouden maar gelabeld blijven. code>kind/code> registreert wat voor soort document de vermelding is. Een vermelding zonder bron wordt niet opgenomen. Een vermelding met tegenstrijdig bewijs wordt als betwist gemarkeerd in plaats van te worden opgelost in de richting die beter leest. Wanneer er nieuw bewijs binnenkomt, wordt de vermelding bijgewerkt en wordt de wijziging in de revisiegeschiedenis vastgelegd in plaats van stilzwijgend overschreven.

Het archief heeft die regel op zichzelf toegepast. Tijdens zijn eigen verificatierondes heeft het twee vermeldingen verwijderd die niet konden worden onderbouwd, een veelvuldig herhaalde bewering gecorrigeerd over hoe snel een inbraak zich ontwikkelde, en de betrouwbaarheidsgraad van een derde vermelding verlaagd toen het onderliggende bewijs tweedehands bleek te zijn. Een incidentendatabase die nooit iets heeft verwijderd, is een database die niet is gecontroleerd.

De twaalf aanvalsoppervlakken waarop het sorteert

Elke record is getagd met een of meer van twaalf typen, en elk type heeft zijn eigen maandelijkse telling. Governance en beleid is de grootste categorie met 65 records, maar slechts één daarvan heeft bevestigde schade — wat de juiste vorm is voor regelgevende activiteit en misleidend is om als incidentenaantal te noemen. Misbruik van inloggegevens volgt met 55, met 40 bevestigde slachtoffers, de hoogste schadedichtheid in de set. Agent-als-wapen staat op 51 met 28 bevestigde. Indirecte promptinjectie heeft 45 records maar slechts 5 met bevestigde schade, wat de duidelijkste illustratie is van de kloof tussen capaciteit en gevolg in de hele dataset: het is de best bestudeerde aanvalsklasse en een van de minst productieve in het wild. Supply-chainvergiftiging, met 36 records, heeft 27 bevestigde slachtoffers — de slechtste verhouding op het overzicht.

September 2026 is de maand die het bewijs levert

Alleen al in september 2026 kwamen er eenenvijftig registraties binnen, meer dan het dubbele van elke andere maand in het venster. Dat is geen plotselinge instorting van de beveiliging. Het is een maand waarin de registratie eindelijk een jaar aan opgebouwde gebeurtenissen heeft ingehaald, en de samenstelling is wat telt: kritieke vermeldingen voor een kwaadaardige code>.git/config/code> die aanvallerscode uitvoert in zeven coding agents voordat er ooit contact met het model wordt opgenomen, voor een Langflow-kwetsbaarheid die in het wild wordt misbruikt, voor een AI-agent-swarmcampagne bij een leverancier van printbeheer, en voor een npm-worm die upstream in de keten terechtkomt. Daarnaast staan er informatieve vermeldingen over de OWASP Agent Control Standard, een EU-Staat-van-de-Unie-toespraak waarin agent-ontsnappingen werden genoemd, en een briefing van een VN-panel dat één incident behandelde als een waarschuwing voor verlies van controle.

De Koreaanse vermeldingen, en wat een regio-veld niet betekent

Het archief z'n code>region/code>-veld markeert waar een gebeurtenis daadwerkelijk plaatsvond, niet waar de leverancier is gevestigd — grensoverschrijdende openbaarmakingen van leveranciers worden altijd als wereldwijd geregistreerd, daarom hebben 291 van de 354 records geen tag voor één enkel land. Twee records hebben de KR-tag, beide beleidsvermeldingen met grade A-bronvermelding en geen bevestigde schade: de verwijdering van DeepSeek uit Zuid-Koreaanse appstores in april 2025, en het bedrijfsbrede verbod op OpenClaw dat Naver, Kakao en Karrot in februari 2026 hebben ingevoerd.

Die terughoudendheid is bewust. Een regiogetal van twee is geen bewering dat Korea twee AI-beveiligingsincidenten heeft gehad. Het is een bewering dat twee incidenten in het venster in Korea zijn geland met een primaire bron die sterk genoeg was om te registreren — en het archief publiceert liever een klein, eerlijk aantal dan een landpagina op te vullen met incidenten die klanten van een Koreaans bedrijf ergens anders zijn overkomen.

Hoe je de betrouwbaarheidsgraden leest voordat je er een citeert

Betrouwbaarheid gaat over bronkwaliteit, niet over ernst, en een beoordeling D betekent niet onwaar — het betekent dat de partijen het oneens zijn en dat je niet één kant alleen moet citeren. Graad A betekent een primaire bron: de leverancier, het slachtoffer, rechtshandhaving of een officieel rapport. Graad B betekent een onderzoekslab of een vooraanstaand medium met controleerbare details. Graad C betekent uitsluitend uit de tweede hand. Graad D betekent dat de feiten of de toeschrijving betwist worden. Met 302 van de 354 records vormt graad A 85% van de dataset, wat ongewoon hoog is voor incidentrapportage en het directe gevolg is van de regel geen bron, geen vermelding.

De eerlijke kanttekeningen verdienen het ronduit te worden vermeld, omdat het archief ze zelf vermeldt. Twee records blijven graad C en drie graad D. Vijfentachtig records hebben een informatief ernstniveau omdat het beleids- of dreigingsrapportvermeldingen zijn die voor tijdlijncontinuïteit zijn bewaard, geen incidenten. De repository is drie weken oud en heeft geen sterren, geen releases en geen externe audit van zijn eigen methodologie — het is een dataset die openbaar is gepubliceerd, geen peer-reviewed studie.

The Orca AI Incident Archive repository on GitHub, showing the README badges and the file tree

Waarom dit meer uitmaakt dan nog een benchmark

Zodra agenten browsers, shells, inloggegevens, code-uitvoering en productietoegang krijgen, is de veiligheidsvraag niet langer waartoe een model in staat is, maar wat er al met een model is gedaan. Benchmarks beantwoorden de eerste vraag goed en de tweede helemaal niet. Een archief van incidenten, beoordeeld op bronkwaliteit en gefilterd op of iemand daadwerkelijk schade heeft ondervonden, is het enige soort instrument dat de tweede beantwoordt — en het werkt alleen als de vermeldingen traceerbaar, corrigeerbaar en vrij te hergebruiken zijn.

Dat is wat nu open is. De dataset staat op a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, de ruwe Markdown, de JSON- en CSV-exports en het schema staan in de a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">openbare repository/a>, en correcties verlopen via de revisiegeschiedenis van het record. Als je een gebeurtenis kent die erin thuishoort, is het bijdragepad één Markdown-bestand en ten minste één bron. Geen bron, geen vermelding.

The live Orca AI Incident Archive page at orcarouter.ai

OrcaRouter, dat het archief publiceert, draait één OpenAI-compatibel endpoint voor meer dan 200 modellen, zonder opslag op providerprijzen en met automatische failover ertussen — dezelfde routeringslaag die het mogelijk maakt om een agent op een goedkoper model te richten voor de eenvoudige aanroepen en op een sterker model voor de moeilijke, wat precies de architectuur is waarin de meeste van de bovenstaande incidenten werden aangetroffen.