
Das Orca AI Incident Archive: 354 echte Vorfälle mit KI-Agenten, jeder mit einem Beleg
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Ein Sicherheitsteam kann Ihnen genau sagen, wie gut ein Modell Prompt-Injection in einer Testumgebung widersteht. Was fast niemand sagen kann, ist, wie viele Organisationen im letzten Monat tatsächlich durch einen Agenten kompromittiert wurden, bei welchen dieser Vorfälle es ein bestätigtes Opfer gab und welche der in dem Bericht zitierten Zahlen vom Anbieter statt von einer Aufsichtsbehörde stammten. Diese Lücke – zwischen dem, was Modelle tun könnten, und dem, was bereits geschehen ist – ist die Lücke, die das a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> schließen sollte. Es ging am 23. September 2026 live und enthält mit Stand seines Datenstichtags vom 22. September 354 Datensätze aus 593 eindeutigen Quellen.
Hinweis zur Genauigkeit: Jede unten stehende Zahl stammt aus dem vom Archiv selbst veröffentlichten code>dist/stats.json/code> in Version 2026-09-22 sowie von der Live-Seite. Die Ankündigung zum Start am 23. September nannte 340 Datensätze, 548 Quellen und 126 mit bestätigtem Schaden; das waren die Zahlen zum Zeitpunkt der Veröffentlichung, und das Archiv wird fortlaufend aktualisiert, weshalb sich die beiden Sätze um etwa einen Tag bei der Erfassung unterscheiden. Wo das README des Archivs und seine Live-Seite während der Entwicklung bei einer Badge-Zahl voneinander abwichen, ist der Live-Seite und dem JSON-Export zu vertrauen.
Was das Archiv tatsächlich enthält
Es ist kein Newsfeed und auch keine CVE-Liste. Jeder Eintrag ist eine einzelne Markdown-Datei mit strukturiertem Frontmatter, abgelegt unter dem Monat, in dem das Ereignis stattgefunden hat, und jeder Eintrag enthält mindestens eine Quelle. Der Datensatz wird unter CC BY 4.0 veröffentlicht und in einem öffentlichen Repository gespiegelt, sodass das Ganze geklont, diffed und zitiert werden kann, statt Screenshots davon zu machen.
Das Abdeckungsfenster umfasst 22 Monate, von einem Vorläufer im Dezember 2024 bis zum 22. September 2026, und die Verteilung ist der interessante Teil. Die Schweregrade teilen sich auf in 45 kritisch, 139 hoch, 77 mittel, 8 niedrig und 85 informativ. Die Quellenkonfidenz teilt sich auf in 302 Grad A, 47 Grad B, 2 Grad C und 3 Grad D. Bestätigter realer Schaden ist für 127 Datensätze erfasst, für 142 ausdrücklich ausgeschlossen und für 85 auf null belassen.
Diese letzten drei Zahlen sind der Grund, warum es sich lohnt, das Archiv sorgfältig zu lesen statt es nur zu überfliegen. Eine Zahl von 354 Einträgen ist keine Zahl von 354 Vorfällen. Nur 138 davon sind überhaupt als Vorfall eingestuft; der Rest sind Offenlegungen von Schwachstellen, Forschungsdemonstrationen, Bedrohungsberichte und politische Vorstöße. Alle fünf zusammen zu zählen, ist genau der Weg, auf dem eine Schlagzeile schiefgeht, weshalb das Archiv sie getrennt hält und Sie filtern lässt.
Warum „ein Jailbreak ist kein Vorfall“ der springende Punkt ist
Die meisten Sammlungen von KI-Sicherheitsvorfällen verwischen einen Unterschied: Ein Agent, der tatsächlich Schaden verursacht hat, ist nicht dasselbe wie ein Forscher, der zeigt, dass er es könnte. Genau diese Gleichsetzung macht aus einer Konferenzdemo eine Schlagzeile über einen Sicherheitsvorfall, und genau sie zu verweigern ist das, worauf das Archiv ausgelegt ist.

Drei Felder tragen diese Last. code>real_harm/code> erfasst, ob ein Opfer bestätigt wurde. code>ai_involvement/code> erfasst, ob eine Primärquelle – der Anbieter, das Opfer, die Strafverfolgungsbehörden oder ein offizieller Bericht – die Rolle der KI bestätigt hat, wobei umstrittene Zuordnungen im Datensatz verbleiben, aber gekennzeichnet werden. code>kind/code> erfasst, um welche Art von Dokument es sich bei dem Eintrag handelt. Ein Eintrag ohne Quelle wird nicht aufgenommen. Ein Eintrag mit widersprüchlichen Belegen wird als umstritten markiert, statt in die Richtung aufgelöst zu werden, die sich besser liest. Wenn neue Belege eintreffen, wird der Eintrag aktualisiert und die Änderung in seiner Revisionshistorie festgehalten, statt stillschweigend überschrieben zu werden.
Das Archiv hat diese Regel auf sich selbst angewendet. Während seiner eigenen Verifizierungsrunden löschte es zwei Einträge, die sich nicht belegen ließen, korrigierte eine weithin wiederholte Behauptung darüber, wie schnell ein Eindringen verlief, und stufte die Vertrauensstufe eines dritten Eintrags herab, als sich herausstellte, dass die zugrunde liegenden Belege aus zweiter Hand stammten. Eine Incident-Datenbank, die noch nie etwas entfernt hat, ist eine Datenbank, die nicht überprüft wurde.
Die zwölf Angriffsflächen, nach denen es sortiert
Jeder Eintrag ist mit einem oder mehreren von zwölf Typen gekennzeichnet, und jeder Typ hat seine eigene monatliche Anzahl. Governance und Policy ist mit 65 Einträgen der größte Bereich, aber nur einer davon hat bestätigten Schaden – was die richtige Form für regulatorische Aktivität ist und irreführend, wenn man es als Vorfallzahl zitiert. Credential-Missbrauch folgt mit 55, davon 40 bestätigte Opfer, die höchste Schadensdichte im Set. Agent-as-a-weapon liegt bei 51 mit 28 bestätigten. Indirekte Prompt-Injection hat 45 Einträge, aber nur 5 mit bestätigtem Schaden, was die klarste Veranschaulichung der Kluft zwischen Fähigkeit und Konsequenz im gesamten Datensatz ist: Es ist die am besten untersuchte Angriffsklasse und eine der unproduktivsten in freier Wildbahn. Supply-Chain-Poisoning hat bei 36 Einträgen 27 bestätigte Opfer – das schlechteste Verhältnis auf dem Tableau.
September 2026 ist der Monat, der die Argumente liefert.
Allein im September 2026 gingen einundfünfzig Einträge ein, mehr als doppelt so viele wie in jedem vorherigen Monat des Zeitraums. Das ist kein plötzlicher Zusammenbruch der Sicherheit. Es ist ein Monat, in dem die Erfassung endlich mit einem Jahr angesammelter Ereignisse gleichzog, und auf die Zusammensetzung kommt es an: kritische Einträge für eine bösartige code>.git/config/code>, die Angreifercode in sieben Coding-Agenten ausführt, bevor das Modell überhaupt kontaktiert wird, für eine Langflow-Schwachstelle, die in freier Wildbahn ausgenutzt wird, für eine Schwarm-Kampagne von KI-Agenten bei einem Druckmanagement-Anbieter und für einen npm-Wurm, der vorgelagert in die Lieferkette eindringt. Daneben stehen informative Einträge zum OWASP Agent Control Standard, zu einer EU-Rede zur Lage der Union, in der Entweichungen von Agenten genannt wurden, und zu einem Kurzbericht eines UN-Gremiums, der einen Vorfall als Warnung vor einem Kontrollverlust behandelte.
Die koreanischen Einträge – und was ein Regionsfeld nicht bedeutet
Das Archivcode>region/code> Feld markiert, wo ein Ereignis tatsächlich verortet wurde, nicht wo der Anbieter seinen Hauptsitz hat — grenzüberschreitende Offenlegungen von Anbietern werden immer als global eingereicht, weshalb 291 von 354 Datensätzen kein Länderkürzel tragen. Zwei Datensätze tragen das KR-Kürzel, beides Policy-Einträge mit Quellen der Stufe A und ohne bestätigten Schaden: Südkoreas Entfernung von DeepSeek aus den inländischen App-Stores im April 2025 und das unternehmensweite Verbot von OpenClaw, das Naver, Kakao und Karrot im Februar 2026 verabschiedet haben.
Diese Zurückhaltung ist Absicht. Eine Regionsanzahl von zwei ist keine Behauptung, Korea habe zwei KI-Sicherheitsvorfälle erlebt. Sie ist die Behauptung, dass zwei Ereignisse im Zeitfenster in Korea gelandet sind, mit einer Primärquelle, die stark genug ist, um erfasst zu werden — und das Archiv veröffentlicht lieber eine kleine, ehrliche Zahl, als eine Länderseite mit Ereignissen aufzublähen, die sich bei den Kunden eines koreanischen Unternehmens irgendwo sonst zugetragen haben.
So lesen Sie die Vertrauensstufen, bevor Sie eine zitieren
Vertrauen bezieht sich auf Quellenqualität, nicht auf Schweregrad, und eine Bewertung mit D bedeutet nicht falsch – sie bedeutet, dass die Parteien sich widersprechen und man nicht nur eine Seite allein zitieren sollte. Note A bedeutet eine Primärquelle: den Anbieter, das Opfer, Strafverfolgungsbehörden oder einen offiziellen Bericht. Note B bedeutet ein Forschungslabor oder ein großes Medienhaus mit nachprüfbaren Details. Note C bedeutet ausschließlich aus zweiter Hand. Note D bedeutet, dass die Fakten oder die Zuordnung umstritten sind. Bei 302 von 354 Datensätzen macht Note A 85 % des Datensatzes aus, was für die Vorfallberichterstattung ungewöhnlich hoch ist und direkt das Ergebnis der Regel „keine Quelle, kein Eintrag“ ist.
Die ehrlichen Einschränkungen sollten klar ausgesprochen werden, denn das Archiv nennt sie. Zwei Datensätze verbleiben in Grad C und drei in Grad D. Fünfundachtzig Datensätze tragen den Schweregrad „informativ“, weil es sich um Richtlinien- oder Bedrohungsberichtseinträge handelt, die zur Wahrung der Zeitachsenkontinuität beibehalten werden, nicht um Vorfälle. Das Repository ist drei Wochen alt und hat keine Stars, keine Releases und keine externe Prüfung seiner eigenen Methodik – es ist ein offen veröffentlichter Datensatz, keine peer-reviewte Studie.

Warum das wichtiger ist als ein weiterer Benchmark
Während Agenten Browser, Shells, Zugangsdaten, Codeausführung und Produktionszugriff erhalten, ist die Sicherheitsfrage nicht mehr, wozu ein Modell fähig ist, sondern was mit einem bereits getan wurde. Benchmarks beantworten die erste Frage gut und die zweite überhaupt nicht. Ein Archiv von Vorfällen, nach Quellenqualität bewertet und danach gefiltert, ob tatsächlich jemand zu Schaden kam, ist die einzige Art von Instrument, das die zweite beantwortet – und es funktioniert nur, wenn die Einträge nachvollziehbar, korrigierbar und frei wiederverwendbar sind.
Das ist jetzt offen. Der Datensatz befindet sich unter a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, das rohe Markdown, die JSON- und CSV-Exporte und das Schema sind im a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">öffentlichen Repository/a>, und Korrekturen laufen über die Revisionshistorie des Eintrags. Wenn Sie ein Ereignis kennen, das hineingehört, besteht der Beitragsweg aus einer Markdown-Datei und mindestens einer Quelle. Keine Quelle, kein Eintrag.

OrcaRouter, der das Archiv veröffentlicht, betreibt einen einzigen OpenAI-kompatiblen Endpunkt über mehr als 200 Modelle hinweg – ohne Aufschlag auf die Anbieterpreise und mit automatischem Failover zwischen ihnen – dieselbe Routing-Schicht, die es ermöglicht, einen Agenten für die einfachen Aufrufe auf ein günstigeres Modell und für die schwierigen auf ein stärkeres zu lenken, was genau die Architektur ist, in der die meisten der oben genannten Vorfälle gefunden wurden.
