
L'Archivio degli Incidenti di Orca AI: 354 incidenti reali di agenti AI, ognuno con una ricevuta
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Un team di sicurezza può dirti con precisione quanto bene un modello resiste al prompt injection all'interno di un ambiente di test. Ciò che quasi nessuno può dirti è quante organizzazioni siano state effettivamente violate da un agente il mese scorso, quali di quelle violazioni abbiano avuto una vittima confermata e quali dei numeri citati nel rapporto provengano dal fornitore anziché da un'autorità di regolamentazione. Quel divario — tra ciò che i modelli potrebbero fare e ciò che è già accaduto — è il divario che a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> è stato creato per colmare. È entrato in funzione il 23 settembre 2026 e, alla sua estrazione dati del 22 settembre, contiene 354 record tratti da 593 fonti uniche.
Nota sull'accuratezza: ogni dato riportato di seguito è letto dal file pubblicato dall'archivio stesso code>dist/stats.json/code> alla versione 2026-09-22 e dalla pagina live. L'annuncio di lancio del 23 settembre citava 340 record, 548 fonti e 126 con danno confermato; quelli erano i dati al momento della pubblicazione, e l'archivio viene aggiornato di continuo, quindi i due insiemi differiscono di circa un giorno di acquisizione. Dove il README dell'archivio e la sua pagina live sono in disaccordo su un numero di badge durante lo sviluppo, le fonti di cui fidarsi sono la pagina live e l'esportazione JSON.
Che cosa contiene effettivamente l'archivio
Non è un feed di notizie e non è una lista di CVE. Ogni voce è un singolo file Markdown con frontmatter strutturato, archiviato sotto il mese in cui l'evento è avvenuto, e ogni voce contiene almeno una fonte. Il dataset è pubblicato sotto CC BY 4.0 e mirrorato in un repository pubblico, quindi l'intero contenuto può essere clonato, confrontato e citato anziché screenshottato.
La finestra di copertura copre 22 mesi, da un precursore di dicembre 2024 fino al 22 settembre 2026, e la distribuzione è la parte interessante. La severità si suddivide in 45 critiche, 139 alte, 77 medie, 8 basse e 85 informative. L'attendibilità della fonte si suddivide in 302 di grado A, 47 di grado B, 2 di grado C e 3 di grado D. Il danno reale confermato è registrato per 127 record, esplicitamente escluso per 142 e lasciato nullo per 85.
Quegli ultimi tre numeri sono il motivo per cui vale la pena leggere l'archivio con attenzione invece che scorrerlo superficialmente. Un conteggio di 354 record non è un conteggio di 354 incidenti. Solo 138 di essi sono classificati come incidenti veri e propri; il resto sono divulgazioni di vulnerabilità, dimostrazioni di ricerca, rapporti sulle minacce e mosse politiche. Contare tutti e cinque insieme è esattamente il modo in cui si arriva a un numero da prima pagina sbagliato, ed è per questo che l'archivio li tiene separati e ti permette di filtrare.
Perché "un jailbreak non è un incidente" è il punto centrale
La maggior parte delle raccolte di eventi di sicurezza IA appiattisce una distinzione: un agente che ha effettivamente causato danni non è la stessa cosa di un ricercatore che dimostra che avrebbe potuto farlo. È proprio quella singola equiparazione che trasforma una demo da conferenza in un titolo di violazione, ed è ciò che l'archivio è progettato per rifiutare.

Tre campi portano quel peso. code>real_harm/code> registra se una vittima è stata confermata. code>ai_involvement/code> registra se una fonte primaria — il fornitore, la vittima, le forze dell'ordine o un rapporto ufficiale — ha confermato il ruolo dell'IA, con attribuzioni contestate mantenute nel set di dati ma etichettate. code>kind/code> registra che tipo di documento è la voce. Una voce senza fonte non entra. Una voce con prove contrastanti è contrassegnata come contestata anziché risolta nella direzione che si legge meglio. Quando arrivano nuove prove, la voce viene aggiornata e la modifica viene scritta nella sua cronologia delle revisioni anziché sovrascritta silenziosamente.
L'archivio ha applicato quella regola a se stesso. Durante i propri cicli di verifica ha eliminato due voci che non potevano essere comprovate, corretto un'affermazione ampiamente ripetuta sulla rapidità con cui è progredita un'intrusione e declassato il grado di affidabilità di una terza voce quando le prove alla base si sono rivelate di seconda mano. Un database di incidenti che non ha mai rimosso nulla è un database che non è stato controllato.
Le dodici superfici di attacco in base alle quali ordina
Ogni record è etichettato con uno o più di dodici tipi, e ciascun tipo porta il proprio conteggio mese per mese. Governance e policy è il gruppo più numeroso con 65 record, ma solo uno di questi ha un danno confermato — che è la forma corretta per l'attività normativa e fuorviante da citare come conteggio di incidenti. L'abuso di credenziali segue a 55, con 40 vittime confermate, la più alta densità di danno del set. Agent-as-a-weapon si colloca a 51 con 28 confermati. L'iniezione indiretta di prompt ha 45 record ma solo 5 con danno confermato, che è l'illustrazione più chiara della scissione tra capacità e conseguenze nell'intero dataset: è la classe di attacco più studiata e una delle meno produttive sul campo. L'avvelenamento della supply chain, a 36 record, ha 27 vittime confermate — il rapporto peggiore della tabella.
Settembre 2026 è il mese che dimostra la tesi
Cinquantuno record sono arrivati solo a settembre 2026, più del doppio di qualsiasi mese precedente nel periodo. Non è un improvviso crollo della sicurezza. È un mese in cui la tenuta dei registri ha finalmente recuperato il ritardo su un anno di eventi accumulati, e la composizione è ciò che conta: voci critiche per un malevolo code>.git/config/code> che esegue codice dell'attaccante in sette agenti di programmazione prima che il modello venga mai contattato, per una falla di Langflow sfruttata in attacchi reali, per una campagna di sciame di agenti AI presso un fornitore di gestione della stampa, e per un worm npm che si inserisce nella catena a monte. Accanto a queste ci sono voci informative sull'OWASP Agent Control Standard, un discorso sullo Stato dell'Unione dell'UE che ha citato fughe di agenti, e un briefing di un panel delle Nazioni Unite che ha trattato un incidente come un monito sulla perdita di controllo.
Le voci coreane, e cosa non significa un campo regione
Il campo code>region/code> dell'archivio indica dove un evento si è effettivamente verificato, non dove ha sede il fornitore: le informative sui fornitori transfrontalieri vengono sempre archiviate come globali, ed è per questo che 291 dei 354 record non riportano alcun tag di singolo paese. Due record riportano il tag KR, entrambi voci di policy con fonti di grado A e nessun danno confermato: la rimozione di DeepSeek dagli app store nazionali da parte della Corea del Sud nell'aprile 2025, e il divieto aziendale di OpenClaw adottato da Naver, Kakao e Karrot nel febbraio 2026.
Quella moderazione è intenzionale. Un conteggio regionale pari a due non è un'affermazione che la Corea abbia avuto due eventi di sicurezza legati all'IA. È un'affermazione che due eventi nella finestra sono ricaduti in Corea con una fonte primaria abbastanza solida da poter essere registrata — e l'archivio preferirebbe pubblicare un piccolo numero onesto piuttosto che gonfiare la pagina di un paese con eventi accaduti ai clienti di un'azienda coreana da qualche altra parte.
Come leggere i livelli di confidenza prima di citarne uno
L'affidabilità riguarda la qualità della fonte, non la gravità, e un grado D non significa falso — significa che le parti sono in disaccordo e non si dovrebbe citare una sola parte. Il grado A indica una fonte primaria: il fornitore, la vittima, le forze dell'ordine o un rapporto ufficiale. Il grado B indica un laboratorio di ricerca o un grande media con dettagli verificabili. Il grado C indica solo fonti di seconda mano. Il grado D indica che i fatti o l'attribuzione sono contestati. Con 302 record su 354, il grado A costituisce l'85% del set di dati, una percentuale insolitamente alta per la segnalazione di incidenti ed è il risultato diretto della regola "nessuna fonte, nessuna voce".
Vale la pena dichiarare apertamente le oneste avvertenze, perché l'archivio le riporta. Due record restano di grado C e tre di grado D. Ottantacinque record hanno severità informativa perché sono voci di policy o di rapporti sulle minacce mantenute per la continuità della timeline, non incidenti. Il repository ha tre settimane e non ha stelle, né release, né un audit esterno della propria metodologia — è un dataset pubblicato apertamente, non uno studio sottoposto a peer review.

Perché questo conta più di un altro benchmark
Man mano che gli agenti acquisiscono browser, shell, credenziali, esecuzione di codice e accesso alla produzione, la questione della sicurezza smette di essere ciò di cui un modello è capace e diventa ciò che è già stato fatto con uno. I benchmark rispondono bene alla prima domanda e per nulla alla seconda. Un archivio di incidenti, classificato in base alla qualità della fonte e filtrato a seconda che qualcuno sia stato effettivamente danneggiato, è l'unico tipo di strumento che risponde alla seconda — e funziona solo se le voci sono tracciabili, correggibili e liberamente riutilizzabili.
Questo è ciò che ora è aperto. Il dataset si trova su a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, il Markdown grezzo, le esportazioni JSON e CSV e lo schema sono nel a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">repository pubblico/a>, e le correzioni passano attraverso la cronologia delle revisioni del record. Se conosci un evento che dovrebbe farne parte, il percorso di contribuzione è un file Markdown e almeno una fonte. Nessuna fonte, nessuna voce.

OrcaRouter, che pubblica l'archivio, gestisce un unico endpoint compatibile con OpenAI su più di 200 modelli, senza ricarichi sui prezzi dei provider e con failover automatico tra di essi — lo stesso livello di routing che permette di indirizzare un agente verso un modello più economico per le chiamate facili e uno più potente per quelle difficili, che è esattamente l'architettura in cui è stata riscontrata la maggior parte degli incidenti sopra.
