
El archivo de incidentes de Orca AI: 354 incidentes reales de agentes de IA, cada uno con un recibo
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Un equipo de seguridad puede decirte con precisión qué tan bien resiste un modelo la inyección de prompts dentro de un entorno de pruebas. Lo que casi nadie puede decirte es cuántas organizaciones fueron realmente vulneradas por un agente el mes pasado, cuáles de esas brechas tuvieron una víctima confirmada y cuáles de las cifras citadas en el informe provinieron del proveedor y no de un regulador. Esa brecha —entre lo que los modelos podrían hacer y lo que ya ha sucedido— es la brecha que el a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> fue creado para cerrar. Entró en funcionamiento el 23 de septiembre de 2026 y, según su corte de datos del 22 de septiembre, contiene 354 registros extraídos de 593 fuentes únicas.
Nota de precisión: cada cifra a continuación se lee del propio code>dist/stats.json/code> publicado por el archivo en la versión 2026-09-22 y de la página en vivo. El anuncio de lanzamiento del 23 de septiembre citaba 340 registros, 548 fuentes y 126 con daños confirmados; esas eran las cifras en el momento de la publicación, y el archivo se actualiza continuamente, por lo que los dos conjuntos difieren en aproximadamente un día de ingesta. Donde el README del archivo y su página en vivo no han coincidido en el número de una insignia durante el desarrollo, la página en vivo y la exportación JSON son las que merecen confianza.
Lo que el archivo contiene realmente
No es un feed de noticias ni una lista de CVE. Cada entrada es un único archivo Markdown con frontmatter estructurado, archivado bajo el mes en que ocurrió el evento, y cada entrada incluye al menos una fuente. El conjunto de datos se publica bajo CC BY 4.0 y se replica en un repositorio público, por lo que todo puede clonarse, compararse y citarse en lugar de capturarse en pantalla.
La ventana de cobertura abarca 22 meses, desde un precursor de diciembre de 2024 hasta el 22 de septiembre de 2026, y la distribución es la parte interesante. La gravedad se divide en 45 críticas, 139 altas, 77 medias, 8 bajas y 85 informativas. La confianza de la fuente se divide en 302 de grado A, 47 de grado B, 2 de grado C y 3 de grado D. Se registra daño confirmado en el mundo real en 127 registros, se descarta explícitamente en 142 y se deja nulo en 85.
Esos tres últimos números son la razón por la que merece la pena leer el archivo con atención en lugar de hojearlo por encima. Un recuento de 354 registros no es un recuento de 354 incidentes. Solo 138 de ellos se clasifican como incidente; el resto son divulgaciones de vulnerabilidades, demostraciones de investigación, informes de amenazas y movimientos políticos. Sumar los cinco juntos es exactamente como se llega a una cifra errónea en un titular, y por eso el archivo los mantiene separados y te permite filtrarlos.
Por qué «un jailbreak no es un incidente» es precisamente la cuestión
La mayoría de las colecciones de eventos de seguridad de IA pasan por alto una distinción: un agente que realmente causó daño no es lo mismo que un investigador que demuestra que podría hacerlo. Esa única confusión es la que convierte una demo de conferencia en un titular de brecha, y es lo que el archivo está diseñado para rechazar.

Tres campos soportan ese peso. code>real_harm/code> registra si se confirmó una víctima. code>ai_involvement/code> registra si una fuente primaria —el proveedor, la víctima, las fuerzas del orden o un informe oficial— confirmó el papel de la IA, y las atribuciones en disputa se mantienen en el conjunto de datos pero etiquetadas. code>kind/code> registra qué tipo de documento es la entrada. Un registro sin fuente no entra. Un registro con pruebas contradictorias se marca como disputado en lugar de resolverse en la dirección que se lea mejor. Cuando llegan nuevas pruebas, el registro se actualiza y el cambio se escribe en su historial de revisiones en lugar de sobrescribirse silenciosamente.
El archivo ha aplicado esa regla a sí mismo. Durante sus propias rondas de verificación eliminó dos entradas que no pudieron corroborarse, corrigió una afirmación ampliamente repetida sobre la rapidez con que progresó una intrusión y rebajó la calificación de confianza de una tercera entrada cuando las pruebas subyacentes resultaron ser de segunda mano. Una base de datos de incidentes que nunca ha eliminado nada es una base de datos que no se ha revisado.
Las doce superficies de ataque por las que ordena
Cada registro está etiquetado con uno o más de doce tipos, y cada tipo tiene su propio recuento mes a mes. Gobernanza y políticas es el grupo más grande, con 65 registros, pero solo uno de ellos tiene daño confirmado —lo cual es la forma correcta que tiene la actividad regulatoria y una forma engañosa de citarla como recuento de incidentes—. El abuso de credenciales le sigue con 55, con 40 víctimas confirmadas, la mayor densidad de daño del conjunto. El agente como arma se sitúa en 51 con 28 confirmados. La inyección indirecta de prompts tiene 45 registros, pero solo 5 con daño confirmado, lo que constituye la ilustración más clara de la división entre capacidad y consecuencia de todo el conjunto de datos: es la clase de ataque más estudiada y una de las menos productivas en el mundo real. El envenenamiento de la cadena de suministro, con 36 registros, tiene 27 víctimas confirmadas: la peor proporción del tablero.
Septiembre de 2026 es el mes que lo demuestra.
Solo en septiembre de 2026 se añadieron cincuenta y un registros, más del doble que en cualquier mes anterior del periodo. Eso no es un colapso repentino de la seguridad. Es un mes en el que el registro por fin se puso al día con un año de eventos acumulados, y lo que importa es la composición: entradas críticas por un code>.git/config/code> malicioso que ejecuta código del atacante en siete agentes de programación antes de que se llegue a contactar con el modelo, por una vulnerabilidad de Langflow explotada en el mundo real, por una campaña de enjambre de agentes de IA en un proveedor de gestión de impresión y por un gusano de npm que entra en la cadena aguas arriba. Junto a ellas figuran entradas informativas sobre el Estándar de Control de Agentes de OWASP, un discurso sobre el Estado de la Unión de la UE que mencionó fugas de agentes y un informe de un panel de las Naciones Unidas que trató un incidente como una advertencia de pérdida de control.
Las entradas coreanas, y lo que un campo de región no significa
El campo code>region/code> del archivo indica dónde recayó realmente un evento, no dónde tiene su sede el proveedor — las divulgaciones de proveedores transfronterizas siempre se presentan como globales, y por eso 291 de 354 registros no llevan etiqueta de un solo país. Dos registros llevan la etiqueta KR, ambos entradas de política con fuentes de grado A y sin daños confirmados: la retirada de DeepSeek de las tiendas de aplicaciones nacionales por parte de Corea del Sur en abril de 2025, y la prohibición para toda la empresa de OpenClaw adoptada por Naver, Kakao y Karrot en febrero de 2026.
Esa moderación es deliberada. Un recuento regional de dos no es una afirmación de que Corea haya tenido dos incidentes de seguridad de IA. Es una afirmación de que dos incidentes dentro de la ventana temporal se registraron en Corea con una fuente primaria lo suficientemente sólida como para documentarlos, y el archivo prefiere publicar un número pequeño y honesto antes que rellenar la página de un país con incidentes que les ocurrieron a los clientes de una empresa coreana en otro lugar.
Cómo interpretar los grados de confianza antes de citar uno
La confianza se refiere a la calidad de la fuente, no a la gravedad, y un grado D no significa falso — significa que las partes discrepan y que no se debe citar a una sola de ellas. El grado A significa una fuente primaria: el proveedor, la víctima, las autoridades o un informe oficial. El grado B significa un laboratorio de investigación o un medio importante con detalles verificables. El grado C significa únicamente de segunda mano. El grado D significa que los hechos o la atribución están en disputa. Con 302 de 354 registros, el grado A representa el 85 % del conjunto de datos, lo cual es inusualmente alto para el reporte de incidentes y es el resultado directo de la regla de sin fuente no hay entrada.
Las salvedades honestas merecen exponerse sin rodeos, porque el archivo las declara. Dos registros siguen siendo de grado C y tres, de grado D. Ochenta y cinco registros tienen severidad informativa porque son entradas de políticas o informes de amenazas conservadas para mantener la continuidad cronológica, no incidentes. El repositorio tiene tres semanas de antigüedad y no tiene estrellas, ni versiones, ni una auditoría externa de su propia metodología; es un conjunto de datos publicado abiertamente, no un estudio revisado por pares.

Por qué esto importa más que otro benchmark
A medida que los agentes adquieren navegadores, shells, credenciales, ejecución de código y acceso a producción, la pregunta de seguridad deja de ser de qué es capaz un modelo y pasa a ser qué se ha hecho ya con uno. Los benchmarks responden bien a la primera pregunta y no responden en absoluto a la segunda. Un archivo de incidentes, clasificado por la calidad de las fuentes y filtrado según si alguien resultó realmente perjudicado, es el único tipo de instrumento que responde a la segunda — y solo funciona si las entradas son rastreables, corregibles y de uso libre.
Eso es lo que ahora está abierto. El conjunto de datos está en a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, el Markdown sin procesar, las exportaciones JSON y CSV y el esquema están en el a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">repositorio público/a>, y las correcciones se gestionan a través del historial de revisiones del registro. Si conoces un evento que deba formar parte de él, la vía de contribución es un archivo Markdown y al menos una fuente. Sin fuente, no hay entrada.

OrcaRouter, que publica el archivo, ofrece un único endpoint compatible con OpenAI para más de 200 modelos, sin recargo sobre los precios de los proveedores y con conmutación por error automática entre ellos —la misma capa de enrutamiento que hace posible dirigir un agente a un modelo más barato para las llamadas fáciles y a uno más potente para las difíciles, que es exactamente la arquitectura en la que se encontraron la mayoría de los incidentes anteriores.
