
Arsip Insiden Orca AI: 354 Insiden Agen AI Nyata, Masing-Masing dengan Bukti
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Tim keamanan dapat memberi tahu Anda secara tepat seberapa baik sebuah model menahan prompt injection di dalam test harness. Yang hampir tidak dapat diberitahukan oleh siapa pun kepada Anda adalah berapa banyak organisasi yang benar-benar diretas oleh agen bulan lalu, pelanggaran mana di antaranya yang memiliki korban terkonfirmasi, dan angka mana yang dikutip dalam laporan berasal dari vendor alih-alih dari regulator. Kesenjangan itu — antara apa yang mungkin dilakukan model dan apa yang sudah terjadi — adalah kesenjangan yang a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> dibangun untuk menutupnya. Arsip ini mulai aktif pada 23 September 2026 dan, per pemotongan data 22 September, memuat 354 catatan yang diambil dari 593 sumber unik.
Catatan akurasi: setiap angka di bawah ini dibaca dari code>dist/stats.json terbitan arsip itu sendiri pada versi 2026-09-22 dan dari halaman live. Pengumuman peluncuran pada 23 September menyebutkan 340 catatan, 548 sumber, dan 126 dengan kerugian yang terkonfirmasi; itu adalah angka pada saat dipublikasikan, dan arsip diperbarui secara terus-menerus, sehingga kedua kumpulan angka tersebut berbeda sekitar satu hari penambahan data. Jika README arsip dan halaman live-nya pernah berbeda mengenai angka lencana selama pengembangan, halaman live dan ekspor JSON-lah yang dapat dipercaya.
Apa yang sebenarnya terkandung dalam arsip itu
Ini bukan feed berita dan bukan daftar CVE. Setiap entri adalah satu file Markdown dengan frontmatter terstruktur, diarsipkan berdasarkan bulan terjadinya peristiwa, dan setiap entri memuat setidaknya satu sumber. Dataset ini diterbitkan di bawah CC BY 4.0 dan dicerminkan di repositori publik, sehingga keseluruhannya dapat dikloning, di-diff, dan dikutip alih-alih hanya berupa tangkapan layar.
Jendela cakupan berlangsung selama 22 bulan, dari prekursor Desember 2024 hingga 22 September 2026, dan distribusinya adalah bagian yang menarik. Tingkat keparahan terbagi menjadi 45 kritis, 139 tinggi, 77 sedang, 8 rendah, dan 85 informasional. Keyakinan sumber terbagi menjadi 302 kelas A, 47 kelas B, 2 kelas C, dan 3 kelas D. Kerugian dunia nyata yang terkonfirmasi tercatat pada 127 catatan, secara eksplisit dikesampingkan pada 142, dan dibiarkan null pada 85.
Tiga angka terakhir itulah alasan arsip ini layak dibaca dengan cermat, bukan sekadar dipindai. Jumlah 354 catatan bukanlah jumlah 354 insiden. Hanya 138 di antaranya yang bahkan diklasifikasikan sebagai insiden; sisanya adalah pengungkapan kerentanan, demonstrasi riset, laporan ancaman, dan langkah kebijakan. Menghitung kelimanya secara bersamaan justru membuat angka utama menjadi keliru, itulah sebabnya arsip ini memisahkannya dan memungkinkan Anda memfilter.
Mengapa "jailbreak bukanlah insiden" adalah intinya
Sebagian besar kumpulan peristiwa keamanan AI meruntuhkan satu perbedaan: agen yang benar-benar menyebabkan kerusakan tidak sama dengan peneliti yang menunjukkan bahwa hal itu bisa terjadi. Penggabungan tunggal itulah yang mengubah demo konferensi menjadi judul berita pelanggaran, dan itulah yang dibangun untuk ditolak oleh arsip ini.

Tiga bidang memikul beban itu. code>real_harm/code> mencatat apakah korban telah dikonfirmasi. code>ai_involvement/code> mencatat apakah sumber primer — vendor, korban, penegak hukum, atau laporan resmi — mengonfirmasi peran AI, dengan atribusi yang diperdebatkan tetap disimpan dalam kumpulan data tetapi diberi label. code>kind/code> mencatat jenis dokumen dari entri tersebut. Catatan tanpa sumber tidak dimasukkan. Catatan dengan bukti yang bertentangan ditandai sebagai diperdebatkan, bukan diselesaikan ke arah mana pun yang tampak lebih baik. Ketika bukti baru muncul, catatan diperbarui dan perubahan itu ditulis ke dalam riwayat revisinya, bukan ditimpa secara diam-diam.
Arsip itu telah menerapkan aturan tersebut pada dirinya sendiri. Dalam putaran verifikasinya sendiri, arsip itu menghapus dua entri yang tidak dapat dibuktikan, mengoreksi klaim yang beredar luas tentang seberapa cepat suatu intrusi berlangsung, dan menurunkan tingkat keyakinan entri ketiga ketika bukti yang mendasarinya ternyata berasal dari tangan kedua. Basis data insiden yang belum pernah menghapus apa pun adalah basis data yang belum diperiksa.
Dua belas permukaan serangan yang menjadi dasar pengurutannya
Setiap catatan ditandai dengan satu atau lebih dari dua belas jenis, dan setiap jenis memiliki jumlah per bulannya sendiri. Tata kelola dan kebijakan adalah kelompok terbesar dengan 65 catatan, tetapi hanya satu di antaranya yang memiliki kerugian terkonfirmasi — bentuk yang tepat untuk aktivitas regulasi dan menyesatkan jika dikutip sebagai jumlah insiden. Penyalahgunaan kredensial menyusul di angka 55, dengan 40 korban terkonfirmasi, kepadatan kerugian tertinggi dalam kumpulan ini. Agen-sebagai-senjata berada di angka 51 dengan 28 terkonfirmasi. Injeksi prompt tidak langsung memiliki 45 catatan tetapi hanya 5 yang memiliki kerugian terkonfirmasi, yang merupakan ilustrasi paling jelas tentang pemisahan kapabilitas versus konsekuensi di seluruh kumpulan data: ini adalah kelas serangan yang paling banyak diteliti dan salah satu yang paling tidak produktif di alam bebas. Peracunan rantai pasok, dengan 36 catatan, memiliki 27 korban terkonfirmasi — rasio terburuk di papan ini.
September 2026 adalah bulan yang membuktikan hal itu.
Lima puluh satu catatan masuk hanya pada September 2026, lebih dari dua kali lipat bulan mana pun sebelumnya dalam rentang ini. Itu bukan keruntuhan keamanan yang tiba-tiba. Ini adalah bulan ketika pencatatan akhirnya menyusul setahun peristiwa yang menumpuk, dan komposisinya yang penting: entri kritis untuk code>.git/config/code> berbahaya yang mengeksekusi kode penyerang di tujuh agen pengkodean sebelum model dihubungi sama sekali, untuk celah Langflow yang dieksploitasi di alam liar, untuk kampanye kawanan agen AI di sebuah vendor manajemen cetak, dan untuk worm npm yang masuk ke rantai di hulu. Di sampingnya terdapat entri informasional tentang OWASP Agent Control Standard, pidato State of the Union Uni Eropa yang menyebut pelarian agen, dan ringkasan panel Perserikatan Bangsa-Bangsa yang memperlakukan satu insiden sebagai peringatan hilangnya kendali.
Entri Korea, dan apa yang bukan makna dari bidang wilayah
Bidang code>region/code> arsip menandai di mana suatu peristiwa benar-benar mendarat, bukan di mana vendor berkantor pusat — pengungkapan vendor lintas batas selalu diajukan sebagai global, itulah sebabnya 291 dari 354 catatan tidak memiliki tag negara tunggal. Dua catatan membawa tag KR, keduanya entri kebijakan dengan sumber grade A dan tanpa bahaya yang dikonfirmasi: penghapusan DeepSeek dari toko aplikasi domestik Korea Selatan pada April 2025, dan larangan seluruh perusahaan terhadap OpenClaw yang diadopsi oleh Naver, Kakao dan Karrot pada Februari 2026.
Penahanan diri itu disengaja. Jumlah wilayah sebesar dua bukanlah klaim bahwa Korea telah mengalami dua peristiwa keamanan AI. Itu adalah klaim bahwa dua peristiwa dalam jendela waktu tersebut terjadi di Korea dengan sumber primer yang cukup kuat untuk dicatat — dan arsip tersebut lebih memilih menerbitkan angka kecil yang jujur daripada mengisi halaman negara dengan peristiwa yang menimpa pelanggan sebuah perusahaan Korea di tempat lain.
Cara membaca tingkat keyakinan sebelum Anda mengutipnya
Tingkat keyakinan berkaitan dengan kualitas sumber, bukan tingkat keparahan, dan nilai D bukan berarti salah — itu berarti para pihak tidak sepakat dan Anda tidak boleh mengutip hanya satu sisi saja. Nilai A berarti sumber primer: vendor, korban, penegak hukum, atau laporan resmi. Nilai B berarti laboratorium riset atau media besar dengan perincian yang dapat diperiksa. Nilai C berarti hanya dari sumber tangan kedua. Nilai D berarti fakta atau atribusinya diperdebatkan. Dengan 302 dari 354 catatan, nilai A mencakup 85% kumpulan data, yang luar biasa tinggi untuk pelaporan insiden dan merupakan hasil langsung dari aturan tanpa sumber, tanpa entri.
Peringatan jujur itu layak dinyatakan secara terus terang, karena arsip menyatakannya. Dua catatan tetap berada di tingkat C dan tiga di tingkat D. Delapan puluh lima catatan memiliki tingkat keparahan informasional karena catatan tersebut merupakan entri kebijakan atau laporan ancaman yang disimpan untuk kesinambungan lini masa, bukan insiden. Repositori ini berusia tiga minggu dan tidak memiliki bintang, tidak memiliki rilis, dan tidak ada audit eksternal atas metodologinya sendiri — ini adalah kumpulan data yang diterbitkan secara terbuka, bukan studi yang ditinjau sejawat.

Mengapa ini lebih penting daripada tolok ukur lainnya
Saat agen memperoleh browser, shell, kredensial, eksekusi kode, dan akses produksi, pertanyaan keamanan bukan lagi tentang apa yang mampu dilakukan oleh model, melainkan tentang apa yang telah dilakukan dengan model tersebut. Tolok ukur menjawab pertanyaan pertama dengan baik dan pertanyaan kedua sama sekali tidak. Arsip insiden, yang dinilai berdasarkan kualitas sumber dan disaring berdasarkan apakah ada orang yang benar-benar dirugikan, adalah satu-satunya jenis instrumen yang menjawab pertanyaan kedua — dan arsip itu hanya berfungsi jika entri-entrinya dapat ditelusuri, dapat dikoreksi, dan bebas digunakan kembali.
Itulah yang kini terbuka. Kumpulan datanya ada di a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, Markdown mentah, ekspor JSON dan CSV, serta skemanya ada di a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">repositori publik/a>, dan koreksi dilakukan melalui riwayat revisi catatan. Jika Anda mengetahui peristiwa yang layak dimasukkan, jalur kontribusinya adalah satu berkas Markdown dan setidaknya satu sumber. Tanpa sumber, tanpa entri.

OrcaRouter, yang menerbitkan arsip tersebut, menjalankan satu endpoint yang kompatibel dengan OpenAI di lebih dari 200 model tanpa markup pada harga penyedia dan failover otomatis di antara mereka — lapisan perutean yang sama yang memungkinkan untuk mengarahkan agen ke model yang lebih murah untuk panggilan yang mudah dan model yang lebih kuat untuk panggilan yang sulit, yang persis merupakan arsitektur tempat sebagian besar insiden di atas ditemukan.
