AI Menjadi Permukaan Serangan pada tahun 2025. Pada tahun 2026, Kami Membuat Pertahanan Gratis.

AI Menjadi Permukaan Serangan pada tahun 2025. Pada tahun 2026, Kami Membuat Pertahanan Gratis.

Tanggal Terbit

Kembali ke semua artikel

Injeksi prompt kini menjadi risiko #1 untuk aplikasi LLM — dan tidak bisa ditambal. Hari ini, OrcaRouter Security Research merilis Firewall agen dan Guardrails input/output kami secara gratis untuk setiap pengguna: kunci API yang sama, satu sakelar di konsol Anda, tanpa perubahan kode. Inilah lanskap ancaman yang membuatnya tidak bisa ditawar — dan arsitektur yang menahannya.

Oleh OrcaRouter Security Research · Juni 2026


Pada Juni 2025, penyerang mengeksfiltrasi data perusahaan dari Microsoft 365 Copilot. Korban tidak melakukan kesalahan. Mereka tidak mengklik tautan, membuka lampiran, atau menyetujui perintah. Mereka menerima email. Asisten AI mereka kemudian membacanya — dan mengikuti instruksi yang tersembunyi di dalamnya. Rantai tersebut, diungkapkan oleh Aim Security sebagai EchoLeak (CVE-2025-32711), mengumpulkan konteks sensitif dari email, file, dan riwayat obrolan dan menyelundupkannya keluar melalui URL gambar yang dimuat secara otomatis. Tanpa klik.

EchoLeak bukanlah suatu keanehan. Itu adalah pratinjau. Setahun kemudian, kita dapat mengatakan dengan jelas apa yang ditunjukkan oleh catatan insiden publik sekarang: sistem AI Anda adalah permukaan serangan Anda, dan sebagian besar organisasi tidak dapat melihat serangan terhadap mereka. Hari ini kami menerbitkan The AI Threat Report 2026 dan, bersamaan dengan itu, merilis dua kontrol yang kami bangun untuk menahan serangan ini — gratis, di gerbang, untuk setiap pengguna OrcaRouter.

Tahun ketika serangan menjadi agen — dan kebocoran menjadi industrial.

Catatan insiden tahun 2026 terbaca seperti uji tekanan terhadap setiap asumsi yang menjadi fondasi keamanan perusahaan:

- Chat & Tanya AI tersisa sekitar 300 juta pesan obrolan pribadi dari lebih dari 25 juta pengguna terekspos karena kesalahan konfigurasi Firebase (404 Media; Malwarebytes, Jan 2026).

- Sears Home Services terekspos 3,7 juta transkrip obrolan AI dan rekaman panggilan — nama, alamat, email — mencakup tahun 2024–2026 (ExpressVPN; Cybernews, Mar 2026).

- Seorang penyerang merangkai satu CVE (CVE-2026-39987 di dalam alat notebook marimo) menjadi agen LLM langsung yang mengekstrak kredensial cloud, mengambil kunci SSH dari AWS Secrets Manager, dan mengeksfiltrasi seluruh basis data internal PostgreSQL dalam waktu kurang dari dua menit (Sysdig; The Hacker News, Mei 2026).

- Microsoft dan Salesforce keduanya merilis tambalan untuk kerentanan kebocoran data agen AI. Di CVE-2026-21520, sebuah bidang SharePoint yang diracuni mengarahkan Copilot untuk mengirim data pelanggan melalui email kepada penyerang — dan data tersebut keluar bahkan setelah mekanisme keamanan menandai serangan tersebut (Dark Reading).

Ekonomi di balik berita utama ini telah berbalik menguntungkan penyerang. Telemetri dari aplikasi LLM produksi menunjukkan bahwa serangan yang berhasil rata-rata selesai dalam 42 detik, dengan 90% di antaranya membocorkan data sensitif (Pillar Security). 13% dari organisasi telah diretas melalui model atau aplikasi AI — dan 97% dari mereka tidak memiliki kontrol akses AI dasar (IBM, 2025). Ringkasan Q1 2026 OWASP memberikan angka pada tren: serangan prompt injection meningkat 340% tahun ke tahun.

Dan kelas kerugian baru tidak memerlukan pelanggaran sama sekali. Penolakan dompet — agen yang dibajak atau melarikan diri yang hanya menghabiskan — telah diamati membakar $46.000 sehari (Sysdig, "LLMjacking"). Tidak ada data yang dicuri. Hanya ada tagihan.


Mengapa stack Anda saat ini tidak dapat melihat apapun darinya?

Keamanan tradisional mengasumsikan sebuah batas: tepercaya di dalam, tidak tepercaya di luar, kontrol di batas. Model bahasa menghilangkan batas itu, karena masukan model juga merupakan pemrogramannya. Setiap email, dokumen, halaman web, dan hasil alat yang dibaca oleh agen dapat membawa instruksi yang akan diikutinya. Tidak ada mekanisme umum yang andal yang dengannya model saat ini dapat memisahkan konten untuk diproses dari perintah untuk dipatuhi.

Itulah mengapa prompt injection memegang posisi #1 di OWASP Top 10 untuk Aplikasi LLM — dan mengapa ia tidak akan "ditambal" seperti buffer overflow ditambal. Ini adalah properti struktural dari medium. Firewall aplikasi web Anda memeriksa permintaan dan melihat panggilan API yang sepenuhnya valid; serangan ada di dalam kata-kata. Pemeriksaan per-permintaan Anda melewati setiap langkah dari serangan berantai, karena kerusakan ada di dalam urutan — volume, pengulangan, dan pengeluaran terhadap waktu — bukan dalam satu panggilan pun.

Kesimpulannya tidak nyaman tetapi jelas: Keamanan AI bukanlah masalah pelatihan model. Itu adalah masalah arsitektur — dan itu dapat diselesaikan dengan disiplin yang sama yang sudah diterapkan perusahaan pada setiap sistem produksi lainnya.


Pertahanannya bersifat arsitektural: dua bidang, enam lapisan, di gerbang.

Setiap serangan di atas berhasil melawan otoritas tanpa lingkup dan gagal melawan otoritas yang memiliki lingkup, dipolisikan, dan diaudit. Mengandungnya memerlukan pengendalian dua bidang yang berbeda:

Bidang konten — apa yang dibaca dan ditulis oleh model. Ini adalah tugas dari Guardrails.

Bidang aksi — apa yang agen lakukan: alat yang dipanggilnya, jaringan yang dijangkau, uang yang dibelanjakannya. Inilah tugas dari Firewall.

Sebuah pertahanan yang hanya memantau satu bidang akan melewatkan serangan berantai yang menghasilkan berita utama, karena insiden paling merusak melintasi keduanya: sebuah injeksi tiba sebagai konten, lalu menghasilkan aksi. OrcaRouter menempatkan enam lapisan independen yang dapat diaudit antara permintaan dan penyesalan:

1. Identitas dengan cakupansetiap agen memanggil melalui kuncinya sendiri yang membawa model yang diizinkan, daftar IP yang diizinkan, batas pengeluaran tetap, dan masa berlaku. Permintaan di luar cakupan akan mati sebelum konten apa pun dibaca.

2. Pagar input — aturan injeksi dan jailbreak, deteksi dan penyembunyian PII, pemblokiran rahasia, dan hakim LLM semantik yang menangkap apa yang tidak dapat ditangkap oleh regex.

3. Firewall aksi — setiap panggilan alat, pengiriman MCP, dan keluar jaringan dinilai terhadap kebijakan default-deny yang terurut dengan enam vonis: izinkan, audit, tolak, sanitasi (redaksi argumen dan lanjutkan), menunggu-persetujuan (tahan langkah yang tidak dapat dibatalkan untuk manusia), dan batas-biaya (hentikan paksa sebuah proses pada batas pengeluaran). Agen yang dibajak tidak dapat mencapai alat, host, atau dolar yang tidak pernah Anda daftarkan.

4. Pagar pengaman output — balasan diperiksa saat akan keluar untuk output yang tidak aman, PII, dan rahasia, dengan pemeriksaan grounding. Ini adalah lapisan yang menangkap URL eksfiltrasi EchoLeak sebelum keluar.

5. Deteksi anomali — baseline perilaku menandai apa yang tidak bisa diprediksi oleh aturan statis: panggilan yang sama dilakukan berulang kali dalam jangka waktu singkat, pengeluaran melonjak terhadap baseline jam-dalam-minggu yang dipelajari, transisi alat-ke-alat yang belum pernah dilakukan oleh ruang kerja.

6. Audit yang ditandatangani — setiap kecocokan, putusan, persetujuan, dan perubahan kebijakan tercatat dalam jejak yang tahan terhadap perubahan, dikorelasikan dengan proses dan sesi agen, dan dapat diekspor sebagai bukti.

Properti yang menentukan adalah penempatan. Kontrol-kontrol ini berada di gateway, di jalur permintaan, sehingga mereka terikat pada kredensial, bukan kode aplikasi — dapat diterapkan di setiap tim dan kerangka kerja, tanpa penulisan ulang agen.

Kami tidak menilai pekerjaan rumah kami sendiri.

Klaim keamanan bernilai persis sebesar bukti di baliknya, jadi kami menampilkannya secara terbuka. Guardrails dan Firewall OrcaRouter dilengkapi dengan kerangka evaluasi yang menilai mereka terhadap lebih dari 80 korpora red-team sumber terbuka — semuanya dikutip dan dilisensikan:

HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), dan AdvBench (Zou et al., 2023) untuk perilaku berbahaya dan ketahanan jailbreak;

garak NVIDIA (Apache-2.0), pemindai kerentanan LLM terbuka, untuk serangan injeksi dan encoding;

AgentDojo (NeurIPS 2024) — tolok ukur prompt-injection agen yang digunakan oleh US dan UK AI Safety Institutes dalam red-teaming bersama — untuk menilai firewall action-plane secara khusus;

TruthfulQAdan lainnya untuk grounding dan halusinasi.

OrcaRouter sendiri mengintegrasikan perangkat terbuka secara langsung: OSV untuk CVE dependensi dan Semgrep untuk kode yang melintasi prompt. Tidak ada kotak hitam. Tidak ada "percaya pada kami."


Dirancang untuk audit yang akan datang

Pada pada 2 Agustus 2026, EU AI Act menjadi sepenuhnya berlaku, dan "show me" menggantikan "tell me" sebagai dasar regulasi. Insting pembuktian yang sama menyebar melalui lingkup SOC 2, kuesioner asuransi siber, dan tinjauan pengadaan. OrcaRouter mengirimkan 36 paket kerangka kepatuhan — termasuk OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS, dan GDPR — yang mewujudkan kontrol ke dalam ruang kerja Anda dan menghasilkan bukti yang ditandatangani. Satu lapisan kontrol yang ditempatkan dengan baik menghasilkan pengesahan untuk semuanya sekaligus.


Apa yang diluncurkan hari ini — dan mengapa gratis

OrcaRouter Firewall + Guardrails sekarang gratis untuk setiap pengguna. API key yang sama. Satu sakelar di konsol Anda. Tidak perlu mengubah kode.

Kami sengaja membuatnya gratis. Data laporan tidak ambigu pada poin ini: larangan tanpa jalan beraspal menghasilkan lebih banyak AI bayangan, bukan lebih sedikit — dan AI bayangan sudah mendorong satu dari lima pelanggaran dengan premi $670,000 (IBM, 2025). Solusi yang berhasil sama bersifat ekonomi dan teknis: buat jalur yang diatur menjadi jalur termudah. Kontrol yang harus Anda bayar ekstra, integrasikan secara manual, dan justifikasi ke komite anggaran adalah kontrol yang akan dilewati sebagian besar tim — dan melewatkannya persis seperti bagaimana organisasi akhirnya menjelaskan laporan insiden yang dijelaskan laporan ini sebelumnya.

Jadi tidak ada yang perlu diintegrasikan dan tidak ada yang perlu dibeli. Anda melampirkan Guardrails dan kebijakan Firewall ke kunci yang sudah Anda gunakan dan ikuti peluncuran yang selamat dari kontak dengan produksi: amati (jalankan dalam mode audit dan biarkan lalu lintas nyata Anda menulis baseline), bayangan (jalankan kebijakan nyata dalam mode akan-blokir hingga false positive mendekati nol), lalu terapkan (balikkan putusan secara langsung, dengan persetujuan manusia dicadangkan untuk hal yang benar-benar tidak dapat dibatalkan). Sebagian besar tim beralih dalam hitungan minggu — dan tetap menjaga kontrol tetap aktif.


Intinya

Lanskap ancaman tahun 2026 bukanlah alasan untuk memperlambat adopsi AI. Ini adalah manual operasi untuk bertahan dari ancaman tersebut. Setiap serangan dalam laporan ini mengalahkan otoritas yang tidak terbatas dan mati di hadapan otoritas yang terbatas, diawasi, dan diaudit — dan properti itu dapat dibangun sekarang, di gerbang, dalam hitungan minggu, secara gratis.

Baca laporan lengkap: The AI Threat Report 2026 · Aktifkan: OrcaRouter 🐋

© 2026 OrcaRouter