
L'IA è diventata la superficie di attacco nel 2025. Nel 2026, stiamo rendendo la difesa gratuita.
Il prompt injection è ora il rischio numero 1 per le applicazioni LLM — e non può essere corretto con una patch. Oggi, OrcaRouter Security Research sta rilasciando il suo Agent Firewall e le Guardrails di input/output gratuitamente per ogni utente: stessa chiave API, un interruttore nella tua console, nessuna modifica al codice. Questo è il panorama delle minacce che lo ha reso non negoziabile — e l'architettura che lo contiene.
Di OrcaRouter Security Research · Giugno 2026
Nel giugno 2025, degli aggressori hanno esfiltrato dati aziendali da Microsoft 365 Copilot. La vittima non ha fatto nulla di male. Non hanno cliccato su un link, aperto un allegato o approvato un prompt. Hanno ricevuto un'email. Il loro assistente AI l'ha poi letta — e ha obbedito alle istruzioni nascoste al suo interno. La catena, divulgata da Aim Security come EchoLeak (CVE-2025-32711), ha raccolto contesti sensibili da email, file e cronologia chat e li ha fatti uscire attraverso un URL di immagine a caricamento automatico. Zero clic.
EchoLeak non è stato un'anomalia. È stata un'anteprima. Un anno dopo, possiamo dire chiaramente ciò che il registro pubblico degli incidenti ora dimostra: i vostri sistemi AI sono la vostra superficie d'attacco, e la maggior parte delle organizzazioni non può vedere gli attacchi contro di loro. Oggi pubblichiamo Il Rapporto sulle Minacce AI 2026 e, insieme, rilasciamo i due controlli che abbiamo costruito per contenere questi attacchi — gratuiti, sul gateway, per ogni utente OrcaRouter.
L'anno in cui gli attacchi sono diventati agentici — e le fughe di notizie sono diventate industriali.
Il registro degli incidenti del 2026 si legge come uno stress test di ogni presupposto su cui è stata costruita la sicurezza aziendale:
- Chat & Ask AI ha lasciato circa 300 milioni di messaggi di chat privati da più di 25 milioni di utenti esposti a causa di una errata configurazione di Firebase (404 Media; Malwarebytes, Jan 2026).
- Sears Home Services ha esposto 3.7 milioni di trascrizioni di chat AI e registrazioni di chiamate — nomi, indirizzi, email — dal 2024 al 2026 (ExpressVPN; Cybernews, mar 2026).
- Un attaccante ha concatenato un singolo CVE (CVE-2026-39987 nel marimo notebook tool) in un agente LLM attivo che ha estratto credenziali cloud, prelevato una chiave SSH da AWS Secrets Manager, ed esfiltrato un intero database PostgreSQL interno in meno di due minuti (Sysdig; The Hacker News, maggio 2026).
- Microsoft e Salesforce entrambi hanno rilasciato patch per difetti di fuga di dati degli agenti AI. In CVE-2026-21520, un campo SharePoint avvelenato ha indirizzato Copilot a inviare via email i dati dei clienti a un attaccante — e i dati sono usciti anche dopo che un meccanismo di sicurezza ha segnalato l'attacco (Dark Reading).
L'economia sottostante a questi titoli si è invertita a favore dell'attaccante. La telemetria delle applicazioni LLM in produzione mostra che l'attacco riuscito medio si completa in 42 secondi, con il 90% di essi perde dati sensibili (Pillar Security). 13% delle organizzazioni sono già state violate tramite un modello o un'applicazione AI — e il 97% di esse non disponeva di controlli di accesso AI di base (IBM, 2025). Il riepilogo Q1 2026 di OWASP ha quantificato la tendenza: gli attacchi di prompt injection sono aumentati del 340% su base annua.
E una nuova classe di perdita non necessita di alcuna violazione. Denial-of-wallet — un agente dirottato o incontrollato che semplicemente spende — è stato osservato bruciare $46,000 al giorno (Sysdig, "LLMjacking"). Nessun dato viene rubato. C'è solo una fattura.

Perché il tuo stack attuale non può vedere nulla di esso
La sicurezza tradizionale presuppone un confine: fidato all'interno, non fidato all'esterno, controlli al confine. I modelli linguistici dissolvono quel confine, perché l'input di un modello è anche la sua programmazione. Ogni email, documento, pagina web e risultato di uno strumento che un agente legge può contenere istruzioni che seguirà. Non esiste un meccanismo affidabile e generale attraverso cui i modelli attuali separano il contenuto da elaborare dai comandi da eseguire.
Ecco perché l'iniezione di prompt detiene la #1 posizione nell'OWASP Top 10 per le applicazioni LLM — e perché non verrà "corretta" come viene corretto un buffer overflow. È una proprietà strutturale del mezzo. Il tuo firewall per applicazioni web ispeziona la richiesta e vede una chiamata API perfettamente valida; l'attacco è nelle parole. I tuoi controlli per richiesta superano ogni singolo passo di un attacco a catena, perché il danno risiede nella sequenza — volume, ripetizione e spesa contro il tempo — non in una singola chiamata.
La conclusione è scomoda ma chiara: La sicurezza dell'IA non è un problema di addestramento del modello. È un problema di architettura — e si può risolvere con la stessa disciplina che le imprese già applicano a ogni altro sistema produttivo.

La difesa è architettonica: due piani, sei strati, al gateway.
Ogni attacco di cui sopra ha successo contro un'autorità senza ambito e fallisce contro un'autorità con ambito, controllata, verificata. Contenerli richiede il controllo di due piani distinti:
Il piano dei contenuti — ciò che il modello legge e scrive. Questo è il compito di Guardrails.
Il piano d'azione — ciò che l'agente fa: gli strumenti che chiama, le reti a cui accede, il denaro che spende. Questo è il compito del Firewall.
Una difesa che osserva solo un piano mancherà gli attacchi concatenati che generano titoli, perché gli incidenti più dannosi attraversano entrambi: un'iniezione arriva come contenuto, poi si traduce in un'azione. OrcaRouter colloca sei strati indipendenti e verificabili tra una richiesta e un rimpianto:
1. Identità con ambito — ogni agente effettua chiamate tramite la propria chiave, che include i modelli consentiti, una lista di indirizzi IP autorizzati, un limite di spesa rigido e una scadenza. Una richiesta fuori ambito termina prima che qualsiasi contenuto venga letto.
2. Guardrail di input — regole di injection e jailbreak, rilevamento e mascheramento di dati PII, blocco di segreti, e un giudice LLM semantico che cattura ciò che le espressioni regolari non possono.
3. Il firewall delle azioni — ogni chiamata di strumento, dispatch MCP e uscita di rete viene giudicata rispetto a una policy ordinata di default-deny con sei verdetti: consenti, verifica, nega, sanifica (redigere gli argomenti e procedere), in attesa di approvazione (trattenere passi irreversibili per un essere umano), e limite-costo (fermare bruscamente un'esecuzione a un tetto di spesa). Un agente dirottato non può raggiungere uno strumento, un host o un dollaro che non hai mai elencato.
4. Guardrail di output — la risposta viene controllata in uscita per output non sicuri, PII e segreti, con verifiche di grounding. Questo è il livello che intercetta l'URL di esfiltrazione di EchoLeak prima che parta.
5. Rilevamento anomalie — le baseline comportamentali segnalano ciò che le regole statiche non possono prevedere: la stessa chiamata ripetuta in una finestra ristretta, spesa che aumenta rispetto a una baseline appresa per ora della settimana, una transizione da strumento a strumento che l'area di lavoro non ha mai effettuato.
6. Audit firmato — ogni corrispondenza, verdetto, approvazione e modifica delle policy viene registrata in una traccia a prova di manomissione, correlata per esecuzione dell'agente e sessione, esportabile come prova.
La proprietà decisiva è posizionamento. Questi controlli risiedono nel gateway, nel percorso della richiesta, quindi si legano a credenziali anziché codice applicativo — applicabile su ogni team e framework, senza riscritture di agenti.
Non correggiamo i nostri stessi compiti.
Le affermazioni di sicurezza valgono esattamente quanto le prove che le supportano, quindi rendiamo pubbliche le nostre. I Guardrails e il Firewall di OrcaRouter sono dotati di un harness di valutazione che li valuta contro più di 80 corpora open-source red-team — ciascuno citato e con licenza:
HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), e AdvBench (Zou et al., 2023) per comportamento dannoso e robustezza ai jailbreak;
garak di NVIDIA (Apache-2.0), lo scanner open di vulnerabilità per LLM, per attacchi di injection e encoding;
AgentDojo (NeurIPS 2024) — il benchmark di iniezione di prompt per agenti che gli Istituti di Sicurezza dell'IA degli Stati Uniti e del Regno Unito hanno utilizzato in un red-teaming congiunto — per valutare specificamente il firewall del piano d'azione;
TruthfulQA e altri per grounding e allucinazione.
OrcaRouter stesso integra strumenti aperti direttamente: OSV per le CVE delle dipendenze e Semgrep per il codice che transita attraverso un prompt. Nessuna scatola nera. Nessun "fidati di noi".

Progettato per l'audit imminente
Il 2 agosto 2026, l'AI Act dell'UE diventa pienamente applicabile, e 'mostrami' sostituisce 'dimmi' come base normativa. Lo stesso istinto probatorio si sta diffondendo negli ambiti SOC 2, nei questionari di cyber-assicurazione e nelle revisioni degli appalti. OrcaRouter pubblica 36 pacchetti di framework di conformità — inclusi OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS e GDPR — che materializzano i controlli nel tuo workspace e generano prove firmate. Un unico livello di controllo ben posizionato produce l'attestazione per tutti contemporaneamente.
Cosa viene lanciato oggi — e perché è gratuito
OrcaRouter Firewall + Guardrails sono ora gratuiti per ogni utente. Stessa chiave API. Un interruttore nella tua console. Nessun codice da modificare.
Li abbiamo resi gratuiti deliberatamente. I dati del rapporto sono inequivocabili su questo punto: la proibizione senza una strada asfaltata produce più AI ombra, non meno — e l'AI ombra già guidauna violazione su cinque con un costo aggiuntivo di 670.000 dollari (IBM, 2025). Il rimedio che funziona è tanto economico quanto tecnico: rendere il percorso governato il percorso più facile. Un controllo per cui devi pagare un extra, integrare manualmente e giustificare a un comitato di bilancio è un controllo che la maggior parte dei team salterà — e saltarlo è esattamente il modo in cui le organizzazioni finiscono per spiegare i rapporti sugli incidenti che questo rapporto ha descritto in anticipo.
Quindi non c'è niente da integrare e niente da acquistare. Alleghi Guardrails e un Firewall policy alla chiave che già usi e segui il rollout che sopravvive al contatto con la produzione: osserva (esegui in modalità audit e lascia che il tuo traffico reale scriva la baseline), simula (esegui la politica reale in modalità di blocco simulato finché i falsi positivi si avvicinano a zero), poi applica (inverti i verdetti in tempo reale, con approvazione umana riservata per quelli veramente irreversibili). La maggior parte dei team converte in settimane — e mantengono i controlli attivi.
La conclusione
Il panorama delle minacce del 2026 non è un motivo per rallentare l'adozione dell'IA. È il manuale operativo per sopravvivere. Ogni attacco in questo rapporto sconfigge l'autorità senza ambito e muore contro un'autorità con ambito, controllata e verificata — e quella proprietà è realizzabile ora, al gateway, in settimane, gratuitamente.
Leggi il rapporto completo: The AI Threat Report 2026 · Attivalo: OrcaRouter 🐋
