
AI blev attackytan 2025. 2026 gör vi försvaret gratis.
- qwenNYQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1M tokens · 55 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 206 tok/s
- orcaNYOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNYAnthropic: Claude Opus 52026-07-2461Intelligens78Kodning
- googleNYGoogle: Gemini 3.6 Flash2026-07-2150Intelligens69Kodning
- googleNYGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1651Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1557Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0854Intelligens72Kodning
- tencentTencent: Hy32026-07-0641Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1651Intelligens69Kodning60Matematik
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligens61Kodning61Matematik
Promptinjektion är nu den största risken för LLM-applikationer – och den kan inte lappas. Idag släpper OrcaRouter Security Research vår agentbrandvägg (Firewall) och in-/utgångsskyddsräcken (Guardrails) gratis för alla användare: samma API-nyckel, en omkopplare i din konsol, inga kodändringar. Detta är hotbilden som gjorde det icke förhandlingsbart – och arkitekturen som håller det i schack.
Av OrcaRouter Säkerhetsforskning · Juni 2026
I juni 2025 exfiltrerade angripare företagsdata från Microsoft 365 Copilot. Offret gjorde inget fel. De klickade inte på en länk, öppnade inte en bilaga eller godkände en prompt. De fick ett e-postmeddelande. Deras AI-assistent läste det senare – och lydde instruktionerna som var gömda i det. Kedjan, som avslöjades av Aim Security som EchoLeak (CVE-2025-32711), samlade in känslig kontext från e-post, filer och chatthistorik och smugglade ut den via en auto-laddande bild-URL. Noll klick.
EchoLeak var ingen avvikelse. Det var en förhandstitt. Ett år senare kan vi tydligt säga vad den offentliga incidentrapporten nu visar: era AI-system är er attackyta, och de flesta organisationer kan inte se attackerna mot dem. Idag publicerar vi The AI Threat Report 2026 och, tillsammans med den, släpper vi de två kontroller vi byggt för att stoppa dessa attacker – gratis, vid gateway, för varje OrcaRouter-användare.
Året då attackerna blev agentiska — och läckorna blev industriella.
2026 års incidentrapport läser som ett stresstest av varje antagande som företagssäkerheten byggdes på:
- Chat & Ask AI lämnade cirka 300 miljoner privata chattmeddelanden från över 25 miljoner användare exponerade genom en felkonfiguration i Firebase (404 Media; Malwarebytes, Jan 2026).
- Sears Home Services exponerade 3,7 miljoner AI-chattranskript och samtalsinspelningar — namn, adresser, e-postmeddelanden — som sträcker sig över 2024–2026 (ExpressVPN; Cybernews, mars 2026).
- En angripare kedjade en enda CVE (CVE-2026-39987 i marimo-anteckningsboksverktyget) till en live LLM-agent som extraherade molnreferenser, hämtade en SSH-nyckel från AWS Secrets Manager och exfiltrerade en hel intern PostgreSQL-databas på under två minuter (Sysdig; The Hacker News, maj 2026).
- Microsoft och Salesforce båda släppte patchar för AI-agenters dataläckagefel. I CVE-2026-21520, ett förgiftat SharePoint-fält ledde Copilot till att mejla kunddata till en angripare — och datan lämnade även efter att en säkerhetsmekanism flaggade attacken (Dark Reading).
Ekonomin bakom dessa rubriker har vänt till angriparens fördel. Telemetri från produktions-LLM-applikationer visar att en genomsnittlig lyckad attack slutförs på 42 sekunder, med 90 % av dem läcker känsliga data (Pillar Security). 13 % av organisationer har redan blivit angripna via en AI-modell eller applikation – och 97 % av dessa saknade grundläggande AI-åtkomstkontroller (IBM, 2025). OWASP:s sammanställning för Q1 2026 satte siffror på trenden: promptinjektionsattacker ökade med 340 % år över år.
Och en ny förlustklass behöver inget intrång alls. Plånboksförnekelse — en kapad eller okontrollerad agent som helt enkelt spenderar — har observerats bränna $46 000 per dag (Sysdig, "LLMjacking"). Inga data stjäls. Det finns bara en räkning.

Varför din nuvarande stack inte kan se något av det
Traditionell säkerhet antar en gräns: betrodd inuti, icke-betrodd utanför, kontroller vid sömmen. Språkmodeller löser upp den gränsen, eftersom en modells indata är också dess programmering. Varje e-postmeddelande, dokument, webbsida och verktygsresultat som en agent läser kan innehålla instruktioner som den kommer att följa. Det finns ingen tillförlitlig, generell mekanism med vilken dagens modeller separerar innehåll att bearbeta från kommandon att lyda.
Det är därför som prompt injection innehar #1-platsen i OWASP Top 10 för LLM-applikationer — och varför det inte kommer att "patchas" på samma sätt som en buffer overflow patchas. Det är en strukturell egenskap hos mediet. Din web application firewall inspekterar förfrågan och ser ett helt giltigt API-anrop; attacken finns i orden. Dina per-förfrågan-kontroller klarar varje steg av en kedjad attack, eftersom skadan lever i sekvensen — volym, upprepning och spenderande mot tid — inte i något enskilt anrop.
Slutsatsen är obekväm men tydlig: AI-säkerhet är inte ett modellträningsproblem. Det är ett arkitekturproblem — och det är lösbart med samma disciplin som företag redan tillämpar på alla andra produktionssystem.

Försvaret är arkitektoniskt: två plan, sex lager, vid gateway.
Varje attack ovan lyckas mot oavgränsad auktoritet och misslyckas mot avgränsad, övervakad, granskad auktoritet. Att innehålla dem kräver kontroll över två distinkta plan:
Innehållsplanet — vad modellen läser och skriver. Detta är jobbet för Guardrails.
Handlingsplanet — vad agenten gör: de verktyg den anropar, de nätverk den når, de pengar den spenderar. Detta är jobbet för den Firewall.
En försvarsmekanism som bara övervakar ett plan kommer att missa de kedjeattacker som skapar rubriker, eftersom de mest skadliga incidenterna korsar båda: en injektion anländer som innehåll och omvandlas sedan till en handling. OrcaRouter placerar sex oberoende, granskningsbara lager mellan en begäran och en ånger:
1. Avgränsad identitet — varje agent anropar via sin egen nyckel som bär tillåtna modeller, en IP-tillåtelselista, ett hårt utgiftstak och ett utgångsdatum. En begäran som ligger utanför omfattningen dör innan något innehåll läses.
2. Inmatningsskydd — injektions- och jailbreak-regler, PII-detektering och maskering, hemlighetsblockering och en semantisk LLM-domare som fångar vad regex inte kan.
3. Åtgärdsbrandväggen — varje verktygsanrop, MCP-utskick och nätverksutgång bedöms mot en ordnad, standard-neka-policy med sex utslag: tillåt, granska, neka, sanera (redigera argument och fortsätt), väntar-på-godkännande (håll irreversibla steg för en människa), och kostnadstak (tvinga stopp av en körning vid en utgiftstak). En kapad agent kan inte nå ett verktyg, en värd, eller en dollar du aldrig listat.
4. Skyddsräcken för utdata — svaret granskas på vägen ut för osäker utdata, PII och hemligheter, med förankringskontroller. Detta är lagret som fångar EchoLeaks exfiltrerings-URL innan det lämnar.
5. Anomalidetektering — beteendebaslinjer flaggar vad statiska regler inte kan förutsäga: samma samtal som hamras i ett snävt fönster, utgiftsökning mot en inlärd timme-per-vecka-baslinje, en verktyg-till-verktyg-övergång som arbetsytan aldrig har gjort.
6. Signerad granskning — varje matchning, dom, godkännande och policyändring hamnar i en manipulationssäker logg, korrelerad per agentkörning och session, exporterbar som bevis.
Den avgörande egenskapen är placering. Dessa kontroller finns vid gatewayen, i request-sökvägen, så de binder till autentiseringsuppgifter snarare än applikationskod — verkställbar över alla team och ramverk, utan att behöva skriva om agenter.
Vi rättar inte våra egna läxor.
Säkerhetspåståenden är värda exakt lika mycket som bevisen bakom dem, så vi lägger våra öppet. OrcaRouters Guardrails and Firewall levereras med en utvärderingsdräkt som betygsätter dem mot mer än 80 öppen källkods-red-team-korpusar — varje citerad och licensierad:
HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024) och AdvBench (Zou et al., 2023) för skadligt beteende och jailbreak-robusthet;
NVIDIA's garak (Apache-2.0), den öppna LLM-sårbarhetsskannern, för injektions- och kodningsattacker;
AgentDojo (NeurIPS 2024) — riktmärket för agent-prompt-injektion som US och UK AI Safety Institutes använde i gemensam red-teaming — för att specifikt betygsätta action-plane-brandväggen;
TruthfulQA och andra för grounding och hallucination.
OrcaRouter själv integrerar öppna verktyg direkt: OSV för CVE:er för beroenden och Semgrep för kod som passerar en prompt. Ingen svart låda. Inget "lita på oss."

Byggd för den kommande revisionen
Den den 2 augusti 2026, blir EU:s AI-förordning fullt tillämplig, och ”visa mig” ersätter ”säg mig” som regulatorisk baslinje. Samma bevisinstinkt sprider sig genom SOC 2‑omfattningar, cyberförsäkringsenkäter och upphandlingsgranskningar. OrcaRouter levererar 36 paket med efterlevnadsramverk — inklusive OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU:s AI‑förordning, SOC 2, HIPAA, PCI DSS och GDPR — som materialiserar kontroller i din arbetsyta och genererar signerade bevis. Ett välplacerat kontrollager producerar intyget för alla dem på en gång.
Vad lanseras idag — och varför det är gratis
OrcaRouter Firewall + Guardrails är nu gratis för alla användare. Samma API-nyckel. En knapp i din konsol. Ingen kod att ändra.
Vi gjorde dem fria medvetet. Rapportens data är otvetydig på denna punkt: förbud utan asfalterad väg producerar mer skugga-AI, inte mindre — och skugga-AI driver redan en av fem intrång till en premie på 670 000 dollar (IBM, 2025). Botemedlet som fungerar är lika mycket ekonomiskt som tekniskt: gör den styrda vägen till den enklaste vägen. En kontroll som du måste betala extra för, integrera för hand och motivera inför en budgetkommitté är en kontroll som de flesta team kommer att hoppa över — och att hoppa över den är precis hur organisationer hamnar i att förklara incidentrapporterna som denna rapport beskrev i förväg.
Så det finns inget att integrera och inget att köpa. Du kopplar Guardrails och en Firewall-policy till nyckeln du redan använder och följer utrullningen som överlever kontakt med produktion: observera(kör i granskningsläge och låt din verkliga trafik skriva baslinjen), skugga(kör den verkliga policyn i skulle-blockera-läge tills falska positiva går mot noll), sedan tvinga(växla beslut live, med mänskligt godkännande reserverat för det verkligt irreversibla). De flesta team konverterar på veckor — och behåller kontrollerna på.
Slutsatsen
Hotbilden för 2026 är inte en anledning att sakta ner AI-antagandet. Det är driftsmanualen för att överleva det. Varje attack i denna rapport besegrar obegränsad auktoritet och dör mot begränsad, övervakad, granskad auktoritet — och den egenskapen är byggbar nu, vid gatewayen, på veckor, gratis.
Läs hela rapporten: The AI Threat Report 2026 · Slå på den: OrcaRouter 🐋
