
AI stało się powierzchnią ataku w 2025 roku. W 2026 roku udostępniamy obronę za darmo.
Wstrzykiwanie promptów jest obecnie największym ryzykiem dla aplikacji LLM – i nie można go naprawić za pomocą łatki. Dziś OrcaRouter Security Research udostępnia nasz agent Firewall oraz Guardrails wejścia/wyjścia za darmo każdemu użytkownikowi: ten sam klucz API, jeden przełącznik w konsoli, bez zmian w kodzie. To jest krajobraz zagrożeń, który uczynił to niepodlegającym negocjacjom – oraz architektura, która go powstrzymuje.
Autor: OrcaRouter Security Research · Czerwiec 2026
W czerwcu 2025 r. atakujący wyeksfiltrowali dane firmowe z Microsoft 365 Copilot. Ofiara nie zrobiła nic złego. Nie kliknęła w link, nie otworzyła załącznika ani nie zatwierdziła monitu. Otrzymała e-mail. Jej asystent AI później go przeczytał – i wykonał ukryte w nim instrukcje. Łańcuch, ujawniony przez Aim Security jako EchoLeak (CVE-2025-32711), zebrał poufne informacje kontekstowe z poczty, plików i historii czatu, a następnie przemycił je za pomocą automatycznie wczytującego się adresu URL obrazu. Zero kliknięć.
EchoLeak nie był wyjątkiem. To był przedsmak. Rok później możemy otwarcie powiedzieć, co obecnie ukazuje publiczny rejestr incydentów: wasze systemy AI stanowią waszą powierzchnię ataku, a większość organizacji nie widzi ataków na nie. Dzisiaj publikujemy The AI Threat Report 2026 i jednocześnie udostępniamy dwie opracowane przez nas zabezpieczenia, aby powstrzymać te ataki — bezpłatnie, na bramie, dla każdego użytkownika OrcaRouter.
Rok, w którym ataki stały się agentowe – a wycieki przemysłowe.
Zapis incydentu z 2026 roku czyta się jak test wytrzymałości każdego założenia, na którym zbudowano bezpieczeństwo przedsiębiorstwa:
- Chat & Ask AI pozostawił około 300 milionów prywatnych wiadomości czatowych od ponad 25 milionów użytkowników ujawnionych przez błędną konfigurację Firebase (404 Media; Malwarebytes, Jan 2026).
- Sears Home Services ujawniło 3,7 miliona transkryptów czatów AI i nagrań rozmów — nazwiska, adresy, e-maile — obejmujące lata 2024–2026 (ExpressVPN; Cybernews, marzec 2026).
- Atakujący połączył pojedyncze CVE (CVE-2026-39987 w narzędziu marimo notebook) w aktywnego agenta LLM, który wyodrębnił poświadczenia chmurowe, pobrał klucz SSH z AWS Secrets Manager i wyniósł całą wewnętrzną bazę danych PostgreSQL w mniej niż dwie minuty (Sysdig; The Hacker News, May 2026).
- Microsoft i Salesforce wydały poprawki dla luk w zabezpieczeniach dotyczących wycieku danych przez agenta AI. W przypadku CVE-2026-21520, zatrute pole w SharePoint sprawiło, że Copilot wysłał e-mailem dane klientów do atakującego — a dane opuściły system nawet po tym, jak mechanizm bezpieczeństwa oznaczył atak (Dark Reading).
Ekonomia kryjąca się za tymi nagłówkami odwróciła się na korzyść atakujących. Telemetria z produkcyjnych aplikacji LLM pokazuje, że średni udany atak kończy się w42 sekundy, przy czym90% z nich wycieka wrażliwe dane (Pillar Security).13% organizacji zostało już naruszonych poprzez model lub aplikację AI — a97% z nich nie miało podstawowych kontroli dostępu do AI (IBM, 2025). Podsumowanie OWASP za pierwszy kwartał 2026 podało liczby dotyczące trendu: ataki typu prompt injection wzrosły o 340% rok do roku.
A nowa klasa strat nie wymaga w ogóle naruszenia. Denial-of-wallet — porwany lub niekontrolowany agent, który po prostu wydaje — został zaobserwowany, jak wypala 46 000 dolarów dziennie (Sysdig, "LLMjacking"). Żadne dane nie są kradzione. Jest tylko rachunek.

Dlaczego twój obecny stack nie widzi nic z tego
Tradycyjne zabezpieczenia zakładają granicę: zaufane wewnątrz, niezaufane na zewnątrz, kontrole na styku. Modele językowe niwelują tę granicę, ponieważ wejście modelu jest jednocześnie jego programowaniem. Każdy e-mail, dokument, strona internetowa i wynik narzędzia, które agent czyta, mogą zawierać instrukcje, które wykona. Nie ma niezawodnego, ogólnego mechanizmu, za pomocą którego dzisiejsze modele oddzielają treść do przetworzenia od poleceń do wykonania.
Dlatego właśnie prompt injection zajmuje pierwszą pozycję na liście OWASP Top 10 dla aplikacji LLM — i dlaczego nie zostanie "załatany" tak, jak załatuje się przepełnienie bufora. Jest to właściwość strukturalna tego medium. Zapora sieciowa aplikacji webowej sprawdza żądanie i widzi całkowicie poprawne wywołanie API; atak tkwi w słowach. Twoje kontrole na żądanie przechodzą każdy krok ataku łańcuchowego, ponieważ szkoda tkwi w sekwencji — objętość, powtarzalność i wydatki w czasie — nie w pojedynczym wywołaniu.
Wniosek jest niewygodny, ale jasny: Bezpieczeństwo AI nie jest problemem szkolenia modeli. To problem architektury — i jest rozwiązywalny z tą samą dyscypliną, którą przedsiębiorstwa już stosują do każdego innego systemu produkcyjnego.

Obrona jest architektoniczna: dwie płaszczyzny, sześć warstw, przy bramie.
Każdy atak powyżej udaje się przeciwko nieograniczonej władzy i zawodzi przeciwko ograniczonej, kontrolowanej, audytowanej władzy. Powstrzymanie ich wymaga kontrolowania dwóch odrębnych płaszczyzn:
Płaszczyzna treści — to, co model czyta i zapisuje. To jest zadanie Guardrails.
Płaszczyzna działania — co agent robi: narzędzia, które wywołuje, sieci, do których dociera, pieniądze, które wydaje. To zadanie należy do Firewall.
Obrona, która obserwuje tylko jedną płaszczyznę, przegapi łańcuchowe ataki trafiające na nagłówki, ponieważ najbardziej niszczycielskie incydenty przekraczają obie: wstrzyknięcie pojawia się jako treść, a następnie realizuje się jako działanie. OrcaRouter umieszcza sześć niezależnych, podlegających audytowi warstw między żądaniem a żalem.
1. Tożsamość z zakresem — każdy agent wywołuje przez własny klucz, który zawiera dozwolone modele, listę dozwolonych IP, twardy limit wydatków i datę wygaśnięcia. Żądanie spoza zakresu jest odrzucane zanim jakakolwiek treść zostanie odczytana.
2. Zabezpieczenia wejściowe – reguły dotyczące iniekcji i jailbreak, wykrywanie i maskowanie PII, blokowanie tajemnic oraz semantyczny sędzia LLM, który wyłapuje to, czego regex nie jest w stanie.
3. Zapora działań — każde wywołanie narzędzia, wysłanie MCP i wychodzący ruch sieciowy są oceniane względem uporządkowanej polityki domyślnie odrzucającej z sześcioma werdyktami: zezwolenie, audyt, odmowa, oczyszczenie (usuń argumenty i kontynuuj), oczekujące na zatwierdzenie (wstrzymaj nieodwracalne kroki dla człowieka), i limit kosztów (twarde zatrzymanie przebiegu przy limicie wydatków). Porwany agent nie może dosięgnąć narzędzia, hosta ani dolara, którego nigdy nie wymieniłeś.
4. Ograniczniki wyjścia — odpowiedź jest sprawdzana przy wychodzeniu pod kątem niebezpiecznych treści, PII i tajemnic, z kontrolami zgodności. To jest warstwa, która przechwytuje adres URL eksfiltracji EchoLeak zanim opuści.
5. Wykrywanie anomalii — linie bazowe zachowań wskazują to, czego statyczne reguły nie są w stanie przewidzieć: to samo wywołanie wielokrotnie powtarzane w krótkim oknie czasowym, gwałtowny wzrost wydatków w porównaniu z wyuczoną linią bazową dla danej godziny tygodnia, przejście między narzędziami, którego obszar roboczy nigdy nie dokonał.
6. Podpisany audyt — każde dopasowanie, werdykt, zatwierdzenie i zmiana polityki trafia do śladu odpornego na manipulacje, skorelowanego według przebiegu agenta i sesji, możliwego do wyeksportowania jako dowód.
Decydującą właściwością jest umiejscowienie. Te mechanizmy kontrolne działają na bramie, w ścieżce żądania, więc wiążą się z poświadczeniami, a nie z kodem aplikacji — egzekwowalne w każdym zespole i frameworku, bez przepisywania agentów.
Nie oceniamy własnych zadań domowych.
Twierdzenia dotyczące bezpieczeństwa są warte dokładnie tyle, ile stojące za nimi dowody, więc nasze stawiamy na widoku. OrcaRouter's Guardrails i Firewall są wyposażone w zestaw ewaluacyjny, który ocenia je w stosunku do ponad 80 otwartoźródłowych korpusów red-team — każdy zacytowany i licencjonowany:
HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), i AdvBench (Zou et al., 2023) dla odporności na szkodliwe zachowania i jailbreak;
garak firmy NVIDIA (Apache-2.0), otwarty skaner podatności LLM, do ataków iniekcji i kodowania;
AgentDojo (NeurIPS 2024) – benchmark do wstrzykiwania promptów agentów, którego amerykański i brytyjski Instytut Bezpieczeństwa AI użyły we wspólnym red teamingu – do oceny konkretnie zapory action-plane;
TruthfulQA oraz inne do ugruntowania i halucynacji.
OrcaRouter sam w sobie integruje bezpośrednio otwarte narzędzia: OSV do CVE zależności oraz Semgrep do kodu, który przechodzi przez prompt. Bez czarnej skrzynki. Bez "zaufaj nam."

Stworzony z myślą o nadchodzącym audycie
W dniu 2 sierpnia 2026 roku unijny akt o sztucznej inteligencji (EU AI Act) w pełni zacznie obowiązywać, a "show me" zastępuje "tell me" jako punkt odniesienia regulacyjnego. Ten sam instynkt dowodowy rozprzestrzenia się na zakresy SOC 2, kwestionariusze ubezpieczeń cybernetycznych i przeglądy zakupowe. OrcaRouter dostarcza 36 pakietów zgodności z frameworkami — w tym OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS i GDPR — które materializują kontrole w Twojej przestrzeni roboczej i generują podpisane dowody. Jedna dobrze umieszczona warstwa kontrolna generuje zaświadczenie dla wszystkich naraz.
Co dziś startuje — i dlaczego jest darmowe
OrcaRouter Firewall + Guardrails są teraz darmowe dla każdego użytkownika.Ten sam klucz API. Jeden przełącznik w konsoli. Żadnych zmian w kodzie.
Umyślnie udostępniliśmy je za darmo. Dane raportu są jednoznaczne w tej kwestii: zakaz bez utwardzonej drogi prowadzi do więcej shadow AI, a nie mniej — a shadow AI już napędza jedno na pięć naruszeń z premią w wysokości 670 000 $ (IBM, 2025). Skuteczne remedium jest zarówno ekonomiczne, jak i techniczne: uczyń nadzorowaną ścieżkę najłatwiejszą ścieżką. Kontrola, za którą trzeba dodatkowo zapłacić, zintegrować ręcznie i uzasadnić komitetowi budżetowemu, jest kontrolą, którą większość zespołów pominie — a pomijanie jej to dokładnie sposób, w jaki organizacje kończą, tłumacząc raporty incydentów, które ten raport opisał z wyprzedzeniem.
Tak więc nie ma nic do integracji i nic do kupienia. Dołączasz Guardrails oraz politykę Firewall do klucza, którego już używasz i postępujesz zgodnie z wdrożeniem, które przetrwa kontakt z produkcją: obserwuj (uruchom w trybie audytu i pozwól swojemu rzeczywistemu ruchowi zapisać linię bazową), cieniuj (uruchom rzeczywistą politykę w trybie would-block, aż fałszywe alarmy zbliżą się do zera), następnie wymuszaj (przełączaj werdykty na żywo, z zastrzeżeniem zgody człowieka dla rzeczywiście nieodwracalnych). Większość zespołów konwertuje w ciągu tygodni — i pozostawia włączone kontrole.
Najważniejsze
Krajobraz zagrożeń na rok 2026 nie jest powodem do spowalniania wdrażania sztucznej inteligencji. To podręcznik przetrwania w tych warunkach. Każdy atak opisany w tym raporcie pokonuje nieograniczoną władzę i ginie w zderzeniu z władzą określoną, kontrolowaną i audytowaną – a tę właściwość można zbudować już teraz, na bramie, w ciągu tygodni, za darmo.
Przeczytaj pełny raport: The AI Threat Report 2026 · Włącz: OrcaRouter 🐋
