ИИ стал поверхностью атак в 2025 году. В 2026 году мы делаем защиту бесплатной.

ИИ стал поверхностью атак в 2025 году. В 2026 году мы делаем защиту бесплатной.

Дата публикации

Назад ко всем статьям

Инъекция промптов теперь является риском №1 для приложений на основе LLM — и ее нельзя исправить с помощью патчей. Сегодня OrcaRouter Security Research выпускает наш агентский Firewall и входные/выходные Guardrails бесплатно для каждого пользователя: тот же ключ API, один переключатель в вашей консоли, никаких изменений кода. Это ландшафт угроз, который сделал это обязательным условием — и архитектура, которая его сдерживает.

От OrcaRouter Security Research · Июнь 2026


В июне 2025 года злоумышленники похитили корпоративные данные из Microsoft 365 Copilot. Жертва не сделала ничего неправильного. Они не переходили по ссылкам, не открывали вложения и не подтверждали запросы. Они получили электронное письмо. Их ИИ-помощник позже прочитал его — и выполнил инструкции, скрытые внутри. Эта цепочка, раскрытая компанией Aim Security как EchoLeak (CVE-2025-32711), собрала конфиденциальный контекст из почты, файлов и истории чатов и вывела его через автоматически загружаемый URL изображения. Ноль кликов.

EchoLeak не был исключением. Это было предвестие. Год спустя мы можем прямо сказать то, что теперь показывает публичный реестр инцидентов: ваши AI-системы — это ваша поверхность атаки, и большинство организаций не видят атак против них. Сегодня мы публикуем The AI Threat Report 2026 и, вместе с ним, выпускаем два средства контроля, которые мы создали для сдерживания этих атак — бесплатно, на шлюзе, для каждого пользователя OrcaRouter.

Год, когда атаки стали агентными — а утечки — промышленными

Запись инцидента 2026 года читается как стресс-тест каждого предположения, на котором строилась корпоративная безопасность:

- Chat & Ask AI оставило примерно 300 миллионов личных чат-сообщений от более чем 25 миллионов пользователей обнаруженными из-за неправильной конфигурации Firebase (404 Media; Malwarebytes, янв. 2026).

- Sears Home Services раскрыла 3,7 миллиона стенограмм AI-чатов и записей звонков — имена, адреса, электронные письма — охватывающие период с 2024 по 2026 год (ExpressVPN; Cybernews, март 2026).

- Злоумышленник объединил одну уязвимость (CVE-2026-39987 в инструменте marimo notebook) в живого LLM-агента, который извлек облачные учетные данные, получил SSH-ключ из AWS Secrets Manager и выгрузил всю внутреннюю базу данных PostgreSQL менее чем за две минуты (Sysdig; The Hacker News, май 2026).

- Microsoft и Salesforce оба выпустили патчи для уязвимостей утечки данных AI-агентов. В CVE-2026-21520, отравленное поле SharePoint направило Copilot на отправку данных клиентов по электронной почте злоумышленнику — и данные покинули даже после того, как механизм безопасности отметил атаку (Dark Reading).

Экономика, стоящая за этими заголовками, изменилась в пользу атакующих. Телеметрия от производственных LLM-приложений показывает, что средняя успешная атака завершается за 42 секунды, при этом 90% из них утекают конфиденциальные данные (Pillar Security). 13%организаций уже были взломаны через ИИ-модель или приложение — и 97% из них не имели базовых средств контроля доступа к ИИ (IBM, 2025). Сводка OWASP за первый квартал 2026 года привела цифры по этой тенденции: атаки с инъекцией промптов выросли на 340% в годовом исчислении.

А новый класс потерь вообще не требует взлома. Denial-of-wallet — захваченный или неуправляемый агент, который просто тратит — был замечен за сжиганием 46 000 долларов в день (Sysdig, "LLMjacking"). Никакие данные не украдены. Есть только счет.


Почему ваш текущий стек не видит ничего из этого

Традиционная безопасность предполагает границу: доверенное внутри, недоверенное снаружи, контроль на стыке. Языковые модели растворяют эту границу, потому что входные данные модели также являются ее программированием. Каждый email, документ, веб-страница и результат работы инструмента, которые читает агент, могут содержать инструкции, которым он будет следовать. Не существует надежного общего механизма, с помощью которого современные модели отделяют контент для обработки от команд для выполнения.

Вот почему внедрение промптов занимает #1 position in the OWASP Top 10 for LLM Applications — и почему оно не будет "исправлено" так, как исправляется переполнение буфера. Это структурное свойство среды. Ваш брандмауэр веб-приложений проверяет запрос и видит совершенно правильный вызов API; атака заключается в словах. Ваши проверки на запрос проходят каждый шаг цепочной атаки, потому что ущерб живет в последовательности — объем, повторение и расходы со временем — а не в одном вызове.

Вывод неприятен, но очевиден: Безопасность ИИ — не проблема обучения модели. Это проблема архитектуры — и эта проблема решается с помощью той же дисциплины, которую предприятия уже применяют к любой другой производственной системе.


Защита является архитектурной: две плоскости, шесть уровней, на шлюзе.

Любая вышеуказанная атака успешна против неограниченной власти и неэффективна против ограниченной, контролируемой, проверяемой власти. Сдерживание их требует контроля двух различных плоскостей:

Плоскость содержания — то, что модель читает и пишет. Это задача Guardrails.

Плоскость действий — то, что агент делает: инструменты, которые он вызывает, сети, к которым он подключается, деньги, которые он тратит. Это работа Firewall.

Защита, которая следит только за одной плоскостью, пропустит цепные атаки, попадающие в заголовки, потому что самые разрушительные инциденты пересекают обе: инъекция приходит как содержимое, затем обналичивается как действие. OrcaRouter размещает шесть независимых, проверяемых слоёв между запросом и сожалением:

1. Идентичность с областью действия — каждый агент действует через свой собственный ключ, который несет разрешенные модели, список разрешенных IP-адресов, жесткий лимит расходов и срок действия. Запрос вне области действия умирает до того, как будет прочитано любое содержимое.

2. Входные защитные правила — правила инъекций и джейлбрейков, обнаружение и маскировка PII, блокировка секретов, и семантический LLM-судья, который ловит то, что не может regex.

3. Брандмауэр действий — каждый вызов инструмента, отправка MCP и исходящий сетевой трафик оцениваются на основе упорядоченной политики с запретом по умолчанию сшестью вердиктами: разрешить, аудит, запретить, санировать (редактировать аргументы и продолжить), ожидание одобрения (приостановить необратимые шаги для человека) и ограничение затрат (немедленно остановить выполнение при достижении лимита расходов). Захваченный агент не может получить доступ к инструменту, хосту или доллару, который вы не указали.

4. Выходные защитные меры — ответ проверяется на выходе на предмет небезопасного вывода, PII и секретов, с проверками на обоснованность. Это уровень, который перехватывает URL эксфильтрации EchoLeak прежде чем он покинет.

5. Обнаружение аномалий — поведенческие базовые линии отмечают то, что статические правила не могут предсказать: один и тот же вызов, повторяющийся в узком временном окне, скачок расходов относительно изученного базового уровня дня недели, переход от инструмента к инструменту, который рабочее пространство никогда не совершало.

6. Подписанный аудит — каждое совпадение, вердикт, одобрение и изменение политики попадают в защищённую от несанкционированного доступа цепочку, сопоставляемую по запускам агента и сеансам, экспортируемую как доказательство.

Решающим свойством является размещение. Эти элементы управления находятся на шлюзе, в пути запроса, поэтому они привязываются к учетным данным, а не к коду приложения — это применимо ко всем командам и фреймворкам, без переписывания агентов.

Мы не проверяем свою домашнюю работу.

Заявления о безопасности стоят ровно столько, сколько доказательства за ними, поэтому мы делаем наши открытыми. OrcaRouter's Guardrails и Firewall поставляются с оценочным инструментом, который оценивает их по более чем 80 корпусам red-team с открытым исходным кодом — каждый из них процитирован и лицензирован:

HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), и AdvBench (Zou et al., 2023) для оценки вредоносного поведения и устойчивости к джейлбрейку;

NVIDIA garak (Apache-2.0), открытый сканер уязвимостей LLM, для атак внедрения и кодирования;

AgentDojo (NeurIPS 2024) — бенчмарк для атак через внедрение подсказок агентов, который использовали Институты безопасности ИИ США и Великобритании в совместном красном командировании — чтобы оценить брандмауэр плана действий;

TruthfulQA и другие для обоснования и галлюцинации.

OrcaRouter сам интегрирует открытые инструменты напрямую: OSV для CVE зависимостей и Semgrep для кода, который проходит через запрос. Никакого черного ящика. Никакого "поверьте нам".


Создано для предстоящего аудита

С 2 августа 2026 года, вступает в полную силу Закон ЕС об ИИ, и «покажи мне» заменяет «расскажи мне» в качестве регуляторного базиса. Тот же доказательственный инстинкт распространяется на области SOC 2, анкеты по киберстрахованию и проверки закупок. OrcaRouter поставляет 36 пакетов фреймворков соответствия — включая OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS и GDPR — которые материализуют контроли в вашем рабочем пространстве и генерируют подписанные доказательства. Один хорошо размещенный слой контролей создает аттестацию для всех них сразу.


Что запускается сегодня — и почему это бесплатно

OrcaRouter Firewall + Guardrails теперь бесплатны для каждого пользователя. Тот же API-ключ. Один переключатель в вашей консоли. Никаких изменений кода.

Мы сделали их бесплатными намеренно. Данные отчета недвусмысленны: запрет без проложенной дороги производит больше теневого ИИ, не меньше — и теневой ИИ уже вызывает одна из пяти утечек с премией в $670,000 (IBM, 2025). Средство, которое работает, является как экономическим, так и техническим: сделайте управляемый путь самым легким путем. Контроль, за который нужно платить дополнительно, интегрировать вручную и обосновывать перед бюджетным комитетом, — это контроль, который большинство команд пропустят, — и именно пропуская его, организации в итоге объясняют отчеты об инцидентах, которые этот отчет описал заранее.

Так что нечего интегрировать и нечего покупать. Вы прикрепляете Guardrails и политику Firewall к ключу, который уже используете, и следуете развертыванию, которое выживает при контакте с продакшеном: наблюдайте (запустите в режиме аудита и дайте вашему реальному трафику создать базовый уровень), затеняйте (запустите реальную политику в режиме would-block, пока ложные срабатывания не приблизятся к нулю), затем применяйте (переключайте вердикты в реальном времени, с человеческим одобрением, зарезервированным для действительно необратимых действий). Большинство команд переходят за недели — и оставляют контроли включенными.


Суть

Ландшафт угроз 2026 года — не повод замедлять внедрение ИИ. Это руководство по выживанию в нём. Каждая атака, описанная в этом отчёте, побеждает несогласованную власть и разбивается о власть ограниченную, контролируемую и проверяемую — и это свойство можно реализовать уже сейчас, на шлюзе, за несколько недель, бесплатно.

Прочитайте полный отчет: Отчет об угрозах ИИ 2026 · Включите: OrcaRouter 🐋

© 2026 OrcaRouter