AI는 2025년에 공격 표면이 되었습니다. 2026년에는 방어를 무료로 만들 것입니다.

AI는 2025년에 공격 표면이 되었습니다. 2026년에는 방어를 무료로 만들 것입니다.

게시일

모든 게시물로 돌아가기

프롬프트 인젝션은 이제 LLM 애플리케이션의 최대 위협으로 자리 잡았으며, 이는 패치로 해결할 수 없습니다. 오늘, OrcaRouter Security Research는 자사의 에이전트 방화벽과 입출력 가드레일을 모든 사용자에게 무료로 제공합니다: 동일한 API 키, 콘솔에서 한 번의 전환, 코드 변경 불필요. 이 위협 환경이 이를 선택이 아닌 필수로 만들었으며, 이 아키텍처가 이를 통제합니다.

OrcaRouter Security Research 작성 · 2026년 6월


2025년 6월, 공격자들이 Microsoft 365 Copilot에서 기업 데이터를 유출했습니다. 피해자는 아무 잘못도 하지 않았습니다. 링크를 클릭하거나 첨부파일을 열거나 프롬프트를 승인하지 않았습니다. 이메일 한 통을 받았습니다. 나중에 AI 어시스턴트가 그 이메일을 읽고, 그 안에 숨겨진 지시를 따랐습니다. 이 체인은 Aim Security에 의해 EchoLeak (CVE-2025-32711)로 공개되었으며, 메일, 파일, 채팅 기록에서 민감한 맥락을 수집하여 자동 로딩 이미지 URL을 통해 몰래 빼돌렸습니다. 제로 클릭이었습니다.

EchoLeak은 이상 사례가 아니었습니다. 그것은 예고편이었습니다. 1년이 지난 지금, 우리는 공개된 사고 기록이 보여주는 바를 명확히 말할 수 있습니다: 여러분의 AI 시스템은 여러분의 공격 표면이며, 대부분의 조직은 그에 대한 공격을 볼 수 없습니다. 오늘 우리는 발행합니다, The AI Threat Report 2026 그리고 그와 함께, 이러한 공격을 차단하기 위해 구축한 두 가지 제어 기능을 발표합니다 — 모든 OrcaRouter 사용자에게 게이트웨이에서 무료로 제공됩니다.

공격이 자율적으로 전환되고 — 유출이 산업화된 해

2026년 사건 기록은 기업 보안이 구축된 모든 가정에 대한 스트레스 테스트처럼 읽힙니다:

- Chat & Ask AI대략 2500만 명 이상의 사용자로부터 3억 개의 비공개 채팅 메시지Firebase 구성 오류로 인해 노출시켰습니다 (404 Media; Malwarebytes, 2026년 1월).

- Sears Home Services 노출되었다 370만 개의 AI 채팅 기록과 통화 녹음 — 이름, 주소, 이메일 — 2024년부터 2026년까지 (ExpressVPN; Cybernews, Mar 2026).

- 공격자가 단일 CVE (CVE-2026-39987 마리모 노트북 도구에서) 이를 라이브 LLM 에이전트에 연결하여 클라우드 자격 증명을 추출하고, AWS Secrets Manager에서 SSH 키를 가져온 후, 내부 PostgreSQL 데이터베이스 전체를 2분 이내에 외부로 유출했습니다 (Sysdig; The Hacker News, 2026년 5월).

- Microsoft와 Salesforce는 모두 AI 에이전트 데이터 유출 결함에 대한 패치를 출시했습니다. 에서 CVE-2026-21520, 중독된 SharePoint 필드가 Copilot을 조종하여 고객 데이터를 공격자에게 이메일로 보내도록 했으며, 데이터가 유출되었습니다 심지어 안전 메커니즘이 공격을 플래그한 후에도 (Dark Reading).

이 헤드라인들 이면의 경제학은 공격자에게 유리하게 역전되었습니다. 프로덕션 LLM 애플리케이션의 텔레메트리는 평균적인 성공적 공격이 완료되는 데 걸리는 시간은 42초, 이 중 90%가 민감 데이터를 유출하는 (Pillar Security). 13% 의 조직이 이미 AI 모델 또는 애플리케이션을 통해 침해되었으며 — 그리고 이 중 97%는 기본 AI 접근 통제가 부족했습니다 (IBM, 2025). OWASP의 2026년 1분기 요약은 추세에 대한 수치를 제시했습니다: 프롬프트 인젝션 공격이 전년 대비 340% 증가했습니다.

그리고 새로운 손실 유형은 침해가 전혀 필요하지 않습니다. 지갑 거부 — 하이재킹되거나 통제 불능 상태가 된 에이전트가 단순히 소비하는 — 가 소진하는 것이 관찰되었습니다. 하루 $46,000을 (Sysdig, "LLMjacking"). 데이터가 도난당하지 않습니다. 오직 청구서만 있습니다.


현재 스택이 왜 그것을 전혀 볼 수 없는가

전통적인 보안은 경계를 가정합니다: 내부는 신뢰할 수 있고, 외부는 신뢰할 수 없으며, 경계에 통제가 있습니다. 언어 모델은 그 경계를 해소합니다. 왜냐하면 모델의 입력이 곧 프로그래밍입니다. 모든 이메일, 문서, 웹 페이지, 그리고 에이전트가 읽는 도구 결과는 그 에이전트가 따를 명령을 포함할 수 있습니다. 오늘날의 모델이 분리하는 처리할 콘텐츠 로부터 따를 명령.

그렇기에 프롬프트 인젝션이 차지하는 OWASP Top 10 for LLM Applications에서의 #1 위치 — 그리고 왜 버퍼 오버플로우가 패치되는 방식으로 '패치'되지 않는지입니다. 이는 매체의 구조적 속성입니다. 웹 애플리케이션 방화벽이 요청을 검사하고 완벽히 유효한 API 호출로 보지만, 공격은 단어들에 있습니다. 요청별 검사가 체인 공격의 모든 단계를 통과하는데, 피해는 시퀀스 — 볼륨, 반복, 시간 대비 지출 — 어떤 단일 호출에도 있지 않습니다.

결론은 불편하지만 분명합니다: AI 보안은 모델 훈련 문제가 아닙니다. 그것은 아키텍처 문제입니다 — 그리고 기업들이 이미 다른 모든 생산 시스템에 적용하는 동일한 규율로 해결 가능합니다.


방어는 아키텍처적입니다: 두 개의 평면, 여섯 개의 계층, 게이트웨이에서.

위의 모든 공격은 범위가 없는 권한에 대해서는 성공하고, 범위가 있고 감시되고 감사된 권한에 대해서는 실패합니다. 이를 억제하기 위해 제어하는 것은두 개의 별개 평면입니다:

콘텐츠 평면 — 모델이 읽고 쓰는 것입니다. 이것은 의 역할입니다 Guardrails.

행동 평면 — 에이전트가 하는: 호출하는 도구, 연결하는 네트워크, 사용하는 비용입니다. 이것이 역할입니다 방화벽의.

단 하나의 평면만을 감시하는 방어는 헤드라인을 장식하는 연쇄 공격을 놓칠 것입니다. 가장 피해가 큰 사고는 두 가지를 모두 넘나들기 때문입니다: 인젝션이 콘텐츠로 도착한 후, 행동으로 전환됩니다. OrcaRouter는 요청과 후회 사이에 여섯 개의 독립적이고 감사 가능한 계층을 배치합니다:

1. 범위가 지정된 신원 — 모든 에이전트는 허용된 모델, IP 허용 목록, 엄격한 지출 상한, 만료 기간을 포함한 자체 키를 통해 호출합니다. 범위를 벗어난 요청은 콘텐츠를 읽기 전에 중단됩니다.

2. 입력 가드레일 — 인젝션 및 재일브레이크 규칙, PII 탐지 및 마스킹, 비밀 차단, 그리고 정규식으로는 잡을 수 없는 것을 포착하는 의미론적 LLM 판정기.

3. 작업 방화벽 — 모든 도구 호출, MCP 디스패치, 네트워크 이그레스는 순서가 지정된 기본 거부 정책과 함께 여섯 가지 판결허용, 감사, 거부, 정화 (인수 숨기고 진행), 승인 대기 (되돌릴 수 없는 단계를 사람이 처리하도록 보류), 그리고 비용 상한 (지출 상한에서 실행을 강제 중단). 하이재킹된 에이전트는 사용자가 나열하지 않은 도구, 호스트 또는 금액에 접근할 수 없습니다.

4. 출력 가드레일 — 응답은 나갈 때 안전하지 않은 출력, 개인정보, 비밀 등을 접지 검사와 함께 검열합니다. 이 층은 EchoLeak의 탈취 URL을 잡아내는 층입니다 전에나갑니다.

5. 이상 탐지 — 행동 기반 기준선은 정적 규칙이 예측할 수 없는 것을 표시합니다: 좁은 시간 창에서 반복되는 동일한 호출, 학습된 주중 시간 기준선에 비해 급증하는 지출, 작업 공간이 한 번도 수행하지 않은 도구 간 전환.

6. 서명된 감사 — 모든 매치, 판정, 승인 및 정책 변경은 변조 방지 추적에 기록되며, 에이전트 실행 및 세션별로 연관되어 증거로 내보낼 수 있습니다.

결정적인 속성은 배치입니다. 이러한 제어는 게이트웨이의 요청 경로에 위치하며, 따라서 바인딩 대상은 자격 증명(애플리케이션 코드가 아닌)이며 — 모든 팀과 프레임워크에 걸쳐 강제 가능하며, 에이전트 재작성 없이.

우리는 우리 숙제를 스스로 채점하지 않습니다.

보안 주장은 그 뒤에 있는 증거만큼만 가치가 있으므로, 우리는 우리의 주장을 공개합니다. OrcaRouter의 Guardrails 및 Firewall은 평가 도구와 함께 제공되며, 이 도구는 다음 항목에 대해 점수를 매깁니다:80개 이상의 오픈소스 레드팀 코퍼스 — 모두 인용 및 라이선스 명시:

HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), 및 AdvBench (Zou et al., 2023) 유해 행동 및 탈옥 견고성을 위한;

NVIDIA의 garak (Apache-2.0), 오픈 LLM 취약점 스캐너로서, 인젝션 및 인코딩 공격을 위한 것입니다;

AgentDojo(NeurIPS 2024) — 미국과 영국 AI 안전 연구소가 합동 레드팀에 사용한 에이전트 프롬프트 인젝션 벤치마크 — 로서, action-plane 방화벽을 구체적으로 평가하기 위한 것입니다;

TruthfulQA 및 grounding과 hallucination을 위한 기타 것들.

OrcaRouter 자체는 오픈 툴링을 직접 통합합니다: OSV 의존성 CVE용 및 Semgrep 프롬프트를 통과하는 코드용. 블랙 박스 없음. '우리를 신뢰하라' 없음.


다가올 감사를 위해 설계되었습니다

2026년 8월 2일 EU AI Act이 전면 적용된다, 그리고 'show me'가 'tell me'를 규제 기준선으로 대체합니다. 동일한 증거 본능이 SOC 2 범위, 사이버 보험 설문지, 조달 검토를 통해 확산되고 있습니다. OrcaRouter는 36개의 컴플라이언스 프레임워크 팩 — OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS, GDPR를 포함하여 — 이들은 컨트롤을 작업 공간에 구현하고 서명된 증거를 생성합니다. 잘 배치된 하나의 컨트롤 레이어가 이 모든 것에 대한 증명을 한 번에 생성합니다.


오늘 출시되는 것 — 그리고 무료인 이유

OrcaRouter Firewall + Guardrails는 이제 모든 사용자에게 무료입니다. 동일한 API 키. 콘솔에서 한 번의 전환. 변경할 코드가 없습니다.

우리는 의도적으로 그것들을 무료로 만들었습니다. 보고서의 데이터는 이 점에서 명확합니다: 포장된 길이 없는 금지는 더 많은 섀도우 AI를 낳을 뿐, 줄이지 않습니다 — 그리고 섀도우 AI는 이미 67만 달러 프리미엄으로 5건 중 1건의 침해를 주도하고 있습니다 (IBM, 2025). 효과적인 해결책은 기술적 측면만큼이나 경제적 측면도 중요합니다: 통제된 경로를 가장 쉬운 경로로 만드십시오. 추가 비용을 지불해야 하고, 수동으로 통합해야 하며, 예산 위원회에 정당화해야 하는 통제는 대부분의 팀이 건너뛰는 통제입니다 — 그리고 그 통제를 건너뛰는 것이 바로 조직이 이 보고서가 미리 설명한 사고 보고서를 설명하게 되는 방식입니다.

따라서 통합하거나 구매할 것이 없습니다. 이미 사용 중인 키에 Guardrails와 Firewall 정책을 연결하고, 실제 운영과의 접촉을 견디는 롤아웃을 따릅니다: observe (감사 모드로 실행하고 실제 트래픽이 기준을 작성하게 함), shadow (실제 정책을 would-block 모드로 실행하여 false positive가 0에 가까워질 때까지), 그 다음 enforce (실시간으로 판정을 전환하고, 진정으로 되돌릴 수 없는 경우에만 인간 승인을 예약). 대부분의 팀은 몇 주 내에 전환하며 — 제어를 계속 유지합니다.


요점

2026년 위협 환경은 AI 도입을 늦출 이유가 아닙니다. 그것은 생존을 위한 운영 매뉴얼입니다. 이 보고서의 모든 공격은 범위가 정해지지 않은 권한을 이기고, 범위가 정해지고 감독되며 감사되는 권한에 맞서 죽습니다. 그리고 그 속성은 지금, 게이트웨이에서, 몇 주 안에, 무료로 구축 가능합니다.

전체 보고서 읽기: The AI Threat Report 2026 · 켜기: OrcaRouter 🐋

© 2026 OrcaRouter