
AI在2025年成為攻擊面。到2026年,我們將使防禦免費。
提示注入已成為大型語言模型應用的首要風險,且此漏洞無法透過修補程式解決。今日,OrcaRouter安全研究團隊正式推出智能體防火牆與輸入/輸出防護欄,全面免費開放給所有使用者:使用同一組API金鑰,在主控台進行一鍵切換,不需修改任何程式碼。這份威脅格局使其成為不容妥協的安全方案——而這套架構正是應對該威脅的完整結構。
由 OrcaRouter Security Research · 2026年6月
2025年6月,攻击者從 Microsoft 365 Copilot 竊取了企業資料。受害者完全沒有任何操作失誤:沒有點擊連結、沒有開啟附件、也沒有核准任何提示。他們只是收到一封電子郵件,而其 AI 助理隨後讀取了這封郵件——並執行了隱藏在郵件中的指令。這條攻擊鏈由 Aim Security 揭露,命名為 EchoLeak (CVE-2025-32711),它從郵件、檔案及聊天記錄中收集敏感上下文,並透過一個自動載入的圖片網址將資料偷渡出去。零點擊。
EchoLeak 並非異類,而是預告。一年後的今天,我們可以直言不諱地說出公眾事件紀錄已證明的事實:你的人工智慧系統就是你的攻擊面,而且多數組織無法看見針對它們的攻擊。今天我們發布The AI Threat Report 2026,同時公開我們為遏制這類攻擊而打造的兩項控制機制——免費提供給每個 OrcaRouter 使用者,並部署在閘道端。
攻擊轉向自主化的一年——而洩露則走向工業化
2026年的事件記錄讀起來像是對企業安全所依據的每個假設的壓力測試:
- Chat & Ask AI 留下了大約 3億條私人聊天訊息,來自超過2500萬用戶 因Firebase配置錯誤而洩露(404 Media;Malwarebytes,2026年1月)。
- Sears Home Services 曝光 370萬條AI聊天記錄和通話錄音 — 姓名、地址、電子郵件 — 涵蓋2024年至2026年(ExpressVPN;Cybernews,2026年3月)。
- 攻擊者將一個 CVE(CVE-2026-39987在 marimo notebook 工具中)引入一個即時 LLM 代理,該代理提取了雲端憑證、從 AWS Secrets Manager 拉取了一個 SSH 金鑰,並竊取了在兩分鐘內整個內部 PostgreSQL 數據庫(Sysdig; The Hacker News,2026 年 5 月)。
- Microsoft 與 Salesforce皆已針對 AI 代理資料外洩漏洞發布修補程式。在 CVE-2026-21520,一個被污染的 SharePoint 欄位引導 Copilot 將客戶資料以電子郵件發送給攻擊者——而這些資料流出即使安全機制已標記此攻擊後(Dark Reading)。
這些頭條新聞背後的經濟態勢已逆轉為對攻擊者有利。來自生產級LLM應用的遙測數據顯示,平均成功攻擊在42秒,其中90%的攻擊導致敏感數據洩露(Pillar Security)。13%的組織已通過AI模型或應用程式遭到入侵——而且其中97%缺乏基本的AI存取控制(IBM,2025)。OWASP的2026年第一季總括報告顯示了這一趨勢的數據:提示注入攻擊同比增長340%。
而一种新的损失类别根本不需要任何入侵。拒绝钱包——一个被劫持或失控的代理,仅仅花费——已被观察到每日烧掉每天46,000美元(Sysdig, "LLMjacking")。没有数据被窃取。只有一张账单。

為什麼你目前的技術棧無法看到任何內容?
傳統安全假設存在一個邊界:內部可信,外部不可信,在介面處進行控制。語言模型消解了這個邊界,因為 模型的輸入也就是其程式指令。 智能體讀取的每封電子郵件、文件、網頁和工具結果都可能包含它會遵循的指令。目前沒有可靠的通用機制能讓模型區分 待處理的內容 與 應遵守的命令。
這就是為什麼提示注入佔據了#1 position in the OWASP Top 10 for LLM Applications——以及為什麼它不會像修補緩衝區溢位那樣被「修補」。這是該媒介的結構性屬性。你的網頁應用程式防火牆檢查請求,看到的是完全有效的API呼叫;攻擊隱藏在字詞之中。你的逐請求檢查通過了連鎖攻擊的每一步,因為損害存在於序列——數量、重複和時間消耗——而不是任何單一呼叫中。
這個結論令人不安但明確:AI安全性不是模型訓練問題,而是架構問題——而且可以透過企業已應用於其他所有生產系統的相同紀律來解決。

防禦是架構性的:兩個平面、六個層次,在閘道處。
所有上述攻擊在面對無範圍限制的權限時都會成功,而在面對有範圍、受監管、經審計的權限時則會失敗。要遏制它們,就需要控制 兩個不同的層面:
內容平面—模型讀取和寫入的內容。這是Guardrails。
行动平面——代理所做的事:它调用的工具、它访问的网络、它花费的金钱。这就是防火墙的工作。
只監視單一平面的防禦方式,將會錯過那些能登上頭條的連鎖攻擊,因為最具破壞性的事件往往橫跨兩者:注入以內容的形式抵達,然後以行動的形式兌現。OrcaRouter 在請求與遺憾之間,設置了六個獨立且可稽核的層級:
1. 範圍化身份 —每個代理通過自己的金鑰進行呼叫,該金鑰攜帶允許的模型、IP允許清單、硬性支出上限以及到期時間。超出範圍的請求在讀取任何內容之前即被終止。
2. 輸入護欄 — 注入與越獄規則、PII檢測與遮罩、秘密阻擋,以及語意LLM判斷器,能捕捉正則表達式無法捕捉的內容。
3. 動作防火牆——每次工具呼叫、MCP 分派與網路出口都依據有序且預設拒絕的策略進行裁決,並給出六種裁決結果:允許、稽核、拒絕、淨化(遮罩引數後繼續執行)、待核准(暫停不可逆步驟以等候人工處理)與成本上限(在達到花費上限時硬性停止執行)。遭劫持的代理無法觸及你從未列出的工具、主機或任何資金。
4. 輸出護欄 — 回覆在發送前會經過安全輸出、個人識別資訊(PII)和機密資訊的篩查,並進行基礎檢查。這一層能夠攔截 EchoLeak 的資料外洩網址 在它離開之前。
5. 異常偵測 —行為基準標記出靜態規則無法預測的情況:同一通電話在短時間內密集撥打、花費對比學習到的每週同時間基準而激增、工作空間從未做過的工具到工具轉換。
6. 簽署的稽核 — 每一次比對、裁決、核准及政策變更均記錄於防篡改追蹤中,並按代理程式執行與工作階段進行關聯,可匯出作為證據。
决定性的属性是放置位置。这些控制存在于网关中,位于请求路径上,因此它们绑定到凭据而不是应用程序代码 ——可在每个团队和框架中强制执行,无需代理重写。
我們不給自己的作業打分
安全聲明的價值完全取決於其背後的證據,因此我們公開我們的證據。OrcaRouter的Guardrails和Firewall附帶一個評估工具,該工具對它們進行評分,根據超過80個開源紅隊語料庫 — 每個都已引用並獲得授權:
HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024),和 AdvBench (Zou et al., 2023) 用於有害行為與越獄魯棒性;
NVIDIA的garak (Apache-2.0),開放式LLM漏洞掃描器,針對注入攻擊和編碼攻擊;
AgentDojo(NeurIPS 2024)——美國和英國人工智慧安全研究所在聯合紅隊演練中使用的提示注入基準測試——專門用於評估行動計劃防火牆;
TruthfulQA 以及其他用於接地和幻覺的
OrcaRouter 本身直接整合開放工具: OSV 用於依賴項的 CVE 和 Semgrep 用於傳遞提示的程式碼。沒有黑箱。沒有「信任我們」。

為即將到來的審計而打造
在 2026年8月2日,歐盟人工智慧法案全面適用,而「展示給我」取代「告訴我」成為監管基準。同樣的證據本能正蔓延到 SOC 2 範圍、網路保險問卷和採購審查。OrcaRouter 提供 36 個合規框架套件 — 包括 OWASP LLM Top 10、NIST AI RMF、ISO/IEC 42001、歐盟人工智慧法案、SOC 2、HIPAA、PCI DSS 和 GDPR — 這些將控制措施具體化到您的工作空間並生成簽名證據。一個精心佈置的控制層即可一次性為所有這些產生認證。
今天推出了什麼——以及為什麼它是免費的
OrcaRouter Firewall + Guardrails 现已对每位用户免费提供。同样的API密钥。在您的控制台中一键切换。无需更改任何代码。
我們是刻意讓它們免費的。這份報告的數據在這一點上毫無歧義:沒有鋪設好道路的禁令只會產生更多影子AI,而非減少——而影子AI早已推動每五起違規事件中就有一起涉及67萬美元的額外成本(IBM, 2025)。有效的解決方案既關乎技術,也關乎經濟:讓合規的路徑成為最輕鬆的路徑。一項需要額外付費、手動整合、還要向預算委員會說明的控制措施,大多數團隊都會略過——而略過它,正是企業最終不得不解釋這份報告事先描述過的事件報告的原因。
所以沒有需要整合的東西,也沒有需要購買的東西。您將Guardrails和防火牆政策附加到您已經使用的金鑰上,並遵循能經得起生產環境考驗的佈署流程: 觀察 (以稽核模式運行,讓您的真實流量寫入基準), 模擬 (以「將封鎖」模式執行真實政策,直到誤報接近零),然後 執行 (即時翻轉判決,並保留人類審核權限給真正不可逆的操作)。大多數團隊在數週內完成轉換——並且持續保持控制。
底線
2026 年的威脅格局不該成為放緩 AI 採用的理由。它正是得以倖存的操作手冊。本報告中的每一起攻擊都能擊敗無限制的權限,卻在受到約束、監控與審計的權限面前失效——而這種特性現在就能建立,在閘道處,幾週內,免費完成。
閱讀完整報告: The AI Threat Report 2026 · 開啟: OrcaRouter 🐋
