
Orca AI Incident Archive: 354 sự cố tác nhân AI thực tế, mỗi sự cố đều có bằng chứng.
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Một đội ngũ bảo mật có thể cho bạn biết chính xác mức độ một mô hình chống lại prompt injection trong môi trường kiểm thử tốt đến đâu. Điều mà gần như không ai có thể cho bạn biết là có bao nhiêu tổ chức thực sự đã bị xâm nhập bởi một agent trong tháng trước, vụ xâm nhập nào trong số đó có nạn nhân được xác nhận, và con số nào trong bài viết được trích từ nhà cung cấp chứ không phải từ cơ quan quản lý. Khoảng cách đó — giữa những gì mô hình có thể làm và những gì đã thực sự xảy ra — chính là khoảng cách mà a href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> được xây dựng để lấp đầy. Nó ra mắt vào ngày 23 tháng 9 năm 2026 và, tính đến thời điểm chốt dữ liệu ngày 22 tháng 9, lưu giữ 354 bản ghi được lấy từ 593 nguồn duy nhất.
Ghi chú về độ chính xác: mọi số liệu dưới đây đều được đọc từ bản đã công bố của chính kho lưu trữ code>dist/stats.json/code> ở phiên bản 2026-09-22 và từ trang trực tiếp. Thông báo ra mắt ngày 23 tháng 9 đã dẫn 340 bản ghi, 548 nguồn và 126 trường hợp có tổn hại đã được xác nhận; đó là các số liệu tại thời điểm đăng bài, và kho lưu trữ được cập nhật liên tục, nên hai bộ số liệu lệch nhau khoảng một ngày thu nhận. Ở những chỗ README của kho lưu trữ và trang trực tiếp của nó không khớp nhau về một con số trên huy hiệu trong quá trình phát triển, thì trang trực tiếp và bản xuất JSON là những thứ đáng tin cậy.
Kho lưu trữ thực sự chứa những gì
Đây không phải là bảng tin và cũng không phải là danh sách CVE. Mỗi mục là một tệp Markdown duy nhất với frontmatter có cấu trúc, được lưu theo tháng mà sự kiện xảy ra, và mỗi mục mang ít nhất một nguồn. Bộ dữ liệu được phát hành theo CC BY 4.0 và được nhân bản trên một kho lưu trữ công khai, nên toàn bộ có thể được clone, tạo diff và trích dẫn thay vì chụp ảnh màn hình.
Khoảng thời gian bao phủ kéo dài 22 tháng, từ một sự kiện tiền đề vào tháng 12 năm 2024 đến ngày 22 tháng 9 năm 2026, và phần phân bố chính là phần thú vị. Mức độ nghiêm trọng chia thành 45 nghiêm trọng, 139 cao, 77 trung bình, 8 thấp và 85 thông tin. Độ tin cậy của nguồn chia thành 302 hạng A, 47 hạng B, 2 hạng C và 3 hạng D. Tác hại thực tế được xác nhận được ghi nhận cho 127 bản ghi, được loại trừ rõ ràng cho 142, và để null cho 85.
Ba con số cuối cùng đó chính là lý do kho lưu trữ này đáng được đọc kỹ thay vì đọc lướt. Con số 354 bản ghi không phải là con số 354 sự cố. Chỉ 138 trong số đó được phân loại là sự cố; phần còn lại là công bố lỗ hổng, trình diễn nghiên cứu, báo cáo mối đe dọa và động thái chính sách. Đếm gộp cả năm loại lại với nhau chính là cách một con số giật tít trở nên sai lệch, đó là lý do kho lưu trữ tách chúng ra và cho phép bạn lọc.
Tại sao "jailbreak không phải là một sự cố" mới là điểm mấu chốt
Hầu hết các bộ sưu tập sự kiện bảo mật AI đều gộp chung một khác biệt: một tác nhân thực sự đã gây ra thiệt hại không giống với một nhà nghiên cứu chứng minh rằng nó có thể làm vậy. Chính sự đánh đồng đó là thứ biến một bản demo tại hội nghị thành tiêu đề về một vụ xâm phạm, và đó là điều mà kho lưu trữ được xây dựng để từ chối.

Ba trường mang sức nặng đó. code>real_harm/code> ghi lại việc một nạn nhân đã được xác nhận hay chưa. code>ai_involvement/code> ghi lại việc một nguồn chính — nhà cung cấp, nạn nhân, cơ quan thực thi pháp luật hoặc một báo cáo chính thức — đã xác nhận vai trò của AI hay chưa, trong khi những quy kết còn tranh chấp vẫn được giữ trong tập dữ liệu nhưng được dán nhãn. code>kind/code> ghi lại mục đó là loại tài liệu gì. Một bản ghi không có nguồn sẽ không được đưa vào. Một bản ghi có bằng chứng mâu thuẫn được đánh dấu là còn tranh chấp thay vì được giải quyết theo hướng nào có vẻ hợp lý hơn. Khi có bằng chứng mới, bản ghi được cập nhật và thay đổi được ghi vào lịch sử sửa đổi của nó thay vì bị âm thầm ghi đè.
Kho lưu trữ đã áp dụng quy tắc đó cho chính mình. Trong các vòng xác minh của chính mình, nó đã xóa hai mục không thể chứng minh được, chỉnh sửa một khẳng định được lặp lại rộng rãi về tốc độ tiến triển của một vụ xâm nhập, và hạ bậc độ tin cậy của mục thứ ba khi bằng chứng nền tảng hóa ra chỉ là nguồn gián tiếp. Một cơ sở dữ liệu sự cố chưa từng xóa bỏ bất cứ điều gì là một cơ sở dữ liệu chưa từng được kiểm tra.
Mười hai bề mặt tấn công mà nó phân loại theo
Mỗi bản ghi được gắn thẻ với một hoặc nhiều trong mười hai loại, và mỗi loại có số lượng riêng theo từng tháng. Quản trị và chính sách là nhóm lớn nhất với 65 bản ghi, nhưng chỉ một trong số đó có tổn hại được xác nhận — đây là hình dạng đúng cho hoạt động quản lý, và là một cách gây hiểu nhầm nếu trích dẫn như số vụ sự cố. Lạm dụng thông tin xác thực đứng tiếp theo với 55, trong đó 40 nạn nhân được xác nhận, mật độ tổn hại cao nhất trong tập dữ liệu. Agent như một vũ khí ở mức 51 với 28 được xác nhận. Prompt injection gián tiếp có 45 bản ghi nhưng chỉ 5 có tổn hại được xác nhận, đây là minh họa rõ nhất cho sự tách biệt giữa năng lực và hậu quả trong toàn bộ tập dữ liệu: đây là lớp tấn công được nghiên cứu nhiều nhất và là một trong những lớp ít hiệu quả nhất ngoài thực tế. Đầu độc chuỗi cung ứng, với 36 bản ghi, có 27 nạn nhân được xác nhận — tỷ lệ tệ nhất trên bảng.
Tháng 9 năm 2026 là tháng chứng minh cho luận điểm.
Chỉ riêng trong tháng 9 năm 2026 đã có 51 bản ghi được ghi nhận, cao hơn gấp đôi bất kỳ tháng nào trước đó trong khoảng thời gian này. Đó không phải là một sự sụp đổ bảo mật đột ngột. Đó là một tháng mà công tác ghi chép cuối cùng đã đuổi kịp một năm sự kiện tích lũy, và điều quan trọng nằm ở thành phần cấu thành: các mục nghiêm trọng về một code>.git/config/code> độc hại thực thi mã của kẻ tấn công trong bảy tác nhân lập trình trước cả khi mô hình được liên hệ, về một lỗ hổng Langflow bị khai thác ngoài thực tế, về một chiến dịch bầy đàn tác nhân AI tại một nhà cung cấp dịch vụ quản lý in ấn, và về một loại sâu npm xâm nhập vào chuỗi cung ứng từ phía thượng nguồn. Bên cạnh đó là những mục thông tin về Tiêu chuẩn Kiểm soát Tác nhân của OWASP, một bài phát biểu Tình hình Liên minh của EU có nhắc tên các vụ tác nhân thoát khỏi kiểm soát, và một bản tóm tắt của ủy ban Liên Hợp Quốc coi một sự cố là lời cảnh báo về tình trạng mất kiểm soát.
Các mục tiếng Hàn, và trường khu vực không có nghĩa là gì
Trường của kho lưu trữcode>region/code> đánh dấu nơi một sự kiện thực sự xảy ra, không phải nơi nhà cung cấp đặt trụ sở — các công bố của nhà cung cấp xuyên biên giới luôn được ghi nhận là toàn cầu, đó là lý do vì sao 291 trong số 354 bản ghi không mang thẻ quốc gia riêng lẻ. Hai bản ghi mang thẻ KR, cả hai đều là mục chính sách với nguồn cấp độ A và không có tổn hại được xác nhận: việc Hàn Quốc loại bỏ DeepSeek khỏi các cửa hàng ứng dụng trong nước vào tháng 4 năm 2025, và lệnh cấm toàn công ty đối với OpenClaw được Naver, Kakao và Karrot thông qua vào tháng 2 năm 2026.
Sự tiết chế đó là có chủ đích. Con số hai cho một khu vực không phải là khẳng định rằng Hàn Quốc đã có hai sự kiện an ninh AI. Đó là khẳng định rằng hai sự kiện trong khoảng thời gian này đã thuộc về Hàn Quốc với nguồn sơ cấp đủ mạnh để ghi nhận — và kho lưu trữ thà công bố một con số nhỏ trung thực hơn là độn trang của một quốc gia bằng những sự kiện xảy ra với khách hàng của một công ty Hàn Quốc ở một nơi khác.
Cách đọc các mức độ tin cậy trước khi bạn trích dẫn một trong số đó
Độ tin cậy nói về chất lượng nguồn, không phải mức độ nghiêm trọng, và xếp hạng D không có nghĩa là sai — nó có nghĩa là các bên bất đồng và bạn không nên chỉ trích dẫn một phía. Hạng A nghĩa là nguồn sơ cấp: nhà cung cấp, nạn nhân, cơ quan thực thi pháp luật hoặc một báo cáo chính thức. Hạng B nghĩa là một phòng nghiên cứu hoặc một cơ quan truyền thông lớn với chi tiết có thể kiểm chứng. Hạng C nghĩa là chỉ dựa vào nguồn thứ cấp. Hạng D nghĩa là các sự kiện hoặc việc quy nguồn đang bị tranh chấp. Với 302 trong số 354 bản ghi, hạng A chiếm 85% tập dữ liệu, mức này cao bất thường đối với báo cáo sự cố và là kết quả trực tiếp của quy tắc không có nguồn thì không đưa vào.
Những lưu ý trung thực này đáng được nói rõ ràng, bởi vì kho lưu trữ đã nêu chúng. Hai bản ghi vẫn ở mức C và ba bản ghi ở mức D. Tám mươi lăm bản ghi mang mức độ nghiêm trọng thông tin vì chúng là các mục chính sách hoặc báo cáo mối đe dọa được giữ lại để duy trì tính liên tục của dòng thời gian, chứ không phải là các sự cố. Kho lưu trữ này mới ba tuần tuổi và không có sao, không có bản phát hành và không có đánh giá bên ngoài nào về phương pháp luận của chính nó — đây là một tập dữ liệu được công bố công khai, không phải là một nghiên cứu đã qua bình duyệt.

Vì sao điều này quan trọng hơn một thước đo chuẩn khác
Khi các agent có được trình duyệt, shell, thông tin xác thực, khả năng thực thi mã và quyền truy cập production, câu hỏi an ninh không còn là mô hình có thể làm được gì mà trở thành người ta đã làm gì với một mô hình. Các benchmark trả lời tốt câu hỏi thứ nhất và hoàn toàn không trả lời câu hỏi thứ hai. Một kho lưu trữ sự cố, được xếp hạng theo chất lượng nguồn và lọc theo việc liệu có ai thực sự bị tổn hại hay không, là loại công cụ duy nhất trả lời câu hỏi thứ hai — và nó chỉ hiệu quả nếu các mục có thể truy vết, có thể đính chính và được tự do tái sử dụng.
Đó là những gì hiện đã mở. Bộ dữ liệu nằm tại a href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, Markdown thô, các bản xuất JSON và CSV cùng lược đồ nằm trong a href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">kho lưu trữ công khai/a>, và các đính chính được thực hiện thông qua lịch sử sửa đổi của bản ghi. Nếu bạn biết một sự kiện nên có trong đó, cách đóng góp là một tệp Markdown và ít nhất một nguồn. Không có nguồn, không có mục.

OrcaRouter, đơn vị xuất bản kho lưu trữ, vận hành một endpoint tương thích OpenAI duy nhất xuyên suốt hơn 200 mô hình mà không đánh thêm phụ phí vào giá của nhà cung cấp và tự động chuyển đổi dự phòng giữa chúng — chính lớp định tuyến đó giúp có thể hướng một agent đến một mô hình rẻ hơn cho các lệnh gọi dễ và một mô hình mạnh hơn cho các lệnh gọi khó, đó chính xác là kiến trúc mà phần lớn các sự cố nêu trên được phát hiện nằm trong.
