Hero: כרטיס לוח בקרה המציג 354, רשומות · 593 מקורות, עם תגי חומרה ותרשים עמודות של 22 חודשים
Guides & Insights

ארכיון התקריות של Orca AI: 354 תקריות אמיתיות של סוכני AI, כל אחת עם אסמכתא

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

צוות אבטחה יכול לומר לך בדיוק עד כמה מודל עומד בפני הזרקת פרומפט בתוך סביבת בדיקה. מה שכמעט אף אחד לא יכול לומר לך הוא כמה ארגונים למעשה נפרצו על ידי סוכן בחודש שעבר, אילו מהפריצות הללו היו בעלות קורבן מאומת, ואילו מהמספרים המצוטטים בכתיבה הגיעו מהספק ולא מהרגולטור. הפער הזה — בין מה שמודלים עשויים לעשות לבין מה שכבר קרה — הוא הפער שa href="https://www.orcarouter.ai/incident-archive">Orca AI Incident Archive/a> נבנה כדי לסגור. הוא עלה לאוויר ב-23 בספטמבר 2026, ונכון לחתך הנתונים שלו מ-22 בספטמבר, הוא מכיל 354 רשומות שנאספו מ-593 מקורות ייחודיים.

הערת דיוק: כל נתון להלן נקרא מהפרסום של הארכיון עצמו code>dist/stats.json/code> בגרסה 2026-09-22 ומהדף החי. הודעת ההשקה ב-23 בספטמבר ציינה 340 רשומות, 548 מקורות ו-126 עם פגיעה מאושרת; אלה היו הנתונים ברגע הפרסום, והארכיון מתעדכן ברציפות, כך ששתי הקבוצות נבדלות בכבערך יום של קליטה. במקומות שבהם ה-README של הארכיון והדף החי שלו לא הסכימו על מספר תג במהלך הפיתוח, הדף החי וייצוא ה-JSON הם אלה שיש לסמוך עליהם.

מה הארכיון באמת מכיל

זה אינו פיד חדשות וזה אינו רשימת CVE. כל רשומה היא קובץ Markdown בודד עם frontmatter מובנה, מתויקת תחת החודש שבו התרחש האירוע, וכל רשומה כוללת לפחות מקור אחד. מערך הנתונים מפורסם תחת CC BY 4.0 ומשוכפל במאגר ציבורי, כך שאפשר לשכפל, להשוות גרסאות ולצטט את כולו במקום לצלם מסך.

חלון הכיסוי נפרש על פני 22 חודשים, מדצמבר 2024, כשלב מקדים, ועד 22 בספטמבר 2026, וההתפלגות היא החלק המעניין. החומרה מתחלקת ל־45 קריטיים, 139 גבוהים, 77 בינוניים, 8 נמוכים ו־85 אינפורמטיביים. מהימנות המקור מתחלקת ל־302 בדרגה A, 47 בדרגה B, 2 בדרגה C ו־3 בדרגה D. נזק ממשי שאושר בעולם האמיתי נרשם עבור 127 רשומות, נשלל במפורש עבור 142, והושאר כ־null עבור 85.

שלושת המספרים האחרונים הם הסיבה לכך שכדאי לקרוא את הארכיון בעיון ולא ברפרוף. ספירה של 354 רשומות אינה ספירה של 354 אירועים. רק 138 מהן מסווגות בכלל כאירוע; השאר הן חשיפות פגיעויות, הדגמות מחקריות, דוחות איומים ומהלכי מדיניות. ספירה של כל חמשת אלה יחד היא בדיוק הדרך שבה מספר שמופיע בכותרת הופך לשגוי, ולכן הארכיון מפריד ביניהם ומאפשר לך לסנן.

למה "ג'יילברייק הוא לא תקרית" הוא כל העניין

רוב האוספים של אירועי אבטחה של בינה מלאכותית מטשטשים הבחנה אחת: סוכן שאכן גרם לנזק אינו אותו דבר כמו חוקר שמראה שהוא יכול לגרום לו. הטשטוש הבודד הזה הוא מה שהופך הדגמה בכנס לכותרת על פרצה, וזה מה שהארכיון נבנה כדי לסרב לו.

A diagram splitting CAPABILITY, what a model might do, from CONSEQUENCE, what actually happened, with EVIDENCE on the divider

שלושה שדות נושאים במשקל הזה. code>real_harm/code> מתעד אם קורבן אומת. code>ai_involvement/code> מתעד אם מקור ראשוני — הספק, הקורבן, אכיפת החוק או דוח רשמי — אישר את תפקיד ה-AI, כאשר ייחוסים שנויים במחלוקת נשמרים במערך הנתונים אך מסומנים. code>kind/code> מתעד איזה סוג של מסמך הרשומה היא. רשומה ללא מקור אינה נכנסת. רשומה עם ראיות סותרות מסומנת כשנויה במחלוקת, ולא מוכרעת בכיוון שנשמע טוב יותר. כאשר מגיעות ראיות חדשות, הרשומה מתעדכנת והשינוי נכתב להיסטוריית הגרסאות שלה, ולא נדרס בשקט.

הארכיון יישם את הכלל הזה על עצמו. במהלך סבבי האימות של עצמו הוא מחק שתי רשומות שלא ניתן היה לבסס, תיקן טענה שחזרה על עצמה בהרחבה בדבר מהירות ההתקדמות של חדירה אחת, והוריד את דירוג הביטחון של רשומה שלישית כאשר התברר שהראיות שעמדו בבסיסה היו מכלי שני. מאגר אירועים שמעולם לא הסיר דבר הוא מאגר שלא נבדק.

שנים עשר משטחי התקיפה שלפיהם הוא ממיין

כל רשומה מתויגת באחד או יותר משנים־עשר סוגים, וכל סוג נושא ספירה חודשית משלו. ממשל ומדיניות היא הקטגוריה הגדולה ביותר עם 65 רשומות, אך רק באחת מהן יש נזק מאומת — זו התמונה הנכונה לפעילות רגולטורית, אך תמונה מטעה אם מצטטים אותה כמניין תקריות. ניצול לרעה של אישורי גישה בא אחריו עם 55, עם 40 קורבנות מאומתים, צפיפות הנזק הגבוהה ביותר במערך. סוכן כנשק עומד על 51 עם 28 מאומתים. להזרקת פרומפט עקיפה יש 45 רשומות אך רק 5 עם נזק מאומת, וזהו ההמחשה הברורה ביותר של הפער בין יכולות להשלכות בכל מערך הנתונים: הוא סוג התקיפה הנחקר ביותר, ואחד הפחות יעילים בשטח. הרעלת שרשרת אספקה, עם 36 רשומות, כוללת 27 קורבנות מאומתים — היחס הגרוע ביותר בלוח.

ספטמבר 2026 הוא החודש שמוכיח את הטענה

חמישים ואחת רשומות נרשמו בספטמבר 2026 לבדו, יותר מכפול מכל חודש קודם בחלון. זו אינה קריסה פתאומית באבטחה. זהו חודש שבו תיעוד הרשומות סוף סוף הדביק את הקצב עם שנה של אירועים מצטברים, וההרכב הוא שקובע: רשומות קריטיות עבור קובץ זדוני בשם code>.git/config/code> שמבצע קוד תוקף בשבעה סוכני קידוד לפני שנוצר קשר עם המודל בכלל, עבור פגיעות Langflow שמנוצלת בשטח, עבור קמפיין נחיל סוכני AI אצל ספק לניהול הדפסה, ועבור תולעת npm שנכנסת לשרשרת במעלה הזרם. לצידן מופיעות רשומות מידעיות על תקן OWASP Agent Control Standard, נאום מצב האיחוד של האיחוד האירופי שהזכיר בריחות סוכנים, ותדרוך פאנל של האו"ם שהתייחס לאירוע אחד כאזהרת אובדן שליטה.

הערכים הקוריאניים, ומה לא אומר שדה אזור

השדה של הארכיון code>region/code> מציין היכן אירוע התרחש בפועל, לא היכן שנמצא המשרד הראשי של הספק — חשיפות ספקים חוצות גבולות תמיד מוגשות כגלובליות, ולכן 291 מתוך 354 רשומות אינן נושאות תג של מדינה אחת. שתי רשומות נושאות את התג KR, שתיהן רשומות מדיניות עם מקורות בדרגה A וללא נזק מאומת: הסרת DeepSeek מחנויות האפליקציות המקומיות בדרום קוריאה באפריל 2025, והאיסור בכל רחבי החברה על OpenClaw שאומץ על ידי Naver, Kakao ו-Karrot בפברואר 2026.

האיפוק הזה מכוון. ספירה אזורית של שניים אינה טענה שלקוריאה היו שני אירועי אבטחת בינה מלאכותית. זוהי טענה ששני אירועים בחלון הזמן שויכו לקוריאה, עם מקור ראשוני חזק מספיק כדי לתעד אותם — והארכיון מעדיף לפרסם מספר קטן וכנה מאשר לנפח עמוד מדינה באירועים שקרו ללקוחות של חברה קוריאנית במקום אחר.

איך לקרוא את דרגות הביטחון לפני שמצטטים אחת

הוודאות נוגעת לאיכות המקור, לא לחומרה, וציונית D אינה אומרת שקר — היא אומרת שהצדדים חלוקים ואין להסתמך על צד אחד בלבד. ציונית A פירושה מקור ראשוני: הספק, הקורבן, אכיפת החוק או דוח רשמי. ציונית B פירושה מעבדת מחקר או כלי תקשורת מרכזי עם פרטים הניתנים לבדיקה. ציונית C פירושה מידע מיד שנייה בלבד. ציונית D פירושה שהעובדות או הייחוס שנויים במחלוקת. מתוך 354 רשומות, 302 הן ציונית A — 85% ממערך הנתונים, שיעור גבוה באופן חריג לדיווח אירועים, והוא תוצאה ישירה של כלל "אין מקור—אין רשומה".

ההסתייגויות הכנות ראויות להיאמר בפשטות, מפני שהארכיון מציין אותן. שתי רשומות נותרות בדירוג C ושלוש בדירוג D. שמונים וחמישה רשומות נושאות חומרה אינפורמטיבית משום שהן רשומות מדיניות או דוחות איומים שנשמרו לשם רציפות ציר הזמן, ולא תקריות. המאגר בן שלושה שבועות ואין בו כוכבים, גרסאות או ביקורת חיצונית על המתודולוגיה שלו עצמו — זהו מערך נתונים שפורסם בגלוי, לא מחקר שעבר ביקורת עמיתים.

The Orca AI Incident Archive repository on GitHub, showing the README badges and the file tree

למה זה חשוב יותר מעוד מבחן ביצועים

ככל שסוכנים רוכשים דפדפנים, מעטפות פקודה, אישורי גישה, הרצת קוד וגישה לסביבת ייצור, השאלה הביטחונית מפסיקה להיות מה שמודל מסוגל לעשות והופכת להיות מה שכבר נעשה עם מודל כזה. בנצ'מרקים עונים היטב על השאלה הראשונה, ואילו על השנייה — כלל לא. ארכיון של אירועים, המדורג לפי איכות המקור ומסונן לפי השאלה אם מישהו נפגע בפועל, הוא הסוג היחיד של כלי שעונה על השנייה — והוא עובד רק אם הרשומות ניתנות למעקב, לתיקון ולשימוש חוזר חופשי.

זה מה שפתוח כעת. מערך הנתונים נמצא בa href="https://www.orcarouter.ai/incident-archive">orcarouter.ai/incident-archive/a>, ה-Markdown הגולמי, ייצוא ה-JSON וה-CSV והסכמה נמצאים בa href="https://github.com/Continuum-AI-Corp/Orca-AI-Incident-Archive">המאגר הציבורי/a>, ותיקונים עוברים דרך היסטוריית הגרסאות של הרשומה. אם אתם יודעים על אירוע ששייך אליו, מסלול התרומה הוא קובץ Markdown אחד ולפחות מקור אחד. אין מקור, אין רשומה.

The live Orca AI Incident Archive page at orcarouter.ai

OrcaRouter, שמפרסם את הארכיון, מפעיל נקודת קצה אחת תואמת ל-OpenAI על פני יותר מ-200 מודלים, ללא תוספת מחיר על תמחור הספקים ועם מעבר אוטומטי ביניהם — אותה שכבת ניתוב שמאפשרת לכוון סוכן למודל זול יותר עבור הקריאות הקלות וחזק יותר עבור הקשות, וזו בדיוק הארכיטקטורה שבה נמצאו רוב התקלות שלעיל.