בינה מלאכותית הפכה למשטח התקיפה ב-2025. ב-2026, אנחנו הופכים את ההגנה לחינם.

בינה מלאכותית הפכה למשטח התקיפה ב-2025. ב-2026, אנחנו הופכים את ההגנה לחינם.

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הזרקת prompt (Prompt injection) היא כעת הסיכון מספר 1 ליישומי LLM — ואי אפשר לתקן אותה באמצעות עדכון. היום, מחקר האבטחה של OrcaRouter משחרר את חומת האש (Firewall) של הסוכן שלנו ואת מעקי הבטיחות (Guardrails) לקלט/פלט בחינם לכל משתמש: אותו מפתח API, מתג אחד בקונסולה שלכם, ללא שינויי קוד. זהו נוף האיומים שהפך את זה לבלתי ניתן לויתור — והארכיטקטורה שמכילה אותו.

מאת OrcaRouter Security Research · יוני 2026


ביוני 2025, תוקפים הוציאו נתונים ארגוניים מ-Microsoft 365 Copilot. הקורבן לא עשה שום דבר לא נכון. הוא לא לחץ על קישור, לא פתח קובץ מצורף, ולא אישר בקשה. הוא קיבל אימייל. העוזר הבינה המלאכותית שלו קרא אותו מאוחר יותר — וציית להוראות שהוסתרו בתוכו. השרשרת, שנחשפה על ידי Aim Security כ- EchoLeak (CVE-2025-32711), אספה הקשר רגיש מדואר, קבצים והיסטוריית צ'אט והבריחה אותו דרך כתובת URL של תמונה שנטענת אוטומטית. אפס קליקים.

EchoLeak לא היה חריג. זו הייתה תצוגה מקדימה. שנה לאחר מכן, אנו יכולים לומר בפשטות מה שמראה כעת תיעוד התקריות הציבורי: מערכות ה‑AI שלכם הן משטח התקיפה שלכם, ורוב הארגונים אינם יכולים לראות את ההתקפות נגדן. היום אנו מפרסמים The AI Threat Report 2026 ולצדו, משחררים את שני הבקרים שבנינו כדי להכיל את ההתקפות האלה — חינם, בשער, לכל משתמש OrcaRouter.

השנה שבה ההתקפות הפכו לסוכניות — והדליפות הפכו לתעשייתיות

תיעוד האירוע משנת 2026 נקרא כמו מבחן מאמץ של כל הנחה שעליה נבנתה אבטחה ארגונית:

- Chat & Ask AI השאיר בערך 300 מיליון הודעות צ'אט פרטיות מיותר מ-25 מיליון משתמשים חשופות דרך תצורה שגויה של Firebase (404 Media; Malwarebytes, ינואר 2026).

- Sears Home Services חשף 3.7 מיליון תמלילי צ'אט AI והקלטות שיחות — שמות, כתובות, אימיילים — המשתרעים על פני 2024–2026 (ExpressVPN; Cybernews, מרץ 2026).

- תוקף שרשרת CVE יחיד (CVE-2026-39987 בכלי marimo notebook) לתוך סוכן LLM חי שחלץ פרטי גישה לענן, שלף מפתח SSH מ-AWS Secrets Manager, והוציא מסד נתונים PostgreSQL פנימי שלם תוך פחות משתי דקות (Sysdig; The Hacker News, מאי 2026).

- Microsoft ו-Salesforce שניהם פרסמו תיקונים לפרצות דליפת נתונים של סוכני AI. ב CVE-2026-21520, שדה SharePoint מורעל הוביל את Copilot לשלוח בדוא"ל נתוני לקוחות לתוקף — והנתונים עזבו אפילו לאחר שמנגנון בטיחות סימן את ההתקפה (Dark Reading).

הכלכלה שמתחת לכותרות הללו התהפכה לטובת התוקף. טלמטריה מיישומי LLM בייצור מראה שההתקפה המוצלחת הממוצעת מסתיימת תוך 42 שניות, כאשר 90% מהן מדליפות נתונים רגישים (Pillar Security). 13% מהארגונים כבר נפרצו באמצעות מודל AI או יישום — ו- 97% מאלה חסרו בקרות גישה בסיסיות ל-AI (IBM, 2025). הסיכום של OWASP לרבעון הראשון של 2026 נתן מספרים על המגמה: התקפות הזרקת הנחיה עלו ב-340% משנה לשנה.

וסוג אובדן חדש אינו זקוק כלל לפריצה. Denial-of-wallet — סוכן שנחטף או יצא משליטה שפשוט מוציא — נצפה כשהוא שורף $46,000 ביום (Sysdig, "LLMjacking"). אף נתון לא נגנב. יש רק חשבון.


למה הסטָאק הנוכחי שלך לא יכול לראות מזה כלום

אבטחה מסורתית מניחה גבול: פנימי מהימן, חיצוני לא מהימן, בקרות בתפר. מודלי שפה ממיסים את הגבול הזה, משום ש הקלט של מודל הוא גם התכנות שלו. כל אימייל, מסמך, דף אינטרנט ותוצאת כלי שסוכן קורא יכולים לשאת הוראות שהוא יבצע. אין מנגנון מהימן וגנרי שבאמצעותו מודלים של ימינו מפרידים תוכן לעיבוד מן פקודות לציית.

לכן הזרקת הפקודה תופסת את #1 position in the OWASP Top 10 for LLM Applications — וזו הסיבה שלא "יתוקן" כפי שמתוקנת גלישת מאגר. זוהי תכונה מבנית של המדיום. חומת האש ליישומי האינטרנט שלך בודקת את הבקשה ורואה קריאת API תקפה לחלוטין; ההתקפה נמצאת ב מילים. הבדיקות שלך לפי בקשה עוברות כל שלב ושלב של התקפה משורשרת, כי הנזק חי ב רצף — נפח, חזרות והוצאות לאורך זמן — לא בקריאה אחת.

המסקנה לא נוחה אבל ברורה: אבטחת בינה מלאכותית אינה בעיית אימון מודל. היא בעיית ארכיטקטורה — וניתן לפתרון באותה משמעת שארגונים מיישמים כבר על כל מערכת ייצור אחרת.


ההגנה היא ארכיטקטורלית: שני מישורים, שש שכבות, בשער.

כל התקפה לעיל מצליחה נגד סמכות לא מוגבלת ונכשלת נגד סמכות מוגבלת, מפוקחת, מבוקרת. הכלתם דורשת שליטה על שני מישורים נפרדים:

מישור התוכן — מה שהמודל קורא וכותב. זו העבודה של Guardrails.

מישור הפעולה — מה שהסוכן עושה: הכלים שהוא מפעיל, הרשתות שהוא מגיע אליהן, הכסף שהוא מוציא. זו עבודתה של החומה.

הגנה שמסתכלת רק על מישור אחד תחמיץ את ההתקפות המשורשרות שמייצרות כותרות, כי התקריות המזיקות ביותר חוצות את שניהם: הזרקה מגיעה כתוכן, ואז מתממשת כפעולה. OrcaRouter מציבה שש שכבות עצמאיות וניתנות לביקורת בין בקשה לחרטה:

1. זהות תחומה — כל סוכן מתקשר דרך המפתח האישי שלו הנושא מודלים מורשים, רשימת IP מותרת, תקרת הוצאה קשיחה, ותאריך תפוגה. בקשה מחוץ לתחום נכשלת לפני קריאת תוכן כלשהו.

2. שומרי סף לקלט — חוקי הזרקה ו-jailbreak, זיהוי והסוואת PII, חסימת סודות, ו-LLM-judge סמנטי שתופס מה ש-regex לא יכול.

3. חומת האש לפעולות — כל קריאת כלי, שליחת MCP ויציאת רשת נשפטים לפי מדיניות מסודרת של ברירת-מחדל-דחייה עם שישה פסקי דין: התיר, ביקורת, דחה, נקה (ערוך ארגומנטים והמשך), ממתין לאישור (החזק צעדים בלתי הפיכים לאדם), ו-מגבלת עלות (עצור הרצה בתקרת הוצאה). סוכן שנחטף לא יכול להגיע לכלי, למארח, או לדולר שמעולם לא רשמת.

4. מסילות הגנה לפלט — התשובה נבדקת ביציאה לאיתור פלט מסוכן, PII, וסודות, עם בדיקות עיגון. זוהי השכבה שתופסת את כתובת ה-URL לחילוץ של EchoLeak לפני שהיא עוזבת.

5. זיהוי חריגים — קווי בסיס התנהגותיים מסמנים מה שחוקים סטטיים אינם יכולים לחזות: אותה שיחה שחוזרת על עצמה בחלון זמן צר, הוצאה שעולה בחדות לעומת קו בסיס נלמד לפי שעה ביום בשבוע, מעבר מכלי לכלי שסביבת העבודה מעולם לא ביצעה.

6. ביקורת חתומה — כל התאמה, פסק דין, אישור ושינוי מדיניות נרשמים במסלול עמיד בפני זיוף, מתואמים לפי ריצת סוכן וסשן, וניתנים לייצוא כראיה.

התכונה המכרעת היא מיקום. בקרות אלה חיות בשער, בנתיב הבקשה, ולכן הן נקשרות ל פרטי כניסה במקום לקוד יישום — ניתנות לאכיפה בכל צוות ומסגרת, ללא שכתובי סוכן.

אנחנו לא בודקים את שיעורי הבית שלנו

טענות אבטחה שוות בדיוק כמו הראיות שמאחוריהן, ולכן אנו מציגים את שלנו בגלוי. ה-Guardrails וה-Firewall של OrcaRouter מגיעים עם רתמת הערכה שמדרגת אותם מול מעל 80 מאגרי red-team בקוד פתוח — כל אחד מצוטט ומורשה:

HarmBench (MIT; ICML 2024), JailbreakBench (NeurIPS 2024), וAdvBench (Zou et al., 2023) להתנהגות מזיקה ועמידות בפני Jailbreak;

NVIDIA's garak (Apache-2.0), סורק הפגיעות של LLM הפתוח, להתקפות הזרקה וקידוד;

AgentDojo (NeurIPS 2024) — בנצ'מרק החדרת פרומפטים לסוכנים (agent prompt-injection benchmark) ששימש את המכונים לבטיחות בינה מלאכותית של ארה"ב ובריטניה בצוות אדום משותף — כדי לדרג את חומת האש של תוכנית הפעולה באופן ספציפי;

TruthfulQA ואחרים להארקה ולהזיות.

אורקה-ראוטר עצמו משלב כלים פתוחים ישירות: OSV עבור CVEs של תלויות ו Semgrep עבור קוד שעובר פרומפט. לא קופסה שחורה. לא "סמוך עלינו."


בנוי לביקורת הקרובה

ב ב-2 באוגוסט 2026, חוק ה-AI של האיחוד האירופי (EU AI Act) הופך לבעל תחולה מלאה, ו-"show me" מחליף את "tell me" כקו הבסיס הרגולטורי. אותו אינסטינקט ראייתי מתפשט לאורך תחומי SOC 2, שאלוני ביטוח סייבר, וסקירות רכש. OrcaRouter מספקת 36 חבילות מסגרות ציות — כולל OWASP LLM Top 10, NIST AI RMF, ISO/IEC 42001, EU AI Act, SOC 2, HIPAA, PCI DSS, ו-GDPR — שמממשים בקרות בסביבת העבודה שלך ומייצרים ראיות חתומות. שכבת בקרה אחת הממוקמת היטב מייצרת את האישור עבור כולם בבת אחת.


מה שמשיקים היום — ולמה זה בחינם

OrcaRouter Firewall + Guardrails כעת חינם לכל משתמש. אותו מפתח API. מתג אחד בקונסולה שלך. אין צורך לשנות קוד.

עשינו אותם בחינם במכוון. הנתונים בדו"ח אינם משתמעים לשתי פנים בנקודה זו: איסור ללא דרך סלולה מייצריותר AI צל, לא פחות — ו-AI צל כבר מניעאחד מכל חמישה פרצות בפרמיה של $670,000 (IBM, 2025). הפתרון שעובד הוא כלכלי כמו טכני:הפכו את הדרך המוסדרת לדרך הקלה ביותר. בקרה שעליך לשלם עליה תוספת, לשלב אותה ידנית, ולהצדיקה בפני ועדת תקציב היא בקרה שרוב הצוותים ידלגו עליה — ודילוג עליה הוא בדיוק האופן שבו ארגונים מוצאים עצמם מסבירים את דו"חות האירועים שהדו"ח הזה תיאר מראש.

אז אין מה לשלב ואין מה לקנות. אתה מצמיד את מדיניות Guardrails ו-Firewall למפתח שבו אתה כבר משתמש ועוקב אחר ההשקה שעומדת במגע עם הייצור: תצפה (הפעל במצב ביקורת ותן לתעבורה האמיתית שלך לכתוב את קו הבסיס), צל (הפעל את המדיניות האמיתית במצב 'חסימה' עד שהאזעקות השווא יתקרבו לאפס), ואז אכוף (הפוך פסקי דין בשידור חי, תוך שמירה על אישור אנושי למקרים הבלתי הפיכים באמת). רוב הצוותים ממירים תוך שבועות — ושומרים על השליטה פעילה.


השורה התחתונה

נוף האיומים של 2026 אינו סיבה להאט את אימוץ הבינה המלאכותית. זהו מדריך התפעול להישרדות בו. כל התקפה בדוח זה מביסה סמכות לא מוגדרת ומתה מול סמכות מוגדרת, מפוקחת ומבוקרת — ותכונה זו ניתנת לבנייה כעת, בשער, תוך שבועות, בחינם.

קרא את הדוח המלא: The AI Threat Report 2026 · הפעל אותו: OrcaRouter 🐋

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube