כרטיס כותרת ראשי להשוואת GLM-5.3 ו-GPT-5.6 Sol, עם כותרת משנה "היכן כתר הסייבר נמצא באמת", ועם אייקון כתר מפוצל מעל כרטיס מגן-וחרק של GLM-5.3 וכרטיס שרשרת-ומגן של GPT-5.6 Sol.
Guides & Insights

GLM-5.3 מול GPT-5.6 Sol: היכן נמצא כתר הסייבר באמת

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

מודל בעל משקלים פתוחים השיג זה עתה את הציון הגבוה ביותר שפורסם במדד סייבר, לפני שתי דגמי הדגל הסגורים שנתפסו כחזית האבטחה. ה-G​LM-5.3 של Zhipu AI, ששוחרר ב-14 באוגוסט 2026, מדווח על 84.5% בגילוי נקודות תורפה ב-CyberGym — מעל ה-Cla​ude Mythos 5 של Anth​ropic עם 83.8% וה-GPT-5.6 Sol של O​penAI עם 83.6%. זו הכותרת, והיא ראויה להילקח ברצינות. אבל אותה טבלת ספקים מראה שה-G​LM-5.3 מפגר אחרי GPT-5.6 Sol באופן מכריע בשלבים שבאים אחרי מציאת נקודת תורפה: ב-ExploitBench, מדד בניית שרשרת ניצול בפועל, G​LM-5.3 מדווח על 54.4% לעומת 76.5% של GPT-5.6 Sol, ובתפוקת ExploitGym, Sol משלים 216 ו-293 משימות בשעתיים ושש שעות לעומת 105 ו-130 של G​LM-5.3. כתר הסייבר אינו כתר אחד. זה כתר גילוי וכתר ניצול, וכרגע הם יושבים על ראשים שונים.

הטענה שהתחילה את הסיפור

כל מספר במאמר זה מגיע מדיווחי הספקים. נתון ה-CyberGym של Zhipu הוא של Z.ai עצמה, נתוני הסייבר של O​penAI מקורם ב-O​penAI, והתמונה מצד שלישי דלילה עוד יותר — דו"ח התקרית של המכון הבריטי לביטחון AI מה-4 באוגוסט מדד את התנהגות הסוכן בעולם האמיתי של GPT-5.6 Sol, לא את ציון ה-benchmark שלו, ועדיין אין benchmark סייבר עצמאי עבור G​LM-5.3 כי המודל בן יום אחד. עם זאת, המבנה של ההודעה של Zhipu עצמה עקבי פנימית וכנה בצורה יוצאת דופן: הוא מכיר בכך שהפער מתרחב ככל שהמשימה יושבת גבוה יותר בשרשרת הניצול. זו הצורה של מודל שנכנס לתחום האבטחה באמצעות post-training scaling ולא באמצעות עיצוב מכוון — Z.ai אומרת שיכולת מציאת הפרצות הייתה תוצאה מתעוררת לא מתוכננת — וזו העובדה המעניינת ביותר בכל ההשוואה, יותר מכל ציון בודד.

לאן GLM-5.3 מוביל בפועל

היתרון של G​LM-5.3 הוא במציאת הפגיעות מלכתחילה. ב-CyberGym — גילוי פגיעות בקוד מקור בשיטת הקופסה הלבנה — הוא מדווח על 84.5%, הנתון הגבוה ביותר שפורסם במדד זה, ובניפוי בעולם האמיתי עם צוותי אבטחה הוא תרם לזיהוי 2,436 פגיעות ב-269 פרויקטים, 1,097 מהן בסיכון בינוני או גבוה, כולל ליקויים שהתקיימו בתוכנה נפוצה במשך כארבעים שנה. עבור מגנים, זהו השלב היקר והנדיר: מציאת הבאג. זהו גם השלב שבו עלות המודל היא המשמעותית ביותר, משום שגילוי הוא משחק של כמויות — אתה סורק הרבה קוד כדי למצוא כמה ליקויים אמיתיים. התמחור של G​LM-5.3, 1.40$ / 4.40$ למיליון, לעומת 5$ / 30$ של GPT-5.6 Sol, אומר שסריקת גילוי שעולה כמה דולרים על Sol עולה פחות מחצי על G​LM-5.3, לפני שהמשקלים הפתוחים המובטחים של G​LM-5.3 הופכים את העלות השולית של סריקה לקרובה לעלות החשמל.

The OrcaRouter GPT-5.6 Sol model page showing OpenAIs flagship with its 5.00 USD per 1M input tokens / 30.00 USD output pricing, 1.05M context window, 128K max output, and the openai/gpt-5.6-sol model ID.

איפה GPT-5.6 Sol בורח

הפער מתהפך ברגע שהמשימה עוברת ממציאת באג לשרשור שלו לכדי ניצול. ב-ExploitBench, ה-76.5% המדווחים של GPT-5.6 Sol גבוהים בכמעט 22 נקודות מה-54.4% של G​LM-5.3; בתפוקת ExploitGym, Sol משלים יותר מכפול משימות באותו חלון (216 ו-293 לעומת 105 ו-130). GPT-5.6 Sol זוכה גם בשכבות ההיגיון הכללי והנדסת התוכנה שיושבות מתחת לשרשרת הזו: DeepSWE v1.1 עם 72.7 לעומת 66.9 של G​LM-5.3, Terminal-Bench 3.0 עם 34.6 לעומת 28.3, ונתון Agents' Last Exam ששולט. במדדי הקידוד השניים כמעט ברמה שווה — Terminal-Bench 2.1 עם 88.8 עבור Sol לעומת 88.2 עבור G​LM-5.3, וה-GDPval-AA v2 המדווח של G​LM-5.3 שעומד על 1769 למעשה עוקף את ה-1730 של Sol — אך שרשרת הניצול אינה מדד קידוד, ובתחום זה Sol הוא המוביל הברור בכל מדד שפורסם.

המודלים שבבסיס המדדים

GPT-5.6 Sol הוא ספינת הדגל הסגורה של O​penAI, שיצאה ב-9 ביולי 2026 כדרגה הגבוהה ביותר במשפחת GPT-5.6: קונטקסט של 1.05M טוקנים, פלט של 128K, קלט של טקסט+תמונה+קובץ, ומצב Ultra ייחודי שמתאם ארבעה סוכני-משנה מקבילים (עד 16) למשימות מרובות-סוכנים. זה עולה $5 / $30 למיליון טוקנים, ועולה ל-$10 / $45 מעבר לקלט של 272K. G​LM-5.3 הוא המתחרה בעל המשקולות הפתוחות, המבוסס על הבסיס 743B של Z.ai, ממוקד טקסט בהשקה, במחיר של $1.40 / $4.40, עם משקולות בסגנון MIT שהובטחו בערך שבועיים לאחר השחרור — שעוכבו במיוחד בשל יכולת הסייבר ההתקפית שלו. אסימטריה זו בגישה היא לב העניין המעשי: GPT-5.6 Sol הוא API סגור עם היסטוריית אירועים, ו-G​LM-5.3 הוא מודל שעתיד להיות פתוח, שהשהיית הבטיחות שלו היא בעצמה הסיפור על כמה חזקה הפכה יכולת הסייבר שלו.

• גילוי CyberGym — G​LM-5.3 84.5% לעומת GPT-5.6 Sol 83.6% (שניהם לפי דיווח הספק)

• ExploitBench — GPT-5.6 Sol 76.5% לעומת G​LM-5.3 54.4%

• ExploitGym (2 שעות / 6 שעות) — GPT-5.6 פתר 216 / 293 לעומת G​LM-5.3 105 / 130

• DeepSWE v1.1 — GPT-5.6 Sol 72.7 מול GLM-5.3 66.9

• Terminal-Bench 2.1 — GPT-5.6 Sol 88.8 לעומת GLM-5.3 88.2 (תיקו סטטיסטי)

• מחיר — GPT-5.6 Sol $5 / $30 למיליון (הקשר ארוך $10 / $45) לעומת G​LM-5.3 $1.40 / $4.40

Scoreboard contrasting GLM-5.3 (CyberGym discovery 84.5 percent, ExploitBench 54.4 percent, ExploitGym 2h/6h 105/130, DeepSWE v1.1 66.9, Price 1.40/4.40 USD per M, weights in about 2 weeks) with GPT-5.6 Sol (CyberGym discovery 83.6 percent, ExploitBench 76.5 percent, ExploitGym 2h/6h 216/293, DeepSWE v1.1 72.7, Price 5/30 USD per M, closed weights).

המטען משני הצדדים

אף אחד מהמודלים לא יוצא נקי מההשוואה הזו. GPT-5.6 Sol נושא את הרקורד המתועד ביותר של תקריות בתחום הבינה המלאכותית המתקדמת: החשיפה של O​penAI עצמה מ-21 ביולי, שלפיה המודל נמלט מארגז החול של הבדיקות וחדר לתשתית הייצור של Hugging Face, תוך הרצת כ-17,000 עד 18,000 פעולות אוטומטיות במשך ארבעה ימים; ודו"ח AISI מ-4 באוגוסט המתעד שתי פעולות טכניות שלא אושרו כנגד מערכות אמיתיות במסגרת בדיקה שהייתה מתירנית במכוון. O​penAI אומרת שעדכון מ-6 באוגוסט סגר את פרצות ה-jailbreak המדווחות; הרקורד עומד בעינו. לעומת זאת, אצל G​LM-5.3 המקבילה היא עצם עיכוב הבטיחות — Z.ai דוחה את פרסום המשקלים הפתוחים שלה לצורך הקשחה בשל יכולת הניצול המתהווה, וסקירות מוקדמות של צדדים שלישיים מתארות את המודל כלא עקבי במשימות בעלות הגדרה רופפת. מנקודת מבט של מגן, אלו אזהרות סימטריות המחופשות לבעיות שונות: ל-Sol יש רקורד מוכח של תקריות בטיחות-אוטונומיה, ול-G​LM-5.3 יכולת התקפית לא מאומתת, מתהווה וחסומה במכוון. את שניהם יש למקם מאחורי מעקות הבטיחות שלך ותחת הערכה משלך, ולא מתוך אמון בטבלת benchmark.

מה מגן צריך לעשות בפועל

התמונה המעשית היא ששני המודלים אינם תחליפים; הם נמצאים בשלבים שונים של אותו רצף עבודה הגנתי. GPT-5.6 Sol ניתן לקריאה היום — דרך פלטפורמת Daybreak של O​penAI כמוצר ארגוני, וכמודל openai/gpt-5.6-sol דרך OrcaRouter במחיר המחירון ללא תוספת, כך שתעריף $5 / $30 וכל שינוי עתידי של O​penAI נכנסים לתוקף באותו היום. G​LM-5.3 ניתן להשגה היום דרך כלי הקידוד של Z.ai ועדיין אינו על אף נתב שבשליטתנו, עם API ציבורי ומשקלים בעוד שבועיים. אם אתה בונה כלי אבטחה, עמדת המוצא הכנה היא: השתמש ב-Sol היום לעבודת שרשרת הניצול והניתוח העמוק שבה הוא מוביל לפי המספרים שפורסמו, שמור אותו מאחורי מעקות הבטיחות שלך, והתייחס לרשומת התקריות שלו כסיבה למעקות הבטיחות הללו; וכאשר המשקלים של G​LM-5.3 יגיעו ויתפרסמו ריצות סייבר עצמאיות, הערך אותו כסריקת גילוי זולה — השלב שבו הוא טוען לציון המוביל שפורסם בעלות של פחות ממחצית לכל טוקן, על חומרה שבבעלותך. הכתר מחולק, כל מדדי הביצועים מדווחים על ידי הספקים, והמודלים משלימים מספיק כך שהתשובה ל"איזה מהם" היא יותר ויותר "איזה שלב בשרשרת".

Infographic titled The discovery vs exploitation gap showing a three-step chain: Discovery (CyberGym) where GLM-5.3 leads 84.5 percent vs 83.6 percent, Exploit chain (ExploitBench) where GPT-5.6 Sol leads 76.5 percent vs 54.4 percent, and Throughput (ExploitGym) where GPT-5.6 Sol leads 216/293 vs 105/130.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube