
Claude Opus 5.5 מוביל את מדד Epoch Capabilities בפער של 0.84 נקודות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
המספר הוא 0.84. Claude Opus 5.5 עומד על 167.35 במדד Epoch Capabilities Index נכון לקובץ שקראנו ב-2 באוקטובר 2026, עם GPT-6 Astra על 166.51 — פער של פחות מנקודה אחת בסולם שבו מרווחי ה-95% שפורסמו עבור שני המודלים חופפים כמעט לחלוטין, 164.0 עד 172.0 עבור Opus 5.5 לעומת 163.14 עד 171.05 עבור Astra. מתחתיהם, Claude Sonnet 5.5 רשם 165.2 ו-Claude Fable 5.1 164.82, כך שארבעת הערכים העליונים במדד משולב בלתי תלוי של יותר מחמישים מבחנים מופרדים ב-2.53 נקודות ושלושה מהם נושאים את שמו של אותו ספק. הסדר אמיתי במובן שהאומדנים הנקודתיים מסודרים. הוא אינו אמיתי במובן שהיתרון של 0.84 נקודות שורד את פסי השגיאה של עצמו, וכל מה ששווה לומר על טבלת המובילים הזו נובע מלהחזיק את שתי העובדות הללו בעת ובעונה אחת.
מהו המדד, ומה 0.84 של נקודה אינו
Epoch Capabilities Index אינו לוח תוצאות של ספק. הוא נבנה על ידי Epoch AI, ארגון מחקר עצמאי, כמדד מורכב המחבר יחד ציונים מיותר מחמישים בנצ'מרקים נבדלים לכדי סולם יכולות כללי אחד, ומסיק את הקושי היחסי של כל בנצ'מרק מהמודלים שבמקרה מופיעים בכמה מהם בעת ובעונה אחת. המתודולוגיה מוצגת במאמר שנכתב עם חוקרים מצוות AGI Safety & Alignment של Google DeepMind ובמימון DeepMind, אך Epoch מצהירה במפורש שהמדד הוא מוצר שלה ושהיא מחזיקה בזכויות מלאות עליו — הבחנה שכדאי לשמור עליה כאשר מקור המימון והמפרסם של הציון אינם אותו צד. הקוד פומבי.
שני מאפיינים של הסקאלה חשובים יותר מהכותרת. הראשון הוא ש-ECI מעוגן בכוונה ולא אבסולוטי: ציונים גולמיים מותאמים מחדש כך ש-Claude 3.5 Sonnet ניצב על 130 ו-GPT-5 על 150, כלומר מספר במדד הזה מקבל משמעות רק לצד מספר אחר מאותו קובץ, ולעולם לא בפני עצמו. השני הוא שלמדד אין תקרה. אין 100 לשאוף אליו, כך ש"ראש המדד" הוא אמירה על תאריך, ולא על גבול שמישהו הגיע אליו.
וזו הסיבה שהקריאה הכנה של 167.35 לעומת 166.51 אינה "Claude Opus 5.5 הוא המודל המסוגל ביותר בעולם." היא צרה יותר ופחות ניתנת לציטוט: לפי המידול של Epoch את הראיות הזמינות ב-2 באוקטובר 2026, שני המודלים אינם ניתנים להבחנה בצמרת, והסדר ביניהם הוא שובר שוויון ולא מדידה. המרווחים שפורסמו אומרים זאת ישירות — 164.0 עד 172.0 ו-163.14 עד 171.05 חולקים את הרוב המכריע של הטווח שלהם. כל מי שמצטט את 0.84 כהכרעה מצטט תוצר לוואי של עיגול.
הבלוק של Anthropic, וגודלה של גרסה
המאפיין המאלף יותר בטבלה אינו מי שנמצא במקום הראשון; אלה דווקא השורה השלישית והרביעית. Claude Sonnet 5.5, שיצא ב-28 בספטמבר עם ציון 165.2, ממוקם 0.38 נקודות מעל Claude Fable 5.1, שיצא ב-1 בספטמבר עם 164.82 — קרוב מספיק כדי ששניהם יהיו באותו מקום למעשה, וקרוב מספיק כדי שהצמד יימצא רק 2.15 נקודות מתחת לראש הטבלה. Sonnet הוא המוצר בדרג הביניים בקו של Anthropic, ו-Fable הוא המודל שהחברה הפנתה אליו היסטורית לעבודת הסקה כללית; העובדה ששניהם כעת תוחמים את החזית ממש מלמטה היא השינוי המהותי ברענון הזה, יותר מאשר זהות המוביל.
גם הצעד הדורי של Anthropic עצמה נראה לעין. Claude Opus 5.5 הוא היורש של Claude Opus 5, שאותו Epoch מדרגת ב-162.94 עם מרווח של 160.2 עד 166.7. זהו שיפור של 4.41 נקודות על פני כחודשיים בערך, מגרסה שיצאה ב-24 ביולי לזו שיצאה ב-22 בספטמבר — מהלך גדול יותר מ-0.84 הנקודות שמפרידות בין המקום הראשון והשני היום. בקריאה כזו, הגודל המעניין בטבלה הזו הוא השיפוע בתוך הקו של ספק אחד, ולא הפער בין שני ספקים בצמרת.
היכן עובר קו המשקלים הפתוחים
Epoch מפריד בין מודלים לפי נגישות, מה שהופך את גבול המשקלים הפתוחים לקריא בלי צורך לנחש. הרשומה הטובה ביותר בקטגוריית המשקלים הפתוחים היא Kimi K3 עם 157.61, מתאריך 16 ביולי ומסומנת כלא-מסחרית. מאחוריה ניצבים DeepSeek V4 Pro 0813 עם 155.38 ו-DeepSeek V4.1 Flash עם 155.0, שניהם ללא הגבלות, ואחר כך GLM-5.3-Flash עם 151.94 ו-GLM-5.2 עם 151.78. המודל הפתוח הקרוב ביותר לפסגה נמצא אפוא בפיגור של 9.74 נקודות — פער רחב פי שמונה-עשרה מזה שבין המקום הראשון לשני, ורחב דיו עד כדי כך שהמרווחים כלל אינם מתקרבים לגעת זה בזה.
האסימטריה הזו היא הממצא היציב היחיד בטבלה. החזית הסגורה היא התגוששות בטווח של שלוש נקודות; המרחק מהחזית הסגורה למשקלים הטובים ביותר שניתנים להורדה גדול יותר בסדר גודל. מדד מורכב שמאפשר להשוות בין דורות של מבחני ביצועים הוא בדיוק הכלי להבחין בכך, מפני שהוא יכול לומר את אותו הדבר ביולי ובספטמבר במקום לדווח שמבחן ביצועים רווי נדם.
חלק מהשורות הסמוכות שווה לנעוץ לצורך הקשר, שכן אלו המודלים שהקוראים בעצם שוקלים אותם מול Opus 5.5:
• Claude Sonnet 5 — 156.34, שוחרר ב-30 ביוני, טווח 153.61 עד 158.81
• Grok 4.6 — 156.61, שוחרר ב-12 באוגוסט, טווח 154.66 עד 158.93
• Gemini 3.8 Flash — 156.93, שוחרר ב-2 בספטמבר, טווח 154.64 עד 160.42
• Muse Spark 1.3 — 156.86, שוחרר ב-2 בספטמבר, טווח 154.73 עד 159.56
• GPT-5.6 Sol — 161.8, שוחרר ב-9 ביולי, טווח 159.26 עד 165.26
פוזיציית מדד אינה שטר

כאן טבלת המובילים מפסיקה לספר את כל הסיפור, משום ששני המודלים שבראש הרשימה ממש לא עולים אותו דבר. מהקטלוג שלנו, שמציג את שניהם במחיר המחירון של הספק ללא תוספת, Claude Opus 5.5 במחיר $4.00/$20.00 עם קריאות מטמון ב-$0.20 ו-GPT-6 Astra במחיר $10.00/$50.00 עם קריאות מטמון ב-$1.00 נמצאים במרחק של פי 2.5 זה מזה בשני הכיוונים של לוח התעריפים. Astra גם עולה מדרגה מעל 272,000 אסימוני פרומפט, שם הקלט עולה ל-$20.00 והפלט ל-$75.00; Opus 5.5 שומר על $4.00/$20.00 קבוע לאורך כל חלון 1M האסימונים שלו. שניהם מספקים 128,000 אסימוני פלט.
בצע את החישוב שעומס עבודה עם הקשר ארוך גורר בפועל — קידומת בת 180,000 אסימונים שמוגשת מהמטמון, 5,000 אסימונים שנוצרו. ב-Opus 5.5 מדובר ב-180,000 אסימונים ב-$0.20 למיליון, או כ-3.6 סנט, ועוד 5,000 ב-$20 למיליון, או 10 סנט: בערך 13.6 סנט. ב-GPT-6 Astra זה 180,000 ב-$1.00, או 18 סנט, ועוד 5,000 ב-$50, או 25 סנט: בערך 43 סנט. יתרון של 0.84 נקודות ופער עלות של פי 3.2 אינם אותו סוג של עובדה, והחלטת רכש ששוקלת רק את הראשון שקלה את המספר הקטן יותר.
Fable 5.1 מעלה את הנקודה מהצד האחר של כרטיס המחירים של אותו ספק: במחיר $10.00/$50.00 הוא מתומחר בדיוק כמו Astra, והוא משיג 164.82 — 2.53 נקודות מתחת ל-Opus 5.5 תמורת אותו כסף. המדד מציב את שלושת המוצרים המובילים של Anthropic בתוך 2.53 נקודות זה מזה, וכרטיס התעריפים שלה מציב אותם במרחק של פי 2.5 זה מזה, וזה תיאור טוב בהרבה של הבחירה העומדת בפני קונה מכל דירוג בודד.
אם אתה מתכוון להתווכח על מספר, תתווכח על התנועה שלך.

הסיבה שמדד זה בכלל שווה קריאה היא שהוא נמדד בידי מישהו שאינו הספקים — אבל המבנה של המדד המשולב עצמו קובע את תנאי הוויכוח. הכיול של Epoch, הערכות הקושי שלה והטיפול שלה במודלים שמדלגים על בנצ'מרקים — כולם נמצאים במעלה הזרם מהמספר שמופיע בטבלה, ואף אחד מהם אינו משהו שקורא יכול לגזור מחדש מצילום מסך. הדבר נכון גם לגבי בנצ'מרק הראשי של כל ספק, ולכן הצעד המועיל אינו לבחור צד ביניהם אלא להשוות ביניהם על תעבורה שבשליטתך.
שני המודלים האלה נגישים ממפתח API אחד ב-OrcaRouter, שמעביר את מחיר המחירון של הספק הלאה בתוספת של 0%: Claude Opus 5.5 במחיר $4.00/$20.00 עם קריאות מטמון ב-$0.20 וGPT-6 Astra במחיר $10.00/$50.00 כשהשכבה שמעל 272K מוחלת בדיוק כפי שהספק קובע אותה. שליחת אותה קבוצת פרומפטים לשניהם היא שינוי בקונפיגורציה ולא חוזה שני, ובמקומות שבהם שניהם מנותבים, מעבר אוטומטי לגיבוי יושב מתחת, וזה חשוב להחלטה כל כך קרובה לרצפת הרעש. לוח הדירוג יכול לומר לך ששני המודלים אינם ניתנים להבחנה. רק ההערכה שלך עצמך יכולה לומר לך איזה מהם אינו ניתן להבחנה בעבודה שלך.

מה יזיז את המספר הזה בחודש הבא?
הקובץ של Epoch הוא קובץ חי, ושלושה דברים היו משנים את הקריאה במהירות. הראשון הוא כל הערכה חדשה של מודל חזיתי שנכנסת לארבעה הראשונים, מכיוון שתצפית בנצ'מרק אחת נוספת מזיזה ציון משולב יותר כשהאשכול כל כך צמוד מאשר כשיש מוביל ברור. השני הוא הסחיפה של רווחי הסמך — הרשומות האחרונות ביותר נושאות את הרווחים הרחבים ביותר, מכיוון שהן הוערכו על המעט ביותר בנצ'מרקים חופפים, כך שהמהדורות של ספטמבר הן השורות שהכי סביר שיזוזו ושל יולי הכי פחות. השלישי הוא בנצ'מרק שמגיע לרוויה, וזה הכשל הספציפי שהמדד נבנה לשרוד: כשמרכיב מפסיק להבדיל, Epoch מבצעת שקלול מחדש של ההרכב במקום לתת ליתרון של מודל להתאדות יחד עם המבחן.
לעת עתה, הסיכום שניתן להגן עליו הוא הצר. Claude Opus 5.5 מחזיק במקום הראשון במדד Epoch Capabilities Index עם 167.35 בזכות יתרון של 0.84 נקודות שמרווח הסמך של עצמו אינו תומך בו, Claude Sonnet 5.5 העפיל למרחק של 2.15 נקודות מהמוביל מהדרג הבינוני של אותו קו, ותחום המשקלים הפתוחים נמצא ביותר מתשע נקודות מאחורי כולם. המוביל הוא הטלת מטבע בין שני ספקים. הפער של ארבע נקודות במחיר ביניהם אינו.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
