כרטיס כותרת שנוצר, שכותרתו 'רמה ב-165', עם כותרת המשנה 'Epoch Capabilities Index, קובץ מ-1 באוקטובר 2026', שלושה כרטיסי נתונים המציגים 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) ו-11 מול 20 (הערכות בנצ'מרק העומדות מאחורי כל נתון), והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Claude Sonnet 5.5 משתווה ל-Claude Fable 5.1 במדד Epoch Capabilities

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שוויון בצמרת טבלת דירוג הוא בדרך כלל הדבר הפחות מעניין שבה. זה היוצא מן הכלל, מפני ששני המודלים השווים בצמרת אינם עולים אותו סכום כסף. בקובץ מדד היכולות של Epoch שעודכן ב-1 באוקטובר 2026, Claude Sonnet 5.5 ו-Claude Fable 5.1 רשומים שניהם 165 — שורות שלוש וארבע מתוך 253 מודלים במעקב — שתי נקודות מאחורי Claude Opus 5.5 ו-GPT-6 Astra, שהם עצמם שווים ב-167, ושתי נקודות מעל Claude Opus 5 ב-163. Claude Sonnet 5.5 שוחרר ב-28 בספטמבר 2026 במחיר 2 דולר למיליון טוקנים בקלט ו-10 דולר למיליון בפלט. Claude Fable 5.1 שוחרר ב-1 בספטמבר במחיר 10 ו-50 דולר. מספר בודד אומר שהשניים ניתנים להחלפה ביכולת כללית. מחיר פלט גבוה פי חמישה אומר שהם לא. שניהם מחזיקים מעמד, והסיבה שהם מחזיקים מעמד יחד היא החלק בטבלה שאיש אינו מצטט.

מהו המדד באמת, ומי מודד

The ECI is not a vendor scoreboard. It is built by Epoch AI, an independent research organisation, as a composite that stitches scores from more than fifty distinct benchmarks into one general-capability scale, inferring each benchmark's relative difficulty from the models that happen to appear on several of them at once. The methodology is set out in a paper, “A Rosetta Stone for AI Benchmarks”, funded by Go​ogle DeepMind and written with researchers from its AGI Safety & Alignment team — but Epoch states plainly that the index is its own product and that it holds full rights over it, and the fitting code is public. That distinction matters when the funder of the research and the publisher of the score are not the same party.

שתי תכונות של הסולם קובעות כיצד ניתן לקרוא מספר בו. הראשונה היא ש-ECI מעוגן ולא מוחלט: ערכים גולמיים מותאמים מחדש כך ש-Claude 3.5 Sonnet מגיע ל-130 ו-GPT-5 ל-150, מה שאומר שנתון אומר משהו רק לצד נתון אחר מאותו קובץ. השנייה היא שאין תקרה. אין 100 להתקרב אליו, ולכן "ראש המדד" הוא אמירה על תאריך ולא על גבול שמישהו הגיע אליו.

התכונה השלישית היא זו שהופכת שוויון לסיפור. המרווחים המתפרסמים לצד כל ציון — מרווחי בוטסטרפ של 90%, שנבנו על ידי דגימה חוזרת של תוצאות הבנצ'מרק הנצפות של כל מודל בעצמו חמש מאות פעמים — זהים לשני המודלים ב-165: 162 עד 169 עבור Claude Sonnet 5.5 ו-162 עד 169 עבור Claude Fable 5.1. הספירות שהפיקו אותם אינן זהות. ה-165 של Claude Sonnet 5.5 מותאם מ-11 הערכות בנצ'מרק. ה-165 של Claude Fable 5.1 מותאם מ-20.

מדוע אותו רווח אינו מעיד על אותן ראיות

ה-ECI זקוק לפחות לארבע הערכות בנצ'מרק לפני שמודל מקבל ציון בכלל, כך ששני הנתונים עוברים את הרף בנוחות. אך הרווח הוא הצהרה על מידת הפיזור של תוצאותיו של המודל עצמו, לא על מספרן — ולכן שני מודלים יכולים להציג את אותו תחום סביב אותה הערכת נקודה, בעוד שאחד מהם נשען על כמחצית מהראיות. אם תתייחס לשני ה-165 כשווים בחוזקם, הרי שקראת את הרווח כתיקון לגודל מדגם — וזה אינו.

לאסימטריה יש השלכה מעשית על התזמון. Epoch מבצעת התאמה מחדש של המודל כולו במשותף על פני כל הנתונים בכל פעם שמגיעות הערכות חדשות, כך שהנתון של מודל יכול לזוז בלי ששום דבר במודל הזה משתנה. למודל עם 11 תצפיות יש יותר מרחב תנועה מזה עם 20, מה שהופך את Claude Sonnet 5.5 לסביר יותר מבין השניים להשתנות ברוויזיה הבאה — בכל אחד מהכיוונים.

האופן שבו Epoch עצמה ממסגרת את הקריאה הנוכחית צר יותר מהכותרות שהיא הפיקה. סיכום הארגון את העדכון פותח בכך ש-Claude Opus 5.5 תופס את המקום הראשון עם 167, לפני GPT-6 Astra בפער קטן, ומעניק את המשפט השני לעובדה ש-Claude Sonnet 5.5 "השתווה בקירוב" ל-Claude Fable 5.1 עם 165. "השתווה בקירוב" הוא הביטוי הקובע, והמרווחים שפורסמו הם הסיבה לכך שהוא הביטוי הנכון.

היכן ששני הפרופילים למעשה נבדלים

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

רמה במדד המשוקלל אינה מעידה על רמה במרכיבים. Epoch מפרסמת פאנל לפי בנצ'מרק בכל עמוד דגם, ושישה בנצ'מרקים מופיעים גם בעמוד של Claude Sonnet 5.5 וגם בעמוד של Claude Fable 5.1 — מה שהופך אותם לששת היחידים שבהם השוואה בתנאים זהים זמינה מהאינדקס עצמו.

• חידות משחקי תעלומה — Claude Sonnet 5.5 65% מול Claude Fable 5.1 58%

• FrontierMath רמות 1–3 (v2) — Claude Sonnet 5.5 89% לעומת Claude Fable 5.1 90%

• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% לעומת Claude Fable 5.1 88%

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% לעומת Claude Fable 5.1 100%

• בנצ'מרק הרכבת רהיטים — Claude Sonnet 5.5 75% לעומת Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% לעומת Claude Fable 5.1 71%

ארבע נקודות של תנועה לכאן או לכאן במדד משולב כה צפוף, והפיצול הבסיסי רחוק מלהיות סימטרי. Claude Sonnet 5.5 מוביל במקומות שבהם העבודה היא בסגנון משחקים ורב-מודלית — פתרון חידות, הרכבה פיזית — ושווה במתמטיקה תחרותית. Claude Fable 5.1 מוביל ב-8 נקודות בדרג הקשה ביותר של FrontierMath וב-24 נקודות ב-SimpleQA Verified, מערך הידע העולמי שבו ציון של 47% מול 71% הוא הפער הבודד הגדול ביותר בפאנל המשותף. קונה הבוחר בין שני המודלים הללו אינו בוחר בין שתי קריאות של אותה יכולת; הוא בוחר בין מודל זול יותר שחזק יותר בעבודה מסוימת ובין מודל יקר יותר שחזק יותר בעבודה אחרת, כאשר מדד היכולת הכללית נמנע מלהפריד ביניהם.

המדד של Epoch גם מבהיר במפורש שיתרון בבנצ'מרק בודד לא חייב להופיע במדד המשולב. הבנצ'מרקים אינם משוקללים לפי דיוק, ומודל שמתמחה יכול לקבל ציון נמוך מיריב בעל פרופיל שונה גם בעודו מוביל במבחנים בודדים — כך נאמר ישירות בתיעוד שלו. זה לא פגם שמתנצלים עליו; זו בדיוק המטרה של מדד משולב המבוסס על חמישים ומשהו מבחנים.

שני המכשירים הבלתי תלויים מצביעים לכיוונים מנוגדים

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

ישנה מדידה עצמאית שנייה בתפוצה, והיא אינה מסכימה עם הראשונה בשאלה איזה משני המודלים הללו מוביל. במדד Artificial Analysis Intelligence Index, הנתונים שהקטלוג שלנו מציג עבור שני המודלים הם 56 עבור Claude Sonnet 5.5 ו-53.4 עבור Claude Fable 5.1, שנלקחו מאותה מהדורה של המדד ולכן נושאים את אותו מדגם של מודלים שנבחנו. שלוש נקודות הפרש, לטובת המודל הזול יותר — בעוד ש-Epoch קוראת אותם כזהים.

אף אחת מהקריאות אינה שגויה, והדרך להשתמש בהן היא לשים לב במה הן חלוקות. שני המדדים מכסים מערכי בנצ'מרק שונים ומשקללים אותם באופן שונה; Epoch composite בנוי לשרוד רוויה של בנצ'מרקים, בעוד שמדד Artificial Analysis הוא צירוף ישיר של סל שונה. כשצמד מודלים כל כך קרובים, לבחירה בכלי המדידה יש משקל רב יותר מאשר לפער הנמדד. קורא שרוצה את החזק מבין שני מספרים סמוכים צריך להסתכל על לוח הבנצ'מרקים הבודדים המשותפים שלמעלה, ולא על אף אחד משני נתוני הכותרת, מפני שזהו המקום היחיד שבו שני המודלים מושווים זה לזה באותו מבחן.

יש עוד פיסת הקשר אחת שהמדד המשולב אינו כולל, אבל Epoch כן: תאריך שחרור. Claude Fable 5.1 מדורג רביעי מבין 253 מודלים במעקב היום. בזמן שחרורו שלו ב-1 בספטמבר 2026 הוא דורג ראשון מבין 247 המודלים שנעקבו אז. המשקולות שלו לא השתנו. החזית פשוט עקפה אותו בשישה מקומות בתוך חודש — וזו הצורה של הטבלה כולה, והסיבה לכך שקריאת מדד חודשית היא תמונת מצב ולא פסק דין.

מה המחיר של ההבדל, ואיפה נמצא הצד הזול.

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

השוויון ביכולת הכללית, והפער של פי 2.5 בקלט ופי 5 בפלט — זהו כל התוכן המעשי של קריאה זו. שני המודלים כלולים בקטלוג שלנו — anthropic/claude-sonnet-5.5 במחיר 2.00 דולר למיליון בקלט ו-10.00 דולר למיליון בפלט, עם 0.20 דולר לקריאות מטמון, ו-anthropic/claude-fable-5.1 במחיר 10.00 ו-50.00 דולר עם 0.25 דולר לקריאות מטמון — ושניהם מועברים הלאה במחיר המחירון של הספק עצמו בלי תוספת מרווח, כך ששינוי בתעריפים של הספק נוחת אצלנו באותו יום שבו הוא נוחת אצלם.

ההישנות חשובה יותר מהכותרת. קחו עומס עבודה ששולח קידומת של 120,000 טוקנים מהמטמון ומייצר 8,000 טוקנים של פלט, ומופעל פעם ביום במשך חודש. ב-Claude Sonnet 5.5 הקידומת הזו עולה 120,000 טוקנים בתעריף $0.20 למיליון, כ-2.4 סנט, בתוספת 8,000 ב-$10 למיליון, 8 סנט — בערך 10.4 סנט להרצה, או כ-$3.12 במשך שלושים יום. ב-Claude Fable 5.1 אותה קידומת היא 120,000 ב-$0.25, 3 סנט, בתוספת 8,000 ב-$50, 40 סנט — בערך 43 סנט להרצה, או $12.90 לאורך החודש. שני המודלים משרתים את אותו חלון של 1M טוקנים עם פלט של עד 128K, כך שההבדל הוא בכרטיס ולא בתקרה.

מנגד, ששת הבנצ'מרקים המשותפים אומרים באיזה כיוון הכסף הנוסף קונה משהו. צוות שעבודתו נראית כמו FrontierMath Tier 4 או שליפה עובדתית פתוחה קונה פער אמיתי של 8 עד 24 נקודות במבחנים האלה בכך שהוא משלם פי ארבעה; צוות שעבודתו נראית כמו פתרון חידות או הרכבה מולטימודלית קונה 5 עד 7 נקודות בכיוון ההפוך בעוד שהוא משלם את המספר הקטן יותר. בפלטפורמה אחת אלה לא שתי החלטות רכש. שני המודלים נמצאים מאחורי מפתח API אחד מבין יותר מ-200 מודלים, כך שהשוואה ביניהם על התעבורה שלך היא שינוי תצורה ולא חוזה שני, ובמקום שבו שניהם מנותבים, מעבר אוטומטי נמצא מתחת — מה שחשוב כששני כלי מדידה בלתי תלויים חלוקים לגבי מי מהם מוביל.

מה יזיז את הקריאה הזו?

שלושה דברים היו משנים זאת, ורק אחד מהם כרוך באחד משני המודלים.

הראשון הוא עוד הערכות בנצ'מרק. Claude Sonnet 5.5 נכנס למדד לפני ארבעה ימים עם 11 מאחוריו; כל הערכה נוספת מצמצמת את המרווח שלו ויכולה להזיז את האומדן הנקודתי שלו, והתאמה מחדש משותפת פירושה שהשינוי אינו מוגבל לשורה החדשה.

השני הוא הגעתו של מודל חזית נוסף. ארבע השורות העליונות משתרעות על פני ארבע נקודות, עם שני תיקו בתוך הטווח הזה, כך שמצטרף חדש אחד שהוערך היטב נוחת בתוך האשכול ולא מתחתיו — והמרווחים שפורסמו, החופפים בכל ארבעתם, משמעים שהסדר ביניהם הוא שובר שוויון ולא מדידה.

השלישי הוא המחיר של המודלים עצמם, שאף אינדקס לא עוקב אחריו. הפער שעליו סובב הקטע הזה הוא פער בכרטיסי תעריפים: 2$ ו-10$ לעומת 10$ ו-50$ היום. שינוי באחד מכרטיסי התעריפים מזיז את ההחלטה בלי להזיז ולו ציון יכולת אחד.

הסיכום שאפשר להגן עליו הוא המצומצם. במדד המשולב של Epoch AI, בקובץ שעודכן ב-1 באוקטובר 2026, Claude Sonnet 5.5 ו-Claude Fable 5.1 הם אותו מספר — 165, חולקים את המקום השלישי, עם מרווחים מפורסמים זהים הנשענים על כמויות שונות של ראיות. במכשיר הנפרד של Artificial Analysis אותם שני מודלים מרוחקים זה מזה בשלוש נקודות. בששת מבחני הביצועים שבהם המדד משווה אותם ישירות, הם מחליפים ביניהם את ההובלה לפי תחום במקום להיות באותו מפלס. ובמחירון הם כלל לא קרובים. הדבר האחד שקריאה זו לא תתמוך בו הוא המשפט שסביר ביותר שהיא תצוטט בו: שהמודלים שקולים זה לזה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית