
בנצ'מרקים של Claude Opus 5.5: כל ציון, הגדרת המאמץ שממנה הוא הגיע, ומי מדד אותו
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
המספר הראשי של Anthropic עבור Claude Opus 5.5 ב-Terminal-Bench 4.0 הוא 66.4%, לעומת 52.3% עבור Claude Opus 5 באותה טבלה — ואותם 66.4% הופקו ברמת xhigh של מאמץ, ולא בברירת המחדל של המודל, medium. המודל שוחרר ב-22 בספטמבר 2026, יומיים לפני כתיבת העמוד הזה, כך שמדובר במודל GA עם תמחור של מודל GA וטבלת בנצ'מרקים של מודל GA. הנתון הבלתי תלוי באותו בנצ'מרק, מטעם Artificial Analysis, הוא 59.6%, בתצורה שנושאת בתוכה את ניתוב אמצעי ההגנה בצד השרת של Anthropic. בין שני המספרים האלה ניצבים הבדל בהרנס, הבדל ברמת המאמץ והבדל בניתוב, ואיש — כולל אנחנו — עדיין לא יכול לומר כמה מהפער אחראי כל אחד מהם. מה שהעמוד הזה יכול לעשות הוא לרכז במקום אחד כל נתון שפורסם עבור Claude Opus 5.5, לציין מי הפיק אותו, לציין באיזו הגדרה הוא הופק, ולכלול את השורות שבהן GPT-6 Astra ו-Claude Fable 5.1 מנצחים.
התחל מהגדרת המאמץ, כי היא מזיזה את המספרים יותר מאשר המודלים.
ברירת המחדל של Claude Opus 5.5 היא medium effort ב-Claude API. ברירת המחדל של Claude Opus 5 הייתה high. אותה רמה בעלת אותו שם גם אינה אותו תקציב חשיבה בשני המודלים, כך ש"הרצנו את שניהם ב-high" לא מהווה השוואה מבוקרת גם כשהתווית זהה. חשיבה אדפטיבית תמיד פעילה ואי אפשר לכבות אותה ב-Opus 5.5; פרמטר ה-effort משנה עומק, השהיה ועלות, ותו לא.
הנתון של Anthropic עבור Terminal-Bench 4.0 הורץ ב-xhigh. העובדה הבודדת הזו היא ההסתייגות החשובה ביותר בעמוד הזה, מפני שהבנצ'מרק שהיא עומדת בראשו הוא זה עם הפער המדווח הרחב ביותר לעומת המודל הקודם, ומפני שאותה טבלה מראה מה קורה כשמשאירים את ההגדרה ללא שינוי:
• FrontierCode v1.1 Main — 54.4% ב-xhigh, 54.6% ב-medium כברירת מחדל. דווח על ידי הספק. ההרצה במצב medium היא גבוהה מהרצת xhigh. בעומס העבודה הזה מחוג המאמץ לא הניב שום דבר מדיד; שני המספרים הם אותו מספר.
• CursorBench 4.0 — 57.8% ב-xhigh, 52.5% ב-medium.מדווח על ידי הספק. אותו מודל, אותה מערכת הרצה, אותו שבוע: 5.3 נקודות — וזהו פער המאמץ הגדול ביותר שעל השולחן.
שתי השורות האלה שיושבות בתוך טבלה אחת של ספק הן כל הטיעון. עומס עבודה אחד אינו רגיש למאמץ והאחר רגיש מאוד למאמץ, וכרטיס המודל אינו יכול לומר לך מראש איזה סוג של עומס עבודה הוא שלך. המסקנה שהנתונים תומכים בה היא צרה וראויה להיאמר באופן צר: רמת המאמץ הנכונה היא כעת מדידה לכל עומס עבודה בנפרד, ולא ברירת מחדל שאתה יורש. היא אינה תומכת בטענה ש"Opus 5.5 מהיר יותר ממה שהמדדים שלו מרמזים" או ש"Anthropic החלישה את ברירת המחדל בכוונה" — לשם כך תזדקק לבדיקות מקיפות לכל עומס עבודה בנפרד על פני כל חמש ההגדרות, ואיש לא פרסם אותן. היא כן אומרת שאם אתה נודד מ-Opus 5 ומשאיר את הגדרת המאמץ שכבר הייתה לך, שינית את הניסוי, ולא רק את המודל.
עוד אסימטריה אחת, והיא חותכת בכיוון ההפוך. עמודת המתחרה בשורת Terminal-Bench של Anthropic היא GPT-6 Astra ב-57.9% — הורץ במאמץ גבוה, לפי הערת התרשים של Anthropic עצמה, בעוד ש-66.4% של Opus 5.5 הורץ ב-xhigh. טבלת ספק שמריצה את המודל שלה בהגדרה אחת ואת המתחרה באחרת אינה השוואה ראש-בראש, לא משנה כיצד נראים שני המספרים זה לצד זה.
טבלת הספקים, עם המקור וההגדרה בכל שורה
כל מה שמופיע בסעיף הזה הוא מדווח על ידי הספק: חומר ההשקה של Anthropic, תשתית הבדיקה של Anthropic, אמצעי הגנה בסביבת ייצור פעילים, חשיבה אדפטיבית במאמץ מרבי אלא אם השורה אומרת אחרת. יש לקרוא זאת כמי ש-Anthropic מודדת את Anthropic.
• Terminal-Bench 4.0 — 66.4%, ברמת מאמץ xhigh. דווח על ידי הספק, שגיאת תקן של כ-±2.6 נקודות. באותה שורה: Claude Opus 5 52.3%, Claude Fable 5.1 55.8%, GPT-6 Astra 57.9% (ברמת מאמץ high), GPT-5.6 Sol 37.3%. Terminal-Bench 4.0 הוא במפורש Benchmark שהספק מודה שהוא פרוקסי לא מושלם לעבודת טרמינל אמיתית, והוא הנתון הראשי של המודל.
• FrontierCode v1.1 ראשי — 54.4% ב-xhigh, 54.6% ב-default medium. לפי דיווח הספק. Opus 5 48.0%, Fable 5.1 50.3%, GPT-6 Astra 53.3%, GPT-5.6 Sol 47.5%. כרטיס המערכת של Anthropic כולל גם את הווריאנט Extended ב-63.6% ונתון מיטבי ב-medium של Extended העומד על 65.3%.
• CursorBench 4.0 — 57.8% ב-xhigh, 52.5% ב-medium.מדווח על ידי הספק. Opus 5 46.6%, Fable 5.1 51.8%, GPT-5.6 Sol 41.7%. שים לב ששורות ה-CursorBench של Fable 5.1 ו-Opus 5 הן במאמץ מרבי, כך ש-Opus 5.5 ב-medium מושווה לבני משפחתו ב-max.
• GDPval-AA v2.1 — 1,846 Elo. זוהי השורה היחידה בטבלת הספק שהספק עצמו לא הריץ. GDPval-AA הוא הערכה של Artificial Analysis, והכתוב של Artificial Analysis עצמה על Opus 5.5 מציין את אותו 1,846, כאשר Fable 5.1 עומד על 1,735 ו-Opus 5 על 1,708. בטבלת הספק: Fable 5.1 1,735, Opus 5 1,708, GPT-5.6 Sol 1,588, GPT-6 Astra 1,542. זוהי השורה היחידה כאן שבה שני ארגונים מסכימים על אותו מספר, וזה מפני שזו אותה מדידה.
• AutomationBench (Zapier) — 40.0%. דווח על ידי הספק, והורץ עם ללא מודלי גיבוי, כך שכל התערבות של אמצעי הגנה נוקדה ככישלון. GPT-6 Astra 41.4%, Fable 5.1 31.4%, GPT-5.6 Sol 28.8%, Opus 5 26.9%.
• Humanity's Last Exam, עם כלים — 67.7%. מדווח על ידי הספק. Fable 5.1 65.6%, Opus 5 63.6%, GPT-6 Astra 57.2%. כרטיס המערכת של Anthropic מדווח בנפרד 64.4% ללא כלים, וזה הנתון שעליכם להסתמך עליו אם אתם משווים למקור שאינו מעניק למודלים שלו גישה לכלים.
• Terminal-Bench-Science 0.1 — 58.7%. דווח על ידי הספק, שגיאה תקנית בערך ±3.5 עד ±5 נקודות, כך שמדובר בטווח ולא בנקודה. GPT-6 Astra 64.6%, Fable 5.1 52.6%, Opus 5 29.0%, GPT-5.6 Sol 22.4%.
• OSWorld 2.0 — 81.8% חלקי. מדווח על ידי הספק, והמילה "חלקי" עושה עבודה אמיתית במשפט הזה: כרטיס המערכת של Anthropic נותן שיעור השלמה קפדני של 48.7% לאותו מודל באותה הערכה. שניהם פורסמו; המספר החלקי הוא זה שמצוטט. Fable 5.1 80.7%, Opus 5 74.0%.
• Chartography, עם כלים — 89.0%. לפי דיווח הספק. Fable 5.1 88.4%, Opus 5 83.4%.

המספרים הבלתי־תלויים, ומה המשמעות האמיתית של "Default Fallback"
Artificial Analysis הוא הצד השלישי היחיד עם הערכה שפורסמה ועדכנית של Claude Opus 5.5 במדד משולב, והנתונים שלו הם אלה שצריך להעמיד לצד אלה של Anthropic. כפי שנקרא ב-24 בספטמבר 2026:
• מדד האינטליגנציה — 58 במאמץ מקסימלי, בתצורה המסומנת "Adaptive Reasoning, Max Effort, Default Fallback". בלתי תלוי, נמדד על ידי Artificial Analysis. המאמר של המדד עצמו מכנה את 58 "הציון הגבוה ביותר שמדדנו, בכמה נקודות". אותו מדד מפרסם גם את Opus 5.5 בכל שאר הגדרות המאמץ, והפיזור הוא החלק השימושי: 56 ב-xhigh, 54 ב-high, 51 ב-medium, 42 ב-low. זהו פער של 16 נקודות על פני סרגל המאמץ במודל בודד — גדול מהפער בין רוב המודלים בלוח הזה.
• Terminal-Bench 4.0 — 59.6%. תוצאה בלתי תלויה. Artificial Analysis מדווחת עליה כ"ברמה של המובילה GPT-6 Astra (xhigh)" וכ-11 נקודות מעל Claude Opus 5.
• המבחן האחרון של האנושות — 61.4%. בלתי תלוי, והתוצאה הטובה ביותר הקודמת באותו לוח הייתה 59.1%, שנקבעה על ידי Claude Fable 5.1.
• SciCode — 66.9%. תוצאה עצמאית, לעומת 63.1% של Claude Fable 5.1.
כעת הפסקה שדורשת הסבר ולא ציטוט. "Default Fallback" אינו ארטיפקט של בנצ'מרק ואינו הגדרה של Artificial Analysis — הוא ניתוב ההגנה בצד השרת של Anthropic, שנשאר מופעל. Claude Opus 5.5 מגיע עם שכבת ההגנה שנשמרה בעבר ל-Fable 5.1: רוב בקשות הסייבר מנותבות בשקיפות מחדש אל Claude Opus 4.8, ועבודת ביולוגיה נופלת חזרה אל Claude Opus 5 אלא אם החשבון מאומת. כאשר Artificial Analysis מריצה את המדד עם Default Fallback מופעל, היא מודדת את המערכת הפרוסה — הדבר שמפתח API לא מאומת באמת מגיע אליו — ולא צ'קפוינט נקי של המשקולות של Opus 5.5. זו המדידה הישרה יותר עבור קונה, והיא המדידה הפחות נקייה עבור בנצ'מרק. Anthropic אומרת זאת בעצמה לגבי הטבלה שלה: התערבויות בהרצת Terminal-Bench 4.0 הביאו לכך שמשימות סייבר הושלמו על ידי Opus 4.8 ומשימות ביולוגיה על ידי Opus 5, והחברה מציינת שהתערבויות אלו כנראה הורידו את הציון המדווח. אז ניתוב ההגנה הוא עובדה תפעולית ממשית בשני הכיוונים, ושום נתון בעמוד הזה לא מבודד את המודל הבסיסי ממנו.
היכן ששתי הטבלאות אינן מסכימות, ומדוע
הציבו את שני המספרים של Terminal-Bench 4.0 זה לצד זה ותקבלו 66.4% מול 59.6% — 6.8 נקודות, באותו בנצ'מרק, עבור אותו מודל. הסיבות ידועות, וכל אחת מהן גדולה מספיק כדי להיות משמעותית בפני עצמה:
• הרנסים שונים. Anthropic הריצה תבנית סוכן (scaffold) משלה; Artificial Analysis הריצה הרנס סוכן ייחוס משלה. ציון benchmark טרמינלי הוא תכונה של ה-scaffold בתוספת המודל, ולא של המודל בלבד, ואף אחד מהארגונים לא פרסם ניסוי של החלפת scaffold.
• הגדרות מאמץ שונות. הנתון של Anthropic, 66.4%, הוא ברמת xhigh. הגדרת המאמץ המשויכת ל-59.6% של Artificial Analysis אינה מצוינת במשפט שנושא את המספר, ונתוני הבנצ'מרק המדווחים שלה הם בדרך כלל אלה של מאמץ מקסימלי.
• אמצעי הגנה מופעלים, בשני המקרים, נספרו באופן שונה. Anthropic פעלה עם fallback והתייחסה להתערבויות ככאלה שמפחיתות את הציון אך הן בכל זאת נספרו. ב-AutomationBench היא פעלה ללא fallback וספרה התערבויות ככישלונות מוחלטים. Artificial Analysis פועלת עם fallback מופעל לאורך כל הדרך.
• המספרים זזים אפילו בתוך הטבלה של אותו ספק עצמו.Anthropic מפרסמת את Claude Opus 5 עם 52.3% ב-Terminal-Bench 4.0 ומציינת שהנתון של 51.8% בלוח הציבורי עבור אותו מודל נמצא "בתוך הרעש".
ואז הראיה החזקה ביותר בעמוד הזה לשאלה כמה שווה הרנס. לוח המובילים הציבורי של Terminal-Bench 4.0, שנלכד ב-24 בספטמבר 2026, אינו מכיל שורה של Claude Opus 5.5 כלל. הערך העליון בו הוא GPT-6 Astra במאמץ מקסימלי, סוכן Codex, 58.2% ±2.8; השני הוא Claude Fable 5.1 במאמץ מקסימלי דרך Claude Code עם 57.9% ±3.8; השלישי הוא Claude Opus 5 ב-xhigh דרך Claude Code עם 53.9% ±3.2. כך שה-66.4% אינו רק מספר שונה מ-59.6% העצמאי — הוא כלל לא נמצא בלוח הציבורי, והגרסה של הלוח עצמו ל-Claude Opus 5 היא 53.9%, ולא 52.3% שטבלת ההשקה מציגה. עד ש-Terminal-Bench יקבל ויפרסם הגשה של Opus 5.5, ה-66.4% הוא תוצאת הרנס של הספק שאף אחד לא שחזר, וה-59.6% הוא המספר שגורם חיצוני אכן יעמוד מאחוריו. שים לב גם שבלוח הזה עצמו, מוביל ה-Terminal-Bench 4.0 של Artificial Analysis וה-Opus 5.5 של Anthropic מגיעים לאותו 59.6% — וזהו תיקו בהרנס אחד, ואינו אומר לך דבר על האחר.

השורות שבהן Opus 5.5 מפסיד
סיכום שמשמיט את ההפסדים אינו סיכום, והטבלה של Anthropic עצמה מכילה את שניהם.
• Terminal-Bench-Science 0.1 — 58.7% לעומת 64.6% של GPT-6 Astra. דווח על ידי הספק, בטבלה של Anthropic, והפסד של 5.9 נקודות למתחרה נקוב בשורה הקרובה ביותר לחשיבה מדעית. הערת טעות התקן של הספק עצמו (±3.5 עד ±5) משמעה שהפער נמצא סמוך לקצה הרעש ולא בנוחות בתוכו — אך זהו הפסד בעמוד של הספק עצמו, והטווח אינו הופך אותו לניצחון. Claude Opus 5 עומד על 29.0% באותה שורה, כך שהרווח הבין-דורי אמיתי גם במקום שבו המתחרה מוביל.
• AutomationBench — 40.0% לעומת 41.4% של GPT-6 Astra. מדווח על ידי הספק, פער של 1.4 נקודות, ובהרצה לא היו מודלים חלופיים, כך שהתערבויות אמצעי הגנה נוקדו ככשלים. משמעות הדבר היא שהשוואה מסוימת זו מודדת את Opus 5.5 כשהיא כוללת את קנס הניתוב שלו, מול מתחרה שקנס הניתוב שלו, יהא אשר יהא, אינו מתואר. זו השורה הפחות ניתנת לפרשנות בעמוד, לשני הכיוונים.
שני מקומות נוספים שבהם היתרון דק יותר ממה שהכותרת מרמזת, ושניהם לפי דיווח הספק. ב-Humanity's Last Exam with tools הפער מול Claude Fable 5.1 הוא 2.1 נקודות (67.7% מול 65.6%); ב-Chartography with tools הוא 0.6 נקודות (89.0% מול 88.4%); ב-OSWorld 2.0 partial הוא 1.1 נקודות (81.8% מול 80.7%). אלו השורות שבהן "Opus 5.5 הוא המודל הסוכני הטוב ביותר" היא טענה על דירוג ולא על פער מדוד, והבדל של 0.6 נקודות בקריאת תרשימים לא אמור להכריע רכש.
המעמד העצמאי של Claude Fable 5.1, לפי גרסת מדד שונה
הצבת Opus 5.5 מול אחיו של עצמו דורשת סעיף משל עצמה, וצריך לצרף לה אזהרה, כי ההשוואה קשה יותר ממה שהיא נראית.
כאשר Artificial Analysis פרסמה את הסקירה שלה על Claude Fable 5.1 ב-1 בספטמבר 2026, המודל קיבל 66 במאמץ מקסימלי במדד ה-Intelligence Index שלה וכינתה אותו הציון הגבוה ביותר שהיא מדדה — מעל Claude Opus 5 עם 63 ו-GPT-5.6 Sol עם 61. במדד כפי שהוא מופיע ב-24 בספטמבר 2026, אותו דגם מופיע עם 53 במאמץ מקסימלי עם גיבוי, ו-Opus 5.5 מופיע עם 58 בתצורה המקבילה. הסקירה מ-22 בספטמבר על Opus 5.5 מכנה את 58 "הציון הגבוה ביותר שמדדנו בפער של כמה נקודות."
שני המשפטים האלה לא יכולים להיות נכונים שניהם על סולם אחד, והפתרון הוא שהם אינם על סולם אחד. המדד הוא אובייקט חי ש-Artificial Analysis מעדכנת; שניים מהמאמרים שפרסמה, בהפרש של חמישה שבועות, מציבים את אותו זוג אחים משני עבריו של המקום הראשון. זו אמירה על עדכוני גרסאות של המדד, לא על נסיגה של מי מהשניים, והיא אומרת שה-66 וה-58 אסור שלעולם יודפסו זה לצד זה. בקריאה באותו יום, באותה טבלה, באותה תצורה מסומנת, הסדר הנוכחי מציב את Opus 5.5 בחמש נקודות מעל Fable 5.1 — ואפילו זו השוואה באותו מדד, של אותו ספק מדד, ולא השוואה ראש בראש מבוקרת. מה שבטוח לומר הוא מצומצם יותר: בעדכון הנוכחי של המדד המשולב העצמאי היחיד שמודד את שניהם, Opus 5.5 הוא החזק מבין שני המודלים של Anthropic, וה-66 הידוע יותר של Fable 5.1 שייך לעדכון קודם של אותו מדד.
ההגדרות שוות עוד משפט אחד, כי קל לבלבל ביניהן. גם ה-66 של Fable 5.1 וגם ה-58 של Opus 5.5 הם שורות במאמץ מרבי — אבל חמש הגדרות המאמץ של Fable 5.1 משתרעות על טווח של פי 11 בשימוש בטוקני פלט, מ-13.1M ב-low ועד 143.7M ב-max, עם ציוני אינדקס מ-58 עד 66. נקודת אינדקס בודדת עבור מודל עם פיזור פנימי כה גדול היא תחליף גרוע לשורה שבאמת היית מריץ.
עלות טוקנים היא ציר בנצ'מרק בפני עצמו
כל מספר שלמעלה הוא ציון. אף אחד מהם אינו חשבון, ובמודל הזה החשבון הוא המקום שבו נמצאת התנועה המעניינת.
Artificial Analysis מודדת את Claude Opus 5.5 במאמץ מקסימלי תוך שימוש בסדר גודל של 119,000 אסימוני פלט לכל משימת Intelligence Index — הגבוה ביותר באינדקס שלה. לשם השוואה, על אותו לוח ובאותה הגדרה: Claude Opus 5 כ-73,000, Claude Fable 5.1 כ-78,000, וGPT-6 Astra כ-27,000. אסימוני חשיבה מחויבים כאסימוני פלט, ולא ניתן לכבות חשיבה אדפטיבית ב-Opus 5.5, כך שהאסימונים שמודל מוציא על עיון אינם הערת שוליים במחיר שלו — הם רובו.
הריצו את החישוב, כי מחיר המחירון מטעה כשלעצמו. Opus 5.5 רשום במחיר של $4.00 לקלט / $20.00 לפלט, קיצוץ של 20% לעומת $5.00 / $25.00 של Opus 5. Artificial Analysis עדיין מודדת את Opus 5.5 במאמץ מקסימלי כעולה בערך $5.98 למשימת אינדקס לעומת $5.86 עבור Opus 5 באותה הגדרה — מעט יותר, לא פחות, כי בערך פי 1.6 מטוקני הפלט אוכלים את כל קיצוץ התעריף של 20% ואף יותר מכך. לאורך כל האינדקס, Opus 5.5 הפיק 260M טוקני פלט לעומת חציון של 88M בלוח, שאותו המעריך מתייג כ"מאוד דברני".
סיפור העלויות, אם כן, חי כולו בהגדרת המאמץ, והוא עובד רק אם אתם משתמשים בה. במאמץ מקסימלי, Opus 5.5 הוא מודל יקר יותר לכל משימה שהושלמה מאשר המודל שהוא מחליף. במאמץ בינוני — ברירת המחדל בפועל של המוצר, וזה התחום שאליו מתייחסת הטענה של Anthropic בדבר "עלות נמוכה בכ-40% להרצה בעומסי עבודה טיפוסיים" — החיסכון אמיתי, אבל זו הצהרה על ממוצע על פני עומסי עבודה שהספק בחר, ולא תוצאה מבוקרת לכל משימה. הקריאה המעשית: הפחתת המחיר של 20% היא הנחה במחירון וברירה בחוגת המאמץ, לא חיסכון אוטומטי. אם תוכנית ההגירה שלכם היא "להחליף את מזהה המודל ולהשאיר את ההגדרות", אתם קונים את הגרסה היקרה.
מה לא מבוסס בכלל?
זהו הקטע ששאר העמוד קיים כדי לתמוך בו.
• לא פורסמה השוואה ישירה, בלתי תלויה, עם מאמץ תואם ו-harness תואם, של Claude Opus 5.5 מול כל יריב בשם.כל השוואה בין ספקים שונים בדף זה — Opus 5.5 מול GPT-6 Astra, מול GPT-5.6 Sol, מול Claude Fable 5.1 — היא השוואה בין שני טבלאות שהופקו על ידי שתי חברות שונות, על שני harnesses שונים, בהגדרות מאמץ שונות, שאחת מהן היא בדרך כלל המודל של הספק עצמו בהגדרה נוחה. אין ניסוי בשום מקום ברשומה הציבורית שמחזיק את ה-scaffold ואת המאמץ קבועים בין שני ספקים ומדווח על שניהם.
• הפילוח של הטוקנים לפי בעיה אינו מפורסם. הנתון המצרפי של טוקני הפלט נמדד באופן בלתי תלוי, אך כמה ממנו הוא חשיבה לעומת טקסט תשובה אינו מפורסם על ידי איש מבין אלה שיכולנו למצוא. כל עמוד שנותן לך מספר מדויק של טוקני חשיבה עבור המודל הזה נותן לך מספר שאיש לא מדד.
• רוב כרטיס המערכת אינו נבחן על ידי צדדים שלישיים. SWE-bench Pro 89.9%, Multilingual 93.9%, DeepSWE v1.1 74.2%, ProgramBench 91.2%, OfficeQA 78.9%, HealthBench Professional 65.6% מותאם לאורך, GMMLU 94.3%, ArXivMath 96.9% עם כלים — הכול מדווח על ידי הספק, ואף אחד מהם לא שוחזר באופן עצמאי במועד כתיבת הדברים.
• הנתון המרכזי של Terminal-Bench 4.0 לא מופיע בלוח הציבורי.נדון לעיל, והוא שייך גם לרשימה הזאת: המספר היחיד המצוטט ביותר על המודל הזה הוא מספר שאיש מחוץ לספק לא הריץ.
• Anthropic מדווחת ש-Claude Opus 5.5 "לעתים קרובות חושד שהוא נבחן" — במילותיה של החברה עצמה, המוצגות כמגבלה על הערכת הבטיחות שלה. יש להתייחס לכך ברצינות כבעיה של מדידה, ולא כאל קוריוז: אם המודל מתנהג אחרת כאשר הוא מאמין שהוא נבחן, אז כל מספר בנצ'מרק בעמוד הזה, של ספק או עצמאי, הוא מדידה של המודל תחת תצפית, והמידה שבה זה שונה מהתנהגות בעת פריסה אינה ידועה ואינה מכומתת. זה חל באותה מידה על השורות הטובות ועל הרעות. זו ההסתייגות היחידה ששום כמות של מתודולוגיית מאמץ מותאם לא מתקנת.
• Sonnet 5.5 ו-Haiku 5.5 אינם זמינים. Anthropic הכריזה עליהם ל"בשבועות הקרובים". הם טרם שוחררו, אין להם מדדי ביצועים מפורסמים, ושום דבר בעמוד הזה לא חל עליהם.
מחיר, מעטפת, והחלקים במפרט שמשנים את הקוד שלך
לפי המחירון שפרסמה Anthropic ב-24 בספטמבר 2026: 4.00 דולר למיליון טוקנים בקלט, 20.00 דולר למיליון בפלט, 0.20 דולר למיליון בקריאת מטמון, 5.00 דולר למיליון בכתיבה למטמון ל-5 דקות, 8.00 דולר למיליון בכתיבה למטמון לשעה, והנחה של 50% בשני הכיוונים ב-Batch API. תעריף קריאת המטמון הוא השקט — הוא 5% מקלט הבסיס, בעוד שרוב מודלי Claude עומדים על 10% ו-Fable 5.1 עומד על 2.5%. מצב מהיר מתומחר בנפרד ב-8.00 / 40.00 דולר, ו-Anthropic מתארת אותו כתצוגה מקדימה למחקר, לא כשכבה כללית.
זהו הקטע שבו טבלת מחירים מפסיקה להיות טריוויה והופכת לחשבון שנתב יכול לעשות בשבילך. Claude Opus 5.5מוגש בתור anthropic/claude-opus-5.5ב-OrcaRouter באותם $4.00 / $20.00, עם מחירי מחירון המועברים הלאה בתוספת של 0% — כך שברגע שאנתרופיק מזיזה תעריף, זה התעריף כאן, באותו יום ובלי השהיית תימחור שצריך לקחת בחשבון במודל. המרכיבים שמכריעים את החשבון האמיתי הם אלה שהקטלוג נושא לצד המחיר: קריאת מטמון ב-$0.20 ב-5% מקלט הבסיסי לעומת 2.5% אצל Fable 5.1, חלון ההקשר של 1M טוקנים, ותקרת הפלט של 128K. מכיוון שפרמטר המאמץ הוא המקום שבו העלות של המודל הזה באמת זזה — תנודה של 16 נקודות במדד וכ-119,000 טוקני פלט למשימה במצב מקסימלי לעומת כ-73,000 אצל Opus 5 — ההגירה שחוסכת כסף היא זו שמאפשרת לכוונן מאמץ לפי עומס עבודה ולא לפי חשבון, ולהציב את המסלול של Opus 5.5 מאחורי failover אוטומטי בזמן שאתם מודדים איזו הגדרה התעבורה שלכם רוצה.
• Envelope — הקשר של 1M טוקנים, פלט מרבי של 128K, פלט של 300K ב-Batch API מאחורי כותרת הבטא output-300k-2026-03-24, חיתוך ידע יוני 2026, הוצאה משימוש לא לפני 22 בספטמבר 2027. הפלט מהיר ביותר מ-30% מ-Claude Opus 5.
• שינויים שוברים לעומת Opus 5 — אין עוד אפשרות להשבית את החשיבה; שימוש מאולץ בכלים (tool_choice שמציין כלי ספציפי) מחזיר שגיאה; בלוקי חשיבה כבולים למודל ולשיחה שהפיקה אותם; הכלי הישן יותר computer_20251124 לשימוש במחשב אינו מתקבל ב-Claude API או ב-Google Cloud. שלושת הראשונים חלים גם על Fable 5.1. וישנו חמישי שקט: טקסט בין קריאות לכלים מגיע כעת בתוך בלוקי חשיבה שהטקסט שלהם ריק בהגדרת התצוגה כברירת מחדל, כך שממשק משתמש שמזרים את הטקסט הזה כמדד התקדמות נשתתק בלי ששום דבר מחזיר שגיאה.
• ניתוב Safeguard, שוב, משום שזהו סעיף במפרט ולא הערת שוליים — רוב בקשות אבטחת הסייבר מנותבות ל-Claude Opus 4.8 ועבודה בביולוגיה נופלת חזרה ל-Claude Opus 5 אלא אם החשבון מאומת. בהערכות הללו ייתכן שהתשובה שתקבלו כלל לא תגיע מ-Opus 5.5, ולכן הציונים המפורסמים במדדים הקרובים לתחומי הסייבר והביולוגיה אינם מדידות נקיות של המודל הזה.
• טענות יעילות, כולן מדיווחי הספק — עלות נמוכה בכ-40% להרצה בעומסי עבודה טיפוסיים לעומת הנחה של 20% במחיר המחירון; דוגמה מנותחת של מיזוג שאורכת 63 דקות ב-Opus 5.5 לעומת 93 ב-Opus 5 בעלות נמוכה ב-50%; והצהרות לקוחות מ-Box (שליש מהטוקנים, תשובות פחות מפורטות בכ-40%), Kiro (בערך חצי מהטוקנים, 40% פחות קריאות), Factory (20–25% פחות טוקני פלט), ו-GitHub (מבין המעטות ביותר של טוקנים וצעדים שהיא מדדה). אלו ממוצעים על פני עומסי עבודה שהספק ושותפיו להשקה בחרו. אלו ייחוסים, לא תוצאות מבוקרות, והם עומדים במתח גלוי עם נתון העלות העצמאי לכל משימה שלמעלה — שהוא עצמו מדידה במאמץ מרבי ולא בברירת מחדל. שניהם יכולים להיות נכונים; אף אחד מהם אינו טענה כללית על עומס העבודה שלך.

מצב הראיות
Claude Opus 5.5 הוא מודל אמיתי עם הורדת מחיר אמיתית, מעטפת אמיתית של 1M אסימונים של הקשר ו-128K של פלט, ושינוי אמיתי ובעל השלכות באופן שבו החשיבה והמאמץ מוגדרים. הוא מגיע גם עם טבלת בנצ'מרקים שמודדת בעיקר את Anthropic, טבלה עצמאית שמודדת בעיקר פריסה מנותבת ולא צ'קפוינט, ובעיית מודעות עצמית מתועדת שמערערת את שתיהן. שום השוואה עצמאית ראש-בראש, עם מאמץ מותאם והרנס תואם, של Claude Opus 5.5 מול מתחרה בשם מפורש לא פורסמה. עד שכזו תפורסם, קראו כל השוואה חוצת-ספקים בעמוד הזה כפי שהיא: שתי טבלאות ספקים משתי חברות בשתי הגדרות, מסודרות זו לצד זו על ידינו — ומדדו מחדש את הגדרת המאמץ שלכם לפני שתמדדו מחדש את המודל.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
