כרטיס כותרת ראשי עבור Claude Opus 5.5 לעומת Claude Opus 5, עם הכותרת 'רמות המאמץ אינן אומרות את אותו הדבר', עם תגים המציגים medium לעומת high כברירת מחדל, ‏$4.00 לעומת $5.00, ו־$0.20 לעומת $0.50 למטמון, והלוגו של OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

Claude Opus 5.5 לעומת Claude Opus 5: רמות המאמץ אינן אומרות את אותו הדבר

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדבר הראשון שצריך לדעת לפני השוואה Claude Opus 5.5 לעומת Claude Opus 5 הוא ששני המודלים אינם חולקים סולם מאמץ, וכמעט כל השוואה ישירה שתקראו השבוע מתעלמת מכך. Opus 5 כברירת מחדל משתמש במאמץ גבוה. Opus 5.5 כברירת מחדל משתמש במאמץ בינוני, וברמה בעלת אותו שם הוא חושב יותר בכל תור מאשר קודמו. אז "Opus 5.5 בברירת מחדל לעומת Opus 5 בברירת מחדל" אינו ניסוי מבוקר — זהו השוואה בין שתי כמויות חשיבה שונות. הספק אומר זאת בעצמו במדריך ההעברה שלו: יש לבדוק מספר רמות מאמץ, ולא להשתמש שוב בהגדרות של Opus 5, מכיוון שרמות בעלות אותו שם אינן ממופות לאותו תקציב חשיבה. ברגע שתפקחו על כך, הפער בין שני המודלים מצטמצם במקומות מסוימים, מתרחב באחרים, והחלטת השדרוג תלויה במשהו אחר מלבד יכולת גולמית — עלות למשימה שהושלמה, וארבעה שינויים ב-API שישברו קוד שרץ על Opus 5 היום.

מה בעצם שונה, מפרט מול מפרט

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

שני המודלים קרובים יותר על הנייר ממה שמספרי הגרסאות מרמזים:

• מחיר — Claude Opus 5.5 במחיר $4.00 קלט / $20.00 פלט למיליון טוקנים לעומת Claude Opus 5 במחיר $5.00 / $25.00

• קריאה מהמטמון — $0.20 למיליון לעומת $0.50 למיליון, קיצוץ של 60% בסעיף ששולט בהרצות אג'נטיות

• כתיבת מטמון — $5 למיליון עבור חלון של 5 דקות ו-$8 עבור חלון של שעה ב-5.5, לעומת $6.25 ב-Opus 5

• הקשר ופלט — מיליון טוקנים של הקשר ו-128K של פלט בשניהם; שניהם מגיעים ל-300K פלט ב-Batch API מאחורי output-300k-2026-03-24 כותרת הבטא

• מאמץ ברירת מחדל — בינוני ב-Opus 5.5 לעומת גבוה ב-Opus 5

• חשיבה — אדפטיבית ותמיד פעילה בשניהם, אך ב-Opus 5.5 כבר אי אפשר להשבית אותה בכלל

• מועד עדכון הידע — יוני 2026 לעומת מאי 2026

• השהיה — Anthropic מדרגת את Opus 5.5 כ"מתון" לעומת המערך הנוכחי, ואומרת שהוא מייצר פלט ביותר מ-30% מהר יותר מ-Opus 5

• פרישה — לא לפני 22 בספטמבר 2027 עבור Opus 5.5, ולא לפני 24 ביולי 2027 עבור Opus 5

שימו לב למה לא שונה: חלון ההקשר, תקרת הפלט, הנחת האצווה, ומודל החשיבה האדפטיבי הפעיל תמיד. Opus 5.5 אינו מודל בעל הקשר גדול יותר או פלט ארוך יותר. הוא מודל זול יותר, מהיר יותר וחסכוני יותר בטוקנים, באותה מעטפת.

מדדי ביצועים, וכוכבית המאמץ על כל אחד מהם

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

הנתונים האלה מגיעים מחומר ההשקה של Anthropic — דיווח של הספק, שהורץ על המודלים שלה — והגדרת המאמץ חשובה כאן יותר משם המודל:

• Terminal-Bench 4.0 — 66.4% לעומת 52.3%, כאשר ההרצה של Opus 5.5 במאמץ xhigh ולא בברירת המחדל

• FrontierCode v1.1 (Main) — 54.4% לעומת 48.0%, ו-54.6% עבור Opus 5.5 במאמץ הבינוני המוגדר כברירת מחדל

• CursorBench 4.0 — 57.8% לעומת 46.6%, ו-52.5% ברמה בינונית

• GDPval-AA v2.1 — 1846 Elo לעומת 1708

• AutomationBench — 40.0% לעומת 26.9%

• המבחן האחרון של האנושות, עם כלים — 67.7% לעומת 63.6%

• Terminal-Bench-Science 0.1 — 58.7% לעומת 29.0%, הפער הרחב ביותר בקבוצה

• OSWorld 2.0 — 81.8% חלקי לעומת 74.0%

• תרשוגרפיה, עם כלים — 89.0% לעומת 83.4%

תוצאת FrontierCode היא זו שכדאי לבחון. Opus 5.5 משיג 54.4% ב-xhigh ו-54.6% ב-medium — סטטיסטית אותו מספר, בשבריר מתקציב החשיבה. כל שיפור ש-Anthropic הכניסה, בבנצ'מרק הזה הוא לא בא מחשיבה מאומצת יותר. אצל CursorBench התמונה הפוכה: 57.8% ב-xhigh לעומת 52.5% ב-medium, פער של חמש נקודות שאומר שהמאמץ עדיין מניב דיוק אמיתי במשימות מסוימות. הלקח אינו "להשתמש ב-medium" או "להשתמש ב-xhigh"; אלא שרמת המאמץ הנכונה היא כעת מדד שנקבע לפי עומס העבודה, וההרגל הישן להשאיר את Opus 5 על ברירת המחדל הגבוהה שלו כבר לא מספר לך דבר על המודל החדש.

Anthropic מוסיפה הסתייגות שכדאי לחזור עליה: ברמת יכולת זו, פערי הבנצ'מרקים הם "מדריך פחות אמין להבדלים בעולם האמיתי", והחברה אומרת שהפער הפנימי שלה ל-Claude Fable 5.1 צר יותר ממה שציוני הפרסום מרמזים. זהו ספק שאומר לך לא לקרוא יותר מדי לתוך הטבלה של עצמו.

עלות לכל משימה שהושלמה היא ההשוואה שמכריעה

מחיר לפי טוקן הוא יחידת המידה הלא נכונה עבור סוכן, וההשוואה הזו היא בדיוק המקום שבו זה מתגלה. הדוגמה המחושבת של Anthropic עצמה: ניתוח מיזוגים שלקח ל-Opus 5.5 ‏63 דקות ועלה 50% פחות מאותה משימה על Opus 5, שלקחה 93 דקות. מחירון התעריפים מסביר חלק מזה — קיצוץ של 20% בקלט ובפלט, 60% בקריאות מהמטמון — אבל לא את כולו. השאר הוא המודל שמשתמש בפחות טוקנים ובפחות סבבים כדי להגיע לאותו מקום. ציטוטי לקוחות שפורסמו עם ההשקה מצביעים לאותו כיוון: Box מדווחת על שליש מהטוקנים ועל תשובות קצרות יותר בכ-40%, Kiro על כמחצית מהטוקנים עם 40% פחות קריאות, Factory על 20–25% פחות טוקני פלט, ו-GitHub על אחד המספרים הנמוכים ביותר של טוקנים וצעדים שהיא מדדה.

אלה הצהרות של לקוחות שפורסמו על ידי הספק, לא תוצאות מבוקרות, והנתון המצטבר "כ-40% זול יותר בעומסי עבודה טיפוסיים" הוא התיאור של Anthropic לממוצע על פני עומסי עבודה שהיא בחרה. הגרסה הכנה לתכנון שלכם: הניחו שהנחת המחירון של 20% היא אמיתית וניתנת להסתמכות, והתייחסו ל-20% הנוספים כהשערה שאפשר לבדוק בתוך אחר צהריים על ידי הרצת אותה משימה בשני המודלים וספירת טוקנים.

הערה מבנית אחת על מדוע הורדת מחיר המטמון עושה יותר משהיא נראית. סוכן ששולח מחדש בכל תור פרומפט מערכת ארוך ועץ קבצים משלם תעריפי קריאה מהמטמון על עיקר הקלט שלו, ולא תעריפי קלט טרי. הורדה מ-0.50$ ל-0.20$ למיליון משנה את הכלכלה של הפעלות ארוכות טווח הרבה יותר מאשר התעריף הכותרתי — והיא הסיבה שעומס עבודה שהיה בקושי כדאי על Opus 5 יכול להפוך לכדאי בבירור על Opus 5.5 בלי שום שינוי בפרומפטים שלך.

ארבעת השינויים השוברים, כרשימת בדיקה למיגרציה

Opus 5.5 הוא מודל חדש, ולא Opus 5 ששמו שונה, והערות המיגרציה של Anthropic מפרטות ארבעה שינויים שישברו קוד שכבר פועל בפרודקשן:

• לא ניתן להשבית את החשיבה. כל נתיב קוד שכיבה את החשיבה יגרום לשגיאה או ישנה את ההתנהגות, והעומק נשלט כעת רק באמצעות הפרמטר effort.

• שימוש כפוי בכלי מחזיר שגיאה. tool_choice שמאלץ כלי עם שם אינו נתמך.

• בלוקי חשיבה קשורים למודל שהפיק אותם ולשיחה, ולכן לא ניתן לשחזר אותם בין מודלים כפי שחלק מהפייפליינים מניחים.

• כלי השימוש במחשב computer_20251124 המוקדם יותר אינו מתקבל ב-Claude API או ב-Google Cloud.

יש שינוי חמישי שאינו מכשיל דבר ולכן הוא מסוכן יותר. טקסט בין קריאות לכלים מוחזר כעת בתוך בלוקי חשיבה שהטקסט שלהם ריק בהגדרת תצוגת ברירת המחדל. אם היישום שלך מזרים את הטקסט הזה למשתמשים כעדכוני התקדמות, הוא משתתק בין קריאות לכלים עד שתגדיר ערך תצוגה שמחזיר את הטקסט. כל בדיקה עוברת; הממשק פשוט מפסיק לתאר.

שלושת הראשונים חלים גם על Claude Fable 5.1, כך שצוות שכבר היגר למודל הזה כבר עשה חלק מהעבודה הזו. צוות שעדיין על Opus 5 לא עשה זאת.

מתי Opus 5 הוא עדיין הבחירה הנכונה

השדרוג אינו אוטומטי, ויש ארבע סיבות אמיתיות להישאר:

• חיזוי עלויות. Opus 5 הוא מודל שכבר אפיינת. אם התקציב שלך מבוסס על צריכת הטוקנים שלו, מעבר למודל שחושב בכמות שונה באותה רמת מאמץ מוגדרת מבטל את תוקף המודל עד שתמדוד מחדש.

• תאימות. אם חלק כלשהו מהסטאק שלך תלוי בהשבתת החשיבה, בכפיית כלי, או בכלי ה-computer-use הישן, ההגירה היא עבודת קוד, לא החלפת מחרוזת.

• ניתוב הגנות. Opus 5.5 מגיע עם הגנות ברמת Fable 5.1, כלומר רוב בקשות אבטחת הסייבר מנותבות מחדש אל Claude Opus 4.8 ועבודות ביולוגיה נופלות בחזרה אל Claude Opus 5, אלא אם החשבון שלך מאומת. אם המוצר שלך נמצא באחד מהתחומים הללו, "שדרוג" עשוי לגרום לכך שהמשתמשים שלך יקבלו תשובות ממודל קטן יותר. ל-Opus 5 אין את הניתוב הזה.

• אריכות ימים. Opus 5 לא הולך לשום מקום בקרוב — Anthropic מציינת את מועד הפרישה כלא לפני 24 ביולי 2027, שהם עשרה חודשים מהיום.

עבור כל השאר החשבון פשוט: יותר יכולות, מחיר נמוך יותר, פחות טוקנים, ורשימת בדיקה להגירה שמהנדס אחד יכול לעבור עליה ביום אחד.

הרצת שניהם במהלך ההחלפה

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

החלק המסובך בכל הגירת דגל הוא האמצע: אתם רוצים את Opus 5.5 על תעבורה חדשה בלי להמר על נתיב הייצור על מודל שטרם אפיינתם בהגדרות המאמץ שלכם, ואתם רוצים לתת ל-Opus 5 להמשיך לשרת בזמן שאתם בודקים. זו בעיית ניתוב ולא בעיית מעבר פלטפורמה, וכדאי להיות מדויקים לגבי מה יושב איפה. Claude Opus 5 נמצא היום ב-OrcaRouter במחיר המחירון של Anthropic עצמה עם 0% תוספת — מחיר המחירון של הספק מועבר ישירות, כך ששינוי בתעריף של ספק נכנס לתוקף אצלנו באותו היום ולא רק אחרי סינכרון. Claude Opus 5.5 עדיין אינו אחד מהנתיבים שלנו; הוא זמין דרך ה-API של Anthropic עצמה ודרך העננים הגדולים. כשהוא יגיע, הוא יהפוך לעוד נתיב אחד על אותו מפתח במקום חוזה שני ו-SDK שני, וזה מה שמאפשר לכם להפנות אחוז מהתעבורה למודל החדש בזמן ש-מעבר אוטומטי בעת תקלה משאיר את השאר על זה שכבר אפיינתם. הרכבת קריאה על פני שניהם — טיוטה מאחד ומעבר אימות מהשני — היא שורה אחת ב-routing-DSL.

היה מדויק לגבי מה שזה קונה לך. זה לא נותן לך בנצ'מרק בלתי־תלוי של Opus 5.5; שום דבר עדיין לא נותן, כי ההשוואות הישירות היחידות שפורסמו הן של Anthropic עצמה, והעוקבים הבלתי־תלויים עדיין מנסים להחליט על תצורות מאמץ. מה שזה כן נותן לך הוא המדידה האחת שבאמת מנבאת את החשבון שלך — על הפרומפטים שלך, ברמת המאמץ שבה תשחרר.

כלל ההחלטה

אם אתם מתחילים משהו חדש, השתמשו ב-Claude Opus 5.5 והתחילו ברמת מאמץ בינונית, ואז בדקו אם נמוכה מחזיקה מעמד במשימה שלכם — Anthropic מדווחת שרמה נמוכה מתקרבת להגדרות הגבוהות יותר שלה במספר הערכות קידוד, ובעלות נמוכה בהרבה, ומספרי FrontierCode שלמעלה מרמזים שברירת המחדל לא מוותרת על הרבה.

אם אתם מריצים את Claude Opus 5 בפרודקשן, הטריגר לנדוד אינו טבלת הבנצ'מרקים. הוא האם אתם מסוגלים לספוג ארבעה שינויים ב-API והאם עומס העבודה שלכם נמצא בתחום אבטחת הסייבר או הביולוגיה, שם ניתוב אמצעי ההגנה יעביר בשקט חלק מהתעבורה שלכם למודל קטן יותר. כל השאר בשדרוג הזה הוא הורדת מחיר שלובשת את בגדי השקת מודל, וכדאי לאמץ אותם.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית