כרטיס כותרת שעליו כתוב "Claude Opus 5.5 Tops the Coding Agent Index at 66" עם כותרת המשנה "טוקנים זולים יותר, חשבון משימה גדול יותר" ומתחתיו שלושה כרטיסים מעוגלים: Coding Agent Index 66, עלות למשימה $13.04 עלייה של 21%, ו-Claude Opus 5: 60 ב-$10.79.
Guides & Insights

Claude Opus 5.5 בראש מדד סוכני הקידוד עם 66 — וחשבון המשימות עולה ב-21%

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הספק הוריד ל-Claude Opus 5.5 את מחירי הטוקנים ב-20% ב-22 בספטמבר 2026. יומיים לאחר מכן, Artificial Analysis פרסמה את מדידת סוכן-הקוד שמראה מה עשתה ההורדה לחשבון של סוכן: העלות למשימה עלתה ב-21%, ל-$13.04, מ-$10.79 שאותו מדד גובה עבור Claude Opus 5. גם הציון עלה — 66 במדד סוכן-הקוד, ש-Artificial Analysis מתארת כגבוה ביותר שהיא מדדה, שש נקודות מעל Claude Opus 5 וארבע מעל Claude Fable 5.1 באותה תצורה. שני הדברים האלה נכונים בעת ובעונה אחת, והסיבה שהם נכונים בעת ובעונה אחת היא כל הסיפור של הדירוג הזה. טוקן זול יותר שמודל מוציא יותר ממנו אינו משימה זולה יותר, ובמאמץ חשיבה מקסימלי בהרצות סוכן ארוכות, Claude Opus 5.5 מוציא הרבה יותר מהם.

מה ש-Coding Agent Index למעשה מדרג

זו אינה טבלת מובילים של מודלים. כל שורה בה היא צמד של הארנס ומודל — צ׳קפוינט שרץ בתוך סוכן קידוד מסוים, בהגדרת מאמץ מסוימת. השורה שכולם מצטטים היא Claude Opus 5.5 במאמץ max בתוך Claude Code, שהוא הארנס שאנתרופיק בונה ומכווננת מולו. הציונים 60 של Claude Opus 5 ו-62 של Claude Fable 5.1 מגיעים מאותו הארנס ומאותה הגדרת מאמץ, וזה מה שהופך אותם להשוואות ההוגנות; שורה עבור מי מהמודלים הללו בסוכן קידוד אחר היא מדידה שונה ואינה מודפסת כאן כאילו הייתה אותה מדידה.

המדד מגיע בגרסאות, והגרסה חשובה יותר משם המותג שעליו. הלוח המתפרסם כעת כv1.5 ממצע שלוש הערכות, כל אחת במשקל שווה, כל אחת מדווחת כ-pass@1 בממוצע על פני שלושה ניסיונות לכל משימה:

Terminal-Bench 4.0 — עבודה עם מעטפת סוכנים ושורת פקודה: ניווט במערכת קבצים, שימוש נכון בכלים, התאוששות מכשל ביניים, והשלמת תהליך עבודה רב-שלבי.

DeepSWE v1.1 — משימות הנדסת תוכנה, עבודת עריכת המאגר.

SWE-Atlas-QnA — שאלות להבנת מאגר קוד, שבהן את התשובה מוצאים על ידי קריאת בסיס הקוד ולא על ידי שינוי שלו.

שלוש הערכות, מספר אחד, ועמודת עלות-למשימה שמודפסת לצידו. עמודת העלות הזו היא הסיבה לכך שהמדד הזה שימושי יותר מציון בלבד, והיא גם הסיבה לכך שמספר הכותרת קשה יותר לקריאה ממה שהוא נראה.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

שלושת הרכיבים, ומאין באו ששת הנקודות

Artificial Analysis פרסמה את שורות הרכיבים לצד המדד המשולב, והן אינן נעות באופן אחיד:

Terminal-Bench 4.063.1% עבור Claude Opus 5.5 לעומת 54.5% עבור Claude Opus 5, שיפור של 8.6 נקודות. זהו השיפור הבודד הגדול ביותר בקבוצה.

DeepSWE v1.168.4% לעומת 62.5%, עלייה של 5.9 נקודות.

SWE-Atlas-QnA66.4%לעומת 62.1%, עלייה של 4.3 נקודות.

תעשה ממוצע של שלושת אלה ותקבל 66.0, שזה הציון המשולב. צורת השיפור היא החלק המעניין: המודל השתפר הכי פחות בקריאת בסיס קוד והכי הרבה בהפעלת מעטפת. Terminal-Bench היא ההערכה הקרובה ביותר למה שאנשים באמת מתכוונים כשאומרים "סוכן קידוד" — לולאה ארוכת טווח שבה המודל בוחר פקודות, קורא את הפלט, ומחליט מה לעשות הלאה, בלי אדם בלולאה בין שלבים. קפיצה של 8.6 נקודות שם היא הצהרה על שימוש מתמשך בכלים, לא על יצירת קוד.

שימו לב למה שמשתמע מכך לגבי היכן לצפות לשיפור. אם עומס העבודה שלכם הוא "הסבר את המאגר הזה", Claude Opus 5.5 הוא שדרוג מתון לעומת Claude Opus 5 — ארבע נקודות. אם עומס העבודה שלכם הוא "רוץ עד שמערך הבדיקות עובר, ותקן את מה שנשבר", זהו הזינוק הגדול ביותר בטבלה.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

המספר המודפס לצד הדירוג: $13.04 למשימה

הנה החשבון שגורם לקיצוץ במחיר להיראות שונה מהאופן שבו הוא הוכרז. מחיר המחירון של Anthropic עבור Claude Opus 5.5 הוא 4.00 דולר למיליון טוקני קלט ו-20.00 דולר למיליון טוקני פלט, לעומת 5.00 דולר ו-25.00 דולר עבור Claude Opus 5, כאשר קריאות מהמטמון ירדו ב-60% ל-0.20 דולר למיליון. כל אחד מהסעיפים האלה זול יותר. ההערכה של Artificial Analysis לגבי עלות משימה במאמץ מקסימלי גבוהה בכל מקרה:

עלות לכל משימה — $13.04 עבור Claude Opus 5.5 לעומת $10.79 עבור Claude Opus 5, עלייה של 21% באותו מדד, אותה תשתית בדיקה, אותה הגדרת מאמץ.

סך הטוקנים לכל משימה — בערך 15.6M לעומת 11.4M, עלייה של כ-37%.

אסימוני פלט לכל משימה — בערך 333,000 לעומת 137,000, יותר מפי שניים. הפלט הוא הכיוון היקר, וזה הקו שזז הכי הרבה.

קלט שמור במטמון לכל משימה — בערך 14.6M לעומת 10.9M, עלייה של כ-34%. הקיצוץ של 60% בקריאת המטמון עושה כאן עבודה אמיתית; הוא פשוט לא מספיק כדי לקזז משימה שקוראת כשליש יותר הקשר.

עשו את החשבון עם התעריפים המפורסמים והתמונה מתבהרת. קחו רק את אסימוני הפלט: 333,000 אסימונים ב-$20.00 למיליון הם בערך $6.66 — בערך מחצית מכלל האומדן של $13.04, מסעיף בודד שהוכפל. שורת קריאת המטמון עצומה בנפח וכמעט בחינם מבחינת מחיר: 14.6M אסימונים ב-$0.20 למיליון הם פחות מ-$3. הקיצוץ של 20% אמיתי והקיצוץ במטמון אמיתי; במאמץ מקסימלי בלולאת סוכן, הם פשוט נדחקים הצידה על ידי מודל שחושב יותר זמן וכותב יותר.

לכך יש השלכה ישירה על האופן שבו אתה מתקצב. אם הצוות שלך מריץ 500 משימות של סוכן קידוד ביום במאמץ מרבי, הפער בין $10.79 ל-$13.04 הוא כ-$1,125 ליום — בערך $34,000 בחודש — עבור אותו מספר משימות. זה המספר שצריך להציג בפני מי שמאשר את החלפת המודל, וזה לא המספר שהורדת המחיר מרמזת עליו.

מדוע $5.98 ו-$13.04 שניהם נכונים

Artificial Analysis פרסמה שונהנתון עלות-למשימה {{2}}שונה{{/2}} עבור אותו מודל ימים קודם לכן, וקריאתם יחד ללא התוויות גורמת להם להיראות כסתירה. הם לא כאלה — אלה שתי הערכות שונות, וההבדל מאלף.

ב-Intelligence Index, הכתוב ב-22 בספטמבר העמיד את העלות למשימה של Claude Opus 5.5 על $5.98, בערך באותה רמה כמו $5.86 של Claude Opus 5, למרות כ-119,000 אסימוני פלט לכל משימה לעומת 73,000 של Opus 5. שם, הורדת המחיר והאסימונים הנוספים מתקזזים כמעט בדיוק. ב-Coding Agent Index, במאמץ מרבי, ב-Claude Code, אותו מודל עולה $13.04 לעומת $10.79.

שתיהן מדידות כנות של עומסי עבודה שונים. הערכת שאלות-תשובות היא חליפין קצר; משימת סוכן היא לולאה ארוכה של קריאות לכלים עם הקשר שהולך וגדל, והגידול מצטבר בכיוון הפלט, שם המחיר הוא הגבוה ביותר. הלקח המעשי הוא של"האם הורדת המחיר מקזזת את הטוקנים הנוספים?" אין תשובה אחת — זה תלוי באורך המשימה, וככל שהמשימה ארוכה יותר ויותר סוכנית, כך הקיזוז נעשה גרוע יותר. אם אתה מתקצב לפי מדד תשובות קצרות, תמעיט בהערכת חשבון הסוכן.

שלוש הסתייגויות שמקומן בשורה

ה-66 הוא מספר של Claude Code, לא מספר של מודל חשוף. המדד מצמיד מודלים להרנסים בכוונה, בטענה שניתוב כלים, לוגיקת ניסיונות חוזרים וניהול הקשר אינם ניתנים להפרדה מביצועי הסוכן הנמדדים. זה פועל לטובת Anthropic כאן, מפני שההרנס שבו הוא מדורג הוא שלה. Artificial Analysis מציינת תצוגת השוואת הרנסים כ"בקרוב"; עד שהיא תתקיים, איש אינו יכול לומר כמה מהיתרון של שש הנקודות הוא הצ'קפוינט וכמה הוא הפיגום שסביבו.

הנתון של Anthropic עצמה עבור Terminal-Bench 4.0 גבוה מהרכיב הזה, והופק על ידי Anthropic. חומר ההשקה מדווח 66.4% ב-xhigh מאמץ; רכיב Coding Agent Index הוא 63.1% ב-max, והריצה הנפרדת והעצמאית של Artificial Analysis מדדה 59.6% בסביבת הבדיקה של עצמה על אותה גרסת מבחן. שלושה מספרים, שלוש תצורות, שלושה מפיקים. ה-63.1% בשורה שמעל הוא רכיב של האינדקס עצמו ויש להשוות אותו רק למספרים האחרים באותו אינדקס; ה-66.4% של הספק מדווח על ידי הספק, לא שוחזר על ידי צד שלישי, ושייך להגדרת מאמץ אחרת.

עדכון האינדקס זז. בלוג זה דיווח על שורות שונות של Coding Agent Index בתחילת ספטמבר, על גרסה מוקדמת יותר של אותו לוח, והנתונים הישנים האלה אינם ברי-השוואה ל-v1.5 — מערך ההערכה עצמו השתנה כאשר Terminal-Bench 4.0 החליף את הגרסה המוקדמת. מראות של צד שלישי עדיין מכילים תמונות מצב מיושנות עם תוויות גרסה ישנות יותר. אם מספר עבור Claude Opus 5.5 באינדקס הזה אינו מגיע מהשורה הנוכחית של v1.5, אל תשימו אותו ליד מספר v1.5, ואל תחשבו דלתא בין השניים.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

מה בעצם לפרוס

הדירוג הוא מספר במאמץ מרבי, ומאמץ מרבי הוא ההגדרה שכמעט אף אחד לא צריך לשחרר כברירת מחדל. ל-Claude Opus 5.5 יש חמש הגדרות מאמץ — נמוך, בינוני, גבוה, xhigh ומקס — והמודל מוגדר כברירת מחדל לבינוני. Artificial Analysis לא פרסמה שורות של Coding Agent Index בהגדרות הנמוכות יותר, כך שהחיסכון בעלות שם אינו מכומת במדד הזה; במדד Intelligence Index, אותו מודל בבינוני קיבל 51 — תואם למקס של Claude Opus 5 — בעלות של $1.34 למשימה. זה הכיוון שבו נמצא החיסכון, וזו הגדרה, לא מודל אחר.

התבנית הריאלית היא פיצול: לשמור על מאמץ מקסימלי עבור הלולאות האוטונומיות הארוכות, שבהן הרווח של 8.6 נקודות ב-Terminal-Bench הוא מה שאתם קונים, ולהריץ את העבודה השגרתית במאמץ נמוך יותר, שבו המודל עדיין מקדים בהרבה את הנקודה שבה סיים Claude Opus 5. כיוון שמאמץ הוא פרמטר של בקשה ולא של פריסה, הפיצול הזה הוא כלל ניתוב, ושני המודלים יושבים על אותו קטלוג — הקטלוג של Anthropicמחירי המחירון מועברים הלאה במרווח של 0%, כך שהורדת מחיר של הספק חלה על anthropic/claude-opus-5.5 באותו היום שבו היא מוכרזת, ואין חוזה שני או שינוי בקוד כרוך בהשוואת A/B בין השניים מול המשימות שלכם. עבור מסלול המאמץ המקסימלי במיוחד, שבו משימה בודדת יכולה להיות הרצה ארוכה ללא השגחה, מעבר אוטומטי (failover) הוא מה שמונע מספק שנתקע לעלות לכם את כל הלולאה.

מה עדיין לא נמדד

שלושה דברים היו משנים את התמונה הזו ואף אחד מהם עדיין לא קיים. אין השוואה עם מאמץ תואם והרנס תואם של Claude Opus 5.5 מול צ'קפוינט מתחרה — כל השוואה חוצת ספקים זמינה היא שתי טבלאות ספקים זו לצד זו. אין ריצה שפורסמה של Coding Agent Index במאמץ בינוני או גבוה, וזה המקום שבו רוב תעבורת הייצור הייתה נמצאת. ושאלת ייחוס ההרנס — כמה מ-66 הוא המודל וכמה הוא Claude Code — הוכרה על ידי האינדקס וננדחתה.

מה שאתה יכול לפעול עליו היום צר יותר ושימושי יותר מאשר דירוג. Claude Opus 5.5 טוב באמת בעבודת סוכן מתמשכת מונחית-shell מאשר Claude Opus 5 — זהו הרכיב היחיד עם רווח גדול, עקבי ושהופק באופן עצמאי. הוא גם עולה יותר לכל משימה בהגדרה שבה נמדד אותו רווח, בכ-$2.25 למשימה, והקיצוץ במחיר לכל טוקן לא מגיע למספר הזה. פרוס אותו במאמץ המרבי היכן שהלולאה ארוכה ועלות הכשל גבוהה; השאר את ההגדרה הזולה בכל מקום אחר; ובדוק מחדש את האינדקס כששורות המאמץ הנמוך יופיעו, כי זו התצורה שרוב הצוותים למעשה ישלמו עליה. אם אתה עובר רק בגלל קיצוץ המחיר, אתה קונה את הדבר הלא נכון — המודל זול יותר לכל טוקן ויקר יותר לכל משימה, ורק אחד משני המספרים האלה מופיע בחשבונית שלך.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית