
Claude Opus 5.5 בראש מדד סוכני הקידוד עם 66 — וחשבון המשימות עולה ב-21%
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 180 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
הספק הוריד ל-Claude Opus 5.5 את מחירי הטוקנים ב-20% ב-22 בספטמבר 2026. יומיים לאחר מכן, Artificial Analysis פרסמה את מדידת סוכן-הקוד שמראה מה עשתה ההורדה לחשבון של סוכן: העלות למשימה עלתה ב-21%, ל-$13.04, מ-$10.79 שאותו מדד גובה עבור Claude Opus 5. גם הציון עלה — 66 במדד סוכן-הקוד, ש-Artificial Analysis מתארת כגבוה ביותר שהיא מדדה, שש נקודות מעל Claude Opus 5 וארבע מעל Claude Fable 5.1 באותה תצורה. שני הדברים האלה נכונים בעת ובעונה אחת, והסיבה שהם נכונים בעת ובעונה אחת היא כל הסיפור של הדירוג הזה. טוקן זול יותר שמודל מוציא יותר ממנו אינו משימה זולה יותר, ובמאמץ חשיבה מקסימלי בהרצות סוכן ארוכות, Claude Opus 5.5 מוציא הרבה יותר מהם.
מה ש-Coding Agent Index למעשה מדרג
זו אינה טבלת מובילים של מודלים. כל שורה בה היא צמד של הארנס ומודל — צ׳קפוינט שרץ בתוך סוכן קידוד מסוים, בהגדרת מאמץ מסוימת. השורה שכולם מצטטים היא Claude Opus 5.5 במאמץ max בתוך Claude Code, שהוא הארנס שאנתרופיק בונה ומכווננת מולו. הציונים 60 של Claude Opus 5 ו-62 של Claude Fable 5.1 מגיעים מאותו הארנס ומאותה הגדרת מאמץ, וזה מה שהופך אותם להשוואות ההוגנות; שורה עבור מי מהמודלים הללו בסוכן קידוד אחר היא מדידה שונה ואינה מודפסת כאן כאילו הייתה אותה מדידה.
המדד מגיע בגרסאות, והגרסה חשובה יותר משם המותג שעליו. הלוח המתפרסם כעת כv1.5 ממצע שלוש הערכות, כל אחת במשקל שווה, כל אחת מדווחת כ-pass@1 בממוצע על פני שלושה ניסיונות לכל משימה:
• Terminal-Bench 4.0 — עבודה עם מעטפת סוכנים ושורת פקודה: ניווט במערכת קבצים, שימוש נכון בכלים, התאוששות מכשל ביניים, והשלמת תהליך עבודה רב-שלבי.
• DeepSWE v1.1 — משימות הנדסת תוכנה, עבודת עריכת המאגר.
• SWE-Atlas-QnA — שאלות להבנת מאגר קוד, שבהן את התשובה מוצאים על ידי קריאת בסיס הקוד ולא על ידי שינוי שלו.
שלוש הערכות, מספר אחד, ועמודת עלות-למשימה שמודפסת לצידו. עמודת העלות הזו היא הסיבה לכך שהמדד הזה שימושי יותר מציון בלבד, והיא גם הסיבה לכך שמספר הכותרת קשה יותר לקריאה ממה שהוא נראה.

שלושת הרכיבים, ומאין באו ששת הנקודות
Artificial Analysis פרסמה את שורות הרכיבים לצד המדד המשולב, והן אינן נעות באופן אחיד:
• Terminal-Bench 4.0 — 63.1% עבור Claude Opus 5.5 לעומת 54.5% עבור Claude Opus 5, שיפור של 8.6 נקודות. זהו השיפור הבודד הגדול ביותר בקבוצה.
• DeepSWE v1.1 — 68.4% לעומת 62.5%, עלייה של 5.9 נקודות.
• SWE-Atlas-QnA — 66.4%לעומת 62.1%, עלייה של 4.3 נקודות.
תעשה ממוצע של שלושת אלה ותקבל 66.0, שזה הציון המשולב. צורת השיפור היא החלק המעניין: המודל השתפר הכי פחות בקריאת בסיס קוד והכי הרבה בהפעלת מעטפת. Terminal-Bench היא ההערכה הקרובה ביותר למה שאנשים באמת מתכוונים כשאומרים "סוכן קידוד" — לולאה ארוכת טווח שבה המודל בוחר פקודות, קורא את הפלט, ומחליט מה לעשות הלאה, בלי אדם בלולאה בין שלבים. קפיצה של 8.6 נקודות שם היא הצהרה על שימוש מתמשך בכלים, לא על יצירת קוד.
שימו לב למה שמשתמע מכך לגבי היכן לצפות לשיפור. אם עומס העבודה שלכם הוא "הסבר את המאגר הזה", Claude Opus 5.5 הוא שדרוג מתון לעומת Claude Opus 5 — ארבע נקודות. אם עומס העבודה שלכם הוא "רוץ עד שמערך הבדיקות עובר, ותקן את מה שנשבר", זהו הזינוק הגדול ביותר בטבלה.

המספר המודפס לצד הדירוג: $13.04 למשימה
הנה החשבון שגורם לקיצוץ במחיר להיראות שונה מהאופן שבו הוא הוכרז. מחיר המחירון של Anthropic עבור Claude Opus 5.5 הוא 4.00 דולר למיליון טוקני קלט ו-20.00 דולר למיליון טוקני פלט, לעומת 5.00 דולר ו-25.00 דולר עבור Claude Opus 5, כאשר קריאות מהמטמון ירדו ב-60% ל-0.20 דולר למיליון. כל אחד מהסעיפים האלה זול יותר. ההערכה של Artificial Analysis לגבי עלות משימה במאמץ מקסימלי גבוהה בכל מקרה:
• עלות לכל משימה — $13.04 עבור Claude Opus 5.5 לעומת $10.79 עבור Claude Opus 5, עלייה של 21% באותו מדד, אותה תשתית בדיקה, אותה הגדרת מאמץ.
• סך הטוקנים לכל משימה — בערך 15.6M לעומת 11.4M, עלייה של כ-37%.
• אסימוני פלט לכל משימה — בערך 333,000 לעומת 137,000, יותר מפי שניים. הפלט הוא הכיוון היקר, וזה הקו שזז הכי הרבה.
• קלט שמור במטמון לכל משימה — בערך 14.6M לעומת 10.9M, עלייה של כ-34%. הקיצוץ של 60% בקריאת המטמון עושה כאן עבודה אמיתית; הוא פשוט לא מספיק כדי לקזז משימה שקוראת כשליש יותר הקשר.
עשו את החשבון עם התעריפים המפורסמים והתמונה מתבהרת. קחו רק את אסימוני הפלט: 333,000 אסימונים ב-$20.00 למיליון הם בערך $6.66 — בערך מחצית מכלל האומדן של $13.04, מסעיף בודד שהוכפל. שורת קריאת המטמון עצומה בנפח וכמעט בחינם מבחינת מחיר: 14.6M אסימונים ב-$0.20 למיליון הם פחות מ-$3. הקיצוץ של 20% אמיתי והקיצוץ במטמון אמיתי; במאמץ מקסימלי בלולאת סוכן, הם פשוט נדחקים הצידה על ידי מודל שחושב יותר זמן וכותב יותר.
לכך יש השלכה ישירה על האופן שבו אתה מתקצב. אם הצוות שלך מריץ 500 משימות של סוכן קידוד ביום במאמץ מרבי, הפער בין $10.79 ל-$13.04 הוא כ-$1,125 ליום — בערך $34,000 בחודש — עבור אותו מספר משימות. זה המספר שצריך להציג בפני מי שמאשר את החלפת המודל, וזה לא המספר שהורדת המחיר מרמזת עליו.
מדוע $5.98 ו-$13.04 שניהם נכונים
Artificial Analysis פרסמה שונהנתון עלות-למשימה {{2}}שונה{{/2}} עבור אותו מודל ימים קודם לכן, וקריאתם יחד ללא התוויות גורמת להם להיראות כסתירה. הם לא כאלה — אלה שתי הערכות שונות, וההבדל מאלף.
ב-Intelligence Index, הכתוב ב-22 בספטמבר העמיד את העלות למשימה של Claude Opus 5.5 על $5.98, בערך באותה רמה כמו $5.86 של Claude Opus 5, למרות כ-119,000 אסימוני פלט לכל משימה לעומת 73,000 של Opus 5. שם, הורדת המחיר והאסימונים הנוספים מתקזזים כמעט בדיוק. ב-Coding Agent Index, במאמץ מרבי, ב-Claude Code, אותו מודל עולה $13.04 לעומת $10.79.
שתיהן מדידות כנות של עומסי עבודה שונים. הערכת שאלות-תשובות היא חליפין קצר; משימת סוכן היא לולאה ארוכה של קריאות לכלים עם הקשר שהולך וגדל, והגידול מצטבר בכיוון הפלט, שם המחיר הוא הגבוה ביותר. הלקח המעשי הוא של"האם הורדת המחיר מקזזת את הטוקנים הנוספים?" אין תשובה אחת — זה תלוי באורך המשימה, וככל שהמשימה ארוכה יותר ויותר סוכנית, כך הקיזוז נעשה גרוע יותר. אם אתה מתקצב לפי מדד תשובות קצרות, תמעיט בהערכת חשבון הסוכן.
שלוש הסתייגויות שמקומן בשורה
ה-66 הוא מספר של Claude Code, לא מספר של מודל חשוף. המדד מצמיד מודלים להרנסים בכוונה, בטענה שניתוב כלים, לוגיקת ניסיונות חוזרים וניהול הקשר אינם ניתנים להפרדה מביצועי הסוכן הנמדדים. זה פועל לטובת Anthropic כאן, מפני שההרנס שבו הוא מדורג הוא שלה. Artificial Analysis מציינת תצוגת השוואת הרנסים כ"בקרוב"; עד שהיא תתקיים, איש אינו יכול לומר כמה מהיתרון של שש הנקודות הוא הצ'קפוינט וכמה הוא הפיגום שסביבו.
הנתון של Anthropic עצמה עבור Terminal-Bench 4.0 גבוה מהרכיב הזה, והופק על ידי Anthropic. חומר ההשקה מדווח 66.4% ב-xhigh מאמץ; רכיב Coding Agent Index הוא 63.1% ב-max, והריצה הנפרדת והעצמאית של Artificial Analysis מדדה 59.6% בסביבת הבדיקה של עצמה על אותה גרסת מבחן. שלושה מספרים, שלוש תצורות, שלושה מפיקים. ה-63.1% בשורה שמעל הוא רכיב של האינדקס עצמו ויש להשוות אותו רק למספרים האחרים באותו אינדקס; ה-66.4% של הספק מדווח על ידי הספק, לא שוחזר על ידי צד שלישי, ושייך להגדרת מאמץ אחרת.
עדכון האינדקס זז. בלוג זה דיווח על שורות שונות של Coding Agent Index בתחילת ספטמבר, על גרסה מוקדמת יותר של אותו לוח, והנתונים הישנים האלה אינם ברי-השוואה ל-v1.5 — מערך ההערכה עצמו השתנה כאשר Terminal-Bench 4.0 החליף את הגרסה המוקדמת. מראות של צד שלישי עדיין מכילים תמונות מצב מיושנות עם תוויות גרסה ישנות יותר. אם מספר עבור Claude Opus 5.5 באינדקס הזה אינו מגיע מהשורה הנוכחית של v1.5, אל תשימו אותו ליד מספר v1.5, ואל תחשבו דלתא בין השניים.

מה בעצם לפרוס
הדירוג הוא מספר במאמץ מרבי, ומאמץ מרבי הוא ההגדרה שכמעט אף אחד לא צריך לשחרר כברירת מחדל. ל-Claude Opus 5.5 יש חמש הגדרות מאמץ — נמוך, בינוני, גבוה, xhigh ומקס — והמודל מוגדר כברירת מחדל לבינוני. Artificial Analysis לא פרסמה שורות של Coding Agent Index בהגדרות הנמוכות יותר, כך שהחיסכון בעלות שם אינו מכומת במדד הזה; במדד Intelligence Index, אותו מודל בבינוני קיבל 51 — תואם למקס של Claude Opus 5 — בעלות של $1.34 למשימה. זה הכיוון שבו נמצא החיסכון, וזו הגדרה, לא מודל אחר.
התבנית הריאלית היא פיצול: לשמור על מאמץ מקסימלי עבור הלולאות האוטונומיות הארוכות, שבהן הרווח של 8.6 נקודות ב-Terminal-Bench הוא מה שאתם קונים, ולהריץ את העבודה השגרתית במאמץ נמוך יותר, שבו המודל עדיין מקדים בהרבה את הנקודה שבה סיים Claude Opus 5. כיוון שמאמץ הוא פרמטר של בקשה ולא של פריסה, הפיצול הזה הוא כלל ניתוב, ושני המודלים יושבים על אותו קטלוג — הקטלוג של Anthropicמחירי המחירון מועברים הלאה במרווח של 0%, כך שהורדת מחיר של הספק חלה על anthropic/claude-opus-5.5 באותו היום שבו היא מוכרזת, ואין חוזה שני או שינוי בקוד כרוך בהשוואת A/B בין השניים מול המשימות שלכם. עבור מסלול המאמץ המקסימלי במיוחד, שבו משימה בודדת יכולה להיות הרצה ארוכה ללא השגחה, מעבר אוטומטי (failover) הוא מה שמונע מספק שנתקע לעלות לכם את כל הלולאה.
מה עדיין לא נמדד
שלושה דברים היו משנים את התמונה הזו ואף אחד מהם עדיין לא קיים. אין השוואה עם מאמץ תואם והרנס תואם של Claude Opus 5.5 מול צ'קפוינט מתחרה — כל השוואה חוצת ספקים זמינה היא שתי טבלאות ספקים זו לצד זו. אין ריצה שפורסמה של Coding Agent Index במאמץ בינוני או גבוה, וזה המקום שבו רוב תעבורת הייצור הייתה נמצאת. ושאלת ייחוס ההרנס — כמה מ-66 הוא המודל וכמה הוא Claude Code — הוכרה על ידי האינדקס וננדחתה.
מה שאתה יכול לפעול עליו היום צר יותר ושימושי יותר מאשר דירוג. Claude Opus 5.5 טוב באמת בעבודת סוכן מתמשכת מונחית-shell מאשר Claude Opus 5 — זהו הרכיב היחיד עם רווח גדול, עקבי ושהופק באופן עצמאי. הוא גם עולה יותר לכל משימה בהגדרה שבה נמדד אותו רווח, בכ-$2.25 למשימה, והקיצוץ במחיר לכל טוקן לא מגיע למספר הזה. פרוס אותו במאמץ המרבי היכן שהלולאה ארוכה ועלות הכשל גבוהה; השאר את ההגדרה הזולה בכל מקום אחר; ובדוק מחדש את האינדקס כששורות המאמץ הנמוך יופיעו, כי זו התצורה שרוב הצוותים למעשה ישלמו עליה. אם אתה עובר רק בגלל קיצוץ המחיר, אתה קונה את הדבר הלא נכון — המודל זול יותר לכל טוקן ויקר יותר לכל משימה, ורק אחד משני המספרים האלה מופיע בחשבונית שלך.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
