כרטיס כותרת ל-Claude Sonnet 5.5 שכותרתו "אותו מחיר, פחות עבודה", עם כותרת המשנה "$2 / $10 למיליון טוקנים, ללא שינוי מ-Sonnet 5" ושלושה כרטיסי נתונים המציגים 56 (AA Intelligence Index), #3 / 216 (דירוג במדד הזה) ו-$7.60 (עלות למשימה במאמץ מקסימלי).
Guides & Insights

Claude Sonnet 5.5: הטענה בדבר עלות של 30%, וששת השינויים ששוברים את הקוד של Sonnet 5

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Claude Sonnet 5.5 שוחרר ב-28 בספטמבר 2026 באותם תעריפים בדיוק כמו Claude Sonnet 5 — 2$ למיליון טוקני קלט, 10$ למיליון טוקני פלט, 0.20$ למיליון קריאות מהמטמון — בעוד שההכרזה של Anthropic פותחת ב"פועל 30%+ מהר יותר ועולה עד 30% פחות ברוב העבודות". שתי הטענות נכונות, והמרחק ביניהן הוא כל הסיפור. החיסכון אינו בלוח התעריפים, מפני שלוח התעריפים לא זז. הוא נובע מהרצת המודל בהגדרת מאמץ נמוכה מזו שקודמו נזקק לה, כלומר הנתון של 30% הוא טענה על נקודת הפעלה שעליכם לבחור, לא מחיר שאתם יורשים. מדידה בלתי תלויה מחדדת את ההתפצלות: ב-Artificial Analysis, Claude Sonnet 5.5 במאמץ מקסימלי עולה 7.60$ למשימה במדד ה-Intelligence Index לעומת 5.09$ עבור Claude Sonnet 5 במאמץ מקסימלי — כ-49% יותר, ולא 30% פחות. זו אינה סתירה לנתון של Anthropic. זהו הקצה האחר של אותו עקום, ושם רוב ההגירות ינחתו כברירת מחדל אם איש לא יריץ מחדש את סבב בחינת המאמץ שלו.

שתי טענות לובשות מספר אחד

הפוסט של Anthropic מציג את הטענה ברמת המשימה בשלושה מקומות, וכל אחד מהם נשען על effort. הגרסה החזקה ביותר: ב-Terminal-Bench 4.0, ברמת Medium effort — ברירת המחדל באפליקציות של Claude — ‏Sonnet 5.5 ״מתעלה בהרבה על הציון הטוב ביותר של Sonnet 5 תמורת פחות מעשירית מהעלות למשימה.״ ב-AA-Briefcase v1.1, ברמת Medium effort, הוא מנצח את הטוב ביותר של Sonnet 5 תמורת כתשיעית מהעלות. ב-CursorBench 4.0, ברמת Low effort, הוא עולה על הטוב ביותר של Sonnet 5 בפחות מעשירית.

קרא את אלה כקבוצה והמנגנון ברור.הרצפה של Sonnet 5.5יושבת מעלהתקרה של Sonnet 5בכמה הערכות. אתה לא מקבל את ה-30% על ידי תשלום פחות לכל טוקן; אתה מקבל אותו על ידי כך שאתה כבר לא צריך את ההגדרה היקרה. Anthropic אומרת בדיוק את זה בתיעוד ההגירה, עמוד אחד מהשיווק: "רמות המאמץ מכוילות מחדש. רמת מאמץ אינה מייצרת את אותה כמות חשיבה כפי שעשתה ב-Claude Sonnet 5. הרץ מחדש את סקר המאמץ שלך במקום להעביר הגדרה."

המשפט הזה הוא השורה המשמעותית ביותר מבחינה תפעולית שאנתרופיק פרסמה השבוע, והוא זה שלא נכנס לרוב הסיקור של ההשקה.

מה שפרסמה Anthropic — מדווח על ידי הספק, לא משוחזר

כל מה שבסעיף הזה הוא מדידה של Anthropic עצמה, מהכרזת Sonnet 5.5 ומכרטיס המערכת. זוהי טענת ספק, לא תוצאה עצמאית, ושובל הערות השוליים חשוב באותה מידה כמו המספרים הכותרתיים.

• Terminal-Bench 4.0 (קידוד סוכני) — Sonnet 5.5 70.6% לעומת Sonnet 5 10.3%. זהו זינוק של פי שבעה בשורה הבודדת המצוטטת ביותר, וזה המספר שרוב הסיקורים הובילו בו.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52.1% ב-Xhigh ו-46.2% ב-Max; Sonnet 5 42.4%; Claude Opus 5.5 54.4%; GPT-6 Sol 49.3%. שימו לב להיפוך: Sonnet 5.5 משיג ציון נמוך יותר ב-Max מאשר ב-Xhigh.

• CursorBench 4.0 — 55.5% עבור Sonnet 5.5 לעומת 34.1% עבור Sonnet 5 ו-57.8% עבור Opus 5.5. CursorBench 4.0 אינו מדווח על GPT-6 Sol באופן פומבי.

• GDPval-AA v2.1 (עבודת ידע) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 על אותם ארבעה דגמים.

• Humanity's Last Exam (עם כלים) — 64.5% / 54.9% / 67.7%.

• OSWorld 2.1 (שימוש במחשב, חלקי) — 80.1% / 57.0% / 81.8%.

• Chartography (זיהוי תרשימים חזותי, ללא כלים) — 61.6% / 15.6% / 64.4% / 53.6%.

שלוש הערות שוליים ראויות ללוות את השורות ההן ולא לשכון מתחתן. ראשית, הנתון של Opus 5.5 ב-Terminal-Bench 4.0, 66.4%, מדווח במאמץ Xhigh — התצורה בעלת הניקוד הגבוה ביותר של Opus 5.5. שנית, ההיפוך ב-FrontierCode Max מוסבר: במצב Max, Sonnet 5.5 הריץ לעיתים קרובות יותר את כישור סקירת הקוד של Claude Code, המפצל את הסקירה בין סוכני משנה רבים, ובשני מקרים הדבר הניב פסק זמן או עריכות מחוץ לתחום המשימה — FrontierCode מעניש שינויים מחוץ לתחום גם כשהם טובים. שלישית, והכי פחות נוח לספק, Artificial Analysis הריצה את GDPval-AA ו-AA-Briefcase על פריסת טרום-שחרור של Sonnet 5.5, שלפי Anthropic הכילה באג שפגע בתגובות לבקשות פלט מובנה. Anthropic צופה שההשפעה תהיה קטנה ושתציג את Sonnet 5.5 בחסר, ואומרת שהבאג תוקן. היא גם מציינת ש-OpenAI תיקנה לאחרונה באג בהבנת תמונות ב-GPT-6 Sol, כך שנתוני GPT-6 Sol בשורות ההן עשויים עדיין שלא לשקף את המודל הנוכחי.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

מה אומרת הריצה העצמאית על אותו מודל

ל-Artificial Analysis יש את Sonnet 5.5 במדידה, והעמוד שלו מציין את התצורה המדויקת: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". באותה גרסה של המדד, 216 מודלים בקטגוריה:

• Claude Sonnet 5.5 — מדד האינטליגנציה 56, מדורג #3 מתוך 216. עלות של $7.60 לכל משימת מדד. הוא ייצר 410 מיליון טוקנים של פלט במהלך הרצת המדד, לעומת חציון של 88 מיליון.

• Claude Sonnet 5 — מדד 38, מדורג #58 מתוך 216, בעמוד משלו שכותרתו "(חשיבה מסתגלת, מאמץ מרבי)". עלות של $5.09 למשימה. 370 מיליון אסימוני פלט.

• Claude Opus 5.5 — מדד 58, מדורג במקום ה-1 מתוך 216. ‏$5.98 למשימה. 95.3 אסימוני פלט לשנייה.

• GPT-6 Sol — מדד 48, במקום ה-20 מתוך 216, במחיר מחירון של $2/$10.‏ $1.06 למשימה, 89.8 טוקני פלט לשנייה.

פער ה-Intelligence Index — 56 מול 38, שמונה עשרה נקודות — הוא האישור העצמאי החזק ביותר במאמר הזה, וזה המספר שקורא צריך באמת לקחת איתו. נתון העלות הוא זה שדורש הסתייגות, וכדאי לומר אותו במדויק: שתי הנקודות הן תצורות של מאמץ מקסימלי, ומאמץ מקסימלי במודל שמבצע הסקה זמן ארוך יותר הוא עמדה יקרה במכוון. Sonnet 5.5 שרף 410M טוקנים בהרצת המדד, בעוד Sonnet 5 שרף 370M, ושניהם הרבה מעל החציון של 88M. מודל שחושב זמן ארוך יותר בהגדרה הגבוהה ביותר עולה יותר בהגדרה הגבוהה ביותר. מה שהמספר מפריך אינו "זול יותר לכל משימה" אלא כל פרשנות שלו כתכונה של המודל ולא של ההגדרה.

Artificial Analysis טרם פרסמה נתון מהירות פלט עבור Sonnet 5.5 — בדף שלה מופיע N/A עבור אסימוני פלט לשנייה, לעומת 78.7 עבור Sonnet 5 ו-95.3 עבור Opus 5.5. לכן החלק של „מהיר יותר ב-30%+” בטענת Anthropic הוא בגדר דיווח ספק בלבד בשלב זה. התייחסו לכך כאל נתון כיווני עד שצד שלישי ימדוד זאת.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

מאיפה החיסכון באמת מגיע, ואיך להשיג אותו

אם מקבלים את המנגנון, הוראות ההגירה נכתבות מעצמן, ו-Anthropic פרסמה אותן:

• התחל בערך high כברירת מחדל, לא לפי מה שהגדרות Sonnet 5 שלך אמרו. ההנחיה של Anthropic היא high, אלא אם עומס העבודה שלך הוא סוכני או רגיש להשהיה.

• קידוד סוכני ושימוש בכלים רב-שלביים — התחילו ברמה בינונית עבור משימות מוגדרות היטב, ועלו לרמה גבוהה עבור משימות קשות או ארוכות יותר.

• צ'אט ועבודות אחרות הרגישות להשהיה — התחילו בבינוני או בנמוך. זהו הטווח שבו חיות הטענות על "עשירית מהעלות".

יש הסבר קוהרנטי לכך שההגדרה הנמוכה עובדת, וזה לא שיווק. הבודקים המוקדמים של Anthropic דיווחו ש-Sonnet 5.5 מאגד קריאות לכלים יחד יותר מאשר Sonnet 5, ומייצר פחות צעדים לכל משימה. ההערה של CodeRabbit בהודעת ההשקה ספציפית באופן יוצא דופן עבור ציטוט השקה: ה"נטייה של Sonnet 5 לפנות לחיפוש באינטרנט לעתים קרובות מדי והשימוש הגבוה שלו בטוקנים – שניהם נעלמו במודל החדש הזה." Sonnet 5.5 גם שמר על אותו טוקנייזר כמו Sonnet 5, כך שטקסט זהה עולה אותו מספר טוקנים — הצמצום הוא בפחות סבבים ופחות קריאות מיותרות, לא באוצר מילים זול יותר. משמעות הדבר גם היא שספירת הטוקנים בלוגים שלך נשארת ברת השוואה לאורך השדרוג, מה שהופך מדידה של לפני ואחרי לפשוטה.

ששת השינויים ששוברים או משנים את הקוד של Sonnet 5

זה החלק של השחרור שגובה זמן הנדסי, וכאן מדריך ההגירה שווה יותר מתרשים הבנצ'מרק. חמישה מתוך השישה מחזירים שגיאות קשות; השישי נכשל בשקט.

• thinking: {"type": "disabled"} מחזיר כעת 400. התחליף הוא thinking: {"type": "between_tools"}, שמכבה חשיבה מראש והוא הגדרת החשיבה הנמוכה ביותר במודל זה. הוא פועל במאמץ נמוך, בינוני וגבוה, אינו דורש כותרת בטא, וזמין בכל פלטפורמה שמשרתת את Sonnet 5.5. במאמץ xhigh או max, between_tools עצמו מחזיר 400 — השתמש בחשיבה אדפטיבית (השמט את השדה, או שלח {"type": "adaptive"}) אם אתה זקוק לרמות אלו. עם between_tools גם לא ניתן לשנות מאמץ באמצע השיחה.

• אין תמיכה בשימוש כפוי בכלי. הגדרת tool_choice ל-{"type": "any"} או {"type": "tool", "name": "..."} מחזירה 400 עם ההודעה "tool_choice: type 'tool' and 'any' are not supported for this model." אותה בדיקה חלה גם על נקודת הקצה לספירת טוקנים. התחליף המתועד לקלט תקין לפי סכימה הוא tool_choice: {"type": "auto"} בתוספת strict: true בכלי, או העברת הסכימה ל-structured outputs.

• בלוקי חשיבה כבולים למודל ולשיחה. Sonnet 5.5 קורא בלוקי חשיבה מ-Sonnet 5, Opus 4.8, Haiku 4.5 וקודמים להם — לא מ-Opus 5, Opus 5.5, או מכל מודל Fable או Mythos. אף מודל אחר לא קורא את הבלוקים של Sonnet 5.5. העבר שיחה מ-Sonnet 5 ל-5.5 וההיגיון שורד; העבר אותה מ-Sonnet 5.5 לכל דבר אחר והתורים המאוחרים פועלים בלעדיו. בנפרד, ה-API בודק כעת אם הנחיית המערכת, רשימת הכלים, או הודעה קודמת השתנו מאז שנוצר בלוק חשיבה, ובחשבונות שנוצרו ב-31 באוגוסט 2026 או לאחריו הוא מחזיר 400 כאשר הם השתנו. שמור על שיחות כ-append-only, או שלח את כותרת הבטא thinking-binding-controls-2026-08-01 עם prefix_mismatch_behavior: "drop_block".

• computer_20251124 נדחה ב-Claude API וב-Google Cloud.שימוש במחשב שם מחייב את ערכת הכלים computer_toolset_20260801. Amazon Bedrock עדיין מקבל את הכלי הישן יותר — פער פלטפורמות שכדאי לציין אם אתם מריצים את אותו סוכן בשתיהן.

• חלק משילובי היועצים אינם קיימים עוד. מבצע Sonnet 5.5 מקבל את Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 או Sonnet 5.5 עצמו כיועץ. יועצי Opus 4.8, Opus 4.7 ו-Sonnet 5, שעובדים עם מבצע Sonnet 5, מחזירים 400 עם מבצע Sonnet 5.5. כל יועץ ש-Sonnet 5.5 מקבל מחזיר עצה מוצפנת, כך שהלקוח שלך לא יכול לקרוא את טקסט העצה.

• טקסט בין קריאות לכלים מגיע כעת בתוך בלוקי חשיבה — ובתצוגת ברירת המחדל: "omitted" הוא ריק. זה השקט. הערות ארוכות יותר ממשפט או שניים בין קריאות לכלים חוזרות כבלוקי חשיבה של עדכון התקדמות ולא כטקסט. אפליקציה שמזרימה את הקריינות הזו למשתמשיה שותקת בין קריאות לכלים, בלי שגיאה ושום דבר בלוגים. התיקון הוא או להגדיר את thinking.display כך שהטקסט יוחזר, או לעבור ל-between_tools, ואז הטקסט חוזר כטקסט רגיל.

עוד שני דברים שמיגרציה נוגעת בהם, ואף אחד מהם אינו שגיאה. ניטור סירובים: Sonnet 5.5 מחזיר stop_reason: "refusal" עם אובייקט stop_details שמציין אחד מחמישה תחומי מדיניות — cyber, bio, frontier_llm, reasoning_extraction, general_harms — ומנגנון הגיבוי בצד השרת של Anthropic ינסה שוב סירובי cyber ו-frontier_llm ב-Sonnet 5, אבל לא את שלושת האחרים. ומצב האבטחה אכן השתנה: Sonnet 5.5 הוא מודל Sonnet הראשון שיוצא עם הגנות סייבר ומנגנוני גיבוי כמו של מחלקת Opus, מה שאומר שבקשות סייבר בסיכון גבוה יותר מועברות באופן גלוי לגיבוי ב-Sonnet 5, והוא גם ה-Sonnet הראשון עם מסווגים נגד reasoning_extraction. אם הצעת הערך של המוצר שלך היא כלי אבטחה, בדוק את הגבול הזה לפני שאתה משחרר את החלפת המודל.

תמחור, ומה שבאמת נמצא במסלול שלנו היום

כרטיס התעריפים לא השתנה מ-Sonnet 5, והצורה המלאה שלו כפי שפורסמה קצרה מספיק כדי לנסח אותה בפשטות:

• קלט — $2.00 למיליון טוקנים. פלט — $10.00 למיליון טוקנים. שניהם זהים ל-Sonnet 5, כפי שמאושר בעמוד המודלים של Anthropic עבור Sonnet 5.5.

• קריאה מהמטמון — $0.20 למיליון, הנחה של 90% על קלט; כתיבה למטמון של 5 דקות $2.50 למיליון; כתיבה למטמון של שעה אחת $4.00 למיליון. הפרומפט המינימלי שניתן לשמור במטמון הוא 512 טוקנים ב-Sonnet 5.5, לעומת 1,024 ב-Sonnet 5.

• Batch — 50% הנחה בשני הכיוונים, כלומר $1.00 / $5.00 למיליון. ב-Message Batches API, הפלט יכול להגיע ל-300K טוקנים עם כותרת הבטא output-300k-2026-03-24.

• מול Opus 5.5 — Sonnet 5.5 הוא בדיוק חצי: $2/$10 לעומת $4/$20, כשכתיבות מטמון בחצי וקריאות מטמון זהות ב-$0.20. זו ההגירה שמשתלמת, ו-Anthropic אומרת זאת במפורש: שני המודלים משלימים זה את זה בצורה הטובה ביותר כאשר Sonnet פועל במאמץ נמוך יותר, ו-Opus "נשאר חזק באופן ברור בעבודה מורכבת ופתוחה הדורשת שיקול דעת מתמשך."

• הקשר ופלט — הקשר של 1M טוקנים, פלט מקסימלי של 128K, חשיבה אדפטיבית מופעלת כברירת מחדל, מאמץ ברירת מחדל גבוה, נקודת חיתוך ידע מהימנה יוני 2026, אפס שמירת נתונים זמין, פרישה לא לפני 28 בספטמבר 2027.

הערת זמינות אחת שאנו מעדיפים לומר במפורש ולא לרמוז עליה: Claude Sonnet 5.5 אינו נכלל בקטלוג המודלים שלנו נכון ל-29 בספטמבר 2026. קודמו anthropic/claude-sonnet-5 ואחיו הגדול יותר anthropic/claude-opus-5.5 כן נכללים בו, והתעריפים שלו אצלנו הם של הספק עצמו — ‏$2.00 לקלט, ‏$10.00 לפלט, ‏$0.20 לקריאה מהמטמון, ‏$2.50 לכתיבה למטמון עבור Sonnet 5, ללא תוספת רווח, כך ששינוי מחיר של הספק נכנס לתוקף כאן באותו יום שבו הוא מתפרסם ולא במחזור החיוב הבא. התכונה האחרונה הזו היא מה שהופך קריאה בטבלת תעריפים לשימושית ולא לדקורטיבית.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

מה אתה יכול לעשות עם זה היום

הרצף האמיתי עבור צוות שכבר מריץ Claude Sonnet 5 בפרודקשן הוא שלושה שלבים, ואף אחד מהם אינו "להחליף את מחרוזת המודל ולצפות בגרף".

ראשית, הרץ מחדש את סבב המאמץ. אם העברת הגדרה גבוהה או מקסימלית מ-Sonnet 5 כי זה מה שסף האיכות שלך דרש, כעת אתה משלם על חשיבה שכבר אינך צריך לקנות. נתוני עלות-למשימה עצמאיים אומרים שהחלק העליון של הסולם נעשה יותר יקר, לא פחות, וטענות העלות של הספק עצמו מתארות כולן את אמצעו. שנית, תקן את שני נתיבי השגיאה לפני הפריסה — חשיבה מושבתת ושימוש כפוי בכלים — כי שניהם נכשלים בקול רם ומיד, וזו הבשורה הטובה. שלישית, שים לב לנתיב הקריינות, כי הוא נכשל בשקט.

אם המודל עדיין לא נמצא במסלול שבו אתה משתמש, הדרך בסיכון נמוך להעריך אותו היא להריץ אותו לצד, לא במקום: השאר את Sonnet 5 מוצמד כגיבוי על אותו מפתח, כך שסירוב, פסק זמן או הערכה גרועה מפנה את הבקשה למודל שאתה כבר סומך עליו, והמעבר האוטומטי לגיבוי סוגר את המעגל בלי אינטגרציה שנייה. זה כל הטיעון להערכת מודל לא מוכח מאחורי נקודת קצה אחת ולא לפני המשתמשים שלך — וזה חל כאן כפליים, כי קטגוריות הסירוב של Sonnet 5.5 חדשות וכיול המאמץ שלו הוא במפורש לא אותו הדבר כמו של קודמו. כשאתה מוכן להעביר את ברירת המחדל, רשימת המודלים על מפתח אחד מגיעה ליותר מ-200 מודלים, מה שהופך את ההשוואה לשינוי בקונפיגורציה ולא לחוזה שני.

מה לצפות

שלושה דברים יכריעו את השאלות הפתוחות במאמר הזה, ואף אחד מהם עוד לא קרה.

מדידת מהירות פלט בלתי תלויה היא הראשונה. Anthropic טוענת למהירות גבוהה ב-30%+ מזו של Sonnet 5; Artificial Analysis לא פרסמה נתון עבור Sonnet 5.5, ולטענה יש משקל ממשי בטיעון העלויות, שכן מודל מהיר יותר מסיים את אותה משימה בפחות זמן שעון ולעיתים בפחות טוקנים. Claude Haiku 5.5 הוא השני — Anthropic אומרת שהוא יגיע "בשבועות הקרובים" והוא יהיה ממוקם מתחת ל-Sonnet 5.5, מה שמשנה את החישוב עבור רצועת הצ'אט בנפח גבוה, שבה מאמץ בינוני ונמוך כבר הופכים את Sonnet 5.5 לתחרותי. השלישי הוא סבב התיקון: Artificial Analysis הריצה את GDPval-AA ואת AA-Briefcase על גרסת טרום-שחרור עם באג בפלט מובנה, Anthropic מצפה שהציונים האלה ימעיטו בערכו של המודל, ואף אחד מהמספרים לא הורץ מחדש. אם הם יעלו, הפער בעבודת ידע מול Opus 5.5 יצטמצם עוד יותר, והטיעון של "חצי מהמחיר" יתחזק.

עד אז, הסיכום שניתן להגן עליו צר יותר מההכרזה ושימושי יותר מתרשים הבנצ'מרק. Claude Sonnet 5.5 הוא שיפור של שמונה-עשרה נקודות בבינה לעומת Sonnet 5 במדד הבלתי תלוי, באותם תעריפים מפורסמים, עם חיסכון אמיתי ומדיד הזמין לכל מי שיורד בסולם המאמץ — וקנס אמיתי ומדיד לכל מי שלא.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית