כרטיס כותרת הירו שכותרתו 'Claude Opus 5.5 ומבחן האבטיח', עם כותרת משנה 'הקלוד הקריא ביותר עד כה — והוא עדיין קובר את העיקר', עם שלושה תגים שעליהם כתוב Flesch-Kincaid 6.95, Reading Ease 68.4, ו-22 בספטמבר 2026, והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Claude Opus 5.5 ומבחן האבטיח: Anthropic תיקנה את הפרוזה, אבל הנקודה עדיין קבורה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אחת הדוגמאות שהגיעה הרחק ביותר מעבר לשבוע ההשקה הייתה סיפור קצר על אבטיח. כמה מאות מילים, בלי מדד מצורף, בלי תרשים — רק מודל שהתבקש לכתוב משהו קטן והצליח ברובו. זהו פריט מוזר לשבת כל כך קרוב למרכז של השקת דגל, אבל הוא מצביע על הדבר שהספק בחר להוביל איתו כשהוציאClaude Opus 5.5 ב-22 בספטמבר 2026: לא עוד נקודה על Terminal-Bench, אלא פרוזה. הניסוח של החברה הוא שהמודל הזה כותב פחות ״קלודית״ — המונח שלה לסגנון הנוסחתי, עתיר ההסתייגויות והמנקה־גרון, זה שClaude Opus 5 ספג בגללו תלונות, ושאליו Claude Fable 5.1GPT-6 Astra וגם GPT-5.6 Solנמדדו מאז, כל אחד מהם. אז השאלה שכדאי לענות עליה אינה אם ההדגמה הייתה מקסימה. אלא אם הפרוזה השתפרה באופן מדיד, בכמה, והיכן היא עדיין נכשלת.

מה ש-Anthropic אומרת שתיקנה

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

הטענה של Anthropic ספציפית מספיק כדי לבדוק אותה. Opus 5.5, כך נטען, מציג את המידע החשוב ביותר תחילה, משתמש בפחות ז'רגון, ועוקב אחר כללי הכתיבה המוצהרים של המשתמש בצורה מדויקת יותר מדגמי Opus קודמים. החומר התומך מדווח על ידי הספק ואינו משוחזר: בדיקות אימות עובדות פנימיות ש-Anthropic אומרת שעברו 16 מתוך 18 ניסיונות, לעומת אפס מתוך 18 עבור גם Claude Fable 5.1 וגם Claude Opus 5. ציטוטי לקוחות בחומר ההשקה מצביעים לאותו כיוון — John Ruelas מ-Ramp מתאר פלט ש"כותב כמו עמית טוב," Box מדווחת על כ-40% פחות מילוליות בעומסי העבודה שלה.

שני דברים ראויים להפרדה כאן. הראשון הוא ש"פחות קלודית" הוא כשל אמיתי, שאפשר לתת לו שם, ולא המצאה שיווקית. אנשי מקצוע מתלוננים על פרוזה של Claude שהיא דחוסה ובנויה רע מאז דורות ה-Opus שאחרי 4.6, והתלונה ספציפית: יותר מדי הקדמה, יותר מדי ניסוחים חוזרים של הפרומפט, הרגל להגיע לנקודה שתי פסקאות אחרי שהקורא כבר נזקק לה. השני הוא שהמספרים של Anthropic עצמה על כך שתיקנה זאת הם בדיוק זה — המספרים של Anthropic עצמה. לנתון 16 מתוך 18 אין שכפול בלתי תלוי, ו"40% פחות אריכות דברים" הוא מדידה פנימית של לקוח, לא מתודולוגיה שפורסמה.

הגרסה כוללת גם שינוי שאינו נוגע לכתיבה, שראוי להכיר: Opus 5.5 הוא מודל Opus הראשון שמשוחרר עם אמצעי הגנה בתחומי הסייבר, הביולוגיה ופיתוח LLM בחזית, התואמים לאלה שב-Claude Fable 5.1. כאשר בקשה מפעילה אחד מהם, Anthropic מציינת שהיא מנתבת את הבקשה בשקיפות למודל אחר במקום לסרב outright.

המספרים שאינם של Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

הקריאה הבלתי־תלויה השימושית ביותר בנוגע לטענת הכתיבה מגיעה מ-Every's Vibe Check, שהריץ את אותם פרומפטים על פני חמישה מודלי חזית ונתן ציון לפלט באמצעות שני כלי קריאות סטנדרטיים. בקבוצת הפרומפטים הזו, Claude Opus 5.5 יצא כקריא ביותר מבין הקבוצה — והפער למודל שאותו הוא החליף הוא הסיפור:

• רמת הכיתה לפי Flesch-Kincaid — Claude Opus 5.5 עם 6.95, לעומת Claude Opus 5 עם 7.97

• מדד הקריאות של פלש — 68.4 עבור Opus 5.5, לעומת 61.35 עבור Opus 5

• Claude Fable 5.1 — רמת כיתה 7.43, קלות קריאה 66.09

• GPT-6 Astra — רמת כיתה 7.52, קלות קריאה 64.55

• GPT-5.6 Sol — רמת כיתה 8.74, קלות קריאה 56.62

קראו את שני המדדים יחד, מפני שהם נעים בכיוונים מנוגדים וזו בדיוק הנקודה: רמת כיתה נמוכה יותר וציון קלות גבוה יותר – שניהם משמעותם פרוזה פשוטה יותר. Opus 5.5 ממוקם בערך כיתה שלמה מתחת ל-Opus 5, בערך חצי כיתה מתחת גם ל-Claude Fable 5.1 וגם ל-GPT-6 Astra, וכמעט שתי כיתות מתחת ל-GPT-5.6 Sol. במילים פשוטות, רמת קריאה של כיתה ז' במקום של כיתה ח'.

זהו שיפור אמיתי, אבל גם שיפור צר בהיקפו. זהו סט הפרומפטים של כלי תקשורת אחד, לא בנצ'מרק עם רשימת משימות קבועה ולוח תוצאות מאחוריו. הוא מספר לך את כיוון ההתקדמות ובקירוב את גודל הצעד. הוא לא מספר לך ש-Opus 5.5 כותב היטב על העבודה שלך, וההערות האיכותניות של Every עצמה מבהירות שגם הסוקר לא חשב כך.

היכן שזה עדיין קובר את הנקודה

אותה סקירה שהפיקה את נתוני הקריאות חדה באשר לכשל ששרד את התיקון. כשהתבקש לפתוח מאמר, לקח ל-Opus 5.5 בין 37 ל-39 משפטים לכסות את מה שהסוקר כיסה ב-21, והוא הקדיש פסקה שלמה לנקודה שהסוקר הציג בשמונה מילים. הסיכום של הסוקר הוא שהמודל "עדיין קובר את הנקודה" — והגרסה החריפה יותר של התלונה היא שהוא יכול לאבחן כראוי מה פסקה צריכה, ואז לייצר נוסח מתוקן שמתעלם מהאבחנה של עצמו.

כעורך הלך לו פחות טוב מאשר ככותב. כשדורג מול שאר המודלים במשימות עריכה, Opus 5.5 דורג אחרי Claude Opus 5, GPT-5.6 Sol וGPT-6 Astra — המודל טוב יותר בייצור משפטים קריאים מאשר בזיהוי איזה משפט היה צריך לבוא ראשון. פסק הדין של המבקר מתגלם במשפט שראוי לצטט, משום שהוא הדבר המועיל ביותר בכל הביקורת: "אני מרוצה ממנו יותר כשותף לדרך מאשר מהפרוזה שהוא מייצר."

המסקנה המעשית נובעת ישירות מכך. נסחו איתו טיוטה, ונסחו במאמץ גבוה ומעלה — בהגדרות המאמץ הנמוכות יותר המילוי המיותר הוא הגרוע ביותר. ספקו דוגמאות משלכם במקום לבקש ממנו להמציא אותן. לאחר מכן העבירו את הנקודה לראש בעצמכם, או מסרו את הטיוטה למשהו שיעשה זאת. מה ש-Opus 5.5 נותן לכם הוא נתיב מהיר יותר לטיוטה ראשונה נקייה, ושותף טוב יותר באמת לסבבים שאחריה. הוא לא נותן לכם עורך.

כמה עולות המילים הנוספות

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

יש ממד עלות לבעיית הפירוט היתר שרוב ביקורות הכתיבה מדלגות עליו, והוא פועל נגד נרטיב ההשקה. Artificial Analysis, שמפעילה הערכה משלה במקום להסתמך על נתוני ספקים, מציבה את Claude Opus 5.5 במקום הראשון מבין 212 מודלים במדד האינטליגנציה שלה עם ציון של 58 — אך במקום ה-95 מבין 212 בפירוט יתר, לאחר שייצרה 260 מיליון טוקני פלט לאורך ריצת המדד הזו לעומת חציון של 88 מיליון. העלות הייתה $5.98 לכל משימת מדד אינטליגנציה להערכה, ו-$8,708.20 בסך הכול.

הצב זאת לצד הטענה של Anthropic עצמה ליעילות, ושתי אלו אינן מתיישבות באופן ברור. העמדה כפי שמדווח על ידי הספק היא ש-Opus 5.5 משתמש בפחות טוקנים ומייצר פלט במהירות גבוהה ביותר מ-30% מ-Opus 5. בהרצה הבלתי תלויה של Artificial Analysis נמצא שהמודל מפורט מאוד ביחס לעמיתיו. שני הדברים יכולים להיות נכונים בו-זמנית — תמהילים שונים של משימות, הגדרות מאמץ שונות, הגדרות שונות של "פחות טוקנים" — אבל איש לא צריך לקרוא את המסגור של ההשקה כעובדה מבוססת לגבי כלכלת טוקנים. בכל הנוגע למחיר, התמונה ברורה יותר: 4 דולר למיליון טוקנים בקלט ו-20 דולר למיליון טוקנים בפלט, ירידה מ-5/25 דולר, עם הנחת מטמון של 95% בנתונים של Artificial Analysis.

אם אתם משלמים לפי טוקן פלט, טקסט מפורט אינו העדפה סגנונית. הוא שורת חיוב בחשבון.

להריץ את זה מול מה שכבר יש לך

הערת כנות אחת לפני החלק המעשי: Claude Opus 5.5 אינו אחד מהנתיבים שלנו. אנחנו לא מארחים אותו, ושום דבר בהמשך לא אמור להתפרש כטענה שאנחנו כן. אתה משיג אותו דרך ה-API של Anthropic עצמה וכמה פלטפורמות של צד שלישי.

מה שיש היום ב-OrcaRouter הוא המודל שהוא החליף, והדרגה שמעליו. Claude Opus 5 נמצא היום ב-OrcaRouter, וכך גם Claude Fable 5.1, שניהם במחיר המחירון של הספק עם 0% תוספת שמועברת הלאה — כלומר שינוי מחיר של ספק נוחת אצלנו באותו יום, ולא כשמפיץ כזה או אחר מתפנה לטפל בזה. אם אתם מנסים להחליט אם הפרוזה של Opus 5.5 שווה את המעבר, זהו צימוד שימושי: אפשר להריץ את ההשוואה במפתח אחד, בלי חוזה נוסף ובלי שינוי בקוד, כי שני המודלים זמינים דרך API אחד ל-200+ מודלים באותה נקודת קצה.

הסיבה הנוספת להשאיר מודל שני במעגל היא אופן הכשל שהמאמר הזה עוסק בו. מודל שקובר את העיקר הוא מודל שתרצה להיות מסוגל לעקוף אותו באמצע המשימה, ומעבר אוטומטי לגיבוי קיים בדיוק כדי שיצירה גרועה לא תהפוך לצינור תקוע. אם אתה מעדיף בכלל לא לבחור מודל אחד, ה-DSL של הניתוב מרכיב כמה מהם לקריאה אחת, ומיזוג מודלים מריץ פאנל של מודלים שעונים יחד — וזה מבנה סביר לעבודת עריכה, שבה הכשל הוא בשיקול הדעת ולא ביכולת.

מי צריך לפעול, ומי צריך לחכות

אם התלונה שלך לגבי Claude Opus 5 הייתה שהיית צריך לשכתב את הפתיחות שלו, Opus 5.5 הוא תיקון אמיתי לכ־בערך רמת כיתה אחת של הבעיה הזו, ונתוני הקריאות אומרים שהשיפור מדיד ולא תחושתי. אם התלונה שלך הייתה שנדרשות שלוש פסקאות כדי להגיע לנקודה, שום דבר בראיות הבלתי תלויות לא אומר שזה השתנה. אלו תלונות שונות, והסיקור של ההשקה התייחס אליהן כאחת.

בעבודה יצירתית ספציפית, סיפור האבטיח אינו ראיה לשום דבר מלבד שאנשים נוטים לפנות לפרומפטים קטנים, חמימים ובעלי סיכון נמוך כשהם רוצים לבחון מודל חדש. זה דבר סביר לעשות. זה גם בדיוק ההקשר שבו נטייה לקבור את הנקודה היא הכי פחות גלויה, כי אף אחד לא קורא סיפור אבטיח בשביל התזה. הצב את המודל מול מסמך שבו הקורא זקוק למסקנה כבר בשני המשפטים הראשונים, ותגלה איזו משתי הבעיות באמת הייתה לך.

הדבר שכדאי לשים לב אליו בהמשך הוא אם המודל הבא במשפחה — הן Sonnet 5.5 והן Haiku 5.5 צפויים בשבועות הקרובים — יירש את השיפור בקריאות, ואם מישהו יפרסם מספר קריאות עבור עריכה ולא עבור ניסוח ראשוני. מספר הניסוח הראשוני הוא הקל. מספר העריכה הוא המקום שבו Opus 5.5 עדיין מדורג אחרי שלושה מהמתחרים שלו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית