כרטיס כותרת ראשי עבור Claude Opus 5.5 מול GPT-5.6 Sol, עם הכותרת 'שתי טבלאות השקה שכמעט אינן חופפות', עם תגים המציגים $4.00 מול $5.00, 66.4% מול 37.3%, ותאריך חיתוך יוני מול פברואר, והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Claude Opus 5.5 מול GPT-5.6 Sol: שתי טבלאות השקה שכמעט ואינן חופפות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שים Claude Opus 5.5 וGPT-5.6 Sol זה לצד זה השבוע, והדבר הראשון שאתה שם לב אליו הוא לא מנצח. זה ששני הספקים פרסמו טבלאות בנצ'מרק שכמעט ואין להן שורה משותפת. חומר ההשקה של Claude Opus 5.5, שיצא ב-22 בספטמבר 2026, מציב אותו 29 נקודות לפני GPT-5.6 Sol ב-Terminal-Bench 4.0. חומר ההשקה של Sol, שזמין באופן כללי מאז 9 ביולי 2026, מוביל במקום זאת עם Terminal-Bench 2.1, שבו Sol Ultra קיבל 91.9%, ועם Artificial Analysis Coding Agent Index, שבו הוא תפס את המקום הראשון עם 80. שתי הטבלאות אמיתיות. שתיהן הורצו על ידי הספק שמנצח בהן. השאלה השימושית היא לא איזה מודל טוב יותר במופשט — אלא איזה בנצ'מרק, שרץ תחת איזו תשתית, מספר לך משהו על עומס העבודה שלך. זו שאלה קשה יותר ממה שכל פוסט השקה רוצה שתשאל, והיא זו שההשוואה הזו בנויה סביבה.

שני הדגמים, זה לצד זה

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• ספק — Anthropic מול OpenAI

• פורסם — Claude Opus 5.5 ב-22 בספטמבר 2026 לעומת GPT-5.6 Sol ב-9 ביולי 2026

• מחיר למיליון טוקנים — $4.00 קלט / $20.00 פלט לעומת $5.00 קלט / $30.00 פלט

• קריאה מהמטמון — $0.20 למיליון ב-Opus 5.5; תעריף המטמון של Sol נקבע לפי פלטפורמה ואינו מפורסם כנתון בודד שניתן להשוות

• חלון הקשר — 1M טוקנים בשניהם

• פלט מקסימלי — 128K טוקנים בשניהם, עם 300K ב-Batch API של Anthropic מאחורי כותרת בטא

• תאריך סיום הידע — יוני 2026 עבור Opus 5.5 לעומת 16 בפברואר 2026 עבור Sol

• שליטה בהיסק — חשיבה אדפטיבית תמיד פעילה, ברירת מחדל בינוני מאמץ, הסקאלה נעה מנמוך עד מקסימום לעומת הגדרת מאמץ היסק מקסימלי וכן מצב Ultra שמתאם תתי-סוכנים מקבילים

• הרכב — Opus 5.5 הוא הראשון ממשפחת 5.5, עם Sonnet 5.5 ו-Haiku 5.5 שהובטחו בשבועות הקרובים, לעומת Sol כספינת הדגל של משפחה תלת-שכבתית לצד Terra ו-Luna

שתיים מהשורות האלה עושות יותר עבודה מהשאר. פער חיתוך הידע הוא ארבעה חודשים, מה שחשוב אם הפרומפטים שלך נוגעים במשהו שקרה באביב הזה. ו-Opus 5.5 כעת מציע מחיר נמוך מ-Sol גם בקלט וגם בפלט — היפוך מלפני שלושה חודשים, כאשר Sol היה האמצעי הזול יותר להגיע לפלט ברמת החזית ו-Claude Opus 5 עמד על $5/$25.

השורות היחידות שבהן שני המודלים מופיעים בפועל

ישנה בדיוק טבלה אחת שפורסמה ומכילה את שני המודלים, והיא של Anthropic. כל נתון בה דווח על ידי הספק, והופק על ידי החברה שמוכרת את אחד משני המודלים:

• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% מול GPT-5.6 Sol 37.3%

• Terminal-Bench-Science 0.1 — 58.7% לעומת 22.4%

• FrontierCode v1.1 (ראשי) — 54.4% לעומת 47.5%

• CursorBench 4.0 — 57.8% לעומת 41.7%

• AutomationBench — 40.0% לעומת 28.8%

• GDPval-AA v2.1 — 1846 Elo לעומת 1588

זהו ניצחון מוחלט, והפערים בשתי שורות ה-Terminal-Bench גדולים דיים כדי להצדיק בחינה מדוקדקת ולא קבלה כפשוטה. הערת השוליים של Anthropic עצמה עושה חלק מהעבודה הזו בשבילך: הרצת ה-Terminal-Bench של Opus 5.5 השתמשה ב-xhigh effort ולא בברירת המחדל, ובברירת המחדל medium effort היתרון של FrontierCode מצטמצם ל-54.6% מול 47.5% — פער של שבע נקודות במקום מספרי הכותרת. Anthropic גם מצרפת אזהרה כללית לכל הטבלה, באומרה שברמת יכולת זו פערי הבנצ'מרק הם "מדריך פחות אמין להבדלים בעולם האמיתי", וכי הפער הפנימי שלה מול Claude Fable 5.1 קטן מכפי שהציונים מרמזים. ספק שממעיט בערך הטבלה של עצמו הוא המשפט המהימן ביותר בה.

שים לב גם למה שחסר בטבלה הזאת: אף בנצ'מרק שבו המודל של OpenAI מנצח. טבלת ספק שמכילה רק שורות מחמיאות אינה ראיה לניצחון גורף; היא ראיה לברירת שורות.

מה אומרים המספרים של OpenAI עצמה

חומר ההשקה של Sol מספר סיפור אחר, על בנצ'מרקים שונים, בהרנס שונה. דווח בהשקה של Sol ביולי:

• Terminal-Bench 2.1 — 91.9% עבור Sol Ultra ו-88.8% עבור Sol הסטנדרטי, לעומת Claude Mythos 5 עם 88.0% ו-Claude Fable 5 עם 84.3%

• Artificial Analysis Coding Agent Index — 80, שתואר באותה עת כמתקדם ביותר, 2.8 נקודות מעל Claude Fable 5

• Agents' Last Exam, תהליכי עבודה מקצועיים ארוכי טווח — 53.6, ש-OpenAI דיווחה שהוא מקדים ב-13.1 נקודות את Claude Fable 5

• BrowseComp — 92.2%; OSWorld 2.0 — 62.6%; SWE-Bench Pro — 64.6%

אף אחת מהשורות האלה אינה כוללת את Claude Opus 5.5, כי הוא לא היה קיים ביולי. הטבלה של Sol נבנתה כדי לנצח את Fable 5 ואת Mythos 5, והיא אכן עושה זאת. האם היא מנצחת את Opus 5.5 פשוט אינה נענית בחומר של אף אחד מהספקים — שתי הטבלאות הורכבו בהפרש של חודשיים זו מזו, מול מתחרים שונים.

השורה של SWE-Bench Pro ראויה לציון נפרד, מפני שזה המקום היחיד שבו חומר ההשקה של OpenAI מראה שהמודל שלה מפסיד: 64.6% ל-Sol לעומת 80% ל-Claude Fable 5. OpenAI הגיבה בכך שהטילה ספק בתקפות הבנצ'מרק, והעריכה שכ-30% מהמשימות בו שבורות. ייתכן מאוד שזה נכון. זו גם תזכורת מועילה לכך ש"הבנצ'מרק הזה פגום" היא טענה ששתי המעבדות משמיעות, ותמיד ביחס לבנצ'מרק שבו הן מפסידות.

בעיית הרתמה, שאותה שום טבלה לא פותרת

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

הסיבה ששתי הטבלאות אינן מתיישבות אינה שספק אחד משקר. הסיבה היא שבנצ'מרקים של קידוד אג'נטי נמדדים מודל בתוספת שלד (scaffold), והשלדים שונים זה מזה. Terminal-Bench 4.0 ו-Terminal-Bench 2.1 הם שתי גרסאות שונות של אותו רעיון, שהורצו בידי אנשים שונים, עם תקציבי כלים שונים וכללי ניסיון חוזר שונים. המספרים של Opus 5.5 של Anthropic הופקו בהרנס של Anthropic; המספרים של Sol של OpenAI הופקו בכלים בסגנון Codex. העבירו כל אחד מהמודלים להרנס של האחר — והציונים ישתנו.

נתונים בלתי-תלויים, היכן שהם קיימים, מתארים תחרות צמודה יותר מכל אחת מהטבלאות. בנצ'מרק סוכן של צד שלישי מאוגוסט 2026, שהורץ על פני מודלים מרובים על עבודה יישומית אמיתית, הכתיר את GPT-5.6 Sol כשילוב הטוב ביותר של דיוק, עלות ומהירות — כ-$0.52 וחמש דקות לכל הרצה — בעוד ש-Claude Opus 5, ולא 5.5, היה המדויק ביותר ב-92% מההרצות. לוח דירוג נפרד למשימות קוד ארגוניות הציב את Claude Opus 5 במקום הראשון עם 96.4%, ואת GPT-5.6 Sol במקום השלישי עם 86.5%, ושוב השווה את Sol ל-Opus הקודם ולא לחדש. שניהם אינם השוואה ראש בראש מול Opus 5.5, ואף אחד מהם אינו מכריע דבר. אך הם כן קובעים שכאשר מישהו שאינו ספק מריץ את ההשוואה, הפערים נעשים קטנים.

המסקנה המעשית היא להפסיק לקרוא את הטבלאות כדירוג ולהתחיל לקרוא אותן כרשימת השערות. אם העבודה שלך היא אוטומציה טרמינלית לטווח ארוך, הפער של Anthropic ב-Terminal-Bench הוא השערה ששווה לבדוק על המשימות שלך. אם מדובר במחקר מקצועי רב-שלבי, תוצאת Agents' Last Exam של Sol היא אותו סוג של השערה. אף אחד מהמספרים לא עובר לעומס העבודה שלך בלי הרצה.

עלות לכל משימה שהושלמה, שהיא העלות היחידה שחשובה

בכרטיס התעריפים, Claude Opus 5.5 זול כעת יותר בשני הכיוונים: 4.00$ מול 5.00$ בקלט, 20.00$ מול 30.00$ בפלט, ותעריף קריאה מהמטמון של 0.20$ — הנמוך ב-60% ממה שגבה Claude Opus 5. עבור סוכן ששולח מחדש הנחיית מערכת ארוכה בכל תור, שורת המטמון הזו היא העלות הדומיננטית והסיבה לכך שסשן ארוך טווח יכול להיות זול באופן מהותי בלי שום שינוי בהנחיה.

אך מחיר לכל טוקן מעולם לא הכריע את חשבון הסוכן. הטענה של OpenAI לגבי Sol בהשקה נשענה על יעילות טוקנים ולא על מחיר המחירון — היא דיווחה על שיפור של 54% ביעילות טוקנים בכתיבת קוד, כאשר טוקני הפלט והזמן שחלף היו פחות ממחצית מאלה של Claude Fable 5 בעלות נמוכה בכ-שליש. Anthropic מציגה טיעון תמונת מראה עבור Opus 5.5: עלות נמוכה בכ-40% להרצה בעומסי עבודה אופייניים מאשר Claude Opus 5, במחירון שירד רק ב-20%, עם הצהרות לקוחות מ-Box, Kiro, Factory ו-GitHub שכולן מציינות הפחתות גדולות בטוקנים או בצעדים. שתי הטענות מצביעות לאותו כיוון — המודל שמסיים במספר סבבים קטן יותר מנצח — ואף אחת מהן אינה מבוקרת באופן בלתי תלוי.

היכן שקיימת מתמטיקה עצמאית של עלות-למשימה, היא כרגע מוטה לטובת Sol: ניתוח אחד שפורסם בספטמבר הציב את GPT-5.6 Sol על $1.56 לכל בעיה שנפתרה ב-SWE-bench Verified בשיעור הצלחה של 96.2%, לעומת Claude Opus 4.8 עם 88.6%. זהו Sol שנמדד מול מודל Anthropic ישן יותר, לא מול Opus 5.5, כך שזו נקודת התחלה ולא פסק דין — אבל זו תזכורת לכך שמודל שפותר את הבעיה בניסיון הראשון זול יותר ממודל זול יותר שזקוק לשלושה סבבים. המדידה היחידה שמכריעה זאת עבורך היא המשימה שלך עצמך, בהרצה בשתי הדרכים, עם ספירות הטוקנים לנגד עיניך.

זו בעיית ניתוב יותר מאשר בעיית רכש, וכדאי לדייק לגבי איזה צד שלה כבר ניתן לפתור. GPT-5.6 Sol זמין ב-OrcaRouter היום במחיר המחירון של OpenAI עצמה עם 0% תוספת — מחיר המחירון של הספק מועבר ישירות, כך ששינוי בתעריף של ספק נכנס לתוקף אצלנו באותו יום ולא אחרי סנכרון. Claude Opus 5.5 אינו אחד מהנתיבים שלנו עדיין; הוא זמין דרך ה-API של Anthropic עצמה ודרך העננים הגדולים. ברגע שהוא יגיע, אותו מפתח ישמש את שניהם, וזה מה שהופך את הניסוי לכלל ניתוב במקום לחוזה שני ול-SDK שני: שלחו את עומס העבודה למודל שהמספרים שלכם מעדיפים, השאירו את מעבר אוטומטי לגיבוי מכוון אל האחר, ותנו לשורת routing-DSL להחליט לפי בקשה ולא לפי רבעון. הורדת מחיר באחד הצדדים היא שינוי בקונפיגורציה, לא מיגרציה.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

היכן ששני אלה באמת נבדלים

הסירו את אמות המידה, ונותרים ארבעה הבדלים, כולם ניתנים לבדיקה:

• מועד חיתוך הידע. יוני 2026 עבור Opus 5.5 לעומת 16 בפברואר 2026 עבור Sol. ארבעה חודשים מהווים פער ממשי לכל דבר שנוגע לספריות עדכניות, לאירועים אחרונים או ל-API-ים ששונו לאחרונה, ואף בנצ'מרק לא לוכד אותו.

• ניתוב הגנה. Opus 5.5 מגיע עם הגנות בדרגת Fable 5.1: רוב בקשות אבטחת הסייבר מנותבות מחדש אל Claude Opus 4.8 ועבודה בביולוגיה נופלת חזרה אל Claude Opus 5, אלא אם החשבון מאומת. אם המוצר שלכם נמצא באחד משני התחומים הללו, חלק מהתעבורה שלכם נענית על ידי מודל קטן יותר. Sol אינו כולל ניתוב מתועד שווה ערך, אם כי OpenAI כן מציינת הערכות בטיחות משלה הקשורות לסייבר.

• תזמור. Sol מספקת מצב Ultra שמתאם כמה תת-סוכנים מקבילים, ארבעה כברירת מחדל, והגדרת מאמץ חשיבה מקסימלי. ל-Opus 5.5 אין אף אחד מאלה כתכונת פלטפורמה; המנוף שלו הוא הפרמטר effort, והרכבה מרובת מודלים היא משהו שאתה בונה או מנתב, ולא משהו שהספק מוסר לך.

• כלכלת המשפחה. Sol היא אחת משלוש דרגות, כאשר Terra ו-Luna נמצאות מתחתיה — ומחירה של Luna קוצץ ב-80% ושל Terra ב-20% בעדכון מ-30 ביולי. האחיות הזולות יותר של Anthropic, Sonnet 5.5 ו-Haiku 5.5, הוכרזו אך טרם שוחררו. אם עומס העבודה שלך מעורב, OpenAI מציעה כיום את הדרגות הזולות יותר.

לבחור ביניהם

בחר ב-Claude Opus 5.5 אם העבודה שלך היא קידוד סוכני או עבודת ידע ארוכי-טווח, אם המחיר לכל טוקן חשוב, אם הפרומפטים שלך נוגעים במשהו מהארבעה חודשים האחרונים, או אם הקשר של 1M טוקנים במחיר $0.20 למיליון טוקנים במטמון הוא מה שהופך את הארכיטקטורה שלך למשתלמת. התחל ברמת ביניים של מאמץ, לא בהגדרה הגבוהה שעברה בירושה, ומדוד אם נמוך מחזיק מעמד.

בחרו ב-GPT-5.6 Sol אם אתם רוצים מצב תזמור המצורף על ידי הספק, אם אתם צריכים שכבת מחיר זולה יותר מתחת לדגם הדגל כבר היום ולא בעוד כמה שבועות, או אם עומס העבודה שלכם הוא מהסוג שעדויות ההשקה של Sol עצמה מכסות בצורה הטובה ביותר — תהליכי עבודה מקצועיים לטווח ארוך ושימוש במחשב, שבהם היא דיווחה על התוצאות החזקות ביותר שלה.

אם אתם כבר עובדים עם Claude Opus 5, שימו לב ש-Opus 5.5 אינו תחליף ישיר: לא ניתן עוד להשבית את החשיבה, שימוש כפוי בכלים מחזיר שגיאה, בלוקי חשיבה כבולים למודל ולשיחה, וכלי computer_20251124 לשימוש במחשב הישן אינו מתקבל ב-Claude API או ב-Google Cloud. שלושת הראשונים חלים גם על Claude Fable 5.1. מעבר ל-Sol הוא אינטגרציה שונה לחלוטין.

מה שבאמת יכריע את ההשוואה הזו הוא ריצה עצמאית אחת של שני המודלים במאמץ תואם, בהארנס תואם, על אותה קבוצת משימות. נכון לשבוע זה, איש לא פרסם ריצה כזו. עד שמישהו יעשה זאת, העמדה הכנה היא זו שהראיות תומכות בה: הטבלה של Anthropic מעדיפה את Opus 5.5 והופקה בידי Anthropic; הטבלה של OpenAI מעדיפה את Sol והופקה בידי OpenAI; התוצאות העצמאיות שקיימות משוות את Sol ל-Opus הקודם ומתארות מרוץ צמוד הרבה יותר; ושתי השורות שיכריעו את החשבון שלך — טוקנים לכל משימה שהושלמה ונפח קריאה מהמטמון — הן שתי השורות שאף אחד מהספקים לא מפרסם.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית