כרטיס Hero שכותרתו Claude Sonnet 5.5 vs GPT-6 Sol, עם כותרת משנה שלשכבת ה-$2 יש כעת שני דגמי דגל, עם תגיות המציגות אותו מחיר: $2 / $10, אינדקס 56 מול 47, וחלון הקשר של 1M מול 1.05M, וכותרת תחתונה שמצטטת את Artificial Analysis v4.3.2 ותמחור ספקים.
Guides & Insights

Claude Sonnet 5.5 מול GPT-6 Sol: בדרגת ה-2$ יש כעת שני דגלי דגל

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Claude Sonnet 5.5 ו-GPT-6 Sol מתומחרים באופן זהה — 2$ למיליון טוקנים בקלט, 10$ למיליון טוקנים בפלט — והם הגיעו בהפרש של שישה ימים בסוף ספטמבר 2026. הצירוף מקרים הזה הוא לא החלק המעניין. החלק המעניין הוא שכאשר Artificial Analysis מדדה את שניהם במדד האינטליגנציה v4.3.2 שלה, המודל הבינוני של Anthro​pic הקדים את המודל ש-Open​AI מוכרת כמודל הדגל שלה: 56 עבור Claude Sonnet 5.5 לעומת 47 עבור GPT-6 Sol. באותה גרסה, Claude Sonnet 5 — המודל ש-Sonnet 5.5 מחליף — נמצא ב-38.

אז זה כבר לא השוואה בין דרג זול לדרג יקר. זו השוואה בין שני מודלים באותו מחיר, משתי מעבדות, עם פער של 18 נקודות בין זה של Anthro​pic לבין קודמו, ופער של תשע נקודות לטובת Anthro​pic מול הגרסה הבכירה של Open​AI. כל מה שלהלן הוא ניסיון להבין איזה מהפערים האלה שורד מפגש עם עומס עבודה אמיתי, ואיזה מהם הוא ארטיפקט של בנצ'מרק.

מה כל מודל הוא בפועל

Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של Anthropic, שיצא ב-28 בספטמבר 2026, חמישה ימים לאחר ההשקה של Claude Opus 5.5 שהבטיחה אותו. הוא נושא את המזהה claude-sonnet-5-5 ב-Claude API, ב-Amazon Bedrock, ב-Google Cloud וב-Microsoft Foundry, שומר על חלון ההקשר של 1M טוקנים ועל תקרת הפלט של 128K של השכבה, ומשאיר את המחירים של Claude Sonnet 5 בדיוק כפי שהם: 2$ לקלט, 10$ לפלט, 0.20$ למיליון עבור קריאות מהמטמון, 2.50$ עבור כתיבה למטמון של חמש דקות. הוא זמין עם אפס שמירת נתונים מהיום הראשון, והתחייבות הפרישה של Anthropic תקפה עד 28 בספטמבר 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

GPT-6 Sol הוא היורש של המודל שנקרא באופן מבלבל GPT-5.6 Sol — זה ש-OrcaRouter עדיין מפרט כנגיש במחיר של $4 לקלט ו-$20 לפלט, ושאותו Artificial Analysis סימן מאז כלא נתמך עם הפניה ל-GPT-6 Sol. המודל החדש הושק ב-22 בספטמבר 2026 במחיר $2 / $10 עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128K, ותעריף מדורג: מחיר הפרסום של $2 / $10 חל עד 272,000 טוקני קלט, וכל מה שמעל לכך מחויב ב-$4 / $15.

הפרט האחרון הזה הוא המקום הראשון שבו נשבר מסגור "תמחור זהה".

שוויון המחירים נכון רק עבור פרומפטים קצרים

שני כרטיסי התעריפים מציינים $2 ו-$10, וכמעט כל השוואה של יום ההשקה נעצרה שם. העמידו את השניים זה מול זה לפי התנאים שקובעים את החשבון:

• תעריף עיקרי — Claude Sonnet 5.5 $2 / $10 לעומת GPT-6 Sol $2 / $10

• תעריף ההקשר הארוך — Sonnet 5.5 מחייב את מלוא חלון ה-1M בתעריף הסטנדרטי; GPT-6 Sol מכפיל ל-$4 / $15 מעל 272,000 טוקני קלט

• חלון הקשר — 1,000,000 טוקנים לעומת 1,050,000 טוקנים

• תפוקה מרבית — 128K טוקנים ב-API הסינכרוני עבור שניהם; ‏Sonnet 5.5 מגיע ל-300K ב-Message Batches API מאחורי output-300k-2026-03-24כותרת

• הנחת אצווה — 50% הנחה על קלט ופלט עבור Sonnet 5.5; בדקו את התנאים הנוכחיים של OpenAI עבור Sol במקום להניח שוויון

• קריאות מטמון — $0.20 למיליון בשניהם

סריקת מאגר של 800,000 טוקנים עולה פי שניים לכל טוקן ב-GPT-6 Sol לעומת Claude Sonnet 5.5, וזה בדיוק עומס העבודה ששני המודלים משווקים עבורו. אם הפרומפטים שלך קצרים, כרטיסי התעריפים באמת שקולים והמחיר לא צריך להכריע דבר. אם הם ארוכים, הוא כבר הכריע.

לוח התוצאות של Anthropic עצמה, קראו בעיון

Anthropic פרסמה השוואה בת ארבעה טורים מול Claude Sonnet 5, Claude Opus 5.5 ו-GPT-6 Sol. הנתונים שמדווח הספק, שאף צד שלישי טרם שחזר אותם:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — ‏Sonnet 5.5 ‏70.6% לעומת Sonnet 5 ‏10.3%

• FrontierCode 1.1, ראשי — Sonnet 5.5 46.2% במאמץ מקסימלי, Sonnet 5 42.4%, Opus 5.5 54.4%, GPT-6 Sol 49.3%

• CursorBench 4.0 — Sonnet 5.5 55.5% לעומת Sonnet 5 34.1% לעומת Opus 5.5 57.8%

• GDPval-AA v2.1 — Sonnet 5.5 1844 לעומת Sonnet 5 1449 לעומת Opus 5.5 1846 לעומת GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 מול Sonnet 5 1359 מול Opus 5.5 1822 מול GPT-6 Sol 1483

• המבחן האחרון של האנושות, עם כלים — Sonnet 5.5 64.5% לעומת Sonnet 5 54.9% לעומת Opus 5.5 67.7%

• OSWorld 2.1, חלקי — Sonnet 5.5 80.1% לעומת Sonnet 5 57.0% לעומת Opus 5.5 81.8%

• קרטוגרפיה, ללא כלים — Sonnet 5.5 61.6% לעומת Sonnet 5 15.6% לעומת Opus 5.5 64.4% לעומת GPT-6 Sol 53.6%

שתיים מהשורות הללו נושאות הערות שוליים ושתיהן חשובות. הנתונים של GDPval-AA, AA-Briefcase ו-Chartography עבור GPT-6 Sol מסומנים על ידי Anthropic ככאלה שנמדדו לאחר תיקון בהבנת תמונות מצד OpenAI, ומספר ה-FrontierCode של Sonnet 5.5 הוא תוצאת ה-Max-effort שלו, ש-Anthropic מציינת שנפלה מתחת לתוצאת ה-Xhigh שלה באותה הערכה. ספק המשווה את עצמו למתחרה על מדד שהוא עצמו מריץ, עם הערות שוליים שמסייגות את שני הצדדים, אינו מהווה ראיה ניטרלית. זו הראיה הטובה ביותר הזמינה ביום ההשקה, וזה אינו אותו דבר כמו מדידה.

מה אומרים המספרים העצמאיים, ומה הם לא אומרים

Artificial Analysis פרסמה הרצה עצמאית ראשונה: Index 56 על v4.3.2, עלות של $7.60 לכל משימת Index, ונתון מילוליות של 410M טוקני פלט מול חציון של 88M. מספר המילוליות הזה ראוי ליותר תשומת לב ממה שהוא מקבל. המשמעות היא שהמודל נוטה להוציא מספר רב מאוד של טוקנים בדרך לתשובה, וזה המנגנון שמאחורי טענת היעילות היחידה שלא מגיעה מהטבלה של Anthropic עצמה.

Anthropic אומרת ש-Claude Sonnet 5.5 מפיק פלט מהר יותר ב-30% מ-Claude Sonnet 5 ועולה "עד 30% פחות לכל משימה" באותו תעריף לפי טוקן. שתי הטענות האלה יחד מתארות מודל שעושה את אותה עבודה בפחות טוקנים, לא מחירון זול יותר. האם זה מחזיק מעמד — בדיוק לשם כך נועדה קריאת מילוליות של 410M טוקנים, והרצה עצמאית אחת אינה מספיקה כדי להכריע בכך — אבל היא כן מספיקה כדי לומר שהמשפט השיווקי וספירת הטוקנים שנמדדה מצביעים בכיוונים מנוגדים, וזו שנמדדה היא זו שמופיעה בחשבונית.

שימו לב גם למה שהמדד העצמאי עדיין אינו מכיל. אין שכפול מפורסם של OSWorld, Terminal-Bench או CursorBench מאף גורם מלבד Anthropic. וה-56 הוא ציון מורכב: הוא לא אומר דבר על איזו מבין עשר ההערכות שבתוכו יצרה את הפער אל מול 47 של Sol. יתרון של תשע נקודות בציון המורכב יכול להסתיר הפסד של חמש-עשרה נקודות בהערכה הבודדת שעליה תלוי עומס העבודה שלך.

היכן שהם נבדלים בדרכים שמחירון אינו יכול להציג

מחיר וציון המדד הם שני הצירים הקלים. אלה שמכריעים לגבי מיגרציה הם הצירים ההתנהגותיים, וכאן שני המודלים רחוקים זה מזה.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 מפעיל חשיבה אדפטיבית כברירת מחדל עם high כמאמץ ברירת המחדל, והוא מסיר שלושה דברים שהדור הקודם איפשר: שליחת thinking: {"type": "disabled"} מחזירה כעת 400 ויש להחליף אותה ב-between_tools; שימוש כפוי בכלים — tool_choice שמוגדר כ-"any" או כלי בשם — מחזיר 400 באופן חד-משמעי; והכלי הישן יותר computer_20251124 computer-use נדחה ב-Claude API וב-Google Cloud לטובת ערכת כלים. בלוקי חשיבה כעת גם כבולים למודל שהפיק אותם, כך ששיחה יכולה לעבור מ-Claude Sonnet 5 ל-Claude Sonnet 5.5 ולשמור על ההיגיון שלה, אך אינה יכולה לחזור אחורה איתו.

אם לולאת הסוכן שלך מגדירה tool_choice: "any" כדי לכפות קריאה תקפה לסכימה, Claude Sonnet 5.5 ידחה את הבקשה עד שתעבור ל-auto עם שימוש קפדני בכלים או פלטים מובנים. זו משימת מיגרציה אמיתית, וזה מסוג הדברים שהופכים החלפת מזהה מודל בשורה אחת לעניין של חצי יום.

עלות המעבר ל-GPT-6 Sol היא שונה במהותה, משום שהמודל שאותו הוא מחליף עדיין נמצא בקטלוג ועדיין נקרא. GPT-5.6 Sol לא הוסר; הוא מסומן כ-deprecated ב-Artificial Analysis, מתומחר בפי שניים מהמודל החדש, ועדיין מקבל תעבורה. המדידות של OrcaRouter עצמה מראות שהוא מעביר בערך 95 מיליון טוקנים בשבוע, וזה מדד עקיף סביר לכמה אינטגרציות טרם היגרו. המעבר ל-GPT-6 Sol הוא החלטת תמחור שאפשר לקבל מאוחר יותר; אין צורך לקבל אותה עכשיו.

מריץ את ההשוואה על מפתח אחד

הבעיה המעשית בהשוואה בין שני ספקים היא שהיא בדרך כלל עולה שני חשבונות, שני מסלולי SDK ושתי קבוצות של מגבלות קצב לפני שתלמד משהו. OrcaRouter נועדה לכווץ את זה: נקודת קצה אחת תואמת OpenAI, יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה ללא תוספת, ומעבר אוטומטי בין ספקים.

שני המודלים שחשובים כאן ניתנים לניתוב דרכו כבר היום. GPT-6 Sol נמצא בקטלוג במחיר $2 / $10 כששכבת ההקשר הארוך נשמרת במלואה, ו-Claude Sonnet 5 — המודל שעדיין נושא את מרבית התעבורה של Claude API, בקצב מדוד של 150 אסימוני פלט לשנייה וזמן p50 לאסימון ראשון של כחמש שניות — נמצא בפלטפורמה מאז 30 ביוני במחיר של Anthropic עצמה, $2 / $10.

Claude Sonnet 5.5 עצמו עדיין לא בקטלוג שלנו. אף שזה נכון, המסלול הישר אליו הוא ה-API של הספק ושלושת העננים ש-Anthropic מפרטת, והדרך הישרה להעריך אותו היא לכוון אותו לפרוסת תעבורה שאתה יכול להרשות לעצמך לאבד. לשם כך נועדה שכבת הניתוב: לקדם אחוז, לעקוב אחר שיעור הכשלים, ולשמור על המודל הקודם כגיבוי ולא כתוכנית חזרה לאחור.

איזה מהם עולה לפרודקשן?

בחר לפי צורת עומס העבודה ולא לפי ציון משולב.

Claude Sonnet 5.5 הוא הקנייה הטובה יותר לעבודה עם הקשר ארוך, לכל דבר שכבר נכתב מול משטח ה-tool-use וה-computer-use של Anthropic, ולצוותים שהפרומפטים שלהם עוברים באופן שגרתי רבע מיליון טוקנים — חלון התעריף האחיד שווה שם יותר מכל דלתא של מדד. קבלו שלהגירה מצורפת רשימת בדיקה: שימוש מאולץ בכלים, מתג החשיבה, זיווגי כלי היועץ, ושינוי בכלי ה-computer-use.

GPT-6 Sol הוא בחירת ההמשכיות הבטוחה יותר עבור סטאק (stack) בצורת OpenAI, והזול יותר אם הפרומפטים שלך קצרים והאינטגרציות שלך כבר בנויות. היתרון שלו אינו ביכולת — במדד המשולב הוא מפגר — אלא בכך שקודמו עדיין משרת ולהגירה אין דדליין.

לפי הנתונים הזמינים כיום, Claude Sonnet 5.5 מנצח בעימות ראש-בראש במדד העצמאי ובכלכלת ההקשר הארוך, ואינו מפסיד בשום דבר שפרסום מדידה כלשהו מסוגל עדיין לזהות מעבר לרמת הביטחון של הטבלה של הספק עצמו. זוהי טענה מצומצמת מזו שחומר ההשקה מציג, והיא זו שכדאי לפעול לפיה.

מה שישנה את התשובה הוא הרצה שנייה ובלתי תלויה בהערכות האג'נטיות, וכן נתון מפורסם של טוקנים לכל משימה עבור שני המודלים על אותן משימות. עד ששניהם יהיו קיימים, המדד המשולב הוא יתרון של תשע נקודות למודל הזול יותר להפעלה, ויתרון של תשע נקודות במדד המשולב אינו זהה ליתרון של תשע נקודות בעומס העבודה שלך.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית