
Claude Sonnet 5.5 מול GPT-6 Sol: בדרגת ה-2$ יש כעת שני דגלי דגל
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 984 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
Claude Sonnet 5.5 ו-GPT-6 Sol מתומחרים באופן זהה — 2$ למיליון טוקנים בקלט, 10$ למיליון טוקנים בפלט — והם הגיעו בהפרש של שישה ימים בסוף ספטמבר 2026. הצירוף מקרים הזה הוא לא החלק המעניין. החלק המעניין הוא שכאשר Artificial Analysis מדדה את שניהם במדד האינטליגנציה v4.3.2 שלה, המודל הבינוני של Anthropic הקדים את המודל ש-OpenAI מוכרת כמודל הדגל שלה: 56 עבור Claude Sonnet 5.5 לעומת 47 עבור GPT-6 Sol. באותה גרסה, Claude Sonnet 5 — המודל ש-Sonnet 5.5 מחליף — נמצא ב-38.
אז זה כבר לא השוואה בין דרג זול לדרג יקר. זו השוואה בין שני מודלים באותו מחיר, משתי מעבדות, עם פער של 18 נקודות בין זה של Anthropic לבין קודמו, ופער של תשע נקודות לטובת Anthropic מול הגרסה הבכירה של OpenAI. כל מה שלהלן הוא ניסיון להבין איזה מהפערים האלה שורד מפגש עם עומס עבודה אמיתי, ואיזה מהם הוא ארטיפקט של בנצ'מרק.
מה כל מודל הוא בפועל
Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של Anthropic, שיצא ב-28 בספטמבר 2026, חמישה ימים לאחר ההשקה של Claude Opus 5.5 שהבטיחה אותו. הוא נושא את המזהה claude-sonnet-5-5 ב-Claude API, ב-Amazon Bedrock, ב-Google Cloud וב-Microsoft Foundry, שומר על חלון ההקשר של 1M טוקנים ועל תקרת הפלט של 128K של השכבה, ומשאיר את המחירים של Claude Sonnet 5 בדיוק כפי שהם: 2$ לקלט, 10$ לפלט, 0.20$ למיליון עבור קריאות מהמטמון, 2.50$ עבור כתיבה למטמון של חמש דקות. הוא זמין עם אפס שמירת נתונים מהיום הראשון, והתחייבות הפרישה של Anthropic תקפה עד 28 בספטמבר 2027.

GPT-6 Sol הוא היורש של המודל שנקרא באופן מבלבל GPT-5.6 Sol — זה ש-OrcaRouter עדיין מפרט כנגיש במחיר של $4 לקלט ו-$20 לפלט, ושאותו Artificial Analysis סימן מאז כלא נתמך עם הפניה ל-GPT-6 Sol. המודל החדש הושק ב-22 בספטמבר 2026 במחיר $2 / $10 עם חלון הקשר של 1,050,000 טוקנים, תקרת פלט של 128K, ותעריף מדורג: מחיר הפרסום של $2 / $10 חל עד 272,000 טוקני קלט, וכל מה שמעל לכך מחויב ב-$4 / $15.
הפרט האחרון הזה הוא המקום הראשון שבו נשבר מסגור "תמחור זהה".
שוויון המחירים נכון רק עבור פרומפטים קצרים
שני כרטיסי התעריפים מציינים $2 ו-$10, וכמעט כל השוואה של יום ההשקה נעצרה שם. העמידו את השניים זה מול זה לפי התנאים שקובעים את החשבון:
• תעריף עיקרי — Claude Sonnet 5.5 $2 / $10 לעומת GPT-6 Sol $2 / $10
• תעריף ההקשר הארוך — Sonnet 5.5 מחייב את מלוא חלון ה-1M בתעריף הסטנדרטי; GPT-6 Sol מכפיל ל-$4 / $15 מעל 272,000 טוקני קלט
• חלון הקשר — 1,000,000 טוקנים לעומת 1,050,000 טוקנים
• תפוקה מרבית — 128K טוקנים ב-API הסינכרוני עבור שניהם; Sonnet 5.5 מגיע ל-300K ב-Message Batches API מאחורי output-300k-2026-03-24כותרת
• הנחת אצווה — 50% הנחה על קלט ופלט עבור Sonnet 5.5; בדקו את התנאים הנוכחיים של OpenAI עבור Sol במקום להניח שוויון
• קריאות מטמון — $0.20 למיליון בשניהם
סריקת מאגר של 800,000 טוקנים עולה פי שניים לכל טוקן ב-GPT-6 Sol לעומת Claude Sonnet 5.5, וזה בדיוק עומס העבודה ששני המודלים משווקים עבורו. אם הפרומפטים שלך קצרים, כרטיסי התעריפים באמת שקולים והמחיר לא צריך להכריע דבר. אם הם ארוכים, הוא כבר הכריע.
לוח התוצאות של Anthropic עצמה, קראו בעיון
Anthropic פרסמה השוואה בת ארבעה טורים מול Claude Sonnet 5, Claude Opus 5.5 ו-GPT-6 Sol. הנתונים שמדווח הספק, שאף צד שלישי טרם שחזר אותם:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% לעומת Sonnet 5 10.3%
• FrontierCode 1.1, ראשי — Sonnet 5.5 46.2% במאמץ מקסימלי, Sonnet 5 42.4%, Opus 5.5 54.4%, GPT-6 Sol 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% לעומת Sonnet 5 34.1% לעומת Opus 5.5 57.8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 לעומת Sonnet 5 1449 לעומת Opus 5.5 1846 לעומת GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 מול Sonnet 5 1359 מול Opus 5.5 1822 מול GPT-6 Sol 1483
• המבחן האחרון של האנושות, עם כלים — Sonnet 5.5 64.5% לעומת Sonnet 5 54.9% לעומת Opus 5.5 67.7%
• OSWorld 2.1, חלקי — Sonnet 5.5 80.1% לעומת Sonnet 5 57.0% לעומת Opus 5.5 81.8%
• קרטוגרפיה, ללא כלים — Sonnet 5.5 61.6% לעומת Sonnet 5 15.6% לעומת Opus 5.5 64.4% לעומת GPT-6 Sol 53.6%
שתיים מהשורות הללו נושאות הערות שוליים ושתיהן חשובות. הנתונים של GDPval-AA, AA-Briefcase ו-Chartography עבור GPT-6 Sol מסומנים על ידי Anthropic ככאלה שנמדדו לאחר תיקון בהבנת תמונות מצד OpenAI, ומספר ה-FrontierCode של Sonnet 5.5 הוא תוצאת ה-Max-effort שלו, ש-Anthropic מציינת שנפלה מתחת לתוצאת ה-Xhigh שלה באותה הערכה. ספק המשווה את עצמו למתחרה על מדד שהוא עצמו מריץ, עם הערות שוליים שמסייגות את שני הצדדים, אינו מהווה ראיה ניטרלית. זו הראיה הטובה ביותר הזמינה ביום ההשקה, וזה אינו אותו דבר כמו מדידה.
מה אומרים המספרים העצמאיים, ומה הם לא אומרים
Artificial Analysis פרסמה הרצה עצמאית ראשונה: Index 56 על v4.3.2, עלות של $7.60 לכל משימת Index, ונתון מילוליות של 410M טוקני פלט מול חציון של 88M. מספר המילוליות הזה ראוי ליותר תשומת לב ממה שהוא מקבל. המשמעות היא שהמודל נוטה להוציא מספר רב מאוד של טוקנים בדרך לתשובה, וזה המנגנון שמאחורי טענת היעילות היחידה שלא מגיעה מהטבלה של Anthropic עצמה.
Anthropic אומרת ש-Claude Sonnet 5.5 מפיק פלט מהר יותר ב-30% מ-Claude Sonnet 5 ועולה "עד 30% פחות לכל משימה" באותו תעריף לפי טוקן. שתי הטענות האלה יחד מתארות מודל שעושה את אותה עבודה בפחות טוקנים, לא מחירון זול יותר. האם זה מחזיק מעמד — בדיוק לשם כך נועדה קריאת מילוליות של 410M טוקנים, והרצה עצמאית אחת אינה מספיקה כדי להכריע בכך — אבל היא כן מספיקה כדי לומר שהמשפט השיווקי וספירת הטוקנים שנמדדה מצביעים בכיוונים מנוגדים, וזו שנמדדה היא זו שמופיעה בחשבונית.
שימו לב גם למה שהמדד העצמאי עדיין אינו מכיל. אין שכפול מפורסם של OSWorld, Terminal-Bench או CursorBench מאף גורם מלבד Anthropic. וה-56 הוא ציון מורכב: הוא לא אומר דבר על איזו מבין עשר ההערכות שבתוכו יצרה את הפער אל מול 47 של Sol. יתרון של תשע נקודות בציון המורכב יכול להסתיר הפסד של חמש-עשרה נקודות בהערכה הבודדת שעליה תלוי עומס העבודה שלך.
היכן שהם נבדלים בדרכים שמחירון אינו יכול להציג
מחיר וציון המדד הם שני הצירים הקלים. אלה שמכריעים לגבי מיגרציה הם הצירים ההתנהגותיים, וכאן שני המודלים רחוקים זה מזה.

Claude Sonnet 5.5 מפעיל חשיבה אדפטיבית כברירת מחדל עם high כמאמץ ברירת המחדל, והוא מסיר שלושה דברים שהדור הקודם איפשר: שליחת thinking: {"type": "disabled"} מחזירה כעת 400 ויש להחליף אותה ב-between_tools; שימוש כפוי בכלים — tool_choice שמוגדר כ-"any" או כלי בשם — מחזיר 400 באופן חד-משמעי; והכלי הישן יותר computer_20251124 computer-use נדחה ב-Claude API וב-Google Cloud לטובת ערכת כלים. בלוקי חשיבה כעת גם כבולים למודל שהפיק אותם, כך ששיחה יכולה לעבור מ-Claude Sonnet 5 ל-Claude Sonnet 5.5 ולשמור על ההיגיון שלה, אך אינה יכולה לחזור אחורה איתו.
אם לולאת הסוכן שלך מגדירה tool_choice: "any" כדי לכפות קריאה תקפה לסכימה, Claude Sonnet 5.5 ידחה את הבקשה עד שתעבור ל-auto עם שימוש קפדני בכלים או פלטים מובנים. זו משימת מיגרציה אמיתית, וזה מסוג הדברים שהופכים החלפת מזהה מודל בשורה אחת לעניין של חצי יום.
עלות המעבר ל-GPT-6 Sol היא שונה במהותה, משום שהמודל שאותו הוא מחליף עדיין נמצא בקטלוג ועדיין נקרא. GPT-5.6 Sol לא הוסר; הוא מסומן כ-deprecated ב-Artificial Analysis, מתומחר בפי שניים מהמודל החדש, ועדיין מקבל תעבורה. המדידות של OrcaRouter עצמה מראות שהוא מעביר בערך 95 מיליון טוקנים בשבוע, וזה מדד עקיף סביר לכמה אינטגרציות טרם היגרו. המעבר ל-GPT-6 Sol הוא החלטת תמחור שאפשר לקבל מאוחר יותר; אין צורך לקבל אותה עכשיו.
מריץ את ההשוואה על מפתח אחד
הבעיה המעשית בהשוואה בין שני ספקים היא שהיא בדרך כלל עולה שני חשבונות, שני מסלולי SDK ושתי קבוצות של מגבלות קצב לפני שתלמד משהו. OrcaRouter נועדה לכווץ את זה: נקודת קצה אחת תואמת OpenAI, יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה ללא תוספת, ומעבר אוטומטי בין ספקים.
שני המודלים שחשובים כאן ניתנים לניתוב דרכו כבר היום. GPT-6 Sol נמצא בקטלוג במחיר $2 / $10 כששכבת ההקשר הארוך נשמרת במלואה, ו-Claude Sonnet 5 — המודל שעדיין נושא את מרבית התעבורה של Claude API, בקצב מדוד של 150 אסימוני פלט לשנייה וזמן p50 לאסימון ראשון של כחמש שניות — נמצא בפלטפורמה מאז 30 ביוני במחיר של Anthropic עצמה, $2 / $10.
Claude Sonnet 5.5 עצמו עדיין לא בקטלוג שלנו. אף שזה נכון, המסלול הישר אליו הוא ה-API של הספק ושלושת העננים ש-Anthropic מפרטת, והדרך הישרה להעריך אותו היא לכוון אותו לפרוסת תעבורה שאתה יכול להרשות לעצמך לאבד. לשם כך נועדה שכבת הניתוב: לקדם אחוז, לעקוב אחר שיעור הכשלים, ולשמור על המודל הקודם כגיבוי ולא כתוכנית חזרה לאחור.
איזה מהם עולה לפרודקשן?
בחר לפי צורת עומס העבודה ולא לפי ציון משולב.
Claude Sonnet 5.5 הוא הקנייה הטובה יותר לעבודה עם הקשר ארוך, לכל דבר שכבר נכתב מול משטח ה-tool-use וה-computer-use של Anthropic, ולצוותים שהפרומפטים שלהם עוברים באופן שגרתי רבע מיליון טוקנים — חלון התעריף האחיד שווה שם יותר מכל דלתא של מדד. קבלו שלהגירה מצורפת רשימת בדיקה: שימוש מאולץ בכלים, מתג החשיבה, זיווגי כלי היועץ, ושינוי בכלי ה-computer-use.
GPT-6 Sol הוא בחירת ההמשכיות הבטוחה יותר עבור סטאק (stack) בצורת OpenAI, והזול יותר אם הפרומפטים שלך קצרים והאינטגרציות שלך כבר בנויות. היתרון שלו אינו ביכולת — במדד המשולב הוא מפגר — אלא בכך שקודמו עדיין משרת ולהגירה אין דדליין.
לפי הנתונים הזמינים כיום, Claude Sonnet 5.5 מנצח בעימות ראש-בראש במדד העצמאי ובכלכלת ההקשר הארוך, ואינו מפסיד בשום דבר שפרסום מדידה כלשהו מסוגל עדיין לזהות מעבר לרמת הביטחון של הטבלה של הספק עצמו. זוהי טענה מצומצמת מזו שחומר ההשקה מציג, והיא זו שכדאי לפעול לפיה.
מה שישנה את התשובה הוא הרצה שנייה ובלתי תלויה בהערכות האג'נטיות, וכן נתון מפורסם של טוקנים לכל משימה עבור שני המודלים על אותן משימות. עד ששניהם יהיו קיימים, המדד המשולב הוא יתרון של תשע נקודות למודל הזול יותר להפעלה, ויתרון של תשע נקודות במדד המשולב אינו זהה ליתרון של תשע נקודות בעומס העבודה שלך.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
