
GPT-6 Sol Pro מול Claude Opus 5: סולם המאמץ שאיש לא מכניס לטבלה
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
GPT-6 Sol Pro ו-Claude Opus 5 מושווים זה לזה כל הזמן, וכמעט תמיד בהגדרה הלא נכונה. ההשוואה שמסתובבת היא בין Claude Opus 5 במאמץ ההסקה הגבוה ביותר שלו לבין GPT-6 Sol Pro במאמץ ההסקה הגבוה ביותר שלו, מה שמייצר פער של שלוש נקודות במדד הנייטרלי ופער עלות של פי חמישה. הגדירו את שני המודלים לתצורה שהספקים של עצמם מספקים כברירת מחדל — וזכרו ש"Pro" בשם הראשון הוא תצורת הסקה, לא דגם נפרד — והפער של שלוש נקודות נעלם לחלוטין. מה שנשאר הוא פער העלויות, והוא החלק היחיד בסיפור ששורד מפגש עם חשבון הפרודקשן.
אין זה תעלול של מצג. זוהי התוצאה הישירה של שני סולמות מאמץ שאינם מכוילים זה כנגד זה, שפורסמו על ידי שני ספקים שמודדים את עצמם מול הדגמים הישנים יותר של האחר.
מהם שני המודלים בעצם, לפני כל השוואה
GPT-6 Sol הוא מודל החשיבה בדרג הביניים של OpenAI, זמין באופן כללי מאז 22 בספטמבר 2026, במחיר של $2.00 למיליון טוקנים בקלט ו-$10.00 למיליון טוקנים בפלט. אין מזהה מודל gpt-6-sol-pro בתיעוד המפתחים של OpenAI — העמוד מפרט רשומת Sol אחת, חלון הקשר של 1,050,000 טוקנים, קלט מרבי של 922,000 טוקנים, תקרת פלט של 128,000 טוקנים, נקודת חיתוך ידע של 20 באפריל 2026, וסולם מאמץ החשיבה הכולל none, low, medium, high, xhigh ו-max, כאשר medium הוא ברירת המחדל. "Pro" הוא ערך של מצב החשיבה, אותה תבנית כינויים שהדור של GPT-5.6 קבע וזה ירש. רשומת קטלוג של צד שלישי בשם GPT-5.6 Sol Pro אכן קיימת, וכעת היא מציינת $2.00 ו-$10.00 — המספרים של GPT-6 Sol — מה שהוא תוצר לוואי של שמות, לא מוצר.
Claude Opus 5 הוא מודל אמיתי ומתומחר בנפרד של Anthropic, הזמין באופן כללי מאז 24 ביולי 2026 במחיר של 5.00 דולר לקלט ו-25.00 דולר לפלט למיליון טוקנים. חלון ההקשר שלו הוא 1,000,000 טוקנים, תקרת הפלט הסינכרוני שלו היא 128,000, וסולם המאמץ שלו — output_config.effort — כולל low, medium, high, xhigh ו-max, כאשר high הוא ברירת המחדל. החשיבה אדפטיבית ומופעלת כברירת מחדל — דבר ראשון מסוגו במשפחת Opus.
עובדה נוספת אחת שמעצבת את כל מה שלהלן, ושאין אף עמוד השוואה קיים שנושא אותה: טבלת מחזור החיים של Anthropic עצמה מפרטת את Claude Opus 5 כ-פעיל (מדור קודם), עם באנר הגירה שמצביע אל Claude Opus 5.5, שהגיע לזמינות כללית ב-22 בספטמבר 2026 במחיר של 4.00$ ו-20.00$. תרשימי ההשקה של OpenAI עדיין משווים בנצ'מרקים מול Opus 5, ולא מול 5.5. המודל שבהשוואה הוא ה-Opus מהדור הקודם.
שתי שורות המחיר, שורה אחר שורה
שתיהן רשימות ספקים — המספרים שפרסמו OpenAI ו-Anthropic בעצמן, המועברים הלאה ללא שינוי על ידי הפלטפורמות שמארחות אותן.
• קלט — GPT-6 Sol $2.00 למיליון טוקנים לעומת Claude Opus 5 $5.00 למיליון טוקנים
• פלט — GPT-6 Sol 10.00$ למיליון טוקנים לעומת Claude Opus 5 25.00$ למיליון טוקנים
• קריאה מהמטמון — GPT-6 Sol $0.20 למיליון טוקנים לעומת Claude Opus 5 $0.50 למיליון טוקנים; שניהם 10% קבועים מתעריף הקלט שאינו במטמון
• כתיבת מטמון — GPT-6 Sol 2.50 דולר למיליון טוקנים ב-TTL יחיד, לעומת Claude Opus 5 6.25 דולר ב-TTL של חמש דקות ו-10.00 דולר ב-TTL של שעה; ה-TTL הארוך יותר הוא אפשרות ש-OpenAI אינה מציעה, והוא הרמה שרוב טבלאות ההשוואה מצטטות בטעות, מפני שהוא זה שמופיע בכרטיסי הקטלוג המתארחים
• טיפול בהקשר ארוך — GPT-6 Sol מתמחר מחדש בקשה מעל סף הקלט שלה בתעריף גבוה יותר עבור הבקשה כולה; Claude Opus 5 אינו מחיל כלל תוספת תשלום בגין הקשר ארוך, כך שבקשה של 900,000 טוקנים מחויבת באותו תעריף לכל טוקן כמו בקשה של 9,000 טוקנים
• אצווה — ל-GPT-6 Sol יש נקודת קצה לאצווה בהנחה סטנדרטית לעומת Message Batches API של Claude Opus 5 בהנחה של 50% בשני הכיוונים, והנחת האצווה של Anthropic מצטברת עם מטמון פרומפטים
• חלון הקשר — GPT-6 Sol 1,050,000 טוקנים לעומת Claude Opus 5 1,000,000 טוקנים
• פלט מקסימלי — 128,000 טוקנים לשניהם, כאשר Claude Opus 5 מעלה זאת ל-300,000 ב-Message Batches API תחת כותרת הבטא output-300k-2026-03-24
מערך האצווה בתוספת מטמון הוא השורה הפחות נדונה ברשימה הזו, וזו שמשנה את מירב החשבון. הנחת אצווה של 50% שמשתלבת עם קריאה מהמטמון בעשירית מתעריף הקלט היא הצעה שונה מהנחת אצווה של 50% בלבד, ולמשימות סינתזה ארוכות — שבהן חלה גם תקרת פלט האצווה של 300,000 טוקנים של Anthropic — היא סוגרת חלק משמעותי מפער שנראה בלתי ניתן לגישור במחיר המחירון.

סולם המאמץ הוא ההשוואה האמיתית
הנה המספר שצריך להופיע בכל אחד מהמאמרים האלה. ב-Artificial Analysis, שההרנס שלה הוא היחיד הנייטרלי שמפרסם סולם מאמץ מלא עבור שני המודלים, Claude Opus 5 משיג 51 במאמץ מקסימלי ועולה $5.86 למשימת אינדקס. בהגדרת ברירת המחדל הגבוהה שלו הוא משיג 48 ועולה $3.61. GPT-6 Sol משיג 48 במאמץ מקסימלי ועולה $1.06 — ו-43 במאמץ גבוה תמורת $0.37.
קרא את שתי השורות האלה יחד. Claude Opus 5, כשהוא פועל בהגדרת המאמץ ש-Anthropic מספקת כברירת מחדל, מגיע בדיוק לאותו ציון אינדקס כמו GPT-6 Sol כשהוא פועל במלוא המאמץ. הפער שדיווחה עליו סיקור ההשקה — שלוש נקודות — קיים רק אם משווים כל מודל בקצה העליון של הסקאלה שלו, והקצה העליון של הסקאלה אינו המקום שבו אף אחד מהמודלים פועל כברירת מחדל. היתרון של Opus 5 במאמץ מקסימלי הוא אמיתי, וכדי להשיג אותו נדרש לשלם בערך פי חמישה וחצי יותר לכל משימה שהושלמה.
שתי הסתייגויות בעניין יושר אמורות להיות מצורפות לאותם נתונים, ושתיהן חסרות מהעמודים שמצטטים אותם.
• גרסת המדד משתנה. הציון של Opus 5 פורסם כ-61, 63, 54 ו-51 לאורך עדכונים עוקבים של מדד Artificial Analysis מאז יולי. אף אחד מהם אינו שגוי; כל אחד מהם שגוי בלי תווית הגרסה שלו. ה-51 שלמעלה הוא זה שבלוח הנוכחי, והוא אינו בר-השוואה ל-61 שצוטט ממאמר מיום ההשקה.
• סולמות מאמץ אינם מכוילים בין ספקים שונים. "גבוה" במודל אחד אינו אותה כמות חשיבה כמו "גבוה" במודל האחר. השגת ציונים זהים בהגדרות שונות לכאורה היא עדות בנוגע לעלות, ולא בנוגע לשקילות ביכולת.
במקום שבו הרשומה העצמאית דקה יותר מכפי שהיא נראית
ל-Claude Opus 5 יש שמונה שבועות של מדידה על ידי צד שלישי מאחוריו, וקבוצה של מספרי השקה שדווחו על ידי הספק, המתויגים בבירור ככאלה — Frontier-Bench v0.1 ב-43.3%, ARC-AGI-3 ב-30.2%, GDPval-AA v2 ב-1,861 Elo. כל אחד מאלה נמדד מול GPT-5.6 Sol או Claude Fable 5, לא מול GPT-6 Sol. אין בשום מקום תוצאה ממערכת בדיקה משותפת שמעמידה את Opus 5 ו-GPT-6 Sol ראש בראש על הבנצ'מרקים של Anthropic עצמה, וכרטיס המערכת של Anthropic מודה שהמודל אינו בעל יכולת כוללת גבוהה יותר מ-Claude Fable 5.
התיעוד העצמאי נושא גם הסתייגות בכיוון ההפוך. בהערכת AA-Omniscience של Artificial Analysis, שיעור ההזיות של Opus 5 הוא 50%, עלייה של ארבעה עשר נקודות לעומת Opus 4.8 — כשהסיבה המתועדת היא ששיעורי הסירוב ירדו מכ-23% ל-7%, כך שהמודל עונה על יותר שאלות וטועה ביותר מהן. Vals AI חשפה בנפרד כי Opus 5 ו-Fable 5 השתמשו ב-Opus 4.8 כגיבוי סירוב במהלך הרצות Terminal-Bench; סיווג מחדש של תשע ההצלחות המושפעות ככישלונות מזיז את Opus 5 מ-84.64% ל-81.27%. אלה אינן ממצאים פוסלים, אך כתבה שטוענת ש-Opus 5 הוא הבחירה המהימנה יותר צריכה אותם מצורפים.

הרקורד העצמאי של GPT-6 Sol הוא, השבוע, ברוחב של מספר אחד: ציון המדד שלמעלה, שנמדד במאמץ מרבי, כשיש מאחוריו שמונה עשר חודשים של השקות דגמים בבדיקות צד שלישי מצטברות. האסימטריה הזו — שמונה שבועות של בחינה מול יום אחד — היא הסיבה הכנה לכך שקונה עשוי עדיין לשלם את פרמיית פי החמישה, והיא סיבה טובה יותר מהכותרת של שלוש הנקודות.
כאשר שכבת ניתוב משנה את ההחלטה
Claude Opus 5 נמצא בקטלוג של OrcaRouter במחיר של $5.00 קלט, $25.00 פלט, $0.50 קריאת מטמון ו-$10.00 כתיבת מטמון למיליון טוקנים, עם חלון של 1,000,000 טוקנים, תקרת פלט של 128,000 טוקנים ושתי נקודות הקצה /v1/chat/completions ו-/v1/messages — תמחור מחירון של הספק מועבר ללא תוספת מעל, כך ששינוי מחיר של Anthropic פעיל אצלנו באותו יום שבו הוא פעיל אצלם. נתון כתיבת המטמון בכרטיס הדגם הוא התעריף של TTL של שעה; הדרגה של חמש דקות של Anthropic היא $6.25, וציטוט אחד בלי לציין איזה הוא איך שני המספרים נראים כמו סתירה.
GPT-6 Sol אינו אחד מהמסלולים שלנו, ולכן אין כאן שום טענה לגבי המחיר שלו דרכנו.

מה שנקודת קצה אחת בעצם קונה בעימות הזה הוא היכולת להחזיק את שתי התשובות בו-זמנית. הטיעון בעד Opus 5 והטיעון בעד Sol תלויים שניהם ב-effort, ו-effort הוא פרמטר לכל בקשה, לא חוזה. צוות שמנתב את שני המודלים מאחורי מפתח אחד עם מעבר אוטומטי לגיבוי יכול לשלוח את העבודה שזקוקה לתקרת ה-max-effort של Opus 5 אל Opus 5 ואת שכבת הנפח אל Sol ב-effort בינוני, בלי אינטגרציה שנייה או סט שני של מגבלות קצב. ה-DSL לניתוב מרכיב את ההחלטה הזו אל תוך הקריאה ולא אל תוך פרויקט הגירה — וזה חשוב כאן באופן ספציפי, כי התשובה הנכונה עבור הצמד הזה משתנה עם הבקשה, לא עם הרבעון.
כלל ההחלטה
• עבודה בנפח ברף איכות ידוע — GPT-6 Sol ברמת מאמץ בינונית או גבוהה. ארבעים נקודות מדד במחיר $0.25 למשימה מהוות את השורה הזולה והאמינה ביותר בלוח הזה, ומחוון המאמץ הוא פרמטר מתועד, לא ניחוש.
• עבודה שדורשת את החלק העליון של טווח היכולות ויכולה לשלם על כך — Claude Opus 5 ב-xhigh או max. שלוש נקודות מדד מעל התקרה של Sol, במחיר של $4.88 עד $5.86 למשימה, והיחיד מבין השניים עם תקרת פלט באצווה של 300,000 טוקנים.
• עבודות אצווה על קורפוסים גדולים — Claude Opus 5, לפי הטיעון המבני ולא לפי הטיעון לכל טוקן. ללא תוספת תשלום על הקשר ארוך, הנחת אצווה שמצטברת עם מטמון, ו-TTL של שעה למטמון עבור קידומות ששורדות חלון של חמש דקות.
כל דבר שתשובה שגויה בו עולה ביוקר — אף אחד מהשניים, לפי הנתונים הנוכחיים. שיעור ההזיות של Opus 5 עלה בארבעה־עשר נקודות בגרסה הזו, והתיעוד של Sol ממקור שלישי הוא ברוחב של מספר אחד.
• אם ההשוואה שהוצגה לך הייתה "Opus 5 max מול Sol max" — הרץ אותה מחדש במאמץ ברירת מחדל לפני שתחליט. שם ההחלטה למעשה מתקבלת, וזו התצורה היחידה שהכיסוי הקיים אף פעם לא מראה לך.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
