
Claude Opus 5.5 מול Grok 4.6: מודל אחד קורא, האחר פועל
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Claude Opus 5.5 וGrok 4.6 הן שתי הדרכים הזולות ביותר לקנות מודל ברמת החזית שיחזיק חצי מיליון טוקנים של הקשר — והן לא אותו מוצר. במדידה אחת Grok 4.6 נמצא שלוש נקודות מתחת לתקרה המוחלטת: 94.9 ב-GPQA Diamond, סט שאלות מדעי ברמת תואר שני שבו ספינת הדגל של Anthropic נמצאת באותה רצועה. במדידה הבאה הוא מפגר בשלושים ושמונה נקודות. ב-Terminal-Bench 4.0, מבחן הטרמינל הסוכני שמבקש ממודל להשלים עבודה אמיתית במעטפת, Artificial Analysis העניקה ל-Grok 4.6 ציון של 21.21% ול-Claude Opus 5.5 ציון של 59.60%. זו לא טעות דפוס באף אחד מהכיוונים, וכל הצורה של הזיווג הזה טמונה בהסבר מדוע שני המספרים נכונים בו-זמנית.
שתי מהדורות, אותה קטגוריית מחיר, בהפרש של ארבעה חודשים
SpaceXAI השיקה את Grok 4.6 ב-12 באוגוסט 2026 כספינת הדגל הנוכחית של קו Grok, במחיר של $2.00 למיליון טוקני קלט ו-$6.00 פלט, עם חלון הקשר של 500,000 טוקנים ומשטח קלט של טקסט, תמונה וקבצים. Anthropic השיקה את Claude Opus 5.5 ב-22 בספטמבר 2026, כשישה שבועות לאחר מכן, במחיר $4.00/$20.00 עם חלון הקשר של 1,000,000 טוקנים ו-128,000 טוקני פלט. שתיהן תומכות במאמץ חשיבה ניתן להגדרה, בקריאה לכלים ובפלטים מובנים; שתיהן מדברות במשטח צ'אט תואם OpenAI, כמו גם בפורמט של הספק שלהן.
אז הקריאה הנאיבית היא עסקה נקייה: Grok 4.6 הוא חצי מהמחיר על קלט וכשליש בערך על פלט, ו-Claude Opus 5.5 עונה עם חלון הקשר כפול. העסקה הזו אמיתית, ובעבודה על מסמכים ארוכים ייתכן שהיא הדבר היחיד שחשוב. היא גם לא המקום שבו נמצא הפער המעניין, מפני ששני המודלים נמדדו על אותה ערכת בדיקה בלתי תלויה ולא נחתו באותו מקום על הצירים שחשובים לעבודה סוכנית.
מה שהקטלוג אומר על הצירים ששניהם נמדדו עליהם
הקטלוג של OrcaRouter כולל מקור תוצאות בנצ'מרק לכל שורה — כל נתון מציין את המעריך שממנו הגיע — כך שהזוגות שלהלן כולם ממקור אחד בשני המודלים, Artificial Analysis, ולא נתון של ספק בצד אחד ושל צד שלישי בצד השני:
• GPQA Diamond — Claude Opus 5.5 אינו מופיע בציר זה בקטלוג שלנו; Grok 4.6 משיג 94.9%
• המבחן האחרון של האנושות — 61.4% עבור Claude Opus 5.5 לעומת 42.9% עבור Grok 4.6
• SciCode — 66.9% לעומת 56.5%
• שליפה בהקשר ארוך — 84.7% לעומת 80.3%
• Terminal-Bench 4.0 — 59.60% לעומת 21.21%
• AA Intelligence Index — 57.6 לעומת 44.3
שורת GPQA נותרה במכוון ריקה בצד של Anthropic במקום להיות מלאה ממצגת של ספק. ה-94.9 של Grok 4.6 שם הוא המספר החזק ביותר בכרטיס שלו, והוא אמיתי — מדידה בלתי תלויה, לא טענה של SpaceXAI — והוא אומר משהו אמיתי על המודל: כשהמשימה היא שאלה מנוסחת היטב עם תשובה אחת שאפשר להגן עליה, Grok 4.6 מתפקד בחזית. קראו אותו לצד 21.21% של Terminal-Bench 4.0 והצורה הופכת לקריאה. לייצר תשובה נכונה בנושא מדע ולהוציא לפועל משימה בת חמישה שלבים ב-shell מול מערכת קבצים אמיתית הם כישורים שונים, ו-Grok 4.6 נמצא הרבה יותר קדימה ביכולת הראשונה מאשר בשנייה.
הסתייגות אחת לגבי ההשוואה הזו לפני שהיא משמשת כהכרעה: הנתונים של Artificial Analysis של שני המודלים נרשמו בתאריכי הערכה שונים, והנתונים של Grok 4.6 הם הסט הישן יותר. ההשוואה היא בין מודל שהוערך באוגוסט למודל שהוערך בספטמבר על גבי מערכת בדיקה שעברה בעצמה עדכון במהלך אותו חלון זמן. כיוון הפער עקבי בחמישה צירים נפרדים, ולכן אנו מתייחסים אליו כאות, אבל ערכי הנקודות המדויקים צריכים להיקרא כהשוואה בין אוגוסט לספטמבר, ולא כהשוואה באותו יום.
מדד שנבנה על ידי מישהו שגם לא מוכר
קיימת מדידה עצמאית שנייה, והיא מסכימה על הכיוון אך הרבה פחות מוכנה לעשות הבחנות עדינות. ה-Epoch Capabilities Index, שנבנה על ידי Epoch AI כמורכב מיותר מחמישים בנצ'מרקים ומכויל מחדש כך ש-Claude 3.5 Sonnet נמצא ב-130 ו-GPT-5 ב-150, מציב את Claude Opus 5.5 ב-167.35 בקובץ שקראנו ב-2 באוקטובר 2026. Grok 4.6 נמצא ב-156.61, מהערכה מ-12 באוגוסט. זהו פער של 10.74 נקודות בסולם שבו נצפה שכחמש נקודות מתאימות להכפלה של מדד אופק הזמן של METR בעת השקת המדד — רחב, ובנוחות מחוץ לטווחים המפורסמים של שני המודלים, 164.0 עד 172.0 ו-154.66 עד 158.93, שאינם חופפים כלל.
כדאי לציין מה המדד הזה לא מכריע. הוא מציב את Claude Sonnet 5.5 ב-165.2 ואת Claude Fable 5.1 ב-164.82, שניהם מעל Grok 4.6, ושניהם זולים יותר לכל מיליון טוקני פלט מאשר התעריף מהדרג השני של Grok 4.6. לכל מי שבוחר לפי יכולת-לכל-דולר בלבד יש אפשרות שלישית ורביעית באותה משפחת ספקים, וההשוואה במאמר הזה עוסקת במשהו אחר: במה כל אחד משני המודלים טוב.
כרטיסי התעריפים, והשורה שמופיעה רק באחד מהם

במחירון של Grok 4.6 קיימת מדרגה שאינה קיימת במחירון של Claude Opus 5.5: בקשות מעל 200,000 טוקנים מחויבות בכפול מהתעריף הבסיסי, כך שהקלט עולה מ-$2.00 ל-$4.00 והפלט מ-$6.00 ל-$12.00, וקריאת המטמון מ-$0.50 ל-$1.00. Claude Opus 5.5 גובה $4.00/$20.00, עם קריאות מטמון של $0.20, באופן אחיד לאורך כל חלון 1,000,000 הטוקנים. ההיפוך הזה הוא התוצאה המעשית של רכישת הקשר ארוך מאחד מהמודלים, והוא הופך את המחיר המוצג ברגע שעומס העבודה באמת גדל:
• מחיר ב-30,000 טוקני קלט — Claude Opus 5.5 הוא היקר, בערך 28 סנט עבור 30,000 בקלט ו-8,000 בפלט, לעומת כ-11 סנט עבור Grok 4.6
• מחיר ב-250,000 טוקני קלט — הסדר מתהפך, כי Grok 4.6 עבר לרמה המוכפלת שלו בעוד ש-Claude Opus 5.5 לא עשה זאת
• קריאות מטמון — $0.20 למיליון עבור Claude Opus 5.5 לעומת $0.50, ועולה ל-$1.00 מעל המדרגה, עבור Grok 4.6
• פלט מקסימלי — 128,000 טוקנים עבור Claude Opus 5.5; תקרת הפלט של Grok 4.6 אינה מפורסמת ברשומת הקטלוג
ל-Grok 4.6 יש גם פער אחד שראוי להצהיר עליו בגלוי במקום להשאירו להתגלות מאוחר יותר. ברשומה שלו אין כלל נתון של פלט מקסימלי — השדה אינו מדוד, לא אפס — ולכן לעומס עבודה שתלוי בתשובות בודדות ארוכות במיוחד אין מספר מפורסם לתכנן לפיו באותו צד של ההשוואה.
עמודת הביצועים שאסור לקרוא
הקטלוג שלנו כולל גם פאנל ביצועי הגשה לכל מודל, ועל Grok 4.6 הוא הדבר המטעה ביותר בעמוד. הכרטיס מציג השהיית p50 של 10,000 אלפיות שנייה ושיעור שגיאות של 97.58% על פני חלון של שבעה ימים, עם 26,184 טוקנים שהוגשו בתקופה זו. השדות האלה לא מתארים מודל איטי. הם מתארים מודל שכמעט לא נקרא: ברמת תעבורה כזו המדגם דק מדי מכדי שלתפלגות השהיה תהיה משמעות, ושיעור השגיאות משקף קומץ ניסיונות ולא איכות שירות. לראות בבלוק הזה ראיה לכך ש-Grok 4.6 איטי זה לקרוא ארטיפקט מדידה כמדידה.
הפאנל של Claude Opus 5.5, לעומת זאת, מגובה באוכלוסייה של ממש — p50 בטווח של 4.4 שניות על פני חלון של שבעה ימים עם דגימות יומיות, ו-156 מיליון טוקנים שהוגשו באותה תקופה. אולם גם את זה יש לקרוא כפי שהוא: תעבורת ה-Playground שלנו, שהיא מדגם של המשתמשים שלנו ולא תכונה של המודל.
איזה מהם לנתב, ואיך לגלות זאת בעבודה שלך בעצמך
הפיצול שהמספרים מתארים יציב מספיק כדי לפעול לפיו. Claude Opus 5.5 הוא הבחירה לעבודה סוכנית וארוכת טווח — הפער ב-Terminal-Bench 4.0 של 59.60% לעומת 21.21% הוא ההפרדה הגדולה ביותר בכל ציר שעליו נמדדו שני המודלים, והוא הציר שמנבא אם אפשר למסור למודל משימה ולא שאלה. הוא גם הבחירה כשהפרומפט ארוך באמת, מפני שכרטיס התעריפים אינו עולה מדרגה והחלון גדול פי שניים. Grok 4.6 הוא הבחירה לעבודה שאלתית בהיקף גדול: ציון של 94.9% ב-GPQA Diamond במחיר $2.00/$6.00 בתוך 200,000 הטוקנים הראשונים הוא עסקה טובה מאוד לעומסי עבודה של אחזור ומענה שלעולם אינם גדלים לדרגה המוכפלת.
שניהם זמינים ב-OrcaRouter במחיר המחירון של הספק עם 0% תוספת — Claude Opus 5.5 במחיר $4.00/$20.00 עם קריאות מטמון ב-$0.20, Grok 4.6 במחיר $2.00/$6.00 כשמדרגת מעל 200K מיושמת בדיוק כפי ש-SpaceXAI קובעת — מאחורי מפתח אחד, כך שאפשר לבדוק את הפיצול שלמעלה על סט הפרומפטים שלך במקום להתווכח עליו. כששניהם מנותבים, מעבר כשל אוטומטי נמצא מתחת, וזה שווה כשלמודל הזול הוא זה שמחזיק את המסלול האייג'נטי.
המסקנה שמגיעה לצימוד הזה: Grok 4.6 הוא הקורא הטוב יותר, ו-Claude Opus 5.5 הוא העובד הטוב יותר. ה-94.9 ב-GPQA Diamond וה-21.21 ב-Terminal-Bench הם אותו מודל שנמדד פעמיים, ולדעת לאיזה משני המספרים הללו דומה עומס העבודה שלך — זו כל ההחלטה.


השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
