
GPT-6 Sol Pro לעומת Grok 4.7: פי שניים מילוליות, שליש מהמחיר
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 986 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 196 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
שני המודלים הזולים ביותר מבין הסמוכים לחזית של ספטמבר 2026 הושקו בהפרש של יום אחד, והדבר המעניין בהם אינו איזה מהם חכם יותר. GPT-6 Sol — המודל שאנשים פונים אליו כשהם מחפשים GPT-6 Sol Pro, שהוא אותו מודל עם reasoning.mode מוגדר ל-pro ולא כמוצר נפרד — הושק ב-22 בספטמבר 2026 במחיר של $2.00 למיליון טוקני קלט ו-$10.00 למיליון טוקני פלט. Grok 4.7 של היצרן הושק ב-21 בספטמבר באותו מחיר של $2.00 לקלט, ו-$6.00 לפלט. על ההרנס הנייטרלי של Artificial Analysis השניים נמצאים במרחק של שתי נקודות אינדקס ובערך שני דולרים למשימה שהושלמה, והסיבה לפער הזה אינה היכולת. היא מספר הטוקנים שכל אחד מהם שורף כדי להגיע לשם.
Sol ייצר 77 מיליון טוקני פלט בהרצת Intelligence Index. Grok 4.7 ייצר 240 מיליון. היחס הזה — קצת יותר משלושה לאחד — הוא כל ההשוואה, והוא הופך על פניה את המסקנה שטבלת מחיר לכל טוקן נותנת לך.
שני כרטיסי התעריפים, ואיפה שהזול אינו זול
שני הספקים מפרסמים את המספרים האלה בעצמם; אף אחד מהם לא תומחר מחדש באופן עצמאי.
• קלט — GPT-6 Sol $2.00 למיליון טוקנים לעומת Grok 4.7 $2.00 למיליון טוקנים
• פלט — GPT-6 Sol $10.00 למיליון טוקנים לעומת Grok 4.7 $6.00 למיליון טוקנים
• קלט במטמון — GPT-6 Sol $0.20 למיליון טוקנים לעומת Grok 4.7 $0.50 למיליון טוקנים; קריאה מהמטמון של Sol זולה פי שניים וחצי, וזה ההפך ממה שמרמז תעריף הפלט הכותרתי
• חלון הקשר — GPT-6 Sol 1,050,000 טוקנים לעומת Grok 4.7 500,000 טוקנים
• תוספת עבור הקשר ארוך — GPT-6 Sol מתמחרת מחדש בקשה מעל 272,000 אסימוני קלט בתעריפים של פי 2 לקלט ולמטמון ופי 1.5 לפלט עבור הבקשה כולה, לעומת Grok 4.7 שמכפילה כל תעריף ב-200,000 אסימוני קלט, גם עבור הבקשה כולה
• מועד חיתוך הידע — GPT-6 Sol, 20 באפריל 2026 לעומת Grok 4.7, שמועד חיתוך האימון המקדים שלו דווח כיוני 2026 עם אימון משלים עד אוגוסט
• מאמץ חשיבה — GPT-6 Sol: ללא, נמוך, בינוני (ברירת מחדל), גבוה, גבוה במיוחד, מקסימלי לעומת Grok 4.7: נמוך, בינוני (ברירת מחדל), גבוה, גבוה במיוחד
• מודאליות — שניהם מקבלים קלט טקסט ותמונה ומחזירים טקסט
שורת קריאת המטמון היא זו שעל קונה להתעכב עליה. קצב הפלט של Grok 4.7 נמוך ב-40%, אבל הקלט המטמון שלו גבוה ב-150%, וקלט מטמון הוא המקום שבו שוכנים היסטוריות סוכנים ארוכות והנחיות מערכת חוזרות. עומס עבודה שרובו קריאה חוזרת של הקשר גדול ויציב ימצא את שני המודלים קרובים בהרבה ממה שמשתמע מ-$6 מול $10.

הרשומה העצמאית, והמספר האחד שמכריע אותה
Artificial Analysis הוא הגוף היחיד שמדד את שני המודלים, וכדאי להציג את המספרים שלו זה לצד זה, משום שהפער ביניהם מלמד.
• מדד האינטליגנציה — GPT-6 Sol 48 במאמץ מקסימלי לעומת Grok 4.7 46 ב-xhigh; שניהם הרבה מעל החציון של 25 בקרב מודלים דומים
• עלות לכל משימת אינדקס — GPT-6 Sol $1.06 לעומת Grok 4.7 $3.74
• אסימוני פלט עבור הרצת האינדקס — GPT-6 Sol 77M מול Grok 4.7 240M, לעומת חציון של 88M
• מהירות פלט — Grok 4.7 נמדד ב־39 טוקנים לשנייה, שאותה ההרנס עצמו מתייג כאיטית במיוחד; הנתון של Sol על אותו לוח אינו מפורסם באותה שורת סיכום
• מדד סוכני הקידוד — GPT-6 Sol 57 במחיר 2.99 דולר למשימה לעומת Grok 4.7 56 עם רנס מבית בשם Grok Build שלו, עלייה של תשע נקודות מ-Grok 4.6
הפרש של שתי נקודות במדד, פי שלושה וחצי מהעלות לכל משימה. זו אינה אנומליית תמחור — זו האריתמטיקה של הרברבנות. Grok 4.7 הוא מודל שחושב בקול רם ובאריכות; מערכת ההערכה מסמנת אותו כ"רברבני מאוד" לעומת חציון של 88 מיליון טוקנים, והעלות עוקבת אחרי הטוקנים, לא אחרי המחירון.
השוואת סוכני הקוד טומנת בחובה הסתייגות שלוח התוצאות מסתיר. ה-56 של Grok 4.7 נמדד בתוך הארנס של Grok Build של xAI עצמה, שהיא התצורה ש-xAI מפיצה ומולה היא מריצה בנצ'מרקים. ה-57 של Sol נמדד בארנס ניטרלי. יתרון של נקודה או שתיים בגלל ארנס של צד ראשון הוא בהחלט בתוך הטווח שבחירת הארנס מסבירה, כלומר הקריאה הכנה היא ששני אלה שווים בקידוד סוכני — ולא ש-Sol מוביל בנקודה אחת.

מה שכל ספק טוען, ומה שאף אחד מהשניים לא הראה
חומר ההשקה של xAI הוא ספציפי וזהו סיפור ארוך טווח: Grok 4.7 בנוי על מודל בסיס גדול יותר מ-Grok 4.6 וקיבל ריצת למידת חיזוק ארוכה יותר שמכוונת למשימות ש"יכולות לקחת שעות להשלים", ומחדדת אימות עצמי, טיפול בהקשר ארוך והתנהגות בתוך סביבת Grok Bot. המספרים שדווחו על ידי הספק כוללים Terminal-Bench 4.0 ב-38.0% לעומת 20.3% של Grok 4.6, CursorBench 4.0 ב-46.3%, ו-DeepSWE v1.1 ב-71.0%. כל אחד מאלה הוא מדידה של xAI עצמה ואף אחד לא שוחזר באופן בלתי תלוי; נתון Terminal-Bench 4.0 הבלתי תלוי שמסתובב נמוך באופן מהותי מזה של הספק, שזו הצורה הרגילה של הפער הזה.
הטענות של OpenAI לגבי GPT-6 Sol הן אלו שכבר נדונו לעיל, והן נושאות את אותה תווית. הנתונים שדווחו על ידי הספק הם 33.2% ב-AutomationBench ברמת מאמץ xhigh לעומת 26.9% של Claude Opus 5 ברמת מאמץ max, בערך 9% מהעלות לכל משימה, ו-68.8% ב-DeepSWE v1.1 ברמת מאמץ max — בתוך 1.1 נקודות מ-Claude Fable 5 ברמת xhigh, בעלות נמוכה בכ-80% לכל משימה. שימו לב ליעד ההשוואה: התרשימים של OpenAI עצמה מציבים את Sol מול המודלים של Anthropic, ולא מול Grok 4.7. אף אחד מהספקים לא פרסם השוואה ראש בראש מול האחר.

היכן שכבת הניתוב מצדיקה את מקומה
OrcaRouter אינה מספקת אף אחד מהמודלים בהתמודדות הזו — גם Grok 4.7 וגם GPT-6 Sol נעדרים מהקטלוג שלנו, כך ששום דבר כאן אינו טענה לגבי המחיר שלהם דרכנו. מה ששכבת ניתוב שווה בהתאמה הספציפית הזו הוא אופן הכשל ולא כרטיס התעריפים. הסיבה להושיט יד אל Grok 4.7 היא ההתנהגות הסוכנית שלו לטווח ארוך; הסיבה שלא להושיט יד אליו היא שמהירות פלט של 39 טוקנים לשנייה הופכת ריצת סוכן ארוכה לאיטית מספיק כדי שזה יהיה משמעותי, וריצה איטית היא ריצה שעלולה לפקוע בזמן.מעבר אוטומטי בין ספקים פירושו שמשימה ארוכה יכולה לנותב אל המודל שבאמת זמין בלי שהמהירות הזו תהפוך לנקודת כשל יחידה, ושפת ה-DSL לניתוב מבטאת את בחירת המודל כחוק בתוך הקריאה ולא כהגירה — וזה חשוב כאן, כי התשובה הנכונה עבור הצמד הזה תלויה בשאלה אם המשימה עתירת טוקנים או רגישה להשהיה, וזו תכונה של הבקשה, לא של הרבעון.
כלל ההחלטה
• קידוד אג'נטי בתקציב קבוע — GPT-6 Sol. רמת יכולת במדד הקידוד הנייטרלי, בערך בשליש מהעלות לכל משימה, כי הוא מגיע לשם עם שליש מהטוקנים.
• משימות ארוכות טווח שבהן אורך הריצה הוא העיקר — Grok 4.7. הגרסה אומנה במיוחד לעבודה של שעות רבות, ומספרי הספק על SWE-Marathon ו-CursorBench נעים בדיוק בכיוון הזה.
• נפח רגיש להשהיה — לא זה ולא זה, לפי הנתונים הנוכחיים. העלות למשימה של Sol היא המספר הטוב יותר, אבל 39 הטוקנים לשנייה שנמדדו של Grok 4.7 הם אילוץ ממשי לכל דבר אינטראקטיבי.
• עומסי עבודה של הקשר ארוך שרובו במטמון — GPT-6 Sol, על שורת הקריאה מהמטמון ולא על שורת הפלט. במחיר של $0.20 לעומת $0.50 למיליון טוקנים במטמון, ועם חלון כפול בגודלו, הטיעון מתחזק ככל שיותר מהפרומפט שלך יציב.
• אם ההשוואה שלך נבנתה מכרטיס התעריפים לפי טוקן — בנה אותה מחדש לפי עלות למשימה. $6.00 לעומת $10.00 עבור פלט הוא זוג המספרים הכי פחות אינפורמטיבי במאמר הזה, והוא הזוג שכל עמוד קיים פותח בו.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
