
GPT-6.1 Sol מול Grok 4.7: תעריף הפלט הזול ביותר בחדר, והשיחה היקרה ביותר
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Grok 4.7, היורש של xAI ל-Grok 4.6, הושק ב-21 בספטמבר 2026 במחיר של $2.00 למיליון טוקנים בקלט ו-$6.00 למיליון טוקנים בפלט. GPT-6.1 Sol, רענון הביניים של OpenAI, הושק שמונה ימים לאחר מכן, ב-29 בספטמבר, במחיר של $2.00 לקלט ו-$10.00 לפלט. תעריפי הקלט זהים, תעריף הפלט זול ב-40% ב-Grok 4.7, ושם רוב ההשוואות נעצרות. זה המקום הלא נכון לעצור, כי אותו גוף בלתי תלוי מדד כעת את שני המודלים מקצה לקצה: Grok 4.7 שרף בערך 240 מיליון טוקנים בפלט בהשלמת ה-Artificial Analysis Intelligence Index; GPT-6.1 Sol שרף 67 מיליון. הכפילו את התעריף הזול פי שלושה וחצי מהנפח, והמודל עם המחיר הנמוך יותר לטוקן עולה $3.74 לכל משימה שהושלמה לעומת $0.72.
שני מודלים, בהפרש של שמונה ימים, וכרטיס תעריפים שמתהפך
Grok 4.7 הוא מודל הקידוד ועבודת הידע החזק ביותר של xAI: חלון הקשר של 500,000 אסימונים, עד 450,000 אסימוני פלט בתגובה אחת לפי הרשומה של הספק עצמו, קלט טקסט, תמונה וקבצים, ומאמץ חשיבה הניתן להגדרה בין נמוך, בינוני (ברירת מחדל), גבוה וגבוה במיוחד. xAI לא חשפה מספר פרמטרים, ותאריך החיתוך של האימון המקדים שלה מדווח כיוני 2026 עם אימון משלים עד אוגוסט.
GPT-6.1 Sol הוא רענון של באמפ אחד של OpenAI לדרגת GPT-6 Sol, ממוקם מתחת ל-GPT-6 Astra ומעל GPT-6 Luna: 1,050,000 טוקנים של הקשר — בערך כפול משל Grok — עם תקרת פלט של 128,000 טוקנים שהיא בערך שליש משל Grok, חיתוך ידע ל-30 באפריל 2026, ואותו קלט של טקסט, תמונה וקובץ. סולם החשיבה שלו נע נמוך עד מקסימלי עם ברירת מחדל של בינוני, והוא כבר לא מקבל ללא בכלל.
שורה אחת לכל מימד, שני הצדדים בכל אחד:
• קלט — GPT-6.1 Sol $2.00 ל-1M לעומת Grok 4.7 $2.00 ל-1M; זהה
• פלט — GPT-6.1 Sol $10.00 ל-1M לעומת Grok 4.7 $6.00 ל-1M; Grok זול ב-40%
• קלט במטמון — GPT-6.1 Sol $0.10 ל-1M לעומת Grok 4.7 $0.50 ל-1M; Sol זול פי חמישה, ההפך ממה ששורת הפלט מרמזת
• חלון הקשר — 1,050,000 אסימונים לעומת 500,000
• פלט מקסימלי בתשובה אחת — 128,000 אסימונים לעומת 450,000 הנטענים
• מדרגת הקשר ארוך — תמחור מחדש של הבקשה כולה מעל 272,000 אסימוני קלט בפי 2 על הקלט והמטמון ובפי 1.5 על הפלט, לעומת הכפלה של כל תעריף מעל 200,000 אסימוני קלט, גם עבור הבקשה כולה
• מאמץ חשיבה — נמוך, בינוני (ברירת מחדל), גבוה, xhigh, מקסימלי לעומת נמוך, בינוני (ברירת מחדל), גבוה, xhigh
• משקלים ופרמטרים — סגור, לא נחשף לעומת סגור, לא נחשף; אף אחד מהם לא נותן לך צ'קפוינט
• מדד האינטליגנציה במאמץ המקסימלי שפורסם — GPT-6.1 Sol 51.8 במקסימלי לעומת Grok 4.7 46.4 ב-xhigh
• עלות לכל משימה במדד, בלתי תלויה — $0.72 לעומת $3.74
• אסימוני פלט בהרצת המדד — 67 מיליון לעומת 240 מיליון, לעומת חציון לוח של כמעט 81 מיליון
שתי שורות ברשימה ההיא הן כל ההשוואה. קצב הפלט של Grok 4.7 נמוך באמת, ושורת המטמון שלו גבוהה באמת פי חמישה; והוא יצר פי שלושה וחצי טוקנים כדי להימדד. כרטיס התעריפים, כשהוא נקרא לבדו, מצביע לכיוון אחד. המדידה מצביעה לכיוון האחר, פי חמישה.

היכן ש-Grok 4.7 באמת מוביל
זה יהיה לא הוגן להציג את המאמר הזה כתבוסה מוחצת, כי Grok 4.7 מנצח בהערכות אמיתיות. הוערכו זה לצד זה ברמת המאמץ המקסימלית שפורסמה ב-Artificial Analysis v4.3.2 — Grok ב-xhigh, Sol ב-max, הבדל בתצורה שכדאי לזכור לאורך כל הדרך:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 לעומת GPT-6.1 Sol Elo 1575.1. יתרון של 140 נקודות Elo בעבודת ידע בעלת ערך כלכלי, והניצחון העצמאי הבודד הגדול ביותר עבור המודל בעל המחירון הזול יותר.
• AutomationBench-AA — Grok 4.7 0.6556 לעומת GPT-6.1 Sol 0.6487. למעשה תיקו, אך נומינלית של Grok.
• SciCode — Grok 4.7 0.5741 לעומת GPT-6.1 Sol 0.5417. יתרון של 3.2 נקודות בקידוד מדעי.
• Terminal-Bench 4.0 — Grok 4.7 0.2576 לעומת GPT-6.1 Sol 0.5606. פיגור של 30 נקודות, והפער הגדול ביותר בזיווג.
• Humanity's Last Exam — Grok 4.7 0.4314 לעומת GPT-6.1 Sol 0.5292.
• AA-LCR v1.1, הסקה בהקשר ארוך — Grok 4.7 0.7667 לעומת GPT-6.1 Sol 0.83.
• AA-Omniscience — Grok 4.7 32.0 לעומת GPT-6.1 Sol 41.5.
• GDP.pdf — Grok 4.7 0.20 לעומת GPT-6.1 Sol 0.31.
• CritPt — Grok 4.7 0.1771 לעומת GPT-6.1 Sol 0.3171.
שלוש מתוך תשע הערכות מסתיימות בניצחון של Grok 4.7 או בתיקו, כולל זו שהכי קשה להתווכח איתה: GDPval-AA נועד לתמחר עבודה מקצועית בעלת ערך כלכלי, ופער של 140 נקודות Elo אינו רעש. אם עומס העבודה שלך הוא מהסוג ש-GDPval נועד לייצג — ניתוח עתיר מסמכים, תוצרים מקצועיים, החלטות שיפוט עם תשובה נכונה — המודל הזול יותר לפי המחירון הוא גם המודל הטוב יותר על הלוח הניטרלי, והקנס של עלות לכל משימה הוא המחיר שאתה משלם על כך.
נתוני ההשקה של xAI עצמה גדולים, וכמו כל נתוני השקה של ספקים, אינם משוחזרים. CursorBench 4.0 ב-46.3% ב-xhigh לעומת 40.4% של Grok 4.6; Terminal-Bench 4.0 ב-38.0% לעומת 20.3%, הגידול הבודד הגדול ביותר שנטען לו בהשקה; DeepSWE v1.1 ב-71.0% ב-high לעומת 65.2%; EEBench ב-64.0% לעומת 53.0%. אלה הם סביבת ההרצה של xAI, ההגדרות של xAI, הדיווח של xAI — ושימו לב שטענת ה-38.0% של Terminal-Bench 4.0 ניצבת מול 0.2576 של הלוח העצמאי עבור אותו מודל באותו בנצ'מרק, וזה סוג הפער שכדאי לצפות לו בין תצורה מכווננת של ספק לבין ריצת מאמץ מרבי נייטרלית.
הנתונים של OpenAI עבור GPT-6.1 Sol ראויים לאותה הנחה ויש להם אותה חולשה. המספר היחיד בהשוואה הזו שאף ספק לא הפיק הוא העלות למשימה שהושלמה, מכיוון שהיא מחושבת מצריכת טוקנים נמדדת ולא מטבלת ניקוד. זה המספר ששורד.
למה 240 מיליון טוקנים מכריעים את זה
Artificial Analysis מתארת את המילוליות של Grok 4.7 בסיכום שלה, ומספר הטוקנים שמאחורי הרצת המדד הוא ההוכחה: 240 מיליון טוקני פלט לעומת חציון לוח תוצאות הקרוב ל-81 מיליון, בערך פי שלושה ממה שמודל טיפוסי באותה חבילת מבחנים מפיק. 67 המיליון של GPT-6.1 Sol נמצאים הרבה מתחת לחציון. חברו את שני היחסים — פי 3.6 מהנפח במחיר של פי 0.6 — ותקבלו שתעריף הפלט הזול יותר קונה יותר טוקנים ולא חשבון קטן יותר, וזה בדיוק איך שנראה הבדל של 3.74 דולר מול 0.72 דולר בעלות למשימה.
שמירה במטמון משנה את גודל ההשפעה אך לא את כיוונה, וזה הפרט שמכשיל אנשים. הקלט השמור במטמון של Grok 4.7 הוא $0.50 למיליון לעומת $0.10 של Sol — יקר פי חמישה בשורה שבה חיים היסטוריות סוכנים ארוכות והנחיות מערכת חוזרות. עומס עבודה שנשלט על ידי קריאה חוזרת של תחילית גדולה ויציבה מוצא אפוא את שני המודלים קרובים יותר ממה ש-$6 מול $10 מרמז, וברגע שמוסיפים על כך את אריכות הדברים של Grok, הם רחוקים יותר ממה ששיעורי הקלט מרמזים. שורת המטמון ושורת הטוקנים מצביעות כאן לאותו כיוון, וזה יוצא דופן והופך את הזיווג הזה לנקי יותר ממה שכרטיסי התעריפים מרמזים.
סעיפי ההקשר הארוך כדאי לתמחר בנפרד מכיוון שהם מופעלים בנקודות שונות. GPT-6.1 Sol מתמחר מחדש בקשה שלמה מעל 272,000 אסימוני קלט; Grok 4.7 עושה את אותו הדבר מעל 200,000. בקריאה של 250,000 אסימונים, Grok כבר הכפיל את מחירו — $4.00 ו-$12.00 עם קריאת מטמון של $1.00 — בעוד Sol עדיין בתעריפים הסטנדרטיים שלו של $2.00 ו-$10.00. בין 200,000 ל-272,000 אסימונים, המודל בעל כרטיס התעריפים הזול הוא היקר יותר בפער ניכר, וטווח זה נפוץ בעבודה עם מסמכים.
המקום שבו Grok באמת מנצח הוא המבנה ולא הציון הוא תקרת הפלט. תגובה מקסימלית של 450,000 טוקנים לעומת 128,000 של Sol היא סוג אחר של תוצר: בסיס קוד שלם שנוצר, תמלול ארוך, סינתזה באורך ספר בקריאה אחת. אם אתם מגיעים לתקרות פלט היום, השורה הזו מכריעה את ההשוואה וכלום בחשבון העלויות שלמעלה לא חל — אינכם יכולים לקנות יכולת שלדגם האחר אין, בכל מחיר.
שניהם על מקש אחד, וזה החלק השימושי
Grok 4.7 נמצא ב-OrcaRouter במחיר המחירון של xAI עצמה — $2.00 ו-$6.00 למיליון טוקנים עם קריאה מהמטמון ב-$0.50 והמדרגה של 200,000 טוקנים ל-$4.00 ו-$12.00 מועברת בדיוק כפי ש-xAI מפרטת אותה — ו-GPT-6.1 Sol נחת בנתיבים שלנו ביום ההשקה במחיר של OpenAI, $2.00 ו-$10.00 עם קלט במטמון ב-$0.10 והמדרגה של 272,000 טוקנים ללא שינוי. לא מתווסף דבר לשניהם: הפלטפורמה מעבירה את מחיר המחירון של הספק כמו שהוא במקום להוסיף עליו מרווח, מה שאומר שהורדת מחיר של ספק באחד מהצדדים נכנסת לתוקף כאן באותו יום שבו היא נכנסת לתוקף שם, בלי חשבונית שנייה ובלי משווק באמצע.

עבור הצמד המסוים הזה, זה שווה יותר מאשר נוחות. שני המודלים חלוקים בדעתם לגבי מה הם טובים בו — Grok 4.7 מוביל ב-Elo לעבודה מקצועית ובקידוד מדעי, GPT-6.1 Sol מוביל בהרצה במסוף, באמינות עובדתית ובשליפה בהקשר ארוך — והגבול בין עומסי העבודה האלה נראה בתעבורה שלך לפני שהוא נראה במדד השוואה. שליחת בקשות בצורת GDPval לכיוון אחד והרצות סוכנים ארוכות-טווח לכיוון השני, מאחורי נקודת קצה אחת, עם מעבר אוטומטי בין השניים בעת כשל ועם כלל ניתוב שאתה משנה בקונפיגורציה ולא בפריסה, היא דרך זולה יותר למצוא את הגבול הזה מאשר פרויקט הערכה. מיזוג מודלים, שבו פאנל של מודלים עונה יחד, הוא האפשרות האחרת שהפלטפורמה מציעה אם אתה מעדיף לא לבחור לפי בקשה בכלל.

השיחה
• עבודה סוכנית וטרמינלית עם פלט ארוך, לולאות של קידומת שמורה במטמון — GPT-6.1 Sol. שלושים נקודות ב-Terminal-Bench 4.0, שורת מטמון זולה פי חמישה, וחמישית מהעלות לכל משימה שהושלמה.
• עבודת ידע מקצועית, ניתוח מסמכים, משימות שיקול דעת — Grok 4.7 בזכות יתרון של 140 נקודות ב-GDPval-AA Elo, כשחשבון הטוקנים מתוקצב ולא מונח כהנחה.
• קידוד מדעי — Grok 4.7, בפער קטן, לפי פילוח SciCode של הלוח. בדקו זאת מול הסוויטה שלכם; 3.2 נקודות נמצאות בתוך הטווח שסט הנחיות שונה יכול להזיז.
• תגובות בודדות מעל 128,000 טוקני פלט — Grok 4.7, ואין אריתמטיקה שמחליפה אותו.
• בקשות בין 200,000 ל-272,000 טוקני קלט — GPT-6.1 Sol, כי Grok 4.7 כבר הכפיל את כל הבקשה שלו ו-Sol לא.
• השיחה הזולה ביותר האפשרית — אף אחד מהשניים האלה. שניהם מודלים מתומחרים כחזית עם תיאבון טוקנים של חזית; ההשוואה היא איזה מהם מסיים את המשימה שלכם, ולא איזה מהם זול באופן מופשט.
• אם השוואה מסתיימת ב״Grok זול יותר לכל טוקן״ — היא הסתיימה צעד אחד מוקדם מדי. הצעד הבא הוא ספירת הטוקנים, והיא 240 מיליון לעומת 67.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
