
Grok 4.7 לעומת Grok 4.6: אותו מחיר $2/$6, מודל שונה מתחת למכסה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 1009 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 195 tok/s
- OrcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- xAISpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
SpaceXAI השיקה Grok 4.7 ב-21 בספטמבר 2026, והדבר הראשון שראוי לשים לב אליו הוא מה שלא השתנה: המחיר. Grok 4.7 עולה 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט, בדיוק מה שGrok 4.6 עולה מאז שהושק ב-12 באוגוסט 2026. אותו מחירון, אותו חלון הקשר של 500,000 טוקנים, אותו קלט טקסט ותמונה — ובכל זאת שני המודלים אינם קרובים זה לזה בהערכות שחשובות לעבודת סוכנים. לפי המספרים שפרסמה SpaceXAI בעצמה, Grok 4.7 כמעט מכפיל את Grok 4.6 ב-Terminal-Bench 4.0, 38.0% לעומת 20.3%. זו כל הצורה של ההשוואה הזו: החלפה בין דורות במחיר זהה שבה כמעט כל השיפור מתרכז במקום אחד, והחלקים של Grok 4.6 שהרגיזו צוותי פרודקשן עדיין שם.
מה בעצם השתנה בין שני המודלים
התיאור של SpaceXAI עצמה את ההשחרור מצומצם, וכדאי לצטט את צורתו ולא את שמות התואר. Grok 4.7 בנוי על מודל בסיס גדול יותר מ-Grok 4.6, והוא קיבל ריצת למידת חיזוק ארוכה יותר, שמכוונת למשימות ש"עשויות לקחת שעות להשלמה". החברה אומרת שאותה ריצה חידדה שלושה דברים: אימות עצמי, טיפול בהקשר ארוך, והתנהגות בסביבת Grok Bot. אין כל טענה על ארכיטקטורה חדשה, מודאליות חדשה, או מערך הגשה שונה.
המסגור הזה חשוב משום שהוא מנבא היכן יופיעו הרווחים במדדי הביצוע, והם מופיעים בדיוק שם. מעבר RL ארוך יותר על משימות קשות בנות שעות רבות מזיז את עבודת הטרמינל והמאגרים הרבה יותר משהוא מזיז חידון ידע. אם קיוויתם ש-Grok 4.7 יהיה מודל רחב יותר מ-Grok 4.6, הערות השחרור אומרות אחרת — זה אותו מבנה מודל, שאומן עמוק יותר אל הקצה הקשה של עבודה אייג'נטית.
סיפור הפרמטרים הוא הפריט היחיד בזה שאינו גילוי מטעם ספק. מאסק אמר בתחילת ספטמבר ש-Grok 4.7 נושא בערך 2.1 טריליון פרמטרים לעומת 1.5 טריליון של Grok 4.6, עלייה של 40%, ומאז חזרו על הנתון הזה בכל מקום. הוא מעולם לא הופיע בדף מפרט של SpaceXAI. התייחסו אליו כאל טענה שמועברת הלאה בהרחבה על מודל הבסיס, ולא כמפרט מאושר — ושימו לב שמנייני פרמטרים אומרים מעט מאוד על עלות ההגשה או היכולת כאשר הארכיטקטורה דלילה, וכזו היא הארכיטקטורה של סדרת Grok.
פער הבנצ'מרק, עם תווית המקור מצורפת
כל נתון בסעיף הזה מגיע מחומר ההשקה של SpaceXAI. שום דבר ממנו לא שוחזר באופן עצמאי בזמן כתיבת הדברים, והדרך הכנה לקרוא אותו היא כמערכת טענות שבמקרה ספציפית באופן יוצא דופן — מה שהופך אותה לניתנת לבדיקה בהמשך, אך לא הופך אותה למאומתת כעת.
• Terminal-Bench 4.0 — Grok 4.7 38.0% (לפי דיווח הספק) לעומת Grok 4.6 20.3%. הדלתא הגדולה ביותר מבין כולן במהדורה, וזו שמתאימה לטענה על "RL ארוך יותר במשימות קשות יותר".
• CursorBench 4.0 — Grok 4.7 46.3% (לפי דיווח הספק) לעומת Grok 4.6 40.4%. שיפור אמיתי, אך צנוע — פחות משש נקודות, במדד שקרוב יותר לעבודת עורך יומיומית מאשר להפעלות מסוף אוטונומיות.
• DeepSWE v1.1 — Grok 4.7 71.0% במאמץ הסקה גבוה (לפי דיווח הספק) לעומת Grok 4.6 65.2%. שוב שיפור מוצק, לא מרהיב.
• EEBench — Grok 4.7 64.0% (לפי דיווח הספק). לא פורסם נתון של Grok 4.6 לצידו, כך שהנתון הזה לא אומר לך דבר על השדרוג.
• AA-Briefcase v1.1 — Grok 4.7 עם 1,657 Elo (כפי שדווח על ידי הספק), בהערכת עבודת ידע מקצועית.
קרא את הרשימה כמכלול והדפוס עקבי: Grok 4.7 טוב יותר באופן משמעותי כשהמשימה ארוכה ואג'נטית, וטוב יותר באופן שולי כשהמשימה קצרה. הזינוק ב-Terminal-Bench הוא בערך פי שניים; השיפורים בעבודת עורך הם באחוזים חד-ספרתיים. אם עומס העבודה שלך הוא בצורת השלמה אוטומטית, אתה משלם את אותו $2/$6 עבור שיפור קטן. אם עומס העבודה שלך הוא "רוץ במשך שעתיים וחזור," הגרסה מכוונת ישירות אליך.
מה אומרת המדידה הבלתי תלויה עד כה
קיים מספר עצמאי אחד, וראוי לנסח אותו בזהירות משום שקל לטעות בקריאתו. Artificial Analysis נותנת ל-Grok 4.7 ציון 46 במדד Intelligence Index שלה, גרסה v4.3.2, ומדרגת אותו במקום ה-16 מתוך 655 מודלים בלוח. Grok 4.6 נמצא על 44 באותו סולם. פער של שתי נקודות במדד מורכב אינו ההכפלה ש-Terminal-Bench מציג, ואי-ההתאמה הזו מלמדת ולא סותרת: המדד משלב חשיבה, ידע, מתמטיקה וקידוד, ולכן רווח גדול בחתך סוכני אחד מדולל על ידי כל מה שהמודל לא שינה.
שני פרטים נוספים מאותו עמוד שימושיים יותר מציון הכותרת. ראשית, Grok 4.7 ייצר 240 מיליון אסימוני פלט בזמן הרצת המדד, לעומת חציון של 92 מיליון — הוא מודל הסקה מפורט, ובתעריף פלט של 6 דולר למיליון, הפירוט הזה הוא סעיף בהוצאות. שנית, הציון המשולב של המדד ממקם אותו בין המודלים החזקים ביותר בדרג המחיר שלו, וזו ההשוואה שבאמת חשובה לקונה. Artificial Analysis לא מילאה שדה מחיר עבור Grok 4.7 בעמוד המודל, לכן אין לקחת משם את נתון העלות למשימה; יש להשתמש במחיר הספק של $2/$6.

מצוק התמחור שאף אחד משני המודלים לא תיקן
הנה החלק מכרטיס התעריפים של Grok 4.6 שצוותי פרודקשן למדו לשנוא, ו-Grok 4.7 לא שינה אותו. מתחת ל-200,000 אסימוני קלט התעריף הוא $2 בקלט ו-$6 בפלט. מעל זה, כל הבקשה מתומחרת מחדש ל-$4 בקלט ו-$12 בפלט. לא האסימונים העודפים — כל הבקשה. קריאה בת 210,000 אסימונים עולה כפול מקריאה בת 199,000 אסימונים, עבור 11,000 אסימונים נוספים.
עם חלון הקשר של 500,000 טוקנים בשני המודלים, קל ליפול מהצוק הזה. הרצות סוכנים עם הקשר ארוך ופרומפטים של מאגר קוד שלם הם בדיוק עומסי העבודה ש-Grok 4.7 כוונן עבורם, מה שאומר שמקרה השימוש הטוב ביותר של המודל הוא גם זה שסביר ביותר להפעיל את הכפלת המחיר. אם אתם מעבירים עבודה אל Grok 4.7 מפני שהוא מתמודד טוב יותר עם הפעלות סוכנים ארוכות, תקצבו את התמחור מחדש לפני שאתם מעבירים אותה, לא אחרי.
יש גם שכבת מהירות שיש לקחת בחשבון. SpaceXAI מציעה גרסה מהירה של Grok 4.7 שמכפילה את מהירות הפלט ומכפילה את המחיר הנקוב. זהו חילוף לגיטימי לקידוד אינטראקטיבי, וחילוף גרוע לעבודה באצווה — אותה משימה באותה איכות עולה פי שניים עבור חיסכון בזמן שעון שאיש אינו צופה בו.
הגירה מ-Grok 4.6 ללא שכתוב
החדשות הטובות המעשיות הן שזו החלפת מודל, לא הגירת פלטפורמה. שני המודלים קולטים טקסט ותמונות ומחזירים טקסט, שניהם משתמשים באותן רמות מאמץ חשיבה מ-low עד xhigh, וצורת הבקשה היא זו ש-SpaceXAI מספקת מאז Grok 4.5. קוד שקורא ל-Grok 4.6 עם פרמטר effort אינו זקוק לארגון מחדש כדי לקרוא ל-Grok 4.7.
המקום שבו ההחלפה גובה מחיר הוא בהערכה. הרווחים של Grok 4.7 מרוכזים בריצות סוכניות ארוכות, ולכן מערך בדיקות הבנוי מפרומפטים קצרים של תור יחיד כמעט לא יראה לך דבר — תראה את השיפור בסדר הגודל של CursorBench ותסיק שהשדרוג לא היה שווה את המאמץ, בעוד שההצדקה עבורו נמצאת במשימות שמערך הבדיקות שלך לעולם לא מתרגל. המדידה שבאמת תכריע את זה היא השלמת משימות בעבודה רב-שלבית: טלאים שהתקבלו, רגרסיות שהוכנסו, קריאות לכלים לכל משימה שהושלמה, ובאיזו תדירות ריצה זקוקה להצלה אנושית. אלה הצירים שאליהם מצביעים המספרים של הספק עצמו, ואלה הצירים שאף בנצ'מרק מפורסם לא מכסה עבור בסיס הקוד שלך.
מילוליות היא הדבר השני שיש למדוד. מודל שמפיק 240 מיליון טוקנים במדד סטנדרטי יפיק יותר טוקנים בעומס העבודה שלך מאשר קודמו, ובתעריף של 6 דולר למיליון טוקני פלט זה יכול למחוק בשקט את הערך של שדרוג באותו מחיר. עקוב אחר טוקני פלט לכל משימה שהושלמה במשך שבוע לפני שאתה מתחייב.

למי להתקשר
ההחלטה היא באמת פשוטה, וזה יוצא דופן בהשוואת מודלים. Grok 4.6 נותר הבחירה הנכונה לתעבורה קצרת-תורים ורגישה לעלות: צ'אט, סיווג, תמצות וסיוע בקוד בקנה מידה של עורך, שבהם הרווחים של Grok 4.7 קטנים והפירוט היתר שלו הוא מס. Grok 4.7 הוא הבחירה הנכונה לעומס העבודה שלשמו הוא נבנה — קידוד סוכני ארוך-טווח ועבודת טרמינל, שבהם משימה רצה שעות, ואימות עצמי הוא ההבדל בין עבודה גמורה לעבודה תקועה.
הרצת שניהם אינה פשרה כאן, זוהי התשובה הנכונה, וזה זול לביצוע. Grok 4.6 נמצא בקטלוג של OrcaRouter במחיר המחירון של SpaceXAI עם 0% תוספת המועברת ישירות, כך שתעריף ה-$2/$6 שלמעלה הוא מה שאתם משלמים — ומכיוון שאנחנו מעבירים את מחיר המחירון של הספק כמו שהוא ולא מוסיפים עליו תוספת, כל שינוי מחיר של הספק חי אצלנו באותו היום שבו הוא נוחת. מפתח API אחד מכסה את Grok 4.6 ואת יותר מ-200 מודלים אחרים, כך שהעברת תעבורה ביניהם לפי משימה היא שינוי בקונפיגורציה ולא חוזה נוסף. אם אתם רוצים להתנסות ב-Grok 4.7 בנתיב ייצור לפני שאתם סומכים עליו, התבנית הבטוחה יותר היא להשאיר את ה-fallback על Grok 4.6 — מודל שאפשר לנתב אליו כבר היום — ולתת ל-failover האוטומטי בין ספקים להעביר את הבקשה בחזרה כשהמודל החדש מתנהג שלא כשורה.

מה לצפות בהמשך
שני דברים יכריעו בהשוואה הזו, ואף אחד מהם עדיין לא קרה. הראשון הוא שחזור בלתי תלוי של הנתון של Terminal-Bench 4.0 — 38% הם זינוק גדול מספיק כדי שמישהו יריץ אותו מחדש, ואם הוא יחזיק מעמד, הטיעון בעד Grok 4.7 בצינורות סוכניים הוא חזק מטעמי מהות ולא מטעמי שיווק. השני הוא שאר מפת הדרכים של Grok: SpaceXAI הציבה בפומבי את Grok 4.8, Grok 4.9 ו-Grok 5 אחרי ההשקה הזו, ותוחלת החיים של Grok 4.6 עצמו הייתה כחמישה שבועות. לאמץ את Grok 4.7 כהנחת פלטפורמה ארוכת טווח יהיה לחזור על הטעות שצוותים עשו עם Grok 4.5.
לעת עתה, השדרוג באותו מחיר הוא אמיתי וכיוון התנועה ברור. המספר שכדאי להיאחז בו הוא ש-$2/$6 קנו לך מודל שבערך מכפיל את ביצועיו בעבודת טרמינל באופק ארוך וכמעט לא זז בשום מקום אחר — וזו טענה ספציפית, שימושית וניתנת לבדיקה ולא קפיצת דור.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
