כרטיס כותרת למאמר על תאריך השחרור של Grok 4.7, ובו כתוב 'Grok 4.7 — שאלת תאריך השחרור', עם כותרת משנה 'לא שוחרר. הנה מה ש-xAI אמרה בפועל.' ושלושה צ'יפים: 'האימון הראשוני הושלם', 'נתוני SpaceX הגיעו', ו'מאסק: 3–4 שבועות', עם שורה תחתונה: '~2.1T פרמטרים — טענה, לא מפרט'.
Guides & Insights

Grok 4.7 משיג ציון 46 במדד האינטליגנציה של Artificial Analysis ומכניס את SpaceXAI לארבעה המובילים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Grok 4.7 משיג ציון 46 במדד האינטליגנציה של Artificial Analysis ומכניס את SpaceXAI לארבעה המובילים

Grok 4.7 יצא. SpaceXAI שחררה אותו ביום שני, 21 בספטמבר 2026 — באותו מחיר של $2 למיליון טוקני קלט ו-$6 למיליון טוקני פלט כמו Grok 4.6, עם אותו חלון הקשר של 500,000 טוקנים, נקודת חיתוך ידע מאוחרת יותר ורמת חשיבה עליונה חדשה. הוא זמין ב-Cursor וב-Grok Build, דרך ה-API של הספק עצמו, ודרך כלי קידוד של צד שלישי, נתבים למודלים ופלטפורמות ענן. Grok 4.5, מ-8 ביולי, נשאר מתחתיו כאפשרות הזולה יותר, והמודלים שהוא עדיין צריך לנצח לא השתנו: Claude Fable 5.1, Claude Opus 5 ו-GPT-5.6 Sol כולם נמצאים מעליו במדד האינטליגנציה v4.3.2 של Artificial Analysis, שם הציון העצמאי הראשון של Grok 4.7 — 46 — נוחת שתי נקודות מעל Grok 4.6 ושבע מתחת ל-Claude Fable 5.1. בלוח AA-Briefcase של אותו מעריך לעבודת ידע לטווח ארוך הוא נוחת במקום הרביעי, אחרי שלושה ערכי Claude ולפני Claude Opus 5 במאמץ xhigh, בעלות של בערך חצי מעלות Claude Opus 5 למשימה — התוצאה העצמאית הראשונה במהדורה הזו שנקראת כניצחון במחיר-ביצועים ולא כפער. אחד עשר יום לאחר מכן, התמונה התרחבה בקצוות ולא במרכז: מאז 1 באוקטובר הוא מושק בתוך האפליקציות האינטרנטיות והניידות של Grok עצמה, שם בורר המצב כעת מציין אותו בשתי הרשומות הקשות ביותר שלו, והוא מופיע ב-OrcaRouter במחיר של SpaceXAI עצמה $2/$6.

זו ההשקה. המספרים השימושיים יותר הגיעו באותו יום, מהמעריך היחיד בסיפור הזה שאינו הספק: Artificial Analysis פרסמה את הבדיקה העצמאית הראשונה שלה על Grok 4.7, וזו תוצאה בת שלושה חלקים — 46 במדד Intelligence Index שרק שתי נקודות מעל Grok 4.6, 56 במדד Coding Agent Index שנמצא תשע נקודות מעליו, ו-1,657 Elo ב-AA-Briefcase שזה 111 נקודות מעל. שלושת המספרים האלה מצביעים לכיוונים שונים, והפער ביניהם הוא הדבר המעניין ביותר בהשקה הזו. בהמשך: המפרט שסופק, טבלת הבנצ'מארקים של הספק עצמו עם התווית הנדרשת לכל שורה, ואחר כך הציונים העצמאיים בקריאה נכונה — כולל מה שהם אומרים על הסתייגות המוכנות ש-SpaceXAI מעולם לא התייחסה אליה.

מה SpaceXAI שחררה ב-21 בספטמבר

התחל במפרט, מכיוון שהוא קרוב באופן יוצא דופן לקודמו. Grok 4.7 מתומחר באופן זהה ל-Grok 4.6 — $2 למיליון טוקנים בקלט ו-$6 למיליון טוקנים בפלט מתחת ל-200,000 טוקני קלט, עולה ל-$4 בקלט ו-$12 בפלט ברגע שבקשה חוצה את הסף הזה, אותו מבנה ש-Grok 4.6 הציג. חלון ההקשר הוא 500,000 טוקנים. תאריך הידע האחרון הוא מאי 2026, שלושה חודשים מאוחר יותר מה-1 בפברואר 2026 של Grok 4.6. מאמץ החשיבה פועל בארבע רמות — נמוכה, בינונית, גבוהה ו-xhigh — והנתונים המפורסמים מצוטטים ברמת xhigh. גרסה מהירה פועלת במהירות פלט כפולה במחיר כפול.

מתחת לפני השטח, xAI מתארת שלושה שינויים ולא ארכיטקטורה חדשה. מודל הבסיס גדול מזה של Grok 4.6. הרצת למידת החיזוק הייתה ארוכה יותר, עם דגש רב יותר על משימות שלוקח שעות רבות להשלים. והמודל אומן לאמת את עבודתו שלו ולשמור טוב יותר על הקשר ארוך, כולל הבנה מובנית של תשתית Grok Bot. הסיכום בשורה אחת של החברה עצמה הוא "מהיר פי שניים, במחצית המחיר של מודלים דומים" — טענת מיצוב ביחס למתחרים ולא מדידה, וכדאי לקרוא אותה ככזו.

הזמינות הייתה רחבה כבר ביום הראשון, ומאז היא התרחבה פעמיים. בעת ההשקה: Cursor ו-Grok Build, ה-API של הספק עצמו, כלי קידוד של צדדים שלישיים, נתבי מודלים ופלטפורמות ענן; העמוד של Grok Build של SpaceXAI עצמה אומר כעת במפורש "להתחיל לבנות עם Grok 4.7". ב-28 בספטמבר הוסיפה Amazon Web Services את המודל ל-Amazon Bedrock עם אותו חלון הקשר של 500,000 טוקנים ואותן ארבע רמות של מאמץ חשיבה, המוגשות דרך פרופילי הסקה חוצי-Region, כך שהמודל נגיש כעת דרך הקטלוג של ההיפרסקיילר עצמו ולא רק דרך ה-API של הספק. לאחר מכן, ב-1 באוקטובר, הוא החל להתפרס בתוך אפליקציות הווב והמובייל הצרכניות של Grok, וגם יומיים לאחר מכן זה עדיין שם. האחרון שבהם שקט באופן יוצא דופן: SpaceXAI הודיעה על הצעד המקביל עבור Grok 4.5 עם פוסט בבלוג שכותרתו "מביאים את Grok 4.5 ל-iOS, ל-Android, לווב ול-X", ואילו עבור Grok 4.7 היא לא פרסמה דבר, כך שהשינוי נראה בתוך המוצר ולא מוצהר. מדובר בשינוי בצד השרת ולא בגרסה שנשלחה למשתמשים, ורשומות האפליקציות מאשרות זאת: גם הרשומה של Grok ב-iOS וגם זו ב-Android עודכנו ב-1 באוקטובר — גרסת ה-App Store היא 1.4.47, ששוחררה באותו יום, והערות השחרור שלה מזכירות רק "שיפורים בצ'אט, בקול וב-Imagine", בעוד הרשומה ב-Play עודכנה באותו יום. השינוי נדחף מהבקאנד ולא מובנה בתוך קובץ בינארי. מכיוון שההתפרסות מדווחת ולא מתועדת, קשה יותר לקבוע את היקפה המדויק מאשר במקרה של הרשומה ב-Bedrock, שמאחוריה עומד פוסט מתוארך של AWS, והדיווח כבר סטה: החשבונות העוקבים אחר הנושא מתארים כעת את Grok 4.7 כמודל הבסיס בכל המצבים — Fast, Expert, Build ו-Heavy — רשימה שאינה תואמת את מה ש-grok.com משרת בפועל. יש לקרוא זאת כדיווח של העוקבים עצמם ולא כתיאור של הספק. שותפי סייבר נבחרים מקבלים גישה בהזמנה בלבד ליכולות ה-red-team של המודל.

תיקון אחד לרשומה שהקטע הזה שמר. מספר הפרמטרים שהופץ במשך חודשיים — כ-2.1 טריליון, כ-40% מעל 1.5 הטריליון של Grok 4.6 — עדיין אינו מופיע באף דף מפרט. xAI לא פרסמה מספר פרמטרים עבור Grok 4.7, ו-Artificial Analysis מציינת את גודל המודל כלא מפורסם. הנתון הזה תמיד היה טענה של מייסד, וההשקה לא הפכה אותו למפרט.

טבלת הבנצ'מרק היא של xAI עצמה — הנה מה שלא

כל נתון ברשימה שלמטה מגיע מהודעת הספק, ואף אחד מהם לא שוחזר באופן בלתי תלוי. קראו אותו כשתווית זו מצורפת: אלה המספרים של xAI בהערכות הנבחרות של xAI, שפורסמו ביום ההשקה, והשבוע הראשון של כל השקה הוא הזמן שבו מדדי הספקים הם הכי פחות מהימנים. גם עמודות ההשוואה הן של הספק עצמו — Grok 4.6 (high), GPT-5.6 Sol (max) ו-Claude Fable 5.1 (max), כשכל אחד מהם הורץ ברמת המאמץ שנבחרה על ידי הספק.

• CursorBench 4.0 — Grok 4.7 46.3%, Grok 4.6 40.4%, GPT-5.6 Sol 41.7%, Claude Fable 5.1 51.8%. לפי דיווח הספק.

• DeepSWE v1.1 — Grok 4.7 ‏71.0% במאמץ גבוה, Grok 4.6 ‏65.2%, GPT-5.6 Sol ‏72.7%, Claude Fable 5.1 ‏70.0%. לפי דיווח הספק.

• Terminal-Bench 4.0 — Grok 4.7 37.6%, Grok 4.6 20.3%, GPT-5.6 Sol 37.3%, Claude Fable 5.1 57.9%. לפי דיווח הספק, ולאחר תיקון: השורה של Grok 4.7 הציגה 38.0% בטבלת יום ההשקה, והיא מופיעה כ-37.6% בעמוד הספק היום.

• EEBench — Grok 4.7 64.0%, Grok 4.6 53.0%, GPT-5.6 Sol 39.4%, Claude Fable 5.1 56.4%. לפי דיווח הספק.

• Harvey Legal Agent — Grok 4.7 19.6%, Grok 4.6 15.8%, GPT-5.6 Sol 2.5%, Claude Fable 5.1 6.7%. לפי דיווח הספק.

• HealthBench Professional — Grok 4.7 56.7%, Grok 4.6 48.5%, GPT-5.6 Sol 60.5%, Claude Fable 5.1 62.1%. לפי דיווח הספק.

• AA Briefcase v1.1 — Grok 4.7 1,657, Grok 4.6 1,546, GPT-5.6 Sol 1,487, Claude Fable 5.1 1,678. זה השורה היחידה בטבלה שאינה עוד בלעדית לספק: לוח ה-AA-Briefcase של Artificial Analysis עצמו מפרסם את אותו 1,657 עבור Grok 4.7 במאמץ xhigh ואת 1,546 עבור Grok 4.6 ברמת high. עמודות ההשוואה עדיין משקפות את בחירת הספק בדגמים וברמות מאמץ.

• GDPval Elo — Grok 4.7 1,695, Grok 4.6 1,605, GPT-6 Astra 1,542, Claude Fable 5.1 1,735. לפי דיווח הספק.

הקריאה הישרה של הסט הזה היא לא "Grok 4.7 מנצח". הוא מנצח את Grok 4.6 בכל השמונה, וזה המינימום שיורש חייב לך. מול השדה זהו מאזן מעורב: הוא מקדים את GPT-5.6 Sol ב-CursorBench, ב-Terminal-Bench וב-EEBench, ומפגר אחריו ב-DeepSWE; מפגר אחרי Claude Fable 5.1 ב-CursorBench, ב-Terminal-Bench, ב-HealthBench ובשתי מדידות בסגנון Elo, ומקדים אותו ב-EEBench ובהערכת סוכן המשפטי של Harvey. זה גם ממחיש כמה מתוצאת בנצ'מרק תלויה ברמת המאמץ — 71.0% ב-DeepSWE הוא מספר ברמת מאמץ גבוהה בתוך טבלה שאחרת מצוטטת ב-xhigh.

הבטיחות היא המקום היחיד שבו הטענות של הספק ספציפיות באופן יוצא דופן. xAI אומרת ש-Grok 4.7 נבנה על מערך הגנות חדש לחלוטין, ומכנה אותו המודל החזק ביותר שהחברה בחנה מבחינת סירובים ועמידות בפני jailbreak. במדד הביובטיחות של LatchBio הוא מדווח על 62.4%; ב-HackerBench v0.3 הוא מדווח שהוא מעביר 3.3% מפרומפטים כפולי-שימוש מסוכנים, בעוד שהוא רק לעיתים רחוקות חוסם עבודת אבטחה לגיטימית. אלה הערכות שדווחו על ידי הספק על השחרור של הספק עצמו, ואף צד שלישי לא שחזר אותן.

המספרים הראשונים בקטע הזה שאינם של הספק הם שלושת המספרים ש-Artificial Analysis פרסמה ב-21 בספטמבר, והם חלוקים זה עם זה באופן אינפורמטיבי. במדד Intelligence Index, Grok 4.7 מקבל ציון 46 במאמץ xhigh בסקאלה v4.3.2 — המקום ה-16 בטבלת המובילים הזו — לעומת 44 של Grok 4.6. העלייה הזו של שתי נקודות היא, לפי Artificial Analysis, מה שמספיק כדי להביא את SpaceXAI אל ארבע המעבדות המובילות במדד. קראו את המיקום במדויק: זו הצהרה על המודל הטוב ביותר של מעבדה, לא על המודל הזה, והמודל עצמו עדיין נמצא ארבע נקודות מתחת ל-50 של Claude Fable 5 ושבע נקודות מתחת ל-53 המשותף ל-Claude Fable 5.1 ול-GPT-6 Astra. עלייה של שתי נקודות היא גם בטווח שמופיע בין רמות המאמץ של אותו מודל, מה שמשמש כתזכורת לכך שמודל יורש שמקבל ציון גבוה מקודמו אינו זהה למודל יורש שמשנה את מה שאפשרי. הערה נוספת לקריאת המספר: גרסת הסקאלה חשובה, משום ש-Artificial Analysis הציגה מחדש את המדד שלה, וערכי 61/62/63 שמופיעים לאורך רוב הסיקור של יולי ואוגוסט שייכים לסקאלה הישנה מלפני ספטמבר 2026 שהוצאה משימוש — אין להשוות אותם לאלה.

ה-Coding Agent Index הוא המספר השני, והוא זה שזז. כשגרסת Grok 4.7 רצה בסביבת ההרצה Grok Build של SpaceXAI עצמה ברמת מאמץ xhigh, היא צוברת 56 לעומת 47 של Grok 4.6 — תשע נקודות, לא שתיים — מה שממקם אותה רביעית מבין המודלים שהוערכו בסביבות ההרצה המקוריות שלהם, אחרי Claude Fable 5.1, GPT-6 Astra ו-Claude Opus 5, ולפני GPT-5.6 Sol. ה-Coding Agent Index הוא שילוב משוקלל באופן שווה של DeepSWE v1.1, Terminal-Bench 4.0 ו-SWE-Atlas-QnA על פני 303 משימות, וכל שלושת הרכיבים השתפרו: DeepSWE מ-65% ל-73%, Terminal-Bench מ-18% ל-33%, ו-SWE-Atlas-QnA מ-58% ל-63%. זו העדות העצמאית הראשונה לכך שהתיקון שתיארה xAI — למידת חיזוק ארוכה יותר עם משקל מוגבר למשימות של שעות רבות — הניב משהו, וזה המספר שצוות שבוחר סוכן קידוד צריך לשקול יותר מכל, משום שהוא נמדד בסביבת ההרצה שאיתה המודל נשלח בפועל ולא בטבלה של הספק עצמו.

ההסתייגות היא כמה עולות תשע הנקודות. ההרצה של Artificial Analysis עצמה יצרה 240 מיליון טוקני פלט ב-Intelligence Index, לעומת חציון של 94 מיליון בקרב המודלים שהיא עוקבת אחריהם — יותר מפי שניים — והעמידה את העלות של הערכת משימת Index אחת על 3.74 דולר. במחיר של 6 דולר למיליון טוקני פלט, מילוליות היא סעיף ההוצאה שמכריע אם לולאה אגנטית היא בהישג יד, ולכן רווח של תשע נקודות שנרכש בתמורה ליותר מפי שניים מהפלט החציוני הוא עסקת חליפין אמיתית ולא שדרוג חינם. אותה מדידה גם אומרת שאין לקרוא את ציוני הכותרת כפסק דין אחד: על בסיס לכל טוקן, היתרון של Grok 4.7 על Grok 4.6 קטן מכפי שדלתא של האינדקס מרמזת, ובהערכות הידע הכללי שמרכיבות את Intelligence Index הוא קרוב לאותו מודל עם חשבון גבוה בהרבה. תוצאת AA-Briefcase בסעיף הבא היא החריג לכך, והיא חריגה גדולה.

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

הלוח העצמאי השני: AA-Briefcase, ומה קונים בחצי מהעלות לכל משימה

פורסם על ידי Artificial Analysis נתון שלישי עבור Grok 4.7 באותו יום, וזה הנתון שנוגע לעבודת ידע ולא לקוד. ב-AA-Briefcase — הלוח שלה עצמה לעבודת ידע סוכנית בטווח ארוך, שנבנה מארבעה תרחישי פרויקט רב-שבועיים ו-91 תוצרים מדורגים — Grok 4.7 במאמץ xhigh צובר 1,657 Elo, רביעי בלוח, כשרק רשומות של Anthropic לפניו: Claude Fable 5.1 במאמץ max (1,678), Claude Opus 5 במאמץ max (1,673) ו-Claude Fable 5.1 ב-xhigh (1,669). הוא 16 Elo אחרי Claude Opus 5 במאמץ max, וב-xhigh, 8 Elo לפני Claude Opus 5 ב-xhigh (1,649). יש לקרוא את המיקום במדויק: "רק מודלים של Anthropic לפניו" הוא המסגור שבו Artificial Analysis עצמה השתמשה, והוא מדויק — אבל רביעי אינו שני, ושלוש השורות שמעליו הן כולן של אותו ספק.

הרווח לעומת הדור הקודם הוא התנועה הבודדת הגדולה ביותר במהדורה. מול Grok 4.6 במאמץ גבוה (1,546), Grok 4.7 ב-xhigh משיג 111 Elo ב-AA-Briefcase — יותר מפי חמישים מהרווח של שתי נקודות במדד Intelligence Index. Artificial Analysis מייחסת אותו כמעט כולו לאיכות אנליטית: 1,994 Elo שם לעומת 1,690 עבור Grok 4.6, בעוד שאיכות ההצגה יורדת במעט, 1,499 לעומת 1,519. זוהי חתימה קריאה: המודל מנמק טוב יותר את הניתוח ומפרמט את התוצר מעט פחות טוב. אותו כיוון מופיע בנתונים ש-Artificial Analysis ציטטה עבור AA-Briefcase-Lite, תרחיש בדיקת הנאותות הציבורי שהיא פרסמה ב-Hugging Face — איכות אנליטית עלתה מ-1,698 ל-1,994, וההצגה ירדה מ-1,531 ל-1,499. שתי הסתייגויות לגבי ההשוואה הזו. AA-Briefcase-Lite הוא הדגמתי במפורש: עמוד המתודולוגיה של Artificial Analysis עצמה אומר שהתרחיש הציבורי החמישי "אינו נכלל בתוצאות הרשמיות של AA-Briefcase". ונתוני האיכות שצוטטו עבורו תואמים את שורות ה-xhigh שפורסמו בלוח הראשי, לכן יש להתייחס לפסקת Lite כהמחשה של כיוון התנועה ולא כלוח תוצאות נפרד.

שורת העלות היא המקום שבו התוצאה הזו משנה החלטה. מדד העלות-למשימה של AA-Briefcase הוא העלות הכוללת של הרצת ההגשה המלאה חלקי 91 המשימות שלה; חלוקת הסכומים הכוללים שפרסמה Artificial Analysis נותנת בערך $9.30 למשימה עבור Grok 4.7 ב-xhigh לעומת בערך $17.79 עבור Claude Opus 5 במאמץ מקסימלי — בערך חצי, עבור פער של 16 נקודות Elo. הסיכום של Artificial Analysis עצמה לתוצאה הוא ש-Grok 4.7 מדורג "ממש אחרי Opus 5 בכ-50% מהעלות למשימה שלו." זהו אותו סחר ששאר הכתבה הזו מתארת, שמגיע לאותה תשובה מכיוון אחר: Grok 4.7 לא מנצח את החזית, הוא חותך אותה במחיר. שתי הסתייגויות, שתיהן כנות. חשבון הטוקנים הוא אמיתי — ב-AA-Briefcase-Lite, Artificial Analysis העריכה את עלות ה-API של הפקת המצגות לדוגמה בכ-$8 עבור Grok 4.7 ב-xhigh לעומת כ-$4.40 עבור Grok 4.6 ב-xhigh, כך שהממשיך עולה בערך 80% יותר מהמודל שהוא מחליף באותה עבודה. והנתונים לפי משימה מחושבים משימוש בטוקנים לפי מחירי מחירון עם שיעור פגיעות מטמון מייצג, כך שהם משתנים בהתאם למטמון שלך: הם מודל של חשבון, לא החשבון שלך.

מה מקומו של Grok 4.7 לעומת Grok 4.6 ושאר התחום

• מחיר לכל 1M טוקנים — Grok 4.7 $2 קלט / $6 פלט מתחת ל-200K קלט, $4/$12 מעל לכך; Grok 4.6 זהה.

חלון הקשר — 500,000 טוקנים עבור שניהם.

• חיתוך הידע — מאי 2026 עבור Grok 4.7 לעומת 1 בפברואר 2026 עבור Grok 4.6.

• מאמץ חשיבה — low / medium / high / xhigh עבור Grok 4.7 לעומת הרמות המפורסמות של Grok 4.6.

• ציון עצמאי — 46 במאמץ xhigh לעומת 44, במדד האינטליגנציה v4.3.2 של Artificial Analysis. די בכך, אומרת Artificial Analysis, כדי להציב את SpaceXAI בארבע המעבדות המובילות במדד.

• ציון קידוד בלתי תלוי — 56 לעומת 47 במדד Artificial Analysis Coding Agent Index, כשכל מודל בהארנס המקורי שלו. רביעי מבין מודלים עם הארנס המקורי, לפני GPT-5.6 Sol.

• ציון עצמאי לעבודת ידע — 1,657 Elo במאמץ xhigh לעומת 1,546 עבור Grok 4.6 במאמץ high, בלוח AA-Briefcase של Artificial Analysis. מקום רביעי בסך הכול, אחרי שלושה מודלים של Anthropic ולפני Claude Opus 5 במאמץ xhigh.

• עלות לכל משימת AA-Briefcase — כ-$9.30 לעומת כ-$17.79 עבור Claude Opus 5 במאמץ מקסימלי, על אותו לוח. בערך חצי מהחשבון לכל משימה עבור פער של 16 Elo.

• אסימוני פלט לכל הרצת Index — 240 מיליון לעומת חציון של 94 מיליון בקרב המודלים ש-Artificial Analysis עוקב אחריהם. השיפור אינו בחינם.

• הערכת קידוד של ספק — CursorBench 4.0 46.3% לעומת 40.4%.

• מהירות שירות — גרסה מהירה במהירות פלט כפולה תמורת מחיר כפול, לעומת השירות הסטנדרטי של Grok 4.6.

• בטיחות — מערך הגנה חדש, עם דיווח של 62.4% במדד הביובטיחות של LatchBio; Grok 4.6 שוחרר בלי הטענה הזו.

ושאר המשתתפים, על אותו לוח תוצאות: Claude Fable 5.1 עם 53, Claude Opus 5 עם 51, GPT-5.6 Sol עם 47, Kimi K3 עם 44. לתחזית של מאסק עצמו — ש-Grok 4.7 "אמור להיות פחות או יותר באותה רמה של Opus 5.0, לא 5.1" — יש עכשיו מספר מתחתיה, והמספר נחת בדיוק היכן שהוא אמר שינחת: מתחת לחזית, לא מעליה. הפער הנמדד מול Claude Fable 5.1 הוא שבע נקודות; פער המחירים נע דווקא בכיוון ההפוך, כשמחירו של Claude Fable 5.1 רשום כ-$10/$50 למיליון טוקנים לעומת $2/$6 של Grok 4.7 — פי חמישה ממחיר הקלט ויותר מפי שמונה ממחיר הפלט. זו העסקה האמיתית שמבקשים מצוות לבצע, והיא עסקת מחיר-ביצועים ולא ניצחון ביכולות. AA-Briefcase הוא הלוח היחיד בכתבה הזו שבו הסדר משתנה: שם Grok 4.7 ב-xhigh יושב לפני Claude Opus 5 ב-xhigh, 1,657 מול 1,649, אם כי עדיין מאחורי Opus 5 במאמץ מקסימלי עם 1,673 ומאחורי Claude Fable 5.1 עם 1,678. כדאי גם להעמיד את שלושת הציונים הבלתי-תלויים זה לצד זה לפני שמסרטטים את הקו, משום שהם אינם מצביעים לאותו כיוון: שבע נקודות מאחור באינטליגנציה כללית, לפני GPT-5.6 Sol במדד סוכני הקוד, 111 Elo לפני קודמו בעבודת ידע, ומשלם על השיפורים בטוקני פלט. איזו מהעובדות האלה תכריע את הבחירה שלכם תלוי בשאלה אם עומס העבודה הוא סוכן קוד, תוצר ידע או פרומפט צ'אט, וזהו פיצול שימושי יותר מדירוג בודד.

מה שההדלפות צדקו בו, והדבר האחד שהן לא הכריעו

הממצאים שהכתבה הזו עקבה אחריהם עד ספטמבר היו אמיתיים, וההשקה הופכת אותם למבחן של ערכו של סוג הראיות הזה. הנה המאזן.

• בקשת המשיכה של הקטלוג קלעה נכון במחיר. ההגשה מ-21 בספטמבר, שהוסיפה את Grok 4.7 לקטלוגים Zen ו-Go של לקוח סוכן בקוד פתוח — נפתחה ב-05:36 UTC, נסגרה אוטומטית בידי בוט תאימות ב-07:46 UTC בגלל קטע חסר בתבנית בקשת המשיכה, ומעולם לא מוזגה — הציגה את המודל בתעריפים המפורסמים של Grok 4.6. התברר שזה היה מדויק לחלוטין: $2/$6, ללא שינוי. אבל המנגנון חשוב יותר מהתוצאה. התורם העתיק את התעריפים מהמודל שמעליו, וההעתקה במקרה הייתה הניחוש הנכון. זה מזל, לא סמכות, וגם טענות היכולת של אותה בקשת משיכה לא נשאו מידע. הצעה יכולה להיות נכונה ועדיין לא להוות ראיה.

• שובל ההקצאה היה אמיתי ולא היה השחרור. השורה של grok-4.7 בדף מכסת המודלים של Google Cloud Console, שדווחה על ידי עוקבים מהקהילה ב-16–17 בספטמבר, ומזהה הבנייה המתוארך grok-4-7-0907 שהופיע בשגיאת תצורה של Grok Bot, שניהם הצביעו על מודל שהיה בהכנה. לאף אחד משניהם איש לא הצמיד תאריך, ואף אחד מהם לא היה ההכרזה. מה שהם מבססים הוא שתשתית של צד שלישי הוכנה — מה, בדיעבד, היה מדויק ובכל זאת לא היה לוח זמנים.

• מספר הפרמטרים לא אושר מעולם. כ-2.1 טריליון, כ-40% יותר מ-Grok 4.6, מאסק חזר עליו ב-2 בספטמבר — ועדיין נעדר מכל דף מפרט בעת ההשקה. זהו המקרה הברור ביותר בכל הסאגה של מספר שהופץ בתפוצה רחבה מספיק כדי להתייחס אליו כעובדה, בעוד שמעולם לא היה לו מקור מצד הספק.

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

הכרטיס שלמעלה מתעד את מצב טרום־ההשקה כפי שהמאמר הזה בדק אותו לאחרונה: אין מזהה מודל, אין תאריך שחרור, אין מדדי ביצועים מפורסמים. כל שורה בו נעקפה מאז על ידי ההכרזה מ־21 בספטמבר, והוא נשמר כאן מפני שהפער בין הכרטיס ההוא לבין המודל שהושק הוא הסיפור האמיתי של ששת השבועות האחרונים — השקה של מודל חזיתי שלא הניבה שום מפרט מאושר בכלל עד ליום שבו הושק.

• הסתייגות המוכנות היא השאלה הפתוחה, וכעת יש לה ראיות חלקיות. מאסק אמר באמצע ספטמבר כי Grok 4.7 "מסיים את העבודה בטרם עת" במשימות בדרגת קושי גבוהה, ושבדיקת התשובות שלו "אינה קפדנית מספיק" — דבר שייחס לעונש בלמידת חיזוק על תגובות ארוכות שהוגדר גבוה מדי, עם הסתייגות "ייתכן". הודעת ההשקה אינה מתייחסת לכך. התיקון המוצהר של xAI הוא עקיף: למידת חיזוק ארוכה יותר, המשוקללת לעבר משימות בנות שעות רבות, ואימות עצמי טוב יותר הם בדיוק השינוי שהיית עושה כדי לטפל בסיום בטרם עת. תוצאת Coding Agent Index היא הסימן החיצוני הראשון לכך שזה הזיז את המחט — 56 לעומת 47 של Grok 4.6, כאשר Terminal-Bench 4.0 כמעט הוכפל מ-18% ל-33%, שזה בדיוק הקצה של הטווח שאופייני לאופק ארוך ולריבוי צעדים. זו אינה תשובה נקייה, משום שאותם ציוני הרנס הם גם אלה שקונים את ההישגים שלהם עם הרבה יותר אסימוני פלט. האם המודל עדיין נוטש משימות ארוכות וקשות ניתן לבדוק על ידי כל מי שיש לו גישה ל-API, וזה נותר הדבר הראשון ששווה לבדוק.

• מאגר הנתונים של SpaceX עדיין אינו מאומת. תוספת האימון המדווחת — טלמטריית Starlink, יומני לחץ של תא הבעירה של Raptor, טלמטריית חדירה לאטמוספירה של Starship, שרשורי Slack פנימיים, כרטיסי Jira, מאגרי GitHub ורשומות ERP — היא דיווח קהילתי של מה שמאסק אמר, לא חשיפה של החברה. הודעת ההשקה מתארת מודל בסיס גדול יותר והרצת למידת חיזוק ארוכה יותר, ואינה אומרת דבר על המאגר. אם הוא נמצא שם, שום מפרט לא יאשר זאת; הראיה היחידה תהיה אם המודל עושה משהו בעבודת הנדסה אמיתית שעמיתיו אינם יכולים.

ציר הזמן שהחמיץ ארבע פעמים, ומה שהשוק צדק בו

Grok 4.7 הובטח, בפומבי, בחמישה לוחות זמנים נפרדים, וארבעת הראשונים פקעו. ב-24–25 ביולי אמר מאסק כארבעה שבועות, כך שהמשמעות היא 22 באוגוסט. ב-12 באוגוסט הוא תיקן ל"3 עד 4 שבועות", כך שהמשמעות היא 2–9 בספטמבר. ב-2 בספטמבר הוא צמצם לכעשרה ימים, כשהוא מצביע על 12 בספטמבר. ב-11 בספטמבר, היום שבו פג המועד, הוא אמר "עוד כמה ימים". החמישי כלל לא היה חלון — שורה של grok-4.7 בעמוד מכסות של Google Cloud — והוא היה הקרוב ביותר לדיוק: המודל שוחרר ב-21 בספטמבר, זמן קצר לאחר התאריך האחרון שמישהו התחייב לו, ובלי תאריך שהוצמד לארטיפקט שקדם לו.

שוקי התחזיות קראו נכון את לוח הזמנים וטעו לגבי המודל. "SpaceXAI משחררת את Grok 4.7 לפני 18 בספטמבר?" של Kalshi הפסיק להיסחר בשעה 03:59 UTC ב-18 בספטמבר, לאחר שהמחיר האחרון שבו נסחר עמד על 65¢, עם 1,785 חוזים שנסחרו ו-1,211 פתוחים. כל חוזה שנסגר בשני השווקים הגדולים — חלונות 14, 21, 28 ו-31 באוגוסט ו-4, 8 ו-11 בספטמבר של Kalshi, וחוזי 12 ו-14 בספטמבר של Polymarket — נפתרו כ"לא". "המודל הבא של Grok (4.7 ומעלה) שיצא עד 18 בספטמבר?" של Polymarket עמד על 64% ב-15 בספטמבר לאחר שנע בין 42% ל-88.5% לאורך אחד עשר ימים. השוק צדק כשלא נגרר אחרי קפיצות שנגרמו מציוצים, וצדק שגם חלון 18 בספטמבר ייסגר ריק. הוא הקדים בשלושה ימים את המודל, וזה הדבר היחיד שחוזה עם תאריך לא יכול לתמחר.

ספירות הצפיות שוות שמירה כהערת כיול. הספירה לאחור של מאסק ב-2 בספטמבר, "יוצא בעוד 10 ימים", משכה 10.29 מיליון צפיות והייתה שגויה. הנסיגה שלו ב-11 בספטמבר משכה 2.05 מיליון וגם היא הייתה שגויה. הפוסטים שלו על מפת הדרכים ב-13–14 בספטמבר משכו כ-1.99 מיליון והיו הקרובים ביותר להיות נכונים — הוא תיאר את Grok 4.8, מודל עם כ-2.5 טריליון פרמטרים שאומן על סטאק C++ מאפס, כ"שיפור ניכר" לעומת Grok 4.7. החשיפה עקבה אחר ביטחון, לא אחר דיוק, לאורך כל הדרך.

שניים מפריטי מפת הדרכים הם כעת שאלות פתוחות ולא תחזיות. ל-Grok 4.8 אין מזהה מודל, אין תמחור, אין חלון הקשר ואין רשומת בנצ'מרק בשום מקום. והמסגור שלפיו Grok 4.7 עבר בשקט "מיתוג מחדש" ל-Grok 4.8 — פרשנות של כלי תקשורת אחד לכך שמאסק נקב בשם 4.8 בעוד 4.7 התעכב — הוכרע בכיוון ההפוך: 4.7 יצא כ-4.7, ב-46 באינדקס לעומת 44 של Grok 4.6, וזהו תוספת של יורש ולא השקה מחדש.

מה זה אומר עבור צוותים שקוראים ל-Grok היום

התמונה המעשית השתנתה ב-21 בספטמבר, והיא השתנתה בדרך הפחות דרמטית האפשרית: מזהה מודל חדש באותו מחיר, אותו חלון הקשר, שיפור של שתי נקודות ב-Index, שיפור של תשע נקודות בסוכן קידוד ושיפור של 111 נקודות בעבודת ידע. שני שינויים מאז חשובים יותר ממה שהם נראים. אפליקציות Grok מעמידות כעת את המודל לרשות משתמשים רגילים ולא רק מפתחים, והקטלוג בצד הזה מציג אותו כעת — ויחד, אלה הופכים את שכבת הניתוב שתוארה בסוף הכתוב הזה מתוכנית לברירת מחדל. אם מודל העלויות שלכם נבנה על Grok 4.6 במחיר $2/$6, מחיר הטוקן עדיין נכון לגבי Grok 4.7 — אבל מספר הטוקנים לא. ההרצה של Artificial Analysis עצמה שרפה 240 מיליון טוקני פלט ב-Intelligence Index לעומת חציון של 94 מיליון בקרב המודלים שהיא עוקבת אחריהם, כך שאותה בקשה יכולה לעלות יותר מפי שניים למרות שמחירון התעריפים זהה — וזה מסוג השינויים שלעולם אינם מופיעים בטבלת תמחור. תמחרו לולאה סוכנית אמיתית לפי טוקני פלט, לא לפי התעריף למיליון, לפני שאתם מסיקים שהשחרור הזה הוא בחינם. אם הסיבה שלכם לעבור היא חזית המחיר-ביצועים שהספק מצהיר עליה, הראיה החזקה ביותר לכך היא כעת AA-Briefcase ולא הטבלה של הספק: מקום רביעי בלוח הזה בכמחצית מהעלות למשימה של Claude Opus 5, לעומת פער של שבע נקודות ב-Intelligence Index מול Claude Fable 5.1 ופער מחיר של פי חמישה בכיוון ההפוך בקלט ופי יותר משמונה בפלט. ואם עומס העבודה שלכם הוא סוכן קידוד ספציפית, הטיעון חזק יותר מכפי שה-Index מרמז: 56 ב-Coding Agent Index בהרנס Grok Build, לפני GPT-5.6 Sol, הוא ליגה אחרת מ-46 באינטליגנציה כללית. איזה מאלה חשוב יותר תלוי לחלוטין בעומס העבודה שלכם, ואף אחד מחוץ ל-SpaceXAI לא הריץ את Grok 4.7 על שלכם.

בקטלוג של OrcaRouter סדרת Grok כוללת כעת את Grok 4.7 לצד Grok 4.6, Grok 4.5 ו-Grok 4.3, בחיוב לפי מחיר המחירון של הספק עם 0% תוספת — $2 למיליון טוקני קלט ו-$6 למיליון טוקני פלט, קריאות קלט מהמטמון ב-$0.50, ואותו מעבר ל-$4 בקלט ו-$12 בפלט ברגע שבקשה חוצה 200,000 טוקני קלט ש-SpaceXAI גובה. זה מה שמקבלים מהעברה של כרטיס התעריפים כפי שהוא: המחיר לכל טוקן במודל העלויות שלך הוא המחיר לכל טוקן בחשבונית שלך, וכל מודל במשפחה נענה למפתח אחד, כך שהעברת עומס עבודה מ-Grok 4.6 ל-Grok 4.7 היא שינוי מחרוזת ולא חוזה נוסף. העמוד הזה כולל חלון הקשר של 500,000 טוקנים ואותו ממשק תואם OpenAI — Chat Completions ו-Responses — שאינטגרציית Grok 4.6 כבר מכוונת אליו.

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

שכבת הניתוב הזו היא גם הדרך בסיכון נמוך להעריך מודל שהמספרים הבלתי-תלויים שלו פורסמו באותו יום כמו של הספק. רשימת הבנצ'מרקים שלעיל היא עדיין של הספק עצמו — ההערכות שבחר, רמות המאמץ שבחר, עמודות ההשוואה שבחר — ושום דבר ממנה לא שוחזר. מה שהשתנה הוא ששלושת הציונים של Artificial Analysis אינם של הספק, כך שהשאלה עברה מ"האם משהו מזה אמיתי" ל"לאיזו מהתוצאות האלה דומה עומס העבודה שלי": ה-46 שאומר אינטליגנציה כללית בטווח הבינוני, ה-56 שאומר רביעי בקרב סוכני קידוד עם harness מקורי, או ה-1,657 שאומר רביעי בעבודת ידע במחצית מעלות המשימה של החזית. והמספר שמכריע את הכלכלה אינו בנצ'מרק כלל אלא אסימוני הפלט שכל הרצה צורכת, שרק התעבורה שלך עצמך יכולה לתמחר — 240 מיליון לכל הרצת Index במדידה של Artificial Analysis לעומת חציון של 94 מיליון, ובערך 8$ לעומת 4.40$ לכל סט של מצגות לדוגמה בתרחיש הציבורי AA-Briefcase-Lite. מעבר אוטומטי (failover) מאפשר לך לכוון תעבורה אמיתית למודל החדש ולחזור לספק שעדיין עונה אם חשבון האסימונים או התנהגות הנטישה המוקדמת מתבררים גרועים מכפי שפורסם — וזה ההבדל בין לבדוק מודל לא מוכח לבין להמר על צינור שלם עליו.

איך לדעת מראש (הבדיקה שעבדה)

החלק הזה היה בעבר רשימה של אותות למעקב בזמן ההמתנה. ההמתנה הסתיימה, אז הנה אותה רשימה, עם ציון לעומת מה שקרה בפועל.

• רשימת המודלים הייתה האישור, והיא זזה. במשך שישה שבועות העצה במאמר הזה הייתה לעקוב אחר רשימת המודלים של הספק ולא אחרי הציוצים, כי ברגע ש-Grok 4.7 יהיה אמיתי הרשימה תקבל מזהה מודל עם תמחור וחלון הקשר מצורפים. זה מה שקרה: grok-4.7 מופיע כעת עם חלון הקשר של 500K, תמחור של $2/$6 מתחת ל-200K קלט ו-$4/$12 מעליו, חתך ידע של מאי 2026 וארבע רמות מאמץ. כל חלון של מאסק, כל טיעון קצב וכל תאריך שוק לא הצליחו להזיז את הרשימה; השחרור הזיז אותה.

• קטלוגים של צד שלישי מובילים את ההכרזה, והם הצעות ולא פריסות. בקשת המשיכה של הקטלוג מ-21 בספטמבר הייתה הגרסה הברורה ביותר של זה עד כה, וסגירתה מאלפת: תורם הכין עבור מודל, בוט סגר את השינוי בגלל קטע תבנית חסר כעבור שעתיים, והמודל שוחרר יומיים לאחר מכן. יש לקרוא את סוג הארטיפקט הזה ככוונה עם חתימת זמן. הוא באמת במעלה הזרם של ההכרזה, והוא אינו זמינות.

• שימו לב לקטלוג המודלים של OrcaRouterהקטלוג עבר כעת. במהלך כל ספטמבר העצה בכתבה הזו הייתה שדף המודל grok-4.7 ב-orcarouter.ai יהיה האות "ניתן לקרוא לו היום דרכנו", מכיוון שמודל מופיע רק לאחר שספק הטמיע אותו. הקטלוג כולל כעת את Grok 4.7 בתעריף הספק ללא תוספת, כך שלבדיקה שהקורא התבקש להריץ יש תשובה: ניתן לנתב אותו דרך API אחד היום.

• מבחינת נראות בצד הצרכן, אפליקציית Grok הציבה כעת את Grok 4.7 מול משתמשים שלעולם לא יפתחו קונסולת API. בקריאה חוזרת ב-2 באוקטובר, נתוני הבורר ש-grok.com מגיש למבקר שאינו מחובר עדיין מזכירים את המודל בשתיים מתוך ארבע הרשומות שלו — ב-Expert כתוב "חושב לעומק · Grok 4.7" וב-Heavy כתוב "צוות מומחים · Grok 4.7" — ואילו Fast, שהוא המצב שבו האפליקציה נפתחת כברירת מחדל, מתואר רק כ"תגובות מהירות", ו-Auto כבחירה בין Fast ל-Expert. ארבע הרשומות הן Auto, Fast, Expert ו-Heavy. Build לא נכלל בהן: Grok Build הוא מוצר מסוף נפרד בעמוד משלו, וזה העמוד שממנו מגיע למעשה הייחוס של המודל ל-Build — הוא אומר למבקרים "התקינו עכשיו והתחילו לבנות עם Grok 4.7". לכן הטענה שהופצה ב-1 באוקטובר ושוב ב-2 באוקטובר — ש-Grok 4.7 הוא כעת מודל הבסיס ב"Fast, Expert, Build and Heavy" — מציינת מצב שהאפליקציה אינה מגישה ומשמיטה את זה שהיא נפתחת בו, והיא קריאה של הטראקרים ולא של הספק, מפני ש-SpaceXAI לא פרסמה דבר על הפריסה הזו בכלל. הצעד המקביל של Grok 4.5 קיבל פוסט בלוג משלו; לזה יש מוצר שהשתנה בשקט מתחת לעמוד חדשות שלא השתנה.

מצב המשחק

Grok 4.7 שוחרר ב-21 בספטמבר 2026, במחיר של 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט, עם חלון הקשר של 500,000 טוקנים וחיתוך ידע ממאי 2026. מה שהשתנה באחד-עשר הימים מאז הוא מפת הזמינות ולא המודל: Amazon Bedrock הוסיף אותו ב-28 בספטמבר, הוא החל להתפרס באפליקציות הווב והמובייל של Grok עצמה ב-1 באוקטובר ועדיין היה בתהליך התפרסות שם ב-2 באוקטובר, והוא מופיע כעת ב-OrcaRouter בתעריף של SpaceXAI עצמה ללא תוספת. הציונים העצמאיים שלו הגיעו באותו יום של ההשקה ועדיין חלוקים: 46 במאמץ xhigh במדד האינטליגנציה v4.3.2 של Artificial Analysis, שתי נקודות מעל Grok 4.6 ומספיק כדי להציב את SpaceXAI בארבע המעבדות המובילות במדד; 56 במדד סוכני הקידוד בהרנס Grok Build, תשע נקודות מעל Grok 4.6 ורביעי מבין מודלים עם הרנס מקורי, לפני GPT-5.6 Sol; ו-1,657 Elo ב-AA-Briefcase, 111 נקודות מעל Grok 4.6 ורביעי בלוח אחרי שלושה ערכים של Anthropic, בערך במחצית העלות למשימה של Claude Opus 5. כל בנצ'מרק בטבלת ההשקה של הספק הוא של הספק עצמו ולא משוחזר, למעט יוצא דופן אחד: לוח ה-AA-Briefcase של Artificial Analysis עצמו מפרסם את אותו 1,657, והספק מאז תיקן את שורת ה-Terminal-Bench שלו מ-38.0% ל-37.6%. הרווחים בקידוד ובעבודת ידע אמיתיים והם עולים טוקני פלט — 240 מיליון לכל הרצת Index לעומת חציון של 94 מיליון, ובערך 8 דולר לעומת 4.40 דולר לכל סט של מצגות לדוגמה בתרחיש בדיקת הנאותות הציבורי של AA — וזה המספר שמכריע אם ההשקה הזו זולה. הנתון של ~2.1 טריליון פרמטרים שהופץ במשך חודשיים עדיין אין לו מקור מהספק, והסתייגות הנטישה המוקדמת מעולם לא טופלה ישירות, אף שהזינוק ב-Terminal-Bench מ-18% ל-33% בהרנס Grok Build הוא הראיה החיצונית הראשונה שהתיקון עבד. שני האותות שהמאמר הזה אמר לקוראים לעקוב אחריהם התממשו: רשימת המודלים של הספק קיבלה את grok-4.7 עם מחיר וחלון הקשר מצורפים, והקטלוג כאן מפרט אותו באותו תעריף. אז המהלך המנצח פשוט יותר משהיה בספטמבר — Grok 4.6 ב-$2/$6 היה התשובה, ו-Grok 4.7 ב-$2/$6 הוא אותה תשובה עם מזהה מודל חדש יותר, ציוני קידוד ועבודת ידע טובים יותר, חשבון טוקנים גדול בהרבה, ואפליקציית צרכנים שמציינת אותו בשני המצבים הקשים ביותר שלה.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית