
Grok 4.5 מול GPT-6 Astra: פי שישה ממחיר המחירון, פי שלושה מהחשבון
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
הציבו את Grok 4.5 ואת GPT-6 Astra זה לצד זה על כרטיסי התעריפים שלהם, והפער נראה אבסורדי: $2.00 מול $10.00 למיליון אסימוני קלט, $6.00 מול $50.00 למיליון בפלט. הריצו את אותם שניים דרך Artificial Analysis's Intelligence Index, והפער מצטמצם למשהו שצוות יכול ממש להתווכח עליו — $1.04 למשימה שהושלמה מול $3.26. מכפיל המחיר המוצהר הוא פי 5 בקלט ופי 8.3 בפלט. מכפיל החיוב, כפי שנמדד על ספירות אסימונים אמיתיות, הוא קצת יותר מפי 3. והממד שבו שני המודלים האלה נבדלים הכי הרבה הוא לא אף אחד מאלה. זה כמה זמן ממתינים לאסימון הראשון, כשהמדידה הבלתי תלויה היא 10.94 שניות מול 342.30.
זה כל העימות בפסקה אחת, וזו הסיבה שהעמוד הזה אינו הכתרה לאף כיוון. GPT-6 Astra הוא המודל האינטליגנטי יותר בפער ברור וניתן לשחזור. Grok 4.5 הוא הזול יותר בפער אמיתי אך קטן במידה ניכרת מכפי שמרמזת רשימת המחירים שלו. כל השאר — מהירות, יעילות טוקנים, הקשר, מבחני הקידוד — או שמתפצל, מסתיים בתיקו, או מתברר שנמדד בשני סרגלים שונים.
אף אחד מאלה אינו דגם חדש
ראוי לומר זאת בפשטות, כי הרבה עמודי השוואה נקראים כאילו שניהם הגיעו רק בשבוע שעבר.
xAI השיקה את Grok 4.5 ב-8 ביולי 2026. הוא בנוי על תשתית V9 בת 1.5 טריליון פרמטרים ואומן במשותף עם Cursor על נתוני הפעלות מפתחים ולא רק על קוד סטטי, ומשם מגיע המוניטין שלו בקידוד סוכני. יש לו חלון הקשר של 500,000 טוקנים. רשימת המודלים של הספק עצמו עדיין כוללת אותו היום, לצד שני ממשיכים — xAI השיקה מאז את Grok 4.6 ו-Grok 4.7 — לכן התייחסו אל Grok 4.5 כאל דרגת ה-$2/$6 של סדרת Grok ולא כאל הדגם הבכיר בה.
OpenAI הכריזה על GPT-6 Astra ב-3 בספטמבר 2026, עם השקה מדורגת לאורך הימים שלאחר מכן, והוא נותר דגם הדגל של OpenAI: חלון הקשר של מיליון טוקנים (הקטלוג של OrcaRouter מפרט 1,050,000 קלט ו-128,000 פלט מרבי), נקודת חיתוך ידע של 30 באפריל 2026, ומיצוב ישיר בעבודה סוכנית לטווח ארוך — שימוש במחשב, מחקר, משימות מדעיות ואבטחת סייבר. לפי OpenAI עצמה, זהו המודל הראשון שעובר את סף אבטחת הסייבר ה"קריטי" שלה, וזו גם הסיבה שהגישה הארגונית כבויה כברירת מחדל עד שמנהל מפעיל אותה.
שניהם זמינים באופן כללי ב-API של הספקים שלהם. אף אחד מהם לא מושק. הדבר היחיד שזז השבוע הוא המשפחה סביב אחד מהם, וזה מופיע בסוף הקטע הזה מכיוון שזה משנה את ההמלצה ולא את ההשוואה.
כרטיסי התעריפים, כולל המדרגה שאף אחד לא מצטט
• קלט, הקשר קצר — Grok 4.5 $2.00 לכל 1M לעומת GPT-6 Astra $10.00 לכל 1M
• פלט, הקשר קצר — Grok 4.5 $6.00 לכל מיליון לעומת GPT-6 Astra $50.00 לכל מיליון
• קלט במטמון — Grok 4.5 $0.30 ל-1M לעומת GPT-6 Astra $1.00 ל-1M
• קלט עם הקשר ארוך — Grok 4.5 $4.00 לכל 1M לעומת GPT-6 Astra $20.00 לכל 1M
• פלט הקשר ארוך — Grok 4.5 $12.00 לכל 1M לעומת GPT-6 Astra $75.00 לכל 1M
• חלון הקשר — Grok 4.5 500,000 טוקנים לעומת GPT-6 Astra 1,000,000 טוקנים
הסעיף שחשוב הוא זה שכמעט אף עמוד השוואה לא מציג. ב-Grok 4.5, ברגע שהפרומפט של בקשה מגיע ל-200,000 טוקנים, כל הבקשה מתומחרת מחדש במדרג הגבוה יותר — התיעוד של xAI מפורש שהחיוב הוא "בתעריף הגבוה עבור כל הטוקנים בבקשה", ולא רק עבור הטוקנים שמעבר לקו. אז חלון 500,000 הטוקנים הוא אמיתי, אבל בערך 60% העליונים שלו מחויבים בתעריף כפול. עמוד התמחור של OpenAI עבור Astra מציג את אותו מבנה דו-טורי של קצר/ארוך בלי לציין היכן נמצאת נקודת המעבר שלו, לכן התייחסו לעמודת ההקשר הארוך כאל זו שחלה כשאתם עובדים בהיקף גדול, ואמתו את הגבול מול החשבונית שלכם.

שני מכפילים ברמת השירות יושבים מעל המספרים של Astra: Batch ו-Flex פועלים במחצית התעריף הסטנדרטי, ומצב Fast פועל בכפול — $20.00 קלט ו-$100.00 פלט בהקשר קצר. ל-Grok 4.5 אין שכבת Batch בגיליון של xAI; המנופים שלו הם הנחת ה-Cache ועיבוד בעדיפות ב-2x.
העמדה שלנו בכל העניין הזה משעממת במכוון: ב-OrcaRouter מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך ששני לוחות התעריפים שלמעלה פעילים אצלנו באותו היום שבו מי מהספקים משנה אותם, וטוקנים שנשמרו במטמון מחויבים לפי תעריף המטמון של הספק ולא לפי מחיר מלא. אין מספר שני שצריך להתאים.
מה העלות האמיתית של עומס עבודה
מחירי המדבקה הם מדריך גרוע כאן, מפני ששני המודלים לא מוציאים את אותו מספר טוקנים כדי לסיים את אותה עבודה. קחו משימת סוכן קידוד עם הקשר של מאגר בגודל 120,000 טוקנים ותשובה של 25,000 טוקנים. ב-Grok 4.5 זה $0.24 של קלט ו-$0.15 של פלט, כלומר $0.39. ב-GPT-6 Astra זה $1.20 ו-$1.25, כלומר $2.45. פער של פי 6.3.
כעת דחוף את הפרומפט מעבר לסף ההקשר הארוך: 300,000 טוקנים בקלט, 20,000 בפלט. Grok 4.5 גובה 1.20 דולר ועוד 0.24 דולר, או 1.44 דולר. GPT-6 Astra גובה 6.00 דולר ועוד 1.50 דולר, או 7.50 דולר. הפער מצטמצם ל-5.2x, מפני ששתי הספקיות מכפילות את תעריף הקלט, ומכפיל הפלט של Astra מצטמצם בדרגה העליונה.
אף אחד מאלה אינו מה ש-Artificial Analysis מודדת, והמספר שלה הוא השימושי יותר. בהרצת ה-Intelligence Index המלא, העלות הממוצעת למשימה שהושלמה היא $1.04 עבור Grok 4.5 במאמץ גבוה ו-$3.26 עבור GPT-6 Astra במאמץ מקסימלי. הסיבה לכך שהמכפיל יורד ל-3.1x כאשר מחיר הקלט שונה פי 5 היא יעילות אסימונים: לאורך המדד, Grok 4.5 יצר 77M אסימוני פלט ו-Astra יצרה 60M. המודל Astra הוא התמציתי יותר, ולכן הוא סוגר חלק מהפער שהוא פתח במחיר. אם ציטטתם "זול פי חמישה" במסמך תקציב, 3x הוא המספר שיופיע בחשבונית.
במהירות יש תיקו. בהשהיה לא.
זהו הממצא שהפתיע אותנו, והוא מנוגד לאינטואיציה שהמודל הזול הוא המהיר.
Artificial Analysis מודדת את Grok 4.5 ב-55 אסימוני פלט לשנייה ואת GPT-6 Astra ב-58. זהו הבדל של 5% באותה גרסת מדד, והסיכום של AA עצמה מתאר את שניהם כאיטיים מהממוצע — חציון ההשוואה הוא 74 אסימונים לשנייה. אם תפוקה היא קריטריון הבחירה שלך, שני הדגמים האלה אינם נבדלים. אמור זאת בפשטות במקום לייצר מנצח: במספר המהירות האחד שנמדד באותה צורה לשניהם, הם שווים.
השהיה מפרידה ביניהם באלימות. AA מעמידה את הזמן של Grok 4.5 עד לטוקן התשובה הראשון על 10.94 שניות, עם 20.01 שניות מקצה לקצה; GPT-6 Astra על 342.30 שניות עם 350.91 שניות מקצה לקצה. זה בערך פי 31, ובבקשה סינכרונית זה ההבדל בין ספינר להפסקת קפה.
שתי הסתייגויות כנות לפני שמישהו מתקצב על סמך זה. ראשית, אלה נתונים שכוללים חשיבה — "הזמן לאסימון התשובה הראשון" של AA סופר בכוונה את זמן החשיבה של המודל — כך שהם מתארים משימה קשה, לא סבב שיחה. שנית, אין התאמת מאמץ: הרשומה המפורסמת של Astra היא במאמץ מקסימלי, וזו של Grok 4.5 במאמץ גבוה, והגדרת המאמץ היא בדיוק החוגה שמזיזה את המספר הזה. הרשומה של OrcaRouter עצמה עבור GPT-6 Astra מציגה זמן p50 עד לאסימון ראשון של 8.31 שניות ו-p95 של 10.00 שניות בתעבורה חיה, שזו נקודת מדידה שונה לחלוטין — אסימון ראשון בקריאות ייצור אמיתיות, לא אסימון תשובה ראשון במשימת בנצ'מרק. אין להשוות ביניהם ואין להציב אותם באותו משפט כהשוואה.

בנצ'מרקים לקידוד: בדוק את הגרסה לפני שאתה מצטט אותה
חפשו את ההתמודדות הזו ותמצאו את 83.3% של Grok 4.5 ב-Terminal-Bench 2.1 לעומת 57.9% של GPT-6 Astra ב-Terminal-Bench 4.0. אלה מדדים שונים עם אותו שם. אי אפשר להשוות ביניהם, ודפי ההשוואה שעורמים אותם זה על זה לא אומרים לכם דבר.
לרוב נתוני הקידוד המפורסמים של שני הספקים יש את הבעיה הזו. הגיליון של xAI עבור Grok 4.5 מדווח על SWE-bench Pro 64.7%, Terminal-Bench 2.1 83.3%, DeepSWE 1.0 62.0% ו-DeepSWE 1.1 53%. הגיליון של OpenAI עבור Astra מדווח על Terminal-Bench 4.0 57.9%, OSWorld 2.0 72.6%, FrontierMath Tier 4 97.6% ו-ARC-AGI-3 99.9%. הכול מדווח על ידי הספקים, וכמעט אין ביניהם חפיפה.
יש מקום אחד שבו השניים נפגשים באמת על אותה ערכת הרצה: DeepSWE v1.1 של Datacurve, שמריצה כל מודל דרך אותו שלד mini-swe-agent על 113 משימות מקוריות ונקיות מזיהום. שם, GPT-6 Astra משיג 74.1% בעלות של כ-6.52 דולר למשימה, בעוד ש-Grok 4.5 מגיע ל-53%. זו התוצאה הבודדת הנקייה ביותר בעמוד הזה, והיא מטה את הכף לטובת Astra באופן חד-משמעי. הסתייגות נוספת אחת הספציפית ל-Grok 4.5: הנתון של CursorBench מבית xAI הוצא מהשוואה פומבית לאחר שהתגלה שמאגר קוד קודם דלף לתוך האימון, לכן יש להתייחס לכל מספר CursorBench עבור מודל זה כבלתי שמיש.
התנהגות אג'נטית וקריאה לכלים
שניהם נוקטים דרכים שונות כדי להגיע לאותו יעד, וההבדל הוא ארכיטקטוני ולא בציון.
תכונותיו של GPT-6 Astra המיועדות למפתחים מניחות שאתם בונים אורקסטרטור. הוא תומך בקריאה אסינכרונית לכלים, כך שהמתנה לכלי אינה חוסמת את המודל מלהמשיך בעבודה אחרת; בהיגוי מחדש באמצע המשימה דרך WebSockets, כך שניתן לשנות את כיוונה של ריצה פעילה בלי להפעיל אותה מחדש; ובמאמץ חשיבה שניתן להתכוונן באמצע השיחה. ב-Codex הוא מוסיף מנגנון שימור הקשר ששומר הערות לאורך חלונות הקשר, בעוד ההקשר המוקדם נשאר ניתן לחיפוש. לפי הדיווחים, כרטיס המערכת של OpenAI עצמה מציין שהמודל קשה יותר לניטור מקודמו, וזו סיבה להתייחס ליומני קריאות לכלים ולמצב המערכת — ולא לנרטיב של המודל — כראיות הביקורת שלכם.
הסיפור הסוכני של Grok 4.5 הוא פחות על פרימיטיבים חדשים ויותר על היכן שהוא אומן. אימון משותף עם Cursor על סשנים אמיתיים של עריכת קבצים מרובים ותיקון באגים הוא הדבר ש-xAI מייחסת לו את יעילות הטוקנים שלה במשימות תוכנה, וזו הסיבה שהמודל מופיע כברירת מחדל במשטחי קידוד ולא כספינת דגל למטרות כלליות. קריאה לפונקציות, פלט מובנה, סטרימינג ומטמון פרומפטים נתמכים כולם; קריאה לכלים עוקבת אחר הצורה התואמת ל-OpenAI, ולכן הכנסתו ללקוח קיים היא שינוי base-URL.
אין בנצ'מרק סוכני עצמאי משותף שבו שניהם מופיעים במאמץ תואם, ולכן לא נמציא מנצח כאן. מה שאפשר לומר הוא שמשטח קריאות הכלים של Astra הוא הביטויי יותר מבין השניים לעבודה בטווח ארוך, וכלכלת הטוקנים לכל משימה של Grok 4.5 היא האטרקטיבית יותר לעבודה בנפח גבוה.
בחר ב-Grok 4.5 אם
• אתה מריץ עבודה בנפח גבוה או בתדירות גבוהה, שבה העלות לכל משימה שולטת בהחלטה, ו-39 ב-AA Intelligence Index עובר את רף האיכות שלך.
• הפרומפטים שלך נמצאים מתחת ל-200,000 טוקנים. זה המקום שבו יתרון המחיר של Grok 4.5 הוא הרחב ביותר, והתמחור מחדש של הקשר ארוך אינו מופעל לעולם.
• אתה רוצה הנחת מטמון שעושה עבודה אמיתית. במחיר של $0.30 למיליון טוקני קלט במטמון לעומת $1.00 של Astra, עומסי עבודה עם קידומת חוזרת — הנחיות מערכת ארוכות, הקשר משותף של ריפו — נעשים זולים במהירות.
• עליך להשיג השהיה של פחות מדקה עד לטוקן הראשון במשימות קשות, ואין ביכולתך לספוג המתנה של מספר דקות.
בחר GPT-6 Astra אם
• המשימה היא המוצר, והחשבון הוא שגיאת עיגול לעומת תשובה שגויה. ארבע עשרה נקודות מדד בקצה הזה של העקומה הן פער אמיתי ביכולת, לא פער שיווקי.
• אתה עובד באמת מעבר ל-500,000 טוקנים. החלון של Astra הוא בערך פי שניים מזה של Grok 4.5, והוא היחיד מבין השניים שמגיע אליו בלי סעיף תמחור מחדש.
• אתה זקוק לשימוש במחשב, למחקר מעמיק, או למצב אבטחת הסייבר — כולל הבקרות שמושבתות כברירת מחדל בארגונים, המגיעות עם סף ה-Critical של OpenAI.
• אתה כותב קוד מתזמר שרוצה קריאות כלים אסינכרוניות והיגוי במהלך הריצה, במקום קריאה ישירה מסוג בקשה–תגובה.
מה זז השבוע, ולמה זה משנה את ההמלצה
ב-22 בספטמבר 2026, OpenAI השיקה את GPT-6 Sol ו-GPT-6 Luna במחירים של 2.00$/10.00$ ו-0.10$/0.50$ למיליון טוקנים, ותיארה את התעריפים כקבועים ולא כקידומיים. Sol הוא המודל בדרג הביניים לקידוד וניתוח, בכ-חמישית ממחיר הקלט של Astra.
זה משנה להחלטה המדויקת הזו. אם הסיבה ששקלת את Grok 4.5 מול GPT-6 Astra הייתה מחיר, ההשוואה הכנה בצד של OpenAI היא כבר לא Astra — Astra הוא דגם הדגל, ו-Sol תופס כעת את הדרגה שבה Grok 4.5 למעשה מתחרה. Grok 4.5 עדיין זול מ-Sol בפלט ($6.00 לעומת $10.00) ומשתווה לו בקלט ($2.00 כל אחד), כך שהוא לא נדחק הצידה; אבל השוואה שנכתבה לפני השבוע השוותה דגם ערך מול דגם דגל וקראה לתוצאה סיפור מחיר.
אותו הדבר נכון גם בצד של xAI: רשימת המודלים של xAI עצמה כוללת את grok-4.6 ו-grok-4.7 לצד grok-4.5, כך ש-Grok 4.5 הוא אפשרות אחת במשפחה ולא החזית הנוכחית.

וזהו הטיעון האמיתי בעד ניתוב במקום בחירה. מערך שני המודלים שמופיע שוב ושוב בכתבות של אנשי מקצוע — לשלוח את עיקר העומס למודל הזול, ולהסלים את הזנב הקשה לזה היקר — הוא החלטת ניתוב, והיא כזו שאפשר לבטא כקונפיגורציה במקום שכתוב מחדש. OrcaRouter מציב את שני המודלים מאחורי API אחד ומפתח אחד, עם העברת מחיר המחירון של הספק הלאה בתוספת של 0%, מעבר אוטומטי בין ספקים בעת כשל, ו-DSL לניתוב שמאפשר לך לשלוח עבודה שמתחת לסף אל grok/grok-4.5 ולהסלים אל openai/gpt-6-astra כאשר משימה נכשלת או חוצה קו גודל. אפשר לנסות את המסלול היקר על פרוסה צרה של תנועה בלי להמר עליו את צינור הייצור שלך.
הגרסה הקצרה
GPT-6 Astra הוא המודל הטוב יותר. זה לא צמוד, והעמוד הזה היה חסר ערך אילו היה מעמיד פנים אחרת — 53 מול 39 באותה גרסת אינדקס, 74.1% מול 53% במבחן הקידוד היחיד ששניהם עברו.
Grok 4.5 הוא המודל הזול יותר, אך בפי 3.1 לכל משימה שהושלמה ולא בפי 5 עד 8.3 כפי שמשתמע ממחירון שלו, מפני ש-Astra מוציאה פחות טוקנים כדי להגיע לשם. ובמדד המהירות האחד שנמדד באופן זהה עבור שניהם, הם באותה רמה.
ההחלטה אינה איזה מודל מנצח. היא אם פער של 14 נקודות במדד שווה בערך לפי שלושה מהחשבון בעומס העבודה הספציפי שלך — ואם התשובה זהה עבור כל בקשה שאתה שולח.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
