כרטיס כותרת ראשי שנוצר עבור מאמר שכותרתו 'Grok 4.7 vs Qwen 3.8 Max — הטלת מטבע על הנייר', עם כותרת המשנה 'מחיר זהה, בהפרש של נקודת מדד אחת, צורות מנוגדות' וצ׳יפים סטטיסטיים המציגים AA Index 46 מול 45, מחיר $2/$6 בשניהם, והקשר 500K מול 984K.
Guides & Insights

Grok 4.7 מול Qwen 3.8 Max: מחיר זהה, פער של נקודה אחת, צורות מנוגדות

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלי דגל סגורים, שניהם במחיר של 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט, שניהם עם ציון שנמצא בפער של נקודה אחת זה מזה באותו מבחן עצמאי, ושוחררו בהפרש של תשעה עשר ימים. Grok 4.7 הגיע ב-21 בספטמבר 2026 מ-SpaceXAI; Qwen 3.8 Max שוחרר על ידי הספק ב-3 באוגוסט 2026 ורוענן ב-2 בספטמבר 2026. במדד Artificial Analysis Intelligence Index הנוכחי, גרסה v4.3.2, Grok 4.7 מקבל ציון 46 ו-Qwen 3.8 Max מקבל ציון 45. מבחינת מחיר ויכולת נמדדת, שני המודלים האלה הם אותה עסקה. בכל דבר אחר — הקשר, מודאליות, מהירות שירות, פתיחות, ומה שכל ספק בחר לייעל — הם לא יכולים להיות שונים יותר, וזה מה שהופך את ההשוואה הזו לשווה הרצה ולא לדילוג.

ראשית, לוח הזמנים, כי ל-Qwen 3.8 Max יש שני תאריכים

זה מבלבל הרבה סיקורים, ולכן כדאי ליישר קו כבר בהתחלה. Qwen 3.8 Max הושק ב-3 באוגוסט 2026 כמודל הגדול והמסוגל ביותר של Alibaba, שנבנה מארכיטקטורת ראייה-שפה של Qwen 3.5 על בסיס עיצוב sparse mixture-of-experts עם דיווח של 2.4 טריליון פרמטרים בסך הכול ו-95 מיליארד פעילים לכל טוקן. ב-2 בספטמבר 2026 Alibaba הוציאה גרסה מחודשת — מהדורת 0902, שהיא הגרסה הנושאת את מזהי המודל העדכניים והגרסה ש-Artificial Analysis מתארכת את העמוד שלה לפיה. אם ראיתם גם תאריך מאוגוסט וגם תאריך מספטמבר עבור Qwen 3.8 Max, זו הסיבה: האחד הוא ההשקה, והשני הוא המהדורה שרוב האנשים מתייחסים אליה בפועל כיום.

ל-Grok 4.7 יש היסטוריה נקייה יותר ואחת מבולגנת יותר מאחוריה. SpaceXAI השיקה אותו ב-21 בספטמבר 2026 לאחר השקה שנדחתה שוב ושוב — מאסק הצביע על חלונות בסוף אוגוסט, בתחילת ספטמבר ובאמצע ספטמבר לפני שהמודל יצא בפועל. ההשקה עצמה הייתה מצומצמת: מודל בסיס גדול יותר מאשר Grok 4.6, ריצת למידת חיזוק ארוכה יותר שכוונה למשימות בנות שעות רבות, וללא שינוי בתעריפון של $2/$6 ש-Grok 4.6 נשא מאז 12 באוגוסט.

עבור מה כל ספק ביצע אופטימיזציה

קרא את שתי הודעות ההשקה כזוג וההימורים העיצוביים כמעט מנוגדים לחלוטין.

SpaceXAI מותאמת לביצוע סוכני. הנתונים המדווחים על ידי הספק של Grok 4.7 מתרכזים בעבודה בטרמינל ובמאגרי קוד: Terminal-Bench 4.0 ב-38.0% לעומת 20.3% של Grok 4.6, CursorBench 4.0 ב-46.3%, DeepSWE v1.1 ב-71.0% במאמץ חשיבה גבוה, EEBench ב-64.0%. התיאור של החברה עצמה את השחרור מציין אימות עצמי וטיפול בהקשר ארוך בתוך סביבת Grok Bot כיעדים. Grok 4.7 משרת חלון של 500,000 טוקנים, מקבל טקסט ותמונות, מחזיר טקסט, וחושף מאמץ חשיבה מ-low עד xhigh. זהו מודל שנבנה להשלים משימות.

Alibaba עשתה אופטימיזציה לטווח. Qwen 3.8 Max מציע חלון הקשר של כ־984,000 טוקנים — למעשה מיליון — והחוזקות שלו כפי שפורסמו הן רוחב ולא עומק בתחום אחד: ציון Terminal Bench 2.1 של 86.6, SWE-bench Pro של 67.7, PaperBench של 93.0, GPQA Diamond של 92.6, MMMU-Pro של 82.3, OSWorld-Verified של 86.1. הוא מקבל קלט טקסט, תמונה ווידאו ומחזיר טקסט, תומך ברמות מאמץ חשיבה כאשר xhigh היא ברירת המחדל, והנקודה החלשה יותר מבין אלו שפורסמו היא Humanity's Last Exam עם 43.6. זהו מודל שנבנה להתמודד עם כל מה שתמסור לו.

כל נתון בפסקה ההיא הוא דיווח של הספק. אף אחד מהסטים לא שוחזר באופן בלתי תלוי, וממילא שני הסטים אינם ניתנים להשוואה ישירה — Terminal-Bench 2.1 ו-Terminal-Bench 4.0 הם בנצ'מרקים שונים, ולכן אסור להעמיד את 86.6 של Qwen ואת 38.0 של Grok זה לצד זה, לעולם.

• מדד משולב עצמאי — Grok 4.7 46 במדד AA Intelligence Index v4.3.2 לעומת Qwen 3.8 Max 45 באותה גרסה. תיקו סטטיסטי.

• מחיר למיליון טוקנים — $2.00 קלט / $6.00 פלט בשניהם. הנחת המטמון של Qwen רשומה כ-88%, מה שנותן תעריף משוקלל של $1.18 למיליון; תנאי המטמון של Grok 4.7 אינם מפורסמים על אותו בסיס.

• חלון הקשר — Grok 4.7 500,000 טוקנים לעומת Qwen 3.8 Max כ-984,000. Qwen מנצחת בכמעט פי שניים, וזהו ההבדל הגדול ביותר במפרט ביניהם.

• מודאליות קלט — Grok 4.7 טקסט ותמונה לעומת Qwen 3.8 Max טקסט, תמונה ווידאו.

• משקלים — שניהם קנייניים. לא ניתן להוריד אף אחד מהמודלים, מה שמסיר מהשוואה הזו לחלוטין את הטיעון הרגיל בדבר משקלים פתוחים.

• פרמטרים — Grok 4.7 לא נחשף באף גיליון מפרטים של SpaceXAI (הנתון של ~2.1T הוא טענה של מאסק) לעומת Qwen 3.8 Max שדווח על 2.4T בסך הכול עם 95B פעילים, שגם עליבאבא לא אישרה בגיליון מפרט.

• מהירות שירות — Qwen 3.8 Max ב-38.8 אסימוני פלט לשנייה עם 3.08 שניות לאסימון הראשון, לפי Artificial Analysis; Grok 4.7 ממוקם על ידי SpaceXAI כבערך פי שניים מהר יותר ממודלים דומים, לפי דיווח הספק, ללא נתון תפוקה עצמאי שפורסם עדיין.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

ההבדל בהקשר הוא ההחלטה האמיתית

כאשר המחיר והיכולת זהים, ההכרעה עוברת לכל מה שאחר שונה, וכאן זה ההקשר. הכפלת החלון מ-500,000 לכ-984,000 טוקנים אינה קישוט במפרט — זה ההבדל בין לפצל מאגר לבין להחזיק אותו.

החלון הארוך יותר של Qwen 3.8 Max מגיע עם הסתייגות מתועדת שחשובה לקונים: גרסת המשקולות הפתוחות ש-Alibaba הכריזה עליה לשבוע שמתחיל ב-10 באוגוסט 2026 הייתה טקסט בלבד ולא כללה את מלוא ההקשר של מיליון טוקנים. זה לא משפיע על נקודת הקצה המתארחת שההשוואה הזו עוסקת בה, אבל כדאי לדעת זאת אם תכננתם סביב השחרור הפתוח.

ישנו שיקול שני בצד של Grok. סדרת Grok יישמה היסטורית מצוק תמחור ב-200,000 אסימוני קלט, שבו בקשה שחוצה את הסף מתמחרת מחדש את כל הבקשה בתעריף כפול — $4 בקלט ו-$12 בפלט. עם חלון של 500,000 אסימונים, הסף הזה נמצא היטב בתוך טווח העבודה של המודל. לפני ניתוב עבודה עם הקשר ארוך אל Grok 4.7, ודא את מחירון התעריפים הנוכחי עבור המודל הפרוס, משום שהאינטראקציה בין חלון גדול לבין מצוק תמחור היא המקום שבו חשבונות ההקשר הארוך משתבשים.

מה עולה חודש עבודה על כל אחד

מכיוון שתעריפי הכותרת זהים, השוואת העלויות חייבת להיבנות מהתנהגות הטוקנים ולא ממחירון התעריפים, ושם שני המודלים נבדלים זה מזה באופן מדיד.

Artificial Analysis מדדה ש-Grok 4.7 מייצר 240 מיליון אסימוני פלט בזמן הרצת Intelligence Index שלה, לעומת חציון של 92 מיליון בקרב המודלים בלוח — הוא מודל חשיבה עתיר מילים. Qwen 3.8 Max ייצר 190 מיליון אסימוני פלט באותו מדד, עם עלות הערכה כוללת של $4,934.79 וקצב נמדד של 38.8 אסימונים לשנייה. שניהם מעל בהרבה מחציון המילוליות, ו-Grok 4.7 הוא המילולי יותר מבין השניים.

אז במחיר זהה של $6 למיליון טוקנים בפלט, המודל שפולט יותר טוקנים לכל משימה עולה יותר לכל משימה. נתוני המילוליות שפורסמו מרמזים ש-Grok 4.7 יצרוך יותר טוקני פלט עבור עבודת אינדוקס שקולה, מה שאומר שהשוויון במחיר הוא למעשה ניצחון קטן ל-Qwen 3.8 Max בעלות לכל משימה — שמקוזז על ידי יתרון המהירות המוצהר של Grok 4.7, שמקצר את זמן השעון ולכן את העלות האנושית של המתנה להרצת סוכן. אף אחד מהקיזוזים האלה לא נראה במחירון, ושניהם ראויים למדידה בתעבורה שלך במקום להניח.

האסימטריה היחידה שאינה שנויה במחלוקת היא שמירה במטמון. Qwen 3.8 Max מפרסם הנחת מטמון של 88% ותעריף משוקלל של $1.18 בתמהיל של 7:2:1 של פגיעות מטמון/קלט/פלט. עבור עומסי עבודה עם תחילית יציבה גדולה — הנחיית מערכת, כותרת בסיס קוד, סט מסמכים — ההנחה הזו היא המקום שבו החיסכון האמיתי נמצא, וכדאי לבדוק כיצד תנאי המטמון של Grok 4.7 משתווים לפני שאתם מתחייבים לנפח שימוש.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

לבחור, כשהמספרים מסרבים לבחור בשבילך

46 ו-45 באותו מדד ובאותו מחיר הם קרובים לתיקו אמיתי ככל שהבלוג הזה עשוי לפרסם. פירוש הדבר הוא שההחלטה צריכה להתקבל לפי הצירים שבהם שני הדגמים נבדלים בפועל, ויש ארבעה כאלה.

בחרו ב-Grok 4.7 אם העבודה שלכם היא קידוד סוכני והרצה במסוף, אם מהירות זמן־קיר בהרצות ארוכות חשובה לכם יותר ממרחב הקשר, ואם אתם רוצים חוגת חשיבה לכל בקשה כדי לשמור על תעבורה קלה בזול. בחרו ב-Qwen 3.8 Max אם אתם מתמודדים באופן שגרתי עם קלטים גדולים מחצי מיליון טוקנים, אם קלט וידאו נמצא במפת הדרכים שלכם, אם אתם רוצים את הנחת המטמון של 88% לעומסי עבודה עתירי־קידומת, או אם אתם רוצים מודל שהספק שלו מפרסם מטריצת הערכה רחבה ולא כזו המרוכזת בנתיב בודד.

אם התשובה הכנה היא "קצת משניהם", זו התשובה הרגילה, וזה בדיוק המקרה שהצמד הזה נבנה עבורו. Qwen 3.8 Max זמין ב-OrcaRouter במחיר המחירון של Alibaba, ו-OrcaRouter מעבירה את מחירי המחירון של הספקים הלאה עם 0% תוספת, כך שה-$2/$6 שלמעלה הם מה שאתם משלמים בפועל, ושינוי בתעריף של ספק נכנס לתוקף כאן באותו יום ולא בעת החידוש. מפתח API אחד מכסה את Qwen 3.8 Max ובנוסף למעלה מ-200 מודלים אחרים, מה שאומר שההחלטה לגבי הקונטקסט הופכת לכלל ניתוב לפי בקשה במקום להתחייבות לפלטפורמה: שלחו את הקלטים העצומים לחלון של 984k והשאירו את כל השאר בנקודת הקצה המהירה והזולה ביותר עבור אותה משימה, עם מעבר אוטומטי אם ספק מתדרדר. במקום שבו משימה באמת זקוקה לשתי הצורות — קריאה בקונטקסט ארוך ואחריה מעבר ביצוע סוכני — ה-DSL של הניתוב מרכיב מודלים לקריאה אחת במקום לאלץ אתכם לבחור צד.

הבהרה אחת שראויה להיאמר, מאחר שאף אחד מהמודלים אינו פתוח: שום דבר בהשוואה הזו אינו כרוך במשקולות שניתן להוריד. שניהם נקודות קצה מתארחות, ואירוח עצמי אינו אפשרות לאף אחד מהם.

המספר האחד שכדאי לזכור

ארבעים ושש מול ארבעים וחמש אינו סיבה לבחור מודל, וזה גם לא אמור להיות. מה שמכריע בהשוואה הזו הוא חלון ההקשר — 500,000 טוקנים מול כ-984,000 — והצורה שכל ספק בחר: Grok 4.7 מותאם לסיים מהר משימות סוכניות קשות, Qwen 3.8 Max מותאם להתמודד עם כל מה שתיתן לו. אותו מחיר, אותה יכולת מדודה, משימות שונות. זו החלטת ניתוב, וזה סוג ההחלטה שאמור לקחת אחר צהריים לבדיקה ולא רבעון לרכש.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית