
Fugu Ultra v2 לעומת Grok 4.6: פי חמישה ממחיר הפלט, בנצ'מרק משותף אחד
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
יש בדיוק בנצ'מרק אחד שעליו Fugu Ultra v2 וגם Grok 4.6 מפרסמים מספר, והוא DeepSWE: Sakana AI מדווחת 74.3 עבור Fugu Ultra v2 בהודעה שלה מ-11 בספטמבר 2026, בעוד שחומר ההשקה של xAI ל-Grok 4.6 מציב את ציונו ב-DeepSWE v1.1 על 65.9%. זהו פער של 8.4 נקודות, וזו ההשוואה הנקייה היחידה ששתי החברות מציעות. כל דבר אחר שאולי תשוו — Chartography ו-SWEFish של Sakana מול GPQA Diamond ו-CursorBench של Grok — נמדד במכשירים שונים על ידי מעבדות שונות. אז השאלה הכנה היא לא "איזה מהם חכם יותר". היא האם היתרון הנטען של Fugu Ultra v2 שווה לשלם עליו 30 דולר למיליון טוקני פלט, כאשר Grok 4.6 גובה 6 דולר.
שתי תשובות שונות לאותה בעיה
Grok 4.6 הוא מודל יחיד, והוא הדגל הנוכחי של סדרת Grok — רשום כ"Latest" בתיעוד המפתחים של הספק עצמו, ומחליף את Grok 4.5 עם אותו חלון הקשר של 500,000 טוקנים, אותו משטח קלט של טקסט/תמונה/קובץ ואותם מחירי בסיס. מועד חיתוך הידע שלו הוא 1 בפברואר 2026, והוא חושף עוצמת חשיבה ברמות low, medium, high ו-xhigh, כאשר high הוא ברירת המחדל. פרט אחד שמפתיע אנשים: לא ניתן לכבות את החשיבה. טוקני חשיבה מחויבים בכל בקשה, מה שהופך את עלות הפלט האמיתית של Grok 4.6 לתלויה בכמה קשה הוא יחליט לחשוב.
Fugu Ultra v2 אינו מודל כלל במובן הרגיל. זהו דרג היכולת השיאית של קו התזמור של Sakana AI — נקודת קצה אחת תואמת OpenAI שמפרקת משימה ומפזרת אותה על פני מאגר של מודלים אחרים, חלקם עם משקלים פתוחים, חלקם מתמחים. הניסוח של Sakana הוא שהוא מגיע לתפוקה ברמת החזית "בלי ההסתמכות ההכרחית על מודלי החזית שהיא מתזמרת", והיא מציינת במפורש ש-Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra מוחרגים מאותו מאגר. אתה משלם על שכבת התזמון, ועל כל טוקן שסוכני המשנה שורפים.
ההבחנה הזו אינה קוסמטית. היא כל הסיבה לכך שפער המחירים קיים, והיא הדבר היחיד שהופך את הפער לניתן להגנה.
כרטיסי התעריפים, כולל החלק שחוזר על עצמו
• קלט — Fugu Ultra v2 $5.00 ל־1M לעומת Grok 4.6 $2.00 ל־1M. Fugu יקר פי 2.5 עוד לפני שמתרחשות קריאות משנה.
• פלט — Fugu Ultra v2 $30.00 ל-1M לעומת Grok 4.6 $6.00 ל-1M. פער של פי 5, וזה שמכריע את רוב החשבונות.
• קלט במטמון — $0.50 לכל 1M בשניהם. זהה. שני ספקים שאין להם שום דבר אחר במשותף הגיעו לאותו מחיר קריאה מהמטמון, מה שהופך לולאות סוכן עתירות מטמון לעומס העבודה היחיד שבו השניים ברי השוואה באמת שורה מול שורה.
• תמחור מחדש להקשר ארוך — Grok 4.6 מכפיל את מחירו ל-$4.00 / $12.00 ברגע שפרומפט חוצה 200,000 טוקנים, והתמחור מחדש חל על הבקשה כולה, ולא רק על החריגה. המדרגה המדווחת של Fugu Ultra v2 מעל כ-272,000 טוקני קלט עוברת לסביבות $10.00 / $45.00, גם על הבקשה כולה. שניהם מענישים פרומפטים ארוכים; Grok מתחיל להעניש 72 אלף טוקנים מוקדם יותר.
• חלון הקשר — Grok 4.6 עם 500K טוקנים לעומת Fugu Ultra v2 עם 1M, כפי שדווח ברישומים של צדדים שלישיים. עמוד ההכרזה של Sakana אינו מציין נתון הקשר כלל, לכן יש להתייחס ל-1M שלו כלא מאושר על ידי הספק.
השורה של הקשר ארוך פועלת לשני הכיוונים וכדאי לעשות את החשבון. פרומפט של 300K טוקנים עולה לך $4.00 לכל מיליון קלט ב-Grok 4.6 וכ-$10.00 ב-Fugu Ultra v2. פרומפט של 150K טוקנים עולה $2.00 ב-Grok ו-$5.00 ב-Fugu. המודל של Sakana יקר יותר בכל אורך פרומפט — השאלה היחידה היא באיזו תדירות צריך לקרוא לו.

הטיעון בעד תשלום פי 5 על תפוקה
הטיעון בעד מתזמר אינו שהוא זול יותר לכל טוקן. הטיעון הוא שהוא זקוק לפחות ניסיונות, ושהטוקנים שהוא מוציא על תיאום זולים יותר מהטוקנים שהייתם מוציאים על כישלון.
זו טענה אמיתית, וסקאנה מצהירה עליה במפורש: Fugu Ultra v2 מכוון לעבודה מורכבת ורבת-שלבים — מחקר אוטונומי, פיתוח full-stack — שבה מצב הכשל של מודל בודד הוא יציאה מהפסים באמצע ריצה ארוכה. אם תעריף פלט של 30$ קונה לך משימה שהושלמה במעבר הראשון במקום בשלישי, תוספת המחיר לכל טוקן אינה רלוונטית.
יש ראיות תומכות מהצד של הספק עצמו, אף שהן נוטות לטובת הספק ויש לקרוא אותן ככאלה. חומר ההשקה של xAI עבור Grok 4.6 מציין בערך 53 סבבים וכ-0.5 מיליארד טוקני קלט לפתרון משימות ארוכות טווח, לעומת כ-103 סבבים ו-2.0 מיליארד טוקני קלט עבור מודל חזית מתחרה — טיעון ש-Grok עצמו חסכוני לכל משימה גם במחיר נמוך לכל טוקן. שתי החברות עושות את אותו מהלך: לדחוף אתכם הרחק מכרטיס התעריפים ולעבר עלות לכל עבודה מוגמרת.
מה שאומר שהמספר המכריע הוא כזה שאף ספק לא מפרסם, ושאותו אתה צריך למדוד בעצמך: טוקנים שנשרפו, מההתחלה ועד הסוף, במשימה שנראית כמו שלך.
היכן שכל אחד מהם חלש באמת
נקודת התורפה המדווחת של Grok 4.6 היא עבודה בטרמינל. הציון שלו ב-Terminal-Bench v3.0 עומד על 26%, הרחק מאחורי צמרת התחום, אף שאותו מודל מציג תוצאה חזקה בהרבה של 88.4% ב-Terminal-Bench v2.1 הישן יותר — אלה מבחנים שונים, וערבוב ביניהם הוא טעות שתראו בהרבה סיקורים. הוא גם מחזיק בציון GPQA Diamond הגבוה ביותר בקבוצה שלו, 94.9%, אבל מאז הוסר GPQA Diamond מאינדקס Artificial Analysis בשל רוויה, כך שציון גבוה בו כבר לא מבדיל בין מודלי חזית כפי שהבדיל לפני שנה.
בצד העצמאי, Artificial Analysis מעניקה ל-Grok 4.6 ציון 44 במדד האינטליגנציה v4.3 שלה, במקום #20 מתוך 200, בעלות של $1.86 למשימה. הנתון שמופץ לעתים קרובות, 61, מגיע מסקאלת מדד שהוחלפה ואין לצטט אותו בלי לומר איזו גרסה הפיקה אותו.
נקודת התורפה של Fugu Ultra v2 היא האימות. נכון למועד הפרסום, דבר ממה שסקאנה הצהירה עליו — חמש התוצאות הטובות ביותר או הטובות-במשותף, ציון ה-Chartography של 48.3 מול 27.3 של Opus 5 ו-29.5 של Fable 5, וה-DeepSWE של 74.3 — לא שוחזר באופן בלתי תלוי. אין גם נתון מפורסם של השהיה או תפוקה, וזה חשוב יותר עבור מתזמר מאשר עבור מודל בודד, משום שזמן התגובה שלו תלוי לחלוטין במה שהוא מחליט לקרוא לו. עבור Fugu Ultra הקודם, בודקים דיווחו בפומבי על ריצות שהשתרעו על כ-30 דקות; זהו המודל מיוני 2026, לא v2, אבל זה אופן הכשל שיש לבדוק לפני שמתחייבים למסלול ייצור.

הערה על שם הספק
פרט אחד שכדאי לדעת לפני שאתם מחפשים את Grok 4.6 בקונסולת מפתחים: המודל נקרא באופן עקבי Grok 4.6, אבל המיתוג של הספק סביבו נמצא במצב משתנה. התיעוד של xAI עצמו נושא כעת את השם SpaceXAI, שינוי שרוב סיקורי ההשקה טרם הדביקו. מזהי המודל ומשטח ה-API לא השתנו — Grok 4.6 הוא מודל OpenAI Responses מן השורה הראשונה ומשתלב ישירות בלולאות קריאה לכלים קיימות ללא שכבת תרגום — אבל אם אתם מחפשים כרטיס מודל והמיתוג נראה שגוי, זו לא טעות שלכם.
קריאה לאחד מאלה בפועל
Grok 4.6 נמצא ב-OrcaRouter לפי התעריף של הספק עצמו — $2.00 למיליון טוקנים בקלט ו-$6.00 למיליון טוקנים בפלט, מועבר הלאה ללא תוספת מחיר, כך ששינוי מחיר של הספק מגיע לכאן באותו יום ולא לפי לוח זמנים של מיגרציה. הוא תואם OpenAI באותה base URL כמו כל דבר אחר בקטלוג, מה שאומר שאפשר לשים אותו מאחורי שרשרת fallback או כלל ניתוב במקום לקודד אותו קשיח, ואפשר להריץ עליו A/B מול מודל אחר בלי חוזה שני או שינוי בקוד.
Fugu Ultra v2 אינו מנותב על ידינו. הוא זמין מ-API התואם ל-OpenAI של Sakana AI עצמה, והחברה אומרת שאינטגרציית Fugu קיימת עוברת אליו בשינוי פרמטר אחד. אם ברצונך להשוות בין השניים בעומס העבודה שלך, ההסדר הזול ביותר הוא להשאיר את Grok 4.6 בשער שלך ולקרוא ל-Fugu Ultra v2 ישירות מ-Sakana מאחורי דגל תכונה — שניהם מדברים באותו פורמט בקשה, כך שאותה מערכת בדיקות עובדת על שניהם.

פסק הדין
Grok 4.6 הוא ברירת המחדל הרציונלית עבור רוב הצוותים, ובכל הנוגע למחיר אין בכלל תחרות. במחיר של $2.00 / $6.00 עם קריאת מטמון של $0.50 וחלון של 500K, הוא מטפל בהסקה על מסמכים ארוכים, סוכני קידוד ועבודה עם קבצים מולטימודליים בחמישית מקצב הפלט של Fugu Ultra v2, והוא מדורג באופן עצמאי ומקבל בנצ'מרק עצמאי. החשיפה שלו היא אורך הפרומפט — צוק ה-200K מכפיל את הבקשה כולה — ולולאות סוכנים עתירות טרמינל, שבהן הציונים המפורסמים שלו אינם תחרותיים.
Fugu Ultra v2שווה את מחיר הפרמיה שלו רק אם יש לך סוג מסוים של עומס עבודה: משימות ארוכות, רב-שלביות, עתירות אוטונומיה, שבהן מודל בודד נוטה לצאת מהפסים, ושבהן אתה גם רוצה את המאפיין הארכיטקטוני ש-Sakana מוכרת — דרגת יכולת שאינה תלויה בכך שספק כלשהו בחזית הטכנולוגיה יישאר זמין או יישאר זול. זה דבר אמיתי לרצות. אבל זו טענה, עדיין לא מדידה, והפער ב-DeepSWE שגורם לזה להיראות אמין הוא בנצ'מרק בודד מספק בודד ביום ההשקה.
אם אינך יכול לומר אילו מהמשימות שלך נכשלות כיום בניסיון השני או השלישי, עדיין אין לך את המספר שיצדיק את פער המחירים. מדוד זאת תחילה. כרטיסי התעריפים כבר אומרים לך את כל השאר.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
