כרטיס הירו למפגש בין Fugu Ultra v2 ל-Grok 4.6, המציג ניגוד בין מערכת תזמור לבין מודל הסקה יחיד בעל הקשר גדול.
Guides & Insights

Fugu Ultra v2 לעומת Grok 4.6: פי חמישה ממחיר הפלט, בנצ'מרק משותף אחד

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

יש בדיוק בנצ'מרק אחד שעליו Fugu Ultra v2 וגם Grok 4.6 מפרסמים מספר, והוא DeepSWE: Sakana AI מדווחת 74.3 עבור Fugu Ultra v2 בהודעה שלה מ-11 בספטמבר 2026, בעוד שחומר ההשקה של xAI ל-Grok 4.6 מציב את ציונו ב-DeepSWE v1.1 על 65.9%. זהו פער של 8.4 נקודות, וזו ההשוואה הנקייה היחידה ששתי החברות מציעות. כל דבר אחר שאולי תשוו — Chartography ו-SWEFish של Sakana מול GPQA Diamond ו-CursorBench של Grok — נמדד במכשירים שונים על ידי מעבדות שונות. אז השאלה הכנה היא לא "איזה מהם חכם יותר". היא האם היתרון הנטען של Fugu Ultra v2 שווה לשלם עליו 30 דולר למיליון טוקני פלט, כאשר Grok 4.6 גובה 6 דולר.

שתי תשובות שונות לאותה בעיה

Grok 4.6 הוא מודל יחיד, והוא הדגל הנוכחי של סדרת Grok — רשום כ"Latest" בתיעוד המפתחים של הספק עצמו, ומחליף את Grok 4.5 עם אותו חלון הקשר של 500,000 טוקנים, אותו משטח קלט של טקסט/תמונה/קובץ ואותם מחירי בסיס. מועד חיתוך הידע שלו הוא 1 בפברואר 2026, והוא חושף עוצמת חשיבה ברמות low, medium, high ו-xhigh, כאשר high הוא ברירת המחדל. פרט אחד שמפתיע אנשים: לא ניתן לכבות את החשיבה. טוקני חשיבה מחויבים בכל בקשה, מה שהופך את עלות הפלט האמיתית של Grok 4.6 לתלויה בכמה קשה הוא יחליט לחשוב.

Fugu Ultra v2 אינו מודל כלל במובן הרגיל. זהו דרג היכולת השיאית של קו התזמור של Sakana AI — נקודת קצה אחת תואמת OpenAI שמפרקת משימה ומפזרת אותה על פני מאגר של מודלים אחרים, חלקם עם משקלים פתוחים, חלקם מתמחים. הניסוח של Sakana הוא שהוא מגיע לתפוקה ברמת החזית "בלי ההסתמכות ההכרחית על מודלי החזית שהיא מתזמרת", והיא מציינת במפורש ש-Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra מוחרגים מאותו מאגר. אתה משלם על שכבת התזמון, ועל כל טוקן שסוכני המשנה שורפים.

ההבחנה הזו אינה קוסמטית. היא כל הסיבה לכך שפער המחירים קיים, והיא הדבר היחיד שהופך את הפער לניתן להגנה.

כרטיסי התעריפים, כולל החלק שחוזר על עצמו

קלט — Fugu Ultra v2 $5.00 ל־1M לעומת Grok 4.6 $2.00 ל־1M. Fugu יקר פי 2.5 עוד לפני שמתרחשות קריאות משנה.

פלט — Fugu Ultra v2 $30.00 ל-1M לעומת Grok 4.6 $6.00 ל-1M. פער של פי 5, וזה שמכריע את רוב החשבונות.

קלט במטמון — $0.50 לכל 1M בשניהם. זהה. שני ספקים שאין להם שום דבר אחר במשותף הגיעו לאותו מחיר קריאה מהמטמון, מה שהופך לולאות סוכן עתירות מטמון לעומס העבודה היחיד שבו השניים ברי השוואה באמת שורה מול שורה.

תמחור מחדש להקשר ארוך — Grok 4.6 מכפיל את מחירו ל-$4.00 / $12.00 ברגע שפרומפט חוצה 200,000 טוקנים, והתמחור מחדש חל על הבקשה כולה, ולא רק על החריגה. המדרגה המדווחת של Fugu Ultra v2 מעל כ-272,000 טוקני קלט עוברת לסביבות $10.00 / $45.00, גם על הבקשה כולה. שניהם מענישים פרומפטים ארוכים; Grok מתחיל להעניש 72 אלף טוקנים מוקדם יותר.

חלון הקשר — Grok 4.6 עם 500K טוקנים לעומת Fugu Ultra v2 עם 1M, כפי שדווח ברישומים של צדדים שלישיים. עמוד ההכרזה של Sakana אינו מציין נתון הקשר כלל, לכן יש להתייחס ל-1M שלו כלא מאושר על ידי הספק.

השורה של הקשר ארוך פועלת לשני הכיוונים וכדאי לעשות את החשבון. פרומפט של 300K טוקנים עולה לך $4.00 לכל מיליון קלט ב-Grok 4.6 וכ-$10.00 ב-Fugu Ultra v2. פרומפט של 150K טוקנים עולה $2.00 ב-Grok ו-$5.00 ב-Fugu. המודל של Sakana יקר יותר בכל אורך פרומפט — השאלה היחידה היא באיזו תדירות צריך לקרוא לו.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

הטיעון בעד תשלום פי 5 על תפוקה

הטיעון בעד מתזמר אינו שהוא זול יותר לכל טוקן. הטיעון הוא שהוא זקוק לפחות ניסיונות, ושהטוקנים שהוא מוציא על תיאום זולים יותר מהטוקנים שהייתם מוציאים על כישלון.

זו טענה אמיתית, וסקאנה מצהירה עליה במפורש: Fugu Ultra v2 מכוון לעבודה מורכבת ורבת-שלבים — מחקר אוטונומי, פיתוח full-stack — שבה מצב הכשל של מודל בודד הוא יציאה מהפסים באמצע ריצה ארוכה. אם תעריף פלט של 30$ קונה לך משימה שהושלמה במעבר הראשון במקום בשלישי, תוספת המחיר לכל טוקן אינה רלוונטית.

יש ראיות תומכות מהצד של הספק עצמו, אף שהן נוטות לטובת הספק ויש לקרוא אותן ככאלה. חומר ההשקה של xAI עבור Grok 4.6 מציין בערך 53 סבבים וכ-0.5 מיליארד טוקני קלט לפתרון משימות ארוכות טווח, לעומת כ-103 סבבים ו-2.0 מיליארד טוקני קלט עבור מודל חזית מתחרה — טיעון ש-Grok עצמו חסכוני לכל משימה גם במחיר נמוך לכל טוקן. שתי החברות עושות את אותו מהלך: לדחוף אתכם הרחק מכרטיס התעריפים ולעבר עלות לכל עבודה מוגמרת.

מה שאומר שהמספר המכריע הוא כזה שאף ספק לא מפרסם, ושאותו אתה צריך למדוד בעצמך: טוקנים שנשרפו, מההתחלה ועד הסוף, במשימה שנראית כמו שלך.

היכן שכל אחד מהם חלש באמת

נקודת התורפה המדווחת של Grok 4.6 היא עבודה בטרמינל. הציון שלו ב-Terminal-Bench v3.0 עומד על 26%, הרחק מאחורי צמרת התחום, אף שאותו מודל מציג תוצאה חזקה בהרבה של 88.4% ב-Terminal-Bench v2.1 הישן יותר — אלה מבחנים שונים, וערבוב ביניהם הוא טעות שתראו בהרבה סיקורים. הוא גם מחזיק בציון GPQA Diamond הגבוה ביותר בקבוצה שלו, 94.9%, אבל מאז הוסר GPQA Diamond מאינדקס Artificial Analysis בשל רוויה, כך שציון גבוה בו כבר לא מבדיל בין מודלי חזית כפי שהבדיל לפני שנה.

בצד העצמאי, Artificial Analysis מעניקה ל-Grok 4.6 ציון 44 במדד האינטליגנציה v4.3 שלה, במקום #20 מתוך 200, בעלות של $1.86 למשימה. הנתון שמופץ לעתים קרובות, 61, מגיע מסקאלת מדד שהוחלפה ואין לצטט אותו בלי לומר איזו גרסה הפיקה אותו.

נקודת התורפה של Fugu Ultra v2 היא האימות. נכון למועד הפרסום, דבר ממה שסקאנה הצהירה עליו — חמש התוצאות הטובות ביותר או הטובות-במשותף, ציון ה-Chartography של 48.3 מול 27.3 של Opus 5 ו-29.5 של Fable 5, וה-DeepSWE של 74.3 — לא שוחזר באופן בלתי תלוי. אין גם נתון מפורסם של השהיה או תפוקה, וזה חשוב יותר עבור מתזמר מאשר עבור מודל בודד, משום שזמן התגובה שלו תלוי לחלוטין במה שהוא מחליט לקרוא לו. עבור Fugu Ultra הקודם, בודקים דיווחו בפומבי על ריצות שהשתרעו על כ-30 דקות; זהו המודל מיוני 2026, לא v2, אבל זה אופן הכשל שיש לבדוק לפני שמתחייבים למסלול ייצור.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

הערה על שם הספק

פרט אחד שכדאי לדעת לפני שאתם מחפשים את Grok 4.6 בקונסולת מפתחים: המודל נקרא באופן עקבי Grok 4.6, אבל המיתוג של הספק סביבו נמצא במצב משתנה. התיעוד של x​AI עצמו נושא כעת את השם SpaceXAI, שינוי שרוב סיקורי ההשקה טרם הדביקו. מזהי המודל ומשטח ה-API לא השתנו — Grok 4.6 הוא מודל Ope​nAI Responses מן השורה הראשונה ומשתלב ישירות בלולאות קריאה לכלים קיימות ללא שכבת תרגום — אבל אם אתם מחפשים כרטיס מודל והמיתוג נראה שגוי, זו לא טעות שלכם.

קריאה לאחד מאלה בפועל

Grok 4.6 נמצא ב-OrcaRouter לפי התעריף של הספק עצמו — $2.00 למיליון טוקנים בקלט ו-$6.00 למיליון טוקנים בפלט, מועבר הלאה ללא תוספת מחיר, כך ששינוי מחיר של הספק מגיע לכאן באותו יום ולא לפי לוח זמנים של מיגרציה. הוא תואם OpenAI באותה base URL כמו כל דבר אחר בקטלוג, מה שאומר שאפשר לשים אותו מאחורי שרשרת fallback או כלל ניתוב במקום לקודד אותו קשיח, ואפשר להריץ עליו A/B מול מודל אחר בלי חוזה שני או שינוי בקוד.

Fugu Ultra v2 אינו מנותב על ידינו. הוא זמין מ-API התואם ל-OpenAI של Sakana AI עצמה, והחברה אומרת שאינטגרציית Fugu קיימת עוברת אליו בשינוי פרמטר אחד. אם ברצונך להשוות בין השניים בעומס העבודה שלך, ההסדר הזול ביותר הוא להשאיר את Grok 4.6 בשער שלך ולקרוא ל-Fugu Ultra v2 ישירות מ-Sakana מאחורי דגל תכונה — שניהם מדברים באותו פורמט בקשה, כך שאותה מערכת בדיקות עובדת על שניהם.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

פסק הדין

Grok 4.6 הוא ברירת המחדל הרציונלית עבור רוב הצוותים, ובכל הנוגע למחיר אין בכלל תחרות. במחיר של $2.00 / $6.00 עם קריאת מטמון של $0.50 וחלון של 500K, הוא מטפל בהסקה על מסמכים ארוכים, סוכני קידוד ועבודה עם קבצים מולטימודליים בחמישית מקצב הפלט של Fugu Ultra v2, והוא מדורג באופן עצמאי ומקבל בנצ'מרק עצמאי. החשיפה שלו היא אורך הפרומפט — צוק ה-200K מכפיל את הבקשה כולה — ולולאות סוכנים עתירות טרמינל, שבהן הציונים המפורסמים שלו אינם תחרותיים.

Fugu Ultra v2שווה את מחיר הפרמיה שלו רק אם יש לך סוג מסוים של עומס עבודה: משימות ארוכות, רב-שלביות, עתירות אוטונומיה, שבהן מודל בודד נוטה לצאת מהפסים, ושבהן אתה גם רוצה את המאפיין הארכיטקטוני ש-Sakana מוכרת — דרגת יכולת שאינה תלויה בכך שספק כלשהו בחזית הטכנולוגיה יישאר זמין או יישאר זול. זה דבר אמיתי לרצות. אבל זו טענה, עדיין לא מדידה, והפער ב-DeepSWE שגורם לזה להיראות אמין הוא בנצ'מרק בודד מספק בודד ביום ההשקה.

אם אינך יכול לומר אילו מהמשימות שלך נכשלות כיום בניסיון השני או השלישי, עדיין אין לך את המספר שיצדיק את פער המחירים. מדוד זאת תחילה. כרטיסי התעריפים כבר אומרים לך את כל השאר.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית