
Sakana Fugu Ultra v2, מוסבר: המאגר הצטמצם והציון עלה
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
Fugu Ultra v2 הוא סוג מוזר של שדרוג: Sakana AI השיקה אותו ב-11 בספטמבר 2026 עם מאגר מודלים שכבר אינו כולל את Claude Fable 5, Claude Fable 5.1 או GPT-6 Astra — שלוש מהמערכות החזקות ביותר שמושקות כיום — ועדיין טוענת שהוא גובר על שלושתן. דגם הדגל החדש בדרג האיכות של המעבדה בטוקיו, שהושק באותו יום לצד אח זול יותר בשם Fugu Max, הוא הטוב ביותר או הטוב במשותף בחמישה מתוך שמונה מבחני ביצועים בהערכה של Sakana עצמה, כולל 48.3 ב-Chartography לעומת 27.3 של Claude Opus 5 ו-29.5 של Claude Fable 5, ו-74.3 ב-DeepSWE. אף אחד מהמספרים האלה לא שוחזר באופן עצמאי, ועדיין אין דף Artificial Analysis לאף דגם של Fugu. הפער הזה הוא הסיפור: מה שמבקשים ממך לקנות הוא שכבת תיאום שכל המסר השיווקי שלה הוא שהיא אינה זקוקה לדגמים הטובים ביותר כדי להפיק את התשובות הטובות ביותר.
Sakana AI נוסדה ב-2023 בידי Llion Jones, מחבר-שותף של מאמר ה-Transformer, ו-David Ha. קו Fugu הושק ביוני 2026 כמערכת ריבוי-סוכנים המסופקת כמודל אחד: אתם פונים לנקודת קצה אחת תואמת-OpenAI, ומאחוריה מתאם מאומן מפרק את הבקשה, מפעיל סוכנים ומסנתז את התוצאה. המחקר אמיתי ומפורסם — TRINITY (arXiv 2512.04695) פיתחה באמצעות אבולוציה מתאם קל-משקל שמקצה את תפקידי Thinker, Worker ו-Verifier; Conductor (arXiv 2512.04388) למד תיאום בשפה טבעית בין סוכנים; הדוח הטכני של Fugu נמצא ב-arXiv 2606.21228. מה ש-Sakana מעולם לא פרסמה הוא הדבר שכולם באמת רוצים: זהות המודלים במאגר, והחלטות הניתוב לפי משימה.
מה בעצם השתנה לעומת ה-Fugu Ultra של יוני?
גרסה 2.0 היא רענון נקודתי כאחד עשר שבועות לאחר המקורית, ולא ארכיטקטורה חדשה. הניסוח של הספק עצמו הוא ש-Fugu Ultra v2 ו-Fugu Max הם "אותה ארכיטקטורת תזמור ליבתית" המכווננת לשתי משימות שונות: Max דוחף את גבול העלות-ביצועים כלפי מטה, ואילו Ultra דוחף את שיא היכולת כלפי מעלה. מזהה המודל הוא fugu-ultra-v2.0, וסאקאנה אומרת שהמעבר מ-Fugu קודם הוא שינוי פרמטר בשורה אחת בלי הגירת SDK — וזה הדבר הידידותי ביותר למשתמש במהדורה הזו.
השינויים המהותיים הם שני הקצוות. ראשית, תאריך הניתוק של האימון עבר ל-20260828, כך שהקואורדינטור כוונן מחדש מול הדור הנוכחי של מודלי החזית. שנית, והרבה יותר מעניין, הרכב המאגר השתנה באופן ש-Sakana בחרה לפרסם: Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra מוחרגים במפורש. הטיעון של Sakana הוא שזה מוכיח שהציונים אינם תלויים במודל חזית קנייני בודד, וזה חשוב אם הדאגה שלך היא נעילת ספקים, ביטולי API או מודל שנעלם מאחורי בקרות יצוא.
יש תוצאה מסדר שני שסקאנה אינה מתעכבת עליה. אם המאגר מוציא את שלושת המודלים החזקים הזמינים, אזי השוואות הבנצ'מרק מול Fable 5 ו-Fable 5.1 נעשות מול מערכות שהמתזמר לא היה יכול להפעיל גם אם היה רוצה. ההשוואה לגיטימית — זוהי טענה על הארכיטקטורה, לא על נגישות — אך היא אינה מבחן שווה-בשווה למי שיש ברשותו המודל הטוב יותר. זהו מבחן לשאלה אם תיאום מנצח יכולת גולמית. זו שאלה מעניינת באמת. היא פשוט אינה השאלה שלוח התוצאות מרמז עליה במבט חטוף.

המספרים, ומי שהפיק אותם
כל נתון בסעיף זה מדווח על ידי הספק. Sakana לא שחררה כלי הערכה, לא טבלת ציונים לפי משימה, ולא מתכון לשחזור, ועיצוב התזמור הופך שכפול עצמאי לקשה יותר ולא לקל יותר: שחזור ציון מחייב גישה לכל מודל במאגר באותן גרסאות ובאותה טופולוגיה, ומלכתחילה הטופולוגיה משתנה בין בקשה לבקשה.
• צ׳רטוגרפיה (חשיבה חזותית על תרשימים ומסמכים מובנים) — Fugu Ultra v2 48.3, Claude Opus 5 27.3, Claude Fable 5 29.5 — לפי דיווח הספק
• DeepSWE (הנדסת תוכנה בעולם האמיתי) — Fugu Ultra v2 74.3 — לפי דיווח הספק, נטען כי הוא עוקף מודלים שעולים פי שלושה עד חמישה יותר לכל טוקן
• מקום ראשון או מקום ראשון במשותף — בחמישה מתוך שמונה בנצ'מרקים: GDP.pdf, Chartography, SWEFish, DeepSWE ו-Toolathon — לפי דיווח הספק
• מיקום בשני המקומות הראשונים — שבעה מתוך שמונה בנצ'מרקים — לפי דיווח הספק
• Fugu Ultra הקודם (יוני 2026, לצורך קנה מידה) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — כפי שדווח על ידי הספק
שורת ה-Chartography ראויה להדגשה שהיא מקבלת, מפני שהיא הקטגוריה היחידה שבה הפער לדגם דגל נוכחי ובעל שם אינו שולי. פער של 21 נקודות לעומת Claude Opus 5 במבחן חשיבה חזותית הוא סוג המספר שבדרך כלל מופיע בלוח דירוג עצמאי בתוך ימים. נכון לכתיבת שורות אלה, טרם הופיע כזה. יש להתייחס לשורה כאל השערה שצמוד לה סכום כספי, ולא כתוצאה מוגמרת.
תמחור: ללא שינוי מאז יוני, ויקר באופן מוחלט בפלט.
Fugu Ultra v2 עולה $5 למיליון טוקני קלט, $30 למיליון טוקני פלט, ו-$0.50 למיליון קלט במטמון. מעל 272,000 טוקנים של הקשר אלה הופכים ל-$10, $45 ו-$1.00 בהתאמה. Fugu Max הוא צורה שונה לחלוטין: $2 קלט, $6 פלט, $0.25 במטמון, אחיד לאורך כל אורך ההקשר, בתוספת $0.007 לכל חיפוש אינטרנט או קריאת fetch.
שני דברים בטבלת התמחור הזו ראויים לקריאה מדוקדקת. הראשון הוא שהפלט גדול פי שישה מהקלט — יחס אגרסיבי שמתמחר את מידת הפירוט של המודל, ותזמור הוא עסק מפורט. מתאם שמפעיל סוכנים ומסנתז את תשובותיהם פולט הרבה טוקנים, ואתה משלם על כולם ב-$30 למיליון. טענת היעילות של Sakana נוגעת למאגר הבסיסי, לא לכמה טקסט המערכת מייצרת בשמך, ואלה מספרים שונים. תקצב לפי ספירות טוקנים נצפות, לא לפי התעריף הכותרתי.
השני הוא צוק 272K. הכפלת התעריף לכל טוקן מעל סף היא דרך לגיטימית לתמחר עבודה עם הקשר ארוך, אבל היא אומרת שהעלות האפקטיבית של הרצת סוכן עם הקשר ארוך אינה המספר שמופיע בעמוד התמחור. אם עומס העבודה שלך נמצא קרוב לגבול, החשבון משתנה באופן מהותי משני צדדיו.
שכבות המנוי של Fugu — Standard ב-$20, Pro ב-$100, Max ב-$200 לחודש, עם מכסות של פי 10 ופי 20 — כולן כוללות גישה אל Fugu, Fugu Ultra ו-Fugu Max. Sakana גם מתמחרת את מודל Fugu הבסיסי לפי השכבה הגבוהה ביותר שקיימת במאגר עבור בקשה נתונה, ומצהירה בבירור שהוספת סוכנים נוספים אינה מכפילה את החשבון. זהו הבדל אמיתי ממודל העלויות של fan-out שהייתם מקבלים אילו קראתם בעצמכם לכמה מודלים מתקדמים.
מה שסקאנה לא תספר לך
שאל אילו מודלים ענו לשאלתך, וה-FAQ עונה ישירות: "מידע הניתוב הזה אינו נחשף מעצם התכנון." מאגרי Ultra ו-Max קבועים, כך שלא ניתן להוציא ספק; רק מודל Fugu הבסיסי תומך בהסרות לפי מודל בהגדרות הקונסולה. לקוחות ארגוניים יכולים לנהל משא ומתן על תצורות מותאמות אישית.
האטימות הזו היא לב הביקורת שסדרת Fugu משכה מאז יוני, והיא ביקורת הוגנת ולא עוינת. כאשר מתזמר משיג ציון טוב על ידי שילוב המודלים של מעבדות אחרות, הציון שייך למערכת — דבר אמיתי וניתן להגנה שאפשר למכור — אבל הוא אינו עובר לשום מודל בודד, ואי אפשר לבקר אותו. המבקרים העלו את הנקודה בצורה בוטה: Fugu לא ניצח את דגם הדגל, הוא שכר את דגם הדגל. במשימות ניתנות לאימות עם בודק זול, כמו מבחן קידוד עם חבילת בדיקות, ועדה באמת יכולה לגבור על החבר הטוב ביותר שלה. במשימות בלי בודק כזה, פאנל שדוגם כמה מודלי חזית ומדווח את התוצאה הטובה ביותר מדווח במידה מסוימת על מזל. בחירות הקטגוריות של Sakana עצמה — Chartography, DeepSWE, Toolathon — נוטות לקצה הניתן לאימות, שזה המקום הנכון להשמיע את הטענה, וגם הסיבה לכך שאי אפשר להכליל את הטענה בחינם.
בודקים עצמאיים גם ציינו את שונות זמן השהיה כעלות המעשית של תזמור: במשימות קשות המתאם מתלבט, ובמשימות קלות ההתלבטות הזו היא תקורה טהורה. משימת שיידר של חוקר אחד דווחה כנמשכת כשלושים דקות, כשהאיכות דורגה רק כמקובלת.

איפה באמת אפשר להשיג את זה
Fugu Ultra v2 זמין כעת דרך ה-API של Sakana עצמה, התואם ל-OpenAI — כוונו לקוח קיים לנקודת הקצה עם מפתח API ושנו שורה אחת — וכן דרך כמה פלטפורמות צד שלישי. OrcaRouter אינה מספקת את דגמי Fugu; אם ברצונכם לקרוא ל-Fugu Ultra v2, ה-API של הספק עצמו הוא הנתיב הישיר.
מה שראוי לציין הוא החלופה ש-Sakana מתחרה בה באופן מרומז. המאגר שמאפשר ל-Fugu Ultra v2 לעבוד מורכב ממודלים שניתן לקרוא להם בנפרד כיום, והיריבים שמולם הוא נמדד הם אלה שצוותים כבר מריצים. Claude Opus 5, DeepSeek V4 Pro ו-Gemini 3.1 Pro נמצאים כולם ב-OrcaRouter במחירי המחירון של הספקים שלהם עם 0% תוספת, מה שאומר שהורדת מחיר מכל אחד מהספקים האלה פעילה אצלנו באותו יום שבו היא מוכרזת. אם הסיבה שאתם שוקלים מתזמר היא חוסן — לא לרצות שמסלול ייצור יהיה תלוי בזמינות של ספק אחד או במדיניות של ספק אחד — אז שכבת ניתוב עם מעבר אוטומטי בין ספקים פותרת חלק מהבעיה הזו ברמת המודל, ו-Fugu Ultra v2 פותר חלק אחר ברמת ההיסק.API אחד ל-200+ מודליםעם מעבר אוטומטי אינו מהווה תחליף למתאם מאומן, ומתאם מאומן אינו מהווה תחליף לאי-תלות בספק יחיד. חלק מהצוותים ירצו את שניהם.
מלכוד הציות
Fugu אינו זמין באיחוד האירופי או באזור הכלכלי האירופי. הניסוח של הספק מפורש: אינו זמין עדיין באיחוד האירופי/ב-EEA בעודו פועל לקראת עמידה ב-GDPR ובתקנות ספציפיות לאיחוד האירופי, ובמקומות אחרים הגישה עשויה להיות מוגבלת בגלל תנאי רשת או כללים מקומיים. אם בארגון שלך יש ישויות באיחוד האירופי שנכללות בהיקף, הדבר מוציא את קו Fugu מהשיקול ללא קשר לביצועים במדדים, וזה שווה לדעת לפני ההערכה ולא אחריה.

מה לצפות
שלושה דברים יהפכו את Fugu Ultra v2 מטענה מעניינת לבחירה קריטית. הערכה בלתי תלויה — רשומה ב-Artificial Analysis, מיקום ב-LMArena, כל דבר שיש מאחוריו מסגרת בדיקה — תכריע בשאלת ה-Chartography בתוך שבוע. מספרים משוחזרים מצד שלישי על מבחני קידוד ניתנים לאימות יאשרו את השיפור ברמת המערכת שהארכיטקטורה חוזה. ומאגר גלוי, או אפילו חלקי, יאפשר לקונים לנתח בדיוק אילו נקודות כשל בודדות הם מקבלים על עצמם כאשר הם מנתבים תעבורת ייצור דרך מתאם שאינם יכולים לבדוק.
עד אז, העמדה הכנה היא זו. Fugu Ultra v2 הוא הניסיון הרציני ביותר עד כה למכור אורקסטרציה כמוצר ולא כדמו מחקרי, ממעבדה שיש מאחוריה עבודה שפורסמה, במחיר שהופך את פרמיית האורקסטרציה לגלויה ולא נסתרת. אם עומס העבודה שלך הוא ארוך טווח, בר-אימות ומוגבל לאזור שבו Sakana יכולה לשרת אותך, כדאי לבצע פיילוט בהיקף מוגדר עם חשבונאות טוקנים מופעלת. אם לא, המודלים שכנגדם נמדד Fugu Ultra v2 נמצאים במרחק קריאת API אחת, במחיר מחירון, עם ההוכחות שמוכיחות מה הם מסוגלים לעשות.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
