כרטיס כותרת הירו עבור Fugu Ultra v2 שכותרתו 'Fugu Ultra v2' עם כתובית המשנה 'המאגר התכווץ והניקוד עלה', תגי גלולה שעליהם כתוב 'Chartography 48.3', 'DeepSWE 74.3' ו-'$5 / $30 ל-1M', שורת פוטר 'Sakana AI - שוחרר ב-11 בספטמבר 2026', והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Sakana Fugu Ultra v2, מוסבר: המאגר הצטמצם והציון עלה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Fugu Ultra v2 הוא סוג מוזר של שדרוג: Sakana AI השיקה אותו ב-11 בספטמבר 2026 עם מאגר מודלים שכבר אינו כולל את Claude Fable 5, Claude Fable 5.1 או GPT-6 Astra — שלוש מהמערכות החזקות ביותר שמושקות כיום — ועדיין טוענת שהוא גובר על שלושתן. דגם הדגל החדש בדרג האיכות של המעבדה בטוקיו, שהושק באותו יום לצד אח זול יותר בשם Fugu Max, הוא הטוב ביותר או הטוב במשותף בחמישה מתוך שמונה מבחני ביצועים בהערכה של Sakana עצמה, כולל 48.3 ב-Chartography לעומת 27.3 של Claude Opus 5 ו-29.5 של Claude Fable 5, ו-74.3 ב-DeepSWE. אף אחד מהמספרים האלה לא שוחזר באופן עצמאי, ועדיין אין דף Artificial Analysis לאף דגם של Fugu. הפער הזה הוא הסיפור: מה שמבקשים ממך לקנות הוא שכבת תיאום שכל המסר השיווקי שלה הוא שהיא אינה זקוקה לדגמים הטובים ביותר כדי להפיק את התשובות הטובות ביותר.

Sakana AI נוסדה ב-2023 בידי Llion Jones, מחבר-שותף של מאמר ה-Transformer, ו-David Ha. קו Fugu הושק ביוני 2026 כמערכת ריבוי-סוכנים המסופקת כמודל אחד: אתם פונים לנקודת קצה אחת תואמת-OpenAI, ומאחוריה מתאם מאומן מפרק את הבקשה, מפעיל סוכנים ומסנתז את התוצאה. המחקר אמיתי ומפורסם — TRINITY ‏(arXiv 2512.04695) פיתחה באמצעות אבולוציה מתאם קל-משקל שמקצה את תפקידי Thinker, Worker ו-Verifier; Conductor ‏(arXiv 2512.04388) למד תיאום בשפה טבעית בין סוכנים; הדוח הטכני של Fugu נמצא ב-arXiv 2606.21228. מה ש-Sakana מעולם לא פרסמה הוא הדבר שכולם באמת רוצים: זהות המודלים במאגר, והחלטות הניתוב לפי משימה.

מה בעצם השתנה לעומת ה-Fugu Ultra של יוני?

גרסה 2.0 היא רענון נקודתי כאחד עשר שבועות לאחר המקורית, ולא ארכיטקטורה חדשה. הניסוח של הספק עצמו הוא ש-Fugu Ultra v2 ו-Fugu Max הם "אותה ארכיטקטורת תזמור ליבתית" המכווננת לשתי משימות שונות: Max דוחף את גבול העלות-ביצועים כלפי מטה, ואילו Ultra דוחף את שיא היכולת כלפי מעלה. מזהה המודל הוא fugu-ultra-v2.0, וסאקאנה אומרת שהמעבר מ-Fugu קודם הוא שינוי פרמטר בשורה אחת בלי הגירת SDK — וזה הדבר הידידותי ביותר למשתמש במהדורה הזו.

השינויים המהותיים הם שני הקצוות. ראשית, תאריך הניתוק של האימון עבר ל-20260828, כך שהקואורדינטור כוונן מחדש מול הדור הנוכחי של מודלי החזית. שנית, והרבה יותר מעניין, הרכב המאגר השתנה באופן ש-Sakana בחרה לפרסם: Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra מוחרגים במפורש. הטיעון של Sakana הוא שזה מוכיח שהציונים אינם תלויים במודל חזית קנייני בודד, וזה חשוב אם הדאגה שלך היא נעילת ספקים, ביטולי API או מודל שנעלם מאחורי בקרות יצוא.

יש תוצאה מסדר שני שסקאנה אינה מתעכבת עליה. אם המאגר מוציא את שלושת המודלים החזקים הזמינים, אזי השוואות הבנצ'מרק מול Fable 5 ו-Fable 5.1 נעשות מול מערכות שהמתזמר לא היה יכול להפעיל גם אם היה רוצה. ההשוואה לגיטימית — זוהי טענה על הארכיטקטורה, לא על נגישות — אך היא אינה מבחן שווה-בשווה למי שיש ברשותו המודל הטוב יותר. זהו מבחן לשאלה אם תיאום מנצח יכולת גולמית. זו שאלה מעניינת באמת. היא פשוט אינה השאלה שלוח התוצאות מרמז עליה במבט חטוף.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

המספרים, ומי שהפיק אותם

כל נתון בסעיף זה מדווח על ידי הספק. Sakana לא שחררה כלי הערכה, לא טבלת ציונים לפי משימה, ולא מתכון לשחזור, ועיצוב התזמור הופך שכפול עצמאי לקשה יותר ולא לקל יותר: שחזור ציון מחייב גישה לכל מודל במאגר באותן גרסאות ובאותה טופולוגיה, ומלכתחילה הטופולוגיה משתנה בין בקשה לבקשה.

• צ׳רטוגרפיה (חשיבה חזותית על תרשימים ומסמכים מובנים) — Fugu Ultra v2 48.3, Claude Opus 5 27.3, Claude Fable 5 29.5 — לפי דיווח הספק

• DeepSWE (הנדסת תוכנה בעולם האמיתי) — Fugu Ultra v2 74.3 — לפי דיווח הספק, נטען כי הוא עוקף מודלים שעולים פי שלושה עד חמישה יותר לכל טוקן

• מקום ראשון או מקום ראשון במשותף — בחמישה מתוך שמונה בנצ'מרקים: GDP.pdf, Chartography, SWEFish, DeepSWE ו-Toolathon — לפי דיווח הספק

• מיקום בשני המקומות הראשונים — שבעה מתוך שמונה בנצ'מרקים — לפי דיווח הספק

• Fugu Ultra הקודם (יוני 2026, לצורך קנה מידה) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — כפי שדווח על ידי הספק

שורת ה-Chartography ראויה להדגשה שהיא מקבלת, מפני שהיא הקטגוריה היחידה שבה הפער לדגם דגל נוכחי ובעל שם אינו שולי. פער של 21 נקודות לעומת Claude Opus 5 במבחן חשיבה חזותית הוא סוג המספר שבדרך כלל מופיע בלוח דירוג עצמאי בתוך ימים. נכון לכתיבת שורות אלה, טרם הופיע כזה. יש להתייחס לשורה כאל השערה שצמוד לה סכום כספי, ולא כתוצאה מוגמרת.

תמחור: ללא שינוי מאז יוני, ויקר באופן מוחלט בפלט.

Fugu Ultra v2 עולה $5 למיליון טוקני קלט, $30 למיליון טוקני פלט, ו-$0.50 למיליון קלט במטמון. מעל 272,000 טוקנים של הקשר אלה הופכים ל-$10, $45 ו-$1.00 בהתאמה. Fugu Max הוא צורה שונה לחלוטין: $2 קלט, $6 פלט, $0.25 במטמון, אחיד לאורך כל אורך ההקשר, בתוספת $0.007 לכל חיפוש אינטרנט או קריאת fetch.

שני דברים בטבלת התמחור הזו ראויים לקריאה מדוקדקת. הראשון הוא שהפלט גדול פי שישה מהקלט — יחס אגרסיבי שמתמחר את מידת הפירוט של המודל, ותזמור הוא עסק מפורט. מתאם שמפעיל סוכנים ומסנתז את תשובותיהם פולט הרבה טוקנים, ואתה משלם על כולם ב-$30 למיליון. טענת היעילות של Sakana נוגעת למאגר הבסיסי, לא לכמה טקסט המערכת מייצרת בשמך, ואלה מספרים שונים. תקצב לפי ספירות טוקנים נצפות, לא לפי התעריף הכותרתי.

השני הוא צוק 272K. הכפלת התעריף לכל טוקן מעל סף היא דרך לגיטימית לתמחר עבודה עם הקשר ארוך, אבל היא אומרת שהעלות האפקטיבית של הרצת סוכן עם הקשר ארוך אינה המספר שמופיע בעמוד התמחור. אם עומס העבודה שלך נמצא קרוב לגבול, החשבון משתנה באופן מהותי משני צדדיו.

שכבות המנוי של Fugu — Standard ב-$20, Pro ב-$100, Max ב-$200 לחודש, עם מכסות של פי 10 ופי 20 — כולן כוללות גישה אל Fugu, Fugu Ultra ו-Fugu Max. Sakana גם מתמחרת את מודל Fugu הבסיסי לפי השכבה הגבוהה ביותר שקיימת במאגר עבור בקשה נתונה, ומצהירה בבירור שהוספת סוכנים נוספים אינה מכפילה את החשבון. זהו הבדל אמיתי ממודל העלויות של fan-out שהייתם מקבלים אילו קראתם בעצמכם לכמה מודלים מתקדמים.

מה שסקאנה לא תספר לך

שאל אילו מודלים ענו לשאלתך, וה-FAQ עונה ישירות: "מידע הניתוב הזה אינו נחשף מעצם התכנון." מאגרי Ultra ו-Max קבועים, כך שלא ניתן להוציא ספק; רק מודל Fugu הבסיסי תומך בהסרות לפי מודל בהגדרות הקונסולה. לקוחות ארגוניים יכולים לנהל משא ומתן על תצורות מותאמות אישית.

האטימות הזו היא לב הביקורת שסדרת Fugu משכה מאז יוני, והיא ביקורת הוגנת ולא עוינת. כאשר מתזמר משיג ציון טוב על ידי שילוב המודלים של מעבדות אחרות, הציון שייך למערכת — דבר אמיתי וניתן להגנה שאפשר למכור — אבל הוא אינו עובר לשום מודל בודד, ואי אפשר לבקר אותו. המבקרים העלו את הנקודה בצורה בוטה: Fugu לא ניצח את דגם הדגל, הוא שכר את דגם הדגל. במשימות ניתנות לאימות עם בודק זול, כמו מבחן קידוד עם חבילת בדיקות, ועדה באמת יכולה לגבור על החבר הטוב ביותר שלה. במשימות בלי בודק כזה, פאנל שדוגם כמה מודלי חזית ומדווח את התוצאה הטובה ביותר מדווח במידה מסוימת על מזל. בחירות הקטגוריות של Sakana עצמה — Chartography, DeepSWE, Toolathon — נוטות לקצה הניתן לאימות, שזה המקום הנכון להשמיע את הטענה, וגם הסיבה לכך שאי אפשר להכליל את הטענה בחינם.

בודקים עצמאיים גם ציינו את שונות זמן השהיה כעלות המעשית של תזמור: במשימות קשות המתאם מתלבט, ובמשימות קלות ההתלבטות הזו היא תקורה טהורה. משימת שיידר של חוקר אחד דווחה כנמשכת כשלושים דקות, כשהאיכות דורגה רק כמקובלת.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

איפה באמת אפשר להשיג את זה

Fugu Ultra v2 זמין כעת דרך ה-API של Sakana עצמה, התואם ל-OpenAI — כוונו לקוח קיים לנקודת הקצה עם מפתח API ושנו שורה אחת — וכן דרך כמה פלטפורמות צד שלישי. OrcaRouter אינה מספקת את דגמי Fugu; אם ברצונכם לקרוא ל-Fugu Ultra v2, ה-API של הספק עצמו הוא הנתיב הישיר.

מה שראוי לציין הוא החלופה ש-Sakana מתחרה בה באופן מרומז. המאגר שמאפשר ל-Fugu Ultra v2 לעבוד מורכב ממודלים שניתן לקרוא להם בנפרד כיום, והיריבים שמולם הוא נמדד הם אלה שצוותים כבר מריצים. Claude Opus 5, DeepSeek V4 Pro ו-Gemini 3.1 Pro נמצאים כולם ב-OrcaRouter במחירי המחירון של הספקים שלהם עם 0% תוספת, מה שאומר שהורדת מחיר מכל אחד מהספקים האלה פעילה אצלנו באותו יום שבו היא מוכרזת. אם הסיבה שאתם שוקלים מתזמר היא חוסן — לא לרצות שמסלול ייצור יהיה תלוי בזמינות של ספק אחד או במדיניות של ספק אחד — אז שכבת ניתוב עם מעבר אוטומטי בין ספקים פותרת חלק מהבעיה הזו ברמת המודל, ו-Fugu Ultra v2 פותר חלק אחר ברמת ההיסק.API אחד ל-200+ מודליםעם מעבר אוטומטי אינו מהווה תחליף למתאם מאומן, ומתאם מאומן אינו מהווה תחליף לאי-תלות בספק יחיד. חלק מהצוותים ירצו את שניהם.

מלכוד הציות

Fugu אינו זמין באיחוד האירופי או באזור הכלכלי האירופי. הניסוח של הספק מפורש: אינו זמין עדיין באיחוד האירופי/ב-EEA בעודו פועל לקראת עמידה ב-GDPR ובתקנות ספציפיות לאיחוד האירופי, ובמקומות אחרים הגישה עשויה להיות מוגבלת בגלל תנאי רשת או כללים מקומיים. אם בארגון שלך יש ישויות באיחוד האירופי שנכללות בהיקף, הדבר מוציא את קו Fugu מהשיקול ללא קשר לביצועים במדדים, וזה שווה לדעת לפני ההערכה ולא אחריה.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

מה לצפות

שלושה דברים יהפכו את Fugu Ultra v2 מטענה מעניינת לבחירה קריטית. הערכה בלתי תלויה — רשומה ב-Artificial Analysis, מיקום ב-LMArena, כל דבר שיש מאחוריו מסגרת בדיקה — תכריע בשאלת ה-Chartography בתוך שבוע. מספרים משוחזרים מצד שלישי על מבחני קידוד ניתנים לאימות יאשרו את השיפור ברמת המערכת שהארכיטקטורה חוזה. ומאגר גלוי, או אפילו חלקי, יאפשר לקונים לנתח בדיוק אילו נקודות כשל בודדות הם מקבלים על עצמם כאשר הם מנתבים תעבורת ייצור דרך מתאם שאינם יכולים לבדוק.

עד אז, העמדה הכנה היא זו. Fugu Ultra v2 הוא הניסיון הרציני ביותר עד כה למכור אורקסטרציה כמוצר ולא כדמו מחקרי, ממעבדה שיש מאחוריה עבודה שפורסמה, במחיר שהופך את פרמיית האורקסטרציה לגלויה ולא נסתרת. אם עומס העבודה שלך הוא ארוך טווח, בר-אימות ומוגבל לאזור שבו Sakana יכולה לשרת אותך, כדאי לבצע פיילוט בהיקף מוגדר עם חשבונאות טוקנים מופעלת. אם לא, המודלים שכנגדם נמדד Fugu Ultra v2 נמצאים במרחק קריאת API אחת, במחיר מחירון, עם ההוכחות שמוכיחות מה הם מסוגלים לעשות.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית