כרטיס כותרת ראשי עבור Fugu Ultra v2 נגד Gemini 3.1 Pro עם כתובית המשנה 'היריב שאולי כבר נמצא בתוך המכונה', תגים מעוגלים עם הכיתוב '$30.00 נגד $12.00 פלט', 'CharXiv 86.6 נגד 80.2 כיווני' ו'מאגר שלא נחשף', שורת פוטר 'Sakana AI נגד Google DeepMind - ספטמבר 2026', והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Fugu Ultra v2 מול Gemini 3.1 Pro: היריב שאולי כבר נמצא בתוך המכונה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

קיימת גרסה של ההשוואה בין Fugu Ultra v2 ל-Gem​ini 3.1 Pro שבה Gem​ini מנצחת לא משנה כיצד יתפתח המבחן — מפני שייתכן שהיא עושה חלק מהעבודה. מערכת התזמור של Sakana AI, שיצאה לאור ב-11 בספטמבר 2026, אינה חושפת אילו מודלים היא מתאמת; המאגר המדווח של Fugu Ultra מיוני כלל את Gem​ini 3.1 Pro בין היתר, וגרסה 2.0 מספרת לנו רק מה היא הסירה, ומציינת את Claude Fable 5,‏ Claude Fable 5.1 ו-GPT-6 Astra כמודרים. ה-Gem​ini 3.1 Pro של Goo​gle הוא מודל חזית רב-מודאלי יחיד עם חלון הקשר של מיליון טוקנים, המטפל בטקסט, בתמונות, בקבצי PDF, באודיו ובווידאו, וזמין באופן כללי מאז מאי 2026 במחיר של 2.00 דולר למיליון טוקנים בקלט ו-12.00 דולר למיליון טוקנים בפלט. אחד מאלה הוא מודל שאפשר לבדוק. האחר הוא מערכת שניצחונותיה במבחנים עשויים להתנתב דרך הראשון, ואף אחד מהספקים לא יגיד לך אם זה אכן כך.

מהי כל מערכת בפועל

Gemini 3.1 Pro מובן באופן שהפך נדיר בקרב מהדורות חזיתיות. זהו טרנספורמר דליל מסוג mixture-of-experts מבית Google DeepMind, שהושק לראשונה בתצוגה מקדימה ב-19 בפברואר 2026, כאשר מקור אחד מתארך את הזמינות הכללית למאי 2026 — הרשימה שלנו מציגה אותו תחת מזהה מודל התצוגה המקדימה. הוא כולל חלון קלט של 1M טוקנים ותקרת פלט של 65K טוקנים, מקבל טקסט, תמונות, PDF, אודיו, וידאו וקוד, וחושף בקרת הסקה תלת-רמתית — נמוכה, בינונית או גבוהה — כאשר גבוהה היא ברירת המחדל של ה-API. Google מדווחת על 77.1% ב-ARC-AGI-2, יותר מכפול מהדור הקודם עם 31.1%; 94.3% ב-GPQA Diamond; 80.6% ב-SWE-bench Verified; 68.5% ב-Terminal-Bench 2.0; 85.9% ב-BrowseComp; ו-44.4% ב-Humanity's Last Exam ללא כלים, ועולה ל-51.4% עם חיפוש והרצת קוד. אלה נתוני ספק. תאריך הידע האחרון שלו הוא ינואר 2025, וכדאי לציין זאת אם העבודה שלך תלויה באירועים אחרונים.

Fugu Ultra v2 הוא מתאם. זהו מודל מאומן, שעל פי דיווח כולל כ-7B פרמטרים, אשר קורא בקשה, מרכיב צוות סוכנים עם תפקידי Thinker, Worker ו-Verifier הנגזרים ממחקר ה-TRINITY של Sakana, ומסנתז תשובה מאחורי נקודת קצה תואמת OpenAI. אין לו רשימת מודאליות מפורסמת משל עצמו — כל מה שהוא יכול לראות, הוא רואה כי מודל במאגר שלו יכול לראות אותו. ההקשר שלו הוא 1M טוקנים עם צוק תמחור חד ב-272K, שבו התעריפים מוכפלים ל-$10 קלט ו-$45 פלט. תקרת הפלט שלו אינה מפורסמת. המאגר שלו אינו מפורסם, החלטות הניתוב שלו "אינן נחשפות מעצם התכנון", ובשכבת Ultra המאגר קבוע, כך שלא ניתן להחריג ספק.

האסימטריה הזו היא כל ההתמודדות. Gem​ini 3.1 Pro הוא רכיב שאפשר לקנות ישירות ולחשוב עליו בהיגיון. Fugu Ultra v2 הוא מכלול שחלקיו אינם נראים ושטענות הבנצ'מרק החזקות ביותר שלו עשויות להיות, בחלקן, התוצאות של Gem​ini עצמו בשילוב עם אלה של מישהו אחר.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

ההשוואה שבה השניים חופפים

מעט מאוד מן העדויות שפורסמו מעמידות את שתי המערכות על אותה שורה. הנתונים שלהלן של Gemini 3.1 Pro הם של Google עצמה; אלה של Fugu Ultra v2 הם של Sakana עצמה; במקום שבו אגרגטור של צד שלישי פרסם שורה משותפת, הדבר מסומן ומלווה בהסתייגות שהיא כיוונית ולא מכרעת.

• הסקה מולטימודלית (CharXiv, שורה משותפת) — Fugu Ultra v2 ‏86.6% לעומת Gemini 3.1 Pro ‏80.2%, לפי BenchLM, שמתייג את הקטגוריה ככיוונית ומסרב לנקוב בשם מנצח

• TerminalBench 2.1 — אין נתון של Fugu Ultra v2 v2.0 מול Gem​ini 3.1 Pro; אין נתון מפורסם בר-השוואה; ה-Fugu Ultra מיוני דיווח על 82.1% לעומת 70.3% של Gem​ini 3.1 Pro בצבירה של צד שלישי

• SWE-Bench Pro — אין נתון עבור Fugu Ultra v2 v2.0 לעומת Gem​ini 3.1 Pro; אין נתון מפורסם להשוואה; ה-Fugu Ultra מיוני דיווח על 73.7% לעומת 54.2% של Gem​ini 3.1 Pro

• ARC-AGI-2 — אין נתון עבור Fugu Ultra v2 לעומת Gemini 3.1 Pro 77.1%, לפי דיווח הספק

• Humanity's Last Exam — אין נתון עבור Fugu Ultra v2 v2.0 לעומת Gemini 3.1 Pro: 44.4% ללא כלים, 51.4% עם כלים, לפי דיווח הספק

• כיסוי מודאליות — Fugu Ultra v2 יורש כל מה שהמאגר שלו תומך בו, לא מפורסם, לעומת ‌Gemini 3.1 Pro: טקסט, תמונה, PDF, אודיו, וידאו וקוד, מתועד

• מחיר קלט / פלט — Fugu Ultra v2 ‏$5.00 / $30.00 לכל 1M, מכפיל את עצמו מעל 272K לעומת Gemini 3.1 Pro ‏$2.00 / $12.00 לכל 1M עד 200K, ‏$4.00 / $18.00 מעבר לכך, קלט במטמון ‏$0.20 / $0.40

• הקשר ופלט — Fugu Ultra v2 עם הקשר של 1M, תקרת פלט שלא פורסמה לעומת Gem​ini 3.1 Pro עם קלט של 1M, פלט של 65K

• משקלים וגישה — Fugu Ultra v2 סגור, EU/EEA מוחרגים, לעומת Gem​ini 3.1 Pro קנייני אך זמין באופן נרחב בכל משטחי Goo​gle

השורה הרב-מודלית היא זו שצריך לטפל בה בזהירות, משום שהיא המצוטטת ביותר והפחות מוצקה. אגרגציית CharXiv של BenchLM מקדימה את Fugu Ultra v2 ב-6.4 נקודות מנורמלות — ואותו עמוד מציין במפורש ששורות כיווניות לעולם לא נקבע להן מנצח, של-Gemini לא היו תוצאות מדודות בקטגוריות הסוכנים, הקידוד, הידע או הרב-לשוניות, ושבמתמטיקה או ברב-לשוניות לא היו ל-Fugu תוצאות כלל. קטגוריה שבה רק צד אחד נמדד ברוב השורות אינה יכולה להניב הכרעה. אם לא תיקחו שום דבר אחר מההשוואה הזו, קחו את זה: בעבודה רב-מודלית ספציפית, הראיות שפורסמו אינן תומכות במסקנה לכאן או לכאן, והשורה היחידה שקיימת היא במפורש לא תוצאה סופית.

האפשרות שמשנה את המסגרת

סקאנה לא תאמר מה יש במאגר. זו בחירת עיצוב מתועדת, לא מחדל — השאלות הנפוצות אומרות שמידע ניתוב אינו נחשף מעצם העיצוב, ואין מנגנון לבדוק אותו. מה שאנחנו יודעים מהדור של יוני הוא שחברי המאגר המדווחים כללו את Gemini 3.1 Pro לצד מודלים חזיתיים אחרים. גרסה 2.0 שינתה את המאגר, וסקאנה תיארה את השינוי רק על ידי חיסור: Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra יצאו. שום דבר בהודעה לא אומר ש-Gemini עדיין בפנים.

אם Gem​ini 3.1 Pro נמצא במאגר, נובעות שלוש השלכות, וכל השלוש מעשיות ולא פילוסופיות. ראשית, חלק מהיכולות הרב-מודאליות של Fugu Ultra v2 הוא הביצועים של Gem​ini, בשילוב עם מודלים אחרים — מה שאומר שאתה משלם פרמיית תיאום על גבי תעריף לפי טוקן שאותו יכולת לשלם ישירות. שנית, Fugu Ultra v2 במחיר של $30 פלט למיליון לעומת Gem​ini 3.1 Pro במחיר של $12 הוא פרמיה על הרכבה, לא על יכולת גולמית; אם המשימה שלך היא שאלה רב-מודאלית בודדת, Gem​ini עונה עליה בזול יותר ואתה יכול לראות בדיוק איזה מודל ענה. שלישית, והשימושי ביותר, המבחן הכנה של מתזמר אינו "האם הוא מנצח את מרכיביו" אלא "האם הוא מנצח את המרכיב הטוב ביותר שלו כשאתה משתמש בו לבד." הארכיטקטורה של Sakana בנויה על הטענה שהיא כן, במשימות ניתנות לאימות. כדאי לבחון את הטענה הזו על עומס העבודה שלך לפני שאתה מקבל אותה על מבחן קריאת גרפים.

יש גרסה שבה התשובה היא לא, והמתזמר עדיין מרוויח את מקומו. אם Gem​ini נמצא במאגר והציון של Fugu Ultra v2 ב-Chartography, 48.3 לעומת 27.3 של Claude Opus 5, מחזיק מעמד, אז מה ש-Sakana בנתה הוא שכבת תיאום שמפיקה באופן אמין יותר מאותו מודל ממה שמקבלים מקריאה אחת שלו. זהו מוצר אמיתי, והשאלה הפתוחה היא רק אם השוליים מכסים את המחיר. אף אחד לא פרסם את הניסוי.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

איפה שהקצוות הכנים נמצאים

היתרונות של Gem​ini 3.1 Pro הם מוחשיים. מחירו הוא בערך שני חמישיות ממחיר Fugu Ultra v2 בקלט ובפלט, ובשונה מ-Fugu התעריפים שלו אינם מוכפלים לאחר סף הקשר — המדרגה ב-200K מתונה יותר מהמצוק ב-272K. הוא מתעד את המודאליות שלו במקום לרשת אותן, מה שאומר שעבודה עם אודיו וווידאו היא תכונה נתמכת ולא תקווה. יש לו תקרת פלט שפורסמה. הוא זמין דרך המשטחים של Goo​gle עצמה, וכמו המודלים האחרים ש-Fugu Ultra v2 נמדד נגדם, הוא ניתן לקריאה ב-OrcaRouter — בתור google/gemini-3.1-pro-preview, במחיר המחירון של Goo​gle עם 0% תוספת, כך ששינוי מחיר של Goo​gle נוחת על אותו מפתח באותו יום שבו הוא מוכרז.

היתרונות של Fugu Ultra v2 צרים יותר ואמיתיים. הוא תוקף בעיה קשה יותר מפעם אחת, עם תפקיד Verifier שבודק את העבודה, ולכן הטענות החזקות ביותר שלו נשענות על מבחני ביצועים שבהם ניתן לבדוק נכונות — Chartography, DeepSWE, Toolathon — ולא על שליפת ידע. מחקרי המקרה שפרסמה Sakana נוטים לאותו כיוון: צמצם CAD מכני שנפתח ונסגר כראוי במקום שבו מודלים אחרים השאירו פערים וחיבורים חלשים; פותר Rubik's cube ב-Python טהור שהשלים את כל 300 הקוביות המעורבבות, בעוד שני קווי בסיס של החזית, אנונימיים, קרסו לחלוטין. קווי הבסיס הללו אנונימיים ונבחרו על ידי הספק, ולכן יש להתייחס אליהם כדוגמה בלבד ולא כהוכחה. אבל הדפוס עקבי לאורך כל המהדורה, והוא מתאר יכולת אמיתית שאין לקריאה בודדת למודל: התמדה על בעיה עד שהתשובה עוברת בדיקה.

שקלו גם את המגבלות. Fugu Ultra v2 אינו נמכר באיחוד האירופי או באזור הכלכלי האירופי (EEA), וסקאנה מציינת במפורש שהיא פועלת לעמידה בדרישות ה-GDPR. ל-Gem​ini 3.1 Pro אין מגבלה כזו, ולזכותו רקורד ארוך בהרבה של הערכה בלתי תלויה.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

הפסיקה

עבור רוב העבודה הרב-מודלית, Gem​ini 3.1 Pro הוא הבחירה הנכונה, וזה לא אפילו קרוב. הוא זול יותר לכל טוקן, זול יותר לכל מסמך, מתועד עבור אודיו ווידאו, מוגבל לסף הקשר שלא מכפיל לך את החשבון באמצע ריצה, ו—החלק שהכי חשוב כאן—אתה יכול לראות מה ענה לך. אם אתה צריך מודל אחד שיקרא PDF, יצפה בקליפ ויענה על שאלה, אין שום טיעון לנתב את זה דרך מאגר שלא נחשף במחיר שהוא פי שניים וחצי ממחיר הפלט.

Fugu Ultra v2 הוא הבחירה הנכונה לסוג עבודה ספציפי וצר בהרבה: משימות ארוכות טווח עם תשובה ניתנת לבדיקה, שבהן לנסות בעיה בשלוש דרכים ולאמת את התוצאה עדיף על לנסות אותה פעם אחת, ושבהן נקודת האיכות השולית שווה את הכפולה. הוא מחוץ לשיקולים לחלוטין אם יש לך משתמשים באיחוד האירופי או באזור הכלכלי האירופי בהיקף הפעילות.

השאלה הלא-נוחה שהעימות מותיר פתוחה היא זו שאיש לא מדד. אם Gem​ini 3.1 Pro נמצא בתוך המאגר — והתשובה הכנה היחידה היום היא ש-Sakana לא אמרה שהוא לא — אז חלק ממה שאתה קונה עם Fugu Ultra v2 הוא Gem​ini 3.1 Pro עם שכבת תיאום מעליו, במחיר שמרמז שהשכבה שווה בערך פי שניים וחצי מהמודל. זה עשוי בהחלט להיות נכון. הארכיטקטורה של Sakana נבנתה כדי שזה יהיה נכון. אבל זו השערה שמאחוריה לוח תוצאות של ספק ואין לה מבחן בלתי תלוי, ועד שמישהו יריץ אותו, המודל שאתה יכול לראות הוא זה שאתה יכול להגן עליו.