
Fugu Ultra v2 מול Gemini 3.1 Pro: היריב שאולי כבר נמצא בתוך המכונה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
קיימת גרסה של ההשוואה בין Fugu Ultra v2 ל-Gemini 3.1 Pro שבה Gemini מנצחת לא משנה כיצד יתפתח המבחן — מפני שייתכן שהיא עושה חלק מהעבודה. מערכת התזמור של Sakana AI, שיצאה לאור ב-11 בספטמבר 2026, אינה חושפת אילו מודלים היא מתאמת; המאגר המדווח של Fugu Ultra מיוני כלל את Gemini 3.1 Pro בין היתר, וגרסה 2.0 מספרת לנו רק מה היא הסירה, ומציינת את Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra כמודרים. ה-Gemini 3.1 Pro של Google הוא מודל חזית רב-מודאלי יחיד עם חלון הקשר של מיליון טוקנים, המטפל בטקסט, בתמונות, בקבצי PDF, באודיו ובווידאו, וזמין באופן כללי מאז מאי 2026 במחיר של 2.00 דולר למיליון טוקנים בקלט ו-12.00 דולר למיליון טוקנים בפלט. אחד מאלה הוא מודל שאפשר לבדוק. האחר הוא מערכת שניצחונותיה במבחנים עשויים להתנתב דרך הראשון, ואף אחד מהספקים לא יגיד לך אם זה אכן כך.
מהי כל מערכת בפועל
Gemini 3.1 Pro מובן באופן שהפך נדיר בקרב מהדורות חזיתיות. זהו טרנספורמר דליל מסוג mixture-of-experts מבית Google DeepMind, שהושק לראשונה בתצוגה מקדימה ב-19 בפברואר 2026, כאשר מקור אחד מתארך את הזמינות הכללית למאי 2026 — הרשימה שלנו מציגה אותו תחת מזהה מודל התצוגה המקדימה. הוא כולל חלון קלט של 1M טוקנים ותקרת פלט של 65K טוקנים, מקבל טקסט, תמונות, PDF, אודיו, וידאו וקוד, וחושף בקרת הסקה תלת-רמתית — נמוכה, בינונית או גבוהה — כאשר גבוהה היא ברירת המחדל של ה-API. Google מדווחת על 77.1% ב-ARC-AGI-2, יותר מכפול מהדור הקודם עם 31.1%; 94.3% ב-GPQA Diamond; 80.6% ב-SWE-bench Verified; 68.5% ב-Terminal-Bench 2.0; 85.9% ב-BrowseComp; ו-44.4% ב-Humanity's Last Exam ללא כלים, ועולה ל-51.4% עם חיפוש והרצת קוד. אלה נתוני ספק. תאריך הידע האחרון שלו הוא ינואר 2025, וכדאי לציין זאת אם העבודה שלך תלויה באירועים אחרונים.
Fugu Ultra v2 הוא מתאם. זהו מודל מאומן, שעל פי דיווח כולל כ-7B פרמטרים, אשר קורא בקשה, מרכיב צוות סוכנים עם תפקידי Thinker, Worker ו-Verifier הנגזרים ממחקר ה-TRINITY של Sakana, ומסנתז תשובה מאחורי נקודת קצה תואמת OpenAI. אין לו רשימת מודאליות מפורסמת משל עצמו — כל מה שהוא יכול לראות, הוא רואה כי מודל במאגר שלו יכול לראות אותו. ההקשר שלו הוא 1M טוקנים עם צוק תמחור חד ב-272K, שבו התעריפים מוכפלים ל-$10 קלט ו-$45 פלט. תקרת הפלט שלו אינה מפורסמת. המאגר שלו אינו מפורסם, החלטות הניתוב שלו "אינן נחשפות מעצם התכנון", ובשכבת Ultra המאגר קבוע, כך שלא ניתן להחריג ספק.
האסימטריה הזו היא כל ההתמודדות. Gemini 3.1 Pro הוא רכיב שאפשר לקנות ישירות ולחשוב עליו בהיגיון. Fugu Ultra v2 הוא מכלול שחלקיו אינם נראים ושטענות הבנצ'מרק החזקות ביותר שלו עשויות להיות, בחלקן, התוצאות של Gemini עצמו בשילוב עם אלה של מישהו אחר.

ההשוואה שבה השניים חופפים
מעט מאוד מן העדויות שפורסמו מעמידות את שתי המערכות על אותה שורה. הנתונים שלהלן של Gemini 3.1 Pro הם של Google עצמה; אלה של Fugu Ultra v2 הם של Sakana עצמה; במקום שבו אגרגטור של צד שלישי פרסם שורה משותפת, הדבר מסומן ומלווה בהסתייגות שהיא כיוונית ולא מכרעת.
• הסקה מולטימודלית (CharXiv, שורה משותפת) — Fugu Ultra v2 86.6% לעומת Gemini 3.1 Pro 80.2%, לפי BenchLM, שמתייג את הקטגוריה ככיוונית ומסרב לנקוב בשם מנצח
• TerminalBench 2.1 — אין נתון של Fugu Ultra v2 v2.0 מול Gemini 3.1 Pro; אין נתון מפורסם בר-השוואה; ה-Fugu Ultra מיוני דיווח על 82.1% לעומת 70.3% של Gemini 3.1 Pro בצבירה של צד שלישי
• SWE-Bench Pro — אין נתון עבור Fugu Ultra v2 v2.0 לעומת Gemini 3.1 Pro; אין נתון מפורסם להשוואה; ה-Fugu Ultra מיוני דיווח על 73.7% לעומת 54.2% של Gemini 3.1 Pro
• ARC-AGI-2 — אין נתון עבור Fugu Ultra v2 לעומת Gemini 3.1 Pro 77.1%, לפי דיווח הספק
• Humanity's Last Exam — אין נתון עבור Fugu Ultra v2 v2.0 לעומת Gemini 3.1 Pro: 44.4% ללא כלים, 51.4% עם כלים, לפי דיווח הספק
• כיסוי מודאליות — Fugu Ultra v2 יורש כל מה שהמאגר שלו תומך בו, לא מפורסם, לעומת Gemini 3.1 Pro: טקסט, תמונה, PDF, אודיו, וידאו וקוד, מתועד
• מחיר קלט / פלט — Fugu Ultra v2 $5.00 / $30.00 לכל 1M, מכפיל את עצמו מעל 272K לעומת Gemini 3.1 Pro $2.00 / $12.00 לכל 1M עד 200K, $4.00 / $18.00 מעבר לכך, קלט במטמון $0.20 / $0.40
• הקשר ופלט — Fugu Ultra v2 עם הקשר של 1M, תקרת פלט שלא פורסמה לעומת Gemini 3.1 Pro עם קלט של 1M, פלט של 65K
• משקלים וגישה — Fugu Ultra v2 סגור, EU/EEA מוחרגים, לעומת Gemini 3.1 Pro קנייני אך זמין באופן נרחב בכל משטחי Google
השורה הרב-מודלית היא זו שצריך לטפל בה בזהירות, משום שהיא המצוטטת ביותר והפחות מוצקה. אגרגציית CharXiv של BenchLM מקדימה את Fugu Ultra v2 ב-6.4 נקודות מנורמלות — ואותו עמוד מציין במפורש ששורות כיווניות לעולם לא נקבע להן מנצח, של-Gemini לא היו תוצאות מדודות בקטגוריות הסוכנים, הקידוד, הידע או הרב-לשוניות, ושבמתמטיקה או ברב-לשוניות לא היו ל-Fugu תוצאות כלל. קטגוריה שבה רק צד אחד נמדד ברוב השורות אינה יכולה להניב הכרעה. אם לא תיקחו שום דבר אחר מההשוואה הזו, קחו את זה: בעבודה רב-מודלית ספציפית, הראיות שפורסמו אינן תומכות במסקנה לכאן או לכאן, והשורה היחידה שקיימת היא במפורש לא תוצאה סופית.
האפשרות שמשנה את המסגרת
סקאנה לא תאמר מה יש במאגר. זו בחירת עיצוב מתועדת, לא מחדל — השאלות הנפוצות אומרות שמידע ניתוב אינו נחשף מעצם העיצוב, ואין מנגנון לבדוק אותו. מה שאנחנו יודעים מהדור של יוני הוא שחברי המאגר המדווחים כללו את Gemini 3.1 Pro לצד מודלים חזיתיים אחרים. גרסה 2.0 שינתה את המאגר, וסקאנה תיארה את השינוי רק על ידי חיסור: Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra יצאו. שום דבר בהודעה לא אומר ש-Gemini עדיין בפנים.
אם Gemini 3.1 Pro נמצא במאגר, נובעות שלוש השלכות, וכל השלוש מעשיות ולא פילוסופיות. ראשית, חלק מהיכולות הרב-מודאליות של Fugu Ultra v2 הוא הביצועים של Gemini, בשילוב עם מודלים אחרים — מה שאומר שאתה משלם פרמיית תיאום על גבי תעריף לפי טוקן שאותו יכולת לשלם ישירות. שנית, Fugu Ultra v2 במחיר של $30 פלט למיליון לעומת Gemini 3.1 Pro במחיר של $12 הוא פרמיה על הרכבה, לא על יכולת גולמית; אם המשימה שלך היא שאלה רב-מודאלית בודדת, Gemini עונה עליה בזול יותר ואתה יכול לראות בדיוק איזה מודל ענה. שלישית, והשימושי ביותר, המבחן הכנה של מתזמר אינו "האם הוא מנצח את מרכיביו" אלא "האם הוא מנצח את המרכיב הטוב ביותר שלו כשאתה משתמש בו לבד." הארכיטקטורה של Sakana בנויה על הטענה שהיא כן, במשימות ניתנות לאימות. כדאי לבחון את הטענה הזו על עומס העבודה שלך לפני שאתה מקבל אותה על מבחן קריאת גרפים.
יש גרסה שבה התשובה היא לא, והמתזמר עדיין מרוויח את מקומו. אם Gemini נמצא במאגר והציון של Fugu Ultra v2 ב-Chartography, 48.3 לעומת 27.3 של Claude Opus 5, מחזיק מעמד, אז מה ש-Sakana בנתה הוא שכבת תיאום שמפיקה באופן אמין יותר מאותו מודל ממה שמקבלים מקריאה אחת שלו. זהו מוצר אמיתי, והשאלה הפתוחה היא רק אם השוליים מכסים את המחיר. אף אחד לא פרסם את הניסוי.

איפה שהקצוות הכנים נמצאים
היתרונות של Gemini 3.1 Pro הם מוחשיים. מחירו הוא בערך שני חמישיות ממחיר Fugu Ultra v2 בקלט ובפלט, ובשונה מ-Fugu התעריפים שלו אינם מוכפלים לאחר סף הקשר — המדרגה ב-200K מתונה יותר מהמצוק ב-272K. הוא מתעד את המודאליות שלו במקום לרשת אותן, מה שאומר שעבודה עם אודיו וווידאו היא תכונה נתמכת ולא תקווה. יש לו תקרת פלט שפורסמה. הוא זמין דרך המשטחים של Google עצמה, וכמו המודלים האחרים ש-Fugu Ultra v2 נמדד נגדם, הוא ניתן לקריאה ב-OrcaRouter — בתור google/gemini-3.1-pro-preview, במחיר המחירון של Google עם 0% תוספת, כך ששינוי מחיר של Google נוחת על אותו מפתח באותו יום שבו הוא מוכרז.
היתרונות של Fugu Ultra v2 צרים יותר ואמיתיים. הוא תוקף בעיה קשה יותר מפעם אחת, עם תפקיד Verifier שבודק את העבודה, ולכן הטענות החזקות ביותר שלו נשענות על מבחני ביצועים שבהם ניתן לבדוק נכונות — Chartography, DeepSWE, Toolathon — ולא על שליפת ידע. מחקרי המקרה שפרסמה Sakana נוטים לאותו כיוון: צמצם CAD מכני שנפתח ונסגר כראוי במקום שבו מודלים אחרים השאירו פערים וחיבורים חלשים; פותר Rubik's cube ב-Python טהור שהשלים את כל 300 הקוביות המעורבבות, בעוד שני קווי בסיס של החזית, אנונימיים, קרסו לחלוטין. קווי הבסיס הללו אנונימיים ונבחרו על ידי הספק, ולכן יש להתייחס אליהם כדוגמה בלבד ולא כהוכחה. אבל הדפוס עקבי לאורך כל המהדורה, והוא מתאר יכולת אמיתית שאין לקריאה בודדת למודל: התמדה על בעיה עד שהתשובה עוברת בדיקה.
שקלו גם את המגבלות. Fugu Ultra v2 אינו נמכר באיחוד האירופי או באזור הכלכלי האירופי (EEA), וסקאנה מציינת במפורש שהיא פועלת לעמידה בדרישות ה-GDPR. ל-Gemini 3.1 Pro אין מגבלה כזו, ולזכותו רקורד ארוך בהרבה של הערכה בלתי תלויה.

הפסיקה
עבור רוב העבודה הרב-מודלית, Gemini 3.1 Pro הוא הבחירה הנכונה, וזה לא אפילו קרוב. הוא זול יותר לכל טוקן, זול יותר לכל מסמך, מתועד עבור אודיו ווידאו, מוגבל לסף הקשר שלא מכפיל לך את החשבון באמצע ריצה, ו—החלק שהכי חשוב כאן—אתה יכול לראות מה ענה לך. אם אתה צריך מודל אחד שיקרא PDF, יצפה בקליפ ויענה על שאלה, אין שום טיעון לנתב את זה דרך מאגר שלא נחשף במחיר שהוא פי שניים וחצי ממחיר הפלט.
Fugu Ultra v2 הוא הבחירה הנכונה לסוג עבודה ספציפי וצר בהרבה: משימות ארוכות טווח עם תשובה ניתנת לבדיקה, שבהן לנסות בעיה בשלוש דרכים ולאמת את התוצאה עדיף על לנסות אותה פעם אחת, ושבהן נקודת האיכות השולית שווה את הכפולה. הוא מחוץ לשיקולים לחלוטין אם יש לך משתמשים באיחוד האירופי או באזור הכלכלי האירופי בהיקף הפעילות.
השאלה הלא-נוחה שהעימות מותיר פתוחה היא זו שאיש לא מדד. אם Gemini 3.1 Pro נמצא בתוך המאגר — והתשובה הכנה היחידה היום היא ש-Sakana לא אמרה שהוא לא — אז חלק ממה שאתה קונה עם Fugu Ultra v2 הוא Gemini 3.1 Pro עם שכבת תיאום מעליו, במחיר שמרמז שהשכבה שווה בערך פי שניים וחצי מהמודל. זה עשוי בהחלט להיות נכון. הארכיטקטורה של Sakana נבנתה כדי שזה יהיה נכון. אבל זו השערה שמאחוריה לוח תוצאות של ספק ואין לה מבחן בלתי תלוי, ועד שמישהו יריץ אותו, המודל שאתה יכול לראות הוא זה שאתה יכול להגן עליו.
