כרטיס כותרת ראשי עבור Fugu Ultra v2 מול Claude Opus 5 עם כותרת המשנה 'אותו מחיר קלט, שני הימורים שונים', תגים בצורת גלולה עם הכיתוב '$5.00 קלט לשניהם', 'Chartography 48.3 מול 27.3' ו'הקשר של 1M', שורת כותרת תחתונה 'Sakana AI מול Anthropic - ספטמבר 2026', והלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Fugu Ultra v2 לעומת Claude Opus 5: אותו מחיר קלט, שני הימורים שונים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Fugu Ultra v2 ו-Claude Opus 5 עולים בדיוק אותו סכום כדי לשאול שאלה, וסכומים שונים בתכלית כדי לקבל מהם תשובה. שניהם מתומחרים ב-5.00 דולר למיליון טוקני קלט. ואילו Fugu Ultra v2 גובה 30.00 דולר למיליון טוקני פלט לעומת 25.00 דולר של Claude Opus 5 — והפער בין שני המספרים האלה אינו הבדל של עיגול, מפני ששתי המערכות פולטות כמויות טקסט שונות מאוד כדי להגיע לתשובה. Sakana AI השיקה את Fugu Ultra v2 ב-11 בספטמבר 2026 כמערכת תזמור שמתאמת מאגר של מודלים של מעבדות אחרות מאחורי נקודת קצה אחת תואמת OpenAI; Claude Opus 5 של Anth​ropic, פעיל מאז סוף יולי 2026, הוא מודל יחיד. ההבדל הזה מכריע את רוב ההשוואה הזאת עוד לפני שמתייעצים עם מבחן ביצועים, וללוח התוצאות של Sakana עצמה יש שורה מביכה: הספק מדווח 48.3 ב-Chartography לעומת 27.3 של Claude Opus 5, וזה הפער הגדול ביותר במהדורה וגם המספר שעומד מאחוריו הכי פחות ראיות חיצוניות.

צירוף המקרים שמעצב את הכול

התחל במה ששני המוצרים מסכימים עליו, כי זה יותר ממחיר הכותרת.

• מחיר קלט — Fugu Ultra v2 ‏$5.00 ל-1M טוקנים לעומת Claude Opus 5 ‏$5.00 ל-1M טוקנים

• מחיר פלט — Fugu Ultra v2 ‏$30.00 ל-1M טוקנים לעומת Claude Opus 5 ‏$25.00 ל-1M טוקנים

• קלט במטמון — Fugu Ultra v2‏ $0.50 לכל 1M מעל תעריף הבסיס לעומת Claude Opus 5, שמתמחר שמירה במטמון כהנחה של עד 90% על קלט במטמון

• הקשר — Fugu Ultra v2 עם 1M טוקנים, כאשר התעריפים מכפילים את עצמם מעל 272K לעומת Claude Opus 5 עם 1M טוקנים, קבוע

• תקרת פלט — Fugu Ultra v2 לא פורסם כנתון בודד לעומת Claude Opus 5 עם 128K טוקנים

• זמינות — Fugu Ultra v2 לא נמכר באיחוד האירופי/באזור הכלכלי האירופי לעומת Claude Opus 5 שזמין באופן כללי בתנאי API סטנדרטיים

• ראיות — בנצ'מרקים שדווחו על ידי הספק של Fugu Ultra v2, אין עדיין הערכה בלתי תלויה לעומת בנצ'מרקים של הספק של Claude Opus 5 בתוספת חודשים של מיקומים בלוחות דירוג של צד שלישי

השורה האחרונה היא המקום שבו ההשוואה באמת מתהפכת. באותו מחיר קלט, אתם בוחרים בין מערכת שאת הציונים שלה יש לקבל באמונה עיוורת לבין מודל שאת הציונים שלו אנשים אחרים שחזרו. צוק ה-272K מחריף זאת: מעבר לסף הזה, תעריף הקלט של Fugu Ultra v2 מוכפל ל-10$ והתעריף של הפלט ל-45$, בעוד שהתעריף של Claude Opus 5 לא זז. עבור הרצות סוכנים בהקשר ארוך — בדיוק עומס העבודה שעבורו נבנה Fugu Ultra v2 — יתרון המחיר של הכותרת הזולה נעלם בדיוק במקום שבו המערכת אמורה לזהור.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

מה כל אחד הוא בפועל

Claude Opus 5 הוא דגל הייצור של Anthropic, והעיצוב שלו קריא מבחוץ. הוא מפעיל חשיבה אדפטיבית כברירת מחדל, ומחליט כמה זמן לחשוב לפני שהוא עונה, עם חוגת מאמץ מפורשת מנמוך עד מקסימום כשאתם רוצים לכפות התעמקות רבה יותר ולשלם על כך. יש לו חלון הקשר של מיליון טוקנים, תקרת פלט של 128K, ראייה, שימוש בכלים ומצב JSON. Anthropic מדווחת על 96.0% ב-SWE-bench Verified ועל 79.2% ב-SWE-bench Pro, יותר מכפול מתוצאת Frontier-Bench v0.1 של קודמו, ועל כ-30.2% ב-ARC-AGI 3 לעומת 7.8% של GPT-5.6 Sol — כולם נתוני הספק, וכולם נמדדו על מודל בודד שאפשר לנעול לפי גרסה. הוא גם מנתב בקשות שסומנו למודל ישן יותר במקום להחזיר שגיאה, וזה פרט תפעולי שחשוב אם יש לכם סקירת תאימות בתהליך.

Fugu Ultra v2 אינו זה, וההבדל אינו קוסמטי. זהו מתאם — מודל מאומן קטן, שלפי הדיווחים מונה כ-7B פרמטרים, שקורא את הבקשה שלך, מרכיב צוות סוכנים, מקצה תפקידי Thinker, Worker ו-Verifier מעבודת TRINITY של Sakana, ומסנתז תשובה סופית. המודלים הבסיסיים אינם נחשפים, החלטות הניתוב אינן נחשפות מעצם התכנון, ולשכבת Ultra המאגר קבוע: לא ניתן להוציא ספק ממנו. הניסוח של Sakana עצמה לגבי גרסה 2 הוא שתאריך הקטיעה של האימון עבר ל-28 באוגוסט 2026 והרכב המאגר השתנה — באופן ספציפי כדי להחריג את Claude Fable 5, Claude Fable 5.1 ו-GPT-6 Astra.

ההחרגה הזו היא הפרט החושפני ביותר בהודעה. Fugu Ultra v2 טוענת לניצחונות בבנצ'מרקים על שלושת המודלים החזקים ביותר הזמינים, בעודה מאשרת שהיא אינה קוראת לאף אחד מהם. יהיה מה שיהיה במאגר, הוא אינו ראש השוק לפי החשבונאות של Sakana עצמה. המסר הוא שתיאום מנצח יכולת. זו תזה אמיתית, ובמשימות ניתנות לאימות עם בודק זול היא תזה שיש מאחוריה ראיות. זו אינה אותה טענה כמו "המערכת הזו חכמה יותר מ-Claude Opus 5", ולוח התוצאות מסודר כך שקל להתבלבל בין השתיים.

לוח התוצאות שSakana בחר

כל מספר שלהלן מגיע מההערכה של Sakana עצמה את Fugu Ultra v2. הנתונים של Claude Opus 5 הם כפי שנמדדו על ידי Sakana באותה השוואה, למעט במקומות שצוין אחרת. אף גורם עצמאי לא שיחזר את עמודת Fugu, ונכון לזמן כתיבת שורות אלו אין רשומה של Artificial Analysis עבור אף דגם Fugu.

• Chartography — Fugu Ultra v2 48.3 לעומת Claude Opus 5 27.3 — לפי דיווח הספק, פער של 21 נקודות

• DeepSWE — Fugu Ultra v2 74.3 לעומת נתון שלא פורסם של Claude Opus 5 באותה טבלה — לפי דיווח הספק

• מיקום בבנצ'מרקים — Fugu Ultra v2 הטוב ביותר או הטוב ביותר במשותף בחמישה מתוך שמונה, בין שני המובילים בשבעה מתוך שמונה — לפי דיווח הספק

• SWE-bench Verified — אין נתון עבור Fugu Ultra v2 לעומת Claude Opus 5 96.0% — לפי דיווח של Anthropic

• SWE-bench Pro — אין נתון עבור Fugu Ultra v2 לעומת Claude Opus 5 79.2% — לפי דיווח של Anthropic

• ARC-AGI 3 — אין נתון עבור Fugu Ultra v2 לעומת Claude Opus 5 ~30.2% — לפי דיווח של Anthropic

קראו את זה כצורה ולא כדירוג. Sakana פרסמה לוח של שמונה מבחני ביצועים שבו היא מנצחת בחמישה, והתוצאות החזקות ביותר של Claude Opus 5 שתועדו בפומבי — שורות ה-SWE-bench, ‏ARC-AGI 3 — פשוט אינן בו. זו אינה האשמה בחוסר תום לב; כך נראה לוח תוצאות של ספק, כולל של כל ספק. אבל זה אומר שאי אפשר להסיק מההשקה ש-Fugu Ultra v2 עוקפת את Claude Opus 5 בהנדסת תוכנה, כי שתי המערכות לא נמדדו על אותן שורות לעתים קרובות מספיק כדי לקבוע. בשורה היחידה שבה שתיהן מופיעות ושתי הספרות פומביות — Chartography — Fugu Ultra v2 טוענת לניצחון גדול. בשורות ההיסק והקידוד הרחבות ביותר, רק צד אחד פרסם.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

עלות למשימה, לא עלות לטוקן.

חשבון הטוקנים של מתזמר אינו תעריף הטוקן שלו. Fugu Ultra v2 מפעיל סוכנים, שכל אחד מהם תורם טוקנים של הסקה ופלט, והמתאם עצמו מייצר טקסט סינתזה. שאלות נפוצות בנושא תמחור של Sakana מציגות כאן התחייבות שימושית באמת — אתה מחויב בתעריף משוקלל אחד המבוסס על המודל המוביל המעורב, והוספת סוכנים אינה מכפילה את החשבון — מה שמסיר את הכפלת ה-fan-out במקרה הגרוע ביותר שהופכת מערכי ריבוי סוכנים נאיביים ליקרים. אבל זה לא מסיר את הנפח. כמות טוקני הפלט המחויבים היא עדיין פונקציה של כמה סוכנים פעלו וכמה הם כתבו, ובמחיר של 30 דולר למיליון, הנפח הזה הוא המשתנה שאתה לא יכול לחזות מדף התמחור.

צורת העלות של Claude Opus 5 היא ההפוכה. קריאה אחת, מודל אחד, חוגת מאמץ בשליטתך, ותעריף פלט של $25 עם עיבוד באצוות הזמין בהנחה של 50% לעבודה שאינה בזמן אמת. אתה יכול לחזות זאת. עבור עומס עבודה שאתה מריץ עשרת אלפים פעמים ביום, יכולת החיזוי שווה הרבה יותר מאשר פער בנצ'מרק במשימת קריאת תרשימים.

כאן גם שאלת הניתוב נפרדת באופן נקי משאלת המודל. Claude Opus 5 יושב על OrcaRouter במחיר המחירון של Anth​ropic עם 0% תוספת — תעריף הספק מועבר כמו שהוא, כך ששינוי מחיר של ספק נכנס לתוקף באותו יום על אותה מפתח, עם מעבר אוטומטי בין נתיבי ספקים אם אחד מהם מוגבל בקצב או מושבת. Fugu Ultra v2 אינו בקטלוג שלנו; הוא מגיע אליכם דרך ה-API התואם ל-OpenAI של Sakana עצמה ומספר פלטפורמות צד שלישי, והמעבר מ-Fugu קודם הוא שינוי של שורת פרמטר אחת. אם מה שאתם באמת רוצים הוא היכולת לחזות מראש של Claude Opus 5 עם פחות חשיפה לספק יחיד, הראוטר הוא התשובה והאורקסטרטור לא. אם מה שאתם רוצים הוא מערכת שמנסה כמה גישות לבעיה קשה בלי שאתם תכתבו את הפיזור בעצמכם, Fugu Ultra v2 הוא הדבר שעושה זאת — וכדאי להריץ אותו בפיילוט עם חשבונאות טוקנים מופעלת.

איפה Fugu Ultra v2 באמת מנצח

תנו למערכת את המגיע לה. תוצאת Chartography, אם היא מחזיקה מעמד, היא מסוג הניצחונות שמודלים בודדים מתקשים לזייף: חשיבה חזותית על מסמכים מובנים מתגמלת ניסיון פירוש, בדיקתו מול המסמך וניסיון נוסף — וזה בדיוק לשם מה נועד תפקיד Verifier. אותו היגיון חל על Toolathon ו-DeepSWE, שבהם אפשר לבחון את התשובה במקום להתווכח עליה. מקרי הבוחן שפרסמה Sakana מצביעים לאותו כיוון: ריצת AutoResearch בת 123 ניסויים במשך ארבע־עשרה שעות על H100 אחד, פותר קובייה הונגרית ב-Python טהור שהשלים את כל 300 הקוביות המעורבבות, בעוד שני בסיסי ייחוס אנונימיים של מודלים חזיתיים קרסו כליל, וצמצם CAD מכני שבאמת נפתח ונסגר. אלה דוגמאות שנבחרו בידי הספק עם בסיסי ייחוס אנונימיים, ולכן הן מוכיחות פחות משהן נראות. אבל הדפוס עקבי, והוא מצביע על קטגוריה אמיתית: משימות שבהן הנכונות ניתנת לבדיקה והחלק הקשה הוא התמדה.

ישנו גם טיעון מבני שאין לו שום קשר לבנצ'מרקים. Claude Opus 5 הוא המודל של ספק אחד, והוא כפוף להחלטות התמחור, ללוח הזמנים להוצאה משימוש ולמדיניות של אותו ספק. Fugu Ultra v2 תוכנן לשרוד כל אחד ואחד מאלה שישתנו, ו-Sakana מצהירה במפורש שזו הנקודה — נעילת ספקים, שלילת גישה ל-API, בקרות יצוא. בשוק שבו מודלים הוסרו מאזורים בהתראה קצרה, זה אינו תרחיש היפותטי. זהו גידור, וגידורים עולים כסף: 5 דולרים יותר למיליון טוקני פלט הוא בערך המחיר של הגידור הזה.

פסק הדין

Claude Opus 5 מנצח בהחלטה שרוב הצוותים למעשה מקבלים. יש מאחוריו חודשים של הערכה בלתי תלויה, חלון של 1M טוקנים שלא מכפיל את מחירו באמצע המסמך, תקרת פלט של 128K, מחיר מפורסם שאפשר לחזות, חוגת מאמץ שמאפשרת לך לקנות חשיבה רק כשהמשימה מצדיקה זאת, ותוצאות צד שלישי על בדיוק אותם מבחני הבנצ'מרק — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — שהצוותים העוסקים בסוכנים ובקוד הכי אכפת להם מהם. Fugu Ultra v2 מנצח בשאלה צרה ומעניינת יותר: האם מתאם עם מאגר קטן יותר יכול לה� outperform מוביל בקטגוריה במשימות שבהן אפשר לבדוק את התשובה. לוח התוצאות של Sakana עצמה אומר כן בחמישה מתוך שמונה שורות, וההדרה מהמאגר אומרת שהניצחון הושג בלי שלושת המודלים הטובים בעולם.

אם אתם מריצים עבודה ניתנת לאימות, ארוכת טווח וניתנת לבדיקה, ואתם מחוץ ל-EU/EEA, Fugu Ultra v2 שווה פיילוט בהיקף מוגדר — מדדו טוקנים של פלט לכל משימה שהושלמה, לא לכל טוקן, וקבעו תקרה לפני שתתחילו. אם אתם זקוקים היום לנתיב ייצור עם ראיות מאחוריו וחשבון שאפשר לחזות מראש, Claude Opus 5 נשאר הבחירה המבוססת יותר, והוא במרחק מפתח API אחד במחיר המחירון של Anth​ropic, כשתעריף הספק מועבר כפי שהוא, ללא שינוי.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית