כרטיס כותרת הירו עבור "Fugu Max לעומת GLM-5.3" עם כותרת משנה "מודל הנפח חותר תחת מודל הערך", שלושה תגים מעוגלים שעליהם כתוב "$6.00 לעומת $3.96 פלט", "7,962.7M טוקנים ל-7 ימים", "$2.00 לעומת $1.26 קלט", שורת פוטר שעליה כתוב "Sakana AI לעומת Z.ai - ספטמבר 2026", והלוגו של OrcaRouter בפינה הימנית התחתונה.
Engineering & Research

Fugu Max לעומת GLM-5.3: מודל הערך נשחק על ידי מודל הכמות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Fugu Max תומחר כדי לנצח בעלות, ו-GLM-5.3 זול יותר בשני הצירים. המתאם של Sakana AI הושק ב-11 בספטמבר 2026 במחיר של $2.00 למיליון אסימוני קלט ו-$6.00 למיליון אסימוני פלט, שנבנה כדי לנתב כל משימה למודל הזול ביותר שיכול להתמודד איתה. GLM-5.3 של Z.ai, שרשום מאז 18 באוגוסט 2026, עומד על $1.26 לקלט ו-$3.96 לפלט למיליון ב-OrcaRouter — בין שליש לשני חמישים מתחת ל-Fugu Max בשניהם, ממודל יחיד של טקסט בלבד עם חלון הקשר של 1M שפורסם ותקרת פלט של 128K. GLM-5.3 גם במקרה הוא המודל העמוס ביותר בקטלוג שלנו בפער גדול. השילוב הזה — זול יותר לאסימון, ומוכיח שהוא נושא תעבורת ייצור בקנה מידה — הופך את זה להתמודדות שבה פרמיית התזמור היא הקשה ביותר להצדקה.

זול יותר בשני הצירים, כשהמפרט מפורסם

ההשוואה לא נוחה עבור Fugu Max עוד לפני ששום בנצ'מרק נכנס לתמונה, משום שזה אינו מקרה של החלפת יכולת במחיר. GLM-5.3 הוא דגל הסמוך לחזית בזכות עצמו — Z.ai מתארת אותו כמספק שיפור של כ-50% בקידוד לעומת GLM-5.2, וכמתאים ל-Mythos 5 ביכולות סייבר נבחרות. זה אינו מודל תקציבי המוצע כאלטרנטיבה זולה. זהו דגל שבמקרה מתומחר מתחת למתזמר מותאם-עלות.

• מחיר קלט — Fugu Max ‏2.00 $ ל-1M טוקנים לעומת GLM-5.3 ‏1.26 $ ל-1M טוקנים

• מחיר פלט — Fugu Max $6.00 ל-1M טוקנים לעומת GLM-5.3 $3.96 ל-1M טוקנים

• קלט שמור במטמון — Fugu Max‏ $0.25 לכל מיליון טוקנים לעומת GLM-5.3, שבו המטמון מתומחר כהנחה על תעריף הקלט הבסיסי

• הקשר — Fugu Max לא פורסם לעומת GLM-5.3 עם 1M טוקנים

• תקרת פלט — Fugu Max לא פורסם לעומת GLM-5.3 128K טוקנים

• מודאליות — Fugu Max לא פורסם לעומת GLM-5.3 טקסט בלבד, מתועד ככזה

• תגי יכולות — Fugu Max: לא פורסמו, לעומת GLM-5.3: שימוש בכלים, מצב JSON, הסקה

• נתוני בנצ'מרק — שש זכיות של Fugu Max שנטענו ללא ציונים לעומת GLM-5.3, עם DeepSWE כפי שדווח על ידי הספק, 46.2 עד 66.9 לעומת הדור הקודם, ובנוסף ציון אינטליגנציה שפורסם של Artificial Analysis

• משקלים — Fugu Max סגור, מאגר לא ידוע לעומת GLM-5.3 ממעבדה עם שושלת משקלים פתוחים

• תעבורה שנצפתה ב-OrcaRouter — Fugu Max אין, לא הועבר לעומת GLM-5.3 עם 7,962.7M טוקנים בשבעת הימים האחרונים

שימו לב למה ששתי השורות האחרונות עושות יחד. GLM-5.3 מגיע משושלת עם משקלים פתוחים, שהיא הצורה החזקה ביותר הזמינה של טיעון העצמאות מהספק שסאקאנה מוכרת כהנחת היסוד כולה של Fugu Max. ויש לו נתון תעבורה נצפה גדול בסדר גודל ממרבית המודלים שאנו משרתים. אם השאלה היא "מה אני מריץ לעבודת ייצור עתירת טקסט בתעריף נמוך", הראיות מצביעות למקום אחר ולא למתזמר.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

טיעון הכמות, ולמה זה לא רק תחרות פופולריות

מספר תעבורה אינו מספר איכות, ואין לקרוא אותו ככזה. מה ש־7.96 מיליארד טוקנים בשבעה ימים כן מדגים הוא ש־GLM-5.3 הורץ בהיקף ייצור על ידי צוותים עצמאיים רבים, על עומסי עבודה אמיתיים, ולא גרם לנדידה המונית ממנו. זהו אות חלש לגבי איכות ואות חזק לגבי כשירות תפעולית: זמן השהיה יציב, התפוקה מחזיקה, ה-API מתנהג כשורה תחת עומס, ואופני הכשל מוכרים לאוכלוסייה גדולה מספיק כדי שהם יצופו בפומבי. למודל ששוחרר באותו שבוע שבו יצא Fugu Max אין מאחוריו מאומה מכל זה.

שורת השהיה מחדדת את הנקודה. GLM-5.3 מציג זמן p50 עד לאסימון הראשון של 4.33 שניות על פני התעבורה שאנו משרתים. עבור עבודה סוכנית — עומס העבודה ששני המוצרים הללו מכוונים אליו — זמן עד לאסימון הראשון מצטבר בכל תור של כל תת-סוכן שהמתאם מפעיל. אורקסטרטור זול יותר שמפעיל ארבעה סוכנים אינו זול יותר אם כל אחד מהם ממתין כמה שניות לפני שהוא מפיק משהו, והעלות הזו לעולם אינה מופיעה בכרטיס תעריפים.

הטיעון הנגדי של Fugu Max הוא שהמתאם שלו מנתב למודל המסוגל הרזה ביותר לכל בקשה, מה שבאופן עקרוני אומר שמשימות רבות כלל לא נוגעות בבקאנד יקר. הרחבת המאגר של Sakana בגרסה זו הוסיפה מודלים עם משקולות פתוחות ומודלים מיוחדים, כולל משפחת NVIDIA Nemotron, באמצעות שיתוף פעולה עם NVIDIA, כך שהשלבים הזולים של הסולם הזה אמיתיים. השאלה היא האם השלבים זולים מ-$3.96 למיליון טוקנים בפלט. עבור רוב משימות הטקסט, הם לא — זהו רף נמוך, ומודלים עם משקולות פתוחות שרצים בתעריפי אירוח בדרך כלל עוברים אותו רק במרווח קטן.

שאלות שכדאי לשאול לפני שאתם בוחרים

האם אורקסטרטור זול יותר ממודל יחיד במשקולות פתוחות? לא כברירת מחדל, והאינטואיציה פועלת בכיוון הלא נכון. תזמור מוסיף את טוקני הסינתזה של מתאם, ובהרצות מרובות-סוכנים גם את הפלט של כל סוכן בצוות. התמחור של Fugu מבית Sakana מסיר את תרחיש הגרוע מכל בכך שהוא מחייב בתעריף משוקלל אחד המבוסס על המודל המשתתף מהדרגה העליונה, במקום לערום סוכנים זה על זה, וזו ויתור אמיתי. אך תעריף הבסיס שאתם משקללים הוא $6.00 לפלט, בעוד שהמודל היחיד שאליו הייתם פונים אחרת הוא $3.96. תזמור חוסך כסף כשהוא מונע ניסיונות חוזרים, לא כשהוא מוסיף מקביליות לשם המקביליות עצמה.

האם מגבלה של טקסט בלבד משנה עבור מי מהשניים? עבור GLM-5.3 היא מתועדת, כך שזו מגבלה שאפשר לתכנן סביבה — אין ראייה, אין אודיו, אין וידאו, והקטלוג אומר זאת. עבור Fugu Max, המודאליות פשוט אינה מפורסמת. זה גרוע יותר ממגבלה, כי אי אפשר לדעת אם פייפליין ששולח PDF יעבוד עד שמנסים אותו. מגבלה שלא צוינה אינה זהה למגבלה שאינה קיימת.

מה קורה לכל אחד מהם כשמודלי הבסיס משתנים?GLM-5.3 הוא מודל אחד בגרסה אחת, שמאומן ומוגש על ידי Z.ai. אם Z.ai משנה את התמחור שלה, השינוי נוחת על המפתח שלכם באותו היום דרך OrcaRouter בתוספת של 0%, ואתם יכולים לראות אותו ולהגיב. ההתנהגות של Fugu Max היא פונקציה של מאגר ש-Sakana אינה חושפת את חבריו, כך שהפסקת תמיכה או שינוי מחיר של מעבדת חזית משנים בשקט את מה שאתם קונים בלי ששם המוצר משתנה. Sakana מציגה זאת כחוסן. זהו חוסן עבור הספק ואטימות עבור הקונה.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

היכן שבאמת מתקבלות החלטות הניתוב

שניהם, למעשה, החלטות ניתוב — Fugu Max מקבל אותן בתוך מתאם אטום, ואתה מקבל אותן בשכבת ה-API. OrcaRouter הוא מהסוג השני: API אחד ליותר מ-200 מודלים עם DSL לניתוב שמאפשר לך לבטא את המדיניות במפורש, מעבר אוטומטי לגיבוי כשנתיב של ספק נפגע, ומיזוג מודלים כשאתה רוצה לשלב פלטים במכוון במקום לסמוך על קופסה שחורה שתעשה זאת. GLM-5.3 מופיע בקטלוג הזה במחיר המחירון של Z.ai עם 0% תוספת, וזה שווה יותר מהרגיל עבור מודל עם כל כך הרבה תעבורה מאחוריו: התעריף שאתה רואה הוא התעריף ש-Z.ai מפרסמת, מועבר כמו שהוא.

ההבדל המעשי הוא יכולת הביקורת. כאשר Fugu Max בוחר מודל עבור הבקשה שלך, אינך מגלה דבר לגבי איזה מודל זה היה או למה. כאשר אתה כותב את מדיניות הניתוב בעצמך, ההחלטה נמצאת במאגר שלך, ניתנת לבדיקה בידי כל מי שסוקר את הקוד שלך, וניתנת לשינוי בלי להמתין לספק. עבור צוותים הנתונים לכל סוג של חובת ציות או חשבונאות עלויות, זה אינו הבדל פילוסופי.

פסק הדין

GLM-5.3 מנצח בהשוואה הזו במונחים שהכי חשובים לצוות ייצור: הוא זול יותר בקלט ובפלט, חלון ההקשר ותקרת הפלט שלו מפורסמים, מגבלות המודאליות שלו מוצהרות, הוא מציע שימוש בכלים, מצב JSON והסקה כיכולות מתועדות, הוא מגיע משושלת של משקולות פתוחות, ויש לו נתון תעבורה של שבעה ימים שמתקרב לשמונה מיליארד טוקנים. אין קריאה של הראיות הפומביות שלפיה Fugu Max הוא הרכישה המבוססת יותר בנקודת מחיר זו.

Fugu Max מחזיק בטיעון אחד, והוא טיעון אמיתי: במשימות שבהן מעבר שני של מתאם תופס טעות שהמעבר הראשון היה מכניס לפרסום, העלות למשימה שהושלמה יכולה להיות עדיפה על העלות לטוקן. זה מצדיק פיילוט בהיקף מוגדר אם העבודה שלך ניתנת לבדיקה, בנפח גבוה, ואתה מחוץ ל-EU/EEA — עם תקרה שנקבעה מראש לטוקני פלט ומדידה של טוקנים לכל משימה שהושלמה. אחרת, המודל היחיד שעולה שליש פחות ופועל בעומס ייצור כבר חודש הוא התשובה, והוא זמין ב-OrcaRouter במחיר המחירון של Z.ai, כאשר תעריף הספק מועבר הלאה.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית