
Fugu Ultra v2 לעומת Qwen3.8-Max: מדוע תג המחיר הוא המספר הלא נכון
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 עולה 30.00 דולר למיליון טוקני פלט. Qwen3.8-Max עולה 6.00 דולר. זהו פער של חמישה לאחד, ואם תבחרו בין שתי המערכות האג'נטיות הללו לפי היחס הזה, תבחרו באופן שגוי — כי אף אחת מהן לא מחויבת למעשה באופן שמחירון שלה מרמז. לפי המדידה של Artificial Analysis עצמה, Qwen3.8-Max ייצר 180 מיליון טוקני פלט כדי להשלים את ה-Intelligence Index, יותר מפי שניים מהמודל החציוני עם 89 מיליון, בעלות של 2.67 דולר למשימה. זהו מודל חסכוני בטוקנים ובזבזני בתשובה. ל-Fugu Ultra v2 של Sakana AI, שהושק ב-11 בספטמבר 2026, יש צורה הפוכה: מאגר לא ידוע של מודלים של מעבדות אחרות שהוא מפעיל ומתאם לפי בקשה, ומחויב בתעריף משולב אחד שלטענת Sakana אינו מתרבה ככל שמוסיפים סוכנים. האחד הוא מודל יחיד בעל 2.4 טריליון פרמטרים שחושב בקול רם במשך זמן רב. האחר הוא מתאם קטן שמעסיק עזרה. השוואת מחירי הטוקנים שלהם כמעט ואינה מספרת לך דבר על איזו מהן זולה יותר להפעלה.
שתי דרכים מנוגדות להיות יקר
התחל מהמנגנון, כי הוא מסביר כל הבדל אחר בהשוואה הזו.
Qwen3.8-Max הוא מודל תערובת מומחים דליל — 2.4 טריליון פרמטרים בסך הכול, כ-95 מיליארד פעילים לכל טוקן — שמגיע לתוצאות סמוכות לחזית על ידי עבודה ממושכת יותר ולא על ידי היותו גדול יותר. Artificial Analysis מדדה אותו ב-37.8 טוקני פלט לשנייה, ודירגה אותו במקום ה-154 מתוך 200 מודלים במהירות, עם 180 מיליון טוקני פלט שהופקו לאורך ה-Intelligence Index (מקום 70 מתוך 200 בשטף מילולי). העלות שלו לכל משימת Intelligence Index עומדת על 2.67$, והנחת המטמון שלו עמוקה באופן יוצא דופן, בשיעור של 88% — זה המנוף שבאמת קובע את החשבון כאן: הרצת סוכן ארוכה שממשיכה לקרוא מחדש את אותו הקשר היא זולה, ואילו כזו שממשיכה לייצר טקסט חדש אינה זולה.
Fugu Ultra v2 ניגש לאותה בעיה מהקצה השני. הוא מתזמר — רכז קטן ומאומן, שדווח כי יש לו כ-7 מיליארד פרמטרים, שקורא בקשה, מרכיב צוות סוכנים לפי תפקידי Thinker, Worker ו-Verifier מעבודת ה-TRINITY של Sakana, ואז מסנתז תשובה. חשבון הטוקנים שלו הוא סכום של מה שסוכני המשנה שלו מייצרים בתוספת טקסט הסינתזה של הרכז עצמו. Sakana מתחייבת בשאלות הנפוצות של התמחור שלה שגובים ממך תעריף משולב אחד הצמוד למודל הבכיר המעורב, וששהוספת סוכנים אינה מכפילה את החשבון, מה שמסיר את התפוצצות הרב-סוכנית הקלאסית שבה התפשטות מכפילה את העלות. מה שזה לא מסיר הוא הנפח. בתעריף של 30.00 דולר למיליון טוקנים בפלט, המספר שקובע הוא כמה סוכנים רצו וכמה הם כתבו, וזה מספר שלא אתה ולא Sakana יכולים לחזות מדף התמחור.
זו הצגה כנה של פער המחירים: זהו תעריף, לא סכום כולל. תעריף גבוה פי חמישה שמוחל על עומס עבודה שאינך יכול לחזות את נפח התפוקה שלו אינו עלות גבוהה פי חמישה — זהו מכפיל בלתי חסום עם רצפה צפויה.

דף המפרט, והשורה האחת שמכריעה את זה
• מחיר — Fugu Ultra v2 $5.00 לקלט / $30.00 לפלט לכל 1M טוקנים לעומת Qwen3.8-Max $2.00 לקלט / $6.00 לפלט
• קלט במטמון — Fugu Ultra v2 $0.50 ל-1M לעומת Qwen3.8-Max $0.25 ל-1M קריאה, והנחת מטמון של 88% כפי שנמדדה על ידי Artificial Analysis
• תוספת עבור הקשר ארוך — הקלט של Fugu Ultra v2 מוכפל ל-$10.00 והפלט ל-$45.00 מעל 272K אסימונים, לעומת Qwen3.8-Max ללא תוספת עבור פרומפט ארוך, אחיד עד גבול החלון
• חלון הקשר — Fugu Ultra v2 מיליון טוקנים לעומת Qwen3.8-Max מיליון טוקנים
• תקרת פלט — Fugu Ultra v2 לא פורסם כנתון בודד לעומת Qwen3.8-Max, כ-128K טוקנים
• מודאליות קלט — טקסט ב-Fugu Ultra v2, כשיכולות המאגר עצמו מאחוריו, לעומת Qwen3.8-Max: טקסט, תמונה, וידאו ו-PDF
• משקלים — Fugu Ultra v2 סגור, והחברות במאגר אינה נחשפת במכוון, לעומת Qwen3.8-Max שמשקלותיו הפתוחים פורסמו עבור נקודת הביקורת מדרגת Max תחת רישיון מותאם אישית
• זמינות אזורית — Fugu Ultra v2 אינו נמכר באיחוד האירופי/באזור הכלכלי האירופי לעומת Qwen3.8-Max שזמין ללא הגבלה אזורית
• הערכה בלתי תלויה — עבור Fugu Ultra v2 לא פורסמה כזו, ואין דף Artificial Analysis עבור אף מודל Fugu, בעוד Qwen3.8-Max הוא רשומה חיה ב-Artificial Analysis עם נתוני מהירות, מילוליות ועלות-למשימה שפורסמו
קראו את שתי השורות האחרונות יחד וההשוואה מתחדדת. Qwen3.8-Max הוא מודל שאפשר לנעול לפי גרסה, לקרוא לו רישיון, להוריד עבורו נקודת ביקורת, ולבדוק מול לוח הניקוד של צד שלישי. Fugu Ultra v2 הוא מערכת שאי אפשר לבדוק, שאי אפשר לארח בעצמך, שאי אפשר לקנות באירופה, ושאי אפשר לאמת מול אף גורם מחוץ ל-Sakana. תוספת החיוב של 272K מחריפה זאת עוד יותר: מעבר לסף הזה תעריף הקלט של Fugu Ultra v2 מוכפל ותעריף הפלט שלו עולה בחצי, ואילו התעריף של Qwen3.8-Max אינו זז. לעבודת מסמכים ומאגרי קוד לטווח ארוך ששתי המערכות נבנו עבורה, הכותרת הזולה יותר היא גם השטוחה יותר.
המספר של Qwen3.8-Max שכולם מצטטים אינו מעודכן
אם קראתם על המודל הזה במקום כלשהו בשבועיים האחרונים, כנראה נתקלתם במדד Intelligence Index של Artificial Analysis שעומד על 58, או 58.1, או 58.4. הנתונים האלה היו אמיתיים וכיום הם כבר לא עדכניים. Artificial Analysis כיילה מחדש את המדד שלה ל-v4.3 ב-7 בספטמבר 2026, וצמצמה את הציונים באופן גורף, והעמוד החי של Qwen3.8-Max מציג כעת 40, מה שממקם אותו במקום ה-30 מתוך 200 מודלים — עם תג "Updated" המסמן ציון שהוצהר מחדש. בכתבות הישנות יותר הופיע גם מס המאמץ שנמדד בקנה המידה הקודם: 64 סבבים למשימה לעומת 14 בדור הקודם של Qwen, וכ-1.14 דולר למשימת Intelligence Index. העמוד הנוכחי מציג 2.67 דולר למשימה, 37.8 אסימוני פלט לשנייה, ו-180 מיליון אסימוני פלט במדד.
שני דברים נובעים מכך. ראשית, בסקאלה המכוילת מחדש, Qwen3.8-Max נמצא באותו טווח כמו שאר השכבה השנייה של החזית, ולא באותה רמה כמוה, וכל השוואה שתקראו שמדרגת אותו מול Claude Opus 5 או Kimi K3 לפי 58 משווה תמונות מצב מסקאלות שונות. שנית, ולמטרות ההתמודדות הזו באופן שימושי יותר, התיקון הוא חד-כיווני: ל-Qwen3.8-Max יש מספר שיכול להיות שגוי ואז להתוקן. ל-Fugu Ultra v2 אין מספר. כל נתון של Fugu במאמר זה מגיע מההערכה של Sakana עצמה, ונכון ל-11 בספטמבר אין עמוד Artificial Analysis עבור Fugu Ultra v2 או כל דגם Fugu אחר — כתובת ה-URL מחזירה 404. כאשר ספק מפרסם לוח תוצאות ואף גורם בלתי תלוי לא הריץ את המודל, לוח התוצאות הוא התיעוד כולו.
איפה שהם באמת חופפים, ואיפה שהם לא
סקאנה מדווחת כי Fugu Ultra v2 הוא הטוב ביותר או הטוב במשותף בחמישה מתוך שמונה מדדים — GDP.pdf, Chartography, SWEFish, DeepSWE ו-Toolathon — ובשני המקומות הראשונים בשבעה מתוך שמונה. שני המספרים הקונקרטיים שמופיעים בהודעה הם Chartography ב-48.3, לעומת 27.3 עבור Claude Opus 5 ו-29.5 עבור Claude Fable 5 באותה טבלה, ו-DeepSWE ב-74.3. השורות שפרסמה Alibaba בעצמה עבור Qwen3.8-Max כוללות את Terminal-Bench 2.1 ב-86.6, OSWorld-Verified ב-86.1, GPQA Diamond ב-92.6 ו-SWE-bench Pro ב-67.7.
שימו לב למה שמשותף לשתי הרשימות האלה: כלום. אף מבחן ביצועים לא מופיע בשתי טבלאות הספקים. אין שורה שבה אפשר להעמיד זה לצד זה נתון של Sakana ונתון של Alibaba ולקרוא מי המנצח, מה שאומר שהתשובה הכנה לשאלה "מי טוב יותר בסוכני קוד" היא שאין ראיות שפורסמו שעונות על כך. מה שקיים הוא מערכת אחת עם שמונה שורות שנבחרו בידי הספק וללא אימות חיצוני, ומערכת אחת עם שורות ספקים בתוספת רשומה בלתי תלויה שמודדת עלות ומהירות ולא יכולת ראש בראש. זהו פער בראיות, לא פער במודלים, והוא צריך לשנות את איך שאתם קונים: אי אפשר לבחור בין אלה על סמך מבחני ביצועים, אז בחרו לפי המאפיינים שאתם באמת יכולים לאמת.

משקלים פתוחים לעומת מאגר שלא נחשף
כאן מתהפך טיעון הנעילה הרגיל, וזה הדבר המעניין ביותר בזיווג.
הפיץ' של Sakana עבור Fugu Ultra v2 הוא ריבונות. מאגר ניתן להחלפה של מודלים פתוחים ומתמחים משמעו ששום החלטת תמחור, לוח זמנים להפסקת תמיכה או שינוי מדיניות של ספק יחיד לא יכולים להפיל את המוצר שלך, והשחרור מבהיר זאת במפורש בכך שהוא מציין שהרכב המאגר השתנה ב-v2. החברה גם מציינת בפשטות שהציונים של Fugu Ultra v2 הושגו ללא Claude Fable 5, Claude Fable 5.1 או GPT-6 Astra במאגר הסוכנים — תוך טענה לניצחונות על שלושת המודלים החזקים ביותר הזמינים ובמקביל אישור שהיא לא קוראת לאף אחד מהם. יהיה אשר יהיה תוכן המאגר, הוא אינו צמרת השוק לפי החשבונאות של Sakana עצמה.
אך לגידור הזה יש עלות שאינה מופיעה במחירון. אינך יכול לראות את המאגר, אינך יכול להכניס חבר למסלול Ultra או להוציא אותו ממנו, אינך יכול לארח בעצמך שום חלק ממנו, ואינך יכול להריץ אותו כלל ב-EU/EEA — תזמור מבוסס סינגפור מעל המשקלים של מעבדות אחרות הוא פרופיל סיכון שונה מבעלות על המשקלים. Qwen3.8-Max עושה בדיוק את ההפך. הוא המודל של ספק אחד ולכן חשוף להחלטות של ספק אחד, אך Alibaba פרסמה משקלים פתוחים עבור הצ'קפוינט Qwen3.8-2.4T-A95B מסדרת Max תחת רישיון מותאם, מה שאומר שפתח המילוט הוא אמיתי ולא רטורי: אם התמחור או התנאים ישתנו, ניתן להריץ את המודל מהתשתית שלך. עבור צוות שהחשש האמיתי שלו הוא שספק ימשוך את השטיח מתחת לרגליו, צ'קפוינט שניתן להוריד הוא ערובה חזקה יותר מהבטחה על מאגר שאינך רשאי לבדוק.
ישנה נקודה מסדר שני לכל מי שמריץ סוכנים על גבי שניהם. Qwen3.8-Max נמצא בקטלוג שלנו במחיר של $2.00 לקלט ו-$6.00 לפלט, שהוא מחיר המחירון של עליבאבא עם 0% תוספת מחיר שמועברת הלאה — שינוי במחיר הספק נוחת על אותו מפתח באותו יום, ומעבר אוטומטי בעת כשל מכסה נתיב ספק שמוגבל בקצב או ירוד. Fugu Ultra v2 אינו ב-OrcaRouter. הוא מגיע אליכם דרך ה-API התואם ל-OpenAI של סקאנה עצמה וכמה פלטפורמות צד שלישי, ומעבר מ-Fugu קודם הוא שינוי פרמטר בשורה אחת. ראוטר אינו תחליף למתאם, ומתאם אינו תחליף ליכולת לעבור לספק חלופי בעת כשל; אם אתם רוצים את שתי התכונות, אתם מריצים מערכות של שני ספקים וצריכים לתקצב שני חשבונות.
איזה אחד כדאי לך לבחור
בחר ב-Qwen3.8-Max אם אתה צריך מודל שאתה יכול לחזות, לאמת ולברוח ממנו. הוא שליש מקצב הפלט של Fugu Ultra v2 במחיר מחירון, אין לו צוק הקשר ארוך, הוא מקבל תמונות, וידאו ו-PDFים בעוד שהמודאליות של מאגר Fugu היא מה שהסוכנים הבסיסיים תומכים בו במקרה, הוא מפרסם נקודת ביקורת שאתה יכול לחזור אליה, הוא נמכר בכל מקום, ויש לו רשומה עצמאית חיה שמודדת את הדברים שבאמת מניעים את החשבון שלך — 37.8 טוקנים לשנייה ונתון עלות למשימה שאתה יכול למדל לפני שאתה מתחייב. החולשות שלו ספציפיות באותה מידה וראויות לציון: הוא איטי, מדורג #154 מתוך 200 במהירות, הוא מילולי באופן עצום עם 180 מיליון טוקנים באינדקס, ו-Artificial Analysis מדדה בנפרד את שיעור ההזיה שלו שעולה מ-23% ל-40% לעומת הדור הקודם, וזה חשש רציני בדיוק לעבודה האוטונומית רבת-השלבים שהוא משווק עבורה. תקצב עבור מאמת, והשתמש בהנחת המטמון העמוק באגרסיביות.
בחר ב-Fugu Ultra v2 אם העבודה שלך היא ארוכת טווח וניתנת לבדיקה, התקציב שלך הוא חקרני ולא ייצורי, ואתה מחוץ לאיחוד האירופי/האזור הכלכלי האירופי. הטיעון המבני בעד מתאם הוא אמיתי, והדוגמאות של הספק עצמו מצביעות על כך בעקביות — ריצת מחקר אוטומטית של 123 ניסויים במשך ארבע עשרה שעות על H100 בודד, פותר קובייה הונגרית בפייתון טהור שהשלים את כל 300 הקוביות המעורבבות, בעוד שני בסיסי ייחוס חזיתיים אנונימיים קרסו לחלוטין. אלה דוגמאות שנבחרו על ידי הספק, עם בסיסי ייחוס אנונימיים, והן מוכיחות פחות ממה שנראה, אבל הדפוס עקבי: במשימות שבהן הנכונות ניתנת לבדיקה והחלק הקשה הוא התמדה, יצירת מאמת עדיפה על בקשה ממודל אחד להתאמץ יותר. מה שאתה קונה הוא ההתמדה הזו, בתעריף גבוה פי חמישה מזה של Qwen3.8-Max, במערכת שאיכותה אינה ניתנת לביקורת ושאין לך אפשרות לקבע את המאגר שלה. הרץ פיילוט בהיקף מוגבל, מדוד טוקני פלט לכל משימה שהושלמה ולא לכל טוקן, וקבע תקרה לפני הריצה הראשונה.

הסיבה שמחיר התווית הוא המספר הלא נכון היא ששני המוצרים האלה העבירו את עלות התשובה הרחק מעלות הטוקן. Fugu Ultra v2 עושה זאת על ידי התפרסות אל מודלים שהוא לא ינקוב בשמם. Qwen3.8-Max עושה זאת על ידי חשיבה במשך 180 מיליון טוקנים. אם אתם כבר יודעים את נפח הטוקנים שלכם לכל משימה, החשבון טריוויאלי וכדאי שתעשו אותו. רוב הצוותים לא יודעים את המספר הזה, ועבורם ההחלטה מצטמצמת למשהו פשוט יותר: Qwen3.8-Max היא הבחירה שאפשר לבקר, לתמחר ולנטוש, ו-Fugu Ultra v2 היא הבחירה שמהמרת שתאום עדיף על יכולת. שתיהן מוצדקות. רק לאחת מהן יש קבלות.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
