بطاقة عنوان رئيسية لـ Fugu Ultra v2 بعنوان 'Fugu Ultra v2' مع عنوان فرعي 'البركة صارت أصغر والنتيجة ارتفعت'، شارات تحمل النصوص 'Chartography 48.3'، 'DeepSWE 74.3' و'$5 / $30 per 1M'، سطر تذييل 'Sakana AI - صدر في 11 سبتمبر 2026'، وشعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

Sakana Fugu Ultra v2، مشروحًا: تقلصت المجموعة وارتفعت النتيجة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Fugu Ultra v2 ترقية غريبة من نوعها: فقد أطلقته Sakana AI في 11 سبتمبر 2026 مع مجموعة نماذج لم تعد تضم Claude Fable 5 ولا Claude Fable 5.1 ولا GPT-6 Astra — ثلاثة من أقوى الأنظمة المطروحة حالياً — وما زالت تزعم أنها تتفوق على الثلاثة جميعاً. الرائد الجديد لمختبر طوكيو في فئة الجودة، الذي صدر في اليوم نفسه مع نظير أرخص يُدعى Fugu Max، هو الأفضل أو متعادل في الصدارة في خمسة من ثمانية معايير في تقييم Sakana نفسه، بما في ذلك 48.3 في Chartography مقابل 27.3 لـ Claude Opus 5 و29.5 لـ Claude Fable 5، و74.3 في DeepSWE. لم يُعَد إنتاج أي من هذه الأرقام بشكل مستقل، ولا توجد حتى الآن صفحة Artificial Analysis لأي نموذج Fugu. تلك الفجوة هي القصة: ما يُطلب منك شراؤه هو طبقة تنسيق تقوم حجّتها بالكامل على أنها لا تحتاج إلى أفضل النماذج لإنتاج أفضل الإجابات.

تأسست Sakana AI في عام 2023 على يد Llion Jones، أحد المؤلفين المشاركين في ورقة Transformer، وDavid Ha. أُطلقت سلسلة Fugu في يونيو 2026 كنظام متعدد الوكلاء يُقدَّم كنموذج واحد: تستدعي نقطة نهاية واحدة متوافقة مع OpenAI، وخلفها منسّق مدرَّب يفكك الطلب، ويولّد وكلاء، ويجمع النتيجة. البحث حقيقي ومنشور — TRINITY (arXiv 2512.04695) طوّر منسّقًا خفيف الوزن يوزّع أدوار Thinker وWorker وVerifier؛ وConductor (arXiv 2512.04388) تعلّم تنسيقًا باللغة الطبيعية بين الوكلاء؛ ويقع التقرير الفني لـ Fugu على arXiv 2606.21228. ما لم تنشره Sakana قط هو ما يريده الجميع فعلاً: هوية النماذج في المجموعة، وقرارات التوجيه لكل مهمة.

ما الذي تغيّر فعليًا عن إصدار يونيو من Fugu Ultra؟

الإصدار 2.0 هو تحديث نقطي بعد نحو أحد عشر أسبوعًا من الإصدار الأصلي، وليس بنية جديدة. تصف الجهة المورّدة نفسها Fugu Ultra v2 وFugu Max بأنهما «البنية الأساسية نفسها لتنسيق العمليات» مضبوطتان لمهمتين مختلفتين: يدفع Max حدود التكلفة مقابل الأداء إلى الأسفل، ويرفع Ultra القدرة القصوى إلى الأعلى. معرّف الطراز هو fugu-ultra-v2.0، وتقول Sakana إن الانتقال من إصدار Fugu أسبق هو تغيير معامل من سطر واحد دون ترحيل SDK — وهو أكثر ما يلائم المستهلك في هذا الإصدار.

التغييرات الجوهرية هي الطرفان. أولاً، انتقل حد التدريب إلى 20260828، لذا أُعيد ضبط المنسّق مقابل الجيل الحالي من النماذج الحدودية. ثانياً، والأكثر إثارة للاهتمام بكثير، تغيّر تكوين المجموعة بطريقة اختارت ساكانا الترويج لها: استُبعد Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra صراحةً. حجة ساكانا هي أن هذا يثبت أن الدرجات لا تعتمد على نموذج حدودي احتكاري واحد، وهو أمر مهم إذا كان قلقك يتعلق بالارتهان لمورّد واحد، أو إلغاء وصول API، أو اختفاء نموذج خلف ضوابط التصدير.

هناك تبعة من الدرجة الثانية لا يتوقف عندها Sakana. إذا كانت المجموعة تستبعد أقوى ثلاثة نماذج متاحة، فإن المقارنات المعيارية مع Fable 5 وFable 5.1 تُجرى مع أنظمة لا يستطيع المنسّق استدعاءها حتى لو أراد. المقارنة مشروعة — فهي ادّعاء عن البنية، لا عن الوصول — لكنها ليست اختبارًا متماثلًا لمن يملك النموذج الأفضل. إنها اختبار لما إذا كان التنسيق يتغلب على القدرة الخام. هذا سؤال مثير للاهتمام حقًا. لكنه ببساطة ليس السؤال الذي توحي به لوحة النتائج بنظرة سريعة.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

الأرقام، ومن أنتجها

كل رقم في هذا القسم مُبلَّغ عنه من المورّد. لم تُصدر Sakana أي أداة تقييم، ولا شبكة درجات لكل مهمة، ولا وصفة إعادة إنتاج، كما أن تصميم التنسيق يجعل التكرار المستقل أصعب لا أسهل: إذ تتطلب إعادة إنتاج درجة ما الوصول إلى كل نموذج في المجموعة بالإصدارات نفسها ومع الطوبولوجيا نفسها، وبحكم التصميم تختلف الطوبولوجيا من طلب إلى آخر.

• رسم المخططات (الاستدلال البصري على المخططات والمستندات المهيكلة) — Fugu Ultra v2 48.3، Claude Opus 5 27.3، Claude Fable 5 29.5 — وفق ما أعلنه المورّد

• DeepSWE (هندسة البرمجيات في العالم الحقيقي) — Fugu Ultra v2 بنتيجة 74.3 — وفق ما أعلنته الشركة المطوّرة، ويُقال إنه يتفوّق على نماذج تكلّف من ثلاثة إلى خمسة أضعاف سعره لكل رمز

• أفضل مركز أو مركز مشترك في المرتبة الأولى — خمسة من أصل ثمانية معايير: GDP.pdf، Chartography، SWEFish، DeepSWE وToolathon — بحسب إفادة المورّد

• احتلال أحد المركزين الأولين — في سبعة من أصل ثمانية اختبارات مرجعية — وفقًا لما أفاد به المورد.

• Fugu Ultra السابق (يونيو 2026، للمقارنة) — LiveCodeBench 93.2، GPQA-Diamond 95.5، TerminalBench 82.1، SWE-Bench Pro 73.7 — وفقًا لما أعلنه المورّد

يستحق صف Chartography ما يحظى به من إبراز، فهو الفئة الوحيدة التي ليست فيها الفجوة أمام طراز رائد حالي ومحدَّد بالاسم فجوة هامشية. وفجوة من 21 نقطة أمام Claude Opus 5 في أحد معايير الاستدلال البصري هي من نوع الأرقام التي تظهر عادةً على لوحة صدارة مستقلة في غضون أيام. وحتى وقت كتابة هذه السطور، لم تظهر أي منها. تعامل مع الصف كفرضية يرتبط بها رقم بالدولار، لا كنتيجة محسومة.

التسعير: دون تغيير منذ يونيو، ومكلف بشكل قاطع على المخرجات.

يكلّف Fugu Ultra v2 مبلغ 5 دولارات لكل مليون رمز إدخال، و30 دولارًا لكل مليون رمز إخراج، و0.50 دولار لكل مليون رمز إدخال مخزّن مؤقتًا. وعند تجاوز 272,000 رمز من السياق، تصبح هذه التكاليف 10 و45 و1.00 دولار على التوالي. أما Fugu Max فله شكل مختلف تمامًا: 2 دولار للإدخال، و6 دولارات للإخراج، و0.25 دولار للمخزّن مؤقتًا، بسعر ثابت بصرف النظر عن طول السياق، بالإضافة إلى 0.007 دولار لكل بحث ويب أو استدعاء جلب.

هناك أمران في جدول الأسعار ذلك يستحقان القراءة المتأنية. الأول هو أن المخرجات تساوي ستة أضعاف المدخلات — نسبة عدوانية تسعّر إسهاب النموذج، والتنسيق عمل يتسم بالإسهاب. المنسّق الذي يولّد وكلاء ويجمع إجاباتهم يصدر الكثير من التوكنات، وتدفع مقابلها جميعًا بسعر 30 دولارًا لكل مليون. ادعاء الكفاءة الخاص بـ Sakana يتعلق بالمجموعة الأساسية، وليس بمقدار النص الذي ينتجه النظام نيابة عنك، وهذان رقمان مختلفان. ضع ميزانيتك بناءً على أعداد التوكنات المرصودة، وليس على السعر المعلن.

الثاني هو جرف 272K. مضاعفة السعر لكل رمز فوق عتبة معينة طريقة مشروعة لتسعير العمل ذي السياق الطويل، لكنها تعني أن التكلفة الفعلية لتشغيل وكيل ذي سياق طويل ليست الرقم الموجود في صفحة الأسعار. إذا كان عبء العمل لديك قريبًا من الحد، فإن الحساب يتغير جوهريًا على جانبي هذا الحد.

طبقات الاشتراك في Fugu — فئة Standard بسعر 20 دولارًا، وPro بسعر 100 دولار، وMax بسعر 200 دولار شهريًا، مع مخصصات تبلغ 10x و20x — تشمل جميعها الوصول إلى Fugu وFugu Ultra وFugu Max. كما تحدد Sakana سعر نموذج Fugu الأساسي بناءً على أعلى طبقة موجودة في المجموعة لطلب معيّن، وتوضح بوضوح أن إضافة مزيد من الوكلاء لا تضاعف الفاتورة. وهذا فرق حقيقي عن نموذج التكلفة المتشعّب الذي ستحصل عليه عند استدعاء عدة نماذج رائدة بنفسك.

ما الذي لن تخبرك به Sakana

اسأل أي النماذج أجابت عن سؤالك، والأسئلة الشائعة صريحة: "معلومات التوجيه هذه غير مُتاحة بحكم التصميم." مجموعتا Ultra وMax ثابتتان، لذا لا يمكنك استبعاد أي مورّد؛ فقط نموذج Fugu الأساسي يدعم الاستثناءات لكل نموذج في إعدادات وحدة التحكم. يمكن لعملاء Enterprise التفاوض على تكوينات مخصصة.

ذلك الغموض هو محور الانتقادات التي جذبتها سلسلة Fugu منذ يونيو، وهو انتقاد منصف لا عدائي. فعندما يحقق منسّق نتيجة جيدة من خلال دمج نماذج مختبرات أخرى، فإن النتيجة تنتمي إلى النظام — وهو شيء حقيقي ويمكن الدفاع عن بيعه — لكنها لا تنتقل إلى أي نموذج منفرد، ولا يمكن تدقيقها. وقد طرح المراجعون هذه النقطة بصراحة: Fugu لم يهزم الطراز الرائد، بل استأجر الطراز الرائد. وفي المهام القابلة للتحقق مع مدقّق رخيص، مثل معيار برمجي مع مجموعة اختبارات، يمكن للجنة أن تتفوق فعلاً على أفضل عضو فيها. أما في المهام التي لا يوجد فيها ذلك، فإن هيئة تأخذ عينات من عدة نماذج متقدمة وتُبلّغ بأفضل نتيجة إنما تُبلّغ جزئيًا عن الحظ. وخيارات Sakana نفسها للفئات — Chartography وDeepSWE وToolathon — تميل نحو الطرف القابل للتحقق، وهو الموضع الصحيح لتقديم الادعاء، وهو أيضًا السبب في أن الادعاء لا يمكن تعميمه مجانًا.

أشار مختبرون مستقلون أيضًا إلى تباين زمن الاستجابة باعتباره التكلفة العملية للتنسيق: في المهام الصعبة يتداول المنسّق الأمر، وفي المهام السهلة يكون ذلك التداول عبئًا إضافيًا محضًا. ويُقال إن مهمة شيدر لأحد الباحثين استغرقت نحو ثلاثين دقيقة، مع تصنيف الجودة على أنها مقبولة فحسب.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

أين يمكنك الحصول عليه فعليًا

أصبح Fugu Ultra v2 متاحًا الآن عبر واجهة برمجة التطبيقات الخاصة بـ Sakana والمتوافقة مع OpenAI — وجّه عميلًا موجودًا إلى نقطة النهاية باستخدام مفتاح API وغيّر سطرًا واحدًا — وعبر عدة منصات خارجية. لا يوفّر OrcaRouter نماذج Fugu؛ وإذا أردت استدعاء Fugu Ultra v2، فإن واجهة برمجة التطبيقات الخاصة بالمورّد هي الطريق المباشر.

ما يجدر ملاحظته هو البديل الذي تنافسه Sakana ضمنيًا. فالمجموعة التي تجعل Fugu Ultra v2 يعمل تُجمَّع من نماذج قابلة للاستدعاء بشكل فردي اليوم، والمنافسون الذين يُقاس عليهم هم من تشغِّلهم الفرق بالفعل. Claude Opus 5 وDeepSeek V4 Pro وGem​ini 3.1 Pro كلها متاحة على OrcaRouter بأسعار قوائم مزوّديها مع هامش ربح 0%، ما يعني أن أي تخفيض سعر من أي من هؤلاء المزوّدين يصبح ساريًا من جانبنا في اليوم نفسه الذي يُعلَن فيه. إذا كان السبب وراء تفكيرك في منسّق هو المرونة — عدم الرغبة في أن يعتمد مسار إنتاجي على وقت تشغيل مورّد واحد أو سياسة مورّد واحد — فإن طبقة توجيه مع تجاوز فشل تلقائي عبر المزوّدين تحل جزءًا من تلك المشكلة على مستوى النموذج، ويحل Fugu Ultra v2 جزءًا مختلفًا على مستوى الاستدلال. واجهة برمجة تطبيقات واحدة لأكثر من 200 نموذج مع تجاوز الفشل ليست بديلاً عن منسّق مدرَّب، والمنسّق المدرَّب ليس بديلاً عن عدم الاعتماد على مورّد واحد. سترغب بعض الفرق في كليهما.

فخ الامتثال

Fugu غير متاح في الاتحاد الأوروبي أو المنطقة الاقتصادية الأوروبية. صياغة المورّد صريحة: غير متاح بعد في EU/EEA بينما يعمل على الامتثال للائحة العامة لحماية البيانات (GDPR) واللوائح الخاصة بالاتحاد الأوروبي، وفي أماكن أخرى قد يكون الوصول محدودًا بسبب ظروف الشبكة أو القواعد المحلية. إذا كان لدى مؤسستك كيانات في نطاق الاتحاد الأوروبي، فإن هذا يستبعد خط Fugu من الاعتبار بغض النظر عن أداء المعايير القياسية، وهو أمر يستحق المعرفة قبل التقييم وليس بعده.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

ماذا تشاهد

ثلاثة أشياء ستنقل Fugu Ultra v2 من ادعاء مثير للاهتمام إلى خيار يمكن الاعتماد عليه. تقييم مستقل — إدخال في Artificial Analysis، أو ترتيب في LMArena، أو أي شيء يقف خلفه إطار اختبار — سيحل مسألة Chartography في غضون أسبوع. أرقام معاد إنتاجها من طرف ثالث على معايير الترميز القابلة للتحقق ستؤكد المكسب على مستوى النظام الذي تتنبأ به البنية. ومجموعة مُفصح عنها، أو حتى مجموعة جزئية، ستتيح للمشترين التفكير في بالضبط أي نقاط فشل فردية يقبلونها عندما يوجهون حركة الإنتاج عبر منسق لا يمكنهم فحصه.

حتى ذلك الحين، الموقف الصادق هو هذا. يُعد Fugu Ultra v2 المحاولة الأكثر جدية حتى الآن لبيع التنسيق كمنتج بدلًا من عرض بحثي، من مختبر تقف خلفه أعمال منشورة، وبسعر يجعل علاوة التنسيق صريحة لا مخفية. إذا كان عبء العمل لديك طويل الأفق وقابلًا للتحقق ومحصورًا في منطقة تستطيع Sakana خدمتك فيها، فإنه يستحق تجربة أولية محددة النطاق مع تفعيل محاسبة الرموز. وإن لم يكن كذلك، فإن النماذج التي يُقاس عليها Fugu Ultra v2 لا تبعد سوى استدعاء API واحد، بسعر القائمة، مع الإيصالات التي تُثبت ما يمكنها فعله.

مقارنات في هذه المقالة3

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا