
Fugu Ultra v2 مقابل Claude Opus 5: نفس سعر الإدخال، رهانان مختلفان
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
يكلّف طرح سؤال على Fugu Ultra v2 وClaude Opus 5 المبلغ نفسه بالضبط، ويكلّف الحصول على إجابة منهما مبلغين مختلفين تمامًا. يبلغ سعر كل منهما 5.00 دولارات لكل مليون رمز إدخال. ثم يتقاضى Fugu Ultra v2 مبلغ 30.00 دولارًا لكل مليون رمز إخراج مقابل 25.00 دولارًا لـ Claude Opus 5 — والفجوة بين هذين الرقمين ليست فرق تقريب، لأن النظامين ينتجان كميات مختلفة جدًا من النص للوصول إلى إجابة. أطلقت Sakana AI نظام Fugu Ultra v2 في 11 سبتمبر 2026 كنظام تنسيق ينسّق مجموعة من نماذج مختبرات أخرى خلف نقطة نهاية واحدة متوافقة مع OpenAI؛ أما Claude Opus 5 من Anthropic، المتاح منذ أواخر يوليو 2026، فهو نموذج واحد. هذا الفرق يحسم معظم هذه المقارنة قبل الرجوع إلى أي اختبار قياسي، ولوحة النتائج الخاصة بـ Sakana نفسها تحتوي على صف محرج: تعلن الشركة عن 48.3 على Chartography مقابل 27.3 لـ Claude Opus 5، وهو أكبر فارق في الإصدار وأيضًا الرقم الأقل دعمًا بأدلة خارجية.
المصادفة التي تشكّل كل شيء
ابدأ بما يتفق عليه المنتجان، لأنه أكثر من السعر المعلن.
• سعر الإدخال — Fugu Ultra v2 $5.00 لكل مليون توكن مقابل Claude Opus 5 $5.00 لكل مليون توكن
• سعر الإخراج — Fugu Ultra v2 بسعر 30.00 دولار لكل مليون رمز مقابل Claude Opus 5 بسعر 25.00 دولار لكل مليون رمز
• الإدخال المخزّن مؤقتًا — Fugu Ultra v2 بسعر 0.50 دولار لكل مليون فوق السعر الأساسي مقابل Claude Opus 5، الذي يسعّر التخزين المؤقت كخصم يصل إلى 90% على الإدخال المخزّن مؤقتًا
• السياق — Fugu Ultra v2 بسعة 1M توكن، مع تضاعف الأسعار فوق 272K، مقابل Claude Opus 5 بسعة 1M توكن، بسعر ثابت
• سقف الإخراج — Fugu Ultra v2 لم يُنشر كرقم واحد مقابل 128K tokens لدى Claude Opus 5
• التوفر — Fugu Ultra v2 غير متاح للبيع في الاتحاد الأوروبي/المنطقة الاقتصادية الأوروبية مقابل Claude Opus 5 المتاح بشكل عام بموجب شروط API القياسية
• الأدلة — نتائج قياس الأداء المُعلَنة من مورّد Fugu Ultra v2، دون أي تقييم مستقل حتى الآن، مقابل نتائج قياس الأداء المُعلَنة من مورّد Claude Opus 5، إضافة إلى أشهر من التصنيفات في لوحات الصدارة من أطراف ثالثة
هذا الصف الأخير هو حيث تنقلب المواجهة فعليًا. بنفس سعر الإدخال، أنت تختار بين نظام يجب أن تأخذ درجاته على الثقة، ونموذج أعاد آخرون إنتاج درجاته. منحدر 272K يضاعف الأمر سوءًا: بعد تلك العتبة، يتضاعف سعر الإدخال لـ Fugu Ultra v2 ليصبح $10 والإخراج $45، بينما لا يتغير سعر Claude Opus 5. بالنسبة لتشغيلات الوكيل ذات السياق الطويل — عبء العمل المحدد الذي صُمم من أجله Fugu Ultra v2 — تختفي ميزة السعر المعلن الأرخص تحديدًا حيث يُفترض أن يتألق النظام.

ما هو كل واحد منها في الحقيقة
كلود أوبوس 5 هو الطراز الرائد الإنتاجي لدى Anthropic، وتصميمه واضح من الخارج. فهو يعمل بالتفكير التكيّفي افتراضيًا، فيقرّر المدة التي سيستغرقها في الاستدلال قبل أن يجيب، مع مقبض جهد صريح يمتد من منخفض إلى أقصى عندما تريد فرض تأمّل أعمق والدفع مقابل ذلك. وهو يحمل نافذة سياق بسعة 1M رمز، وحدًّا أعلى للإخراج قدره 128K، ورؤية، واستخدام أدوات، ووضع JSON. وتُبلّغ Anthropic عن 96.0% في SWE-bench Verified و79.2% في SWE-bench Pro، أي أكثر من ضعف نتيجة سلفه في Frontier-Bench v0.1، ونحو 30.2% في ARC-AGI 3 مقابل 7.8% لـ GPT-5.6 Sol — وكلها أرقام من الجهة المورّدة، وكلها مقيسة على نموذج واحد يمكنك تثبيته بحسب الإصدار. كما يوجّه الطلبات المُعلَّمة إلى نموذج أقدم بدلًا من إرجاع خطأ، وهو تفصيل تشغيلي يهمّك إذا كانت لديك مراجعة امتثال ضمن المسار.
Fugu Ultra v2 ليس ذلك، والفرق ليس شكليًا. إنه منسّق — نموذج صغير مدرّب، يُقال إنه بنحو 7 مليارات معلمة، يقرأ طلبك، ويجمّع فريقًا من الوكلاء، ويسند أدوار Thinker وWorker وVerifier المستمدة من عمل TRINITY لدى Sakana، ويصوغ إجابة نهائية. لا تُكشف النماذج الأساسية، ولا تُعرَض قرارات التوجيه بحكم التصميم، وبالنسبة إلى فئة Ultra فإن المجموعة ثابتة: لا يمكنك استبعاد أي مورّد. وصياغة Sakana نفسها للإصدار 2 هي أن تاريخ قطع التدريب انتقل إلى 28 أغسطس 2026 وأن تركيبة المجموعة تغيّرت — وتحديدًا لاستبعاد Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra.
ذلك الاستبعاد هو أكثر التفاصيل دلالةً في البيان. يدّعي Fugu Ultra v2 تحقيق انتصارات في اختبارات القياس على أقوى ثلاثة نماذج متاحة، في حين يؤكد أنه لا يستدعي أيًّا منها. ومهما كانت المجموعة تحتويه، فهي ليست قمة السوق بحسب حسابات Sakana نفسها. الفكرة المطروحة هي أن التنسيق يتفوق على القدرة. هذه أطروحة حقيقية، وفي المهام القابلة للتحقق مع مدقّق رخيص تكون أطروحة تسندها أدلة. غير أنها ليست الادعاء نفسه القائل إن «هذا النظام أذكى من Claude Opus 5»، وقد رُتّبت لوحة النتائج بحيث يسهل الخلط بين الادعاءين.
لوحة النتائج التي اختارها Sakana
كل رقم أدناه مأخوذ من تقييم Sakana نفسه لـ Fugu Ultra v2. أرقام Claude Opus 5 هي كما قاستها Sakana في المقارنة نفسها، إلا حيث يُذكر خلاف ذلك. لم يُعِد أي طرف مستقل إنتاج عمود Fugu، واعتبارًا من وقت كتابة هذا النص لا يوجد مُدخل لـ Artificial Analysis لأي طراز من طرازات Fugu.
• Chartography — Fugu Ultra v2 48.3 مقابل Claude Opus 5 27.3 — وفق ما أبلغ عنه المورّد، بفارق 21 نقطة
• DeepSWE — Fugu Ultra v2 74.3 مقابل عدم وجود رقم منشور لـ Claude Opus 5 في الجدول نفسه — وفق ما أعلنته الجهة المورّدة
• الترتيب في الاختبارات المعيارية — Fugu Ultra v2 الأفضل أو الأفضل مناصفةً في خمسة من أصل ثمانية، وضمن أفضل اثنين في سبعة من أصل ثمانية — وفقًا لما ذكرته الشركة المصنّعة
• SWE-bench Verified — لا يوجد رقم لـ Fugu Ultra v2، مقابل 96.0% لـ Claude Opus 5 — وفق ما أبلغت به Anthropic
• SWE-bench Pro — لا يوجد رقم مُعلن لـ Fugu Ultra v2، مقابل 79.2% لـ Claude Opus 5 — وفق ما أعلنته Anthropic
• ARC-AGI 3 — لا يوجد رقم خاص بـ Fugu Ultra v2 مقابل Claude Opus 5 ~30.2% — وفق ما أبلغت عنه Anthropic
اقرأ ذلك على أنه شكل لا ترتيب. نشرت Sakana لوحة من ثمانية اختبارات معيارية تفوز فيها بخمسة منها، وأقوى نتائج Claude Opus 5 الموثّقة علنًا — صفوف SWE-bench وARC-AGI 3 — ليست ببساطة موجودة عليها. هذا ليس اتهامًا بسوء نية؛ بل هذا ما تبدو عليه لوحة نتائج أي مورّد، بما في ذلك لوحة كل مورّد. لكن هذا يعني أنك لا تستطيع أن تستنتج من الإصدار أن Fugu Ultra v2 يتفوق على Claude Opus 5 في هندسة البرمجيات، لأن النظامين لم يُقاسا على الصفوف نفسها مرات كافية كي نقول ذلك. في الصف الوحيد الذي يظهر فيه كلاهما ويكون الرقمان علنيين — Chartography — يدّعي Fugu Ultra v2 فوزًا كبيرًا. وفي أوسع صفوف الاستدلال والبرمجة، نشر طرف واحد فقط.

التكلفة لكل مهمة، وليس التكلفة لكل توكن
فاتورة الرموز (tokens) الخاصة بمنسّق ليست سعر الرمز الواحد لديه. يُشغّل Fugu Ultra v2 وكلاء، كل منهم يساهم برموز التفكير والإخراج، بينما ينتج المنسّق نفسه نص التوليف. ويقدّم قسم الأسئلة الشائعة حول التسعير من Sakana التزامًا مفيدًا حقًا هنا — إذ تُحتسب عليك رسوم بسعر موحّد مدمج استنادًا إلى النموذج الأعلى فئةً المشارك، وإضافة وكلاء لا تضاعف الفاتورة — وهو ما يزيل أسوأ حالة من التضاعف بالتوسع التي تجعل إعدادات الوكلاء المتعددين الساذجة مكلفة. لكنه لا يزيل الحجم. فكمية رموز الإخراج المفوترة لا تزال دالةً على عدد الوكلاء الذين عملوا ومقدار ما كتبوه، وعند 30 دولارًا لكل مليون، يمثّل هذا الحجم المتغير الذي لا يمكنك التنبؤ به من صفحة التسعير.
شكل التكلفة لدى Claude Opus 5 هو العكس. نداء واحد، ونموذج واحد، وقرص جهد تتحكم فيه، وسعر إخراج قدره 25 دولارًا، مع إتاحة المعالجة الدفعية بخصم 50% للأعمال غير الفورية. يمكنك التنبؤ به. وبالنسبة لعبء عمل تشغّله عشرة آلاف مرة في اليوم، فإن قابلية التنبؤ تستحق أكثر بكثير من هامش في نتائج اختبار قياسي في مهمة قراءة الرسوم البيانية.
وهنا أيضًا تنفصل مسألة التوجيه بوضوح عن مسألة النموذج. Claude Opus 5 متاح على OrcaRouter بسعر Anthropic المعلن وبدون أي هامش ربح — إذ يُمرَّر سعر المزوّد كما هو، فأي تغيير في سعر المورّد يسري على المفتاح نفسه في اليوم نفسه، مع تحويل تلقائي للفشل عبر مسارات المزوّدين إذا تعرّض أحدها لتقييد المعدّل أو توقّف. أما Fugu Ultra v2 فليس ضمن كتالوجنا؛ بل يصل إليك عبر واجهة Sakana البرمجية المتوافقة مع OpenAI وعدة منصات خارجية، والانتقال من إصدار Fugu أقدم هو تغيير معامل في سطر واحد. إذا كنت تريد فعليًا ما يوفّره Claude Opus 5 من قابلية للتنبؤ مع تعرّض أقل لمزوّد واحد، فالجواب هو الموجّه وليس المنسّق. وإذا كنت تريد نظامًا يجرّب عدة مقاربات لمسألة صعبة دون أن تكتب أنت تفريع المهام، فإن Fugu Ultra v2 هو ما يفعل ذلك — وينبغي أن تجرّبه تجربةً أولية مع تفعيل محاسبة الرموز.
حيث يتفوق Fugu Ultra v2 حقًا
أعطِ النظام ما يستحقه. نتيجة Chartography، إن صمدت، هي من نوع الانتصارات التي يصعب على النماذج المفردة تزييفها: فالاستدلال البصري على المستندات المهيكلة يكافئ تجربة قراءة، والتحقق منها مقابل المستند، ثم المحاولة مجددًا — وهو بالضبط الغرض من دور Verifier. وينطبق المنطق نفسه على Toolathon وDeepSWE، حيث يمكن اختبار الإجابة بدل الجدال حولها. وتميل دراسات الحالة المنشورة من Sakana في الاتجاه نفسه: تشغيل AutoResearch بـ123 تجربة على مدى أربع عشرة ساعة على H100 واحدة، وحلّال مكعب روبيك مكتوب ببايثون خالصة أنهى جميع المكعبات الثلاثمئة المخلوطة حيث تعطّل خطّا أساس رائدان مجهولا الهوية تمامًا، وقزحية CAD ميكانيكية تفتح وتغلق فعليًا. هذه أمثلة منتقاة من المورّد مع خطوط أساس مجهولة الهوية، لذا فهي تُثبت أقل مما تبدو عليه. لكن النمط متسق، وهو يشير إلى فئة حقيقية: مهام يكون فيها الصواب قابلًا للتحقق، ويكون الجزء الصعب هو المثابرة.
هناك أيضًا حجة هيكلية لا علاقة لها باختبارات الأداء. Claude Opus 5 هو نموذج مورد واحد، ويخضع لقرارات التسعير وجدول الإيقاف التدريجي والسياسات الخاصة بمورد واحد. صُمّم Fugu Ultra v2 ليصمد أمام أي تغيّر منفرد في أيٍّ من هذه الأمور، وSakana صريحة في أن هذه هي النقطة — الارتباط بالمورد، وسحب واجهات API، وضوابط التصدير. في سوق سُحبت منها النماذج من مناطق بإشعار ضئيل، هذا ليس افتراضًا. إنه تحوّط، والتحوّط يكلّف مالًا: 5 دولارات إضافية لكل مليون رمز إخراج هو تقريبًا ما يُسعّر به هذا التحوّط.
الحكم
يفوز Claude Opus 5 في القرار الذي تتخذه معظم الفرق فعليًا. فوراءه أشهر من التقييم المستقل، ونافذة سياق بسعة مليون رمز (token) لا يتضاعف سعرها في منتصف مستندك، وسقف إخراج يبلغ 128 ألفًا، وسعر معلن يمكنك التنبؤ به، ومقياس جهد يتيح لك شراء الاستدلال فقط عندما تستحق المهمة ذلك، ونتائج من أطراف ثالثة على المقاييس المرجعية نفسها — SWE-bench Verified وSWE-bench Pro وARC-AGI 3 — التي تهتم بها أكثر الفرق العاملة بالوكلاء والبرمجة. أما Fugu Ultra v2 فيفوز في سؤال أضيق وأكثر إثارة للاهتمام: هل يمكن لمنسّق يمتلك مجموعة أصغر أن يتفوق على طراز رائد في المهام التي يمكن التحقق من إجابتها. تقول لوحة النتائج الخاصة بـ Sakana إن الجواب نعم في خمسة من ثمانية صفوف، ويقول استبعاد المجموعة إن الفوز تحقق دون أفضل ثلاثة نماذج في العالم.
إذا كنت تُنجز عملاً قابلاً للتحقق، وطويل المدى، وقابلاً للفحص، وكنت خارج الاتحاد الأوروبي/المنطقة الاقتصادية الأوروبية، فإن Fugu Ultra v2 يستحق تجربةً محدودة النطاق — قِس توكنات الإخراج لكل مهمة مكتملة، لا لكل توكن، وحدِّد سقفاً قبل أن تبدأ. وإذا كنت بحاجة اليوم إلى مسار إنتاجي تسنده أدلة وفاتورة يمكنك التنبؤ بها، فإن Claude Opus 5 يظل الخيار الأقوى إسناداً بالأدلة، وهو على بُعد مفتاح API واحد بسعر Anthropic المعلن مع تمرير سعر المزوِّد كما هو دون تغيير.

