بطاقة عنوان بارزة لـ Fugu Ultra v2 مقابل Gemini 3.1 Pro مع العنوان الفرعي "الخصم الذي قد يكون بالفعل داخل الآلة"، وشارات كبسولية تحمل "$30.00 مقابل $12.00 للإخراج"، و"CharXiv 86.6 مقابل 80.2 اتجاهي" و"مجموعة غير معلنة"، وسطر تذييل "Sakana AI مقابل Google DeepMind - سبتمبر 2026"، وشعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

Fugu Ultra v2 مقابل Gemini 3.1 Pro: الخصم الذي قد يكون بالفعل داخل الآلة

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

هناك نسخة من مقارنة Fugu Ultra v2 مع Gem​ini 3.1 Pro يفوز فيها Gem​ini أيًا كانت نتيجة الاختبارات المعيارية — لأنه قد يكون هو من يؤدي بعض العمل. نظام التنسيق من Sakana AI، الذي صدر في 11 سبتمبر 2026، لا يفصح عن النماذج التي ينسّق بينها؛ وقد ضمّت المجموعة المعلنة لـ Fugu Ultra في يونيو Gem​ini 3.1 Pro بين نماذج أخرى، ولا تخبرنا النسخة 2.0 إلا بما أزالته، إذ تسمّي Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra كنماذج مستبعدة. Gem​ini 3.1 Pro من Goo​gle هو نموذج واحد متعدد الوسائط طليعي بسياق يبلغ مليون رمز (token)، يتعامل مع النصوص والصور وملفات PDF والصوت والفيديو، ومتاح عمومًا منذ مايو 2026 بسعر 2.00 دولار لكل مليون رمز إدخال و12.00 دولارًا لكل مليون رمز إخراج. أحدهما نموذج يمكنك فحصه. والآخر نظام قد تمر انتصاراتاته في الاختبارات المعيارية عبر الأول، ولن يخبرك أي من المورّدين ما إذا كانت تفعل ذلك.

ما هو كل نظام في حقيقته

Gem​ini 3.1 Pro مقروء بطريقة أصبحت نادرة بين الإصدارات الرائدة. إنه محوّل مزيج خبراء متناثر من Goo​gle DeepMind، تم شحنه لأول مرة في المعاينة في 19 فبراير 2026، مع مصدر واحد يؤرخ التوفر العام إلى مايو 2026 — قائمتنا الخاصة تحمله تحت معرّف نموذج المعاينة. يحمل نافذة إدخال بحجم 1M توكن وسقف إخراج بحجم 65K توكن، ويقبل النصوص والصور وملفات PDF والصوت والفيديو والشفرة، ويكشف عن تحكم في الاستدلال من ثلاث درجات — منخفض، متوسط أو مرتفع — مع كون المرتفع هو الافتراضي في API. تُبلغ Goo​gle عن 77.1% على ARC-AGI-2، أكثر من ضعف الجيل السابق البالغة 31.1%؛ 94.3% على GPQA Diamond؛ 80.6% على SWE-bench Verified؛ 68.5% على Terminal-Bench 2.0؛ 85.9% على BrowseComp؛ و44.4% على Humanity's Last Exam بدون أدوات، وترتفع إلى 51.4% مع البحث وتنفيذ الشفرة. هذه أرقام الشركة المصنعة. تاريخ قطع المعرفة الخاص به هو يناير 2025، وهو أمر يستحق الإشارة إذا كان عملك يعتمد على الأحداث الأخيرة.

Fugu Ultra v2 هو منسّق. إنه نموذج مدرّب، يُقال إنه بحوالي 7B معامل، يقرأ طلبًا، ويجمّع فريقًا من الوكلاء بأدوار Thinker وWorker وVerifier مستمدة من بحث TRINITY من Sakana، ويولّف إجابة خلف نقطة نهاية متوافقة مع OpenAI. ليس لديه قائمة وسائط منشورة خاصة به — أي شيء يراه، يراه لأن نموذجًا في مجموعته يمكنه رؤيته. سياقه 1M رمز مع جرف تسعيري حاد عند 272K، حيث تتضاعف الأسعار إلى 10 دولارات للإدخال و45 دولارًا للإخراج. سقف إخراجه غير منشور. مجموعته غير معلنة، وقرارات التوجيه الخاصة به "غير مكشوفة بحكم التصميم"، وبالنسبة لطبقة Ultra تكون المجموعة ثابتة، لذا لا يمكنك استبعاد مزوّد.

هذا التفاوت هو المواجهة بأكملها. إن Gem​ini 3.1 Pro مكوّن يمكنك شراؤه مباشرةً والاستدلال بشأنه. أما Fugu Ultra v2 فهو تجميعة لا يمكنك رؤية أجزائها، وقد تكون أقوى ادعاءاتها في اختبارات المعايير، جزئيًا، نتائج Gem​ini نفسها مدمجة مع نتائج شخص آخر.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All' and the description that Fugu dynamically orchestrates the world's best models to tackle complex, multi-step tasks behind a single API, plus the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

المقارنة التي يتداخل فيها الاثنان

لا يكاد شيء من الأدلة المنشورة يضع النظامين في الصف نفسه. الأرقام الواردة أدناه لـ Gemini 3.1 Pro هي أرقام Google الخاصة؛ وأرقام Fugu Ultra v2 هي أرقام Sakana الخاصة؛ وحيثما نشر مجمِّع طرف ثالث صفًا مشتركًا، فإنه مُعلَّم ويأتي مع تحفّظ مفاده أنه إشاري لا حاسم.

• الاستدلال متعدد الوسائط (CharXiv، صف مشترك) — Fugu Ultra v2 بنسبة 86.6% مقابل Gem​ini 3.1 Pro بنسبة 80.2%، وفقًا لـ BenchLM، الذي يصنّف الفئة على أنها اتجاهية ويمتنع عن إعلان فائز

• TerminalBench 2.1 — لا يوجد رقم لـ Fugu Ultra v2 v2.0 مقابل Gem​ini 3.1 Pro؛ لا يوجد رقم منشور قابل للمقارنة؛ أفاد Fugu Ultra في يونيو بنسبة 82.1% مقابل 70.3% لـ Gem​ini 3.1 Pro في تجميع طرف ثالث

• SWE-Bench Pro — لا توجد نتيجة منشورة قابلة للمقارنة تخص Fugu Ultra v2 v2.0 مقابل Gem​ini 3.1 Pro؛ فقد أبلغ Fugu Ultra في يونيو عن 73.7% مقابل 54.2% لـ Gem​ini 3.1 Pro

• ARC-AGI-2 — لا يوجد رقم لـ Fugu Ultra v2 مقابل 77.1% لـ Gemini 3.1 Pro، وفق ما أعلنته الجهة المطوّرة

• Humanity's Last Exam — لا يوجد رقم لـ Fugu Ultra v2 v2.0 مقابل Gem​ini 3.1 Pro: 44.4% بدون أدوات، و51.4% معها، حسب ما أفاد به المورّد

• تغطية الوسائط — يرث Fugu Ultra v2 كل ما يدعمه مجمّعه، وهي غير معلَنة، مقابل Gemini 3.1 Pro: النص والصورة وPDF والصوت والفيديو والكود، موثّقة.

• سعر الإدخال / الإخراج — Fugu Ultra v2 $5.00 / $30.00 لكل مليون، ويتضاعف فوق 272K مقابل Gem​ini 3.1 Pro $2.00 / $12.00 لكل مليون حتى 200K، و$4.00 / $18.00 بعد ذلك، الإدخال المخزّن مؤقتًا $0.20 / $0.40

• السياق والإخراج — Fugu Ultra v2 سياق 1M، سقف الإخراج غير معلن مقابل Gem​ini 3.1 Pro إدخال 1M، إخراج 65K

• الأوزان والوصول — Fugu Ultra v2 مغلق، باستثناء الاتحاد الأوروبي/المنطقة الاقتصادية الأوروبية مقابل Gemini 3.1 Pro مملوك لكنه متاح على نطاق واسع عبر خدمات Google

صف الوسائط المتعددة هو الصف الذي يجب التعامل معه بعناية، لأنه الأكثر اقتباسًا والأقل متانة. يضع تجميع CharXiv من BenchLM نموذج Fugu Ultra v2 في المقدمة بفارق 6.4 نقطة معيارية — وتذكر الصفحة نفسها بوضوح أن الصفوف الاتجاهية لا تحصل أبدًا على فائز، وأنه لم توجد نتائج مقيسة لـ Gemini في الفئات الوكيلية أو البرمجية أو المعرفية أو متعددة اللغات، وأنه لم توجد أي نتائج مقيسة لـ Fugu في الرياضيات أو تعدد اللغات. الفئة التي تم قياس جانب واحد فقط منها في معظم الصفوف لا يمكن أن تنتج حكمًا. إذا لم تأخذ شيئًا آخر من هذه المقارنة، فخُذ هذا: في العمل متعدد الوسائط تحديدًا، لا تدعم الأدلة المنشورة أي استنتاج في أي من الاتجاهين، والصف الوحيد الموجود ليس صراحةً نتيجة محسومة.

الإمكانية التي تغيّر الإطار

لن تقول ساكانا ما الذي تحتويه المجموعة. هذا خيار تصميمي موثّق، وليس سهواً — إذ تقول الأسئلة الشائعة إن معلومات التوجيه غير مكشوفة بحكم التصميم، ولا توجد أي آلية لفحصها. وما نعرفه من جيل يونيو هو أن أعضاء المجموعة المُبلَّغ عنهم شملوا Gem​ini 3.1 Pro إلى جانب نماذج رائدة أخرى. وقد غيّر الإصدار 2.0 المجموعة، ولم تصف ساكانا هذا التغيير إلا بالطرح: Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra خرجوا. ولا شيء في بيان الإصدار يقول إن Gem​ini ما زال بالداخل.

إذا كان Gemini 3.1 Pro ضمن المجموعة، فإن ثلاث نتائج تترتب على ذلك، وجميعها عملية لا فلسفية. أولًا، جزء من الأداء متعدد الوسائط لدى Fugu Ultra v2 هو أداء Gemini، مدمجًا مع أداء نماذج أخرى — ما يعني أنك تدفع علاوة تنسيق فوق سعر لكل رمز كان يمكن أن تدفعه مباشرة. ثانيًا، سعر Fugu Ultra v2 البالغ 30 دولارًا لكل مليون رمز إخراج مقابل 12 دولارًا لـ Gemini 3.1 Pro هو علاوة على التجميع، لا على القدرة الخام؛ إذا كانت مهمتك سؤالًا متعدد الوسائط واحدًا، فإن Gemini يجيب عنه بتكلفة أقل ويمكنك أن ترى بالضبط أي نموذج أجاب. ثالثًا، والأكثر فائدة، أن المعيار الصادق لأي منسّق ليس «هل يتفوق على مكوناته؟» بل «هل يتفوق على أفضل مكوّناته عندما تستخدمه وحده؟». بُنيت بنية Sakana على الادعاء بأنه يفعل ذلك، في مهام قابلة للتحقق. ويستحق هذا الادعاء أن يُختبر على عبء العمل الخاص بك قبل أن تقبله بناءً على معيار قراءة الرسوم البيانية.

هناك سيناريو يكون فيه الجواب «لا»، ومع ذلك يظل المُنسِّق يستحق مكانه. إذا كان Gemini ضمن المجموعة، وإذا صمدت نتيجة Fugu Ultra v2 في Chartography البالغة 48.3 مقابل 27.3 لـ Claude Opus 5، فإن ما بنته ساكانا هو طبقة تنسيق تستخرج من النموذج نفسه، وبشكل موثوق، أكثر مما تحصل عليه عند استدعائه مرة واحدة. هذا منتج حقيقي، والسؤال المطروح هو فقط ما إذا كان الهامش يغطي السعر. لم ينشر أحد هذه التجربة.

A two-column scoreboard for Fugu Ultra v2 vs Gemini 3.1 Pro titled 'Fugu Ultra v2 vs Gemini 3.1 Pro - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Modalities inherited, undisclosed, CharXiv 86.6 (directional), Weights closed, pool hidden, EU/EEA availability not served. Right column Gemini 3.1 Pro: Input price $2.00 / 1M, Output price $12.00 / 1M, Modalities text, image, PDF, audio, video, CharXiv 80.2 (directional), Weights proprietary, documented, EU/EEA availability available. Footer 'CharXiv row directional only per BenchLM; Fugu figures vendor-reported by Sakana.', with the OrcaRouter logo bottom-right.

حيث تكون الحدود الصادقة

مزايا Gemini 3.1 Pro ملموسة. فهو يكلّف نحو خُمسَي سعر Fugu Ultra v2 عند الإدخال والإخراج، وخلافًا لـ Fugu لا تتضاعف أسعاره بعد تجاوز عتبة سياق معيّنة — فالزيادة عند 200K ألطف من جرف 272K. وهو يوثّق وسائطه بدلًا من أن يرثها، ما يعني أن العمل بالصوت والفيديو ميزة مدعومة لا مجرد أمل. وله سقف إخراج منشور. وهو متاح عبر واجهات Google الخاصة، ومثل النماذج الأخرى التي يُقاس عليها Fugu Ultra v2، فهو قابل للاستدعاء على OrcaRouter — بصيغة google/gemini-3.1-pro-preview، بسعر القائمة لدى Google مع هامش ربح 0%، لذا يستقر تغيير سعر Google على المفتاح نفسه في اليوم نفسه الذي يُعلن فيه.

مزايا Fugu Ultra v2 أضيق نطاقًا لكنها حقيقية. فهو يهاجم مشكلة صعبة أكثر من مرة، مع دور Verifier يتحقق من العمل، ولهذا تقع أقوى ادعاءاته على معايير قياس يمكن التحقق من صحتها — Chartography وDeepSWE وToolathon — لا على استرجاع المعرفة. وتسير دراسات الحالة المنشورة من Sakana في الاتجاه نفسه: قزحية CAD ميكانيكية تفتح وتغلق بشكل صحيح حيث تركت النماذج الأخرى فجوات ووصلات ضعيفة؛ وحلّال مكعب روبيك بلغة Python خالصة يُنهي جميع المكعبات الثلاثمائة المخلوطة، بينما انهار خطا أساس حدوديان مجهولا الهوية بالكامل. هذان الخطان الأساسيان مجهولا الهوية ومختاران من المورّد، لذا تعامل معهما كتوضيح لا كبرهان. لكن النمط متسق عبر الإصدار، وهو يصف قدرة حقيقية لا يمتلكها استدعاء نموذج واحد: المثابرة على مشكلة حتى تجتاز الإجابة فحصًا.

ضع القيود في الحسبان أيضًا. فـ Fugu Ultra v2 لا يُباع في الاتحاد الأوروبي ولا في المنطقة الاقتصادية الأوروبية، وتقول ساكانا صراحةً إنها تعمل على الامتثال للائحة GDPR. أما Gem​ini 3.1 Pro فلا يخضع لأي قيد من هذا القبيل، وله سجل أطول بكثير من التقييمات المستقلة.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview, captured September 11, 2026, English UI), showing the Flagship and Featured badges, the capability tags Vision, Audio, Tools, JSON and Reasoning, the 1M token context and 65K max output fields, the input and output modality line reading 'audio + file + image + text + video' to 'text', the pricing tiles reading INPUT $2.00 and OUTPUT $12.00 per 1M tokens with p50 TTFT 3.82s, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

الحكم

في معظم الأعمال متعددة الوسائط، يُعد Gem​ini 3.1 Pro هو الخيار الصحيح، وليس الأمر متقاربًا. فهو أرخص لكل توكن، وأرخص لكل مستند، وموثّق للتعامل مع الصوت والفيديو، وسقفه عتبة سياق لا تضاعف فاتورتك أثناء التشغيل، و—وهو الجزء الأكثر أهمية هنا—يمكنك أن ترى ما الذي أجابك. إذا كنت تحتاج إلى نموذج واحد ليقرأ ملف PDF، ويشاهد مقطعًا، ويجيب عن سؤال، فلا يوجد أي مبرر لتوجيه ذلك عبر مجموعة نماذج غير معلنة بسعر يبلغ 2.5 ضعف سعر الإخراج.

Fugu Ultra v2 هو الخيار الصحيح لنوع محدد وأضيق بكثير من العمل: مهام طويلة المدى ذات إجابة قابلة للتحقق، حيث تجربة المشكلة بثلاث طرق والتحقق من النتيجة أفضل من تجربتها مرة واحدة، وحيث تستحق الزيادة الحدية في الجودة التكلفة المضاعفة. وهو خارج الاعتبار تمامًا إذا كان لديك مستخدمون في الاتحاد الأوروبي أو المنطقة الاقتصادية الأوروبية ضمن النطاق.

السؤال المقلق الذي تتركه هذه المواجهة مفتوحًا هو السؤال الذي لم يقِسْه أحد. إذا كان Gem​ini 3.1 Pro داخل المجموعة — والإجابة الصادقة الوحيدة اليوم هي أن Sakana لم تقل إنه ليس كذلك — فإن جزءًا مما تشتريه مع Fugu Ultra v2 هو Gem​ini 3.1 Pro مع طبقة تنسيق فوقه، بسعر يوحي بأن الطبقة تساوي نحو مرتين ونصف قيمة النموذج. قد يكون ذلك صحيحًا بالفعل. فقد بُنيت بنية Sakana لتحقيق ذلك. لكنها فرضية تقف خلفها لوحة نتائج من المورّد ولا يوجد اختبار مستقل لها، وإلى أن يجريها أحد، فإن النموذج الذي تراه هو النموذج الذي يمكنك الدفاع عنه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا