
Fugu Ultra v2 مقابل Gemini 3.1 Pro: الخصم الذي قد يكون بالفعل داخل الآلة
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
هناك نسخة من مقارنة Fugu Ultra v2 مع Gemini 3.1 Pro يفوز فيها Gemini أيًا كانت نتيجة الاختبارات المعيارية — لأنه قد يكون هو من يؤدي بعض العمل. نظام التنسيق من Sakana AI، الذي صدر في 11 سبتمبر 2026، لا يفصح عن النماذج التي ينسّق بينها؛ وقد ضمّت المجموعة المعلنة لـ Fugu Ultra في يونيو Gemini 3.1 Pro بين نماذج أخرى، ولا تخبرنا النسخة 2.0 إلا بما أزالته، إذ تسمّي Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra كنماذج مستبعدة. Gemini 3.1 Pro من Google هو نموذج واحد متعدد الوسائط طليعي بسياق يبلغ مليون رمز (token)، يتعامل مع النصوص والصور وملفات PDF والصوت والفيديو، ومتاح عمومًا منذ مايو 2026 بسعر 2.00 دولار لكل مليون رمز إدخال و12.00 دولارًا لكل مليون رمز إخراج. أحدهما نموذج يمكنك فحصه. والآخر نظام قد تمر انتصاراتاته في الاختبارات المعيارية عبر الأول، ولن يخبرك أي من المورّدين ما إذا كانت تفعل ذلك.
ما هو كل نظام في حقيقته
Gemini 3.1 Pro مقروء بطريقة أصبحت نادرة بين الإصدارات الرائدة. إنه محوّل مزيج خبراء متناثر من Google DeepMind، تم شحنه لأول مرة في المعاينة في 19 فبراير 2026، مع مصدر واحد يؤرخ التوفر العام إلى مايو 2026 — قائمتنا الخاصة تحمله تحت معرّف نموذج المعاينة. يحمل نافذة إدخال بحجم 1M توكن وسقف إخراج بحجم 65K توكن، ويقبل النصوص والصور وملفات PDF والصوت والفيديو والشفرة، ويكشف عن تحكم في الاستدلال من ثلاث درجات — منخفض، متوسط أو مرتفع — مع كون المرتفع هو الافتراضي في API. تُبلغ Google عن 77.1% على ARC-AGI-2، أكثر من ضعف الجيل السابق البالغة 31.1%؛ 94.3% على GPQA Diamond؛ 80.6% على SWE-bench Verified؛ 68.5% على Terminal-Bench 2.0؛ 85.9% على BrowseComp؛ و44.4% على Humanity's Last Exam بدون أدوات، وترتفع إلى 51.4% مع البحث وتنفيذ الشفرة. هذه أرقام الشركة المصنعة. تاريخ قطع المعرفة الخاص به هو يناير 2025، وهو أمر يستحق الإشارة إذا كان عملك يعتمد على الأحداث الأخيرة.
Fugu Ultra v2 هو منسّق. إنه نموذج مدرّب، يُقال إنه بحوالي 7B معامل، يقرأ طلبًا، ويجمّع فريقًا من الوكلاء بأدوار Thinker وWorker وVerifier مستمدة من بحث TRINITY من Sakana، ويولّف إجابة خلف نقطة نهاية متوافقة مع OpenAI. ليس لديه قائمة وسائط منشورة خاصة به — أي شيء يراه، يراه لأن نموذجًا في مجموعته يمكنه رؤيته. سياقه 1M رمز مع جرف تسعيري حاد عند 272K، حيث تتضاعف الأسعار إلى 10 دولارات للإدخال و45 دولارًا للإخراج. سقف إخراجه غير منشور. مجموعته غير معلنة، وقرارات التوجيه الخاصة به "غير مكشوفة بحكم التصميم"، وبالنسبة لطبقة Ultra تكون المجموعة ثابتة، لذا لا يمكنك استبعاد مزوّد.
هذا التفاوت هو المواجهة بأكملها. إن Gemini 3.1 Pro مكوّن يمكنك شراؤه مباشرةً والاستدلال بشأنه. أما Fugu Ultra v2 فهو تجميعة لا يمكنك رؤية أجزائها، وقد تكون أقوى ادعاءاتها في اختبارات المعايير، جزئيًا، نتائج Gemini نفسها مدمجة مع نتائج شخص آخر.

المقارنة التي يتداخل فيها الاثنان
لا يكاد شيء من الأدلة المنشورة يضع النظامين في الصف نفسه. الأرقام الواردة أدناه لـ Gemini 3.1 Pro هي أرقام Google الخاصة؛ وأرقام Fugu Ultra v2 هي أرقام Sakana الخاصة؛ وحيثما نشر مجمِّع طرف ثالث صفًا مشتركًا، فإنه مُعلَّم ويأتي مع تحفّظ مفاده أنه إشاري لا حاسم.
• الاستدلال متعدد الوسائط (CharXiv، صف مشترك) — Fugu Ultra v2 بنسبة 86.6% مقابل Gemini 3.1 Pro بنسبة 80.2%، وفقًا لـ BenchLM، الذي يصنّف الفئة على أنها اتجاهية ويمتنع عن إعلان فائز
• TerminalBench 2.1 — لا يوجد رقم لـ Fugu Ultra v2 v2.0 مقابل Gemini 3.1 Pro؛ لا يوجد رقم منشور قابل للمقارنة؛ أفاد Fugu Ultra في يونيو بنسبة 82.1% مقابل 70.3% لـ Gemini 3.1 Pro في تجميع طرف ثالث
• SWE-Bench Pro — لا توجد نتيجة منشورة قابلة للمقارنة تخص Fugu Ultra v2 v2.0 مقابل Gemini 3.1 Pro؛ فقد أبلغ Fugu Ultra في يونيو عن 73.7% مقابل 54.2% لـ Gemini 3.1 Pro
• ARC-AGI-2 — لا يوجد رقم لـ Fugu Ultra v2 مقابل 77.1% لـ Gemini 3.1 Pro، وفق ما أعلنته الجهة المطوّرة
• Humanity's Last Exam — لا يوجد رقم لـ Fugu Ultra v2 v2.0 مقابل Gemini 3.1 Pro: 44.4% بدون أدوات، و51.4% معها، حسب ما أفاد به المورّد
• تغطية الوسائط — يرث Fugu Ultra v2 كل ما يدعمه مجمّعه، وهي غير معلَنة، مقابل Gemini 3.1 Pro: النص والصورة وPDF والصوت والفيديو والكود، موثّقة.
• سعر الإدخال / الإخراج — Fugu Ultra v2 $5.00 / $30.00 لكل مليون، ويتضاعف فوق 272K مقابل Gemini 3.1 Pro $2.00 / $12.00 لكل مليون حتى 200K، و$4.00 / $18.00 بعد ذلك، الإدخال المخزّن مؤقتًا $0.20 / $0.40
• السياق والإخراج — Fugu Ultra v2 سياق 1M، سقف الإخراج غير معلن مقابل Gemini 3.1 Pro إدخال 1M، إخراج 65K
• الأوزان والوصول — Fugu Ultra v2 مغلق، باستثناء الاتحاد الأوروبي/المنطقة الاقتصادية الأوروبية مقابل Gemini 3.1 Pro مملوك لكنه متاح على نطاق واسع عبر خدمات Google
صف الوسائط المتعددة هو الصف الذي يجب التعامل معه بعناية، لأنه الأكثر اقتباسًا والأقل متانة. يضع تجميع CharXiv من BenchLM نموذج Fugu Ultra v2 في المقدمة بفارق 6.4 نقطة معيارية — وتذكر الصفحة نفسها بوضوح أن الصفوف الاتجاهية لا تحصل أبدًا على فائز، وأنه لم توجد نتائج مقيسة لـ Gemini في الفئات الوكيلية أو البرمجية أو المعرفية أو متعددة اللغات، وأنه لم توجد أي نتائج مقيسة لـ Fugu في الرياضيات أو تعدد اللغات. الفئة التي تم قياس جانب واحد فقط منها في معظم الصفوف لا يمكن أن تنتج حكمًا. إذا لم تأخذ شيئًا آخر من هذه المقارنة، فخُذ هذا: في العمل متعدد الوسائط تحديدًا، لا تدعم الأدلة المنشورة أي استنتاج في أي من الاتجاهين، والصف الوحيد الموجود ليس صراحةً نتيجة محسومة.
الإمكانية التي تغيّر الإطار
لن تقول ساكانا ما الذي تحتويه المجموعة. هذا خيار تصميمي موثّق، وليس سهواً — إذ تقول الأسئلة الشائعة إن معلومات التوجيه غير مكشوفة بحكم التصميم، ولا توجد أي آلية لفحصها. وما نعرفه من جيل يونيو هو أن أعضاء المجموعة المُبلَّغ عنهم شملوا Gemini 3.1 Pro إلى جانب نماذج رائدة أخرى. وقد غيّر الإصدار 2.0 المجموعة، ولم تصف ساكانا هذا التغيير إلا بالطرح: Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra خرجوا. ولا شيء في بيان الإصدار يقول إن Gemini ما زال بالداخل.
إذا كان Gemini 3.1 Pro ضمن المجموعة، فإن ثلاث نتائج تترتب على ذلك، وجميعها عملية لا فلسفية. أولًا، جزء من الأداء متعدد الوسائط لدى Fugu Ultra v2 هو أداء Gemini، مدمجًا مع أداء نماذج أخرى — ما يعني أنك تدفع علاوة تنسيق فوق سعر لكل رمز كان يمكن أن تدفعه مباشرة. ثانيًا، سعر Fugu Ultra v2 البالغ 30 دولارًا لكل مليون رمز إخراج مقابل 12 دولارًا لـ Gemini 3.1 Pro هو علاوة على التجميع، لا على القدرة الخام؛ إذا كانت مهمتك سؤالًا متعدد الوسائط واحدًا، فإن Gemini يجيب عنه بتكلفة أقل ويمكنك أن ترى بالضبط أي نموذج أجاب. ثالثًا، والأكثر فائدة، أن المعيار الصادق لأي منسّق ليس «هل يتفوق على مكوناته؟» بل «هل يتفوق على أفضل مكوّناته عندما تستخدمه وحده؟». بُنيت بنية Sakana على الادعاء بأنه يفعل ذلك، في مهام قابلة للتحقق. ويستحق هذا الادعاء أن يُختبر على عبء العمل الخاص بك قبل أن تقبله بناءً على معيار قراءة الرسوم البيانية.
هناك سيناريو يكون فيه الجواب «لا»، ومع ذلك يظل المُنسِّق يستحق مكانه. إذا كان Gemini ضمن المجموعة، وإذا صمدت نتيجة Fugu Ultra v2 في Chartography البالغة 48.3 مقابل 27.3 لـ Claude Opus 5، فإن ما بنته ساكانا هو طبقة تنسيق تستخرج من النموذج نفسه، وبشكل موثوق، أكثر مما تحصل عليه عند استدعائه مرة واحدة. هذا منتج حقيقي، والسؤال المطروح هو فقط ما إذا كان الهامش يغطي السعر. لم ينشر أحد هذه التجربة.

حيث تكون الحدود الصادقة
مزايا Gemini 3.1 Pro ملموسة. فهو يكلّف نحو خُمسَي سعر Fugu Ultra v2 عند الإدخال والإخراج، وخلافًا لـ Fugu لا تتضاعف أسعاره بعد تجاوز عتبة سياق معيّنة — فالزيادة عند 200K ألطف من جرف 272K. وهو يوثّق وسائطه بدلًا من أن يرثها، ما يعني أن العمل بالصوت والفيديو ميزة مدعومة لا مجرد أمل. وله سقف إخراج منشور. وهو متاح عبر واجهات Google الخاصة، ومثل النماذج الأخرى التي يُقاس عليها Fugu Ultra v2، فهو قابل للاستدعاء على OrcaRouter — بصيغة google/gemini-3.1-pro-preview، بسعر القائمة لدى Google مع هامش ربح 0%، لذا يستقر تغيير سعر Google على المفتاح نفسه في اليوم نفسه الذي يُعلن فيه.
مزايا Fugu Ultra v2 أضيق نطاقًا لكنها حقيقية. فهو يهاجم مشكلة صعبة أكثر من مرة، مع دور Verifier يتحقق من العمل، ولهذا تقع أقوى ادعاءاته على معايير قياس يمكن التحقق من صحتها — Chartography وDeepSWE وToolathon — لا على استرجاع المعرفة. وتسير دراسات الحالة المنشورة من Sakana في الاتجاه نفسه: قزحية CAD ميكانيكية تفتح وتغلق بشكل صحيح حيث تركت النماذج الأخرى فجوات ووصلات ضعيفة؛ وحلّال مكعب روبيك بلغة Python خالصة يُنهي جميع المكعبات الثلاثمائة المخلوطة، بينما انهار خطا أساس حدوديان مجهولا الهوية بالكامل. هذان الخطان الأساسيان مجهولا الهوية ومختاران من المورّد، لذا تعامل معهما كتوضيح لا كبرهان. لكن النمط متسق عبر الإصدار، وهو يصف قدرة حقيقية لا يمتلكها استدعاء نموذج واحد: المثابرة على مشكلة حتى تجتاز الإجابة فحصًا.
ضع القيود في الحسبان أيضًا. فـ Fugu Ultra v2 لا يُباع في الاتحاد الأوروبي ولا في المنطقة الاقتصادية الأوروبية، وتقول ساكانا صراحةً إنها تعمل على الامتثال للائحة GDPR. أما Gemini 3.1 Pro فلا يخضع لأي قيد من هذا القبيل، وله سجل أطول بكثير من التقييمات المستقلة.

الحكم
في معظم الأعمال متعددة الوسائط، يُعد Gemini 3.1 Pro هو الخيار الصحيح، وليس الأمر متقاربًا. فهو أرخص لكل توكن، وأرخص لكل مستند، وموثّق للتعامل مع الصوت والفيديو، وسقفه عتبة سياق لا تضاعف فاتورتك أثناء التشغيل، و—وهو الجزء الأكثر أهمية هنا—يمكنك أن ترى ما الذي أجابك. إذا كنت تحتاج إلى نموذج واحد ليقرأ ملف PDF، ويشاهد مقطعًا، ويجيب عن سؤال، فلا يوجد أي مبرر لتوجيه ذلك عبر مجموعة نماذج غير معلنة بسعر يبلغ 2.5 ضعف سعر الإخراج.
Fugu Ultra v2 هو الخيار الصحيح لنوع محدد وأضيق بكثير من العمل: مهام طويلة المدى ذات إجابة قابلة للتحقق، حيث تجربة المشكلة بثلاث طرق والتحقق من النتيجة أفضل من تجربتها مرة واحدة، وحيث تستحق الزيادة الحدية في الجودة التكلفة المضاعفة. وهو خارج الاعتبار تمامًا إذا كان لديك مستخدمون في الاتحاد الأوروبي أو المنطقة الاقتصادية الأوروبية ضمن النطاق.
السؤال المقلق الذي تتركه هذه المواجهة مفتوحًا هو السؤال الذي لم يقِسْه أحد. إذا كان Gemini 3.1 Pro داخل المجموعة — والإجابة الصادقة الوحيدة اليوم هي أن Sakana لم تقل إنه ليس كذلك — فإن جزءًا مما تشتريه مع Fugu Ultra v2 هو Gemini 3.1 Pro مع طبقة تنسيق فوقه، بسعر يوحي بأن الطبقة تساوي نحو مرتين ونصف قيمة النموذج. قد يكون ذلك صحيحًا بالفعل. فقد بُنيت بنية Sakana لتحقيق ذلك. لكنها فرضية تقف خلفها لوحة نتائج من المورّد ولا يوجد اختبار مستقل لها، وإلى أن يجريها أحد، فإن النموذج الذي تراه هو النموذج الذي يمكنك الدفاع عنه.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
