
Fugu Ultra v2 مقابل Grok 4.6: خمسة أضعاف سعر المخرجات، ومعيار مشترك واحد
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
يوجد اختبار أداء واحد بالضبطFugu Ultra v2 وGrok 4.6 ينشران فيه رقمًا، وهو DeepSWE: تذكر Sakana AI نتيجة 74.3 لـ Fugu Ultra v2 في إعلانها الصادر في 11 سبتمبر 2026، بينما تضع مواد الإطلاق الخاصة بـ xAI لـ Grok 4.6 درجة DeepSWE v1.1 الخاصة به عند 65.9%. هذه فجوة قدرها 8.4 نقاط، وهي المقارنة النظيفة الوحيدة التي تقدمها الشركتان. وكل ما قد تصطفّه غير ذلك — Chartography وSWEFish من Sakana مقابل GPQA Diamond وCursorBench من Grok — يُقاس بأدوات مختلفة في مختبرات مختلفة. لذا فالسؤال الصادق ليس "أيهما أذكى". بل هل تستحق الأفضلية المزعومة لـ Fugu Ultra v2 أن تدفع 30 دولارًا لكل مليون رمز إخراج، بينما يتقاضى Grok 4.6 مبلغ 6 دولارات.
إجابتان مختلفتان لنفس المشكلة
Grok 4.6 هو نموذج واحد، وهو الطراز الرائد الحالي في خط Grok — مُدرَج بوصفه «Latest» في وثائق المطوّرين الخاصة بالمورّد، ويخلف Grok 4.5 مع نافذة السياق نفسها البالغة 500,000 رمز، والسطح نفسه لإدخال النصوص/الصور/الملفات، والتسعير الأساسي نفسه. ويحمل تاريخ قطع المعرفة في 1 فبراير 2026، ويتيح ضبط جهد الاستدلال عبر المستويات منخفض ومتوسط وعالٍ وxhigh، مع اعتبار «عالٍ» الافتراضي. وهناك تفصيل يفاجئ الناس: لا يمكن إيقاف الاستدلال. إذ تُحتسب رموز التفكير في كل طلب، ما يجعل التكلفة الفعلية لمخرجات Grok 4.6 متوقفة على مدى الجهد الذي يقرر أن يفكّر به.
Fugu Ultra v2 ليس نموذجًا على الإطلاق بالمعنى المعتاد. إنه المستوى الأعلى قدرةً في خط التنسيق لدى Sakana AI — نقطة نهاية واحدة متوافقة مع OpenAI تقوم بتفكيك المهمة وتوزيعها عبر مجموعة من النماذج الأخرى، بعضها مفتوح الأوزان، وبعضها متخصص. تُصوّر Sakana الأمر بأنه يصل إلى مخرجات بمستوى الحدود "دون الاعتماد الذي لا غنى عنه على النماذج الرائدة التي تنسقها"، وتذكر بوضوح أن Claude Fable 5 وClaude Fable 5.1 وGPT-6 Astra مستبعدة من تلك المجموعة. أنت تدفع مقابل طبقة الجدولة، ومقابل كل رمز يستهلكه الوكلاء الفرعيون.
هذا التمييز ليس تجميليًا. إنه السبب الكامل وراء وجود فجوة السعر، وهو الشيء الوحيد الذي يجعل الفجوة قابلة للدفاع عنها.
بطاقات الأسعار، بما في ذلك الجزء الذي يتكرر
• الإدخال — Fugu Ultra v2 بسعر 5.00 دولارات لكل مليون مقابل Grok 4.6 بسعر 2.00 دولار لكل مليون. سعر Fugu يعادل 2.5× قبل حدوث أي استدعاءات فرعية.
• الإخراج — Fugu Ultra v2 بسعر 30.00 دولارًا لكل 1M مقابل Grok 4.6 بسعر 6.00 دولارات لكل 1M. فجوة بمقدار 5×، وهي التي تحدد معظم الفواتير.
• المدخلات المخزنة مؤقتًا — 0.50 دولار لكل مليون على كليهما. متطابقان. مورّدان لا يجمع بينهما أي شيء آخر وصلا إلى نفس سعر قراءة الذاكرة المؤقتة، مما يجعل حلقات الوكيل كثيفة الذاكرة المؤقتة هي عبء العمل الوحيد حيث يكون الاثنان قابلين للمقارنة حقًا سطرًا بسطر.
• إعادة تسعير السياق الطويل — تتضاعف أسعار Grok 4.6 إلى $4.00 / $12.00 بمجرد أن تتجاوز المطالبة 200,000 رمز، وتسري إعادة التسعير على الطلب بأكمله، وليس على التجاوز فقط. وتنتقل الفئة المُعلَنة لـ Fugu Ultra v2 فوق نحو 272,000 رمز إدخال إلى حوالي $10.00 / $45.00، وكذلك على الطلب بأكمله. ويعاقب كلاهما المطالبات الطويلة؛ ويبدأ Grok في المعاقبة أبكر بمقدار 72 ألف رمز.
• نافذة السياق — Grok 4.6 بـ500K رمز مقابل Fugu Ultra v2 بـ1M وفقًا لما ورد في قوائم طرف ثالث. صفحة إعلان Sakana لا تذكر أي رقم للسياق على الإطلاق، لذا تعامل مع 1M الخاص بها على أنه غير مؤكد من المورّد.
قضية السياق الطويل لها وجهان، ويستحق الأمر إجراء الحسابات. الموجّه الذي يبلغ 300 ألف رمز يكلفك 4.00 دولارات لكل مليون رمز إدخال على Grok 4.6 وحوالي 10.00 دولارات على Fugu Ultra v2. والموجّه الذي يبلغ 150 ألف رمز يكلف 2.00 دولار على Grok و5.00 دولارات على Fugu. نموذج Sakana أكثر تكلفة عند كل طول موجّه — والسؤال الوحيد هو كم مرة يحتاج إلى الاستدعاء.

الحجة المؤيدة لدفع 5× مقابل المخرجات
حجة المنسّق ليست أنه أرخص لكل توكن. بل إنه يحتاج إلى محاولات أقل، وإن التوكنات التي ينفقها على التنسيق أرخص من التوكنات التي ستنفقها في الفشل.
هذه حجة حقيقية، وتطرحها Sakana صراحةً: يستهدف Fugu Ultra v2 العمل المعقد متعدد الخطوات — البحث المستقل، والتطوير المتكامل — حيث يكون نمط فشل نموذج واحد هو الانحراف عن المسار في منتصف تشغيل طويل. إذا كان معدل إخراج بقيمة 30 دولارًا يمنحك مهمة مكتملة من المحاولة الأولى بدلاً من الثالثة، فإن العلاوة لكل توكن لا أهمية لها.
هناك أدلة داعمة من جانب المورّد نفسه، مع أنها تميل لصالح المورّد وينبغي قراءتها على هذا الأساس. تشير مواد إطلاق xAI الخاصة بـ Grok 4.6 إلى نحو 53 دورة وحوالي 0.5 مليار رمز إدخال لحل مهام طويلة الأفق، مقابل ما يقرب من 103 دورات و2.0 مليار رمز إدخال لنموذج حدودي منافس — وهي حجة مفادها أن Grok نفسه اقتصادي لكل مهمة حتى عند سعر منخفض لكل رمز. وكلتا الشركتين تقومان بالخطوة نفسها: دفعك بعيدًا عن قائمة الأسعار ونحو التكلفة لكل مهمة منجزة.
وهذا يعني أن الرقم الحاسم هو رقم لا ينشره أي من المورّدين، وعليك قياسه بنفسك: الرموز المستهلكة، من البداية إلى النهاية، في مهمة تشبه مهمتك.
حيث يكون كل واحد منها ضعيفًا حقًا
نقطة الضعف المعلنة لدى Grok 4.6 هي العمل في الطرفية. تبلغ نتيجته في Terminal-Bench v3.0 نسبة 26%، متخلفة كثيرًا عن صدارة المجال، رغم أن النموذج نفسه يسجل نسبة أقوى بكثير تبلغ 88.4% في Terminal-Bench v2.1 الأقدم — فهما اختباران مختلفان، والخلط بينهما خطأ ستراه في كثير من التغطيات. كما يحمل أعلى نتيجة GPQA Diamond بين أقرانه عند 94.9%، لكن GPQA Diamond أُسقط منذ ذلك الحين من مؤشر Artificial Analysis باعتباره مشبعًا، لذا لم تعد النتيجة العالية فيه تُميّز بين النماذج الرائدة كما كانت تفعل قبل عام.
على الجانب المستقل، يمنح Artificial Analysis نموذج Grok 4.6 درجة 44 على v4.3 Intelligence Index الخاص به، في المرتبة #20 من 200، بتكلفة لكل مهمة تبلغ 1.86 دولار. أما الرقم 61 المتداول كثيرًا فهو من مقياس مؤشر تم تجاوزه، ولا ينبغي الاقتباس منه دون ذكر النسخة التي أنتجته.
نقطة ضعف Fugu Ultra v2 هي التحقق. حتى وقت النشر، لم يُعَد إنتاج أي شيء ادّعته Sakana بشأنه بشكل مستقل — لا النتائج الخمس الأفضل أو المشتركة في الأفضل، ولا نتيجة Chartography البالغة 48.3 مقابل 27.3 لـ Opus 5 و29.5 لـ Fable 5، ولا 74.3 في DeepSWE. كذلك لا يوجد رقم منشور لزمن الاستجابة أو معدل الإنتاجية، وهو أمر يهمّ المنسّق أكثر مما يهمّ نموذجًا واحدًا، لأن زمن استجابته يعتمد كليًا على ما يقرر استدعاءه. وبالنسبة إلى Fugu Ultra السابق، أفاد المختبِرون علنًا بتشغيلات تمتد إلى نحو 30 دقيقة؛ ذلك يخصّ طراز يونيو 2026، وليس v2، لكنه نمط الفشل الذي ينبغي اختباره قبل أن تلتزم بمسار إنتاجي.

ملاحظة حول اسم المورّد
هناك نقطة دقيقة يجدر معرفتها قبل أن تبحث عن Grok 4.6 في وحدة تحكم المطوّر: يُسمى النموذج باستمرار Grok 4.6، لكن العلامة التجارية للمورّد حوله في حالة تقلّب. وثائق xAI نفسها تحمل الآن اسم SpaceXAI، وهو تغيير لم تواكبه معظم تغطيات الإطلاق. معرّفات النموذج وواجهة API لم تتغير — Grok 4.6 نموذج OpenAI Responses من الدرجة الأولى ويعمل مباشرة ضمن حلقات استدعاء الأدوات القائمة دون طبقة ترجمة — لكن إذا كنت تبحث عن بطاقة نموذج وبدت العلامة التجارية خاطئة، فليس هذا خطأك.
استدعاء أي من هذين عمليًا
Grok 4.6 متاح على OrcaRouter بسعر المزوّد نفسه — $2.00 لكل مليون إدخال و$6.00 لكل مليون إخراج، يُمرَّر دون أي هامش ربح، لذا يصل أي تغيير في سعر المورّد إلى هنا في اليوم نفسه بدلاً من أن يصل وفق جدول ترحيل. وهو متوافق مع OpenAI، على عنوان URL الأساسي نفسه الذي يستخدمه كل شيء آخر في الكتالوج، ما يعني أنه يمكنك وضعه خلف سلسلة احتياطية أو قاعدة توجيه بدلاً من ترميزه مباشرة، ويمكنك إجراء اختبار A/B له مقابل نموذج آخر دون عقد ثانٍ أو تغيير في الكود.
لا نقوم بتوجيه Fugu Ultra v2. فهو متاح من واجهة برمجة التطبيقات المتوافقة مع OpenAI الخاصة بـ Sakana AI، وتقول الشركة إن تكاملاً قائماً مع Fugu ينتقل إليه بتغيير معامل واحد. إذا أردت مقارنة الاثنين على عبء عملك، فإن أرخص ترتيب هو ترك Grok 4.6 على بوابتك واستدعاء Fugu Ultra v2 مباشرة من Sakana خلف علامة ميزة — فكلاهما يستخدمان صيغة الطلب نفسها، لذا تعمل أداة الاختبار نفسها على كليهما.

الحكم
Grok 4.6 هو الخيار الافتراضي العقلاني لمعظم الفرق، وهو ليس قريبًا على صعيد السعر. بسعر 2.00 دولار / 6.00 دولار مع قراءة ذاكرة مؤقتة بـ 0.50 دولار ونافذة 500K، يتعامل مع استدلال المستندات الطويلة ووكلاء البرمجة والعمل على الملفات متعددة الوسائط بخُمس معدل إخراج Fugu Ultra v2، كما أنه مُقيَّم ومُختبَر بشكل مستقل. موطن تعرضه هو طول المُوجِّه — إذ يضاعف منحدر 200K الطلب بأكمله — وحلقات الوكلاء كثيفة الاعتماد على الطرفية، حيث لا تكون درجاته المنشورة تنافسية.
Fugu Ultra v2 لا يستحق سعره المرتفع إلا إذا كان لديك نوع محدد من أعباء العمل: مهام طويلة، متعددة الخطوات، وثقيلة الاعتماد على الاستقلالية، حيث يميل نموذج واحد إلى الانحراف، وحيث تريد أيضًا الخصيصة المعمارية التي تسوّقها Sakana — طبقة قدرات لا تعتمد على بقاء أي مورّد في الطليعة متاحًا أو بقائه رخيصًا. هذا شيء حقيقي يستحق الرغبة. لكنه ادّعاء، وليس قياسًا بعد، وفجوة DeepSWE التي تجعله يبدو موثوقًا هي معيار قياس واحد من مورّد واحد في يوم الإصدار.
إذا لم يكن بوسعك أن تحدد أيًّا من مهامك يفشل حاليًا في المحاولة الثانية أو الثالثة، فما زلت لا تملك الرقم الذي يبرر فارق السعر. قِس ذلك أولًا. فبطاقات الأسعار تخبرك بالفعل بكل ما تبقى.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
