البطاقة العنوانية الرئيسية للمقارنة "Grok 4.6 ضد DeepSeek V4 Pro"، بعنوان فرعي "حرب أسعار في الطليعة، خاضت بفارق 24 ساعة"، مع شارة "مقارنة · أغسطس 2026".
Guides & Insights

Grok 4.6 ضد DeepSeek V4 Pro: حرب أسعار على الحدود، تُخاض بفارق 24 ساعة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أُطلِق نموذجان رائدان في غضون 24 ساعة من بعضهما البعض، والفجوة بين قائمتَي أسعارهما هي الأوسع التي أنتجها هذا الجيل. أُطلِق Grok 4.6 في 12 أغسطس 2026 بسعر 2 دولار لكل مليون رمز إدخال و6 دولارات لكل مليون رمز إخراج. وتلاه DeepSeek V4 Pro — الإصدار الإنتاجي الرسمي للنموذج الرائد لـ D​eepSeek، بإصدار DeepSeek-V4-Pro-0813 — في 13 أغسطس 2026 بسعر 3 يوانات لكل مليون رمز إدخال مع تجاوز الذاكرة المؤقتة (cache miss) و6 يوانات لكل مليون رمز إخراج، أي ما يعادل تقريبًا 0.42 دولار و0.85 دولار. الفئة نفسها، والطموحات الوكيلية نفسها، لكن بفارق عشرة أضعاف في السعر. هذه ليست مقارنة بين مواصفتين؛ بل مقارنة بين استراتيجيتين لتسعير نموذجٍ شكله وكيل، وكلاهما صدر هذا الأسبوع.

تضع هذه المقالة قائمتي الأسعار جنبًا إلى جنب، وتقرأ ادعاءات كل مورّد حول الأداء مع إبقاء اسم المورّد ظاهرًا، وتحسب التكلفة الفعلية للفجوة على حمل عمل حقيقي — لأن هذه النماذج على الورق أقرب في القدرات منها في الفلسفة، والفارق في السعر لكل مهمة هو موضع القرار.

التوقيت هو بيت القصيد

ليس من قبيل المصادفة التقويمية أن يصل النموذجان معًا في نافذة زمنية واحدة مدتها 48 ساعة. جروك 4.6 هو إعادة التهيئة الوكيلية من SpaceXAI لنموذجها الأساسي البالغ 1.5 تريليون معامل — تحديث ما بعد التدريب يعتمد بكثافة على التعلم بالتعزيز عبر البرمجة وأعمال النواة والتصميم بمساعدة الحاسوب، وهو مُسعَّر ليكون وقودًا لمنتجات كيرسور وجروك بوت التي تملكها الشركة. ديب سيك V4 Pro هو إضفاء الصفة الرسمية على نسخة معاينة أعادت بهدوء تعريف معنى "الوكيلية" بجزء صغير من التكلفة، وهي الآن معزَّزة لاقتصاد الوكلاء: ملاحظات إصدار ديب سيك للبناء 0813 تتصدَّر بقدرات وكيلية محسَّنة بشكل ملحوظ، وتضيف دعمًا لواجهة برمجة تطبيقات Responses وتكامل Codex، وتحتفظ بوضعَي التفكير (الافتراضي) وعدم التفكير، وإخراج JSON، واستدعاءات الأدوات، وتنسيق واجهة برمجة تطبيقات Anthropic. شركتان مختلفتان جدًا توصّلتا في الوقت نفسه إلى أن السوق الأهم في أواخر 2026 هي الوكلاء — وسعّرت كل منهما دخولها لمحافظ مختلفة جدًا.

ورقتا الأسعار، جنبًا إلى جنب

Grok 4.6 — $2.00 / $6.00 / $0.50 (إدخال مخزّن مؤقتًا) لكل مليون توكن، بسياق 500K، وزيادة بقيمة $4 / $12 / $1 عند تجاوز حوالي 200K من توكنات الإدخال، ونسخة أسرع بمعدل مضاعف للسعر الأساسي.

DeepSeek V4 Pro — ¥3.00 (≈$0.42) للمدخلات غير المخزنة مؤقتًا، ¥0.025 (≈$0.0035) للمدخلات المخزنة مؤقتًا، ¥6.00 (≈$0.85) للمخرجات لكل مليون توكن، مع نافذة سياق تبلغ مليون توكن وما يصل إلى 384 ألف توكن للمخرجات. نسخته الأرخص، V4 Flash، بسعر ¥1 / ¥2.

حتى عند مقارنته بـ Grok 4.6 — الذي هو بالفعل أرخص واجهة برمجة تطبيقات (API) في جيله — فإن DeepSeek V4 Pro أرخص بنحو خمس مرات في مدخلات cache-miss وأرخص بسبع مرات في المخرجات، كما يوفّر نافذة سياق أكبر بمقدار 2x وأقصى مخرجات أكبر بكثير في نفس الفئة السعرية. الاثنان لا يتنافسان على السعر؛ فـ D​eepSeek قد حدد من جانب واحد حدًا أدنى جديدًا، وأصبح Grok الآن الخيار المتميز في الجملة نفسها. هذا التأطير مهم، لأن التأطير السابق — «Grok 4.6 هو النموذج الرائد الرخيص» — كان صحيحًا ليوم واحد فقط.

Two-column scoreboard: Grok 4.6 AA Index 61 (independent), $2/$6, 500K context, DeepSWE v1.1 65.9% (vendor), Terminal-Bench 26% (v3.0), cache-hit input $0.50 vs DeepSeek V4 Pro AA Index none yet, ≈$0.42/$0.85, 1M context, DeepSWE 62.7% (vendor), Terminal-Bench 87.9% (v2.1), cache-hit input ≈$0.0035.

ما الذي حسّنه DeepSeek V4 Pro فعليًا

أرقام إطلاق DeepSeek هي الأكثر إثارة للدهشة لأنها تُقاس مقارنةً بنسختها التجريبية الخاصة، والقفزة من النسخة التجريبية إلى الإصدار النهائي هائلة. وفقًا لتقييمات المورّد نفسه:

DeepSWE — 62.7% على الإصدار الرسمي، مقارنةً بـ 12.8% في الإصدار التجريبي — وهي نتيجة طويلة الأمد في هندسة البرمجيات تضعها الشركة بين 58.0% لـ Opus 4.8 و70.0% لـ Claude Fable 5.

Cybergym — 83.3%، ارتفاعًا من 52.7%، متقدمًا بفارق ضئيل على Fable 5 (83.1%) ومتفوقًا على Opus 4.8 (78.3%).

Terminal Bench 2.1 — 87.9%، بفارق نقطة واحدة عن 88.0% لـ Fable 5 ومتقدماً على 85.0% لـ Opus 4.8.

AutomationBench (عام) — 31.8%، ارتفاعًا من 12.8%، متقدمًا على كل من Fable 5 (29.1%) وOpus 4.8 (27.2%).

Toolathlon-Verified، NL2Repo، DSBench-FullStack وDSBench-Hard — 74.1%، 61.5%، 71.1% و67.2% على التوالي، متجمّعة عند نطاق Opus 4.8 / Fable 5 أو قربه.

كل واحدة من تلك النتائج مبلغ عنها من DeepSeek على مجموعة التقييم الخاصة به. الاتجاه لا لبس فيه — النسخة التجريبية لم تكن جاهزة لحلقات الوكلاء الإنتاجية بينما يدّعي الإصدار النهائي أنه كذلك — لكن الوصف الصادق هو أنه لا يوجد مختبر مستقل قام بتقييم DeepSeek V4 Pro بعد، والنماذج التي قورن بها لم يسمِّها طرف خارجي.

بماذا يجيب Grok 4.6

منافس Grok 4.6 مختلف في نوعه: فهو الوحيد من بين الاثنين الذي يملك لوحة نتائج مستقلة. قيّمته Artificial Analysis عند 61 على مؤشر الذكاء الخاص بها — متعادلًا مع GPT-5.6 Sol، ومتفوقًا على Kimi K3 (60) — قبل حتى إطلاق DeepSeek V4 Pro. ويدّعي جدول مورّده تحقيق نسبة ريادة 65.9% على DeepSWE v1.1 و69.9% على CursorBench v3.2، مع نقطة ضعف معترف بها علنًا عند 26% على Terminal-Bench v3.0. هذه الأرقام مقدّمة من xAI، ولم يُعد إنتاج أيٍّ منها بشكل مستقل حتى 13 أغسطس.

تختلف مطابقة الإصدارات عندما تحاول المقارنة بين الاثنين مباشرة. نتيجة D​eepSeek البالغة 87.9 على Terminal Bench 2.1؛ بينما نتيجة Grok البالغة 26% على الإصدار الأصعب v3.0 — اختباران مختلفان، لذا فإن عبارة "D​eepSeek تسحق Grok على الأجهزة الطرفية" ليست قولًا صادقًا، وكذلك عبارة "Grok تتصدر على DeepSWE" ليست صادقة دون الإشارة إلى أن البائعين استخدما إصدارات تقييم مختلفة وأنه لا يوجد رقم من جهة خارجية. ما يمكن مقارنته هو البُعد المستقل: لدى Grok 4.6 بطاقة أداء واحدة موثقة، بينما DeepSeek V4 Pro لا يملك أيًا منها بعد، وبالنسبة لقرار الإنتاج، فإن هذا التباين بحد ذاته معلومات.

Screenshot of the Artificial Analysis page for Grok 4.6 (high) scoring 61 — the independent scorecard DeepSeek V4 Pro does not yet have.

التكلفة الإجمالية لتشغيل وكيل لفترة طويلة

خذ مهمة وكيلية واقعية — قراءة واستدلال عبر 500 ألف توكن من السياق، وكتابة 100 ألف توكن من المخرجات، وهي إعادة هيكلة متوسطة الحجم أو خط أنابيب مستندات طويلة، ضمن نوافذ النموذجين:

Grok 4.6 — 0.5M إدخال بسعر $2 = $1.00، بالإضافة إلى 0.1M إخراج بسعر $6 = $0.60. الإجمالي: $1.60.

DeepSeek V4 Pro — 0.5 مليون إدخال بخطأ في ذاكرة التخزين المؤقت بسعر ¥3 = ¥1.50، بالإضافة إلى 0.1 مليون إخراج بسعر ¥6 = ¥0.60. الإجمالي: ¥2.10، حوالي $0.29.

هذه فجوة بمقدار 5.5x في نفس المهمة الاسمية، قبل أي ميزة تخزين مؤقت — ونافذة D​eepSeek البالغة 1M مع حد أقصى للإخراج يبلغ 384K تعني أيضًا أن المهمة تناسب تمريرة واحدة حيث قد تضطر نافذة Grok 4.6 البالغة 500K إلى تمريرتين. العقبة التي تمنع هذا من أن يكون إجابة من سطر واحد هي تكلفة التفكير والمخاطرة: وضع التفكير في D​eepSeek مفعل افتراضيًا، لذا كل طلب يدفع مقابل أثر تفكير كامل حتى عندما لا تريده، وثقة البائع بمعاييره الخاصة لم يختبرها أي طرف مستقل. الرخص لكل رمز مع تفكير دائم النشاط ما زال رخصًا لكل مهمة بهذه الأسعار، لكن "رخص" و"موثوق" ادعاءان مختلفان، وواحد فقط من هذين النموذجين يحمل الثاني.

من الذي يجب أن يختار ماذا

القرار أقل ما يتعلق بـ"أيهما أفضل" وأكثر ما يتعلق بـ"أي ملف مخاطر يناسب عبء العمل":

حجم كبير، مقيّد بالتكلفة، ومستعد لتحمل أرقام غير موثقة — DeepSeek V4 Pro هو خيار السعر الأدنى. سياق 1M ومخرجات 384K يجعلانه المرشح الأقوى للسياقات الطويلة والمعالجة بالدفعات، ومعدل الإدخال المخزن ¥0.025 يجعل خطوط المعالجة كثيفة الاسترجاع شبه مجانية. فقط قم بتقييماتك الخاصة، لأنه لا يوجد أي طرف مستقل قام بذلك.

عمق وكيل مع بطاقة أداء مستقلة، في نظام بيئي متوافق مع OpenAI — درجة 61 لنموذج Grok 4.6 موثقة، واتجاه معايير البرمجة والوكيل متسق، ونقاط الضعف الطرفية معروفة مسبقًا. المهلة البالغة 42 ثانية حتى أول رمز هي الثمن الذي تدفعه مقابل الجودة الموثقة.

Screenshot of the OrcaRouter model page for Grok 4.6, the pass-through endpoint where both models sit behind one key at provider list price.

حركة المرور المختلطة — هذا هو الحال بالنسبة للتوجيه بدلاً من الاختيار. في OrcaRouter، يقع كلا النموذجين خلف مفتاح واحد بأسعار ممررة من قائمة المزودين — لذا يظل سعر D​eepSeek ¥3/¥6 كما هو ¥3/¥6 في الفاتورة، ويظل Grok 4.6 بسعر $2/$6، دون أي هامش ربح على أي منهما. يمكن لقاعدة توجيه أن ترسل العمل طويل السياق والمقيد بالتكلفة إلى DeepSeek V4 Pro، والعمل الوكيلي المُتحقق منه إلى Grok 4.6، وتقسيم حركة المرور حسب الطلب حتى يحسم تقييمك الخاص الانقسام، والاعتماد على التبديل التلقائي إذا تعارض سلوك أي من البائعين في الأسبوع الأول مع أرقام إطلاقه. بالنسبة لنموذجين عمرهما يوم واحد على طرفي نقيض من حرب الأسعار، فإن القدرة على مقارنة كليهما على عبء العمل الخاص بك — وعكس التقسيم دون تغيير الكود — ليست مجرد راحة. إنها الطريقة الوحيدة المبررة لاعتماد أيٍّ منهما.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube