
معايير DeepSeek V4 Pro: بطاقة الأداء الكاملة لـ0813، وكل فحص مستقل، وما لم يتحقق منه أحد بعد
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 143 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
الإجابة في سطر واحد: ينشر DeepSeek V4 Pro بطاقة أداء وكيلية قوية فعلًا وفق أرقام DeepSeek الخاصة — Terminal-Bench 2.1 عند 87.9، وDeepSWE عند 62.7، وCyberGym عند 83.3 — لكن تقريبًا كل رقم رئيسي مُبلَّغ عنه من البائع، والصورة المستقلة أكثر فتورًا. تضع Artificial Analysis الإصدار الرسمي 0813 عند 53 على مؤشر الذكاء لديها، على مستوى GLM 5.2، وبفارق أربع نقاط خلف GPT-5.6 Terra وسبع نقاط خلف Kimi K3؛ ويصنّفه Vals AI في المرتبة 12، أدنى من GPT-5.5 من الجيل السابق. هذا المقال هو التجميع الكامل الذي لم يكتبه أحد آخر: بطاقة نتائج 0813 الكاملة، ومجموعة اختبارات البرمجة الموسعة من التقرير الفني، وكل تحقق مستقل موجود، وسجل صادق بالأرقام التي أعيد إنتاجها وتلك التي ما تزال معتمدة على كلمة DeepSeek وحدها. بعد أسبوع من نشر البطاقة، بدأت صورة الخدمة تكتمل أيضًا — ففي 19 أغسطس 2026، نشرت LMSYS وAnt Group حزمة خدمة H20 تصل إلى 271 توكن إخراج في الثانية بحجم دفعة 1، وهي مشمولة في قسم خاص بها أدناه ومصنّفة، مثل كل ما هو في جانب البائع في هذه الصفحة، على أنها مُبلَّغ عنها ذاتيًا حتى يعيد أحد إنتاجها.
بطاقة الأداء الرسمية 0813 — أرقام DeepSeek الخاصة، كلها
يذكر الإعلان الرسمي لشركة DeepSeek (وثائق API، news260813، 13 أغسطس 2026) أن البناء الإنتاجي مَبنيّ على معاينة أبريل. كل رقم في هذا القسم مُبلَّغ من قِبل المورّد — ولم تتم إعادة إنتاج أيٍّ منها بشكل مستقل حتى 16 أغسطس 2026:
• Terminal-Bench 2.1 — 87.9 (المعاينة: 72.1).
• DeepSWE — 62.7 (المعاينة: 12.8) — قفزة بنحو 5 أضعاف، وهي الادعاء الأكثر لفتًا للانتباه على البطاقة.
• CyberGym — 83.3 (المعاينة: 52.7).
• Humanity's Last Exam — 42.7 بدون أدوات، 60.0 مع الأدوات (معاينة: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (معاينة: 55.9).
• AutomationBench (عام) — 31.8 (معاينة: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (معاينة: 41.8 / 31.1).
• NL2Repo — 61.5 (المعاينة: 38.5).
• Agents' Last Exam — 25.7 (المعاينة: 16.5).
النمط الذي يجب ملاحظته هو أين تتركز المكاسب: معايير الوكلاء والأمن السيبراني. هذا بالضبط نوع بطاقة الأداء التي يُنتجها مختبر عندما يريد الترويج لنموذج وكيل — وهو بالضبط النوع الذي يحتاج إلى إعادة تشغيل محايدة قبل أن تنفق أموال الإنتاج عليه.

مجموعة الترميز الموسعة من التقرير الفني لـ DeepSeek
ما وراء بطاقة العامل، يضيف التقرير الفني لـ DeepSeek (كما جمعه BenchLM في 16 أغسطس 2026) مجموعة أوسع للبرمجة والسياق الطويل. كما أنه مُبلَّغ من البائع، ومصنَّف على أنه "Provider exact" بواسطة BenchLM — دون اختبار مستقل:
• SWE-bench Verified — 80.6%؛ SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — الأفضل الموثّق في كتالوج BenchLM.
• تقييم Codeforces — 3206 — وهو أيضًا الأفضل توثيقًا في الكتالوج.
• BrowseComp — 83.4%؛ Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%؛ CorpusQA 1M — 62.0% — وكلاهما الأفضل ضمن السجل لاسترجاع 1M رمزًا، وهو أمر مهم لنموذج يعلن عن نافذة سياق تبلغ 1M رمزًا.
• GPQA Diamond — 92.8، وSciCode — 49.2، وLong-Context Recall — 75.3 (كما هو مدرج في صفحة نموذج OrcaRouter).
ما الذي يقيسه المقيّمون المستقلون فعليًا
ثلاثة مصادر مستقلة قامت بتشغيل DeepSeek V4 Pro، وتركزت تقييماتها دون بطاقة البائع:
• Artificial Analysis Intelligence Index — 53 (تقرير SCMP، أغسطس 2026؛ تعرض صفحة نموذج OrcaRouter القيمة 53.2، محتلًا المرتبة 20 من بين 132). على قدم المساواة مع GLM 5.2، وأقل بأربع نقاط من GPT-5.6 Terra، وبسبع نقاط عن Kimi K3.
• Artificial Analysis Coding — 68.8، مصنّفة في المرتبة 24 من أصل 130 (وفقًا لصفحة نموذج OrcaRouter).
• Vals AI Index — الثاني عشر، متخلفًا عن GPT-5.5 من الجيل السابق وبفارق كبير عن Kimi K3 وClaude Opus 5 (SCMP). وقد رصدت اختبارات Vals AI الخاصة نقطتي ضعف ملموستين: إنجاز المهام داخل بيئة طرفية معزولة، وبناء نماذج مالية معقدة في جداول بيانات Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI، التشغيل المستقل الوحيد "Benchmark exact" في المجموعة).
السجل الصادق — ما تمت إعادة إنتاجه مقابل ما لا يزال مجرد كلمة DeepSeek
هذا هو القسم الذي تهدف مقالة المعيار إلى توفيره، والسبب لوضع إشارة مرجعية على هذه الصفحة بدلاً من تغطية الإطلاق. قسّم كل نتيجة إلى واحدة من مجموعتين:
• مصادر مستقلة:AA Intelligence Index 53 / 53.2، وAA Coding 68.8، وترتيب Vals AI الثاني عشر، وVibe Code Bench 49.93 — وتشغيل من مصادر مستقلة لـ Terminal-Bench 2.1 سجّل 78.7 الذي يجاور رقم 87.9 الخاص بـ DeepSeek على صفحة OrcaRouter. إن الفجوة البالغة تسع نقاط بين رقم المورّد والتشغيل المستقل هي أهم معلومة في هذه الصفحة: إنها فجوة إعادة الإنتاج، مُحدّدة كميًا.
• مُبلَّغ عنه من المورّد فقط، ولم يُعاد إنتاجه بشكل مستقل:كل رقم في البطاقة الرسمية 0813 أعلاه (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) ومجموعة الترميز الموسعة بأكملها (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). وتصف وثائق DeepSeek الخاصة رقم Terminal-Bench 2.1 بأنه "تشغيل من المورّد".
عند قراءته بهذا الشكل، تكون القصة متسقة: DeepSeek V4 Pro هو نموذج حدودي حقيقي في منتصف الترتيب — بدرجة AA 53، وترتيب يقع بين المرتبة 13 والمرتبة 29 — مع بطاقة تقييم من البائع تدّعي أداءً قريبًا من الأفضل في المهام الوكيلية والبرمجة. كلتا العبارتين صحيحتان، ولا يوجد تعارض بينهما؛ إحداهما مُقاسة والأخرى مُدّعاة.

ما هي تكلفة بطاقة الأداء؟
DeepSeek V4 Pro هو النموذج الرائد من نوع MoE بإجمالي 1.6T مع 49B نشط، ونافذة سياق تبلغ 1M رمزًا، وحد أقصى للإخراج يبلغ 384K. على OrcaRouter يُسعَّر وفق قائمة أسعار DeepSeek دون أي زيادة: $0.435 لكل مليون رمز إدخال و$0.87 لكل مليون رمز إخراج (قراءة الكاش $0.060 لكل مليون)، وفقًا للدليل الذي تم التحقق منه في 15 أغسطس 2026 وتأكيده على صفحة النموذج المباشرة. بهذا المعدل، يُعد حساب السعر لكل نقطة أقوى حجة لصالح هذا النموذج: فهو تقريبًا عُشر سعر الإخراج للنماذج التي تقترب منه في النتائج على المؤشر المستقل، لذا فأنت تدفع أسعارًا في المستوى المتوسط مقابل سجل أداء يقع، إذا كانت ادعاءات البائع صحيحة، بالقرب من القمة. ملاحظة واحدة: أعلنت DeepSeek عن جدول تسعير للذروة وخارج الذروة (خارج الذروة بنسبة 50% من الذروة) يسري اعتبارًا من 17 أغسطس بتوقيت بكين، لذلك قد يتغير السعر — الأرقام هنا هي سعر القائمة الحالي وقت كتابة هذا المقال.

تقديم DeepSeek V4 Pro: 271 رمزًا في الثانية على H20
تقيس المعايير ما يعرفه النموذج؛ بينما تقيس أرقام الخدمة مدى رخص تكلفة جعله يفكر. في 19 أغسطس 2026، نشرت LMSYS — المنظمة التي تقف وراء Chatbot Arena — وفريق المصادر المفتوحة في Ant Group أول عمل جاد في الخدمة على إصدار 0813: «حزمة خدمة مخصصة للسيناريو» مبنية على SGLang، المحرك مفتوح المصدر الذي تحافظ عليه LMSYS. الرقم الرئيسي هو 271 رمز إخراج/ثانية عند حجم دفعة 1 على NVIDIA H20، وهو ما يقدّره الفريق بـفارق 1.42× عن B300 — وقد تحقق على شريحةٍ بلا أنوية FP4 Tensor أصلية. هذه هي قياسات LMSYS وAnt Group الخاصة بهما، أُعلنت في مدونتهما وعلى X؛ ولم تتم إعادة إنتاج أي منها بشكل مستقل.
باقي أرقام الحزمة، جميعها مُبلَّغة ذاتيًا من قبل LMSYS وAnt Group على حزمتهم الخاصة:
• كمون فك الترميز — مكوّن "DSpark المُحسَّن" يقلل زمن كل رمز مخرَج (TPOT) بنسبة 74.8–78.0% عند حجم دفعة 1.
• Prefill — تكتمل التعبئة المسبقة لمليون رمز في 43.7 ثانية، بزيادة 36.5% في متوسط الإنتاجية الهندسي.
• KV cache — مخطط يسميه الفريق "Humming MXFP4AFP8 + Online C128" يوسّع سعة ذاكرة التخزين المؤقت KV للرموز الكاملة بمقدار 10.14×، وهي الرافعة التي تجعل أعباء عمل الوكلاء ذات المليون رمز عملية على هذه الفئة من السيليكون.
• فك الترميز لكل GPU — عند سياق 4K، ترتفع إنتاجية فك الترميز لكل GPU من 319.9 إلى 703.2 رمزًا/ثانية/GPU، أي تحسّن بنسبة 2.20×.
اقرأ التحذيرات قبل أن تحدد حجم أسطولك بناءً عليه. حجم الدفعة 1 هو نظام التدفق الفردي — وهو ما يصادفه وكيل تفاعلي أو محادثة، وليس واجهة برمجة تطبيقات عالية التزامن — والمقارنة البالغة 1.42× مقارنةً بـ B300 هي نسبة تذكرها LMSYS دون نشر القيمة المطلقة لرموز/ثانية الخاصة بـ B300، لذا فإن الفجوة مُدّعاة وليست قابلة للتحقق. كما أن النتيجة تقيس الحزمة البرمجية، وليس الشريحة: هذه المكاسب تأتي من تحسينات على مستوى SGLang تعمل على عتاد كان سيبدو غير كافٍ لبنية MoE بإجمالي 1.6 تريليون معلمة. للتوضيح، تقيس صفحة النموذج المباشر في OrcaRouter نموذج DeepSeek V4 Pro عند 80.8 رمزًا/ثانية في المخرجات عبر نقطة نهاية API مشتركة — أما رقم H20 فهو معيار تدفق فردي على حزمة مخصصة، وهو رقم مختلف له معنى مختلف.
إذا كانت أحمال عملك تُقدَّم عبر API، فلا يتغيّر شيء من هذا في طريقة استدعائك للنموذج: {{1}}DeepSeek V4 Pro هو مفتاح واحد متوافق مع OpenAI على OrcaRouter بسعر DeepSeek المعلن، مع تجاوز تلقائي للفشل إذا تعطّل المزوّد.{{/1}} أرقام H20 هي الأكثر أهميةً إذا كنت في الفريق الذي يوازن بين تشغيل أسطول H20 ذاتي الاستضافة وبين الدفع مقابل API — فالفجوة التي يسدّها عمل LMSYS وAnt Group هي قرار شراء عتاد، وليس قرار اختيار نموذج.
عندما تكون هذه التوصية خاطئة
الحالات التي يجب فيها ألا يكون DeepSeek V4 Pro اختيارك:
• تحتاج إلى استدلال متقدم مؤكد بشكل مستقل.مؤشر AA Index 53 في منتصف المجموعة — Kimi K3 (60) وGPT-5.6 Terra (57) متقدمان ومتحقق منهما. إذا كان قرارك يعتمد على السقف المُقاس، فإن بطاقة البائع لا تغيّره.
• أنت تراهن على الإنتاج بناءً على DeepSWE 62.7 قبل أن يكرر أحدهم الاختبار. قفزة من 12.8 إلى 62.7 في إصدار واحد هي ادعاء، وليست حقيقة. انتظر إعادة إنتاج محايدة — الفجوة بين 87.9 و78.7 في Terminal-Bench تُظهر ما قد يكتشفه المرء.
• عبء عملك هو أتمتة طرفية معزولة أو نمذجة مالية في Excel.يقول Vals AI إن هذه هي بالضبط المجالات التي يواجه فيها النموذج صعوبة، بغض النظر عن أي تقييم من المورد.
• أنت تتخذ قرارًا في مجال الأمن السيبراني بناءً على CyberGym 83.3. وهذا يعني أن DeepSeek يختبر نموذجه الخاص على معياره الخاص — فبائع الأمن الذي يشتري بناءً على هذا الرقم يشتري بيانات غير مدققة.
• أنت تشتري H20s اعتمادًا على رقم 271 رمزًا/ثانية وحده. هذا الرقم معيار أداء أحادي الحزمة مُبلَّغ ذاتيًا عند حجم دفعة 1 — واعد، ولم يُكرَّر، وهو نقطة واحدة على منحنى تكلفة يشمل أيضًا الاستخدام والطاقة وأي حزمة تقديم ستشغّلها فعليًا.
الخلاصة
DeepSeek V4 Pro 0813 هو نموذج حدودي حقيقي ببطاقة أداء من البائع تتجاوز سجله المستقل. إصدار 0813 حوّل معاينة نصية إلى منافس جاد في مجال الوكلاء الأذكياء — وقد غطّينا الإصدار نفسه على حدة — وإذا كنت تريد تقييمه اليوم، فهو مفتاح واحد متوافق مع OpenAI على OrcaRouter بسعر ديب سيك المعلن، مع تجاوز تلقائي للفشل إذا تباطأ المزوّد. فقط اقرأ بطاقة الأداء بالطريقة التي يقسّمها بها هذا المقال: الفحوصات المستقلة (AA 53، Vals في المركز 12، نتيجة 78.7 في Terminal-Bench) هي ما يمكنك الوثوق به اليوم؛ أما أرقام 87.9 و62.7 فهي ما ينبغي التحقق منه قبل البناء عليها. وينطبق الانضباط نفسه الآن على التقديم: معدل 271 رمزًا في الثانية الذي أعلنته LMSYS وAnt Group على H20 هو أفضل صورة للإنتاجية لدينا، وما يزال قولهم حتى تؤكده تجربة محايدة. اشترِه لأجل السعر مقابل الأداء وسياق المليون رمز، وليس لأجل الأرقام الرئيسية غير المعاد إنتاجها.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
