بطاقة عنوان رئيسية لمقال "معايير DeepSeek V4 Pro": لوحة نتائج بمقياس كبير، عنوان رئيسي "DeepSeek V4 Pro — بطاقة نتائج المعايير"، عنوان فرعي "نتائج 0813 الرسمية، فحوصات مستقلة، وما لم يُعاد إنتاجه بعد"، ورقاقات تحمل "TERMINAL-BENCH 2.1: 87.9"، "DEEPSWE: 62.7"، "AA INDEX: 53"، "1M CONTEXT". شعار OrcaRouter مركّب في الأسفل يمينًا.
Guides & Insights

معايير DeepSeek V4 Pro: بطاقة الأداء الكاملة لـ0813، وكل فحص مستقل، وما لم يتحقق منه أحد بعد

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الإجابة في سطر واحد: ينشر DeepSeek V4 Pro بطاقة أداء وكيلية قوية فعلًا وفق أرقام Deep​Seek الخاصة — Terminal-Bench 2.1 عند 87.9، وDeepSWE عند 62.7، وCyberGym عند 83.3 — لكن تقريبًا كل رقم رئيسي مُبلَّغ عنه من البائع، والصورة المستقلة أكثر فتورًا. تضع Artificial Analysis الإصدار الرسمي 0813 عند 53 على مؤشر الذكاء لديها، على مستوى GLM 5.2، وبفارق أربع نقاط خلف GPT-5.6 Terra وسبع نقاط خلف Kimi K3؛ ويصنّفه Vals AI في المرتبة 12، أدنى من GPT-5.5 من الجيل السابق. هذا المقال هو التجميع الكامل الذي لم يكتبه أحد آخر: بطاقة نتائج 0813 الكاملة، ومجموعة اختبارات البرمجة الموسعة من التقرير الفني، وكل تحقق مستقل موجود، وسجل صادق بالأرقام التي أعيد إنتاجها وتلك التي ما تزال معتمدة على كلمة Deep​Seek وحدها. بعد أسبوع من نشر البطاقة، بدأت صورة الخدمة تكتمل أيضًا — ففي 19 أغسطس 2026، نشرت LMSYS وAnt Group حزمة خدمة H20 تصل إلى 271 توكن إخراج في الثانية بحجم دفعة 1، وهي مشمولة في قسم خاص بها أدناه ومصنّفة، مثل كل ما هو في جانب البائع في هذه الصفحة، على أنها مُبلَّغ عنها ذاتيًا حتى يعيد أحد إنتاجها.

بطاقة الأداء الرسمية 0813 — أرقام Deep​Seek الخاصة، كلها

يذكر الإعلان الرسمي لشركة Deep​Seek (وثائق API، news260813، 13 أغسطس 2026) أن البناء الإنتاجي مَبنيّ على معاينة أبريل. كل رقم في هذا القسم مُبلَّغ من قِبل المورّد — ولم تتم إعادة إنتاج أيٍّ منها بشكل مستقل حتى 16 أغسطس 2026:

• Terminal-Bench 2.1 — 87.9 (المعاينة: 72.1).

• DeepSWE — 62.7 (المعاينة: 12.8) — قفزة بنحو 5 أضعاف، وهي الادعاء الأكثر لفتًا للانتباه على البطاقة.

• CyberGym — 83.3 (المعاينة: 52.7).

• Humanity's Last Exam — 42.7 بدون أدوات، 60.0 مع الأدوات (معاينة: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (معاينة: 55.9).

• AutomationBench (عام) — 31.8 (معاينة: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (معاينة: 41.8 / 31.1).

• NL2Repo — 61.5 (المعاينة: 38.5).

• Agents' Last Exam — 25.7 (المعاينة: 16.5).

النمط الذي يجب ملاحظته هو أين تتركز المكاسب: معايير الوكلاء والأمن السيبراني. هذا بالضبط نوع بطاقة الأداء التي يُنتجها مختبر عندما يريد الترويج لنموذج وكيل — وهو بالضبط النوع الذي يحتاج إلى إعادة تشغيل محايدة قبل أن تنفق أموال الإنتاج عليه.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

مجموعة الترميز الموسعة من التقرير الفني لـ Deep​Seek

ما وراء بطاقة العامل، يضيف التقرير الفني لـ Deep​Seek (كما جمعه BenchLM في 16 أغسطس 2026) مجموعة أوسع للبرمجة والسياق الطويل. كما أنه مُبلَّغ من البائع، ومصنَّف على أنه "Provider exact" بواسطة BenchLM — دون اختبار مستقل:

• SWE-bench Verified — 80.6%؛ SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93.5% — الأفضل الموثّق في كتالوج BenchLM.

• تقييم Codeforces — 3206 — وهو أيضًا الأفضل توثيقًا في الكتالوج.

• BrowseComp — 83.4%؛ Terminal-Bench 2.0 — 67.9%.

• MRCR 1M — 83.5%؛ CorpusQA 1M — 62.0% — وكلاهما الأفضل ضمن السجل لاسترجاع 1M رمزًا، وهو أمر مهم لنموذج يعلن عن نافذة سياق تبلغ 1M رمزًا.

• GPQA Diamond — 92.8، وSciCode — 49.2، وLong-Context Recall — 75.3 (كما هو مدرج في صفحة نموذج OrcaRouter).

ما الذي يقيسه المقيّمون المستقلون فعليًا

ثلاثة مصادر مستقلة قامت بتشغيل DeepSeek V4 Pro، وتركزت تقييماتها دون بطاقة البائع:

• Artificial Analysis Intelligence Index — 53 (تقرير SCMP، أغسطس 2026؛ تعرض صفحة نموذج OrcaRouter القيمة 53.2، محتلًا المرتبة 20 من بين 132). على قدم المساواة مع GLM 5.2، وأقل بأربع نقاط من GPT-5.6 Terra، وبسبع نقاط عن Kimi K3.

• Artificial Analysis Coding — 68.8، مصنّفة في المرتبة 24 من أصل 130 (وفقًا لصفحة نموذج OrcaRouter).

• Vals AI Index — الثاني عشر، متخلفًا عن GPT-5.5 من الجيل السابق وبفارق كبير عن Kimi K3 وClaude Opus 5 (SCMP). وقد رصدت اختبارات Vals AI الخاصة نقطتي ضعف ملموستين: إنجاز المهام داخل بيئة طرفية معزولة، وبناء نماذج مالية معقدة في جداول بيانات Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI، التشغيل المستقل الوحيد "Benchmark exact" في المجموعة).

السجل الصادق — ما تمت إعادة إنتاجه مقابل ما لا يزال مجرد كلمة Deep​Seek

هذا هو القسم الذي تهدف مقالة المعيار إلى توفيره، والسبب لوضع إشارة مرجعية على هذه الصفحة بدلاً من تغطية الإطلاق. قسّم كل نتيجة إلى واحدة من مجموعتين:

• مصادر مستقلة:AA Intelligence Index 53 / 53.2، وAA Coding 68.8، وترتيب Vals AI الثاني عشر، وVibe Code Bench 49.93 — وتشغيل من مصادر مستقلة لـ Terminal-Bench 2.1 سجّل 78.7 الذي يجاور رقم 87.9 الخاص بـ Deep​Seek على صفحة OrcaRouter. إن الفجوة البالغة تسع نقاط بين رقم المورّد والتشغيل المستقل هي أهم معلومة في هذه الصفحة: إنها فجوة إعادة الإنتاج، مُحدّدة كميًا.

• مُبلَّغ عنه من المورّد فقط، ولم يُعاد إنتاجه بشكل مستقل:كل رقم في البطاقة الرسمية 0813 أعلاه (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) ومجموعة الترميز الموسعة بأكملها (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). وتصف وثائق Deep​Seek الخاصة رقم Terminal-Bench 2.1 بأنه "تشغيل من المورّد".

عند قراءته بهذا الشكل، تكون القصة متسقة: DeepSeek V4 Pro هو نموذج حدودي حقيقي في منتصف الترتيب — بدرجة AA 53، وترتيب يقع بين المرتبة 13 والمرتبة 29 — مع بطاقة تقييم من البائع تدّعي أداءً قريبًا من الأفضل في المهام الوكيلية والبرمجة. كلتا العبارتين صحيحتان، ولا يوجد تعارض بينهما؛ إحداهما مُقاسة والأخرى مُدّعاة.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

ما هي تكلفة بطاقة الأداء؟

Deep​Seek V4 Pro هو النموذج الرائد من نوع MoE بإجمالي 1.6T مع 49B نشط، ونافذة سياق تبلغ 1M رمزًا، وحد أقصى للإخراج يبلغ 384K. على OrcaRouter يُسعَّر وفق قائمة أسعار Deep​Seek دون أي زيادة: $0.435 لكل مليون رمز إدخال و$0.87 لكل مليون رمز إخراج (قراءة الكاش $0.060 لكل مليون)، وفقًا للدليل الذي تم التحقق منه في 15 أغسطس 2026 وتأكيده على صفحة النموذج المباشرة. بهذا المعدل، يُعد حساب السعر لكل نقطة أقوى حجة لصالح هذا النموذج: فهو تقريبًا عُشر سعر الإخراج للنماذج التي تقترب منه في النتائج على المؤشر المستقل، لذا فأنت تدفع أسعارًا في المستوى المتوسط مقابل سجل أداء يقع، إذا كانت ادعاءات البائع صحيحة، بالقرب من القمة. ملاحظة واحدة: أعلنت Deep​Seek عن جدول تسعير للذروة وخارج الذروة (خارج الذروة بنسبة 50% من الذروة) يسري اعتبارًا من 17 أغسطس بتوقيت بكين، لذلك قد يتغير السعر — الأرقام هنا هي سعر القائمة الحالي وقت كتابة هذا المقال.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

تقديم DeepSeek V4 Pro: 271 رمزًا في الثانية على H20

تقيس المعايير ما يعرفه النموذج؛ بينما تقيس أرقام الخدمة مدى رخص تكلفة جعله يفكر. في 19 أغسطس 2026، نشرت LMSYS — المنظمة التي تقف وراء Chatbot Arena — وفريق المصادر المفتوحة في Ant Group أول عمل جاد في الخدمة على إصدار 0813: «حزمة خدمة مخصصة للسيناريو» مبنية على SGLang، المحرك مفتوح المصدر الذي تحافظ عليه LMSYS. الرقم الرئيسي هو 271 رمز إخراج/ثانية عند حجم دفعة 1 على NVIDIA H20، وهو ما يقدّره الفريق بـفارق 1.42× عن B300 — وقد تحقق على شريحةٍ بلا أنوية FP4 Tensor أصلية. هذه هي قياسات LMSYS وAnt Group الخاصة بهما، أُعلنت في مدونتهما وعلى X؛ ولم تتم إعادة إنتاج أي منها بشكل مستقل.

باقي أرقام الحزمة، جميعها مُبلَّغة ذاتيًا من قبل LMSYS وAnt Group على حزمتهم الخاصة:

• كمون فك الترميز — مكوّن "DSpark المُحسَّن" يقلل زمن كل رمز مخرَج (TPOT) بنسبة 74.8–78.0% عند حجم دفعة 1.

• Prefill — تكتمل التعبئة المسبقة لمليون رمز في 43.7 ثانية، بزيادة 36.5% في متوسط الإنتاجية الهندسي.

• KV cache — مخطط يسميه الفريق "Humming MXFP4AFP8 + Online C128" يوسّع سعة ذاكرة التخزين المؤقت KV للرموز الكاملة بمقدار 10.14×، وهي الرافعة التي تجعل أعباء عمل الوكلاء ذات المليون رمز عملية على هذه الفئة من السيليكون.

• فك الترميز لكل GPU — عند سياق 4K، ترتفع إنتاجية فك الترميز لكل GPU من 319.9 إلى 703.2 رمزًا/ثانية/GPU، أي تحسّن بنسبة 2.20×.

اقرأ التحذيرات قبل أن تحدد حجم أسطولك بناءً عليه. حجم الدفعة 1 هو نظام التدفق الفردي — وهو ما يصادفه وكيل تفاعلي أو محادثة، وليس واجهة برمجة تطبيقات عالية التزامن — والمقارنة البالغة 1.42× مقارنةً بـ B300 هي نسبة تذكرها LMSYS دون نشر القيمة المطلقة لرموز/ثانية الخاصة بـ B300، لذا فإن الفجوة مُدّعاة وليست قابلة للتحقق. كما أن النتيجة تقيس الحزمة البرمجية، وليس الشريحة: هذه المكاسب تأتي من تحسينات على مستوى SGLang تعمل على عتاد كان سيبدو غير كافٍ لبنية MoE بإجمالي 1.6 تريليون معلمة. للتوضيح، تقيس صفحة النموذج المباشر في OrcaRouter نموذج DeepSeek V4 Pro عند 80.8 رمزًا/ثانية في المخرجات عبر نقطة نهاية API مشتركة — أما رقم H20 فهو معيار تدفق فردي على حزمة مخصصة، وهو رقم مختلف له معنى مختلف.

إذا كانت أحمال عملك تُقدَّم عبر API، فلا يتغيّر شيء من هذا في طريقة استدعائك للنموذج: {{1}}DeepSeek V4 Pro هو مفتاح واحد متوافق مع OpenAI على OrcaRouter بسعر Deep​Seek المعلن، مع تجاوز تلقائي للفشل إذا تعطّل المزوّد.{{/1}} أرقام H20 هي الأكثر أهميةً إذا كنت في الفريق الذي يوازن بين تشغيل أسطول H20 ذاتي الاستضافة وبين الدفع مقابل API — فالفجوة التي يسدّها عمل LMSYS وAnt Group هي قرار شراء عتاد، وليس قرار اختيار نموذج.

عندما تكون هذه التوصية خاطئة

الحالات التي يجب فيها ألا يكون DeepSeek V4 Pro اختيارك:

• تحتاج إلى استدلال متقدم مؤكد بشكل مستقل.مؤشر AA Index 53 في منتصف المجموعة — Kimi K3 (60) وGPT-5.6 Terra (57) متقدمان ومتحقق منهما. إذا كان قرارك يعتمد على السقف المُقاس، فإن بطاقة البائع لا تغيّره.

• أنت تراهن على الإنتاج بناءً على DeepSWE 62.7 قبل أن يكرر أحدهم الاختبار. قفزة من 12.8 إلى 62.7 في إصدار واحد هي ادعاء، وليست حقيقة. انتظر إعادة إنتاج محايدة — الفجوة بين 87.9 و78.7 في Terminal-Bench تُظهر ما قد يكتشفه المرء.

• عبء عملك هو أتمتة طرفية معزولة أو نمذجة مالية في Excel.يقول Vals AI إن هذه هي بالضبط المجالات التي يواجه فيها النموذج صعوبة، بغض النظر عن أي تقييم من المورد.

• أنت تتخذ قرارًا في مجال الأمن السيبراني بناءً على CyberGym 83.3. وهذا يعني أن DeepSeek يختبر نموذجه الخاص على معياره الخاص — فبائع الأمن الذي يشتري بناءً على هذا الرقم يشتري بيانات غير مدققة.

• أنت تشتري H20s اعتمادًا على رقم 271 رمزًا/ثانية وحده. هذا الرقم معيار أداء أحادي الحزمة مُبلَّغ ذاتيًا عند حجم دفعة 1 — واعد، ولم يُكرَّر، وهو نقطة واحدة على منحنى تكلفة يشمل أيضًا الاستخدام والطاقة وأي حزمة تقديم ستشغّلها فعليًا.

الخلاصة

DeepSeek V4 Pro 0813 هو نموذج حدودي حقيقي ببطاقة أداء من البائع تتجاوز سجله المستقل. إصدار 0813 حوّل معاينة نصية إلى منافس جاد في مجال الوكلاء الأذكياء — وقد غطّينا الإصدار نفسه على حدة — وإذا كنت تريد تقييمه اليوم، فهو مفتاح واحد متوافق مع OpenAI على OrcaRouter بسعر ديب سيك المعلن، مع تجاوز تلقائي للفشل إذا تباطأ المزوّد. فقط اقرأ بطاقة الأداء بالطريقة التي يقسّمها بها هذا المقال: الفحوصات المستقلة (AA 53، Vals في المركز 12، نتيجة 78.7 في Terminal-Bench) هي ما يمكنك الوثوق به اليوم؛ أما أرقام 87.9 و62.7 فهي ما ينبغي التحقق منه قبل البناء عليها. وينطبق الانضباط نفسه الآن على التقديم: معدل 271 رمزًا في الثانية الذي أعلنته LMSYS وAnt Group على H20 هو أفضل صورة للإنتاجية لدينا، وما يزال قولهم حتى تؤكده تجربة محايدة. اشترِه لأجل السعر مقابل الأداء وسياق المليون رمز، وليس لأجل الأرقام الرئيسية غير المعاد إنتاجها.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا