بطاقة عنوان رئيسية لمقال "معايير DeepSeek V4 Pro": لوحة نتائج بمقياس كبير، عنوان رئيسي "DeepSeek V4 Pro — بطاقة نتائج المعايير"، عنوان فرعي "نتائج 0813 الرسمية، فحوصات مستقلة، وما لم يُعاد إنتاجه بعد"، ورقاقات تحمل "TERMINAL-BENCH 2.1: 87.9"، "DEEPSWE: 62.7"، "AA INDEX: 53"، "1M CONTEXT". شعار OrcaRouter مركّب في الأسفل يمينًا.
Guides & Insights

معايير DeepSeek V4 Pro: بطاقة الأداء الكاملة لـ0813، وكل فحص مستقل، وما لم يتحقق منه أحد بعد

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الإجابة في سطر واحد: يحقق DeepSeek V4 Pro أداءً وكيليًا قويًا حقًا وفقًا لأرقام DeepSeek الخاصة — Terminal-Bench 2.1 عند 87.9، وDeepSWE عند 62.7، وCyberGym عند 83.3 — لكن كل رقم بارز تقريبًا مُعلَن من قِبل الشركة المطوّرة، والصورة المستقلة أكثر برودة. يضع Artificial Analysis الإصدار الرسمي 0813 عند 53 على Intelligence Index الخاص به، معادلًا لـ GLM-5.2، متأخرًا بأربع نقاط عن GPT-5.6 Terra وبسبع نقاط عن Kimi K3؛ ويصنّفه Vals AI في المرتبة 12، أدنى من GPT-5.5 من الجيل السابق. هذه المقالة هي التجميع الكامل الذي لم يكتبه أي شخص آخر: بطاقة أداء 0813 الكاملة، ومجموعة البرمجة الموسعة من التقرير الفني، وكل فحص مستقل موجود، وسجل أمين بالأرقام التي أُعيد إنتاجها وتلك التي لا تزال كلمة DeepSeek وحدها.

بطاقة النتائج الرسمية 0813 — أرقام DeepSeek الخاصة، كلها

يذكر الإعلان الرسمي لـ DeepSeek ({{1}}توثيق API، الأخبار260813، 13 أغسطس 2026{{/1}}) أن الإصدار الإنتاجي مبني على المعاينة الصادرة في أبريل. جميع الأرقام في هذا القسم مُعلنة من قِبل البائع — لم يتم التحقق منها بشكل مستقل حتى 16 أغسطس 2026: يرجى الملاحظة.

Terminal-Bench 2.1 — 87.9 (المعاينة: 72.1).

DeepSWE — 62.7 (المعاينة: 12.8) — قفزة بنحو 5 أضعاف، وهي الادعاء الأكثر لفتًا للانتباه على البطاقة.

CyberGym — 83.3 (المعاينة: 52.7).

Humanity's Last Exam — 42.7 بدون أدوات، 60.0 مع الأدوات (معاينة: 37.7 / 48.2).

Toolathlon-Verified — 74.1 (معاينة: 55.9).

AutomationBench (عام) — 31.8 (معاينة: 12.8).

DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (معاينة: 41.8 / 31.1).

NL2Repo — 61.5 (المعاينة: 38.5).

Agents' Last Exam — 25.7 (المعاينة: 16.5).

النمط الذي يجب ملاحظته هو أين تتركز المكاسب: معايير الوكلاء والأمن السيبراني. هذا بالضبط نوع بطاقة الأداء التي يُنتجها مختبر عندما يريد الترويج لنموذج وكيل — وهو بالضبط النوع الذي يحتاج إلى إعادة تشغيل محايدة قبل أن تنفق أموال الإنتاج عليه.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

مجموعة الترميز الموسعة من التقرير الفني لـ DeepSeek

إلى جانب بطاقة الوكيل، يضيف التقرير الفني لـ DeepSeek (كما جمعته BenchLM في 16 أغسطس 2026) مجموعة أوسع للبرمجة والسياق الطويل. كما أنه مُبلَّغ من قِبل البائع، وموسوم بـ"مزود دقيق" من قبل BenchLM — دون اختبار مستقل:

SWE-bench Verified — 80.6%؛ SWE-bench Pro — 55.4%.

LiveCodeBench Pass@1-CoT — 93.5% — الأفضل الموثّق في كتالوج BenchLM.

تقييم Codeforces — 3206 — وهو أيضًا الأفضل توثيقًا في الكتالوج.

BrowseComp — 83.4%؛ Terminal-Bench 2.0 — 67.9%.

MRCR 1M — 83.5%؛ CorpusQA 1M — 62.0% — وكلاهما الأفضل ضمن السجل لاسترجاع 1M رمزًا، وهو أمر مهم لنموذج يعلن عن نافذة سياق تبلغ 1M رمزًا.

GPQA Diamond — 92.8، وSciCode — 49.2، وLong-Context Recall — 75.3 (كما هو مدرج في صفحة نموذج OrcaRouter).

ما الذي يقيسه المقيّمون المستقلون فعليًا

ثلاثة مصادر مستقلة قامت بتشغيل DeepSeek V4 Pro، وتركزت تقييماتها دون بطاقة البائع:

Artificial Analysis Intelligence Index — 53 (تقرير SCMP، أغسطس 2026؛ صفحة نموذج OrcaRouter تُظهر 53.2، مرتبة 20 من 132). على قدم المساواة مع GLM-5.2، بأربع نقاط خلف GPT-5.6 Terra، وسبع نقاط خلف Kimi K3.

Artificial Analysis Coding — 68.8، مصنّفة في المرتبة 24 من أصل 130 (وفقًا لصفحة نموذج OrcaRouter).

Vals AI Index — الثاني عشر، متخلفًا عن GPT-5.5 من الجيل السابق وبفارق كبير عن Kimi K3 وClaude Opus 5 (SCMP). وقد رصدت اختبارات Vals AI الخاصة نقطتي ضعف ملموستين: إنجاز المهام داخل بيئة طرفية معزولة، وبناء نماذج مالية معقدة في جداول بيانات Excel.

Vibe Code Bench v1.1 — 49.93 (Vals AI، التشغيل المستقل الوحيد "Benchmark exact" في المجموعة).

السجل الصادق — ما تمت إعادة إنتاجه مقابل ما لا يزال مجرد كلام من DeepSeek

هذا هو القسم الذي تهدف مقالة المعيار إلى توفيره، والسبب لوضع إشارة مرجعية على هذه الصفحة بدلاً من تغطية الإطلاق. قسّم كل نتيجة إلى واحدة من مجموعتين:

مصدر مستقل:مؤشر AA Intelligence 53 / 53.2، وAA Coding 68.8، وترتيب Vals AI 12، وVibe Code Bench 49.93 — وتشغيل من مصدر مستقل آخر لـ Terminal-Bench 2.1 بقيمة 78.7 يقع بجانب 87.9 الخاصة بـ DeepSeek على صفحة نموذج OrcaRouter. تلك الفجوة البالغة تسع نقاط بين رقم المورّد والتشغيل المستقل هي أهم معلومة في هذه الصفحة: إنها فجوة إعادة الإنتاج، مُحدّدة كميًا.

مُبلَّغ عنها من البائع فقط، لم يتم إعادة إنتاجها بشكل مستقل: كل رقم في البطاقة الرسمية 0813 أعلاه (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) ومجموعة البرمجة الموسعة بأكملها (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). وتصف وثائق DeepSeek الخاصة رقم Terminal-Bench 2.1 بأنه "تشغيل من المزوّد".

عند قراءته بهذا الشكل، تكون القصة متسقة: DeepSeek V4 Pro هو نموذج حدودي حقيقي في منتصف الترتيب — بدرجة AA 53، وترتيب يقع بين المرتبة 13 والمرتبة 29 — مع بطاقة تقييم من البائع تدّعي أداءً قريبًا من الأفضل في المهام الوكيلية والبرمجة. كلتا العبارتين صحيحتان، ولا يوجد تعارض بينهما؛ إحداهما مُقاسة والأخرى مُدّعاة.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

ما هي تكلفة بطاقة الأداء؟

DeepSeek V4 Pro هو النموذج الرئيسي MoE بإجمالي 1.6T / 49B نشط، مع نافذة سياق 1M رمزًا وحد أقصى للإخراج 384K. على OrcaRouter يُسعَّر بسعر DeepSeek المعلن مع عدم وجود أي زيادة: $0.435 لكل مليون رمز إدخال و$0.87 لكل مليون رمز إخراج (قراءة الكاش $0.060 لكل مليون)، وفقًا للدليل الذي تم فحصه في 15 أغسطس 2026 وتأكيده على صفحة النموذج الحيَة. بهذا السعر، تكون حسابات السعر لكل نقطة أقوى حجة لصالح النموذج: فهو تقريبًا عُشر سعر إخراج النماذج التي تحقق نتائج قريبة منه في المؤشر المستقل، لذلك فأنت تدفع أسعارًا متوسطة مقابل لوحة نتائج تكون، إذا صحت ادعاءات البائع، قريبة من القمة. ملاحظة واحدة: أعلنت DeepSeek عن جدول تسعير للفترات الذروة/خارج الذروة (خارج الذروة بنسبة 50% من الذروة) اعتبارًا من 17 أغسطس بتوقيت بكين، لذا قد يتغير السعر — الأرقام هنا هي السعر المعلن الحالي وقت كتابة هذا المقال.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

عندما تكون هذه التوصية خاطئة

الحالات التي يجب فيها ألا يكون DeepSeek V4 Pro اختيارك:

تحتاج إلى استدلال متقدم مؤكد بشكل مستقل.مؤشر AA Index 53 في منتصف المجموعة — Kimi K3 (60) وGPT-5.6 Terra (57) متقدمان ومتحقق منهما. إذا كان قرارك يعتمد على السقف المُقاس، فإن بطاقة البائع لا تغيّره.

أنت تراهن على الإنتاج بناءً على DeepSWE 62.7 قبل أن يكرر أحدهم الاختبار. قفزة من 12.8 إلى 62.7 في إصدار واحد هي ادعاء، وليست حقيقة. انتظر إعادة إنتاج محايدة — الفجوة بين 87.9 و78.7 في Terminal-Bench تُظهر ما قد يكتشفه المرء.

عبء عملك هو أتمتة طرفية معزولة أو نمذجة مالية في Excel.يقول Vals AI إن هذه هي بالضبط المجالات التي يواجه فيها النموذج صعوبة، بغض النظر عن أي تقييم من المورد.

أنت تتخذ قرارًا في مجال الأمن السيبراني بشأن CyberGym 83.3. هذا اختبار من DeepSeek لنموذجها الخاص على معيارها الخاص — أي بائع أمن يشتري بناءً على هذا الرقم يشتري بيانات غير مدققة.

خلاصة القول

DeepSeek V4 Pro 0813 هو نموذج حقيقي في طليعة النماذج؛ إذ تتفوق بطاقة أداء المورّد الخاصة به على سجله المستقل. حوّل إصدار 0813 المعاينة النصية إلى منافسٍ جادٍ في فئة الوكلاء — وقد غطّينا الإصدار نفسه بشكل منفصل — وإذا أردت تقييمه اليوم، فهو مفتاح واحد متوافق مع OpenAI على OrcaRouter بالسعر الرسمي لـ DeepSeek، مع تحويل تلقائي عند تعطّل المزود. عليك فقط قراءة بطاقة الأداء بالطريقة التي تقسّمها بها هذه المقالة: الفحوصات المستقلة (AA 53، وVals في المرتبة 12، وتشغيل Terminal-Bench بنتيجة 78.7) هي ما يمكنك الوثوق به اليوم؛ أما نتائج 87.9 و62.7 فهي ما يجب التحقق منه قبل البناء عليها. اشترِه من أجل نسبة السعر إلى الأداء وسياق المليون رمز، وليس من أجل الأرقام الرئيسية غير المعاد إنتاجها.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube