
معايير DeepSeek V4 Pro: بطاقة الأداء الكاملة لـ0813، وكل فحص مستقل، وما لم يتحقق منه أحد بعد
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
الإجابة في سطر واحد: يحقق DeepSeek V4 Pro أداءً وكيليًا قويًا حقًا وفقًا لأرقام DeepSeek الخاصة — Terminal-Bench 2.1 عند 87.9، وDeepSWE عند 62.7، وCyberGym عند 83.3 — لكن كل رقم بارز تقريبًا مُعلَن من قِبل الشركة المطوّرة، والصورة المستقلة أكثر برودة. يضع Artificial Analysis الإصدار الرسمي 0813 عند 53 على Intelligence Index الخاص به، معادلًا لـ GLM-5.2، متأخرًا بأربع نقاط عن GPT-5.6 Terra وبسبع نقاط عن Kimi K3؛ ويصنّفه Vals AI في المرتبة 12، أدنى من GPT-5.5 من الجيل السابق. هذه المقالة هي التجميع الكامل الذي لم يكتبه أي شخص آخر: بطاقة أداء 0813 الكاملة، ومجموعة البرمجة الموسعة من التقرير الفني، وكل فحص مستقل موجود، وسجل أمين بالأرقام التي أُعيد إنتاجها وتلك التي لا تزال كلمة DeepSeek وحدها.
بطاقة النتائج الرسمية 0813 — أرقام DeepSeek الخاصة، كلها
يذكر الإعلان الرسمي لـ DeepSeek ({{1}}توثيق API، الأخبار260813، 13 أغسطس 2026{{/1}}) أن الإصدار الإنتاجي مبني على المعاينة الصادرة في أبريل. جميع الأرقام في هذا القسم مُعلنة من قِبل البائع — لم يتم التحقق منها بشكل مستقل حتى 16 أغسطس 2026: يرجى الملاحظة.
• Terminal-Bench 2.1 — 87.9 (المعاينة: 72.1).
• DeepSWE — 62.7 (المعاينة: 12.8) — قفزة بنحو 5 أضعاف، وهي الادعاء الأكثر لفتًا للانتباه على البطاقة.
• CyberGym — 83.3 (المعاينة: 52.7).
• Humanity's Last Exam — 42.7 بدون أدوات، 60.0 مع الأدوات (معاينة: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (معاينة: 55.9).
• AutomationBench (عام) — 31.8 (معاينة: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (معاينة: 41.8 / 31.1).
• NL2Repo — 61.5 (المعاينة: 38.5).
• Agents' Last Exam — 25.7 (المعاينة: 16.5).
النمط الذي يجب ملاحظته هو أين تتركز المكاسب: معايير الوكلاء والأمن السيبراني. هذا بالضبط نوع بطاقة الأداء التي يُنتجها مختبر عندما يريد الترويج لنموذج وكيل — وهو بالضبط النوع الذي يحتاج إلى إعادة تشغيل محايدة قبل أن تنفق أموال الإنتاج عليه.

مجموعة الترميز الموسعة من التقرير الفني لـ DeepSeek
إلى جانب بطاقة الوكيل، يضيف التقرير الفني لـ DeepSeek (كما جمعته BenchLM في 16 أغسطس 2026) مجموعة أوسع للبرمجة والسياق الطويل. كما أنه مُبلَّغ من قِبل البائع، وموسوم بـ"مزود دقيق" من قبل BenchLM — دون اختبار مستقل:
• SWE-bench Verified — 80.6%؛ SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — الأفضل الموثّق في كتالوج BenchLM.
• تقييم Codeforces — 3206 — وهو أيضًا الأفضل توثيقًا في الكتالوج.
• BrowseComp — 83.4%؛ Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%؛ CorpusQA 1M — 62.0% — وكلاهما الأفضل ضمن السجل لاسترجاع 1M رمزًا، وهو أمر مهم لنموذج يعلن عن نافذة سياق تبلغ 1M رمزًا.
• GPQA Diamond — 92.8، وSciCode — 49.2، وLong-Context Recall — 75.3 (كما هو مدرج في صفحة نموذج OrcaRouter).
ما الذي يقيسه المقيّمون المستقلون فعليًا
ثلاثة مصادر مستقلة قامت بتشغيل DeepSeek V4 Pro، وتركزت تقييماتها دون بطاقة البائع:
• Artificial Analysis Intelligence Index — 53 (تقرير SCMP، أغسطس 2026؛ صفحة نموذج OrcaRouter تُظهر 53.2، مرتبة 20 من 132). على قدم المساواة مع GLM-5.2، بأربع نقاط خلف GPT-5.6 Terra، وسبع نقاط خلف Kimi K3.
• Artificial Analysis Coding — 68.8، مصنّفة في المرتبة 24 من أصل 130 (وفقًا لصفحة نموذج OrcaRouter).
• Vals AI Index — الثاني عشر، متخلفًا عن GPT-5.5 من الجيل السابق وبفارق كبير عن Kimi K3 وClaude Opus 5 (SCMP). وقد رصدت اختبارات Vals AI الخاصة نقطتي ضعف ملموستين: إنجاز المهام داخل بيئة طرفية معزولة، وبناء نماذج مالية معقدة في جداول بيانات Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI، التشغيل المستقل الوحيد "Benchmark exact" في المجموعة).
السجل الصادق — ما تمت إعادة إنتاجه مقابل ما لا يزال مجرد كلام من DeepSeek
هذا هو القسم الذي تهدف مقالة المعيار إلى توفيره، والسبب لوضع إشارة مرجعية على هذه الصفحة بدلاً من تغطية الإطلاق. قسّم كل نتيجة إلى واحدة من مجموعتين:
• مصدر مستقل:مؤشر AA Intelligence 53 / 53.2، وAA Coding 68.8، وترتيب Vals AI 12، وVibe Code Bench 49.93 — وتشغيل من مصدر مستقل آخر لـ Terminal-Bench 2.1 بقيمة 78.7 يقع بجانب 87.9 الخاصة بـ DeepSeek على صفحة نموذج OrcaRouter. تلك الفجوة البالغة تسع نقاط بين رقم المورّد والتشغيل المستقل هي أهم معلومة في هذه الصفحة: إنها فجوة إعادة الإنتاج، مُحدّدة كميًا.
• مُبلَّغ عنها من البائع فقط، لم يتم إعادة إنتاجها بشكل مستقل: كل رقم في البطاقة الرسمية 0813 أعلاه (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) ومجموعة البرمجة الموسعة بأكملها (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). وتصف وثائق DeepSeek الخاصة رقم Terminal-Bench 2.1 بأنه "تشغيل من المزوّد".
عند قراءته بهذا الشكل، تكون القصة متسقة: DeepSeek V4 Pro هو نموذج حدودي حقيقي في منتصف الترتيب — بدرجة AA 53، وترتيب يقع بين المرتبة 13 والمرتبة 29 — مع بطاقة تقييم من البائع تدّعي أداءً قريبًا من الأفضل في المهام الوكيلية والبرمجة. كلتا العبارتين صحيحتان، ولا يوجد تعارض بينهما؛ إحداهما مُقاسة والأخرى مُدّعاة.

ما هي تكلفة بطاقة الأداء؟
DeepSeek V4 Pro هو النموذج الرئيسي MoE بإجمالي 1.6T / 49B نشط، مع نافذة سياق 1M رمزًا وحد أقصى للإخراج 384K. على OrcaRouter يُسعَّر بسعر DeepSeek المعلن مع عدم وجود أي زيادة: $0.435 لكل مليون رمز إدخال و$0.87 لكل مليون رمز إخراج (قراءة الكاش $0.060 لكل مليون)، وفقًا للدليل الذي تم فحصه في 15 أغسطس 2026 وتأكيده على صفحة النموذج الحيَة. بهذا السعر، تكون حسابات السعر لكل نقطة أقوى حجة لصالح النموذج: فهو تقريبًا عُشر سعر إخراج النماذج التي تحقق نتائج قريبة منه في المؤشر المستقل، لذلك فأنت تدفع أسعارًا متوسطة مقابل لوحة نتائج تكون، إذا صحت ادعاءات البائع، قريبة من القمة. ملاحظة واحدة: أعلنت DeepSeek عن جدول تسعير للفترات الذروة/خارج الذروة (خارج الذروة بنسبة 50% من الذروة) اعتبارًا من 17 أغسطس بتوقيت بكين، لذا قد يتغير السعر — الأرقام هنا هي السعر المعلن الحالي وقت كتابة هذا المقال.

عندما تكون هذه التوصية خاطئة
الحالات التي يجب فيها ألا يكون DeepSeek V4 Pro اختيارك:
• تحتاج إلى استدلال متقدم مؤكد بشكل مستقل.مؤشر AA Index 53 في منتصف المجموعة — Kimi K3 (60) وGPT-5.6 Terra (57) متقدمان ومتحقق منهما. إذا كان قرارك يعتمد على السقف المُقاس، فإن بطاقة البائع لا تغيّره.
• أنت تراهن على الإنتاج بناءً على DeepSWE 62.7 قبل أن يكرر أحدهم الاختبار. قفزة من 12.8 إلى 62.7 في إصدار واحد هي ادعاء، وليست حقيقة. انتظر إعادة إنتاج محايدة — الفجوة بين 87.9 و78.7 في Terminal-Bench تُظهر ما قد يكتشفه المرء.
• عبء عملك هو أتمتة طرفية معزولة أو نمذجة مالية في Excel.يقول Vals AI إن هذه هي بالضبط المجالات التي يواجه فيها النموذج صعوبة، بغض النظر عن أي تقييم من المورد.
• أنت تتخذ قرارًا في مجال الأمن السيبراني بشأن CyberGym 83.3. هذا اختبار من DeepSeek لنموذجها الخاص على معيارها الخاص — أي بائع أمن يشتري بناءً على هذا الرقم يشتري بيانات غير مدققة.
خلاصة القول
DeepSeek V4 Pro 0813 هو نموذج حقيقي في طليعة النماذج؛ إذ تتفوق بطاقة أداء المورّد الخاصة به على سجله المستقل. حوّل إصدار 0813 المعاينة النصية إلى منافسٍ جادٍ في فئة الوكلاء — وقد غطّينا الإصدار نفسه بشكل منفصل — وإذا أردت تقييمه اليوم، فهو مفتاح واحد متوافق مع OpenAI على OrcaRouter بالسعر الرسمي لـ DeepSeek، مع تحويل تلقائي عند تعطّل المزود. عليك فقط قراءة بطاقة الأداء بالطريقة التي تقسّمها بها هذه المقالة: الفحوصات المستقلة (AA 53، وVals في المرتبة 12، وتشغيل Terminal-Bench بنتيجة 78.7) هي ما يمكنك الوثوق به اليوم؛ أما نتائج 87.9 و62.7 فهي ما يجب التحقق منه قبل البناء عليها. اشترِه من أجل نسبة السعر إلى الأداء وسياق المليون رمز، وليس من أجل الأرقام الرئيسية غير المعاد إنتاجها.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
