بطاقة العنوان الرئيسية: اختبارات DeepSeek V4.1 Flash القياسية — ما الذي يثبته 74.2 وما لا يثبته، بتاريخ إصدار 2026-09-10 مع ملاحظة نصها: ستة أيام من النتائج المستقلة.
Guides & Insights

مقاييس أداء DeepSeek V4.1 Flash: ما الذي يثبته 74.2 وما الذي لا يثبته

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

حصل DeepSeek V4.1 Flash على 74.2 في DeepSWE v1.1، وهو أعلى بعُشر نقطة من GPT-6 Astra، ونصف نقطة من Gemini 3.8 Flash وClaude Opus 5، وقد جرى الاقتباس من هذا الرقم طوال الأسبوع باعتباره تبدّلًا في الحراسة. يجدر بنا أن نكون دقيقين بشأن ما هو عليه فعليًا. النموذج نفسه ليس جديدًا — فقد أصبح DeepSeek V4.1 Flash متاحًا للعموم في 2026-09-10، أي قبل ستة أيام — لذا لا شيء هنا يُعدّ إطلاقًا. ما وقع داخل تلك النافذة هو طبقة القياس: أول إدخالات فهرس مستقلة، وأول نتيجة ساحة مستقلة، ودعم تقديم من اليوم الأول عبر ثلاث حزم، وقرار بائع بإحالة رايته الخاصة إلى التقاعد لصالح هذا النموذج. هذه الصفحة تجميع لما جرى قياسه فعليًا، مع تسمية المصدر لكل رقم، وبيان صريح لما لم يثبته أحد بعد.

رقم DeepSWE، والنماذج الأربعة الواقعة ضمن نصف نقطة منه

DeepSWE v1.1 هو معيار مرجعي لهندسة البرمجيات طويلة الأفق من Datacurve — 113 مهمة أصلية عبر 91 مستودعًا مفتوح المصدر وخمس لغات برمجة، مبنيّ حول تغييرات متعددة الملفات والصحة السلوكية. على بطاقة نموذج DeepSeek الخاصة، يقرأ الجدول المُبلَّغ عنه من المورّد: DeepSeek V4.1 Flash 74.2، وClaude Opus 5 74.0، وGPT-5.6 Sol 73.0، وKimi K3 67.5، وGLM-5.3 66.9، وDeepSeek V4-Pro-0813 62.7، وDeepSeek V4-Flash 54.4.

لا تُعيد لوحة الصدارة المستقلة للمقياس نفسه إنتاج ذلك الترتيب، والفروق أهم من العنوان الرئيسي. تضع لوحة صدارة DeepSWE v1.1 Pass@1 الخاصة بـ Datacurve Muse Spark 1.3 (FAIR) في المركز الأول عند 75.40، متقدمةً على DeepSeek V4.1 Flash عند 74.20. وخلفها: GPT-6 Astra عند 74.12 (مرتفع للغاية) و74.10 (الأقصى)، وGemini 3.8 Flash عند 73.83 (مرتفع)، وClaude Opus 5 عند 73.65 (الأقصى).

إذن، فإن 74.2 مُدخل حقيقي في لوحة صدارة حقيقية تابعة لطرف ثالث، وهو في المرتبة الثانية، لا الأولى. الادعاء الذي انتشر يوم الإصدار — بأن هذا هو أحدث ما توصلت إليه التقنية على DeepSWE — لا يصمد أمام لوحة الصدارة التي تحمل النتيجة. ويتقدم Muse Spark 1.3 بفارق 1.2 نقطة.

الآن الجزء الذي يتم تجاهله. أربعة نماذج حدودية تقع ضمن مسافة 0.55 نقطة من بعضها البعض في هذا المعيار: 74.20، و74.12، و73.83، و73.65. وهذا نطاق أضيق من ضوضاء القياس. التباين المنشور من تشغيل إلى آخر على DeepSWE يتراوح في حدود 1.4 إلى 3.2 نقطة — أي ثلاثة إلى ستة أضعاف حجم الفارق الكامل بين الأربعة الأوائل. إن تفوقًا بمقدار 0.2 نقطة على GPT-6 Astra ليس اكتشافًا؛ إنه ما يبدو عليه التعادل عندما تطبعه بمنزلتين عشريتين.

حساسية السقالة هي السبب الثاني للتعامل مع الرقم بحذر، وهنا تقدّم وثائق المورّد نفسه الدليل. يذكر DeepSeek نتائج DeepSWE عبر ثماني سقالات في مواد الإصدار نفسها. تحقق الرقم 74.2 على mini-SWE. وسجّل النموذج نفسه 72.6 على DSH Minimal، و70.5 على DSH Standard، و69.8 على Claude Code، و67.6 على DSH PTC، و66.2 على Pi، و65.6 على Codex، و65.5 على OpenCode. هذا فارق مقداره 8.7 نقطة على نموذج واحد ومعيار واحد، مدفوعًا بالكامل بأداة الربط المحيطة به. أي شخص يقارن رقم DeepSeek الناتج على mini-SWE برقم منافس ناتج على حلقة وكيل مختلفة فإنه يقارن سقالات، لا نماذج.

حيث يضعه المؤشر المستقل فعليًا

يُجري Artificial Analysis مجموعة اختبارات ثابتة عند إعدادات جهد مُعلنة، ما يجعل مؤشره Intelligence Index أنظف فحص خارجي متاح. في صفحة نموذج DeepSeek V4.1 Flash، عند أقصى جهد للاستدلال، يبلغ المؤشر 40 — في المرتبة #6 من 113 نموذجًا في تلك الفئة، مقابل وسيط الفئة البالغ 18. المنافسون المغلقون يعلونه: Claude Opus 5 (max) 51، GPT-5.6 Sol (max) 47، GLM-5.3 (max) 45، Kimi K3 (max) 44، Gemini 3.8 Flash (high) 41. النموذج الرائد السابق لـ DeepSeek نفسه، V4-Pro-0813، يقع أدناه عند 36.

اقرأ لوحتي النتائج جنبًا إلى جنب، فسيظهر أن الاختلاف بنيوي، لا خطأ. على المعيار الذي اختارته DeepSeek، وعند البنية المساندة الصحيحة، يضاهي النموذج الطليعة. أما على مجموعة خارجية ثابتة بمتوسط يشمل الاستدلال والبرمجة والرياضيات والعمل الوكيلي، فهو متأخر بإحدى عشرة نقطة عن Claude Opus 5 ونقطة واحدة عن Gemini 3.8 Flash. يمكن أن يكون كلا الأمرين صحيحًا. جدول المورّد حجة؛ والمؤشر متوسط.

تحمل صفحة المؤشر أيضًا رقمين يهمان لقرار التوجيه ونادرًا ما يتصدران العناوين. يعمل DeepSeek V4.1 Flash عند 214.4 توكن إخراج في الثانية بأقصى جهد — سريع. كما ولّد 250 مليون توكن إخراج لإكمال Intelligence Index، مقابل وسيط قدره 140 مليون، وهو ما تضع عليه Artificial Analysis علامة إسهاب ملحوظ. الإسهاب ليس مشكلة جودة؛ إنه فاتورة. النموذج الذي يفكر بعدد توكنات يزيد 79% عن أقرانه يعيد جزءًا من ميزته السعرية في كل استدعاء استدلال طويل.

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: درجة النموذج الواحد ودرجة الوكلاء المتعددين ليستا القياس نفسه

هذا هو الرقم الأكثر عرضة للقراءة الخاطئة، لذا يجدر فصله بعناية.

• نموذج واحد، تكوين قياسي — يسجل DeepSeek V4.1 Flash 20.3 على ProgramBench (Almost@1)، وفقًا لبطاقة نموذج DeepSeek الخاصة. وهذا أقل من GPT-5.6 Sol عند 23.0 وأقل بكثير من Claude Opus 5 عند 37.0، وأعلى قليلاً فقط من GLM-5.3 عند 19.0 وKimi K3 عند 17.5. مُبلَّغ عنه من البائع، وهو لا يجمّل النموذج.

• تكوين فريق متعدد الوكلاء — التقرير التقني لـ DeepSeek، DeepSeek-V4.1-Flash: تجاوز حدود ضغط ذاكرة KV المؤقتة، يصف وصفة أولية للتعلم المعزز بسرب الوكلاء Agent Swarm RL حيث ينسق وكيل رئيسي بين أعضاء الفريق عبر لوحة مهام مشتركة. على مجموعة فرعية عالية الثقة من ProgramBench مكوّنة من 172 مهمة — مهام ينجح فيها الحل المرجعي بنسبة 95% أو أفضل — يرتفع تكوين الوكلاء المتعددين من 13.59% عند مهلة ساعة واحدة إلى ذروة 30.04% عند ثماني ساعات، بينما ينتقل خط الأساس أحادي الوكيل من 12.79% إلى 20.39%.

30.04% هو مصدر الادعاء «30%»، وهو ليس نتيجة نموذج واحد. إنه فريق من الوكلاء مُنح ثماني ساعات، وقيس على مجموعة فرعية مُرشَّحة، في التقييم الأولي الخاص بالبائع. والمقارنة التي يدعو إليها — «أعلى بكثير من Sol المنفرد، وقرابة ضعف Kimi K3» — منصفة حسابياً مقابل 23.0 لـ Sol و17.5 لـ K3، وهي أيضاً مقارنة بين إعداد متعدد الوكلاء وخطوط أساس أحادية النموذج على مجموعة مهام مختلفة. ويُظهر التقرير نفسه الأثر على FrontierSWE v2: وصول متعدد الوكلاء إلى 32.90% عند عشرين ساعة مقابل 28.20% لوكيل منفرد. الفجوة حقيقية، وهي تضيق مع تمديد الموعد النهائي، وتكلفة الرموز للحصول عليها ليست صغيرة — إذ يفيد أحد التقارير العملية عن أكثر من 10 أضعاف الرموز وأزمنة تشغيل تقترب من أربع ساعات.

عدد المعلمات لم يُحسم بعد، لذا اعتبر كل مقارنة بين الأحجام مؤقتة.

تصف ملاحظات إصدار DeepSeek نموذج "MoE بمعلمات 552B". هذا هو الرقم الذي أعلنته الشركة المطوّرة، وهو ما تكرره معظم التغطيات. كما أنه ليس الأرتيفاكت بأكمله.

توثّق بطاقة النموذج الخاصة بـ DeepSeek نفسها مكوّنًا ثانيًا إلى جانب العمود الفقري للمحوّل: "ذاكرة Engram الشرطية (196 مليار معامل، يتم الوصول إليها بشكل متفرق عبر بحث قائم على التوكنات)." اجمع الاثنين فتحصل على 748 مليار. تلك هي الحسابات الكامنة وراء التفسير المجتمعي الذي انتشر على r/LocalLLaMA في غضون ساعات من الإصدار، كما يسرد فهرس safetensors الخاص ببطاقة النموذج نفسها 763 مليار معامل عبر أنواع التنسورات الخاصة به. رقم نحو 510 غيغابايت الخاص بـ FP8 يأتي من السلسلة نفسها من التحليل: ما تنزّله فعليًا وتحتفظ به في الذاكرة.

التوفيق بينها هو أن هذه الأرقام تُحصي أشياء مختلفة. 552B هو العمود الفقري الحوسبي — المعاملات التي يمر عبرها التوكن. 196B هو جدول بحث يُستشار في طبقات محددة فيعيد معلومات مخزّنة بدلاً من إجراء حسابات عليها. أما 8B و16B، وهما رقما التنشيط اللذان تذكرهما DeepSeek، فهما الشرائح لكل توكن النشطة أثناء التعبئة المسبقة وفك التشفير على التوالي. جميع الأرقام الأربعة تصف النموذج نفسه.

لا شيء من ذلك يجعل المقارنة آمنة. كل ادعاء من الصيغة «هذا النموذج يضاهي نموذجًا رائدًا بجزء يسير من الحجم» يستند إلى عنوان من مورّد يستبعد خُمس المُخرَج. وإلى أن ينشر أحدهم حصرًا للمعاملات قابلًا لإعادة الإنتاج، ينبغي أن تحمل الحجج القائمة على الحجم التحفظ في متنها.

ARC-AGI: لا توجد نتيجة لهذا النموذج

لا توجد نتيجة ARC-AGI-2 أو ARC-AGI-1 لـ DeepSeek V4.1 Flash. لا تتضمن صفحة النتائج الموثّقة الخاصة بـ ARC Prize أي إدخال لهذه النسخة، كما لا يحتوي جدول المعايير الخاص بـ DeepSeek نفسه على أي صف لـ ARC. النتيجة الوحيدة الموثّقة من ARC Prize لـ DeepSeek هي الخاصة بنسخة V4 Flash 0731 الأقدم — 61.4% على ARC-AGI-2 semi-private بأقصى جهد استدلالي و89.0% على ARC-AGI-1، بتكلفة $0.04 و$0.02 لكل مهمة على التوالي. تلك أرقام النموذج السابق على نموذج مختلف، والاستشهاد بها كنتائج لـ V4.1 Flash سيكون خطأً. إذا كان ARC-AGI يهمّ تقييمك، فهذا النموذج غير مُقيَّم حاليًا.

ما الذي هبط أيضًا داخل النافذة؟

تغيّرت ثلاثة أمور بالنسبة للقارئ الذي يقرر ما إذا كان سيجرّب هذا النموذج، وليس أي منها الإصدار الخاص بالنموذج نفسه.

• نتيجة ساحة مستقلة. شغّلت OpenDesign Arena ثلاثة عشر نموذجًا عبر مهام تصميم متطابقة — تطبيقات ويب، ولوحات معلومات، وشاشات جوال، وصفحات هبوط. حصل DeepSeek V4.1 Flash على 81.2 من 100 مقابل 82.7 لـ GPT-6 Astra، بتكلفة $0.023 لكل تصميم منجز مقابل $1.61، وأنهى في 5.3 دقائق مقابل 11.1. كان معدل التسليم — المخرجات القابلة للاستخدام دون مراجعة — 57.7% مقابل 60% لـ Astra. هذا أحد أول القياسات المستقلة حقًا لهذا النموذج، وهو يقيس مخرجات التصميم تحديدًا، وليس الاستدلال العام أو البرمجة.

• دعم الخدمة من اليوم الأول على ثلاث منصات. نشرت vLLM صورة من اليوم الأول (2026-09-09) تم التحقق من صحتها على عتاد NVIDIA وAMD. نشرت SGLang وMiles دعم الاستدلال والتعلم المعزز من اليوم الأول في 2026-09-10، بما في ذلك مسار Engram للتفريغ إلى المضيف الذي رفع سعة ذاكرة KV المؤقتة بنسبة 36% على 4x GB300، وتحسين إعادة التشغيل المحدود الذي رفع إنتاجية التعبئة المسبقة بمقدار 1.56x على 8x H200. أعلنت Cambricon عن تكييف من اليوم الأول على منصة vLLM في اليوم نفسه. وبالنسبة إلى نموذج تقوم ميزته البيعية على ضغط مكثف لذاكرة KV المؤقتة — ربع بصمة الجيل السابق في HBM، وثُمن بصمته في SSD — فإن إمكانية تشغيله على منصات قياسية من اليوم الأول هي الفرق بين نتيجة مخبرية وشيء يمكنك نشره.

• أحالت الشركة المورّدة طرازها الرائد الخاص إلى التقاعد.تتخلص DeepSeek تدريجياً من V4-Pro. اعتباراً من الساعة 04:00 بالتوقيت العالمي المنسق في 2026-09-14، يُوجَّه أي طلب يذكر “deepseek-v4-pro” إلى V4.1 Flash ويُحتسب بسعر Flash، ويستمر ذلك حتى إطلاق V4.1 Pro. إن DeepSeek V4.1 Pro لم يُطلق بعد — فهو طراز مستقبلي، وإعادة التوجيه هذه حل مؤقت يمنع تعطل التكاملات المثبّتة. كذلك أُحيل إلى التقاعد: “deepseek-v4-flash” و“deepseek-v4-flash-vision-exp”، وكلاهما يُوجَّه مؤقتاً إلى V4.1 Flash لأغراض التوافق. إذا كان لديك معرّف طراز مثبّت في بيئة الإنتاج، فإن إعادة التوجيه هذه هي الحقيقة التشغيلية الوحيدة في هذه الصفحة التي لا يمكنك تجاهلها.

ما يفعله السعر بالقرار

التسعير هو النقطة التي يتوقف عندها هذا النموذج عن كونه مجرد حديث عن معايير الأداء. ووفقًا للأسعار المنشورة من DeepSeek نفسها، اعتبارًا من 04:00 UTC بتاريخ 2026-09-10، مع تعريف ساعات الذروة على أنها 01:00–04:00 و06:00–10:00 UTC في أيام الأسبوع، وكل ما عدا ذلك خارج ساعات الذروة.

• خارج أوقات الذروة، لكل مليون رمز — 0.003 دولار عند إصابة الذاكرة المؤقتة، و0.15 دولار عند إخفاقها، و0.60 دولار للمخرجات.

• الذروة، لكل مليون رمز — 0.006 دولار عند إصابة الذاكرة المؤقتة، و0.30 دولار عند عدم إصابتها، و1.20 دولار للإخراج.

• الإدخال المخزَّن مؤقتًا، مقارنةً بنموذج مغلق متقدم — ثلاثة أعشار سنت لكل مليون مقابل نحو خمسين سنتًا. بالنسبة لوكيل يكرر المرور على المستودع نفسه، تحمل تلك الفئة معظم الرموز.

• مقيس على الكتالوج الخاص بنا — 0.15 دولارًا للإدخال و0.60 دولارًا للإخراج لكل مليون، و784 مللي ثانية متوسط الزمن حتى أول رمز، و211 رمزًا في الثانية خلال الأيام السبعة الماضية.

تُدرج Artificial Analysis النموذج نفسه بسعر 0.30 دولار للإدخال و1.20 دولار للإخراج، مع خصم على الذاكرة المؤقتة بنسبة 98%، وسعر مدمج قدره 0.18 دولار لكل مليون — وهذه هي شريحة الذروة، والرقمان هما السعر نفسه في ساعات مختلفة من اليوم. يجدر استيعاب هذا التمييز قبل مقارنة الموردين: النموذج ذو التسعير الزمني على مستويين لا يمكن مقارنته بسعر معلن واحد.

ولهذا السبب أيضًا يكون التسعير التمريري أكثر أهمية من المعتاد هنا. OrcaRouter يوجّه DeepSeek V4.1 Flash إلى جانب بقية كتالوجه عند هامش ربح 0% — سعر قائمة المزوّد، دون تغيير، لذا تصل فئتا الذروة وخارج الذروة لدى DeepSeek إلى جانبنا تمامًا كما تنشرهما DeepSeek، ويصبح أي تغيير في سعر المورّد فعّالًا في اليوم نفسه. في نموذج يتضاعف سعره لمدة أربع ساعات كل صباح من أيام الأسبوع، فإن منصة تُسطّح الفئات تخفي الرقم الوحيد الذي كنت تحتاجه.

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

ما لم يثبته أحد

الفجوة في هذه القصة ليست معيارًا مفقودًا. بل هي أنه لا توجد مواجهة مباشرة موثوقة بين DeepSeek V4.1 Flash ومنافسيها المذكورين على أداة اختبار مشتركة، أجراها شخص ليس لديه مصلحة في النتيجة. كل رقم في هذه الصفحة هو واحد من ثلاثة أشياء: مُبلَّغ عنه من البائع، أو أنتجه طرف ثالث على تكوين مختلف، أو متوسط عبر مجموعة اختبارات ثابتة لم تُصمم لعزل هذه المواجهة. لا توجد أي تجربة تم فيها تقييم DeepSeek V4.1 Flash وGPT-6 Astra على نفس المهام، ونفس الهيكل، ونفس إعداد الجهد، ونُشرت مع تباين.

ثلاثة أشياء محددة ستغيّر الصورة، ولا يوجد أي منها اليوم.

• مقارنة DeepSWE الخاضعة للتحكم بالهيكل التجريبي. إن الفارق البالغ 8.7 نقاط عبر هياكل DeepSeek التجريبية الخاصة أكبر من أي فجوة بين أفضل أربعة نماذج على لوحة الصدارة. وإلى أن يُقاس الحدّ الأقصى على منصة اختبار واحدة، فإن الترتيب في صدارة ذلك الجدول لا يحمل معنى يُعتد به.

• إعادة إنتاج مستقلة لنتيجة فريق وكلاء ProgramBench. تأتي نسبة 30.04% من التقرير التقني الخاص بالمورّد حول مجموعة فرعية مُرشَّحة مكوَّنة من 172 مهمة، في إعداد أولي، مع تكلفة رموز لم تُوصَّف لميزانيات الإنتاج.

• ARC-AGI. لا توجد أي نتيجة لنقطة التحقق هذه على الإطلاق.

النتيجة العملية هي ادعاء أضيق مما تدعمه العناوين الرئيسية. إن DeepSeek V4.1 Flash يقع بشكل قابل للقياس ضمن هامش الضوضاء عن الطليعة في أحد معايير البرمجة ذات الأفق الطويل، ومنافس حقًا في مهام التصميم المستقلة بنحو 1.4% من التكلفة، ومتخلف بنحو عشر نقاط في مؤشر إجمالي. هذا كافٍ لتبرير تشغيله على عبء العمل الخاص بك وترك تقييمك يحسم المسألة. لكنه ليس كافيًا لتبرير إعادة كتابة جدول توجيه الإنتاج بناءً على 0.2 نقطة — وكون كلتا العبارتين صحيحتين هو الاكتشاف بأكمله.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا