بطاقة عنوان رئيسية لـ DeepSeek-V4-Flash-Vision-Exp مع عنوان فرعي 'نفس سعر V4-Flash، الآن مع عيون'، وأيقونة خطية لعين وعلامة سعر، وشارة صغيرة مستديرة مكتوب عليها 'تجريبي • API • 2026-08-21'، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) يُطلق على API: بنفس سعر V4-Flash، الآن بعيون

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصبح نموذج DeepSeek V4 Flash Vision (Exp) متاحًا على منصة Deep​Seek API اليوم، 21 أغسطس 2026، والرقم الأهم في الإعلان ليس معيارًا — بل هو السعر: هذا النموذج التجريبي للرؤية يُحتسب بنفس معدلات الرموز تمامًا مثل DeepSeek V4 Flash، النموذج النصي فقط الذي يضاهي قدرته النصية الخالصة تمامًا. وهذا يجعلها المرة الأولى التي تقبل فيها منصة Deep​Seek الخاصة بالـ API الصور على الإطلاق، ويعني أن أرخص طريقة لتشغيل وكيل بسياق مليون رمز أصبحت متعددة الوسائط مجانًا.

ما الذي تم شحنه فعليًا

DeepSeek V4 Flash Vision (Exp) هو نموذج متعدد الوسائط تجريبي، يتم الوصول إليه باستخدام معرّف النموذج deepseek-v4-flash-vision-exp. يأخذ نصوصًا وصورًا كمدخلات ويُخرج نصًا، عبر نافذة سياق تبلغ مليون رمز (1M) مع حد أقصى للإخراج يبلغ 384 ألف رمز، في وضعي التفكير وعدم التفكير. وهو يدعم تنسيق Chat Completions، ورسائل بأسلوب Anthropic، وتنسيق Responses، وهو الثلاثي الذي يحتاجه إطار عمل وكيل لتوصيله دون محوّل مخصص.

عند إدخال الصور، يقبل Deep​Seek تنسيقات JPEG وPNG وGIF وWebP، ويتم تمريرها بثلاث طرق: base64 مضمن، أو رابط خارجي، أو ملف مرفوع عبر Files API الجديدة. لا يوجد حتى الآن إدخال فيديو أو صوت — "الرؤية" هنا هي صور ثابتة فقط.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

تحديد موضع Deep​Seek نفسه، في ملاحظات الإصدار: القدرة النصية البحتة — الوكلاء، والاستدلال، والمعرفة العالمية — على قدم المساواة مع إصدار DeepSeek V4 Flash الرسمي، بينما تشهد قدرة الوكلاء متعددي الوسائط قفزة كبيرة لتقترب من Opus-4.8. هذا ادعاء من البائع، غير مُعاد إنتاجه، ويستحق القراءة بعناية، لأن تفاصيل المعايير التي تقف خلفه أكثر إثارة للاهتمام من العنوان الرئيسي.

لماذا قفزة المعيار أكبر مما تبدو

جميع الأرقام التالية هي من إعداد Deep​Seek نفسه، نُشرت اليوم في ملاحظة الإطلاق، ولم يتم التحقق منها بشكل مستقل. في معايير الوكلاء التي تتضمن لقطات شاشة وصورًا، فإن DeepSeek V4 Flash القائم على النص فقط لا يقرأها، بل يتجاهل ببساطة الأجزاء متعددة الوسائط من المهمة. أما DeepSeek V4 Flash Vision (Exp) فينظر إليها فعليًا، وهذا هو سبب الفروق الكبيرة:

• ApexBench Pass@1 — Vision-Exp 36.5 مقابل V4-Flash 26.2 (Opus-4.8 39.4)

الاختبار الأخير للوكلاء — Vision-Exp 27.3 مقابل V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 مقابل V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 مقابل V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 مقابل V4-Flash 54.4 (Opus-4.8 58.0)

• رسم الخرائط — Vision-Exp 64.3 (إصدار V4-Flash النصي فقط لا يمكنه محاولة ذلك)

• ZeroBench Pass@5 — Vision-Exp 35.0 (لا يمكن لإصدار V4-Flash النصي فقط خوضه)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

رقمان من تلك الأرقام يستحقان نظرة ثانية. في اختبار Agents' Last Exam، يتفوق Vision-Exp (27.3) على Opus-4.8 (25.7) بهامش ضئيل، وكذلك في DeepSWE يتغلب على Opus-4.8 (59.3 مقابل 58.0). وهذا هو ما تستند إليه فعليًا عبارة "قريب من Opus-4.8" — ليس نتيجة بارزة واحدة، بل مجموعة من معايير الوكلاء حيث تؤدي رؤية الشاشة إلى سد معظم الفجوة مع النموذج متعدد الوسائط الرائد، بينما يقل سعره عنه بمقدار عشرة أضعاف تقريبًا.

كم تبلغ تكلفة الصورة، حتى الخانة العشرية.

يتم تحويل الصور إلى رموز لأغراض الفوترة — حتى 384 رمزًا لكل صورة — ثم تُحتسب بنفس معدلات الرمز الواحد المعتمدة لـ DeepSeek V4 Flash. ونظرًا لأن Deep​Seek نقلت جميع نماذجها إلى تسعير فترات الذروة/خارج الذروة في 16 أغسطس 2026، فإن الأرقام الدقيقة تعتمد على وقت الاستدعاء:

الإدخال، خطأ الكاش — $0.22 لكل مليون توكن خارج أوقات الذروة، $0.44 في أوقات الذروة

• الإدخال، إصابة ذاكرة التخزين المؤقت — 0.007 دولار لكل مليون رمز خارج أوقات الذروة، و0.014 دولار في الذروة

الإخراج — 0.66 دولار لكل مليون توكن خارج أوقات الذروة، 1.32 دولار في أوقات الذروة.

ساعات الذروة — 01:00–04:00 و06:00–10:00 UTC (جميع الساعات الأخرى خارج الذروة)

أجرِ الحسابات وستكاد تكلفة الرؤية تختفي. صورة واحدة عند سقفها البالغ 384 رمزًا تبلغ حوالي 0.0085 سنتًا خارج أوقات الذروة و0.017 سنتًا في الذروة، كمدخلات. وكيل يقرأ 50 لقطة شاشة في تشغيل واحد يضيف نحو نصف سنت من رموز الإدخال — قبل أن يكتب النموذج حتى أول رمز إخراج له. كما يقيّد Deep​Seek الدقة قبل الاستدلال: مستوى التفاصيل المنخفض يعيد التحجيم إلى 512×512، والمستوى العالي/الأصلي يعيد معايرة الصورة مسبقًا (الصغيرة تُكبَّر تقريبًا إلى 384×384، والكبيرة تُصغَّر تقريبًا إلى 800×800)، لذلك لا يُغذَّى الأصل عالي الدقة أبدًا للنموذج بعدد بكسلاته الأصلية.

طاقم الدعم: واجهة برمجة تطبيقات Files مجانية و Harness 0.1.1

قطعتان من البنية التحتية صدرتا إلى جانب النموذج. أصبحت Files API متاحة ومجانية الآن: ارفع صورة مرة واحدة، وأشِر إليها باستخدام file_id، وأعد استخدامها عبر الطلبات دون إعادة إرسال البايتات — وهو أمر مفيد لعامل تصفح يحتفظ بصفحة في السياق عبر عدة جولات. كما أن Deep​Seek Harness 0.1.1، الذي صدر في اليوم نفسه، يتضمن دعمًا جاهزًا للنموذج الجديد، وبذلك يمكن للأداة التي تختبر وتشغّل مهام العوامل الخاصة بـ Deep​Seek استهدافه فورًا.

تحذير الإنتاج، بعبارات صريحة

هذا نموذج تجريبي. تصنّفه DeepSeek صراحةً على هذا النحو، ولم تعلن عن أي تاريخ للإتاحة العامة، وتوصي بعدم تشغيله مباشرة في بيئات الإنتاج؛ الخطة المعلنة هي التكرار بناءً على الملاحظات وإصدار نسخة مستقرة لاحقًا. النتيجة العملية هي أن العقل النصي مُثبت — فهو نفس عائلة الأوزان التي تشغّل V4-Flash — لكن مسار الرؤية هو كود جديد، ولا أحد خارج DeepSeek اختبره تحت الضغط على نطاق واسع.

هذه هي بالضبط الحالة التي تُثبت فيها طبقة التوجيه قيمتها. على OrcaRouter، يعمل كل من deepseek/deepseek-v4-flash-vision-exp وdeepseek/deepseek-v4-flash خلف واجهة برمجة تطبيقات واحدة، بسعر DeepSeek الرسمي دون أي زيادة. يمكنك توجيه حركة المرور التي تحمل صورًا إلى النموذج التجريبي، وفي نفس الإعداد، ضبط تحويل تلقائي إلى نموذج احتياطي حال حدوث خطأ أو انتهاء المهلة — مما يقلل من مخاطر مشكلة "الكود الجديد" بأكملها. كما تتيح لغة التوجيه الخاصة بالمجال (DSL) إرسال الطلبات التي تحتوي فعليًا على صور فقط إلى نموذج الرؤية، مع إبقاء حركة المرور النصية البحتة على DeepSeek V4 Flash، مما يحقق مكاسب المعايير حيثما وجدت دون دفع أي شيء إضافي حيث لا توجد.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

ماذا تشاهد بعد ذلك

الأسئلة المفتوحة هي الأسئلة المعتادة لأي إطلاق تجريبي. متى يصل DeepSeek V4 Flash Vision (Exp) إلى الإتاحة العامة (GA)، وهل يبقى السعر ثابتًا؟ هل يتبع ذلك دعم إدخال الفيديو أو الصوت — فالنموذج اليوم يدعم الصور الثابتة فقط، مما يترك نماذج الوسائط المتعددة الكبيرة الرائدة دون منافس في الوسائط المتحركة. وهل تعيد التقييمات المستقلة (أول تشغيل من طرف ثالث على ApexBench أو Terminal-Bench) إنتاج الأرقام المنشورة؟ المثير للاهتمام أنه حتى لو انخفضت جميع المعايير، فإن الادعاء الفعّال من حيث التكلفة بالفعل — الرؤية بأسعار النصوص — هو حقيقة تسعير وليس ادعاءً معياريًا، ولا يحتاج إلى إعادة إنتاج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube