
Ling-3.0-flash-VL مقابل DeepSeek V4 Flash Vision Exp: رهانان على الرؤية المفتوحة
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
Ling-3.0-flash-VL وDeepSeek V4 Flash Vision Exp هما النموذجان المفتوحا الأوزان للرؤية في هذه الفئة الوزنية اللذان يمكن لفريق أن ينزّلهما ويشغّلهما فعليًا اليوم، وقد بناهما أشخاص يختلفون حول الغرض من الرؤية. يُنشّط Ling-3.0-flash-VL، من مختبر inclusionAI التابع لمجموعة Ant، نحو 5.5 مليار من أصل 124 مليار معامل لكل رمز، ويتعامل مع الرؤية كشيء يُطبَّق داخل حلقة تغذية راجعة — توليد، عرض، نظر، تصحيح — بأدنى تكلفة استدلال ممكنة. أما DeepSeek V4 Flash Vision Exp، أول بناء متعدد الوسائط من DeepSeek، فيقرن نافذة سياق تبلغ مليون رمز بحد أقصى للإخراج قدره 384 ألف رمز، ويتعامل مع الرؤية كمدخل إضافي يقرأه الوكيل في طريقه إلى إنجاز مهمة طويلة. أحدهما مُحسَّن لمدى قلة تكلفة التفكير. والآخر مُحسَّن لمدى ما يمكنه استيعابه أثناء ذلك.
هذا الفرق، وليس فارقًا في نتائج الاختبارات المرجعية، هو ما ينبغي أن يوجّه الاختيار. لا يملك النموذجان بروتوكول تقييم مشتركًا يمكن المقارنة في ضوئه، وواحد منهما فقط لديه نتيجة مستقلة أصلًا. ما يلي هو الصورة الصادقة لهذه المواجهة: رهانات البنية المعمارية، والمواصفات التي تتباين فعليًا، ووضع الاختبارات المرجعية بما في ذلك سبب ضحالته، وتكلفة كل منهما، وأيهما يفوز لأي مهمة — إضافة إلى الجزء الذي نقول فيه بصراحة أي الاثنين موجود في كتالوجنا.
الرهانان، بصياغة دقيقة
جانب Ling من هذا هو رهان على التخلخل التنشيطي كمحرك التكلفة الأساسي. Ling-3.0-flash-VL هو مزيج متناثر من الخبراء بإجمالي 124 مليار معامل — تُظهر بطاقة النموذج حوالي 124.8 مليار، ويصف كتاب وصفات SGLang 5.1 مليار نشط حيث تقول البطاقة تقريبًا 5.5 مليار — يشغّل جذعًا هجينًا من 42 طبقة يتبادل بين Kimi Delta Attention وكتل MLA المبوبة بنسبة 5:1. يُغذي ذلك الجذع مشفّر رؤية ذو دقة اعتباطية ومُسقِط MLP من طبقتين، مع تعامل VideoRoPE مع الموضع المكاني والزماني بحيث تصل إطارات الفيديو بترتيب متماسك. النتيجة المعمارية هي نموذج يكلف جزءًا صغيرًا من نموذج كثيف بـ 124 مليار للتشغيل لكل رمز، وهذا هو السبب الكامل لظهوره على حدود الذكاء مقابل المعاملات النشطة.
جانب DeepSeek هو رهان على السياق وقدرة الوكلاء على التحمل. يأخذ DeepSeek V4 Flash Vision Exp بنية DeepSeek-V4-Flash النصية ويضيف مُرمِّز رؤية ومُواءِمًا، ثم يواصل التدريب — ويقدّر أحد المصادر النتيجة بنحو 305B من المعاملات، وهو ما لم يؤكده DeepSeek بالتفصيل. يحمل نافذة سياق تبلغ 1,048,576 رمزًا و384,000 رمز كحد أقصى للإخراج، ويدعم مخرجات JSON، واستدعاءات الأدوات، وواجهة Responses API، وواجهة Anthropic API، واستمرار بادئة المحادثة، وقد أوضح DeepSeek صراحةً أن هذا ليس نموذجًا للإجابة عن الأسئلة البصرية. إنه إدراك للوكلاء: قراءة لقطات شاشة الويب، وواجهات البرامج، والمخططات، ثم المتابعة إلى استدعاءات الأدوات. تُحوَّل الصور إلى رموز وتُحاسَب على هذا الأساس، بحد أقصى 384 رمزًا لكل صورة.
اقرأ هاتين الفقرتين معًا، فتظهر ملامح القرار. إذا كان عبء عملك هو "انظر إلى هذا، واتخذ قرارًا، وتصرّف، ثم انظر مرة أخرى"، فإن عدد المعاملات النشطة في Ling هو ما يجعل هذه الحلقة ميسورة الكلفة، وقد صُمم تصميم التغذية الراجعة البصرية لديه لهذا الغرض تحديدًا. وإذا كان عبء عملك هو "اقرأ هذا المستند ذا 400 صفحة وما فيه من أشكال وواصل القراءة"، فإن نافذة السياق في DeepSeek هي الميزة، ولا ينافسها شيء من جانب Ling.
لماذا تكون مقارنة المعايير أهزل مما تبدو عليه
هذا هو القسم الذي تتخطاه معظم المقارنات، وتخطّيه يُنتج جدولاً من الأرقام لا يعني شيئًا. وإليك الحالة الفعلية للأدلة.
Ling-3.0-flash-VL لديه قياس مستقل واحد: 25 على Artificial Analysis Intelligence Index v4.3، في المرتبة #2 من 64 في فئته الحجمية مقابل وسيط الفئة 8. تدّعي بطاقة البائع بشكل منفصل 42 على بروتوكول Intelligence Index v4.1.1، وهو مقياس متقاعد وغير قابل للمقارنة — تعامل مع 42 على أنه غير مُعاد إنتاجه.
ليس لـ DeepSeek V4 Flash Vision Exp أي صفحة على Artificial Analysis على الإطلاق. كل رقم يُنشر عنه هو رقم خاص بـ DeepSeek، من إعلان الإصدار، والعديد منها محسوب صراحةً بالنسبة إلى Opus-4.8 بدلًا من بروتوكول ثابت. هذا ليس انتقادًا للأرقام؛ بل هو بيان عمّا يمكنك فعله بها. لا يمكنك أن تضع نموذجًا مُقيَّمًا بشكل مستقل ونموذجًا مُقيَّمًا من البائع فقط في العمود نفسه وتعلن فائزًا، وأي صفحة تفعل ذلك فإنها تختلق نتيجة.
ما يُعد مشروعًا هو مقارنة كل نموذج بسجلّه المُبلَّغ عنه الخاص به، مع إرفاق مصدره:
• Ling-3.0-flash-VL، مستقل — مؤشر الذكاء 25 على v4.3، المرتبة #2 من 64 في الفئة، ووسيط الفئة 8، وفقًا لـ Artificial Analysisbr /> • Ling-3.0-flash-VL، بحسب المورّد — 42 على بروتوكول v4.1.1 المتقاعد، و1,441 مقابل 1,440 لـ GPT-5.4 في Image-to-WebDev Arena باسم "linthium"؛ وكلاهما من إبلاغ المورّد، وفارق الساحة ضمن ضجيج Elobr /> • DeepSeek V4 Flash Vision Exp، بحسب المورّد — Terminal Bench 2.1 83.9؛ DeepSWE 59.3 مقابل 58.0 لـ Opus-4.8؛ Agents' Last Exam 27.3 مقابل 25.7 لـ Opus-4.8؛ Toolathlon-Verified 75.9؛ Cybergym 75.3؛ Chartography 64.3؛ NL2Repo 57.7؛ DSBench-Hard 63.6؛ ZeroBench Pass@5 35.0؛ ApexBench Pass@1 36.5؛ AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp، مستقل — لم يُنشر أي منها
لاحِظ مما تتكوّن قائمة DeepSeek في الغالب: تقييمات وكيلية وتقييمات هندسة برمجيات، لا تقييمات رؤية. وإطار DeepSeek نفسه هو أنه في المهام النصية البحتة يطابق نموذج الرؤية النسخة الرسمية DeepSeek-V4-Flash دون أي تراجع، وأن المكاسب تتحقق في معايير الوكلاء متعددة الوسائط — حيث يصف DeepSeek النتيجة بأنها تقترب من Opus-4.8 بدل أن تتجاوزه، ويعترف بفجوة نحو عشر نقاط في مهام علوم البيانات المنظمة ومهام البرمجة NL2Repo وDSBench-Hard. هذه مجموعة مزاعم حذرة على نحو غير معتاد، وتخبرك أن النموذج يُسوَّق كتبديل إدراكي لمنظومة وكلاء قائمة لا كسقف جديد.

المواصفات التي تختلف فعلياً
تتفق ورقتا المواصفات في معظم النقاط: كلتاهما مفتوحتا الأوزان بموجب رخصة MIT، وكلتاهما تستقبلان النص والصور وتُعيدان النص، وكلتاهما توفّران أوزان BF16 مع إصدارات مُكمَّمة، ولديهما وصفات تقديم منشورة، وكلتاهما تتعاملان مع الفيديو بشكل ما. وتتركز الاختلافات في أربعة مواضع.
• المعاملات — Ling-3.0-flash-VL يبلغ إجماليه 124B مع حوالي 5.5B نشطة لكل رمز؛ يُذكر أن DeepSeek V4 Flash Vision Exp يبلغ حوالي 305B دون رقم منشور للمعاملات النشطةbr /> • نافذة السياق — Ling-3.0-flash-VL تبلغ 262K رمزًا وفقًا لـ Artificial Analysis مقابل 256K المذكورة في بطاقة النموذج الخاصة به؛ DeepSeek V4 Flash Vision Exp يعمل بـ 1,048,576 رمزًا أصليًاbr /> • الحد الأقصى للإخراج — Ling-3.0-flash-VL أقصر بكثير، في نطاق عشرات الآلاف من الرموز؛ DeepSeek V4 Flash Vision Exp يصل إلى 384,000br /> • معالجة الصور — Ling-3.0-flash-VL يقبل حتى 40 صورة لكل طلب بحد أقصى 16,384 × 784 بكسل لكل صورة، base64 فقط؛ DeepSeek V4 Flash Vision Exp يقبل base64، أو عناوين URL خارجية أو مرجع Files API، ويحدد تكلفة الصورة بحد أقصى 384 رمزًا لكل صورةbr /> • المعاملات النشطة — Ling-3.0-flash-VL تنشط حوالي 5.5B لكل رمز؛ DeepSeek V4 Flash Vision Exp لم تنشر أي رقم للمعاملات النشطة
صفُ معالجة الصور هو الصف الذي يُستهان به. فسقفٌ صارم عند 384 رمزًا لكل صورة يعني أن مخططًا مكتظًّا أو لقطة شاشة لصفحة كاملة يُضغط إلى ميزانية تقارب ميزانية صورة مصغّرة — رخيص، وفاقد للتفاصيل على نحوٍ يؤثر في مهام القراءة الدقيقة. أما مقاربة لينغ فتسلك الاتجاه المعاكس: ميزانية بكسل كبيرة جدًّا لكل صورة، ونقلٌ بترميز base64 فقط، وبالتالي حمولة طلب أثقل بكثير. وأيّهما أفضل يتوقف كليًّا على ما إذا كانت صورك فوتوغرافية لمستندات تحتاج إلى قراءتها بدقة، أم لقطات شاشة لواجهات تحتاج إلى فهمها فهمًا تقريبيًّا.
الصف الثاني الأقل تقديرًا هو الحد الأقصى للإخراج. سقف Ling-3.0-flash-VL البالغ عشرات الآلاف من الرموز مناسب لحلقة الوصف ثم التصحيح، ومقيِّد لأي شيء يريد إصدار مُخرَج كبير — ملف مُولَّد طويل، أو إعادة كتابة مستند كامل، أو فرق من آلاف الأسطر. مخرجات DeepSeek البالغة 384K موجودة تحديدًا لأن عبء العمل المقصود لها ينتهي بنتيجة استدعاء أداة كبيرة أو مُخرَج مُولَّد. إذا كان خط الأنابيب لديك يتوقع من النموذج أن يعيد شيئًا طويلًا، فإن ذلك الصف وحده يحسم المواجهة قبل أن يفعل أي اختبار معياري ذلك.
السعر، والفرق بين المجاني وغير المسعّر
يحتوي DeepSeek V4 Flash Vision Exp على رقم حقيقي في كتالوجنا: 0.24 دولار لكل مليون رمز إدخال و0.73 دولار لكل مليون رمز إخراج، مع نافذة سياق تبلغ 1,048,576 رمزًا وحد أقصى للإخراج يبلغ 384,000 رمز، ويمكن الوصول إليه باسم deepseek/deepseek-v4-flash-vision-exp. هذا سعر منشور، ويُحتسب بالطريقة نفسها المتبعة مع V4-Flash النصي، مع تحويل الصور إلى رموز بما يصل إلى 384 لكل صورة. إنه سعر يمكنك وضعه في جدول بيانات.
لا يملك Ling-3.0-flash-VL سعرًا واحدًا. تسرده صفحة Artificial Analysis عند $0.00 لكل مليون رمز إدخال و$0.00 لكل مليون رمز إخراج مقابل وسيطات النماذج النظيرة البالغة $0.14 و$0.40 — لكن ذلك يعكس التجربة المجانية العاملة على Ling Studio من Ant، وليس تعريفة. لا تنشر وثائق Ant متعددة الوسائط أي سعر لكل رمز للنموذج البصري، لذا لا يوجد ما يمكن التحقق من الصفر مقابله. وقد أُدرج النموذج النصي الشقيق Ling-3.0-flash بنحو $0.075 لكل مليون رمز إدخال و$0.22 لكل مليون رمز إخراج، وأُطلقت إصدارات Ling الخاصة بمجالات محددة من Ant كواجهات برمجة تطبيقات مجانية، ما يوحي بشكل نهائي مشابه — لكن الإيحاء ليس سعرًا.
ضع هذين جنبًا إلى جنب بصدق، وستكون مقارنة التكلفة كالتالي: أحد النموذجين له سعر، والآخر له نافذة ترويجية وتخمين معقول. أي شخص يزعم أن Ling-3.0-flash-VL أرخص من DeepSeek V4 Flash Vision Exp إنما يقارن تجربة مجانية بسعر قائمة. العبارة التي يمكن الدفاع عنها هي أن Ling-3.0-flash-VL من المرجّح جدًا أن يكون أرخص لكل توكن عند تسعيره، لأن 5.5B معامل نشط ميزة بنيوية لا يمحوها أي تغيير في السعر — مع التحفظ بأن إسهاب Ling-3.0-flash-VL يقتطع من ذلك. يسجّل Artificial Analysis أنه يحرق 160M من توكنات الإخراج على Intelligence Index، في المرتبة #8 من 64 مقابل وسيط قدره 84M، وموسومًا بأنه «very verbose». أنت تدفع مقابل كل توكن يُصدَر، لذا فإن نموذجًا يقول ما يقرب من ضعف ذلك للوصول إلى الإجابة نفسها يعيد جزءًا مما يكسبه تنشيطه المتناثر.
أي واحد، لأي غرض؟
شجرة القرار الصادقة تنقسم حسب السياق وطول المخرجات قبل أن تنقسم على أي شيء آخر، لأن هذين هما البعدان اللذان لا يُعدّ فيهما النموذجان بديلين لبعضهما.
اختر DeepSeek V4 Flash Vision Expعندما تكون مهمتك طويلة وتنتهي بمُخرَج: مستندات من مئات الصفحات مع رسوم توضيحية، وقواعد برمجية تُقرأ من البداية إلى النهاية، وحلقات وكلاء تحتاج إلى إصدار نتيجة كبيرة، وأحمال عمل تريد فيها تسليم صورة عبر URL أو مرجع من Files API بدلاً من base64، وخطوط معالجة تحتاج فيها إلى Responses API، أو استمرار البادئة (prefix continuation)، أو سعر منشور لكل رمز يمكنك وضع ميزانية بناءً عليه. كما أنها الوحيدة من بين الاثنين التي لديها مورّد يدّعي التكافؤ مع نموذجه النصي في المهام النصية، وهذا مهم إذا كان نموذج واحد سيحل محل نموذجين في حزمة التقنيات لديك.
اختر Ling-3.0-flash-VL عندما يكون القيد المُقيِّد لديك هو التكلفة لكل استدعاء وتكون حلقتك قصيرة: أتمتة واجهة المستخدم الرسومية، وفحص لقطات الشاشة المتكرر، وتوليد الواجهات الأمامية بدورة عرض وتصحيح، والتدقيقات النقطية في المستندات الطبية أو المالية حيث تحتاج إلى دقة عالية لكل صورة ويمكنك قبول مخرجات صغيرة. عدد المعلمات النشطة البالغ 5.5 مليار هو سبب اختياره، وترخيص MIT هو سبب كونه آمنًا للاستضافة الذاتية، وقد صُمم تصميم حلقة التغذية الراجعة البصرية تحديدًا لنمط المراقبة-الفعل-التحقق-التصحيح. كن على علم بأنك تختار نموذجًا غير مسعّر مع مسار دخول مجاني ودون التزام بما سيأتي بعده.
وإذا كان ما تحتاجه فعلاً هو نموذج واحد يقرأ الصور بكفاءة دون أي من الطرفين — لا حيلة التخلخل 5.5B، ولا نافذة المليون رمز — فإن أياً من هذين ليس هو الإجابة المثيرة للاهتمام، ونماذج الرؤية العادية متوسطة المستوى ستخدمك بشكل أفضل وأرخص من أي من المتخصصين.
تشغيلها، وأين نندرج بصدق
DeepSeek V4 Flash Vision Exp متاح في كتالوجنا.يمكنك استدعاؤه عبر نقطة النهاية المتوافقة مع OpenAI الخاصة بـ OrcaRouter باستخدام سلسلة النموذج deepseek/deepseek-v4-flash-vision-exp، على المفتاح نفسه الذي تستخدمه لكل شيء آخر، بالسعر المعلن 0.24$/0.73$ دون أي إضافة — يُمرَّر سعر قائمة المزوّد كما هو، لذا إذا خفّضت DeepSeek السعر فسيصل إليك في اليوم نفسه وليس عند تجديد العقد التالي. إذا كنت تُدخل نموذج رؤية في مسار إنتاجي لأول مرة، فهذا هو الأكثر أمانًا بين الاثنين للبدء به على طبقة التوجيه، لأنه يمكنك تكوين سلسلة احتياطية بحيث إذا حدث خطأ من المزوّد تُعاد المحاولة عبر مسار آخر قبل أن تبدأ استجابتك. لا أحد يريد أن تكون أول مكالمة رؤية إنتاجية له هي التي تعلّمه عن فشل المزوّد الواحد.

لا يوجد Ling-3.0-flash-VL في كتالوجنا، ولن نلمّح إلى خلاف ذلك. فهو متاح عبر منصة Ant نفسها، التي تنشر نقطة نهاية متوافقة مع OpenAI وأخرى متوافقة مع Anthropic، وعبر الوصول التجريبي المجاني على Ling Studio، وعبر الأوزان المفتوحة على Hugging Face، التي يمكنك تشغيلها بنفسك باستخدام وصفة SGLang المنشورة أو نسخة vLLM المتفرّعة الخاصة بـ Ant. وهناك أمر واحد يجب التحقق منه قبل أن تستثمر في هذا المسار: أمثلة واجهة برمجة تطبيقات Ant تستخدم المعرّف Ling-3.0-flash-VL-rc1، وهو علامة إصدار مرشّح، ولم يُحسم علنًا بعد ما إذا كانت نقطة التحقق المُخدَمة تطابق الأوزان المفتوحة. إذا أجريت اختبار أداء مقابل واجهة API المستضافة متوقعًا أن تنتقل الأرقام إلى نشر BF16 مستضاف ذاتيًا، فاختبر هذا الافتراض أولًا.

الخلاصة التي تصمد أمام التدقيق: هذه ليست إجابات متنافسة على سؤال واحد. إن DeepSeek V4 Flash Vision Exp طبقة إدراك طويلة السياق للوكلاء، بسعر منشور وورقة معايير مُبلَّغ عنها من المورّد تعتمد على تقييمات وكيلية. أما Ling-3.0-flash-VL فهو نموذج رؤية زهيد التشغيل، يمتلك نتيجة مستقلة حقيقية واحدة، وطبقة مجانية بلا سعر معلن، وتصميمًا موجّهًا نحو حلقات تصحيحية قصيرة. طابِق شكل عبء العمل لديك مع شكل النموذج، وحقيقة أن أحدهما فقط لديه نتيجة مستقلة على لوحة النتائج ينبغي أن توجّه مدى الوزن الذي توليه لتسويق الآخر.
يصل المفتاح نفسه إلى بقية الكتالوج، ويمكنك تصفح كتالوج النماذج الكامل لترى ما الذي يوجد أيضًا خلف نقطة نهاية واحدة متوافقة مع OpenAI.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
