
Ling-3.1-flash مقابل DeepSeek V4.1 Flash: نقطتان في المؤشر، وثلاثة أضعاف الفاتورة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Ling-3.1-flash وDeepSeek V4.1 Flash (Max) يفصل بينهما نقطتان على مؤشر Artificial Analysis Intelligence — 41 مقابل 39 — وهما بعيدان تمامًا عن بعضهما في السعر. شغّل التقييمات العشرة التي يتكوّن منها ذلك المؤشر على كل نموذج، فيكلّف Ling-3.1-flash نحو 0.99 دولار لكل مهمة مقابل 0.27 دولار لـ DeepSeek. كلاهما نموذجان بخليط خبراء بمعاملات تبلغ نحو 550 مليارًا مع سياق مُدّعى يبلغ مليون رمز. أحدهما نموذج مغلق نصي فقط من مختبر InclusionAI التابع لمجموعة Ant، صدر في 2026-10-01 وما زال بلا أوزان منشورة أو ترخيص. والآخر مفتوح بموجب MIT منذ 2026-09-10، ويستقبل الصور إلى جانب النص، ويعمل عبر 23 مزوّدًا، وهو النموذج الذي سيكون لدى معظم الفرق بالفعل في ملف إعدادات. المقارنة ليست قريبة على معظم المحاور. والسؤال المثير هو لماذا توجد هاتان النقطتان أصلًا.
حيث يكون Ling-3.1-flash متقدمًا حقًا
إنه متقدّم في التقييمات التي تقيس التعامل مع الطرفية وكتابة تعليمات برمجية يجب أن تعمل، والفارق يستحق الذكر بدقة لأن الإجمالي يخفيه.
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 مقابل DeepSeek V4.1 Flash (Max) 0.268. كلاهما رقمان متواضعان بالقيمة المطلقة؛ والفارق يمثل ربع نتيجة DeepSeek.
• SciCode — 0.541 مقابل 0.519.
• الاستدلال الفيزيائي CritPt — 0.180 مقابل 0.143.
• العمل الوكيلي في العالم الحقيقي وفق GDPval-AA — 1,621.75 إيلو مقابل 1,600 إيلو.
اثنان من تلك الأربعة شبه تعادل، وواحد فوز بفارق ضئيل، وTerminal-Bench 4.0 هو الصف الوحيد الذي كان الفارق فيه ليبقى بعد تغيير البذرة. قارِن ذلك بما يتفوق فيه DeepSeek: AA-Briefcase v1.1 للعمل المعرفي القائم على الوكلاء عند 1,420.47 Elo مقابل 1,400.35، وAutomationBench-AA عند 0.689 مقابل 0.617، وAA-LCR للاستدلال طويل السياق عند 0.84 مقابل 0.83، و—الصف الأكثر أهمية للإنتاج—AA-Omniscience عند −5.30 مقابل +2.22 لدى Ling-3.1-flash في مقياس تكون فيه الهلوسة أسوأ من الرفض. تبلغ دقة DeepSeek هناك 46.4% مع معدل هلوسة 96.5% بين الأسئلة التي يجيب عنها؛ ويجيب Ling-3.1-flash بشكل صحيح عن 29.1% بمعدل هلوسة 37.9%. لا يصلح أي منهما كنموذج توجّهه إلى قاعدة معرفية دون استرجاع يسبقه.
الفجوة السعرية أكبر من فجوة المؤشر، وهي ليست مجرد بطاقة الأسعار
تبدو الأسعار المعلنة متطابقة تقريبًا. تسجّل Artificial Analysis كليهما عند 0.30 دولار لكل مليون توكن إدخال. لكنهما يختلفان اختلافًا حادًا في الرقمين الآخرين:
• المخرجات — Ling-3.1-flash 0.90 دولار لكل مليون مقابل DeepSeek V4.1 Flash (Max) 1.20 دولار لكل مليون. هنا يُعد Ling-3.1-flash النموذج الأرخص بلا منازع، بنسبة 25%.
• قراءة الذاكرة المؤقتة — Ling-3.1-flash بدولار 0.06 لكل مليون مقابل DeepSeek V4.1 Flash (Max) بدولار 0.006 لكل مليون، أي خصم بنسبة 98% مقابل خصم بنسبة 80%. عند هذه النقطة يتوقف النموذجان عن كونهما قابلين للمقارنة.
يبلغ السعر المدمج عند مزيج 7:2:1 من إصابة الذاكرة المؤقتة/الإدخال/الإخراج $0.192 لـ Ling-3.1-flash و$0.184 لـ DeepSeek V4.1 Flash (Max) — وهو ما يكاد يكون تعادلًا. لكن المزيج افتراض بشأن كيفية استخدامك للنموذج، وهذا الافتراض يؤدي دورًا كبيرًا. أي عبء عمل يتسم بإعادة استخدام مكثفة للموجّهات — موجّه نظام طويل، أو مقدمة استرجاع، أو حلقة وكيل تعيد إرسال السياق المتراكم في كل دور — يدفع المزيج الفعّال نحو قراءات الذاكرة المؤقتة، وهناك يسيطر فرق 10× في تسعير الذاكرة المؤقتة. ويفاقم حجم الرموز الأمر بالطريقة نفسها: إن Ling-3.1-flash نموذج استدلال ثرثار، يولّد 220 مليون رمز إخراج عبر تقييمات المؤشر مقابل 250 مليونًا لدى DeepSeek، ويستغرق في المتوسط نحو 357 ثانية لكل مهمة تقييم مقابل 285 ثانية لدى DeepSeek. إنه يفكر أكثر في كل إجابة ويستغرق وقتًا أطول في ذلك.

مثال عملي: نفس حلقة الوكيل على كليهما
لنأخذ وكيلًا يقود الأدوات يعالج 1M رمز إدخال لكل مهمة، 90% منها تُخدَم من الذاكرة المؤقتة، ويعيد 200,000 رمز إخراج. على Ling-3.1-flash وفق الأرقام أعلاه: 900,000 رمز إدخال مخزّن مؤقتًا بسعر $0.06 بالإضافة إلى 100,000 رمز إدخال جديد بسعر $0.30 بالإضافة إلى 200,000 رمز إخراج بسعر $0.90 يصل إلى حوالي $0.26 لكل مهمة. الحلقة نفسها على DeepSeek V4.1 Flash (Max) تصل إلى حوالي $0.14 — أي النصف تقريبًا.
طبّق الآن جدول DeepSeek، لأن هذا هو الجزء الذي تتجاهله معظم المقارنات. سعر DeepSeek خارج أوقات الذروة هو السعر المذكور أعلاه، وتغطي فترات خارج الذروة عطلات نهاية الأسبوع ومعظم ساعات اليوم؛ لكن خلال نافذتين في أيام الأسبوع، 01:00–04:00 و06:00–10:00 UTC، يتضاعف تسعير الإدخال والذاكرة المؤقتة. انقل الحلقة نفسها إلى نافذة ذروة، فتصل تكلفة DeepSeek إلى نحو 0.28 دولار — وعند هذه النقطة تصبح بطاقة التعرفة الثابتة الأعلى لدى Ling-3.1-flash هي الخيار الأرخص لتلك الساعة، ويكون خصم الذاكرة المؤقتة البالغ 10× قد أُبطل مفعوله بالساعة.
هذا هو القرار كاملاً في زوج أرقام واحد. إذا كانت حركة وكلائك كثيفة الاعتماد على ذاكرة التخزين المؤقت ويمكنك جدولتها، فإن DeepSeek V4.1 Flash (Max) يكلف نحو نصف تكلفة Ling-3.1-flash مقابل فارق نقطتين في المؤشر. وإذا كانت حركة مرورك كثيفة الاعتماد على ذاكرة التخزين المؤقت وتقع ضمن نوافذ الذروة لدى DeepSeek، فإن تكلفة الطرازين متقاربة، ويصبح الأداء الأفضل بشكل طفيف لدى Ling-3.1-flash في صف وكيل الطرفية هو العامل الفاصل.
المحاور التي لا تُجرى فيها أيُّ مقارنة
الأبعاد الثلاثة ليست متقاربة، وهي التي تميل إلى تحديد المعمارية قبل مناقشة السعر.
• الأوزان والترخيص — لم تنشر Ling-3.1-flash أوزانًا، وليس لديها نص ترخيص، وتصنّفها Artificial Analysis على أنها مملوكة. DeepSeek V4.1 Flash (Max) أوزان مفتوحة بموجب MIT، وقابلة للتنزيل من Hugging Face، مع السماح بالاستخدام التجاري. يمكن استضافة أحد هذين ذاتيًا وضبطه بدقة وعزله عن الشبكة؛ أما الآخر فلا.
• الوسائط — Ling-3.1-flash نصي فقط: مُدخلاته نص ومُخرجاته نص. أما DeepSeek V4.1 Flash (Max) فيقبل الصور إلى جانب النص، ويُقيَّم وفق معايير متعددة الوسائط. إذا كان أي جزء من خط سير معالجتك يمرِّر إلى النموذج لقطة شاشة أو مخططًا أو مسحًا ضوئيًا، فالمقارنة تنتهي عند هذا الحد.
• سطح الخدمة — DeepSeek V4.1 Flash (Max) متاح عبر 23 مزوّدًا، بما في ذلك OrcaRouter؛ ويعمل Ling-3.1-flash عبر واجهة API الخاصة بالمورّد نفسه، وعبر المنصات الخارجية التي تحمل إصداره. بالنسبة لمسار الإنتاج، فإن عدد المزوّدين سمة من سمات المرونة، وليس مسابقة شعبية.
عدم تماثل آخر لا يظهر في أي من تلك القوائم: DeepSeek V4.1 Flash (Max) يوفر 384,000 توكن إخراج في استجابة واحدة. لم تنشر Ant حدًا أقصى لطول الإخراج لـ Ling-3.1-flash، لذا لا يمكن بعد تحديد حجم عبء عمل توليد طويل بالقياس إليه. غياب حد أقصى منشور ليس مماثلًا لكونه صغيرًا، لكنه ليس رقمًا يمكنك التصميم على أساسه أيضًا.
تشغيل كليهما، وكيف يبدو ذلك في الواقع
لا يتوفّر Ling-3.1-flash في كتالوج OrcaRouter اليوم — إذ يعيد الاستعلام عبر واجهة برمجة النماذج العامة لدينا نتيجة "غير موجود" لهذا النموذج ضمن InclusionAI، ولن يتظاهر هذا المقال بغير ذلك. أما DeepSeek V4.1 Flash فهو قابل للتوجيه الآن بسعر القائمة دون أي هامش ربح من المزوّد، لذا فإن أي تغيير في سعر المزوّد يسري على جانبنا في اليوم نفسه الذي يصل فيه، وهو يقف خلف مفتاح API الواحد نفسه الذي يغطي بقية الكتالوج، مع تبديل تلقائي عند التعطّل بين المزوّدين upstream.
لهذا اللاتماثل شكل عملي. الطريقة العقلانية لإجراء مقارنة يكون فيها أحد النموذجين مغلقًا، ومسعّرًا بنحو أربعة أضعاف سابقه، ويمكن الوصول إليه عبر مورّد واحد، هي الإبقاء على النموذج المفتوح واسع الإتاحة بوصفه المسار الافتراضي، والتعامل مع المنافس كشيء تختبره لا كشيء تلتزم به. يمكن لـ DeepSeek V4.1 Flash (Max) أن يحمل حلقة الإنتاج اليوم — أوزان مفتوحة، إدخال صور، إخراج 384K، وخصم 98% على التخزين المؤقت — بينما تتولى Ling-3.1-flash العمل الخاص بالوكلاء حيث تنطبق فعليًا فوارق Terminal-Bench وSciCode لديها. ولأن كليهما يتحدث صيغة chat-completions المتوافقة مع OpenAI، فإن هذا التقسيم قرار توجيه لا مشروع تكامل: نقطة نهاية واحدة، ومفتاح واحد، وقاعدة ترسل المهام التي يكون كل نموذج أفضل فيها بشكل قابل للقياس.
الحكم
بناءً على الأدلة المتاحة، يفوز DeepSeek V4.1 Flash (Max) في هذه المواجهة، وهو يفوز أساسًا بفضل أمور لا علاقة لها بنقطتي Index: أوزان مفتوحة تحت MIT، وإدخال الصور، و384,000 رمز إخراج، وخصم 98% على التخزين المؤقت، و23 مزودًا يمكن التحويل بينها عند الفشل. أما حالة Ling-3.1-flash فهي أضيق لكنها حقيقية — فهو الوكيل الأفضل في الطرفية والأدوات بين الاثنين، وهو الوحيد من بينهما الذي لم ينشر جدول أسعار مضمّنًا فيه مضاعف ساعات الذروة.
هناك أمران قد يغيّران هذا التقييم. إذا نشرت Ant الأوزان بموجب ترخيص متساهل، فستُغلق فجوة الانفتاح وتصبح المقارنة حديثًا مباشرًا عن القدرات والتكلفة. وإذا تم التحقق من نافذة السياق الطويل التي تقدمها Ant عند 1M رمز الذي يعلنه كلا النموذجين، يتوقف ادعاء تكافؤ السياق عن كونه مجرد ادعاء. وحتى ذلك الحين، فإن الخلاصة الصادقة هي أن النموذج قد يفوز في صف من معيار وكلاء ويظل خاسرًا في التقييم — وأن فجوة النقطتين في المؤشر بين هذين النموذجين تعادل تقريبًا 3.6× من التكلفة لكل مهمة، وهي مقايضة لا ينبغي أن يقدم عليها إلا عبء عمل محدد بعينه.


