
Ling-3.0-flash-VL مقابل Ling 3.0 Flash: عقل واحد بحجم 124B، الآن بعيون
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
Ling-3.0-flash-VL وLing 3.0 Flash ليسا نموذجين متنافسين، وقراءة هذا الثنائي كمبارزة بين النماذج ستوصلك إلى نتيجة خاطئة. Ling-3.0-flash-VL هي نسخة الرؤية-اللغة التي أصدرها مختبر inclusionAI التابع لمجموعة Ant Group هذا الأسبوع — أوزانها منشورة على Hugging Face برخصة MIT منذ 4 سبتمبر 2026 — وهي مبنية مباشرةً على Ling 3.0 Flash، نموذج النصوص مفتوح الأوزان ذي 124 مليار معامل الذي يشكّل ركيزة الفئة السريعة لدى المختبر منذ أواخر يوليو. يتشارك النموذجان في نفس تصميم MoE الهجين الخطّي، ونفس اقتصاديات التنشيط المتناثر، ونفس منهجية خدمة سياق 256 ألف توكن، ونفس رخصة MIT. ما تضيفه نسخة VL هو الشيء الوحيد الذي لم يمتلكه نموذج النصوص أبدًا: دعم أصلي لإدخال الصور والفيديو، يتم عبر مُرمِّز ViT، ومُسقط MLP من طبقتين، وترميز زمني VideoRoPE. إذن تتلخص المقارنة في سؤال عملي واحد: إذا كان عبء عملك لا يتضمن صورةً أبدًا، فهل يستحق النموذج ذو العينين أن تتحوّل إليه؟
السبب الذي يجعل السؤال جديرًا بالطرح أصلًا هو أن inclusionAI لا تؤطّر Ling-3.0-flash-VL كخط إنتاج منفصل. إذ تصفها بطاقة النموذج بأنها "نموذجنا متعدد الوسائط الأصلي من الجيل التالي"، المبني على Ling-3.0-flash، ويرث قدرات اللغة والاستدلال والسياق الطويل لذلك النموذج ويوسّعها برؤية تشارك في الحلقة الكاملة للفهم والاستدلال والتنفيذ والتحقق — لا رؤيةً تُضاف كمدخلات خارجية. وبالنسبة لعائلة نماذج كان إصدارها الرئيسي السابق نصيًا فقط بشكل صريح، فهذا تحوّل حقيقي، ويغيّر أي نقطة تحقق (checkpoint) ينبغي لفريق يعتمد على النصوص والأدوات أن يعتمدها كمعيار.
نقطتا فحص، وعمود فقري واحد
لينغ 3.0 فلاش، الخصم في هذه المقارنة، هو الأكثر نضجًا بين الاثنين. تم الإعلان عنه في أواخر يوليو 2026، وتم إصدار مصدره المفتوح بموجب رخصة MIT في 7 أغسطس، وهو نموذج هجين خطي مختلط من نوع mixture-of-experts بإجمالي 124 مليار معامل وحوالي 5.1 مليار معامل نشط لكل رمز — 35 طبقة KDA و7 طبقات Gated MLA مكدسة بنسبة 5:1، و512 خبيرًا موجهًا مع تفعيل 8 منها، وسياق أصلي يبلغ 256 ألف رمز يُقدَّم بحجم 262,144 رمزًا. وهو نصّي فقط، مع دعم لاستدعاء الأدوات، والتفكير مفعّل افتراضيًا عبر قالب الدردشة، وملف تكلفة منخفض بشكل غير اعتيادي بالنسبة لحجمه. وهو أيضًا النصف الموثّق من الزوج: منصة Artificial Analysis تدرجه في لوحة الصدارة المباشرة الخاصة بها، حيث يحتل المرتبة الأولى بين 63 نموذجًا في فئته، وقد قاست إخراجًا يبلغ حوالي 313 رمزًا في الثانية عبر واجهة برمجة تطبيقات البائع.
يحافظ Ling-3.0-flash-VL على تلك البنية ويضيف فوقها طبقة معالجة بصرية. تصف بطاقة النموذج مشفِّرًا مرئيًا من طراز ViT تُحاذى ميزاته مع فضاء النص عبر مُسقِط MLP من طبقتين، بينما يرمّز VideoRoPE الموضع المكاني والترتيب الزمني معًا ليتسنى للنموذج تحديد موضع الأحداث والاستدلال على مقاطع الفيديو الطويلة. والعمود الفقري هو الهجين نفسه KDA-to-MLA بنسبة 5:1، غير أنه هذه المرة بإجمالي 124 مليار معامل و5.5 مليار معامل نشط لكل رمز، مع بدن من 42 طبقة. المدخلات نص وصورة وفيديو، والمخرجات نص. وسياقه المُعلَن يصل إلى مليون رمز، مع وصفة SGLang الموصى بها التي تخدم 256 ألف رمز عبر تحجيم YaRN. ومثل شقيقه النصي، يأتي النموذج ووضع التفكير مفعَّلًا افتراضيًا (يمكن تعطيله لكل طلب عبر chat_template_kwargs)، ويعمل إما تحت SGLang أو تحت فرع مخصص من vLLM تابع لـ inclusionAI. إصدار BF16 يشغل حوالي 250 غيغابايت على القرص، موزعة على 64 جزءًا بصيغة safetensor — أي في فئة ربع تيرابايت نفسها الخاصة بأوزان النموذج النصي.
ما مدى حداثته؟ فعند كتابة هذا التقرير، كان عدد مرات تنزيل مستودع VL في حدود العشرات، وكانت بطاقة النموذج الخاصة به لا تزال قيد التحديث، ولم تُدرِجه Artificial Analysis بعد. وكل ما ورد أدناه مما لا يُنسَب صراحةً إلى Artificial Analysis هو من إعداد inclusionAI نفسها.

لوحة النتائج
اللاتماثل هنا ليس في الجودة — بل في الطريقة. ستة أبعاد تلتقط القرار:
• الذكاء (بطاقة المورّد، AA Index v4.1.1) — Ling-3.0-flash-VL: 42 كما أبلغ المورّد. Ling 3.0 Flash: 38، وهو رقم المؤشر الأسبق الذي تستشهد به البطاقة.
• لوحة AA الحية اليوم (v4.3) — Ling-3.0-flash-VL: غير مدرج بعد. Ling 3.0 Flash: تقدير 25، مصنف #1 من 63 في فئته.
• المدخلات — Ling-3.0-flash-VL: نص وصورة وفيديو. Ling 3.0 Flash: نص فقط.
• السياق — كلاهما يدّعي ما يصل إلى مليون توكن؛ وكلاهما يُقدَّم عمليًا عند 256 ألف (262,144) توكن اليوم.
• السعر — Ling-3.0-flash-VL: لا يتوفر سعر قائمة بعد؛ يتوفر فقط بأوزان مفتوحة بترخيص MIT. Ling 3.0 Flash: حوالي 0.07 دولار لكل مليون إدخال و0.22 دولار لكل مليون إخراج عبر واجهة برمجة التطبيقات الرسمية للمورّد.
• اخترها لـ — Ling-3.0-flash-VL: المستندات، ولقطات الشاشة، والمخططات، والفيديو، والوكلاء الذين يعملون عبر الواجهات الرسومية. Ling 3.0 Flash: استدعاء الأدوات بكثافة نصية وخطوط المعالجة الوكيلة طويلة المدى.

لوحة النتائج التي لا يمكن لنموذج النص الوصول إليها
هنا يختلف الاثنان فعليًا، والاختلاف بنيوي وليس تنافسيًا: على معايير الصور والفيديو، لا يوجد أي إدخال لنموذج Ling 3.0 Flash النصي فقط، لأنه لا يمكنه قبول المدخلات. أمّا مخطط Ling-3.0-flash-VL الخاص — وهو تقييم من inclusionAI، غير مُعاد إنتاجه، أُجري جزئيًا داخليًا وجزئيًا عبر واجهات برمجة تطبيقات المنافسين تحت إعدادات اختبار رسمية — فيعرض أرقامًا عبر الفئات الثلاث التي يبرزها البطاق. ففي فهم الصور المعقدة، يُظهر MMMU-Pro بنتيجة 79.0 وMathVision بنتيجة 84.87، مع نتيجة أقل بكثير بلغت 19.88 في Humanity's Last Exam-Multimodal، مما يعكس مدى صعوبة هذه المجموعة على الجميع. وفي العمل على المستندات والمخططات، يكون النموذج قويًا: OmniDocBench1.5 بنتيجة 91.35 وCharXiv_RQ بنتيجة 81.30. وفي مجموعات القياس متعددة الوسائط الموجهة بالوكيل التي تجعل هذا الإصدار مثيرًا للاهتمام — ClawEval-MM بنتيجة 59.9، وWebVoyager بنتيجة 90.83، وVision2Web بنتيجة 57.69 — يُطلب منه قراءة واجهة والتصرف بناءً عليها، وهي بالتحديد مهمة وكيل الواجهة الرسومية التي لا يستطيع النموذج النصي القيام بها.
اقرأ هذه الأمور في سياقها، وستتضح صورة متماسكة: هذا ليس نموذجًا مخصصًا للتفوق في اختبارات المعرفة على الصور، بل نموذجًا مخصصًا لتحويل البكسلات إلى أفعال — اقرأ التخطيط، وتابع الرسم البياني، وتشغّل الصفحة. على الرسم البياني الخاص بالبائع نفسه، يتصدر هذا النموذج مجال المقارنة الثلاثية (Qwen3.8-27B بجهد استدلال عالٍ، وGemini 3.5 Flash-Lite، وKimi-K2.6) في معايير OmniDocBench وWebVoyager وClawEval-MM، بينما يتخلف في مجموعات المعرفة والاستدلال الصعبة مثل MathVision وHLE-MM. تعامل مع كل رقم من هذه الأرقام على أنه مجرد ادعاء من inclusionAI إلى أن تؤكده مختبرات محايدة — لكن اتجاه الضبط واضح ومتسق.
الرقم الوحيد الذي يستحق الجدال حوله: 42 مقابل 38
أكثر ادعاءٍ يُحتمل أن يدفع فريقًا يعتمد على النصوص فقط إلى التحول هو الادعاء الرئيسي: تُفيد inclusionAI بأن نموذج Ling-3.0-flash-VL سجّل 42 على مؤشر Artificial Analysis Intelligence Index (الإصدار 4.1.1)، أي أربع نقاط فوق الـ38 التي تُسندها إلى Ling 3.0 Flash على نفس إصدار المؤشر. لاحظ ما يقيسه هذا المؤشر: فحصه المركّب في الإصدار 4.1.1 يستند إلى مجموعات اختبار نصية ووكيلية — GDPval، Terminal-Bench، SciCode، GPQA Diamond، Humanity's Last Exam وما يشابهها — ولا شيء منها من مهام الصور. لذا فإن البائع يدّعي أن إضافة التدريب البصري إلى العمود الفقري المشترك رفعت ذكاء النموذج في الجانب النصي بأربع نقاط، وليس فقط أنه أصبح قادرًا على وصف الصور. هذا ادعاء لافت واحتماله وارد تمامًا — إذ إن الضبط الدقيق بالتعليمات متعددة الوسائط يرفع عادةً القدرة النصية.
تحفّظان بشأن المصادر يبقيان هذا الرقم في نصابه. أولاً، الرقم 38 هو قيمة من جيل فهرس أقدم: فقد نقلت Artificial Analysis منذ ذلك الحين لوحتها المباشرة إلى إصدار فهرس أحدث (v4.3)، حيث تُدرج حاليًا تقدير Ling 3.0 Flash عند 25 مع بقائه في المرتبة الأولى بين 63 نموذجًا في فئته. ويقع زوج المورّد 42 مقابل 38 على المقياس الأقدم، لذا لا ينبغي قراءته على أنه «أربع نقاط فوق التقييم الذي تمنحه AA لنموذج النص اليوم». ثانيًا، الرقم 42 هو رقم inclusionAI الخاص على نموذج لم تُدرجه Artificial Analysis بعد، ولم تنشر inclusionAI نتائج نقطة التحقق VL على مجموعات اختبار النص الفردية (SWE-Bench, Terminal-Bench) التي يفردها مخطط نموذج النص الخاص بها. أربع نقاط هي بالضبط حجم المكسب الذي قد ترغب في إعادة إنتاجه قبل أن ترحّل خط أنابيب نصيًا بحتًا بالاستناد إليه.

السعر: أحدهما له سعر قائمة، والآخر ليس له.
مقارنة التكلفة حاليًا هي مقارنة تحتوي على سعر واحد فقط. نموذج Ling 3.0 Flash متاح للاستدعاء اليوم عبر واجهة برمجة التطبيقات (API) الأصلية للبائع بسعر يبلغ تقريبًا 0.07 دولار لكل مليون رمز إدخال و0.22 دولار لكل مليون رمز إخراج — تسعير محدد من البائع، ومؤكد في قائمة Artificial Analysis — مع كون الإدخال المخزن مؤقتًا أرخص، وقد انتهت خصومات فترة الإطلاق. أما Ling-3.0-flash-VL فلا يوجد له أي سعر API منشور في أي مكان؛ لا يمكنك الدفع لكل توكن له بعد. إذا أردت استخدامه هذا الأسبوع، فاستضفه ذاتيًا: أوزان MIT بحوالي 250 جيجابايت بصيغة BF16، على نفس فئة العتاد التي يتطلبها نموذج النصوص بالفعل — 4 وحدات معالجة رسومية بسعة 141 جيجابايت لكل وحدة (H20-3e أو H200) أو عقدة Blackwell بأربع وحدات معالجة رسومية مع توازي الموتر 4، أو 8 وحدات H100/H800 بسعة 80 جيجابايت عند TP8.
هذا يعيد صياغة الجوانب الاقتصادية لفريق يعتمد على النصوص فقط. إذا كنت تشتري الرموز، فإن نموذج النصوص بسعر $0.07/$0.22 رخيص ومُثبت. وإذا كنت تستضيف بالفعل نموذج النصوص 124B على خوادمك الخاصة، فإن نقطة التحقق الخاصة بالرؤية واللغة ليست عملية شراء بنية تحتية ثانية — بل هي مجرد ~250 جيجابايت إضافية من الأوزان على نفس فئة الخوادم، ولا تُبرَّر إلا بأحمال العمل التي تستهلك البكسلات فعليًا. النموذج الذي يمتلك عيونًا لا يُثبت قيمته إلا عندما تكون العيون جزءًا من الحلقة.
من الذي يجب أن يختار ماذا
• النصوص فقط والكميات الكبيرة — ابقَ على Ling 3.0 Flash. ستحصل على نموذج مُثبَت ومُدرَج في AA، وسعر حقيقي لكل توكن، واستدعاء أدوات ناضج. مكاسب نموذج VL البالغة أربع نقاط في المؤشر لم تُكرَّر، وسرعة معالجة النصوص لديه غير مقيسة؛ لا يوجد دليل حتى الآن على أنه أفضل نموذج نصي، بل مجرد ادعاء بذلك.
• تدخل الرؤية في الحلقة — مستندات، لقطات شاشة، رسوم بيانية، صور، إطارات فيديو، أو واجهة مستخدم يجب على وكيلك قراءتها والنقر عليها — فإن Ling-3.0-flash-VL هو الخيار الواضح، لأنه نفس العمود الفقري للاستدلال الذي تعرفه بالفعل مع إضافة مجموعة الرؤية، وليس نموذجًا متعدد الوسائط منفصلًا يتعين عليك إعادة تقييمه من الصفر.
• حركة مرور مختلطة، غير محسومة — الخطوة منخفضة المخاطر هي إبقاء كلاهما متاحًا والتوجيه حسب الطلب بدلًا من إعادة البنية حول أحدهما. وهذه هي الخاصية التي توجد بوابة النماذج لتوفيرها لك: واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج، وأسعار المزودين القائمة تُمَرَّر كما هي دون أي زيادة (0% هامش ربح)، وتحويل تلقائي عند تدهور أداء أحد المزودين. لا توجد أيّ من نقطتَي فحص Ling خلف نقطة نهاية OrcaRouter بعد — سعر نموذج النص هو سعر البائع نفسه، ولا يوجد لنموذج VL أي سعر مستضاف إطلاقًا — لكن عندما يكتسب نموذج VL سعرًا، فإن نقل جزء من الحركة إليه وقياس الأداء يعد تغيير إعدادات وليس مشروع تكامل.
ما الذي لا يزال مفقودًا؟
تشغيل مستقل لـ Ling-3.0-flash-VL على مؤشر Artificial Analysis Intelligence Index الحالي — الرقم 42 هو تصريح inclusionAI بشأن نسخة أقدم من المؤشر.
أي سعر لواجهة برمجية مستضافة لنموذج VL، وهو العائق الأكبر الوحيد أمام التبني الاستخدامي غير الرسمي.
<div dir="rtl"> نشر {{1}}انشقاقات نصية فقط {{2}}(SWE-Bench Pro, Terminal-Bench 2.1){{/2}} {{3}}لنقطة فحص الرؤية واللغة (VL){{/3}}، حتى تتمكن {{4}}فريق يركز على النصوص{{/4}} من التحقق من أن {{5}}حزمة الرؤية{{/5}} لم تُكلفها شيئًا. </div>
• رقم زمن الاستجابة من النهاية إلى النهاية أو معدل الإنتاجية لنظام VL تحت حمل الصور — يتم قياس سرعة نموذج النص فقط؛ بينما لا يتم قياس سرعة نموذج الرؤية.
• تأكيد محايد لمخطط قياس أداء الرؤية، حيث أُجريت أجزاء منه على منصة الاختبار الخاصة بـ inclusionAI، ومن المقرر إصدار معيار داخلي واحد على الأقل لاحقًا.
الحكم
هذه ليست مسابقةً في جودة النماذج؛ بل قرارٌ بشأن نمط الإدخال مع ادعاءٍ من أربع نقاط مُلحَق. إذا كانت مدخلاتك نصية، فابقَ على Ling 3.0 Flash — فهو أرخص ومُدرج في قائمة AA وأداؤه مقيس، وميزة نموذج VL عليه هي حاليًا رقم من جهة البائع على مقياس فهرسي أقدم. إذا بدأ عبء عملك من شاشة — صفحة مستند، أو لقطة شاشة، أو مخططًا بيانيًا، أو إطار فيديو، أو واجهة رسومية يجب أن يتعامل معها وكيلك — فإن Ling-3.0-flash-VL هو نفس الدماغ 124B الذي تعرفه من قبل، لكنه أصبح الآن قادرًا على الرؤية؛ وهذا خيار جديد حقيقي لم يكن موجودًا في الطبقة السريعة من Ling قبل أسبوع. اعتمده حيثما تكون الرؤية حقيقية فعلًا، وتحقق من الـ42 قبل أن ترحّل أي شيء على أساسه، وأبقِ الاختيار قابلاً للعكس في طبقة التوجيه حتى يصدر تقييم مستقل وسعر قائمة.
