بطاقة عنوان رئيسية مولّدة لـ Ling-3.0-flash-VL، بعنوان فرعي 'Ant تفتتح نموذجًا متعدد الوسائط على خط Ling السريع'، تعرض ثلاثة أيقونات إدخال مُسمّاة نص وصورة وفيديو قصير تمر عبر شريحة تقرأ '124B sparse MoE · 5.5B active' إلى أيقونة إخراج نصي، مع شرائح تذييل 'MIT weights' و'Live API' و'FP8' وملاحظة 'الأوزان منشورة في 4 سبتمبر 2026'، وشعار OrcaRouter أسفل اليمين.
Guides & Insights

Ling-3.0-flash-VL: Ant تطلق نموذجًا متعدد الوسائط على خط Ling السريع

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 4 سبتمبر 2026، نشر مختبر inclusionAI التابع لشركة Ant Group أوزانًا مرخصة برخصة MIT لنموذج Ling-3.0-flash-VL على منصة Hugging Face، وفي اليوم نفسه حدّث وثائق مطوري منصة Ant Ling لتتوافق مع ذلك. يُعد Ling-3.0-flash-VL أول نقطة تحقق تدعم الرؤية ضمن عائلة Ling-3.0-flash: نفس البنية الأساسية المتناثرة ثنائية الخبراء التي تضم نحو 124 مليار معامل والتي جعلت نموذج Ling-3.0-flash النصي فقط واحدًا من أكثر نماذج الاستدلال منخفضة التكلفة التي أثارت جدلًا في أواخر الصيف، لكنه الآن يقرأ الصور ومقاطع الفيديو القصيرة إضافة إلى النصوص. وجرى تكميم FP8 في 8 سبتمبر، صباح يوم كتابة هذا التقرير. وهكذا، وخلال أربعة أيام، حصل الإصدار على ثلاث واجهات يمكن للقارئ التعامل معها — أوزان مفتوحة، وواجهة برمجة تطبيقات رسمية على منصة Ant Ling، ودرجة 42 أبلغت بها الجهة الموردة وفق بروتوكول مؤشر تحليل الذكاء الاصطناعي الإصدار 4.1.1، أي أعلى بأربع نقاط من الدرجة 38 التي قيست بشكل مستقل للنموذج النصي الشقيق. وما لم يحصل عليه بعد هو إعلان رسمي: فبطاقة Hugging Face والبرنامج التعليمي للمطورين هما الإطلاق بأكمله، ولهذا يفصل هذا المقال بين ما تذكره الجهة الموردة وما يمكن لطرف خارجي التحقق منه.

تكمُن أهمية هذا الإصدار في أثره على خريطة منتجات Ant. فحتى منتصف عام 2026، كانت النماذج متعددة الوسائط في محفظة نماذج Ant تندرج ضمن خط Ming المنفصل، بينما كان يُنظر إلى Ling-3.0-flash — بما في ذلك في الشرح الذي خصّصته هذه المدوّنة نفسها لنموذج النص — بصفته الطبقة السريعة المخصّصة للنصوص والأدوات، والموجّهة للوكلاء والبرمجة والبحث العميق. والآن يزيل Ling-3.0-flash-VL هذا الحدّ الفاصل: فهو يُدخل المعلومات البصرية في نموذج استدلال يعتمد عددًا صغيرًا على نحوٍ غير معتاد من المعاملات المُفعَّلة، ويستهدف جلسات تشغيل طويلة للوكلاء، ويُسلّم النتيجة إلى المطوّرين بثلاث طرائق في آنٍ واحد. وهذا ما يجعله قرارًا مختلفًا حقًّا عن النسخ السابقة المضبوطة حسب المجال (Ling-3.0-flash-Fin وLing-3.0-flash-Sante)، التي صدرت بواجهات برمجة تطبيقات مجانية من دون أوزان. أمّا هذا الإصدار فهو مفتوح، ويعمل على منصة Ant المدفوعة، وهو حديث العهد لدرجة أن أحدًا من خارج الشركة المطوّرة لم ينشر له بعدُ تشغيلًا مستقلًّا. وهذه الحقيقة الأخيرة هي الأهم في هذا المقال.

ما الذي تم إصداره، ومتى؟

كل تاريخ مذكور أدناه قابل للتحقق من المستودعات والوثائق؛ ولا يعتمد أيٌّ منه على بيان صحفي غير موجود.

• 4 سبتمبر — أُنشئ مستودع inclusionAI/Ling-3.0-flash-VL على Hugging Face في الساعة 15:24 UTC مع 64 شريحة أوزان بصيغة bf16، وحزمة كاملة من الشيفرات المخصصة لـ bailing_moe_v3_vl، وهي البنية، إلى جانب قالب محادثة يتيح التفكير افتراضيًا، وترخيص MIT. ويبلغ عدد التنزيلات العشرات وقت كتابة هذا النص؛ إذ لا يلتقطه في اليوم الأول سوى مراقب المستودعات.

• 4 سبتمبر — أضافت بوابة مطوّري منصة Ling التابعة لشركة Ant درسًا تعليميًا حول فهم الوسائط المتعددة يوثّق النموذج عبر واجهة برمجة التطبيقات الرسمية (يُظهر ختم "آخر تحديث" في الصفحة تاريخ 4 سبتمبر 2026). وغطّت وسائل الإعلام الصينية المطوّرة هذه الإمكانية في اليوم التالي، واصفةً إياها بأنها فهم للصور والفيديوهات القصيرة من أجل الإجابة البصرية عن الأسئلة وتحليل المحتوى.

• من 5 سبتمبر فصاعدًا — ظهر دعم الخدمة والنشر بسرعة: دليل عملي لنشر النموذج عبر SGLang، ونسخة فرعية مخصصة من vLLM يديرها فريق inclusionAI، وقائمة نشر بآلية "إحضار أوزانك الخاصة" مع نقطة نهاية جاهزة لإكمال المحادثات. هذه أدوات تشغيل وبنية تحتية، وليست إعلانات، لكنها تخبرك أن النموذج صُمم ليكون قابلًا للخدمة، وليس مجرد منشور.

• 8 سبتمبر — تم إطلاق نموذج inclusionAI/Ling-3.0-flash-VL-fp8 مع تكميم FP8 (64 شريحة، ~126 جيجابايت)، مع الإبقاء على برج الرؤية بدقة أعلى عمدًا بينما تم ضغط أوزان MoE إلى FP8 E4M3. بالنسبة للاستضافة الذاتية على عدد أقل أو أصغر من وحدات معالجة الرسوميات، هذه هي نقطة التفتيش التي سيقوم معظم الناس بتحميلها فعليًا.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

البطاقة أعلاه هي أقرب ما في هذا الإصدار إلى منشور إطلاق: وصفٌ للنموذج، وهندسته، وروابط إلى وصفات SGLang وvLLM، بلا أيّ إعلان آخر في أي مكانٍ نجده. لاحظ التناقض الذي يستحق الإبراز منذ البداية: تقول بطاقة النموذج إنه "يُفعَّل 5.5 مليار معامل فقط لكل رمز"، بينما يصف دليل SGLang العملي، المكتوب بالتزامن مع الإصدار نفسه، نموذجًا بـ"5.1 مليار معامل نشط". وفي نقطة تحقق جديدة كليًا، يعود الفرق على الأرجح إلى طريقة احتساب برج الرؤية لا إلى نموذجين مختلفين، لكنه تحديدًا نوع التفاصيل التي ينبغي وسمها بأنها غير محسومة بدلًا من تهوين شأنها.

نموذج 124B يُفعّل 5.5B — الآن بعيون

يحتفظ Ling-3.0-flash-VL بمنهجية MoE المتناثرة الهجينة التي ميّزت النسخة النصية الشقيقة. تصف البطاقة شبكة أساسية من 42 طبقة تتناوب بين طبقات Kimi-Delta-Attention وGated-MLA بنسبة 5:1 — وهي نفس البنية الإيقاعية لنموذج Ling-3.0-flash — بإجمالي معاملات يبلغ حوالي 124.8 مليارًا، ولا يُفعَّل منها سوى جزء صغير لكل رمز. الجديد هو مجموعة الإدراك: مُرمِّز بصري من نوع ViT يغذي مُسقِط MLP من طبقتين يتصل بالشبكة الأساسية اللغوية، بالإضافة إلى VideoRoPE لتشفير الموضع المكاني والزماني معًا، بحيث تصل إطارات الفيديو بترتيبٍ يمكن للنموذج التفكير فيه. المدخلات هي النص والصورة والفيديو، والمخرجات نص.

• المعلمات — 124B إجمالاً، ~5.5B مُفعَّلة لكل رمز وفقًا لبطاقة البائع (انظر تحفّظ المحاسبة أعلاه).

• السياق — المُعلن عنه يدعم ما يصل إلى مليون رمز (توكن)؛ لكن خطط النشر المتاحة اليوم تعمل عند 256 ألف رمز عبر توسعة النطاق YaRN، وهذا هو الرقم العملي الصادق الذي ينبغي التخطيط على أساسه حتى ينشر أحدهم تشغيلًا أطول تم التحقق منه.

• التفكير — الاستدلال مفعّل افتراضيًا عبر قالب المحادثة؛ تُظهر كل من أمثلة واجهة برمجة التطبيقات (API) الرسمية ووصفات التشغيل مفتاح تبديل لكل طلب، وهو enable_thinking: false، للمكالمات الحساسة لزمن الاستجابة.

• الترخيص — MIT، لكلا صيغتي الدقة، بدون أي شروط إضافية. هذا هو نفس الترخيص النظيف الذي جعل فتح مصدر نموذج النص في أغسطس حدثًا بارزًا، وهو السبب الكامل في أن الاستضافة الذاتية خيار واقعي بدلاً من منطقة رمادية.

يُعدّ القصد من التصميم بنفس أهمية ورقة المواصفات. تضع أنت نموذج Ling-3.0-flash-VL كطرازٍ "يُدخل المعلومات البصرية في العملية الكاملة للفهم والاستدلال والتنفيذ والتحقق" {{1}}— وهي لغة أعباء العمل الوكيلية، لا لغة التعليق على الصور.{{/1}} إن نموذجًا يمكنه مشاهدة تسجيل شاشة مدته 30 ثانية،{{2}} والاحتفاظ بجلسة استدعاء أدوات طويلة في السياق،{{/2}} وإبقاء تكلفته النشطة قريبة من 5B معاملات،{{3}} يستهدف مباشرةً العملاء الذين يستخدمون الحاسوب والوكلاء المستندين إلى الفيديو القصير.{{/3}} هذا منتج مختلف عن نماذج اللغة المرئية المُحسّنة للإجابة عن الأسئلة عبر صورة واحدة، وهو الإطار الذي يجب أن تُقرأ جميع المعايير أدناه على ضوئه.

ما الذي تقبله واجهة برمجة التطبيقات الرسمية فعليًا

يوثّق البرنامج التعليمي لمنصة Ant Ling نموذج Ling-3.0-flash-VL على شكلين من واجهات API: نقطة نهاية متوافقة مع OpenAI على الرابط api.ant-ling.com/v1/chat/completions ونقطة نهاية متوافقة مع Anthropic على الرابط api.ant-ling.com/anthropic/v1/messages. يجدر بك معرفة هذه القيود قبل البناء على المنصة:

• الصور — JPEG و PNG، بصيغة base64 فقط، حتى 40 صورة لكل طلب، أبعاد كل صورة حتى 16,384 × 784 بكسل، وكل سلسلة base64 حتى 32 ميجابايت. أما المتوافق مع OpenAI image_url.detail، فهو المعامل الذي يتم تجاهله؛ ويقرر المحرك الدقة داخليًا.

• فيديو — MP4 أو MOV أو WMV، مقطع واحد لكل طلب، بحد أقصى 30 ثانية، يتم أخذ عينات منه بمعدل ثابت يبلغ إطارين في الثانية حتى 32 إطارًا، وbase64 يصل إلى 32 ميجابايت. يعمل الفيديو على نقطة النهاية المتوافقة مع OpenAI فقط؛ بينما تقبل نقطة النهاية المتوافقة مع Anthropic النصوص والصور ولكن ليس الفيديو.

• معرّف النموذج — تستدعي أمثلة curl في الدليل التعليمي النموذج Ling-3.0-flash-VL-rc1 بدلاً من Ling-3.0-flash-VL. إنّ -rc1 لاحقة تدل على نسخة مرشّحة للإصدار، وهذه مسألة مفتوحة حقيقية: لا شيء في الوثائق يذكر أي الأوزان تقدمها المنصة، ولا ما إذا كانت نقطة تحقّق الـ API مطابقةً لإصدار الأوزان المفتوحة الصادر في 4 سبتمبر. وإذا كنت تختبر الـ API مقارنةً بالأوزان المفتوحة، فهذا أول ما يجب أن تختبره، لا أن تفترضه.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

الصفحة أعلاه هي مكان تواجد قيود الإدخال — تنسيقات الصور والفيديو، والسقوف القصوى لكل طلب، وشكلا نقطتي النهاية. وهي أيضًا المكان الذي يُؤكَّد فيه أن النموذج هو واجهة برمجة تطبيقات تجارية حية وليست مجرد هيكل وثائقي فقط.

الأرقام — ومن أوردها

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

الرقم البارز الوحيد على البطاقة هو 42 على بروتوكول الإصدار 4.1.1 من Artificial Analysis Intelligence Index، وهو ما تقول Ant إنه يتقدّم بأربع نقاط على درجة Ling-3.0-flash النصّي فقط البالغة 38. التمييز في تلك الجملة جوهري. الرقم 38 قياسٌ من Artificial Analysis — أُجري بشكل مستقل، ونُشر على لوحة صدارتهم، واقتُبس باستحسان في التغطية الصحفية للقطاع للنموذج النصي. أما الرقم 42 فادّعاءٌ على بطاقة نموذج Ant نفسها، صِيغ بموجب بروتوكول مؤشر AA لكنه غير مُدرج بعد لدى Artificial Analysis، التي لم تكن لديها أي صفحة لـ Ling-3.0-flash-VL وقت كتابة هذا المقال. لم يشغّل أي طرف خارج Ant نقطة التحقق هذه بعد. تعامل مع 42 بوصفه رقمًا من جهة مورّد ينتمي إلى العائلة نفسها التي أنتجت الرقم الحقيقي 38 للنموذج النصي — سببٌ للنظر، لا رقمٌ يُستشهد به بوصفه أمرًا مثبتًا.

أما كل ما سواه في هذا الإصدار فهو كيفي أو منهجي؛ فبطاقة النموذج تصف الموديل عبر مخطط قدرات بعنوان «فهم، واستدلال، وتنفيذ» وتلمّح إلى تقييم وكيلي على Terminal-Bench أُجري وفق بروتوكول بأسلوب AA، لكنها لا تنشر أي نتائج رقمية نصية يمكننا إعادة إنتاجها هنا. ويسرد دليل النشر خلايا دقة (MMMU-Pro، GSM8K) مرتبطة بإعدادات خدمة محددة، وهذه الخلايا جديرة بالاطلاع، لكنها قياسات على صلة بالبنية التحتية وليست تقييمات مستقلة. الخلاصة الصادقة قصيرة: نموذج استدلال معقول، منخفض تكلفة الخدمة، قادر على معالجة الصور، وبلا لوحة نتائج مستقلة متاحة للعموم بعد.

ما هي تكلفته، وما الذي يوحي به تاريخ العائلة؟

دليل شركة أنت التعليمي متعدد الوسائط لا يدرج سعرًا لكل توكن لنموذج Ling-3.0-flash-VL، لذا فإن أي شيء هنا هو استنتاج، ومُعلَّم بوضوح على هذا النحو. النقطة المرجعية المفيدة هي النموذج النصي الشقيق على المنصة نفسها: سعر القائمة الرسمي لنموذج Ling-3.0-flash يبلغ نحو 0.075 دولار لكل مليون توكن إدخال و0.22 دولار لكل مليون توكن إخراج، مع قراءات كاش أرخص بنحو 80%، كما تسعّره وحدة التحكم الصينية بالرنمينبي (¥0.40 إدخال / ¥1.20 إخراج لكل مليون توكن) بعد عرض ترويجي مبكر بخصم 75% انتهى في 31 أغسطس. النموذج متعدد الوسائط 124B-A5.5B أكثر تكلفة في التشغيل من النموذج النصي 124B-A5.1B — إذ إن برج الرؤية كثيف ويعمل لكل توكن صورة — لذا فإن سعرًا يقع عند تلك الفئة أو أعلى منها بقليل يعد افتراضًا مسبقًا معقولًا. غير أن تاريخ العائلة يؤشر في الاتجاه الآخر أيضًا: فالمتغيران النطاقيان Fin وSante أُطلقا كواجهات برمجة تطبيقات مجانية، لذا فقد أظهرت أنت أنها ستستخدم التسعير الصفري لزرع التبني لأي متغير من Ling ترغب في وجوده في السوق. أما ما إذا كان نموذج VL سيتبع فئة النموذج النصي المدفوع أو نمط المتغير المجاني فببساطة ليس معلنًا بعد.

بالنسبة لمسار الاستضافة الذاتية، الأرقام ملموسة لأن الملفات عامة. إصدار bf16 هو تنزيل يبلغ نحو 250 جيجابايت عبر 64 شريحة — وهو أمر يتطلب وحدات معالجة رسومية متعددة إلا على أكبر العقد الفردية — في حين أن إصدار FP8 (حوالي 126 جيجابايت، مع إبقاء برج الرؤية في bf16) يتسع بشكل مريح على عقدة بها 8 مسرعات من فئة 80 جيجابايت، وهو الإصدار الذي ستشغله معظم الفرق فعليًا. توجد الادعاءات المتعلقة بالإنتاجية من دليل التقديم (serving cookbook) لكنها مرتبطة بالمورّدين؛ وتوقع التحذير المعتاد بأن معدل token/s الفعلي يعتمد على أجهزتك ودفعتك.

أين تتناسب طبقة التوجيه — بصراحة

عند الإطلاق، لا تذكر أي بوابة نماذج خارجية رئيسية فحصناها نموذج Ling-3.0-flash-VL، كما أن OrcaRouter — منصة التوجيه التي تنتمي إليها هذه المدونة — لا يوفّره أيضًا. لا يُقصد من أي شيء في هذا النص أن يوحي بغير ذلك. هذه هي الحقيقة الصريحة لنموذج عمره أربعة أيام، ويجدر قولها بوضوح لأن الخيارات الفعلية المتاحة للقارئ اليوم هي اثنان فقط: الاتصال بواجهة Ant الرسمية، أو استضافة أوزان MIT ذاتيًا. أما مسألة التوجيه فهي ما سيحدث بعد ذلك. متى وصل نموذج مثل هذا إلى خدمة الأطراف الثالثة، تصبح اقتصاديات جهاز التوجيه المباشر هي سبب تفضيله في التقييم: سعر القائمة لدى المزود يُمرَّر بهامش ربح 0%، لذا فإن أي تخفيض من البائع (أو تجربة طبقة مجانية مثل إطلاقَي Fin وSante) يظهر في نفس يوم إعلانه، كما أن تجاوز الفشل التلقائي يتيح لك توجيه عمل حقيقي نحو نموذج مفتوح عمره أيام دون المخاطرة ببنيتك على وقت تشغيل مزود واحد أو سلوك نقطة تحقق واحدة. وبالنسبة لعائلة أعادت تسعير نفسها مرة واحدة ثم تفرّعت إلى أربعة متغيرات في ستة أسابيع، فإن هذا ليس أمرًا افتراضيًا — بل هو الفرق بين إعادة الاختبار يدويًا كلما تحرّكت Ant، وإعادة الاختبار مرة واحدة عبر واجهة API واحدة.

ماذا تشاهد

هذا الإصدار حديثٌ بما يكفي لأن تكون الإشارات المفيدة فيه غالبًا مجرد فحوصات يمكن لأي شخص إجراؤها. أولًا: هل تُدرج Artificial Analysis (أو مختبرٌ مستقلٌ آخر) النموذج Ling-3.0-flash-VL وتؤكّد الرقم 42 أو تصحّحه؟ فهذه النقطة المفردة هي ما يفصل بين «أفضل نموذج في العائلة» و«رقمٍ آخر من مورّد». ثانيًا: ما إذا كان -rc1 هو المُعرِّف الموجود على واجهة API الرسمية الذي يشير إلى الأوزان المفتوحة بتاريخ 4 سبتمبر؛ وإذا لم يفعل، فإن واجهة API ومسار الاستضافة الذاتية نموذجان مختلفان، وكل مقارنة تقرؤها ينبغي أن توضّح أيّهما استُخدم. ثالثًا: التسعير؛ هل يوجد سعر VL منشور على منصة Ling، وهل يتبع النطاق المدفوع لنموذج النص أم نهج Fin/Sante في جعل API مجانيًا؟ رابعًا: هل تحافظ نقطة فحص FP8 على دقة البطاقة في الخدمة الفعلية؟ إن إبقاء برج الرؤية في bf16 علامة جيدة، لكن ادعاءات تكميم الرؤية تحتاج إلى تشغيلٍ فعلي لا إلى مجرد إعداد. وخامسًا: مسألة خارطة المنتجات؛ فمع وجود الرؤية الآن داخل خط Ling السريع، راقب ما إذا كانت Ant ستُبقي Ming علامةً تجارية متعددة الوسائط منفصلة أم ستسمح لهما بالتقارب.

بالنسبة للمطوّر، الإجابة على المدى القريب قصيرة. إذا كنت تريد الاعتماد على هذا اليوم، فإن واجهة برمجة التطبيقات الرسمية هي مسار البنية التحتية الصفرية، وأوزان FP8 هي مسار الاستضافة الذاتية، وكلا الأمرين واقعيان اعتبارًا من هذا الأسبوع. وإذا كنت تريد البناء على الرقم 42، فانتظر حتى يقوم شخص خارج Ant بإعادة إنتاجه. كل ما هو مفيد حقًا في Ling-3.0-flash-VL — أوزان MIT، بنية معقولة، تصميم جريء لنسبة السعر إلى التفعيل، وتقييم بائع يستحق أن يؤخذ بجدية — موجود بالفعل؛ أما كل ما من شأنه أن يجعله خيارًا افتراضيًا آمنًا فما يزال معلقًا.