
لينغ-3.1-فلاش يسجل 41 على مؤشر الذكاء الاصطناعي للتحليل الاصطناعي: نموذج الخبراء المزيج بـ560 مليار معلمة يضاعف سابقه
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Ling-3.1-flash، نموذج خليط الخبراء من Ant Group البالغ 560 مليار معامل، يحمل الآن رقمًا لم يكتبه مختبره الخاص: 41 على مؤشر الذكاء Artificial Analysis Intelligence Index. يُدار هذا المؤشر بواسطة جهة تقييم مستقلة، على عتاد تتحكم فيه جهة التقييم، مقابل مجموعة اختبارات ثابتة — وهو يضع النموذج أعلى بـ21 نقطة من سابقه المباشر، Ling-3.0-flash، الذي لا يزال عند 20 على المؤشر نفسه. أعلنت Ant عن Ling-3.1-flash في نهاية سبتمبر 2026، بينما تؤرخ Artificial Analysis الإصدار في 1 أكتوبر، وهو أصغر بثلاثة أشهر من النموذج الذي يضاعف نتيجته.
تلك الفجوة هي القصة. تحرّك بمقدار 21 نقطة على مؤشر مركّب تُغذّيه عشرة تقييمات مختلفة ليس من النوع الذي يمكن لرسم بياني لمورّد أن يزوّره، وليس من النوع الذي كان بإمكان هذه المدونة أن تكتب عنه قبل أسبوعين، حين كان القياس الوحيد الموجود لـ Ling-3.1-flash هو بطاقة المعايير الخاصة بـ Ant نفسها: 1,673 إيلو على GDPval-AA v2.1، و75.16 على FrontierSWE، و65.35 على HealthBench Professional. كانت تلك الأرقام ادعاءات حقيقية من مختبر حقيقي، لكنها لم تُعَد إنتاجها. أما الـ41 فمختلف في نوعه. إنه أول رقم في هذا الإصدار يمكن مساءلة طرف ثالث عليه.
ما الذي يقيسه الـ41 فعليًا
يُعدّ Artificial Analysis Intelligence Index v4.3.2 مقياسًا مركّبًا مرجّحًا لعشر تقييمات: AA-Briefcase v1.1، وGDPval-AA v2.1، وAutomationBench-AA، وTerminal-Bench 4.0، وSciCode، وHumanity's Last Exam، وGDP.pdf، وCritPt، وAA-Omniscience، وAA-LCR v1.1. إن قراءة مقياس مركّب بمعزل عن غيره خطأ، لذا فإن الصفوف الخاصة بكل تقييم تهم أكثر من العنوان الرئيسي:
• GDPval-AA — 1,621.75 لـ Ling-3.1-flash مقابل 948.35 لـ Ling-3.0-flash. هذه أكبر قفزة منفردة في المجموعة، وعليها يعتمد معظم تحرّك المؤشر.
• GDP.pdf — 0.100 اجتياز كامل، ارتفاعًا من 0.054. لا يزال منخفضًا بالقيم المطلقة، لكنه شبه تضاعف.
• AA-LCR v1.1 للاستدلال طويل السياق — 0.83 مقابل 0.73 للسلف، وعلى قدم المساواة مع DeepSeek V4.1 Flash (Max) عند 0.84.
• SciCode — 0.541 مقابل 0.420. مكسب في علوم البرمجة، وليس مكسبًا في جودة المحادثة.
• استدلال الفيزياء في CritPt — 0.180، مقابل 0.017 سابقًا. عشرة أضعاف سابقه على قاعدة صغيرة.
• AA-Omniscience — +2.22، مقابل −17.88 لـ Ling-3.0-flash. يُناقَش هذا أدناه، لأنه يتعارض مع...
لم يخسر Ling-3.0-flash أمام Ling-3.1-flash في هذه الصفوف فحسب؛ بل انهار في اثنين منها. سجّل 0.032 على AutomationBench-AA و0.000 بالضبط على Terminal-Bench 4.0. هذا هو السياق الذي ينبغي أن يُقرأ فيه الرقم 41 — كان النموذج السابق نموذجًا فعّالًا ورخيصًا ومفتوح الأوزان، ولم تكن لديه تقريبًا أي قدرة على العمل الوكيلي في الطرفية على الإطلاق.

من أين جاء المكسب: العمل الوكيلي، لا المحادثة
قارن مساهمات Ling-3.1-flash في المؤشر مع نموذجَي فئة Flash اللذين غالبًا ما يُوضع إلى جانبهما، وسيظهر نمط يخفيه الإجمالي. يسجّل DeepSeek V4.1 Flash (Max) 39 في المؤشر نفسه، ويسجّل GLM 5.3 Flash 42، فتقف الثلاثة جميعًا داخل نطاق من ثلاث نقاط. لكنها تصل إلى هناك من مواضع مختلفة.
• العمل الطرفي الوكيلي — Ling-3.1-flash 0.333 على Terminal-Bench 4.0، وDeepSeek V4.1 Flash (Max) 0.268، وGLM 5.3 Flash 0.328.
• العمل الواقعي القائم على الوكلاء — Ling-3.1-flash 1,621.75 Elo على GDPval-AA، وDeepSeek V4.1 Flash (Max) 1,600، وGLM 5.3 Flash 1,646.86.
• AutomationBench-AA — Ling-3.1-flash 0.617، DeepSeek V4.1 Flash (Max) 0.689، GLM 5.3 Flash 0.604.
• علم البرمجة — Ling-3.1-flash 0.541 على SciCode، DeepSeek V4.1 Flash (Max) 0.519، GLM 5.3 Flash 0.516.
القراءة الضيقة هي أن Ling-3.1-flash منافس في معايير الوكلاء ومتقدم قليلاً في SciCode. القراءة المفيدة هي أنه الأقوى من بين الثلاثة في مقياسي الطرفيات الوكيلية اللذين يقصدهما معظم الناس عندما يقولون "هل يمكنه قيادة حلقة أدوات" — وهو متأخر عن كليهما في مقياس موثوقية المعرفة. هذا نمط محدد، وليس فوزاً عاماً، ويستحق التسمية قبل أن يشتري أي شخص عبء عمل بناءً على رقم المؤشر وحده.
الفاتورة التي تأتي مع طراز أكبر
كان سعر Ling-3.0-flash محددًا عند 0.07 دولار لكل مليون رمز إدخال و0.22 دولار لكل مليون رمز إخراج على واجهة برمجة التطبيقات الخاصة بـ Ant، وكان متاحًا بأوزان مفتوحة بموجب رخصة MIT. أما Ling-3.1-flash فليس أيًّا من هذين الأمرين بعد. تسجّل Artificial Analysis تكلفة تشغيله عند 0.30 دولار لكل مليون إدخال و0.90 دولار لكل مليون إخراج — مع سعر للإصابة في الذاكرة المؤقتة قدره 0.06 دولار، وهو خصم بنسبة 80% على الإدخال — محسوبة مقابل واجهة برمجة التطبيقات الخاصة بـ InclusionAI بصفتها مزوّد الخدمة. وهذا يمثل زيادة تناهز أربعة أضعاف في سعر الإدخال مقارنةً بالنموذج الذي يحل محلّه، مقابل مكسب قدره 21 نقطة في المؤشر.
ما إذا كانت هذه المقايضة جيدة يعتمد كليًا على عبء العمل، ويمكن للمؤشر نفسه أن يسعّرها: فتشغيل جميع تقييمات مؤشر الذكاء العشرة على Ling-3.1-flash يكلّف نحو 960 دولارًا بهذه المعدلات، مقابل نحو 477 دولارًا لـ DeepSeek V4.1 Flash (Max) و280 دولارًا لـ GLM 5.3 Flash. والسبب ليس بطاقة الأسعار فقط. فـ Ling-3.1-flash مستدلّ كثير الكلام — إذ استهلك 220 مليون رمز إخراج أثناء معالجة المؤشر، وهو أعلى بكثير من الوسيط لفئته السعرية، كما أن دورات تقييمه تستغرق في المتوسط نحو 357 ثانية لكل مهمة، مقابل 285 ثانية لـ DeepSeek V4.1 Flash (Max) و979 ثانية لـ GLM 5.3 Flash. وعلى أساس كل مهمة، يكلّف Ling-3.1-flash نحو 0.99 دولار، مقابل 0.27 دولار لـ DeepSeek و0.25 دولار لـ GLM 5.3 Flash.
لا شيء من هذا مرئي من الـ41، وكلّه يصل إلى الفاتورة. يمكن لنموذج أن يفوز بمؤشر ويخسر ميزانية.
الرقمان اللذان يتعارضان مع العنوان الرئيسي.
الأول هو موثوقية المعرفة. يسجّل Ling-3.1-flash +2.22 على AA-Omniscience، الذي يقيس ما إذا كان النموذج يعرف ما يعرفه: الإجابات الصحيحة تكسب نقاطًا، والهلوسات تخسر نقاطًا، والامتناع لا يكلّف شيئًا. معدل دقته 29.1% ومعدل هلوسته 37.9%. وبوضعه إلى جانب نظرائه، يكون ذلك أضعف ملف في المجموعة — إذ يسجّل GLM 5.3 Flash +7.47 مع معدل هلوسة 27.6%، ويسجّل DeepSeek V4.1 Flash (Max) −5.30 مع معدل هلوسة مذهل يبلغ 96.5% بين الأسئلة المُجاب عنها. يكافئ المقياس المركّب Ling-3.1-flash على القدرة التي يُظهرها، لا على الموثوقية التي يُظهرها بها، والنموذج الذي يختلق ثلث ما يؤكده يحتاج إلى استرجاع حوله في بيئة الإنتاج.
الثاني هو السياق. تدرج Artificial Analysis نموذج Ling-3.1-flash بنافذة سياق تبلغ 1,000,000 توكن. وتشير مواد الإصدار الخاصة بـ Ant أيضًا إلى 1M كهدف. لكن وثائق المطورين الخاصة بـ Ant، التي تعدّد نوافذ العائلة نموذجًا بنموذج، تمنح Ling-3.0-flash نافذة أصلية تبلغ 1M قابلة للتمديد إلى 1، ولا تحمل بعد أي مدخل لـ Ling-3.1-flash على الإطلاق. الصف المميز للسياق الطويل الذي جرى قياسه فعلًا — AA-LCR عند 0.83 — هو نتيجة استدلال على سياق طويل، وليس قياسًا لنافذة مقدمة. تعامل مع 1M باعتباره النافذة المعلنة، وتحقق من النافذة المسلَّمة عبر طلب السياق الطويل الخاص بك قبل أن تصمم على أساسه.
كيف يقارن على ورقة المواصفات
الصورة بُعدًا بُعدًا، الموضوع أولًا، في كل سطر:
• إجمالي المعلمات — Ling-3.1-flash 560B مقابل DeepSeek V4.1 Flash (Max) 552B مقابل GLM 5.3 Flash 320B.
• المعلمات النشطة لكل رمز — Ling-3.1-flash 25B مقابل DeepSeek V4.1 Flash (Max) 16B مقابل GLM 5.3 Flash 18B. يُعد Ling-3.1-flash الأكثر تنشيطًا، وهذا أحد أسباب بقاء تكلفة خدمته عند ما هي عليه.
• الأوزان والترخيص — Ling-3.1-flat غير منشور (مملوك، لا يوجد نص ترخيص) مقابل DeepSeek V4.1 Flash (Max) مفتوح بموجب MIT مقابل GLM 5.3 Flash مفتوح بموجب MIT.
• السياق المُعلَن — Ling-3.1-flash 1M مقابل DeepSeek V4.1 Flash (Max) 1M مقابل GLM 5.3 Flash 1M. الثلاثة جميعًا يدّعون السقف نفسه؛ لكن اثنين فقط منهما يملكان نقطة تحقق قابلة للتنزيل يمكنك التحقق من خلالها.
• الوسائط — Ling-3.1-flash: إدخال نص، إخراج نص مقابل DeepSeek V4.1 Flash (Max): إدخال نص وصورة مقابل GLM 5.3 Flash: إدخال نص وصورة وفيديو. هذا هو المحور الوحيد الذي يتخلف فيه Ling-3.1-flash ببساطة، ولا يعوّض عنه أي صف في المعايير.
• السعر على واجهة برمجة التطبيقات الخاصة بالمورّد — Ling-3.1-flash $0.30 / $0.90 لكل مليون إدخال / إخراج مقابل DeepSeek V4.1 Flash (Max) $0.30 / $1.20 مقابل GLM 5.3 Flash $0.15 / $0.50.
• درجة المؤشر — 41 مقابل 39 مقابل 42. فارق ثلاث نقاط في مقارنة ثلاثية لا يشكّل ترتيبًا؛ بل هو تعادل يحسمه أي تقييم يشبه عبء عمل القارئ.
حيث يمكنك الاتصال به
Ling-3.1-flash ليس مدرجًا في كتالوج OrcaRouter اليوم — إذ يعيد الاستعلام عبر واجهة API العامة للنماذج لدينا عن النموذج التابع لـ InclusionAI نتيجة "غير موجود"، ولن نلمّح إلى خلاف ذلك. وهو يعمل حاليًا عبر API الخاص بـ Ant وعلى منصات طرف ثالث تحمل هذا الإصدار، وهذا هو المدى الصادق لتوفره. وما يجدر ملاحظته لأي شخص يقارن النماذج الثلاثة أعلاه هو أن النموذجين الآخرين قابلان للتوجيه الآن: كل من DeepSeek V4.1 Flash وGLM 5.3 Flash موجودان في كتالوج OrcaRouter بأسعار القائمة لدى مزوديها مع هامش ربح صفري، عبر مفتاح API واحد، مع تحويل تلقائي عند الفشل بينهما. إذا كانت المقارنة أعلاه تشير إلى أن عبء العمل لديك يهتم بموثوقية المعرفة أكثر من العمل الوكيلي في الطرفية، فإن GLM 5.3 Flash هو الذي ينبغي تجربته — ويمكنك تجربته مقابل DeepSeek V4.1 Flash على المفتاح نفسه دون عقد ثانٍ أو سطر واحد من كود العميل الجديد.
ما الذي يغيّره الـ41، وما الذي لا يغيّره
ما يغيّره هو مكانة الإصدار. لم يعد Ling-3.1-flash مواصفةً مرفقةً بمخطط من المورّد؛ بل أصبح نموذجًا له موقع مُقاس بشكل مستقل، وهذا الموقع يمثل قفزة جيلية حقيقية في القدرات الوكيلية مقارنةً بـ Ling-3.0-flash — ذلك النوع من القفزات الذي يأتي من تغيير في التصميم لا من مزيد من الحوسبة على الوصفة نفسها. وما لا يغيّره هو أي شيء يتعلق بالمشتريات. لا تزال الأوزان مغلقة، والترخيص لا يزال غير مكتوب، والنمط لا يزال نصيًا فقط، والسعر يعادل نحو أربعة أضعاف سعر سابقه مقابل مكسب يتركّز في مهام الوكلاء والطرفية.
إذا كان عملك يقوم على حلقات الوكلاء، وتشغيل الأدوات، وسلاسل الأدوات الطويلة، فإن الرقم 41 هو أكثر رقم ذي دلالة صدر عن هذا النموذج حتى الآن، وهو يستحق نظرة جادة ما دامت إتاحته لا تزال تتوسع. أما إذا كان عملك متعدد الوسائط، أو قائمًا على الإجابة عن أسئلة حساسة معرفيًا، أو على استدلال عالي الحجم حساس للميزانية، فإن الرقم 41 لا يبلغ مشكلتك — وGLM 5.3 Flash، القابل للتوجيه بالفعل والمفتوح بالفعل بموجب MIT بنصف سعر المخرجات، هو النموذج الأفضل موقعًا بين الثلاثة. يخبرك المؤشر بمكانة Ling-3.1-flash. لكنه لا يخبرك بما إذا كان ينبغي أن يهمك ذلك، وهذا السؤال تجيب عنه طبيعة ما تبنيه.


مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
