
يتصدّر Xiaomi MiMo-V2.6-Pro مؤشر الأوزان المفتوحة برصيد 46 — وينشر فاتورة التدريب
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
شاومي MiMo-V2.6-Pro هو الآن النموذج الأعلى تصنيفًا مفتوح الأوزان على مؤشر الذكاء التابع لـ Artificial Analysis، عند 46 على الإصدار v4.3.2 — بفارق نقطة واحدة عن GLM-5.3 ونقطتين عن Kimi K3، و20 نقطة فوق الـ26 التي سجلها سلفه MiMo-V2.5-Pro على مقياس المؤشر الأسبق. هذا الرقم أنتجته Artificial Analysis عبر تشغيل أداة التقييم الخاصة بها، وليس شاومي، وهو المعلومة الأكثر فائدة في هذا الإصدار. المعلومة الثانية الأكثر فائدة هي السعر المطبوع بجانبه: 0.43 دولار لكل مليون توكن إدخال، و0.87 دولار لكل مليون توكن إخراج، مقابل 5.00 و25.00 دولارًا لـ Claude Opus 5 — وهو نموذج يتقدم بخمس نقاط في المؤشر. الثالثة هي ما لم يتوقع أحد أن تكشف عنه شاومي: كشف حساب علني لما كلفته بالفعل عملية التعلم المعزز التي أنتجت MiMo-V2.6-Pro.
النتيجة قياس، وليست ادعاءً.
يكاد يكون كل ما يُنشَر عن إطلاق نموذج صيني وصلًا في صورة رقم من المورّد، وقد تعلّم القرّاء أن يقللوا من قيمته. هذا الإطلاق مختلف، والاختلاف يستحق أن نكون دقيقين بشأنه لأن تغطية الإطلاق قد شوّشته بالفعل.
قامت Artificial Analysis بتقييم MiMo-V2.6-Pro نفسه، على المركّب v4.3.2 — عشر تقييمات تغطي الاستدلال والمعرفة والرياضيات والبرمجة، بما في ذلك AA-Briefcase v1.1 وGDPval-AA v2.1 وAutomationBench-AA وTerminal-Bench 4.0 وSciCode وHumanity's Last Exam وGDP.pdf وCritPt وAA-Omniscience وAA-LCR v1.1. الرقم 46 هو ما أسفرت عنه تلك المجموعة. كما سجّلت الخصائص التشغيلية التي تحدد ما إذا كان النموذج قابلاً للاستخدام بدلاً من كونه جيدًا فحسب: 134.3 رمز إخراج في الثانية، و2.15 ثانية حتى أول رمز، وخصم بنسبة 99% على الذاكرة المؤقتة، وتكلفة مقاسة قدرها 0.13 دولار لكل مهمة في Intelligence Index.
يستحق اثنان من تلك التأكيد. معدل 134.3 رمزًا في الثانية يضع MiMo-V2.6-Pro في المرتبة الحادية عشرة من بين 114 نموذجًا من حيث السرعة — وبالنسبة لنموذج خليط الخبراء بتريليون معامل، فهذه نتيجة خدمة، وليست مجرد نتيجة تدريب. و0.13 دولار لكل مهمة هو الرقم الذي يصمد أمام الميزانية: فهو التكلفة الفعلية لتشغيل المؤشر على هذا النموذج، مقيسة بالطريقة نفسها عبر كل نموذج على اللوحة، ما يجعله قابلًا للمقارنة على نحو لا تكون عليه أسعار الرموز المعلنة في العناوين قابلة للمقارنة.

ما يغطيه الفهرس وما لا يغطيه
تاج النماذج مفتوحة الأوزان حقيقي، لكنه أضيق مما يبدو عليه. عند 46، يتصدر MiMo-V2.6-Pro فئة الأوزان المفتوحة. لكنه لا يتصدر المؤشر. قمة v4.3 هي Claude Fable 5.1 بأقصى جهد مع احتياطي افتراضي وGPT-6 Astra بأقصى جهد، وكلاهما عند 53، مع Claude Opus 5 عند 51 وClaude Fable 5 عند 50. لذا فالتوصيف الصادق هو فجوة قدرها خمس نقاط عن الطليعة في مؤشر مركّب يكافئ الاتساع، وتحسّن قدره عشرون نقطة عن الجيل السابق لشاومي نفسه.
• الرائد في الأوزان المفتوحة — Xiaomi MiMo-V2.6-Pro 46، GLM-5.3 (max) 45، Kimi K3 (max) 44
• قمة المؤشر نفسه — Claude Fable 5.1 (الأقصى، الاحتياطي) 53، GPT-6 Astra (الأقصى) 53، Claude Opus 5 (الأقصى) 51
• السرعة — 134.3 رمز إخراج في الثانية، الحادي عشر من بين 114 نموذجًا تم قياسها؛ الوسيط لفئة الحجم هو 77.9
• الوقت حتى أول رمز — 2.15 ثانية، مقابل وسيط قدره 2.34 ثانية
• تكلفة كل مهمة في مؤشر الذكاء — 0.13 دولار، مع تكلفة تشغيل التقييم بأكمله 206.66 دولار
• السعر المدرج — 0.43 دولار لكل مليون رمز إدخال، و0.87 دولار لكل مليون رمز إخراج، وخصم 99% على التخزين المؤقت، وسعر مدمج قدره 0.18 دولار عند مزيج إصابة الذاكرة المؤقتة/الإدخال/الإخراج بنسبة 7:2:1
ثمة رقم واحد في صفحة Artificial Analysis يمثّل تحفّظًا حقيقيًا لا مفخرة: فقد أحصى مزوّد API واحدًا فقط لـ MiMo-V2.6-Pro وقت كتابة هذه السطور. وهذا هو عنق الزجاجة العملي أمام هذا النموذج الآن، وهو ليس مشكلة جودة — بل مشكلة توافر. النموذج الذي يمكن الوصول إليه عبر مسار واحد لا يملك أي تجاوز للفشل. وإذا تدهور ذلك المسار، تدهور تطبيقك معه، وقصة تجاوز الفشل هي بالضبط ما وُجد الموجّه لتوفيره. والملاحظة ذات الصلة لأي شخص يخطط بناءً على هذا الإصدار هي أننا لا نستضيف MiMo-V2.6-Pro، ولن ندّعي خلاف ذلك؛ فالمسار إليه اليوم هو منصة Xiaomi نفسها والمجموعة القليلة من الكتالوجات الخارجية التي تدرجه.

الرقمان اللذان لا يجب الخلط بينهما
نشرت شاومي أيضًا أرقام قياس أداء خاصة بها، وهي من نوع مختلف عن الـ46. تُفيد لوحة معلومات الشركة بأن MiMo-V2.6-Pro ينتقل من 58.4 إلى 72.57 على DeepSWE v1.1 خلال مسار التعلم المعزز الخاص به، بعد تقييمه باستخدام mini-swe-agent بمتوسط ثلاث مرات. هذا هو نظام اختبار شاومي، ومُقيّم شاومي، وتشغيل شاومي دون اتصال. لم يُقدَّم إلى لوحة صدارة DeepSWE العامة، ولم يُعِد أحد إنتاجه.
اقرأ الاثنين جنبًا إلى جنب وستكون المغريات أن تتعامل مع 72.57 باعتباره نتيجة على قدم المساواة مع نسبة 74% التي تدرجها لوحة DeepSWE العامة في الطبقة العليا. إنهما ليسا على المقياس نفسه. رقم لوحة الصدارة هو تكوين مُقدَّم، Pass@1، مصحوب بفاصل ثقة منشور ومتوسط تكلفة لكل مهمة؛ أما رقم المورّد فهو تقييم داخلي لا يرافقه أيٌّ من ذلك. وقد أشارت مقالتنا الصادرة في 21 سبتمبر إلى هذه النقطة حين كانت الأرقام لا تزال مجرد قراءات على لوحة معلومات، وهي تصح الآن بعد إتاحة الأوزان. يمكن أن يكون منصةَ تقييم المورّد صادقًة تمامًا ومع ذلك ألّا تكون مدخلًا في لوحة الصدارة، لأن مدخل لوحة الصدارة ادعاء عن تكوين محدّد في ظروف محدّدة يمكن لطرف ثالث إعادة تشغيله.
ينطبق الانضباط نفسه على نفقات التدريب. تُبلغ Xiaomi عن نحو 3,474,715 دولارًا عبر التشغيلين Pro وFlash — 2,620,670 دولارًا لـPro، و854,044 دولارًا لـFlash — على مدى أكثر من ثلاثين خطوة تعلّم معزز لكل منهما وحوالي 750,000 مسار لكل واحد، وأُنجز ذلك في أقل من ستة أيام. هذه هي أرقام محاسبة الحوسبة الخاصة بالشركة. وهي مثيرة للاهتمام لأن المختبرات لا تنشرها تقريبًا أبدًا، وهي ليست سعر API، ولا تكلفة ستدفعها، ولا رقمًا دقّق فيه أي طرف ثالث.
ما الذي طرحته شاومي فعليًا
الإصدار عبارة عن نموذج خليط خبراء متناثر بإجمالي 1.02 تريليون معامل، مع تنشيط 42 مليارًا لكل رمز، ونافذة سياق تبلغ مليون رمز، وتعدد وسائط أصلي عبر النص والصورة والفيديو والصوت. نظيره Xiaomi MiMo-V2.6-Flash هو البنية نفسها على نطاق أصغر، بإجمالي 309 مليارات و15 مليارًا نشطة. تحمل الأوزان المنشورة وسم رخصة MIT، وتتضمن حزمة الإصدار تقريرًا فنيًا، وإرشادات النشر، و—وفقًا لـ Xiaomi—بيئات تدريب التعلم المعزز والشيفرة اللازمة لفحص التدريب اللاحق وإعادة إنتاجه.
هذا البند الأخير هو الفرق الجوهري بين هذا الإطلاق وإعلان API نموذجي، وهو يستحق أن يُفصل عن التسويق. إن نشر بيئة RL ادعاء بأن إعداد التدريب قابل للفحص. أما ما إذا كانت البيئات المنشورة كافية لإعادة إنتاج نتيجة 72.57 فهي مسألة منفصلة سيحسمها الأشخاص الذين يحاولون ذلك، لا ملاحظات الإصدار. تصف ملاحظات التدريب الخاصة بـXiaomi تشغيلًا مزج مهام البرمجة ومهام الوكيل العام والمهام البصرية ومهام الأمن السيبراني في تمريرة واحدة، مع أدوات تقييم ترتب المسارات الناجحة وتعيد توزيع المكافأة نحو مسارات أفضل — كما تسجل أيضًا حالات فشل: إعادة تشغيل بسبب نفاد ذاكرة GPU ناتجة عن اختلال توازن الحمل بين الخبراء، وعطل شبكي بين عنقود التدريب ونشر أداة التقييم، وإعادة تشغيل Flash بعد خطأ في البنية التحتية ظل غير مكتشف لنحو ثلاث ساعات. إن نشر حالات الفشل إلى جانب الانتصارات هو الجزء الذي يجعل بقية الإفصاح موثوقًا.
ما تكلفة الاتصال، وأين تكمن مسألة التوجيه
بسعر 0.43 دولار و0.87 دولار لكل مليون توكن، يأتي MiMo-V2.6-Pro بتسعير يناسب طرازًا من الفئة المتوسطة، بينما تشير نتائج تقييمه إلى أداء يوازي طرازًا رائدًا مفتوح الأوزان. أبقت شاومي على التسعير القياسي للجيل السابق MiMo-V2.5 بدلًا من رفع سعر نقطة التحقق الجديدة، ولهذا يبدو السعر منخفضًا مقارنةً بعدد المعاملات. خصم 99% على التخزين المؤقت يعني أن حلقة الوكيل المعتمدة كثيرًا على التخزين المؤقت تقرأ سياقها مقابل لا شيء فعليًا، وهنا تحديدًا تتراكم فاتورة الوكيل طويل الأفق.
ثمة نسخة من هذه المقايضة تُوجَّه بسلاسة، ونسخة لا تفعل ذلك. النسخة التي تفعل: النماذج الحدودية التي قد تقارن MiMo-V2.6-Pro بها — Claude Opus 5 بسعر 5.00/25.00 دولارًا، وGPT-6 Astra، وGemini 3.8 Flash، وGLM-5.3 — كلها يمكن الوصول إليها عبر مفتاح OrcaRouter واحد بسعر قائمة المزوّد وبهامش ربح 0%، لذلك فإن أي خفض سعر من المورّد على أيٍّ منها يصبح ساريًا لدينا في اليوم نفسه، ويمكن لقاعدة توجيه أن ترسل الطلب إلى نموذج ثانٍ عندما يكون الأول بطيئًا أو غير متاح. وهذا يهم أكثر من المعتاد هنا، لأن النموذج الحاصل على أفضل تقييم للأوزان المفتوحة هو أيضًا صاحب أضيق مسار للوصول إليه. والجمع بين الاثنين — مسار رخيص للأوزان المفتوحة للأعمال الكبيرة ومسار حدودي للذيل الصعب — قرار توجيه، وهو نوع القرار الذي يكفّ عن كونه رهانًا في اللحظة التي يصبح فيها المساران على المفتاح نفسه.
منتج آخر يجب إبقاؤه واضحًا، لأنه يسهل الخلط بينه وبين الطراز: تقدم Xiaomi أيضًا MiMo-V2.6-Pro-UltraSpeed، وهي طبقة خدمة مستضافة مبنية من نقطة الحفظ نفسها. وتزعم مواد Xiaomi الخاصة سرعة إخراج تصل إلى عشرين ضعفًا مقارنة بخدمة Pro القياسية بالجودة نفسها؛ بينما تصف قوائم الكتالوجات الخارجية ذلك بنحو عشرة أضعاف. هذان رقمان مختلفان يصفان الطبقة نفسها، ولم ينشر أحد توزيعات زمن الاستجابة لكل طلب للتوفيق بينهما، كما أن هذه الطبقة تحمل تعريفة أعلى بدرجة جوهرية. لا يغيّر UltraSpeed شيئًا فيما يمكن للأوزان فعله — بل يغيّر السرعة التي ستشغّلها بها خوادم شخص آخر.
ما الذي قد يغيّر هذه الصورة؟
ثلاثة أمور، مرتبة حسب مدى أهميتها.
مسار تقديم ثانٍ وثالث. كون العدّ في Artificial Analysis قائمًا على مزوّد واحد هو القيد الذي يحدّ كل ما سواه. مزيد من المسارات يعني تجاوز الأعطال، ويعني منافسة على الأسعار في طبقة التقديم، ويعني إمكان إدخال النموذج في مسار إنتاجي بدل أن يبقى مجرد تجربة.
إعادة إنتاج مستقلة لأرقام DeepSWE. الرقم 46 مستقل بالفعل؛ أما 72.57 فليس كذلك. إذا جاءت التجارب الخارجية قريبة منه، فإن الحجة لصالح النموذج تتعزز بقدر كبير. أما إذا جاءت أدنى منه بشكل ملموس، فسيظل رقم Artificial Analysis هو الجدير بالثقة، وينضم رقم البائع إلى القائمة الطويلة من ادعاءات الإطلاق التي لم تصمد عند أول احتكاك.

تفصيلات لكل تقييم. المركّب هو مركّب. أي من التقييمات العشرة يفوز فيها MiMo-V2.6-Pro وأيها يخسرها هو الفرق بين نموذج تنشره للبرمجة الوكيلية ونموذج تنشره للإجابة على الأسئلة كثيفة الاسترجاع، والمؤشر وحده لا يخبرك بذلك. هذه التفصيلة هي ما يجب مراقبته لاحقًا، وهي ما يحتاجه إعداد التوجيه قبل أن يستحق الكتابة.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
