
Xiaomi MiMo-V2.6-Pro: نتيجة 72.57 في DeepSWE، وتشغيل توقف، ولا يزال بلا تاريخ إصدار
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro أوقف تشغيله العام لتدريب التعلم المعزز في 20 سبتمبر بدرجة DeepSWE v1.1 بلغت 72.57، وهي ظاهرة على لوحة تحكم Xiaomi الخاصة — أقل بـ1.4 نقطة من 74% التي تتقاسمها GPT-6 Astra و Gemini 3.8 Flash و Claude Opus 5 في قمة نفس لوحة الصدارة. Xiaomi MiMo-V2.6-Flash، النموذج الأصغر الذي دُرّب إلى جانبه، توقف في 19 سبتمبر عند 65.68. كلا التشغيلين انتهيا عند الخطوة 30، وقرأت الفاتورة المجمعة التي نشرتها Xiaomi بجانبهما $3,474,715 عندما التقطنا الصفحة هذا الصباح.
هذه هي كل الأخبار السارة، وهي سارة حقًا. أما بقية القصة فهي فجوة بين رقم ومنتج. لا يمتلك Xiaomi MiMo-V2.6-Pro ولا Xiaomi MiMo-V2.6-Flash تاريخ إصدار، ولا بطاقة نموذج، ولا معرّف API، ولا سعرًا منشورًا، ولا مجموعة أوزان قابلة للتنزيل. لا توجد نقطة نهاية للاتصال بها. الموجود هو لوحة تحكم للتدريب يمكن لأي شخص مشاهدتها، ورقم قياس أداء أنتجته أداة الاختبار الخاصة بـ Xiaomi، ومجتمع أمضى ستة أيام يقرأ صفحة قياس عن بُعد بالطريقة التي اعتاد الناس بها قراءة أوراق الشاي.
إذن، هذا مقال عمّا نعرفه حتى الآن، والنسخة الصادقة منه تفصل بين ثلاثة أمور ظلّت تغطية الأسبوع الماضي تمزجها بهدوء: ما أعلنته شاومي رسميًا، وما أفاد به مراقب واحد بشأنه، وما يعنيه أي من ذلك لمن يختار نموذجًا للبرمجة اليوم.
ما الذي نشرته شاومي فعليًا على الإنترنت
في 16 سبتمبر، فتح فريق MiMo، بقيادة Luo Fuli، صفحة بث حي على نطاق Xiaomi الخاص تعرض التدريب اللاحق لنموذجين لم يصدرا بعد في الوقت الفعلي: عدد الخطوات، ومنحنيات المكافأة، وإنتاجية الرموز، وعدد بيئات العزل، وإشعارات أعطال GPU، وعدّاد تكلفة يرتفع بينما تراقب. وإطار Xiaomi، وفقًا للتغطية، هو أنها أمضت نحو ستة أشهر في العمل على سؤال واحد — إلى أي مدى يمكن توسيع نطاق التعلم المعزز — وقررت إجراء تلك التجربة علنًا بدلًا من الإعلان عن نتيجة.
تتسم لوحة المعلومات بصراحة غير معتادة بالنسبة لوثيقة صادرة عن مورّد. فهي تُدرج إخفاقاتها الخاصة في موجز إشعارات: إعادة تشغيل لـ Pro عند الخطوة 17 بسبب خطأ نفاد ذاكرة GPU ناتج عن اختلال توازن حمل الخبراء، وهو ما يقول الفريق إنه أصلحه عبر تعديل استراتيجية التوازي في التدريب؛ وخلل في اتصال الشبكة بين عنقود تدريب Pro ونشر التقييم، ما فرض إعادة تشغيل وقرارًا باستبعاد مجموعة بيانات الأمن السيبراني من تشغيل Pro القادم بعد "أنماط سيئة في سجلات rollout"؛ وإعادة تشغيل لـ Flash عند الخطوة 15 بعد أن ظل صنف من أخطاء البنية التحتية غير مكتشف لنحو ثلاث ساعات؛ وإعادة تشغيل لـ Pro بسبب خلل في VRAM على عقدة واحدة. وتشير أيضًا إلى أن المهام التي حُكم بأنها "سهلة نسبيًا لنموذج pro الحالي" قد استُبعدت — وهو اعتراف تتركه معظم تقارير ما بعد التدريب دون ذكر.

بطاقتا التشغيل هما الجزء المهم لأي شخص يتتبّع التوقيت. كلا الطرازين موسومان بـمتوقف: MiMo-V2.6-Pro بعد 5 أيام و7 ساعات من الوقت الفعلي، وMiMo-V2.6-Flash بعد 3 أيام و11 ساعة، كلٌّ عند الخطوة 30، في 20 سبتمبر و19 سبتمبر على التوالي. استهلك Pro 75 مليار رمز و753 ألف عيّنة مقابل 2.62 مليون دولار؛ واستهلك Flash 81.4 مليار رمز مقابل 854 ألف دولار. تسحب كل خطوة دفعة من 1,568 موجّهًا مع 16 عملية تنفيذ لكل موجّه — أي 25,088 مسارًا لكل خطوة، تُشغَّل بشكل غير متزامن بالكامل.
يستحق القول بوضوح: لم تقل Xiaomi ما إذا كانت كلمة "stopped" تعني أن التشغيل قد انتهى، أو توقف مؤقتًا، أو حُفظ عند نقطة تحقق. البطاقة المتوقفة ليست إشعار اكتمال، ولا أحد خارج الفريق يعرف أيّها هي.
ما هو المؤكد، وما هو غير المؤكد؟
الرقم 72.57 ليس إشاعة. إنه مطبوع على لوحة معلومات Xiaomi، في مخطط معنون DeepSWE v1.1، mini-swe-agent، avg@3، بجانب المنحنى البرتقالي الخاص بتشغيل Pro. ويظهر الرقم 65.68 الخاص بنموذج Flash على المخطط نفسه. كما يظهر الرقم — بصيغة 62.24 ثم 65.97 لاحقًا — في لقطات سابقة من اللوحة نفسها، وهو ما يمنح المنحنى شكله: صعود مطرد عبر 30 خطوة بدلًا من تقييم واحد محظوظ.
ما هو مجرد تقرير هو نقطة البداية. الادّعاء المتداول على X في 21 سبتمبر، من الحساب @nrehiew_، هو أن طراز Pro انتقل "من 58.41 إلى 72.57" على DeepSWE وأن عمليات التشغيل قد اكتملت. تتطابق نقطة النهاية مع لوحة معلومات المورّد تمامًا. خط الأساس 58.41 هو قراءة ذلك الحساب لمكان بداية المنحنى — فنقطة Pro في أقصى يسار الرسم البياني تقع فعلًا في أواخر الخمسينيات — ولم تنشر Xiaomi رقم step-1. وادّعاء الاكتمال هو أيضًا تفسير لبطاقتين معلَّمتين كمتوقفتين، وهو قراءة معقولة وليس تصريحًا من Xiaomi. تعامل مع تحسّن الـ14 نقطة على أنه متين من حيث الاتجاه وتقريبي من حيث الأرقام.

هناك تمييز آخر أغفلته التغطية، وهو التمييز الذي يحدد قيمة هذا الرقم. لوحات المعايير في لوحة المعلومات هي تقييمات شاومي الخاصة: فقد شغّلت الشركة أداة الاختبار على نقاط التحقق الخاصة بها ونشرت النتائج. أداة الاختبار هي نفسها التي تستخدمها لوحة الصدارة العامة — mini-swe-agent، DeepSWE v1.1 — ما يجعل الرقم أكثر قابلية للمقارنة مما لو كان معيارًا مطوّرًا داخليًا من مورّد. لكن التقييم الذاتي ليس إدخالًا في لوحة الصدارة، و72.57 لا يظهر على لوحة Datacurve، لأن لا أحد قد قدّمه.
سقف 74٪ أكثر إحكامًا مما يوحي به العنوان الرئيسي
وهو ما يضع المقارنة في بؤرة التركيز. تُدرِج لوحة صدارة DeepSWE v1.1 الخاصة بـ Datacurve، وآخر تحديث لها في 3 سبتمبر 2026، 113 مهمة موزعة على 91 مستودعًا في خمس لغات، وتتعادل أعلى ثلاث تهيئات لديها عند 74% في Pass@1: GPT-6 Astra عند جهد استدلال xhigh، وGemini 3.8 Flash عند high، وClaude Opus 5 عند max. الأرقام التي تقع بجوار تلك الدرجات هي المثيرة للاهتمام.
• الثقة — GPT-6 Astra 74% ±3، Gemini 3.8 Flash 74% ±1، Claude Opus 5 74% ±4. على نفس لوحة الصدارة، يأتي GPT-5.6 Sol عند 73% ±3، وGLM-5.3 وKimi K3 عند 69%. تتداخل الفواصل إلى ما يتجاوز المنزلة العشرية الثانية بكثير.
• التكلفة لكل مهمة — يبلغ متوسط Gemini 3.8 Flash نحو 2.36 دولار، وGPT-6 Astra نحو 6.52 دولار، وClaude Opus 5 نحو 11.84 دولار. ويشير مخطط لوحة الصدارة نفسه إلى أن Gemini 3.8 Flash هو التكوين الأكثر كفاءة على اللوحة، كما يبلغ الفارق بين هذه الثلاثة نحو خمسة إلى واحد مقابل معدل نجاح لا يستطيع المعيار التمييز فيه.
• الخطوات — احتاج Gemini 3.8 Flash في المتوسط إلى 166 خطوة وكيل لكل مهمة، وClaude Opus 5 إلى 99، وGPT-6 Astra إلى 29. النتيجة المتعادلة تخفي ثلاثة أساليب عمل مختلفة جدًا، والرخيص هو الأكثر اجتهادًا.

عندما يُوصف الرقم المعلن 72.57 بأنه "يقترب من قمة لوحة الصدارة"، فإن النسخة الدقيقة أضيق نطاقًا وأقل دراماتيكية. فهو يقع ضمن نحو نقطة ونصف من تعادل ثلاثي لا تستطيع هوامش الخطأ الخاصة بالمقياس نفسه الفصل بين أطرافه. إنها نتيجة قوية لنموذج لا يزال في مرحلة ما بعد التدريب، أنتجته الشركة المصنّعة لا القائمون على المقياس، على لوحة لم يُقدَّم النموذج إليها. آخر تحديث للوحة الصدارة يسبق مشاركة Xiaomi بالكامل، ولهذا لا يظهر أي شيء من MiMo عليها بعد.
لماذا تتدرب Xiaomi علنًا
ليست الشفافية أمرًا عرضيًا. كان آخر إصدار مفتوح الأوزان لـ Xiaomi هو Xiaomi MiMo-V2.5 وXiaomi MiMo-V2.5-Pro في نهاية أبريل، وكلاهما بموجب رخصة MIT — قابل للاستخدام تجاريًا، وقابل للضبط الدقيق، وقابل لإعادة التوزيع. MiMo-V2.5-Pro هو نموذج خليط خبراء بمعاملات تبلغ 1.02 تريليون، مع 42 مليار معامل نشط، ومعمارية انتباه هجينة، ونافذة سياق تبلغ مليون رمز، وقد جعلت مواد إطلاقه الادعاءات الوكيلية صريحة: مترجم كُتب من الصفر بلغة Rust عبر مئات من استدعاءات الأدوات، وتطبيق سطح مكتب من ثمانية آلاف سطر بُني على مدى إحدى عشرة ساعة من عمل الوكيل.
بثّ مرحلة ما بعد التدريب للجيل القادم هو ادّعاء من نوع مختلف. المختبر الذي ينشر منحنيات المكافأة الخاصة به، وأعداد بيئاته المعزولة، وأعطال GPU لديه في الوقت الفعلي، يطلب أن يُحكَم عليه بناءً على العملية لا على عرض تقديمي للإطلاق، وهو يشير إلى جدول زمني. قال لوه فولي إن التفاصيل التقنية لعمل التعلم المعزز ستُتاح كمصدر مفتوح جزءاً جزءاً على مدى الأسابيع المقبلة. هذا أقرب ما قدّمه أي أحد إلى جدول زمني: المنهجية أولاً، والنموذج لاحقاً.
كما يتناسب ذلك أيضًا مع نمط سبق أن استخدمته Xiaomi، حيث يظهر نموذج علنًا باسم آخر قبل أن تعلن الشركة عنه. عادات الشركة هي أن تدرّب بهدوء، وتختبر في العلن، ثم تطلق مع الأوزان.
ما يمكنك تشغيله اليوم
لا شيء ضمن عائلة MiMo-V2.6. إذا كنت تريد نموذج Xiaomi MiMo الآن، فإن الجيل V2.5 هو الموجود — أوزان مفتوحة عبر قنوات Xiaomi الخاصة وعدة منصات طرف ثالث، مع بطاقات وأسعار منشورة. لا يوجد API لـ MiMo-V2.6، ولا معرّف نموذج، ولا قائمة أسعار، وأي صفحة تستشهد بمعرّف MiMo-V2.6 أو بسعر لكل رمز فهي تملأ فراغًا تركته Xiaomi فارغًا. إن السلسلتين `mimo-v2.6-pro` و `mimo-v2.6-flash` على لوحة التحكم هما اسما مهمتي تدريب، وليسا نقاط نهاية منشورة.
النتيجة العملية الأخرى هي ما ينبغي فعله في هذه الأثناء. إذا كان السبب في أن MiMo-V2.6-Pro مثير للاهتمام بالنسبة لك هو أنه قد يكون وسيلة أرخص لبلوغ أداء برمجي بمستوى الطليعة، فإن التكوينات التي يُقاس مقابلها قابلة للاستدعاء بالفعل، وتقول لوحة الصدارة إن الخيار الرخيص منافس: Gemini 3.8 Flash يعادل أعلى معدل نجاح بتكلفة 2.36 دولارًا للمهمة، ومُعلَّم بأنه أكثر تكوينات اللوحة كفاءة. يمكن الوصول إلى Gemini 3.8 Flash وClaude Opus 5 وGPT-6 Astra جميعًا عبر مفتاح OrcaRouter API واحد بسعر قائمة المزوّد مع تمرير هامش ربح بنسبة 0% — لذا يصبح أي تغيير في أسعار المزوّد ساريًا من جانبنا في اليوم نفسه بدلًا من دورة الفوترة التالية — مع تهيئة التحويل الاحتياطي لكل نموذج بدلًا من كل مزوّد. وعندما يفتح مختبر ما نموذجًا كهذا، فإن توجيهه خلف المفتاح نفسه هو الطريقة الأقل التزامًا لتقييمه: يمكنك وضعه أمام حركة مرور حقيقية دون المخاطرة بمسار إنتاجي على نقطة تحقق لم يصفها أحد.
ما الذي سيغيّر هذه القصة فعليًا؟
أربع إشارات، تقريبًا حسب مقدار ما ستحسمه:
• أوزان على Hugging Face بموجب ترخيص معلن، وهكذا وصل جيل V2.5، وهو أقوى دليل على أن تشغيل RL أنتج نموذجًا جاهزًا للإطلاق بدلًا من تجربة انتهت.
• بطاقة نموذج تتضمّن أعداد المعاملات وطول السياق والبنية — لا شيء من أرقام V2.6 متاح للعموم، ولوحة المعلومات لا تعرضها. افتراض أن V2.6-Pro يرث شكل V2.5-Pro البالغ 1.02T/42B سيكون مجرد تخمين.
• معرّف API وقائمة أسعار، وهي اللحظة التي يتحوّل فيها رقم DeepSWE إلى قرار شراء بدلًا من رياضة للمتفرّجين.
• تقديم إلى لوحة DeepSWE التابعة لـ Datacurve، من شأنه أن يضع MiMo-V2.6-Pro على الجدول نفسه وتحت أشرطة الخطأ نفسها مثل النماذج التي يُقارَن بها. فالتقييم الذي يُجريه المورّد والتقديم إلى لوحة الصدارة ليسا الادعاء نفسه، والفجوة بينهما هي بالضبط صف واحد من ذلك الجدول.
حتى ذلك الحين، الخلاصة الصادقة هي أن Xiaomi أظهرت التجربة الأكثر شفافية في التدريب اللاحق التي نشرها أي مختبر كبير، على نموذجين لم تُطلقهما بعد، مع رقم أداء معياري واحد مُبلَّغ عنه ذاتيًا يقترب من — لكنه لا ينضم إلى — قمة لوحة الصدارة. والتقرير المنهجي موعود به في الأسابيع المقبلة. أما تاريخ الإصدار فغير موعود به على الإطلاق.
