بطاقة عنوان رئيسية لمقالة "MiMo-V2.6: ما الذي تُظهره ورقة التعلّم المعزز"، مع سطر علوي "تقرير تقني" وعنوان فرعي "تقرير Xiaomi عن التعلّم المعزز المختلط، مقروءًا بما يتحقق منه وما لا يتحقق منه". أربع شرائح مستديرة الحواف تحمل النصوص "موجّه MoE المجمّد"، و"تكلفة المُقيِّم 12.7%"، و"DeepSWE من 58.4 إلى 72.6"، و"مؤشر AA 46". سطر تذييل يقول "أرقام DeepSWE مُبلَّغ عنها من المورّد؛ ومؤشر AA 46 قياس من Artificial Analysis." شعار OrcaRouter مُركَّب في الركن السفلي الأيمن.
Guides & Insights

MiMo-V2.6: ما تُظهره ورقة Xiaomi البحثية حول التعلم المعزز فعلاً، وما تتركه دون تحقق

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

معظم أوراق النماذج المنشورة هذا الشهر هي أوراق معمارية. لكن التقرير التقني الذي يقف خلف Xiaomi MiMo-V2.6-Pro وXiaomi MiMo-V2.6-Flash ليس كذلك. بعنوان MiMo-V2.6: توسيع نطاق التعلم المعزز نحو التحسين الذاتي، قُدّم في 21 سبتمبر 2026 ونُسب إلى LLM-Core Xiaomi، وهو لا يكاد يخصص أي جزء من طوله للعمود الفقري للخليط المتناثر من الخبراء، ويخصص كل شيء تقريباً لسؤال واحد: ماذا يحدث عندما تذهب ميزانية ما بعد التدريب بأكملها إلى جولة واحدة مختلطة من التعلم المعزز. تقرير DeepSeek-V4.1-Flash، في المقابل، هو مستند ذاكرة — يذهب طوله إلى الانتباه المتناثر المضغوط، وإعادة استخدام KV عبر الطبقات، وتخزين FP4. ضع الاثنين جنباً إلى جنب وستجد أنهما حجتان حول من أين تأتي القدرة، وهما لا يتفقان.

يستحق التقرير أن يُقرأ وفق منطقه الخاص، لكنه يستحق قراءة متأنية، لأنه تقرير ذاتي من المختبر الذي أجرى التجربة. فهو يسمّي آلياته، ويعرض اختباراته الإبطالية، وينشر إخفاقاته، ويورد في السياق نفسه أرقامًا لا يمكن التحقق منها من الخارج. وفصل هذين الأمرين هو معظم العمل. هذه المقالة تفعل ذلك، وقد كُتبت في 23 سبتمبر 2026 — بعد يومين من رفع نقاط التحقق، بينما كانت الورقة أحدث ما نُشر عنها وأقلّه تأييدًا.

لماذا يهم التاريخ الموجود على الورقة أكثر من المعتاد؟

وصلت نقاط تحقق MiMo-V2.6-Pro و MiMo-V2.6-Flash من شاومي إلى مركز النماذج في 21 سبتمبر 2026، بترخيص MIT ودون قيود. والتقرير مؤرخ في اليوم نفسه، وقد بلغ قمة قائمة الأكثر رواجًا على موقع المسودات حيث نُشر. هذا التوقيت هو سبب كونه خبرًا لا استعراضًا استرجاعيًا: فالورقة ليست شرحًا لاحقًا لنموذج سبق أن قاسه الجميع. إنها تصل جنبًا إلى جنب مع الأوزان، قبل أن ينشر أي شخص خارج شاومي تشغيلًا مستقلًا.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

ذلك الترتيب هو أيضًا موضع الضعف الرئيسي في الورقة كدليل. فكل ما يتفرع عنه — منحنى DeepSWE، ومكاسب معدل النجاح، والدفاع ضد اختراق المكافأة — هو ادعاء حول عملية تدريب حدثت مرة واحدة، داخل مختبر واحد، على عنقود واحد، ولم يكرّرها أحد آخر. وتتعامل سلسلة النقاش التي لفتت الانتباه إلى التقرير مع ذلك باعتباره الجزء المثير للاهتمام: فهذه ورقة بيانات وتجارب، وليست ورقة معمارية، والتجارب هي بالضبط نوع النتائج التي إما تُكرَّر أو لا تُكرَّر.

ثلاثة محاور للتوسّع، وواحد منها فقط يُعد مشكلة في العتاد.

إطار التقرير هو أن الحوسبة الخاصة بالتعلّم المعزّز قد وُسِّعت على ثلاثة محاور دفعةً واحدة، والمحور الثالث هو الذي يغيّر طريقة تفكيرك في هذه الطريقة.

• الدفعة ومعدل الإنتاجية — 1,568 عيّنة لكل تحديث، تُوسَّع كل عيّنة إلى ست عشرة جولة تنفيذ، أي نحو 25,000 مسار لكل خطوة، باستهلاك يتراوح بين 2.7 و3.7 مليار توكن لكل خطوة عند أطوال سياق تصل إلى مليون توكن. ومعمارية جولات التنفيذ غير متزامنة بالكامل، وهو ما يجعل حجم الدفعة هذا قابلاً للاستمرار من الأساس.

• البيئات — تشغيل مختلط واحد يمتد عبر مهام البرمجة والوكيل العام والمهام البصرية والسيبرانية، في ظل عدة أُطر تشغيل للوكلاء في آن واحد، بدلًا من دورات تعلم معزز منفصلة لكل مجال. والوصف المختصر الذي تستخدمه شاومي لذلك هو "You Only RL Once". والحجة وراء الخلط هي أن المكاسب في قدرة واحدة تعزّز القدرات الأخرى؛ أما الخطر فهو أن تُحرَم فئة مهام بطيئة من الموارد، وهو ما تقول الشركة إنها تتعامل معه بالجدولة التكيّفية.

• حوسبة المُقيِّم — المحور الذي لا يتعلق بوحدات معالجة الرسوميات بالمعنى المعتاد. لا يمكن لنتيجة النجاح/الفشل الثنائية أن تُرتِّب حلين كلاهما ناجح، لذا تصبح إشارة المكافأة نفسها هي الشيء الذي تقوم بتوسيعه. يقارن مُقيِّم وكيلي المحاولات الست عشرة لمهمة ما بشكل مشترك، ويُنتج إشارة متدرجة بدلًا من بت واحدة.

ذلك المحور الثالث هو حيث تستحق عبارة «التحسين الذاتي» الواردة في العنوان مكانها، وهو حيث يكون التقرير أكثر انكشافًا. إنّ قيام النموذج بتقييم مخرجاته الخاصة يُعدّ سطحًا لاختراق المكافأة، والتقرير يتعامل معه على هذا الأساس.

الآليتان اللتان تستحقان الفهم فعليًا

إعادة توزيع الميزة على مستوى المجموعة

بعد كل خطوة، تنتج السياسة ست عشرة محاولة لكل مهمة، وتوضع جميعها في مساحة عمل مشتركة حتى يتمكن نموذج تقييم من فحصها معًا بدلًا من فحصها واحدة تلو الأخرى. ثم تُقيَّم الرقع الناجحة على خمسة محاور: مدى ملاءمة النهج للمشكلة، ومدى دقة التنفيذ من دون مسارات احتياطية لا داعي لها، ومدى كون التغيير أدنى ما يمكن، وما إذا كان يعدّل أي شيء خارج النطاق، وما إذا كان يطابق نمط الكود المحيط. وتتلقى التمريرات ذات الترتيب الأدنى تعزيزًا إيجابيًا أقل. وأي رقعة يُتأكَّد أنها غش تُصفَّر وتُعامَل كفشل.

النتيجة هي إشارة تدريب تدفع نحو حلول أقصر وأرخص بدلًا من كونها صحيحة فحسب — ويصف التقرير ذلك بأنه توجيه نحو رموز (tokens) أقل لكل مهمة. هذا هو الجزء الذي ينبغي التمسك به، لأن النتائج الرئيسية الواردة لاحقًا في الورقة تشير إلى الاتجاه المعاكس.

تخليق المكافأة حسب المجموعة

النصف غير المتصل من الفكرة نفسها. فبدلًا من اشتقاق الجودة بالكامل من مُقيّم مباشر، يحسب الفريق مسبقًا معايير تقييم خاصة بكل مهمة، ويضرب مكافأة الاختبار الثنائية في درجات الجودة والسلوك المستمدة من تلك المعايير. يصف التقرير ذلك بأنه بناء المعايير من عمليات تنفيذ متباينة — أي من الحالات التي اختلفت فيها النتيجة، وهي حيث توجد المعلومة.

التقييم ليس مجانيًا. تُقدِّر التقرير كلفة أداة التقييم بنحو 12.7% من إجمالي كلفة التعلّم المعزَّز في MiMo-V2.6-Pro. وهذا الرقم وحده هو أنفع ما في الورقة البحثية لكل من يفكر في نسخ هذه الطريقة، لأنه يحوِّل عبارة «وسِّع نطاق أدوات التقييم لديك» من فكرة إلى بند في الميزانية.

الراوتر المجمّد هو النتيجة التي ستنسخها معظم الفرق أولاً

يحتوي قسم الاستقرار في التقرير على نتيجة قائمة بذاتها، مستقلة عن MiMo-V2.6 ومستقلة عن مدى جودة أداء النموذج.

مع موجّهات خليط الخبراء القابلة للتدريب، انحرف حِمل الخبراء بشكل سيئ على مدار عشرين خطوة. ارتفع معامل الاختلاف بين الخبراء من 0.78 إلى 2.0. وانتقلت ذروة الحِمل على أكثر الخبراء انشغالاً من ستة أضعاف المتوسط إلى ستة عشر ضعفاً. وارتفعت نسبة الخبراء الباردين — أولئك الذين لا يتلقون أي حركة تقريباً — من 0.5% إلى 22%. وأدت استعادة أوزان الموجّه إلى قيمها الابتدائية عند الخطوة 20 إلى استعادة التوازن فوراً.

كان رد شاومي هو تجميد موجّه MoE طوال التشغيل. والمنطق ليس خفيًا: على هذا المقياس من الدفعات، يُعد عدم استقرار التوجيه مشكلة في ديناميكيات التدريب يمكنك ببساطة أن ترفض وجودها، وليس الموجّه هو المكان الذي يؤدي فيه التعلم المعزز عمله. أما ما إذا كان التجميد يكلف شيئًا على صعيد الجودة النهائية، فلم تُجب عنه أي دراسة استئصال في المواد المنشورة، وهذا مطلب مشروع.

ما لا يقوله هذا الاكتشاف هو أي شيء عن الخدمة. إن توازن حمل الموجّه أثناء جولة تدريب واستخدام الخبراء تحت حركة الإنتاج سؤالان مختلفان، والتقرير لا يتناول إلا الأول.

الأرقام، مع تسمياتها المرفقة.

النتائج الرئيسية للتقرير نظيفة في الشكل وفوضوية في التفاصيل، وهذه الفوضى ليست فضيحة — إنها ثلاث قياسات مختلفة لثلاثة أشياء مختلفة تشترك في الاسم نفسه.

• DeepSWE v1.1، محتجَز — ارتفع MiMo-V2.6-Pro من 58.4 إلى 72.6 خلال التشغيل؛ وMiMo-V2.6-Flash من 48.7 إلى 65.7. يتكوّن المعيار من 113 مهمة هندسة مستودعات طويلة الأفق تُقيَّم بواسطة مدقّقات وظيفية عبر خمس لغات برمجة، والمقياس هو average@3 — متوسط معدل اجتياز المدقّق عبر ثلاث محاولات مُعيّنة، وهو ليس مماثلًا لسؤال ما إذا كانت أي واحدة من المحاولات الثلاث قد نجحت. إن قراءة avg@3 على أنها pass@3 ستُبالغ في تقدير كل رقم في الصفحة.

• المعيار نفسه، عند قياسه في مكان آخر — تُظهر بطاقات النماذج الصادرة 71.9 لـ Pro و67.9 لـ Flash. وأظهرت لوحة معلومات التدريب العامة لدى شاومي 72.57 و65.68. لذا هناك ثلاثة أرقام منشورة لكل نموذج، اثنان منها من شاومي، واتجاه التباين مختلف لكل من الشقيقين. ولا شيء منها خاطئ؛ فهي تصف لقطة من لوحة معلومات، ومدخلًا في بطاقة، وسطرًا في تقرير، عند نقاط مختلفة وربما في ظل أُطر اختبار مختلفة.

• التقطير — MiMo-V2.6-Distill-Qwen-9B، الذي جرى ضبطه الدقيق انطلاقًا من Qwen3.5-9B على عروض توضيحية ولّدها MiMo، رفع SWE-bench Verified من 61.1 إلى 66.2. هذا هو الرقم الأكثر قابلية للنقل في الورقة، لأن نموذج طالب بحجم 9B هو حجم تستطيع معظم الفرق تشغيله فعليًا.

• مقياس أداء مصغّر داخلي في الأمن السيبراني — من 31.3 إلى 47.0. "داخلي" تعني داخلي حقًا: فالمهام غير منشورة، لذا لا يمكن إعادة إنتاج الفارق حتى من حيث المبدأ.

• مؤشر Artificial Analysis Intelligence Index — 46 لـ MiMo-V2.6-Pro. هذا الرقم مختلف من حيث النوع. أنتجته Artificial Analysis بتشغيل أداة التقييم الخاصة بها على نقطة التحقق الصادرة، وليس Xiaomi، مما يجعله الرقم الرئيسي الوحيد في هذا الإصدار الذي يمكن للقارئ اعتباره مقيسًا لا مُبلَّغًا عنه. وهو أيضًا الرقم الذي ينبغي مقارنته بـ GLM-5.3 وKimi K3 والحدود المغلقة، ويأتي أقل بخمس نقاط من Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

يتسم التقرير بالصدق بشأن حدود جدوله الخاص، وهذه هي الجملة التي يجدر أن تُقتبس في وجه كل من ليس كذلك: فالمقارنات تخلط بين معايير قياس عامة وداخلية ولا تعزل مساهمة التعلم المعزز عن البنية أو التدريب المسبق. وكون النموذج أفضل بعد التعلم المعزز ليس دليلًا على أن التعلم المعزز هو السبب.

هناك تحفّظ ثانٍ، وهو التحفّظ الذي يتعارض مع الإطار المطروح. فالمكاسب المُبلَّغ عنها تصاحب عمومًا ارتفاعًا في استخدام الرموز. ويعرض التقرير ذلك بوصفه تحسّنًا مستمرًا في القدرات لا بوصفه كفاءة، وهو محق في ذلك. لكن GAR صُمّم صراحةً للتوجيه نحو مسارات أقصر وعدد أقل من الرموز لكل مهمة، والنتيجة الإجمالية لا تُظهر أن عبء العمل أصبح أرخص. ارتفعت القدرات؛ ولم تنخفض التكلفة لكل مهمة. وإذا قرأت "التحسين الذاتي" على أنه "سيحتاج النموذج أموالًا أقل مني في الربع القادم"، فلا تدعم الورقة هذه القراءة.

ما يتركه التقرير دون التحقق منه

حتى 23 سبتمبر 2026، لم ينشر أي طرف ثالث إعادة تشغيل مستقلة لأعمدة DeepSWE أو Terminal Bench أو CyberGym. التمييز المهم هو بين نقطة المؤشر وكل ما عداها: 46 قياس أجراه شخص آخر، و72.6 ادّعاء حول عملية تدريب لا يستطيع أحد إعادة تنفيذها، لأن العملية كلفت، وفق ما ذُكر، 2.6 مليون دولار لـ Pro و0.9 مليون دولار لـ Flash ولن تتكرر مرتين.

ما نشرته شاومي، خلافًا لمعظم المختبرات، هو ديناميكيات التدريب، وإطار التعلم المعزز، وبيئات المهام — أكثر من 7,000 بيئة مصنَّفة عبر هندسة البرمجيات، وإعادة إنتاج الثغرات، والعمل المعرفي، وتصميم الويب. وهذا هو الأثر الأطول بقاءً. فالأوزان تخبرك بما أنتجته التجربة؛ أما البيئات فتخبرك كيف تجري التجربة بنفسك، وهو السبيل الوحيد لحسم أيٍّ من ادعاءات التعلم المعزز.

يستحق الدفاع ضد اختراق المكافأة تحفظاً محدداً. فهو موصوف بأنه متعدد الطبقات — تصميم المكافأة، والتقييم الخصومي، وكشف الشذوذ، والتحقق المتبادل بين المدققين — وهو موصوف بالكامل من قبل الطرف الذي سيكون محرجاً من فشله. إن الدفاع ضد نموذج يخدع مُقيِّماً قائماً على نموذج ليس من النوع الذي يمكن لتقرير ذاتي أن يحسمه. الآلية مذكورة بالاسم ونمط الفشل معترف به، وهو أكثر مما تفعله معظم الأوراق البحثية، ولا يزال سؤالاً مفتوحاً.

ما الذي يمكنك فعله فعليًا بهذا اليوم

كلا نقطتي التحقق قابلتان للتنزيل، دون قيود، تحت وسم رخصة MIT: Xiaomi MiMo-V2.6-Pro-RL وXiaomi MiMo-V2.6-Flash-RL، متعدّدتا الوسائط بالكامل، بسياق يبلغ مليون رمز، مع الإبلاغ في فهرس Flash عن 172.9 GB من بيانات الأوزان موزعة على 65 شظية بصيغة FP8. لم تنشر Xiaomi بطاقة تسعير لكل رمز لجيل V2.6، لذا فإن الخيار اليوم هو الاستضافة الذاتية مقابل نموذج مستضاف تدفع مقابله بالفعل.

هذه المقارنة هي حيث تكمن القيمة العملية للورقة البحثية، وهي غير مُجْمِلة للورقة بطريقة مفيدة. فالادّعاء قيد الاختبار ليس «هل MiMo-V2.6-Pro جيد» — فـ46 إجابة تحسم ذلك. بل هو «هل ينتج التعلّم المعزّز على مهام وكيلية مختلطة استدلالًا ينتقل إلى عبء العمل الخاص بي»، والطريقة الصادقة الوحيدة للإجابة عن ذلك هي تشغيل الاثنين ومقارنتهما، وهذه مسألة توجيه قبل أن تكون مسألة بحثية. DeepSeek-V4.1-Flash على بُعد مفتاح API واحد بتكلفة 0.15 و0.60 دولار لكل مليون رمز، وQwen3.8-Flash وGLM-5.3-Flash يقبعان على المفتاح نفسه، وإذا أردت أن تضع نقطة استرجاع MiMo مستضافة ذاتيًا خلف النقطة الطرفية نفسها لمدة أسبوع وترى ما إذا كان منحنى DeepSWE يظهر في تقييماتك الخاصة، فذلك تغيير في الإعداد لا ترحيل. وOrcaRouter لا تستضيف نماذج Xiaomi، ولا ينبغي قراءة أي شيء هنا على أنه يدّعي خلاف ذلك — لكن النماذج التي ستقارنها بها كلها يمكن الوصول إليها عبر مفتاح OrcaRouter API واحد بسعر المزوّد مع تمرير هامش ربح 0%، مع تحويل تلقائي عند الفشل إذا تبيّن أن نقطة استرجاع تجرّبها غير مستقرة تحت الحمل.

حالة النموذج غير المُثبت هي الحالة التي وُجد تجاوز الفشل من أجلها. نقطة تحقق نُشرت قبل يومين، مع تقييم أجراه المورّد ودون إعادة تشغيل مستقلة، هي بالضبط ما تريد تجربته دون أن تضع مسار إنتاج خلفه.

من ينبغي أن يقرأ الورقة

إذا كنت تُشغّل تدريبًا لاحقًا، فاقرأه من أجل نتيجة الموجِّه ورقم تكلفة المُقيِّم. كلاهما قابل للنقل، وكلاهما رخيص الاختبار، ولا يعتمد أي منهما على تصديق أي شيء عن جدول المعايير القياسية الخاص بـ MiMo-V2.6. ونتيجة الموجِّه المجمَّد تحديدًا من النوع الذي تكلّف تجربته ظهيرة واحدة وتوفّر عليك تشغيلًا كاملًا.

إذا كنت تختار نموذجًا، فاقرأ نقطة المؤشر وتجاهل الباقي. قاس Artificial Analysis الرقم 46 على النموذج الصادر؛ وهذا هو الرقم الوحيد في هذا الإصدار الذي لم يأتِ من المورّد، وهو يضع MiMo-V2.6-Pro في قمة مجال الأوزان المفتوحة ومتأخرًا بخمس نقاط عن Claude Opus 5. أما كل ما تبقى في التقرير فيصف كيف وصلت Xiaomi إلى هناك، وكيف وصلت Xiaomi إلى هناك ليس شيئًا يمكنك شراؤه.

وإذا كنت تقرأ التغطية الإعلامية بدلًا من الورقة البحثية، فالشيء الذي ينبغي الانتباه إليه هو عبارة «التحسين الذاتي». تُظهر نتائج التقرير نفسه أن القدرة ترتفع جنبًا إلى جنب مع استخدام الرموز، وهو اكتشاف حقيقي وقابل للتكرار بشأن توسيع نطاق التعلم المعزز. وهو ليس ادعاءً بأن النموذج أصبح أرخص في التشغيل، والأوراق التي تلي هذه الورقة هي التي ستخبرك ما إذا كان سيصبح كذلك في النهاية.