
MiMo-V2.6: ما تُظهره ورقة Xiaomi البحثية حول التعلم المعزز فعلاً، وما تتركه دون تحقق
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 182 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
معظم أوراق النماذج المنشورة هذا الشهر هي أوراق معمارية. لكن التقرير التقني الذي يقف خلف Xiaomi MiMo-V2.6-Pro وXiaomi MiMo-V2.6-Flash ليس كذلك. بعنوان MiMo-V2.6: توسيع نطاق التعلم المعزز نحو التحسين الذاتي، قُدّم في 21 سبتمبر 2026 ونُسب إلى LLM-Core Xiaomi، وهو لا يكاد يخصص أي جزء من طوله للعمود الفقري للخليط المتناثر من الخبراء، ويخصص كل شيء تقريباً لسؤال واحد: ماذا يحدث عندما تذهب ميزانية ما بعد التدريب بأكملها إلى جولة واحدة مختلطة من التعلم المعزز. تقرير DeepSeek-V4.1-Flash، في المقابل، هو مستند ذاكرة — يذهب طوله إلى الانتباه المتناثر المضغوط، وإعادة استخدام KV عبر الطبقات، وتخزين FP4. ضع الاثنين جنباً إلى جنب وستجد أنهما حجتان حول من أين تأتي القدرة، وهما لا يتفقان.
يستحق التقرير أن يُقرأ وفق منطقه الخاص، لكنه يستحق قراءة متأنية، لأنه تقرير ذاتي من المختبر الذي أجرى التجربة. فهو يسمّي آلياته، ويعرض اختباراته الإبطالية، وينشر إخفاقاته، ويورد في السياق نفسه أرقامًا لا يمكن التحقق منها من الخارج. وفصل هذين الأمرين هو معظم العمل. هذه المقالة تفعل ذلك، وقد كُتبت في 23 سبتمبر 2026 — بعد يومين من رفع نقاط التحقق، بينما كانت الورقة أحدث ما نُشر عنها وأقلّه تأييدًا.
لماذا يهم التاريخ الموجود على الورقة أكثر من المعتاد؟
وصلت نقاط تحقق MiMo-V2.6-Pro و MiMo-V2.6-Flash من شاومي إلى مركز النماذج في 21 سبتمبر 2026، بترخيص MIT ودون قيود. والتقرير مؤرخ في اليوم نفسه، وقد بلغ قمة قائمة الأكثر رواجًا على موقع المسودات حيث نُشر. هذا التوقيت هو سبب كونه خبرًا لا استعراضًا استرجاعيًا: فالورقة ليست شرحًا لاحقًا لنموذج سبق أن قاسه الجميع. إنها تصل جنبًا إلى جنب مع الأوزان، قبل أن ينشر أي شخص خارج شاومي تشغيلًا مستقلًا.

ذلك الترتيب هو أيضًا موضع الضعف الرئيسي في الورقة كدليل. فكل ما يتفرع عنه — منحنى DeepSWE، ومكاسب معدل النجاح، والدفاع ضد اختراق المكافأة — هو ادعاء حول عملية تدريب حدثت مرة واحدة، داخل مختبر واحد، على عنقود واحد، ولم يكرّرها أحد آخر. وتتعامل سلسلة النقاش التي لفتت الانتباه إلى التقرير مع ذلك باعتباره الجزء المثير للاهتمام: فهذه ورقة بيانات وتجارب، وليست ورقة معمارية، والتجارب هي بالضبط نوع النتائج التي إما تُكرَّر أو لا تُكرَّر.
ثلاثة محاور للتوسّع، وواحد منها فقط يُعد مشكلة في العتاد.
إطار التقرير هو أن الحوسبة الخاصة بالتعلّم المعزّز قد وُسِّعت على ثلاثة محاور دفعةً واحدة، والمحور الثالث هو الذي يغيّر طريقة تفكيرك في هذه الطريقة.
• الدفعة ومعدل الإنتاجية — 1,568 عيّنة لكل تحديث، تُوسَّع كل عيّنة إلى ست عشرة جولة تنفيذ، أي نحو 25,000 مسار لكل خطوة، باستهلاك يتراوح بين 2.7 و3.7 مليار توكن لكل خطوة عند أطوال سياق تصل إلى مليون توكن. ومعمارية جولات التنفيذ غير متزامنة بالكامل، وهو ما يجعل حجم الدفعة هذا قابلاً للاستمرار من الأساس.
• البيئات — تشغيل مختلط واحد يمتد عبر مهام البرمجة والوكيل العام والمهام البصرية والسيبرانية، في ظل عدة أُطر تشغيل للوكلاء في آن واحد، بدلًا من دورات تعلم معزز منفصلة لكل مجال. والوصف المختصر الذي تستخدمه شاومي لذلك هو "You Only RL Once". والحجة وراء الخلط هي أن المكاسب في قدرة واحدة تعزّز القدرات الأخرى؛ أما الخطر فهو أن تُحرَم فئة مهام بطيئة من الموارد، وهو ما تقول الشركة إنها تتعامل معه بالجدولة التكيّفية.
• حوسبة المُقيِّم — المحور الذي لا يتعلق بوحدات معالجة الرسوميات بالمعنى المعتاد. لا يمكن لنتيجة النجاح/الفشل الثنائية أن تُرتِّب حلين كلاهما ناجح، لذا تصبح إشارة المكافأة نفسها هي الشيء الذي تقوم بتوسيعه. يقارن مُقيِّم وكيلي المحاولات الست عشرة لمهمة ما بشكل مشترك، ويُنتج إشارة متدرجة بدلًا من بت واحدة.
ذلك المحور الثالث هو حيث تستحق عبارة «التحسين الذاتي» الواردة في العنوان مكانها، وهو حيث يكون التقرير أكثر انكشافًا. إنّ قيام النموذج بتقييم مخرجاته الخاصة يُعدّ سطحًا لاختراق المكافأة، والتقرير يتعامل معه على هذا الأساس.
الآليتان اللتان تستحقان الفهم فعليًا
إعادة توزيع الميزة على مستوى المجموعة
بعد كل خطوة، تنتج السياسة ست عشرة محاولة لكل مهمة، وتوضع جميعها في مساحة عمل مشتركة حتى يتمكن نموذج تقييم من فحصها معًا بدلًا من فحصها واحدة تلو الأخرى. ثم تُقيَّم الرقع الناجحة على خمسة محاور: مدى ملاءمة النهج للمشكلة، ومدى دقة التنفيذ من دون مسارات احتياطية لا داعي لها، ومدى كون التغيير أدنى ما يمكن، وما إذا كان يعدّل أي شيء خارج النطاق، وما إذا كان يطابق نمط الكود المحيط. وتتلقى التمريرات ذات الترتيب الأدنى تعزيزًا إيجابيًا أقل. وأي رقعة يُتأكَّد أنها غش تُصفَّر وتُعامَل كفشل.
النتيجة هي إشارة تدريب تدفع نحو حلول أقصر وأرخص بدلًا من كونها صحيحة فحسب — ويصف التقرير ذلك بأنه توجيه نحو رموز (tokens) أقل لكل مهمة. هذا هو الجزء الذي ينبغي التمسك به، لأن النتائج الرئيسية الواردة لاحقًا في الورقة تشير إلى الاتجاه المعاكس.
تخليق المكافأة حسب المجموعة
النصف غير المتصل من الفكرة نفسها. فبدلًا من اشتقاق الجودة بالكامل من مُقيّم مباشر، يحسب الفريق مسبقًا معايير تقييم خاصة بكل مهمة، ويضرب مكافأة الاختبار الثنائية في درجات الجودة والسلوك المستمدة من تلك المعايير. يصف التقرير ذلك بأنه بناء المعايير من عمليات تنفيذ متباينة — أي من الحالات التي اختلفت فيها النتيجة، وهي حيث توجد المعلومة.
التقييم ليس مجانيًا. تُقدِّر التقرير كلفة أداة التقييم بنحو 12.7% من إجمالي كلفة التعلّم المعزَّز في MiMo-V2.6-Pro. وهذا الرقم وحده هو أنفع ما في الورقة البحثية لكل من يفكر في نسخ هذه الطريقة، لأنه يحوِّل عبارة «وسِّع نطاق أدوات التقييم لديك» من فكرة إلى بند في الميزانية.
الراوتر المجمّد هو النتيجة التي ستنسخها معظم الفرق أولاً
يحتوي قسم الاستقرار في التقرير على نتيجة قائمة بذاتها، مستقلة عن MiMo-V2.6 ومستقلة عن مدى جودة أداء النموذج.
مع موجّهات خليط الخبراء القابلة للتدريب، انحرف حِمل الخبراء بشكل سيئ على مدار عشرين خطوة. ارتفع معامل الاختلاف بين الخبراء من 0.78 إلى 2.0. وانتقلت ذروة الحِمل على أكثر الخبراء انشغالاً من ستة أضعاف المتوسط إلى ستة عشر ضعفاً. وارتفعت نسبة الخبراء الباردين — أولئك الذين لا يتلقون أي حركة تقريباً — من 0.5% إلى 22%. وأدت استعادة أوزان الموجّه إلى قيمها الابتدائية عند الخطوة 20 إلى استعادة التوازن فوراً.
كان رد شاومي هو تجميد موجّه MoE طوال التشغيل. والمنطق ليس خفيًا: على هذا المقياس من الدفعات، يُعد عدم استقرار التوجيه مشكلة في ديناميكيات التدريب يمكنك ببساطة أن ترفض وجودها، وليس الموجّه هو المكان الذي يؤدي فيه التعلم المعزز عمله. أما ما إذا كان التجميد يكلف شيئًا على صعيد الجودة النهائية، فلم تُجب عنه أي دراسة استئصال في المواد المنشورة، وهذا مطلب مشروع.
ما لا يقوله هذا الاكتشاف هو أي شيء عن الخدمة. إن توازن حمل الموجّه أثناء جولة تدريب واستخدام الخبراء تحت حركة الإنتاج سؤالان مختلفان، والتقرير لا يتناول إلا الأول.
الأرقام، مع تسمياتها المرفقة.
النتائج الرئيسية للتقرير نظيفة في الشكل وفوضوية في التفاصيل، وهذه الفوضى ليست فضيحة — إنها ثلاث قياسات مختلفة لثلاثة أشياء مختلفة تشترك في الاسم نفسه.
• DeepSWE v1.1، محتجَز — ارتفع MiMo-V2.6-Pro من 58.4 إلى 72.6 خلال التشغيل؛ وMiMo-V2.6-Flash من 48.7 إلى 65.7. يتكوّن المعيار من 113 مهمة هندسة مستودعات طويلة الأفق تُقيَّم بواسطة مدقّقات وظيفية عبر خمس لغات برمجة، والمقياس هو average@3 — متوسط معدل اجتياز المدقّق عبر ثلاث محاولات مُعيّنة، وهو ليس مماثلًا لسؤال ما إذا كانت أي واحدة من المحاولات الثلاث قد نجحت. إن قراءة avg@3 على أنها pass@3 ستُبالغ في تقدير كل رقم في الصفحة.
• المعيار نفسه، عند قياسه في مكان آخر — تُظهر بطاقات النماذج الصادرة 71.9 لـ Pro و67.9 لـ Flash. وأظهرت لوحة معلومات التدريب العامة لدى شاومي 72.57 و65.68. لذا هناك ثلاثة أرقام منشورة لكل نموذج، اثنان منها من شاومي، واتجاه التباين مختلف لكل من الشقيقين. ولا شيء منها خاطئ؛ فهي تصف لقطة من لوحة معلومات، ومدخلًا في بطاقة، وسطرًا في تقرير، عند نقاط مختلفة وربما في ظل أُطر اختبار مختلفة.
• التقطير — MiMo-V2.6-Distill-Qwen-9B، الذي جرى ضبطه الدقيق انطلاقًا من Qwen3.5-9B على عروض توضيحية ولّدها MiMo، رفع SWE-bench Verified من 61.1 إلى 66.2. هذا هو الرقم الأكثر قابلية للنقل في الورقة، لأن نموذج طالب بحجم 9B هو حجم تستطيع معظم الفرق تشغيله فعليًا.
• مقياس أداء مصغّر داخلي في الأمن السيبراني — من 31.3 إلى 47.0. "داخلي" تعني داخلي حقًا: فالمهام غير منشورة، لذا لا يمكن إعادة إنتاج الفارق حتى من حيث المبدأ.
• مؤشر Artificial Analysis Intelligence Index — 46 لـ MiMo-V2.6-Pro. هذا الرقم مختلف من حيث النوع. أنتجته Artificial Analysis بتشغيل أداة التقييم الخاصة بها على نقطة التحقق الصادرة، وليس Xiaomi، مما يجعله الرقم الرئيسي الوحيد في هذا الإصدار الذي يمكن للقارئ اعتباره مقيسًا لا مُبلَّغًا عنه. وهو أيضًا الرقم الذي ينبغي مقارنته بـ GLM-5.3 وKimi K3 والحدود المغلقة، ويأتي أقل بخمس نقاط من Claude Opus 5.


يتسم التقرير بالصدق بشأن حدود جدوله الخاص، وهذه هي الجملة التي يجدر أن تُقتبس في وجه كل من ليس كذلك: فالمقارنات تخلط بين معايير قياس عامة وداخلية ولا تعزل مساهمة التعلم المعزز عن البنية أو التدريب المسبق. وكون النموذج أفضل بعد التعلم المعزز ليس دليلًا على أن التعلم المعزز هو السبب.
هناك تحفّظ ثانٍ، وهو التحفّظ الذي يتعارض مع الإطار المطروح. فالمكاسب المُبلَّغ عنها تصاحب عمومًا ارتفاعًا في استخدام الرموز. ويعرض التقرير ذلك بوصفه تحسّنًا مستمرًا في القدرات لا بوصفه كفاءة، وهو محق في ذلك. لكن GAR صُمّم صراحةً للتوجيه نحو مسارات أقصر وعدد أقل من الرموز لكل مهمة، والنتيجة الإجمالية لا تُظهر أن عبء العمل أصبح أرخص. ارتفعت القدرات؛ ولم تنخفض التكلفة لكل مهمة. وإذا قرأت "التحسين الذاتي" على أنه "سيحتاج النموذج أموالًا أقل مني في الربع القادم"، فلا تدعم الورقة هذه القراءة.
ما يتركه التقرير دون التحقق منه
حتى 23 سبتمبر 2026، لم ينشر أي طرف ثالث إعادة تشغيل مستقلة لأعمدة DeepSWE أو Terminal Bench أو CyberGym. التمييز المهم هو بين نقطة المؤشر وكل ما عداها: 46 قياس أجراه شخص آخر، و72.6 ادّعاء حول عملية تدريب لا يستطيع أحد إعادة تنفيذها، لأن العملية كلفت، وفق ما ذُكر، 2.6 مليون دولار لـ Pro و0.9 مليون دولار لـ Flash ولن تتكرر مرتين.
ما نشرته شاومي، خلافًا لمعظم المختبرات، هو ديناميكيات التدريب، وإطار التعلم المعزز، وبيئات المهام — أكثر من 7,000 بيئة مصنَّفة عبر هندسة البرمجيات، وإعادة إنتاج الثغرات، والعمل المعرفي، وتصميم الويب. وهذا هو الأثر الأطول بقاءً. فالأوزان تخبرك بما أنتجته التجربة؛ أما البيئات فتخبرك كيف تجري التجربة بنفسك، وهو السبيل الوحيد لحسم أيٍّ من ادعاءات التعلم المعزز.
يستحق الدفاع ضد اختراق المكافأة تحفظاً محدداً. فهو موصوف بأنه متعدد الطبقات — تصميم المكافأة، والتقييم الخصومي، وكشف الشذوذ، والتحقق المتبادل بين المدققين — وهو موصوف بالكامل من قبل الطرف الذي سيكون محرجاً من فشله. إن الدفاع ضد نموذج يخدع مُقيِّماً قائماً على نموذج ليس من النوع الذي يمكن لتقرير ذاتي أن يحسمه. الآلية مذكورة بالاسم ونمط الفشل معترف به، وهو أكثر مما تفعله معظم الأوراق البحثية، ولا يزال سؤالاً مفتوحاً.
ما الذي يمكنك فعله فعليًا بهذا اليوم
كلا نقطتي التحقق قابلتان للتنزيل، دون قيود، تحت وسم رخصة MIT: Xiaomi MiMo-V2.6-Pro-RL وXiaomi MiMo-V2.6-Flash-RL، متعدّدتا الوسائط بالكامل، بسياق يبلغ مليون رمز، مع الإبلاغ في فهرس Flash عن 172.9 GB من بيانات الأوزان موزعة على 65 شظية بصيغة FP8. لم تنشر Xiaomi بطاقة تسعير لكل رمز لجيل V2.6، لذا فإن الخيار اليوم هو الاستضافة الذاتية مقابل نموذج مستضاف تدفع مقابله بالفعل.
هذه المقارنة هي حيث تكمن القيمة العملية للورقة البحثية، وهي غير مُجْمِلة للورقة بطريقة مفيدة. فالادّعاء قيد الاختبار ليس «هل MiMo-V2.6-Pro جيد» — فـ46 إجابة تحسم ذلك. بل هو «هل ينتج التعلّم المعزّز على مهام وكيلية مختلطة استدلالًا ينتقل إلى عبء العمل الخاص بي»، والطريقة الصادقة الوحيدة للإجابة عن ذلك هي تشغيل الاثنين ومقارنتهما، وهذه مسألة توجيه قبل أن تكون مسألة بحثية. DeepSeek-V4.1-Flash على بُعد مفتاح API واحد بتكلفة 0.15 و0.60 دولار لكل مليون رمز، وQwen3.8-Flash وGLM-5.3-Flash يقبعان على المفتاح نفسه، وإذا أردت أن تضع نقطة استرجاع MiMo مستضافة ذاتيًا خلف النقطة الطرفية نفسها لمدة أسبوع وترى ما إذا كان منحنى DeepSWE يظهر في تقييماتك الخاصة، فذلك تغيير في الإعداد لا ترحيل. وOrcaRouter لا تستضيف نماذج Xiaomi، ولا ينبغي قراءة أي شيء هنا على أنه يدّعي خلاف ذلك — لكن النماذج التي ستقارنها بها كلها يمكن الوصول إليها عبر مفتاح OrcaRouter API واحد بسعر المزوّد مع تمرير هامش ربح 0%، مع تحويل تلقائي عند الفشل إذا تبيّن أن نقطة استرجاع تجرّبها غير مستقرة تحت الحمل.
حالة النموذج غير المُثبت هي الحالة التي وُجد تجاوز الفشل من أجلها. نقطة تحقق نُشرت قبل يومين، مع تقييم أجراه المورّد ودون إعادة تشغيل مستقلة، هي بالضبط ما تريد تجربته دون أن تضع مسار إنتاج خلفه.
من ينبغي أن يقرأ الورقة
إذا كنت تُشغّل تدريبًا لاحقًا، فاقرأه من أجل نتيجة الموجِّه ورقم تكلفة المُقيِّم. كلاهما قابل للنقل، وكلاهما رخيص الاختبار، ولا يعتمد أي منهما على تصديق أي شيء عن جدول المعايير القياسية الخاص بـ MiMo-V2.6. ونتيجة الموجِّه المجمَّد تحديدًا من النوع الذي تكلّف تجربته ظهيرة واحدة وتوفّر عليك تشغيلًا كاملًا.
إذا كنت تختار نموذجًا، فاقرأ نقطة المؤشر وتجاهل الباقي. قاس Artificial Analysis الرقم 46 على النموذج الصادر؛ وهذا هو الرقم الوحيد في هذا الإصدار الذي لم يأتِ من المورّد، وهو يضع MiMo-V2.6-Pro في قمة مجال الأوزان المفتوحة ومتأخرًا بخمس نقاط عن Claude Opus 5. أما كل ما تبقى في التقرير فيصف كيف وصلت Xiaomi إلى هناك، وكيف وصلت Xiaomi إلى هناك ليس شيئًا يمكنك شراؤه.
وإذا كنت تقرأ التغطية الإعلامية بدلًا من الورقة البحثية، فالشيء الذي ينبغي الانتباه إليه هو عبارة «التحسين الذاتي». تُظهر نتائج التقرير نفسه أن القدرة ترتفع جنبًا إلى جنب مع استخدام الرموز، وهو اكتشاف حقيقي وقابل للتكرار بشأن توسيع نطاق التعلم المعزز. وهو ليس ادعاءً بأن النموذج أصبح أرخص في التشغيل، والأوراق التي تلي هذه الورقة هي التي ستخبرك ما إذا كان سيصبح كذلك في النهاية.
