
Intern-S2-Mobius: النموذج ذو الـ35B معلمة الذي يفصل المعرفة عن الاستدلال
- qwenجديدQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 لكل مليون رمز · 56 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3150الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 201 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicجديدAnthropic: Claude Opus 52026-07-2461الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2150الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1651الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1557الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0951الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0955الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0959الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0854الذكاء72البرمجة
- tencentTencent: Hy32026-07-0641الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3053الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1651الذكاء69البرمجة60الرياضيات
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242الذكاء61البرمجة61الرياضيات
نشر فريق InternLM التابع لمختبر شانغهاي للذكاء الاصطناعي بهدوء Intern-S2-Mobius، وهو نموذج أساسي مفتوح الأوزان بحجم 35 مليار معلمة يفعل شيئًا لا يفعله تقريبًا أي نموذج آخر تم إصداره: فهو يتوقف عن تخزين المعرفة داخل طبقاته. فبدلًا من الهيكل القياسي لمحول Transformer — حيث تحمل كل طبقة كتلة تغذية أمامية خاصة بها مليئة بالحقائق المحفوظة — يسحب Mobius كل تلك المعرفة إلى ذاكرة واحدة مشتركة عالميًا ويتيح لعدد صغير من Reasoners الاستعلام منها مرارًا وتكرارًا. والعائد المزعوم ليس درجة أعلى في المعايير. بل هو السرعة: الإجابات نفسها في نحو ثلث إلى خُمس رموز الاستدلال، وحتى 4.6 أضعاف إنتاجية الطلبات. يشرح هذا الدليل ما هو Mobius فعلًا، وما الذي يكشفه ملف إعداده ولا تكشفه بطاقة النموذج، وما تُظهره المعايير المنشورة سطرًا بسطر — متضمنًا الصفّين اللذين يخسر فيهما — وأين يصمد ادعاء «أسرع 4 مرات» وأين يتبخر، ومن الذي ينبغي له أن يهتم به واقعيًا.
ملاحظة بشأن الدقة: كل رقم مذكور أدناه مصدره بطاقة تعريف النموذج الخاصة بـ InternLM، وأرقام أدائه وكفاءته المنشورة، ودليل نشره، وملفات إعداده على Hugging Face. لا يوجد أي تقييم مستقل من طرف ثالث لـ Intern-S2-Mobius حتى وقت كتابة هذا النص — فهو غير مدرج في أي لوحة تصنيف مستقلة، ولا يُنشر عبر أي مزود استدلال، وعداد تنزيله ما زال عند الصفر. تعامل مع جميع الأرقام المقارنة باعتبارها واردة من البائع حتى يقوم شخص ما بإعادة إنتاجها. مواصفات وأكواد نموذج بهذه الحداثة تتغير بسرعة؛ تحقق قبل البناء.
خلاصة سريعة: Intern-S2-Mobius نموذج أساسي متعدد الوسائط بـ35 مليار معامل، مرخّص بموجب Apache 2.0، تم تدريبه مسبقًا بشكل مستمر من Qwen3.5-35B ثم خضع للتدريب اللاحق باستخدام التعلم بالإشراف والتعلم المعزز. تكمن حداثته في الناحية المعمارية: تصميم Mobius-v0 يستبدل تخزين المعرفة المرتبط بالطبقات في التغذية الأمامية بذاكرة مشتركة عالمية واحدة تضم 2560 خبيرًا، يتم الاستعلام عنها بواسطة أربع كتل Reasoner مكدّسة يمكنها الوصول إلى المعرفة خارج عمقها الخاص (اتصال متبقي خلفي) وتحسين الحالات الكامنة عبر تكرار كامن متكرر قبل فك الترميز (الاستدلال الكامن الديناميكي). في تقييم InternLM الخاص، يتفوق على خط الأساس Qwen3.5-35B الذي بُني منه في سبعة من أصل تسعة معايير عامة (متوسط 67.88 مقابل 65.05) ويسحقه في المهام العلمية (52.14 مقابل 18.20)، مع إنتاج آثار استدلال أقصر بنحو 1.5 مرة في المتوسط — أقصر 4.6 مرة في MMLU Pro، و5.0 مرة في GPQA Diamond. هذا الضغط في الآثار هو مصدر كسب الإنتاجية: 2.9 مرة عند حجم الدفعة 16، ويرتفع إلى 4.6 مرة عند حجم الدفعة 256. أما المآخذ فحقيقية: فهو يخسر في أصعب معيارين للاستدلال (HLE وUGD hard)، وكسب الإنتاجية يختفي إلى حد كبير في رياضيات المسابقات، ولا أحد خارج المختبر تحقق من أي من ذلك.
النقاط الرئيسية
• إصدار يضع البنية أولاً: يفصل Mobius-v0 متجهات المعرفة عن عوامل الاستدلال — ذاكرة مشتركة واحدة تضم 2,560 خبيرًا تخدم أربع كتل استدلال، بدلاً من 40 طبقة يخزّن كل منها معرفة FFN الخاصة به.
• الكفاءة، لا الذكاء، هي الفكرة الأساسية: متوسط طول المخرجات ينخفض حوالي 1.5 مرة، ويرتفع معدل معالجة الطلبات 2.9 مرة عند الدفعة 16 إلى 4.6 مرة عند الدفعة 256 مقارنةً بخط الأساس Transformer.
• إنه يتفوق حقًا على نموذجه الأساسي: متوسط 67.88 مقابل 65.05 في المهام العامة، محققًا الفوز في MMLU Pro (89.05 مقابل 85.31)، وAIME 2026 (95.31 مقابل 92.08)، وHMMT 2026 (85.51 مقابل 78.50).
• لكنه يخسر حيث يكون التروّي في القرار أكثر أهمية: HLE 19.11 مقابل 22.40 وUGD الصعبة 73.02 مقابل 78.02 — وهما أصعب تقييمين في المجموعة، وقد فاز بهما المحوّل العادي في كلتا الحالتين.
• القفزة العلمية هي أكبر نتيجة منفردة: Biology-Instructions 51.40 مقابل 3.77، Mol-Instructions 45.73 مقابل 21.70، MolecularIQ 59.29 مقابل 29.13.
• مفتوح ولكن غير متوفر: أوزان Apache 2.0 على Hugging Face، لا يوجد موفر استدلال يستضيفه، ~73 جيجابايت من أوزان bfloat16 — الاستضافة الذاتية هي الطريقة الوحيدة حالياً لتشغيله.
ما هو Intern-S2-Mobius في الحقيقة؟
Intern-S2-Mobius هو نموذج أساسي بحجم 35B نشرته منظمة internlm، وهي منظمة Hugging Face المسؤولة عن سلسلة Intern التابعة لمختبر شنغهاي للذكاء الاصطناعي. تم نشر الأوزان على Hugging Face في 29 يوليو 2026، وأصبح مستودع GitHub المرافق — دليل README ودليل النشر وتقرير فني كامل بصيغة PDF — متاحًا للعموم في 5 أغسطس 2026. تم إصداره بموجب ترخيص Apache 2.0، وهو من أكثر التراخيص تساهلاً للأوزان المفتوحة: الاستخدام التجاري والتعديل وإعادة التوزيع مسموحة جميعًا.
إنه ليس ضبطًا دقيقًا. إنه تدريب مسبق مستمر مع جراحة البنية المعمارية. استندت InternLM إلى Qwen3.5-35B — نموذج Alibaba مفتوح الأوزان من نوع خليط الخبراء بحجم 35 مليار معامل، الذي صدر في 4 مارس 2026 — وأعادت هيكلة طريقة تخزين النموذج للمعرفة والوصول إليها، ثم واصلت التدريب المسبق على النتيجة، ثم طبقت عليه الضبط الدقيق بالإشراف والتعلم المعزز. هذا النسب مهم لتفسير النتائج المعيارية: كل مقارنة تنشرها InternLM هي Mobius مقابل النموذج الدقيق الذي نشأت منه، وهو أنقى إزالة محتملة لتغيير البنية وأيضًا، بشكل مريح، المقارنة الأكثر احتمالًا لتملقها.
النموذج متعدد الوسائط. تصنّفه Hugging Face كـ"صورة-نص-إلى-نص"، ويؤكد الإعداد وجود مشفّر رؤية كامل بالإضافة إلى معالجة رموز الفيديو. كما أنه، انطلاقًا من الحكم على ما يُشحن مع الأوزان، موجّه مباشرةً نحو العلوم — المزيد حول ذلك أدناه.
معمارية موبيوس، بلغة بسيطة
يقوم المحول التقليدي (Transformer) بالتداخل بين مهمتين في كل طبقة. الانتباه ينقل المعلومات بين الرموز (tokens)؛ بينما الشبكة المغذية للأمام (أو في نموذج خليط الخبراء، بنك من شبكات FFN الخبيرة) تخزن المعرفة. ولأن الشبكة المغذية للأمام تقع داخل الطبقة، فإن المعرفة التي تحملها لا يمكن الوصول إليها إلا عند ذلك العمق. الحقيقة التي تُتعلَّم في الطبقة 30 لا يمكن الرجوع إليها بواسطة الاستدلال الذي يحدث في الطبقة 5. تتدفق المعلومات إلى الأمام، طبقة بعد طبقة، وهذا هو المسار الوحيد.
موبيوس يكسر هذا الارتباط. يصف InternLM ثلاث عواقب.
فصل المعرفة عن الاستدلال.يتم استبدال التخزين المرتبط بالطبقات في FFN بـالذاكرة المشتركة عالميًا. فبدلاً من أن تمتلك 40 طبقة كلٌّ منها شريحةً من معرفة النموذج، هناك مجمّع واحد يمكن لكل مرحلة استدلال الوصول إليه. حجة InternLM هي أن هذا يحسّن ضغط المعرفة — إذ لا تحتاج الحقائق نفسها إلى إعادة تعلّمها بشكل متكرر على أعماق متعددة — ويمنح كل مُستدلّ مساحة معرفية أوسع بكثير مما يمكن أن تقدمه FFN الخاصة بطبقة واحدة.
اتصال متبقي عكسي.نظرًا لأن الذاكرة مشتركة، فإن مراحل التفكير الضحلة والعميقة تصل كلتاهما إلى المستودع ذاته. لم يعد الوصول إلى المعرفة مقتصرًا على تدفق أمامي. يمكن لمرحلة ضحلة أن تستدعي شيئًا لم يكن، في بنية قياسية، ليتاح إلا بعد ثلاثين طبقة لاحقًا. يدّعي InternLM أن هذا يسمح للنموذج بتكوين المعرفة عبر الأعماق بمرونة أكبر، والأهم من ذلك، تجميع المعلومات المفيدة في خطوات استدلال أقل. تلك الجملة الأخيرة هي الأطروحة بأكملها للإصدار.
الاستدلال الكامن الديناميكي. بدلاً من إضفاء طابع خارجي على كل خطوة تفكير كرموز مرئية لسلسلة الأفكار، تعمل Mobius على تحسين حالاتها الخفية المستمرة من خلال التكرار الكامن المتكرر قبل فك تشفير أي شيء. يحدث جزء من "التفكير" في مساحة التمثيل الداخلية للنموذج بدلاً من النص المُولَّد، ويتم تخصيص مقدار هذا الحساب الداخلي ديناميكيًا لكل رمز. التأثير العملي هو أن النموذج يحتاج إلى كتابة عدد أقل من الكلمات للوصول إلى نفس النتيجة — وبما أن التوليد ذاتي الانحدار ومتسلسل، فإن كتابة عدد أقل من الكلمات هي الطريقة الأكثر مباشرة لجعل نموذج الاستدلال أسرع.
إجمالاً، الفكرة هي نموذج استدلالي يفكر أكثر ويكتب أقل.

ما الذي يكشفه ملف الإعدادات؟
تصف بطاقة النموذج البنية نثرًا. الملف code>config.json/code> يجعلها ملموسة، ويحتوي على عدة أرقام تستحق المعرفة.
• أربعة وحدات Reasoner عبر 40 طبقة. يصرّح تكوين النص بوجود 40 طبقة مخفية ولكن أربع كتل فقط. يتم تنظيم الطبقات الأربعين في أربع مراحل Reasoner تتفاعل مع الذاكرة المشتركة Memory، بدلاً من أربعين وحدة مستقلة للمعرفة والانتباه.
• 2,560 خبيرًا. هذا هو التجسيد الحرفي للذاكرة المشتركة. يضمّ Mobius 2,560 خبيرًا مع 8 خبراء مُفعَّلين لكل توكين وحجم وسيط صغير جدًا لكل خبير يبلغ 512، إضافةً إلى خبير مشترك واحد. ولإعطاء فكرة عن الحجم، يستخدم شقيقه Intern-S2-Preview 256 خبيرًا. إن تجمّعًا أكبر بعشر مرات من خبراء أصغر بكثير هو بالضبط ما يبدو عليه «مخزن معرفة عالمي واحد بدلًا من شبكات FFN لكل طبقة» عندما تكتُبه كإعدادات.
• 35B على العلبة، ~36B على القرص، ~3B نشطة.بطاقة النموذج تشير إلى 35B؛ قارئ safetensors من Hugging Face يبلغ عن 36B معلمة؛ فهرس الأوزان يبلغ إجماليه 72.96 جيجابايت بصيغة bfloat16، أي ما يعادل تقريبًا 36.5B. دليل النشر هو الأكثر دقة: فهو يصف الإصدار بأنه نموذج 30B-A3B — بحوالي 3B معلمة نشطة لكل رمز. كما هو الحال مع أي MoE متناثر، تدفع ثمن مجموعة الأوزان الكاملة في الذاكرة وتحصل على حوسبة نموذج صغير لكل رمز.
• انتباه هجين، بنسبة 3:1. تتناوب قائمة الطبقات بين ثلاث طبقات انتباه خطي وطبقة انتباه كامل واحد، على طول الطريق — عشر طبقات انتباه كامل من أصل 40. يحافظ الانتباه الخطي على ذاكرة السياق الطويل ويمنع انفجار الحساب؛ وتحافظ طبقات الانتباه الكامل الدورية على الاسترجاع الدقيق الذي يتخلى عنه الانتباه الخطي الخالص. تستخدم الطبقات الخطية نواة التفاف بعرض 4 وحالة SSM بصيغة float32، وهي الوصفة القياسية الحالية بنمط gated-delta.
• سياق 256K.الحد الأقصى للتضمينات الموضعية هو 262,144. لاحظ الفجوة بين ما تدعمه البنية وبين كيفية تقييمها: أجرى InternLM معايير النصوص الخاصة به عند 128K، وعند 64K على MMLU Pro وSimpleQA وHLE. سقف 256K ليس مثل 256K من الجودة المُثبتة.
• رأس تنبؤ متعدد الرموز مدمج. توجد وحدة MTP من طبقة واحدة تضم 256 خبيرًا خاصًا بها. هذا ليس للزينة — يوصي دليل النشر بالتشغيل باستخدام فك الترميز التخميني MTP وأربعة رموز مسودة، لذا فإن جزءًا من قصة السرعة في العالم الحقيقي هو فك الترميز التخميني، وليس البنية وحدها.
• برج رؤية حقيقي. مشفر رؤية من 27 طبقة وبُعد خفي 1152، وحجم رقعة 16، ودمج مكاني 2×2، وتقطيع زمني للفيديو، ويُسقط في تدفق النص ذي 2048 بُعدًا باستخدام RoPE متعدد الوسائط المتداخل. الإدخال: صور وفيديو، والإخراج: نص.
• تفاصيل أخرى للمهتمين: 16 رأس انتباه ببعد رأس يبلغ 256، ورأسان للمفتاح والقيمة (انتباه استعلام مجمّع قوي)، ومخرجات انتباه بوابية، وعامل دوراني جزئي بقيمة 0.25، وثيتا RoPE البالغة 10 ملايين، ومفردات مكونة من 251,392 رمزًا.
المعايير، سطرًا بسطر
InternLM تم تقييمه باستخدام OpenCompass ونشر مقارنة واحدة: Intern-S2-Mobius-35B مقابل Qwen3.5-35B، النموذج الذي تم التدريب المستمر منه. تسعة معايير عامة، وثلاثة علمية.
في المهام العامة، يفوز Mobius في سبعة من تسعة. MMLU Pro — معرفة واسعة متعددة المجالات مع مشتتات أصعب من MMLU الأصلي — يحقق نتيجة 89.05 مقابل 85.31، بزيادة قدرها 3.7 نقطة وأوضح نتيجة معرفية في المجموعة. GPQA Diamond، أسئلة علمية بمستوى الدراسات العليا كُتبت لتكون مقاومة لـ Google، وهي تعادل أساسيًا عند 80.81 مقابل 80.24. IMO Bench، رياضيات بمستوى الأولمبياد، يحقق نتيجة 81.25 مقابل 77.50. AIME 2026، امتحان الرياضيات التمهيدي الأمريكي، يحقق نتيجة 95.31 مقابل 92.08. HMMT 2026، بطولة هارفارد ومعهد ماساتشوستس للتكنولوجيا للرياضيات، هي الأكبر من حيث الفارق في نتائج الرياضيات عند 85.51 مقابل 78.50. AMO يحقق نتيجة 58.00 مقابل 50.00. و SimpleQA — استرجاع الحقائق في صيغة قصيرة، وهو المعيار الذي يقيس بشكل مباشر ما إذا كان النموذج يعرف الأمور فعلًا — يقفز من 21.39 إلى 28.90، أي تحسن نسبي قدره 35% وهو أفضل دليل منفرد على حجة InternLM القائلة بأن "الذاكرة المشتركة تضغط المعرفة بشكل أفضل".
ثم الخسارتان، وهما الصفان المثيران للاهتمام. UGD hard يسير في الاتجاه الآخر: 73.02 لـ Mobius مقابل 78.02 لخط الأساس، بفارق خمس نقاط. و HLE — اختبار Humanity's Last Exam، أصعب تقييم عام شائع الاستخدام، حيث لا تزال النماذج المتطورة تسجل درجات في العشرات والعشرينات — هو 19.11 مقابل 22.40. المحول البسيط يفوز بفارق 3.3 نقاط على المعيار المصمم خصيصًا ليتطلب أكبر قدر من التفكير.
هذا النمط ليس ضجيجًا، وليس مخفيًا: نشرته InternLM. القراءة الأكثر ترجيحًا هي أن التفكير الكامن هو ضغط، والضغط فقداني في النهاية. استيعاب التفكير في حالات خفية مستمرة يعمل بشكل رائع عندما يكون التفكير مكثفًا في الاسترجاع أو يتبع شكلًا مألوفًا — وهو ما يصف MMLU Pro وSimpleQA ومعظم رياضيات المسابقات. في المسائل التي تتطلب حقًا سلاسل تفكير طويلة واستكشافية وتصحيحية للأخطاء، لا يزال التتبع الصريح رمزًا برمز يبدو أنه يستحق تكلفته. المتوسط العام — 67.88 مقابل 65.05 — هو فوز حقيقي، لكنه متوسط يخفي مقايضة، وليس تحسنًا موحدًا.
النتائج العلمية تمثل درجة مختلفة من الاختلاف. Biology-Instructions ترتفع من 3.77 إلى 51.40. Mol-Instructions، التي تغطي فهم الجزيئات وتوليدها، ترتفع من 21.70 إلى 45.73. MolecularIQ يرتفع من 29.13 إلى 59.29. المتوسط هو 52.14 مقابل 18.20. الأرقام مثل 3.77 التي ترتفع إلى 51.40 ليست مكاسب معمارية؛ إنها بصمة تدريب مستهدف على مهام لم يُعلَّم النموذج الأساسي القيام بها أصلًا. حصول Qwen3.5-35B على أقل من 4% في Biology-Instructions يعني أنه لا يفهم صيغة المهمة، وليس أنه سيئ في علم الأحياء. اقرأ هذه الصفوف الثلاثة على أنها "أضاف InternLM تخصصًا علميًا"، وهو أمر قيّم حقًا وهو المغزى الكامل من خط Intern-S — فقط لا تنسبه إلى معمارية Mobius.
أين تكون «أسرع 4 مرات» حقيقية، وأين لا تكون؟
الادعاء بالكفاءة هو السبب في وجود هذا النموذج، لذا يستحق قراءة متأنية. عنوان InternLM هو "تسريع استدلال من البداية إلى النهاية بنحو 4 أضعاف." رقم الإنتاجية المنشور أكثر إفادة من العنوان، وأكثر صدقًا.
بقياس إنتاجية الطلبات مقابل حجم الدفعة، بمتوسط عبر المعايير، يتفوق Mobius على خط الأساس Transformer بمقدار 2.9x عند حجم دفعة 16 و4.6x عند حجم دفعة 256. الفجوة تتسع مع حجم الدفعة، وهو ما تتوقعه عندما يأتي التفوق من توليد عدد أقل من الرموز لكل طلب: كلما زاد عدد الطلبات التي تجمعها معًا، زاد تراكم خطوات فك التشفير الموفرة. العنوان الرئيسي «ما يقرب من 4x» هو نقطة وسطى لنطاق، وليس ثابتًا.
حلّل الأمر حسب كل معيار وسوف تتضح الصورة أكثر. في MMLU Pro و GPQA Diamond، يكون Mobius أسرع بشكل كبير عند كل حجم دفعة — فمنحنيات الإنتاجية تنفصل فورًا وتستمر في التباعد. في IMO Bench، يتفوق باستمرار لكن بشكل متواضع. في AIME 2026 و HMMT 2026، يكون Transformer الأساسي في الواقع أسرع عند أحجام الدفعات المتوسطة، بينما يتقدم Mobius فقط عند حجم الدفعة 256. وفي أصعب مسائل الرياضيات التنافسية، تكون ميزة الإنتاجية متعادلة أو أسوأ عبر معظم نطاق التشغيل المفيد.
لماذا؟ لأن الإنتاجية تتبع ضغط التتبع بشكل شبه مثالي. ينخفض متوسط طول المخرجات عبر المعايير بحوالي 1.5 مرة، من حوالي 20,400 رمز إلى حوالي 13,200. لكن هذا المتوسط يغطي نطاقًا واسعًا: أقصر بـ4.6 مرة في MMLU Pro (حوالي 1,100 رمز مقابل 5,150) و أقصر بـ5.0 مرة في GPQA Diamond (حوالي 2,600 مقابل 12,900)، في مقابل فقط 1.4 مرة في IMO Bench، 1.5 مرة في AIME 2026، و 1.2 مرة في HMMT 2026. حيثما يتمكن النموذج من ضغط تفكيره، فإنه يحلّق. وحيثما تتطلب المسألة 24,000 رمزًا من الاشتقاق مهما كان الأمر، فإنه يعجز عن ذلك، فتظهر بدلًا من ذلك أعباء البنية.
المعنى العملي: إذا كانت مهامك تشبه استرجاع المعرفة، أو الاختيار من متعدد، أو الأسئلة والأجوبة التقنية، أو التصنيف، فإن التسريع يكون كبيرًا وفوريًا. أما إذا كانت مهامك اشتقاقًا رياضيًا أو علميًا صعبًا، فتوقع تكافؤًا تقريبيًا في الأداء، وستكون النتيجة مفاجأة سارة. أي شخص يصف النموذج بأنه "أسرع بأربع مرات" كخاصية عامة له، إنما يستند إلى متوسط سلوكين مختلفين تمامًا.

الحزمة العلمية المخفية في قائمة الملفات
أكثر ما يكشف عنه هذا الإصدار ليس في بطاقة النموذج إطلاقًا — بل في قائمة ملفات المستودع. إلى جانب ملفات التوكينيزر المعتادة، توفّر Intern-S2-Mobius ثلاثة توكينيزرات إضافية للنطاقات: code>tokenizer_PROT.model/code> للسلاسل البروتينية، code>tokenizer_SMILES.model/code> للبنى الجزيئية بترميز SMILES، و code>tokenizer_XNA.model/code> لتسلسلات الأحماض النووية. كما توجد في المستودع مصفوفة NumPy غريبة من البيانات الزلزالية.
إن أجهزة الترميز المخصصة للبروتينات والجزيئات وDNA/RNA ليست شيئًا تضيفه بشكل عابر. فهي تعني أن النموذج تم تدريبه على قراءة تلك الأنواع من التسلسلات كمدخلات من الدرجة الأولى بدلاً من كونها نصًا عاديًا يحتوي على أحرف. هذا هو ما يحول نتيجة 3.77 إلى 51.40 في Biology-Instructions، ويضع Mobius في نفس عائلة شقيقه Intern-S2-Preview، الذي أضاف أنماط السلاسل الزمنية والرؤية، ووفقًا لـ InternLM، كان أول نموذج مفتوح المصدر بقدرة توليد بنى البلورات للمواد.
إذا كنت مطوّرًا للأغراض العامة، فهذه معلومة هامشية. إذا كنت تعمل في علم الأحياء الحسابي، أو المعلوماتية الكيميائية، أو علوم المواد، فقد يكون هذا أهم سطر في هذه المقالة: هذا نموذج صغير، بترخيص Apache-2.0، قابل للاستضافة الذاتية، ويتحدث لغة SMILES وتسلسلات البروتين بشكل أصلي.
مكانه في عائلة Intern
سلسلة Intern-S هي سلسلة الوسائط المتعددة العلمية من مختبر شانغهاي للذكاء الاصطناعي. أسس Intern-S1 الصيغة، ووسّعها Intern-S1-Pro إلى فئة تريليون معامل. أما Intern-S2-Preview، الذي صدر قبل موبيوس بفترة وجيزة، فهو الخيار الأكثر كفاءة: نموذج بإجمالي 36 مليار معامل و3 مليارات معامل نشطة، مع 256 خبيرًا وسياق يبلغ 262 ألف رمز. يدّعي InternLM أنه يضاهي S1-Pro بمقياس تريليون المعامل في المهام العلمية المهنية الأساسية — أي تقليص عدد المعاملات بنحو 30 ضعفًا مقابل قدرة علمية مماثلة.
Intern-S2-Mobius هو شيء ثالث: من الناحية المعمارية، إصدار يحمل اسم Intern-S2. إن "v0" في Mobius-v0 يقوم بعمل حقيقي في تلك التسمية — هذا هو التكرار العام الأول لتصميم، وليس خط إنتاج ناضج. إنه يتصل بكيان ArchSpace، منصة InternLM المفتوحة للتحقق من ابتكارات هندسة نماذج اللغة الكبيرة، والتي يتمثل هدفها المعلن في "تحويل استكشاف هندسة نماذج اللغة الكبيرة إلى معرفة قابلة لإعادة الاستخدام للمجتمع"، مع مراجعة الأقران ونشر النتائج بما في ذلك النتائج السلبية. Mobius هو ما يبدو عليه ذلك البرنامج عندما ينتقل اقتراح من مسبار بمقياس 1B إلى نموذج 35B يمكنك تنزيله فعليًا. يُرفق تقرير فني كامل بمستودع GitHub لأي شخص يريد الاشتقاقات.
في ضوء ذلك، فإن الخسارتين في الاختبارات المعيارية سمة من سمات الإصدار، وليستا موضع إحراج. هذا مختبر ينشر تجربة معمارية بأمانة، بما في ذلك مواضع تراجعها.
كيفية تشغيله
يُدعم Intern-S2-Mobius بثلاث حزم استدلال، ويقدّم دليل النشر استدعاءات عملية لكل منها.
LMDeploy هو المسار الموصى به والوحيد الذي يعرضه الدليل على GPU واحدة: قدّم الخدمة باستخدام الواجهة الخلفية لـ PyTorch، code>--trust-remote-code/code>، توازي الموترات من الدرجة 1، وفك الترميز التخميني MTP مفعّلًا عبر خوارزمية التخمين qwen3_5_mtp مع أربعة رموز أولية. vLLM يُعرض مع توازي الموترات من الدرجة 2، ومحلل الاستدلال qwen3، ومحلل استدعاء الأدوات qwen3_coder، واختيار الأداة تلقائيًا، وفك الترميز التخميني MTP مع أربعة رموز تخمينية. Transformers يعمل للاستدلال الأساسي عبر code>AutoModelForImageTextToText/code> مع code>trust_remote_code=True/code> وbfloat16 — لاحظ أن النموذج يأتي مع كود نمذجة مخصص، لذا فإن تنفيذ الكود عن بُعد إلزامي، وتستهدف الإعدادات Transformers 5.2.
معاملات أخذ العينات الموصى بها في InternLM هي درجة حرارة 0.8، وtop-p 0.95، وtop-k 50، وmin-p 0.0 — وهي أكثر دفئًا من الإعدادات شبه الجشعة التي تفضّلها معظم نماذج الاستدلال، وهو أمر يستحق الاحترام بدلاً من تجاوزه بدافع العادة.
فيما يتعلق بالعتاد: نحو 73 غيغابايت من أوزان bfloat16، بالإضافة إلى كاش KV والتنشيطات، تعني أن مسرّعًا واحدًا بسعة 80 غيغابايت سيكون بالكاد كافيًا، بينما بطاقة واحدة بسعة 141 غيغابايت ستكون مريحة؛ وهذا على الأرجح سبب اعتماد مثال vLLM على وحدتي GPU بينما يفترض مثال LMDeploy وحدة واحدة كبيرة. الأعمال التي تتطلب سياقات طويلة سترفع هذه المتطلبات أكثر. فعّل MTP — إذ يوصي الدليل بذلك صراحةً — وجزء كبير من تسارع الأداء المُعلن عنه يكمن هناك وليس في البنية الأساسية.
أهم تحفظ عملي: لا يوجد حاليًا أي مزود استدلال يستضيف هذا النموذج. لوحة مزودي Hugging Face توضح ذلك صراحةً، وكان عداد التنزيلات لا يزال عند الصفر عند كتابة هذا النص. لا توجد نقطة نهاية API، ولا سعر لكل مليون رمز، ولا طريقة مُدارة لتجربته. الاستضافة الذاتية هي الخيار الوحيد اليوم.

من الذي يجب أن يهتم حقًا؟
1. الفرق التي تدير أعباء عمل استدلالية عالية الحجم وشكلها استرجاعي
هذا هو الملف الشخصي الذي بُنيت البنية من أجله. إذا كنت تخدم دفعات كبيرة من الأسئلة والأجوبة التقنية، أو تحليل المستندات، أو الاستخراج المنظم، أو التصنيف بأسلوب الاختيار من متعدد عبر نموذج استدلالي، وكانت فاتورتك تهيمن عليها رموز الاستدلال التي لا تظهرها للمستخدم أبدًا، فإن النموذج الذي يصل إلى نفس الإجابة بخُمس الرموز يمثل خفضًا مباشرًا للتكلفة. أرقام MMLU Pro وGPQA — مسارات أقصر بـ4.6 مرة و5.0 مرة مع دقة مساوية أو أفضل — هي بالضبط هذا الشكل. قم بقياس أدائه مقابل حركة المرور الخاصة بك قبل تصديق ذلك، لكن الآلية سليمة والحافز كبير.
2. مجموعات العلوم الحسابية
مُرمِّزات أصلية للبروتين وSMILES والأحماض النووية، بالإضافة إلى مكاسب كبيرة مُقاسة في معايير الأحياء والجزيئات، في نموذج بترخيص Apache 2.0 يعمل على وحدة معالجة رسومية واحدة أو اثنتين. بالنسبة لمختبر يحتاج إلى إبقاء البيانات داخل مقر العمل (on-premises) ولا يمكنه إرسال الهياكل الجزيئية إلى واجهة برمجة تطبيقات تجارية، فهذا المزيج نادر. خط Intern-S كان يتطوّر تدريجيًا لتحقيق هذا، وMobius هو نقطة الدخول الأرخص إليه حتى الآن.
3. الباحثون ومراقبو الهندسة المعمارية
كان فكُّ الارتباط بين المعرفة والاستدلال، والاستدلال الكامن، خيطي بحث نشيطين منذ فترة؛ ولم يُتحقَّق من سوى القليل جدًا منها عند 35B مع نشرها علنًا وحالات الفشل باقية كما هي. إذا كنت مهتمًا بمعرفة إلى أين تتجه البنى ما بعد-Transformer بعد ذلك، فإن التقرير التقني والصفّين الخاسرين أكثر إثارة للاهتمام من متوسط الدرجة. صُمِّم ArchSpace صراحةً لجعل هذا النوع من النتائج قابلاً لإعادة الاستخدام.
من لا ينبغي أن يهتم، على الأقل حتى الآن: أي شخص يبحث عن مساعد عام للإنتاج. لا توجد نقطة نهاية مستضافة، ولا تقييم مستقل، ولا أدوات للنظام البيئي، ولا سجل حافل. هذا ليس انتقادًا للنموذج — بل هو وصف لإصدار بحثي عمره أسبوع واحد.
كيف يتناسب مع الحزمة الإنتاجية
الموضع الصادق لـ Intern-S2-Mobius اليوم هو مرشح تقييم، وليس نموذجًا افتراضيًا. وهو قطعة بحثية غير مستضافة وغير مُتحقَّق منها وعمرها أسبوع واحد، ذات بنية مثيرة للاهتمام حقًا، ونقطة قوة محددة جدًا — الاستدلال الاقتصادي في الرموز في المهام المرتكزة على الاسترجاع — بالإضافة إلى تخصص حقيقي في بيانات التسلسل العلمي.
النمط المنطقي هو إبقاء حركة مرور الإنتاج على نقطة نهاية محايدة تجاه البائعين مثل OrcaRouter، والتي تمنحك واجهة برمجة تطبيقات واحدة متوافقة مع OpenAI عبر نماذج متعددة، وتشغيل Mobius بشكل منفصل على وحدات معالجة الرسوم الخاصة بك للشريحة الضيقة التي قد يتفوق فيها. قِس ما يهم فعلًا لهذا النموذج: ليست الدقة وحدها، بل التوكنات المستهلكة لكل إجابة صحيحة. ذلك هو المحور الذي تم تحسين Mobius من أجله، وهو المحور الذي تتجاهله معظم أدوات التقييم. إذا ثبتت فعاليته على عبء العمل لديك، فلديك مسار مستضاف ذاتيًا رخيص التشغيل وغير مقيّد قانونيًا. إذا لم يحدث ذلك، فقد خسرت يومًا من وقت وحدات معالجة الرسوم ولم يتحرك مسار إنتاجك أبدًا.
نفس المنطق ينطبق بالعكس إذا استضافه مزوّد في نهاية المطاف: يتيح لك الموجّه اختبار A/B لنموذج جديد مقابل نموذجك الحالي دون إعادة كتابة أي شيء، وهو بالضبط الأسلوب الأمثل لاعتماد بنية لم يختبرها أحد بشكل مستقل.
القيود والتحفظات
ابدأ بالأكبر: لا يوجد تحقق مستقل من أي شيء في أرقام هذا المقال. كل معيار، وكل منحنى إنتاجية، وكل مقارنة لطول الرموز مصدرها InternLM. المقارنة أيضًا مواتية من الناحية البنيوية — يُقاس موبيوس فقط مقابل خط الأساس المحدد الذي اشتُقّ منه بالتدريب المسبق المستمر، وليس مقابل النماذج الحدودية الحالية، ويعني التدريب اللاحق الإضافي عبر SFT وRL أن المقارنة ليست عزلًا نظيفًا للبنية المعمارية حتى مع تقديمها على أنها كذلك. بعض المكسب يعود إلى موبيوس؛ وبعضه ببساطة هو تدريب إضافي.
التراجعات حقيقية وهي في أصعب المهام. خسارة HLE بمقدار 3.3 نقطة و UGD hard بمقدار 5 نقاط، بينما يفوز بكل ما هو أسهل تقريبًا، هي بصمة متماسكة ومقلقة قليلاً لنموذج نقطة بيعه هي كفاءة التفكير.
من الناحية التشغيلية، فإن العوائق كبيرة. كود النمذجة المخصص يعني استخدام code>trust_remote_code/code> وإصدارًا متطورًا للغاية من Transformers. الأطر التي تدعمه يجب أن تكون حديثة بما يكفي لتعرف ما هو code>interns2_mobius/code>، ويحذر دليل InternLM نفسه من أن هذه تكوينات مرجعية قيد التطوير النشط. نحو 73 جيجابايت من الأوزان ليس نموذجًا للحواسيب المحمولة. لا توجد واجهة برمجة تطبيقات مستضافة، ولا تسعير، ولا حدود لمعدل الاستخدام، ولا اتفاقية مستوى خدمة — لأنه لا توجد خدمة.
أخيرًا، لاحظ ما لم يُنشر: لا توجد نتائج معايير متعددة الوسائط على الرغم من وجود مُشفر رؤية كامل، ولا يوجد تقييم للسياق الطويل على الرغم من سقف 256K، ولا توجد معايير برمجة على الإطلاق، ولا يوجد تقييم للسلامة أو المواءمة، ولا توجد مقارنة مع أي نموذج آخر غير Qwen3.5-35B. بالنسبة للنشر للأغراض العامة، فهذه فراغات كبيرة. أما بالنسبة لورقة بحثية عن البنية مع أوزان مرفقة، فهي ببساطة خارج النطاق — وهذه هي الطريقة الصحيحة لفهم هذا الإصدار.
الأسئلة الشائعة
ما هو Intern-S2-Mobius؟
نموذج أساسي متعدد الوسائط بمعاملات 35B، بترخيص Apache 2.0، من فريق InternLM التابع لمختبر شنغهاي للذكاء الاصطناعي، مبني على بنية Mobius-v0 التي تفصل تخزين المعرفة عن حساب الاستدلال. تم تدريبه مسبقًا بشكل مستمر انطلاقًا من Qwen3.5-35B، ثم خضع لتدريب لاحق باستخدام SFT والتعلم المعزز، ونُشر على Hugging Face في 29 يوليو 2026.
ما الذي يجعل بنية موبيوس مختلفة؟
تخزّن المحولات التقليدية المعرفة في كتلة تغذية أمامية داخل كل طبقة، لذا لا يمكن الوصول إلى المعرفة إلا في العمق الذي توجد فيه. يستبدل Mobius ذلك بذاكرة واحدة مشتركة عالميًا — تضم 2,560 خبيرًا في الإعداد المُصدر — تستعلم منها أربع كتل استدلال مرارًا، مما يتيح الوصول إلى المعرفة عبر الأعماق ويسمح بجزء من التفكير في حالات مخفية مستمرة بدلاً من رموز سلسلة التفكير المُولَّدة.
هل Intern-S2-Mobius أسرع بالفعل 4x؟
في المتوسط ومع أحجام الدفعات الكبيرة، نعم تقريبًا: تقيس InternLM إنتاجية طلبات أعلى بمقدار 2.9 مرة عند الدفعة 16، لترتفع إلى 4.6 مرة عند الدفعة 256. لكن الأمر يختلف بشكل كبير حسب المهمة. ففي MMLU Pro وGPQA Diamond يكون الكسب كبيرًا في كل حجم دفعة؛ بينما في مسابقات الرياضيات AIME وHMMT، يكون Transformer الأساسي أسرع فعليًا في أحجام الدفعات المتوسطة. ويتتبع التسريع مدى قدرة النموذج على تقصير مسار الاستدلال الخاص به.
كيف يمكن مقارنته بـ Qwen3.5-35B؟
يفوز في سبعة من أصل تسعة معايير عامة بمتوسط 67.88 مقابل 65.05، بما في ذلك MMLU Pro (89.05 مقابل 85.31)، وAIME 2026 (95.31 مقابل 92.08)، وHMMT 2026 (85.51 مقابل 78.50)، وSimpleQA (28.90 مقابل 21.39). ويخسر في UGD hard (73.02 مقابل 78.02) وHLE (19.11 مقابل 22.40). وفي المهام العلمية يتقدم بفارق كبير — متوسط 52.14 مقابل 18.20.
هل يمكنني استخدام Intern-S2-Mobius عبر API؟
ليس حاليًا. لا يستضيفه أي مزود استدلال، ولا توجد تسعيرة منشورة، ولا تُدرج Hugging Face أي نشر. الاستضافة الذاتية باستخدام LMDeploy أو vLLM أو Transformers هي الطريقة الوحيدة لتشغيله اليوم.
ما هي الأجهزة التي أحتاجها لتشغيله؟
تبلغ الأوزان حوالي 73 غيغابايت بصيغة bfloat16، لذا خطط لاستخدام مسرّع واحد من فئة 141 غيغابايت أو وحدتي GPU بسعة 80 غيغابايت، مع توفير مساحة إضافية لذاكرة التخزين المؤقت KV. يستخدم مثال LMDeploy من InternLM التوازي الموتر بقيمة 1؛ بينما يستخدم مثال vLLM القيمة 2. يُنصح بتفعيل فك التخمين MTP باستخدام أربعة رموز مسودة.
ما هو طول سياقه؟
يدعم التكوين 262,144 رمزًا (256K). لاحظ أن InternLM تم تقييمه عند 128K في معظم معايير النصوص و64K في MMLU Pro وSimpleQA وHLE، لذلك لم يتم إثبات الجودة المُتحقق منها عند 256K الكاملة.
هل هو متعدد الوسائط؟
نعم. يصنّفه Hugging Face ضمن فئة image-text-to-text، ويتضمن الإعداد مشفّر رؤية من 27 طبقة مع معالجة رموز الفيديو. ومع ذلك، لم ينشر InternLM أي نتائج معايير متعددة الوسائط مع هذا الإصدار، لذا فإن قدرة الرؤية غير موثقة عمليًا.
لماذا يشتمل على مُجزِّئات البروتين وSMILES؟
نظرًا لأن خط Intern-S هو عائلة نماذج علمية، فإن المُرمِّزات المخصصة لتسلسلات البروتين، وترميز SMILES الجزيئي، والأحماض النووية تعني أن النموذج يقرأ تلك التنسيقات كأنواع إدخال أصلية، ولهذا السبب يسجل 51.40 في Biology-Instructions بينما يسجل خط الأساس 3.77.
هل الترخيص حقًا Apache 2.0؟
نعم — Apache 2.0، مع ملف الترخيص في المستودع. الاستخدام التجاري والتعديل وإعادة التوزيع مسموح بها، وهو أكثر تساهلاً بشكل ملحوظ من العديد من إصدارات الأوزان المفتوحة الصادرة عن مختبرات كبيرة.
هل يجب أن أستخدمه في الإنتاج؟
ليس بعد. عمره أسبوع واحد، غير مستضاف، ولم يتحقق منه أي طرف ثالث، ويفتقر إلى تقييمات البرمجة والوسائط المتعددة والسياق الطويل والسلامة. تعامل معه كمرشح للتقييم للاستدلال الفعّال في استخدام التوكنات أو للعمل على التسلسلات العلمية، وواصل توجيه حركة المرور الإنتاجية إلى النماذج القائمة عبر نقطة نهاية محايدة تجاه البائع، وأعد النظر عندما تتوفر أرقام مستقلة.
خلاصة القول
يُعد Intern-S2-Mobius واحدًا من الإصدارات النموذجية الأكثر إثارة للاهتمام هذا العام، ولا علاقة لذلك تقريبًا بدرجاته. لقد اتخذ InternLM فكرة معمارية حقيقية — وهي التوقف عن ربط المعرفة بالطبقات، ووضعها في ذاكرة مشتركة واحدة، والسماح للنموذج بجزء من تفكيره في الفضاء الكامن بدلاً من الرموز — ثم وسّع نطاقها إلى 35B، ودرّبه بشكل صحيح، وأصدر الأوزان بموجب ترخيص Apache 2.0 إلى جانب التقرير الفني والنتائج التي لم تكن في صالحه. آلية الكفاءة واضحة والأدلة عليها متسقة داخليًا: فالمسارات تصبح أقصر بمعدل 1.5 مرة في المتوسط، وتصل إلى 5 مرات أقصر في المهام المكثفة بالمعرفة، ويزداد الإنتاجية بنفس النسبة التي يمكن توقعها من ذلك.
التحذيرات واضحة بنفس القدر. {{1}}لم يتحقق أي شخص خارج Shanghai AI Laboratory من رقم واحد.{{/1}} {{2}}المقارنة مع النسخة الأساسية للنموذج نفسه وتتضمن تدريبًا لاحقًا إضافيًا، لذا فهي ليست دراسة الإزالة النظيفة التي تبدو عليها.{{/2}} {{3}}تتلاشى زيادة السرعة إلى حد كبير في الرياضيات الصعبة.{{/3}} {{4}}يخسر النموذج على المعيارين الأكثر تطلبًا للاستدلال في جدوله الخاص.{{/4}} ولا توجد طريقة لتجربته دون استئجار وحدات GPU.
إذًا: ليست نموذجًا يُنشر هذا الأسبوع، لكنها نموذجٌ يستحق المتابعة عن كثب، وخيارٌ جذابٌ حقًا لفئتين محددتين — الفرق التي تهيمن فاتورة استدلالها على رموزٍ لا يقرؤها أحد، والمجموعات العلمية التي تحتاج نموذجًا صغيرًا بترخيصٍ متسامح يتحدث البروتينات والجزيئات بشكلٍ طبيعي. أبقِ حزمة الإنتاج على نماذج مُثبتة عبر نقطة نهاية محايدة تجاه البائع مثل OrcaRouter، وشغّل Mobius على أجهزتك الخاصة للحالة الضيقة، وقِس الرموز لكل إجابة صحيحة بدلًا من الدقة وحدها. إذا صمدت البنية تحت التدقيق المستقل، فسيُذكر Mobius-v0 بدرجةٍ أقل كنموذج 35B وأكثر كرقم إصدار يسبق الإصدار الذي كان له شأن.
