بطاقة رئيسية مُولّدة تقارن بين Intern-S2 وGemini 3.1 Pro، وتُظهر صفحة شكل علمي ومخططًا يغذّيان نموذجًا متعدد الوسائط على اليسار، وأربع أيقونات إدخال للصورة والصوت والفيديو والنص حول بطاقة API مغلقة على اليمين، معنونة بالتباين بين التعدد الوسائطي العلمي بترخيص Apache-2.0 ونموذج رائد عام متعدد الوسائط مغلق بسياق 1M، مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

Intern-S2 مقابل Gemini 3.1 Pro: المواجهة متعددة الوسائط التي قاسها InternLM فعليًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

معظم المواجهات في هذه السلسلة تتطلب تجميع ادعاءات مورّدين اثنين معًا. هذه المواجهة لا تتطلب ذلك. إن Intern-S2، النموذج متعدد الوسائط Apache-2.0 ذو 397 مليار معامل الذي أصدرته InternLM اليوم، وGemini 3.1 Pro، النموذج الرائد في الاستدلال لدى Google، يظهران معًا كعمودين مقاسين في جدول المعايير نفسه — مما يجعل هذه المواجهة المباشرة الأكثر إنصافًا في المجموعة، وليس من قبيل المصادفة أنها المواجهة التي يكون على النموذج المفتوح فيها أكبر قدر مما يجب أن يجيب عنه. يقرأ Gemini 3.1 Pro النصوص والصور والصوت والفيديو، ويمتلك سياقًا بسعة مليون رمز، وقد تعرّض للتدقيق القاسي من مختبرات مستقلة وحركة الإنتاج منذ دخوله مرحلة المعاينة في 19 فبراير 2026. يقرأ Intern-S2 النصوص والصور والسلاسل الزمنية، ورُفع إلى Hugging Face صباح هذا اليوم، وليس لديه أي نتيجة تقييم من طرف ثالث من أي نوع. في الصفوف التي جرى فيها قياس كلا النموذجين، يفوز نموذج Google في أكثرها لا في أقلها.

كلاهما يقرأ الصور. وهنا ينتهي التشابه.

كلمة "متعدد الوسائط" تجعل هذه النماذج تبدو متكافئة. لكنها ليست متكافئة، والفرق يكمن في ما بُني كل واحد منها لينظر إليه.

دُرِّب مسار الرؤية في Intern-S2 على استهلاك صفحات خام من الأدبيات العلمية — الأشكال، والمعادلات، والمخططات البنيوية، والتخطيط — كتمثيل مشترك واحد بدلاً من استخراج النص أولاً. ومعاييره متعددة الوسائط علمية: VQA للمجهر البيولوجي، والاستشعار عن بعد، والإجابة عن أسئلة المخططات العلمية. كما يقبل بيانات السلاسل الزمنية ويمكنه إنتاج تنبؤات، وهو نوع مدخلات لا يكاد أي نموذج رائد عام يتعامل معه على الإطلاق.

تعدد الوسائط لدى Gemini 3.1 Pro عام الأغراض وأوسع من حيث الأنواع: النص والصورة والصوت والفيديو، ضمن نموذج واحد، ويستهدف كامل نطاق مهام الإنتاج حيث توجّه النموذج إلى ملف وتطرح سؤالًا. تسجيل اجتماع، أو لقطة شاشة لواجهة مستخدم، أو مخطط في ملف PDF، أو مقطع فيديو — كلها مؤهلة، وكلها خلفها ستة أشهر من التقييم العام.

إذا كان المُدخَل عبارة عن شكل علمي، فإن Intern-S2 صُمّم خصيصًا لهذا الغرض، ولديه أرقام المورّد ليبرّر بها موقفه. أما إذا كان المُدخَل أي شيء آخر، فإن Gemini 3.1 Pro يقبل الصوت والفيديو، بينما Intern-S2 لا يقبل أيًا منهما. وهذا يحسم جزءًا كبيرًا من أسئلة "أيّهما ينبغي أن أستخدم" قبل أن يدخل السعر أو مقاييس الأداء في الصورة، وأي شخص يخبرك أن الاثنين قابلان للتبادل لم يقرأ قائمة المُدخَلات.

ما يظهره الجدول المشترك، اقرأه بصدق

لأن InternLM أجرى اختبار قياس على كليهما، فهذا أحد المواضع القليلة التي تكون فيها المقارنة المباشرة مشروعة بدلًا من أن تكون مُجمّعة. التحفظ لم يتغير ويجدر ذكره مرة واحدة: كل رقم من أرقام Intern-S2 مُبلَّغ عنه من المورّد، وقد شغّله InternLM على منصته الخاصة للاختبار عبر OpenCompass وVLMEvalKit وAgentCompass، دون إعادة إنتاج مستقلة. كما أن أرقام Gemini في ذلك الجدول مأخوذة أيضًا من تشغيل InternLM للمقارنة، رغم أن Gemini لديه سجل مستقل واسع خارجها.

• المعرفة متعددة الوسائط — Gemini 3.1 Pro بنتيجة 83.99 على MMMU Pro مقابل Intern-S2 بنتيجة 81.68.

• الأسئلة والأجوبة حول المخططات العلمية — Gemini 3.1 Pro 71.18 على ChartQAPro مقابل Intern-S2 71.12. تعادل تام حتى منزلتين عشريتين.

• الاستشعار عن بعد — Gemini 3.1 Pro 54.27 على XLRS-Bench مقابل Intern-S2 51.38.

• الأسئلة البصرية في الفحص المجهري — Gemini 3.1 Pro 71.02 على MicroVQA مقابل Intern-S2 69.67.

• المهام العلمية متعددة الوسائط — Intern-S2 بنتيجة 60.74 على SFE مقابل Gemini 3.1 Pro بنتيجة 59.57. الانتصار الوحيد لـ Intern-S2 في مجال تعدد الوسائط.

• المعرفة العامة — Gemini 3.1 Pro ‏91.00 على MMLU Pro مقابل Intern-S2 ‏89.77.

• رياضيات المرحلة الثانوية — Gemini 3.1 Pro بنتيجة 94.70 في HMMT-2026 مقابل Intern-S2 بنتيجة 93.56.

• الاستدلال في الأدبيات العلمية — Intern-S2 بنتيجة 55.71 في Biology-Instructions مقابل Gemini 3.1 Pro بنتيجة 13.87، و53.95 مقابل 38.84 في Mol-Instructions.

• مسائل الأولمبياد العلمي — Intern-S2 87.00 في FrontierScience-Olympiad مقابل Gemini 3.1 Pro 79.00.

• إتقان الطرفية — Gemini 3.1 Pro ‏73.80 على TerminalBench 2.1 مقابل Intern-S2 ‏64.04.

القراءة الصادقة: يفوز Gemini 3.1 Pro في الصفوف الواسعة متعددة الوسائط بفوارق ضيقة، ويفوز Intern-S2 في صفوف الأدبيات العلمية العميقة بفوارق هائلة، ولا أي من النتيجتين مفاجئ بالنظر إلى ما دُرّب عليه كل منهما. وضيق الفوارق في خسائر الصفوف متعددة الوسائط هو على الأرجح الاكتشاف الأكثر إثارة للاهتمام — فنقطة حفظ مفتوحة صدرت في اليوم نفسه ولا تبعد أكثر من نقطتين عن طراز رائد مغلق عمره ستة أشهر في MMMU Pro وChartQAPro هي نتيجة أقوى لـ InternLM من أي من أرقامه العلمية المذهلة.

السياق والمخرجات وسؤال المعاينة

تنقسم قصة المدخلات الطويلة بوضوح. يمتلك Gemini 3.1 Pro نافذة سياق تبلغ 1M رمز مع سقف إخراج يبلغ 64K — وهو ما يكفي لمجموعة مستندات طويلة وإجابة وافية. يُقيَّم Intern-S2 عند ما يصل إلى 256K رمزًا للاستدلال النصي و64K للوسائط المتعددة، ولا ينشر سقفًا للإخراج؛ عامل نافذته القابلة للاستخدام على أنها أصغر من نافذة Gemini حتى يقيسها أحد بشكل مستقل.

هناك تحفّظ تشغيلي واحد على جانب Google يجب أن يظهر في أي مقارنة صادقة. لا يزال Gemini 3.1 Pro نموذج معاينة، وليس إصدار GA. تحمل نماذج المعاينة توقعات موثوقية أقل، كما أن لوحة معدل الأخطاء لمدة 7 أيام على صفحة النموذج تذكير دائم بتجاوز عدم الاستقرار بدلًا من بناء مسار حرج فوقه. أما Intern-S2 فهو إصدار كامل بترخيص Apache-2.0 مع أوزان يمكنك تثبيتها — وهو ما يجعل، على نحو مخالف للحدس، النموذج المفتوح الجديد أكثر استقرارًا تشغيليًا من بين الاثنين بالمعنى الأكثر أهمية: لا يمكن لأحد أن يغيّره تحتك.

• السياق — تم تقييم Intern-S2 بنص 256 ألف رمز / 64 ألف متعدد الوسائط مقابل Gemini 3.1 Pro بـ 1 مليون رمز.

• المدخلات — Intern-S2 نص، وصورة، وسلاسل زمنية مقابل Gemini 3.1 Pro نص، وصورة، وصوت، وفيديو.

• الأوزان — Intern-S2 برخصة Apache-2.0، متاحة للتنزيل مقابل Gemini 3.1 Pro المغلق.

• النضج — Intern-S2 عمره ساعات، ولا توجد درجة مستقلة مقابل Gemini 3.1 Pro preview منذ فبراير 2026، وتم اختباره بكثافة وبشكل مستقل.

• السعر — لا تتوفر لـ Intern-S2 قائمة أسعار عامة؛ الاستضافة الذاتية أو واجهة Intern API الرسمية مقابل Gemini 3.1 Pro: 2.00 دولار للإدخال / 12.00 دولار للإخراج لكل مليون، وترتفع إلى 4.00/18.00 دولار فوق 200 ألف رمز إدخال.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

السعر وأين يعيش كل واحد

تتقاضى Gemini 3.1 Pro مبلغ 2.00 دولار لكل مليون رمز إدخال و12.00 دولارًا لكل مليون رمز إخراج في الفئة القياسية، لترتفع إلى 4.00/18.00 دولارًا بمجرد أن يتخطى الطلب 200 ألف رمز إدخال — وهي علاوة السياق الطويل التي تلدغك تمامًا حين تستخدم نافذة المليون رمز التي تبرر اختيارها. وهو قابل للتوجيه عبر OrcaRouter بالسعر المعلن نفسه، مع تمريره بهامش ربح 0%، على مفتاح يحمل أيضًا أكثر من 200 طراز آخر؛ وتكتسب آلية التمرير أهمية هنا لأن أي تغيير في سعر Goog​le يصل إلى جهتنا في اليوم نفسه لا بعد دورة إعادة تسعير. أما الجزء المفيد في هذه المقارنة تحديدًا فهو لغة التوجيه DSL: يمكنك إرسال أعمال الصور والفيديو إلى Gemini 3.1 Pro ودفعات المستندات العلمية إلى Intern-S2 المستضاف ذاتيًا، وإبقاء كليهما خلف نقطة نهاية واحدة دون عقد ثانٍ أو تغيير في الكود.

لا يوجد لـ Intern-S2 سعر API منشور. استضافة أوزان Apache-2.0 بنفسك هي المسار الذي ستسلكه معظم الفرق فعليًا، وعند 403B معامل يشكّل ذلك التزامًا حقيقيًا بالعتاد. تتوفر واجهة Intern API الرسمية للفرق التي تفضّل عدم تشغيل وحدات GPU، لكن من دون بطاقة أسعار عامة لا يمكنك إجراء مقارنة التكلفة مع سعر Gemini البالغ $2/$12 على الورق — عليك طلب الحصة والقيام بالحساب بنفسك.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

المكالمة

اختر Gemini 3.1 Pro إذا كنت بحاجة إلى نموذج متعدد الوسائط عام يستقبل الصوت والفيديو، ويستوعب مليون رمز، ويحظى بأشهر من التحقق المستقل، ويمكن استئجاره بالرمز اليوم. فهو النموذج الأفضل إثباتًا والأوسع قدرة، وشارة المعاينة تحفّظ يخصّ الموثوقية لا القدرة.

اختر Intern-S2 إذا كانت مدخلاتك متعددة الوسائط علمية وكانت بياناتك لا تستطيع مغادرة بنيتك التحتية. فهو الوحيد من بين الاثنين الذي يقرأ صفحات الأدبيات الخام أصليًا، ويتنبأ من إشارات السلاسل الزمنية، ويمكن ضبطه الدقيق على بيانات تجريبية مملوكة بموجب ترخيص متساهل. تقبّل أنك أول شخص يشغّله، وأن جدول المعايير الذي يجادل لصالحه كتبه الأشخاص الذين صنعوه.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

لا يحسم أي من النموذجين هذا الأمر بشكل قاطع، ويُثبت الجدول ذلك على نحو أفضل مما قد يفعله أي حكم نهائي. أحدهما نموذج عام يصادف أنه بارع في العلوم؛ والآخر أداة علمية تصادف أنها تنافسية في الأعمال العامة متعددة الوسائط — وفي إصدار مفتوح صدر في اليوم نفسه، تكون كلمة "تنافسية" هي النتيجة الأكثر إثارة للدهشة.

لتمسك بكلا شقّي هذه المقارنة دون عقد ثانٍ: مفتاح API واحد يغطي أكثر من 200 نموذج يضع النموذج الرائد المغلق متعدد الوسائط وكل البدائل خلف نقطة نهاية واحدة، بحيث يمكنك توجيه أعمال الصور والفيديو في اتجاه، ودفعات المستندات في الاتجاه الآخر.