بطاقة عنوان رئيسية للمقارنة 'InternLumina-U2 vs Qwen2.5 Omni' مع عنوان فرعي 'نموذج الأومني الذي طرحته Alibaba مقابل النموذج الذي ما يزال موعودًا به' وثلاث شرائح إحصائية — 'Qwen2.5 Omni: 17 شهرًا في الإنتاج'، 'InternLumina-U2: يوم واحد من البرمجة'، 'Apache-2.0 على كلا الجانبين' — مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

InternLumina-U2 مقابل Qwen2.5 Omni: نموذج Omni الذي أصدرته Alibaba مقابل النموذج الذي ما زالت Shanghai AI Lab تعد به

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إن InternLumina-U2 وQwen2.5 Omni كلاهما إجابةٌ عن الطموح نفسه — نموذجٌ واحدٌ يعالج كل الأنماط بدلًا من مجموعةٍ من النماذج المتخصصة — لكن من جيلين مختلفين. Qwen2.5 Omni هو الجواب الذي صدر فعلًا: نموذجٌ مفتوح الأوزان بسبعة مليارات معامل، أُطلق في مارس 2025، وعمره سبعة عشر شهرًا وقت كتابة هذا النص، يستقبل النصوص والصور والصوت والفيديو كمدخلات، ويرد بنصوص أو بكلامٍ طبيعيٍّ متدفق. أما InternLumina-U2 فهو جواب مختبر شنغهاي للذكاء الاصطناعي، نُشر كرمز استدلالٍ في 1 سبتمبر 2026: نموذج انتشارٍ متناثرٍ بستة عشر مليار معامل، يدّعي إدراك الصور والفيديو والثلاثي الأبعاد، وتوليد الصور وتحريرها عبر واجهةٍ واحدةٍ مشتركةٍ من الرموز المنفصلة. جيلٌ من فكرة الأومني يعمل في الإنتاج منذ عامٍ ونصف؛ بينما عمر الجيل الآخر يومٌ واحدٌ لا يمكن لأحدٍ تشغيله، لأن أوزانه لم توجد بعد. والفجوة بينهما هي الفرق بين وعدٍ تحقق ووعدٍ أُطلق.

النموذج الشامل الذي تم إطلاقه: Qwen2.5 Omni

يستحق Qwen2.5 Omni أن يُؤخذ على محمل الجد كخط أساس؛ لأنه نموذج مفتوح نادر قدّم فعليًا وعد "إدراك كل شيء، والإجابة بأي شكل". تعتمد بنيته المعمارية Thinker-Talker على اقتران مفكّر نصّي بمتحدّث يولّد الكلام، باستخدام ترميز موضعي متعدد الوسائط متزامن زمنيًا بحيث يظل الصوت والفيديو متوافقين؛ إذ تشمل المدخلات النص والصور والصوت والفيديو، ويمكن أن يكون الناتج نصًا إلى جانب صوت في الجولة نفسها، مع أربعة أصوات مدمجة. والقيود موثّقة بقدر ما هي القدرات موثّقة: سياق النموذج هو 32K رمزًا، ولا يوجد استدعاء دوال ولا مخرجات منظمة، وهو محاور شامل (omni) وليس وكيلًا. ما لا يفعله يستحق التأكيد عليه في هذه المقارنة — فهو يدرك الصور والصوت والفيديو، لكنه لا يولّدها. إنّ "omni" في Qwen2.5 Omni تعني الإدراك الشامل مع توليف الكلام على جانب المخرجات؛ فالبكسلات تدخل، والكلمات تخرج.

سجل الأداء حقيقي. تم تنزيل النموذج مئات الآلاف من المرات، وله واجهة برمجية مستضافة عبر منصة المطوّر الخاصة به وعبر عدة منصات تابعة لجهات خارجية، وقد أمضى سبعة عشر شهرًا في تراكم عمليات التكميم والأدوات المجتمعية وسعر معروف {{1}}— حيث تشير قوائم المجمّعين إلى نصّ يبلغ حوالي 0.09 دولار لكل مليون رمز إدخال و0.34 دولار لكل مليون رمز إخراج، مع احتساب الصوت بشكل منفصل.{{/1}} سبعة عشر شهرًا هي فترة طويلة بما يكفي لتكون نقاط قوته وحدوده معروفة جيدًا على حد سواء. {{2}}وهذا ما يشتريه النضج: ليس الكمال، بل القدرة على التنبؤ.{{/2}}

الأومني الموعود: InternLumina-U2

يحاول InternLumina-U2 أن يخطو خطوة إضافية تتجاوز Qwen2.5 Omni، وهذه الخطوة تقع بالضبط حيث تكمن الصعوبة. فرضيّته التصميمية هي أن الإدراك والتوليد ينبغي أن يتشاركا واجهة واحدة موحّدة من الرموز المنفصلة: فبدلاً من نموذج لغوي يدرك الفيديو ونموذج انتشار منفصل يرسم، يمكن لبنية انتشارية واحدة متناثرة من نوع MoE — بحجم 16 مليار معلمة إجمالاً، ومليار واحد فقط نشط — أن تقرأ صورة أو مخططاً بيانياً أو فيديو أو أصلًا ثلاثي الأبعاد، وتكتب صورة جديدة أو تعديلًا، وذلك باستخدام مفردات بصرية منفصلة بالكامل من ثمانية دفاتر رموز (codebooks)، بحيث يحمل كل موضع بصري ما يكفي من المعلومات لدعم الاتجاهين معًا. وهذا ادعاء أكثر جوهرية من ادعاء Qwen2.5 Omni. فمن شيء أن توجّه كل أنماط الإدخال إلى نص وكلام، ومن شيء آخر تمامًا أن تجعل مجموعة واحدة من الأوزان تولّد وحدات البكسل بطلاقة تضاهي طلاقة تفكيرها فيها.

إنه أيضًا، في الوقت الراهن، ادعاءٌ لا يمكن التحقق منه. نشر المختبر كود الاستدلال، وصفحة مشروع تتضمن جدول معايير "أولي وجزئي"، ونموذجًا فارغًا على Hugging Face؛ بينما الأوزان وكود التدريب والتقرير الفني وحزمة Ascend-NPU جميعها مُعلَّمة بأنها "قريبًا". لا يوجد أي تقييم مستقل لأنه لا يوجد شيء يمكن تقييمه. كانت بنية Qwen2.5 Omni قابلة للتحقق في الأسبوع الذي صدرت فيه لأن الأوزان صدرت معها؛ أما بنية InternLumina-U2 فقابلة للقراءة اليوم، لكن جودتها لا تزال وعدًا من البائع.

لوحة النتائج

بما أن أحد هذين النموذجين له تاريخ يمتد لسبعة عشر شهرًا والآخر له يوم واحد من التعليمات البرمجية، فإن الصفوف تحمل دلالة المنشأ بدلًا من الادعاء بأن الأعمدة متماثلة.

• العمر — Qwen2.5 Omni: صدر في مارس 2025، أي سبعة عشر شهرًا قيد الاستخدام الفعلي، ومئات الآلاف من التنزيلات. InternLumina-U2: نُشر كود الاستدلال في 1 سبتمبر 2026، صفر تنزيلات، صفر عمليات تشغيل مستقلة.

• الشكل — Qwen2.5 Omni: ~7B من البداية إلى النهاية، Thinker-Talker مع ترميز موضعي متعدد الوسائط متوافق زمنيًا. InternLumina-U2: 16B إجمالي / 1B نشط، وهو LLM انتشارية متناثرة بنمط MoE مع مُرمِّز مرئي منفصل قائم على ثمانية دفاتر أكواد.

يدعم كلاهما النصوص والصور؛ كما يدعم Qwen2.5 Omni الصوت والفيديو للمحادثة الشاملة؛ ويدعي InternLumina-U2 {{1}}فهم الفيديو عبر 64 إطارًا تم أخذ عينات منها وفهم ثلاثي الأبعاد عبر طرق عرض GLB/GLTF المعروضة في Blender{{/1}}.

• المخرجات — Qwen2.5 Omni: نص وكلام متدفق، أربعة أصوات. InternLumina-U2: يدّعي النص، وتحويل النص إلى صورة حتى 1024×1024، وتحرير الصور القائم على التعليمات.

• حدود التوليد — Qwen2.5 Omni: يولّد الكلمات والصوت، وليس البكسلات. InternLumina-U2: يحاول توليد البكسلات وتحريرها داخل نموذج الرموز المنفصلة نفسه الذي يقرأ.

• الأوزان والترخيص — كلاهما بأوزان مفتوحة بموجب Apache-2.0 من حيث المبدأ؛ أوزان Qwen2.5 Omni قابلة للتنزيل اليوم، بينما أوزان InternLumina-U2 ليست متاحة للعامة بعد.

• التقديم — Qwen2.5 Omni: واجهة برمجة تطبيقات مستضافة بالإضافة إلى استضافة ذاتية (نشر ثقيل بالدقة الكاملة)؛ سياق معروف 32K، بدون استدعاء دوال. InternLumina-U2: غير قابل للتقديم — برنامج التشغيل المُصدَر يتوقع نقاط تفتيش غير موجودة.

• الأرقام الرئيسية — Qwen2.5 Omni: لها حضور طويل على لوحة صدارة OmniBench (بدرجة تقارب 0.561 على اللوحات الحالية)؛ InternLumina-U2: ChartQA 86.52، MathVision 33.22، GenEval 0.81 — جميعها بيانات أبلغ عنها البائع، وهي أولية وجزئية.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

لماذا الفجوة بين الأجيال هي القصة الحقيقية

ضع الأعمار جانبًا، فالفارق الجوهري هو الحد الذي تتوقف عنده كل نماذج. اختار Qwen2.5 Omni نسخة عملية من "أومني": إدراك واسع النطاق، والإجابة باللغة أو الصوت، وترك تركيب الصور والفيديو لنماذج توليد مخصّصة في مواضع أخرى من البنية. هذا التقسيم للعمل هو كيف يُبنى أساسًا كل نظام متعدد الوسائط في الإنتاج خلال 2026، وهو السبب في أن Qwen2.5 Omni استطاع أن يُطلق في 2025 ويظل مفيدًا في 2026 — فهو يؤدي جزأه جيدًا وينسجم مع البقية. أما InternLumina-U2 فهو رهان على أن تقسيم العمل هو المشكلة: أي أن النموذج الذي يُجبَر على تمثيل كل شيء — الإدراك والتوليد — في مفردات منفصلة مشتركة واحدة سيتعلم فهمًا أعمق للرؤية من نموذج لا يُطلب منه سوى وصفها. هذا الرهان، إن أتى ثماره، هو النتيجة الأهم. وإن لم يُؤتِ، يتحول InternLumina-U2 إلى نسخة أبطأ وأكثر استهلاكًا من Qwen2.5 Omni مع مولّد صور مُثبّت بشكل غير سلس في الأوزان نفسها. المسابقة برمّتها — وهي مسابقة بين تصميم مُطلق وفرضية، لا بين نموذجين قابلين للتشغيل — هي فيما إذا كانت البنية الأصعب تبرر وجودها.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

بطاقة Qwen/Qwen2.5-Omni-7B على Hugging Face، الملتقطة في 27 أغسطس 2026 — نظرة عامة على Thinker-Talker، وترخيص Apache-2.0، ووسوم أنماط النموذج الخاصة بالنص والصورة والصوت والفيديو.

ماذا يشتري في الواقع عام ونصف من التنزيلات؟

النضج ليس مجرد شعور؛ إنه قائمة بما تعرفه. مع Qwen2.5 Omni، تعرف أن سياق 32K قيد صارم وتستطيع هندسة حلول حوله. تعرف أنه لا يوجد مسار لاستدعاء الدوال ولن تتظاهر بوجوده. تعرف تقريبًا كم تكلّف عمليات النشر، سواء عبر واجهة API مستضافة أو على وحدات معالجة رسومية خاصة بك، لأن النموذج تم تسعيره وتشغيله من قِبَل عددٍ كافٍ من الأشخاص حتى استقرت الأرقام. تعرف أن موقع OmniBench على لوحات الصدارة حقيقي، لأن لوحات صدارة مستقلة تتعقّبه منذ أكثر من عام. أما مع InternLumina-U2، فلا ينطبق أيٌّ من هذه الأفعال — أنت لا تعرف، ولا يمكنك أن تعرف، إذ لا يوجد أثر ملموس. عندما يكون عمر النموذج يومًا واحدًا وبلا وزن، يصبح كل ادعاء حوله مجرد إعلان نية. وهذا التباين ليس طعنًا في العلم؛ بل هو الموقف المعرفي الصحيح لأي شخص يختار ما سيبني عليه.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

مستودع GitHub الخاص بـ InternLM/InternLumina-U2، الذي تم التقاطه في 2 سبتمبر 2026 — صفحة المستودع الرئيسية التي تجعل البنية العامة متاحة — الوصف والترخيص وسكريبتات الاستدلال — بينما الأوزان نفسها غائبة عن الشجرة.

قرار التوجيه، مُؤطَّر بصدق

سنوضح التوافر بصراحة: لا يستضيف OrcaRouter نموذج InternLumina-U2، لأنه لا توجد أوزان ليستضيفها أي طرف، كما أننا لا نوفّر حاليًا Qwen2.5 Omni أيضًا — فهو يعمل عبر واجهة برمجة تطبيقات المطوّر نفسه ومنصات طرف ثالث. إذن الدرس المستفاد هنا يتعلق بالمنهجية، وليس باستدعاء هذين النموذجين عبر مفتاح واحد اليوم. النمط الدائم هو الذي يصل إليه كل قرار بين نموذج ناضج ووافد جديد في النهاية: أبقِ النموذج المثبت على المسار الرئيسي، حيث تعني واجهة برمجة تطبيقات واحدة تغطي أكثر من 200 نموذج وبدون أي زيادة سعرية أنك تدفع سعر القائمة المعلن من المزود ولا شيء أكثر؛ ووجّه الوافد الجديد غير المثبت إلى مسار اختباري مع تجاوز تلقائي للفشل، بحيث إذا تعثّر أو انحرف أو أعاد نتائج غير منطقية في المرة الأولى، ينتقل الطلب تلقائيًا إلى النموذج الذي له سجل حافل يمتد لسبعة عشر شهرًا. هكذا يمكنك تقييم بنية جديدة طموحة مثل InternLumina-U2 في اليوم الذي تُطرح فيه أوزانه — دون المراهنة على مسار الإنتاج الذي تعتمد عليه بالفعل.

الحكم

Qwen2.5 Omni هو النموذج الشامل الذي يمكنك البناء عليه اليوم: مُتاح للتسليم، قابل للتنزيل، موثّق، بحدود معروفة وسعر مستقر. أما InternLumina-U2 فهو النموذج الشامل الذي يستحق المتابعة: خطوة معمارية حقيقية تتجاوز الإدراك نحو الإبداع، مرخّص برخصة Apache-2.0، مع كوده متاح للعموم وأوزانه قيد الإصدار. إذا صمد رهان المختبر على الترميزات متعددة الدفاتر تحت الاختبار المستقل، فإن InternLumina-U2 لن يكون منافسًا لـ Qwen2.5 Omni بقدر ما سيكون الجيل التالي من الفكرة ذاتها. وإذا لم يصمد، فسيظل النموذج العام الذي بلغ من العمر سبعة عشر شهرًا والذي شُحن فعلًا موجودًا هناك، يؤدي المهمة التي ظل يؤديها طوال الوقت. تابع صفحة Hugging Face؛ فالحكم ينتظر ملفات safetensors، لا هذه المقالة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube