بطاقة عنوان رئيسية للمقارنة 'InternLumina-U2 vs Gemini Omni 1.1 Flash' مع العنوان الفرعي 'النموذج الذي لا يمكنك تشغيله بعد مقابل النموذج الذي تدفع مقابله بالثانية' وثلاث رقاقات إحصائية — 'InternLumina-U2: كود فقط، الأوزان قادمة قريبًا'، 'Gemini Omni 1.1 Flash: GA 27 أغسطس 2026'، '$0.03–$0.30 لكل ثانية من الفيديو' — مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

InternLumina-U2 مقابل Gemini Omni 1.1 Flash: النموذج الذي لا يمكنك تشغيله بعد مقابل النموذج الذي تدفع مقابله بالثانية

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إذا كان موعدك النهائي هذا الأسبوع، فهذه المقارنة تُختصر في جملة واحدة. Gemini Omni 1.1 Flash هو نموذج توليد الفيديو المتاح للعموم من Google — تستدعيه عبر واجهة برمجة تطبيقات، فيُعيد مقطعًا مصحوبًا بصوت متزامن، وتدفع مقابل كل ثانية من المخرجات. أما InternLumina-U2 فهو نموذج بحثي من مختبر الذكاء الاصطناعي في شنغهاي، نُشر بهدوء بترخيص Apache-2.0 — يمكنك تنزيل كود الاستدلال الخاص به، لكن ليس أوزانه، التي لا يزال المختبر يضع عليها علامة "قريبًا". أحدهما منتج يمكنك شراؤه الآن؛ والآخر رهان على شكل ورقة بحثية لا يمكنك تشغيله إطلاقًا. والسؤال المثير للاهتمام هو لماذا يضعهم أي شخص في الجملة نفسها من الأساس، وماذا يكشف كل منهما عن اتجاه العمل المفتوح متعدد الوسائط في أواخر 2026.

كل ما يلي مُصنَّف حسب المصدر. تفاصيل InternLumina-U2 مأخوذة من مستودع GitHub وصفحة المشروع اللذين نشرتهما المختبر في 1 سبتمبر 2026 — في اليوم نفسه الذي ظهر فيه إصدار Hugging Face الفارغ — وكل رقم من أرقام معايير الأداء الخاصة به مُعلَن من قِبل البائع، ومبدئي، ولم يُستنسَخ. أما تفاصيل Gemini Omni 1.1 Flash فمأخوذة من مواد الإصدار وصفحة التسعير الخاصة بشركة Google للنموذج الذي أصبح متاحًا بشكل عام في 27 أغسطس 2026.

إجابتان على السؤال نفسه "متعدد الوسائط"

يعيش كلا النموذجين تحت راية فضفاضة هي «نموذج واحد، طرائق متعددة»، وهذا التصنيف المشترك هو السبب الوحيد وراء المقارنة بينهما. أما في جوهرهما فليس بينهما أي قاسم مشترك تقريبًا. Gemini Omni 1.1 Flash خدمة توليد مغلقة ومستضافة تضع الفيديو في المقام الأول: زوّدها بنص أو صورة أو مقطع مرجعي قصير أو صوت، فتُنتج ما يصل إلى عشر ثوانٍ من فيديو بدقة 720p مع كلام وموسيقى ومؤثرات صوتية مدمجة، ويمكن تمديدها بزيادات مدتها عشر ثوانٍ حتى تبلغ مشهدًا من أربعين ثانية. وهي تحلل المقطع الذي لديك بالفعل — إذ يفحص تمرير التمديد الآن ما يصل إلى عشر ثوانٍ من السياق السابق بدلًا من ثانية واحدة فقط — كما تدعم التحكم في الإطار الأول/الأخير بحيث يمكنك تثبيت بداية اللقطة ونهايتها وترك النموذج يملأ الوسط. إنها أداة لصناعة الصور المتحركة، تُباع بالثانية.

إنترنلومينا-U2 رهان في الاتجاه المعاكس: نموذج واحد متناثر يعمل بنظام خليط الخبراء، بإجمالي 16 مليار معلمة منها مليار واحد نشط، يدّعي فهم الصور والفيديو والأصول ثلاثية الأبعاد، وتوليد الصور وتحريرها عبر واجهة موحّدة من الرموز المتقطعة. جانبه البصري متقطّع بالكامل — ثمانية قواميس رموز مكمّلة مستمدة من أداة ترميز يسميها المختبر "AToken"، بحيث يوصف كل موضع بصري بثمانية رموز بدلاً من رمز واحد — أما جانبه اللغوي فيقوم على بنية انتشارية مدّها المختبر من نموذج "LLaDA-2.0". الفكرة هي أن الفهم والتوليد يجب أن يعزّزا بعضهما بعضاً ضمن مجموعة أوزان واحدة بدلاً من أن يُجمّعا من نماذج متخصصة منفصلة. وما إذا كان ذلك ينجح هو أمر لا يمكن الإجابة عنه حالياً: فالنموذج غير قابل للتشغيل في أي مكان، لأن الأوزان غير متاحة للعموم.

لوحة النتائج، على ما هي عليه.

لوحة النتائج الصادقة لهذا الزوج يجب أن تحمل مصدر كل صف، لأن أحد العمودين هو منتج يُشحن بأسعار معلنة، بينما الآخر ادعاء بحثي غير مُعلن عنه وليس له سعر إطلاقًا.

• ما هو — Gemini Omni 1.1 Flash: نموذج مستضاف لتوليد الفيديو وتحريره (معرّف النموذج gemini-omni-1.1-flash)، متاح للعموم اعتبارًا من 27 أغسطس 2026. InternLumina-U2: نموذج لغوي كبير للانتشار (diffusion LLM) قائم على العلم المفتوح، للفهم البصري الشامل، وتوليد الصور وتحريرها، مع إصدار الكود البرمجي في 1 سبتمبر 2026.

• الأوزان — Gemini Omni 1.1 Flash: لا شيء، مغلق ولا يُتاح إلا عبر الاستضافة. InternLumina-U2: لا شيء بعد أيضًا، لكنه مرخّص بموجب Apache-2.0 ومُعلَّم صراحةً بأنه "قريبًا."

• المخرجات التي تحصل عليها — Gemini Omni 1.1 Flash: مقاطع فيديو بدقة 720p مدتها 10 ثوانٍ مع صوت، وقابلة للتمديد حتى 40 ثانية؛ مع رفع الدقة إلى 1080p و4K؛ ونص مرافق. InternLumina-U2: لا شيء بعد — سوى كود الاستدلال وخارطة طريق.

• ما يستقبله — Gemini Omni 1.1 Flash: نص، صورة، فيديو (حتى ~131 ألف رمز إدخال؛ ثلاثة مقاطع بمدة 10 ثوانٍ لكل طلب)، صوت. InternLumina-U2: يزعم دعم النصوص، الصور الطبيعية، الرسوم البيانية الكثيفة، الفيديو على أكثر من 64 إطارًا مُلتقطًا، والأصول ثلاثية الأبعاد بصيغة GLB/GLTF المُصيَّرة إلى 64 منظرًا للون والعمق.

• كيف تشغّلها — Gemini Omni 1.1 Flash: عبر Gemini API من Google باستخدام واجهة Interactions API ذات الحالة؛ وصول المستهلكين عبر Google Flow لمشتركي AI Plus وPro وUltra. InternLumina-U2: استضافة ذاتية فقط، وفقط بعد طرح الأوزان؛ يتوقع الكود وجود مجلد نقاط تحقق مجزأ، وأوزان مُرمِّز AToken، وFlashAttention، وBlender 4.5 للمسار ثلاثي الأبعاد.

• ما التكلفة — Gemini Omni 1.1 Flash: 0.03 دولار/ثانية بجودة 360p (مسودة)، و0.10 دولار/ثانية بجودة 720p، و0.15 دولار/ثانية بجودة 1080p، و0.30 دولار/ثانية بجودة 4K، مع بطاقة أسعار توكنات بقيمة 1.50 دولار لكل مليون توكن إدخال و9.00 دولارات لكل مليون توكن إخراج نصي. InternLumina-U2: مهما كانت تكلفة وحدات معالجة الرسومات (GPU) لديك، بمجرد أن يتوفر.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

العمودان لا يقيسان المحور نفسه. جانب Gemini مُسعَّر ومُقدَّم ومفيد فورًا؛ بينما جانب InternLumina هو مواصفات لنموذج ليس نموذجًا بعد.

الجزء الحالي بالفعل: الإصدار العام من Gemini Omni 1.1 Flash

يُعَدّ Gemini Omni 1.1 Flash مهمًا بحد ذاته هذا الأسبوع، لأنه يمثل اللحظة التي توقف فيها خط فيديو Omni من Google عن كونه معاينة. وسيُطفأ، في 30 سبتمبر 2026، عنوان المعاينة السابق لـ Gemini Omni Flash؛ وهذا النموذج GA هو البديل الذي يُنقل إليه المطورون. قائمة التحسينات ملموسة: تمديد المشاهد إلى أربعين ثانية عبر زيادات من عشر ثوانٍ، والتحكم بالإطارات المفتاحية الذي يتيح لك تحديد أول إطار وآخره ويجعل النموذج يولّد اللقطات الواصلة بينهما، ومقاطع مرجعية تصل مدتها إلى ثلاث ثوانٍ للحفاظ على اتساق الشخصية أو البيئة، وفئة مسودة بدقة 360p تُسعَّر بثلث سعر 720p مع سرعة أكبر بنسبة تصل إلى 60% لتكرار اختبار المطالبات قبل العرض النهائي المكلف. وإذا كنت تبني خطوط إنتاج فيديو، فإن جدول الأسعار — 0.10 دولار للثانية بدقة 720p، و1.01 دولار لمقطع من عشر ثوانٍ، ونحو 4 دولارات لمشهد مدته أربعون ثانية بدقة 720p ومبني من أربع استدعاءات تمديد — هو الرقم الذي يغيّر نموذج التكلفة لديك.

لا شيء من ذلك يجعلها منافسًا لـ InternLumina-U2 بأي معنى تشغيلي. فـ Gemini Omni 1.1 Flash يولّد الحركة؛ بينما InternLumina-U2، إذا صمدت ادعاءاته عند ملامسة الأوزان، سيفهم الحركة ويولّد صورًا ثابتة. والفريق الذي يحتاج فيديو منتج هذا الربع لن يختار بين الاثنين — فطراز Gemini هو الوحيد من بينهما الذي يمكن استدعاؤه أصلًا، وهو متاح عبر واجهة Google البرمجية الخاصة وعدة منصات طرف ثالث.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

وثائق "النماذج" الخاصة بواجهة برمجة تطبيقات Gemini على موقع مطوّري الذكاء الاصطناعي من Google، تم التقاطها في 2 سبتمبر 2026 — وهي الصفحة التي تُدرج عائلة Gemini الحالية، مع سلسلة Gemini Omni في شريط التنقل الجانبي.

الجزء الذي لا يسري فيه التيار إطلاقًا: InternLumina-U2

كان إصدار InternLumina-U2 في الأول من سبتمبر من النوع الأكثر هدوءًا: ثلاث عمليات دفع (commits) إلى مستودع على GitHub، وصفحة مشروع، وملف ركيزة (stub) على Hugging Face بحجم 28 بايت لا يحوي سوى ترويسة رخصة Apache-2.0، ودون أي إعلان. ما هو متاح للعموم فعلًا هو أداة الاستنتاج (inference harness) والبنية المعمارية، وهما جديران بالقراءة المتأنية تحديدًا لأن لا أحد تمكن من اختبار النموذج نفسه. يُظهر المستودع مشغلًا (driver) بنقطة دخول واحدة لكل مهمة — النصوص، وتوليد الصور من النص حتى دقة 1024×1024، وفهم الصور عبر الصور الطبيعية والمخططات الكثيفة، وتحرير الصور القائم على التعليمات مع وضع CFG المزدوج الاختياري، وفهم الفيديو عبر 64 إطارًا مأخوذًا بالعينات، وفهم ثلاثي الأبعاد عبر عروض GLB/GLTF المُصيَّرة باستخدام Blender. الرهان في التصميم هو أن المفردات البصرية المنفصلة متعددة الدفاتر (multi-codebook) تتيح لبنية أساسية واحدة (backbone) القيام بكل ذلك دون تضخيم طول التسلسل — وهي الغريزة نفسها القائلة بأن «الرموز المرئية ينبغي أن تحمل مزيدًا من المعلومات»، والتي تدفع نماذج الفيديو الأصلية المعتمدة على الترميز، مُطبَّقةً على واجهة موحّدة للفهم والتوليد.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

مستودع InternLM/InternLumina-U2 على GitHub، كما التُقط في 2 سبتمبر 2026 — الصفحة الرئيسية للمستودع المرخّص بموجب Apache-2.0، مع وصف «نموذج لغوي كبير متعدد دفاتر الشيفرات قائم على الانتشار»، وثلاث عمليات إيداع، وسكربتات الاستدلال الخاصة بكل مهمة، وهي كل ما يشمله الإصدار العام حتى الآن.

جدول المعايير في صفحة المشروع مُصنَّف من قبل المختبر نفسه على أنه «نتائج أولية جزئية»، والأرقام الموجودة فيه تحتمل التأويل في الاتجاهين: أرقام قوية للرسوم البيانية والمستندات (ChartQA 86.52، CharXiv-DQ 83.65، وفقًا لما أبلغه البائع) تقع بجوار نتيجة GenEval البالغة 0.81 والتي تتخلف عن 0.89 لنموذج واحد على الأقل يدّعي المختبر تفوّقه عليه. لا يوجد تقييم مستقل، لأنه لا يوجد نموذج لتقييمه. يبقى كل ما يتعلق بالجودة الفعلية مجرد ادعاء حتى تظهر ملفات safetensors في تلك الصفحة الفارغة على Hugging Face.

ما تفعله طبقة التوجيه عندما يوجد جانب واحد فقط

هذه إحدى المقارنات التي يكون فيها جانب التوجيه متعلقًا بالوقت حقًا، وليس بالاختيار. لن ندّعي أن OrcaRouter يخدم InternLumina-U2 — فلا يمكن لأحد ذلك، لأن الأوزان غير مطروحة — وGemini Omni 1.1 Flash ليس في كتالوجنا أيضًا؛ إذ تصل إليه عبر واجهة برمجة تطبيقات Google الخاصة. ما فائدة طبقة التوجيه في هذه الفجوة في الواقع هو إبقاء خياراتك مفتوحة دون إعادة بناء خط أنابيبك مرتين. نموذج التمرير المباشر هو الآلية: فعندما يظهر نموذج مستضاف من بائع في كتالوج، يُمرَّر سعر القائمة الخاص بالمزوّد بهامش ربح 0%، لذا فإن السعر بالثانية الذي ينشره البائع هو السعر بالثانية الذي تدفعه عبر مفتاح واحد بدلاً من عقد لكل مزوّد. وعندما يصل أخيرًا إصدار أوزان Apache-2.0 مثل InternLumina-U2، فإن التصرف العقلاني ليس اقتلاع حزمة الفيديو العاملة لديك — بل تشغيل النموذج الجديد على مسار اختبار خلف تجاوز الفشل التلقائي، بحيث عندما يُسيء نموذج الانتشار غير المثبت التصرف لأول مرة، يعود الطلب إلى النموذج الذي تثق به بالفعل دون أي تغيير في الكود. جرّب الشيء الجديد حيث لا يمكنه أن يؤذيك؛ وجّه الأشياء التي تدرّ المال.

الحكم

إذا كنت بحاجة إلى فيديو هذا الشهر، فالقرار محسوم لك: Gemini Omni 1.1 Flash حقيقي ومسعّر ومتاح للعموم، بينما لا يمكن لأحد استدعاء InternLumina-U2. أما إذا كنت تراقب إلى أين يتجه البحث المفتوح في الوسائط المتعددة، فإن InternLumina-U2 هو النتاج الأكثر إثارة للاهتمام — رهان نادر من {{1}}مختبر كبير{{/1}} على نموذج منفصل تمامًا متعدد دفاتر الشيفرات، بترخيص Apache-2.0؛ إذ أصبحت بنيته معلنة بالفعل، ويُرجَّح ألّا تتأخر أوزانه طويلًا. تعامل مع المستودع بوصفه معاينة لاتجاه بحثي، وتعامَل مع نموذج الفيديو المتاح عمومًا بوصفه أداة يمكنك البناء عليها اليوم، ولا تدع الوسم المشترك «متعدد الوسائط» يقنعك بأنهما يتنافسان على المهمة نفسها.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube