بطاقة عنوان رئيسية مولّدة لـ InternLumina-U2 تتضمن شارة PREVIEW، والعنوان 'InternLumina-U2'، والعنوان الفرعي 'نموذج انتشار واحد بحجم 16B للصور والفيديو والثلاثي الأبعاد'، وسطرًا يشير إلى مختبر شنغهاي للذكاء الاصطناعي، وLLM انتشار متعدد القواميس، وأن الكود صدر في 2026-09-01 وأن الأوزان ستُتاح قريبًا، ورقاقات للصور والفيديو والثلاثي الأبعاد، وأشكالًا تجريدية زرقاء وسماوية وكهرمانية تمثل Understand-Generate-Edit على اليمين، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

InternLumina-U2 معاينة: نموذج انتشار واحد بحجم 16B للصور والفيديو والثلاثي الأبعاد — الأوزان لا تزال قادمة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في الساعة 04:03 بتوقيت UTC يوم 1 سبتمبر 2026، أنشأ مختبر شنغهاي للذكاء الاصطناعي مستودع GitHub باسم InternLumina-U2. وبعد ثلاث عشرة دقيقة، سجّلت المنظمة نفسها مستودعًا يحمل الاسم نفسه على Hugging Face. لم تكن هناك أي تدوينة إطلاق، ولا بطاقة تعريف للنموذج، ولا أي إعلان من أي نوع — فقط كود الاستدلال الخاص بـ InternLumina-U2، وهو نموذج خليط من الخبراء بمعاملات تبلغ 16 مليارًا (مع 1 مليار نشط فقط)، والذي تصفه المنظمة بأنه نموذج واحد يغطي فهم الصور، وتوليد الصور من النص، وتحرير الصور، وفهم الفيديو، والفهم ثلاثي الأبعاد عبر واجهة واحدة من الرموز المنفصلة. الكود حقيقي وعلني؛ أما النموذج نفسه فليس كذلك — حتى الآن. الأوزان موسومة بعبارة "قريبًا"، ومستودع Hugging Face مجرد عنصر نائب فارغ، والتقرير الفني الموعود لم يظهر بعد. ومع ذلك، فإن ما صدر بهدوء في 1 سبتمبر هو الصورة العامة الأكثر اكتمالًا لهذا النموذج الموجودة في أي مكان.

إذا كانت هذه هي المرة الأولى التي تسمع فيها عن InternLumina-U2، فهذا هو بيت القصيد. لم يُعلَن عن أي شيء يخص الإصدار، ولا يبدو أن هناك أي تغطية مستقلة حتى الآن — والكتابات التي تلتقط الإشارات المبكرة هي بالضبط أول مكان يظهر فيه نموذج كهذا، قبل منشور الإطلاق وأحيانًا قبل الأوزان. كل ما يلي مأخوذ من مستودع GitHub وصفحة المشروع والصفحة الأولية على Hugging Face التي نشرها المختبر نفسه في الأول من سبتمبر، وأي شيء يتجاوز تلك المصادر يُوسَم صراحةً بأنه استنتاج.

ما الذي تم شحنه فعليًا في الأول من سبتمبر؟

مستودع GitHub InternLM/InternLumina-U2أُنشئ في 1 سبتمبر 2026، وشهد ذلك اليوم ثلاثة Commits: إيداع init، وإيداع يضع رابط النموذج على أنه "coming soon" ونتائج المعايير على أنها "preliminary"، وإيداع لإصلاح التنقل. وهو مرخّص بموجب Apache-2.0 ويتضمن README بعنوان "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing" بنسخة إنجليزية وأخرى صينية، وأداة استدلال كاملة، وخارطة طريق. وهناك أمر طريف جدير بالملاحظة: يحمل الإدخال الإخباري الخاص بالمستودع ختم "[2026-08]"، بينما يعود كلٌّ من إيداع init وطابَعَي الوقت المسجَّلَين في المستودع إلى 1 سبتمبر 2026 — لذا تعامل مع أوائل سبتمبر على أنه تاريخ الإصدار الفعلي، لا أغسطس. المستودع أدناه هو كامل الإصدار العام: كل ملف يظهر في الشجرة هو جزء مما طُرح، ولا يوجد أي شيء آخر في أي مكان حتى الآن.

A screenshot of the GitHub repository InternLM/InternLumina-U2 captured September 2, 2026, showing the repo description 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', an Apache-2.0 license, 4 stars, commits dated 'yesterday' including 'init repo', and the file tree with the inference entrypoints infer_1024_sft.sh, infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py.

GitHub — InternLM/InternLumina-U2، أُنشئ في 2026-09-01 بموجب ترخيص Apache-2.0، مع كود استدلال للنصوص، وتوليد الصور من النصوص، وفهم الصور، وتحرير الصور، وفهم الفيديو، والفهم ثلاثي الأبعاد.

Hugging Face — internlm/InternLumina-U2، أُنشئ في 2026-09-01، ويحتوي حاليًا على ملف .gitattributes فقط وملف README بحجم 28 بايت، محتواه بالكامل هو ترويسة ترخيص Apache-2.0. لا أوزان، ولا إعدادات، ولا ملفات tokenizer.

صفحة المشروع — internlm.github.io/InternLumina-U2، مع أشكال توضيحية للبنية المعمارية، وجدول معايير أولي، وعروض توضيحية مؤقتة؛ ويُشار إلى التقرير الفني بأنه «قريبًا».

كود الاستدلال منظم كسكربت رئيسي واحد مع قسم لكل مهمة: توليد النص العادي، توليد الصورة من النص بدقة تصل إلى 1024×1024 مع إعدادات CFG وخطوات زمنية قابلة للضبط، فهم الصور عبر الصور الطبيعية والرسوم البيانية الكثيفة، تحرير الصور القائم على التعليمات مع وضع CFG المزدوج الاختياري، فهم الفيديو عبر 64 إطارًا مأخوذًا بالعينة، وفهم ثلاثي الأبعاد عبر أصول GLB/GLTF التي تُعرض في 64 عرضًا ملونًا وعمقيًا عبر خط أنابيب Blender مدمج قبل الترميز. هذا الاتساع في المهام هو الأطروحة التصميمية الكاملة للنموذج، ويستحق التوقف عنده قبل الغوص في البنية.

نموذج واحد، ست وظائف، مفردات رموز واحدة

إنترن لومينا-U2 ينتمي إلى خط بحثي سريع التطور يراهن على أن اللغة والرؤية يجب أن تتشاركا في واجهة واحدة قائمة على الرموز المتقطعة، بدلاً من أن تعيشا في حزمتين منفصلتين للفهم والتوليد. الأعمال السابقة للمختبر نفسه في هذا الاتجاه — لومينا-DiMOO، النموذج الموحّد للانتشار المتقطع الذي عُرض في WAIC 2025 — تُستشهد بها جنباً إلى جنب مع LLaDA2.0-Uni وShow-o2 وMMaDA بوصفها الأنظمة الرائدة التي يبني عليها إنترن لومينا-U2 ويدّعي تفوّقه عليها. الرهان المحدد الذي يقدّمه إنترن لومينا-U2 هو أن عنق الزجاجة لهذه النماذج الموحّدة ليس في البنية، بل في المفردات البصرية: فقاعدة الشيفرات الواحدة تضع حداً أقصى لكمية المعلومات التي يمكن أن يحملها الرمز البصري الواحد، بينما الأنظمة الهجينة بين المتقطع والمستمر التي تقسّم الفهم والتوليد عبر تمثيلات مختلفة تُجبر النموذج على الحفاظ على حزمتين على أي حال.

إجابة InternLumina-U2 هينمذجة منفصلة تمامًا متعددة دفاتر الشيفرات. يستخدم الجانب البصري محلل AToken من Apple، الذي يصف كل موضع بصري باستخدام ثمانية دفاتر شيفرات متكاملة، في محاولة للحفاظ على الملمس المحلي والنصوص المدمجة والهندسة والتفاصيل عالية التردد دون تضخيم طول التسلسل. في جانب الإدخال، يحتفظ كل من دفاتر الشيفرات الثمانية بتضمينه الخاص، ويتم تسلسل التضمينات الثمانية الخاصة بكل موضع ثم إسقاط ناتجها على رمز أساسي واحد. في جانب الإخراج، يكون التنبؤ متوازيًا مكانيًا، لكنه تتابعي ذاتي عبر عمق دفاتر الشيفرات: يزيل العمود الفقري للانتشار التشويش عن العديد من المواضع المكانية المقنعة بالتوازي، ثم يتنبأ رأس تتابعي ذاتي متعدد دفاتر الشيفرات بالرموز الثمانية لكل موضع بالترتيب.

Scale — إجمالي المعاملات 16B، منها 1B نشط (16B-A1B)، وهو MoE متفرق.

العمود الفقري للغة — نموذج اللغة الانتشارية LLaDA-2.0 MoE، الذي يمتد هدفه الانتشار الكتلي إلى المهام البصرية من خلال تدريب مشترك متعدد المهام (وصف المورّد).

تمثيل مرئي — رموز منفصلة تمامًا عبر 8 قواميس شيفرات من مُرمِّز AToken التابع لشركة Apple.

الأجهزة — مهيأة للعمل مع وحدات معالجة الرسوميات من NVIDIA ووحدات المعالجة العصبية Ascend من هواوي أثناء التدريب والتقييم والاستدلال، مع تطابق عددي على مستوى العمليات بين الواجهتين الخلفيتين.

A generated single-column state-of-play scoreboard titled 'InternLumina-U2 — the state of play' listing: Size 16B MoE, 1B active; Modalities image, video, 3D + T2I + editing; Visual tokens 8-codebook discrete (AToken); Backbone LLaDA-2.0 MoE diffusion LLM; Weights not released yet; Released code and page 2026-09-01, with a footer reading 'All details vendor-reported; no independent scores yet' and the OrcaRouter logo in the bottom-right corner.

ما يقدمه ذلك عمليًا، إذا صدقت الادعاءات، هو أقدم حلم في المجال متعدد الوسائط: مجموعة واحدة من الأوزان تستطيع قراءة صورة، وتعديلها، ورسم صورة جديدة من نص، والإجابة عن أسئلة حول مقطع فيديو، ووصف عنصر ثلاثي الأبعاد — بحيث يعزز الفهمُ والتوليدُ بعضُهما بعضًا عبر الواجهة نفسها بدلاً من أن يُجمَّعا من نماذج متخصصة. وهذا أيضًا هو الادعاء الأجدر بنظرة متشككة، لأنه الأصعب في أن يتحقق.

الأرقام، على ما هي عليه

كل معيار يمتلكه InternLumina-U2 هو مُعلَن من البائع، وأوّلي، وجزئي. ملف README وصفحة المشروع يقولان ذلك بأنفسهما: "نتائج أولية وجزئية. ستظهر جداول المقارنة الكاملة في التقرير الفني القادم." لا يوجد أي تقييم مستقل، لأن الأوزان غير متاحة للعموم. تعامل مع الأرقام أدناه باعتبارها ادعاءات المختبر نفسه، وليست نتائج موثّقة.

فهم الرسوم البيانية / المستندات — ChartQA 86.52, CharXiv-DQ 83.65 (وفقًا لتقارير المورّد).

الاستدلال الرياضي البصري — MathVision 33.22، DynaMath 56.37؛ يقول المختبر إن هذا يتفوق على InternVL3-8B المخصص للفهم فقط في كليهما.

المتانة ضد الهلوسة — HallusionBench 62.15.

فهم الفيديو — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (صفحة المشروع).

فهم ثلاثي الأبعاد— 3D MM-Vet 41.8.

نص إلى صورة — DPG-Bench 87.10، TIIF-Bench Short/Long 84.60/85.95، GenEval 0.81 (صفحة المشروع).

تحرير الصور — ImgEdit 3.83.

قصة المقارنة هي الموضع الذي ينبغي للقارئ الأمين أن يتأنى فيه. يدّعي ملف README أن InternLumina-U2 يتفوّق على النماذج الموحّدة مثل InternVL-U وLLaDA2.0-Uni وShow-o2 وLumina-DiMOO في معايير الفهم الدقيق والتوليد، لكن جدول صفحة المشروع نفسه يُظهر InternLumina-U2 عند 0.81 في GenEval مقابل 0.89 لنموذج LLaDA2.0-Uni، لذا يتخلّف النموذج عن منافس واحد على الأقل في مقياس توليد رائد واحد على الأقل. إن انتقاء بضعة أرقام مواتية من جدول جزئي هو بالضبط ما صُمّم التحذير القائل بوجود «جداول المقارنة الكاملة في التقرير التقني» لتليينه. وهذه الأرقام مجرّد إشارة اتجاهية صادرة من المختبر، لا أكثر.

ما هو حقيقي مقابل ما هو موعود

نطاق الإصدار صريح بشكل غير معتاد، وهذا أمر مهم لأي شخص يقرر ما إذا كان يمكنه تجربة هذا اليوم. تم شحن: كود الاستدلال. لم يتم شحن: الأوزان، وكود التدريب (المُوعَد في مستودع منفصل)، وحزمة Ascend للتدريب والاستدلال، والتقرير الفني. مستودع Hugging Face الذي سيحتضن النموذج في النهاية هو مجرد هيكل فارغ — لقطة الشاشة أدناه هي كامل المحتويات الحالية للصفحة التي يصل إليها القارئ عند النقر على رابط "Model (coming soon)" في ملف README.

A screenshot of the Hugging Face model page internlm/InternLumina-U2 captured September 2, 2026, showing the empty placeholder: the model name under the internlm organisation, a License badge reading apache-2.0, the notice 'README.md exists but content is empty', 'Downloads are not tracked for this model', and no inference provider yet serving the model.

حتى الكود المُصدَر لا يمكنه إنتاج مخرجات بعد. يتوقّع مشغِّل الاستدلال وجود دليل نقاط فحص مقسّم من Hugging Face وأوزان مُرمِّز AToken في مسار محدد — ولا يوجد أيٌّ من هذين في المستودع — لذا فإن ما يمكن تنزيله اليوم هو مواصفات لكيفية تشغيل النموذج، وليس نموذجًا يعمل فعلًا. وعندما تصل الأوزان أخيرًا، لن تكون الاستضافة الذاتية مجرد عملية pip-install روتينية. فالنموذج يستخدم واجهة برمجية للتوليد من نوع block-diffusion بدلًا من واجهة التوليد القياسية في Transformers، ويتطلب مُرمِّز AToken تقنية FlashAttention، والكود يحتاج إلى GPU مرئي وقت الاستيراد، والمشغِّل الجذري أحادي العملية، وخط أنابيب الإخراج ثلاثي الأبعاد يتطلّب Blender 4.5 لتشفير الأصول. إنه مشروع نشر حقيقي، وليس تجربة لعطلة نهاية الأسبوع — وهذا تحديدًا نوع الاحتكاك الذي وُجدت طبقة التوجيه لامتصاصه بالنسبة لمعظم الفرق.

عندما تستقر الأوزان، تعامل معه باعتباره النموذج غير المُثبت الذي هو عليه.

لا أحد يستطيع اليوم تشغيل InternLumina-U2، ولا يمكن لأي مزوّد تقديمه، لأن الأوزان غير موجودة في المجال العام. سيتغيّر ذلك في لحظة ما — فرخصة Apache-2.0، ونمط المختبر لعام 2026 في الفتح المكثّف للمصادر المفتوحة (مبادرة ArchSpace لفتح كل شيء، وInternVL3.5، ونماذج Intern-S2 العلمية) يجعلان إطلاق الأوزان احتمالًا راجحًا لا مجرد تخمين. وعندما يحدث ذلك، فإن الخطوة العقلانية الأولى ليست المراهنة بخط الإنتاج على نموذج انتشار صادر للتو، ذي متطلبات تقديم غير مألوفة وبلا أي تقييمات مستقلة؛ بل تشغيله جنبًا إلى جنب مع النموذج الذي تثق به فعلًا، على مسار اختباري، مع تحويل تلقائي عند الفشل إلى النموذج المُثبَت بمجرد أن يسيء النموذج الجديد التصرف. هذا هو السيناريو الذي صُممت من أجله طبقة التوجيه: واجهة API واحدة تشمل أكثر من 200 نموذج، وأسعار المزوّدين المعلنة تُمرَّر دون أي هامش ربح (0%)، وتحويل تلقائي عند الفشل يحوّل "تجربة الجديد" إلى قاعدة توجيه بدلًا من عملية ترحيل. OrcaRouter مُهيأ على هذا النسق — ولكي نكون دقيقين، فإننا لا نوجّه InternLumina-U2 ولا نستطيع ذلك، لأن الأوزان لم تُطرح بعد. هذا القسم يتعلق بسير العمل عندما تُطرح الأوزان، لا بادعاء أن النموذج متاح في أي مكان اليوم.

ماذا تشاهد بعد ذلك

أربعة أحداث من شأنها أن تنقل InternLumina-U2 من مرحلة المعاينة إلى الواقع، بترتيب تقريبي حسب الاحتمالية. أولاً، امتلاء مستودع Hugging Face: ظهور ملفات safetensors، وملف إعدادات، وأوزان مُرمِّز AToken في تلك الهيكلية هو اللحظة التي يصبح فيها النموذج موجودًا فعليًا. ثانيًا، التقرير الفني، الذي يُفترض أن يحمل جداول المقارنة الكاملة، ومن شأنه أن يحوّل الأرقام الجزئية المقدمة من البائع أعلاه إلى ما يمكن التحقق منه. ثالثًا، مستودع كود التدريب ومجموعة Ascend التقنية، وهو أمر مهم لأي شخص يرغب في ضبط النموذج بدقة أو تشغيله على أجهزة غير تابعة لـ NVIDIA. رابعًا، تقييم مستقل أول — نتيجة Elo في الساحة، أو تشغيل مُعاد إنتاجه لاختبار ChartQA أو GenEval — يختبر وعد "نموذج واحد، ست مهام" دون التحيز الانتقائي الخاص بالمختبر. كون الكود متاحًا للعموم في الأول من سبتمبر يعني أن البنية المعمارية أصبحت معروفة بالفعل؛ أما غياب الأوزان فيعني أن كل ما يتعلق بالجودة الفعلية لا يزال مجرد ادعاء. راقب مستودع النموذج بدلاً من خلاصة الإعلانات — فالأجزاء المثيرة للاهتمام أصبحت علنية بالفعل، والنموذج نفسه على الأرجح ليس بعيدًا عن ذلك.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube