بطاقة عنوان رئيسية لـ«Realtime-Venus»، بعنوان فرعي «ورقة بحثية، ونقطتا تفتيش، ولا إعلان»، مع ثلاث بطاقات نصّها «Realtime-Venus-Omni: 9B، سمعي-بصري، Apache-2.0»، و«Realtime-Venus-Audio: 9B، تفاعل منطوق»، و«لا يزال مفقودًا: API، السعر، منشور الإطلاق، اختبار مرجعي مستقل»، فوق شريط تذييل نصّه «جميع أرقام الاختبارات المرجعية مستمدة من التقرير الفني؛ ولم يُعِد أحدٌ إنتاج أيٍّ منها بشكل مستقل.» شعار OrcaRouter مركّب في الزاوية اليمنى السفلية.
Guides & Insights

Realtime-Venus: نموذج 9B ثنائي الاتجاه الكامل من Ant Group طُرح دون إطلاق

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 12 سبتمبر 2026، ظهر على arXiv تقرير تقني يصف Realtime-Venus، وهو نظام تفاعل كامل الازدواجية مبنيّ من نموذجين بحجم 9B دُرّبا بشكل منفصل — Realtime-Venus-Omni للتفاعل السمعي-البصري وRealtime-Venus-Audio للتفاعل المنطوق — منسوب إلى Venus Team في Ant Group بالتعاون مع جامعة تسينغهوا. وفي غضون أيام، أصبح مستودع بترخيص Apache-2.0 تحت inclusionAI/Realtime-Venus على Hugging Face يضم كلتا نقطتي التحقق كملفات BF16 safetensors قابلة للتنزيل، إلى جانب صفحة مشروع ومستودع GitHub مرافق. أما ما لم يظهر فهو الجزء الجدير بالملاحظة: لا منشور إطلاق، ولا صفحة منتج، ولا API، ولا قائمة أسعار، ولا شيء على مواقع Ant Group الخاصة يعلن أن أيًا من ذلك موجود. هذا إصدار شمل كل شيء باستثناء الإعلان، وهو ما يجعل فصل الحقائق المؤكدة عن الادعاءات هو المهمة كلها.

ما الذي يوجد فعليًا على القرص؟

المستودع ليس مجرد هيكل فارغ. فهو يضم مجلدين للنماذج، يحتوي كل منهما على أوزان safetensors مقسّمة إلى أجزاء، وملف إعدادات، وشيفرة Hugging Face Transformers المخصصة التي ترشدك بطاقة النموذج إلى تحميلها باستخدام trust_remote_code=True. هناك ملف متطلبات، ومجلد أصول يضم موارد تحويل الرموز إلى أشكال موجية وصوتًا مرجعيًا، وترخيص Apache-2.0 في المستوى الأعلى. توثّق البطاقة التثبيت لـ Python 3.10 مع CUDA وFFmpeg، وكلاً من مرآة ModelScope ومسار تنزيل Hugging Face. الأوزان حقيقية، والشيفرة موجودة، ولا شيء يمنعك من تنزيلها اليوم.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

غيابان لا يقلان إفادة عن المحتويات. الأول هو أن المستودع يصرّح بوضوح بأنه غير منتشر من قِبل أي مزوّد استدلال — فلا توجد نقطة نهاية مُستضافة، ولا خيار بلا خوادم، ولا منصة طرف ثالث تحمله. والثاني هو أن التنزيلات لا تُتعقّب على الإطلاق، ما يعني أنه لا توجد إشارة عامة إلى عدد الأشخاص الذين سحبوه. قد يبدو النموذج مُتبنّى أو مُتجاهَلًا على Hugging Face؛ أما هذا النموذج فيتعذّر قراءته بهذه الطريقة.

نقطتا التفتيش، وما يفصل بينهما

كلاهما 9B، وكلاهما يتشاركان بنية أساسية تدفقية، والفرق بينهما هو ما يمكنهما إدراكه.

• Realtime-Venus-Omni — نقطة التحقق السمعية البصرية. مُرمِّز بصري SigLIP2 للإطارات المتدفقة، ومُرمِّز صوتي Whisper-Medium، وعمود فقري لغوي Qwen3-8B. يقبل الفيديو أو الصور، والصوت، والنص؛ ويُعيد النص، واختياريًا، موجة كلامية.

• Realtime-Venus-Audio — البنية الأساسية نفسها مع إيقاف الرؤية عند التحميل. إدخال الصوت والنص، وإخراج النص والكلام. وهو موجود للحالة التي لا تكون فيها الكاميرا ذات صلة، حين تريد بصمة الذاكرة الأصغر والمسار الأبسط.

• مواصفات مشتركة — سياق من 40,960 رمزًا في كليهما، وأوزان BF16 في كليهما، ويُولَّد الكلام كرموز S3 متقطعة يفكّ ترميزها مفكّك ترميز تدفقي لمطابقة التدفق، بدلًا من نموذج تحويل نص إلى كلام منفصل يُلحَق في النهاية.

• النسب — تنص بطاقة النموذج على أن نقطة التحقق Omni مقتبسة من MiniCPM-o 4.5، النموذج المتعدد الوسائط الشامل بحجم 9B الذي أتاحته OpenBMB كمفتوح المصدر في وقت سابق من عام 2026. هذه ليست حاشية. بل يعني أن مساهمة Ant Group هي التدريب اللاحق، وبيئة التشغيل، وتصميم التفويض، مضافًا فوق العمود الفقري للبث الذي يملكه طرف آخر، وهو ادعاء مختلف وأكثر تحديدًا من "نموذج omni جديد بحجم 9B".

الفكرة الجديدة حقًا الوحيدة: التفويض كحدث تدفقي من الدرجة الأولى

على كل نظام يعمل بالازدواج الكامل في 2026 أن يحل التناقض نفسه. يعمل التحكم في المحادثة على مستوى دقة زمنية تتراوح من المللي ثانية إلى الثانية الواحدة. أما استدعاءات الأدوات والاسترجاع والاستدلال المعقد فتستغرق من ثوانٍ إلى عشرات الثواني. النموذج الذي يتوقف ليفكر يكف عن العمل بالازدواج الكامل؛ أما النموذج الذي لا يتوقف أبدًا فلا يمكنه استخدام أداة.

يقدّم Realtime-Venus استجاباته عبر بيئة تشغيل ثنائية الحلقات. تعمل حلقة التفاعل في كتل زمنية ثابتة طولها ثانية واحدة، فتستوعب باستمرار سمات الصوت والفيديو، وتحدّث حالة المحادثة، وتقرر ما إذا كان عليها أن تنصت أم تتحدث، مع بثّ النص والكلام المتوائم. وهي لا تتوقف عندما يكون العمل في الخلفية قيد التنفيذ. الحلقة الثانية هي مُجدول تسميه الورقة البحثية Realtime-Venus-Harness: عندما ترى الواجهة الأمامية أن مهمة تتجاوز ما يمكنها إنجازه في مسارها المباشر، فإنها تصدر تفويضًا غير متزامن عبر علامات خاصة مضمّنة في تسلسلها المخفي، ويتولى Realtime-Venus-Harness تنفيذ المهمة في الخلفية ثم يعيد دمج النتيجة في الحوار الجاري.

التفصيل الذي يجعل هذا أكثر من مجرد مخطط هو ما تسميه الورقة الالتقاط السببي للمهمة — إذ تُنفَّذ المهمة المفوَّضة على نسخة معزولة من حالة المحادثة، بحيث لا يمكن إفساد مهمة خلفية طويلة الأمد بسبب استمرار المحادثة في المضي قدمًا أثناء تشغيلها. هذا هو نمط الفشل الذي يجعل معظم تصاميم «فوّض واستمر في الحديث» تتهاوى عمليًا، وهو أكثر ما يثير الاهتمام في التقرير.

المنظومة ليست في الأوزان. إنها توجد في مستودع GitHub كمكوّن منفصل، ما يعني أن الجزء الذي يجعل البنية مميزة هو الجزء الذي سيتعين عليك تجميعه والثقة به بنفسك.

الأرقام، وبالتحديد لمن تعود

كل رقم أدناه مستمد من التقرير الفني وبطاقة النموذج. لم يُعِد إنتاجه أي شخص خارج المؤلفين، ولم ينشر أي طرف ثالث تقييمًا، ولا يوجد مدخل في لوحة الصدارة للتحقق منه. اقرأها بوصفها قياسات المؤلفين أنفسهم.

• معايير الفيديو، Realtime-Venus-Omni — أفضل نتيجة في ستة من المعايير الثمانية التي يستخدمها التقرير، بما في ذلك StreamingBench 70.2، وOVO-Bench 64.7، وDaily-Omni 81.3.

• معايير الأداء الصوتية، Realtime-Venus-Audio — MMAU 78.0، وMMAU-Pro 63.2، وLlama Questions 83.8، وSpeech CMMLU 67.8، ودرجة VoiceBench AlpacaEval البالغة 4.81 التي يصفها التقرير بأنها تطابق أفضل رقم مقارن.

• Full-Duplex-Bench v1.5 — الاستجابة إلى 75% من مقاطعات المستخدم، مع معدلات استمرار تبلغ 97% أثناء الإشارات الخلفية، و88% أثناء الكلام الموجّه إلى الآخرين، و86% أثناء الكلام في الخلفية. يذكر التقرير أن هذا يتجاوز أداء Gemini 3.1 Live وGPT-4o في جميع مقاييس الاستمرار الثلاثة.

رقم Daily-Omni هو الجدير بالتوقف عنده. يذكر MiniCPM-o 4.5، النموذج الذي تم تكييف نقطة الحفظ هذه منه، 80.2 على المعيار نفسه. ويذكر Realtime-Venus-Omni الرقم 81.3. إذا صحّ الرقمان، فإن التحسين الناتج عن جهد كبير في التدريب اللاحق والتشغيل يبلغ نحو نقطة واحدة على معيار كان النموذج الأساسي قويًا فيه أصلًا — وهو نتيجة واقعية لهذا النوع من العمل وسرد أقل إثارة بكثير من العنوان الرئيسي «الأفضل في ست من ثماني».

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

ما الذي لم يتم إثباته؟

قائمة الأسئلة المفتوحة أطول من قائمة الأسئلة المحسومة، وهذه هي الحالة الصادقة لنموذج عمره ستة أيام.

• لا يوجد أي تقييم مستقل. لا تصنيف في الساحة، ولا إعادة إنتاج من طرف ثالث، ولا مجموعة خارجية واحدة نشرت رقمًا.

• لا يوجد رقم لزمن الاستجابة بالمللي ثانية. يصف التقرير إيقاع تفاعل بمعدل ثانية واحدة، وتوثّق البطاقة نداءات البثّ لكل ثانية، لكن لا يوجد رقم منشور لزمن الوصول إلى أول صوت، وهو المقياس الذي تُشترى على أساسه هذه الفئة فعليًا.

• لا API ولا سعر، ولا أي تصريح بأن أياً منهما قادم. وما إذا كان هذا منتجاً في انتظار الإطلاق أو أثراً بحثياً سيبقى مجرد تنزيل، فأمر غير معروف على وجه اليقين.

• لا توجد نيّة معلنة من المورّد. غياب الإعلان ليس دليلًا على استراتيجية إطلاق هادئة؛ وهو أيضًا متوافق مع مستودع نُشر من أجل ورقة بحثية ولا شيء أكثر.

• لا يوجد دليل إنتاجي على الهيكل الرابط. فهو المكوّن الحامل للعبء في البنية المعمارية، والأقل توثيقًا.

لماذا يستمر حدوث المسار الهادئ

هذه هي المرة الثانية هذا العام التي يصل فيها عمل Ant Group على النماذج إلى الجمهور عبر مستودع بدلًا من إطلاق رسمي. ظهر UI-Venus-2-9B، وهو وكيل GUI الخاص بالمختبر، على Hugging Face في نهاية أغسطس 2026 دون ورقة بحثية، ولا صفحة مشروع، ولا إعلان — ومنذ ذلك الحين تبعه تقرير. أما Realtime-Venus فقد وصل بالترتيب المعاكس: التقرير أولًا، والمستودع إلى جانبه، ولا يزال الإعلان محتجزًا.

هذا النمط ليس فريدًا لدى Ant Group. فالمختبرات الصينية على وجه الخصوص دأبت على طرح مخرجات بحثية ومنتجات منشورة للمستهلكين في العالم، بينما تؤجّل الإعلان الموجّه إلى المطورين إلى وقت لاحق، أو تتخطّاه كليًا. ولمن يتتبّع هذا المجال، فإن ذلك مزعج، لأن الإشارة المعتادة — منشور إطلاق، أو بطاقة أسعار، أو موقع توثيق — هي بالتحديد الجزء المفقود. لقد أصبح المُخرَج هو الإعلان الآن، وقراءته بعناية هي السبيل الوحيد لمعرفة ما الذي طُرح.

إذا أردت تشغيله

البطاقة عملية بشكل غير معتاد لإصدار بهذا الحداثة. التحميل قياسي: AutoModel.from_pretrained على دليل نقاط التحقق المحلي مع الوثوق بالكود البعيد، وانتباه SDPA، و bfloat16. يتم الدخول إلى البث ثنائي الاتجاه الكامل باستدعاء واحد يبدّل النموذج إلى الوضع المزدوج، وبعد ذلك تكون الحلقة الموثقة هي ثانية واحدة من streaming_prefill متبوعة بـ streaming_generate، متكررة. يتم تمكين ذاكرة الفيديو الطويل باستخدام معامل memory-minutes المضبوط على أربعين، ويوصف بأنه بدون تدريب، وهو أمر ملحوظ لقدرة تتطلب عادةً الضبط الدقيق. تم توثيق تحذيرين بدلاً من اكتشافهما: حد أقصى للإطارات يقتطع الفيديو الطويل بصمت ما لم يتم رفع ثابت قبل استيراد الأدوات المساعدة، ومتطلب خط CJK للترجمات غير اللاتينية المعروضة في الفيديو المزدوج.

ما لا تمنحك إياه البطاقة هو حدّ أدنى من العتاد. إن نموذجًا بحجم 9B بصيغة BF16 يبلغ نحو ثمانية عشر غيغابايت من الأوزان قبل أي ذاكرة تنشيط، وهو ما يضع الاستدلال المزدوج في الزمن الحقيقي في نطاق GPU جاد ويجعله خارج متناول النشر على الحواسيب المحمولة الذي صُمّمت عائلة MiniCPM-o التي يشتقّ منها جزئيًا من أجله.

ثمة خط فاصل هنا يستحق التسمية، لأنه الموضع الذي يندرج فيه الموجّه فعلياً. يفوّض Realtime-Venus عمله الشاق — الاسترجاع، والاستدلال المعقّد، واستدعاءات واجهات برمجة التطبيقات التجارية — إلى نموذج خلفي. ذلك الجزء المفوَّض هو استدلال نصي عادي، وهو الجزء الذي يحدد ما إذا كانت واجهة محادثتك الأمامية مفيدة أم مجرد طلاقة في الحديث. لا يحمل OrcaRouter أي جزء من Realtime-Venus؛ فطبقة الازدواج هنا تنزيل مستضاف ذاتياً ولا نوفّره كخدمة. أما الاستدلال الذي يسلّمه فهو الجزء الذي نغطيه:ما يقرب من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش إضافي، والتحويل التلقائي عند الفشل عندما يمرّ المصدر الأعلى بيوم سيئ، ، ولغة DSL للتوجيه تجمع عدة نماذج في استدعاء واحد، ودمج النماذج للحالات التي لا يكفي فيها حكم نموذج واحد. وعلامة التفويض هي قرار الواجهة الأمامية؛ وأي نموذج يجيب عليه هو خيار إعداد، وإبقاء هذا الخيار خارج الأوزان هو ما يتيح لك تغييره دون إعادة تدريب أي شيء.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

ما الذي سيحسم الأمر؟

ثلاثة أمور ستنقل Realtime-Venus من ورقة بحثية مرفقة بأوزان إلى نموذج يمكن لأي شخص تقييمه. فريق مستقل يعيد إنتاج أرقام الاستمرارية الخاصة بـ Full-Duplex-Bench، لأن نسبة 97% في الإشارات الخلفية رقم استثنائي، والأرقام الاستثنائية تحتاج إلى قارئ ثانٍ. ورقم كمون منشور، لأن الأنظمة كاملة الازدواجية تعيش أو تموت على زمن الوصول إلى أول صوت، ولم يعلن هذا النظام هدفًا بعد. وتوثيق لأداة الاختبار، لأن تصميم التفويض غير المتزامن هو الجزء الوحيد الجديد حقًا في هذا الإصدار، وهو الآن الجزء الذي يمكنك القراءة عنه لكن يصعب تبنّيه.

حتى ذلك الحين، يكون الوصف الدقيق ضيّقًا وغير مثير، وهذا تحديدًا سبب كونه يستحق التدوين: إصدار حقيقي وفق Apache-2.0 لنقطتَي تحقق 9B كاملتَي الازدواجية، مبنيّ على عمود فقري مفتوح، مع مقاييس أداء قوية مُبلَّغ عنها ذاتيًا، ولا تحقق مستقل، ولا API، ولا إعلان. وكل ما فوق هذا الخط استنتاج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا