
Realtime-Venus مقابل SeedRealtime: طريقتان متعارضتان لعدم التوفر
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus وSeedRealtime هما نصفا القصة نفسها في 2026، ويفشلان في اختبارين متعاكسين. SeedRealtime هو نموذج ByteDance الكامل ثنائي الاتجاه سمعيًا وبصريًا بشكل أصلي، شُغِّل داخل تطبيق Doubao في 5 أغسطس 2026 مجانًا، ووصل إلى جمهور يصفه صانعه بأنه بالمئات الملايين — بلا API، ولا معرّف نموذج، ولا سعر، ولا هدف لزمن الاستجابة. Realtime-Venus هو زوج من نقاط التحقق بحجم 9B من فريق Venus التابع لمجموعة Ant وجامعة Tsinghua، نُشر في 12 سبتمبر 2026 تحت Apache-2.0 مع تقرير تقني وبلا أي إعلان، ويقبع في مستودع يستطيع أي مهندس تنزيله ولا يكاد أي منهم يستطيع نشره واقعيًا. أحدهما لا يمكنك استدعاؤه. والآخر يمكنك تنزيله ثم تكتشف أنه ليس لديك ما تستدعيه عليه. كلاهما في الحقيقة على حدود القدرة نفسها، ولا يملك أي منهما معيارًا أعاد أحد من خارج مؤلفيه إنتاجه.
نوعان من «لا يمكنك الحصول عليه»
يجدر بنا أن نكون دقيقين، لأن عبارة "not available" تخفي فرقاً حقيقياً.
SeedRealtime غير متاح بالطريقة التي يكون بها منتج استهلاكي غير متاح: فهو موجود، ويعمل، وله مستخدمون، والباب ببساطة مغلق أمام المطورين. لا توجد واجهة برمجة تطبيقات (API)، ولا قائمة أسعار، ولا بوابة توثيق، ولا جدول زمني معلن لواحدة. لقد كان طريق ByteDance إلى السوق هو التطبيق، وكان التطبيق كافيًا. ما تحصل عليه بصفتك مطورًا هو عرض تجريبي يمكنك تجربته ولا يمكنك دمجه.
Realtime-Venus غير متاح بالطريقة التي يكون فيها المنتج البحثي غير متاح: الأوزان عامة، والترخيص متساهل، والشيفرة موجودة، ولا أحد يقوم بتشغيله. المستودع غير منشور من قبل أي مزود استدلال، والتنزيلات لا يتم تتبعها على الإطلاق، لذا لا توجد إشارة عامة للتبني في أي من الاتجاهين. إنه متاح بالمعنى الذي يهم الباحث وغير متاح بالمعنى الذي يهم مدير المنتج.
ومجتمعةً، فإنها تؤطّر السؤال الذي لا يزال هذا التصنيف بأكمله عالقًا عنده حاليًا: النماذج التي تعمل موجودة خلف تطبيقات المستهلك، والنماذج التي يمكنك تشغيلها ليست قيد الإنتاج في أي مكان.
كلاهما في المستوى الذي يميّز عام 2026 فعليًا
من المفيد قراءة مجال الوقت الحقيقي على ثلاثة مستويات. المستوى الأول هو صوت نصف ثنائي الاتجاه مع رؤية مُضافة إليه — مساعدون قائمون على الأدوار يمكنهم الرؤية لكنهم ما زالوا يتناوبون. المستوى الثاني هو صوت كامل ثنائي الاتجاه، يستمع ويتحدث في الوقت نفسه دون كاميرا: Seeduplex من ByteDance، وGPT-Live من OpenAI، وGrok Voice Think Fast 2.0 من xAI. المستوى الثالث هو ثنائي الاتجاه الكامل سمعيًا وبصريًا، حيث يمتد الإدراك والتعبير عبر الفيديو والصوت باستمرار.
SeedRealtime هو أول نموذج في المستوى الثالث يصل إلى النشر التجاري واسع النطاق. Realtime-Venus هو مشارك مفتوح الأوزان في المستوى نفسه — فيديو عبر مشفر SigLIP2، وصوت عبر Whisper-Medium، وعمود فقري Qwen3-8B، وحلقة تفاعل مدتها ثانية واحدة لا تتوقف عن الإدراك. تشير بطاقة النموذج الخاصة به إلى أنه مشتق من MiniCPM-o 4.5، نموذج OpenBMB متعدد الوسائط الذي صدر في وقت سابق من عام 2026، مما يضع مساهمة Ant Group في التدريب اللاحق ووقت التشغيل بدلاً من البنية الأساسية.
ما يشتركان فيه، وما يضعهما في مرتبة أعلى من الأنظمة الصوتية فقط، هو أن أياً منهما لا يتوقف للنظر. الإدراك البصري المستمر أثناء التحدث قدرة مختلفة حقاً عن وصف إطار واحد، وقد صُمم كلا النموذجين حولها.
ما قيمة أرقام كل واحد منها

لا يمتلك أيٌّ من النموذجين معيارًا مرجعيًّا من طرف ثالث. غير أن الأدلة ليست متكافئة، والفرق مهم.
• لا تنشر SeedRealtime أي معيار تقييم على الإطلاق. ما تقدّمه ByteDance هو ادعاء بأن مشكلات إيقاع الحوار — مقاطعة المستخدم، والتأخر في الرد، والتحفيز بفعل ضوضاء شخص غريب — تنخفض بنحو النصف مقارنةً بنظام تتابعي، استنادًا إلى تقييمات بشرية من الطرف إلى الطرف. أما البيانات الأساسية فغير منشورة.
• أرقام الطراز السابق على المنوال نفسه. وفق ما ورد، فإن Seeduplex، النموذج الصوتي فقط الذي أطلقته ByteDance داخل Doubao في أبريل 2026، خفّض معدلات الاستجابة الخاطئة والمقاطعة الخاطئة إلى النصف، وقلّص زمن الكمون عند نقطة النهاية بنحو 250 مللي ثانية، وقلّل الاستجابات المبكرة بنسبة 40%، ورفع رضا المكالمات بمقدار 8.34 نقطة في اختبار A/B واسع النطاق. وكل ذلك وفق ما أعلنته الجهة الموردة.
• تنشر Realtime-Venus جدولاً. ويزعم تقريرها تحقيق أفضل الدرجات في ستة من أصل ثمانية معايير قياس للفيديو، بما في ذلك StreamingBench 70.2، وOVO-Bench 64.7، وDaily-Omni 81.3، كما تتصدر في MMAU 78.0، وMMAU-Pro 63.2، وLlama Questions 83.8، وSpeech CMMLU 67.8 بالنسبة إلى نقطة التحقق الصوتية.
• كلاهما لم يُعَد إنتاجه. فالجدول المنشور الذي لم يتحقق منه أحد، واختبار A/B غير المنشور الذي لا يستطيع أحد التحقق منه، هما نوعان مختلفان من الأدلة غير المتحقق منها. ولا أيٌّ منهما دليل يمكنك أن تبني عليه قرارًا شرائيًا.
المقارنة الوحيدة الجديرة بالعقد داخل أرقام Realtime-Venus هي مقابلتها بنموذجها الأساسي. يُبلّغ MiniCPM-o 4.5 عن 80.2 على Daily-Omni؛ ويُبلّغ Realtime-Venus-Omni عن 81.3. تحسّن بنقطة واحدة على النموذج الذي جرى تكييفه منه، على معيار كان ذلك النموذج يتعامل معه بالفعل، هو نتيجة معقولة لجهد في التدريب اللاحق والتشغيل — وادعاء أصغر بكثير مما تبدو عليه عبارة "الأفضل في ستة من أصل ثمانية" إذا قُرئت بمفردها.

مشكلة تناوب الأدوار، وهي حيث يكمن الازدواج الكامل.
الازدواج الكامل ليس ميزةً تتعلق بزمن الاستجابة. بل هو مجموعة من السلوكيات: معرفة متى تعني الوقفة "أنا أفكر" بدلًا من "لقد انتهيت"، والتمييز بين حديث شخص يقف إلى الجوار والشخص الذي يتحدث إليك، والبقاء صامتًا خلال القناة الخلفية بدلًا من اعتبار "مم-هم" مقاطعة.
يتمثل نهج SeedRealtime في نمذجة حالة المحادثة بشكل أصيل والاستغناء التام عن كاشف النشاط الصوتي الخارجي، بحيث يصبح تناوب الأدوار سلوكاً متعلَّماً داخل الشبكة بدلاً من عتبة تُطبَّق على تدفق صوتي. وهذا هو الالتزام المعماري نفسه الذي يتبناه Realtime-Venus، وكلاهما يقف في مواجهة أنظمة التعاقب التي تحتاج إلى مكوّن منفصل ليقرر من يتحدث.
موضع اختلاف الأدلة هو أن ادعاء SeedRealtime يتعلق بالنشر على نطاق واسع — مئات الملايين من المستخدمين، غرف حقيقية، وضوضاء حقيقية — بينما ادعاء Realtime-Venus يتعلق بمعيار قياس. نتائج Full-Duplex-Bench v1.5 الخاصة بـ Realtime-Venus-Audio — استجابة بنسبة 75% للمقاطعات، واستمرار بنسبة 97% في ظل الإشارات الخلفية، و88% في ظل الكلام الموجّه إلى الآخرين، و86% في ظل الكلام الخلفي، متجاوزةً Gemini 3.1 Live وGPT-4o في الاستمرار — هي الأرقام الأكثر صلةً مباشرةً التي نشرها أي من النموذجين لهذه المشكلة. وهي أيضًا مُبلَّغ عنها ذاتيًا بالكامل، واستمرار بنسبة 97% في ظل الإشارات الخلفية رقم لافت يستحق قارئًا ثانيًا قبل أن يقتبسه أحد كحقيقة.
حيث يترك كل واحد بنّاءً
الفجوة العملية ليست في الجودة، بل في شكل العرض.
• SeedRealtime — يمكنك تجربته في Doubao مجانًا، ولا يمكنك دمجه أبدًا. لا يوجد مسار من «هذا مثير للإعجاب» إلى «هذا داخل منتجي».
• Realtime-Venus — يمكنك تنزيله، وضبطه الدقيق، وتشغيله في بيئة معزولة، وفحص كل طبقة. الثمن هو نقطتا تحقق 9B بصيغة BF16 بما يقارب ثمانية عشر غيغابايت من الأوزان لكل واحدة، إضافة إلى حلقة بث متواصلة لكل ثانية، ما يعني عقدة GPU تُحتسب تكلفتها سواء اتصل بها أحد أم لا.
• لا يتوفر لأيّ منهما خيار مُستضاف. ولا يمكن تجربة أيّ منهما باستخدام مفتاح وفترة بعد الظهر.
تلك النقطة الأخيرة هي السبب في أن هذين النموذجين أكثر فائدة كزوج منهما كخصمين. وهما معًا يبرهنان على أن نصفي المشكلة قد حُلا — القدرة تعمل، والأوزان قابلة للإصدار — بينما يُظهران أنه لم يجمعهما أحد بعد في شيء يستطيع المطور استدعاءه فعليًا.
هناك حل التفافي يلجأ إليه كثير من الفرق، ويجدر أن نوضح ما يغطيه وما لا يغطيه. إذا تعذّر الحصول على طبقة الصوت، فلا يزال بإمكانك بناء الجزء الذي يفكّر. يفوّض Realtime-Venus عمله المكلف — الاسترجاع، والاستدلال الصعب، واستدعاءات API للأعمال — إلى إطار خلفي عبر علامات تفويض غير متزامنة، وذلك المسار المفوَّض هو استدلال نصي عادي. OrcaRouter لا يحمل Realtime-Venus ولا SeedRealtime؛ فكلا طبقتي الاتصال ثنائي الاتجاه خارج ما نقدّمه، ولا نستضيف أياً منهما.قرابة 200 نموذج نصي خلف مفتاح واحد بسعر قائمة المزوّد ودون أي هامش إضافي هو النصف الذي نغطيه فعلاً من البنية، مع تحويل تلقائي عند الفشل حتى لا تفشل مهمة خلفية لأن أحد المزوّدين في المنبع مرّ بفترة سيئة، ولغة توجيه (DSL) لتأليف عدة نماذج في استدعاء واحد، ودمج النماذج حيث لا يكفي حكم نموذج واحد. إنه ليس الجزء الصعب في هذه الأنظمة. إنه الجزء القابل للشراء فعلاً.

ما الذي قد يغيّر هذه المقارنة؟
ثلاثة تطورات من شأنها أن تحسم الأمر، ولم يحدث أي منها بعد. معيار تقييم مستقل لـ Realtime-Venus، لأن جدولًا بلا قارئ ثانٍ ادعاء وليس نتيجة. واجهة برمجة تطبيقات (API) لـ SeedRealtime، لأن النموذج الذي يملك أقوى أدلة على النشر هو حاليًا النموذج الذي لا يستطيع أحد استخدامه. ورقم كمون منشور من أي منهما — فزمن الوصول إلى الصوت الأول هو المقياس الذي تُشترى على أساسه هذه الفئة، وحتى كتابة هذه السطور لم يذكر أي من النموذجين رقمًا واحدًا.
حتى ذلك الحين، فإن الخلاصة الصادقة هي أن SeedRealtime هو الدليل على أن الاتصال السمعي البصري كامل الازدواجية يعمل على نطاق المستهلك، وأن Realtime-Venus هو الدليل على أنه يمكن فتح الأوزان، ولا أي من هاتين الحقيقتين يقرّب أي مطوّر أكثر من إطلاق منتج. هذا ليس انتقادًا لأي من المختبرين. إنه وصف لفئة حلّت مشكلة البحث ولم تحلّ بعد مشكلة التوزيع.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
