بطاقة عنوان رئيسية لـ «Realtime-Venus مقابل Sesame Preview»، بعنوان فرعي «مختبران، الفخ نفسه، اتجاهان متعاكسان»، مع ثلاث بطاقات مكتوب عليها «Sesame Preview: تطبيق مجاني، أربعة وكلاء، لا يوجد API منذ مايو 2026»، و«Realtime-Venus: أوزان Apache-2.0، لا يوجد منتج، ولا إعلان»، و«لا ينشر أي منهما درجة صوتية تم التحقق منها بشكل مستقل»، فوق شريط تذييل مكتوب عليه «قدرات Sesame وفقًا لوثائق المعاينة المحمولة الخاصة به؛ أرقام Realtime-Venus من تقريره الفني، غير معاد إنتاجها.» شعار OrcaRouter مُدمج في الزاوية السفلى اليمنى.
Guides & Insights

ريال تايم-فينوس مقابل سيزامي بريفيو: ما يمكنك الحصول عليه ليس هو ما هو جيد

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

‏Realtime-Venus وSesame Preview طوّرتهما مختبرات تحمل أفكارًا مختلفة تمامًا عن الغرض من نموذج صوتي، وقد وقع كلٌّ منهما في الفخ نفسه قادمًا من الاتجاه المعاكس. فـSesame Preview تطبيق استهلاكي مجاني — على iOS منذ مايو 2026، وعلى Android منذ أوائل أغسطس — يضم أربعة وكلاء محادثة، وبحثًا مباشرًا على الويب أثناء المكالمات، وصوتًا وصفه المراجعون بأنه الأفضل في فئته. أما الأوزان المفتوحة التي نشرتها Sesame فهي نموذج مختلف وأصغر لا تقدّمه الشركة نفسها بوصفه الصوت الذي سمعته في العرض التجريبي. وسلك Realtime-Venus، وهو نظام ثنائي الاتجاه كامل بحجم 9B من فريق Venus التابع لمجموعة Ant Group وجامعة Tsinghua، المسار المعاكس: فالمخرجات القابلة للتنزيل هي النموذج الحقيقي نفسه، ولا يوجد أي منتج على الإطلاق. وفي كلتا الحالتين، فإن الفجوة بين ما هو متاح وما هو مبهر هي أكثر ما يفيد فهمه قبل أن تخطط لأي شيء بناءً على أيٍّ منهما.

ما هو كل واحد منها في الحقيقة

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview هو منتج. Sesame مختبر في سان فرانسيسكو أسسه في 2023 Brendan Iribe وAnkit Kumar وRyan Brown، بدعم من a16z وSequoia وSpark وMatrix، ويضم مساعده الصوتي الموجّه للمستهلكين أربع شخصيات — Maya وMiles وSimone وCharlie — لكل منها مزاج وصوت مميزان. يستطيع الوكيل البحث في الويب أثناء المحادثة، وتدوين الملاحظات والتذكيرات، وإرسال ملخص بعد المكالمة. الذاكرة خاصة بكل وكيل وتتزامن عبر الويب والجوال عند تسجيل الدخول، مع وضع التخفي الذي يقرأ الذكريات السابقة دون كتابة ذكريات جديدة. إنه مجاني، ولا يعرض إعلانات، وتقول الشركة إنها لا تبيع البيانات.

إنّ Realtime-Venus إصدار بحثي. وهناك نقطتا تفتيش بحجم 9B بموجب ترخيص Apache-2.0 على Hugging Face — Realtime-Venus-Omni للتفاعل السمعي البصري وRealtime-Venus-Audio للتفاعل المنطوق — إضافة إلى تقرير تقني مُقدَّم إلى arXiv في 12 سبتمبر 2026، وصفحة مشروع، ومستودع مصاحب يضم مكوّن Realtime-Venus-Harness. لا يوجد تطبيق، ولا واجهة برمجية API، ولا سعر، ولا إعلان من المورّد. المستودع غير منشور من قبل أي مزوّد استدلال، ولا يتم تتبّع عمليات التنزيل.

الفخ، في كلا الاتجاهين

نسخة Sesame هي الشكل الكلاسيكي للتظاهر بالانفتاح، وSesame أكثر صدقًا بشأن ذلك من معظم المختبرات. إن نقطة التفتيش CSM التي أصدرها المختبر بموجب Apache-2.0 هي نموذج أساسي لتوليد الكلام — عمود فقري من Llama يغذّي مفكّك ترميز Mimi-codec — وتوضّح الوثائق صراحةً أنه ليس صوت التطبيق وليس نظام كلام إلى كلام من طرف إلى طرف. فهو لا يستطيع توليد نص، وقد دُرّب على بيانات إنجليزية في المقام الأول بقدرة محدودة خارج ذلك. وما يشغّل Sesame Preview هو نموذج إنتاجي أكبر لم يُصدر. لذا إن كنت قد بحثت عن الصوت من العرض التجريبي، فقد وجدت سلالته البحثية وليس الشيء نفسه. وعندما يجيب أحد الوكلاء الأربعة على مكالمتك، فأنت تسمع شيئًا لا يمكنك تنزيله.

نسخة Realtime-Venus هي الصورة المرآة، ويمكن القول إنها الأغرب. كل ما نُشر حقيقي: أوزان حقيقية، وشيفرة حقيقية، وتقرير حقيقي، ورخصة متساهلة. ما ينقص هو أي طريقة لاستخدامها لا تتضمن امتلاك GPU. نقطتا تفتيش بحجم 9B بصيغة BF16 تبلغ كل واحدة منهما نحو ثمانية عشر غيغابايت من الأوزان قبل ذاكرة التنشيط، وكلتاهما مصممتان لتشغيل حلقة بث متواصلة بمعدل ثانية واحدة مع إدخال صوتي ومرئي مباشر. هذا نشر من فئة الخوادم. تطبيق استهلاكي يوفّر القدرة نفسها على هاتف يفعل شيئًا لا يحاول هذا الإصدار القيام به، والفجوة بين نموذج قابل للتنزيل ونموذج قابل للتشغيل هي بالضبط حيث سيتعثر معظم من يريدونه.

القابلية للقياس هي الفرق الأكثر حِدّة

لا يمتلك أيّ من النموذجين درجة مستقلة لجودة الصوت، لكن الأسباب تختلف.

• Sesame Preview — لا مدخل إلى الساحة، ولا تقييم منشور للصوت الإنتاجي. تستند سمعته إلى المراجعين وإلى تأثير العرض التجريبي الأصلي على المستمعين، وهو دليل حقيقي من نوع ما وغير مُكمَّم تمامًا.

• CSM-1B — نقطة التحقق المفتوحة هي نموذج توليد أساسي؛ ولا تتم مقارنته بمعايير الأنظمة الحوارية لأنه ليس منها.

• Realtime-Venus — رقم صوتي واحد مُبلَّغ عنه ذاتيًا، درجة VoiceBench AlpacaEval البالغة 4.81 التي يصفها تقريره بأنها تضاهي أفضل رقم مقارن. لم يقيّمه أي طرف ثالث.

• ما لا يمنحك إياه أيٌّ منهما — رقم ينتجه شخص لا مصلحة له في النتيجة. إذا كانت جودة الصوت هي معيار الشراء لديك، فإن المقارنة بأكملها غير قابلة للتقييم، والتصرف الصادق هو أن تستمع إلى كليهما وتقرر بنفسك بدلًا من الاعتماد على جدول.

تناوب الأدوار، حيث لدى كليهما ما يثبتانه

بُنيت سمعة Sesame على هذا تحديدًا. كان العرض التوضيحي الذي جعل المختبر مشهورًا صوتًا يحمل نَفَسًا وترددًا وتوقيتًا للمقاطعة، مقنعًا بما يكفي ليظن المستمعون أن شخصًا ما على الخط. هذا ادّعاء عن ديناميكية المحادثة، وهو الأمر الذي يُسوَّق المنتج على أساسه.

تقدم Realtime-Venus الادعاء نفسه مصحوبًا بأرقام. على Full-Duplex-Bench v1.5، تشير نقطة التفتيش الصوتية الخاصة به إلى أنه يستجيب لـ75% من مقاطعات المستخدم، مع معدلات استمرار تبلغ 97% في حالات الإيماءات اللفظية، و88% في الكلام الموجّه إلى الآخرين، و86% في الكلام الخلفي — ويُقال إنه يتجاوز Gemini 3.1 Live وGPT-4o في جميع مقاييس الاستمرار الثلاثة. هذه الأرقام مستمدة من تقريره الخاص، ولم يُعِد أحد إنتاجها.

إذن، المقارنة هي عرض توضيحي بلا رقم في مقابل رقم بلا عرض توضيحي، وهو موقف محرج حقًا، ووصف منصف للطريقة التي تقدّم بها هذه الفئة بأكملها تقاريرها عن نفسها الآن. والشيء الوحيد الذي يمكن قوله بثقة هو أن أياً من الادعاءين لم يصمد أمام جهة خارجية، وأن استمرارًا بنسبة 97% في ظل القنوات الخلفية مرتفع بما يكفي ليستحق جهة خارجية قبل أن يُقتبس على أنه أمر محسوم.

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

ما يمكنك بناؤه فعليًا

Sesame Preview لا يمنح المطوّر شيئًا. لا يوجد API، ولا معرّف النموذج، ولا قائمة أسعار، ولا خطة معلنة له. تقتصر المكالمات على ثلاثين دقيقة عند تسجيل الدخول، وخمس دقائق بخلاف ذلك، والإنجليزية هي اللغة الوحيدة المدعومة رسميًا، وسيبحث الوكيل ويتذكر لكنه لن ينفذ المهام — فلن يحجز الرحلة. الطبقة المجانية هي المنتج. هذا عرض ممتاز للمستهلك، لكنه طريق مسدود للتكامل.

يمنح Realtime-Venus المطوّر كل شيء باستثناء مكان لتشغيله. الأوزان مرخّصة بترخيص متسامح، والكود يُحمَّل باستدعاءات Transformers القياسية، ويُدخَل إلى البث الكامل ثنائي الاتجاه بمفتاح دالة واحد، والحلقة الموثّقة هي ثانية واحدة من التعبئة المسبقة المتدفقة تتبعها عملية توليد متدفقة، ثم تتكرر. تُفعَّل ذاكرة الفيديو الطويل بمعامل دقائق الذاكرة وتُوصَف بأنها خالية من التدريب، وهو أمر غير معتاد لقدرة تتطلب عادةً الضبط الدقيق. تم توثيق تحذيرين بدلاً من تركهما ليُكتشفا: حدّ أقصى للإطارات يبتر الفيديو الطويل بصمت ما لم يُرفع ثابت قبل استيراد الأداة المساعدة، ومتطلب خط CJK للترجمات الفرعية غير اللاتينية المرسومة في فيديو ثنائي الاتجاه.

ما لا يغيّره أيٌّ من ذلك هو أن أداة التشغيل — المكوّن الذي ينفّذ التفويضات غير المتزامنة التي تشكّل الجزء الأكثر تميّزًا في البنية — توجد في مستودع GitHub منفصل، وهي أقل توثيقًا بكثير من النموذج، وهي الجزء الذي يصعب الحكم على جاهزيته للإنتاج. في أي نشر فعلي، لا يعدو مسار التفويض كونه استدلالًا نصيًا عاديًا يعمل خلف واجهة محادثة أمامية. لا يضم OrcaRouter أيًّا من Realtime-Venus أو Sesame Preview؛ وكلا طبقتي الصوت خارج نطاق ما نقدّمه، ونقول ذلك بصراحة بدلًا من الإيحاء بعلاقة استضافة غير موجودة. ما يقرب من 200 نموذج نصي خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح يمثّل النصف الذي نغطيه من تلك البنية، مع التجاوز التلقائي للفشل بحيث تنجو مهمة مفوّضة من انقطاع في المنبع، ولغة DSL للتوجيه تجمع عدة نماذج في نداء واحد، ودمج النماذج حيث لا يكفي حكم نموذج واحد. إنه الجزء القابل للشراء من تصميم ليس جزؤه المثير معروضًا للبيع.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

التوصية الصادقة

إذا كنت مستهلكًا يريد أفضل صوت حواري متاح اليوم من حيث جودة الصوت ولا تحتاج إلى دمجه، فإن Sesame Preview مجاني، وهو متاح على كلتا منصتي الهواتف المحمولة، وقد استحق سمعته بما يكفي ليواصل المراجعون قول ذلك. استخدمه واستمتع به.

إذا كنت باحثًا أو فريقًا هندسيًا غنيّ الموارد يحتاج إلى حزمة مفتوحة كاملة الازدواجية سمعية-بصرية يمكنك فحصها وضبطها الدقيق، فإن Realtime-Venus هو أحد الخيارات الحقيقية القليلة جدًا، وكون معاييره التقييمية مُبلَّغًا عنها ذاتيًا لا يغيّر من أن الأوزان مفتوحة حقًا وأن المعمارية موثَّقة حقًا.

إذا كنت فريق منتجات يبحث عن طبقة صوتية لتطلقها هذا الربع، فلا أيٌّ من هذين هو إجابتك، والخلاصة المفيدة من هذه المقارنة الثنائية هي السبب. أحد المختبرين بنى شيئًا ممتازًا وأبقى الجزء الجيد مغلقًا؛ والآخر نشر كل شيء وترك لك توفير البنية التحتية. لقد أثبتت هذه الفئة أنها قادرة على صناعة صوت يستحق الاستماع إليه، ولم تقرر بعد ما إذا كان ينبغي أن يكون هذا الصوت قابلًا للشراء بأي شكل غير التطبيق.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا