بطاقة العنوان الرئيسية لعرض «Realtime-Venus vs Qwen-Audio-3.0-TTS»، بعنوان فرعي «المولّد والمستمع ليسا الصفقة نفسها»، مع ثلاث بطاقات نصّها «Qwen-Audio-3.0-TTS-Plus: إيلو 1,259، في المرتبة الثانية في Artificial Analysis Provider Voice Arena»، و«Realtime-Venus: لا يوجد أي تقييم لجودة الصوت على الإطلاق»، و«المُدخل هو الفرق كله: نصّ فقط، مقابل الصوت والفيديو والنصّ»، فوق شريط تذييل نصّه «أرقام Qwen وفق Artificial Analysis؛ أرقام Realtime-Venus من تقريره التقني، دون إعادة إنتاج.» وشعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

Realtime-Venus مقابل Qwen-Audio-3.0-TTS: أحدهما يقرأ النص الخاص بك، والآخر يجب أن يسمعك

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

المقارنة المُغرية بين Realtime-Venus وQwen-Audio-3.0-TTS هي السعر لكل ساعة صوت، وهي تُنتج إجابة واضحة خاطئة تمامًا. يُنتج Qwen-Audio-3.0-TTS-Plus الكلام بحوالي 27.6 دولار لكل مليون حرف، وهو ما يعادل نحو 1.66 دولار لساعة من الصوت الجاهز. أما Realtime-Venus، النظام كامل الازدواجية بقوة 9B الذي بناه فريق Venus التابع لـ Ant Group بالتعاون مع جامعة تسينغهوا، فلا سعر له على الإطلاق لأنه لا يملك خدمة مستضافة — لكن استضافته ذاتيًا ستكلفك عقدة GPU تعمل باستمرار، وهو ما يزيد بمقدار مرتبة قدرية واحدة على الأقل في الساعة. يفوز محرّك الإنتاج في الحساب. لكن الحساب يقيس منتجين مختلفين: Qwen-Audio-3.0-TTS يأخذ النص ويُعيد الصوت، وRealtime-Venus يأخذ الصوت والفيديو ويُعيد محادثة. السؤال الذي يفصلهما فعليًا ليس ما يُخرجانه. بل ما إذا كان يتعيّن على أي شيء أن يردّ.

المُدخل هو الفرق كله

Qwen-Audio-3.0-TTS، الذي أطلقته Tongyi Lab التابعة لـ Alibaba Cloud في 20 يوليو 2026، هو نموذج تحويل النص إلى كلام يُتاح كواجهة برمجة تطبيقات مُستضافة بدون أوزان مفتوحة. يدخل النص عبر نقطة نهاية HTTP ويخرج الصوت. لا يوجد مسار إدخال صوتي، ولا دور لأخذه، ولا نص مكتوب لإرجاعه، ولا مفهوم للمقاطعة — فالنموذج لم يسمع شيئًا قط. نموذج تكلفته بالكامل أشبه بمطبعة: حروف تدخل، وصوت يخرج.

في المقابل، يظل Realtime-Venus يستمع باستمرار. تحمل نقطة التفتيش السمعية البصرية مُشفِّرًا بصريًا SigLIP2 للإطارات المتدفقة، ومُشفِّرًا صوتيًا Whisper-Medium يغذّي عمودًا فقريًا Qwen3-8B، وتُشغِّل كلتا نقطتي التفتيش حلقة تفاعل مدتها ثانية واحدة تُحدِّث باستمرار حالة المحادثة وتقرر ما إذا كانت ستتحدث أو تبقى صامتة. وتنتج الكلام عبر رموز S3 المنفصلة ومُفكِّك ترميز مطابقة التدفق بدلًا من مرحلة تركيب منفصلة، ويمكنها إرجاع النص إلى جانب الشكل الموجي.

هذا ليس فرقًا في الميزات. إنه الفرق بين مكوّن ونظام. ضع الاثنين جنبًا إلى جنب، فيمكن إدخال أحدهما في مسار معالجة يضم بالفعل متعرّفًا على الكلام ونموذجًا لغويًا في مقدمته. أما الآخر فيستبدل الثلاثة جميعًا.

حالة عملية تجعله ملموسًا

تخيّل خط دعم. يتصل عميل، ويصف مشكلة بشكل سيئ، ويتوقف في منتصف الجملة ليبحث عن رقم حساب، ويقاطعه إعلان في الخلفية، ثم يطرح سؤالًا متابعًا قبل أن ينتهي موظف الدعم من الإجابة.

نظام مبني على Qwen-Audio-3.0-TTS يتعامل مع هذا كثلاثة موردين وثلاث فواتير: يحوّل المُعرّف كلام المتصل إلى نص، ويقرر نموذج لغوي ما يجب قوله، ثم ينطقه Qwen-Audio-3.0-TTS. كل قفزة تضيف زمن استجابة، وكل حدّ هو حيث يموت التنغيم. الفشل الحرج بنيوي — لا يستطيع جزء تحويل النص إلى كلام سماع الوقفة في منتصف جملة ينطقها بالفعل، لذا يجب أن يتولى شيء أمامه التعامل مع المقاطعة.

يتعامل Realtime-Venus مع المكالمة نفسها كنموذج واحد، دون كاشف نشاط صوتي خارجي، ودون تسليم. أرقامه في Full-Duplex-Bench v1.5 — استجابة بنسبة 75% للمقاطعات، ومعدلات استمرار تبلغ 97% في ظل الإشارات الخلفية، و88% في ظل الكلام الموجه للآخرين، و86% في ظل الكلام الخلفي — هي بالضبط المقاييس التي تصف هذا السيناريو. وهي أيضًا مُبلَّغ عنها ذاتيًا، من التقرير الفني للنموذج نفسه، دون إعادة إنتاج خارجية. اقرأها كادعاء تصميمي، لا كقياس.

جودة الصوت: أحدهما لديه Elo، والآخر لا يملك شيئًا

هذا هو الجزء الأكثر اختلالاً في المقارنة، وهو يصب في مصلحة علي بابا بفارق كبير.

• تقييم مستقل — يحتل Qwen-Audio-3.0-TTS-Plus المركز الثاني في Provider Voice Arena التابعة لـ Artificial Analysis بمعدل Elo يبلغ 1,259 على 1,544 عينة حتى 18 سبتمبر 2026، خلف Cartesia Sonic 3.6 عند 1,277 وأمام Inworld Realtime TTS-2 عند 1,247 وSpeechify Simba 3.2 عند 1,241.

• من أين بدأ الأمر — يُدرِج عمود الإصدار الخاص بالساحة هذا الطراز كمدخل في سبتمبر 2026، وهو التصنيف وفق التقييم الحالي وليس تاريخ الإطلاق في 20 يوليو 2026. وكلما تحرّك، ظل محافظًا على المركزين الأولين طوال الوقت.

• Realtime-Venus — لا مشاركة في الحلبة، ولا تقييم صوتي من طرف ثالث، لا شيء على الإطلاق. ورقمه الوحيد المتعلق بالصوت هو نتيجة VoiceBench AlpacaEval المُبلَّغ عنها ذاتيًا والبالغة 4.81، والتي يصفها التقرير بأنها تطابق أفضل رقم في المقارنة.

• ما يعنيه ذلك — لم يحكم أحد من خارج المؤلفين ما إذا كان Realtime-Venus يبدو جيدًا صوتيًا. هذا ليس نقطة ضده؛ فهو ببساطة مجهول، والمجهول يختلف عن السيئ. ولكن إذا كانت جودة الصوت هي المُخرَج المطلوب، فإن شراء نموذج مُصنَّف بـ Elo يتفوق على الأخذ بنموذج غير مُصنَّف على الثقة العمياء.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

اللغة، والأصوات، والتحكم التعبيري

نموذج Alibaba مصمم لاتساع نطاق الإلقاء. يوفر أكثر من ألف صوت، ويغطي ست عشرة لغة، من بينها عشرون منطقة لهجات صينية، ويتيح 86 وسمًا مضمّنًا للعاطفة والإلقاء — واجهة تحكم تكتبها في النص نفسه، إضافة إلى تعليمات الإلقاء باللغة الطبيعية. يمتد الإخراج حتى 48 كيلوهرتز، ارتفاعًا من 24 كيلوهرتز في الجيل السابق، ويمكن أن تمتد عملية توليد واحدة إلى ثلاث دقائق. تستهدف فئة Flash نحو 300 مللي ثانية للوصول إلى الحزمة الأولى للتشغيل في الوقت الفعلي؛ أما فئة Plus فهي فئة الجودة، وتولّد بمعدل نحو ستة عشر حرفًا في الثانية، وهو بطيء بما يكفي ليؤثر في منتج مباشر، وغير ملحوظ في التوليد الدفعي.

يوفّر Realtime-Venus توثيقًا باللغتين الإنجليزية والصينية، ويشحن صوتًا مرجعيًا واحدًا مع الأوزان، ويمنحك مفكّكًا من الرمز إلى الموجة الصوتية بدلًا من مكتبة أصوات. التعبيرية بمعنى Qwen — وسوم، وتعليمات، وألف إعداد مسبق — ليس لها نظير هنا. ما يمتلكه بدلًا من ذلك هو القدرة على تغيير أدائه استجابةً لما يسمعه، وهو نوع مختلف من التحكم التعبيري وأصعب بكثير في وضعه على ورقة مواصفات.

تكلفة كل مسار، بصراحة

هناك تحذير حقيقي بشأن رقم Alibaba قبل أن يضع أي شخص ميزانية بناءً عليه. فالرقم الشائع ذكره، 27.6 دولارًا لكل مليون حرف، لا يطابق صفحة أسعار Alibaba الخاصة في كل لقطة، كما أن الشرائح مسعّرة بشكل منفصل. تحقق من الرقم على مستوى الحساب بدلًا من الوثوق بجدول مقارنة، بما في ذلك هذا الجدول.

لا يوجد سعر مدرج لـ Realtime-Venus لأنه لا يوجد شيء يمكن شراؤه. التكلفة هي نقطتا تحقق بحجم 9B بصيغة BF16 — نحو ثمانية عشر جيجابايت من الأوزان لكل منهما قبل ذاكرة التنشيط — إضافة إلى حلقة بث متواصلة، ما يعني عقدة GPU تُحاسب شهريًا سواء اتصل بها أحد أم لا. عند حجم استخدام ثابت، يكون ذلك أرخص لكل محادثة من واجهة برمجة تطبيقات صوتية تُحاسب حسب الاستهلاك. وعند حجم الاستخدام المتقطع، يكون أسوأ بكثير، ونقطة التعادل هي السؤال المالي الوحيد المهم.

هناك مسار ثالث ستهبط عليه فرق كثيرة، ويستحقّ التسمية لأنه يغيّر شكل القرار. إذا أبقيت على سلسلة متتالية، فإن الجزء الوحيد الذي يحتاج إلى أن يكون نموذجًا مستضافًا هو الجزء الأوسط — أي الاستدلال. لا يوفّر OrcaRouter Qwen-Audio-3.0-TTS ولا Realtime-Venus؛ فطبقتي الصوت كلتاهما خارج ما نقدّمه، ونفضّل قول ذلك على الإيحاء بخلافه. وجزء الاستدلال هو ما نغطّيه فعلًا: ما يقرب من 200 نموذج نصي خلف مفتاح واحد بسعر قائمة المزوّد مع هامش ربح صفري، وتحويل تلقائي عند الفشل عبر المزوّدين upstreams بحيث لا تؤدي فترة سيئة عند أحد المزوّدين إلى إسقاط مكالمة جارية، لغة توجيه DSL تجمع عدة نماذج في مكالمة واحدة، ودمج النماذج عندما يستحق قرار أكثر من رأي واحد. في سلسلة متتالية، هذا هو الجزء الذي ترغب أكثر من غيره في أن تكون قادرًا على استبداله دون التفاوض على عقد، والجزء الذي يصل فيه تخفيض سعر المورّد في اليوم نفسه بدلًا من موعد التجديد.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

الاستنساخ ذو حدين

Qwen-Audio-3.0-TTS قادر على استنساخ صوت من عيّنة مرجعية قصيرة، وعبر اللغات، وهو موثّق بوصفه متينًا أمام المدخلات الصاخبة أو الرنّانة. وتلك هي القدرة الأكثر فائدة تجاريًا في المقارنة، وأكبر مساحة امتثال. فالمنتج القادر على إعادة إنتاج صوت أي متحدث من عشر ثوانٍ من الصوت لديه إجابة أطول بكثير عن "صوت مَن هذا، ومَن وافق عليه" من منتج لا يتحدث إلا ضمن الإعدادات المسبقة لمورّد ما.

تأتي Realtime-Venus مزوّدة بصوت مرجعي إلى جانب الأوزان. يمكنك الاستنساخ به إذا كانت لديك المادة الصوتية وعملية التدريب، لكن لا شيء في هذا الإصدار مُهيَّأ لجعل ذلك سهلًا — وهو، بالنسبة لنشر مستضاف ذاتيًا داخل حدود الامتثال، يُعدّ على الأرجح الخيار الافتراضي الأكثر أمانًا.

أي واحد تشتريه فعليًا؟

اشترِ Qwen-Audio-3.0-TTS عندما يكون الصوت هو المخرَج. السرد، التوطين، إمكانية الوصول، الدبلجة، أي سير عمل يوجد فيه النص قبل أن يوجد الصوت وتكون الجودة لكل ساعة مُصيَّرة هي المقياس. ابدأ بـ Flash إذا كان التشغيل مباشرًا، وانتقل إلى Plus عندما يكون الصوت نفسه هو المنتج، وسعّر سير عمل الاستنساخ بشكل منفصل عن مكتبة الإعدادات المسبقة.

استخدم Realtime-Venus عندما يكون المُدخَل شخصًا ويجب أن يتصرف النظام كمستمع. مساعدة تدرك الكاميرا، وتفاعل دون استخدام اليدين، وأي شيء حيث سيقاطع إنسان في منتصف الجملة ويتوقع أن يتعامل النظام مع ذلك. المقايضة صارخة: تتخلى عن صوت مُقيَّم بـ Elo، وألف إعداد مسبق، وأي خيار مستضاف، وفي المقابل تحصل على الوحيد من بين الاثنين القادر على سماعك.

معظم المنتجات تريد كليهما، في مواضع مختلفة. ما ينبغي ألا تشترك فيه هو نموذج التكلفة — فسعر الساعة من الصوت هو المقياس المناسب لواحد فقط من هذين النموذجين، وهو ليس النموذج الذي يدير المحادثة.