
Inworld Realtime TTS-2 مقابل Cartesia Sonic 3.6: الصوت الذي يصغي مقابل ملك الساحات
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
هناك نظريتان متنافستان حول سبب جعل الصوت الاصطناعي يبدو بشريًا، وفي الوقت الحالي أفضل مثالين تجاريين لهاتين النظريتين Inworld Realtime TTS-2 و Cartesia Sonic 3.6. نظرية Cartesia هي أن الإنسانية تكمن في الصوت: اجعل الجرس الصوتي والنبرة والإيقاع الزمني مطابقةً تمامًا لصوت شخص حقيقي، وسيمنحك المستمعون المرتبة الأولى — وهذا ما فعله Sonic 3.6 في أغسطس، إذ قفز إلى صدارة ساحة Provider Voice التابعة لـ Artificial Analysis بدرجة Elo 1,282. نظرية Inworld هي أن الإنسانية تكمن في الاستماع: يكيِّف TTS-2 إلقاءه بناءً على الصوت الفعلي للمحادثة التي سبقته، فهو لا يبدو كشخص فحسب، بل يستجيب كشخص. هذا الأسبوع اصطدمت النظريتان على لوحة النتائج: إعادة التقييم ذاتها التي وضعت Inworld Realtime TTS-2 في المرتبة الثانية على لوحة المزودين، بدرجة Elo 1,252، وضعته أيضًا في المرتبة الأولى على ساحة Controlled Voice — اللوحة التي كانت Cartesia تتصدرها — بدرجة 1,123 مقابل 1,119 لـ Sonic 3.6. أحد النموذجين يحمل تاج المزودين، أما الآخر فقد انتزع للتو تاج ساحة التحكم.
هذه ليست مبارزة يكون فيها أحد الطرفين مخطئًا بوضوح. صُمم النموذجان لمهام متداخلة لكنها ليست متطابقة، والفرق في السعر — Sonic 3.6 بسعر 49.0 دولارًا لكل مليون حرف مقابل 25 دولارًا عند الطلب لـ Inworld Realtime TTS-2 — حقيقي بما يكفي ليجعل القرار يتضمن عنصرًا متعلقًا بالميزانية بالإضافة إلى عنصر الجودة.
نظريتان حول صوتٍ يبدو بشريًا
أطلقت Cartesia إصدار Sonic 3.6 بهدوء في أغسطس 2026، وهو إصدار ثانوي حسّن أداء Sonic 3.5 دون تغيير السعر أو الطرح المعماري. ظهر التحسّن في المجال الذي كانت Cartesia بحاجة إليه: فقفز النموذج إلى 1,282 نقطة في تقييم إيلو على حلبة Provider Voice لدى Artificial Analysis، حيث يستخدم كل نموذج أصواته الأصلية، وحافظ على صدارة حلبة Controlled Voice طوال شهر أغسطس. وفي اللوحة المتحكَّم بها، يُستنسخ كل نموذج على نفس المتحدثين المرجعيين الثمانية، لذا فإن ذلك التاج يُعدّ حكمًا على محرك التوليف الصوتي نفسه، بمعزلٍ عن الموهبة الصوتية. وبعد إعادة احتساب Inworld للنتائج بمناسبة إتاحتها العامة هذا الأسبوع، ما تزال Cartesia تتصدر لوحة المزوّد، لكن Sonic 3.6 يحتل الآن المرتبة الثانية على اللوحة المتحكَّم بها برصيد 1,119 إيلو، بفارق أربع نقاط عن Inworld Realtime TTS-2 الذي يبلغ 1,123.
ينحدر Inworld Realtime TTS-2 من تقليد مختلف. أمضى خط سابقه، TTS 1.5، أوائل 2026 في أعلى الساحات نفسها تقريبًا، وقد قاست المعاينة البحثية لـ TTS-2 إيلو 1,209 على لوحة مقدّمي الخدمة في يونيو. وقد ارتقى نموذج GA منذ ذلك الحين: على اللوحات الحالية، يحتل 1,252 على صوت مقدّم الخدمة (#2، خلف Sonic 3.6 بـ 1,282)، و1,123 على الصوت المتحكَّم فيه (#1). لكن ما يميّز النموذج الرائد فعلًا ليس إيلو؛ بل أن النموذج يتلقّى الأدوار السابقة للمحادثة كمدخلٍ صوتي ويتيح لها تشكيل طريقة إلقاء السطر التالي. تضبط Cartesia العاطفة من النص المكتوب. أمّا Inworld فيستمع إلى الطريقة التي قيل بها آخر شيء.
لوحة النتائج، الموسومة بصدق
أرقام Elo مأخوذة من حلبات الكلام في منصة Artificial Analysis، وقُرئت من اللوحات المباشرة في سبتمبر 2026. أرقام زمن الاستجابة مُقدَّمة من البائع ما لم يُنصَّ على خلاف ذلك، ولم يُنشر أي تدقيق مستقل لزمن الاستجابة لأيٍّ من النموذجين.
• جودة مستقلة — Cartesia Sonic 3.6: Elo 1,282 (#1، صوت المزوِّد) و1,119 (#2، الصوت المُتحكَّم به) مقابل Inworld Realtime TTS-2: Elo 1,252 (#2، صوت المزوِّد) و1,123 (#1، الصوت المُتحكَّم به)
• السعر لكل 1 مليون حرف — 49.0 دولارًا (حسب تتبع Artificial Analysis) مقابل 25 دولارًا عند الطلب، و20.8 دولارًا كمتوسط مرجح كما تتبعه Artificial Analysis، وينخفض إلى 12.50 دولارًا عند الحجم الكبير (البائع)
• الوقت حتى أول صوت — أقل من 90 مللي ثانية (وفقًا للبائع) مقابل وسيط أقل من 200 مللي ثانية، وأقل من 100 مللي ثانية عند p99 في اختبارات إطلاق Inworld (وفقًا للبائع)؛ إن بديل Inworld منخفض الكمون لـ Sonic هو الطبقة المنفصلة TTS-2 Flash، التي يبلغ زمن وصول أول بايت فيها حوالي 25 مللي ثانية.
• اللغات — 42 لغة موطَّنة مقابل أكثر من 100 لغة لتوجيه الإلقاء، مع ادعاء Inworld بأن هوية الصوت الواحد تمتد إلى أكثر من 200 منطقة (وفقًا للبائع)
• استنساخ فوري للصوت — حوالي 10 ثوانٍ من الصوت مقابل 5–15 ثانية، بالإضافة إلى نسخة بيتا للاستنساخ الاحترافي تتطلب حوالي 10 دقائق من الصوت للحصول على نسخ أعلى دقة
• التحكم في الإلقاء — وسوم نصية مضمّنة مثل [laughter]، بالإضافة إلى تعديل مستوى الصوت والسرعة مقابل التوجيه باللغة الإنجليزية الواضحة مثل "[calm, reassuring]" أو [whisper]، وتعليمات على مستوى الطلب، وثلاثة أوضاع استقرار من Stable إلى Expressive.

لماذا يُعتبر "الاستماع إلى المحادثة" محورًا مختلفًا؟
لوحة النتائج أعلاه تقيس كيفية ظهور الصوت {{1}}في عزلة{{/1}}. البُعد الذي تتباين فيه النموذجان حقًا {{2}}لا يظهر في أي لوحة تصدُّر{{/2}}، لأنه لا يوجد إلا عبر عدة جولات من الحوار.
تم تصميم Inworld Realtime TTS-2 للحالة التي يقول فيها شخص شيئًا ما للتو. يستوعب النموذج الصوتَ من الأدوار السابقة — وليس مجرد نصّها — ويحلّل النبرة والإيقاع والحالة العاطفية، ويختار حالة الاستجابة قبل أن يتكلم. إذا كان المتصل محبطًا، يتغيّر الأداء؛ وإذا كان مسترخيًا، يعود كما كان. لهذا السبب تسوّق Inworld النموذج للوكلاء والرفقاء والألعاب بدلًا من السرد: فالميزة غير مجدية في نداء واحد من نصّ إلى صوت، ومفيدة في المحادثة.
يعمل Cartesia Sonic 3.6 بشكل مختلف. إنه محرك بث سريع وعالي الجودة، ويتمثل ادعاء Cartesia نفسه في معايرة عاطفية تلقائية من النص المكتوب — فهو يقرأ الكلمات ويعدّل نبرة الصوت وفقًا لذلك. وما لا يفعله هو الاستماع إلى صوت الجولات السابقة. ضمن عبارة واحدة، قد يبدو الاثنان متقاربين؛ أما عبر محادثة كاملة، فإن Inworld ينمذج شيئًا لا يحاول Sonic فعله. إذا كان منتجك تعليقًا صوتيًا من جولة واحدة، فإن هذه النمذجة مجرد عبء إضافي. وإذا كان وكيلًا مباشرًا، فهي جوهر المنتج ذاته.

السرعة، والسعر، وتحذير فلاش.
على مستوى زمن الاستجابة الخالص، كانت "كارتيسيا" هي صاحبة الأرقام القياسية: زمن أقل من 90 مللي ثانية حتى أول صوت هو رقم تعلنه الشركة المصنعة، لكنه الرقم الذي توفّره الشركة منذ جيل "سونيك 3"، ولم ينشر أحد أي تدقيق يناقض ذلك. نموذج "إنوورلد" الرئيسي يردّ في فئة محادثة مشابهة عند أقل من 200 مللي ثانية، وهو أمر جيد للوكلاء المباشرين. أما اللعب الحقيقي لزمن الاستجابة لدى "إنوورلد" فهو طبقة "فلاش" التي صدرت إلى جانب نموذج GA — وهي نموذج منفصل بزمن استجابة يبلغ حوالي 25 مللي ثانية حتى أول بايت، ويستهدف أعباء العمل عالية الحجم حيث تكون تكلفة وزمن استجابة فئة "سونيك" أكثر أهمية من التعبيرية. والملاحظ أن "فلاش" عضو مجرّد من العائلة: استنساخ فوري وغير لفظيات مضمّنة، لكن دون استنساخ احترافي ودون تحكّم لغوي طبيعي كامل.
غير أن الأسعار تذهب في الاتجاه المعاكس. تبلغ تكلفة Sonic 3.6 حوالي 49.0 دولارًا لكل مليون حرف — أي ما يقارب ضعف معدل Inworld البالغ 25 دولارًا عند الطلب، ونحو أربعة أضعاف الطبقة الأعلى البالغة 12.50 دولارًا. وفجوة الجودة بينهما، على اللوحات التي يظهر فيها كلاهما، لا تبرر هذا المضاعف بالنسبة لمشترٍ بكميات كبيرة. أما بالنسبة لوكيل صوتي فوري يولّد آلاف الأحرف في كل محادثة، فإن الفجوة في تكلفة الحرف الواحد هي الفرق بين اقتصاد وحدة سليم واقتصاد هشّ.
أيهما أختار؟
• اختر Cartesia Sonic 3.6 إذا كان تاج قائمة المزودين هو ما تريده — فهو الصوت الأعلى تقييماً الذي يستخدم أصواته الأصلية، Elo 1,282، للعبارات القصيرة المكتفية بذاتها مثل إجابات المساعد وأسطر الألعاب وقراءات الحالة. مقابل 49 دولاراً لكل مليون حرف تدفع ثمن التاج، ويظل النموذج الذي يجب التغلب عليه في تلك القائمة.
• اختر Inworld Realtime TTS-2 إذا كان المنتج محادثة متعددة الأدوار حيث يجب أن يستجيب الصوت للشخص على الطرف الآخر — مكالمات الدعم، رفيقًا، مقابلة، جلسة تعليمية. وهو الآن يتصدر لوحة المقارنة الخاضعة للتحكم، حيث تنطق كل النماذج بنفس الأصوات المرجعية الثمانية، ويحقق ذلك بسعر أقل بنحو النصف بينما يستمع إلى صوت المحادثة.
• اجعل التحويل جزءًا من التوجيه إذا لم تستطع أن تعرف مسبقًا نوع الصوت الذي تحتاجه المكالمة. ليس أيٌّ من النموذجين متاحًا على OrcaRouter حتى وقت كتابة هذه السطور — إذ يُستدعى Sonic عبر واجهة Cartesia البرمجية الخاصة وعدة منصّات خارجية، ويُستدعى Inworld عبر واجهته البرمجية الخاصة — لكن طبقة التوجيه هي تحديدًا البنية التي تسمح لمحادثة بالبدء بصوتٍ واحد ثم التحويل إلى الصوت الآخر عند الفشل، مع تمرير السعر المعلن من كل مزوّد بهامش ربح 0%. وفي اليوم الذي تنقلب فيه إحدى هذه اللوحات مجددًا — وقد فعلت هذا الأسبوع — يصبح الخيار تغيير إعداد بدلًا من إعادة كتابة.
النسخة المختصرة
هذا انقسام حقيقي، والإجابة الصادقة هي أن الانقسام يتعلق بتناوب الأدوار، وليس بجودة الصوت. إذا كنت بحاجة إلى الصوت المستقل الأعلى تقييمًا باستخدام أصواته الأصلية الخاصة، فإن Cartesia Sonic 3.6 يحمل تاج المزودين على Elo برصيد 1,282 ويتقاضى 49 دولارًا لكل مليون حرف مقابل ذلك. إذا كنت بحاجة إلى صوت يستجيب للطريقة التي خُوطب بها، فإن Inworld Realtime TTS-2 أصبح متاحًا للعامة هذا الأسبوع بتسعيرة 25 دولارًا عند الطلب، ويتصدر اللوحة المضبوطة حيث يلتقي النموذجان على أصوات متساوية، ويحمل ميزة الوعي بالمحادثة التي لا يقيسها أي ميدان قياسًا كاملًا. أصبحت لوحات النتائج الآن منقسمة بين النموذجين — وهذا هو أصدق تصوير ممكن لسوق يعتمد فيه "الأفضل" على الاختبار.

