
Gemini 3.8 TTS مقابل Inworld Realtime TTS-2: أي لوحة نتائج تعتقد أنها تغيّر الإجابة
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
ضع Gemini 3.8 Flash TTS و Inworld Realtime TTS-2 جنبًا إلى جنب على Artificial Analysis Provider Voice Arena وستبدو الإجابة بديهية: المرتبة 2 مقابل المرتبة 4، وإيلو 1,260 مقابل 1,245، و8 أصوات في الساحة لكل منهما، و16.50 دولارًا موحّدًا لكل مليون حرف مقابل 20.80 دولارًا. ويفوز المورّد من حيث المرتبة والسعر، كما أن فارق الـ15 نقطة يقع داخل فترتي الثقة لكلا الصفين على أي حال.
انتقل إلى اللوحة الأخرى التي تنشرها Artificial Analysis وسينقلب الترتيب. يحتل Inworld Realtime TTS-2 المرتبة الأولى في Controlled Voice Arena بدرجة Elo تبلغ 1,123، بينما يبلغ متغيّر Flash الخاص به 1,075. هذا ليس فرقًا ناتجًا عن التقريب — بل إنه نموذج مختلف هو الذي يفوز، والسبب هو أن اللوحتين لا تقيسان الشيء نفسه. إذا كنت تختار صوتًا لمنتج ما، فإن معرفة أي من هذين السؤالين يطرحه حال استخدامك فعليًا هي القرار بأكمله.

مجلسان، سؤالان مختلفان
تقيّم ساحة Provider Voice Arena الأصوات الأصلية الخاصة بالنموذج نفسه — تلك التي يوفّرها المورّد ويستضيفها. تُبقي ساحة Controlled Voice Arena الصوت ثابتًا وتقيّم مدى جودة أداء كل نموذج عندما يُطلب منه التحدث بصوت ليس صوته. المقيّمون أنفسهم، ونفس نوع المقارنة العمياء، لكن المتغيّر مختلف.
هذا التمييز يقابل وظيفتين مختلفتين:
• ترتيب المزوّدين يجيب عن سؤال: "هل يبدو هذا النموذج جيدًا جاهزًا للاستخدام؟". وهو لوحة الصدارة المناسبة لمنتج يُشحن بمجموعة ثابتة من أصوات الرواة ولا يستنسخ أي شيء أبدًا.
• يجيب الترتيب المضبوط عن سؤال "هل يطيع هذا النموذج مواصفة صوتية". إنها لوحة التقييم الصحيحة لمنتج تكون فيه النبرة الصوتية ملكًا للعميل — نبرة علامة تجارية مستنسخة، أو ممثل مرخّص، أو هوية خاصة بكل مستأجر.
تتصدر نماذج Google القائمة الأولى، وتتصدر نماذج Inworld القائمة الثانية. وكلا العبارتين صحيحتان في الوقت نفسه، ولا تتعارض إحداهما مع الأخرى، وهذا بالضبط هو سبب أن إجابة واحدة عن سؤال «أي نموذج TTS هو الأفضل» تكون عادةً علامة على أن الكاتب اختار لوحة واحدة ولم ينظر إلى الأخرى.

ما الذي يعنيه موقع Inworld الأول عمليًا
النتيجة الحائزة على المركز الأول في فئة «المتحكَّم بها» هي ادّعاء بالإخلاص لتعليمة ما، والإخلاص لتعليمة ما هو الخاصية التي تحدّد ما إذا كان الاستنساخ قابلاً للاستخدام على الإطلاق.
يأتي مسار الاستنساخ الخاص بـ Inworld في شكلين. يعمل الاستنساخ الفوري انطلاقًا من عيّنة قصيرة — رقم المورّد هو من 5 إلى 15 ثانية من التسجيل الصوتي المرجعي — بينما توجد فئة استنساخ احترافية في مرحلة بيتا وتحتاج إلى ما في حدود عشر دقائق. كلاهما مُبلَّغ به من المورّد، ولا يتحقق أيٌّ منهما بشكل مستقل من قبل الآرينا؛ ما تقيسه الآرينا هو سلوك النموذج بعد أن يحصل على صوت، وليس جودة خطوة الاستنساخ التي أنتجته.
ادعاءات زمن الاستجابة المرتبطة بهذه العائلة تقع في الفئة نفسها. رقم البايت الأول لنسخة Flash — 25 مللي ثانية، مُبلَّغ عنه عبر قياس طرف ثالث — وأرقام p99 الخاصة بالنموذج الكامل هما من Inworld نفسها، وليس لدى arena ما تقوله عن أيٍّ منهما. إنها معقولة لنموذج موجَّه للزمن الحقيقي، وهي غير مُتحقَّق منها، وهذه هي الطريقة الصحيحة للتعامل معها.
إذن، القراءة العملية هي: إذا كان منتجك يستنسخ الأصوات، فإن نتيجة Controlled من Inworld هي الأكثر صلة من بين النتيجتين، وهي السبب في أن انخفاض رتبة Provider لا يؤدي إلى الاستبعاد. أما إذا كان منتجك لا يستنسخ الأصوات، فهذه الميزة غير مرئية لك، ولوحة Provider هي التي ينبغي قراءتها.
يتكوّن سلّم الأسعار من ثلاث درجات، والدرجة الرخيصة هي اشتراك.
مقارنة سعر واحد بسعر واحد تُخطئ في هذه المواجهة، لأن Inworld ليس لديها سعر — بل لديها سلّم.
عند الطلب — Realtime TTS-2 بسعر 25.00 دولارًا لكل مليون حرف، وFlash بسعر 15.00 دولارًا. هذا هو السعر الذي يراه المتصل الذي يدفع حسب الاستخدام، وهو الرقم المنشور من المورّد نفسه.
• خطة Creator — 20.00 دولارًا و10.00 دولارات للنموذجين نفسيهما، أي خصم بنسبة 20% و33% مقابل الالتزام بخطة بدلًا من الدفع حسب الاستخدام. مُبلَّغ عنه من البائع، وهو المستوى الأجدر بإعادة التحقق منه على صفحة التسعير المباشرة قبل الالتزام، لأن شروط الخطط تتغير أسرع من الأسعار المعلنة.
• مُوحَّد — تحويل الساحة لكل مليون حرف يمنح 20.80 دولارًا لـ Realtime TTS-2 و10.40 دولارًا لـ Flash، وهو حساب اللوحة لا عرض أسعار من أيٍّ من المورّدين.
في المقابل، أسعار Google قائمة على الرموز وترويجية: 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولارات لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم 18.00 دولارًا؛ أما Flash-Lite TTS فيبلغ 0.50 دولار و6.00 دولارات، ثم 12.00 دولارًا. وبعد التطبيع، يبلغ ذلك 16.50 دولارًا و11.00 دولارًا.

اقرأ الاثنين معًا، وستكون الصورة أكثر إثارة للاهتمام من «Google أرخص». بناءً على الأرقام كما نُشرت اليوم، يُعد Flash TTS الأرخص بين الطرازات الثلاثة، وتأتي نسخة Flash من Inworld في المرتبة الثانية من حيث الرخص — والطرازان Flash متقاربان بما يكفي لأن تغييرًا صغيرًا في نسبة الصوت إلى النص قد يقلب أيهما تبلغ فاتورته أقل. في 1 يناير 2027، عندما يتضاعف سعر Google، يستقر الترتيب ويصبح Inworld هو الخيار الأرخص عند كل درجة من درجات سلّمه السعري. أي شخص يقارن بين هذين في سبتمبر ثم يلتزم في ديسمبر فإنه يقارن الأرقام الخاطئة.
حيث يكون كل منها هو الإجابة الأفضل
النموذجان متقاربان في الجودة بما يكفي لدرجة أنّ الفوارق بينهما بنيوية، لذا فالصيغة الأمينة هي قائمة شروط لا حُكم.
اختر Gemini 3.8 Flash TTS عندما يكون اختيار الصوت متروكًا لك. تصميم الأصوات من وصف مكتوب، وحوار بين متحدثين في استدعاء واحد، وتنسيق على مستوى الأدوار، وأوسع تغطية لغوية بين الاثنين وفقًا لإحصاء Google نفسه — ولا يضاهي Inworld أيًا منها في هذه المقارنة. كما أنه النموذج الأرخص اليوم، ويمنحك نظيره Flash-Lite نقطة سعرية ثانية داخل API نفسها.
اختر Inworld Realtime TTS-2 عندما يكون الصوت صوت العميل. صف Controlled Voice في المقدمة، ومسار استنساخ فوري يُقاس بثوانٍ من الصوت المرجعي، وطبقة استنساخ احترافية للحالات التي تحتاج إلى المزيد، وتوجّه فوري مدعوم بادعاءات زمن أول بايت التي ينشرها المورّد — مع التحفظ بأن هذه الادعاءات هي ادعاءات المورّد. وهو متوفر باللغة الإنجليزية فقط وفقًا لوثائق المورّد نفسه، وهذا قيد صارم إذا كنت بحاجة إلى أي شيء آخر.
لا يتم استضافة أي من هذين النموذجين بواسطة OrcaRouter، ومن الجدير بالذكر ذلك بدلاً من التلميح إلى عكس ذلك: مكان استدعاء Gemini 3.8 Flash TTS هو واجهة برمجة تطبيقات Google الخاصة والأسطح التي حددتها Google في 23 سبتمبر، ومكان استدعاء Inworld Realtime TTS-2 هو منصة Inworld الخاصة. ما هو OrcaRouter من أجله هو كل ما يحيط بهذا الاختيار — أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزود بدون هامش ربح، لذا فإن تغيير سعر المورد مثل خطوة يناير يكون مباشرًا على جانبنا في نفس اليوم، تجاوز الفشل التلقائي بحيث لا يجب أن يكون النموذج المُقيَّم تبعية إنتاجية، ولغة توجيه (DSL) لتأليف النماذج في نداء واحد عندما لا يحمل صوت واحد المهمة بأكملها.
السبب في إبقاء هذين الأمرين مطروحين هو أن تغيّر معدل يناير والتمييز بين Controlled وProvider سببان منفصلان يمكن أن تتغيّر الإجابة بسببهما. وخط المعالجة الذي لا يستطيع استدعاء إلا واحد منهما لا يستطيع متابعة أيٍّ منهما.
