بطاقة رئيسية مُولَّدة لـ 'Gemini 3.8 TTS مقابل Inworld Realtime TTS-2' على خلفية بيضاء مع لمسات تدرج ناعمة باللونين الأزرق والسماوي. البطاقة اليسرى 'Gemini 3.8 Flash TTS' تُدرج Elo 1,260 في المرتبة 2، و8 أصوات ساحة، و130 لغة مُعلنة، و16.50 دولارًا لكل مليون حرف مُطبَّع؛ البطاقة اليمنى 'Inworld Realtime TTS-2' تُدرج Elo 1,245 في المرتبة 4، و8 أصوات ساحة، واللغة الإنجليزية فقط، و20.80 دولارًا لكل مليون حرف مُطبَّع، والمركز الأول في Controlled Voice Arena. سطر تذييل يقول 'Elo حسب Artificial Analysis Provider Voice Arena، سبتمبر 2026؛ الأسعار حسب Google وInworld.' شعار OrcaRouter مُدمَج في الزاوية اليمنى السفلية.
Guides & Insights

Gemini 3.8 TTS مقابل Inworld Realtime TTS-2: أي لوحة نتائج تعتقد أنها تغيّر الإجابة

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Gemini 3.8 Flash TTS و Inworld Realtime TTS-2 جنبًا إلى جنب على Artificial Analysis Provider Voice Arena وستبدو الإجابة بديهية: المرتبة 2 مقابل المرتبة 4، وإيلو 1,260 مقابل 1,245، و8 أصوات في الساحة لكل منهما، و16.50 دولارًا موحّدًا لكل مليون حرف مقابل 20.80 دولارًا. ويفوز المورّد من حيث المرتبة والسعر، كما أن فارق الـ15 نقطة يقع داخل فترتي الثقة لكلا الصفين على أي حال.

انتقل إلى اللوحة الأخرى التي تنشرها Artificial Analysis وسينقلب الترتيب. يحتل Inworld Realtime TTS-2 المرتبة الأولى في Controlled Voice Arena بدرجة Elo تبلغ 1,123، بينما يبلغ متغيّر Flash الخاص به 1,075. هذا ليس فرقًا ناتجًا عن التقريب — بل إنه نموذج مختلف هو الذي يفوز، والسبب هو أن اللوحتين لا تقيسان الشيء نفسه. إذا كنت تختار صوتًا لمنتج ما، فإن معرفة أي من هذين السؤالين يطرحه حال استخدامك فعليًا هي القرار بأكمله.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

مجلسان، سؤالان مختلفان

تقيّم ساحة Provider Voice Arena الأصوات الأصلية الخاصة بالنموذج نفسه — تلك التي يوفّرها المورّد ويستضيفها. تُبقي ساحة Controlled Voice Arena الصوت ثابتًا وتقيّم مدى جودة أداء كل نموذج عندما يُطلب منه التحدث بصوت ليس صوته. المقيّمون أنفسهم، ونفس نوع المقارنة العمياء، لكن المتغيّر مختلف.

هذا التمييز يقابل وظيفتين مختلفتين:

• ترتيب المزوّدين يجيب عن سؤال: "هل يبدو هذا النموذج جيدًا جاهزًا للاستخدام؟". وهو لوحة الصدارة المناسبة لمنتج يُشحن بمجموعة ثابتة من أصوات الرواة ولا يستنسخ أي شيء أبدًا.

• يجيب الترتيب المضبوط عن سؤال "هل يطيع هذا النموذج مواصفة صوتية". إنها لوحة التقييم الصحيحة لمنتج تكون فيه النبرة الصوتية ملكًا للعميل — نبرة علامة تجارية مستنسخة، أو ممثل مرخّص، أو هوية خاصة بكل مستأجر.

تتصدر نماذج Google القائمة الأولى، وتتصدر نماذج Inworld القائمة الثانية. وكلا العبارتين صحيحتان في الوقت نفسه، ولا تتعارض إحداهما مع الأخرى، وهذا بالضبط هو سبب أن إجابة واحدة عن سؤال «أي نموذج TTS هو الأفضل» تكون عادةً علامة على أن الكاتب اختار لوحة واحدة ولم ينظر إلى الأخرى.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

ما الذي يعنيه موقع Inworld الأول عمليًا

النتيجة الحائزة على المركز الأول في فئة «المتحكَّم بها» هي ادّعاء بالإخلاص لتعليمة ما، والإخلاص لتعليمة ما هو الخاصية التي تحدّد ما إذا كان الاستنساخ قابلاً للاستخدام على الإطلاق.

يأتي مسار الاستنساخ الخاص بـ Inworld في شكلين. يعمل الاستنساخ الفوري انطلاقًا من عيّنة قصيرة — رقم المورّد هو من 5 إلى 15 ثانية من التسجيل الصوتي المرجعي — بينما توجد فئة استنساخ احترافية في مرحلة بيتا وتحتاج إلى ما في حدود عشر دقائق. كلاهما مُبلَّغ به من المورّد، ولا يتحقق أيٌّ منهما بشكل مستقل من قبل الآرينا؛ ما تقيسه الآرينا هو سلوك النموذج بعد أن يحصل على صوت، وليس جودة خطوة الاستنساخ التي أنتجته.

ادعاءات زمن الاستجابة المرتبطة بهذه العائلة تقع في الفئة نفسها. رقم البايت الأول لنسخة Flash — 25 مللي ثانية، مُبلَّغ عنه عبر قياس طرف ثالث — وأرقام p99 الخاصة بالنموذج الكامل هما من Inworld نفسها، وليس لدى arena ما تقوله عن أيٍّ منهما. إنها معقولة لنموذج موجَّه للزمن الحقيقي، وهي غير مُتحقَّق منها، وهذه هي الطريقة الصحيحة للتعامل معها.

إذن، القراءة العملية هي: إذا كان منتجك يستنسخ الأصوات، فإن نتيجة Controlled من Inworld هي الأكثر صلة من بين النتيجتين، وهي السبب في أن انخفاض رتبة Provider لا يؤدي إلى الاستبعاد. أما إذا كان منتجك لا يستنسخ الأصوات، فهذه الميزة غير مرئية لك، ولوحة Provider هي التي ينبغي قراءتها.

يتكوّن سلّم الأسعار من ثلاث درجات، والدرجة الرخيصة هي اشتراك.

مقارنة سعر واحد بسعر واحد تُخطئ في هذه المواجهة، لأن Inworld ليس لديها سعر — بل لديها سلّم.

عند الطلب — Realtime TTS-2 بسعر 25.00 دولارًا لكل مليون حرف، وFlash بسعر 15.00 دولارًا. هذا هو السعر الذي يراه المتصل الذي يدفع حسب الاستخدام، وهو الرقم المنشور من المورّد نفسه.

• خطة Creator — 20.00 دولارًا و10.00 دولارات للنموذجين نفسيهما، أي خصم بنسبة 20% و33% مقابل الالتزام بخطة بدلًا من الدفع حسب الاستخدام. مُبلَّغ عنه من البائع، وهو المستوى الأجدر بإعادة التحقق منه على صفحة التسعير المباشرة قبل الالتزام، لأن شروط الخطط تتغير أسرع من الأسعار المعلنة.

• مُوحَّد — تحويل الساحة لكل مليون حرف يمنح 20.80 دولارًا لـ Realtime TTS-2 و10.40 دولارًا لـ Flash، وهو حساب اللوحة لا عرض أسعار من أيٍّ من المورّدين.

في المقابل، أسعار Google قائمة على الرموز وترويجية: 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولارات لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم 18.00 دولارًا؛ أما Flash-Lite TTS فيبلغ 0.50 دولار و6.00 دولارات، ثم 12.00 دولارًا. وبعد التطبيع، يبلغ ذلك 16.50 دولارًا و11.00 دولارًا.

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

اقرأ الاثنين معًا، وستكون الصورة أكثر إثارة للاهتمام من «Google أرخص». بناءً على الأرقام كما نُشرت اليوم، يُعد Flash TTS الأرخص بين الطرازات الثلاثة، وتأتي نسخة Flash من Inworld في المرتبة الثانية من حيث الرخص — والطرازان Flash متقاربان بما يكفي لأن تغييرًا صغيرًا في نسبة الصوت إلى النص قد يقلب أيهما تبلغ فاتورته أقل. في 1 يناير 2027، عندما يتضاعف سعر Google، يستقر الترتيب ويصبح Inworld هو الخيار الأرخص عند كل درجة من درجات سلّمه السعري. أي شخص يقارن بين هذين في سبتمبر ثم يلتزم في ديسمبر فإنه يقارن الأرقام الخاطئة.

حيث يكون كل منها هو الإجابة الأفضل

النموذجان متقاربان في الجودة بما يكفي لدرجة أنّ الفوارق بينهما بنيوية، لذا فالصيغة الأمينة هي قائمة شروط لا حُكم.

اختر Gemini 3.8 Flash TTS عندما يكون اختيار الصوت متروكًا لك. تصميم الأصوات من وصف مكتوب، وحوار بين متحدثين في استدعاء واحد، وتنسيق على مستوى الأدوار، وأوسع تغطية لغوية بين الاثنين وفقًا لإحصاء Google نفسه — ولا يضاهي Inworld أيًا منها في هذه المقارنة. كما أنه النموذج الأرخص اليوم، ويمنحك نظيره Flash-Lite نقطة سعرية ثانية داخل API نفسها.

اختر Inworld Realtime TTS-2 عندما يكون الصوت صوت العميل. صف Controlled Voice في المقدمة، ومسار استنساخ فوري يُقاس بثوانٍ من الصوت المرجعي، وطبقة استنساخ احترافية للحالات التي تحتاج إلى المزيد، وتوجّه فوري مدعوم بادعاءات زمن أول بايت التي ينشرها المورّد — مع التحفظ بأن هذه الادعاءات هي ادعاءات المورّد. وهو متوفر باللغة الإنجليزية فقط وفقًا لوثائق المورّد نفسه، وهذا قيد صارم إذا كنت بحاجة إلى أي شيء آخر.

لا يتم استضافة أي من هذين النموذجين بواسطة OrcaRouter، ومن الجدير بالذكر ذلك بدلاً من التلميح إلى عكس ذلك: مكان استدعاء Gemini 3.8 Flash TTS هو واجهة برمجة تطبيقات Google الخاصة والأسطح التي حددتها Google في 23 سبتمبر، ومكان استدعاء Inworld Realtime TTS-2 هو منصة Inworld الخاصة. ما هو OrcaRouter من أجله هو كل ما يحيط بهذا الاختيار — أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزود بدون هامش ربح، لذا فإن تغيير سعر المورد مثل خطوة يناير يكون مباشرًا على جانبنا في نفس اليوم، تجاوز الفشل التلقائي بحيث لا يجب أن يكون النموذج المُقيَّم تبعية إنتاجية، ولغة توجيه (DSL) لتأليف النماذج في نداء واحد عندما لا يحمل صوت واحد المهمة بأكملها.

السبب في إبقاء هذين الأمرين مطروحين هو أن تغيّر معدل يناير والتمييز بين Controlled وProvider سببان منفصلان يمكن أن تتغيّر الإجابة بسببهما. وخط المعالجة الذي لا يستطيع استدعاء إلا واحد منهما لا يستطيع متابعة أيٍّ منهما.