بطاقة رئيسية مُولَّدة لـ 'Gemini 3.8 TTS vs Sesame Preview' على خلفية بيضاء مع لمسات متدرجة زرقاء وسماوية ناعمة. تسرد البطاقة اليسرى 'Gemini 3.8 Flash TTS' تصنيف Elo 1,260 في المرتبة 2، و8 أصوات ساحة، ونقطة نهاية API، و16.50 دولارًا لكل مليون حرف بعد التطبيع؛ أما البطاقة اليمنى 'Sesame' فتنقسم إلى 'تطبيق المعاينة — مجاني، بالإنجليزية فقط، بلا API، وبلا معرّف نموذج' و'نقطة تفتيش CSM-1B — Apache 2.0، و2 مليار معامل، وعمود فقري Llama'. يقرأ سطر التذييل 'تصنيف Elo وفق Artificial Analysis Provider Voice Arena، سبتمبر 2026؛ وتفاصيل CSM-1B وفق بطاقة النموذج الخاصة به.' شعار OrcaRouter مركَّب في الزاوية اليمنى السفلية.
Guides & Insights

Gemini 3.8 TTS مقابل Sesame Preview: أحدهما تنزيل، والآخر تطبيق

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ابحث عن مقارنة بين Gemini 3.8 Flash TTS و Sesame Preview وستجد الكثير من الكتابات التي تتعامل معهما كمنتجين في الفئة نفسها. لكنهما ليسا كذلك، والفرق ليس تفصيلاً تقنياً. إن Gemini 3.8 Flash TTS هو نقطة نهاية API: فلديه معرّف نموذج، وبطاقة أسعار منشورة، ومركز في لوحة الصدارة في المرتبة 2 بتصنيف Elo قدره 1,260 عبر 1,999 عيّنة على Artificial Analysis Provider Voice Arena، وتنسيق طلب موثّق. أما Sesame Preview فهو تطبيق مساعد صوتي استهلاكي مجاني بوكلاء مُسمّين ومحادثات متعددة الأدوار وحد أقصى للمكالمة يبلغ 30 دقيقة. فليس لديه API، ولا معرّف نموذج، ولا خطة فوترة، ولا نتيجة على تلك اللوحة.

الشيء الوحيد من Sesame الذي يمكنك البناء عليه فعليًا هو أمر مختلف مرة أخرى: CSM-1B، وهو نقطة تفتيش بترخيص Apache 2.0 على Hugging Face يولّد رموزًا صوتية من النص باستخدام بنية Llama الأساسية ومفكك ترميز صوتي Mimi. إنه ليس الصوت الذي يتحدث عنه الناس عندما يصفون كم يبدو صوت التطبيق بشريًا. لذا تتحول المقارنة إلى سؤال قابل للإجابة: هل تريد استئجار نموذج كلام، أم تريد تنزيله؟

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

شيئان يُسمّيان Sesame، وواحد منهما فقط قابل للبناء

التسمية هي مصدر معظم الالتباس، لذا افصلها قبل المضي قدمًا.

Sesame Preview — التطبيق. مجاني الاستخدام، وكلاء بأسماء Maya وMiles وSimone وCharlie، محادثة متعددة الأدوار مع سياق يستمر عبر الأدوار، البحث في الويب والتذكيرات كإمكانات، الإنجليزية فقط، وحد أقصى 30 دقيقة للمكالمة. لا توجد واجهة للمطورين: لا شيء للمصادقة عليه، ولا شيء للقياس، ولا نقطة نهاية لاستدعائها.

• CSM-1B — نقطة التحقق. نُشر على Hugging Face تحت sesame/csm-1b بموجب رخصة Apache 2.0، مع بنية Llama أساسية ومُفكِّك تشفير أصغر يُنتج رموز صوت Mimi. بنحو ملياري معامل، باللغة الإنجليزية، بأوزان F32، ويعمل عبر Hugging Face Transformers. توثّق بطاقة النموذج طرح نسخة 1B في مارس 2025 ووصول دعم Transformers الأصلي في مايو 2025.

هذان الاثنان يتشاركان شركة وسلالة بحثية، وهنا تقريبًا تنتهي العلاقة. التطبيق منتج؛ أما نقطة الحفظ فهي أثر من البحث الذي سبقه. المراجعون الذين يثنون على الذاكرة الحوارية للتطبيق يصفون نظامًا مزودًا بالاسترجاع وإدارة الحالة حول نموذج كلام، وليس خاصية من خصائص نقطة الحفظ بحجم 2B التي يمكنك تنزيلها.

ما الذي يوجد فعليًا في نقطة الحفظ؟

CSM-1B هو نموذج تحويل النص إلى كلام بالمعنى المعماري المهم لأي شخص يخطط لتشغيله: فهو يأخذ النص وسياق الصوت كمدخلات، ويُصدر رموز صوتية RVQ، التي يحوّلها وحدة فك الترميز إلى شكل موجي. الحقائق العملية من بطاقة النموذج:

• الترخيص — Apache 2.0. هذا هو السطر الأكثر تأثيرًا على الإطلاق في الصفحة. وعلى خلاف تراخيص الأوزان المخصّصة للأبحاث فقط، يسمح Apache 2.0 بالاستخدام التجاري دون اتفاق منفصل، مما يجعل CSM-1B من بين نقاط الحفظ الصوتية المفتوحة القليلة القابلة للاستخدام فعليًا.

• الحجم — حوالي 2 مليار معامل بدقة F32. كبير بما يكفي ليتطلب عتادًا حقيقيًا لأي شيء متزامن، وصغير بما يكفي ليعمل على مسرّع واحد للتطوير.

• اللغة — الإنجليزية، وفقًا للبطاقة. ليس نموذجًا متعدد اللغات.

• الزخم — 141,461 تنزيلًا في الشهر الماضي وقت كتابة هذا النص، مع نحو 245,000 إعجاب على المستودع. هذه نقطة تحقق واسعة الاستخدام بمعايير نماذج الكلام المفتوحة، وهي أقوى حجة على أن لهذا المُخرَج قاعدة مستخدمين حقيقية مستقلة عن التغطية الصحفية للتطبيق.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

ما لا تمنحك إياه البطاقة هو ادّعاء جودة يمكنك مقارنته بأي شيء. لا يوجد صف في الساحة، ولا معيار أداء من مورّد أعاد طرف ثالث إنتاجه، ولا تقييم منشور لكيفية ارتباط مخرجات نقطة التحقق بمخرجات التطبيق. وكل من يخبرك أن النموذج القابل للتنزيل يشبه التطبيق إنما يستنتج ذلك من الاسم.

لماذا لا توجد مقارنة مباشرة، ولماذا لا يُعد ذلك فجوة بحثية

لا توجد مقارنة بين Gemini 3.8 TTS وSesame Preview على لوحات المتصدرين لأنه لا يمكن أن توجد. تصنّف الساحة النماذج من خلال جعل المستمعين يقارنون مقاطع أنتجتها نقطة نهاية مستضافة. أحد طرفي هذا الاقتران ليس لديه نقطة نهاية، لذا لا يمكن إدخاله.

هذا أمر يستحق الدقة، لأن عبارة "لا توجد مواجهة مباشرة" غالبًا ما تُكتب وكأن البيانات مفقودة. إنها ليست مفقودة. إنها غير معرّفة. الشيئان اللذان تتم مقارنتهما لا يشتركان في سطح قابل للقياس:

• يُقيَّم Gemini 3.8 Flash TTS وفق أصواته الأصلية المستضافة. لا يمتلك Sesame Preview أصواتًا أصلية ليُقيَّم بها بهذا المعنى — فهو يمتلك وكلاء.

• ينشر Gemini 3.8 Flash TTS بطاقة أسعار بالوحدات الرمزية. Sesame Preview مجاني ولا ينشر شيئًا، لأنه لا يوجد ما يمكن فوترته.

• يأخذ Gemini 3.8 Flash TTS نصًا ويعيد صوتًا. يأخذ Sesame Preview محادثة ويعيد محادثة، مع أي طبقات استرجاع وذاكرة يضيفها التطبيق فوق ذلك.

أقرب شيء إلى مقارنة مشروعة هو المقارنة بين Gemini 3.8 Flash TTS وCSM-1B، وحتى هذه المقارنة غير متكافئة: أحدهما لديه تصنيف Elo مستقل وبطاقة أسعار من المورّد، والآخر لا يملك أياً منهما. ما يمكنك مقارنته هو شكل الالتزام — واجهة برمجة تطبيقات محسوبة الاستخدام مقابل نقطة تحقق قابلة للتنزيل — وهذه المقارنة لا تحتاج إلى لوحة صدارة.

الجانب الوحيد من هذا الذي عليه أرقام

كل ما هو كمّي في هذا الاقتران يقع في جانب جوجل، وهذا بحد ذاته هو المغزى.

على Artificial Analysis Provider Voice Arena، بتاريخ 24 سبتمبر 2026، يحتل Gemini 3.8 Flash TTS المرتبة 2 بتقييم Elo يبلغ 1,260 عبر 1,999 عينة و8 أصوات في الساحة، وصدر في 23 سبتمبر 2026. ويأتي شقيقه Gemini 3.8 Flash-Lite TTS في المرتبة 6 بتقييم 1,235. تفرض Google رسومًا على Flash TTS بقيمة 0.50 دولار لكل مليون رمز نصي مُدخل و9.00 دولار لكل مليون رمز صوتي مُخرج حتى 31 ديسمبر 2026، ثم 18.00 دولارًا، مع Flash-Lite TTS عند 0.50 و6.00 دولار، ثم 12.00 دولارًا؛ وتقوم Artificial Analysis بتطبيع تلك الأسعار إلى 16.50 و11.00 دولارًا لكل مليون حرف حتى يمكنهما مشاركة لوحة مع نماذج تُفوتر بوحدات أخرى. هذا التطبيع هو حساب اللوحة، وليس اقتباسًا من Google.

في مقابل ذلك، لا سعر لـ CSM-1B لأنه لا يمتلك عدّادًا. لديه عدد تنزيلات وترخيص وعدد معاملات. إذا كان إطار قرارك يحتاج إلى Elo، فلن توفّر هذه المقارنة واحدًا لجانب Sesame، والاستنتاج الصادق هو أن الخيارين يُقيَّمان وفق معايير مختلفة، بدلًا من أن أحدهما غير مُثبت.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

إذا كان ما أردته هو تجربة التطبيق

كثير من الأشخاص الذين يبحثون عن هذه المقارنة لا يختارون نموذجًا على الإطلاق. لقد استخدموا تطبيق Sesame، وأعجبهم شعور المحادثة، ويريدون ذلك في منتجهم. تلك مشكلة مختلفة، ولن يحلها التنزيل.

ما يجعل التطبيق يبدو على النحو الذي يبدو به ليس في الغالب نموذج الكلام. فالسياق المستمر عبر الأدوار، وقرار البحث في الويب أثناء المحادثة، وتوقيت تحدث الوكيل — كلها أمور تنسيقية، ولا شيء منها يوجد في نقطة تحقق بحجم 2B. تنزيل CSM-1B يمنحك صوتًا. أما بناء سلوك التطبيق فوقه فهو هندستك أنت، كما أن حد المكالمة البالغ 30 دقيقة وغياب API يعنيان أنك لا تستطيع استئجار النسخة الجاهزة أيضًا.

إذا كان ما أردته هو نموذج كلام يمكنك استدعاؤه، فالإجابة الصادقة هي أن Gemini 3.8 Flash TTS هو الخيار الذي يمتلك واجهة موثّقة، وسعرًا منشورًا، وتقييمًا مستقلًا، وحوارًا بصوتين في طلب واحد. وإذا كان ما أردته هو أوزان يمكنك الاحتفاظ بها، فإن CSM-1B تحت Apache 2.0 هو الخيار الوحيد من بين الاثنين الذي يمكنك فعلاً الاحتفاظ به — والمقايضة هي أنك توفّر العتاد، ومكدس الخدمة، وكل ضمانات الجودة بنفسك.

لا تستضيف OrcaRouter أيًا من هذين. يتم استدعاء نموذج Google عبر واجهة برمجة التطبيقات الخاصة بـ Google والواجهات المذكورة في إعلانها الصادر في 23 سبتمبر؛ CSM-1B هي نقطة تفتيش تشغّلها. الغرض من OrcaRouter هو الطبقة الأعلى من ذلك الاختيار: أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزود دون أي هامش ربح، لذا يصبح تغيير سعر البائع ساريًا في نفس اليوم، التحويل التلقائي عند الفشل بحيث لا يكون المسار التجريبي تابعًا للإنتاج، و DSL للتوجيه يجمع النماذج في استدعاء واحد عندما لا يكون صوت واحد هو المهمة بأكملها.

النسخة المختصرة من هذه المقارنة هي أنها ليست مقارنة حقًا. أحد الطرفين لديه بطاقة أسعار وتصنيف Elo؛ والآخر لديه ترخيص وعدد مرات التنزيل. اختر الطرف الذي يمكنك فعلاً ملء عموده.