
Gemini 3.8 Live مقابل Gemini 3.8 TTS: حلقة محادثة وصوت قراءة يتشاركان اسم جيل واحد
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 181 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
Gemini 3.8 Live هو نموذج تحويل الكلام إلى كلام طُرح في 15 سبتمبر 2026 باسم gemini-3.8-live وgemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" ليس نموذجًا على الإطلاق — بل هو المصطلح الجامع الذي تستخدمه تغطية الإطلاق، بما في ذلك عنوان منشور Google نفسه، للإشارة إلى زوج نقاط نهاية تحويل النص إلى كلام التي وصلت في 23 سبتمبر 2026 باسم gemini-3.8-flash-tts وgemini-3.8-flash-lite-tts. لذا ليست هذه صفحة المقارنة المعتادة، حيث يتنافس منتجان على وظيفة واحدة. إنها صفحة عن وظيفتين تشتركان في رقم جيل، وعن الخطأ المحدد الذي يقع فيه الناس عندما يتعاملون مع كلمتي "Live" و"TTS" كأنهما نوعان من الشيء نفسه.
التفرع الذي يخفيه رقم الجيل المشترك
توثيق Google لتوليد الكلام يرسم الحد بنفسه، والجملة يسهل تمريرها: "تختلف قدرة TTS عن توليد الكلام المقدم عبر Live API." يوضح المقطع نفسه السبب، والسبب بنيوي وليس مسألة جودة. صُمم Live API من أجل "الصوت التفاعلي غير المنظم، والمدخلات والمخرجات متعددة الوسائط." إن TTS عبر Gemini API "مصمم خصيصًا للسيناريوهات التي تتطلب تلاوة نصية دقيقة مع تحكم دقيق." توضح ملاحظة لاحقة شكل الإدخال صراحةً: نماذج TTS تأخذ النص فقط وتعيد الصوت فقط.
هذا القيد الوحيد — إدخال نصي، إخراج صوتي، لا إدخال صوتي — هو المقارنة بأكملها. نموذج Gemini 3.8 Live يسمع الشخص الذي يتحدث إليه. أما نموذج Gemini 3.8 Flash TTS أو Flash-Lite TTS فلا يسمع أحدًا أبدًا؛ بل يقرأ سلسلة نصية ويؤديها. وكل ما تبقى يتبع من ذلك: فالمعايير القياسية الموجودة لأحدهما لا معنى لها بالنسبة للآخر، والتسعير يُقاس بوحدات مختلفة، وأنماط الفشل غير قابلة للمقارنة على الإطلاق.
هذا مهم لأن حالتي الاستخدام تبدوان متطابقتين من الخارج. فوكيل صوتي ومسار لسردٍ صوتي ينتهي بهما الأمر إلى إصدار كلام يشبه كلام البشر. غير أن واحدًا منهما فقط يمكن مقاطعته.
حيث يُحَلّ "Gemini 3.8 TTS" فعليًا
افتح جدول النماذج المدعومة لتوليد الكلام في Gemini API وستجد أربعة إدخالات TTS ولا يوجد إدخال باسم Gemini 3.8 TTS. اثنان منها من هذا الجيل: Gemini 3.8 Flash TTS، معرّف الطراز gemini-3.8-flash-tts، مع 130 لغة، وGemini 3.8 Flash-Lite TTS، معرّف الطراز gemini-3.8-flash-lite-tts، مع 101 لغة. الاثنان الآخران — Gemini 3.1 Flash TTS Preview وGemini 2.5 Pro Preview TTS — هما جيل المعاينة الذي يستبدله Flash-Lite.
لذلك عندما يقول شخص ما "Gemini 3.8 TTS"، فإنه عادةً يشير إلى فئة Flash، لأنها الفئة التي يستهل بها منشور الإطلاق، والتي تحتل المرتبة الأعلى في لوحة Arena. وعندما يقولون ذلك بخصوص وكيل صوتي مباشر، فإنهم لا يشيرون إلى شيء، لأن الشيء الذي يريدونه موجود على نقطة نهاية مختلفة باسم مختلف وعقد إدخال مختلف.
هناك تصادم ثالث جدير بالتسمية، لأنه ينتج أسوأ نصيحة. Gemini 3.8 Live ليس نموذج تحويل النص إلى كلام مزوّدًا بميزات إضافية. إنه نموذج تحويل الكلام إلى كلام، والسبب في أن تكلفته أعلى لكل وحدة هو أنه يؤدي عملًا أكثر لكل وحدة: الاستماع، والاستدلال أثناء الكلام، والتعامل مع المقاطعات، وفي نسخة Extended Thinking، التروّي قبل أن يجيب.
الرقم الوحيد الذي يُقارن حقًا
درجات الجودة لا تنتقل بين هاتين العائلتين؛ فلا توجد لوحة واحدة تُقيّم راويًا ومُحاوِرًا على المحور نفسه. أما المال فينتقل، بمجرد أن تختار الوحدة بأمانة، والوحدة الأمينة لأي شيء صوتي هي ساعة الصوت.
• القياس عند الإدخال — تُحاسب Gemini 3.8 Live بالدقيقة من الصوت، 0.005 دولار لكل دقيقة إدخال و0.018 دولار لكل دقيقة إخراج، مقابل Gemini 3.8 Flash TTS التي تُحاسب لكل مليون رمز صوتي، 9.00 دولارات حتى 31 ديسمبر 2026 و18.00 دولارًا بعد ذلك
• القياس عند الإخراج — يبلغ الصوت ثنائي الاتجاه في Gemini 3.8 Live نحو 1.38 دولار مقابل ساعة من الإدخال والإخراج المتزامنين بالسعر المعلن، قبل أي تخزين مؤقت للمطالبات، مقابل Gemini 3.8 Flash TTS التي هي بث أحادي الاتجاه، ويصل مليون حرف من السرد النهائي إلى 16.5 دولارًا وفق تسوية Artificial Analysis
• إدخال النص — تُحاسب Gemini 3.8 Live النص والصوت على بنود منفصلة، 0.75 دولار لكل مليون رمز نصي إدخال و4.50 دولارات إخراج، مقابل نقاط نهاية TTS التي تُحاسب إدخال النص بـ0.50 دولار لكل مليون رمز
• فئة Flash-Lite — لا يوجد لدى Gemini 3.8 Live نظير أرخص؛ فالخيار هو Live أو Extended Thinking، مقابل Gemini 3.8 Flash-Lite TTS التي تُسعّر بـ6.00 دولارات ثم 12.00 دولارًا لكل مليون رمز صوتي، مع Artificial Analysis عند 11.0 دولارًا لكل مليون حرف
• شكل الإدخال — Gemini 3.8 Live صوت وفيديو ونص إدخالًا، وصوت إخراجًا، مقابل نقاط نهاية TTS نص إدخالًا وصوت إخراجًا
رقم Live هو ناتج حسابنا من أسعار Google المنشورة لكل دقيقة، وليس رقمًا بالساعة تنشره Google. أرقام الأحرف هي تطبيع Artificial Analysis وهي التي يجب الاقتباس بها عند مقارنة فئات التوليف. لاحظ أن لوحة Speech to Speech الخاصة بـ Artificial Analysis تحمل عمودًا منفصلًا لتكلفة الساعة من الصوت المُدخل لنماذج Live — حوالي 3.50 دولارًا لـ Gemini 3.8 Live و0.84 دولارًا لنسخة Extended Thinking — وهو تطبيع مختلف مرة أخرى، ولا ينبغي مقارنته ببطاقة الأسعار لكل دقيقة كما لو كانا القياس نفسه.

ما الذي يتعطّل عندما تختار الخيار الخطأ؟
أنماط الفشل جديرة بالتأمل لأنها شديدة التباين فيما بينها.
تستدعي نقطة نهاية تحويل النص إلى كلام (TTS) بينما كنت تحتاج إلى حلقة محادثة، ولا يحدث أي خطأ. يعيد الطلب صوتًا صالحًا. تحصل على رد طليق وجيد الإلقاء لنص ثابت، ثم صمت — لأنه لم يكن هناك من يستمع أصلًا. تكتشف الفرق ذلك عندما تبني أول اختبار مقاطعة لديها وتجد أن "المستخدم" عليه الانتظار حتى ينتهي المقطع كاملًا قبل أن يبدأ الدور التالي. إضافة محادثة بأثر رجعي إلى نقطة نهاية تخليق الكلام تعني إضافة التعرّف على الكلام، وسياسة لتناوب الأدوار، وآلية مقاطعة حولها، وعند هذه النقطة تكون قد أعدت بناء سلسلة متتالية وصرت تدفع مقابل نموذجين بدلًا من واحد.
استدعِ نقطة نهاية Live عندما تحتاج إلى سرد صوتي، وتدفع مقابل قدرة لا تستخدمها. يُقاس استهلاك نموذج Live في كلا الاتجاهين، لأنه يتوقع كلا الاتجاهين. في حالة كتاب صوتي أو تعليق صوتي لفيديو تدريبي، يكون جانب الإدخال نصًا لا يتغير أبدًا، ولا يحتاج النموذج إلى سماع أي شيء. أنت تشتري حلقة محادثة لقراءة مستند بصوت عالٍ.
الحالة الوحيدة التي يكون فيها الاختيار صعبًا حقًا هي التسلسل: التعرّف، ثم الاستدلال، ثم التركيب. هذه البنية ليست بائدة، ولا تزال الخيار الصحيح لكثير من الأنظمة الإنتاجية، لأنها تتيح لك تبديل كل مرحلة على حدة واختيار مورّد مختلف لكل منها. وهي تكلّفك زمن استجابة، وتكلّفك التنغيم الذي يحافظ عليه نموذج واحد من طرف إلى طرف عبر حدود الدور. والمقايضة حقيقية في الاتجاهين كليهما.
حيث يوجد المسار بالفعل
لا يوفّر OrcaRouter نقاط وصول Gemini 3.8 Live ولا نقاط TTS 3.8، ويستحق هذا القول قبل أي شيء آخر عن التوجيه، إذ يسهل افتراض العكس من كتالوج بهذا الاتساع. أما ما يضمّه الكتالوج فهو بقية العائلة — google/gemini-3.8-flash ضمن 28 من نماذج Google وأكثر من 200 نموذج إجمالاً، من مفتاح واحد بسعر المزوّد ودون أي هامش ربح.
هذا مهم تحديدًا للتسلسل المتعاقب. إذا كانت بنيتك المعمارية تقوم على التعرّف، ثم الاستدلال، ثم التوليف، فإن مرحلة الاستدلال هي التي يُثمر فيها مفتاح واحد عبر العديد من المورّدين، لأنها المرحلة التي تبدّلها أكثر من غيرها، والمرحلة التي ينبغي أن يصل فيها خفض سعر أحد المورّدين إلى فاتورتك في اليوم نفسه بدلًا من تجديد العقد التالي. وهي أيضًا المرحلة التي التحويل التلقائي عند الفشل تبرّر فيها وجودها: فلدى التسلسل المتعاقب ثلاثة مواضع للانقطاع، والموضع الأوسط هو الأرخص لجعله احتياطيًا.

قاعدة قرار قصيرة
إذا كان على النموذج أن يستجيب لشيء لم يكن لديه مسبقًا كنص، فأنت تريد Gemini 3.8 Live، وعليك أن تضع ميزانية على أساس أسعار Google للصوت بالدقيقة وأن تتوقع التفكير في أي من النسختين تحتاج. وإذا كان النص مكتوبًا بالفعل والمهمة هي أداؤه، فأنت تريد Gemini 3.8 Flash TTS أو Flash-Lite TTS، وعليك أن تضع ميزانية لكل مليون حرف وأن تختار الفئة بناءً على تغطية اللغات وما إذا كانت فجوة الجودة تستحق فجوة السعر.
وإذا طُلب منك مقارنة "Gemini 3.8 Live and Gemini 3.8 TTS" كما لو كانا منتجين، فإن أول شيء مفيد يمكنك فعله هو السؤال عن أي نقطة نهاية. فالاسم الوارد في الموجز لا يحيل إلى نقطة نهاية واحدة، والجواب يغيّر البنية المعمارية وليس الفاتورة فحسب.

