بطاقة رئيسية مُولّدة لمقال «Gemini 3.8 Live مقابل ElevenLabs»، تعرض بطاقتين مستديرتين على جانبي العنوان الرئيسي. تظهر على البطاقة اليسرى عبارة «Gemini 3.8 Live» فوق أيقونة سحابة وموجة صوتية، وتحتها السطر «من الكلام إلى الكلام، تمريرة واحدة، لكل دقيقة»؛ وتظهر على البطاقة اليمنى عبارة «ElevenLabs Agents» فوق أيقونة خط أنابيب من ثلاث كتل مُعنونة بـ «STT - LLM - TTS»، وتحتها السطر «مُجمّع، لكل دقيقة وكيل». ويظهر عنوان فرعي: «مكوّن تستأجره مقابل نظام يستأجر المكوّنات». وشعار OrcaRouter مُدمج في الزاوية السفلية اليمنى.
Guides & Insights

Gemini 3.8 Live مقابل ElevenLabs: نموذج في مواجهة خط معالجة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

افتح وثائق ElevenLabs الخاصة بمنصّتها للوكلاء، وستجد نموذج Gemini جالسًا في وسطها. إن ElevenLabs Agents عبارة عن سلسلة متتالية — واجهة أمامية للتعرّف على الكلام، ونموذج لغوي، وواجهة خلفية لتحويل النص إلى كلام — والنموذج اللغوي في المنظومة المنشورة هو أحد نماذج Gemini. وهذا هو المكان الصحيح لبدء مقارنة بين Gemini 3.8 Live وElevenLabs، لأن الشيئين موضع المقارنة ليسا من النوع نفسه.Gemini 3.8 Live هو نموذج الكلام إلى كلام، الذي طُرح على Live API في 15 سبتمبر 2026، بتسعير لكل دقيقة من الصوت.ElevenLabs Eleven v3 هو نموذج التوليف الرائد لمنصّة صوتية تبيع أيضًا ElevenLabs Agents، وهو مسعّر لكل حرف، لا لكل محادثة. أحدهما مكوّن يمكنك استئجاره. والآخر نظام يستأجر المكوّنات — بما في ذلك، في تكوين منشور واحد على الأقل، نموذج من نماذج Gemini.

هذا التباين يحسم معظم الأسئلة التي يجلبها الناس فعليًا إلى هذه المقارنة. إذا كنت تسأل أيّهما ينبغي أن تختار، فالجواب الصادق هو أنهما ليسا بديلين لبعضهما: أحدهما نموذج له قائمة أسعار ولا يوفّر خدمات الاتصال الهاتفي، والآخر منتج يوفّر الاتصال الهاتفي وحدود التزامن وثلاثة عدّادات تعمل في آنٍ واحد. وأيُّهما أرخص أو أفضل أو أسرع يعتمد كليًا على أيّ من هذين الشكلين يشبه تطبيقك بالفعل.

نموذج واحد، أو ثلاثة نماذج بالتتابع

Gemini 3.8 Live نظام أصلي للتحويل من الكلام إلى الكلام. يدخل الصوت ويخرج الصوت، ويحدث الاستدلال في التمريرة الأمامية نفسها التي تُنتج الكلام — نموذج واحد، وميزانية زمن استجابة واحدة، وفاتورة واحدة. أطلقته Google بنسختين في 15 سبتمبر 2026: gemini-3.8-live للعمل الحواري على نطاق واسع، وgemini-3.8-live-extended-thinking للواجهة نفسها مع استدلال متعدد الخطوات يدعمها. كلاهما يتعامل مع 97 لغة مع التبديل أثناء المحادثة، وكلاهما يعالج المدخلات المرئية في زمن شبه حقيقي، وكلاهما يشغّل استدعاءات الأدوات وواجهات API في الخلفية بينما تستمر المحادثة، وكلاهما يضع علامة مائية SynthID على كل ثانية من الصوت المُولَّد. السعر المعلن هو 0.005 دولار لكل دقيقة من الصوت المُدخل و0.018 دولار لكل دقيقة من الصوت المُخرج.

ElevenLabs Agents ليس ذلك. إنه خط معالجة، وخط المعالجة هو المنتج. يقوم نموذج تعرّف على الكلام في الوقت الفعلي بتفريغ كلام المتصل كتابةً، ويقرر نموذج لغوي ما ينبغي قوله، ويتلفظ نموذج تركيب — Eleven Flash v2 في الإعداد الذي توثقه ElevenLabs — بالإجابة. تُحتسب كل مرحلة على حدة، ويمكن استبدال كل مرحلة، ويقع كل ذلك خلف طبقة مُدارة تتعامل مع الاتصالات الهاتفية، وكشف أدوار المحادثة، والتزامن. أما ElevenLabs Eleven v3، نموذج التركيب الأبرز للشركة، فهو منتج مختلف مرة أخرى: نموذج تحويل النص إلى كلام بسعر 100 دولار لكل مليون حرف، يُباع للتعليق الصوتي والدبلجة وتصميم الأصوات بدلاً من خوض محادثة.

إذن، أول شيء يجب إدراكه هو أن "Gemini 3.8 Live مقابل ElevenLabs Eleven v3" ليس مواجهة مباشرة بين نموذجين للكلام. Eleven v3 لا يستقبل مدخلات صوتية ولا يجري محادثة. المقارنة ذات المعنى هي بين Gemini 3.8 Live وElevenLabs Agents، مع وجود Eleven v3 في المعادلة فقط كسقف جودة التركيب الذي بُنيت المنصة حوله.

أين يقع كل واحد منها فعليًا على اللوحة

لا توجد لوحة صدارة تصنّف هذين الاثنين مقابل بعضهما البعض، والسبب في ذلك جدير بالتأمل: فهما يواصلان الظهور في لوحات مختلفة تقيس أشياء مختلفة.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

في مؤشر Speech to Speech لدى Artificial Analysis — الذي يدمج الاستدلال الكلامي، وإنجاز المهام الوكيلية، وتفضيلات الساحة، ونجاح المهام في رقم واحد — يسجّل Gemini 3.8 Live نتيجة 76.0، فيما تحل نسخة Extended Thinking عند 82.6 في المركز الأول. هذه قياسات تُجريها Artificial Analysis وفق منظومة الاختبار الخاصة بها، وليست أرقامًا نشرتها Google، رغم أن إعلان Google نفسه يستشهد بأرقام من المكوّنات نفسها.

لا يظهر ElevenLabs على لوحة الصدارة تلك إطلاقًا، لأنه لا يطرح نموذجًا من الكلام إلى الكلام يمكن قياسه. أما حيث يظهر فهو في Speech Agent Arena، التي تقيّم وكلاء مُركّبين لا نماذج، والصورة هناك مختلطة حقًا: قِيسَ ElevenLabs Agents عند 937 Elo بمعدل نجاح في المهمة بلغ 90.5%، مقابل 1,046 Elo و74.6% نجاح في المهمة لوكيل مبني على الجيل السابق من Gemini Live، مع وصول وكيل Gemini إلى أول صوت في 0.96 ثانية. اقرأ هذين المعطيين بعناية. يتفوق الوكيل المدعوم من Gemini في التفضيل والسرعة؛ ويتفوق وكيل ElevenLabs في إنجاز المهمة. هذا نظام متسلسل (cascade) يتغلب على نموذج أصلي في الموثوقية، وهي النتيجة التي لا تتوقعها مخططات البنية.

هناك تحفظان على تلك الأرقام، وكلاهما مهم. استخدم جانب Gemini في تلك المقارنة جيل Gemini Live من أوائل 2026، وليس 3.8 Live، لذا فهو ليس قراءةً عن النموذج الذي يتناوله هذا المقال. واللوحة الثالثة المعنية — حلبة الكلام Provider Voices التابعة لـ Artificial Analysis، التي تصنّف نماذج التوليف — تضع ElevenLabs Eleven v3 عند 1,177 Eloوالنسخة المحادثية، ElevenLabs v3 Conversational، عند 1,219 Elo، مقابل 1,283 للمتصدر، Cartesia Sonic 3.6. تقيس تلك اللوحة مدى جودة الصوت، وليس مدى جودة أداء الوكيل، وخلط الاثنين هو ما ينتهي بالناس إلى اقتباس درجة توليف كدليل على نظام محادثة.

تباين المواصفات

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• البنية — Gemini 3.8 Live نموذج واحد أصلي للتحويل المباشر من الكلام إلى الكلام، في مقابل ElevenLabs Agents الذي هو سلسلة متتالية من التعرّف على الكلام ونموذج لغوي وتركيب الكلام

• الإدخال والإخراج — يستقبل Gemini 3.8 Live الصوت ويعيده صوتًا في تمريرة واحدة، مقابل ElevenLabs التي تستقبل الصوت عبر Scribe v2 Realtime وتعيده عبر Eleven Flash v2، مع نص مكتوب في ما بينهما

• ما يمكنك استبداله — Gemini 3.8 Live: لا شيء، فالنموذج هو النموذج؛ مقابل ElevenLabs: كل مرحلة بشكل مستقل، بما في ذلك النموذج اللغوي، الذي يُعد في المكدّس الموثّق أحد نماذج Google

• اللغات — Gemini 3.8 Live 97 مع التبديل أثناء المحادثة مقابل ElevenLabs Eleven v3 74

• تسعير الصوت — Gemini 3.8 Live $0.005 لكل دقيقة إدخال و$0.018 لكل دقيقة إخراج مقابل ElevenLabs المسعّر على دقائق الوكيل مع احتساب رموز نموذج اللغة بشكل منفصل إضافةً إلى ذلك

• الاتصالات الهاتفية — Gemini 3.8 Live: لا يوجد اتصال هاتفي من الطرف الأول؛ أنت توفر الناقل وإدارة الجلسة بنفسك، مقابل ElevenLabs المُدار من الطرف الأول.

• التزامن — Gemini 3.8 Live بحسب ما تسمح به حصة Live API لديك مقابل ElevenLabs التي تُباع ضمن طبقات للتزامن

• أدوات الوكلاء — أداة Gemini 3.8 Live الخلفية وتنفيذ API داخل النموذج مقابل ElevenLabs، وهي طبقة وكيل مُدارة تتضمن كشف نوبات التحدث، وسير العمل، ومكتبة أصوات

• مُخرَج مفتوح — لا هذا ولا ذاك. كلاهما مغلق، وسحابي فقط، ومملوك.

• زمن الاستجابة — Gemini 3.8 Live: 1.18 ثانية حتى أول صوت للنموذج القياسي و1.35 لـ Extended Thinking، وفقًا لـ Artificial Analysis؛ في المقابل، لم تنشر ElevenLabs رقمًا واحدًا، لأن زمن استجابة النظام المتتالي هو مجموع ثلاث مراحل

الصف الأخير هو الذي يشرح خيار البنية أفضل من أي صف آخر. النموذج الأصلي لديه ميزانية زمن استجابة واحدة. أما البنية المتسلسلة فلديه ثلاث، والسبب في أن الفرق ما زالت تختار البنية المتسلسلة هو كل ما يسبقها: النص المكتوب الذي يمكنك تسجيله، والمرحلة التي يمكنك استبدالها، ورقم الهاتف الذي يعمل ببساطة.

تكلفة الدقيقة، في كلا الاتجاهين

حساب Gemini 3.8 Live سهل بشكل غير معتاد لأن هناك مقياس واحد فقط. دقيقة من المحادثة تساوي تقريبًا دقيقة من صوت المتصل بالإضافة إلى دقيقة من صوت النموذج: $0.005 زائد $0.018، أي نحو 2.3 سنت في الدقيقة بالسعر المنشور. يضع عمود التكلفة لكل ساعة لدى Artificial Analysis، الذي يوحّد تكلفة إكمال مجموعة ثابتة من الاستدلال الصوتي إلى رقم بالساعة، النموذج القياسي عند $0.84 لكل ساعة من الصوت المُدخل — أرخص سعر مدفوع في ذلك الجدول — ونسخة Extended Thinking عند $3.50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

حساب ElevenLabs أصعب، وهذا هو المقصود لا نقد له. دقيقة الوكيل ليست سعراً واحداً: فهناك رسوم المنصة على دقيقة الوكيل نفسها، ورموز نموذج اللغة المستهلكة في الجزء الأوسط، ودقائق الناقل تحتها — ثلاث عدادات، وثلاثة موردين في أسوأ الحالات، وفاتورة تتحرك عندما يتحرك أيٌّ منها. أما جانب التخليق فهو أكثر وضوحاً: ElevenLabs Eleven v3 بسعر 100 دولار لكل مليون حرف يبلغ نحو 8 دولارات للساعة من السرد المتواصل بمعدلات الكلام العادية، مقابل نحو 2.70 دولار لأرخص منافس مفتوح الأوزان على الساحة نفسها. تتقاضى ElevenLabs علاوة مقابل الصوت، وعلى تلك اللوحة فإن العلاوة حقيقية — فهي تحتل المرتبة الرابعة إجمالاً.

ما تعنيه هيكلتا التكلفة هاتان عمليًا هو أن Gemini 3.8 Live أرخص لكل دقيقة محادثة، وأرخص بكثير لكل ساعة صوت، بينما ElevenLabs أغلى وأكثر قابلية للتنبؤ بكثير من حيث التشغيل. الفريق الذي لا يضم مهندسي تعلّم آلة ولديه رقم هاتف يحتاج إلى تشغيله سينفق أقل على ElevenLabs في الشهر الأول، لأن البديل هو بناء ما بنته ElevenLabs بالفعل. الفريق الذي يدير بالفعل إدارة الجلسات الخاصة به وشركة الاتصالات الخاصة به سينفق أقل على النموذج الخام، لأنه لا يدفع مقابل خط أنابيب يمتلكه بالفعل.

ما الذي تتفوق فيه ElevenLabs حقًا

قد يكون من السهل قراءة فجوة السعر كأنها حكم نهائي. لكنها ليست كذلك، والأسباب هي تلك التي لا تُظهرها بطاقة الأسعار أبدًا.

• الاتصالات الهاتفية. تبيع ElevenLabs أرقام الهواتف، وربط SIP، والقدرة على الرد على المكالمات بشكل متزامن. وتبيع Google نموذجًا يتحدث. إذا كان منتجك عبارة عن خط هاتف، فإن الفجوة بين هاتين الجملتين تمثل أشهرًا من العمل الهندسي.

• هوية الصوت. تُعد Voice Library وخط أنابيب الاستنساخ واستوديو الدبلجة سطح منتج ناضج. يمنحك Gemini 3.8 Live نموذجًا؛ لكنه لا يمنحك كتالوجًا من الأصوات المرخّصة أو سير عمل لتوطين تسجيل موجود إلى تسع لغات.

• نص مكتوب افتراضيًا. ولأن النظام المتتالي يفرّغ الكلام إلى نص قبل أن يستنتج، تحصل على سجلات نصية لكل مكالمة مجانًا — وهي مفيدة للامتثال، وللتقييم، وللعمل غير اللامع المتمثل في معرفة سبب خطأ الوكيل في شيء ما. ولا يملك نموذج الكلام إلى الكلام الأصلي أثرًا كهذا إلا إذا بنيت واحدًا.

• أجزاء قابلة للاستبدال. عندما يصدر نموذج لغوي أفضل، يمكن لسلسلة ElevenLabs أن تتبنّاه دون إعادة تدريب أي شيء. ولهذا السبب تحديدًا يضمّ المكدّس الموثَّق نموذج Google في وسطه — وهي أقوى حجة منفردة لصالح معمارية السلسلة.

ما الذي يمنحك إياه النموذج الخام

الحجة المضادة لا تتعلق بالسعر، بل بما يمكن لتمريرة أمامية واحدة أن تفعله ولا تستطيع ثلاث مراحل فعله.

يسمع Gemini 3.8 Live التنغيم والنبرة والتردد مباشرةً، لا من خلال نص مكتوب يكون قد تخلّى عنها بالفعل؛ ولهذا يستطيع التبديل بين اللغات في منتصف الجملة، ولهذا فإن درجة ديناميكيات المحادثة لديه — 96.1% للطراز القياسي، وفق Artificial Analysis — هي المكوّن الوحيد الذي يتفوق فيه على شقيقه كثيف الاستدلال. كما ينفّذ استدعاءات الأدوات وواجهات API في الخلفية بينما يواصل الكلام، فلا يؤدي البحث إلى صمت. وتُعدّ نسخة Extended Thinking قدرة مختلفة حقًا، لا نسخة أكبر من القدرة نفسها: فهي تحلّ 68.6% من سيناريوهات خدمة العملاء في τ-Voice مقابل 30.1% للطراز القياسي، أي بفارق 38 نقطة هو أكبر رقم منفرد في الإصدار، وهو السبب الذي دفع Google إلى تقسيم الخط إلى خطين.

إذا كانت وظيفة وكيلك هي إتمام مهمة متعددة الخطوات لا خوض محادثة ممتعة، فإن تلك الفجوة البالغة 38 نقطة هي القرار بأكمله، ويكلف 3.50 دولارات في الساعة بدلاً من 0.84 دولار — أي أنه لا يزال أقل تكلفة من كل نموذج يتفوق عليه في تلك اللوحة.

الساق الوسطى هي التي يمكنك تحريكها فعليًا.

هنا يكمن الخط الفاصل الجدير بالتسمية، لأنه النقطة التي يتحول عندها سؤال البنية المعمارية إلى سؤال شرائي. في نظام متتالٍ، تكون المرحلة الوسطى — الجزء الذي يقرر ما يُقال، ويستدعي الأدوات، ويقوم بالاستدلال — مجرد استدلال نصي عادي. وهي أيضًا المرحلة الأكثر تباينًا في التكلفة، والأكثر ارتباطًا بمورّد واحد، والأقل مبررًا للارتباط بأي بائع بعينه. حزمة التقنيات التي توثّقها ElevenLabs تصادف أنها تستخدم نموذج Gemini هناك. لكن ليس بالضرورة أن تفعل ذلك.

تغطي OrcaRouter هذا الجزء وليس الطرفين الخارجيين. نحن لا نستضيف نقاط نهاية الصوت Gemini 3.8 Live — فهي تأتي من Live API الخاصة بجوجل — ولا نستضيف ElevenLabs، التي تُعد طبقَتا التركيب والوكيل فيها منتجها الخاص. ما نقدمه هو طبقة النص الكامنة تحتها: أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش إضافي، لذا يصل أي تخفيض سعري من مختبر في المنبع إلى فاتورتك في اليوم نفسه بدلًا من التجديد التالي. وبالنسبة إلى حزمة صوتية تحديدًا، هناك ثلاث من هذه الخصائص تثبت قيمتها. يحافظ التبديل التلقائي عند الفشل على استمرار المكالمة عندما يحدث خطأ في خدمة خلفية أو تنتهي مهلتها في منتصف الجملة، وهو عطل يلاحظه المتصل على الفور. ويجمع DSL للتوجيه عدة نماذج في مكالمة واحدة، فيمكن لنموذج رخيص التعامل مع أدوار الإقرار بينما يتولى نموذج أقوى المعاملة. كما يتيح دمج النماذج للوحة من النماذج أن تجيب معًا في الأدوار التي لا يكون فيها حكم نموذج واحد جيدًا بما يكفي للثقة به وحده. تغيير النموذج الذي يقع في منتصف السلسلة هو تغيير في الإعدادات، لا إعادة بناء — وهذا هو السبب الكامل وراء وجود بنية السلسلة.

أي واحدة تختار؟

اختر ElevenLabs إذا كنت تُطلق خط هاتف ولا تريد بناء حزمة صوتية بنفسك. فأنت تشتري خدمات الاتصال الهاتفي، وكتالوج أصوات، ونصوصًا مكتوبة، وقدرة على المعالجة المتزامنة، وعقد دعم، والرسوم الإضافية لكل دقيقة هي ما تكلّفه هذه الأشياء. كما أنك تشتري القدرة على تغيير النموذج في منتصف الطريق دون تغيير أي شيء آخر، وهذه ميزة تستحق أكثر مما تبدو عليه.

اختر Gemini 3.8 Live إذا كان الصوت ميزةً في شيء تديره بالفعل. فأنت تحصل على أرخص معدل كفء للتحويل من الكلام إلى الكلام ينشره أي أحد حالياً، و97 لغة مع التبديل أثناء المحادثة، وتنفيذ أدوات يعمل بينما يواصل النموذج التحدث، و—إذا كان وكيلك مضطراً إلى إكمال المهام بدلاً من مجرد التحادث—فجوة قدرات الوكيل البالغة 38 نقطة التي تشتريها نسخة Extended Thinking مقابل نحو أربعة أمثال تكلفة الصوت بالساعة. أنت توفّر الناقل ودورة حياة الجلسة والسجلات.

ما يجب متابعته: ما إذا كانت ElevenLabs تنشر رقمًا واحدًا لزمن الاستجابة لدقيقة وكيل مُدار، لأن هذا هو الرقم الذي سيجعل هذه المقارنة كمية بدلًا من هيكلية؛ وما إذا كانت نتيجة Speech Agent Arena تصمد عندما يُقاس وكيل مبني على 3.8 Live عليها، لأن نظام تتالي يتفوق حاليًا على نموذج أصلي في نجاح المهمة هو أكثر شيء مثير للاهتمام في هذه المواجهة وأقلها تفسيرًا.