بطاقة العنوان الرئيسية لـ«GPT-Live-1 مقابل ElevenLabs»، بعنوان فرعي «نموذج واحد متكامل من الطرف إلى الطرف مقابل مكدس متتالي، يُقاس عند نقطة التقائهما الفعلية»، وتحمل ثلاث بطاقات نصها «GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، ازدواج كامل، بلا استنساخ»، «ElevenLabs Agents: Elo 937 في Speech Agent Arena، ونجاح المهام 90.5%»، «ElevenLabs Eleven v3: أكثر من 70 لغة، وأكثر من 10,000 صوت من المكتبة»، فوق شريط تذييل نصه «أرقام Arena وفقًا لـ Artificial Analysis؛ والأسعار وفقًا لوثائق المورّد، سبتمبر 2026». شعار OrcaRouter مُدمج في الزاوية السفلى اليمنى.
Guides & Insights

GPT-Live-1 مقابل ElevenLabs: نموذج واحد يستمع، وشركة واحدة تبيع كل شيء آخر

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الرقم الأكثر فائدة في هذه المقارنة هو 90.5%. فهو معدل نجاح المهام الذي قاسه Artificial Analysis لـ ElevenLabs Agents في Speech Agent Arena — الأعلى ضمن المراكز الستة الأولى في تلك اللوحة، وقد حققه نظام ليس نموذجًا واحدًا على الإطلاق، بل سلسلة من التعرف على الكلام ونموذج لغوي ومُركّب صوتي ربطتها معًا منطق تناوب الأدوار الخاص بـ ElevenLabs. لا يظهر GPT-Live-1، النموذج ثنائي الاتجاه الكامل من طرف إلى طرف من OpenAI، في تلك اللوحة، لأنه ينافس في لوحة مختلفة: مؤشر Speech to Speech، حيث يحتل المركز السادس مناصفةً من أصل أربعة عشر بنسبة 70.3%. وفي الوقت نفسه، يظل ElevenLabs Eleven v3 الصوت الإنتاجي الأكثر انتشارًا في الصناعة، مع أكثر من 10,000 صوت في مكتبته وأكثر من 70 لغة.

المعنى المختصر هو أن أحد الجانبين يبيعك محادثة، بينما يبيعك الجانب الآخر شركة. هذا الاختصار صحيح في معظمه، لكنه يخفي تحته اكتشافًا أكثر إثارة للاهتمام: فالنظام المتسلسل المحكم الهندسة لا يزال يتفوق على نموذج أصلي كامل الازدواجية في إنجاز المهمة.

معماريتان، والفرق يكمن في مواضع الفواصل.

GPT-Live-1 هو نموذج واحد يستقبل الصوت والنص ويُخرج الصوت والنص. يتعامل مع المقاطعة بشكل أصلي — فاختبارات Open​AI الخاصة، المنشورة مع إصدار واجهة برمجة التطبيقات في سبتمبر وغير المُعاد إنتاجها خارج الشركة، تفيد بتفاعلية تبلغ 80.1% على Full Duplex Bench v1.5 مقابل 45.4% لـ GPT-Realtime-2.1، وزمن استجابة لتبادل الأدوار يبلغ 0.798 ثانية مقابل 1.41. لا توجد أي فواصل، لأنه لا يوجد ما يمكن وصله معًا.

إن ElevenLabs Agents هو الرهان المعاكس، بشكل متعمد. يصف توثيق ElevenLabs مسارًا: التعرف على الكلام المُعاير، ونموذج لغوي تختاره أو تجلبه بنفسك، ومُخلّق منخفض الكمون — عادةً ما يكون شيئًا من سلسلة Flash — ونموذج مملوك لتناوب الأدوار في الأعلى. المقاطعة (Barge-in) هي إعداد لكل وكيل يكشف عن مدى الاستعداد للدور والمهلات الزمنية بدلاً من كونها خاصية للنموذج. في التكوين الافتراضي المُقاس في Artificial Analysis، تتضمن الحزمة Scribe v2 Realtime للتعرف على الكلام، ونموذج Gem​ini للاستدلال، و Eleven Flash v2 للتخليق.

لهذا التصميم ميزة هائلة وتكلفة بنيوية واحدة. الميزة هي أن كل مرحلة قابلة للاستبدال: نموذج رخيص للأدوار البسيطة، ونموذج متقدم للأدوار الصعبة، ومُركّب مختلف لمنطقة مختلفة. أما التكلفة فهي أن زمن الاستجابة يتراكم عند كل نقطة التحام، ويجب اتخاذ قرار تناوب الأدوار من الخارج.

بُعدًا بُعدًا

• الهندسة المعمارية — {{1}}GPT-Live-1{{/1}}: {{2}}نموذج واحد شامل من طرف إلى طرف، صوت داخل وصوت خارج{{/2}} مقابل {{3}}ElevenLabs Agents{{/3}}: {{4}}التعرف على الكلام ونموذج لغوي وتركيب متتالية مع طبقة تناوب أدوار خاصة{{/4}}

• أدلة مستقلة — GPT-Live-1: 70.3% على Artificial Analysis Speech to Speech Index، بالمناصفة في المركز السادس من أصل أربعة عشر مقابل ElevenLabs Agents: Elo 937 على Speech Agent Arena بمعدل نجاح للمهام يبلغ 90.5% عبر 676 عيّنة، وهو أفضل معدل نجاح ضمن المراكز الستة الأولى في تلك اللوحة

• لوحات الجودة — GPT-Live-1: غير مُصنَّف في ساحات تحويل النص إلى كلام، لأنه نوع مختلف من النماذج مقارنةً بـ ElevenLabs: Eleven v3 Conversational عند 1,194 Elo وEleven v3 عند 1,166 على لوحة Provider Voice، بسعر 50 دولارًا و100 دولار لكل مليون حرف على الترتيب

• السعر — GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، تُفوتر بالثانية، ويُقاس الاستدلال الخلفي بشكل منفصل مقابل ElevenLabs: نحو 50 دولارًا لكل مليون حرف لـ Eleven v3 Conversational وحوالي 100 دولار لـ Eleven v3، مع الإبلاغ عن الوكلاء بنحو 0.08 دولار في الدقيقة، ويرتفع عند تجاوز سقف التزامن، وتُفوتر تكاليف نموذج اللغة والاتصالات الهاتفية بشكل منفصل

• زمن الاستجابة — GPT-Live-1: لا يوجد زمن منشور على مستوى النموذج للوصول إلى أول مقطع صوتي؛ 0.798 ثانية زمن استجابة تبادل الأدوار في اختبارات المورّد مقابل ElevenLabs: نحو 75 مللي ثانية لـ Flash v2.5 ونحو 280 مللي ثانية لـ Eleven v3 Conversational، مع إرشادات المورّد بأقل من 800 مللي ثانية للوصول إلى أول مقطع صوتي على مستوى الوكيل

• الأصوات والاستنساخ — GPT-Live-1: اثنا عشر إعدادًا مسبقًا لواجهة برمجة التطبيقات، بلا استنساخ بحكم التصميم مقابل ElevenLabs: أكثر من 10,000 صوت في المكتبة، واستنساخ فوري من عيّنة قصيرة، واستنساخ احترافي من 30 إلى 180 دقيقة من الصوت مع التحقق الذاتي

• اللغات — GPT-Live-1: اللغات الرئيسية مخدومة جيدًا، مع تفاوت في الطلاقة خارجها في تغطية الإطلاق، مقابل ElevenLabs Eleven v3: أكثر من 70 لغة، مقابل 32 لخط Flash وأكثر من 90 للتعرف على الكلام الخاص به.

• الاتساع — GPT-Live-1: نقطة نهاية واحدة، ومعرّف نموذج واحد، ومستويات تزامن من 25 إلى 500 جلسة، ولا توجد طبقة مجانية، مقابل ElevenLabs: تخليق الصوت، والتعرّف على الكلام، والدبلجة، والمؤثرات الصوتية، والموسيقى، وسوق للأصوات، ومنصة وكلاء ضمن عقد واحد، مع طبقة مجانية لا تحمل ترخيصًا تجاريًا

A two-column comparison scoreboard titled 'GPT-Live-1 vs ElevenLabs — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Architecture: one end-to-end full-duplex model', 'Price: $0.05 per voice minute plus backend', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning', 'Best at: interruption handling'. The right column, labelled ElevenLabs, reads 'Architecture: cascaded STT + LLM + TTS', 'Price: ~$50 to $100 per 1M characters; agents ~$0.08 per minute', 'Independent score: Elo 937 on the AA Speech Agent Arena, 90.5% task success', 'Latency: ~75 ms Flash v2.5, ~280 ms v3 Conversational (vendor)', 'Voices: 10,000+ library voices, cloning with verification', 'Best at: platform breadth and voice quality'. The footer reads 'ElevenLabs agent pricing is third-party reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Artificial Analysis Speech Agent Arena leaderboard, ranking cascaded voice-agent systems by Elo and task success rate. The top rows read Gemini 3.1 Flash Live Minimal at 1,046 Elo over 768 samples with a 74.6% task success rate, Gemini 3.1 Flash Live High at 1,014 with 71.8%, GPT-Realtime-1.5 at 1,000 with 85.1%, GPT Realtime (Aug '25) at 944 with 89.4%, and ElevenLabs Agents, labelled 'Default Cascaded System', at Elo 937 over 676 samples with a task success rate of 90.5% — the highest in the top six. The board continues with Amazon Bedrock Nova 2.0 Sonic at 917 and Grok Voice Think Fast 2.0 High at 908 with a 94.7% success rate.

حيث لا تكون ElevenLabs متقدمة فحسب، بل بلا منازع

ثلاث من الفجوات في تلك القائمة ليست متقاربة، وأي مقارنة تكتفي بجملة واحدة لها إنما تُجحف بحق صاحب المنصب الحالي.

الاستنساخ هو الأول. يوفّر GPT-Live-1 اثني عشر إعدادًا مسبقًا، وبحكم التصميم، لا استنساخ على الإطلاق — موقف سلامة متعمّد وليس ميزة ناقصة. تقدّم ElevenLabs استنساخًا فوريًا من عيّنة مرجعية قصيرة، واستنساخًا احترافيًا مدرّبًا على ما بين 30 و180 دقيقة من الصوت، مشروطًا بمستويات الخطط وخطوة تحقق ذاتي. إذا كان صوت منتجك جزءًا من هويته، فهذا ليس بُعدًا يتنافس فيه GPT-Live-1.

تأتي مكتبة الأصوات في المرتبة الثانية. فأكثر من 10,000 صوت، بالإضافة إلى سوق مرخّصة لأصوات أيقونية من التركات والمؤدّين، أصل لا تحاكيه أي إصدارة نموذج. وهو أيضاً الأمر الذي يستهين به المشترون أكثر من أي شيء آخر: فاختيار الصوت هو الميل الأخير في منتج صوتي، وامتلاك عشرة آلاف صوت للاختيار منها يختصر تمرين بناء علامة تجارية إلى ظهيرة واحدة.

الثالث هو الاتساع. التعرّف على الكلام، والدبلجة، والمؤثرات الصوتية، والموسيقى، ومنصة وكلاء — الفريق الذي يحتاج أربعة من هذه يشتري عقدًا واحدًا بدل أربعة. هذه ميزة استراتيجية، لا ميزة جودة، وتظل قائمة حتى إذا فاز الطرف الآخر بمعيار قياسي.

تحمل كلتا الشركتين أسئلة حوكمة مكانها مراجعة المشتريات لا حاشية. يتطلب الاستنساخ الاحترافي لدى ElevenLabs تحققًا ذاتيًا، وتحظر شروطها استنساخ صوت شخص آخر حتى مع الموافقة؛ كما تواجه الشركة مجموعة دعاوى جماعية رُفعت في مايو 2026 بشأن الموافقة على بيانات التدريب، وهي مزاعم غير مثبتة. موقف Open​AI أبسط لأنه أزال الميزة التي تولّد الخطر.

A screenshot of ElevenLabs' official models documentation page, describing Eleven v3 under a 'Flagship models' heading as 'Our most emotionally rich, expressive speech synthesis model', with the supporting lines 'Dramatic delivery and performance', '70+ languages supported', '5,000 character limit' and 'Support for natural multi-speaker dialogue'. The surrounding navigation lists ElevenLabs' wider product set, including text to speech, speech to text, music, text to dialogue, dubbing, sound effects, voices and voice agents.

ضريبة التعاقب، وأين يستحق دفعها

تظهر تكاليف التسلسل في صورة زمن استجابة وفي صورة تنسيق. وتضع إرشادات المورّد الخاصة بـ ElevenLabs زمن الوصول إلى أول صوت لدى الوكيل دون 800 مللي ثانية عند الوسيط ودون 1.5 ثانية عند المئين 95 — وهي أرقام تصف خط الأنابيب بأكمله، لا الـ75 مللي ثانية الخاصة بالمُخلّق الصوتي. ويُضاف فوق ذلك زمن توليد النموذج اللغوي وزمن عبور الشبكة. يمكن تعويض بعض ذلك باختيار مراحلك بعناية؛ لكن لا شيء منه مجاني.

فاتورة التنسيق أخفّ وطأةً لكنها حقيقية. فكل مرحلة إضافية هي موضع آخر يمكن أن يفشل فيه استدعاء، ومهلة إضافية يجب ضبطها، ومورّد آخر يجب مطابقة الفواتير معه. وهذا هو الجزء الذي يزيله نموذج أصلي شامل من طرف إلى طرف بالكامل: هناك شيء واحد يمكن أن يتعطّل، وإما أن يجيب أو لا.

الموضع الذي تبرّر فيه هذه السلسلة المتتالية تكلفتها هو المرحلة الوسطى. فالنموذج اللغوي الذي يقف خلف وكيل صوتي هو المكوّن الذي تتحسّن جودته بأسرع وتيرة ويتفاوت سعره أكثر من أي مكوّن آخر، والقدرة على استبداله دون المساس بالطبقة الصوتية تستحق مالًا حقيقيًا على مدى عمر المنتج. نحو 190 نموذجًا من أحد عشر مزوّدًا upstreamتقف خلف مفتاح OrcaRouter واحد بسعر قائمة المزوّد دون أي هامش إضافي، لذا يصل أي تغيير في سعر المزوّد إلى تلك الطبقة في اليوم نفسه، ويحول التبديل التلقائي دون أن يؤدي انقطاع في الواجهة الخلفية إلى إنهاء مكالمة جارية. لا يمكن الوصول إلى حزمة الوكلاء من ElevenLabs ولا إلى نقطة Live Sessions في GPT-Live-1 بهذه الطريقة — فطبقات الصوت مملوكة لبائعيها، وهذه هي الطبقة الواقعة تحتها.

أي واحدة تختار؟

اختر GPT-Live-1 إذا كانت آليات المحادثة هي المنتج وتريد عقدًا واحدًا بنمط فشل واحد. خطوط هاتفية يتحدث فيها المتصلون فوق الوكيل، وحيث يكون التسليم الطبيعي أهم من الصوت المثالي، وحيث تكفي اثنتا عشرة صوتًا جيدًا. أنت تقبل نموذجًا مستضافًا مغلقًا، بلا استنساخ، وبجودة مستقلة متوسطة، وبلا طبقة مجانية لبناء النماذج الأولية عليها.

اختر ElevenLabs إذا كان القيد هو جودة الصوت أو الاستنساخ أو الاتساع. السرد، والدبلجة، والمنتجات متعددة اللغات، وأي شيء يكون فيه الصوت هو العلامة التجارية، وأي شيء يحتاج إلى التعرف على الكلام في العقد نفسه. أنت تقبل تشغيل بنية متتالية، وأسعارًا تبلغ نحو عشرة إلى عشرين ضعف سعر GPT-Live-1 لكل وحدة كلام، وأن منطق المقاطعة مسؤوليتك في ضبطه ومسؤوليتك إن أخطأت فيه.

نسبة 90.5% هي الجزء الجدير بأن نأخذه معنا. فهي تقول إن شركة جمّعت ثلاثة نماذج وطبقةً لتناوب الأدوار تفوّقت على شركة درّبت نموذجًا واحدًا ليقوم بكل ذلك، وفق المقياس الأقرب إلى ما إذا كانت المكالمة قد نجحت. إن الازدواج الكامل تقدّم معماري حقيقي، وهو ليس — بناءً على الأدلة الحالية — الشيء الذي يحدد ما إذا كان المتصل ينال ما أراده.