بطاقة عنوان رئيسية لـ 'GPT-Live-1 مقابل Cartesia Sonic 3.6'، مع عنوان فرعي 'أفضل صوت ليس هو الذي يمكنه سماعك'، تحمل ثلاث بطاقات مكتوب عليها 'Cartesia Sonic 3.6: 1,275 Elo، المركز الأول في كلتا ساحتي الكلام لدى Artificial Analysis'، 'GPT-Live-1: 70.3% في Speech to Speech Index، المركز السادس مناصفةً من 14'، 'لوحات نتائج مختلفة، لأنها تقيس أشياء مختلفة'، فوق شريط تذييل مكتوب عليه 'أرقام الساحات وفقًا لـ Artificial Analysis؛ أرقام التفاعل الخاصة بـ GPT-Live-1 مُبلَّغ عنها من OpenAI.' شعار OrcaRouter مُركَّب في الزاوية اليمنى السفلى.
Guides & Insights

GPT-Live-1 مقابل Cartesia Sonic 3.6: لوحة TTS الأولى لا تقيس المقاطعة

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

تتصدّر Cartesia Sonic 3.6 حاليًا كلاً من ساحتَي تحويل النص إلى كلام لدى Artificial Analysis — 1,275 إيلو في لوحة Provider Voice والمركز الأول في لوحة Controlled Voice أيضًا، متقدمةً على كل محرك تجاري تحيط به منصة أكبر. أما GPT-Live-1 فغير مُدرَج في أيٍّ منهما، لأنه ليس نموذج تحويل النص إلى كلام. وهو يحتل المركز السادس مناصفةً من أصل أربعة عشر في لوحة مختلفة لدى Artificial Analysis، هي Speech to Speech Index، بنسبة 70.3%. وعند قراءة هاتين الحقيقتين معًا، فإنهما تصفان الانقسام الفعلي بين هذين المنتجين: من المرجح جدًا أن Sonic 3.6 هو الصوت الأفضل، وGPT-Live-1 هو الوحيد من بينهما القادر على سماع المتصل يبدأ الحديث ويتوقف.

كلاهما يعمل الآن وكلاهما متاح تجاريًا — Sonic 3.6 على واجهة برمجة التطبيقات الخاصة بـ Cartesia منذ صدور نسخته المستقرة في 27 أغسطس 2026، وGPT-Live-1 على واجهة برمجة تطبيقات المطورين الخاصة بـ OpenAI منذ 10 سبتمبر 2026، مقابل 0.05 دولار لكل دقيقة صوتية. الاختيار بينهما ليس قرارًا يتعلق بالجودة. إنه قرار بشأن أي نصف من وكيل صوتي تشتريه.

ساحتان، وسؤالان، ولماذا كان الانقسام حقيقيًا

تُجري Artificial Analysis لوحاتها الصوتية بطريقة يجدر فهمها قبل أن يستشهد أحد أمامك بأيٍّ من تصنيفَي Elo. تُرتّب ساحة Provider Voice المحرّكات باستخدام الأصوات الأصلية الخاصة بكل مورّد — فهي تقيس الصوت الذي تحصل عليه فعليًا خارج الصندوق، وهو الرقم الذي يهم المشتري. أما ساحة Controlled Voice فتستنسخ كل نموذج على الأصوات المرجعية الثمانية نفسها، ليقارن المستمعون محرّك التخليق الصوتي بدلًا من موهبة الصوت. يتصدّر Sonic 3.6 كلتيهما، وهو أمر أندر مما يبدو: فقد كان لكل من اللوحتين بطل مختلف خلال معظم عام 2026.

لا تحتوي أي من اللوحتين على عيّنة واحدة لنموذج يتم مقاطعته. فهما يقيسان كيف يبدو الكلام، بمعزل عن غيره، للمستمع. أما Speech to Speech Index فمبنيّ بشكل مختلف — فهو يدمج الاستدلال الكلامي، والأداء الوكيلي، وتفضيلات الساحة، ونجاح المهام في رقم واحد، ولا يقبل إلا النماذج التي تكون أصلاً من الكلام إلى الكلام. لا يوجد لـ Cartesia أي إدخال هناك. ليس لأن Sonic 3.6 سيئ، بل لأن محرك تحويل النص إلى كلام لا يملك شيئاً يقدّمه.

إذن، فإن الرقم 1,275 ونسبة 70.3% ليسا رقمين متنافسين، وأي مقارنة تضعهما في سطر واحد إنما تكذب عليك في صمت. وما يثبتانه معًا هو أن الجودة لم تعد المحور الذي يدور حوله هذا القرار.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

بُعدًا بُعدًا

• Kind — GPT-Live-1: تحويل الكلام إلى كلام ثنائي الاتجاه كامل، نموذج واحد للحلقة بأكملها مقابل Cartesia Sonic 3.6: تحويل النص إلى كلام متدفق، مقترنًا بالتعرف على الكلام Ink-2 للوكلاء

• جودة مستقلة — GPT-Live-1: 70.3% في مؤشر Speech to Speech، بالمناصفة في المركز السادس من أصل أربعة عشر مقابل Cartesia Sonic 3.6: 1,275 Elo في لوحة Provider Voice، من 1,755 عيّنة، والأول أيضًا في لوحة Controlled Voice

• التعامل مع المقاطعة — GPT-Live-1: خاصية للنموذج، تقرر عدة مرات في الثانية ما إذا كان يتنازل عن الدور، مقابل Cartesia Sonic 3.6: نمط تكامل، حيث يُلغي العميل سياق التركيب ويعتمد على الطوابع الزمنية على مستوى الكلمة للقطع في اللحظة المناسبة

• السعر — GPT-Live-1: 0.05 دولار لكل دقيقة صوتية، تُحتسب لكل ثانية، الواجهة الخلفية للاستدلال تُقاس بشكل منفصل مقابل Cartesia Sonic 3.6: حوالي 49 دولارًا لكل مليون حرف ضمن خطط الائتمان، بالإضافة إلى 0.06 دولار لكل دقيقة من مدة مكالمة الوكيل و0.014 دولار لكل دقيقة لرقم هاتف Cartesia.

• زمن الاستجابة — GPT-Live-1: لم يُنشر أي رقم على مستوى النموذج؛ زمن استجابة تبادل الأدوار المذكور هو 0.798 ثانية في اختبارات OpenAI الخاصة، مقابل Cartesia Sonic 3.6: أقل من 90 مللي ثانية للوصول إلى أول صوت، وهو رقم معلن من المورّد وليس قياسًا مستقلًا من طرف إلى طرف.

• الإنتاجية — GPT-Live-1: جلسات متزامنة، بحد أقصى 25 في الطبقة 1 و500 في الطبقة 5، مع عدم وجود طبقة مجانية، مقابل Cartesia Sonic 3.6: نحو 132 حرفًا في الثانية، أي ضعف معدل ElevenLabs v3 تقريبًا في المقارنة نفسها، مع طبقة مجانية تبلغ 20,000 رصيد شهريًا

• اللغات — GPT-Live-1: طلاقة غير متساوية خارج اللغات الرئيسية في تغطية الإطلاق مقابل Cartesia Sonic 3.6: 44 لغة عبر 61 منطقة لغوية، مع إضافة الأودية والأردية في هذا الإصدار

• التحكم الصوتي — GPT-Live-1: اثنا عشر إعدادًا مسبقًا، والنبرة والوتيرة عبر التوجيه النصي، ولا استنساخ، مقابل Cartesia Sonic 3.6: أكثر من 500 صوت مُعدّ مسبقًا، واستنساخ فوري، واستنساخ احترافي في المستويات الأعلى، وطوابع زمنية للكلمات والفونيمات، ولا SSML — يتكيف النموذج مع الوتيرة من النص نفسه

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

المقاطعة سمة من سمات البنية، لا مجرد مربع اختيار.

أكثر خطأ شائع يقع فيه المشترون بشأن هذه المقارنة هو التعامل مع دعم المقاطعة كقيمة منطقية. توثيق Cartesia صريح بشأن كيفية عمل نسختها من هذه الميزة: عندما يتحدث المتصل متجاوزًا صوت الوكيل، يرسل العميل إلغاءً لسياق التوليف الحالي، والطوابع الزمنية على مستوى الكلمة التي تُعاد عبر اتصال WebSocket هي ما يتيح لك إيقاف التشغيل عند المقطع الصوتي الصحيح. هذا تصميم متقن، وهكذا تتعامل معظم وكلاء الصوت في بيئات الإنتاج مع المقاطعة اليوم.

لا يزال هذا تصميمًا يُتخذ فيه قرار التوقف عن الكلام داخل تطبيقك، باستخدام إشارة النشاط الصوتي، وبأي زمن استجابة يسمح به الذهاب والإياب. أما GPT-Live-1 فينقل هذا القرار إلى داخل النموذج. فهو يقرر باستمرار ما إذا كان يواصل الإنصات، أو يتوقف مؤقتًا، أو يأخذ الدور، أو يسلّمه، ولهذا تُفيد أرقام OpenAI نفسها بتفاعلية تبلغ 80.1% مقابل 45.4% لـ GPT-Realtime-2.1 على Full Duplex Bench v1.5، مع زمن استجابة لتبادل الأدوار يبلغ 0.798 ثانية مقابل 1.41. هذه الأرقام أرقام OpenAI، نُشرت مع الإصدار ولم يُعِد إنتاجها أي طرف من خارج الشركة — لكن الفرق المعماري الكامن وراءها ليس محل نزاع، وهو الأمر الوحيد الذي لا يمكن لنظام تتابعي أن يقاربه عبر الضبط.

مكمن تفوق التتابع هو كل ما يأتي بعد الجملة. زمن الوصول إلى أول صوت لدى Cartesia، البالغ أقل من 90 مللي ثانية، هو رقم معلن من البائع، وهو يقيس النموذج، وليس المحادثة: الرقم الذي يشهده المتصل يتضمن أيضًا التعرف على الكلام، وكشف أدوار الحديث، وزمن توليد النموذج اللغوي، ونقل الشبكة، والتخزين المؤقت للصوت. وهذا بالضبط هو سبب استحقاق التتابع للبناء عندما تحتاج إلى التحكم في كل مرحلة — نموذج صغير سريع للأدوار البسيطة، ونموذج متقدم للأدوار الصعبة، ومُركِّب صوتي لا يجعلك تنتظر أبدًا.

تلك المرحلة الوسطى هي الجزء الوحيد في أي من المكدسين القابل للنقل فعلًا، وهي الجزء الذي يحدد جودة المكالمة وتكلفتها معًا. ونحو 190 نموذجًا من أحد عشر مزودًا في السلسلة العليا يقبع خلف مفتاح OrcaRouter واحد بسعر قائمة المزوّد دون أي هامش ربح، كما تتيح لغة التوجيه DSL لنقطة نهاية واحدة أن ترسل الأدوار البسيطة إلى نموذج رخيص وأن تصعّد الأدوار المعقدة إلى نموذج رائد — وهو النمط الذي يريده وكيل صوتي فعليًا، مطبَّقًا على المرحلة الأكثر تغيرًا. لا يمكن الوصول إلى Sonic 3.6 ولا GPT-Live-1 عبر طبقة توجيه؛ فطبقات الصوت تخص بائعيها.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

إدارة المال

لا يتوافق نموذجا التسعير، لذا يستحق التحويل أن يُنفّذ على نحو صحيح. يجري الكلام بنحو 150 كلمة في الدقيقة، ويبلغ متوسط الإنجليزية نحو خمسة أحرف ونصف لكل كلمة، لذا فإن دقيقة من الكلام المنطوق تبلغ نحو 800 إلى 900 حرف. عند 49 دولارًا لكل مليون حرف، تبلغ تكلفة التخليق لدى Cartesia نحو أربعة سنتات لكل دقيقة من الصوت.

ثم تصل بقية السلسلة المتتالية. تتقاضى Cartesia ‏0.06 دولار لكل دقيقة من مدة مكالمة وكيل الصوت، و0.014 دولار لكل دقيقة إذا استخدمت رقم هاتفها، إضافةً إلى تكلفة الأحرف. أضف التعرف على الكلام ونموذجًا لغويًا للنص، وستتجاوز عشرة سنتات للدقيقة قبل أن يقول أي شخص أي شيء صعب. يغطي سعر GPT-Live-1 البالغ 0.05 دولار لكل دقيقة صوتية الاستماع وتناوب الأدوار والتحدث، بينما يُحتسب الاستدلال المفوّض بشكل منفصل بالسعر المعتاد للنموذج الخلفي — وهو، بالنسبة لمكالمة حجز مرتبطة بعملية بحث أو اثنتين، رقم حقيقي وليس خطأ تقريب.

تقع نقطة الانتقال عند الحجم والصعوبة. المكالمات القصيرة المتكررة عالية الحجم — التأكيدات، والإشعارات، والاستعلامات البسيطة — تُفضّل النموذج المتتالي، لأن نموذجًا رخيصًا يجيب عن سؤال نمطي هو أرخص شيء في هذه المقارنة. أما المكالمات التي يخرج فيها المتصل عن النص، أو يتحدث متجاوزًا الوكيل، أو يغيّر رأيه في منتصف الجملة، فتُفضّل النموذج من طرف إلى طرف، لأن نمط فشل النموذج المتتالي هناك ليس إجابة خاطئة، بل إجابة محرجة.

أي واحدة تختار؟

اختر Cartesia Sonic 3.6 إذا كنت تريد أفضل صوت من حيث التقييم متاحًا وكنت مستعدًا لتولي مسؤولية منطق المحادثة بنفسك. إنه الخيار الصحيح للتعليق الصوتي، وللوكلاء المكتوبين ذوي الحجم الكبير، وللفرق التي لديها خط أنابيب قائم للتعرف على الكلام، ولكل من يحتاج إلى الطوابع الزمنية على مستوى الكلمة التي تجعل التعامل الدقيق مع المقاطعة ممكنًا. تحصل على فئة مجانية، وأكثر من 500 صوت، والاستنساخ، و44 لغة، وعلى قمة كلتا لوحتي الجودة، وتحتفظ بالسيطرة على كل مرحلة.

اختر GPT-Live-1 إذا كانت المقاطعة هي المنتج. أي شيء يكون فيه التحدث فوقك هو الحالة الطبيعية لا الحالة الاستثنائية، وحيث يتفوق تسليم الدور خلال 0.8 ثانية على بداية خلال 90 مللي ثانية في جملة لم يُكمل أحد طرحها. أنت تقبل نموذجًا مغلقًا ومستضافًا ويُحتسب بالدقيقة، باثني عشر صوتًا ودون استنساخ، وتقبل أن درجته المستقلة في الجودة في منتصف الجدول.

الإغراء هو أن تقرأ 1,275 مقابل 70.3% وتعتبر الأمر محسومًا. لكنه ليس كذلك، والفرق بين هذين الرقمين هو الحجة كلها: أحدهما يقيس كيف يبدو الصوت، والآخر يقيس ما إذا كان يستحق التحدث معه.