بطاقة عنوان لمقال GPT-Live-1 Speech to Speech Index تعرض أعلى ثلاث نتائج: GPT-Live-1 مع GPT-6 Astra بجهد متوسط عند 81.5، وGrok Voice Think Fast 2.0 High عند 81.3، وGPT-Live-1 مع GPT-5.6 Sol بجهد منخفض عند 80.1
Guides & Insights

يتصدّر GPT-Live-1 مؤشر تحويل الكلام إلى كلام بنتيجة 81.5 — لكن التصنيف يعود إلى الواجهة الخلفية الخاصة به

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

GPT-Live-1، نموذج الصوت ثنائي الاتجاه الكامل الذي شُحن لأول مرة داخل ChatGPT في 8 يوليو 2026، أصبح الآن الأول في مؤشر Artificial Analysis Speech to Speech بنتيجة 81.5 — صفّ موجود فقط لأن النموذج وُجّه إلى GPT-6 Astra للقيام بتفكيره. شغّل نفس الواجهة الأمامية الصوتية مع GPT-5.6 Sol كواجهة خلفية مفوّضة بجهد استدلالي منخفض فتحصل على 80.1، وهو الثالث. المركز الثاني، بنتيجة 81.3، يعود إلى Grok Voice Think Fast 2.0 High.

إقراران صادقان قبل الأرقام. النموذج ليس جديدًا: فقد وصل GPT-Live-1 إلى واجهة برمجة التطبيقات الخاصة بالمطورين في 10 سبتمبر 2026، بعد شهرين قضاها بصفته الصوت الافتراضي في ChatGPT. الجديد، بحسب قياس جرى في 15 سبتمبر، هو أن مقيّمًا خارجيًا قيّمه — وهو الأمر الوحيد الغائب عن كل ما كُتب عن هذا النموذج حتى الآن، بما في ذلك ما كتبناه نحن، حيث كانت الأرقام الوحيدة المتاحة هي تلك التي نشرتها OpenAI عن نفسها. وفارق 0.2 نقطة عن المركز الثاني أصغر من الفجوة البالغة 1.4 نقطة بين إعدادَي GPT-Live-1 نفسهما، وهو الرقم الأكثر فائدة في لوحة النتائج.

إذاً العنوان الرئيسي «GPT-Live-1 هو أفضل نموذج صوتي» ليس تماماً ما يقوله المؤشر. إنه يقول إن GPT-Live-1 مع GPT-6 Astra عند جهد متوسط هو كذلك، بفارق خُمس نقطة، وإن اختيار الواجهة الخلفية يغيّر النتيجة أكثر مما يفعله أي نموذج منافس.

ما الذي يقيسه المؤشر فعليًا

تبني Artificial Analysis مؤشر Speech to Speech Index باعتباره مركّبًا متساوي الأوزان من أربعة أجزاء: Speech Reasoning، الذي يقيسه Big Bench Audio؛ وAgentic Performance، الذي يقيسه τ-Voice؛ وArena Preference، وهو تصنيف Elo للتفضيلات البشرية القائمة على المقارنات الثنائية؛ وTask Success Rate. لا يحصل على قيمة في المؤشر إلا النماذج المتوفرة لها المكوّنات الأربعة جميعًا — أما كل ما عدا ذلك فيظهر كشرطة، ولهذا فإن عدد صفوف الجدول أكبر بكثير من عدد الدرجات. أُطلق المؤشر نفسه في 23 يونيو 2026، وخضع للتنقيح مرتين منذ ذلك الحين، وكان آخرهما استبدال Conversational Dynamics بـ Task Success، لذلك فإن درجة من تنقيح واحد ليست قابلة للمقارنة تمامًا مع درجة من تنقيح آخر.

ثمة تفصيلان منهجيان إضافيان يهمّان عند قراءة التصنيف. إن Arena Elo مُجمّد عند القيمة التي كان عليها عندما أصبح النموذج قابلاً للنشر لأول مرة، لذا يكافئ مكوّن التفضيل الوصول المبكر بدلاً من أن تكون الأفضل اليوم. كما أن المؤشر يقيّم نظاماً كاملاً لا نموذجاً واحداً: فبالنسبة إلى GPT-Live-1، يغطي الرقم الواجهة الصوتية الأمامية بالإضافة إلى أي نموذج خلفي يُحيل إليه العمل. هذا اختيار تصميمي مقصود، وهو السبب في ظهور النموذج نفسه مرتين بدرجات مختلفة.

أعلى الحقل، كما نُشر:

• GPT-Live-1 (Astra، متوسط) — المؤشر 81.5، الأول

• Grok Voice Think Fast 2.0 High — المؤشر 81.3، الثاني

• GPT-Live-1 (Sol, low) — المؤشر 80.1، الثالث

• GPT-Realtime-2.1 High — المؤشر 73.9، الرابع

• GPT-Realtime-2 High — مؤشر 73.6، الخامس

• Grok Voice Think Fast 1.0 — المؤشر 72.3، السادس

• Gemini 3.1 Flash Live High — مؤشر 71.5، السابع

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

للمقارنة، فإن النموذج الذي يستبدله GPT-Live-1 يقع أدنى منه بـ7.6 نقاط. هذه فجوة جيلية حقيقية، وهي ليست محل خلاف.

فوز بـ0.2 نقطة يأتي من مكوّن واحد بالضبط

فكِّك المركّب، وسيتوقف المتصدران عن الظهور كنموذجين من النوع نفسه. أما على صعيد المكوّنات، فوفقًا لـ Artificial Analysis:

• الأداء الوكيلي (τ-Voice) — GPT-Live-1 بنسبة 67.9% مقابل Grok Voice Think Fast 2.0 High بنسبة 56.5%

• الاستدلال الكلامي (Big Bench Audio) — 90% مقابل 97%

• معدل نجاح المهام — 87.4% مقابل 94.6%

• إيلو الساحة — 1048 مقابل 1011

• الزمن حتى أول صوت — 1.34 ثانية مقابل 0.70 ثانية

• التكلفة لكل ساعة، بما يشمل الواجهة الخلفية — 5.83 دولار مقابل 4.80 دولار

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

يفوز GPT-Live-1 في اثنين من أصل ستة خطوط ويخسر أربعة، ومع ذلك يتصدر المؤشر. الحساب ليس لغزًا: فجوة τ-Voice تبلغ 11.4 نقطة، وهي أكبر بكثير من أي فارق آخر في الجدول، وفي ظل الترجيح المتساوي تجرّ النتيجة المركّبة إلى ما فوق الخط. بعبارات واضحة، GPT-Live-1 هو الوكيل الأفضل، وGrok Voice Think Fast 2.0 High هو المستمع الأفضل والأسرع — ويصادف أن المؤشر يمنح الأمر الذي يتفوق فيه GPT-Live-1 وزنًا كبيرًا بما يكفي ليجعله الأول.

إذا كان منتجك وكيلاً صوتيًا يقوم بالحجز أو الحل أو تنفيذ المعاملات، فإن تقدم 11.4 نقطة في τ-Voice هو الرقم الذي يتنبأ بتجربتك. وإذا كان منتجك محادثة يجب أن تبدو فورية وألا تقاطع المستخدم أبدًا، فإن زمن الوصول إلى أول صوت البالغ 0.70 ثانية هو الرقم الذي يتنبأ بتجربتك، ويفوز Grok بها بمعامل يقارب اثنين. في ما يخص تنفيذ المهام الخاضعة للتنظيم، هناك تحذير ثانٍ: معدل نجاح المهام لدى Grok البالغ 94.6% هو الأعلى في الجدول المرئي، ومعدل GPT-Live-1 البالغ 87.4% يعني أن مهمة واحدة تقريبًا من كل ثماني لا تكتمل. كلاهما تحسن عن الجيل السابق. ولا يعد أي منهما مشكلة محلولة.

الصف رقم 1 هو تكوين توجيه، وليس نموذجًا.

هذا هو الجزء الذي يستحق اهتمامًا أكثر من موقع لوحة الصدارة. GPT-Live-1 طبقة صوتية كاملة الازدواجية تتولى الاستماع والتحدث والمقاطعة وتناوب الأدوار بنفسها، وتفوّض الاستدلال واستدعاءات الأدوات والبحث إلى نموذج خلفي منفصل بينما تستمر المحادثة. سجّلت Artificial Analysis اثنتين من تلك الاقترانات كمدخلين منفصلين. أنتجت Astra عند الجهد المتوسط 81.5. وأنتجت Sol عند الجهد المنخفض 80.1.

هذا الفارق البالغ 1.4 نقطة هو القصة. الفجوة بين المركز الأول والثاني هي 0.2 نقطة. الفجوة بين التكوينين المُقيَّمين لدى GPT-Live-1 أكبر بسبع مرات. لم يتغير أي شيء في نموذج الصوت بين هذين الصفين — فقط أي نموذج كان يقوم بالتفكير، وبأي مستوى جهد. لوحة الصدارة التي ترتب الأنظمة تخبرك، بدقة، أن التكوين هو المنتج.

وهو يعدّل أيضًا تقاريرنا الخاصة. في 11 سبتمبر 2026 سجّلنا GPT-Live-1 عند 69.8% على هذا المؤشر، خلف كل من GPT-Realtime-2.1 وGrok. كانت تلك هي القراءة المتاحة آنذاك، وقد دعمت استنتاجًا معقولًا — مفاده أن OpenAI بنت أفضل آليات المحادثة وليس أفضل وكيل صوتي. يحمل المؤشر الآن تهيئتين مُفوَّضتين لـ GPT-Live-1 عند 81.5 و80.1. لا تنشر Artificial Analysis سجل تغييرات، وقد عدّلت مكوّنات المؤشر في أغسطس، لذا لا يمكننا الجزم بما إذا كان الرقم السابق تهيئة غير مُقيَّمة أو مُقيَّمة جزئيًا أو تشغيلًا في ظل الترجيح الأقدم؛ وما يمكن ملاحظته هو أن الاقترانات المُفوَّضة تظهر الآن كصفوف كاملة خاصة بها، وأن الإجابة تغيّرت عندما ظهرت هذه الاقترانات على هذا النحو.

النتيجة العملية هي أن السؤال "أي نموذج صوتي" سؤال خاطئ، والسؤال الصحيح هو "أي نموذج صوتي مع أي خلفية، وبأي مستوى جهد". وهذا سؤال توجيه، وهو السؤال الذي وُجد منتجنا تحديدًا للإجابة عنه. يكشف OrcaRouter عن الخلفية المفوَّضة لنموذج GPT-Live-1، أي GPT-6 Astra، عبر نقطة النهاية نفسها المتوافقة مع OpenAI التي تُستخدم مع أكثر من 200 نموذج آخر، لذا فإن تبديل طبقة التفكير ليس سوى تغيير في معرّف النموذج لا عملية تكامل. أما لغة التوجيه DSLفتدمج عدة نماذج في استدعاء واحد، كما أن التبديل التلقائي عند الفشل يعني أن الاقتران غير المُجرَّب ليس رهانًا إنتاجيًا — فإذا تدهورت الخلفية، يهبط الطلب في مكان آخر بدلًا من أن يفشل. ولنكون دقيقين بشأن ما لا نقوم به: نموذج GPT-Live-1 نفسه ليس في فهرسنا ولسنا نقدّمه. أما الخلفية التي يفوّض إليها فهي مسألة مختلفة.

كم تكلفة ساعة من هذا

تُفوتر الواجهة الأمامية لـ GPT-Live-1 بسعر 0.05 دولار لكل دقيقة صوتية، وتُحتسب بالثانية، أي 3.00 دولارات لكل ساعة من اتصال مفتوح. لكن هذه ليست الفاتورة كاملة: إذ تُحتسب الاستدلالات المفوَّضة واستدعاءات الأدوات والبحث على الويب بشكل منفصل وفق ما يفرضه النموذج الخلفي. قاست Artificial Analysis الرقم الإجمالي الشامل، ولهذا فإن عمود التكلفة لديها هو الذي ينبغي استخدامه:

• GPT-Live-1 (Sol, low) — 4.47 دولار في الساعة

• Grok Voice Think Fast 2.0 High — 4.80 دولار في الساعة

• GPT-Live-1 (Astra، متوسط) — 5.83 دولار في الساعة

• GPT-Realtime-2.1 High — 10.75 دولار في الساعة

الفائز في التصنيف هو الأغلى بين الخيارات الثلاثة الحالية، والتكوين الذي فاز يكلّف 30% أكثر في الساعة من التكوين الذي حلّ ثالثًا. وبقراءة معاكسة، فإن التقسيم مفيد: 3.00 دولارات من كل ساعة هي طبقة الصوت، والباقي — 1.47 دولار على Sol و2.83 دولار على Astra — هو توكنات الواجهة الخلفية. وتشكّل طبقة التفكير ما بين الثلث والنصف من فاتورتك، وهي حصة كبيرة لمكوّن تتعامل معه لوحة الصدارة كأنه حاشية.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

ومع ذلك، مقارنةً بالنموذج الذي يحل محله، فإن المجموعة بأكملها بسعر يقارب النصف — فالواجهة الأمامية بسعر 0.05 دولار للدقيقة هي تخفيض حقيقي، وليست إعادة تغليف. ولأن رموز الواجهة الخلفية تُحتسب بأسعار الواجهة الخلفية، فإن تكلفة نشر GPT-Live-1 تعتمد في الغالب على نموذج الاستدلال الذي توجّه إليه، ويمكن أن تكون الواجهات الخلفية مملوكة لـ OpenAI أو نماذج طرف ثالث. على OrcaRouter، يتم تمرير هذه الواجهات الخلفية بسعر قائمة المزوّد مع هامش ربح 0%، لذا فإن أي تغيير في سعر البائع على طبقة التفكير يصبح ساريًا في اليوم نفسه بدلاً من دورة الفوترة التالية.

ما لا يحسمه المؤشر

ثلاثة تحفظات، أوردها المصدر بدلًا من استنتاجها. كلا مُدخلَي GPT-Live-1 وGrok Voice Think Fast 2.0 High موسومان بأنهما مبنيان على تجربة واحدة، وهو أمر ضئيل لقرار بفارق 0.2 نقطة — إذ قد تُعيد إعادة التشغيل ترتيب المركزين الأول والثاني دون أن يتغير شيء في أيٍّ من النموذجين. أما Arena Elo، كما ذُكر، فقد جُمّد عند أول قياس قابل للنشر لكل نموذج. ولا يتضمن المؤشر أي مُدخل لكيفية تصرف هذه الأنظمة في مكالمة طويلة: فالمكوّنات قصيرة الأفق بحكم التصميم، بينما نمط الفشل الذي يقتل وكلاء الصوت فعليًا في الإنتاج هو الانحراف على مدى محادثة تستغرق عشرين دقيقة.

وبشكل منفصل، ومن المورّد نفسه لا من الفهرس: فقد صدرت واجهة برمجة تطبيقات GPT-Live-1 دون إدخال الصور أو الفيديو، ودون مخرجات مُهيكلة، ودون طبقة مجانية، كما أن حدود معدّل الاستخدام لديها تُحسب بعدد الجلسات المتزامنة لا بعدد الطلبات في الدقيقة. هذه قيود يوم الإطلاق وقد تكون تغيّرت بالفعل؛ تحقّق منها قبل أن تبني تصميمك عليها.

ماذا نفعل بهذا؟

إذا كنت تختار هذا الأسبوع بنية معمارية بدلاً من نموذج، فإن المؤشر يكافئ النمط المفوّض في الأعمال الوكيلية والنمط المتعاقب في زمن الاستجابة. GPT-Live-1 عند 81.5 هو أقوى دليل حتى الآن على أن فصل المحادثة عن الاستدلال هو الشكل الصحيح للوكلاء الصوتيين المنجزين للمهام. Grok Voice Think Fast 2.0 High عند 81.3، مع 0.70 ثانية حتى أول صوت ومعدل نجاح للمهام يبلغ 94.6%، هو أقوى دليل على أن الشكل المفوّض ليس الوحيد الذي ينجح — وأنه ليس الأسرع بعد.

القرار المستخلص من الأرقام أقل تكلفة مما يبدو. لا يزيد الفارق بين إعدادَي GPT-Live-1، وبين النموذج الذي تفوّق عليه في أربعة من ستة مكونات، على 1.36 دولار في الساعة. عند هذا الفارق، الخطوة الصحيحة هي التوقف عن قراءة لوحات الصدارة وتمرير نصوصك الخاصة عبر كليهما. يخبرك المؤشر بشكل المقايضة؛ لكنه لا يستطيع أن يخبرك على أي جانب منها يقف مستخدموك.

أسئلة يستدعيها الرقم

هل GPT-Live-1 هو أفضل نموذج صوتي الآن؟

بالمقياس المركّب، نعم — بفارق 0.2 نقطة ومع تجربة واحدة تقف خلفه. أما بحسب المكوّنات، فيعتمد الأمر كليًا على ما تبنيه: فهو يتصدّر في الأداء الوكيلي وتفضيل الآرينا، ويتخلّف في الاستدلال الصوتي ومعدل نجاح المهام وزمن الوصول إلى أول صوت. إن تقدّمًا مركّبًا بمقدار 0.2 نقطة يستند إلى ميزة واحدة في أحد المكوّنات قدرها 11.4 نقطة هو مركز أول قابل للدفاع عنه، لا مركز أول حاسم.

هل يجب عليك استخدام GPT-6 Astra للحصول على 81.5؟

بالنسبة لذلك الصف تحديدًا، نعم — إن 81.5 يخص GPT-Live-1 المُهيأ مع Astra عند جهد استدلال متوسط. أما Sol عند الجهد المنخفض فهو بديل موثّق عند 80.1 وأرخص بمقدار 1.36 دولار في الساعة، وتدعم OpenAI إحضار نماذج طرف ثالث كواجهة خلفية، لذا فإن مدخلات لوحة الصدارة ليست سوى نقطتين على منحنى وليست الخيارات الوحيدة. أي اقتران هو الأفضل لعبء العمل لديك ليس شيئًا يمكن لمؤشر عام أن يجيبك عنه.

لماذا سجّل النموذج نفسه 69.8 في تغطيتنا السابقة و81.5 الآن؟

الرقمان يغطيان أمرين مختلفين. القراءة السابقة أدرجت GPT-Live-1 في المؤشر كمدخل واحد؛ أما الجدول الحالي فيحمل تهيئتيه المفوَّضتين كصفّين منفصلين ومُقيَّمين بالكامل، مع اقتران Astra عند 81.5 واقتران Sol عند 80.1. راجعت Artificial Analysis مكوّنات المؤشر في أغسطس ولا تنشر سجل تغييرات، لذا تعامل مع الفارق على أنه تغيّر في ما جرى قياسه لا كدليل على أن النموذج تحسّن — وتعامل مع أي درجة مركّبة مفردة لنموذج يفوّض المهام على أنها بيان عن تهيئة.