بطاقة عنوان رئيسية مكتوب عليها 'GPT-Live-1 مقابل Grok Voice Think Fast 2.0' مع العنوان الفرعي 'واجهتا API صوتيتان تتحركان في اتجاهين متعاكسين من حيث السعر' والسطر '$0.05 في الدقيقة مقابل $0.08 في الدقيقة'، فوق لوحتين: اليسرى تعرض بطاقة سعر مع سهم لأسفل مكتوب عليه '$0.05'، واليمنى تعرض بطاقة سعر مع سهم لأعلى مكتوب عليه '$0.08' والتعليق '+60%'، كل منها مزود بشريط موجات صوتية ثنائي الاتجاه كامل، وشعار OrcaRouter مركّب في الزاوية.
Guides & Insights

GPT-Live-1 مقابل Grok Voice Think Fast 2.0: واجهتا API صوتيتان تتحركان في اتجاهين متعاكسين للسعر

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أكثر ما يفيد في هذه المواجهة هو اتجاه، لا رقم. عندما أطلقت xAI نموذج Grok Voice Think Fast 2.0 في أواخر يوليو 2026، رفعت سعر الصوت لكل دقيقة بنسبة 60%، من 0.05 دولار الذي كان يتقاضاه Think Fast 1.0 إلى 0.08 دولار. وبعد ستة أسابيع، في 10 سبتمبر 2026، أتاحت OpenAI نموذج GPT-Live-1 في واجهة API للمطورين بالسعر نفسه تمامًا الذي كانت xAI قد تخلت عنه للتو. وهذا يمنحك الحالة النادرة التي يمكن فيها مقارنة واجهتي API الصوتيتين الرائدتين كاملتي الازدواجية بالسعر مباشرة، والتي يكون فيها الوافد الأحدث هو الأرخص — بينما النموذج الأقدم والأغلى هو الذي تقف خلفه نتائج اختبارات معيارية من طرف ثالث.

السجل، قبل أي اختبارات أداء

كلا هذين نموذجا تحويل الكلام إلى كلام، مصمّمان لأعباء عمل على غرار المكالمات الهاتفية: محادثة مباشرة مع عميل، ومقاطعة، واستدعاء أداة، وفاتورة تُقاس بالدقائق. وبعد ذلك يتباعدان سريعًا.

• سعر الدقيقة من الصوت — GPT-Live-1 بسعر 0.05 دولار مقابل Gr​ok Voice Think Fast 2.0 بسعر 0.08 دولار

• وحدة الفوترة — تُحاسب GPT-Live-1 بالثانية دون تقريب إلى الدقيقة الكاملة التالية؛ ويُسعَّر Gr​ok Voice Think Fast 2.0 لكل دقيقة من الصوت، ما يعادل نحو 4.80 دولارات في الساعة

• الإصدار — تم إطلاق GPT-Live-1 داخل ChatGPT في 8 يوليو 2026 ووصل إلى API في 10 سبتمبر 2026؛ وأُعلن عن Grok Voice Think Fast 2.0 حوالي 29–30 يوليو 2026، أي بعد Think Fast 1.0 بنحو ثلاثة أشهر

• نقاط النهاية — GPT-Live-1 مخصص لـ Live Sessions فقط، على v1/live/sessions، عبر WebRTC؛ يعمل Gr​ok Voice Think Fast 2.0 على واجهة Speech-to-Speech API الخاصة بـ x​AI عبر كلٍ من WebSocket وWebRTC.

• سطح الأدوات — يُحيل GPT-Live-1 المهام إلى نموذج استدلال خلفي عبر Responses API؛ ولدى Gr​ok Voice Think Fast 2.0 بحث الويب، وبحث X، وبحث الملفات، وخوادم MCP، ودوال من جانب العميل متاحة داخل الجلسة

• قابلية نقل الصوت — يستخدم GPT-Live-1 مجموعة OpenAI المُعاد إتقانها المكوّنة من اثني عشر صوتًا؛ ويدعم Gr​ok Voice Think Fast 2.0 الأصوات المدمجة والمخصّصة

خط WebSocket أصغر مما يبدو، وله أهمية أكبر مما ينبغي. حصة كبيرة من البنية التحتية للاتصالات الهاتفية — تمديدات بث الوسائط داخل معظم منتجات CPaaS — تتحدث WebSocket، لا WebRTC. يلتقي Gr​ok Voice Think Fast 2.0 بهذه البنية التحتية حيث توجد؛ أما GPT-Live-1 فليس كذلك، والوصول إلى WebRTC انطلاقًا من مسار مكالمة لا يتحدث إلا WebSocket هو عمل هندسي حقيقي وليس مجرد مفتاح إعداد.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Grok Voice Think Fast 2.0 - the scoreboard'. The GPT-Live-1 column lists Price $0.05 / minute; Price direction new entrant at $0.05; Transport WebRTC only; Quality evidence vendor-run, unreproduced; Tool calling delegated to backend model; Model ID single fixed ID. The Grok Voice Think Fast 2.0 column lists Price $0.08 / minute; Price direction raised 60% from $0.05; Transport WebSocket + WebRTC; Quality evidence 82.9 third-party speech index; Tool calling in-session search, MCP, functions; Model ID versioned ID plus floating alias. A footer reads 'Grok quality figure is a third-party index; GPT-Live-1 benchmarks are OpenAI's own and unreproduced.'

عدم التماثل في المعايير هو القصة الحقيقية

وهنا يتوقف المقارنة عن كونها متكافئة، وهنا يخطئ معظم الكُتّاب في فهم الأمر بالعكس حين يتعاملون مع مجموعتي الأرقام باعتبارهما النوع نفسه من الأدلة.

تأتي النتائج الرئيسية لـ Gr​ok Voice Think Fast 2.0 من مؤشر جودة الكلام إلى الكلام الخاص بـ Artificial Analysis، وهو قياس طرف ثالث يضع النموذج عند 82.9%، ارتفاعًا من 75.7% في الإصدار 1.0، متقدمًا على GPT-Realtime-2.1 عند 79.1% و Gemini 3.1 Flash عند 69.5%. كما تعلن x​AI عن المركز الأول في τ-voice Bench للسلوك الوكيلي عند 56.5%، متقدمة على GPT-Realtime-2.1 عند 45.7%. هذه قياسات تُجرى خارجيًا لنموذج x​AI.

النتائج الرئيسية لـ GPT-Live-1 هي نتائج OpenAI نفسها. تعلن الشركة عن تفاعلية الازدواج الكامل بنسبة 80.1% مقابل 45.4% لـ GPT-Realtime-2.1، وانخفاض زمن استجابة تبادل الأدوار من 1.4 ثانية إلى 0.8، وارتفاع دقة استدعاء الأدوات من 60% إلى 87%. كل رقم من هذه الأرقام مُبلَّغ عنه من الشركة المصنعة، ولم يُعِد إنتاجه أي مختبر مستقل، وهو يقارن نموذج OpenAI الجديد بنموذج OpenAI السابق نفسه بدلاً من مقارنته بمنافس.

هذا ليس سببًا لرفض الأرقام — فاتجاه المسار متسق مع ما يذكره المتبنّون الأوائل — لكنه يعني أن المقارنة الوحيدة بين المورّدين المتاحة حاليًا تُفضّل نموذج x​AI في اختبارات أُجريت بشكل مستقل، بينما الرقم الوحيد المتاح لميزة زمن الاستجابة لدى Ope​nAI هو رقم Ope​nAI نفسه. لا تتعامل مع 0.8 ثانية و0.70 ثانية كمنافسة حقيقية؛ فواحد فقط من هذين الرقمين قاسه شخص لا مصلحة له في النتيجة.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

فخ الأسماء المستعارة، ولماذا فاجأ ارتفاع السعر الناس على حين غرة

كانت زيادة بنسبة 60% لتُعدّ خطأ تقريب في معظم ملاحظات الإصدار لو لم تكن x​AI قد مرّرتها أيضًا عبر اسم مستعار. التطبيقات التي تشير إلى الاسم المستعار grok-voice-latest ورثت الموديل الجديد والسعر الأعلى تلقائيًا في 5 أغسطس 2026، ما لم تكن قد ثبّتت grok-voice-think-fast-1.0 صراحةً. هذا قرار تصميمي جدير بالفهم لا بالشكوى: الأسماء المستعارة العائمة تمنحك ترقيات مجانية، كما أنها تحرّك اقتصاديات وحدتك دون أن تسألك.

الحل البديهي أضعف مما يبدو. Grok Voice Think Fast 1.0 — النموذج الذي يبلغ سعره 0.05 دولار للدقيقة، والصادر في 23 أبريل 2026 — أصبح الآن مُصنَّفًا كمُهمَل في قائمة نماذج xAI نفسها. تثبيته يحميك من الترقية التلقائية، وهو يشتري وقتًا لا مسارًا دائمًا أرخص، لأن النموذج المهمَل له تاريخ تقاعد ينتظره في الأفق. خطط للترحيل وفق جدولك الزمني الخاص، لا وفق جدول الاسم المستعار.

تستحق واجهة التسعير نفسها قراءة متأنية قبل أن تلتزم برقم. تسرد صفحة النماذج الخاصة بـ xAI الأسعار المرتبطة بالإصدارات بوضوح — grok-voice-think-fast-2.0 بسعر 0.08 دولار لكل دقيقة من الصوت، و4.80 دولار للساعة، إضافة إلى 0.004 دولار لكل إدخال نصي — بينما تعلن بطاقة Voice API المنفصلة في الصفحة نفسها عن سعر وكيل "يبدأ من 0.05 دولار للدقيقة"، وهو نقطة الدخول لا السعر الذي يُحاسب به نموذج 2.0. إذا كان تخطيط السعة لديك قد بُني على الرقم التسويقي، فهو أقل بنحو 60% عمّا ينبغي.

لا يواجه نموذج OpenAI هذه المشكلة بالشكل نفسه، لأنه لا يوجد شيء يمكن أن ينتقل إليه تلقائيًا. يمتلك GPT-Live-1 معرّف نموذج واحدًا فقط، gpt-live-1، وهو أيضًا اللقطة الافتراضية الخاصة به — فلا توجد نسخ مؤرخة لتثبيتها، وبالتالي لا يوجد اسم مستعار يمكنه تغيير النموذج أو السعر بصمت. المقابل هو أنك لا تستطيع أيضًا تجميد سلوك معروف بأنه جيد والاستمرار عليه بينما يستقر شيء جديد.

يحتسب كلا النموذجين طبقة الاستدلال بشكل منفصل عن طبقة الصوت، وهنا يتوقف السعر المعلن عن كونه التكلفة الكاملة. تُحتسب استدعاءات Responses المفوّضة من GPT-Live-1 وفق أسعار النموذج الخلفي المُهيأ العادية لكل توكن. وتضيف xAI مبلغ 0.004 دولار عن كل إدخال نصي في جلسة الصوت، بالإضافة إلى استدعاءات الأدوات، ورقم هاتف مُخصّص بنحو 0.01 دولار في الدقيقة عند الحاجة إليه، والاتصالات الهاتفية والتخزين، فوق سعر الصوت لكل دقيقة. الوكيل الصوتي الذي يستمع في الغالب ويبحث عن شيء بين الحين والآخر سيبقى قريبًا من سعره المعلن؛ أما الذي يستدعي الأدوات في كل دور فلن يبقى كذلك، ولن يتباعدا في الاتجاه نفسه، لأن تصميم الخلفية المفوّضة وتصميم الأدوات داخل الجلسة يحرقان التوكنات في مواضع مختلفة.

من جانبنا، السبب في أن تغييرات السعر لكل دقيقة تستحق المراقبة عن كثب هو أن OrcaRouter يمرر سعر قائمة المزود دون أي هامش ربح. عندما يغيّر أحد البائعين سعرًا منشورًا، يتغير الرقم من جانبنا في نفس اليوم بدلاً من دورة العقد التالية.

A screenshot of xAI's developer Models documentation page, showing a Voice API card with an agent price of 'Starting at $0.05 / min' alongside Text to Speech at $15.00 / 1M chars and Speech to Text at $0.10 / hour batch and $0.20 / hour streaming, plus a Grok 4.6 card listing a 500k-token context with $2.00 / 1M input and $6.00 / 1M output tokens, and an Imagine API card for image and video generation.

ما الذي يكلفك إياه تقسيم التفويض في الهندسة

إذا كنت تختار بين هذين بناءً على المعمارية لا على السعر، فالسؤال الحاسم هو أين يقع الحدّ الفاصل.

يحتفظ نموذج xAI بالأدوات داخل الجلسة. هذا أبسط من حيث التفكير فيه — اتصال واحد، ومحادثة واحدة، ومكان واحد يحدث فيه استدعاء دالة — وهو يعني أن النموذج يستطيع أن يقرر في منتصف الجملة أنه يحتاج إلى البحث ويواصل التحدث بينما ينتظر.

نموذج OpenAI يُخرج هذا العمل إلى الخارج. تُبقي طبقة الصوت المحادثة حيّة وتُسلّم المهمة إلى نموذج استدلال منفصل عبر Responses API، ما يعني أن تعريفات أدواتك، واسترجاعك، ومنطق عملك توجد في تكامل عادي مع نموذج نصي بدلًا من أن تكون داخل تدفق أحداث الجلسة. هذا يعني أجزاءً متحركة أكثر، وهو أيضًا أكثر قابلية للنقل: فالنصف المُفوَّض هو نداء API عادي يمكنك تبديله وتسعيره والتحويل عند فشله بشكل مستقل عن طبقة الصوت.

هذا مهم لسبب واحد فقط. لا يقدّم GPT-Live-1 ولا Gr​ok Voice Think Fast 2.0 أي جهة سوى البائع الخاص بكل منهما — فكلاهما أحادي المصدر، ولا يمكن للموجّه أن يساعدك في الشق الصوتي. ما يمكن للموجّه فعله هو توحيد النصف الذي يمكنك اختياره فعلاً. إن GPT-5.6 Terra، الواجهة الخلفية في مثال التفويض الخاص بـ Ope​nAI، متاح عبر OrcaRouter بسعر 2.00 دولار لكل مليون توكن إدخال و12.00 دولار لكل مليون توكن إخراج مع إتاحة كل من /v1/chat/completions و/v1/responses، إلى جانب نحو 190 نموذجًا آخر بمفتاح واحد. إذا كان وكيلك الصوتي يستدعي نموذج استدلال في كل دور، فهذا هو البند الذي يمكن للتوجيه أن يصنع فرقًا فيه.

الحكم، مقسّمًا حسب عبء العمل

• اختر GPT-Live-1 إذا كان السعر لكل دقيقة هو القيد، أو إذا كان مسار الاتصال لديك يتحدث WebRTC بالفعل، أو إذا كنت تريد أن يكون عقل الاستدلال خلف الصوت نموذجًا نصيًا قابلًا للتبديل بدلًا من أن يكون جزءًا ثابتًا من الجلسة.

• اختر Gr​ok Voice Think Fast 2.0 إذا كنت بحاجة إلى جودة مُتحقَّق منها بشكل مستقل ومطروحة أمامك قبل أن تلتزم، أو إذا كانت بنية الاتصالات الهاتفية لديك أصيلة بتقنية WebSocket، أو إذا كانت الأدوات داخل الجلسة — وبخاصة البحث في X — جوهرية في المنتج وليست أمراً عارضاً.

• راقب الاسم المستعار إذا كنت بالفعل على x​AI. إن تثبيت معرّف نموذج ذي إصدار هو الشيء الوحيد الذي يفصلك عن التغيير التلقائي التالي في المعدل، ويستحق الانضباط نفسه أن يُطبَّق في أي مكان يظهر فيه اسم مستعار عائم.

الخلاصة غير المريحة هي أن النموذج الأرخص هو الذي لا يقف خلفه دليل من طرف ثالث، والنموذج الأفضل توثيقًا هو الذي أصبح للتو أغلى بنسبة 60%. إذا كنت في مرحلة مبكرة بما يكفي من عملية البناء بحيث لا يكون أي من التكاملين مثبتًا نهائيًا، فإن أقل خطوة مخاطرة هي بناء نموذج أولي مقابل كليهما — فمسار الصوت لا يزيد عن بضع مئات من الأسطر في كلتا الحالتين — ودع جودة النص المفرّغ الخاصة بك تحسم الأمر، لأن الأدلة العامة لا تحسمه حاليًا.