
GPT-Live-1 مقابل Grok Voice Think Fast 2.0: واجهتا API صوتيتان تتحركان في اتجاهين متعاكسين للسعر
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 لكل مليون رمز
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
أكثر ما يفيد في هذه المواجهة هو اتجاه، لا رقم. عندما أطلقت xAI نموذج Grok Voice Think Fast 2.0 في أواخر يوليو 2026، رفعت سعر الصوت لكل دقيقة بنسبة 60%، من 0.05 دولار الذي كان يتقاضاه Think Fast 1.0 إلى 0.08 دولار. وبعد ستة أسابيع، في 10 سبتمبر 2026، أتاحت OpenAI نموذج GPT-Live-1 في واجهة API للمطورين بالسعر نفسه تمامًا الذي كانت xAI قد تخلت عنه للتو. وهذا يمنحك الحالة النادرة التي يمكن فيها مقارنة واجهتي API الصوتيتين الرائدتين كاملتي الازدواجية بالسعر مباشرة، والتي يكون فيها الوافد الأحدث هو الأرخص — بينما النموذج الأقدم والأغلى هو الذي تقف خلفه نتائج اختبارات معيارية من طرف ثالث.
السجل، قبل أي اختبارات أداء
كلا هذين نموذجا تحويل الكلام إلى كلام، مصمّمان لأعباء عمل على غرار المكالمات الهاتفية: محادثة مباشرة مع عميل، ومقاطعة، واستدعاء أداة، وفاتورة تُقاس بالدقائق. وبعد ذلك يتباعدان سريعًا.
• سعر الدقيقة من الصوت — GPT-Live-1 بسعر 0.05 دولار مقابل Grok Voice Think Fast 2.0 بسعر 0.08 دولار
• وحدة الفوترة — تُحاسب GPT-Live-1 بالثانية دون تقريب إلى الدقيقة الكاملة التالية؛ ويُسعَّر Grok Voice Think Fast 2.0 لكل دقيقة من الصوت، ما يعادل نحو 4.80 دولارات في الساعة
• الإصدار — تم إطلاق GPT-Live-1 داخل ChatGPT في 8 يوليو 2026 ووصل إلى API في 10 سبتمبر 2026؛ وأُعلن عن Grok Voice Think Fast 2.0 حوالي 29–30 يوليو 2026، أي بعد Think Fast 1.0 بنحو ثلاثة أشهر
• نقاط النهاية — GPT-Live-1 مخصص لـ Live Sessions فقط، على v1/live/sessions، عبر WebRTC؛ يعمل Grok Voice Think Fast 2.0 على واجهة Speech-to-Speech API الخاصة بـ xAI عبر كلٍ من WebSocket وWebRTC.
• سطح الأدوات — يُحيل GPT-Live-1 المهام إلى نموذج استدلال خلفي عبر Responses API؛ ولدى Grok Voice Think Fast 2.0 بحث الويب، وبحث X، وبحث الملفات، وخوادم MCP، ودوال من جانب العميل متاحة داخل الجلسة
• قابلية نقل الصوت — يستخدم GPT-Live-1 مجموعة OpenAI المُعاد إتقانها المكوّنة من اثني عشر صوتًا؛ ويدعم Grok Voice Think Fast 2.0 الأصوات المدمجة والمخصّصة
خط WebSocket أصغر مما يبدو، وله أهمية أكبر مما ينبغي. حصة كبيرة من البنية التحتية للاتصالات الهاتفية — تمديدات بث الوسائط داخل معظم منتجات CPaaS — تتحدث WebSocket، لا WebRTC. يلتقي Grok Voice Think Fast 2.0 بهذه البنية التحتية حيث توجد؛ أما GPT-Live-1 فليس كذلك، والوصول إلى WebRTC انطلاقًا من مسار مكالمة لا يتحدث إلا WebSocket هو عمل هندسي حقيقي وليس مجرد مفتاح إعداد.

عدم التماثل في المعايير هو القصة الحقيقية
وهنا يتوقف المقارنة عن كونها متكافئة، وهنا يخطئ معظم الكُتّاب في فهم الأمر بالعكس حين يتعاملون مع مجموعتي الأرقام باعتبارهما النوع نفسه من الأدلة.
تأتي النتائج الرئيسية لـ Grok Voice Think Fast 2.0 من مؤشر جودة الكلام إلى الكلام الخاص بـ Artificial Analysis، وهو قياس طرف ثالث يضع النموذج عند 82.9%، ارتفاعًا من 75.7% في الإصدار 1.0، متقدمًا على GPT-Realtime-2.1 عند 79.1% و Gemini 3.1 Flash عند 69.5%. كما تعلن xAI عن المركز الأول في τ-voice Bench للسلوك الوكيلي عند 56.5%، متقدمة على GPT-Realtime-2.1 عند 45.7%. هذه قياسات تُجرى خارجيًا لنموذج xAI.
النتائج الرئيسية لـ GPT-Live-1 هي نتائج OpenAI نفسها. تعلن الشركة عن تفاعلية الازدواج الكامل بنسبة 80.1% مقابل 45.4% لـ GPT-Realtime-2.1، وانخفاض زمن استجابة تبادل الأدوار من 1.4 ثانية إلى 0.8، وارتفاع دقة استدعاء الأدوات من 60% إلى 87%. كل رقم من هذه الأرقام مُبلَّغ عنه من الشركة المصنعة، ولم يُعِد إنتاجه أي مختبر مستقل، وهو يقارن نموذج OpenAI الجديد بنموذج OpenAI السابق نفسه بدلاً من مقارنته بمنافس.
هذا ليس سببًا لرفض الأرقام — فاتجاه المسار متسق مع ما يذكره المتبنّون الأوائل — لكنه يعني أن المقارنة الوحيدة بين المورّدين المتاحة حاليًا تُفضّل نموذج xAI في اختبارات أُجريت بشكل مستقل، بينما الرقم الوحيد المتاح لميزة زمن الاستجابة لدى OpenAI هو رقم OpenAI نفسه. لا تتعامل مع 0.8 ثانية و0.70 ثانية كمنافسة حقيقية؛ فواحد فقط من هذين الرقمين قاسه شخص لا مصلحة له في النتيجة.

فخ الأسماء المستعارة، ولماذا فاجأ ارتفاع السعر الناس على حين غرة
كانت زيادة بنسبة 60% لتُعدّ خطأ تقريب في معظم ملاحظات الإصدار لو لم تكن xAI قد مرّرتها أيضًا عبر اسم مستعار. التطبيقات التي تشير إلى الاسم المستعار grok-voice-latest ورثت الموديل الجديد والسعر الأعلى تلقائيًا في 5 أغسطس 2026، ما لم تكن قد ثبّتت grok-voice-think-fast-1.0 صراحةً. هذا قرار تصميمي جدير بالفهم لا بالشكوى: الأسماء المستعارة العائمة تمنحك ترقيات مجانية، كما أنها تحرّك اقتصاديات وحدتك دون أن تسألك.
الحل البديهي أضعف مما يبدو. Grok Voice Think Fast 1.0 — النموذج الذي يبلغ سعره 0.05 دولار للدقيقة، والصادر في 23 أبريل 2026 — أصبح الآن مُصنَّفًا كمُهمَل في قائمة نماذج xAI نفسها. تثبيته يحميك من الترقية التلقائية، وهو يشتري وقتًا لا مسارًا دائمًا أرخص، لأن النموذج المهمَل له تاريخ تقاعد ينتظره في الأفق. خطط للترحيل وفق جدولك الزمني الخاص، لا وفق جدول الاسم المستعار.
تستحق واجهة التسعير نفسها قراءة متأنية قبل أن تلتزم برقم. تسرد صفحة النماذج الخاصة بـ xAI الأسعار المرتبطة بالإصدارات بوضوح — grok-voice-think-fast-2.0 بسعر 0.08 دولار لكل دقيقة من الصوت، و4.80 دولار للساعة، إضافة إلى 0.004 دولار لكل إدخال نصي — بينما تعلن بطاقة Voice API المنفصلة في الصفحة نفسها عن سعر وكيل "يبدأ من 0.05 دولار للدقيقة"، وهو نقطة الدخول لا السعر الذي يُحاسب به نموذج 2.0. إذا كان تخطيط السعة لديك قد بُني على الرقم التسويقي، فهو أقل بنحو 60% عمّا ينبغي.
لا يواجه نموذج OpenAI هذه المشكلة بالشكل نفسه، لأنه لا يوجد شيء يمكن أن ينتقل إليه تلقائيًا. يمتلك GPT-Live-1 معرّف نموذج واحدًا فقط، gpt-live-1، وهو أيضًا اللقطة الافتراضية الخاصة به — فلا توجد نسخ مؤرخة لتثبيتها، وبالتالي لا يوجد اسم مستعار يمكنه تغيير النموذج أو السعر بصمت. المقابل هو أنك لا تستطيع أيضًا تجميد سلوك معروف بأنه جيد والاستمرار عليه بينما يستقر شيء جديد.
يحتسب كلا النموذجين طبقة الاستدلال بشكل منفصل عن طبقة الصوت، وهنا يتوقف السعر المعلن عن كونه التكلفة الكاملة. تُحتسب استدعاءات Responses المفوّضة من GPT-Live-1 وفق أسعار النموذج الخلفي المُهيأ العادية لكل توكن. وتضيف xAI مبلغ 0.004 دولار عن كل إدخال نصي في جلسة الصوت، بالإضافة إلى استدعاءات الأدوات، ورقم هاتف مُخصّص بنحو 0.01 دولار في الدقيقة عند الحاجة إليه، والاتصالات الهاتفية والتخزين، فوق سعر الصوت لكل دقيقة. الوكيل الصوتي الذي يستمع في الغالب ويبحث عن شيء بين الحين والآخر سيبقى قريبًا من سعره المعلن؛ أما الذي يستدعي الأدوات في كل دور فلن يبقى كذلك، ولن يتباعدا في الاتجاه نفسه، لأن تصميم الخلفية المفوّضة وتصميم الأدوات داخل الجلسة يحرقان التوكنات في مواضع مختلفة.
من جانبنا، السبب في أن تغييرات السعر لكل دقيقة تستحق المراقبة عن كثب هو أن OrcaRouter يمرر سعر قائمة المزود دون أي هامش ربح. عندما يغيّر أحد البائعين سعرًا منشورًا، يتغير الرقم من جانبنا في نفس اليوم بدلاً من دورة العقد التالية.

ما الذي يكلفك إياه تقسيم التفويض في الهندسة
إذا كنت تختار بين هذين بناءً على المعمارية لا على السعر، فالسؤال الحاسم هو أين يقع الحدّ الفاصل.
يحتفظ نموذج xAI بالأدوات داخل الجلسة. هذا أبسط من حيث التفكير فيه — اتصال واحد، ومحادثة واحدة، ومكان واحد يحدث فيه استدعاء دالة — وهو يعني أن النموذج يستطيع أن يقرر في منتصف الجملة أنه يحتاج إلى البحث ويواصل التحدث بينما ينتظر.
نموذج OpenAI يُخرج هذا العمل إلى الخارج. تُبقي طبقة الصوت المحادثة حيّة وتُسلّم المهمة إلى نموذج استدلال منفصل عبر Responses API، ما يعني أن تعريفات أدواتك، واسترجاعك، ومنطق عملك توجد في تكامل عادي مع نموذج نصي بدلًا من أن تكون داخل تدفق أحداث الجلسة. هذا يعني أجزاءً متحركة أكثر، وهو أيضًا أكثر قابلية للنقل: فالنصف المُفوَّض هو نداء API عادي يمكنك تبديله وتسعيره والتحويل عند فشله بشكل مستقل عن طبقة الصوت.
هذا مهم لسبب واحد فقط. لا يقدّم GPT-Live-1 ولا Grok Voice Think Fast 2.0 أي جهة سوى البائع الخاص بكل منهما — فكلاهما أحادي المصدر، ولا يمكن للموجّه أن يساعدك في الشق الصوتي. ما يمكن للموجّه فعله هو توحيد النصف الذي يمكنك اختياره فعلاً. إن GPT-5.6 Terra، الواجهة الخلفية في مثال التفويض الخاص بـ OpenAI، متاح عبر OrcaRouter بسعر 2.00 دولار لكل مليون توكن إدخال و12.00 دولار لكل مليون توكن إخراج مع إتاحة كل من /v1/chat/completions و/v1/responses، إلى جانب نحو 190 نموذجًا آخر بمفتاح واحد. إذا كان وكيلك الصوتي يستدعي نموذج استدلال في كل دور، فهذا هو البند الذي يمكن للتوجيه أن يصنع فرقًا فيه.
الحكم، مقسّمًا حسب عبء العمل
• اختر GPT-Live-1 إذا كان السعر لكل دقيقة هو القيد، أو إذا كان مسار الاتصال لديك يتحدث WebRTC بالفعل، أو إذا كنت تريد أن يكون عقل الاستدلال خلف الصوت نموذجًا نصيًا قابلًا للتبديل بدلًا من أن يكون جزءًا ثابتًا من الجلسة.
• اختر Grok Voice Think Fast 2.0 إذا كنت بحاجة إلى جودة مُتحقَّق منها بشكل مستقل ومطروحة أمامك قبل أن تلتزم، أو إذا كانت بنية الاتصالات الهاتفية لديك أصيلة بتقنية WebSocket، أو إذا كانت الأدوات داخل الجلسة — وبخاصة البحث في X — جوهرية في المنتج وليست أمراً عارضاً.
• راقب الاسم المستعار إذا كنت بالفعل على xAI. إن تثبيت معرّف نموذج ذي إصدار هو الشيء الوحيد الذي يفصلك عن التغيير التلقائي التالي في المعدل، ويستحق الانضباط نفسه أن يُطبَّق في أي مكان يظهر فيه اسم مستعار عائم.
الخلاصة غير المريحة هي أن النموذج الأرخص هو الذي لا يقف خلفه دليل من طرف ثالث، والنموذج الأفضل توثيقًا هو الذي أصبح للتو أغلى بنسبة 60%. إذا كنت في مرحلة مبكرة بما يكفي من عملية البناء بحيث لا يكون أي من التكاملين مثبتًا نهائيًا، فإن أقل خطوة مخاطرة هي بناء نموذج أولي مقابل كليهما — فمسار الصوت لا يزيد عن بضع مئات من الأسطر في كلتا الحالتين — ودع جودة النص المفرّغ الخاصة بك تحسم الأمر، لأن الأدلة العامة لا تحسمه حاليًا.
