
{{1}}Gemini 3.8 Live{{/1}} مقابل {{2}}GPT-Live-1{{/2}}: الاتصال ثنائي الاتجاه الكامل مقابل النموذج الذي يفكر بينما يتحدث
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
لمدة شهرين تقريبًا، حُسِم الجدل بالمعمارية. GPT-Live-1ثنائي الاتجاه بالكامل حقًا — فهو يستمع بينما يتحدث، ويُصدر إشارات متجاوبة مثل «ممم» و«فهمت»، ويقرر عدة مرات في الثانية ما إذا كان سيتحدث أو يفسح المجال. Gemini 3.8 Live، الذي أُعلن في 15 سبتمبر 2026، نموذج قائم على الأدوار. في ظل الإطار القديم، جعل ذلك المقارنة سهلة، وهو الآن أسلوب خاطئ لقراءتها.
ما تغيّر ليس أن Google ضاهت full-duplex، بل أن Google طرحت الشيء الذي كان full-duplex يُستخدم للتعويض عنه: نموذج صوتي قادر على إجراء محادثة بينما تُنفَّذ مهمة متعددة الخطوات في الخلفية، ونسخة ثانية تفكر بصوت مسموع أثناء عملها. الفرق المعماري حقيقي. غير أنه لم يعد المحور الذي يحدد قرار الشراء.
طريقتان لإبقاء المحادثة حيّة
الرهان على الازدواج الكامل هو أن جودة المحادثة هي المنتج. يعالج GPT-Live-1 الصوت المدخل والمخرج بشكل مستمر ومتزامن داخل نموذج واحد، بدلًا من تسلسل تحويل الكلام إلى نص ثم إلى نموذج لغوي ثم إلى تحويل النص إلى كلام. وهذا يلغي فقدان المعلومات بين المراحل، وينتج السلوك الذي يلاحظه الناس فعلًا: يمكنك المقاطعة في منتصف الإجابة فيتكيّف؛ ولا يخطئ في اعتبار وقفة أو ضجيج خلفي نهايةً لدورك؛ ويبقى صامتًا حتى يُطلب منه التحدث.
الرهان القائم على الأدوار، الذي يخوضه Gemini 3.8 Live، هو أن المحادثة هي البنية الداعمة للعمل. تتمحور ميزاته حول الحفاظ على إنتاجية الجلسة بدلاً من الحفاظ على الإيقاع الطبيعي: معالجة المدخلات البصرية شبه الفورية، والانتقال التلقائي بين 97 لغة مدعومة أثناء المحادثة، وتنفيذ الأدوات وواجهات برمجة التطبيقات في الخلفية الذي يقر بالطلب ويواصل التحدث بينما يكتمل الاستدعاء.
يرفض كلا النموذجين إنهاء المكالمة معك أثناء تفكيرهما. لكنهما يختلفان في طريقة الرفض. يفعل GPT-Live-1 ذلك بعدم إيقاف بث الصوت أبدًا. أما Google فتفعل ذلك بالتحدث طوال العمل.

ما الذي يقوله المؤشر فعليًا
تحتفظ Artificial Analysis بمؤشر Speech to Speech — وهو مركّب مرجّح من الاستدلال الكلامي، والأداء الوكيلي، وتفضيلات الساحة، ومعدل نجاح المهام. اقرأ لوحة الصدارة الملتقطة في 16 سبتمبر 2026 بعناية، لأن العنوان الرئيسي يخفي البنية:
• Gemini 3.8 Live Extended Thinking — 82.6 (الأول)
• GPT-Live-1 (واجهة Astra الخلفية، جهد متوسط) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• {{1}}GPT-Live-1 (خلفية Sol، جهد منخفض) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
ثلاثة أمور تنتج عن هذا الترتيب. أولًا، تحتل Google المرتبة الأولى، لكنها تحتلها بالنسخة المكلفة، لا تلك التي سينشرها معظم الناس. ثانيًا، يظهر GPT-Live-1 مرتين، لأن Artificial Analysis تقيّم النظام بأكمله لا الواجهة الصوتية الأمامية — والفارق البالغ 1.4 نقطة بين تهيئتيه أكبر بسبع مرات من الفارق البالغ 0.2 نقطة بين المركزين الأول والثاني. ثالثًا، النموذج المذكور في عنوان هذه المواجهة، Gemini 3.8 Live، يأتي في المركز الخامس، أدنى من كلا تهيئتي GPT-Live-1.
إذا كنت تقارن مقارنة متماثلة — الفئة القياسية مقابل الفئة القياسية — فإن GPT-Live-1 يفوز في هذه المواجهة على المؤشر المركّب، والفرق ليس ضئيلًا. إن نتيجة 82.6 تعود إلى Gemini 3.8 Live Extended Thinking، وهو منتج مختلف بسعر مختلف وطرح مختلف.

أين لا يزال GPT-Live-1 متقدمًا
الاتصال المزدوج الكامل ليس تمييزًا تسويقيًا، ويُظهر تقسيم المعايير أين يتحول إلى ميزة حقيقية:
• الأداء الوكيلي — يتقدّم GPT-Live-1 بفارق حاسم في τ-Voice بنسبة 67.9% مقابل 56.5% لـ Grok. لم تنشر Google رقمًا مماثلًا لـ τ-Voice بشأن Gemini 3.8 Live، بل فقط 68.6% لنسخة Extended Thinking.
• ديناميكيات المحادثة — لا يزال تبادل الأدوار في الوضع المزدوج الكامل يشكّل معيار الطبيعية، وقد تخلفت النماذج القائمة على الأدوار تاريخياً عن اللحاق به.
• عمق التفويض — يُحيل GPT-Live-1 الاستعلامات الصعبة إلى نموذج نصي متقدّم، مع توثيق كلٍّ من GPT-5.5 وGPT-6 Astra كنماذج خلفية، ويكشف عن محدّدات جهد الاستدلال.
• الاستقاء — تحتوي النصوص الصوتية من ChatGPT على روابط الاستشهاد، وهو أمر لا يزال غير شائع في التفاعلات الصوتية عمومًا.
العامل الموازن هو أن GPT-Live-1 يتخلف في الاستدلال الكلامي الخام: 90.1% في Big Bench Audio مقابل 97.2% لـ Grok. كما أن رقم الكمون الرئيسي البالغ 0.798 ثانية في Full Duplex Bench هو قياس مختلف عن زمن وصول الـ API إلى أول صوت، الذي يتراوح من 1.24 إلى 1.34 ثانية.
أين يتفوق Gemini 3.8 Live
مزايا Google لا تتعلق بالمحادثة بقدر ما تتعلق بما يمكن أن تفعله الجلسة:
• الرؤية، اليوم — دعمت Gemini إدخال الكاميرا ومشاركة الشاشة منذ فترة. أُطلقت GPT-Live-1 من دون فيديو أو مشاركة شاشة، حيث قالت OpenAI إنهما قادمان وأشارت إلى Advanced Voice Mode الأقدم كحل مؤقت. وتضيف Gemini 3.8 Live معالجة المدخلات البصرية شبه الفورية فوق ذلك.
• تغطية اللغات — 97 لغة مدعومة مع إمكانية التبديل التلقائي في منتصف المحادثة، مقابل مجموعة أضيق بكثير على جانب OpenAI.
• التكلفة — السعر المُعلن هو 0.005 دولار لكل دقيقة من الإدخال الصوتي و0.018 دولار لكل دقيقة من الإخراج الصوتي. وتُحتسب GPT-Live-1 بسعر 0.05 دولار لكل دقيقة صوتية للواجهة الأمامية وحدها، مع تكلفة إجمالية مقيسة تبلغ نحو 4.47–5.83 دولار في الساعة عند احتساب رموز الواجهة الخلفية.
• مستوى ثانٍ يفكّر بصوت مسموع — يسرد Gemini 3.8 Live Extended Thinking تقدّمه بإشارات مثل "دعني أتحقق من ذلك…"، وهو حلّ مختلف لمشكلة الصمت عمّا يقدّمه الازدواج الكامل.
مقارنة التكلفة التي تهم
تبدو الأسعار الأمامية وكأنها هزيمة ساحقة — 0.018 دولار مقابل 0.05 دولار في الدقيقة — كما أن الأرقام لكل ساعة أكثر حدة. يضع مخطط تكلفة الساعة لصوت الإدخال من Artificial Analysis نموذج Gemini 3.8 Live عند 1.50 دولار في الساعة، مقابل 4.14 دولار لـ GPT-Realtime-2 High و10.75 دولار لـ GPT-Realtime-2.1 High. ويستقر Grok Voice Think Fast 2.0 عند 4.80 دولار.
المشكلة أنّ أياً من الرقمين ليس الفاتورة الحقيقية. فسعر GPT-Live-1 البالغ 0.05 دولار للدقيقة يغطي واجهة الصوت الأمامية فقط؛ أما نموذج النصوص الخلفي الذي يقوم بالاستدلال الفعلي فيُحتسب بشكل منفصل، وهكذا يتحول رقم معلن قدره 0.05 دولار إلى 4.47–5.83 دولار للساعة إجمالاً. ولدى Gemini 3.8 Live البنية الهيكلية نفسها — فتنفيذ الأدوات في الخلفية هو من عمل نموذج النصوص — ولم تنشر Google تكلفة ذلك.
إذن، القراءة الصادقة هي أن Gemini 3.8 Live أرخص عند المدخل بفارق واسع، أما المقارنة الإجمالية فهي غير معروفة لكليهما حتى تقيس عبء العمل الخاص بك. هذا ليس تهربًا؛ بل هو الوضع الفعلي للمعلومات.
الطبقة التي يفوّض إليها كلاهما
إليك الحقيقة البنيوية التي تجعل هذه المواجهة قرارًا أقل إحكامًا للارتباط مما تبدو عليه. كلا النموذجين يفوّض المهام. فـ GPT-Live-1 يحوّل الاستعلامات الصعبة إلى نموذج نصي خلفي بحكم التصميم، بينما تُترجم عمليات تنفيذ الأدوات في الخلفية على جانب Gemini إلى استدعاءات نموذج عادية. وفي الحالتين، الواجهة الأمامية الصوتية ليست سوى طبقة رقيقة فوق نموذج نصي يتولى الاستدلال — وهذه الطبقة النصية هي حيث يكمن تباين تكاليفك، وحيث يكون التبديل رخيصًا.
يوفّر OrcaRouter 190 نموذجًا خلف مفتاح واحد بسعر قائمة المزوّد دون هامش ربح، لذا يصل أي خفض سعر من المنبع إلى جهتنا في اليوم نفسه بدلًا من عند تجديد العقد التالي. بالنسبة لمنظومة صوتية، فإن الخاصيتين المهمتين هما أن هدف التفويض يمكن تبديله أثناء حركة المرور الحية دون المساس بتكامل الصوت، وأن التحويل التلقائي عند الفشل يبقي المكالمة مستمرة عندما يحدث خطأ في خادم خلفي أو تنتهي المهلة. توضيح واحد، لأنه من السهل الإيحاء بخلاف ذلك: نحن لا نستضيف نقاط نهاية الصوت Gemini 3.8 Live أو GPT-Live-1 — فهي تأتي من واجهات API الخاصة بالموردين أنفسهم. أما النماذج النصية التي تُوكل إليها المهام عمومًا فهي موجودة على الراوتر.

كيفية الاختيار
اختر GPT-Live-1 إذا كانت جودة المحادثة هي المنتج — التعامل الطبيعي مع المقاطعات، وإشارات الاستماع، والشعور بأنك تتحدث إلى شيء ما بدلاً من تشغيله — وإذا كنت قادرًا على استيعاب التكلفة الإجمالية، وهي أعلى بكثير مما يوحي به السعر المعلن. لاحظ أن واجهة برمجة التطبيقات الخاصة به لم تتوفر إلا في سبتمبر 2026، لذا فإن أدوات الطرف الثالث المحيطة به حديثة العهد.
اختر Gemini 3.8 Live إذا كنت بحاجة إلى الرؤية الآن، أو إذا كنت بحاجة إلى أكثر من بضع وعشرين لغة، أو إذا كانت اقتصاديات الدقيقة هي ما يهيمن على نموذجك. تقبّل أنك تشتري الفئة القياسية، التي تحتل المرتبة الخامسة في المؤشر المركّب وليس الأولى، وأن الرقم 82.6 الذي سيقتبسه الجميع يعود إلى نسخة Extended Thinking.
اختر Gemini 3.8 Live Extended Thinking إذا كان الاستدلال هو المقصد وكنت تريد المتصدر الحالي في المؤشر — لكن تحقق من طرحه أولاً، لأن مسار توزيعه عبر Gemini Live وDocs وGmail وKeep أوسع من مسار النموذج القياسي، وما زال توفره للمؤسسات في معاينة خاصة.
الشيء الذي يجب مراقبته خلال الربع القادم هو ما إذا كان الازدواج الكامل سيظل خندقًا. النماذج القائمة على الأدوار تسد الفجوة الحوارية عبر مسار مختلف — إبقاء الصوت مشغولًا بالسرد بينما يجري العمل — وإذا صمد ذلك في ظل الاستخدام الفعلي، فإن الفارق المعماري الذي ميز هذه الفئة لمدة عام سيتوقف عن كونه الشيء الذي يسأل عنه المشترون.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
