بطاقة عنوان رئيسية لـ Gemini 3.8 Live مقابل GPT-Live-1 مع العبارة الاستهلالية «OrcaRouter · رادار النماذج — وجهًا لوجه» والعنوان الفرعي «ازدواج كامل مقابل قائم على الأدوار - حجة المعمارية، إعادة قراءة». تقول بطاقتان «Gemini 3.8 Live — قائم على الأدوار، دعم الرؤية اليوم، 97 لغة، دقائق أرخص» و«GPT-Live-1 — ازدواج كامل، قنوات خلفية، يفوّض إلى خلفية رائدة»، مع شرائح للمؤشر 76.0 مقابل 81.5، و0.018 دولار مقابل 0.05 دولار لكل دقيقة، والفيديو قادم قريبًا على OpenAI. شعار OrcaRouter مُركّب في الزاوية اليمنى السفلية.
Guides & Insights

{{1}}Gemini 3.8 Live{{/1}} مقابل {{2}}GPT-Live-1{{/2}}: الاتصال ثنائي الاتجاه الكامل مقابل النموذج الذي يفكر بينما يتحدث

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لمدة شهرين تقريبًا، حُسِم الجدل بالمعمارية. GPT-Live-1ثنائي الاتجاه بالكامل حقًا — فهو يستمع بينما يتحدث، ويُصدر إشارات متجاوبة مثل «ممم» و«فهمت»، ويقرر عدة مرات في الثانية ما إذا كان سيتحدث أو يفسح المجال. Gemini 3.8 Live، الذي أُعلن في 15 سبتمبر 2026، نموذج قائم على الأدوار. في ظل الإطار القديم، جعل ذلك المقارنة سهلة، وهو الآن أسلوب خاطئ لقراءتها.

ما تغيّر ليس أن Google ضاهت full-duplex، بل أن Google طرحت الشيء الذي كان full-duplex يُستخدم للتعويض عنه: نموذج صوتي قادر على إجراء محادثة بينما تُنفَّذ مهمة متعددة الخطوات في الخلفية، ونسخة ثانية تفكر بصوت مسموع أثناء عملها. الفرق المعماري حقيقي. غير أنه لم يعد المحور الذي يحدد قرار الشراء.

طريقتان لإبقاء المحادثة حيّة

الرهان على الازدواج الكامل هو أن جودة المحادثة هي المنتج. يعالج GPT-Live-1 الصوت المدخل والمخرج بشكل مستمر ومتزامن داخل نموذج واحد، بدلًا من تسلسل تحويل الكلام إلى نص ثم إلى نموذج لغوي ثم إلى تحويل النص إلى كلام. وهذا يلغي فقدان المعلومات بين المراحل، وينتج السلوك الذي يلاحظه الناس فعلًا: يمكنك المقاطعة في منتصف الإجابة فيتكيّف؛ ولا يخطئ في اعتبار وقفة أو ضجيج خلفي نهايةً لدورك؛ ويبقى صامتًا حتى يُطلب منه التحدث.

الرهان القائم على الأدوار، الذي يخوضه Gemini 3.8 Live، هو أن المحادثة هي البنية الداعمة للعمل. تتمحور ميزاته حول الحفاظ على إنتاجية الجلسة بدلاً من الحفاظ على الإيقاع الطبيعي: معالجة المدخلات البصرية شبه الفورية، والانتقال التلقائي بين 97 لغة مدعومة أثناء المحادثة، وتنفيذ الأدوات وواجهات برمجة التطبيقات في الخلفية الذي يقر بالطلب ويواصل التحدث بينما يكتمل الاستدعاء.

يرفض كلا النموذجين إنهاء المكالمة معك أثناء تفكيرهما. لكنهما يختلفان في طريقة الرفض. يفعل GPT-Live-1 ذلك بعدم إيقاف بث الصوت أبدًا. أما Google فتفعل ذلك بالتحدث طوال العمل.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

ما الذي يقوله المؤشر فعليًا

تحتفظ Artificial Analysis بمؤشر Speech to Speech — وهو مركّب مرجّح من الاستدلال الكلامي، والأداء الوكيلي، وتفضيلات الساحة، ومعدل نجاح المهام. اقرأ لوحة الصدارة الملتقطة في 16 سبتمبر 2026 بعناية، لأن العنوان الرئيسي يخفي البنية:

Gemini 3.8 Live Extended Thinking — 82.6 (الأول)

• GPT-Live-1 (واجهة Astra الخلفية، جهد متوسط) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• {{1}}GPT-Live-1 (خلفية Sol، جهد منخفض) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

ثلاثة أمور تنتج عن هذا الترتيب. أولًا، تحتل Google المرتبة الأولى، لكنها تحتلها بالنسخة المكلفة، لا تلك التي سينشرها معظم الناس. ثانيًا، يظهر GPT-Live-1 مرتين، لأن Artificial Analysis تقيّم النظام بأكمله لا الواجهة الصوتية الأمامية — والفارق البالغ 1.4 نقطة بين تهيئتيه أكبر بسبع مرات من الفارق البالغ 0.2 نقطة بين المركزين الأول والثاني. ثالثًا، النموذج المذكور في عنوان هذه المواجهة، Gemini 3.8 Live، يأتي في المركز الخامس، أدنى من كلا تهيئتي GPT-Live-1.

إذا كنت تقارن مقارنة متماثلة — الفئة القياسية مقابل الفئة القياسية — فإن GPT-Live-1 يفوز في هذه المواجهة على المؤشر المركّب، والفرق ليس ضئيلًا. إن نتيجة 82.6 تعود إلى Gemini 3.8 Live Extended Thinking، وهو منتج مختلف بسعر مختلف وطرح مختلف.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

أين لا يزال GPT-Live-1 متقدمًا

الاتصال المزدوج الكامل ليس تمييزًا تسويقيًا، ويُظهر تقسيم المعايير أين يتحول إلى ميزة حقيقية:

الأداء الوكيلي — يتقدّم GPT-Live-1 بفارق حاسم في τ-Voice بنسبة 67.9% مقابل 56.5% لـ Grok. لم تنشر Google رقمًا مماثلًا لـ τ-Voice بشأن Gemini 3.8 Live، بل فقط 68.6% لنسخة Extended Thinking.

ديناميكيات المحادثة — لا يزال تبادل الأدوار في الوضع المزدوج الكامل يشكّل معيار الطبيعية، وقد تخلفت النماذج القائمة على الأدوار تاريخياً عن اللحاق به.

عمق التفويض — يُحيل GPT-Live-1 الاستعلامات الصعبة إلى نموذج نصي متقدّم، مع توثيق كلٍّ من GPT-5.5 وGPT-6 Astra كنماذج خلفية، ويكشف عن محدّدات جهد الاستدلال.

الاستقاء — تحتوي النصوص الصوتية من ChatGPT على روابط الاستشهاد، وهو أمر لا يزال غير شائع في التفاعلات الصوتية عمومًا.

العامل الموازن هو أن GPT-Live-1 يتخلف في الاستدلال الكلامي الخام: 90.1% في Big Bench Audio مقابل 97.2% لـ Grok. كما أن رقم الكمون الرئيسي البالغ 0.798 ثانية في Full Duplex Bench هو قياس مختلف عن زمن وصول الـ API إلى أول صوت، الذي يتراوح من 1.24 إلى 1.34 ثانية.

أين يتفوق Gemini 3.8 Live

مزايا Google لا تتعلق بالمحادثة بقدر ما تتعلق بما يمكن أن تفعله الجلسة:

الرؤية، اليوم — دعمت Gemini إدخال الكاميرا ومشاركة الشاشة منذ فترة. أُطلقت GPT-Live-1 من دون فيديو أو مشاركة شاشة، حيث قالت OpenAI إنهما قادمان وأشارت إلى Advanced Voice Mode الأقدم كحل مؤقت. وتضيف Gemini 3.8 Live معالجة المدخلات البصرية شبه الفورية فوق ذلك.

تغطية اللغات — 97 لغة مدعومة مع إمكانية التبديل التلقائي في منتصف المحادثة، مقابل مجموعة أضيق بكثير على جانب OpenAI.

التكلفة — السعر المُعلن هو 0.005 دولار لكل دقيقة من الإدخال الصوتي و0.018 دولار لكل دقيقة من الإخراج الصوتي. وتُحتسب GPT-Live-1 بسعر 0.05 دولار لكل دقيقة صوتية للواجهة الأمامية وحدها، مع تكلفة إجمالية مقيسة تبلغ نحو 4.47–5.83 دولار في الساعة عند احتساب رموز الواجهة الخلفية.

مستوى ثانٍ يفكّر بصوت مسموع — يسرد Gemini 3.8 Live Extended Thinking تقدّمه بإشارات مثل "دعني أتحقق من ذلك…"، وهو حلّ مختلف لمشكلة الصمت عمّا يقدّمه الازدواج الكامل.

مقارنة التكلفة التي تهم

تبدو الأسعار الأمامية وكأنها هزيمة ساحقة — 0.018 دولار مقابل 0.05 دولار في الدقيقة — كما أن الأرقام لكل ساعة أكثر حدة. يضع مخطط تكلفة الساعة لصوت الإدخال من Artificial Analysis نموذج Gemini 3.8 Live عند 1.50 دولار في الساعة، مقابل 4.14 دولار لـ GPT-Realtime-2 High و10.75 دولار لـ GPT-Realtime-2.1 High. ويستقر Grok Voice Think Fast 2.0 عند 4.80 دولار.

المشكلة أنّ أياً من الرقمين ليس الفاتورة الحقيقية. فسعر GPT-Live-1 البالغ 0.05 دولار للدقيقة يغطي واجهة الصوت الأمامية فقط؛ أما نموذج النصوص الخلفي الذي يقوم بالاستدلال الفعلي فيُحتسب بشكل منفصل، وهكذا يتحول رقم معلن قدره 0.05 دولار إلى 4.47–5.83 دولار للساعة إجمالاً. ولدى Gemini 3.8 Live البنية الهيكلية نفسها — فتنفيذ الأدوات في الخلفية هو من عمل نموذج النصوص — ولم تنشر Google تكلفة ذلك.

إذن، القراءة الصادقة هي أن Gemini 3.8 Live أرخص عند المدخل بفارق واسع، أما المقارنة الإجمالية فهي غير معروفة لكليهما حتى تقيس عبء العمل الخاص بك. هذا ليس تهربًا؛ بل هو الوضع الفعلي للمعلومات.

الطبقة التي يفوّض إليها كلاهما

إليك الحقيقة البنيوية التي تجعل هذه المواجهة قرارًا أقل إحكامًا للارتباط مما تبدو عليه. كلا النموذجين يفوّض المهام. فـ GPT-Live-1 يحوّل الاستعلامات الصعبة إلى نموذج نصي خلفي بحكم التصميم، بينما تُترجم عمليات تنفيذ الأدوات في الخلفية على جانب Gemini إلى استدعاءات نموذج عادية. وفي الحالتين، الواجهة الأمامية الصوتية ليست سوى طبقة رقيقة فوق نموذج نصي يتولى الاستدلال — وهذه الطبقة النصية هي حيث يكمن تباين تكاليفك، وحيث يكون التبديل رخيصًا.

يوفّر OrcaRouter 190 نموذجًا خلف مفتاح واحد بسعر قائمة المزوّد دون هامش ربح، لذا يصل أي خفض سعر من المنبع إلى جهتنا في اليوم نفسه بدلًا من عند تجديد العقد التالي. بالنسبة لمنظومة صوتية، فإن الخاصيتين المهمتين هما أن هدف التفويض يمكن تبديله أثناء حركة المرور الحية دون المساس بتكامل الصوت، وأن التحويل التلقائي عند الفشل يبقي المكالمة مستمرة عندما يحدث خطأ في خادم خلفي أو تنتهي المهلة. توضيح واحد، لأنه من السهل الإيحاء بخلاف ذلك: نحن لا نستضيف نقاط نهاية الصوت Gemini 3.8 Live أو GPT-Live-1 — فهي تأتي من واجهات API الخاصة بالموردين أنفسهم. أما النماذج النصية التي تُوكل إليها المهام عمومًا فهي موجودة على الراوتر.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

كيفية الاختيار

اختر GPT-Live-1 إذا كانت جودة المحادثة هي المنتج — التعامل الطبيعي مع المقاطعات، وإشارات الاستماع، والشعور بأنك تتحدث إلى شيء ما بدلاً من تشغيله — وإذا كنت قادرًا على استيعاب التكلفة الإجمالية، وهي أعلى بكثير مما يوحي به السعر المعلن. لاحظ أن واجهة برمجة التطبيقات الخاصة به لم تتوفر إلا في سبتمبر 2026، لذا فإن أدوات الطرف الثالث المحيطة به حديثة العهد.

اختر Gemini 3.8 Live إذا كنت بحاجة إلى الرؤية الآن، أو إذا كنت بحاجة إلى أكثر من بضع وعشرين لغة، أو إذا كانت اقتصاديات الدقيقة هي ما يهيمن على نموذجك. تقبّل أنك تشتري الفئة القياسية، التي تحتل المرتبة الخامسة في المؤشر المركّب وليس الأولى، وأن الرقم 82.6 الذي سيقتبسه الجميع يعود إلى نسخة Extended Thinking.

اختر Gemini 3.8 Live Extended Thinking إذا كان الاستدلال هو المقصد وكنت تريد المتصدر الحالي في المؤشر — لكن تحقق من طرحه أولاً، لأن مسار توزيعه عبر Gemini Live وDocs وGmail وKeep أوسع من مسار النموذج القياسي، وما زال توفره للمؤسسات في معاينة خاصة.

الشيء الذي يجب مراقبته خلال الربع القادم هو ما إذا كان الازدواج الكامل سيظل خندقًا. النماذج القائمة على الأدوار تسد الفجوة الحوارية عبر مسار مختلف — إبقاء الصوت مشغولًا بالسرد بينما يجري العمل — وإذا صمد ذلك في ظل الاستخدام الفعلي، فإن الفارق المعماري الذي ميز هذه الفئة لمدة عام سيتوقف عن كونه الشيء الذي يسأل عنه المشترون.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا