
Gemini 3.8 Live Extended Thinking مقابل GPT-Live-1: تعادل بفارق 1.1 نقطة وفاتورتان مختلفتان
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
على صعيد النتيجة المركبة، هذا تعادل. Gemini 3.8 Live Extended Thinking يقع عند 82.6 على مؤشر Speech to Speech Index لدى Artificial Analysis؛ GPT-Live-1، في واجهته الخلفية Astra بمستوى جهد استدلالي متوسط، يقع عند 81.5. على المكوّن الوكيلي الكامن تحته — إنجاز مهام τ-Voice — الفارق 0.7 نقطة، 68.6% مقابل 67.9%. وعلى مكوّن الاستدلال يكون أوسع ويسير في الاتجاه المعاكس: 97.7% على Big Bench Audio لنموذج Gemini، و90.1% لـ GPT-Live-1. لا شيء في هذا التفاوت يصمد أمام تشغيل ثانٍ للاختبار المعياري، ولا شيء منه هو ما ينبغي أن تبني قرارك عليه.
ما يفصل بين هذين ليس الجودة. بل إنهما يختلفان حول ماهية وكيل الصوت، ومن يقوم بالتفكير، و—الجزء الذي يصطدم ببند الميزانية أولًا—كيف تُحتسب تكلفة الجلسة. يفرض Gemini 3.8 Live Extended Thinking رسومًا حسب رمز الصوت، ويجري التفكير داخل النموذج نفسه الذي يتحدث. أما GPT-Live-1 فيفرض سعرًا ثابتًا مقابل زمن الجلسة، سواء كان أحد يتحدث أم لا، ويسلّم التفكير الفعلي إلى نموذج نصي منفصل تختاره وتدفع مقابله بشكل منفصل. هذان منتجان مختلفان يحملان درجة المعيار نفسها، والمناسب منهما يعتمد على سؤال لا تطرحه لوحة الصدارة أبدًا: كيف تبدو المكالمة المتوسطة على خطك؟
تعادل 1.1 نقطة، وأين ينكسر فعليًا
ابدأ بالأرقام، لأن نحافة العنوان هي المقصد:
• مؤشر الكلام إلى الكلام — Gemini 3.8 Live Extended Thinking (High) 82.6 مقابل GPT-Live-1 (خلفية Astra، جهد متوسط) 81.5
• الأداء الوكيلي (إتمام مهام τ-Voice) — 68.6% مقابل 67.9%، مع GPT-Live-1 عند 59.3% عندما يشغّل الواجهة الخلفية Sol بجهد منخفض
• الاستدلال الكلامي (Big Bench Audio) — 97.7% مقابل 90.1%، المكوّن الوحيد الذي لا يُعدّ الفارق فيه مجرد ضوضاء
• مسارات العمل المصرفية المعقّدة (Sierra τ³-Banking، حسب ما أفاد به المورّد) — 35.1% مقابل 32.0%
• الوقت حتى أول صوت — 1.35 ثانية مقابل 1.24–1.34 ثانية عبر واجهة API
• التكلفة المقاسة لكل ساعة — 3.50 دولار مقابل 5.83 دولار لتكوين Astra، وكلاهما وفق قياس الصوت المُدخَل لدى Artificial Analysis
القراءة الصادقة هي أن النموذجين لا يمكن التمييز بينهما على المؤشر المركّب، ويمكن التمييز بينهما في الاستدلال الكلامي حيث يتقدّم نموذج Gemini بنحو ثماني نقاط، ويمكن التمييز بينهما في التكلفة حيث يتقدّم بنحو 40%. أما ما يتفوق فيه GPT-Live-1 فهو أجزاء التجربة التي يصعب على أي معيار تقييمها: فهو مزدوج الاتجاه بالكامل حقًا، يستمع بينما يتحدث، ويطلق إشارات استماع رجعية، ويقرر عدة مرات في الثانية ما إذا كان سيتحدث أو يفسح المجال. أما Gemini 3.8 Live Extended Thinking فيعمل بنظام الأدوار. وهو يحل المشكلة الأساسية نفسها — ترك المتصل في صمت بينما يعمل الوكيل — عبر السرد بدلًا من ذلك، فيستدل ويتحدث في آن واحد بعبارات مثل «دعني أتحقق من ذلك…» بينما تُنفَّذ المهمة.
كلا الأسلوبين يُبقي الخط حيًّا. غير أنّ الإحساس بهما مختلف. وواحدٌ منهما فقط يظهر في الفهرس.

نموذجا فوترة، ولماذا تُضلّل بطاقة الأسعار
هذا هو القسم الذي يحدد معظم عمليات النشر، وهو القسم الذي تتخطاه التغطية.
Gemini 3.8 Live Extended Thinking تُحتسب رسومه بالطريقة نفسها التي تُحتسب بها رسوم نموذج الرموز. عبر Live API، الأسعار المنشورة هي 3.00 دولارات لكل مليون رمز إدخال صوتي — أي نحو 0.005 دولار لكل دقيقة من الإدخال الصوتي — و12.00 دولارًا لكل مليون رمز إخراج صوتي، أي نحو 0.018 دولار لكل دقيقة، مع احتساب رموز التفكير ضمن ذلك الإخراج. أنت تدفع مقابل الصوت الذي ينتقل. المتصل الذي يتوقف أو يفكر أو يُوضع على الانتظار لا يكلفك شيئًا ما دام صامتًا.
GPT-Live-1 تتم فوترته بالطريقة نفسها التي تتم بها فوترة خط الهاتف. إنه سعر ثابت قدره $0.05 لكل دقيقة من وقت الجلسة، يُحتسب لكل ثانية، بغض النظر عمن يتحدث أو ما إذا كان أي شخص يتحدث. الواجهة الخلفية للاستدلال غير مشمولة: نموذج النصوص الذي يقوم بالتفكير، وأي أدوات يستدعيها، تتم فوترتها بشكل منفصل إضافةً إلى ذلك. وهكذا يتحول السعر المعلن البالغ $0.05 إلى رقم إجمالي يبلغ حوالي $4.47 في الساعة على الواجهة الخلفية Sol و$5.83 في الساعة على Astra medium، وفقًا لقياسات Artificial Analysis.
ضع هذين الرقمين جنبًا إلى جنب، وستجد أن المقارنة الساذجة — 0.018 دولار مقابل 0.05 دولار في الدقيقة، أي فارق يبلغ 2.8× — خاطئة في الاتجاهين معًا. فأرقام التكلفة بالساعة المقيسة تضع الفارق الحقيقي عند 3.50 دولار مقابل 5.83 دولار، أي أقرب إلى 1.7×. لكن نموذج ساعة الجلسة يغيّر أيضًا شكل فاتورتك وليس مستوىها فحسب: فعلى GPT-Live-1 تتبع تكلفتك مدة المكالمة، لذا فإن الخط ذا المكالمات الطويلة الهادئة قليلة المحتوى — طابور دعم، أو خطوة تحقق، أو إحالة إلى نظام الرد الصوتي التفاعلي — يدفع القدر نفسه الذي يدفعه خط مكتظ. أما على جانب Gemini، فتتبع التكلفة الصوت، لذا فالصمت مجاني والإسهاب ليس كذلك. احسب الأرقام على متوسط مدة مكالمتك أنت قبل أن تحسبها على سعر الدقيقة، لأن هذا هو الرقم الذي يحدد أي الخيارين أرخص لك، وهو ليس الجواب نفسه لخط حجوزات وخط فرز.
حيث يحدث التفكير
الفرق البنيوي الثاني هو التفويض، وهو العامل الذي يحدد مقدار ما يمكنك استبداله فعلاً من هذا المكدس.
GPT-Live-1 هو واجهة أمامية. يتولى الصوت ثنائي الاتجاه، وعندما يحتاج استعلام إلى استدلال حقيقي فإنه يسلّم العمل إلى نموذج خلفي منفصل — GPT-5.5 وGPT-6 Astra موثّقان كخلفيتين — مع محددات جهد الاستدلال التي تتيح لك اختيار مقدار ما تريد شراءه من ذلك الخلفي. ولهذا تُدرج اللوحة GPT-Live-1 مرتين بدرجات مختلفة: 81.5 على Astra بجهد متوسط، و80.1 على Sol بجهد منخفض. وفارق 1.4 نقطة بين تهيئتيه هو أكبر من فجوة 1.1 نقطة بين النموذجين في هذه المواجهة، ما يخبرك بأنه على جانب OpenAI، التهيئة التي تختارها تهم أكثر من المورّد الذي تختاره.
Gemini 3.8 Live Extended Thinkingيستدل في النموذج نفسه الذي يتحدث. لا توجد خدمة خلفية منفصلة لاختيارها ولا فاتورة منفصلة لها؛ المقايضة هي أنك تضبط العمق عبر مستويات التفكير — المنخفض والمتوسط والعالي — على النموذج نفسه، والرقمان 82.6 و68.6 هما (العالي) التكوين. يعمل تنفيذ الأدوات وواجهة API في الخلفية بشكل غير متزامن على الجانبين، لذا لا يتعطل أي من النموذجين أثناء عمله.
نتيجة عملية واحدة: لأن ذكاء GPT-Live-1 هو نموذج نصي مُشترى خلف واجهة صوتية، فإن سقف جودته يتحرك عندما تطلق OpenAI نموذجًا نصيًا، وليس عندما تطلق نموذجًا صوتيًا. سقف Gemini 3.8 Live Extended Thinking يتحرك عندما تعيد Google تدريب النموذج الصوتي. إذا كنت تراهن على منصة صوتية لمدة عامين، فإن هذا الفرق في وتيرة الترقية يستحق تفكيرًا أكثر من 1.1 نقطة مؤشر.
ما هي تكاليف التبديل، أيًّا كان المسار الذي تسلكه
لا شيء من هذين يمثل تبديلًا لمعرّف النموذج، والفرق التي تتعامل معه على هذا النحو تكتشف ذلك في بيئة الإنتاج. عند الانتقال إلى Gemini 3.8 Live Extended Thinking يعني قبول عقد دور مختلف: استدعاءات الدوال غير متزامنة دائمًا، لذا فإن إعلان أداة حاجبة يُرجع خطأً صارمًا بدلًا من وضعها في قائمة الانتظار، وعلى العملاء قراءة interaction_status حقل — IN_PROGRESS أثناء الاستدلال أو عندما لا تزال أداة قيد التشغيل، IDLE فقط عند اكتمال المهمة بأكملها — بدلًا من الوثوق بـ turnComplete ليعني أن العمل قد انتهى. عند الانتقال إلى GPT-Live-1 يعني تبنّي بنيته التحتية لاختيار الواجهة الخلفية وواجهة فوترة ثانية، والتعايش مع واجهة برمجة تطبيقات لم تصبح متاحة عمومًا للمطورين إلا في 10 سبتمبر 2026، بعد ظهورها الأول في ChatGPT في 8 يوليو — لذا فإن الأدوات الخارجية ومجموعات تطوير البرامج والمراقبة حولها عمرها شهور، وليس سنوات. أيًا كان الاتجاه الذي تتحرك فيه، ضع ميزانية عمل التكامل بجانب فاتورة الرموز. في حزمة صوتية ناضجة، تكون إعادة الهيكلة عادة أكبر الاثنين.
كيفية إجراء مقارنة كهذه دون المراهنة عليها
الطريقة المعقولة لحسم مسألة فارق 1.1 نقطة هي تشغيل كليهما على حركة المرور الخاصة بك، والجزء المحرج هو أن القيام بذلك عادةً يعني تكاملين، وعقدين، ومجموعتي بيانات اعتماد. لا يجب أن يعني ذلك معماريتين. في كلا هذين النظامين، الواجهة الصوتية الأمامية هي طبقة رقيقة فوق استدعاءات نماذج النصوص العادية — بالنسبة لـ GPT-Live-1 فهذا صريح، وبالنسبة لجانب Gemini فإن تنفيذ الأدوات في الخلفية يُحل بالطريقة نفسها — وهذه الطبقة النصية هي حيث يكمن تباين التكلفة لديك وحيث يكون التبديل رخيصًا حقًا.
يوفر OrcaRouter 190 نموذجًا من مفتاح واحد بسعر قائمة المزوّد دون أي هامش ربح، لذا فإن أي تغيير في السعر من المنبع يصبح ساريًا لدينا في اليوم نفسه بدلًا من الانتظار حتى تجديد العقد التالي. بالنسبة إلى مكدس صوتي، فإن الخاصيتين المهمتين هما أن هدف التفويض يمكن تبديله على حركة المرور الحية دون المساس بتكامل الصوت، وأن التحويل التلقائي عند الفشل يبقي المكالمة قائمة عندما يقع خطأ في الخادم الخلفي أو تنتهي مهلته — وهذا ما يتيح لك تجربة إعداد غير مُثبَت على حركة مرور حقيقية دون وضع خط إنتاج خلفه. ولتكون دقيقًا بشأن ما نستضيفه وما لا نستضيفه: لا توجد نقطة نهاية Gemini 3.8 Live Extended Thinking ولا نقطة نهاية GPT-Live-1 على الراوتر لدينا — تلك تأتي من واجهات برمجة التطبيقات الخاصة بـ Google وOpenAI. أما النماذج النصية التي تُفوَّض إليها فكثيرًا ما تكون على الراوتر لدينا، ومن بينها Gemini 3.8 Flash.
أعلى اللوحة، ومدى قلة استقراره
اللقطة أدناه تم التقاطها في 16 سبتمبر 2026:
• Gemini 3.8 Live Extended Thinking (High) — 82.6، المركز الأول
• GPT-Live-1 (خلفية Astra، جهد متوسط) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• {{1}}GPT-Live-1 (خلفية Sol، جهد منخفض) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
ثلاثة أمور تستحق الملاحظة. أولًا، المركز الأول والثالث يفصل بينهما 1.3 نقطة، والمركز الأول والخامس 6.6، لذا فإن قمة هذا الجدول تزاحم وليست ترتيبًا. ثانيًا، النموذج المذكور في عنوان هذه المواجهة ليس مشاركة Gemini صاحبة المركز الخامس — بل هو Gemini 3.8 Live القياسي، منتج مختلف وأرخص بكثير، ولا ينبغي الخلط بينه وبين نسخة الاستدلال التي تُقارن هنا. ثالثًا، هناك سابقة في التعامل مع أي رقم مؤشر منفرد باعتباره مؤقتًا: فقد أبلغت xAI عن 82.9 لـ Grok Voice Think Fast 2.0 في يوليو، وهذا النموذج يظهر بـ81.3 على هذا الجدول. لا تصمد دائمًا درجات المؤشر التي يبلغ عنها الموردون عند ملامسة لوحة صدارة حية. إن أرقام τ-Voice البالغة 68.6% و67.9% توجد الآن على لوحة عامة تُدار تحت أداة القياس الخاصة بـ Artificial Analysis، لذا فهي مؤكدة وليست مجرد ادعاء — لكن فارق 0.7 نقطة بين نموذجين على الأداة نفسها ليس فارقًا. تحقق من ذلك على حركة المرور الخاصة بك أو تجاهله.

رقم إضافي يستحق أن يُحسب ضمن القرار، لأنه الرقم الأقل راحة في هذه المقارنة: تُبلغ Google عن 35.1% لـ Gemini 3.8 Live Extended Thinking على لوحة صدارة Sierra's τ³-Banking، مقابل 32.0% لـ GPT-Live-1 Astra. هذه أرقام معلنة من المورّد، ولم يُعَد إنتاجها، وهي تصف عالمًا يفشل فيه الوكيل الصوتي الرائد على تلك اللوحة في نحو ثلثي محاولات المهام المصرفية الواقعية. إذا كان وكيلك يجب أن ينجز عملًا خاضعًا للتنظيم ومتعدد الخطوات، فلا أحد هذين النموذجين مكتمل — وتقدّم بمقدار 3.1 نقطة على ذلك المعيار ليس سببًا لاختيار مورّد، بل سببًا للإبقاء على إنسان في حلقة التحقق.

إذن: إذا كانت طبيعية المحادثة هي المنتج وكانت مكالماتك قصيرة وكثيفة، فإن سلوك الازدواج الكامل لدى GPT-Live-1 ميزة حقيقية لا يستطيع المؤشر رؤيتها، والفوترة على أساس مدة الجلسة مقبولة عند طول المكالمة هذا. إذا كانت المكالمات طويلة أو هادئة أو متغيرة، أو إذا كان الاستدلال الصوتي والتكلفة لكل ساعة هما المهيمنان، فإن Gemini 3.8 Live Extended Thinking متقدم في المكونات المهمة وأرخص بنحو 40% في الساعة أثناء قيامه بذلك — مع التحفظ بأنه يعمل بنظام الأدوار، ولا يزال في مرحلة معاينة للمؤسسات، ويتطلب إعادة هيكلة من جانب العميل قبل أن يتمكن من تشغيل أدواتك. ما لا يبرره أي من هذا هو اختيار أحدهما استنادًا إلى قوة 1.1 نقطة مؤشر. بناءً على الأدلة المتاحة، السبب الصادق للاختيار بين هذين هو نموذج الفوترة والبنية التي تحته، وكلاهما من الأمور التي يمكنك قياسها على حركة المرور الخاصة بك هذا الأسبوع.
على OrcaRouter، يُبقي التحويل التلقائي عند الفشل المكالمةَ مستمرة عند حدوث خطأ في الواجهة الخلفية أو انتهاء المهلة.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
