بطاقة عنوان رئيسية تحمل: GPT-Live-1 مقابل Gemini 3.5 Live Translate، وعنواناً فرعياً: عامّ مُطلَق في مواجهة متخصص في المعاينة، وسطراً: GA بسعر 0.05 دولار في الدقيقة مقابل المعاينة بنحو 0.037 دولار في الدقيقة، فوق لوحتين: تُظهر اليسرى موجة صوتية بازدواج كامل مع أسهم تنحني في الاتجاهين وشارة GA ممتلئة، وتُظهر اليمنى كرة أرضية مع فقاعتَي كلام وشارة PREVIEW محددة بإطار، مع شعار OrcaRouter مركّباً في الزاوية.
Guides & Insights

GPT-Live-1 مقابل Gemini 3.5 Live Translate: نظام عام مُطلَق مقابل متخصّص قيد المعاينة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يُجرى مقارنة بين هذين النموذجين لأن كليهما يوفّر الكلام في الوقت الفعلي عبر API، لكن المقارنة تنهار بمجرد أن تقرأ بطاقات النموذج. GPT-Live-1 هو نموذج صوتي كامل الازدواجية متعدد الأغراض نقلته OpenAI إلى API المطورين في 10 سبتمبر 2026، بعد ثلاثة أشهر من إطلاقه داخل ChatGPT في 8 يوليو. Gemini 3.5 Live Translate هو نموذج ترجمة من صوت إلى صوت مخصص لغرض واحد، أطلقته Google DeepMind في 9 يونيو 2026، ولا يزال معرّف النموذج الخاص به يحمل كلمة preview. أحد هذين يمكنك تقديمه لعملاء يدفعون اليوم وفق سعر منشور. والآخر يمكن لـ Google أن تغيّره تحتك دون إشعار إهمال. هذا التفاوت، وليس ورقة المعايير، هو ما ينبغي أن يحدد الاختيار.

آلتان مختلفتان تحملان الملصق نفسه

يجدر بنا أن نتحدث بصراحة عن مدى ضآلة التداخل بين هذه الأمور. يقوم Gemini 3.5 Live Translate بالترجمة. فهو يتلقى صوتًا متدفقًا بلغة واحدة ويعيد صوتًا متدفقًا بلغة أخرى، مع الحفاظ على صوت المتحدث ونبرته، عبر أكثر من 70 لغة وأكثر من 2000 زوج لغوي، مع الكشف التلقائي عن اللغة والتشغيل ثنائي الاتجاه. وهو لا يجري محادثة، ولا يستدعي دالة، ولا يجيب عن سؤال. إنه محرك ترجمة فورية.

GPT-Live-1 هو الشكل المعاكس. إنه نموذج محادثة: يستمع ويتحدث في الوقت نفسه، ويقرر عدة مرات في الثانية ما إذا كان يواصل الاستماع، أو يتوقف مؤقتًا، أو يقاطع، أو يستدعي أداة، ويسند العمل الثقيل — البحث في الويب، والتفكير الأعمق، والمهام الوكيلية — إلى نموذج استدلال منفصل عبر Responses API بينما تستمر المحادثة. مثال WebRTC الذي نشرته Ope​nAI بنفسها يربط هذا التفويض بـ GPT-5.6 Terra. الترجمة واحدة من الأشياء التي يمكنه القيام بها؛ وليست ميزة يملك نموذج Goo​gle أي مكافئ لها في الاتجاه الآخر.

إذن، السؤال العملي أضيق مما توحي به المواجهة الرئيسية: إذا كان ما تبنيه هو الترجمة الفورية، فنموذج Google مصمم خصيصًا لهذا الغرض، بينما نموذج OpenAI عام الأغراض. وإذا كان ما تبنيه وكيلًا صوتيًا يترجم من حين لآخر، فإن GPT-Live-1 هو الوحيد بين الاثنين الذي يقع أصلًا في فئة المنتج الصحيحة.

ما تكلفة كل واحد منها لكل دقيقة من الصوت؟

هنا يُبرّر المتخصص وجوده، والحسابات عويصة حقًا على OpenAI.

• GPT-Live-1 — ‏0.05 دولار لكل دقيقة من الصوت، تُحتسب بالثانية بدلًا من تقريبها إلى الدقيقة الكاملة التالية. تُحتسب عمليات الاستدلال واستدعاءات الأدوات التي ينفّذها الخادم الخلفي المفوَّض بشكل منفصل وفق الأسعار المعتادة لذلك النموذج.

• Gemini 3.5 Live Translate — ‏3.50 دولار لكل مليون رمز إدخال صوتي و21.00 دولارًا لكل مليون رمز إخراج صوتي، مع احتساب الفوترة بواقع 25 رمزًا لكل ثانية من الصوت. وبالمجموع، يبلغ ذلك نحو 0.037 دولار لكل دقيقة من الصوت المترجم.

من حيث دقائق الترجمة الصافية، تُعد Goo​gle أرخص بنحو الربع. وهذا ليس فرقًا ناتجًا عن التقريب عند التوسّع: إذ تكلّف 10,000 دقيقة ترجمة شفهية شهريًا نحو 500 دولار على طبقة الصوت لدى GPT-Live-1، مقابل نحو 368 دولارًا على Gem​ini 3.5 Live Translate. والفجوة حقيقية وليست أثرًا من تغيير طريقة الاحتساب، لأن النموذجين يحتسبان رسومهما على وحدات مختلفة فعليًا.

هناك مكمن مشكلة في الاتجاه الآخر. الرقم المعلن البالغ $0.05 لـ GPT-Live-1 هو سعر طبقة الصوت فقط. إذا قام وكيلك بالترجمة وأيضًا بالبحث عن شيء ما، أو أحال جملة صعبة إلى نموذج استدلال، فأنت تدفع مقابل ذلك التفويض إضافةً إلى ذلك — ويُسعَّر النموذج المفوَّض لكل رمز مثل أي نموذج رائد آخر. حِمل عمل الترجمة فقط لا يفعِّل ذلك أبدًا. أما حِمل عمل الترجمة مع أي شيء إضافي فيفعِّل ذلك، ويتوقف تحديد الفائز في المقارنة لكل دقيقة عن كونه بديهيًا.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

تسمية المعاينة هي المخاطرة التي لا يأخذها أحد في الحسبان.

معرف نموذج Gemini 3.5 Live Translate هو gemini-3.5-live-translate-preview. تم إطلاقه إلى Gemini Live API وGoogle AI Studio كمعاينة عامة، وفي الوقت نفسه إلى تطبيق Google Translate على Android وiOS وكمعاينة خاصة في Google Meet لعملاء Workspace المختارين. تعني المعاينة ما عنته دائمًا في Google: لا ضمان للاستقرار، ولا نافذة إيقاف منشورة، ولا التزام بأن السعر الذي تدفعه سيبقى بعد الإصدار التالي.

بالنسبة لتطبيق موجّه للمستهلكين، هذا أمر مقبول. لكن بالنسبة لأعباء العمل التي وُجّه هذا النموذج إليها فعليًا — الترجمة الفورية في مركز اتصال، أو منتج للاجتماعات، أو منتج للسفر — فهو أكبر مخاطر التكامل على الإطلاق في المنظومة التقنية. فأنت تبني تبعية إنتاجية على نموذج لم تلتزم جوجل به صراحةً.

لدى GPT-Live-1 المشكلة العكسية، وهي أصغر لكنها ليست صفرًا. فهو متاح عمومًا، بسعر منشور، وبنقطة نهاية موثّقة، ولن يختفي. لكن سطح واجهة API الخاصة به ضيق بطريقة تفاجئ الفرق التي تفترض أنه ينضم مباشرة إلى تكامل Ope​nAI قائم: هناك معرّف نموذج واحد بالضبط، ونقطة نهاية واحدة، ولا مسار عبر Chat Completions أو Responses أو Realtime أو Batch أو Assistants أو الضبط الدقيق. الطريقة الوحيدة للدخول هي نقطة نهاية Live Sessions عند v1/live/sessions عبر WebRTC، مع معالجة الأحداث على قناة بيانات. هذا تكامل جديد، وليس تغييرًا في المعامل.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

اللغات، وأين يكون المتخصص العام أضعف بصراحة

عدد Goo​gle هو أكثر من 70 لغة مع الحفاظ على الصوت والنبرة. وثائق Ope​nAI الخاصة أقل ثقة بشكل ملحوظ بشأن تغطيتها الخاصة: تشير مواد الإطلاق إلى أنه بالنسبة لبعض اللغات، قد يحمل النموذج لكنة غير أصلية أو يُظهر فجوات في الطلاقة، وهي لا تنشر عددًا للغات ينافس عدد Goo​gle.

هذا ليس بائعًا يتحفظ — بل هكذا يبدو نموذج محادثة عامّ إلى جانب متخصص مُدرَّب على المشكلة. إذا كان عرض القيمة لمنتجك هو "نحن نفسر 40 لغة جيدًا"، فالمتخصص هو الخيار الأمين، وسيُحرجك العامّي في الذيل الطويل. وإذا كان منتجك وكيلًا صوتيًا لسوق ناطق بالإنجليزية مع ميزة ترجمة مُلحَقة به، فلن تظهر فجوات اللغات لدى العامّي أبدًا.

يضع كلا الطرازين علامة مائية على الصوت المُولَّد باستخدام SynthID، وهذا أمر مهم إذا كنت في ولاية قضائية أو لديك عقد عميل يتطلب إثبات المصدر على الكلام الاصطناعي. وهذه النقطة متعادلة.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

حيث تغيّر بنية التفويض البناء

الفرق البنيوي بين هذين الاثنين هو أن GPT-Live-1 هو في الحقيقة نموذجان بينهما درز في المنتصف. طبقة الصوت تُبقي المحادثة حيّة؛ بينما يقوم نموذج استدلال منفصل بالتفكير. هذا الدرز هو حيث يذهب جهدك الهندسي، وهو أيضًا حيث يصبح نموذج التكلفة معقدًا.

من الجدير معرفته أن النصف المفوَّض هو نموذج نصي عادي يمكنك توجيهه مثل أي نموذج آخر. GPT-5.6 Terra، الخادم الخلفي في مثال Ope​nAI نفسه، يُقدَّم عبر OrcaRouter مقابل $2.00 لكل مليون رمز إدخال و$12.00 لكل مليون رمز إخراج، مع نافذة سياق بسعة مليون رمز وإتاحة كلٍّ من /v1/chat/completions و/v1/responses. إذا أردت استبدال العقل الاستدلالي خلف وكيل صوتي — بنموذج أرخص في المكالمات البسيطة، أو أقوى في حالات التصعيد — فإن هذا النصف من المنظومة لديه خيارات، لأنه مجرد استدعاء API عادي يجاور نحو 190 نموذجًا آخر بمفتاح واحد.

أما النصف الصوتي فلا. GPT-Live-1 ليس على OrcaRouter، وكذلك Gem​ini 3.5 Live Translate؛ فكلاهما متاح فقط من المورّد الذي أنتجهما. الموضع الذي يستحق فيه الموجّه مكانه في بنية كهذه هو كل ما يقع بعد الصوت: نماذج النصوص التي تقوم بالاسترجاع، والتلخيص، والكتابة المرتجعة إلى CRM، والتصعيد، وهو النصف من الفاتورة الذي يمكنك فعلاً توحيده على مفتاح واحد وفاتورة واحدة.

ما الذي يجب اختياره فعليًا

• اختر Gem​ini 3.5 Live Translate إذا كانت الترجمة هي المنتج، وكان سعر الدقيقة يهم أكثر من استقرار العقد، وكنت قادرًا على استيعاب تغيّر نموذج معاينة تحتك. خصّص ميزانية نحو 0.037 دولار للدقيقة، وأبقِ طبقة تجريد فوق المكالمة بحيث يمكن لنموذج GA أن يحل محله دون إعادة كتابة.

• اختر GPT-Live-1 إذا كنت بحاجة إلى وكيل محادثة يصادف أنه يترجم، أو إذا كنت بحاجة إلى استدعاء الدوال واستخدام الأدوات داخل الحلقة الصوتية، أو إذا كان فريق المشتريات سيسأل عما يحدث عند إخراج النموذج من الخدمة وتحتاج إلى إجابة أفضل من "لا شيء، على الأرجح."

• لا تختر أياً منهما لمجرد أنه فاز في اختبار معياري. فالاختبارات المعيارية على الجانبين غير قابلة للمقارنة — فأرقام OpenAI في الازدواج الكامل هي أرقامها الخاصة، ولم يعِد إنتاجها أي طرف ثالث، كما أن ادعاءات Google اللغوية لم تُختبر مقابل نموذج عام على المجموعة الصوتية نفسها.

ملاحظة استشرافية واحدة: الواجهتان تتقاربان لا تتصادمان. نموذج الترجمة من Goo​gle يعيش بالفعل داخل Gem​ini Live، وطبقة الصوت في GPT-Live-1 مصممة صراحةً بحيث تُسقَط خلفها نماذج حدودية جديدة. التوقع المعقول هو أنه خلال دورتي إصدار أو نحو ذلك تتحسن ترجمة النموذج العام، وتصبح قصة تكامل النموذج المتخصص أقل مخاطرة. إذا كنت تبني اليوم وكان القرار متقاربًا، فهذا حجة لصالح الخيار الأرخص والأكثر قابلية للاستبدال، ولإبقاء مسار الصوت معزولًا خلف واجهة في كل الأحوال.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا