
GPT-Live-1 مقابل Gemini 3.5 Live Translate: نظام عام مُطلَق مقابل متخصّص قيد المعاينة
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 لكل مليون رمز
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
يُجرى مقارنة بين هذين النموذجين لأن كليهما يوفّر الكلام في الوقت الفعلي عبر API، لكن المقارنة تنهار بمجرد أن تقرأ بطاقات النموذج. GPT-Live-1 هو نموذج صوتي كامل الازدواجية متعدد الأغراض نقلته OpenAI إلى API المطورين في 10 سبتمبر 2026، بعد ثلاثة أشهر من إطلاقه داخل ChatGPT في 8 يوليو. Gemini 3.5 Live Translate هو نموذج ترجمة من صوت إلى صوت مخصص لغرض واحد، أطلقته Google DeepMind في 9 يونيو 2026، ولا يزال معرّف النموذج الخاص به يحمل كلمة preview. أحد هذين يمكنك تقديمه لعملاء يدفعون اليوم وفق سعر منشور. والآخر يمكن لـ Google أن تغيّره تحتك دون إشعار إهمال. هذا التفاوت، وليس ورقة المعايير، هو ما ينبغي أن يحدد الاختيار.
آلتان مختلفتان تحملان الملصق نفسه
يجدر بنا أن نتحدث بصراحة عن مدى ضآلة التداخل بين هذه الأمور. يقوم Gemini 3.5 Live Translate بالترجمة. فهو يتلقى صوتًا متدفقًا بلغة واحدة ويعيد صوتًا متدفقًا بلغة أخرى، مع الحفاظ على صوت المتحدث ونبرته، عبر أكثر من 70 لغة وأكثر من 2000 زوج لغوي، مع الكشف التلقائي عن اللغة والتشغيل ثنائي الاتجاه. وهو لا يجري محادثة، ولا يستدعي دالة، ولا يجيب عن سؤال. إنه محرك ترجمة فورية.
GPT-Live-1 هو الشكل المعاكس. إنه نموذج محادثة: يستمع ويتحدث في الوقت نفسه، ويقرر عدة مرات في الثانية ما إذا كان يواصل الاستماع، أو يتوقف مؤقتًا، أو يقاطع، أو يستدعي أداة، ويسند العمل الثقيل — البحث في الويب، والتفكير الأعمق، والمهام الوكيلية — إلى نموذج استدلال منفصل عبر Responses API بينما تستمر المحادثة. مثال WebRTC الذي نشرته OpenAI بنفسها يربط هذا التفويض بـ GPT-5.6 Terra. الترجمة واحدة من الأشياء التي يمكنه القيام بها؛ وليست ميزة يملك نموذج Google أي مكافئ لها في الاتجاه الآخر.
إذن، السؤال العملي أضيق مما توحي به المواجهة الرئيسية: إذا كان ما تبنيه هو الترجمة الفورية، فنموذج Google مصمم خصيصًا لهذا الغرض، بينما نموذج OpenAI عام الأغراض. وإذا كان ما تبنيه وكيلًا صوتيًا يترجم من حين لآخر، فإن GPT-Live-1 هو الوحيد بين الاثنين الذي يقع أصلًا في فئة المنتج الصحيحة.
ما تكلفة كل واحد منها لكل دقيقة من الصوت؟
هنا يُبرّر المتخصص وجوده، والحسابات عويصة حقًا على OpenAI.
• GPT-Live-1 — 0.05 دولار لكل دقيقة من الصوت، تُحتسب بالثانية بدلًا من تقريبها إلى الدقيقة الكاملة التالية. تُحتسب عمليات الاستدلال واستدعاءات الأدوات التي ينفّذها الخادم الخلفي المفوَّض بشكل منفصل وفق الأسعار المعتادة لذلك النموذج.
• Gemini 3.5 Live Translate — 3.50 دولار لكل مليون رمز إدخال صوتي و21.00 دولارًا لكل مليون رمز إخراج صوتي، مع احتساب الفوترة بواقع 25 رمزًا لكل ثانية من الصوت. وبالمجموع، يبلغ ذلك نحو 0.037 دولار لكل دقيقة من الصوت المترجم.
من حيث دقائق الترجمة الصافية، تُعد Google أرخص بنحو الربع. وهذا ليس فرقًا ناتجًا عن التقريب عند التوسّع: إذ تكلّف 10,000 دقيقة ترجمة شفهية شهريًا نحو 500 دولار على طبقة الصوت لدى GPT-Live-1، مقابل نحو 368 دولارًا على Gemini 3.5 Live Translate. والفجوة حقيقية وليست أثرًا من تغيير طريقة الاحتساب، لأن النموذجين يحتسبان رسومهما على وحدات مختلفة فعليًا.
هناك مكمن مشكلة في الاتجاه الآخر. الرقم المعلن البالغ $0.05 لـ GPT-Live-1 هو سعر طبقة الصوت فقط. إذا قام وكيلك بالترجمة وأيضًا بالبحث عن شيء ما، أو أحال جملة صعبة إلى نموذج استدلال، فأنت تدفع مقابل ذلك التفويض إضافةً إلى ذلك — ويُسعَّر النموذج المفوَّض لكل رمز مثل أي نموذج رائد آخر. حِمل عمل الترجمة فقط لا يفعِّل ذلك أبدًا. أما حِمل عمل الترجمة مع أي شيء إضافي فيفعِّل ذلك، ويتوقف تحديد الفائز في المقارنة لكل دقيقة عن كونه بديهيًا.

تسمية المعاينة هي المخاطرة التي لا يأخذها أحد في الحسبان.
معرف نموذج Gemini 3.5 Live Translate هو gemini-3.5-live-translate-preview. تم إطلاقه إلى Gemini Live API وGoogle AI Studio كمعاينة عامة، وفي الوقت نفسه إلى تطبيق Google Translate على Android وiOS وكمعاينة خاصة في Google Meet لعملاء Workspace المختارين. تعني المعاينة ما عنته دائمًا في Google: لا ضمان للاستقرار، ولا نافذة إيقاف منشورة، ولا التزام بأن السعر الذي تدفعه سيبقى بعد الإصدار التالي.
بالنسبة لتطبيق موجّه للمستهلكين، هذا أمر مقبول. لكن بالنسبة لأعباء العمل التي وُجّه هذا النموذج إليها فعليًا — الترجمة الفورية في مركز اتصال، أو منتج للاجتماعات، أو منتج للسفر — فهو أكبر مخاطر التكامل على الإطلاق في المنظومة التقنية. فأنت تبني تبعية إنتاجية على نموذج لم تلتزم جوجل به صراحةً.
لدى GPT-Live-1 المشكلة العكسية، وهي أصغر لكنها ليست صفرًا. فهو متاح عمومًا، بسعر منشور، وبنقطة نهاية موثّقة، ولن يختفي. لكن سطح واجهة API الخاصة به ضيق بطريقة تفاجئ الفرق التي تفترض أنه ينضم مباشرة إلى تكامل OpenAI قائم: هناك معرّف نموذج واحد بالضبط، ونقطة نهاية واحدة، ولا مسار عبر Chat Completions أو Responses أو Realtime أو Batch أو Assistants أو الضبط الدقيق. الطريقة الوحيدة للدخول هي نقطة نهاية Live Sessions عند v1/live/sessions عبر WebRTC، مع معالجة الأحداث على قناة بيانات. هذا تكامل جديد، وليس تغييرًا في المعامل.

اللغات، وأين يكون المتخصص العام أضعف بصراحة
عدد Google هو أكثر من 70 لغة مع الحفاظ على الصوت والنبرة. وثائق OpenAI الخاصة أقل ثقة بشكل ملحوظ بشأن تغطيتها الخاصة: تشير مواد الإطلاق إلى أنه بالنسبة لبعض اللغات، قد يحمل النموذج لكنة غير أصلية أو يُظهر فجوات في الطلاقة، وهي لا تنشر عددًا للغات ينافس عدد Google.
هذا ليس بائعًا يتحفظ — بل هكذا يبدو نموذج محادثة عامّ إلى جانب متخصص مُدرَّب على المشكلة. إذا كان عرض القيمة لمنتجك هو "نحن نفسر 40 لغة جيدًا"، فالمتخصص هو الخيار الأمين، وسيُحرجك العامّي في الذيل الطويل. وإذا كان منتجك وكيلًا صوتيًا لسوق ناطق بالإنجليزية مع ميزة ترجمة مُلحَقة به، فلن تظهر فجوات اللغات لدى العامّي أبدًا.
يضع كلا الطرازين علامة مائية على الصوت المُولَّد باستخدام SynthID، وهذا أمر مهم إذا كنت في ولاية قضائية أو لديك عقد عميل يتطلب إثبات المصدر على الكلام الاصطناعي. وهذه النقطة متعادلة.

حيث تغيّر بنية التفويض البناء
الفرق البنيوي بين هذين الاثنين هو أن GPT-Live-1 هو في الحقيقة نموذجان بينهما درز في المنتصف. طبقة الصوت تُبقي المحادثة حيّة؛ بينما يقوم نموذج استدلال منفصل بالتفكير. هذا الدرز هو حيث يذهب جهدك الهندسي، وهو أيضًا حيث يصبح نموذج التكلفة معقدًا.
من الجدير معرفته أن النصف المفوَّض هو نموذج نصي عادي يمكنك توجيهه مثل أي نموذج آخر. GPT-5.6 Terra، الخادم الخلفي في مثال OpenAI نفسه، يُقدَّم عبر OrcaRouter مقابل $2.00 لكل مليون رمز إدخال و$12.00 لكل مليون رمز إخراج، مع نافذة سياق بسعة مليون رمز وإتاحة كلٍّ من /v1/chat/completions و/v1/responses. إذا أردت استبدال العقل الاستدلالي خلف وكيل صوتي — بنموذج أرخص في المكالمات البسيطة، أو أقوى في حالات التصعيد — فإن هذا النصف من المنظومة لديه خيارات، لأنه مجرد استدعاء API عادي يجاور نحو 190 نموذجًا آخر بمفتاح واحد.
أما النصف الصوتي فلا. GPT-Live-1 ليس على OrcaRouter، وكذلك Gemini 3.5 Live Translate؛ فكلاهما متاح فقط من المورّد الذي أنتجهما. الموضع الذي يستحق فيه الموجّه مكانه في بنية كهذه هو كل ما يقع بعد الصوت: نماذج النصوص التي تقوم بالاسترجاع، والتلخيص، والكتابة المرتجعة إلى CRM، والتصعيد، وهو النصف من الفاتورة الذي يمكنك فعلاً توحيده على مفتاح واحد وفاتورة واحدة.
ما الذي يجب اختياره فعليًا
• اختر Gemini 3.5 Live Translate إذا كانت الترجمة هي المنتج، وكان سعر الدقيقة يهم أكثر من استقرار العقد، وكنت قادرًا على استيعاب تغيّر نموذج معاينة تحتك. خصّص ميزانية نحو 0.037 دولار للدقيقة، وأبقِ طبقة تجريد فوق المكالمة بحيث يمكن لنموذج GA أن يحل محله دون إعادة كتابة.
• اختر GPT-Live-1 إذا كنت بحاجة إلى وكيل محادثة يصادف أنه يترجم، أو إذا كنت بحاجة إلى استدعاء الدوال واستخدام الأدوات داخل الحلقة الصوتية، أو إذا كان فريق المشتريات سيسأل عما يحدث عند إخراج النموذج من الخدمة وتحتاج إلى إجابة أفضل من "لا شيء، على الأرجح."
• لا تختر أياً منهما لمجرد أنه فاز في اختبار معياري. فالاختبارات المعيارية على الجانبين غير قابلة للمقارنة — فأرقام OpenAI في الازدواج الكامل هي أرقامها الخاصة، ولم يعِد إنتاجها أي طرف ثالث، كما أن ادعاءات Google اللغوية لم تُختبر مقابل نموذج عام على المجموعة الصوتية نفسها.
ملاحظة استشرافية واحدة: الواجهتان تتقاربان لا تتصادمان. نموذج الترجمة من Google يعيش بالفعل داخل Gemini Live، وطبقة الصوت في GPT-Live-1 مصممة صراحةً بحيث تُسقَط خلفها نماذج حدودية جديدة. التوقع المعقول هو أنه خلال دورتي إصدار أو نحو ذلك تتحسن ترجمة النموذج العام، وتصبح قصة تكامل النموذج المتخصص أقل مخاطرة. إذا كنت تبني اليوم وكان القرار متقاربًا، فهذا حجة لصالح الخيار الأرخص والأكثر قابلية للاستبدال، ولإبقاء مسار الصوت معزولًا خلف واجهة في كل الأحوال.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
