
Qwen3.8-LiveTranslate مقابل Gemini 3.5 Live Translate: أحدهما يطلق رقمًا، والآخر يطلق خريطة
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
أكبر نموذجين للترجمة الصوتية الفورية لا يتفقان على ما هما مستعدان لأن يُقاسا عليه، وهذا الخلاف أنفع من أي مقارنة للمواصفات. Qwen3.8-LiveTranslate، الذي صدر في 19 سبتمبر 2026، يتصدر برقم صارم واحد: متوسط التأخر 2.3 ثانية، انخفاضًا من 2.8 في الجيل السابق. Gemini 3.5 Live Translate، النموذج الصوتي-إلى-الصوتي الذي أعلنت عنه الشركة في يونيو 2026 وما زال يحمل معرّف نموذج تجريبي، يتصدر بالانتشار — أكثر من 70 لغة، وكشف تلقائي، والتبديل في منتصف المحادثة، والتكامل مع تطبيقي Translate وMeet. شركة واحدة نشرت رقمًا لزمن الاستجابة يمكن محاسبتها عليه. والأخرى نشرت عددًا للغات. وإذا كنت تختار بينهما، فإن إدراك سبب اختلاف هذين النوعين من الوعود أهم من معرفة أي القائمتين أطول.
معماريتان تتفقان على الهدف ولا شيء آخر
كلا النموذجين موجودان للقضاء على السلوك ذاته: المترجم القائم على الأدوار الذي ينتظر حتى تُكمل جملة قبل أن يقول أي شيء. تلك الوقفة هي ما يجعل الترجمة الفورية الآلية تبدو وكأنها ترجمة فورية آلية.
Qwen3.8-LiveTranslate يصل إلى ذلك بفضل بنية Interleave على أساس هجين MoE، مقسمة إلى وحدة Thinker تدمج الصوت والفيديو والنص المصدر والترجمة في تسلسل سببي واحد، ووحدة Talker تعيد تخليق الترجمة بنبرة المتحدث الأصلي. والزعم أن دمج التعرف والترجمة والتخليق في تسلسل واحد يزيل زمن الوصول والخسارة الدلالية التي تتكبدها خط أنابيب من ثلاث مراحل عند كل حد من حدود الوحدات.
يتبنى Gemini 3.5 Live Translate الموقف نفسه من الطرف إلى الطرف من الاتجاه المعاكس: فهو مبني على Gemini 3 Pro كنموذج أصلي من الصوت إلى الصوت، يتدفق باستمرار عبر Gemini Live API بدلاً من تنفيذ سلسلة منفصلة من ASR → MT → TTS. عملياً، تُبقي على WebSocket ثنائي الاتجاه دائم، وترفع كُتلاً صوتية بحجم 100 ms إلى الأعلى، وتسحب كُتلاً صوتية مترجمة إلى الأسفل. لا يفعل أي من النموذجين الأمر القديم. كلاهما الآن يفعل الأمر الجديد. الفروقات كلها في التفاصيل من الدرجة الثانية.
مقارنة زمن الاستجابة ليست التعادل الذي تبدو عليه
تصف Google نموذج Gemini 3.5 Live Translate بأنه يبقى «بضع ثوانٍ خلف» المتحدث. ولم تنشر رقم LAAL، أو أي مقياس زمن استجابة آخر مسمّى وقابل لإعادة الإنتاج، لهذا النموذج. أما Qwen فقد نشرت 2.3 ثانية وعرّفت ما يعنيه ذلك.
عدم التماثل هذا يُختزل عادةً إلى «كلاهما يقع حول ثانيتين إلى ثلاث». هذا التفسير لا يدعمه أي شيء قالته أيٌّ من الشركتين. فعبارة جوجل تتوافق مع ثانيتين وتتوافق مع أربع؛ غير أن الشركة أحجمت ببساطة عن أن تُحدَّد بدقة. أما المقارنة التي يمكن إجراؤها فعلاً اليوم فهي:
• مقياس زمن الاستجابة المنشور — Qwen3.8-LiveTranslate: LAAL 2.3 ثانية، وفق ما أعلنه المزوّد. Gemini 3.5 Live Translate: لا يوجد أي مقياس منشور.
• قياس مستقل لزمن الاستجابة — لا يوجد أيٌّ منهما، لأيٍّ من الطرازين. ولم ينشر أي طرف ثالث مقارنةً مباشرة بينهما.
الاستنتاج الصادق هو أنه فيما يتعلق بزمن الاستجابة، قدّمت Qwen ادعاءً قابلاً للتكذيب، وقدّمت Google ادعاءً غامضًا. هذه نقطة لصالح Qwen من حيث الشفافية، وصفر نقطة تمامًا لصالحها من حيث الأداء حتى يقيس شخص ما كليهما. إذا كان زمن الاستجابة هو العامل الحاسم في النشر الخاص بك، فإن الحالة الراهنة للأدلة لا تدعم قرار شراء في أي من الاتجاهين.

60 لغة مقابل أكثر من 70 هي لوحة النتائج الخاطئة
يُستشهد بأعداد اللغات باستمرار، وهي تُضلِّل في كلا الاتجاهين.
يتعرّف Qwen3.8-LiveTranslate على 60 لغة مصدر وينتج مخرجات منطوقة بـ29 منها. يدعم Gemini 3.5 Live Translate أكثر من 70 لغة مع الكشف التلقائي، وفي Google Meet يتوسّع ذلك إلى أكثر من 2000 تركيبة لغوية، حيث كان الحد الأقصى السابق هو الترجمة القائمة على الإنجليزية عبر خمس لغات.
اقرأ الرقم الثاني بتمعّن قبل أن تتعامل معه باعتباره مكسبًا ثلاثيًا. رقم Google الذي يتجاوز 2000 يحصي أزواجًا مرتّبة — كل لغة مصدر مقترنة بكل لغة هدف — وهو مقياس مشروع ومفيد فعلًا للتغطية، لكنه ليس قابلًا للمقارنة بعدّ لغة واحدة. وقائمة Google، رغم أنها أوسع، تميل بشدة نحو اللغات ذات أعداد المتحدثين الكبيرة: الأفريكانية، العربية، البنغالية، الهولندية، الإنجليزية، الفرنسية، الألمانية، الهندية، الإندونيسية، الإيطالية، اليابانية، الكورية، الملايوية، الفارسية، البولندية، البرتغالية، الروسية، الإسبانية، السواحيلية، التاميلية، التيلوغوية، التايلاندية، التركية، الأوكرانية، الأردية، الفيتنامية، الزولوية. ولا تزال لغات الإخراج المنطوق الـ29 لدى Qwen أضيق من ذلك، ولا تشكل قائمة أيٍّ من المورّدين إجابةً جدية عن الذيل الطويل — اللهجات الإقليمية واللغات قليلة الموارد التي فشلت فيها أدوات الترجمة الفورية تاريخيًا بأشد ما يكون. وتقول كلتا الشركتين إنهما تعملان على ذلك. ولم تطرحه أيٌّ منهما بعد.
حيث يختلف الاثنان فعليًا: الغرفة الممتلئة بالأشخاص
المكان الوحيد الذي تقدم فيه النماذج وعودًا مختلفة حقًا هو التعامل مع المتحدثين المتعددين، وهو الفرق الأكثر ترجيحًا لحسم نشر حقيقي.
تأتي Qwen3.8-LiveTranslate مزوّدة بميزة تمييز المتحدثين في الوقت الفعلي: تُنسب كل جملة إلى متحدثها فور وصولها، ويوصف استنساخ الصوت بأنه مستقر عبر تغيّرات الأدوار. يُبلّغ Qwen من تلقاء نفسه عن معدل خطأ في تمييز المتحدثين يبلغ 9.7% على مجموعة الاختبار الطويلة متعددة المتحدثين الخاصة به، مقابل 30.6% لـ Seed LiveInterpret 2.0 — وهي مقارنة بائع في تقييم أجراه البائع نفسه، لذا تعامل مع ذلك كادّعاء مصحوب برقم لا كنتيجة. كما يُصدر النموذج النص المصدر والترجمة على الخط الزمني نفسه، وهو ما يجعل الترجمات الثنائية اللغة المتزامنة ممكنة دون تمريرة محاذاة منفصلة.
يتبنى Gemini 3.5 Live Translate تركيزًا معاكسًا. فقوته الموثّقة هي الحفاظ على العروض الصوتية — أي الحفاظ على حدة صوت المتحدث وإيقاعه ونبرته وسجلّه العاطفي، بحيث يحمل الصوت المترجَم إحساس الأصل. أما نقاط ضعفه الموثّقة فهي تحديدًا المجالات التي قد يفيد فيها تمييز المتحدثين: استنساخ صوتي غير متسق قد ينحرف بعد فترات توقف طويلة أو يقع على الجنس الخطأ، وضعف في تناوب الحديث مع عدم وجود إشارة واضحة لنهاية الجملة، وصعوبة مع اللهجات القوية ومع أزواج اللغات المتقاربة مثل الإسبانية والبرتغالية، ومعالجة غير مثالية للضجيج الخلفي. كما تحدّ Google الجلسات الصوتية البحتة عند 15 دقيقة ما لم تُمدَّد، وتضع على كل تدفّق صوتي مُولَّد علامة مائية SynthID لا يمكن إزالتها حاليًا.
• الإسناد المتعدد للمتحدثين — Qwen: فصل المتحدثين في الوقت الفعلي، بادعاء معدل خطأ في الإسناد (DER) يبلغ 9.7%. Gemini: ضعف موثَّق في تناوب الأدوار، بلا ادعاء بفصل المتحدثين.
• أمانة الصوت — Qwen: إعادة إنتاج الجرس الصوتي الأصلي عبر وحدة Talker. Gemini: الحفاظ على التنغيم وطبقة النغمة والوتيرة؛ مع انحراف موثّق في الاستنساخ.
• مخرجات ثنائية اللغة — Qwen: يُصدر المصدر والترجمة على الجدول الزمني نفسه. Gemini: تفريغ نصي اختياري للمدخلات والمخرجات، يُضبط لكل جلسة.
• العلامة المائية — Qwen: لم يُذكر أي شيء. Gemini: SynthID على جميع الصوت المُولَّد، ولا سبيل لإزالته.
• مدة الجلسة — Qwen: لم يُذكر. Gemini: حد أقصى 15 دقيقة للجلسات الصوتية البحتة.
• أنواع المُدخلات — Qwen: الصوت والصورة. Gemini: الصوت فقط، دون إدخال نصي.

ما تكلفة تشغيل كل واحد منها فعليًا
يتم تسعير Qwen3.8-LiveTranslate لكل مليون توكن عبر WebSocket Realtime API. في منطقة سنغافورة: 7.50 دولارات لإدخال الصوت، و0.55 دولار لإدخال الصور، و20.00 دولارًا لإخراج النص، و30.00 دولارًا لإخراج الصوت. في بكين: 40 ¥ / 3.3 ¥ / 100 ¥ / 160 ¥ لكل مليون — أي نحو 5.65 / 0.47 / 14.13 / 22.61 دولارًا. سياقه 53,248 توكن، وحد المعدل هو 10 طلبات في الدقيقة و100,000 توكن في الدقيقة في كلتا المنطقتين.
سقف 10 طلبات في الدقيقة هو الرقم الأكثر تأثيرًا في جدول الأسعار. لم تُنشر الشروط التجارية لـ Gemini 3.5 Live Translate بالطريقة نفسها، وهو بحد ذاته إشارة إلى مستوى النضج: إذ توزّعه Google عبر Live API وAI Studio في معاينة عامة، وعبر Google Meet في معاينة خاصة لعملاء Workspace مختارين، وعبر تطبيق Translate على Android وiOS. تخضع أسعار المعاينة وحدود معدل المعاينة للتغيير دون إشعار، ولم تلتزم Google بتحديد تاريخ للتوفر العام (GA).
إذن، المقارنة من حيث التكلفة الآن هي بين نموذج له سعر منشور وسقف تزامن صارم، ونموذج ليس له سعر منشور وسقفه غير محدد. إذا كنت بحاجة إلى نمذجة اقتصاديات الوحدة هذا الربع، فإن واحدًا فقط منهما قابل للموازنة.

ما الذي سيتعين على اختبار مستقل أن يُظهره
كل ما ورد أعلاه مبنيّ على إعلانات المورّدَين أنفسهما، لأن أحدًا لم يشغّل هذين النموذجين مقابل بعضهما البعض. النتيجة التي من شأنها أن تحسم هذه المواجهة فعليًا تحتاج إلى أربعة أشياء، ولا يوجد أي منها حتى الآن:
• قياس LAAL بالطريقة نفسها على كلا النموذجين، وعلى المقطع الصوتي نفسه، وفي أزواج اللغات نفسها — لا يمكن مقارنة رقم Qwen البالغ 2.3 ثانية بأي شيء أحجمت Google عن ذكره.
• معدل خطأ تمييز المتحدثين على مجموعة بيانات مشتركة متعددة المتحدثين، وليس على مجموعة Omnilingua-MSpeaker الخاصة بـ Qwen.
• ثبات استنساخ الصوت عبر الجلسات الطويلة، وهو المجال الذي تشير فيه وثائق Gemini نفسها إلى الانحراف، وتقدّم فيه Qwen أقوى ادعاءاتها.
• السلوك عند حدود التزامن — ما إذا كان حد 10 RPM لدى Qwen يصمد تحت حمل الاجتماعات الفعلي، وما إذا كانت حصص المعاينة لدى Gemini تنجو من التلامس مع بيئة الإنتاج.
إلى أن يوجد ذلك الاختبار، يظل الموقف القابل للدفاع ضيقًا: فقد نشرت Qwen المزيد ووعدت بأشياء أكثر تحديدًا؛ بينما تمتلك Google تغطية لغوية أوسع وبصمة توزيع لا يمكن لأي نموذج يقتصر على API أن يضاهيها.
أي واحدة تختار؟
ركّز على شكل مشكلتك، لا على لوحة النتائج، لأن لوحة النتائج ليست جديرة بالثقة بعد.
إذا كان عبء عملك متعدد الأطراف وكان الإسناد مهمًا — تفريغ الاجتماعات، أو حلقة نقاش، أو قاعة محكمة، أو أي شيء تكون فيه معرفة من قال جملة مترجمة جزءًا من القيمة — فإن Qwen3.8-LiveTranslate هو الوحيد من بين الاثنين الذي يدّعي هذه القدرة، وضعف تناوب الأدوار الموثّق لدى Gemini يشير في الاتجاه نفسه. وإذا كان عبء عملك واسع اللغات، وموجهًا للمستهلكين، وموجودًا بالفعل داخل منظومة Google، فإن أكثر من 70 لغة لدى Gemini 3.5 Live Translate ووجوده في تطبيق Translate وMeet ميزتان لا يضاهيهما أي منافس يعتمد على API فقط من حيث التوزيع.
إذا كنت تبني منتجًا بدلًا من شراء عرض توضيحي، لاحظ أن كليهما متخصصان في نطاق ضيق. لا يشغّل أيٌّ منهما حلقة وكيل، ولا يلخّص أيٌّ منهما، كما أن Qwen3.8-LiveTranslate يدعم صراحةً عدم استدعاء الدوال، وعدم الإخراج المنظّم، وعدم التخزين المؤقت للسياق، وعدم الضبط الدقيق. المترجم هو مقدمة خط الأنابيب الخاص بك، وليس كله. OrcaRouter ليس المكان المناسب لاستدعاء أيٍّ من نموذجي الترجمة اليوم — فلا يوجد أيٌّ منهما في كتالوجنا، ونفضّل قول ذلك بدلًا من الإيحاء بخلافه. ما نقدمه هو النصف من الحزمة الذي يستهلك النص المفرّغ: مفتاح واحد عبر أكثر من 200 نموذج بسعر قائمة المزوّد دون تمرير أي هامش ربح، لذا يمكن استبدال الملخّص أو منفّذ المصطلحات أو الوكيل اللاحق الذي يقرأ ذلك النص المفرّغ أو التبديل عند الفشل دون لمس عقد مورّد ثانٍ.
قاعه
Qwen3.8-LiveTranslate وGemini 3.5 Live Translate متقاربان بما يكفي في الأساسيات بحيث أصبح التسويق هو العامل الفارق: أحدهما نشر رقمًا لزمن الاستجابة وبطاقة أسعار، والآخر نشر خريطة لغات ومنظومة بيئية. ولم يخضع أيٌّ منهما لاختبار مستقل. النسخة الجديرة بالقراءة من هذه المواجهة هي تلك التي تُكتب بعد أن يُشغِّل أحدهم كليهما على التسجيل الصوتي نفسه — وبالنظر إلى السرعة التي تتحرك بها هذه الفئة، فقد لا يكون ذلك بعيدًا.
مقارنات في هذه المقالة3
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
