
تعرّف على Qwen3.8-LiveTranslate: نصف الثانية الذي يضع الترجمة الفورية بالذكاء الاصطناعي على وتيرة البشر
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate طُرح في 19 سبتمبر 2026، ويختصر الإعلان بأكمله إلى عملية طرح واحدة. متوسط التأخر — LAAL، وهو متوسط الفارق بين خروج الكلمة من فم المتحدث ووصول ترجمتها إلى أذن المستمع — ينخفض من 2.8 ثانية في الجيل السابق إلى 2.3 ثانية. يعمل المترجمون الفوريون المحترفون بمدة سماع-إلى-نطق تتراوح بين 2 و3 ثوانٍ تقريباً. هذه هي القصة كاملة: ليس أن الآلة أصبحت أسرع، بل أن تأخرها يقع الآن ضمن النطاق الذي يتوقف فيه المستمعون عن ملاحظة وجود آلة على الإطلاق. تشير أرقام الإطلاق إلى أن جودة ترجمة FLEURS للجيل السابق بلغت 83.0 xCOMET-XXL؛ بينما يُزعم أن هذا الجيل يبلغ 85.7. كلا الرقمين من البائع، وتم إنتاجهما على إعداد التقييم الخاص بالبائع، ولم يعيد أي طرف مستقل إنتاجهما بعد — وهو التحفظ الأكثر أهمية في هذا المقال.
ما يجعل هذا الإصدار جديرًا بالقراءة بما يتجاوز العنوان هو الآلية. لم يُقلّص Qwen زمن الاستجابة عبر صنع نظام تعرّف أسرع أو مُركّب أنحف. بل حذف الحدود الفاصلة بينهما.
ما الذي تغيّر فعليًا: اختفت الفواصل
الترجمة الفورية التقليدية هي مسار معالجة من ثلاث مراحل ظل يُجمَّع بالطريقة نفسها لعقد من الزمن: ينسخ التعرّف الآلي على الكلام التدفق، ثم تحوّل الترجمة الآلية النص المكتوب، ثم يقرأ تحويل النص إلى كلام النتيجة بصوت مسموع. كل مرحلة نموذج منفصل له ميزانية زمن استجابة خاصة به، وكل عملية تسليم تفقد شيئًا ما — التنغيم في المرحلة الأولى، وهوية المتحدث في المرحلة الثالثة، وبضع مئات ثابتة من المللي ثانية عند كل حدّ يتعين فيه على وحدة ما الانتظار حتى يتوفر ما يكفي من الرموز لتكون واثقة.
يستبدل Qwen3.8-LiveTranslate ذلك التتابع المتسلسل بما تسمّيه الشركة بنية Interleave المبنية على بنية أساسية Hybrid MoE، والمقسّمة إلى وحدتين متعاونتين:
• Thinker — يرتّب الفيديو والصوت والنص المصدر والترجمة في تسلسل سببي واحد، متداخلةً حسب الترتيب الزمني، وينتج الفهم والترجمة من البداية إلى النهاية في تمريرة واحدة بدلاً من ثلاث.
• Talker — يأخذ النص المترجم مع الصوتالأصلي ويولّد كلامًا يحافظ على نبرة المتحدث الأصلي، بحيث يكون الصوت المدبلج متطابقًا بشكل ملحوظ مع الشخص الذي تحدث.
الادّعاء المعماري هو أنه لأن التعرّف والترجمة والتوليف تتشارك إطارًا واحدًا لنمذجة التسلسل، بدلًا من تمرير الرسائل عبر حدود الوحدات، فإن النظام يتوقف عن دفع ضريبة ما بين الوحدات مرتين في كل ملفوظ. وهذا سرد معقول لمصدر الـ 0.5 ثانية، وهو أيضًا بالضبط نوع الادّعاء الذي يسهل الجزم به ويكلف التحقق منه كثيرًا. فاعتبره تفسير الجهة المورّدة، لا نتيجةً مُثبتة.
القدرات الثلاث الجديدة حقاً
لم تتغيّر تغطية اللغات: 60 لغة مصدر يتم التعرف عليها، و29 متاحة للإخراج المنطوق — وهي الأعداد نفسها كما في Qwen3.5-LiveTranslate. أما الإضافات المثيرة للاهتمام فكلها تتعلق بما يحدث عندما يتحدث أكثر من شخص واحد.
• تمييز المتحدثين في الوقت الفعلي — تُنسب كل جملة إلى متحدث أثناء نطقها، ويُوصف استنساخ جرس الصوت بأنه أكثر استقرارًا عبر تغيّرات الأدوار. تُبلغ Qwen عن معدل خطأ في تمييز المتحدثين قدره 9.7% في مجموعة اختبارها الطويلة متعددة المتحدثين مقابل 30.6% لـ Seed LiveInterpret 2.0. كلا الرقمين مصدرهما Qwen.
• المصدر والترجمة في الإطار نفسه — يُخرج النموذج النص الأصلي والنص المترجم على خط زمني واحد، وهو ما يجعل إنشاء زوج من النصوص المصاحبة ثنائية اللغة على الشاشة ممكنًا دون الحاجة إلى تمرير محاذاة ثانٍ.
• إزالة الغموض بالسياق الطويل — يُنقل السياق السابق مع المضي قدمًا حتى تبقى الأسماء وألقاب التبجيل والمصطلحات التخصصية متسقة. وهذا هو الأهم عمليًا: فشل الترجمة الفورية الكلاسيكي ليس كلمة خاطئة، بل أن يُترجم الشخص نفسه بثلاث طرق مختلفة في الاجتماع الواحد.
يُعد تمييز المتحدثين العنصر المُميّز حقًا هنا. يواجه Gemini 3.5 Live Translate، النموذج المنافس من Google للترجمة الفورية من كلام إلى كلام، مشكلة موثّقة في تبادل الأدوار — إذ قد يجد صعوبة في معرفة متى يتوقف المتحدث فعليًا. وتزعم Qwen السمة المعاكسة كميزة. ولم تنشر أي من الشركتين مقارنة مباشرة من شأنها أن تحسم الأمر.

قراءة ادعاءات المقاييس بأمانة
اختُبر Qwen على مجموعتين، وهما جديرتان بالفصل لأنهما تقيسان أمرين مختلفين.
• FLEURS، 70 اتجاهًا لغويًا — المعيار الصوتي متعدد اللغات العام والواسع الاستخدام. وتزعم Qwen الريادة على كل من سابقتها وما تسميه أنظمة الترجمة الفورية السائدة حالياً من حيث جودة الترجمة، ومتوسط التأخر، ودقة التعرف على الكلام، وجودة تركيب الكلام. مقارنة 85.7 مقابل 83.0 xCOMET-XXL موجودة هنا.
• Omnilingua-MSpeaker، 14 اتجاهًا لغويًا — مجموعة تقييم الصوت الطويل متعدد المتحدثين الخاصة بـ Qwen. وتزعم الشركة أمانة وطلاقة وإيجازًا أفضل، إلى جانب معدل خطأ أدنى في تمييز المتحدثين. إن معيارًا مرجعيًا يبنيه المورّد ليس بلا قيمة، لكنه ليس دليلًا أيضًا: فقد صممه الأشخاص الذين يُقيَّم نموذجهم عليه.
الخلاصة الصادقة هي أن FLEURS حقيقي وعام، لذا فإن 85.7 قابل للتحقق مبدئيًا على الأقل؛ أما Omnilingua-MSpeaker فليس كذلك، لذا فإن التفوق في فصل المتحدثين يظل ادعاءً حتى يعيد شخص تشغيله. لم ينشر أي طرف ثالث أرقام Qwen3.8-LiveTranslate وقت كتابة هذا النص، والنموذج عمره ساعات.
ما تكلفة API، ورقم واحد سيلدغك
Qwen3.8-LiveTranslate مغلق الأوزان ومتاح عبر API فقط. يعمل عبر WebSocket Realtime API تحت معرّف الطراز qwen3.8-livetranslate-flash-realtime، وليس عبر نقطة نهاية HTTP عادية. التسعير لكل مليون رمز، ولأن رموز الصوت كثيفة، تبدو الأسعار المعلنة مذهلة عند مقارنتها بنماذج النصوص حتى تتذكر ما هو رمز الصوت:
• منطقة سنغافورة — الإدخال الصوتي 7.50 دولار، الإدخال المرئي 0.55 دولار، الإخراج النصي 20.00 دولار، الإخراج الصوتي 30.00 دولار لكل مليون رمز.
• منطقة بكين — ¥40 للمدخلات الصوتية، و¥3.3 للمدخلات الصورية، و¥100 للمخرجات النصية، و¥160 للمخرجات الصوتية لكل مليون رمز، وهو ما يعادل تقريبًا $5.65 / $0.47 / $14.13 / $22.61 بالأسعار الحالية.
• السياق — إجمالي 53,248 رمزًا، موزّعة على 49,152 كحدّ أقصى للإدخال و4,096 كحدّ أقصى للإخراج.
• حدود المعدل — 10 طلبات في الدقيقة و100,000 رمز في الدقيقة، متطابقة في كلتا المنطقتين.
حدّ المعدّل هذا هو الرقم الجدير بأن نضع تحته خطًّا. فعشر طلبات في الدقيقة سخيّة بالنسبة لحفنة من غرف الاجتماعات، لكنها أبعد ما تكون عن الكفاية لنشر مركز اتصال أو لبثّ مباشر بآلاف التدفقات المتزامنة. لقد أبقى Qwen تسعير الواجهة ثابتًا تقريبًا مقارنةً بالجيل السابق — فأسعار بكين لم تتغيّر، وسنغافورة أرخص بشكل طفيف — لكن نموذجًا جاهزًا معماريًا للتوسّع يُتاح وكأنه نسخة تجريبية. وعلى كل من يخطّط لحركة إنتاجية أن يقرأ سقف الـ 10 طلبات في الدقيقة على أنه القيد المُلزِم، لا سعر التوكن الواحد.

استدعاؤه لا يشبه استدعاء نموذج محادثة.
واجهة Realtime API تعمل بالأحداث، وهو نموذج ذهني مختلف عن نقطة نهاية الإكمال. تفتح مقبسًا، وتستقبل session.created، ثم ترسل حدث session.update لتهيئة الجلسة قبل أن ينتقل أي صوت.
• target_languageهو مطلوب ويجب تعيينه قبل أول مقطع صوتي — لا يوجد هدف افتراضي ضمني.
• لغة المصدر اختيارية، ويُضبط افتراضيًا على الكشف التلقائي.
• output_modalities يحدد ["text"] للنص المكتوب فقط أو ["text","audio"] للكلام المترجم.
• input_audio_buffer.append يحمل مقاطع PCM مشفرة بترميز base64 إلى الأعلى؛ response.text.delta وresponse.audio.delta يعودان إلى الأسفل، مع response.done الذي يعلن نهاية الدور.
ملاحظتان عمليتان. أولًا، لا يستطيع المتصفح تعيين ترويسة Authorization في مصافحة WebSocket، لذا يجب فتح الاتصال من جهة الخادم وتمرير الصوت إلى العميل عبر المقبس الخاص بك — وهذا ليس شيئًا يمكن توصيله مباشرة في الواجهة الأمامية. ثانيًا، يحذّر Qwen صراحةً من أن مجموعة المعاملات والأحداث تختلف عن الجيل السابق LiveTranslate، لذا فإن أي شفرة مكتوبة مقابل Qwen3.5-LiveTranslate تحتاج إلى إعادة فحص بدلًا من مجرد إعادة توجيهها. هناك نقطة نهاية تجريبية مجانية تعمل على omni.qwen.ai/live-translate إذا أردت سماع التأخير قبل تكريس وقت الهندسة.
ما لا يفعله عمدًا
تُدرج Qwen مجموعة من القدرات باعتبارها غير متاحة، والقائمة توضّح ذلك. لا استدعاء للدوال. لا إخراج منظّم. لا بحث في الويب. لا متابعة للبادئة، ولا تخزين مؤقت للسياق، ولا استدلال بالدفعات. لا ضبط دقيق.
هذا متخصّص، وليس عامًّا يرتدي قبعة المترجم الفوري. لن يشغّل حلقة الوكيل الخاصة بك، ولن يكون النموذج الذي يلخّص الاجتماع. صمّم بناءً على ذلك: فالمترجم الفوري ينتج نصًّا مكتوبًا وبثًّا صوتيًّا مترجمًا، وكل ما يأتي لاحقًا بعد ذلك — مستخرِج بنود الإجراءات، ومُطبّق المصطلحات، وإعادة الكتابة إلى CRM — هو مهمة نموذج نصّي منفصل.
هذا التقسيم هو حيث يستحق الراوتر مكانه. Qwen3.8-LiveTranslate نفسه متاح عبر واجهة API الخاصة بالمورّد وعدة منصات طرف ثالث؛ وهو ليس ضمن كتالوج OrcaRouter اليوم، ولن نتظاهر بغير ذلك. ما يوفّره OrcaRouter فعلاً هو المنظومة المحيطة — بما في ذلك الطراز الرائد Qwen3.8-Max من علي بابا نفسها، وهو نموذج خليط خبراء متناثر بمعاملات تبلغ 2.4 تريليون، مع سياق من 1M رمز، بسعر 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج، تُفوتَر بسعر قائمة المزوّد دون تمرير أي هامش ربحإن إبقاء المترجم والنماذج التي تستهلك مخرجاته خلف نقطة نهاية واحدة ومفتاح واحد يعني أن مسار النصوص لا يحتاج إلى عقد ثانٍ عند تبديل أداة التلخيص، كما أن التبديل التلقائي عند الفشل يبقي النصف اللاحق من النظام حياً عندما يتعثر مزوّد واحد — وهو سيناريو، عند 10 طلبات في الدقيقة، يستحق التخطيط له بدلاً من اكتشافه.

ماذا تشاهد بعد ذلك
هناك أمران سيجعلان هذا الإصدار ينتقل من ادعاء مدعوم بحجج قوية إلى حقيقة مستقرة. الأول هو قياس مستقل لزمن الاستجابة: فـ LAAL مقياس محدد جيدًا، وأي شخص لديه نقطة نهاية التجربة وعدة ساعة إيقاف يستطيع إنتاج رقم لم تصنعه Qwen. والثاني هو خارطة الطريق المعلنة من Qwen نفسها — الاقتراب أكثر من الحد الأدنى لزمن الاستجابة، والذاكرة طويلة المدى عبر الجلسات، وتغطية اللغات ذات الذيل الطويل واللهجات الإقليمية. وبند الذيل الطويل هو الذي يجب محاسبتهم عليه، لأن 60 لغة مصدر عدد محترم لكنه يستبعد بهدوء معظم متحدثي العالم، والفجوة بين عرض تجريبي يعمل بالماندرين والإنجليزية وآخر يعمل باليوروبا أو الكيتشوا هي المكان الذي تعثرت فيه منتجات الترجمة الفورية تاريخيًا.
في الوقت الحالي، الموقف المعقول هو أن Qwen3.8-LiveTranslate هو أول نموذج ترجمة فورية يُصاغ رقمه الأبرز في مواجهة مترجمين بشريين لا في مواجهة سلفه — وهذا التأطير اختبار أصعب بكثير في اجتيازه من ذاك الذي يحلّ محلّه. لم يجتزه بعد. بل تطوّع له فحسب.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
