بطاقة عنوان رئيسية لـ Gemini 3.8 Live مقابل GLM-4-Voice مع عبارة تمهيدية 'OrcaRouter · رادار النماذج — مواجهة مباشرة' وعنوان فرعي 'ما الذي جلبه فعلاً 21 شهرًا من الذكاء الاصطناعي الصوتي.' بطاقتان تقرآن 'Gemini 3.8 Live — سبتمبر 2026، مستضاف، أدوات، 97 لغة' و'GLM-4-Voice — ديسمبر 2024، أوزان مفتوحة، 9B، الصينية والإنجليزية'، مع شرائح تشير إلى فارق 21 شهرًا، وكود Apache-2.0 وترخيص أوزان مخصص. شعار OrcaRouter مركّب في الزاوية اليمنى السفلية.
Guides & Insights

Gemini 3.8 Live مقابل GLM-4-Voice: ما الذي حققته 21 شهرًا من الذكاء الاصطناعي الصوتي فعليًا؟

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

GLM-4-Voice صدر في 3 ديسمبر 2024. Gemini 3.8 Live تم الإعلان عنه في 15 سبتمبر 2026. هذه 21 شهرًا، وهي أهم حقيقة في هذه المقارنة — أكثر أهمية من أي معيار قياس، لأنها تحدد نوع السؤال الذي تطرحه فعليًا.

هذان النموذجان ليسا متنافسين. لا أحد ينشر الصوت على نطاق واسع في 2026 يختار بينهما بناءً على الجودة. السؤال الحقيقي هو ذاك الذي يطرحه GLM-4-Voice ولا تستطيع Gemini 3.8 Live الإجابة عنه: ما الذي يتطلبه أن تمتلك هذا بدلًا من أن تستأجره؟ لهذا السؤال إجابة حقيقية، وقد تغيّرت خلال 21 شهرًا أقل مما قد تتوقع.

ما الذي أطلقته Google، وما الذي أطلقته Zhipu

Gemini 3.8 Live هو نموذج حوار مباشر مستضاف ومغلق الأوزان. يتعامل مع الإدخال المرئي شبه الفوري، ويكتشف تلقائيًا وينتقل بين 97 لغة مدعومة في منتصف المحادثة، وينفذ الأدوات واستدعاءات API في الخلفية بينما تستمر المحادثة. وهو متاح للمطورين عبر Gemini API وGoogle AI Studio، في معاينة خاصة في Gemini Enterprise، وفي Search Live. التسعير المعلن هو $0.005 لكل دقيقة من الإدخال الصوتي و$0.018 لكل دقيقة من الإخراج الصوتي عبر Live API؛ مخطط التكلفة لكل ساعة من الإدخال الصوتي الخاص بـ Artificial Analysis يضعه بشكل مستقل عند $1.50 لكل ساعة. نظيره، Gemini 3.8 Live Extended Thinking، يتصدر حاليًا نفس المؤشر عند 82.6، بينما يقع Gemini 3.8 Live نفسه عند 76.0.

GLM-4-Voice هو أول نموذج كلام شامل من طرف إلى طرف من Zhipu AI، وهو نقطة تحقق قابلة للتنزيل. وهو تجميعة من ثلاثة أجزاء: مُرمِّز كلام مبني على مُشفِّر Whisper-large-v3 مع عنق زجاجة مُكمَّم بالمتجهات بنحو 0.4 مليار معامل، ونموذج لغوي انحداري ذاتي (GLM-4-Voice-9B، مهيأ من GLM-4-9B) بنحو 9 مليارات معامل، ومُفكِّك ترميز بمطابقة التدفق أُعيد تدريبه من CosyVoice. يتحدث الصينية والإنجليزية، ويدعم العاطفة والنبرة وسرعة الكلام واللهجة القابلة للتحكم بالتعليمات — الكانتونية والماندرين التشونغتشينغية وكلام بكين من بينها — ويُرمِّز الكلام عند 12.5 هرتز إلى مجرى دفتر شفرات واحد بنحو 175 بت/ث، أي أقل بترتيب من حيث الحجم من مُرمِّزات الصوت العصبية النموذجية.

الأبعاد، جنبًا إلى جنب:

• الإصدار — Gemini 3.8 Live: 15 سبتمبر 2026. GLM-4-Voice: 3 ديسمبر 2024.

• الأوزان — مغلقة، مستضافة فقط مقابل قابلة للتنزيل، شيفرة Apache-2.0 مع ترخيص مخصص للأوزان.

• اللغات — 97 مع التبديل أثناء المحادثة مقابل الصينية والإنجليزية.

• الرؤية — إدخال بصري شبه فوري مقابل لا شيء.

• استدعاء الأدوات — تنفيذ الأدوات وواجهات API في الخلفية أثناء المحادثة مقابل عدم وجود قناة أدوات على الإطلاق.

• السياق — غير منشور من Google مقابل سياق 8K، مخرجات بحد أقصى 4K.

• الحد الأدنى للاستضافة الذاتية — لا ينطبق مقابل 32 GB RAM بالإضافة إلى CUDA GPU رسميًا؛ حوالي 12 GB VRAM عند int4.

• وضع العلامات المائية — SynthID على جميع الصوت المُولَّد مقابل عدم وصف أي منها.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 شهرًا اكتسبت القدرة، وليس الجودة فقط

القصة السهلة هي أن نموذجًا حدوديًا من 2026 يتفوق على نقطة تحقق مفتوحة من 2024. وهو كذلك، والهامش كبير — لكن الملاحظة الأكثر فائدة هي أن الفئة تغيّر شكلها بدلًا من أن تتحرك على محور واحد.

في التقرير التقني الخاص بـ Zhipu، سجل GLM-4-Voice دقة تحويل الكلام إلى نص بنسبة 93.6% على Topic-StoryCloze، و82.9% من الكلام إلى الكلام، وطبيعية UTMOS عند 4.45، وأسئلة وأجوبة منطوقة عند 5.40/10 في العام و5.20/10 في المعرفة — وكلها مُبلَّغ عنها ذاتيًا وغير مُعاد إنتاجها. التقييم المستقل أكثر ندرة وأقل إطراءً: على VoiceBench سجل إجماليًا 56.48، ليحلّ في حدود المرتبة 29 من 42 في جدولة ما، والمرتبة 30 من 40 في أخرى، مع وصف فهم المحادثات متعددة الأدوار بالضعف في اللغتين. وفي معيار C³ لفهم الحوار متعدد الأدوار يبلغ 11.09% بالصينية و33.22% بالإنجليزية. وجد VCB Bench أنه تصدّر في التحكم العاطفي عند 93.0 على المقياس الفرعي SIF الصيني، ومحاذاة قوية بين النص والكلام، لكن معالجة اللهجات في TELEVAL جاءت عند 4.57% دون تعليمات صريحة.

تلك الأرقام تصف نموذجًا بارعًا في التعبير الصوتي وضعيفًا في الفهم المستدام. هذا نموذج كلام لعام 2024 في جملة واحدة.

حصول Gemini 3.8 Live على 76.0 في مؤشر Speech to Speech Index من Artificial Analysis هو نتيجة مركّبة تجمع بين الاستدلال الكلامي، والأداء الوكيلي، وتفضيل الساحة، ومعدل نجاح المهام. ليس الأمر أن النموذج الأحدث أفضل في المهمة نفسها بمضاعف أكبر، بل إن النتيجة المركّبة باتت تشمل الأداء الوكيلي ونجاح المهام أصلاً — وهما فئتان لا يستطيع GLM-4-Voice المنافسة فيهما لأنه لا يملك قناة أدوات. يُقيَّم نموذج 2024 على لعبة لم يُبنَ يوماً للعبها.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

الرخصة هي الجزء الذي يتجاهله الناس

إذا كنت تنظر إلى GLM-4-Voice لأنه مفتوح، فاقرأ الشروط قبل أن ينتهي تنزيل الأوزان. الانقسام حقيقي ويسهل إساءة قراءته:

• Code — Apache-2.0. متساهلة حقًا.

• الأوزان — ترخيص مخصص يتطلب الإسناد والتسجيل لدى Zhipu للاستخدام التجاري.

«الأوزان المفتوحة» و«Apache-2.0» ليسا الادعاء نفسه، وكثير من التغطية الثانوية لهذا النموذج تخلط بينهما. إذا كنت تنوي إطلاق منتج تجاري على GLM-4-Voice، فإن متطلّب التسجيل خطوة قانونية وليس إجراءً شكليًا، وينبغي أن يكون على المسار الحرج. تذهب إحدى أدوات التتبع إلى أبعد من ذلك وتصف النموذج بأنه مملوك مع استخدام تجاري مشروط. وفي كلتا الحالتين، فإن غياب فاتورة لكل دقيقة ليس غيابًا لعلاقة تجارية.

حساب التكلفة، إذا أُجري بصدق

الحجة لصالح الاستضافة الذاتية هي أن التكلفة الشهرية الثابتة تتفوق على التكلفة لكل دقيقة عند الأحجام الكبيرة. تلك الحجة حقيقية، لكنها أصغر مما تبدو بمجرد أن تحسب ما تديره فعليًا.

يرغب GLM-4-Voice رسميًا في 32 غيغابايت من الذاكرة العشوائية ووحدة معالجة رسومات CUDA. تعمل التكميمات int4 المجتمعية في نحو 12 غيغابايت من VRAM، أي حوالي 10–11 غيغابايت عمليًا، وهو نطاق RTX 3060، مع سقف عملي يبلغ نحو 30 ثانية من الكلام في كل دور. تكافئ A10 سحابية بتكلفة تتراوح تقريبًا بين 0.50 و1.00 دولار في الساعة ما بين 350 و700 دولار شهريًا لنسخة تعمل باستمرار — قبل أن تخدم مستخدمًا واحدًا، ودون أي تجاوز للفشل، ولا سعة اندفاعية، ولا أحد يمكن استدعاؤه عندما ينتج مفكك الترميز ضجيجًا في الثالثة فجرًا.

في المقابل، فإن Gemini 3.8 Live بسعر 1.50 دولار لكل ساعة من الصوت المُدخل يعني أن 350 دولارًا تشتري لك نحو 233 ساعة من الصوت. وهذا ليس أسوأ بالضرورة، ويأتي معه سعة لم تكن قد جهّزتها. نقطة التقاطع موجودة؛ وهي أعلى مما توحي به المقارنة الرئيسية، وتتحرك تبعًا لما إذا كانت حركة المرور لديك ثابتة أم انفجارية. حركة المرور الانفجارية هي الحالة التي يفوز فيها التسعير حسب الدقيقة بشكل حاسم، لأن وحدات GPU الخاملة تُفوتر بالمقدار نفسه تمامًا الذي تُفوتر به المشغولة.

هناك أيضًا فرق في ما تحصل عليه مقابل المال. تُقدِّر تقارير المجتمع حول عمليات نشر GLM-4-Voice المكمَّمة زمن استجابة الحوار المستمر بـ38–120 مللي ثانية، رغم أن هذه الأرقام تأتي من كتابات وليس من Zhipu. أما زمن استجابة Gemini 3.8 Live فلم تنشره Google إطلاقًا. إذا كان انخفاض زمن الاستجابة متطلبًا صارمًا لديك، فلا يقدِّم أيٌّ منهما رقمًا يمكنك التخطيط بناءً عليه — أحدهما لديه قياسات مجتمعية من طرف ثالث، والآخر لديه شهادات شركاء ولا رقم.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

الخيار الأوسط: امتلك المنطق، واستأجر الإمكانات

صياغة المسألة على أنها استضافة ذاتية مقابل استضافة مُدارة تغفل الترتيب الذي ينتهي إليه معظم الفرق في الواقع. فـ GLM-4-Voice لا يملك قناة أدوات، لذا أي منتج مبني عليه يحتاج إلى نموذج نصي منفصل للقيام بالبحث — ما يعني أن نموذج الكلام المستضاف ذاتيًا يقع أمام نموذج نصي مستضاف في كل الأحوال. وقرار النشر وقرار القدرات قابلان للفصل.

هذا التقسيم هو حيث يؤدي الموجّه عملًا حقيقيًا. يحمل OrcaRouter 190 نموذجًا خلف مفتاح واحد بسعر قائمة المزوّد دون أي هامش، لذا يمكن تبديل هدف التفويض خلف واجهة الكلام الأمامية لديك على حركة المرور المباشرة دون إعادة بناء أي شيء، ويصلك تخفيض سعر المنبع في اليوم نفسه بدلًا من التجديد التالي. تكتسب التحويلة التلقائية عند الفشل أهمية أكثر من المعتاد في إعداد مستضاف ذاتيًا، لأنه عندما تكون نسخة GPU الخاصة بك هي ما سقط، يظل نموذج الواجهة الخلفية قابلاً للوصول ولا يتعين أن تنتهي الجلسة معه. توضيحان، بما أن هذه المقارنة تثير الالتباس: نحن لا نستضيف GLM-4-Voice، كما أن نقاط نهاية Gemini 3.8 Live ليست على الموجّه لدينا أيضًا — فهي تأتي من مورّديها. ما يوجد على الموجّه هو طبقة النص التي يسلّم إليها كلاهما العمل.

القرار، والدرس الكامن تحته

اختر GLM-4-Voice إذا كنت تحتاج إلى النموذج على عتادك الخاص، وإذا كان حجم حركة المرور لديك ثابتًا فعلاً ومرتفعًا، وإذا كنت تبني بالصينية أو الإنجليزية فقط، وإذا كنت تحتاج إلى تعديل النموذج بدلًا من استدعائه. احسب تسجيل الترخيص كمهمة حقيقية، وتوقّع أن تحل مشكلة الفهم متعدد الأدوار بنفسك — فهي نقطة الضعف الموثّقة في النموذج، ولن يُخفي ذلك تمامًا أي قدر من الضبط الدقيق ضمن سقف إخراج 4K.

اختر Gemini 3.8 Live إذا كانت متطلباتك تشمل الرؤية، أو استدعاء الأدوات، أو أكثر من لغتين، أو أي نمط مرور تصفه بأنه متذبذب. إنه نموذج معاينة بأرقام سياق وزمن استجابة غير منشورة، وهو ما يمثل خطرًا حقيقيًا عند التخطيط، لكنه أيضًا الوحيد من بين الاثنين القادر على البحث عن شيء ما في منتصف الجملة.

الدرس العام أنفع من أي من الحكمين. أنتج أحد وعشرون شهرًا من الذكاء الاصطناعي الصوتي نموذجًا ليس في المقام الأول نموذجًا صوتيًا أفضل — بل هو واجهة صوتية إلى وكيل. إذا كان سبب رغبتك في الأوزان المفتوحة هو التكلفة، فالحساب أقرب مما يوحي به الإطار الخالي من الترخيص. وإذا كان سببك هو التحكم، فإن ذلك لم يتحول إلى سلعة على الإطلاق، ويظل GLM-4-Voice إجابة مشروعة عن سؤال لا يتناوله Gemini 3.8 Live.