
Muse Realtime Avatar مقابل Gemini 3.8 Live: وجهٌ في مواجهة خط صوتي
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 180 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
هذان ليسا بديلين، وأسرع طريقة لملاحظة ذلك هي السؤال عمّا يخرجه كل واحد منهما. Muse Realtime Avatar، الذي أعلنت عنه Meta في 23 سبتمبر 2026، يعيد فيديو متزامنًا لشخصية تتحدث — فأنت تقدّم صورة مرجعية، وهو يجعل ذلك الشيء يتحدث ويؤدي إيماءات في إطارات عمودية بدقة 448×768. Gemini 3.8 Live، الذي أعلنت عنه Google في 15 سبتمبر 2026 وأصبح متاحًا عمومًا للمطورين في اليوم نفسه، يعيد الصوت والنص. وليس لديه أي مخرجات فيديو على الإطلاق. وضعهما في المقارنة نفسها ليس خطأً — فهما يتنافسان على سطح المحادثة نفسه، والمشترون يسألون بالفعل أيّهما يبنون عليه — لكن القرار ليس "أيّهما أفضل". بل "أي من منتجين مختلفين أحتاج؟"، وتكاد كل مقارنة منشورة بينهما تخطئ في ذلك عبر رصف معايير تقيس أشياء مختلفة.
إليك عدم التماثل الذي ينبغي أن يؤطّر كل ما يلي. يمكنك استدعاء Gemini 3.8 Live اليوم، من طرفية، باستخدام مفتاح. ولا يمكنك استدعاء Muse Realtime Avatar إطلاقًا — لا API، ولا سعر، ولا موعد. عرضته Meta في Connect ونشرت منشورًا بحثيًا؛ أما Google فقد أطلقت قائمة أسعار ومعرّف نموذج. هذه مقارنة بين منتج وإعلان، وهي تعني أن السؤال المفيد ليس أيهما يفوز، بل ما الذي يُلزمك به كلٌّ منهما.
ما ينتجه كل واحد منها فعليًا
هذه هي المقارنة بأكملها في ستة أسطر، ولا واحد من الستة قريب.
• المخرجات — يُعيد Muse Realtime Avatar صوتًا وفيديو بورتريه متزامنين، يُولَّدان معًا من تدفق واحد من رموز الكلام؛ بينما يُعيد Gemini 3.8 Live الصوت والنص، دون أي توليد للفيديو في أي جزء من النموذج.
• وصول المطورين — لا يملك Muse Realtime Avatar أي وصول للمطورين: فقد أُعلن في 23 سبتمبر 2026 كميزة ضمن وكيل Muse من Meta، بلا API، وبلا نقطة نهاية، وبلا تاريخ معلن. Gemini 3.8 Live موجود في Gemini API وGoogle AI Studio اعتبارًا من 15 سبتمبر 2026، تحت معرّفي نموذج، gemini-3.8-live وgemini-3.8-live-extended-thinking.
• السعر — لا يوجد سعر معلن لـ Muse Realtime Avatar لأنه لا يوجد شيء يمكن شراؤه. أمّا Gemini 3.8 Live فيعلن عن 0.005 دولار لكل دقيقة من الإدخال الصوتي و0.018 دولار لكل دقيقة من الإخراج الصوتي عبر Live API.
• التقييم المستقل — لا يملك Muse Realtime Avatar أي تقييم مستقل؛ فأرقامه هي أرقام Meta نفسها، مقيسة مقابل خطوط أساس اختارتها Meta. ويسجّل Gemini 3.8 Live 76.0 على Artificial Analysis Speech to Speech Index، فيما تسجّل النسخة ذات التفكير الموسّع 82.6 — وهو رقم صادر عن طرف ثالث، ما يمثّل فئة مختلفة من الأدلة.
• زمن الاستجابة — الرقمان المنشوران لا يمثلان القياس نفسه، وهنا تخطئ معظم المقالات. تُبلغ Meta عن 870 مللي ثانية من نهاية دورك إلى أول بايت من رد صوتي ومرئي متزامن. أما رقم Google، وفقًا للقياس الذي أجرته Artificial Analysis، فهو 1.18 ثانية حتى أول صوت في النموذج القياسي و1.35 ثانية في نسخة الاستدلال.
• الإطار واللغة — يعرض Muse Realtime Avatar فيديو عموديًا بدقة 448×768 بمعدل 25 إطارًا في الثانية. يتميز Gemini 3.8 Live بالتبديل التلقائي أثناء المحادثة عبر 97 لغة مدعومة، ويعالج المرئي شبه الفوري كمدخل.
هذا الصف الأخير يحتوي على الفرق الذي يظل الناس يطمسونه. يستطيع Gemini 3.8 Live أن يرى. لكنه لا يستطيع أن يُظهر. يستطيع Muse Realtime Avatar أن يُظهر. أما ما إذا كان يستطيع أن يرى فليس هذا ما يتناوله منشور Meta — فهو مُولِّد مدفوع بالصوت، مشروط برموز الكلام وصورة مرجعية، ومهمته إنتاج وجه لا قراءته.

أرقام زمن الاستجابة غير قابلة للمقارنة، والفجوة أصغر مما تبدو عليه.
870 ms مقابل 1.18 ثانية تبدو وكأن ميتا أسرع بنسبة 26%. اقرأ القياسات وستتلاشى المقارنة. رقم ميتا هو الزمن من نهاية دور المستخدم إلى أول بايت من رد يتضمن فيديو — ومنشور ميتا صريح في أنه مقياس لأول بايت، وليس الزمن حتى اكتمال الرد، وليس زمن استجابة التسليم المستمر لبقية المكالمة. يمكن لنظام أن يبلغ 870 ms إلى أول بايت ومع ذلك يبدو بطيئًا في الثانية الثانية عشرة. رقم جوجل هو الزمن إلى أول صوت، وهو شيء أصغر بكثير من حيث الإنتاج، ويقيسه مُقيِّم خارجي لا المورّد.
كلا الرقمين من النوع الذي يخبرك بأن النظام حواريّ لا قائم على الأدوار، ولا يخبرك أي منهما كيف يبدو الاتصال عند الدقيقة الخامسة. وإذا كنت تختار بينهما من حيث الاستجابة، فإن الموقف الصادق هو أنه لم ينشر أحد قياسًا متماثلًا، والسبيل الوحيد للحصول على قياس كهذا هو تشغيل النظام الذي يمكن الاتصال به.
ما يمكنك البناء عليه اليوم، وما ستنتظره
يأتي Gemini 3.8 Live مزوّدًا بما يحتاجه قرار الإنتاج: معرّفا نموذجين يمكنك تثبيتهما، وأسعار معلنة لكل دقيقة، ودرجة مؤشر من طرف ثالث، وتاريخ معلن للتوفر العام. كما يأتي بالقيود التي عادةً ما تتسم بها منتجات الصوت — إدخال صوتي، وإخراج صوتي ونصي، وعدم توليد الفيديو.
يأتي Muse Realtime Avatar بما يحمله أي منشور بحثي: بنية معمارية، وأربعة أرقام أعلنت عنها الشركة، ومجموعة من اختبارات التفضيل المُفصح عنها التي أجرتها Meta مقارنةً بنظامين تجاريين للصور الرمزية، أحدهما تقول Meta نفسها إنه غير قابل للتمييز إحصائياً عن التكافؤ في السلوك. ما يفتقر إليه هو طريقة لشرائه. يشير منشور Meta أيضاً إلى أن العروض التوضيحية المعروضة لا تعكس كلها الصور الرمزية المتاحة في تطبيق Muse، وهذه هي الجملة التي ينبغي أن تحكم أي خطة تبنيها حول هذا.
هناك خيار ثالث جدير بالذكر، لأنه الخيار الذي تسلكه معظم الفرق فعليًا. لا يُعد أي من هذين النموذجين وكيلًا كاملًا. يُسند Gemini 3.8 Live الأعمال الخلفية إلى الأدوات وواجهات برمجة التطبيقات بينما يواصل التحدث؛ بينما يفوّض GPT-Live-1 استدلاله بالكامل إلى نموذج خلفي منفصل. طبقة المحادثة هي الواجهة الأمامية، والتفكير هو نداء مختلف لنموذج مختلف. ذلك النداء الثاني هو استدلال نصي عادي، وهو قابل للتوجيه.
على OrcaRouter، تلك الطبقة هي نقطة نهاية واحدة: 196 نموذجًا من 15 مزوّدًا خلف مفتاح واحد، بسعر المزوّد المعلن مُمرَّرًا دون أي هامش إضافي، مع تجاوز تلقائي للفشل إذا تعطّل النموذج الذي اخترته أو انتهت مهلته. نحن لا نستضيف Gemini 3.8 Live — فواجهة Live API حكر على Google وحدها — ولا نستضيف Muse Realtime Avatar، الذي لا يستضيفه أحد. ما نوفّره هو النصف الخاص بوكيل صوتي الذي يتوسّع بقدر ما يبذله المتصلون من جهد في التفكير، والنصف الذي يمكنك تغييره دون إعادة التفاوض على أي شيء.

حيث قد يلتقي الاثنان فعلاً
الحجة وراء وضعهما جنبًا إلى جنب ليست المقاييس المرجعية. بل إن كليهما يحاول شغل الخانة نفسها في منتج ما: الشيء الذي يتحدث إليه المستخدم. رهان Google هو أن الخانة محادثة، وأن ما يُقدَّم محادثة جيدة — 97 لغة، وتنفيذ أدوات في الخلفية، ونسخة استدلالية تحلّ 68.6% من سيناريوهات خدمة العملاء في τ-Voice مقابل 30.1% للنموذج القياسي. ورهان Meta هو أن الخانة حضور، وأن المستخدم الذي يستطيع رؤية الوكيل هو مستخدم يبقى في المحادثة.
هذه الرهانات ليست متنافية. يمكن لمنتج، بشكل معقول، أن يستخدم Gemini 3.8 Live لحلقة الصوت وشيئًا مثل Muse Realtime Avatar للطبقة البصرية، إذا أصبحت طبقة الصورة الرمزية قابلة للاستدعاء يومًا ما. وما لا يمكنه فعله هو التعامل معهما كأنهما قابلان للتبادل، لأن أحدهما لن يمنحك وجهًا أبدًا، والآخر قد لا يمنحك نقطة نهاية أبدًا.
كيف تقرر
إذا كنت تطلق منتجًا صوتيًا هذا الربع، فالقرار قد اتُّخذ بالفعل من أجلك: Gemini 3.8 Live قابل للاستدعاء، أما Muse Realtime Avatar فليس كذلك. اختر نسختك على المحور الذي يجادل الإصدار بشأنه فعلاً — نموذج التفكير الممتد يجلب 38 نقطة في إكمال المهام الوكيلية مقابل ما يزيد قليلاً عن أربعة أضعاف تكلفة الصوت لكل ساعة، والنموذج القياسي هو أرخص نموذج صوتي كفء على اللوحة العامة. ثم وجّه الاستدلال المفوَّض بشكل منفصل، لأن الفاتورة وزمن الاستجابة كلاهما يكمن هناك.
إذا كنت تقيّم طبقة أفاتار، فالإجابة الصادقة هي أنه لا يوجد شيء يمكن تقييمه بعد. الموجود هو منشور بحثي يتضمن أربعة أرقام معلنة من الشركة وعرضًا توضيحيًا. الشيء الجدير بالمراقبة ليس المؤشر — فلن يظهر Muse Realtime Avatar على أحد المؤشرات — بل ما إذا كانت Meta تنشر بطاقة أسعار ونقطة نهاية وتاريخًا، وما إذا كانت 870 مللي ثانية ستصمد عندما يعمل الأفاتار على هاتف عبر اتصال شبكة خلوية بدلًا من عرض توضيحي في Connect.
حتى ذلك الحين، تكون المقارنة في صورة أقصر مما تمنحها إياه معظم المقالات. أحدهما منتج له سعر ورقم طراز ونتيجة تقييم خارجية. والآخر توضيح جيد جدًا لشيء لا يملك أيًا من ذلك بعد.

