
Muse Realtime Avatar مقابل GPT-Live-1: الحضور في مواجهة المحادثة
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 180 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
تخبرك وحدة الفوترة بما تعتقد كل شركة أنها تبيعه. GPT-Live-1، النموذج الصوتي كامل الازدواجية من OpenAI، يفوتر بسعر ثابت قدره 0.05 دولار لكل دقيقة صوت تُحتسب بالثانية، وحدود معدله محددة بالجلسات المتزامنة — 25 في الفئة 1، وترتفع إلى 500 في الفئة 5. تلك وحدة خط هاتف. Muse Realtime Avatar، الذي أعلنت عنه Meta في 23 سبتمبر 2026، ليس له وحدة فوترة، لأنه لا يوجد شيء لفوترته: لا API، ولا نقطة نهاية، ولا سعر، ولا تاريخ. وحدته المنشورة هي رقم عتاد بدلاً من ذلك — 12 جلسة متزامنة في الوقت الفعلي على وحدة NVIDIA GB200 واحدة. شركة تبيع المحادثة بالدقيقة. والأخرى تُظهر لك ما يكلفه عرض وجه، ولم تقرر بعد بيعه.
كلا النموذجين جديدان نسبيًا، ولا يُعد أي منهما إطلاقًا بالمعنى الذي تحمله الكلمة عادةً. أُطلقت GPT-Live-1 داخل ChatGPT في 8 يوليو 2026، ولم تصل إلى واجهة برمجة التطبيقات للمطورين إلا في 10 سبتمبر — شهرين كانت فيهما الصوت الافتراضي لمنتج استهلاكي، وغير متاحة لأي شخص يبني. وأُعلن عن Muse Realtime Avatar في 23 سبتمبر 2026 في Meta Connect، ويُعرض في منشور الأبحاث الخاص بـMeta، ولا يزال قدرةً من قدرات وكيل Muse بدلًا من أن يكون منتجًا. والمقارنة بينهما هي مقارنة بين مرحلتين مختلفتين من الفكرة نفسها: ما الذي يحدث عندما يصبح نموذج محادثة جيدًا بما يكفي بحيث يصبح السؤال التالي هو ما ينظر إليه المستخدم أثناء حديثه.
ما الذي بنته OpenAI: محادثة لا تتعطل أبدًا
GPT-Live-1 ثنائي الاتجاه بالكامل بالمعنى المهم من الناحية التشغيلية — فهو لا ينتظرك حتى تنتهي قبل أن يبدأ العمل. يصل إلى واجهة برمجة تطبيقات المطورين عبر نقطة نهاية واحدة بالضبط، وهي نقطة نهاية Live Sessions، ضمن معرّف نموذج واحد بالضبط، gpt-live-1، مع عدم وجود لقطات مؤرخة لتثبيتها وعدم تمكين أي نقاط نهاية شقيقة. لا Chat Completions، ولا Responses، ولا Realtime، ولا الضبط الدقيق، ولا نقاط نهاية لتحويل الصوت إلى نص أو الكلام. إدخال الصور والفيديو غير مدعوم صراحةً.
قرار التصميم الذي يشكّل كل ما يليه هو التفويض. لا يقوم GPT-Live-1 بالتفكير الصعب بنفسه. تُقرن وثائق OpenAI طبقة الصوت بواجهة خلفية استدلال منفصلة، وفي مثال WebRTC المنشور تكون تلك الواجهة الخلفية GPT-5.6 Terra. لذا فإن جلسة GPT-Live-1 هي عدّادان يعملان في آن واحد: 0.05 دولار في الدقيقة للصوت، بالإضافة إلى معدلات الرموز المعتادة لنموذج الواجهة الخلفية مقابل كل استدعاء أداة وكل بحث وكل خطوة استدلال يحيلها. في مؤشر Speech to Speech Index تظهر تلك الشخصية المنقسمة على شكل النموذج نفسه وهو يسجّل مرتين — 81.5 مع GPT-6 Astra وهو يقوم بالتفكير بجهد متوسط، و80.1 مع GPT-5.6 Sol بجهد منخفض. الفجوة البالغة 1.4 نقطة بين هذين الإعدادين أوسع من هامش 0.2 نقطة الذي يضع أفضل إعداد لـ GPT-Live-1 في المركز الأول.
هذا هو الشكل الصادق للنموذج. الواجهة الأمامية للصوت ثابتة؛ أما الذكاء فهو معامل تضبطه أنت، وهو يحرّك النتيجة أكثر مما يفعله أي نموذج منافس.
ما بنته Meta: وجه يتحرك مع الصوت
يتصدى Muse Realtime Avatar لمشكلة لا يواجهها GPT-Live-1 — وهي الحفاظ على تزامن الفيديو المُولَّد مع الكلام المُولَّد. إجابة Meta هي جعلهما نفس التدفق: يُصدر Muse Realtime Voice رموز كلام تحمل المحتوى والنغمة معًا، والأفاتار عبارة عن Diffusion Transformer مدفوع بالصوت يستهلك نفس هذه الرموز، مشروطًا بصورة مرجعية ونافذة متجددة من الكامنات المرئية الحديثة. لا شيء يُزامَن شفويًا بعد الحدث، لأنه لا يوجد "بعد الحدث" — الصوت والفم والتعبير تنتج من عملية واحدة.
الأرقام المنشورة هي أرقام Meta نفسها، ومقيسة مقابل خطوط أساس اختارتها Meta، ولم يُعِد إنتاج أي منها خارج الشركة. 870 مللي ثانية من نهاية دورك إلى أول بايت من رد متزامن بالصوت والفيديو. فيديو عمودي بدقة 448×768 بمعدل 25 إطارًا في الثانية، موسوم بطبقة تراكب شفافة ليتمكن المشاهد من إدراك أنه ليس من كاميرا. اثنتا عشرة جلسة متزامنة على GB200 واحد، بزيادة سعة تبلغ 8× مقارنة بخط الأساس ثنائي الخطوات BF16 الخاص بـ Meta، بفضل التدريب الواعي بالتكميم بأربع بتات، وذاكرات KV الدائمة، والتجميع الديناميكي المراعي لزمن الاستجابة. ونتيجة تفضيل تُبلغ عنها Meta ترتفع من 45% إلى 55% مقارنة بخط الأساس ذلك، مع فوزين معلن عنهما ضد أنظمة أفاتار تجارية — إضافة إلى الإفصاح بأنه في ما يتعلق بالإيماءات المميزة، فإن النتيجة ضد أحدها لا تختلف إحصائيًا عن التعادل.
لا يوجد في تلك القائمة أي سعر، أو نقطة نهاية، أو تاريخ.

فاتورة المترين، وأين يثبت التوجيه جدارته
ليست بنية تكلفة GPT-Live-1 رقمًا واحدًا، والتعامل معها كرقم واحد هو ما يجعل نموذجًا صوتيًا يبدو رخيصًا ينتج شهرًا مكلفًا. الصوت بتكلفة 0.05 دولار للدقيقة، ويُحتسب بالثانية دون تقريب لأعلى، وتُحتسب أول 15 ثانية من الجلسة مقدمًا لكن تُخصم من المدة اللاحقة بدلًا من أن تُضاف فوقها. كل ما تفوّضه الجلسة — الاستدلال، واستدعاءات الأدوات، وأي بحث — يُحتسب بشكل منفصل بأسعار النموذج الخلفي نفسها. وجّه التفويض إلى مستدلّ متقدم ودعه يبحث في كل دور، وستكون قد بنيت خطًا مفتوحًا بتكلفة 3 دولارات في الساعة وبنموذج متميز خلفه.
هذا العدّاد الثاني هو النصف القابل للتوجيه. على OrcaRouter، الواجهة الخلفية لجلسة GPT-Live-1 ليست سوى نداء نموذج آخر: 196 نموذجًا من 15 مزوّدًا خلف مفتاح واحد، بسعر المزوّد المُعلن دون أي هامش، مع تحويل تلقائي عند فشل النموذج الذي اخترته أو انتهاء مهلة استجابته. لا يمكنك توجيه طبقة الصوت — Live Sessions هو نقطة نهاية OpenAI وحدها — لكن كل ما تفوّضه طبقة الصوت إليه يقع على مفتاح واحد، ما يعني أن الجزء من الفاتورة الذي يتغير بحسب مدى تفكير المتصلين لديك هو أيضًا الجزء الذي يمكنك تغييره دون عقد.
لا يحتوي Muse Realtime Avatar، في المقابل، على عدّادات يلزم توجيهها. فهو ميزة ضمن تطبيق.

رهانان بشأن الغرض من وكيل صوتي
إذا جرّدنا الأمر من المواصفات، يختلف الشِّركتان حول المنتج. رهان OpenAI هو أن المحادثة هي المنتج — أي أن وكيل الصوت خط هاتفي، والعمل كله في جعله يبدو كذلك: ألّا يتعثّر أبدًا، وأن يُحيل التفكير الصعب إلى نموذج خلفه، والفوترة بالدقيقة، والتوسّع بحسب عدد المكالمات المتزامنة. كل خيار في واجهة GPT-Live-1 API ينبع من ذلك. حدود معدّل قائمة على التزامن، ونقل عبر WebRTC فقط، ونقطة نهاية واحدة ضيّقة عن قصد، ولا فيديو وارد أو صادر.
رهان ميتا هو أن الحضور هو المنتج نفسه — وأن المستخدم الذي يستطيع رؤية الوكيل هو مستخدم يبقى في المحادثة، وأن الهندسة المثيرة للاهتمام ليست تبادل الأدوار بل الحفاظ على تماسك شخصية مُصوَّرة على امتداد مدة المكالمة. وتُنتج تلك الخيارات نظامًا مُحسَّنًا لمعدل الإطارات وكثافة الجلسات على وحدة معالجة رسومات، بلا أي واجهة تجارية على الإطلاق.
هناك احتمال حقيقي أن يكون كلاهما على حق وأن يُدمجا معًا. يمكن لمنتج أن يدير محادثته على نموذج صوتي مزدوج الاتجاه بالكامل، وطبقته البصرية على مُصيّر أفاتار، والشيء الوحيد الذي يمنع ذلك اليوم هو أن مُصيّر الأفاتار ليس لديه نقطة نهاية. ما ليس معقولًا هو التعامل معهما كنسختين من نفس عملية الشراء.
من يجب أن يتصرف، ومن يجب أن ينتظر؟
إذا كنت تبني منتجًا صوتيًا الآن، فإن GPT-Live-1 قابل للاستدعاء بينما Muse Realtime Avatar ليس كذلك، وهذا يحسم القرار. والاختيار المثير للاهتمام داخل GPT-Live-1 هو الواجهة الخلفية التي تُفوّض إليها المهمة، لأنها المكان الذي تتحرّك فيه النتيجة والفاتورة فعليًا — وهي الجزء الوحيد من المنظومة الذي يمكنك توجيهه وتبديله والتحويل عند تعذّره دون المساس بتكامل الصوت.
إذا كان ما تريده هو أفاتار، فإن الانتظار ليس سلبيًا. الأمور التي تستحق المراقبة محددة: هل تنشر Meta قائمة أسعار ونقطة نهاية، وهل يظهر موعد معلن، وهل تصمد الـ870 مللي ثانية عند التلامس مع هاتف على اتصال خلوي بدلًا من عرض تجريبي في Connect. وتشير تدوينة Meta نفسها إلى أن عروضها التجريبية لا تعكس جميعها الأفاتار المتاح في تطبيق Muse، وهذه هي الجملة التي ينبغي التمسك بها.
إلى أن يتغير أحد تلك الأمور، للمقارنة إجابة من سطر واحد. GPT-Live-1 هو خط هاتفي بعقل تختاره أنت. Muse Realtime Avatar هو وجه بلا رقم هاتف.

