
GPT-Live-1 مقابل VoxCPM2: أحدهما يكلّف 0.05 دولار في الدقيقة، والآخر يكلّف وحدة معالجة رسومات بسعة 24 جيجابايت
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
أوضح طريقة لمقارنة GPT-Live-1 مع VoxCPM2 هي أن تلاحظ أنهما لا يبدوان كمتنافسين إلا عندما تضع رقمًا على العتاد. GPT-Live-1 هو نموذج OpenAI الصوتي كامل الازدواجية، متاح في API منذ 10 سبتمبر 2026 بسعر 0.05 دولار لكل دقيقة صوت دون أي تثبيت. VoxCPM2 هو نموذج OpenBMB لتحويل النص إلى كلام مفتوح الأوزان بمعاملات 2 مليار، صدر تحت Apache 2.0 في أبريل 2026، ويعمل على حوالي 8 جيجابايت من VRAM ولا ينشره أي مزود استدلال — لذا إذا أردته، فأنت تملك الجهاز. أحدهما محادثة تستأجرها بالثانية؛ والآخر مُركِّب تديره. السؤال ليس أيهما أفضل، بل أيّهما يمكن لعبء عملك أن يستوعبه فعلاً.

نموذجان، وظيفتان، وسطر مواصفات صادق واحد لكل منهما
• الوظيفة — يُجري GPT-Live-1 محادثة: يستمع ويتحدّث في الوقت نفسه، ويتبادل الأدوار، ويتعامل مع المقاطعات والإشارات الخلفية، ويعيد النصوص المكتوبة. ويحوّل VoxCPM2 النص إلى كلام. وهو لا يسمع شيئًا أبدًا.
• الوصول — GPT-Live-1 مستضاف ومغلق، معرّف نموذج واحد خلف نقطة نهاية Live Sessions، مع مثال التكامل المنشور الذي يعمل عبر WebRTC. VoxCPM2 هو نقطة تحقق قابلة للتنزيل على Hugging Face وModelScope، بترخيص Apache 2.0، مجاني للاستخدام التجاري.
• السعر — تبلغ تكلفة GPT-Live-1 نحو 0.05 دولار لكل دقيقة صوتية، تُحتسب بالثانية، مع احتساب الواجهة الخلفية للتفويض بشكل منفصل. أما VoxCPM2 فتبلغ تكلفته 0 دولار لكل استدعاء بالإضافة إلى وحدة معالجة رسومية (GPU)، والاستضافة مفتوحة المصدر هي نموذج التكلفة بالكامل.
• البصمة — لا يحتاج GPT-Live-1 إلى أي عتاد من جانبك. أما VoxCPM2 فيحتاج إلى نحو 8 غيغابايت من VRAM (6–8 غيغابايت عند Q4)، وPython 3.10+، وPyTorch 2.5+، وCUDA 12+.
• المعايير المرجعية — كل إحصاء صوتي لـ GPT-Live-1 هو إحصاء OpenAI، ولم يُعَد إنتاجه؛ واللوحة المستقلة الوحيدة تضعه في المرتبة السابعة من أصل أحد عشر. أما الأرقام المنشورة لـ VoxCPM2 فهي أرقام OpenBMB، والقياسات المستقلة الموجودة بشأن مزاعمه متعددة اللغات تشير في الاتجاه المعاكس.
سؤال الـ24 جيجابايت، مُسعّرًا
أرقام الخدمة الخاصة بـ VoxCPM2 هي التي تحدد ما إذا كانت الاستضافة الذاتية هواية أم معمارية. على بطاقة RTX 4090 واحدة، يعمل النموذج بمعامل زمن حقيقي يبلغ نحو 0.30 في PyTorch العادي ونحو 0.13 مع مسار Nano-VLLM — أي ما يعادل نحو 7.7 ساعات من الصوت المولّد لكل ساعة من وقت GPU في الإعداد الأسرع. وهذه أرقام بطاقة النموذج نفسه وليست قياساً خارجياً؛ إذ تُبلغ وصفة خدمة مستقلة جرى التحقق منها على بطاقة 4090 مع CUDA 12.9 عن معاملات زمن حقيقي في الحالة المستقرة تبلغ نحو 0.120 للتخليق بدون أمثلة و0.139 للاستنساخ، مع ذروة ذاكرة GPU قرب 22 غيغابايت من أصل 24 غيغابايت. وكلا المجموعتين في الحالة المستقرة، وليستا عند بدء التشغيل البارد — فالطلب الأول في عملية جديدة أبطأ بكثير، وهذا هو الرقم الذي يستشهد به الناس عندما يقولون إن النموذج غير قابل للاستخدام.
ضع ذلك بجانب API. GPT-Live-1 بسعر 0.05 دولار في الدقيقة أي 3.00 دولارات لساعة من محادثة متواصلة. بطاقة بسعة 24 GB مستأجرة في السوق المفتوحة تتراوح تكلفتها في الساعة ضمن أرقام الدولارات الأحادية المنخفضة، كما أن امتلاك واحدة يُطفأ إلى ما يشبه ذلك عند احتساب معدل الاستخدام. لذا تنتهي المقارنة حيث تنتهي هذه المقارنات عادةً، مع عدم تماثل مزعج واحد: فاتورة GPU تصل سواء تحدّث أحدهم إلى منتجك أم لا، أما فاتورة API فتتقلص إلى الصفر في يوم هادئ وتبلغ خمسة أرقام في يوم مزدحم. التركيب الدفعي لكتالوج ثابت يناسب GPU تمامًا. وخط هاتفي دائم التشغيل يناسب العداد تمامًا.
ما يفعله VoxCPM2 ولا يفعله أي شيء مفتوح آخر
السبب الذي يجعل VoxCPM2 يستحق كل هذا الاهتمام ليس أنه يتفوق في معايير القياس — فهو في الغالب لا يفعل — بل أنه يصمّم صوتًا من وصف نصي دون أي صوت مرجعي على الإطلاق. هذه قدرة جديدة حقًا في الأوزان المفتوحة، وهي تغيّر سير العمل لأي شخص يحتاج إلى صوت غير موجود بعد: اختبره تجريبيًا عبر النثر، وكرّر التحسين عبر النثر، وبعد ذلك فقط قرّر ما إذا كنت ستستنسخه. وإلى جانب ذلك، يجمع 30 لغة إضافة إلى تسع لهجات صينية، ومخرجات بتردد 48 kHz عبر مرحلة تحسين فائق مدمجة، وضبطًا دقيقًا ببيانات صوتية لا تتجاوز 5–10 دقائق.
قاعدة الأدلة أهزل من قائمة الميزات. يقدّم تقرير OpenBMB الخاص معدل خطأ الكلمات في الإنجليزية بنسبة 1.84% ومعدل خطأ الأحرف في الصينية بنسبة 0.97%، ومتوسط خطأ 1.68% عبر 30 لغة، مقيسًا على مجموعته الخاصة المكوّنة من 500 عبارة منطوقة لكل لغة ومُقيَّمًا بنموذج مورّد آخر. وحيث يوجد اختبار مستقل، تكون الفجوة كبيرة: على مجموعة الاختبار متعددة اللغات الخاصة بـ MiniMax والمُقيَّمة باستخدام Whisper-large-v3، تبلغ الهندية 19.70 والعربية 13.05 — أسوأ بأضعاف من الأرقام المعلنة ذاتيًا. كما تحذّر OpenBMB من أن تصميم الصوت والتحكم في النمط ينتجان نتائج متغيّرة بين عمليات التشغيل، وتقترح التوليد من مرة إلى ثلاث مرات للحصول على الناتج الذي تريده، وهو طريقة هادئة للقول إن التكلفة لكل استدعاء لنتيجة صالحة للاستخدام ليست استدعاءً واحدًا.
ضريبة التكامل التي لا يدرجها أحد في المقارنة
تفصيل واحد غير جذاب يحدد ما إذا كان VoxCPM2 أسبوعًا من العمل أو شهرًا. مستودعه على Hugging Face موسوم بـvoxcpm بدلاً من transformers، مما يعني أن المكتبة التي تُحمَّل بها تقريبًا كل الأشياء الأخرى على ذلك الموقع لا يمكنها تحميل هذا النموذج. تم فتح طلب السحب لإصلاح ذلك في 4 أغسطس 2026 ولم يكن قد دُمج عندما تحققنا آخر مرة. طلبات السحب لإضافته إلى حزم تقديم أخرى قد دُمجت، والتبني ليس موضع شك: 393,079 تنزيلًا في آخر ثلاثين يومًا حتى وقت هذا الالتقاط، مع 27 مهايئًا، و30 ضبطًا دقيقًا، و12 تكميمًا، و100 Spaces مبنية على نقطة التحقق.

الضريبة المكافئة لـ GPT-Live-1 هي إعادة كتابة لطبقة النقل. فجلساته مبنية حول اتصال حي بدلاً من نقطة نهاية صوتية بنمط الطلب والاستجابة، وتعني الفوترة ذات المقياسين أن كل نداء استدلال مفوَّض، وكل استدعاء أداة، وكل بحث ويب يُحاسَب بأسعار النموذج الخلفي نفسها إضافة إلى دقيقة الصوت. وعلى الفرق التي تنتقل من تكامل زمن حقيقي مقيس بالرموز أن تخطط للانتقال كمهمة هندسية، لا كمجرد تبديل لمعرّف النموذج.
حيث تفيد طبقة التوجيه فعليًا
لا يضم OrcaRouter لا GPT-Live-1 ولا VoxCPM2، ومن الجدير قول ذلك صراحةً بدلاً من أن ندع بقية هذا القسم توحي بخلاف ذلك. تقع طبقة الصوت في GPT-Live-1 خلف نقطة النهاية الخاصة بـ OpenAI؛ ولا يمتلك VoxCPM2 أي مزوّد مستضاف على الإطلاق. ولا يمكن استدعاء أيٍّ منهما باستخدام مفتاحنا.
سبب استمرار طرح مسألة التوجيه هو أن كلا النموذجين يقعان عند طرف خط أنابيب وسطه نص. فعادةً ما يكون نشر VoxCPM2 مستجيبًا لشيء ما — مولّد نصوص برمجية، أو خطوة ترجمة، أو مُطبِّع نصي، أو نموذج حوار يقرر ما سيُلتقط صوتيًا بعد ذلك — وكل تلك استدعاءات نماذج عادية. أما جلسة GPT-Live-1 فتُفوِّض تفكيرها إلى نموذج خلفي مُسمّى في إعدادات الجلسة، وهو في وثائق OpenAI نفسها GPT-5.6 Terra، المتاح عبر OrcaRouter بسعر OpenAI المعلن. ويتقدم تفويض العميل خطوة أبعد، إذ يتيح لتطبيقك أنت أن يوفّر النموذج الخلفي، ما يعني أن النموذج الكامن خلف الصوت يمكن أن يكون أي نقطة نهاية تتحكم بها. نحو 190 نموذجًا من أحد عشر مزوّدًا أعلى السلسلة تقف خلف مفتاح واحد بالسعر المعلن دون أي هامش ربح — فحين يخفض مزوّد سعره، يسري التخفيض هنا في اليوم نفسه لا عند التجديد — مع تحوّل تلقائي بين المزوّدين عند الفشل، ولغة توجيه خاصة (DSL) لتركيب عدة نماذج في استدعاء واحد. تأمين رخيص للنصف الأكثر تغيّرًا من المنظومة.
ينبغي أن يوضع تنبيه واحد في هذا القسم بدلًا من أن يُدفن فيه، لأنه التفصيل الذي يجعل نصف هذه المقارنة الخاص بـ GPT-Live-1 أقل حسمًا مما توحي به اختبارات المورّد المرجعية. في مؤشر Artificial Analysis Speech to Speech Index المستقل، يسجّل GPT-Live-1 نسبة 69.8% — في المرتبة السابعة من بين أحد عشر، خلف GPT-Realtime-2.1 بنسبة 73.9% وGrok Voice Think Fast 2.0 بنسبة 79.0%. هذا الطراز هو الأرخص على تلك اللوحة لكل ساعة من الصوت المُدخل عند 4.42 دولار، وهو ليس الأفضل. ضع في حسبانك احتمال أن طبقة الصوت التي توحّد معاييرك عليها ليست هي التي ستحتفظ بها.

أي واحد، لأي غرض؟
اختر VoxCPM2 إذا كان النص موجودًا قبل الصوت. التعليق السردي، والكتب الصوتية، والدبلجة، وإمكانية الوصول، والجُمل الصوتية في الألعاب، ومنتج يحتاج إلى صوت لم يسجّله أحد بعد — وبخاصة أي عبء عمل يكون حجمه كبيرًا ومتوقعًا ويستحق تكلفة رأسمالية ثابتة. تقبّل أنك ستشغّله بنفسك، وأن الأدوات المحيطة به لا تزال في طور الاستقرار، وأن ادعاءات الجودة متعددة اللغات تستحق اختبار استماع تجريه بنفسك قبل أن تصل إلى عميل.
اختر GPT-Live-1 إذا كان هناك شخص على الطرف الآخر. وكلاء الصوت، دعم الهاتف، تدفقات الاستقبال، أي شيء حيث يجب على النموذج أن يقرر في الوقت الفعلي ما إذا كان الإنسان قد انتهى من التحدث. ادفع السعر لكل دقيقة مقابل امتياز عدم امتلاك المشكلة، وخصص الميزانية للخلفية المفوضة كبند منفصل لأن هذا هو المكان الذي تصبح فيه المكالمة رخيصة أو مكلفة.
الخطأ هو التعامل معهما كبديلين في منافسة. هما طبقتان لنفس المنتج بالنسبة لمعظم الفرق التي تحتاج كليهما، والإجابة الخاطئة حقًا الوحيدة هي اختيار الخيار المُستضاف ذاتيًا لأن الترخيص يقول إنه مجاني دون حساب تكلفة وحدة معالجة الرسومات التي تجعل ذلك صحيحًا.
