
VoxCPM2: 900,000 عملية تنزيل شهريًا، وما زالت Transformers غير قادرة على تحميله
- metaجديدMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 لكل مليون رمز · 705 tok/s
- qwenجديدQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 لكل مليون رمز · 57 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3150الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 201 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicجديدAnthropic: Claude Opus 52026-07-2461الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2150الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1651الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1557الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0951الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0955الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0959الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0854الذكاء72البرمجة
- tencentTencent: Hy32026-07-0641الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3053الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1651الذكاء69البرمجة60الرياضيات
البيانات الوصفية لـ Hugging Face الخاصة بـ VoxCPM2 تُدرج مكتبتها على أنها voxcpm — وليس transformers. هذا الحقل الوحيد يفسر فجوة غريبة في عالم الكلام مفتوح المصدر الآن: نموذج OpenBMB لتحويل النص إلى كلام بعدد معاملات يبلغ 2 مليار حقق 900,282 عملية تنزيل خلال الثلاثين يومًا الأخيرة، وأفرز 25 نموذجًا مضبوطًا علنيًا، و10 عمليات تكميم، و7 محولات، وأكثر من 100 Space، ومع ذلك لا يزال يتعذر تحميله بالمكتبة التي يُحمَّل بها كل نموذج آخر تقريبًا على ذلك الموقع. فُتح طلب السحب لإصلاح ذلك في 4 أغسطس 2026 وما زال مفتوحًا حتى اليوم.
تلك الفجوة جديرة بالفهم قبل أن يصدر الإصلاح، لأنها تحدد تكلفة دمج هذا النموذج عليك هذا الأسبوع مقابل الربع القادم. وهي تستند إلى سؤال أكثر إثارة للاهتمام، وهو ما إذا كان VoxCPM2 متقدمًا فعلًا كما توحي التغطية. كل ما يلي مستند إلى ثلاثة مصادر أساسية: openbmb/VoxCPM2 بطاقة نموذجه وبيانات مستودعه، وملف README الخاص بـ OpenBMB/VoxCPM على GitHub، والتقرير الفني لنموذج VoxCPM2 (arXiv:2606.06928، المُقدَّم في 5 يونيو 2026). كل نتيجة معيارية في هذا المقال من إنتاج OpenBMB، وأُجريت بواسطة OpenBMB، و— كما يذكر التقرير نفسه في جدول المقارنة الرئيسي — الأرقام المنافسة فيه منقولة من أوراق أخرى بدلًا من إعادة تجربتها في ظروف مطابقة. على حد علمنا، لم ينشر أي مختبر مستقل إعادة إنتاج لأيٍّ من ذلك.
ورقة المواصفات في شاشة واحدة
تم إصدار VoxCPM2 في أبريل 2026 (تم إنشاء مستودع Hugging Face في 3 أبريل، وآخر تعديل في 16 أبريل) باعتباره الجيل الثالث من خط VoxCPM. مقارنةً بسابقه المباشر:
• الحجم — معاملات 2B مقابل 0.8B لـ VoxCPM1.5 وبنية أساسية بحجم 0.6B لـ VoxCPM-0.5B.
• اللغات — 30 لغة بالإضافة إلى 9 لهجات صينية، مقابل الصينية والإنجليزية فقط في النسختين السابقتين.
• الصوت — يقبل مرجعًا بتردد 16 كيلوهرتز ويُخرج بتردد 48 كيلوهرتز، مقارنةً بـ VoxCPM1.5 الذي يكون إدخالُه وإخراجُه متماثلين بتردد 44.1 كيلوهرتز.
• العمود الفقري — MiniCPM-4-1B (28 طبقة، عرض 2048) كنموذج لغة دلالي نصي، بعد أن كان MiniCPM-4-0.5B (24 طبقة، عرض 1024).
• ميزانية التسلسل — 8192 رمزًا بمعدل 6.25 هرتز من جهة نموذج اللغة، أي ما يعادل حوالي 20 دقيقة من الصوت في سياق واحد.
• تكلفة ثانية من الكلام — معامل الوقت الفعلي 0.30 في PyTorch العادي و0.13 عبر Nano-vLLM على بطاقة RTX 4090 واحدة، بحوالي 8 غيغابايت من ذاكرة الفيديو. حقق VoxCPM1.5 0.15 عند 0.8 مليار معامل و6 غيغابايت.
• الترخيص — Apache-2.0 على الأوزان، ورمز الضبط الدقيق، وأدوات الاستدلال. لا بوابة، ولا شرط استخدام مقبول، والاستخدام التجاري مسموح.
• بيانات التدريب — "أكثر من مليوني ساعة" من الكلام متعدد اللغات، دون ذكر اسم المجموعة ودون بيان المصدر.
اقرأ سطر RTF مرتين، لأنه يسير في الاتجاه المعاكس. VoxCPM2 أبطأ بنحو الضعف لكل ثانية من الصوت المُولَّد مقارنةً بالنموذج 0.8B الذي يحل محله، ويحتاج إلى ثلث ذاكرة VRAM إضافية. لم يشترِ نموذج 2B الإنتاجية؛ بل اشترى اللغات والتحكم، وكلَّفها زمن استجابة إضافيًا. إذا كنت تشغّل وكيلًا في الوقت الفعلي، فهذه المقايضة هي أول ما يجب تقييمه.
ما الذي يغيّره PR #47756 فعليًا
اليوم، تشغيل VoxCPM2 يعني تثبيت حزمة OpenBMB الخاصة — pip install voxcpm، Python 3.10 إلى 3.12، PyTorch 2.5 أو أحدث، CUDA 12 أو أحدث — وتحميل النموذج عبر استدعاء VoxCPM.from_pretrained الذي لا علاقة له بواجهة Transformers API. كل ما يتبع ذلك القرار مصمم خصيصًا: تجميعك الخاص، ووصلات التقديم الخاصة بك، ومعالجتك الخاصة للأوضاع الخمسة للتوليد.
من شأن العمل الجاري أن يغيّر هذا الوضع. قُدّمت القضية رقم 47695، «إضافة دعم أصلي لـ OpenBMB VoxCPM2»، في 31 يوليو. تبعها طلب السحب رقم 47756، «دعم لـ VoxCPM2»، في 4 أغسطس، وكان آخر تحديث له في 5 أغسطس. وهو يحمل وسم «نموذج جديد» ويضيف تكوينًا معياريًا وتنفيذًا للنمذجة، ومحللًا مخصصًا ومعالجًا مخصصًا، وتشفيرًا وفك تشفير AudioVAE مع البث، وتكييفًا بالصوت المرجعي، واستمرارًا للصوت الموجَّه، وتسجيلات فئات تلقائية، ومدخل خط أنابيب من النص إلى الشكل الموجي — مع الإبلاغ عن نجاح 64 اختبارًا للنماذج. وهو مبني على طلب السحب 47736 الذي يضيف MiniCPM4 نفسه؛ إذ يجب أن يُدمج العمود الفقري النصي قبل أن يتمكن النموذج الكلامي الذي يغلّفه من ذلك.

هناك تفصيلان يستحقان الوزن، وكلاهما يقلّل من التفاؤل. أولاً، جميع العناصر الثلاثة — المشكلة وطلبا السحب — قد فتحها مساهم فردي واحد من المجتمع، وليس بواسطة OpenBMB ولا بواسطة أحد القائمين على Hugging Face. لا يوجد التزام من البائع وراء ذلك، وبالتالي لا يوجد جدول زمني يمكنك التخطيط بناءً عليه. ثانيًا، مجموعة من طلبي سحب تضم 203 عمليات إيداع تمس نمطًا جديدًا ليست مراجعة سريعة. طلبات السحب الخاصة بالنماذج الجديدة في مكتبة Transformers عادةً ما تستغرق أسابيع من المراجعات المتبادلة بين القائمين، وهذا الطلب تحديدًا حصل على أربعة تعليقات حتى الآن.
القراءة العملية: إذا كانت فئة Transformers الأصلية ضرورية لبنيتك — لأنك تعتمد على AutoModel، أو لأن طبقة التقديم لديك لا تفهم سوى Transformers — فإن VoxCPM2 ليس جاهزًا لك، ولا يوجد موعد محدد. إذا كان بإمكانك العمل ضمن حزمة voxcpm، فإن النموذج قابل للاستخدام بالكامل اليوم، وقد صوّت النظام البيئي بوضوح على أن هذا أمر مقبول: 900,282 عملية تنزيل حدثت دون وجود دعم أصلي على الإطلاق. وهناك أيضًا مسار وسط تغفله معظم التغطيات. توفر OpenBMB تكامل vLLM-Omni يعرض نقطة نهاية متوافقة مع OpenAI /v1/audio/speech، بالإضافة إلى إصدار llama.cpp-omni بأوزان GGUF يعمل على CPU أو Metal أو CUDA أو Vulkan دون أي اعتماد على Python. إذا كان ما أردته فعليًا من Transformers هو واجهة خدمة قياسية بدلاً من الفئة نفسها، فذلك موجود بالفعل.
"بدون مُجزِّئ" لا يعني غير مُكمَّم
العبارة التي تتردد في كل عنوان حول هذا النموذج هي الأكثر تعرّضًا للقراءة الخاطئة. لا يمتلك VoxCPM2 أي برنامج ترميز صوتي خارجي منفصل — لا توجد مفردات مُتعلَّمة من رموز الكلام تقع بين نموذج اللغة وشكل الموجة، كما هو الحال في سلالتي CosyVoice أو Moshi. هذا هو الادعاء، وهو صحيح.
لا يزال هناك تكميم داخل النموذج. تشغّل الشبكة الأساسية عنق زجاجة شبه منفصل قابل للاشتقاق يعتمد على التكميم العددي المحدود (Finite Scalar Quantization)، والورقة صريحة بشأن دوره: نموذج اللغة الدلالي النصي ينتج حالات مخفية، ويقوم FSQ بترميزها كميًا عدديًا لكل بُعد في "هيكل دلالي"، ثم يستعيد نموذج اللغة الصوتي المتبقي التفاصيل الدقيقة التي أسقطها FSQ، بينما يحوّل محوّل الانتشار المحلي كلا تياري الشروط إلى الرقعة الكامنة المستمرة التالية عبر مطابقة التدفق. المراحل الأربع التي تراها مختصرة بـ LocEnc وTSLM وRALM وLocDiT هي تحديدًا تلك السلسلة.
التمييزُ المهمُّ عمليًّا ليس "مكمَّمًا مقابل غيرِ مكمَّم". بل إنَّ عنقَ الزجاجة يُدرَّب من البداية إلى النهاية مع كلِّ ما حوله، بدلًا من أن يُجمَّد مسبقًا بوصفه برنامجَ ترميزٍ مستقلًّا له دالةُ خسارةٍ خاصةٌ به. هذا هو ما يُزيل نمطَ الفشلِ المعتادَ الذي يتعلم فيه نموذجُ اللغة التنبؤَ برموزٍ لا يستطيع برنامجُ الترميز فكَّ ترميزِها بأمانة. وقد وسَّع VoxCPM2 عنقَ زجاجة FSQ من 256 إلى 512 بُعدًا، واستبدل المجموعَ العنصريَّ القديمَ الذي يغذِّي النموذجَ المتبقِّي بإسقاطِ تسلسلٍ قابلٍ للتعلم — تغييراتٌ صغيرة، ومن بين القلائل في التقرير المدعومة بآليةٍ مُصرَّحٍ بها بدلًا من فارقٍ في المعايير.
مخرجات 48 كيلوهرتز مُختلَقة جزئيًا، وهذا هو التصميم.
"مخرج بجودة استوديو 48 كيلوهرتز" هي المواصفة الأكثر اقتباسًا في النموذج والأكثر إساءة فهمه أيضًا. AudioVAE V2 غير متماثل: المشفِّر يعمل بتردد 16 كيلوهرتز، بينما يعيد المفكِّك البناء بتردد 48 كيلوهرتز. الورقة تسمّي هذا "الدقة الفائقة الضمنية"، وهو اسم صادق لما هو عليه.
اتبع النتيجة. إن مُرمِّزًا بتردد 16 كيلوهرتز له سقف نايكويست عند 8 كيلوهرتز، لذا لا يصل إلى النموذج أي شيء يتجاوز 8 كيلوهرتز في صوتك المرجعي. كل ذرّة طاقة في الأوكتافين العلويين من المخرجات — هواء الصوت، صفير الحروف، سطوع حافة الصنج — تولّدها وحدة فك الترميز من معرفة سابقة معقولة، ولا تُنقل من المتحدث الذي استنسخته. بالنسبة لمعظم أعمال السرد وأعمال الوكلاء، يكون هذا غير ملحوظ أو تحسينًا، لأن معرفة سابقة مُتعلَّمة جيدة تتفوق على رفّ 8 كيلوهرتز الصلب. أما لمن وظيفته الإخلاص لصوت مسجَّل محدد، فهذه حقيقة يجب التصميم على أساسها، وهي ليست أمرًا سيكشفه اختبار استماع على سماعات حاسوبك المحمول.
تبرير الورقة هو الحجة الهندسية الأكثر مصداقية في التقرير، ويستحق إعادة ذكره لأنه ليس تسويقًا: إبقاء المُرمِّز عند 16 كيلوهرتز يتيح لـ OpenBMB إعادة استخدام مجموعة بيانات تدريب VoxCPM الأصلية البالغة 16 كيلوهرتز بالكامل، ويلغي عدم التطابق الكامن بين المصادر المسجلة بمعدلات عينات مختلفة، ويتجنب انفجار طول التسلسل الذي كان معدل إدخال أعلى ليفرضه على حلقة الانحدار الذاتي. ترقية مفكك الترميز فقط تشتري دقة الإخراج دون الدفع مقابلها في الجزء المكلف من النموذج. تلك مقايضة جيدة، اتُّخذت عن عمد. كما أنها تعني أن مستخدمي VoxCPM1.5 ينتقلون من مُرمِّز 44.1 كيلوهرتز إلى مُرمِّز 16 كيلوهرتز — تخفيض في جانب الإدخال يُباع ضمن ترقية في جانب الإخراج. جدول إعادة البناء الخاص بـ OpenBMB يُظهر شكل ذلك: ما يزال كودك VoxCPM1.5 يحقق أفضل مسافة ميل عبر النطاق الكامل بين الأجيال الثلاثة، 1.139 مقابل 1.335 لـ AudioVAE V2، لأنه يعمل أصلاً بمعدل عينات مرتفع بدلاً من إعادة البناء إليه.
قراءة لوحة نتائج OpenBMB بالطريقة التي كتبتها OpenBMB
تنافسي، ليس الأول.
في معيار Seed-TTS-Eval القياسي لاستنساخ الصوت بصفر لقطة، يسجّل VoxCPM2 معدل خطأ كلمات بنسبة 1.84% مع تشابه متحدث بنسبة 75.3% على المجموعة الإنجليزية، ومعدل خطأ أحرف بنسبة 0.97% مع تشابه بنسبة 79.5% على الصينية، و8.13% معدل خطأ أحرف مع تشابه بنسبة 75.3% على المجموعة الصينية الصعبة. تصف الورقة البحثية نتائجها بكلمة "تنافسية"، والجدول يدعم هذه الكلمة بدلاً من الأوصاف الأقوى المتداولة.

من بين الأنظمة مفتوحة المصدر في نفس الجدول، يحقق Fish Audio S2 معدل خطأ أفضل في المجموعات الفرعية الثلاث جميعها (0.99 / 0.54 / 5.99). ويتفوق Qwen3-TTS عليه في معدل الخطأ في الكلمات (WER) للإنجليزية عند 1.23. أما LongCat-Audio-DiT فيكتسحه كليًا في خمس من ست خلايا — 1.50 في WER و78.6 في التشابه للإنجليزية، و81.8 في التشابه للصينية، و6.04 في CER و79.7 في التشابه للصينية الصعبة. لكن ما يميز VoxCPM2 فعلًا هو التوازن: فهو أحد الأنظمة القليلة جدًا التي تجمع في الوقت نفسه بين القرب من القمة في التشابه ومستوى محترم في الوضوح، وهو الوحيد في تلك القائمة الذي يدعم أيضًا تصميم الصوت باللغة الطبيعية. ولكن "الأفضل على الإطلاق" ليس ما يعرضه جدوله الرئيسي، والتقييم الصادق هو أنه نظام عام قوي، وليس رائدًا في المعايير.
3.3 أضعاف المعاملات لم تُحقق أي وضوح يُذكر
الصف الأكثر فائدة في ذلك الجدول هو الذي لا يستشهد به أحد. VoxCPM-0.5B، الجيل الأول بحجم 0.6B من سبتمبر 2025، يسجل 1.85% WER للإنجليزية و0.93% CER للصينية. أما VoxCPM2، بحجم 2B، فيسجل 1.84% و0.97%. ضمن هامش الضوضاء في الإنجليزية، وأسوأ قليلاً في الصينية.
ما قدّمته المعلمات الإضافية فعليًا يظهر في عمودَي التشابه وليس في أي مكان آخر: ارتفعت درجة SIM للإنجليزية من 72.9 إلى 75.3، وللصينية من 77.2 إلى 79.5. كل ما عدا ذلك مما اشتراه نموذج {{1}}2B{{/1}} خارج هذا المعيار تمامًا — 28 لغة إضافية، وتصميم صوت من وصف نصي، واستنساخ قابل للتحكم في أسلوبه، ومخرجات بتردد 48 كيلوهرتز. هذا كثير، وهو المبرر الصادق للترقية. لكن إذا كانت مهمتك هي استنساخ الإنجليزية أو الصينية وكنت تختار بناءً على معدل الخطأ، فإن {{3}}VoxCPM2{{/3}} لا يمنحك شيئًا لم يمنحك إياه نموذج {{4}}0.6B{{/4}} من قبل، بثلاثة أضعاف الأوزان وضعف زمن الاستجابة. والغريب أن {{2}}VoxCPM1.5{{/2}} هو الأسوأ بين الثلاثة على هذا المعيار (2.12 / 1.18)، مما يجعل تطوّر العائلة يبدو أقل شبهاً بالسُلّم وأكثر شبهاً بثلاثة منتجات مختلفة.
نموذج واحد، تقييمان، بينهما فارق مرتبة من الحجم
هنا يلزم توخي الحذر، لأن النتيجتين متعددتي اللغات في هذا التقرير تتعارضان تعارضًا شديدًا، وكلتاهما يُستشهد بها كما لو كانت تحسم المسألة.
العنوان الرئيسي هو {{1}}متوسط معدل خطأ يبلغ 1.68% عبر 30 لغة{{/1}}. هذا ناتج عن مجموعة اختبار {{2}}بنتها OpenBMB بنفسها{{/2}} — {{3}}500 جملة منطوقة لكل لغة{{/3}} — وتم تقييمها باستخدام Gemini 3.1 Flash Lite كمُعرِّفٍ للكلام. وفيها، تسجّل VoxCPM2 الإنجليزية {{4}}0.42، والصينية 0.92، والهندية 0.79، والعربية 1.23{{/4}}.
كما يشغّل التقرير أيضًا MiniMax-MLS-Test، وهي مجموعة اختبار خارجية من 24 لغة تم تقييمها باستخدام Whisper-large-v3. النموذج نفسه. هناك، يسجّل VoxCPM2 في الهندية 19.70 وفي العربية 13.05 — أي أسوأ بخمس وعشرين مرة وبعشر مرات على التوالي مما يقوله معياره الخاص، وذلك في لغات يدعمها رسميًا. وفي العمود نفسه أيضًا: الكانتونية 38.58، والتشيكية 24.13، والرومانية 21.58، والأوكرانية 6.32.
ثلاثة أمور توفّق بين معظم هذا، وهي جديرة بالفصل لأن النسخة المتداولة على نطاق واسع من هذه القصة تخطئ في فهمها:
• التشيكية والرومانية والأوكرانية ليست لغات مدعومة. تحقق من علامات اللغة الخاصة بالمستودع: 30 رمزًا، ولا يوجد بينها cs أو ro أو uk. انتقاد VoxCPM2 بسبب معدل خطأ 24% في اللغة التشيكية هو انتقاد له بسبب لغة لم يدّعِ دعمها أبدًا. اللغة الكانتونية تقع بشكل معقول ضمن "اللهجات الصينية التسع"، لكن كل نظام في ذلك العمود يتجاوز 30% فيها، مما يشير إلى المُعرِّف وليس إلى أيٍّ من النماذج.
• العربية والهندية مدعومتان، وهذه هي النتيجة الحقيقية.هاتان هما اللغتان اللتان تدّعي OpenBMB تغطيتهما، ويختلف تقييماه بفارق مرتبة من حيث الحجم. تفسير الورقة نفسه هو أن هذه اللغات لديها "حجم بيانات محدود نسبيًا" في مجموعة التدريب، وأن "جزءًا من ارتفاع WER قد ينبع من الدقة المحدودة للمتعرف." هذه فرضية عادلة وغير مختبرة. إذا كنت تقدم خدمة التعرف على الكلام بالعربية أو الهندية، فإن النطاق المنشور لهذا النموذج هو 0.79% إلى 19.70%، ولم يتم التحقق من أي من الطرفين بشكل مستقل. خصص يومًا لقياسك الخاص؛ لا تعتمد على أي من الرقمين.
• المقاييس ليست حتى بنفس الوحدة.تُقيَّم الهندية بمعدل خطأ الأحرف على المجموعة الداخلية ومعدل خطأ الكلمات على MiniMax-MLS. وهذه ليست كميات قابلة للمقارنة، وهو سبب إضافي لعدم اعتبار الفجوة البالغة 25 ضعفًا إدانة واضحة — وسبب إضافي لعدم قراءة متوسط 1.68% كدرجة قابلة للمقارنة المباشرة.
ينطبق نفس التحذير على الادعاء الأكثر اعتمادًا على الأرقام في تغطية هذا النموذج: وهو أن VoxCPM2 يتفوق على ElevenLabs في تشابه المتحدث، بنسبة 85.4% مقابل 61.3% في الإنجليزية، متفوقًا في 22 من أصل 24 لغة. هذا ما يقوله الجدول فعلًا. وهو أيضًا جدول تجمعه الورقة جزئيًا من نتائج سبق الإبلاغ عنها، وفيه يحتوي عمود وضوح الكلام لدى ElevenLabs على 73.94% WER للتايلاندية، و73.42% للفيتنامية، و16.03% للصينية. تلك ليست أرقام منتج تجاري يعمل؛ بل هي بصمة خلل في التقييم أو الإعدادات. الجدول المعطوب في عمود واحد لا يصبح موثوقًا في عمود آخر لمجرد أن النتيجة تخدم النموذج الذي تقرأ عنه.
خمسة أوضاع من نواة واحدة — والوصفة التي تحرّك أرقامك
الفكرة الأنظف في العمارة هي أن VoxCPM2 لا يملك نماذج أو رؤوسًا منفصلة لقدراته. جميع الأوضاع الخمسة تستخدم المعاملات نفسها مع ترتيب مختلف لتسلسل الإدخال، ولهذا السبب فإن نقطة فحص واحدة بحجم 2B تغطي ما يتطلب عادةً أسطولًا صغيرًا:
• التحويل الأساسي للنص إلى كلام — نصٌّ مُدخَل، وصوتٌ مُخرَج.
• تصميم الصوت — الوصف الموضوع بين قوسين يُضاف ببساطة إلى مقدمة النص، لذا فإن "(رجل متعب في منتصف العمر، أجشّ الصوت، يتحدث ببطء)" والسطر نفسه يمرّان عبر نفس نموذج اللغة دون أي وحدة إضافية. لا يوجد صوت مرجعي إطلاقًا.
• الاستنساخ المرجعي — مقطع مرجعي معزول يحدد هوية المتحدث، دون الحاجة إلى نص.
• الاستنساخ القابل للتحكم — مقطع مرجعي بالإضافة إلى وصف للأسلوب، بحيث يمكنك استنساخ صوت ثم تطلب منه أن يبدو متعجلًا أو مستمتعًا.
• الاستنساخ الاستمراري — مقطع مرجعي مقترن بنصّه، يُعامل كبادئة صوتية يُكملها النموذج، وهو الوضع الأعلى دقة.
ما دُفن في التقرير هو مقبض تتجاهله معظم المقالات، وهو الأكثر ترجيحًا لتغيير نتائجك. مسارا التكييف — المرجع المعزول وبادئة الاستمرار — يمكن استخدامهما بشكل منفصل أو معًا، وهما يتبادلان التأثير ضد بعضهما. في تجربة OpenBMB الخاصة، استخدامهما معًا يعطي أفضل تشابه للمتحدث على كل مجموعة فرعية. إسقاط بادئة الاستمرار وتمرير المرجع المعزول فقط يعطي أفضل وضوح على النص الصيني الصعب، بمعدل خطأ أحرف 6.85% مقابل 7.44%، مع التخلي عن حوالي خمس نقاط من التشابه. تفسير الورقة منطقي: بدون بادئة صوتية زمنية تثبّت العروض، يملك النموذج حرية أكبر في اختيار أسلوب أداء ينجو من النص الصعب.
إذن، الافتراضي شيء مُختار وليس سقفًا. فالعمل على مطابقة الصوت يتطلب المسارين معًا؛ أما النص الصعب أو غير العادي فيكتفي بالمرجع فقط. غير أن هناك نقطة صراحة: الأرقام المطلقة في جدول الاستئصال لا تتطابق مع الجدول الرئيسي للوصفة التي تذكر الورقة أنها استخدمتها طوال الوقت، وهذا في نسخة ما قبل النشر يُحتمل أن يكون خطأً في التدوين أكثر من كونه أمرًا مريبًا — لكنه السبب الثالث للتعامل مع كل رقم هنا بوصفه اتجاهًا للاختبار، لا قيمةً للاقتباس.
تصميم الصوت: أكثر طاعةً من كونه طبيعياً
تصميم الصوت هو الميزة التي تجعل هذا الإصدار مثيرًا للاهتمام وليس مجرد تحسين تدريجي، وهو المجال الذي تكشف فيه أرقام البائع نفسه عن مفاضلة حقيقية.
على منصة InstructTTSEval، يحقق VoxCPM2 درجة 84.2 في تحديد المعلمات الصوتية، و83.2 في التوجيهات الأسلوبية الوصفية، و71.4 في لعب الأدوار للغة الإنجليزية — وهذا الرقم الأخير هو الأفضل في الجدول، متقدمًا على Qwen3-TTS-1.7B-VD التي سجلت 68.4 وGemini-TTS-Pro التي سجلت 67.2. أما في اللغة الصينية فهو أضعف وينعكس الترتيب: 85.2 / 71.5 / 60.8، مقابل 89.0 / 90.1 / 75.5 لـ Gemini-TTS-Pro. لذا فإن أقوى ادعاء يمكن تقديمه هو أن VoxCPM2 يتصدر في لعب الأدوار بالإنجليزية، بينما يتخلف عن نظام حدودي مغلق تقريبًا في كل جوانب اتباع التعليمات الأخرى.
لجنة الاستماع البشرية — 50 مستمعًا، بتصميم عشوائي مزدوج التعمية، وفقًا للتقرير — تجعل الأمر أكثر حسمًا. في التوليد القابل للتحكّم، يسجّل VoxCPM2 4.50 في اتّباع التعليمات مقابل 4.41 لـ Qwen3-TTS-VD، ويخسر في الطبيعيّة (4.48 مقابل 4.61). وفي الاستنساخ صفري اللقطات العادي، يفوز في تشابه المتحدّث (4.74 مقابل 4.69)، ويتعادل أو يتخلّف في الطبيعيّة (4.78 مقابل 4.80 لـ Qwen3-TTS، مع تداخل فترات الثقة).
النمط ثابت بما يكفي للتخطيط بناءً عليه: VoxCPM2 ينفّذ ما تطلبه منه، ويبدو صوته أقل بشريةً قليلًا أثناء ذلك، بينما يبدو صوت Qwen3-TTS أفضل قليلًا لكنه يتبع التعليمات بدقّة أقل قليلًا. أيّهما هو الصحيح يعتمد كليًا على ما إذا كانت قيمة منتجك تكمن في التحكّم الدقيق أم في الأداء السلس. تُشير OpenBMB بنفسها إلى النتيجة الطبيعيّة في قائمة القيود، وهذا من النوع الذي عادةً ما تتجاهله الشركات المورّدة: تصميم الصوت والاستنساخ القابل للتحكّم "قد يُنتجان نتائج متفاوتة بين عمليات التشغيل"، وقد يتطلّب الحصول على الصوت الذي تريده عدة محاولات. أضِف آلية إعادة محاولة إلى خط الإنتاج، وإذا كان الصوت مهمًّا، أضِف بوابة استماع بشري.
ما تكلفة تشغيله، ومتى يكون الاستئجار هو القرار الصحيح
لا توجد نسخة مستضافة من VoxCPM2 في أي مكان. الشريط الجانبي الخاص بـ Hugging Face يوضح ذلك بصراحة — "هذا النموذج غير منشور بواسطة أي مزوّد استدلال" — وهذا يشملنا نحن أيضًا: OrcaRouter لا يخدم VoxCPM2، ومهما بلغت الرغبة، فلن يغيّر ذلك حقيقة أن نموذج TTS بحجم 2B بدون شريك استدلال هو إمّا أوزان تستضيفها بنفسك أو لا شيء.
مما يجعل مسألة التكلفة مسألة GPU، والحساب واضح. عند معامل الوقت الفعلي لـ Nano-vLLM البالغ 0.13 على بطاقة RTX 4090 واحدة، فإن ساعة GPU واحدة تنتج حوالي 7.7 ساعات من الصوت، لذا تكلفتك لكل ساعة صوت هي سعر الساعة لبطاقة 24 جيجابايت مقسومًا على حوالي 7.7. في PyTorch العادي عند RTF 0.30، ينخفض ذلك إلى حوالي 3.3 ساعات صوت لكل ساعة GPU. كلا الرقمين من OpenBMB، تم قياسهما على أجهزتهم ونصوصهم، وكلاهما سيختلف على أجهزتك — حجم الدفعة، وصعوبة النص، وعدد مرات إعادة المحاولة التي تفرضها بوابة الجودة الخاصة بك هي جميعها عوامل مضاعفة لا يتضمنها رقم RTF. معدل إعادة المحاولة هو ما ينساه الناس: النموذج الذي يخبرك البائع أنه قد يحتاج إلى عدة محاولات للوصول إلى الصوت المستهدف لا يكلف ما يوحي به RTF.

المقارنة التي يريدها الناس في هذه المرحلة هي مع واجهة برمجة تطبيقات مستأجرة، والإجابة الصادقة هي أنه لا يمكن التحويل بين الاثنين بشكل دقيق. openai/tts-1-hd يُفوتر بمبلغ 30.00 دولارًا لكل مليون توكن واردة وصادرة — وهذا هو سعر القائمة لدى المزود الذي يمر مباشرة عبر OrcaRouter، إذ لا نضيف أي هامش ربح، لذا فإن الرقم في صفحة نموذجنا هو الرقم الذي تفرضه OpenAI. لكن التوكنات ليست ثوانٍ، ولا يوجد سعر منشور يحوّل أحدهما إلى الآخر بشكل موثوق بما يكفي لبناء جدول بيانات عليه. أي شخص يعرض عليك مقارنة نظيفة لكل ساعة بين نموذج TTS مفتوح الأوزان مستضاف ذاتيًا وواجهة برمجة تطبيقات تُفوتر بالتوكنات، فقد افترض افتراضًا لم يكشفه لك.
{{1}}ما الجدير بالذكر هو موضع الخط الفاصل من الناحية المعمارية{{/1}}. الاستضافة الذاتية لنموذج VoxCPM2 منطقية عندما تحتاج إلى صوت مستنسخ بعينه، وعندما يكون حجم العمل الصوتي ثابتًا بما يكفي لإبقاء GPU مشغولة، وعندما لا يمكن للبيانات مغادرة بنيتك التحتية، أو عندما تنوي ضبطه بدقة عبر LoRA — وهو يدعم ذلك باستخدام 5 إلى 10 دقائق من الصوت المستهدف، وهذا {{2}}رخيص حقًا{{/2}}. أما الاستئجار فمنطقي عندما يكون الحجم متقطعًا، أو عندما لا يتوفر لديك طاقم لتشغيل GPU، أو عندما يكون الصوت قابلاً للاستبدال. معظم منتجات الصوت الحقيقية عبارة عن نظامين وليس نظامًا واحدًا: طبقة توليف ونموذج لغوي يقوم بالاستدلال الذهني. النصف الخاص بالاستدلال هو الجزء الذي يستحق وضعه خلف مفتاح واحد مع {{3}}التبديل التلقائي عند الفشل بين المزودين{{/3}}، بحيث يصبح استبدال النموذج مجرد تغيير سلسلة نصية وليس دورة شراء؛ وهذا هو الشكل الذي صُمم من أجله OrcaRouter، عبر أكثر من 200 نموذج. أما نصف التوليف، عندما يكون صوتًا محددًا تملكه وتضبطه بدقة، فهو ينتمي إلى عتادك الخاص. {{4}}VoxCPM2 يقع تمامًا في تلك الفئة الثانية{{/4}}، و{{5}}حقيقة أن لا أحد يقدمه هي نتيجة لطبيعته وليست إغفالًا{{/5}}.
ما الذي يخبرك به OpenBMB ألا تتوقعه
قسم القيود صريح بشكل غير معتاد بالنسبة لإصدار يتمتع بهذا الزخم، وهو قصير بما يكفي ليُؤخذ على محمل الجد:
• جودة الاستنساخ سطح لإساءة الاستخدام. البطاقة تقول ذلك مباشرة: النموذج ينتج كلامًا واقعيًا بما يكفي لانتحال الشخصية والاحتيال، ويجب وضع علامات على الصوت المُنتَج بالذكاء الاصطناعي. رخصة Apache-2.0 لا تفرض أي قيد على هذا مطلقًا — على عكس تراخيص عدة نماذج صوتية منافسة مفتوحة الأوزان، لا يوجد بند استخدام مقبول يمكن الاحتماء به. سياسة الموافقة والإفصاح هي مسؤوليتك أنت لكتابتها.
• التباين من تشغيل لآخر متوقع على ميزتي التحكم، وليس خطأً يجب تسجيله.
• اللغات الثلاثون هي حدٌّ حقيقي. أي شيء خارجها قد يعمل لكنه غير مُختبَر؛ توقع ضبطًا دقيقًا.
• يُوصف تناسُق التحكم في الأسلوب بأنه لا يزال قيد التطوير من قِبل الذين بنوه.
والفجوات التي لا تذكرها البطاقة: لا يوجد أي إفصاح عن مجموعة بيانات التدريب إطلاقًا، لذا فإن ترخيص Apache-2.0 على الأوزان يحسم مسألة الكود ولا يقول شيئًا عن مصدر البيانات. لا يوجد تقييم مستقل لأي رقم في هذا المقال. لا يوجد زمن استجابة منشور بالمللي ثانية — إن معامل الوقت الفعلي (RTF) هو نسبة إنتاجية، والوكيل الصوتي ينجو أو يموت على قياس الوقت حتى أول صوت، وهو ما لا يظهر في أي مكان في التقرير.
ثلاثة أسئلة لا تحسمها بطاقة النموذج
هل يجب أن أترك VoxCPM1.5 أو VoxCPM-0.5B؟
فقط للقدرات الجديدة، وفقط بعد القياس. إذا كنت بحاجة إلى لغات تتجاوز الصينية والإنجليزية، أو تصميم صوت، أو استنساخ يمكن التحكم في أسلوبه، فإن الترقية هي جوهر الأمر ولا يوجد بديل ضمن العائلة. إذا كنت تستخدم اليوم استنساخًا بالإنجليزية أو الصينية وكنت راضيًا، فإن الحجة واهية على وجهها: نفس المعيار يُظهر أن VoxCPM-0.5B يضاهي VoxCPM2 في معدل الخطأ، وستدفع ضعف زمن الاستجابة وثلثًا إضافيًا من VRAM مقابل حوالي 2.4 نقطة من تشابه المتحدث. هناك أيضًا تفصيل ترحيل يسهل تفويته — إذا كنت تُغذي VoxCPM1.5 بمرجع صوتي بتردد 44.1 كيلوهرتز، فإن مشفر VoxCPM2 يستقبل 16 كيلوهرتز، لذا يتغير مسار المرجع لديك ويتوقف الجزء العلوي من مادة المصدر عن الأهمية.
هل يمكنني بالفعل إطلاق منتج صوتي تجاري باستخدام هذا؟
قانونيًا، الترخيص من بين أكثر التراخيص تساهلًا: Apache-2.0، بدون بوابة، بدون قيود استخدام، الاستخدام التجاري مسموح به صراحةً، وكل من الأوزان ورمز الضبط الدقيق مشمولان. السؤال المفتوح ليس نص الترخيص بل ما ينقص خلفه. لا تذكر OpenBMB أي مجموعة تدريب، مما يعني أنه لا يمكن لأحد أن يخبرك بأصوات من ضمن المليوني ساعة. بالنسبة لنموذج ميزته الرئيسية هي إعادة إنتاج صوت شخص معين، فهذا سؤال لمستشارك القانوني وليس لبطاقة النموذج — وهو نفس السؤال الذي يتجاهله حاليًا كل نموذج صوتي مفتوح الأوزان. عمليًا، العوائق الأصعب تشغيلية: لا توجد فئة Transformers أصلية بعد، ولا نقطة نهاية مستضافة في أي مكان، وتباين من تشغيل إلى آخر في ميزات التحكم، ولا مؤشر زمني حتى أول صوت إذا كنت تبني أي شيء للمحادثة.
هل هو جيد بما يكفي لاستبدال مزود خدمة تحويل النص إلى كلام المدفوع؟
بالنسبة للسرد بالإنجليزية والصينية، والمحتوى المسجَّل مسبقًا، وأي عبء عمل تتحكم فيه بصوت محدد ويمكن تجميع العمل دفعة واحدة: نعم، بناءً على الأدلة المتاحة، والترخيص يجعل تجربته شبه مجانية. أما بالنسبة لوكلاء المحادثة في الوقت الفعلي: قِس زمن الوصول إلى أول صوت بنفسك قبل الالتزام، إذ لم ينشره أحد ولن يخبرك به معدل الوقت الفعلي (RTF). وبالنسبة للعربية أو الهندية أو أي لغة في الذيل الطويل: فإن تقييمي البائع نفسه يختلفان بفارق عشرة أضعاف، لذا تعامل مع النموذج باعتباره غير مُثبت هناك بغض النظر عن الرقم الذي رأيته منقولًا. وبالنسبة لأي شيء يكون فيه الخطأ في النطق حادثًا تجاريًا لا مجرد إزعاج، لاحظ أن VoxCPM2 ليس الرائد في الوضوح حتى في جدوله الخاص — فـ Fish Audio S2 وLongCat-Audio-DiT يتقدمان عليه هناك، وهما أيضًا بأوزان مفتوحة.
ماذا تشاهد
شيئان، على جداول زمنية مختلفة. الأقرب هو PR #47756 وPR MiniCPM4 الذي تحته. إذا تم دمجهما، يصبح VoxCPM2 AutoModel استدعاءً وتنخفض تكلفة التكامل لمن يعتمدون على Transformers إلى ما يقرب من العدم بين عشية وضحاها — وبالنظر إلى أن 900,282 عملية تنزيل شهريًا تحدث بالفعل بالطريقة الصعبة، فهذا تمكين ذو معنى. وإذا توقفا، يظل الحل لتلك الفرق هو "استخدام حزمة OpenBMB أو نقطة نهاية vLLM-Omni"، ولا يملك المساهم المجتمعي الذي يحمل كلا PR أي نفوذ لتغيير ذلك.
الأبطأ هو ما إذا كان أي شخص خارج OpenBMB سينشر رقمًا على الإطلاق. بعد أربعة أشهر من الإصدار، مع 900,000 تحميل شهري، و25 عملية ضبط دقيق، وأكثر من 100 مساحة Spaces مبنية عليه، لا يزال كل رقم أداء متداول يعود إلى تقرير فني واحد كتبه الأشخاص الذين درّبوا النموذج. هذا ليس انتقاصًا من OpenBMB، الذين وثقوا عملهم بدقة وصدق أكثر من معظم الجهات — فالتقرير يبوح بخيارات جهاز التعرّف، ونقاط ضعف حجم البيانات، وعدم استقراره الخاص. إنه انتقاص من بقيتنا. أكثر شيء قيّم يمكن لأي شخص في مجتمع الكلام مفتوح المصدر أن ينشره هذا الشهر هو تشغيل VoxCPM2 وQwen3-TTS وFish Audio S2 وLongCat-Audio-DiT مع تقييم Seed-TTS-Eval وMiniMax-MLS بنتيجة Whisper، وتحت ظروف متطابقة. وحتى يوجد ذلك، فإن الملخص العادل لـVoxCPM2 هو أنه أقوى نموذج صوتي بأوزان مفتوحة لكل نقطة تفتيش تم إصداره على الإطلاق، وأنه ليس الأكثر دقة، وأن كلا شطري هذه الجملة يستندان إلى كلمة البائع.
