
NVIDIA NemotronLabs VoiceChat 11B: نموذج الصوت ثنائي الاتجاه الكامل الذي أصدرته NVIDIA دون الإعلان عنه
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
بطاقتا نموذج متعارضتان داخل مستودع Hugging Face نفسه. البطاقة التي تُعرض على الصفحة تُسمّي النموذج NVIDIA NemotronLabs VoiceChat 11B، وتذكر أن تاريخ إصداره 3 أغسطس 2026، وتُدرج 11B معلمة. أما الثانية، وهي ملف باسم overview.md لا يراه أحد ما لم يفتح تبويب الملفات، وتُسمّي النموذج نفسه 12B، وتؤرخ الإصدار في 16 يوليو، وتتضمن قسمًا للمعايير لا تتضمنه البطاقة العامة، وما تزال كلمة TODO موجودة في المكان المخصص لوصف النتائج. ولم تُرفق أي من البطاقتين بمنشور إطلاق أو بيان صحفي أو تقرير تقني أو تغريدة من NVIDIA.
لكن ما بداخله ليس عنصرًا نائبًا. إنه نقطة فحص بحجم 44 GB تسمع وتتحدث في الوقت نفسه: مكدس واحد يأخذ صوت الميكروفون ويُخرج الكلام المُصنَّع، دون المرور المعتاد بالتعرف على الكلام إلى نموذج اللغة ثم إلى تحويل النص إلى كلام. وهو مبني على Nemotron Nano 9B v2 كأساس، ويمكنه استدعاء الأدوات في منتصف الجملة بينما يواصل الحديث، وتدّعي NVIDIA أنه أول نموذج مفتوح كامل الازدواج يمكنه فعل ذلك.
كل ما يلي يُقرأ مباشرة من ذلك المستودع — البطاقتان، config.json، وفهرس الموتر داخل ملف الأوزان، الذي حللناه بأنفسنا لحسم مسألة 11B مقابل 12B. كل رقم أداء تنشره NVIDIA لهذا النموذج هو رقم NVIDIA الخاص، قاسته NVIDIA، ولم يُعاد إنتاجه. يوجد في العلن قياس مستقل واحد بالضبط لهذه السلالة، من Artificial Analysis، وهو مُدرَج تحت اسم مختلف وعدد معلمات مختلف — وهذا يتبين أنه أكثر ما يثير الاهتمام في هذا الإصدار.
ما هو موجود فعليًا في المستودع
تم إنشاء المستودع في 29 يوليو 2026، وتم آخر تعديل عليه في 4 أغسطس. يحتوي على سبعة عشر ملفًا: بطاقتا النموذج المتنافستان، وترخيص، و config.json، وملف 44.4 غيغابايت model.safetensors، ومخطط معماري، ودليل مُرمِّز RNN-T، وأربع مذكرات سياسات قصيرة حول الانحياز والسلامة والخصوصية وقابلية التفسير، وثلاثة .wav ملفات — عرض لتبادل الأدوار، وعرض للمقاطعة الصوتية، وعرض لاستدعاء الأدوات — مدمجة كمشغلات صوتية في أعلى البطاقة بحيث تسمع النموذج قبل أن تقرأ عنه.
عدة أشياء مفقودة، وهي أهم من قائمة الملفات.
• لا توجد ورقة بحثية لهذا النموذج. تستشهد البطاقة بخمسة مراجع: VoiceBench وFull-Duplex-Bench 1.0 وFull-Duplex-Bench v3 وSALM-Duplex وAudio Flamingo 3، بالإضافة إلى الطبعة الأولية الخاصة بـ NVIDIA باسم PersonaPlex. لا يعد أيٌّ منها تقريرًا فنيًا من NemotronLabs VoiceChat. تُوصف البنية المعمارية في حوالي ثلاث فقرات ومخطط بياني، وهذا هو كل ما طُرح علنًا حول كيفية بنائه.
• لا توجد طريقة لاستدعائه. توضح صفحة Hugging Face بوضوح أن النموذج «لا يتم نشره بواسطة أي موفر استدلال». لا توجد نقطة نهاية مستضافة، سواء من NVIDIA أو من أي شخص آخر. الموضوع الوحيد المفتوح في مجتمع المستخدمين على المستودع هو مستخدم يطلب من NVIDIA إضافة handler.py حتى يمكن نشر نقطة التحقق على Hugging Face Inference Endpoints — شخص حاول تشغيله بالطريقة السهلة ولم يجد واحدًا.
• لا يوجد pipeline_tag ولا library_name. لهذا السبب لا تحتوي الصفحة على أداة استدلال ولا على تسمية مهمة، وهذه علامة على المشكلة الأعمق: config.json ليس إعداد Transformers. إنه إعداد NeMo للتدريب بحجم 32 كيلوبايت، يشتمل على كتلة AdamW، وجدولة معدل التعلم، وصناديق تجميع محمّل البيانات، وتقسيم التحقق. لا يمكنك توجيه AutoModel.from_pretrained إلى هذا. تستنسخ فرعًا معينًا من مستودع NVIDIA للكلام — nemotron-labs-voicechat — وتبني بيئة conda مثبّتة على Python 3.12 وPyTorch 2.10 وTransformers 4.56، وتُجمّع causal-conv1d وmamba-ssm دون عزل البناء، ثم تشغّل البرنامج النصي الخاص بهم.
يعكس عداد التنزيل كل ذلك. إن 107 إعجابات مقابل 80 تنزيلًا في الشهر الأول للنموذج هي بصمة إصدار قام الناس بوضع إشارة مرجعية عليه دون تشغيله.

قمنا بعدّ المعاملات، و11B يفوز
يحمل ملف safetensors ترويسة JSON تسرد كل موتر وشكله ونوع بياناته، لذا فإن عدد المعلمات ليس مسألة رأي. سحبنا الترويسة وجمعناها: 11,095 مليون معلمة عبر 1,626 موترًا من نوع float32، تشغل 44.38 جيجابايت. لذا فإن البطاقة المعروضة صحيحة وoverview.md قديم — هذا نموذج بحجم 11B، ورقم 12B هو بقايا.
توضح شجرة نماذج Hugging Face من أين يمكن أن يكون قد تسلل نموذج 12B. السلالة التي ترسمها تسير عبر {{1}}Nemotron Nano 12B v2 Base{{/1}}، ثم {{2}}Nemotron Nano 12B v2{{/2}}، ثم {{3}}Nemotron Nano 9B v2{{/3}}، وفقط بعد ذلك يأتي هذا النموذج. تحتوي عائلة النصوص الأساسية الخاصة بـ NVIDIA على كل من 12B و9B، حيث أن 9B هو سليل مقلّم من 12B، وVoiceChat مبني على 9B. بطاقة نموذج صيغت في وقت سابق من تلك السلسلة كانت ستحمل بطبيعة الحال الرقم الأكبر.
كما تنقسم الترويسة بوضوح على طول نصفي البنية:
• جانب الفهم — 10.098B. من ذلك، 7.714B هي حزمة محولات Nemotron Nano v2، و0.609B هي مُرمِّز الكلام، وثلاث مصفوفات منفصلة بحجم 131,072 × 4,480 تشغل كل منها 0.587B.
• جانب التحدث — 0.997B. العمود الفقري لتحويل النص إلى كلام من 28 طبقة وعرض 1,152 وبحجم 0.595B، ورأس إخراج بخليط غاوسي بحجم 0.159B، وكودك صوتي عصبي يبلغ حجم مُرمِّزه ومُفكِّك تشفيره 0.092B لكلٍّ منهما.
نتيجتان عمليتان تترتبان على نوع البيانات (dtype). الأولى أن تنزيل 44 غيغابايت ليس نموذجًا كبيرًا، بل هو نموذج عادي مُصدَّر بصيغة float32؛ وإذا حوّلته إلى bfloat16 فستكون الأوزان حوالي 22 غيغابايت. والثانية أن الحد الأدنى الذي أعلنته NVIDIA وهو 80 غيغابايت لوحدة معالجة الرسوميات هو نتيجة لذلك الاختيار وليس لحجم النموذج، وأي شخص يملك بطاقة بسعة 48 غيغابايت ومستعدًا لتحويل نقطة التفتيش (checkpoint) بنفسه ليس مستبعدًا بشكل واضح — لكن لا أحد نشر تشغيلًا مؤكدًا بهذه المساحة، فتعامل معها كعملية حسابية لا كوعد.
كيف يستمع ويتحدث في نفس الوقت
"Full duplex" هو جوهر هذا الإصدار، ويُظهر الإعداد كيف يتم الحصول عليه. ثلاثة خيارات تصميمية تقوم بالمهمة.
• لا يمكن لمرمّز الكلام أن ينظر إلى الأمام. إنه نموذج Conformer من 24 طبقة و8 رؤوس، وسياق انتباهه مضبوط على [70, 0] — سبعون إطارًا من السياق الأيسر وصفر إطارًا من السياق الأيمن. المتعرّف التقليدي يطلع على الصوت بعد اللحظة الحالية لإزالة الغموض عما سمعه للتو؛ أمّا هذا المرمّز فيمنع من فعل ذلك، مما يكلّفه الدقة ويمنحه القدرة على إصدار قرار فور وصول إطار.
• كل شيء مكمم إلى 80 مللي ثانية. طول الإطار في الإعداد هو 0.08 ثانية، وهو ما يطابق حجم المقطع البالغ 80 مللي ثانية الذي وصفته NVIDIA في أماكن أخرى لهذا الخط من العمل. يتخذ النموذج قرارًا كل 80 مللي ثانية بشأن مواصلة الاستماع أو بدء التحدث. هذا الإيقاع هو ما يجعل الاقتحام يبدو فوريًا وليس مجرد مهذب.
• استدعاءات الأدوات تخرج من فمه. تذكّر تلك المصفوفات الثلاث المتماثلة الشكل، التي تحتوي كلٌّ منها على 131,072 مفردة. إحداها هي تضمين المُدخلات، وأخرى هي رأس نموذج اللغة العادي — والثالثة تُدعى function_head. إن «قناة الإخراج المنفصلة لاستدعاءات الأدوات» المذكورة في نص البطاقة هي إسقاط إخراج ثالث فعلي، بعرض 587 مليون معامل، يعمل بالتوازي مع توليد الكلام. وهذا هو السبب المعماري الذي يجعل النموذج قادرًا على إرسال استدعاء أداة دون إيقاف المحادثة، وهو التزام تصميمي حقيقي وليس مجرد اصطلاح تعليمات.
في مرحلة لاحقة من خط المعالجة، يتنبأ مفكك الترميز في نظام تحويل النص إلى كلام برموز لبرنامج ترميز (كودك) قائم على التكميم المتجهي المتبقي، بعدد 31 مكمّمًا ومعدلات اختزال تبلغ 7 و7 و9 — أي اختزال بعامل 441× يجعل معدل رموز الصوت عند 50 إطارًا في الثانية، مع إخراج بتردد 22.05 كيلوهرتز. أما الإدخال فبتردد 16 كيلوهرتز. يوجد أيضًا في نقطة التحقق (checkpoint) مفكك ترميز RNN-T وشبكة مشتركة (joint network)؛ ولهذا السبب تشمل المخرجات المعلنة للنموذج نسخة نصية من كلام المستخدم إلى جانب النص والصوت الخاصين بالنموذج: النسخة النصية هي رأس تعرّف حقيقي، وليست ناتجًا ثانويًا. الصوت الافتراضي اسمه Aria، ومقطع مرجعي مدته ثلاث ثوانٍ يضبط خصائص المتحدث.
تفصيل إضافي من الإعدادات يستحق الإشارة إليه لأنه يؤكد قيدًا مذكورًا: محمّل بيانات التدريب يضع حدًا أقصى للعبارات عند 142.39 ثانية. تحذير البطاقة بأن النموذج لا يحتفظ بسياق صوتي يتجاوز دقيقتين واضح في خط أنابيب البيانات الذي أنتجه.
النتائج، ومن الذي قام بقياسها فعليًا
ادعاءات NVIDIA الرئيسية هي زمن الاستجابة والترتيب. في Full-Duplex-Bench 1.0، تبلغ عن 448 مللي ثانية لاتخاذ دور سلس و480 مللي ثانية للتنازل عند المقاطعة، مع معدل استحواذ يبلغ 0.82 في تبادل الأدوار السلس و1.0 في مقاطعة المستخدم، ودرجة حكم GPT-4o تبلغ 4.33 في التعامل مع المقاطعات. وتدعي المركز الثاني بين النماذج مفتوحة المصدر للازدواج الكامل على VoiceBench والمركز الثاني بين النماذج مفتوحة المصدر على Full-Duplex-Bench. كل هذه النتائج من تشغيلات NVIDIA الخاصة.
اصطفهم بمحاذاة العالم الخارجي وتنفتح فجوتان.
• فيما يتعلق بالاستدلال الكلامي، رقم المورّد أعلى بحوالي ثماني نقاط. الملف غير المعروض overview.md يبلغ 37.0% في Big Bench Audio. قامت Artificial Analysis بقياس هذه السلالة بشكل مستقل عند 29.2%. نفس المعيار، نفس العائلة، فجوة كبيرة بما يكفي لتغيير مكانة النموذج في الترتيب.
• في VoiceBench، رقم المورّد متواضع جدًا. تدّعي البطاقة أنها في المركز الثاني بين النماذج مفتوحة المصدر ذات الازدواج الكامل؛ وتُظهر لوحة متصدرات VoiceBench العامة هذا النموذج عند 58.10، وهو الأعلى في فئة النماذج مفتوحة المصدر ذات الازدواج الكامل، متقدمًا على Freeze-Omni عند 55.20 وMoshi عند 29.51. وتشير بطاقة NVIDIA الأولية إلى 55.1 لنفسها — وهو أقل من الرقم المدرج حاليًا في اللوحة.
هناك شذوذ أصغر أيضًا: جدول المقارنة الخاص بـ NVIDIA يقيّم منافسيه بشكل أكثر كرمًا مما تفعله Artificial Analysis. تضع البطاقة المسودة Freeze-Omni عند 33.4% وPersonaPlex 7B عند 19.1% على Big Bench Audio؛ بينما تقيس Artificial Analysis 33.9% و12.6%. ترتيب الأقران يبقى كما هو في كلتا الحالتين، وهو أمر مطمئن، لكنه تذكير بأن بيئة اختبار البائع وبيئة الاختبار المستقلة لا تعيدان نفس الأرقام حتى بالنسبة لأطراف ثالثة.

الرسم البياني يجعل العنوان الصريح أمرًا لا مفر منه. بين النماذج مفتوحة المصدر ذات الازدواج الكامل، تُعد هذه خطوة حقيقية إلى الأمام — إذ تضاعف أداء PersonaPlex في الاستدلال المنطقي من الكلام بأكثر من الضعف، وتترك Moshi في فئة مختلفة تمامًا. وبالمقارنة مع ما يمكنك شراؤه، فهي بعيدة كل البعد: Step-Audio R1.1 بنسبة 96%، وVoice Agent من Grok 4.5 وGemini 2.5 Flash (Thinking) بنسبة 92%، وNova 2.0 Sonic بنسبة 87%. أي بفجوة تبلغ نحو ثلاثة إلى واحد في الاستدلال من المدخلات المنطوقة.
أفضل طريقة لمعرفة تكلفة الازدواج الكامل حاليًا هي داخل كتالوج NVIDIA نفسه. في VoiceBench، حصل NVIDIA Nemotron 3 Nano Omni 30B A3B — وهو نموذج أكبر ليس بازدواج كامل — على 89.39، مقابل 58.10 لـ VoiceChat. نحو ثلاثين نقطة من جودة المساعد هو ثمن معالجة المقاطعة وتناوب الأدوار الأسرع من 500 مللي ثانية، على الأقل في هذا الجيل. إذا كان منتجك لا يحتاج إلى نموذج يمكن مقاطعته في منتصف الكلمة، فأنت تدفع الكثير مقابل ميزة لن تستخدمها.
استدعاء الأدوات هو العنوان الرئيسي، وأيضًا الجزء الأضعف.
"أول نموذج مزدوج الاتجاه مفتوح المصدر يدعم استدعاء الأدوات" هو الادعاء الذي يستند إليه الإصدار، والأرقام تحته متفاوتة. في تحويل منطوق لـ BFCL-v3، تبلغ NVIDIA عن متوسط 56.1%: 58.5% بسيط، 62.5% متعدد، 42.5% متوازٍ، 27.5% متوازٍ-متعدد، و89.6% في الرفض الصحيح للمكالمات غير ذات الصلة. أما على Full-Duplex-Bench v3، فإن الانقسام يكون أكثر حدة.
• اختيار الأداة — 82.5%. اختيار الدالة الصحيحة من القائمة، وهو ما تصفه NVIDIA بإنصاف بأنه منافس للنماذج المتطورة.
• دقة الوسيطات — 44.2%. ملء معاملات تلك الدالة بشكل صحيح بناءً على ما قاله المستخدم.
• Pass@1 — 33%. إتمام الاستدعاء بالكامل بشكل صحيح من المحاولة الأولى.
النموذج الذي يعرف الأداة التي يريدها بموثوقية أكبر بمقدار الثلثين مقارنةً بقدرته على ملء وسيطات الأداة، هو نموذج سيبحث بثقة عن الطقس لمدينة خاطئة. في وكيل نصي، يمكنك اكتشاف ذلك عبر طبقة تحقق وإعادة محاولة؛ أما في مكالمة صوتية مباشرة، فإن إعادة المحاولة مسموعة، وتشير البطاقة إلى أنه لا ينبغي للنموذج إعادة محاولة مكالمة فاشلة إطلاقًا — بل يُوجَّه لإخبار المستخدم أن هناك مشكلة في واجهة البرمجة.
القيود التشغيلية حوله صارمة، وتوردها NVIDIA دون تجميل: خمس أدوات كحد أقصى لكل جلسة قبل أن يتدهور الجودة، لا استدعاءات متزامنة موثوقة لأدوات متعددة، لا توجد طريقة للمستخدم للمقاطعة أثناء تنفيذ أداة، وميل في المحادثة المختلطة إلى الإجابة من معرفتها الخاصة بدلاً من استدعاء الأداة التي كان ينبغي عليها استدعاؤها. استجابات الأدوات الطويلة توقف الوكيل، وهذا هو ما توجد ميزة "رسالة الانتظار" لإخفائه — حيث تكتب مسبقًا عبارة يقولها الوكيل لحظة تشغيل استدعاء، بحيث يكون للصمت ما يملؤه.
إحدى الغرائب التي ستُكلف شخصًا ما بعد ظهر كامل: يجب أن تكون مطالبات النظام واستجابات الأدوات ASCII فقط. لا شرطات طويلة، ولا علامات اقتباس منحنية، ولا رموز درجة، ولا رموز تعبيرية. يجب تسطيح مخرجات الأدوات إلى جمل ASCII بسيطة ومناسبة للنطق قبل وصولها إلى النموذج، مما يعني أنه لا يمكن تمرير استجابة API بصيغة JSON بشكل خام.
تكلفة تشغيله، والترخيص الذي يمنعك
ابدأ بالعتاد. توثيق فرع NVIDIA يطلب وحدة معالجة رسوميات بسعة ذاكرة لا تقل عن 80 جيجابايت، مما يشير إلى H100 أو H200، والإعداد المختبر هو H100 مع vLLM. تبلغ تكلفة سعة H100 عند الطلب حوالي 2–3 دولارًا للساعة عبر مزودي الخدمات السحابية الشائعين لوحدات معالجة الرسوميات، لذا فإن المثيل المستمر التشغيل يكلّف ما يقارب 1,500–2,200 دولارًا شهريًا قبل أن تكتب أي كود تطبيق، أو توظّف أحدًا لإبقائه يعمل، أو تخدم محادثة متزامنة ثانية.
الآن المقارنة. تعمل منصة Artificial Analysis على توحيد تسعير خدمات الكلام إلى الكلام المستضافة بحسب تكلفة الساعة الواحدة من الصوت المُدخل، ويتراوح النطاق الحالي من حوالي 1.42 دولارًا في الساعة عند الطرف الرخيص إلى 10.75 دولارًا في الساعة لأغلى فئة متميزة، مع خيار متوسط السوق حسن السمعة مثل Grok Voice Think Fast 2.0 بسعر 4.80 دولارًا في الساعة — أي ما يعادل 0.08 دولار لكل دقيقة صوتية.

اقرأ هاتين الفقرتين معًا وستجد أن حالة الاستضافة الذاتية أضعف مما تبدو. إن جهاز H100 المخصص لا يكون أرخص من نقطة نهاية مستضافة متوسطة السعر إلا إذا أبقته مشغولًا فعليًا، وهو أكثر تكلفة من الطرف الرخيص في سوق الاستضافة تقريبًا بغض النظر عن معدل الاستخدام — بينما تتحمل أيضًا أعباء الهندسة والمناوبة ونموذجًا يسجل 29.2% بينما تسجل الخيارات المستضافة 87–96%.
ثم هناك الجدار. الترخيص هو OpenMDW License Agreement v1.1، وتنص البطاقة في اقتباسها الخاص على أن النموذج "جاهز لأغراض البحث فقط." كود الفرع على GitHub هو Apache-2.0؛ الأوزان ليست كذلك. يمكنك تنزيل هذا ودراسته وضبطه وقياس أدائه والكتابة عنه. لا يمكنك وضعه أمام العملاء. لذلك فإن كل حجة اقتصادية أعلاه أكاديمية لشركة تحاول شحن منتج صوتي — لم يكن السؤال أبدًا ما إذا كانت حسابات GPU تعمل.
ولهذا السبب أيضًا سنقول الأمر الواضح بصراحة: NemotronLabs VoiceChat 11B لا يمكن الاتصال به عبر OrcaRouter، لأنه لا يمكن الاتصال به عبر أي شيء. ما يمنحك إياه المفتاح الواحد هو خط الأساس الذي ينبغي أن يُقاس عليه — النماذج الصوتية والسمعية المستضافة تقع خلف واجهة برمجة تطبيقات واحدة بهامش ربح 0%، أي أننا نمرر سعر القائمة الخاص بالمزود مباشرةً، فعندما يخفض المورّد سعر الصوت لديه، فإن الرقم الأقل هو ما تدفعه في ذلك اليوم وليس بعد دورة عقد. إذا كنت تسعّر وكيلًا صوتيًا، فإن رقم الدقيقة هذا هو الرقم الذي يجب أن يتفوق عليه معالج رسوميات بسعة 80 جيجابايت، ومن الجدير معرفته على وجه الدقة قبل أن تلتزم برفّ خوادم.
مشكلة الاسم: 11B، 12B، NemotronLabs، Nemotron 3
هنا أخطأت معظم التغطية المبكرة، لذا يجدر بنا توخي الحذر بشأن ما هو مُثبت وما هو غير مُثبت.
أربع من قنوات NVIDIA الخاصة تصف هذا العمل بثلاث تسميات مختلفة. تنشر Hugging Face نموذج "NVIDIA NemotronLabs VoiceChat 11B" بأوزان مفتوحة وترخيص للبحث فقط. وفي مارس 2026، وصفت مدونة مطوري NVIDIA نموذج "Nemotron 3 VoiceChat" بأنه نموذج كامل الازدواجية بمعاملات 12B في مرحلة وصول مبكر، يستهدف أقل من 300 مللي ثانية كزمن استجابة من البداية إلى النهاية على مقاطع بحجم 80 مللي ثانية، مع برنامج وصول مبكر يقدم حاويات مرجعية ونتائج معايير ومسارًا لضبط الدقة، ويعد بأوزان مفتوحة وقابلة للفحص للنشر في المؤسسات. وتضع كل من لوحة صدارة VoiceBench العامة وArtificial Analysis إدخالاتهما باسم "Nemotron 3 VoiceChat (V1)" بسعة 12B.
ما هو معروف: أوصاف البنية تتطابق مكوّنًا بمكوّن — مشفّر Fast Conformer، النواة الأساسية Nemotron Nano v2 9B، مفكّك تشفير النص إلى كلام من NVIDIA، قناة منفصلة لاستدعاء الأدوات، إطارات بمعدل 80 مللي ثانية، حزمة موحّدة واحدة. البطاقة غير المعروضة في مستودع Hugging Face تستخدم رقم 12B الذي تستخدمه الواجهات الأخرى. إنه نفس خط العمل، وإدخالات الأطراف الثالثة تقيس هذه العائلة بشكل شبه مؤكد.
ما هو غير مؤكد: أن نقطة التحقق التي يمكنك تنزيلها اليوم هي مطابقة تمامًا لما قيّمته Artificial Analysis وVoiceBench، أو ما يقدمه برنامج الوصول المبكر. ثمة تفصيلان يعارضان افتراض ذلك. تختلف أعداد المعاملات؛ إذ بلغ القياس 11.095 مليار بينما ورد 12 مليار في الملفات. وتختلف مستهدفات زمن الاستجابة اختلافًا حادًا؛ فالمدونة تَعِد المؤسسات بزمن استجابة أقل من 300 مللي ثانية من البداية إلى النهاية، بينما تسجّل البطاقة التي صدرت فعليًا 448 و480 مللي ثانية على Full-Duplex-Bench. قد تكون هذه نقاط قياس مختلفة على النموذج نفسه، أو نماذج مختلفة. لم تقل NVIDIA ذلك، لأن NVIDIA لم تقل أي شيء عن هذا الإصدار على الإطلاق.
الخلاصة العملية: إذا كنت تستشهد برقم لهذا النموذج، فاذكر أي سطح جاء منه. التغطية التي تنسب نسبة 29.2% من Artificial Analysis إلى بطاقة نموذج Hugging Face، أو نسبة 37.0% من NVIDIA إلى اختبار مستقل، دمجت شيئين تحتفظ بهما NVIDIA نفسها في مستندين منفصلين بعدد معلمات مختلف.
أين ينكسر
قسم القيود في بطاقة المسودة صريح بشكل غير معتاد، وفرع GitHub يضيف المزيد. تم الجمع:
• الإنجليزية فقط، ولا خارطة طريق متعددة اللغات في المستودع.
• ذاكرة دقيقتين. قد لا يتم الاحتفاظ بالمحادثة التي تتجاوز نافذة الصوت البالغة دقيقتين — حد أقصى صارم لمكالمات الدعم أو أي شيء يحتاج إلى تذكر ما تم الاتفاق عليه قبل أربع دقائق.
• أغبى من عموده الفقري. تصرّح NVIDIA بأن أداءه قد يكون أقل من Nemotron Nano 9B v2 في المعرفة واتباع التعليمات والأمان، لأنه تم ضبطه من أجل الطبيعية المحادثاتية. لم يُدرَّب صراحةً على الاستدلال أو المواءمة؛ يُشار إلى أن الاستدلال متعدد الخطوات والحساب ضعيفان.
• لا يوجد تواصل خلفي موثوق. إشارة "مم-هم" التي تدل على أن إنسانًا ما زال يستمع لا تتم معالجتها بشكل منهجي.
• سوف يقاطعك في منتصف الجملة.تسرد ملاحظات الفرع مقاطعة المستخدم عند توقّف مؤقت في منتصف الجملة، و"الاستمرار الجامح / الحديث الذاتي"، ضمن أنماط الفشل المعروفة — وهي التكلفة المباشرة لمشفر بلا سياق يميني إطلاقًا.
• غرف هادئة فقط. غير مناسب صراحةً للبيئات الصاخبة أو المترددة الصدى، خاصةً حيث يوجد حديث في الخلفية. وهذا يستبعد معظم قاعات مراكز الاتصال ومعظم السيارات.
من الذي يجب عليه فعليًا تنزيل هذا؟
الباحثون العاملون على نمذجة الكلام الثنائي يحصلون على الفائدة الأكبر هنا، وعليهم التحرك: نقطة بداية مفتوحة بحجم 11B مع قناة استدعاء أدوات تعمل، مدربة على حوالي 550,000 ساعة من الصوت المدمج الحقيقي والاصطناعي، هي أفضل بكثير من إعادة التنفيذ من ورقة SALM-Duplex. رخصة البحث ليست قيدًا على هذا العمل.
الفرق التي تبني وكلاء صوتيين يجب أن تقرأ البطاقة وتتخطى التنزيل. لن يغيّر بنيتك أي شيء تتعلمه من نقطة تفتيش float32 بحجم 44 جيجابايت لا يمكن شحنها، والدرس الصادق من المعايير هو أن الازدواج الكامل من طرف إلى طرف ليس منافسًا بعد لنموذج مستضاف جيد في الأمر الذي يلاحظه المستخدمون أكثر من غيره، وهو ما إذا كان المساعد قد فهمهم. في هذه الأثناء، الخطوة الحكيمة هي البناء على نقطة نهاية مستضافة وإبقاء التبديل رخيصًا — مفتاح واحد عبر أكثر من 200 نموذج مع التبديل التلقائي يعني أن حادث مزود الخدمة لا يُسقط خط هاتفك في منتصف المكالمة، ويعني أيضًا أن الانتقال لاحقًا إلى نموذج مفتوح بالازدواج الكامل هو تغيير إعدادات وليس إعادة كتابة.
الشركات التي تهتم بهذا الأمر تحديدًا يجب أن تتقدم للوصول المبكر إلى Nemotron 3 VoiceChat بدلاً من البناء على أوزان Hugging Face. فهذا البرنامج هو المكان الذي تتوفر فيه الرخصة القابلة للنشر والحاويات المرجعية وادعاء زمن الاستجابة الأقل من 300 مللي ثانية. أما النقطة المرجعية العامة فهي معاينة بحثية لنفس الفكرة، نُشرت دون الأعمال الورقية التي تسمح لك باستخدامها.
ثلاثة أسئلة سيستمر هذا المستودع في تلقيها
هل يمكنني استخدامه تجاريًا إذا قمت بضبطه بدقة شديدة؟ لا. إن OpenMDW v1.1 بالإضافة إلى بيان البطاقة "لأغراض البحث فقط" يحكم الأوزان وأي شيء مشتق منها؛ ترخيص Apache-2.0 على فرع GitHub يغطي كود الاستدلال وليس نقطة التحقق. الضبط الدقيق لا يغيّر الترخيص. إذا كانت الحقوق التجارية هي ما تحتاجه، فإن برنامج الوصول المبكر هو المسار الذي أعدته NVIDIA فعليًا لهذا الغرض.
هل هذا هو نفس النموذج الموجود في لوحات الصدارة؟ نفس العائلة، بشكل شبه مؤكد؛ لكن الأثر المطابق غير مؤكد. الإدخالات في لوحة الصدارة وArtificial Analysis مسجلة باسم "Nemotron 3 VoiceChat (V1)" بحجم 12B، بينما يبلغ حجم الملف القابل للتنزيل 11.095B، ولم تنشر NVIDIA أي شيء يوفق بينهما. استخدم أرقام لوحة الصدارة كأفضل قراءة مستقلة متاحة عن السلالة، وليس كقياس موثق للملف الموجود على Hugging Face.
هل سيعمل على بطاقة أصغر من 80 جيجابايت؟ ربما، بعد بعض العمل، ولم ينشر أحد إثباتًا. الأوزان بصيغة float32، لذا فإن التحويل إلى bfloat16 يجب أن يخفض حوالي 44 جيجابايت من المعاملات إلى حوالي 22 جيجابايت، مما يترك مساحة حقيقية على بطاقة 48 جيجابايت قبل احتساب ذاكرة التخزين المؤقت KV وبرنامج الترميز ومخازن البث المؤقتة. لكن المسار المدعوم هو vLLM على H100 بسعة 80 جيجابايت، وحاوية النشر مبنية لذلك، والتكوين الوحيد المختبر الذي تُبلغ عنه NVIDIA هو ذلك. خصص ميزانية للوقت، وليس فقط لذاكرة الفيديو.
ماذا تشاهد
ثلاثة أمور من شأنها أن تغيّر قراءة هذا الإصدار. تقرير تقني، أو حتى بطاقة مواصفات تتوقف عن مناقضة نفسها، من شأنها أن تخبرنا ما إذا كانت نقطة التحقق 11B هي الأثر الذي قاسته لوحات المتصدرين. إعادة إنتاج مستقلة لزمن الاستجابة — شخص من خارج NVIDIA يؤكد زمن تبادل الأدوار 448 مللي ثانية على أجهزته الخاصة — من شأنها أن تحوّل الادعاء الأكثر جاذبيةً في الإصدار من تسويق إلى حقيقة. ورخصة تجارية، أو نقطة وصول مستضافة من أي جهة، من شأنها أن تنقل هذا من فضولٍ هامشي مجاور للأوراق البحثية إلى خيار حقيقي للفرق الكثيرة التي ستستبدل عن طيب خاطر بعض جودة الاستدلال بوكيل صوتي يمكن مقاطعته.
حتى يتحقق أحد تلك الأمور، يظل الوصف الدقيق محدودًا لكنه جدير بالملاحظة حقًا: نشرت NVIDIA أقوى نقطة فحص صوتية مفتوحة كاملة الازدواجية تم قياسها حتى الآن، ومنحتها أول قناة فعّالة لاستدعاء الأدوات في هذه الفئة، ورخّصتها بحيث لا يستطيع أي شخص توزيعها، وامتنعت عن ذكر أن أيًّا من هذا قد حدث.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
