بطاقة عنوان رئيسية تحمل النص «GPT-Live-1 مقابل NVIDIA Nemotron VoiceChat 11B» مع عنوان فرعي «فاتورة بالدقيقة أم وحدة معالجة رسومات بسعة 80 GB» وسطر «0.05 دولار في الدقيقة مقابل مسرّع واحد بسعة 80 GB»، وفوق لوحتين: اللوحة اليسرى تُظهر مخططًا سحابيًا مع قرص عدّاد وأيقونة عملة معدنية، واللوحة اليمنى تُظهر لوحة مسرّع خادم مع أيقونة شريحة ووسم «80 GB VRAM»، مع شعار OrcaRouter مركّبًا في الزاوية.
Guides & Insights

GPT-Live-1 مقابل NVIDIA Nemotron VoiceChat 11B: فاتورة لكل دقيقة أم وحدة معالجة رسومات بسعة 80 جيجابايت

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الاختيار بين GPT-Live-1 وNVIDIA Nemotron VoiceChat 11B ليس اختيارًا بين نموذجين صوتيين، بل اختيار بين نموذجَي أعمال يتخذان من النماذج الصوتية زيًّا. GPT-Live-1 هو API مستضاف نقلته OpenAI إلى وصول المطورين في 10 سبتمبر 2026، ويُحتسب سعره عند 0.05 دولار لكل دقيقة صوت من دون أن ينطوي ذلك على أي عتاد يخصك. أما NVIDIA Nemotron VoiceChat 11B — المنشور باسم NVIDIA-NemotronLabs-VoiceChat-11B، مع حاوية NGC بتاريخ 21 يوليو 2026 ونقطة حفظ على Hugging Face إلى جانبه — فهو نموذج كلام مزدوج الاتجاه بالكامل، مفتوح الأوزان، وذو 11 مليار معامل، ولن يعمل على أي شيء أقل من وحدة معالجة رسومات بسعة 80 GB. أحدهما يكلفك مالًا عن كل دقيقة محادثة؛ والآخر يكلفك مالًا سواء اتصل أحد أم لم يتصل.

نقطة التعادل أبسط مما توحي به عروض المورّدين.

ابدأ بالرقم الوحيد الذي يتفق عليه الجانبان. GPT-Live-1 بسعر 0.05 دولار للدقيقة يعادل 3.00 دولارات لساعة من الخط المفتوح المتواصل. هذا هو سعر محادثة صوتية واحدة تعمل دائمًا.

الآن، قيّم تكلفة البديل. يحتاج Nemotron VoiceChat 11B إلى GPU بذاكرة VRAM لا تقل عن 80 GB — مثل A100 أو H100 أو H200 أو B100 أو B200 أو بطاقة من فئة RTX 6000، على Linux. استئجار أحدها في السوق المفتوحة يقع عند بضعة دولارات قليلة في الساعة، وتبلغ تكلفة امتلاك واحد بعد إطفائها رقمًا مشابهًا عندما تأخذ معدل الاستخدام في الحسبان. لذا فإن خط صوتي واحد يعمل دائمًا يكون متعادلًا تقريبًا: تكلفة GPU المستأجر تقارب تكلفة API، قبل أن تدفع مقابل أي شيء يعمل عليه.

تلك هي المقارنة الخاطئة، وهي المقارنة التي تتوقف عندها معظم الكتابات التي تقارن بين البناء والشراء. المقارنة الصحيحة هي لكل GPU، لا لكل سطر، وهي تتوقف على رقم لم تنشره NVIDIA.

• GPT-Live-1 على حساب من المستوى 1 — 25 جلسة متزامنة، أي 1.25 دولار في الدقيقة، أو 75 دولارًا في الساعة، عندما تكون جميع الخطوط الـ25 نشطة

• Nemotron VoiceChat 11B على GPU واحد بسعة 80 GB — بأي عدد من الجلسات المتزامنة يستوعبها نموذج هجين Mamba/Transformer بحجم 11B داخل 80 GB، وبتكلفة استئجار تعادل تقريبًا تكلفة تأجير البطاقة

نموذج 11B على مسرّع بسعة 80 GB يعني هامشاً كبيراً، كما أن 80 GB شرط يمنحك عملياً قدراً كبيراً من سعة المعالجة بالدفعات. إذا كانت بطاقة واحدة تحمل حتى ست محادثات متزامنة، فإن الاستضافة الذاتية أرخص بشكل كبير من الـ API عند الحمل الكامل. وإذا كانت تحمل محادثة ونصفاً، فهي ليست كذلك. وإلى أن يقيس أحدهم التزامن على حركة مرور حقيقية، فإن الموقف الصادق هو أن نقطة التعادل من المرجح أن تصبّ في مصلحة الاستضافة الذاتية عند الحجم الكبير، وأن أياً من المورّدين لم يمنحك الرقم الذي يثبت ذلك.

A two-column comparison scoreboard titled 'GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B - the scoreboard'. The GPT-Live-1 column lists Shape hosted API; Cost $0.05 / minute; Turn-taking 0.8 s, vendor-reported; Voices 12; Tool calling delegated to backend model; Ops burden none, vendor runs it. The Nemotron VoiceChat 11B column lists Shape open weights; Cost one 80 GB GPU, billed while idle; Turn-taking 448 ms on Full-Duplex-Bench 1.0; Voices 1 fixed voice, Aria; Tool calling in-session, separate output channel; Ops burden you run the GPU on Linux. A footer reads 'Nemotron turn-taking figure is a published benchmark; GPT-Live-1 latency is OpenAI's own and unreproduced.'

حيث يكون النموذج المفتوح أفضل حقًا، وليس مجرد أرخص

تستحق مقارنة زمن الاستجابة عناية أكبر من مقارنة السعر، لأن النموذج المفتوح يمتلك على هذا المحور أدلة أفضل.

• زمن انتقال تناوب الأدوار — يُبلّغ Nemotron VoiceChat 11B عن 448 مللي ثانية لتناوب الأدوار السلس على Full-Duplex-Bench 1.0، مع زمن انتقال للمقاطعة والتنازل قدره 480 مللي ثانية ومعدل استحواذ 1.00 عند مقاطعة المستخدم. أما رقم GPT-Live-1 فهو 0.8 ثانية، انخفاضًا من 1.4، وفقًا لما أبلغت عنه Ope​nAI.

اقرأ هذين الرقمين جنبًا إلى جنب مع مصدرهما المرفق، فتنقلب الصورة. أرقام NVIDIA مستمدة من مجموعة اختبارات معيارية منشورة ومحدَّدة علنًا. أما أرقام OpenAI فمصدرها OpenAI نفسها، إذ تقارن نموذجها الجديد بجيلها السابق، ولم يُعَد إنتاجها بشكل مستقل. وبناءً على الأدلة المتاحة، فإن النموذج مفتوح الأوزان أسرع بشكل قابل للقياس في الأمر الذي يجعل وكيل الصوت يبدو بشريًا، أما النموذج المُستضاف فأسرع فقط وفقًا لمواده الصحفية الخاصة.

تدّعي NVIDIA أيضًا أنها الأولى: يُوصف Nemotron VoiceChat 11B بأنه أول نموذج مفتوح ثنائي الاتجاه الكامل يدعم استدعاء الأدوات في الوقت الفعلي أثناء المحادثة، باستخدام قناة إخراج منفصلة وعبارات انتظار مُعدّة مسبقًا حتى يتمكن الوكيل من مواصلة الحديث بينما ينتظر واجهة API خارجية. وتأتي بطاقة النموذج مع ثلاثة عينات صوتية تدعوك للاستماع إلى ذلك تحديدًا — تبادل أدوار طبيعي يُوصف بأنه استجابة بنحو 450 مللي ثانية، ومقاطعة حيث يفسح النموذج المجال فورًا، وأدوات تُستدعى مباشرةً في منتصف المحادثة. هذه العينات من المورّد، وهي تؤيد رقم 448 مللي ثانية بدلًا من اختباره بشكل مستقل، لكنها على الأقل أدلة مسموعة مرفقة بنقطة تحقق قابلة للتنزيل وليست مجرد رقم في منشور إطلاق. تلك هي المشكلة المعمارية نفسها التي يحلها GPT-Live-1 عبر التفويض، لكن بإجابة مختلفة — النموذج المفتوح يحافظ على الخط بنفسه؛ أما النموذج المستضاف فيُسلّم المهمة إلى نموذج استدلال منفصل ويترك طبقة الصوت تُبقي المحادثة حية.

أوجه الشبه لا تقل إفادة عن أوجه الاختلاف. كلاهما يعملان في وضع الازدواج الكامل، أي أنهما يستمعان وهما يتحدثان بدلًا من تبادل الأدوار. كلاهما يدعم المقاطعة والتدخل الصوتي. دُرِّبا على الكلام على نطاق يجعل مسارات المعالجة المتتالية القديمة ASR ثم LLM ثم TTS تبدو كثلاثة منتجات منفصلة مثبّتة معًا — فقد شهدت نقطة تفتيش NVIDIA نحو 550,000 ساعة من الكلام.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, showing the openmdw-1.1 license tag, a model size of 11B params, 3,630 downloads last month, an inference-providers row stating the model isn't deployed by any Inference Provider, a model tree descending from NVIDIA-Nemotron-Nano-12B-v2-Base, three audio samples labelled natural turn-taking at roughly 450 ms response, barge-in where the model yields instantly, and tool calling live, and the description that NVIDIA NemotronLabs VoiceChat is an 11B end-to-end real-time speech full duplex model and the first open full-duplex model to support tool calling.

ما تتخلى عنه، وهو ليس المال فقط

أول شيء تتخلى عنه مع النموذج المفتوح هو الصوت. تستخدم نقطة الحفظ الصادرة صوتًا ثابتًا واحدًا باسم Aria، ولا تدعم استنساخ الصوت أو مكتبة أصوات. يأتي GPT-Live-1 باثني عشر صوتًا تغطي لكنات ولهجات ولغات مختلفة، وقد أعادت OpenAI إتقانها خصيصًا لهذا النموذج. إذا كان صوت منتجك جزءًا من هويته، أو كنت بحاجة إلى خدمة أسواق متعددة بوكلاء مختلفي الصوت من عملية نشر واحدة، فإن هذا وحده يكاد يكون كافيًا لاستبعاده — وهو القيد الأقل ظهورًا في مقارنة المواصفات، لأنه يبدو كعدد ميزات لا كقرار منتج.

الشيء الثاني الذي تتخلى عنه هو سقف السياق. يحمل النموذج حدًّا للنطق أثناء التدريب يبلغ نحو 142 ثانية، وقيودًا عملية حول الاحتفاظ بأكثر من نحو دقيقتين من السياق الصوتي. المكالمة الهاتفية التي تستمر عشرين دقيقة ليست سياقًا واحدًا متصلًا لنقطة التحقق هذه؛ بل هي سلسلة من المقاطع يتعين على النظام المحيط إدارتها. وعادةً ما تتكفّل النماذج المستضافة بهذه الأعمال التدبيرية نيابةً عنك.

الثالث هو ما يُسمح لك بفعله به. تحمل بطاقة نموذج Hugging Face رخصة openmdw-1.1، بينما وصفت بعض التغطية للإصدار أنه للاستخدام البحثي فقط، وتصف صفحة حاوية NGC المكونات بأنها جاهزة للاستخدام التجاري أو غير التجاري. ثلاثة مصادر، وثلاث قراءات مختلفة، ونص الرخصة وحده هو الحاكم. هذا التباين هو نوع الشيء الذي يبرز في مراجعة قانونية قبل ثلاثة أسابيع من الإطلاق. حُلّه قبل أن تبني، لا بعد ذلك.

الرابع هو العمليات. وحدة معالجة رسومات بسعة 80 GB ليست بندًا يمكنك إيقاف تشغيله في أحد أيام الأحد الهادئة: فحتى عند انعدام حركة المرور، أنت تدفع ثمن البطاقة، وتتحمل مسؤولية منحنى التوسع، وترقيات برامج التشغيل، وتخطيط السعة، والمناوبة عند الطلب لمسار صوتي في الوقت الفعلي، حيث يعني انقطاع الاتصال فقدان عميل. كما لا يوجد بديل مستضاف يمكن الاعتماد عليه أثناء وصولك إلى هناك — فصف مزوّد الاستدلال في بطاقة Hugging Face يذكر بوضوح أن النموذج غير منشور من قبل أي مزوّد استدلال، لذا لا يوجد إصدار بالدفع حسب الدقيقة من نقطة التحقق هذه لبناء نموذج أولي مقابله. إما أن تستضيفه ذاتيًا، أو لا تستخدمه. هذا العمل غير ظاهر في المقارنة حسب الدقيقة، وواضح جدًا في خطة التوظيف.

الهجين الذي ينبغي لمعظم الفرق أن تفكر فيه فعلاً

الإطار الذي يجعل هذا القرار قابلاً للمعالجة هو أن النموذجين لا يجب أن يكونا ثنائيين. عادةً ما يمتلك وكيل الصوت طبقةً صوتية وطبقة استدلال، وطبقة الاستدلال هي حيث تكمن المرونة.

لقد صُمم GPT-Live-1 بهذه الطريقة عن قصد. تُبقي طبقة الصوت فيه المحادثة مستمرة بينما يُفوَّض التفكير عبر Responses API إلى نموذج نصي عادي — ومثال WebRTC الذي نشرته Ope​nAI بنفسها يربط ذلك الخادم الخلفي بـ GPT-5.6 Terra. هذا النصف من منظومتك هو استدعاء API عادي، يُسعَّر حسب الرمز، مع خيار حقيقي بين البائعين. تتوفر GPT-5.6 Terra عبر OrcaRouter بسعر 2.00 دولار لكل مليون رمز إدخال و12.00 دولارًا لكل مليون رمز إخراج، مع سياق من مليون رمز، وإتاحة كلٍّ من /v1/chat/completions و/v1/responses، إلى جانب نحو 190 نموذجًا آخر يمكن الوصول إليها بمفتاح واحد.

هذا مهم لمشروع استضافة ذاتية على وجه التحديد لأنه يغيّر ملف المخاطر. إذا شغّلت Nemotron VoiceChat 11B ولم يصمد أمام حركة المرور لديك، فإن نصف الصوت يمثل تكلفة GPU غارقة — لكن نصف الاستدلال يمكن نقله أو تجاوز الفشل فيه أو تقسيمه بين نموذج رخيص للجولات الروتينية ونموذج قوي للتصعيدات دون المساس بمسار الصوت على الإطلاق. إن التجاوز التلقائي للفشل عبر المزوّدين في المنبع هو الفرق بين أمسية سيئة وربع سنة سيئ عندما يتعطل اعتماد على مصدر واحد.

اذكر بوضوح ما هو متاح وما ليس متاحًا وأين: لا يتم تقديم GPT-Live-1 ولا Nemotron VoiceChat 11B عبر OrcaRouter. كلاهما يأتي من مصدره الأصلي — نقطة نهاية Live Sessions من OpenAI في إحدى الحالتين، ووحدة معالجة الرسومات الخاصة بك في الحالة الأخرى. تقع فاعلية التوجيه بالكامل في المرحلة اللاحقة للصوت.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

أي واحد نبني عليه؟

• اختر GPT-Live-1 إذا كنت تريد الإطلاق هذا الربع، أو إذا كنت بحاجة إلى أكثر من صوت واحد، أو إذا كانت محادثاتك تتجاوز بانتظام دقيقتين من السياق المتواصل، أو إذا لم يكن حجم الاستخدام مرتفعًا بعد بما يكفي لتبرير وحدة معالجة رسومات تُحاسبك أثناء الخمول.

• اختر NVIDIA Nemotron VoiceChat 11B إذا كنت تشغّل بالفعل وحدات معالجة رسومات بسعة 80 GB، أو إذا كنت تحتاج إلى تبادل أدوار الحديث بأقل من 500 ms بناءً على الأدلة لا الادعاءات، أو إذا كنت تحتاج إلى بقاء الصوت داخل بنيتك التحتية الخاصة لأسباب تتعلق بموقع البيانات، أو إذا كان حجم مكالماتك بحيث يكون عدّاد الدقائق في API أكبر بند في الفاتورة.

• ابنِ نموذجًا أوليًا على API وقِس أداء نقطة التحقق. يتوقف القرار على رقم واحد غير منشور — الجلسات المتزامنة لكل بطاقة 80 GB — والسبيل الوحيد للحصول عليه هو قياسه على شكل حركة المرور لديك. هذا عمل أسبوع، وهو الفرق بين قرار بنية تحتية يمكن الدفاع عنه وتخمين متنكّر في ثوب قرار.