
GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B : une facture à la minute ou un GPU de 80 Go
Le choix entre GPT-Live-1 et NVIDIA Nemotron VoiceChat 11B n’est pas un choix entre deux modèles vocaux. C’est un choix entre deux modèles économiques déguisés en modèles vocaux. GPT-Live-1 est une API hébergée qu’OpenAI a rendue accessible aux développeurs le 10 septembre 2026, facturée 0,05 $ par minute d’audio, sans aucun matériel de votre côté. NVIDIA Nemotron VoiceChat 11B — publié sous le nom NVIDIA-NemotronLabs-VoiceChat-11B, avec un conteneur NGC daté du 21 juillet 2026 et un checkpoint Hugging Face à côté — est un modèle vocal full-duplex à poids ouverts de 11 milliards de paramètres qui ne tournera sur rien de moins qu’un GPU de 80 Go. L’un de ces deux vous coûte de l’argent par minute de conversation ; l’autre vous coûte de l’argent, que quelqu’un appelle ou non.
Le seuil de rentabilité est plus simple que ne le suggèrent les présentations des fournisseurs
Commencez par le seul chiffre sur lequel les deux parties s’accordent. GPT-Live-1 à 0,05 $ par minute, c’est 3,00 $ pour une heure de ligne ouverte en continu. C’est le prix d’une conversation vocale toujours active.
Voyons maintenant le coût de l'alternative. Nemotron VoiceChat 11B nécessite un GPU disposant d'au moins 80 Go de VRAM — une carte de classe A100, H100, H200, B100, B200 ou RTX 6000, sous Linux. Louer l'une de ces cartes sur le marché libre coûte quelques dollars de l'heure, et en posséder une s'amortit à un montant similaire une fois l'utilisation prise en compte. Une seule ligne vocale toujours active revient donc à peu près au même prix : le GPU loué coûte à peu près ce que coûte l'API, avant même d'avoir payé quoi que ce soit pour ce qui tourne dessus.
C’est la mauvaise comparaison, et c’est celle sur laquelle la plupart des analyses « construire ou acheter » s’arrêtent. La bonne comparaison se fait par GPU, pas par ligne, et elle dépend d’un chiffre que NVIDIA n’a pas publié.
• GPT-Live-1 sur un compte Tier 1 — 25 sessions simultanées, soit 1,25 $ la minute, ou 75 $ l'heure, lorsque les 25 lignes sont actives
• Nemotron VoiceChat 11B sur un seul GPU de 80 GB — autant de sessions simultanées qu’un modèle hybride Mamba/Transformer de 11B peut en faire tenir dans 80 GB, pour environ le coût de location de la carte
Un modèle 11B sur un accélérateur de 80 Go, c’est beaucoup de marge, et 80 Go est une exigence qui, en pratique, permet d’obtenir une très grande capacité de traitement par lots. Si une carte prend en charge ne serait-ce que six conversations simultanées, l’auto-hébergement est nettement moins cher que l’API à pleine charge. Si elle n’en prend en charge qu’une et demie, ce n’est pas le cas. Tant que personne n’évalue la concurrence sur du trafic réel, la position honnête est que le seuil de rentabilité favorisera probablement l’auto-hébergement à volume, et qu’aucun des deux fournisseurs ne vous a donné le chiffre permettant de le prouver.

Là où le modèle ouvert est véritablement meilleur, pas seulement moins cher
La comparaison des latences mérite plus d’attention que celle des prix, car sur cet axe, le modèle ouvert dispose de meilleures preuves.
• Latence de prise de tour — Nemotron VoiceChat 11B rapporte 448 ms pour une prise de tour fluide sur Full-Duplex-Bench 1.0, avec une latence d'interruption et de cession de 480 ms et un taux de reprise sur interruption utilisateur de 1,00. Le chiffre de GPT-Live-1 est de 0,8 seconde, contre 1,4 auparavant, selon OpenAI.
Lisez ces deux chiffres côte à côte avec les sources jointes, et le tableau s’inverse. Les chiffres de NVIDIA proviennent d’une suite de benchmarks publiée et dont les spécifications sont publiques. Ceux d’OpenAI proviennent d’OpenAI, qui compare son nouveau modèle à sa propre génération précédente, et n’ont pas été reproduits de manière indépendante. D’après les éléments disponibles, le modèle à poids ouverts est mesurablement plus rapide sur ce qui fait qu’un agent vocal paraît humain, et le modèle hébergé n’est plus rapide que selon ses propres supports de communication.
NVIDIA revendique également une première : Nemotron VoiceChat 11B est présenté comme le premier modèle ouvert full-duplex à prendre en charge l'appel d'outils en temps réel pendant une conversation, en utilisant un canal de sortie distinct et des phrases d'attente prédéfinies afin que l'agent puisse continuer à parler pendant qu'il attend une API externe. La fiche du modèle livre trois échantillons audio vous invitant à écouter précisément cela — une alternance de parole naturelle décrite comme une réponse d'environ 450 ms, une interruption (barge-in) où le modèle cède instantanément, et des outils appelés en direct au milieu de la conversation. Ces échantillons proviennent du fournisseur et corroborent le chiffre de 448 ms plutôt que de le tester indépendamment, mais ils constituent au moins une preuve audible attachée à un checkpoint téléchargeable, plutôt qu'un simple nombre dans un article de lancement. C'est le même problème architectural que GPT-Live-1 résout par la délégation, auquel il est répondu différemment — le modèle ouvert tient la ligne lui-même ; le modèle hébergé confie la tâche à un modèle de raisonnement distinct et laisse la couche vocale maintenir la conversation en vie.
Les similitudes sont aussi instructives que les différences. Les deux fonctionnent en duplex intégral, ce qui signifie qu’ils écoutent pendant qu’ils parlent plutôt que de parler à tour de rôle. Tous deux prennent en charge l’interruption et le barge-in. Tous deux ont été entraînés sur de la parole à une échelle qui fait paraître les anciens pipelines en cascade ASR-puis-LLM-puis-TTS comme trois produits distincts boulonnés ensemble — le checkpoint de NVIDIA a vu environ 550 000 heures de parole.

Ce à quoi vous renoncez, et ce n’est pas seulement une question d’argent.
La première chose à laquelle vous renoncez avec le modèle ouvert, c'est la voix. Le checkpoint publié utilise une voix unique et fixe, nommée Aria, et ne prend en charge ni le clonage vocal ni une bibliothèque de voix. GPT-Live-1 propose douze voix couvrant différents accents, dialectes et langues, et OpenAI les a remasterisées spécifiquement pour ce modèle. Si la voix de votre produit fait partie de son identité, ou si vous devez servir plusieurs marchés avec des agents aux sonorités différentes à partir d'un seul déploiement, c'est presque éliminatoire en soi — et c'est la limitation la moins visible dans une comparaison de spécifications, parce qu'elle ressemble à un nombre de fonctionnalités plutôt qu'à une décision produit.
La deuxième chose à laquelle vous renoncez, c’est le plafond de contexte. Le modèle présente une limite de longueur d’énoncé à l’entraînement d’environ 142 secondes, ainsi qu’une limitation pratique quant à sa capacité à conserver plus d’environ deux minutes de contexte audio. Un appel téléphonique qui dure vingt minutes ne constitue pas un contexte continu pour ce checkpoint ; c’est une séquence de segments que le système environnant doit gérer. Les modèles hébergés absorbent généralement cette gestion pour vous.
Le troisième point, c'est ce que vous êtes autorisé à en faire. La fiche modèle Hugging Face porte la licence openmdw-1.1, tandis que certains articles consacrés à la sortie l'ont décrite comme réservée à la recherche, et la page du conteneur NGC présente les composants comme prêts pour un usage commercial ou non commercial. Trois sources, trois interprétations différentes, et seul le texte de la licence fait foi. Ce genre d'écart ressort lors d'un examen juridique trois semaines avant le lancement. Réglez la question avant de construire, pas après.
Le quatrième point, ce sont les opérations. Un GPU de 80 Go n'est pas une ligne budgétaire que l'on peut désactiver un dimanche tranquille : même sans aucun trafic, vous payez la carte, et c'est vous qui assumez la courbe de mise à l'échelle, les mises à jour des pilotes, la planification des capacités et l'astreinte pour un chemin audio temps réel où une connexion coupée équivaut à un client perdu. Il n'existe d'ailleurs aucune solution hébergée sur laquelle s'appuyer en attendant d'y arriver — la ligne relative au fournisseur d'inférence de la fiche Hugging Face indique clairement que le modèle n'est déployé par aucun fournisseur d'inférence, il n'y a donc pas de version à la minute de ce checkpoint pour prototyper. Soit vous l'auto-hébergez, soit vous ne l'utilisez pas. Ce travail est invisible dans la comparaison au coût par minute et très visible sur un plan d'embauche.
L’hybride que la plupart des équipes devraient réellement envisager
Le cadrage qui rend cette décision traitable est que les deux modèles ne doivent pas nécessairement être un binaire. Un agent vocal comporte généralement une couche vocale et une couche de raisonnement, et c’est la couche de raisonnement qui offre la flexibilité.
GPT-Live-1 est conçu ainsi, à dessein. Sa couche vocale maintient la conversation en vie pendant que la réflexion est déléguée, via l'API Responses, à un modèle texte ordinaire — l'exemple WebRTC publié par OpenAI lui-même relie ce backend à GPT-5.6 Terra. Cette moitié de votre pile est un appel d'API classique, facturé au token, avec un vrai choix de fournisseurs. GPT-5.6 Terra est servi via OrcaRouter à 2,00 $ par million de tokens d'entrée et 12,00 $ par million de tokens de sortie, avec un contexte de 1 M de tokens et l'exposition à la fois de /v1/chat/completions et de /v1/responses, aux côtés de près de 190 autres modèles accessibles avec une seule clé.
Cela compte particulièrement pour un projet d’auto-hébergement, car cela change le profil de risque. Si vous déployez Nemotron VoiceChat 11B et qu’il ne tient pas face à votre trafic, la partie vocale est un coût GPU irrécupérable — mais la partie raisonnement peut être déplacée, basculée en cas de défaillance ou scindée entre un modèle économique pour les tours de routine et un modèle puissant pour les escalades, sans toucher du tout au chemin audio. Le basculement automatique entre fournisseurs en amont fait la différence entre un mauvais après-midi et un mauvais trimestre lorsqu’une dépendance à source unique tombe en panne.
Notez clairement ce qui est disponible et ce qui ne l'est pas, et où : ni GPT-Live-1 ni Nemotron VoiceChat 11B ne sont servis par OrcaRouter. Les deux proviennent de leur propre origine — le point de terminaison Live Sessions d'OpenAI dans un cas, votre propre GPU dans l'autre. Le levier de routage se situe entièrement en aval de l'audio.

Sur lequel construire
• Choisissez GPT-Live-1 si vous voulez mettre en production ce trimestre, si vous avez besoin de plusieurs voix, si vos conversations dépassent régulièrement deux minutes de contexte continu, ou si le volume n’est pas encore assez élevé pour justifier un GPU qui facture lorsqu’il est inactif.
• Choisissez NVIDIA Nemotron VoiceChat 11B si vous utilisez déjà des GPU de 80 Go, si vous avez besoin d'une alternance de parole en moins de 500 ms fondée sur des preuves plutôt que sur des affirmations, si vous avez besoin que l'audio reste dans votre propre infrastructure pour des raisons de résidence des données, ou si vous avez un volume d'appels tel que la facturation à la minute de l'API représente le poste le plus important de la facture.
• Prototypez sur l’API et évaluez les performances du checkpoint. La décision repose sur un seul chiffre non publié — le nombre de sessions simultanées par carte de 80 Go — et la seule façon de l’obtenir est de le mesurer sur votre propre profil de trafic. Cela représente une semaine de travail, et c’est la différence entre une décision d’infrastructure défendable et une supposition déguisée en décision.
