
GPT-Live-1 vs VoxCPM2 : l'un coûte 0,05 $ la minute, l'autre exige un GPU de 24 Go
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
La façon la plus claire de comparer GPT-Live-1 et VoxCPM2 est de remarquer qu’ils ne semblent concurrents que tant qu’on ne chiffre pas le matériel. GPT-Live-1 est le modèle vocal full-duplex d’OpenAI, disponible dans l’API depuis le 10 septembre 2026 à 0,05 $ par minute de voix, sans rien à installer. VoxCPM2 est le modèle de synthèse vocale à poids ouverts de 2 milliards de paramètres d’OpenBMB, publié sous Apache 2.0 en avril 2026, qui tourne avec environ 8 Go de VRAM et n’est déployé par aucun fournisseur d’inférence — donc si vous le voulez, c’est vous qui possédez la machine. L’un est une conversation que vous louez à la seconde ; l’autre est un synthétiseur que vous exploitez. La question n’est pas de savoir lequel est meilleur, mais lequel votre charge de travail peut réellement absorber.

Deux modèles, deux usages, une ligne de spécifications honnête pour chacun.
• Fonction — GPT-Live-1 tient une conversation : il écoute et parle simultanément, alterne les tours de parole, gère les interruptions et les rétrocanaux, et renvoie des transcriptions. VoxCPM2 transforme le texte en parole. Il n’entend jamais rien.
• Accès — GPT-Live-1 est hébergé et fermé, un ID de modèle derrière le point de terminaison Live Sessions, avec l'exemple d'intégration publié fonctionnant via WebRTC. VoxCPM2 est un checkpoint téléchargeable sur Hugging Face et ModelScope, sous Apache 2.0, gratuit pour un usage commercial.
• Prix — GPT-Live-1 coûte 0,05 $ par minute vocale, facturé à la seconde, avec le backend de délégation mesuré séparément. VoxCPM2 coûte 0 $ par appel, plus un GPU, et l'hébergement open source représente tout le modèle de coûts.
• Empreinte — {{1}}GPT-Live-1{{/1}} n'a besoin d'aucun de vos matériels. {{2}}VoxCPM2{{/2}} nécessite environ 8 Go de VRAM (6 à 8 Go en Q4), Python 3.10+, PyTorch 2.5+ et CUDA 12+.
• Benchmarks — chaque chiffre vocal de GPT-Live-1 provient d’OpenAI et n’a pas été reproduit ; le seul classement indépendant le place septième sur onze. Les chiffres publiés de VoxCPM2 sont ceux d’OpenBMB, et les mesures indépendantes qui existent sur ses affirmations multilingues indiquent l’inverse.
La question des 24 Go, chiffrée
Les chiffres de service de VoxCPM2 sont ceux qui déterminent si l'auto-hébergement relève du passe-temps ou de l'architecture. Sur une seule RTX 4090, le modèle tourne à un facteur temps réel d'environ 0,30 en PyTorch standard et d'environ 0,13 avec la voie Nano-VLLM — soit environ 7,7 heures d'audio généré par heure de temps GPU sur la configuration la plus rapide. Ce sont les chiffres de la fiche modèle elle-même, et non une mesure externe ; une recette de service indépendante validée sur une 4090 avec CUDA 12.9 rapporte des facteurs temps réel en régime permanent d'environ 0,120 pour la synthèse zéro-shot et de 0,139 pour le clonage, avec une mémoire GPU de pointe proche de 22 Go sur 24 Go. Les deux séries sont en régime permanent, pas à froid — la première requête dans un nouveau processus est bien plus lente, et c'est le chiffre que les gens citent lorsqu'ils disent que le modèle est inutilisable.
Mettez cela en regard de l’API. GPT-Live-1 à 0,05 $ la minute, c’est 3,00 $ pour une heure de conversation ininterrompue. Une carte de 24 GB louée sur le marché ouvert coûte quelques dollars par heure, et en posséder une revient à un montant similaire une fois l’utilisation prise en compte. La comparaison aboutit donc là où ces comparaisons aboutissent généralement, avec une asymétrie inconfortable : la facture du GPU arrive que quelqu’un parle ou non à votre produit, tandis que celle de l’API tombe à zéro les jours calmes et atteint cinq chiffres les jours chargés. La synthèse par lots d’un catalogue fixe est parfaitement adaptée au GPU. Une ligne téléphonique toujours active est parfaitement adaptée au compteur.
Ce que VoxCPM2 fait qu'aucune autre solution ouverte ne fait
Si VoxCPM2 mérite autant d’attention, ce n’est pas parce qu’il remporte des benchmarks — ce n’est généralement pas le cas —, mais parce qu’il conçoit une voix à partir d’une description textuelle, sans aucun audio de référence. C’est une capacité véritablement nouvelle dans les poids ouverts, et elle change le flux de travail de quiconque a besoin d’une voix qui n’existe pas encore : l’auditionner en prose, itérer en prose, et seulement ensuite décider s’il faut la cloner. À cela s’ajoutent 30 langues ainsi que neuf dialectes chinois, une sortie à 48 kHz via un étage de super-résolution intégré, et un affinage avec aussi peu que 5 à 10 minutes d’audio.
La base de preuves est plus mince que la liste des fonctionnalités. Le rapport d'OpenBMB lui-même donne un taux d'erreur sur les mots en anglais de 1,84 % et un taux d'erreur sur les caractères en chinois de 0,97 %, ainsi qu'une erreur moyenne de 1,68 % sur 30 langues, mesurée sur son propre ensemble de 500 énoncés par langue et évaluée par le modèle d'un autre fournisseur. Là où un test indépendant existe, l'écart est important : sur l'ensemble de test multilingue de MiniMax évalué avec Whisper-large-v3, l'hindi atteint 19,70 et l'arabe 13,05 — plusieurs fois pires que les chiffres auto-déclarés. OpenBMB avertit également que la conception de voix et le contrôle du style produisent des résultats variables d'une exécution à l'autre et suggère de générer une à trois fois pour obtenir le résultat souhaité, ce qui est une manière discrète de dire que le coût par appel d'un résultat utilisable n'est pas celui d'un seul appel.
La taxe d'intégration que personne n'inclut dans la comparaison
Un détail peu glamour détermine si VoxCPM2 représente une semaine de travail ou un mois. Son dépôt Hugging Face est étiqueté voxcpm plutôt que transformers, ce qui signifie que la bibliothèque avec laquelle presque tout le reste de ce site se charge ne peut pas charger ce modèle. La pull request pour corriger cela a été ouverte le 4 août 2026 et n’avait pas été fusionnée lors de notre dernière vérification. Les pull requests pour l’ajouter à d’autres stacks de service ont été fusionnées, et l’adoption ne fait aucun doute : 393 079 téléchargements au cours des trente derniers jours au moment de cette capture, avec 27 adaptateurs, 30 fine-tunes, 12 quantifications et 100 Spaces construits sur le checkpoint.

La taxe équivalente de GPT-Live-1 est une réécriture du transport. Ses sessions reposent sur une connexion en direct plutôt que sur un point de terminaison audio requête-réponse, et la facturation à deux compteurs signifie que chaque appel de raisonnement délégué, invocation d’outil et recherche web est facturé aux tarifs propres du modèle backend, en plus de la minute vocale. Les équipes qui migrent depuis une intégration temps réel facturée au token doivent budgéter ce passage comme une tâche d’ingénierie, et non comme un simple changement d’ID de modèle.
Quand une couche de routage est réellement utile
OrcaRouter ne propose ni GPT-Live-1 ni VoxCPM2, et il vaut mieux le dire clairement plutôt que de laisser le reste de cette section sous-entendre le contraire. La couche vocale de GPT-Live-1 se trouve derrière le point de terminaison propre à OpenAI ; VoxCPM2 n’a aucun fournisseur hébergé. Ni l’un ni l’autre ne peut être appelé avec notre clé.
Si la question du routage revient sans cesse, c'est que les deux modèles se trouvent à la lisière d'un pipeline dont le milieu est du texte. Un déploiement VoxCPM2 répond généralement à quelque chose — un générateur de script, une étape de traduction, un normaliseur de texte, un modèle de dialogue qui décide de ce qui sera prononcé ensuite — et ce sont des appels de modèle ordinaires. Une session GPT-Live-1 délègue sa réflexion à un modèle backend nommé dans la configuration de la session, et dans la documentation d'OpenAI elle-même, ce backend est GPT-5.6 Terra, disponible via OrcaRouter au prix catalogue d'OpenAI. La délégation côté client va encore plus loin, en permettant à votre propre application de fournir le backend, ce qui signifie que le modèle derrière la voix peut être n'importe quel endpoint que vous contrôlez. Environ 190 modèles de onze fournisseurs en amont se trouvent derrière une seule clé à prix catalogue, sans marge — ainsi, lorsqu'un fournisseur baisse un prix, la baisse est effective ici le jour même plutôt qu'au renouvellement — avec basculement automatique entre fournisseurs et un DSL de routage permettant de composer plusieurs modèles en un seul appel. Une assurance peu coûteuse pour la moitié de la pile qui change le plus souvent.
Une mise en garde a sa place dans cette section plutôt que d’y être enfouie, car c’est le détail qui rend la moitié GPT-Live-1 de cette comparaison moins tranchée que ne le suggèrent les benchmarks de son fournisseur. Dans l’indice indépendant Speech to Speech d’Artificial Analysis, GPT-Live-1 obtient 69,8 % — septième sur onze, derrière GPT-Realtime-2.1 à 73,9 % et Grok Voice Think Fast 2.0 à 79,0 %. Le modèle est l’élément le moins cher de ce classement par heure d’audio en entrée, à 4,42 $, et ce n’est pas le meilleur. Prévoyez la possibilité que la couche vocale que vous retenez comme standard ne soit pas celle que vous conserverez.

Lequel, pour quoi
Prenez VoxCPM2 si le texte existe avant l’audio. Narration, livres audio, doublage, accessibilité, répliques vocales de jeu, un produit qui a besoin d’une voix que personne n’a encore enregistrée — et surtout toute charge de travail où le volume est élevé, prévisible et justifie un coût d’investissement fixe. Acceptez que vous l’exécuterez vous-même, que l’outillage qui l’entoure est encore en train de se stabiliser, et que les affirmations de qualité multilingue méritent votre propre test d’écoute avant d’arriver à un client.
Choisissez GPT-Live-1 si une personne se trouve à l’autre bout. Agents vocaux, assistance téléphonique, flux de prise en charge, tout scénario où le modèle doit décider en temps réel si l’humain a fini de parler. Payez le tarif à la minute pour le privilège de ne pas prendre en charge le problème, et budgétisez le backend délégué comme une ligne distincte, car c’est là que l’appel devient bon marché ou coûteux.
L’erreur est de les considérer comme des alternatives dans un comparatif. Pour la plupart des équipes qui ont besoin des deux, ce sont deux couches d’un même produit, et la seule réponse réellement fausse est de choisir la version auto-hébergée parce que la licence la déclare gratuite, sans chiffrer le GPU qui rend cette gratuité réelle.
