Une carte hero générée pour « Gemini 3.8 TTS vs VoxCPM2 » sur fond blanc, avec de doux accents en dégradé bleu et cyan. La carte de gauche, « Gemini 3.8 Flash TTS », indique un point de terminaison d'API, un Elo de 1 260 au rang 2, et 16,50 $ par million de caractères normalisés ; la carte de droite, « VoxCPM2 », indique une licence Apache 2.0, 2 milliards de paramètres, environ 8 Go de VRAM pour l'exécution, un facteur temps réel de 0,30 en PyTorch pur et aucun point de terminaison hébergé. Une ligne de pied de page indique : « Elo selon l'Artificial Analysis Provider Voice Arena, septembre 2026 ; chiffres VoxCPM2 selon sa fiche modèle. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2 : louer une voix ou la faire tourner soi-même, en chiffres réels

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il n'existe aucune ligne de classement qui place Gemini 3.8 Flash TTS et VoxCPM2 côte à côte, et cette absence est le fait le plus utile de cette comparaison. Gemini 3.8 Flash TTS est un point de terminaison hébergé avec un Elo de 1 260 au rang 2 de l'Artificial Analysis Provider Voice Arena et une grille tarifaire publiée en tokens. VoxCPM2 est un checkpoint OpenBMB — 2 milliards de paramètres, Apache 2.0, publié en avril 2026 — qu'aucun fournisseur d'inférence n'héberge. Vous ne pouvez pas le louer. Vous l'exécutez.

Donc la question n’est pas de savoir quel modèle sonne mieux. Il s’agit de savoir si votre charge de travail est mieux servie en payant au caractère pour les GPU de quelqu’un d’autre ou en possédant les GPU et en les payant, qu’ils fonctionnent ou non. C’est une question d’arithmétique et, contrairement à la plupart des comparaisons de modèles, elle a une réponse que vous pouvez calculer avant de vous engager.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

L’un de ceux-ci se loue, l’autre s’exploite.

Commencez par ce que chacun vous remet réellement.

• Accès — Gemini 3.8 Flash TTS est uniquement disponible via API, appelé par l'intermédiaire de l'API Gemini et des surfaces Google nommées dans son annonce du 23 septembre 2026. VoxCPM2 n'a aucun point de terminaison propriétaire en usage en production et aucun fournisseur d'inférence ne le sert ; le checkpoint est le produit.

• Licence — VoxCPM2 est distribué sous Apache 2.0, qui autorise l’utilisation commerciale sans accord distinct. Il s’agit d’une licence réellement permissive, et ce n’est pas la norme par défaut pour les poids ouverts de parole, dont plusieurs sont distribués sous des conditions réservées à la recherche qui renvoient l’utilisation commerciale vers une API hébergée.

• Taille — VoxCPM2 compte 2 milliards de paramètres et tient dans environ 8 Go de VRAM en précision réduite pour le développement, avec un pic de service autour de 22 Go sur une carte de 24 Go. Google n’a publié aucun nombre de paramètres pour l’un ou l’autre des modèles Gemini 3.8 TTS.

• Création vocale — Gemini 3.8 Flash TTS réalise la conception vocale à partir d'une description écrite, la réplication vocale à partir d'un échantillon de 30 secondes, et un dialogue à deux locuteurs en un seul appel. VoxCPM2 est un modèle de synthèse vocale à voix unique ; une conversation correspond à deux exécutions assemblées.

• Score indépendant — Flash TTS en a un. VoxCPM2 n’apparaît pas parmi les lignes classées du Provider Voice Arena capturé le 24 septembre 2026. L’absence d’un classement n’est pas un verdict sur la qualité — elle signifie généralement que personne n’a soumis le modèle — mais elle signifie bien qu’il n’y a aucun chiffre de préférence tiers à prendre en compte.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Ce dernier point joue dans les deux sens et mérite d’être dit clairement plutôt que d’être éludé : si vous avez besoin d’un signal de qualité indépendant avant de vous engager, un seul de ces deux en fournit un.

Le nombre qui décide : le facteur temps réel

L'auto-hébergement d'un modèle vocal transforme une facturation au caractère en une facturation à l'heure-GPU, et le taux de conversion entre ces deux unités est le facteur temps réel du modèle — combien de secondes de calcul sont nécessaires pour produire une seconde d'audio.

Les chiffres publiés de VoxCPM2 sont de 0,30 en PyTorch standard et de 0,13 sous Nano-VLLM. Interprétez-les comme un débit plutôt qu’une latence : à 0,13, une heure-GPU de temps réel produit de l’ordre de 7,7 heures d’audio finalisé. À 0,30, la même heure-GPU produit plutôt autour de 3,3 heures. Ce sont les chiffres de la fiche modèle elle-même, mesurés par OpenBMB, et ils constituent l’entrée la plus importante de toute décision « construire ou acheter » ici.

Trois choses en découlent.

• La pile de service compte plus que le modèle. Passer de PyTorch standard à Nano-VLLM fait plus que doubler le débit sur un matériel identique. Tout modèle de coût fondé sur le chiffre de 0,30 surestime le coût auto-hébergé d’un facteur d’environ 2,3.

• Tout se joue sur l’utilisation. Un GPU loué qui reste inactif 90 % du temps n’est pas moins cher qu’une API, quel que soit le prix. Le seuil de rentabilité n’apparaît que lorsque vous gardez la carte occupée.

• Le traitement par lots modifie encore les calculs. Le facteur temps réel est mesuré par flux ; un serveur qui traite des requêtes simultanées amortit le coût fixe sur celles-ci, ce qui est exactement le régime où l’auto-hébergement commence à l’emporter.

Ce que coûte une heure d’audio, dans les deux sens

Mettez les deux modèles de facturation sur le même axe. Une heure d’audio finalisé représente 3 600 secondes de sortie.

Du côté de la location, Google facture en tokens plutôt qu'en caractères : 0,50 $ par million de tokens texte en entrée et 9,00 $ par million de tokens audio en sortie jusqu'au 31 décembre 2026, puis 18,00 $ ; Flash-Lite TTS, c'est 0,50 $ et 6,00 $, puis 12,00 $. Batch et Flex coûtent 0,25 $ et 4,50 $ pour Flash TTS, contre 0,25 $ et 3,00 $ pour Flash-Lite TTS, et Priority coûte 0,90 $ et 16,00 $. Artificial Analysis normalise les tarifs standard à 16,50 $ et 11,00 $ par million de caractères, ce qui correspond à la conversion du tableau plutôt qu'à un tarif communiqué par Google, et c'est le chiffre à utiliser pour comparer avec un modèle qui facture en caractères.

Du côté auto-hébergé, il n’existe aucun tarif au caractère. Le coût est l’heure-GPU, multipliée par le nombre d’heures dont vous avez besoin au débit ci-dessus, plus la stack de service, plus les personnes qui la maintiennent en fonctionnement. L’avantage de VoxCPM2 est que le coût marginal de la millième heure est le même que celui de la première — et son inconvénient est que le coût marginal de la première heure est un GPU.

C'est pourquoi la décision est d'une clarté inhabituelle :

• En deçà d’un certain volume, l’API l’emporte, et de loin. Vous payez quelques dollars à un chiffre par heure d’audio contre un coût d’investissement, et le tarif promotionnel de Google élargit encore cet écart jusqu’au 1er janvier 2027.

• Au-delà de ce volume, sur du matériel que vous possédez déjà et que vous pouvez garder occupé, le checkpoint Apache 2.0 l’emporte de façon décisive — et contrairement à un checkpoint sous licence de recherche, rien dans la licence ne vous empêche de le distribuer.

• Entre les deux, la réponse honnête est que vous achetez de l’optionalité plutôt que des économies. L’auto-hébergement vous permet de figer une version, de conserver l’audio sur votre propre infrastructure et de ne plus avoir à vous soucier d’un changement de tarif d’un fournisseur.

Où chacun est la bonne réponse

Choisissez Gemini 3.8 Flash TTS lorsque vous voulez le produit le mieux documenté. Il dispose d'un score indépendant, d'un prix publié, d'un dialogue à deux voix en un seul appel, de la conception et de la réplication de voix, et d'aucune surface opérationnelle au-delà d'une clé API. Son homologue Flash-Lite TTS vous offre un second niveau de prix dans la même interface, à un tarif normalisé de 11,00 $ par million de caractères. Ce que vous acceptez en échange, c'est un tarif qui double le 1er janvier 2027 et l'impossibilité d'exécuter le modèle où que ce soit.

Choisissez VoxCPM2 lorsque le travail d'exploitation est ce qui importe. Apache 2.0 signifie que l'usage commercial est autorisé purement et simplement, la taille de 2B signifie qu'un seul accélérateur suffit, et le facteur temps réel de 0,13 sous Nano-VLLM signifie qu'une carte modeste produit plusieurs heures d'audio par heure d'horloge murale. Ce que vous acceptez, c'est que personne d'autre ne va l'exécuter pour vous : pas de point d'accès hébergé, pas de ligne d'arène, pas de grille tarifaire de fournisseur, et chaque garantie de qualité que vous obtenez est une garantie que vous construisez et mesurez vous-même.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Aucun des deux modèles n'est hébergé par OrcaRouter, et cela mérite d'être dit directement plutôt que suggéré autrement. L'endroit pour appeler Gemini 3.8 Flash TTS, c'est l'API de Google elle-même et les interfaces que Google a désignées ; VoxCPM2 est un checkpoint que vous déployez. Ce qu'OrcaRouter couvre, c'est la couche au-dessus de cette décision — plus de 200 modèles derrière une seule clé à prix catalogue du fournisseur sans marge, de sorte qu'un changement de prix d'un fournisseur est répercuté chez nous le jour même plutôt qu'au cycle de facturation suivant, basculement automatique afin qu'un modèle en cours d'évaluation n'ait jamais à constituer une dépendance de production, et un DSL de routage qui compose plusieurs modèles en un seul appel lorsqu'une seule voix ne porte pas toute la tâche.

Que regarder ensuite

Deux choses changeraient sensiblement cette comparaison, et aucune ne s'est encore produite.

Le premier cas est celui d'un acteur qui héberge VoxCPM2. Son absence du marché de l'inférence est la principale raison pour laquelle les deux modèles sont comparés sur des critères économiques plutôt que sur la qualité — si un fournisseur l'adopte, le calcul louer-contre-posséder cesse d'être le facteur décisif et la ligne manquante dans l'arène devient celle que l'on veut voir remplie.

Le second est le changement de tarif de janvier du côté de Google. Au tarif promotionnel, l'API est suffisamment bon marché pour que la plupart des charges de travail n'aient rien à auto-héberger ; au tarif post-promotionnel, l'écart se resserre au point qu'une équipe disposant déjà de capacité GPU et d'un volume régulier devrait refaire ses calculs plutôt que de supposer que l'API l'emporte encore.

Jusqu'à ce que l'une de ces évolutions se produise, l'élément décisif n'est pas un classement. C'est le nombre d'heures d'audio que vous produisez par mois, et si la carte est occupée.