Carte de titre principale pour « GPT-Live-1 vs Breeze TTS 2 », sous-titrée « Une conversation ou une voix — et une seule des deux est une facture », comportant trois cartes affichant « GPT-Live-1 : 0,05 $ par minute vocale, pas de poids, entend pendant qu'il parle », « Breeze TTS 2 : 3B de poids ouverts, 1 205 Elo, licence de recherche uniquement », « C'est la licence, pas l'Elo, qui décide ici », au-dessus d'un bandeau de pied de page indiquant « Chiffres d'arène de Breeze TTS 2 selon Artificial Analysis ; chiffres de GPT-Live-1 rapportés par OpenAI. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

GPT-Live-1 vs Breeze TTS 2 : le leader vocal à poids ouverts que vous ne pouvez pas livrer

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Breeze TTS 2 est le modèle de synthèse vocale à poids ouverts le mieux noté sur Provider Voices Speech Arena d’Artificial Analysis, avec un score Elo de 1 205 et une septième place au classement général parmi plus de cent systèmes évalués — devant tous les moteurs sous licence commerciale qui publient leurs poids. Ses poids sont téléchargeables depuis le 25 août 2026. Il est aussi, selon la licence qui accompagne ces poids, inutilisable dans un produit. GPT-Live-1 est le compromis inverse sur tous les plans : fermé, hébergé, facturé 0,05 $ la minute de voix depuis son arrivée sur l’API pour développeurs d’OpenAI le 10 septembre 2026, et le seul des deux capable d’entendre un appelant l’interrompre.

Mettez ces deux phrases côte à côte, et la comparaison se règle plus vite que ne le font la plupart des confrontations de modèles. Ce n’est pas une lutte pour savoir lequel synthétise mieux la parole. C’est une lutte pour savoir si vous achetez une voix ou une conversation, et si « open » signifie ce que vous pensiez qu’il signifiait.

Ce ne sont pas le même genre de chose, et c'est là tout l'intérêt

Breeze TTS 2, d'une startup d'environ quinze personnes appelée BreezeBlue, est un modèle de synthèse vocale de 3 milliards de paramètres. Le texte entre, l'audio sort. Il n'entend rien. Il n'a pas d'avis sur le moment où un tour de parole devrait se terminer, car il n'a aucune notion de tour de parole. Diffusé en flux via un WebSocket, il commence à produire de l'audio avant que votre texte ait fini d'être généré, ce qui est vraiment utile pour garder le rythme d'un agent vocal serré — mais la décision de quand parler a été prise par ce qui a écrit le texte.

GPT-Live-1 est un modèle parole-à-parole en duplex intégral. L’audio et le texte entrent ; l’audio et le texte sortent ; et le modèle décide plusieurs fois par seconde s’il doit continuer à écouter, faire une pause, prendre la parole ou la céder. Les propres chiffres d’Open​AI pour Full Duplex Bench v1.5, publiés lors de la sortie et non reproduits en dehors de l’entreprise, situent son interactivité à 80,1 % contre 45,4 % pour GPT-Realtime-2.1, avec une latence de prise de parole de 0,798 seconde contre 1,41.

Cette asymétrie n’est pas une critique envers Breeze TTS 2. C’est un avertissement sur la place de chacun dans une pile. Si vous construisez une cascade — reconnaissance vocale alimentant un modèle de langage alimentant un synthétiseur — Breeze TTS 2 est un candidat pour le dernier tiers de celle-ci. Si vous achetez GPT-Live-1, vous achetez toute la boucle et lui confiez la logique d’alternance des tours de parole avec.

Dimension par dimension

• Modèle d’interaction — GPT-Live-1 : duplex intégral, barge-in natif, écoute pendant qu’il parle vs Breeze TTS 2 : synthèse vocale en flux, aucune entrée audio du tout

• Poids — GPT-Live-1 : fermé, hébergé uniquement, un seul identifiant de modèle et aucun instantané daté, contre Breeze TTS 2 : 3 milliards de paramètres sur Hugging Face depuis le 25 août 2026, code d'inférence PyTorch sous Apache-2.0

• Licence — GPT-Live-1 : conditions commerciales via l'API d'OpenAI, rien à examiner par rapport à Breeze TTS 2 : une licence de recherche et non commerciale couvrant les poids, les fine-tunes, les LoRAs, les fusions, les quantifications et les sorties auto-hébergées

• Unité de prix — GPT-Live-1 : 0,05 $ par minute vocale, facturé à la seconde, backend de raisonnement facturé séparément vs Breeze TTS 2 : 34 $ par million de caractères sur le point de terminaison hébergé, avec un tarif dégressif jusqu’à 28 $ pour le plan publié le plus élevé

• Éléments probants sur la qualité — GPT-Live-1 : 70,3 % sur l’Artificial Analysis Speech to Speech Index, sixième ex æquo sur quatorze modèles évalués, contre Breeze TTS 2 : 1 205 Elo sur l’arène Provider Voices, septième au classement général et premier parmi les modèles à poids ouverts, selon Artificial Analysis

• Langues — GPT-Live-1 : la couverture du lancement signale systématiquement une fluidité inégale en dehors des principales langues face à Breeze TTS 2 : 50 revendiquées par le fournisseur, la fiche du modèle étant étiquetée pour l’anglais et le chinois

• Contrôle vocal — GPT-Live-1 : douze voix API, ton et débit pilotés par prompt, aucun clonage du tout vs Breeze TTS 2 : clonage à partir d’audio de référence, conception vocale sans référence, direction vocale et événements vocaux intégrés

• Débit — GPT-Live-1 : mesuré par sessions simultanées, plafonné à 25 au niveau 1 et à 500 au niveau 5, sans niveau gratuit, contre Breeze TTS 2 : environ 45 caractères par seconde selon la mesure d’Artificial Analysis, ce qui est plus lent que plusieurs concurrents commerciaux et compte pour les travaux de longue haleine

A two-column comparison scoreboard titled 'GPT-Live-1 vs Breeze TTS 2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Weights: closed, hosted only', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning'. The right column, labelled Breeze TTS 2, reads 'Kind: streaming text-to-speech', 'Price: $34 per 1M characters hosted', 'Weights: 3B on Hugging Face, research licence', 'Independent score: 1,205 Elo, 7th of 100+ on the AA Provider Voices arena', 'Latency: p50 133.6 ms time to first audio (vendor)', 'Voices: cloning, voice design, inline events'. The footer reads 'GPT-Live-1 interactivity OpenAI-reported and unreproduced; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La licence fait plus de travail que le classement

La fiche de modèle de BreezeBlue est, à ce sujet, d'une franchise inhabituelle, ce qui fait honneur à l'entreprise. Le code d'inférence est sous Apache-2.0. Les poids et toutes les sorties que vous générez en les hébergeant vous-même sont destinés à la recherche, et tout déploiement commercial nécessite soit un abonnement hébergé payant, soit une autorisation écrite. Cette restriction s'étend explicitement aux modèles dérivés, aux LoRAs, aux fusions et aux quantifications — ce qui ferme l'échappatoire à laquelle on recourt habituellement.

Donc, la formule « leader des poids ouverts » a besoin d’un qualificatif que les gros titres comportent rarement. Breeze TTS 2 est ouvert au sens où vous pouvez le télécharger, l’inspecter, le benchmarker et l’exécuter sur votre propre matériel pour l’évaluation. Il n’est pas ouvert au sens où il permettrait à une startup de bâtir un produit dessus sans soit payer BreezeBlue, soit financer un examen juridique. Sur les trois choses que les gens entendent par poids ouverts — la vérifiabilité et le coût — vous en obtenez deux. La troisième — la liberté de livrer — vous ne l’avez pas.

C’est une vraie différence avec un modèle comme GPT-Live-1, où la question de la licence n’est pas « puis-je » mais « combien ». Les deux finissent par une facture. Un seul des deux finit d’abord par l’avis d’un avocat.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2, showing the tags 'Text-to-Speech', Transformers, Safetensors, PyTorch, English and Chinese, the licence label 'breezeblue-research-and-non-commercial-license', the notice 'Source code is licensed under Apache 2.0. Breeze TTS 2 model weights, derivative models, and self-hosted outputs are for research and non-commercial use only', a news entry dated 2026.08.25 reading 'We release Breeze TTS 2 model weights and the PyTorch inference code', the claim that it 'ranks #1 among open-weight models on the Artificial Analysis TTS leaderboard', a model size of 3B params with F32 and BF16 tensor types, and the note 'This model isn't deployed by any inference provider'.

Les deux unités de prix ne sont pas comparables, voici donc le calcul.

0,05 $ la minute et 34 $ par million de caractères semblent appartenir à des univers différents, parce que c’est bien le cas. Pour les comparer, il faut convertir. Le débit de parole est d’environ 150 mots par minute, et l’anglais compte en moyenne environ cinq caractères et demi par mot une fois les espaces comptés, donc une minute de sortie vocale représente environ 800 à 900 caractères. Au tarif de 34 $ par million de Breeze TTS 2, cela représente environ trois cents de synthèse par minute — moins cher que les cinq de GPT-Live-1, sur la parole brute.

La comparaison s'effondre immédiatement après, parce que les cinq centimes de GPT-Live-1 incluent l'écoute. Il transcrit aussi l'appelant, détermine quand le tour se termine et gère l'interruption — un travail qu'une cascade doit acheter ailleurs : un modèle de reconnaissance vocale, un modèle de détection de tour de parole et un modèle de langage pour produire le texte que lira Breeze TTS 2. Ajoutez ceux-ci et les trois centimes de synthèse de la cascade se retrouvent sous une facture généralement plus élevée que celle du modèle de bout en bout.

Le résumé honnête est que la voix la moins chère est Breeze TTS 2 et que la conversation la moins chère est GPT-Live-1, et la différence entre ces deux affirmations représente tout ce que coûte réellement un agent vocal.

A screenshot of the Artificial Analysis Provider Voices speech arena leaderboard, ranking text-to-speech models by blind-listener Elo. The table runs Cartesia Sonic 3.6 first on 1,275 Elo from 1,755 samples and $49.0 per million characters, then Inworld Realtime TTS-2 at 1,244, Speechify Simba 3.2 at 1,233 and Qwen-Audio-3.0-TTS-Plus at 1,232, down to BreezeBlue Breeze TTS 2 at 1,205 Elo from 1,227 samples, seventh overall, carrying the only Open Weights badge in the top ten at $34.0 per million characters with an August 2026 release date.

Là où ils se rencontreraient réellement

Une équipe qui construit aujourd’hui un agent téléphonique et qui refuse de s’engager sur la pile de bout en bout d’un seul fournisseur assemblerait exactement cette cascade : Breeze TTS 2 ou un moteur comparable pour la bouche, autre chose pour les oreilles, et un modèle de langage routé pour la réflexion. Le dernier de ces trois éléments est celui qui change le plus souvent — c’est là que la qualité progresse le plus vite, que le coût varie le plus, et où le modèle qui gagne ce trimestre est rarement celui qui gagnera le suivant.

Cette couche est un appel API normal, et c'est la seule partie de cette pile qui mérite de rester portable. Environ 190 modèles issus de onze fournisseurs en amont se trouvent derrière une seule clé OrcaRouter, au prix catalogue du fournisseur et sans marge, de sorte que remplacer le modèle de raisonnement derrière un agent vocal relève d'un changement de configuration plutôt que d'un projet d'intégration, et le basculement automatique évite qu'un backend qui expire fasse tomber l'appel. Ni le point de terminaison Live Sessions de GPT-Live-1 ni l'API hébergée de Breeze TTS 2 ne sont accessibles de cette manière — les couches vocales de cette comparaison se situent hors de portée d'une couche de routage, et il vaut la peine d'être clair à ce sujet plutôt que de laisser entendre le contraire.

Lequel choisir

Choisissez GPT-Live-1 si la conversation est le produit et que vous pouvez accepter un front-end hébergé et fermé. Lignes de réservation, support de premier niveau, tout contexte où un appelant qui parle par-dessus l'agent est un événement normal plutôt qu'une exception. Vous achetez la gestion des interruptions, et vous l'achetez à un tarif à la minute qui reste prévisible, tandis que le raisonnement qui la sous-tend est la partie que vous ajustez.

Choisissez Breeze TTS 2 si vous avez besoin d’une voix que vous pouvez inspecter, si vous construisez un produit où la synthèse n’est qu’un composant parmi tant d’autres, ou si vous avez besoin de clonage et de conception de voix que GPT-Live-1 n’offre pas du tout. Sachez d’emblée que les poids sont destinés à la recherche, que l’affirmation des 50 langues est une affirmation de fournisseur face à une fiche étiquetée pour deux langues, et que les chiffres de latence sont les propres mesures de BreezeBlue sur un chemin rapide préchauffé plutôt qu’un audit indépendant.

L’instinct qui consiste à y voir un concours de qualité est le mauvais instinct. Breeze TTS 2 est proche du sommet du classement sur lequel il concourt, et GPT-Live-1 concourt dans une catégorie entièrement différente. La décision qui coûte réellement de l’argent est celle qui sous-tend les deux : quel modèle fait le travail de réflexion, et si vous pouvez changer d’avis là-dessus en un après-midi.