Breeze TTS 2 — Le nouveau leader TTS à poids ouverts avec 1 215 Elo. Illustration régénérée.
Guides & Insights

Breeze TTS 2 : Le nouveau leader TTS à poids ouverts à 1,215 Elo

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Breeze TTS 2 est désormais le modèle de synthèse vocale à poids ouverts le mieux classé sur le Provider Voices Speech Arena d'Artificial Analysis, avec 1 215 Elo — soit 90 points d'avance sur le précédent leader à poids ouverts, Fish Audio S2 Pro — et se classe 6e au total parmi plus de 100 systèmes évalués. Ce classement constitue la première confirmation indépendante de ce que BreezeBlue affirme depuis qu'elle a dévoilé le modèle à la mi-août 2026 : qu'un modèle vocal âgé de deux semaines, issu d'une start-up d'une quinzaine de personnes, peut se hisser au niveau de la pointe de la synthèse vocale commerciale. Les poids ouverts ont été publiés sur Hugging Face le 25 août 2026 ; le résultat de l'arène a suivi dans la journée. Quoi que Breeze TTS 2 s'avère être par ailleurs, ce n'est plus une promesse de fournisseur — il a un Elo qui l'atteste.

Ce qui s'est réellement passé, dans l'ordre.

Le calendrier est important ici, car il explique pourquoi un article sur un « classement des poids ouverts » provient d'une entreprise dont la plupart des gens n'avaient pas entendu parler il y a trois semaines. BreezeBlue a été fondée par Yang Bin, ancien cofondateur technique de l'un des principaux laboratoires d'IA de Chine, grâce à un tour de table de 6 millions de dollars mené par Yuanjing Capital et Redpoint China. Le modèle a franchi trois étapes visibles :

• 7 août 2026 — BreezeBlue a publié sa propre suite de benchmarks de synthèse vocale pour la conception vocale, la direction vocale et l'évaluation de la latence sur Hugging Face.

• 16–17 août 2026 — l'entreprise a officiellement annoncé Breeze TTS 2 comme modèle vocal phare en temps réel pour les médias interactifs, et a ouvert une API hébergée à 34 $ par million de caractères.

• 25 août 2026 — les poids et le code d'inférence PyTorch ont été publiés en open source sur Hugging Face sous le nom BreezeBlue/Breeze-TTS-2, un modèle de 3 milliards de paramètres sous licence de recherche et non commerciale.

Le classement Artificial Analysis Provider Voices était en ligne quelques jours après la sortie des poids ouverts. Comme l'arène évalue les modèles en écoute comparative en aveugle, les 1 215 points Elo ne sont pas un benchmark que BreezeBlue a réalisé sur elle-même — c'est le jugement accumulé des auditeurs comparant des échantillons réels, ce qui manque le plus à un modèle aussi jeune.

Le tableau d'affichage

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Rang Arena — #6 au classement général sur Provider Voices ; #1 parmi tous les modèles à poids ouverts, devant Fish Audio S2 Pro (1 125 Elo).

• Elo — 1 215, avec un IC à 95 % d'environ ±17 (Artificial Analysis, fin août 2026).

• Langues — 50, selon BreezeBlue ; la fiche du modèle est étiquetée anglais et chinois.

• Prix — 34 $ par million de caractères sur l'endpoint hébergé de BreezeBlue ; les poids ouverts sont gratuits à télécharger mais sont soumis à une licence non commerciale.

• Vitesse — environ 45 caractères par seconde selon les mesures d'Artificial Analysis — plus lent que plusieurs concurrents, ce qui est important pour les tâches de longue durée.

• Latence — latence de streaming inférieure à 40 ms, selon BreezeBlue (indiqué par le fournisseur, non mesuré indépendamment).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Ce que Breeze TTS 2 fait réellement différemment

L'Elo fait la une, mais la promesse du produit est plus intéressante que le score. Breeze TTS 2 repose sur deux idées que la plupart des modèles de synthèse vocale considèrent comme secondaires : la conception vocale et la direction vocale. La conception vocale est zero-shot et sans référence — vous décrivez une voix en langage naturel (« un narrateur chaleureux d'une quarantaine d'années avec un léger accent traînant du Sud et un humour pince-sans-rire ») et le modèle génère cette voix sans enregistrement en studio ni clip de référence. La direction vocale découple le timbre du locuteur de l'intention d'interprétation, afin de faire passer une réplique sur un ton sarcastique, chuchoté ou précipité sans que le modèle glisse vers un autre personnage. BreezeBlue affirme que la même identité de locuteur survit au changement, et son propre benchmark de direction vocale rapporte une similarité de locuteur de 0,67 SPK_SIM (chiffre communiqué par le fournisseur).

Ces deux capacités indiquent le marché visé par Breeze TTS 2. Les documents de presse sont explicites : personnages de jeux vidéo, compagnons numériques, narration, dramatiques radiophoniques et streamers virtuels — de l'audio long format, piloté par les rôles, avec plusieurs personnages, et pas simplement une autre API de narration. L'entreprise fournit une bibliothèque de voix d'appoint appelée Voice Galaxy, avec plus de 15 000 voix de personnages créées par la communauté et par les studios, et la démo de BreezeBlue est une dramatique radiophonique de fans à plusieurs personnages qui dure plus de dix minutes. Dans ses propres benchmarks publiés (fournis par le vendeur, non reproduits), Breeze TTS 2 revendique la première place du benchmark Voice Design de synthèse vocale avec un score Role Fit de 78,02 contre 72,78 pour MiMo-V2.5-TTS, et un composite Voice Direction de 4,25.

L'astérisque de licence

Avant que l’expression « open weights » ne fasse trop de travail de marketing, lisez la fiche du modèle. Breeze TTS 2 compte 3B de paramètres, safetensors, F32/BF16, et le code source est sous licence Apache 2.0 — mais les poids, les modèles dérivés et les sorties auto-hébergées ne sont autorisés que pour la recherche et l’usage non commercial, conformément à la licence breezeblue-research-and-non-commercial-license. Cela signifie que « open weights » ne veut pas dire ici « gratuit pour votre produit ». L’auto-hébergement commercial n’est pas autorisé par la licence telle qu’elle est rédigée ; la voie commerciale passe par l’API hébergée à 34 $ par million de caractères. C’est la même structure que plusieurs autres publications open de 2026 — inspectables et auto-hébergeables pour la recherche, mais avec l’usage générateur de revenus réservé à l’endpoint du fournisseur.

Pourquoi un routeur est important pour un modèle aussi jeune

Le véritable risque avec Breeze TTS 2 en ce moment n'est pas la qualité — c'est l'âge. Le modèle est en ligne depuis dix jours, et les poids depuis deux. Aucune équipe de production ne devrait miser un pipeline vocal sur un modèle aussi jeune sans disposer d'un moyen de s'en détacher, et c'est précisément le mode de défaillance qu'une couche de routage existe pour absorber. Si vous évaluez Breeze TTS 2 via une passerelle qui traite le point de terminaison du fournisseur comme une route parmi d'autres, vous obtenez le leader Elo aujourd'hui, un basculement automatique vers un fournisseur de secours lorsque l'API est dégradée, et un changement d'une ligne si un modèle vieux d'une semaine montre une régression. C'est la même discipline que le DSL de routage applique à tout modèle : le composer avec des alternatives, garder l'interface stable, et laisser le modèle faire ses preuves avant de le laisser devenir un élément porteur. Aucun des modèles de cette série n'est encore routé sur OrcaRouter lui-même, donc le conseil honnête est de brancher Breeze TTS 2 sur la passerelle que vous faites déjà tourner — et de garder votre fournisseur actuel actif en parallèle pendant que l'Elo mûrit et devient plus fiable.

Que regarder ensuite

Le créneau n°1 open-weights de Provider Voices est l'histoire du jour, mais c'est le plus faible des deux arènes pour ce modèle. Dans l'arène Controlled Voice d'Artificial Analysis, où tous les modèles sont comparés sur les mêmes voix de référence fixes, Breeze TTS 2 se classe n°3 parmi les modèles open-weights avec 1 002 Elo, derrière Voxtral de Mistral à 1 010 — et n°16 au total sur 39. Cet écart entre son score en voix de fournisseur (1 215, n°1 open) et son score en voix contrôlée (1 002, n°3 open) mérite d'être surveillé : il suggère que l'avantage de Breeze TTS 2 se concentre dans les voix qu'il conçoit pour lui-même, ce qui est exactement l'affirmation du produit, et c'est aussi exactement l'affirmation qu'un benchmark indépendant devrait continuer de contrôler. Surveillez si l'Elo en voix contrôlée se rapproche du nombre en voix de fournisseur, si la licence commerciale se resserre ou s'assouplit, et — surtout — si quelqu'un reproduit les benchmarks de conception vocale et de direction vocale en dehors de la propre suite de BreezeBlue.

Pour un modèle qui n'existait pas il y a un mois, Breeze TTS 2 a déjà gagné la chose la plus utile qu'un modèle de synthèse vocale puisse obtenir : un score indépendant qui confirme le marketing. Qu'il devienne une voix par défaut pour les produits interactifs dépend moins de la prochaine mise à jour Elo que de l'évolution de la licence et de l'aspect auto-hébergement — mais depuis cette semaine, la synthèse vocale à poids ouverts a un nouveau leader, et il a deux semaines.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.