Breeze TTS 2 — Der neue Open-Weights-TTS-Spitzenreiter bei 1.215 Elo. Regenerierte Abbildung.
Guides & Insights

Breeze TTS 2: Der neue Open-Weight-TTS-Spitzenreiter mit 1.215 Elo

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Breeze TTS 2 ist jetzt das bestplatzierte Open-Weights-Text-to-Speech-Modell in der Provider Voices Speech Arena von Artificial Analysis, mit 1.215 Elo – 90 Punkte Vorsprung auf den bisherigen Open-Weights-Führer Fish Audio S2 Pro, und insgesamt auf Platz 6 von mehr als 100 bewerteten Systemen. Die Auflistung ist die erste unabhängige Bestätigung dessen, was BreezeBlue seit der Vorstellung des Modells Mitte August 2026 behauptet hat: dass ein zwei Wochen altes Sprachmodell von einem Start-up mit etwa 15 Mitarbeitern an der kommerziellen Text-to-Speech-Spitze mithalten kann. Die offenen Gewichte wurden am 25. August 2026 auf Hugging Face veröffentlicht; das Arena-Ergebnis folgte innerhalb eines Tages. Was auch immer Breeze TTS 2 sonst noch sein mag, es ist keine Herstellerversprechung mehr – es hat eine Elo-Zahl, die das bestätigt.

Was tatsächlich passiert ist, der Reihe nach.

Der zeitliche Ablauf ist hier von Bedeutung, denn er erklärt, warum ein Beitrag über ein „Open-Weights-Leaderboard“ von einem Unternehmen stammt, von dem die meisten Menschen vor drei Wochen noch nie gehört hatten. BreezeBlue wurde von Yang Bin gegründet, einem ehemaligen technischen Mitgründer eines der führenden KI-Labore Chinas, mit einer Startfinanzierung von 6 Millionen US-Dollar, angeführt von Yuanjing Capital und Redpoint China. Das Modell durchlief drei sichtbare Meilensteine:

• 7. August 2026 — BreezeBlue hat seine eigene Text-to-Speech-Benchmark-Suite für Sprachdesign, Sprachregie und Latenzbewertung auf Hugging Face veröffentlicht.

Am 16.–17. August 2026 kündigte das Unternehmen Breeze TTS 2 offiziell als Echtzeit-Flaggschiff-Sprachmodell für interaktive Medien an und eröffnete eine gehostete API zu einem Preis von 34 $ pro 1 Million Zeichen.

• 25. August 2026 – die Gewichte und der PyTorch-Inferenzcode wurden auf Hugging Face als BreezeBlue/Breeze-TTS-2 veröffentlicht, ein 3B-Parametermodell unter einer Forschungs- und Nicht-Kommerziell-Lizenz.

Das Artificial Analysis Provider Voices Ranking war innerhalb weniger Tage nach der Veröffentlichung der Open-Weights live. Da die Arena Modelle anhand von blindem Side-by-Side-Hören bewertet, ist die 1.215 Elo kein Benchmark, den BreezeBlue an sich selbst durchgeführt hat — es ist das gesammelte Urteil von Zuhörern, die echte Samples miteinander vergleichen, und genau das fehlt einem so jungen Modell am meisten.

Die Anzeigetafel

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• Arena-Rang — #6 insgesamt bei Provider Voices; #1 unter allen Open-Weights-Modellen, vor Fish Audio S2 Pro (1.125 Elo).

• Elo — 1,215, mit einem 95-%-Konfidenzintervall von ungefähr ±17 (Artificial Analysis, Stand Ende August 2026).

• Sprachen — 50, laut BreezeBlue; die Modellkarte ist als Englisch und Chinesisch gekennzeichnet.

• Preis — $34 pro 1M Zeichen auf dem gehosteten Endpunkt von BreezeBlue; offene Gewichte sind kostenlos herunterladbar, unterliegen jedoch einer nicht-kommerziellen Lizenz.

• Geschwindigkeit — etwa 45 Zeichen pro Sekunde bei den Messungen von Artificial Analysis — langsamer als mehrere Konkurrenten, was bei langen Aufgaben wichtig ist.

• Latenz — Streaming-Latenz unter 40 ms, laut BreezeBlue (Herstellerangabe, nicht unabhängig gemessen).

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

Was Breeze TTS 2 tatsächlich anders macht

Die Elo bekommt die Schlagzeile, aber der Produktanspruch ist interessanter als die Punktzahl. Breeze TTS 2 basiert auf zwei Ideen, die die meisten Text-to-Speech-Modelle als nebensächlich behandeln: Stimmdesign und Stimmregie. Stimmdesign ist Zero-Shot und referenzfrei – Sie beschreiben eine Stimme in natürlicher Sprache („eine warme, Mitte 40 Jahre alte Erzählerstimme mit leichtem Südstaatenakzent und trockenem Witz“) und das Modell erzeugt diese Stimme ohne Studioaufnahme oder Referenzclip. Stimmregie entkoppelt das Timbre des Sprechers von der Vortragsabsicht, sodass Sie eine Zeile sarkastisch, gedämpft oder hastig klingen lassen können, ohne dass das Modell in eine andere Figur abdriftet. BreezeBlue sagt, dass dieselbe Sprecheridentität den Wechsel übersteht, und sein eigener Stimmregie-Benchmark meldet eine Sprecherähnlichkeit von 0,67 SPK_SIM (vom Anbieter gemeldet).

Diese beiden Fähigkeiten weisen auf den beabsichtigten Markt von Breeze TTS 2 hin. Die Pressematerialien sind eindeutig: Videospielfiguren, digitale Begleiter, narratives Geschichtenerzählen, Hörspiele und virtuelle Streamer – lange, rollengetriebene Audioinhalte mit mehreren Charakteren, nicht nur eine weitere Erzähl-API. Das Unternehmen liefert eine begleitende Stimmbibliothek namens Voice Galaxy mit mehr als 15.000 von Community und Studios erstellten Charakterstimmen, und die Demo-Reel von BreezeBlue ist ein mehrstimmiges Fan-Hörspiel, das über zehn Minuten läuft. In eigenen veröffentlichten Benchmarks (vom Anbieter gemeldet, nicht reproduziert) beansprucht Breeze TTS 2 den ersten Platz beim Text-to-Speech-Voice-Design-Benchmark mit einem Role-Fit-Score von 78,02 gegenüber 72,78 für MiMo-V2.5-TTS und einem Voice-Direction-Composite-Wert von 4,25.

Das Lizenzsternchen

Bevor die Formulierung „offene Gewichte“ zu viel Marketingarbeit leistet, lies die Modellkarte. Breeze TTS 2 hat 3B Parameter, safetensors, F32/BF16, und der Quellcode ist Apache 2.0 – aber die Gewichte, abgeleiteten Modelle und selbst gehosteten Ausgaben sind nur für Forschung und nicht-kommerzielle Nutzung lizenziert, unter der breezeblue-research-and-non-commercial-license. Das bedeutet: „Offene Gewichte“ ist hier nicht „kostenlos für dein Produkt“. Kommerzielles Self-Hosting ist laut Lizenz nicht gestattet; der kommerzielle Weg ist die gehostete API für 34 $ pro 1 Million Zeichen. Das entspricht dem Muster mehrerer anderer Open-Release von 2026 – für Forschung einsehbar und selbst hostbar, aber die umsatzbringende Nutzung bleibt dem eigenen Endpoint des Anbieters vorbehalten.

Warum ein Router für ein so junges Modell wichtig ist

Das ehrliche Risiko bei Breeze TTS 2 ist derzeit nicht die Qualität – sondern das Alter. Das Modell ist seit zehn Tagen live, die Gewichte seit zwei. Kein Produktionsteam sollte eine Sprach-Pipeline auf ein so junges Modell setzen, ohne eine Möglichkeit, sich davon zu lösen, und genau das ist die Fehlerart, die eine Routing-Schicht abfangen soll. Wenn Sie Breeze TTS 2 über ein Gateway evaluieren, das den Anbieter-Endpunkt als eine Route unter vielen behandelt, erhalten Sie heute die Elo-Spitzenposition, automatisches Failover zu einem Fallback-Anbieter, wenn die API beeinträchtigt ist, und eine Änderung in einer Zeile, wenn ein eine Woche altes Modell eine Regression zeigt. Das ist dieselbe Disziplin, die die Routing-DSL auf jedes Modell anwendet: Setzen Sie es mit Alternativen zusammen, halten Sie die Schnittstelle stabil, und lassen Sie das Modell sich beweisen, bevor Sie es tragend werden lassen. Keines der Modelle in dieser Serie ist bisher selbst auf OrcaRouter geroutet, also ist der ehrliche Rat, Breeze TTS 2 in das Gateway einzubinden, das Sie bereits betreiben – und Ihren aktuellen Anbieter parallel dazu aktiv zu halten, während der Elo älter und vertrauenswürdiger wird.

Was als Nächstes ansehen

Der Provider-Voices-#1-Open-Weights-Platz ist heute die Geschichte, aber er ist die schwächere der beiden Arenen für dieses Modell. In Artificial Analysis' Controlled-Voice-Arena, in der alle Modelle mit denselben festen Referenzstimmen verglichen werden, belegt Breeze TTS 2 mit 1.002 Elo den dritten Platz unter den Open-Weights-Modellen, hinter Mistrals Voxtral mit 1.010 – und insgesamt den 16. Platz von 39. Diese Lücke zwischen seinem Provider-Voice-Ergebnis (1.215, #1 Open) und seinem Controlled-Voice-Ergebnis (1.002, #3 Open) ist beobachtenswert: Sie deutet darauf hin, dass der Vorteil von Breeze TTS 2 in den Stimmen konzentriert ist, die es selbst entwirft – genau das ist der Produktanspruch, und genau das ist auch der Anspruch, den ein unabhängiger Benchmark unter Druck halten sollte. Beobachten Sie, ob sich das Controlled-Voice-Elo der Provider-Voice-Zahl annähert, ob sich die kommerzielle Lizenz verschärft oder lockert, und – vor allem – ob jemand die Voice-Design- und Voice-Direction-Benchmarks außerhalb von BreezeBlues eigener Suite reproduziert.

Für ein Modell, das vor einem Monat noch nicht existierte, hat Breeze TTS 2 bereits das Nützlichste verdient, was ein Text-to-Speech-Modell verdienen kann: einen unabhängigen Score, der mit dem Marketing übereinstimmt. Ob es zur Standardstimme für interaktive Produkte wird, hängt weniger vom nächsten Elo-Update ab als davon, wie sich die Lizenz- und Self-Hosting-Geschichte entwickelt – aber seit dieser Woche hat Open-Weight-Text-to-Speech einen neuen Spitzenreiter, und der ist zwei Wochen alt.

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.