
GPT-Live-1 vs. Breeze TTS 2: Der Open-Weights-Sprachführer, den Sie nicht ausliefern können
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Breeze TTS 2 ist das am höchsten bewertete Text-to-Speech-Modell mit offenen Gewichten in der Provider Voices Speech Arena von Artificial Analysis, hält 1.205 Elo und liegt insgesamt auf Platz sieben unter mehr als hundert bewerteten Systemen – vor jeder kommerziell lizenzierten Engine, die ihre Gewichte veröffentlicht. Seine Gewichte sind seit dem 25. August 2026 herunterladbar. Außerdem ist es unter der Lizenz, mit der diese Gewichte ausgeliefert werden, in einem Produkt nicht verwendbar. GPT-Live-1 ist in jeder Hinsicht der umgekehrte Kompromiss: geschlossen, gehostet, mit 0,05 US-Dollar pro Minute Sprache abgerechnet, seit es am 10. September 2026 in die Entwickler-API von OpenAI aufgenommen wurde, und der Einzige der beiden, der hören kann, wenn ein Anrufer ihn unterbricht.
Stellen Sie diese beiden Sätze nebeneinander, und der Vergleich klärt sich schneller als die meisten Modellvergleiche. Es geht nicht um die Frage, welches Modell Sprache besser synthetisiert. Es geht um die Frage, ob Sie eine Stimme oder eine Konversation kaufen, und ob „offen“ bedeutet, was Sie angenommen haben.
Sie sind nicht dieselbe Art von Sache, und genau darum geht es.
Breeze TTS 2, von einem Startup namens BreezeBlue mit rund fünfzehn Mitarbeitern, ist ein Text-to-Speech-Modell mit 3 Milliarden Parametern. Text geht rein, Audio kommt raus. Es hört nichts. Es hat keine Meinung dazu, wann ein Turn enden sollte, weil es kein Konzept von einem Turn hat. Über einen WebSocket gestreamt, beginnt es mit der Audioausgabe, bevor dein Text fertig generiert ist, was wirklich nützlich ist, um den Takt eines Voice-Agents straff zu halten – aber die Entscheidung darüber, wann gesprochen wird, hat das getroffen, was den Text geschrieben hat.
GPT-Live-1 ist ein Vollduplex-Sprach-zu-Sprach-Modell. Audio und Text gehen hinein; Audio und Text kommen heraus; und das Modell entscheidet mehrmals pro Sekunde, ob es weiter zuhören, pausieren, den Turn übernehmen oder ihn abgeben soll. Die eigenen Zahlen des Full Duplex Bench v1.5 von OpenAI, die mit der Veröffentlichung publiziert und außerhalb des Unternehmens nicht reproduziert wurden, beziffern seine Interaktivität auf 80,1 % gegenüber 45,4 % für GPT-Realtime-2.1, mit einer Turn-Taking-Latenz von 0,798 Sekunden gegenüber 1,41.
Diese Asymmetrie ist keine Kritik an Breeze TTS 2. Sie ist ein Hinweis darauf, wo jedes von beiden in einem Stack hingehört. Wenn Sie eine Kaskade aufbauen – Spracherkennung, die ein Sprachmodell speist, das wiederum einen Synthesizer speist –, ist Breeze TTS 2 ein Kandidat für das letzte Drittel davon. Wenn Sie GPT-Live-1 kaufen, kaufen Sie den gesamten Kreislauf und übergeben damit auch die Logik des Sprecherwechsels.
Dimension für Dimension
• Interaktionsmodell — GPT-Live-1: Vollduplex, natives Barge-in, hört zu, während es spricht, vs. Breeze TTS 2: Streaming-Text-zu-Sprache, überhaupt keine Audioeingabe
• Gewichte — GPT-Live-1: geschlossen, nur gehostet, eine Modell-ID und keine datierten Snapshots vs. Breeze TTS 2: 3B Parameter auf Hugging Face seit 25. August 2026, PyTorch-Inferenzcode Apache-2.0
• Lizenz — GPT-Live-1: kommerzielle Bedingungen über die API von OpenAI, nichts zu prüfen vs. Breeze TTS 2: eine Forschungs- und nichtkommerzielle Lizenz, die die Gewichte, Fine-Tunes, LoRAs, Merges, Quantisierungen und selbst gehostete Ausgaben abdeckt
• Preiseinheit — GPT-Live-1: 0,05 $ pro Sprachminute, sekundengenau abgerechnet, Reasoning-Backend separat abgerechnet vs. Breeze TTS 2: 34 $ pro Million Zeichen auf dem gehosteten Endpunkt, mit Staffelung bis hinunter zu 28 $ beim höchsten veröffentlichten Tarif
• Qualitätsbelege — GPT-Live-1: 70,3 % im Artificial Analysis Speech to Speech Index, geteilter sechster Platz von vierzehn bewerteten Modellen gegenüber Breeze TTS 2: 1.205 Elo in der Provider Voices Arena, insgesamt Siebter und Erster unter den Open-Weights-Modellen, laut Artificial Analysis
• Sprachen — GPT-Live-1: Die Launch-Berichterstattung bemängelt durchgängig uneinheitliche Flüssigkeit außerhalb der großen Sprachen gegenüber Breeze TTS 2: 50 laut Anbieter, wobei die Modellkarte für Englisch und Chinesisch gekennzeichnet ist
• Sprachsteuerung — GPT-Live-1: zwölf API-Stimmen, Ton und Tempo per Prompt gesteuert, überhaupt kein Klonen vs. Breeze TTS 2: Klonen per Referenzaudio, referenzfreies Stimmdesign, Stimmregie und Inline-Vokalereignisse
• Durchsatz — GPT-Live-1: wird nach gleichzeitigen Sitzungen abgerechnet, begrenzt auf 25 in Tarif 1 und 500 in Tarif 5, ohne kostenlose Stufe, im Vergleich zu Breeze TTS 2: rund 45 Zeichen pro Sekunde laut der Messung von Artificial Analysis, was langsamer als mehrere kommerzielle Konkurrenten ist und bei Langform-Arbeiten von Bedeutung ist

Die Lizenz verrichtet mehr Arbeit als die Rangliste
BreezeBlues eigene Modellkarte ist diesbezüglich ungewöhnlich unverblümt, was dem Unternehmen zur Ehre gereicht. Der Inferenzcode steht unter Apache-2.0. Die Gewichte und alle Ausgaben, die Sie durch deren Selbsthosting erzeugen, sind für Forschungszwecke bestimmt, und der kommerzielle Einsatz erfordert entweder ein kostenpflichtiges gehostetes Abonnement oder eine schriftliche Genehmigung. Diese Einschränkung erstreckt sich ausdrücklich auf abgeleitete Modelle, LoRAs, Merges und Quantisierungen – was das Schlupfloch schließt, zu dem man normalerweise greift.
Also braucht die Formulierung „Anführer bei offenen Gewichten“ eine Einschränkung, die Schlagzeilen selten mitliefern. Breeze TTS 2 ist in dem Sinne offen, dass man es herunterladen, inspizieren, benchmarken und zur Evaluierung auf eigener Hardware ausführen kann. Es ist nicht in dem Sinne offen, der ein Start-up darauf ein Produkt bauen lässt, ohne entweder BreezeBlue zu bezahlen oder eine rechtliche Prüfung zu kaufen. Zwei der drei Dinge, die Leute mit offenen Gewichten meinen – Überprüfbarkeit und Kosten – bekommt man. Das dritte – die Freiheit, es auszuliefern – nicht.
Das ist ein echter Unterschied zu einem Modell wie GPT-Live-1, bei dem die Lizenzfrage nicht „darf ich“ lautet, sondern „wie viel“. Beide enden mit einer Rechnung. Nur bei einem von beiden steht am Ende zuerst die Einschätzung eines Anwalts.

Die beiden Preiseinheiten lassen sich nicht vergleichen, hier also die Rechnung
0,05 $ pro Minute und 34 $ pro Million Zeichen wirken, als stammten sie aus verschiedenen Universen – denn genau das tun sie. Um sie zu vergleichen, muss man umrechnen. Gesprochene Sprache läuft mit ungefähr 150 Wörtern pro Minute, und Englisch kommt im Durchschnitt auf etwa fünfeinhalb Zeichen pro Wort, wenn man Leerzeichen mitzählt; damit entspricht eine Minute gesprochener Ausgabe grob 800 bis 900 Zeichen. Bei den 34 $ pro Million von Breeze TTS 2 sind das etwa drei Cent Synthese pro Minute – günstiger als die fünf von GPT-Live-1, bezogen auf die reine Sprachausgabe.
Der Vergleich zerfällt unmittelbar danach, denn die fünf Cent von GPT-Live-1 beinhalten das Zuhören. Es transkribiert außerdem den Anrufer, entscheidet, wann der Turn endet, und kümmert sich um die Unterbrechung — Arbeit, die eine Kaskade von woanders einkaufen muss: ein Spracherkennungsmodell, ein Turn-Detection-Modell und ein Sprachmodell, um den Text zu erzeugen, den Breeze TTS 2 vorlesen wird. Rechnet man diese hinzu, steht die Kaskade mit ihren drei Cent für die Synthese unter einer Rechnung, die üblicherweise größer ist als die des End-to-End-Modells.
Die ehrliche Zusammenfassung ist, dass die günstigere Stimme Breeze TTS 2 ist und das günstigere Gespräch GPT-Live-1, und der Unterschied zwischen diesen beiden Aussagen ist alles, was ein Voice-Agent tatsächlich kostet.

Wo sie sich tatsächlich treffen würden
Ein Team, das heute einen Telefonagenten baut und sich nicht auf den End-to-End-Stack eines einzigen Anbieters festlegen will, würde genau diese Kaskade zusammenstellen: Breeze TTS 2 oder eine vergleichbare Engine für den Mund, etwas anderes für die Ohren und ein geroutetes Sprachmodell für das Denken. Das letzte dieser drei ist der Teil, der sich am häufigsten ändert – dort verbessert sich die Qualität am schnellsten, dort schwanken die Kosten am stärksten, und dort ist das Modell, das dieses Quartal gewinnt, selten das, das nächste gewinnt.
Diese Ebene ist ein normaler API-Aufruf und der einzige Teil dieses Stacks, der portabel bleiben sollte. Ungefähr 190 Modelle von elf vorgelagerten Anbietern stehen hinter einem einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass der Austausch des Reasoning-Modells hinter einem Voice-Agent eine Konfigurationsänderung statt eines Integrationsprojekts ist, und automatisches Failover verhindert, dass ein Backend, das in einen Timeout läuft, den Anruf abbricht. Weder der Live-Sessions-Endpunkt von GPT-Live-1 noch die gehostete API von Breeze TTS 2 ist auf diesem Weg erreichbar — die Voice-Ebenen in diesem Vergleich liegen außerhalb der Reichweite einer Routing-Ebene, und es lohnt sich, das klarzustellen, statt etwas anderes zu implizieren.
Welches soll man wählen?
Wählen Sie GPT-Live-1, wenn das Gespräch das Produkt ist und Sie ein gehostetes, geschlossenes Frontend akzeptieren können. Reservierungs-Hotlines, First-Level-Support, alles, wo es der Normalfall und nicht die Ausnahme ist, dass ein Anrufer dem Agenten ins Wort fällt. Sie kaufen die Unterbrechungsbehandlung, und Sie kaufen sie zu einem Minutentarif, der berechenbar bleibt, während das Reasoning dahinter der Teil ist, den Sie justieren.
Wählen Sie Breeze TTS 2, wenn Sie eine Stimme benötigen, die Sie prüfen können, wenn Sie ein Produkt entwickeln, bei dem die Synthese eine Komponente unter vielen ist, oder wenn Sie Klonen und Voice-Design benötigen, die GPT-Live-1 überhaupt nicht bietet. Gehen Sie mit dem Wissen hinein, dass die Gewichte für Forschungszwecke bestimmt sind, dass die Behauptung von 50 Sprachen eine Herstellerangabe ist, die einer für zwei Sprachen gekennzeichneten Karte gegenübersteht, und dass die Latenzwerte BreezeBlues eigene Messungen auf einem vorgewärmten schnellen Pfad und kein unabhängiges Audit sind.
Der Instinkt, das als Qualitätswettbewerb zu behandeln, ist der falsche Instinkt. Breeze TTS 2 ist nahe an der Spitze des Feldes, auf dem es antritt, und GPT-Live-1 tritt auf einem völlig anderen Feld an. Die Entscheidung, die tatsächlich Geld kostet, ist die, die unter beiden liegt: Welches Modell übernimmt das Denken, und ob du es dir an einem Nachmittag anders überlegen kannst.
