Eine generierte Hero-Karte für „Gemini 3.8 TTS vs. VoxCPM2“ auf weißem Hintergrund mit sanften blau- und cyanfarbenen Verlaufsakzenten. Die linke Karte „Gemini 3.8 Flash TTS“ listet einen API-Endpunkt, Elo 1.260 auf Rang 2 und 16,50 $ pro 1 Mio. normalisierte Zeichen auf; die rechte Karte „VoxCPM2“ listet Apache 2.0, 2 Mrd. Parameter, rund 8 GB VRAM zum Ausführen, einen Echtzeitfaktor von 0,30 in reinem PyTorch und keinen gehosteten Endpunkt auf. Eine Fußzeile lautet: „Elo pro Artificial Analysis Provider Voice Arena, Sept. 2026; VoxCPM2-Angaben laut seiner Modellkarte.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

Gemini 3.8 TTS vs. VoxCPM2: Eine Stimme mieten oder selbst betreiben – in echten Zahlen

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Es gibt keine Bestenlisten-Zeile, die Gemini 3.8 Flash TTS und VoxCPM2 nebeneinanderstellt, und dieses Fehlen ist die nützlichste Tatsache in diesem Vergleich. Gemini 3.8 Flash TTS ist ein gehosteter Endpunkt mit einem Elo von 1.260 auf Rang 2 in der Artificial Analysis Provider Voice Arena und einer veröffentlichten Preisliste in Tokens. VoxCPM2 ist ein OpenBMB-Checkpoint – 2 Milliarden Parameter, Apache 2.0, veröffentlicht im April 2026 –, den kein Inferenzanbieter hostet. Man kann es nicht mieten. Man betreibt es selbst.

Es geht also nicht darum, welches Modell besser klingt. Es geht darum, ob Ihrem Workload besser damit gedient ist, pro Zeichen für die GPUs von jemand anderem zu bezahlen, oder damit, die GPUs zu besitzen und für sie zu bezahlen, ob sie arbeiten oder nicht. Das ist eine Rechenfrage, und anders als bei den meisten Modellvergleichen gibt es darauf eine Antwort, die Sie berechnen können, bevor Sie sich festlegen.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

Eines davon mietet man, das andere bedient man.

Beginne mit dem, was dir jedes einzelne tatsächlich in die Hand gibt.

• Zugriff — Gemini 3.8 Flash TTS ist ausschließlich per API verfügbar und wird über die Gemini API sowie die in der Ankündigung vom 23. September 2026 genannten Google-Oberflächen aufgerufen. VoxCPM2 hat keinen First-Party-Endpunkt im Produktivbetrieb und keinen Inferenzanbieter, der es bereitstellt; der Checkpoint ist das Produkt.

• Lizenz — VoxCPM2 erscheint unter Apache 2.0, was kommerzielle Nutzung ohne separate Vereinbarung erlaubt. Das ist eine wirklich freizügige Lizenz, und sie ist nicht der Standard für offene Sprachgewichte; etliche davon erscheinen unter Bedingungen, die nur Forschung zulassen und kommerzielle Nutzung zurück über eine gehostete API lenken.

• Größe — VoxCPM2 hat 2 Mrd. Parameter und passt bei reduzierter Präzision für die Entwicklung in etwa 8 GB VRAM, wobei die Serving-Spitzenlast auf einer 24-GB-Karte bei rund 22 GB liegt. Google hat für keines der beiden Gemini 3.8 TTS-Modelle eine Parameteranzahl veröffentlicht.

• Stimmenerstellung — Gemini 3.8 Flash TTS führt Stimmdesign anhand einer schriftlichen Beschreibung, Stimmreplikation anhand einer 30-sekündigen Probe und einen Dialog mit zwei Sprechern in einem Aufruf durch. VoxCPM2 ist ein Text-zu-Sprache-Modell mit einer einzigen Stimme; ein Gespräch besteht aus zwei zusammengefügten Durchläufen.

• Unabhängige Bewertung – Flash TTS hat eine. VoxCPM2 erscheint nicht unter den gereihten Einträgen auf der Provider Voice Arena, erfasst am 24. September 2026. Das Fehlen auf einer Bestenliste ist kein Urteil über die Qualität – es bedeutet meist, dass niemand das Modell eingereicht hat –, aber es bedeutet, dass es keinen Drittanbieter-Präferenzwert gibt, den man abwägen könnte.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Dieser letzte Punkt hat zwei Seiten und sollte klar ausgesprochen statt beschönigt werden: Wenn du vor deiner Entscheidung ein unabhängiges Qualitätssignal brauchst, liefert nur eine der beiden eines.

Die Zahl, die den Ausschlag gibt: Echtzeitfaktor

Das Selbsthosting eines Sprachmodells verwandelt eine Abrechnung pro Zeichen in eine Abrechnung pro GPU-Stunde, und der Wechselkurs zwischen diesen beiden Einheiten ist der Echtzeitfaktor des Modells – wie viele Sekunden Rechenzeit es braucht, um eine Sekunde Audio zu erzeugen.

Die veröffentlichten Werte von VoxCPM2 liegen bei 0,30 in reinem PyTorch und bei 0,13 unter Nano-VLLM. Lesen Sie diese als Durchsatz, nicht als Latenz: Bei 0,13 erzeugt eine GPU-Stunde Wanduhrzeit etwas in der Größenordnung von 7,7 Stunden fertigem Audio. Bei 0,30 erzeugt dieselbe GPU-Stunde eher 3,3 Stunden. Das sind die eigenen Zahlen der Model Card, gemessen von OpenBMB, und sie sind die wichtigste einzelne Eingangsgröße für jede Build-versus-Buy-Entscheidung hier.

Daraus folgen drei Dinge.

• Der Serving-Stack ist wichtiger als das Modell. Der Wechsel von reinem PyTorch zu Nano-VLLM mehr als verdoppelt den Durchsatz auf identischer Hardware. Jedes Kostenmodell, das auf dem Wert 0,30 basiert, überschätzt die Self-Hosting-Kosten um den Faktor etwa 2,3.

• Auslastung ist das A und O. Eine gemietete GPU, die 90 % der Zeit im Leerlauf ist, ist zu keinem Preis günstiger als eine API. Der Break-even stellt sich erst ein, wenn Sie die Karte beschäftigt halten.

• Batching ändert die Rechnung erneut. Der Echtzeitfaktor wird pro Stream gemessen; ein Server, der gleichzeitige Anfragen bearbeitet, amortisiert die Fixkosten über sie hinweg – und genau das ist das Regime, in dem Self-Hosting beginnt zu gewinnen.

Was eine Stunde Audio kostet – in beide Richtungen

Setzen Sie die beiden Abrechnungsmodelle auf dieselbe Achse. Eine Stunde fertiges Audio entspricht 3.600 Sekunden Ausgabe.

Bei den Mietangeboten rechnet Google in Tokens statt in Zeichen ab: 0,50 $ pro Million eingegebener Text-Tokens und 9,00 $ pro Million ausgegebener Audio-Tokens bis zum 31. Dezember 2026, danach 18,00 $; Flash-Lite TTS liegt bei 0,50 $ und 6,00 $, danach 12,00 $. Batch und Flex kosten 0,25 $ und 4,50 $ für Flash TTS gegenüber 0,25 $ und 3,00 $ für Flash-Lite TTS, und Priority liegt bei 0,90 $ und 16,00 $. Artificial Analysis normalisiert die Standardtarife auf 16,50 $ und 11,00 $ pro Million Zeichen, was die Umrechnung des Boards und nicht eine Preisangabe von Google ist, und dieser Wert ist zu verwenden, wenn man ihn mit einem Modell vergleicht, das in Zeichen abrechnet.

Auf der eigenen Seite gibt es überhaupt keinen Preis pro Zeichen. Die Kosten sind die GPU-Stunde, multipliziert mit der Anzahl an Stunden, die man bei dem obigen Durchsatz braucht, plus der Serving-Stack, plus die Leute, die ihn am Laufen halten. VoxCPM2s Vorteil ist, dass die Grenzkosten der tausendsten Stunde dieselben sind wie die der ersten — und sein Nachteil ist, dass die Grenzkosten der ersten Stunde eine GPU sind.

Deshalb ist die Entscheidung ungewöhnlich eindeutig:

• Unterhalb eines bestimmten Volumens gewinnt die API – und zwar deutlich. Sie zahlen einstellige Dollarbeträge pro Stunde Audio im Vergleich zu Kapitalkosten, und der Aktionspreis von Google vergrößert diese Lücke bis zum 1. Januar 2027.

• Oberhalb dieses Volumens gewinnt der Apache-2.0-Checkpoint auf Hardware, die Sie bereits besitzen und auslasten können, eindeutig – und anders als bei einem forschungslizenzierten Checkpoint hindert Sie nichts an der Lizenz daran, ihn auszuliefern.

• Dazwischen ist die ehrliche Antwort, dass Sie eher Wahlfreiheit als Einsparungen kaufen. Self-Hosting verschafft Ihnen die Möglichkeit, eine Version festzuschreiben, Audio auf Ihrer eigenen Infrastruktur zu behalten und sich nicht mehr um Tarifänderungen eines Anbieters kümmern zu müssen.

Wo jede einzelne die richtige Antwort ist

Wählen Sie Gemini 3.8 Flash TTS, wenn Sie das besser dokumentierte Produkt möchten. Es hat eine unabhängige Bewertung, einen veröffentlichten Preis, Zwei-Sprecher-Dialog in einem einzigen Aufruf, Voice-Design und -Replikation und keine operative Oberfläche außer einem API-Schlüssel. Sein Schwestermodell Flash-Lite TTS bietet Ihnen einen zweiten Preispunkt innerhalb derselben Schnittstelle zu normalisierten 11,00 $ pro Million Zeichen. Was Sie im Gegenzug akzeptieren, ist ein Tarif, der sich am 1. Januar 2027 verdoppelt, und keine Möglichkeit, das Modell irgendwo auszuführen.

Nimm VoxCPM2, wenn die operative Arbeit der eigentliche Punkt ist. Apache 2.0 bedeutet, dass kommerzielle Nutzung ohne Weiteres erlaubt ist, die 2B-Größe bedeutet, dass ein einziger Beschleuniger ausreicht, und der Echtzeitfaktor von 0,13 unter Nano-VLLM bedeutet, dass eine eher kleine Karte mehrere Stunden Audio pro Stunde Wanduhrzeit erzeugt. Was du in Kauf nimmst, ist, dass niemand sonst es für dich betreiben wird: kein gehosteter Endpunkt, keine Arena-Zeile, keine Preisliste eines Anbieters, und jede Qualitätsgarantie, die du bekommst, ist eine, die du selbst aufbaust und misst.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Keines der beiden Modelle wird von OrcaRouter gehostet, und das sollte man direkt sagen, statt etwas anderes nahezulegen. Die Stelle, an der man Gemini 3.8 Flash TTS aufruft, ist Googles eigene API und die von Google genannten Oberflächen; VoxCPM2 ist ein Checkpoint, den man selbst bereitstellt. Was OrcaRouter abdeckt, ist die Ebene über dieser Entscheidung — über 200 Modelle hinter einem Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist statt erst zum nächsten Abrechnungszyklus, automatisches Failover sodass ein Modell, das gerade evaluiert wird, nie eine Produktionsabhängigkeit sein muss, und eine Routing-DSL, die mehrere Modelle zu einem Aufruf zusammenführt, wenn eine einzelne Stimme nicht die ganze Aufgabe tragen kann.

Was als Nächstes ansehen

Zwei Dinge würden diesen Vergleich wesentlich verändern, und keines von beiden ist bisher eingetreten.

Das Erste ist jemand, der VoxCPM2 hostet. Seine Abwesenheit auf dem Inferenzmarkt ist der Hauptgrund dafür, dass die beiden Modelle eher nach Wirtschaftlichkeit als nach Qualität verglichen werden — wenn ein Anbieter es aufgreift, ist die Rechnung „Mieten versus Eigenbetrieb" nicht mehr der entscheidende Faktor, und die fehlende Zeile in der Arena wird zu dem, was man ausgefüllt sehen möchte.

Der zweite Punkt ist die Preisänderung im Januar aufseiten von Google. Zum Aktionspreis ist die API günstig genug, dass die meisten Workloads nichts selbst hosten sollten; beim Preis nach der Aktion verengt sich die Lücke so weit, dass ein Team mit vorhandener GPU-Kapazität und stetigem Volumen die Zahlen erneut durchrechnen sollte, anstatt anzunehmen, dass die API weiterhin gewinnt.

Bis sich eines davon bewegt, ist die entscheidende Eingangsgröße nicht eine Bestenliste. Sie besteht darin, wie viele Stunden Audio du pro Monat produzierst, und darin, ob die Karte ausgelastet ist.