
GPT-Live-1 vs. VoxCPM2: Das eine kostet 0,05 $ pro Minute, das andere kostet eine 24-GB-GPU
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Der sauberste Weg, GPT-Live-1 mit VoxCPM2 zu vergleichen, ist zu erkennen, dass sie nur wie Konkurrenten aussehen, bis man die Hardware beziffert. GPT-Live-1 ist OpenAIs Vollduplex-Sprachmodell, seit dem 10. September 2026 in der API für 0,05 US-Dollar pro Minute Sprache, ohne dass etwas installiert werden muss. VoxCPM2 ist OpenBMBs Open-Weight-Text-to-Speech-Modell mit 2 Milliarden Parametern, im April 2026 unter Apache 2.0 veröffentlicht, das mit etwa 8 GB VRAM läuft und von keinem Inferenzanbieter bereitgestellt wird – wenn man es also will, besitzt man die Maschine. Das eine ist ein Gespräch, das man sekundenweise mietet; das andere ist ein Synthesizer, den man selbst betreibt. Die Frage ist nicht, welches besser ist, sondern welches die eigene Arbeitslast tatsächlich aufnehmen kann.

Zwei Modelle, zwei Aufgaben, je eine ehrliche Spec-Zeile
• Funktion — GPT-Live-1 führt ein Gespräch: Es hört und spricht gleichzeitig, wechselt sich ab, geht mit Unterbrechungen und Rückmeldesignalen um und liefert Transkripte. VoxCPM2 wandelt Text in Sprache um. Es hört nie etwas.
• Zugang — GPT-Live-1 wird gehostet und ist geschlossen, eine Modell-ID hinter dem Live-Sessions-Endpunkt, wobei das veröffentlichte Integrationsbeispiel über WebRTC läuft. VoxCPM2 ist ein herunterladbarer Checkpoint auf Hugging Face und ModelScope, Apache 2.0, kostenlos für die kommerzielle Nutzung.
• Preis — GPT-Live-1 kostet 0,05 $ pro Sprachminute, sekundengenau abgerechnet, wobei das Delegation-Backend separat gemessen wird. VoxCPM2 kostet 0 $ pro Aufruf plus eine GPU, und Open-Source-Hosting ist das gesamte Kostenmodell.
• Ressourcenbedarf — GPT-Live-1 benötigt keine eigene Hardware. VoxCPM2 benötigt etwa 8 GB VRAM (6–8 GB bei Q4), Python 3.10+, PyTorch 2.5+ und CUDA 12+.
• Benchmarks — jede Sprachkennzahl von GPT-Live-1 stammt von OpenAI und wurde nicht reproduziert; das eine unabhängige Ranking führt es auf Platz sieben von elf. Die veröffentlichten Zahlen von VoxCPM2 stammen von OpenBMB, und die unabhängigen Messungen, die es zu seinen Mehrsprachigkeitsaussagen gibt, deuten in die andere Richtung.
Die 24-GB-Frage, bepreist
Die Serving-Zahlen von VoxCPM2 sind diejenigen, die entscheiden, ob Self-Hosting ein Hobby oder eine Architektur ist. Auf einer einzelnen RTX 4090 läuft das Modell mit einem Real-Time-Faktor von etwa 0,30 in reinem PyTorch und etwa 0,13 mit dem Nano-VLLM-Pfad – was in der schnelleren Konfiguration grob 7,7 Stunden generiertes Audio pro Stunde GPU-Zeit bedeutet. Dabei handelt es sich um die Angaben der Model Card selbst und nicht um eine externe Messung; ein unabhängiges Serving-Rezept, das auf einer 4090 mit CUDA 12.9 validiert wurde, meldet Real-Time-Faktoren im eingeschwungenen Zustand von etwa 0,120 für Zero-Shot-Synthese und 0,139 für Cloning, bei einem Spitzen-GPU-Speicher von knapp 22 GB von 24 GB. Beide Wertegruppen gelten im eingeschwungenen Zustand, nicht beim Kaltstart – die erste Anfrage in einem frischen Prozess ist deutlich langsamer, und das ist die Zahl, die Leute zitieren, wenn sie sagen, das Modell sei unbrauchbar.
Setz das neben die API. GPT-Live-1 kostet bei 0,05 $ pro Minute 3,00 $ für eine Stunde ununterbrochener Konversation. Eine auf dem freien Markt gemietete 24-GB-Karte liegt im niedrigen einstelligen Dollarbereich pro Stunde, und eine eigene amortisiert sich auf etwas Ähnliches, sobald die Auslastung eingerechnet wird. Der Vergleich landet also dort, wo solche Vergleiche üblicherweise landen, mit einer unangenehmen Asymmetrie: Die GPU-Rechnung kommt, egal ob jemand mit deinem Produkt spricht oder nicht, und die API-Rechnung skaliert an einem ruhigen Tag auf null und an einem geschäftigen auf fünfstellige Beträge. Die Batch-Synthese eines festen Katalogs ist wie gemacht für die GPU. Eine immer aktive Telefonleitung ist wie gemacht für den Zähler.
Was VoxCPM2 kann, was sonst nichts Offenes kann
VoxCPM2 verdient nicht deshalb so viel Aufmerksamkeit, weil es Benchmarks gewinnt – das tut es meistens nicht –, sondern weil es eine Stimme aus einer Textbeschreibung entwirft, ganz ohne Referenzaudio. Das ist eine wirklich neue Fähigkeit im Bereich der offenen Gewichte, und es verändert den Workflow für alle, die eine Stimme brauchen, die es noch nicht gibt: sie in Prosa probehören, in Prosa iterieren und erst dann entscheiden, ob man sie klonen möchte. Darüber hinaus vereint es 30 Sprachen plus neun chinesische Dialekte, 48-kHz-Ausgabe über eine integrierte Super-Resolution-Stufe und Fine-Tuning mit nur 5–10 Minuten Audio.
Die Evidenzbasis ist dünner als die Funktionsliste. Der eigene Bericht von OpenBMB nennt eine englische Wortfehlerrate von 1,84 % und eine chinesische Zeichenfehlerrate von 0,97 % sowie eine durchschnittliche Fehlerrate von 1,68 % über 30 Sprachen, gemessen an seinem eigenen Datensatz mit 500 Äußerungen pro Sprache und bewertet durch das Modell eines anderen Anbieters. Wo ein unabhängiger Test existiert, ist die Lücke groß: Im mehrsprachigen Testset von MiniMax, bewertet mit Whisper-large-v3, liegt Hindi bei 19,70 und Arabisch bei 13,05 – um ein Vielfaches schlechter als die selbst berichteten Werte. OpenBMB warnt außerdem, dass Stimmdesign und Stilsteuerung zwischen Durchläufen variable Ergebnisse liefern, und empfiehlt, ein- bis dreimal zu generieren, um die gewünschte Ausgabe zu erhalten – was auf subtile Weise sagt, dass ein brauchbares Ergebnis nicht zum Preis eines einzigen Aufrufs zu haben ist.
Die Integrationssteuer, die niemand in den Vergleich aufnimmt
Ein unspektakuläres Detail entscheidet darüber, ob VoxCPM2 eine Woche Arbeit oder einen Monat bedeutet. Sein Hugging-Face-Repository trägt das Tag voxcpm statt transformers, was bedeutet, dass die Bibliothek, mit der nahezu alles andere auf dieser Website geladen wird, dieses Modell nicht laden kann. Der Pull Request, der das beheben sollte, wurde am 4. August 2026 geöffnet und war bei unserer letzten Prüfung noch nicht gemergt. Pull Requests, um es zu anderen Serving-Stacks hinzuzufügen, wurden bereits gemergt, und die Akzeptanz steht außer Frage: 393.079 Downloads in den letzten dreißig Tagen zum Zeitpunkt dieser Erfassung, mit 27 Adaptern, 30 Finetunes, 12 Quantisierungen und 100 Spaces, die auf dem Checkpoint aufbauen.

Die äquivalente Abgabe von GPT-Live-1 ist eine Neuimplementierung des Transports. Seine Sitzungen sind um eine Live-Verbindung herum aufgebaut statt um einen Request-Response-Audio-Endpunkt, und die Abrechnung über zwei Zähler bedeutet, dass jeder delegierte Reasoning-Aufruf, jeder Tool-Aufruf und jede Websuche zusätzlich zur Sprachminute zu den eigenen Tarifen des Backend-Modells berechnet wird. Teams, die von einer token-abgerechneten Echtzeit-Integration umsteigen, sollten den Wechsel als Engineering-Aufgabe einplanen, nicht als Austausch einer Modell-ID.
Wo eine Routing-Schicht tatsächlich hilft
OrcaRouter führt weder GPT-Live-1 noch VoxCPM2, und es lohnt sich, das klar zu sagen, anstatt den Rest dieses Abschnitts etwas anderes implizieren zu lassen. Die Sprachschicht von GPT-Live-1 liegt hinter OpenAIs eigenem Endpunkt; VoxCPM2 hat überhaupt keinen gehosteten Anbieter. Keines von beiden kann man mit unserem Schlüssel aufrufen.
Der Grund, warum die Routing-Frage immer wieder aufkommt, ist, dass beide Modelle am Rand einer Pipeline sitzen, deren Mitte Text ist. Ein VoxCPM2-Deployment antwortet üblicherweise auf etwas — einen Skriptgenerator, einen Übersetzungsschritt, einen Textnormalisierer, ein Dialogmodell, das entscheidet, was als Nächstes gesprochen wird — und das sind ganz gewöhnliche Modellaufrufe. Eine GPT-Live-1-Session delegiert ihr Denken an ein Backend-Modell, das in der Session-Konfiguration benannt wird, und in OpenAIs eigener Dokumentation ist dieses Backend GPT-5.6 Terra, das über OrcaRouter zum OpenAI-Listenpreis verfügbar ist. Die Client-Delegation geht noch weiter und lässt Ihre eigene Anwendung das Backend stellen, was bedeutet, dass das Modell hinter der Stimme ein beliebiger Endpunkt sein kann, den Sie kontrollieren. Rund 190 Modelle von elf vorgelagerten Anbietern stehen hinter einem Schlüssel zum Listenpreis ohne Aufschlag — wenn ein Anbieter also einen Preis senkt, ist die Senkung hier noch am selben Tag live statt erst bei der Verlängerung — mit automatischem Failover über Anbieter hinweg und einer Routing-DSL, um mehrere Modelle zu einem einzigen Aufruf zu kombinieren. Günstige Absicherung für die Hälfte des Stacks, die sich am häufigsten ändert.
Eine Warnung gehört in diesen Abschnitt, statt darin vergraben zu werden, denn sie ist das Detail, das die GPT-Live-1-Hälfte dieses Vergleichs weniger gefestigt erscheinen lässt, als es die Hersteller-Benchmarks nahelegen. Im unabhängigen Artificial Analysis Speech to Speech Index erreicht GPT-Live-1 69,8 % – Siebter von elf, hinter GPT-Realtime-2.1 mit 73,9 % und Grok Voice Think Fast 2.0 mit 79,0 %. Das Modell ist mit 4,42 $ pro Stunde Eingabe-Audio das günstigste auf dieser Rangliste, und es ist nicht das beste. Rechnen Sie mit der Möglichkeit, dass die Sprachschicht, die Sie als Standard festlegen, nicht diejenige ist, die Sie behalten.

Welches, wofür
Nehmen Sie VoxCPM2, wenn der Text vor dem Audio existiert. Erzählstimme, Hörbücher, Synchronisation, Barrierefreiheit, Sprachzeilen für Spiele, ein Produkt, das eine Stimme braucht, die noch niemand aufgenommen hat — und besonders jede Arbeitslast, bei der das Volumen hoch und vorhersehbar ist und die einen festen Kapitalaufwand rechtfertigt. Akzeptieren Sie, dass Sie es selbst betreiben werden, dass die Werkzeuge drumherum noch nicht gefestigt sind und dass die Qualitätsversprechen zur Mehrsprachigkeit Ihren eigenen Hörtest verdienen, bevor sie einen Kunden erreichen.
Nehmen Sie GPT-Live-1, wenn am anderen Ende ein Mensch ist. Sprachagenten, Telefonsupport, Aufnahmeabläufe – alles, wo das Modell in Echtzeit entscheiden muss, ob der Mensch fertig gesprochen hat. Zahlen Sie den Minutenpreis für das Privileg, die Verantwortung für das Problem nicht selbst tragen zu müssen, und veranschlagen Sie das delegierte Backend als separate Budgetposition, denn dort entscheidet sich, ob der Anruf günstig oder teuer wird.
Der Fehler besteht darin, sie in einem Bake-off als Alternativen zu behandeln. Für die meisten Teams, die beides brauchen, sind sie zwei Schichten desselben Produkts, und die einzige wirklich falsche Antwort ist, die selbst gehostete Variante zu wählen, weil in der Lizenz „kostenlos“ steht, ohne die GPU einzupreisen, die das erst wahr macht.
