
GPT-Live-1 vs. ElevenLabs: Ein Modell, das zuhört, ein Unternehmen, das alles andere verkauft
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Die nützlichste Zahl in diesem Vergleich ist 90,5 %. Das ist die Aufgaben-Erfolgsrate, die Artificial Analysis für ElevenLabs Agents in seiner Speech Agent Arena gemessen hat – der höchste Wert unter den Top Sechs dieser Rangliste, erreicht von einem System, das überhaupt kein einzelnes Modell ist, sondern eine Kaskade aus Spracherkennung, einem Sprachmodell und einem Synthesizer, zusammengefügt durch ElevenLabs' eigene Turn-Taking-Logik. GPT-Live-1, OpenAIs End-to-End-Vollduplex-Modell, erscheint nicht in dieser Rangliste, weil es in einer anderen antritt: dem Speech to Speech Index, wo es mit 70,3 % gleichauf auf dem sechsten Platz von vierzehn liegt. Unterdessen bleibt ElevenLabs Eleven v3 die am breitesten eingesetzte Produktionsstimme der Branche, mit mehr als 10.000 Stimmen in der Bibliothek und über 70 Sprachen.
Die Kurzformel lautet, dass die eine Seite einem ein Gespräch verkauft und die andere einem ein Unternehmen. Diese Kurzformel ist größtenteils richtig, und sie verbirgt den interessanteren Befund darunter: Eine gut konstruierte Kaskade schlägt beim Erledigen der Aufgabe noch immer ein natives Vollduplexmodell.
Zwei Architekturen – und der Unterschied liegt darin, wo die Nahtstellen sind
GPT-Live-1 ist ein einzelnes Modell, das Audio und Text entgegennimmt und Audio und Text ausgibt. Es kommt nativ mit Unterbrechungen zurecht – OpenAIs eigene Tests, veröffentlicht mit dem API-Release im September und außerhalb des Unternehmens nicht reproduziert, berichten von 80,1 % Interaktivität auf Full Duplex Bench v1.5 gegenüber 45,4 % für GPT-Realtime-2.1 sowie einer Turn-Taking-Latenz von 0,798 Sekunden gegenüber 1,41. Es gibt keine Nahtstellen, denn es gibt nichts zusammenzunähen.
ElevenLabs Agents ist bewusst die Gegenwette. Die Dokumentation von ElevenLabs beschreibt eine Pipeline: abgestimmte Spracherkennung, ein Sprachmodell, das Sie wählen oder selbst mitbringen, einen Synthesizer mit niedriger Latenz – typischerweise etwas aus der Flash-Reihe – und ein proprietäres Turn-Taking-Modell obendrein. Barge-in ist eine Konfiguration pro Agent, die Turn-Eagerness und Timeouts offenlegt, statt eine Eigenschaft des Modells zu sein. In der benchmarkten Standardkonfiguration von Artificial Analysis besteht der Stack aus Scribe v2 Realtime für die Spracherkennung, einem Gemini-Modell für das Reasoning und Eleven Flash v2 für die Synthese.
Dieses Design hat einen enormen Vorteil und einen strukturellen Preis. Der Vorteil ist, dass jede Stufe austauschbar ist: ein günstiges Modell für einfache Turns, ein Frontier-Modell für schwierige, ein anderer Synthesizer für eine andere Locale. Der Preis ist, dass sich die Latenz an jeder Nahtstelle summiert und die Entscheidung über den Sprecherwechsel von außen getroffen werden muss.
Dimension für Dimension
• Architektur — GPT-Live-1: ein End-to-End-Modell, Audio rein und Audio raus vs. ElevenLabs Agents: kaskadierte Spracherkennung, Sprachmodell und Synthese mit einer proprietären Turn-Taking-Schicht
• Unabhängiger Beleg — GPT-Live-1: 70,3 % im Artificial Analysis Speech to Speech Index, gemeinsam auf dem sechsten Platz von vierzehn vs. ElevenLabs Agents: Elo 937 in der Speech Agent Arena mit einer Aufgaben-Erfolgsquote von 90,5 % über 676 Stichproben, die beste Erfolgsquote unter den Top Sechs dieser Rangliste
• Qualitäts-Boards — GPT-Live-1: nicht in den Text-to-Speech-Arenen gelistet, da es eine andere Art von Modell ist als ElevenLabs: Eleven v3 Conversational mit 1.194 Elo und Eleven v3 mit 1.166 im Provider-Voice-Board, zu Preisen von 50 $ bzw. 100 $ pro Million Zeichen
• Preis — GPT-Live-1: 0,05 $ pro Sprachminute, sekundengenau abgerechnet, Backend-Reasoning separat abgerechnet vs. ElevenLabs: rund 50 $ pro Million Zeichen für Eleven v3 Conversational und etwa 100 $ für Eleven v3, wobei Agenten mit ungefähr 0,08 $ pro Minute angegeben werden, steigend über die Nebenläufigkeitsgrenze hinaus, und Sprachmodell- sowie Telefoniekosten separat abgerechnet.
• Latenz — GPT-Live-1: keine Time-to-First-Audio-Angabe auf Modellebene veröffentlicht; 0,798 Sekunden Turn-Taking-Latenz in Herstellertests vs. ElevenLabs: etwa 75 Millisekunden für Flash v2.5 und etwa 280 Millisekunden für Eleven v3 Conversational, mit Herstellerempfehlung von unter 800 Millisekunden bis zum ersten Audio auf Agentenebene
• Stimmen und Klonen — GPT-Live-1: zwölf API-Presets, bewusst kein Klonen vs. ElevenLabs: mehr als 10.000 Stimmen in der Bibliothek, sofortiges Klonen anhand einer kurzen Probe, professionelles Klonen aus 30 bis 180 Minuten Audio mit Selbstverifizierung
• Sprachen — GPT-Live-1: wichtige Sprachen gut bedient, ungleichmäßige Sprachbeherrschung darüber hinaus in der Startabdeckung vs. ElevenLabs Eleven v3: über 70 Sprachen, gegenüber 32 für die Flash line und über 90 für deren Spracherkennung
• Breite — GPT-Live-1: ein Endpunkt, eine Modell-ID, Parallelitätsstufen von 25 bis 500 Sitzungen und kein kostenloser Tarif vs. ElevenLabs: Synthese, Spracherkennung, Synchronisation, Soundeffekte, Musik, ein Voice-Marktplatz und eine Agentenplattform unter einem Vertrag, mit einem kostenlosen Tarif, der keine kommerzielle Lizenz beinhaltet


Wo ElevenLabs nicht nur führend, sondern unangefochten ist.
Drei der Abstände in dieser Liste sind nicht knapp, und jeder Vergleich, der ihnen einen Satz widmet, ist unfair gegenüber dem Amtsinhaber.
Cloning ist das Erste. GPT-Live-1 wird mit zwölf Presets ausgeliefert und, per Design, überhaupt keinem Cloning – eine bewusste Sicherheitshaltung statt eines fehlenden Features. ElevenLabs bietet Instant-Cloning aus einer kurzen Referenzprobe und professionelles Cloning, das auf 30 bis 180 Minuten Audio trainiert wird, erst ab bestimmten Plan-Stufen und nach einem Selbstverifizierungsschritt verfügbar. Wenn die Stimme Ihres Produkts Teil seiner Identität ist, ist dies keine Dimension, auf der GPT-Live-1 konkurriert.
Die Voice-Bibliothek ist das Zweite. Mehr als 10.000 Stimmen sowie ein lizenzierter Marktplatz ikonischer Stimmen aus Nachlässen und von Künstlern sind ein Aktivposten, den keine Modellveröffentlichung repliziert. Sie ist außerdem das, was Käufer am häufigsten unterschätzen: Die Wahl einer Stimme ist die letzte Meile eines Voice-Produkts, und wenn man aus zehntausend wählen kann, komprimiert das eine Branding-Übung zu einem Nachmittag.
Das dritte ist die Breite. Spracherkennung, Synchronisation, Soundeffekte, Musik, eine Agentenplattform – ein Team, das vier davon braucht, kauft einen Vertrag statt vier. Das ist ein strategischer Vorteil, kein Qualitätsvorteil, und er überdauert es, wenn die andere Seite einen Benchmark gewinnt.
Beide Unternehmen bringen Governance-Fragen mit sich, die in eine Beschaffungsprüfung gehören und nicht in eine Fußnote. ElevenLabs' professionelles Klonen erfordert eine Selbstverifizierung, und seine Bedingungen verbieten das Klonen der Stimme einer anderen Person selbst mit Einwilligung; das Unternehmen sieht sich zudem einer Reihe von Sammelklagen gegenüber, die im Mai 2026 wegen der Einwilligung zu Trainingsdaten eingereicht wurden, wobei die Ansprüche unbewiesen sind. OpenAIs Position ist einfacher, weil es die Funktion entfernt hat, die das Risiko erzeugt.

Die Kaskadensteuer – und wo es sich lohnt, sie zu entrichten
Die Kosten einer Kaskade zeigen sich als Latenz und als Orchestrierung. Die Anbieterempfehlungen für ElevenLabs geben die Zeit bis zum ersten Audio eines Agenten mit unter 800 Millisekunden im Median und unter 1,5 Sekunden im 95. Perzentil an – Werte, die die gesamte Pipeline beschreiben, nicht die 75 Millisekunden des Synthesizers. Obendrauf kommen die Generierungszeit des Sprachmodells und die Netzwerkübertragung. Ein Teil davon lässt sich durch sorgfältige Auswahl Ihrer Stufen zurückgewinnen; nichts davon ist kostenlos.
Die Orchestrierungsrechnung fällt milder aus, ist aber real. Jede zusätzliche Stufe ist ein weiterer Ort, an dem ein Aufruf fehlschlagen kann, ein weiteres Timeout, das abgestimmt werden muss, ein weiterer Anbieter, mit dem Rechnungen abgeglichen werden müssen. Das ist der Teil, den ein natives End-to-End-Modell vollständig beseitigt: Es gibt eine Sache, die kaputtgehen kann, und sie antwortet entweder oder nicht.
Wo sich die Kaskade bezahlt macht, ist die mittlere Stufe. Das Sprachmodell hinter einem Voice-Agent ist die Komponente, deren Qualität am schnellsten steigt und deren Kosten am stärksten schwanken, und es austauschen zu können, ohne die Voice-Schicht anzufassen, ist über die Lebensdauer eines Produkts hinweg bares Geld wert. Rund 190 Modelle von elf vorgelagerten Anbieternstehen hinter einem einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung eines Anbieters diese Schicht noch am selben Tag erreicht und automatisches Failover verhindert, dass ein Backend-Timeout einen laufenden Anruf beendet. Weder der Agent-Stack von ElevenLabs noch der Live-Sessions-Endpunkt von GPT-Live-1 ist auf diesem Weg erreichbar — die Voice-Schichten gehören ihren Anbietern, und dies ist die Schicht darunter.
Welches soll man wählen?
Wählen Sie GPT-Live-1, wenn die Gesprächsmechanik das Produkt ist und Sie einen Vertrag mit einem einzigen Fehlermodus wollen. Telefonleitungen, bei denen Anrufer dem Agenten ins Wort fallen, bei denen eine natürliche Übergabe wichtiger ist als eine perfekte Stimme und bei denen zwölf gute Stimmen ausreichen. Sie akzeptieren ein geschlossenes gehostetes Modell, kein Klonen, unabhängige Qualität im Mittelfeld und keinen kostenlosen Tarif zum Prototyping.
Entscheiden Sie sich für ElevenLabs, wenn Stimmqualität, Klonen oder Bandbreite die Einschränkung ist. Narration, Synchronisation, mehrsprachige Produkte, alles, wo die Stimme die Marke ist, alles, was Spracherkennung im selben Vertrag benötigt. Sie akzeptieren eine Kaskade, die betrieben werden will, Preise, die pro Spracheinheit rund zehn- bis zwanzigmal so hoch sind wie die von GPT-Live-1, und die Tatsache, dass die Unterbrechungslogik von Ihnen konfiguriert werden muss und dass es an Ihnen liegt, sie auch falsch zu machen.
Die 90,5 % sind der Teil, den man mitnehmen sollte. Sie besagen, dass ein Unternehmen, das drei Modelle und eine Turn-Taking-Schicht kombinierte, ein Unternehmen übertraf, das ein einziges Modell darauf trainiert hatte, all das zu erledigen – und zwar bei der Kennzahl, die am engsten damit zusammenhängt, ob der Anruf funktioniert hat. Vollduplex ist ein echter architektonischer Fortschritt, und nach der aktuellen Beweislage ist es nicht das, was entscheidet, ob der Anrufer bekommt, was er wollte.
