
GPT-Live-1 vs SeedRealtime: SeedRealtime ist das ambitioniertere Modell, und man kann es nicht kaufen
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Ein Vergleich von GPT-Live-1 und SeedRealtime in Bezug auf die Leistungsfähigkeit ergibt eine unbequeme Antwort, denn die beiden Modelle konkurrieren nicht unter denselben Bedingungen. GPT-Live-1 ist OpenAIs Vollduplex-Sprachmodell, das am 8. Juli 2026 in ChatGPT eingeführt und am 10. September 2026 über die Live Sessions API für Entwickler geöffnet wurde, mit 12 Stimmen, einem veröffentlichten Minutenpreis und einer erheblichen Lücke: Bild- und Videoeingabe werden ausdrücklich nicht unterstützt. SeedRealtime, veröffentlicht vom Seed-Team von ByteDance am 5. August 2026, ist vollständig um genau diese Lücke herum gebaut. Es ist ein natives audiovisuelles Vollduplex-Modell, das in einer einzigen Ende-zu-Ende-Architektur sieht, hört und spricht – und es ist nur in der Doubao-Consumer-App verfügbar, ohne öffentliche API, ohne offene Gewichte, ohne technischen Bericht und ohne veröffentlichte Parameteranzahl.
Was jedes Einzelne tatsächlich wahrnehmen kann
Am einfachsten erkennt man die Lücke, wenn man fragt, was jedes Modell über den Raum weiß, in dem es sich befindet.
GPT-Live-1 hört. Das ist die gesamte Eingabeoberfläche. Audio und Text gehen hinein, Audio und Text kommen heraus, und in der Dokumentation von OpenAI werden Bild und Video als nicht unterstützt aufgeführt. Es beherrscht die Gesprächsmechanik des Zuhörens außerordentlich gut – es entscheidet viele Male pro Sekunde, ob es weiter zuhören, pausieren, unterbrechen oder ein Tool aufrufen soll, und es hält den Vollduplexbetrieb aufrecht, sodass es eingehendes Audio weiter verarbeitet, während es spricht. Außerdem liefert es Transkripte der Spracherkennung zusammen mit dem Audio zurück – so ein unspektakuläres Detail, das eine Woche Integrationsarbeit spart.
SeedRealtime hört und sieht, in einem Modell statt in einer Pipeline. ByteDance beschreibt eine einheitliche Architektur, die Audio, Video und Text zusammen verarbeitet, Mehrdeutigkeit mit visuellem Kontext auflöst – Homophone unterscheidet, versteht, worauf sich „dies“ aus Szene, Gestik, Blick und vorheriger Handlung bezieht – und Wahrnehmung, Verstehen, Entscheidungsfindung und Ausdruck parallel statt sequenziell ausführt. ByteDances veröffentlichte Demonstrationen umfassen ein geräuschvolles Gruppenabendessen, bei dem das Modell Stimmen an Identitäten binden muss, einen Museumsbesuch, die Korrektur eines Espresso-Arbeitsablaufs und die Unterdrückung von Störungen an einem Flughafen, während es Off-Screen-Erinnerungen behält und eine Online-Suche durchführt.
• Eingaben — GPT-Live-1 nur Audio und Text, Bild und Video ausdrücklich nicht unterstützt vs. SeedRealtime Audio, Video und Text in einem Modell vereint
• Sprecherwechsel — GPT-Live-1 entscheidet intern, viele Male pro Sekunde, während SeedRealtime den Sprecherwechsel in das Modell verlagert und den externen Sprachaktivitätsdetektor vollständig entfernt
• Proaktives Verhalten — GPT-Live-1 reagiert, delegiert und ruft Tools auf, während SeedRealtime so beschrieben wird, dass es sich unaufgefordert äußert, wenn ein Zielobjekt im Sichtfeld erscheint
• Verfügbarkeit — GPT-Live-1 ist in der API von OpenAI allgemein verfügbar, für 0,05 $ pro Minute, im Vergleich zu SeedRealtime, das in Doubao kostenlos ist, ohne API und ohne Zeitplan dafür

Die Beweisqualität verhält sich umgekehrt zur Ambition
Hier hört der Vergleich auf, ByteDance zu schmeicheln.
OpenAI veröffentlicht Zahlen. Es sind eigene Zahlen: GPT-Live-1 wird darin mit GPT-Realtime-2.1 verglichen statt mit einem Wettbewerber, und kein unabhängiges Labor hat sie reproduziert – 80,1 % bei Vollduplex-Interaktivität gegenüber 45,4 %, eine Latenz beim Sprecherwechsel, die von 1,4 Sekunden auf 0,8 gesenkt wurde, eine Genauigkeit beim Tool-Aufruf, die von 60 % auf 87 % stieg. Vom Anbieter selbst durchgeführt und nicht reproduziert zu sein, ist ein echter Vorbehalt, und es ist ein Vorbehalt, den man wenigstens an einer Zahl festmachen kann.
ByteDance veröffentlicht fast nichts. Die zentrale Behauptung über SeedRealtime ist eine Ende-zu-Ende-Evaluation durch Menschen, die besagt, dass es audiovisuelle Probleme mit dem Gesprächstempo im Vergleich zu kaskadierten ASR-plus-Vision-plus-TTS-Systemen halbiert – weniger Unterbrechungen mitten im Satz, weniger langsame Antworten nach einer Pause, weniger Fehlauslösungen durch Hintergrundgeschwätz. Es gibt keine Stichprobengröße, keine Methodik, keine genaue Zahl für die Verbesserung und überhaupt keine Latenzangabe. Es gibt auch keine Parameteranzahl und keinen technischen Bericht.
Das Ergebnis ist, dass das Modell mit der interessanteren Architektur dasjenige ist, das man am wenigsten bewerten kann. Das ist nicht dasselbe wie die Aussage, dass es schlechter abschneidet – die Demonstrationen sind wirklich beeindruckend, und die technische Ausarbeitung zu gechunkter audiovisueller Eingabe und Streaming-Generierung deutet auf ein echtes System statt auf eine Demo hin –, aber es bedeutet, dass jeder Qualitätsvergleich zwischen diesen beiden derzeit ein Vergleich zwischen einem dokumentierten Modell und einem beeindruckenden Video ist.
Warum die API-Lücke kein Detail ist
SeedRealtime ist seit dem 5. August 2026 vollständig in Doubao ausgerollt, sowohl für Sprache als auch für Video, und das kostenlos. Es gibt keinen Volcano-Engine- oder BytePlus-Endpunkt, keine kostenpflichtige Tarifstufe, kein veröffentlichtes Kontingent und keinen genannten Zeitrahmen für die Öffnung des Entwicklerzugangs. In der Roadmap von ByteDance ist von geringerer Latenz, präziserer Sprecherverfolgung und werkzeuggebundenen Aufgaben die Rede; ein Datum wird nicht genannt.
Es gibt einen Zugangsvorbehalt, der dies noch verschärft. Doubao ist ein Produkt mit Fokus auf das chinesische Festland und erfordert in der Regel eine Mobilfunknummer des chinesischen Festlands zur Registrierung, wobei keine lokalisierte englische Version angekündigt ist. Für ein Team außerhalb Chinas ist SeedRealtime nicht nur nicht als API eingeführt – es ist auch als Produkt nicht erreichbar.
Stellt man das dem eigenen Integrationsaufwand von GPT-Live-1 gegenüber, wird der Trade-off konkret. Die API von OpenAI ist in einer Weise eng gefasst, die Menschen überrascht: eine einzige Modell-ID, einen einzigen Endpunkt unter v1/live/sessions, WebRTC-Transport mit Event-Handling auf einem Datenkanal und keinen Weg über Chat Completions, Responses, Realtime, Batch oder die Fine-Tuning-Endpunkte. Die Rate Limits werden in gleichzeitigen Sitzungen bemessen — 25 in Tier 1, steigend über 50, 200, 300 und 500 — und nicht in Anfragen pro Minute, und der Free-Tarif kann das Modell überhaupt nicht aufrufen. Das ist eine neue Integration, und es ist immer noch eine Integration, mit der man heute Nachmittag beginnen kann.

Zwei Antworten auf dasselbe Delegationsproblem
Beide Modelle lehnen den alten kaskadierten Aufbau ab, bei dem Spracherkennung, ein Sprachmodell und Sprachsynthese nacheinander ablaufen, mit etwa 1,7 Sekunden Stille zwischen den Gesprächsbeiträgen. Sie lehnen ihn auf unterschiedliche Weise ab, und der Unterschied verrät, welches von beiden für einen Telefonanruf und welches für einen Raum gebaut ist.
GPT-Live-1 teilt die Arbeit vertikal. Eine schnelle Sprachschicht führt das Gespräch; alles Schwerere – Websuche, tiefergehende Schlussfolgerungen, agentische Arbeit – wird an ein separates Reasoning-Modell über die Responses API übergeben, während das Gespräch weiterläuft. Das von OpenAI veröffentlichte WebRTC-Beispiel verbindet dieses Backend mit GPT-5.6 Terra. Die Konsequenz ist, dass die Denkhälfte ein gewöhnlicher Textmodell-Aufruf ist, pro Token bepreist, und daher etwas, das man unabhängig von der Sprachschicht wählen, austauschen und routen kann. Für eine Support-Hotline ist das die richtige Form: Die Stimme ist die Schnittstelle und das Reasoning ist das Produkt.
SeedRealtime hält alles in einem einzigen Netzwerk, und genau das ermöglicht es ihm, eine Geste zu betrachten, während sie mitten im Satz ist. Es ist auch der Grund, warum es sich nicht zerlegen lässt – man kann die Reasoning-Hälfte nicht austauschen, weil es keine Reasoning-Hälfte gibt, und man kann es nirgendwo ausführen, weil es keinen Ort gibt, an dem man es ausführen könnte.
Wenn Sie heute einen Voice-Agent bauen, ist genau diese Unterscheidung die ganze Entscheidung. Nur eines dieser beiden ist eine Komponente, die Sie in eine Architektur einfügen können. GPT-5.6 Terra, das Backend im Delegationsbeispiel von OpenAI, wird über OrcaRouter bereitgestellt – zu 2,00 $ pro Million Input-Tokens und 12,00 $ pro Million Output-Tokens mit einem Kontext von 1 Mio. Tokens, wobei sowohl /v1/chat/completions als auch /v1/responses exponiert sind – neben etwa 190 weiteren Modellen mit einem Schlüssel, sodass die Reasoning-Ebene hinter einem Voice-Agent aufgeteilt, bepreist und einem Failover unterzogen werden kann, ohne den Audio-Pfad zu berühren. Weder GPT-Live-1 noch SeedRealtime werden von OrcaRouter bereitgestellt; sie sind ausschließlich von ihren eigenen Anbietern erhältlich, und kein Router kann das ändern.

Was würde die Antwort ändern?
Drei Dinge, nach Wahrscheinlichkeit geordnet.
• Eine ByteDance-Entwickler-API. Wenn SeedRealtime auf Volcano Engine oder BytePlus mit einem veröffentlichten Tarif auftaucht, ist es keine Fallstudie mehr, sondern wird zu einem wirklich differenzierten Produkt — audio-visueller Vollduplex ohne einen gehosteten Wettbewerber im Westen. Das ist das Signal, auf das man achten sollte, und es ist nicht aufgetaucht.
• Vision hält Einzug in eine gehostete Voice-API. Die Dokumentation von GPT-Live-1 macht ausdrücklich klar, dass Bilder und Videos nicht unterstützt werden, was weniger nach einem Versehen als nach einer bewussten Grenze für die erste Veröffentlichung klingt. Wenn OpenAI die Videooberfläche ausliefert, die anderswo in ChatGPT demonstriert wurde, verringert sich die Fähigkeitslücke, die SeedRealtime interessant macht, erheblich.
• Jede unabhängige Messung von SeedRealtime. Eine Latenzzahl eines Drittanbieters oder eine Parameteranzahl würde es ermöglichen, die beiden an etwas anderem als Ambition zu messen.
Das praktische Fazit für alle, die jetzt entwickeln, ist kurz. GPT-Live-1 ist das einzige dieser beiden Modelle, das man einsetzen kann, und mit 0,05 US-Dollar pro Minute, sekundengenau abgerechnet, zwölf Stimmen und einem dokumentierten Endpunkt ist es eine sinnvolle Standardwahl für konversationelle Sprachinteraktion. SeedRealtime ist das interessantere Modell und könnte durchaus das leistungsfähigere sein; zugleich ist es derzeit eher eine Demonstration davon, wie eine konvergierte audiovisuelle Architektur aussieht, als ein Produkt, das man einem Kunden präsentieren kann. Sortieren Sie es unter „beobachten“ ein, nicht unter „darauf aufbauen“.
