
GPT-Live-1 vs SeedRealtime: SeedRealtime is het ambitieuzere model, en het is niet te koop
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Een vergelijking van GPT-Live-1 en SeedRealtime op het gebied van capaciteiten levert een ongemakkelijk antwoord op, omdat de twee modellen niet op dezelfde voorwaarden concurreren. GPT-Live-1 is OpenAI's full-duplex stemmodel, uitgebracht in ChatGPT op 8 juli 2026 en opengesteld voor ontwikkelaars via de Live Sessions API op 10 september 2026, met 12 stemmen, een gepubliceerd tarief per minuut en één belangrijk gat: beeld- en video-invoer worden expliciet niet ondersteund. SeedRealtime, uitgebracht door het Seed-team van ByteDance op 5 augustus 2026, is volledig rond dat gat gebouwd. Het is een native audio-visueel full-duplexmodel dat kijkt, luistert en spreekt in één end-to-endarchitectuur — en het is alleen beschikbaar in de consumentenapp Doubao, zonder publieke API, zonder open gewichten, zonder technisch rapport en zonder gepubliceerd aantal parameters.
Wat ieder van hen daadwerkelijk kan waarnemen
De zuiverste manier om de kloof te zien, is te vragen wat elk model weet over de kamer waarin het zich bevindt.
GPT-Live-1 hoort. Dat is het volledige invoeroppervlak. Audio en tekst gaan erin, audio en tekst komen eruit, en in OpenAI's documentatie staan afbeelding en video als niet ondersteund. Het gaat buitengewoon goed om met de gespreksmechanica van het horen — het beslist meerdere keren per seconde of het moet blijven luisteren, pauzeren, onderbreken of een tool aanroepen, en het houdt volledige duplex aan, zodat het binnenkomende audio blijft verwerken terwijl het spreekt. Het levert ook spraakherkennings-transcripties naast de audio, wat precies het soort onglamoureus detail is dat een week integratiewerk bespaart.
SeedRealtime hoort en ziet, in één model in plaats van in een pijplijn. ByteDance beschrijft een uniforme architectuur die audio, video en tekst samen verwerkt, ambiguïteit oplost met visuele context — homofonen onderscheidt, begrijpt waar "dit" naar verwijst op basis van scène, gebaar, blik en eerdere actie — en perceptie, begrip, besluitvorming en expressie parallel laat lopen in plaats van opeenvolgend. De gepubliceerde demonstraties van ByteDance omvatten een lawaaiig groepsdiner waarbij het model stemmen aan identiteiten moet koppelen, een museumbezoek, het corrigeren van een espresso-workflow, en het onderdrukken van interferentie op een luchthaven terwijl het geheugen buiten beeld vasthoudt en een online opzoeking doet.
• Invoer — GPT-Live-1 alleen audio en tekst, afbeelding en video expliciet niet ondersteund vs SeedRealtime audio, video en tekst samengevoegd in één model
• Beurtwisseling — GPT-Live-1 beslist intern, vele malen per seconde, tegenover SeedRealtime die de beurtwisseling in het model verplaatst en de externe spraakactiviteitsdetector volledig verwijdert.
• Proactief gedrag — GPT-Live-1 reageert, delegeert en roept tools aan vs SeedRealtime wordt beschreven als ongevraagd van zich laten horen wanneer een doelobject in beeld verschijnt
• Beschikbaarheid — GPT-Live-1 algemeen beschikbaar in de API van OpenAI voor $0,05 per minuut tegenover SeedRealtime gratis binnen Doubao, zonder API en zonder tijdlijn voor een.

De kwaliteit van het bewijs loopt tegengesteld aan de ambitie
Dit is het punt waarop de vergelijking ByteDance niet langer flatteert.
OpenAI publiceert cijfers. Het zijn de eigen cijfers van het bedrijf, ze vergelijken GPT-Live-1 met GPT-Realtime-2.1 in plaats van met een concurrent, en geen enkel onafhankelijk lab heeft ze gereproduceerd — 80,1% op full-duplex interactiviteit tegenover 45,4%, de latentie bij beurtwisseling teruggebracht van 1,4 seconden naar 0,8, de nauwkeurigheid bij tool-calling van 60% naar 87%. Door de leverancier uitgevoerd en niet gereproduceerd is een reële kanttekening, en het is een kanttekening die je tenminste aan een cijfer kunt koppelen.
ByteDance publiceert vrijwel niets. De centrale bewering over SeedRealtime is een end-to-end menselijke evaluatie die zegt dat het de auditief-visuele problemen met gespreksritme halveert ten opzichte van cascadesystemen met ASR plus vision plus TTS — minder afbrekingen midden in een zin, minder trage antwoorden na een pauze, minder valse triggers door achtergrondgepraat. Er is geen steekproefgrootte, geen methodologie, geen exact cijfer voor de verbetering en helemaal geen latencycijfer. Er is ook geen parameteraantal en geen technisch rapport.
Het resultaat is dat het model met de interessantere architectuur juist het model is dat je het minst kunt beoordelen. Dat is niet hetzelfde als zeggen dat het slechter presteert — de demonstraties zijn oprecht indrukwekkend, en het technische verslag over audio-visuele input in chunks en streaminggeneratie doet vermoeden dat het om een echt systeem gaat en niet om een demo — maar het betekent wel dat elke vergelijking tussen deze twee qua kwaliteit momenteel een vergelijking is tussen een gedocumenteerd model en een indrukwekkende video.
Waarom het API-gat geen detail is
SeedRealtime is sinds 5 augustus 2026 volledig uitgerold binnen Doubao, zowel in spraak als video, kosteloos. Het heeft geen Volcano Engine- of BytePlus-endpoint, geen betaald niveau, geen gepubliceerd quotum en geen aangekondigde tijdlijn voor het openstellen van ontwikkelaarstoegang. In de roadmap van ByteDance wordt melding gemaakt van lagere latentie, scherpere sprekerstracking en taken die aan tools zijn gekoppeld; er wordt geen datum genoemd.
Er is een toegangsbeperking die dit verergert. Doubao is in de eerste plaats een product voor het vasteland van China en vereist doorgaans een mobiel nummer van het vasteland om te kunnen registreren, zonder dat er een gelokaliseerde Engelse versie is aangekondigd. Voor een team buiten China is SeedRealtime niet alleen niet gelanceerd als API — het is als product ook niet bereikbaar.
Zet dat tegenover de eigen integratielast van GPT-Live-1, en de afweging wordt concreet. De API van OpenAI is beperkt op manieren die mensen verrassen: één model-ID, één endpoint op v1/live/sessions, WebRTC-transport met eventafhandeling op een datakanaal, en geen route via Chat Completions, Responses, Realtime, Batch of de fine-tuning-endpoints. Snelheidslimieten worden uitgedrukt in gelijktijdige sessies — 25 op Tier 1, oplopend via 50, 200, 300 en 500 — in plaats van verzoeken per minuut, en de Free-tier kan het model helemaal niet aanroepen. Dat is een nieuwe integratie, en het is nog steeds een integratie die je vanmiddag kunt starten.

Twee antwoorden op hetzelfde delegatieprobleem
Beide modellen verwerpen het oude cascadeontwerp, waarbij spraakherkenning, een taalmodel en spraaksynthese achter elkaar draaien met ongeveer 1,7 seconde dode lucht tussen beurten. Ze verwerpen het op verschillende manieren, en het verschil vertelt je welk model gebouwd is voor een telefoongesprek en welk voor een ruimte.
GPT-Live-1 splitst het werk verticaal. Een snelle stemlaag houdt het gesprek gaande; alles wat zwaarder is — webzoekopdrachten, dieper redeneren, agentisch werk — wordt via de Responses API aan een afzonderlijk redeneermodel overgedragen terwijl het gesprek doorgaat. Het gepubliceerde WebRTC-voorbeeld van OpenAI koppelt die backend aan GPT-5.6 Terra. Het gevolg is dat het denkende deel een gewone aanroep van een tekstmodel is, met een prijs per token, en dus iets dat je onafhankelijk van de stemlaag kunt kiezen, verwisselen en routeren. Voor een supportlijn is dat de juiste vorm: de stem is de interface en het redeneerwerk is het product.
SeedRealtime houdt alles in één netwerk, en dat is wat het in staat stelt om naar een gebaar te kijken terwijl het midden in een zin zit. Het is ook wat het onmogelijk maakt om het op te splitsen — je kunt de redeneerhelft niet omwisselen, omdat er geen redeneerhelft is, en je kunt het nergens draaien, want er is geen plek om het te draaien.
Als je vandaag een voice agent bouwt, is dat onderscheid de hele beslissing. Slechts één van deze twee is een component die je in een architectuur kunt onderbrengen. GPT-5.6 Terra, de backend in OpenAI's delegatievoorbeeld, wordt geleverd via OrcaRouter voor $2,00 per miljoen inputtokens en $12,00 per miljoen output met een context van 1M tokens en zowel /v1/chat/completions als /v1/responses beschikbaar — naast ongeveer 190 andere modellen op één sleutel, zodat de reasoning-laag achter een voice agent kan worden opgesplitst, geprijsd en overgeschakeld bij uitval zonder het audiopad aan te raken. Noch GPT-Live-1 noch SeedRealtime wordt door OrcaRouter geleverd; ze komen van één bron, hun eigen leveranciers, en geen enkele router kan dat veranderen.

Wat zou het antwoord veranderen
Drie dingen, in volgorde van waarschijnlijkheid.
• Een ByteDance-ontwikkelaars-API. Als SeedRealtime op Volcano Engine of BytePlus verschijnt met een gepubliceerd tarief, is het niet langer een casestudy en wordt het een werkelijk gedifferentieerd product — audio-visuele full-duplex zonder gehoste concurrent in het Westen. Dat is het signaal om in de gaten te houden, en het is niet verschenen.
• Vision arriveert in een gehoste spraak-API. De documentatie van GPT-Live-1 is expliciet dat afbeelding en video niet worden ondersteund, wat minder leest als een vergissing dan als een bewuste grens voor een eerste release. Als OpenAI het video-oppervlak uitbrengt dat het elders in ChatGPT heeft gedemonstreerd, wordt het verschil in mogelijkheden dat SeedRealtime interessant maakt aanzienlijk kleiner.
• Enige onafhankelijke meting van SeedRealtime. Een latentiecijfer van een derde partij of een aantal parameters zou het mogelijk maken de twee op iets anders dan ambitie te vergelijken.
Het praktische oordeel voor iedereen die nu bouwt, is kort. GPT-Live-1 is de enige van deze twee die je kunt uitrollen, en tegen $0,05 per minuut, per seconde gefactureerd, met twaalf stemmen en een gedocumenteerd endpoint, is het een redelijke standaard voor conversationele spraak. SeedRealtime is het interessantere model en is wellicht het capabelere model; het is voorlopig ook een demonstratie van hoe een geconvergeerde audio-visuele architectuur eruitziet, in plaats van een product dat je aan een klant kunt voorleggen. Zet het in de categorie 'om in de gaten te houden', niet 'om op voort te bouwen'.
