
GPT-Live-1 vs SeedRealtime: SeedRealtime är den mer ambitiösa modellen, och den går inte att köpa
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
En jämförelse av GPT-Live-1 och SeedRealtime när det gäller kapacitet ger ett obekvämt svar, eftersom de två modellerna inte tävlar på samma villkor. GPT-Live-1 är OpenAIs full-duplex-röstmodell, lanserad i ChatGPT den 8 juli 2026 och öppnad för utvecklare via Live Sessions-API:et den 10 september 2026, med 12 röster, en publicerad minutkostnad och en betydande lucka: bild- och videoindata stöds uttryckligen inte. SeedRealtime, som släpptes av ByteDances Seed-team den 5 augusti 2026, är byggd helt och hållet kring den luckan. Det är en nativ audiovisuell full-duplex-modell som tittar, lyssnar och talar i en enda end-to-end-arkitektur – och den finns endast i Doubao-konsumentappen, utan offentligt API, utan öppna vikter, utan teknisk rapport och utan publicerat antal parametrar.
Vad var och en faktiskt kan uppfatta
Det tydligaste sättet att se klyftan är att fråga vad varje modell vet om rummet den befinner sig i.
GPT-Live-1 hör. Det är hela inmatningsytan. Ljud och text kommer in, ljud och text kommer ut, och i OpenAIs dokumentation anges bild och video som icke stödda. Den hanterar samtalsmekaniken kring lyssnande extremt bra – den avgör flera gånger i sekunden om den ska fortsätta lyssna, pausa, avbryta eller anropa ett verktyg, och den upprätthåller full duplex så att den fortsätter bearbeta inkommande ljud medan den talar. Den returnerar också transkriptioner från taligenkänning tillsammans med ljudet, vilket är en sådan oglamorös detalj som sparar en veckas integrationsarbete.
SeedRealtime hör och ser, i en enda modell i stället för i en pipeline. ByteDance beskriver en enhetlig arkitektur som hanterar ljud, video och text tillsammans och löser upp tvetydigheter med hjälp av visuell kontext – skiljer homofoner åt, förstår vad "detta" syftar på utifrån scen, gest, blick och tidigare handling – och kör perception, förståelse, beslutsfattande och uttryck parallellt i stället för i sekvens. ByteDances publicerade demonstrationer omfattar en bullrig gruppmiddag där modellen måste koppla röster till identiteter, ett museibesök, korrigering av ett espressoarbetsflöde och undertryckande av störningar på en flygplats medan den håller kvar minne utanför skärmen och gör en onlinesökning.
• Indata — GPT-Live-1 endast ljud och text, bild och video stöds uttryckligen inte vs SeedRealtime där ljud, video och text är sammansmälta i en modell
• Turtagning — GPT-Live-1 bestämmer internt, många gånger per sekund, medan SeedRealtime flyttar turtagningen in i modellen och tar bort den externa röstaktivitetsdetektorn helt
• Proaktivt beteende — GPT-Live-1 svarar, delegerar och anropar verktyg, medan SeedRealtime beskrivs tala spontant när ett målobjekt dyker upp i synfältet
• Tillgänglighet — GPT-Live-1 allmänt tillgängligt i OpenAI:s API för $0,05 per minut jämfört med SeedRealtime gratis i Doubao, utan API och utan någon tidsplan för ett sådant

Beviskvaliteten går i motsatt riktning mot ambitionen.
Det är här jämförelsen slutar smickra ByteDance.
OpenAI publicerar siffror. De är deras egna, de jämför GPT-Live-1 mot GPT-Realtime-2.1 i stället för mot en konkurrent, och inget oberoende labb har reproducerat dem – 80,1 % i full-duplex-interaktivitet mot 45,4 %, turtagningslatens nedskuren från 1,4 sekunder till 0,8, noggrannhet vid verktygsanrop från 60 % till 87 %. Att den körs av leverantören och inte har reproducerats är ett verkligt förbehåll, och det är ett förbehåll man åtminstone kan fästa vid en siffra.
ByteDance publicerar nästan ingenting. Det centrala påståendet om SeedRealtime är en mänsklig end-to-end-utvärdering som säger att den halverar problemen med audiovisuell samtalsrytm jämfört med kaskadkopplade ASR-plus-vision-plus-TTS-system – färre avbrott mitt i meningar, färre långsamma svar efter en paus, färre falska utlösningar från bakgrundsprat. Det finns ingen urvalsstorlek, ingen metodik, ingen exakt siffra för förbättringen och inget latensnummer alls. Det finns inte heller något parameterantal och ingen teknisk rapport.
Resultatet är att modellen med den mer intressanta arkitekturen är den du kan utvärdera minst. Det är inte samma sak som att säga att den presterar sämre — demonstrationerna är verkligen slående, och den tekniska beskrivningen kring chunkad audiovisuell indata och strömmande generering antyder ett verkligt system snarare än en demo — men det betyder att varje jämförelse mellan dessa två vad gäller kvalitet för närvarande är en jämförelse mellan en dokumenterad modell och en imponerande video.
Varför API-gapet inte är en detalj
SeedRealtime har rullats ut fullt ut i Doubao sedan den 5 augusti 2026, både i röst och video, utan kostnad. Det har ingen slutpunkt hos Volcano Engine eller BytePlus, ingen betald nivå, ingen publicerad kvot och ingen angiven tidsplan för att öppna utvecklaråtkomst. ByteDances färdplan nämner lägre latens, skarpare talarspårning och verktygsanslutna uppgifter; den nämner inget datum.
Det finns ett förbehåll kring åtkomst som förvärrar saken. Doubao är en produkt som i första hand riktar sig till det kinesiska fastlandet och kräver vanligtvis ett mobilnummer från fastlandet för registrering, och ingen lokaliserad engelsk version har aviserats. För ett team utanför Kina är SeedRealtime inte bara ännu inte lanserad som API – det går inte heller att nå som produkt.
Ställ det mot GPT-Live-1:s egen integrationsbörda, och avvägningen blir konkret. OpenAI:s API är snävt på sätt som överraskar folk: ett modell-ID, en slutpunkt på v1/live/sessions, WebRTC-transport med händelsehantering på en datakanal, och ingen väg genom Chat Completions, Responses, Realtime, Batch eller finjusteringsslutpunkterna. Hastighetsgränser uttrycks i samtidiga sessioner — 25 på nivå 1, stigande genom 50, 200, 300 och 500 — i stället för förfrågningar per minut, och gratisnivån kan inte anropa modellen alls. Det är en ny integration, och det är fortfarande en integration du kan påbörja i eftermiddag.

Två svar på samma delegeringsproblem
Båda modellerna avvisar den gamla kaskaddesignen, där taligenkänning, en språkmodell och talsyntes körs i sekvens med ungefär 1,7 sekunders dödtid mellan turer. De avvisar den på olika sätt, och skillnaden säger dig vilken som är byggd för ett telefonsamtal och vilken som är byggd för ett rum.
GPT-Live-1 delar arbetet vertikalt. Ett snabbt röstlager håller samtalet; allt tyngre — webbsökning, djupare resonemang, agentiskt arbete — lämnas över till en separat resonemangsmodell via Responses API medan samtalet fortsätter. OpenAIs publicerade WebRTC-exempel kopplar den backenden till GPT-5.6 Terra. Konsekvensen är att den tänkande halvan är ett vanligt anrop till en textmodell, prissatt per token, och därför något du kan välja, byta ut och dirigera oberoende av röstlagret. För en supportlinje är det rätt form: rösten är gränssnittet och resonemanget är produkten.
SeedRealtime håller allt i ett enda nätverk, vilket är det som gör att den kan betrakta en gest medan den är mitt i en mening. Det är också det som gör den omöjlig att dela upp — du kan inte byta ut resonemangshalvan, för det finns ingen resonemangshalva, och du kan inte köra den någonstans, för det finns ingenstans att köra den.
Om du bygger en röstagent idag är den distinktionen hela beslutet. Endast en av dessa två är en komponent som du kan sätta in i en arkitektur. GPT-5.6 Terra, backend i OpenAI:s delegationsexempel, tillhandahålls via OrcaRouter för $2.00 per miljon indatatokens och $12.00 per miljon utdatatokens med en kontext på 1M tokens och både /v1/chat/completions och /v1/responses exponerade — vid sidan av ungefär 190 andra modeller på en enda nyckel, så att resonemangsnivån bakom en röstagent kan delas upp, prissättas och redundansväxlas utan att röra ljudvägen. Varken GPT-Live-1 eller SeedRealtime tillhandahålls av OrcaRouter; de har en enda källa hos sina egna leverantörer, och ingen router kan ändra på det.

Vad skulle ändra svaret
Tre saker, i ordning efter sannolikhet.
• Ett utvecklar-API från ByteDance. Om SeedRealtime dyker upp på Volcano Engine eller BytePlus med ett publicerat pris upphör det att vara en fallstudie och blir en genuint differentierad produkt — audiovisuell full duplex utan någon hostad konkurrent i väst. Det är signalen att bevaka, och den har inte synts till.
• Vision som anländer i ett hostat röst-API. GPT-Live-1:s dokumentation är tydlig med att bild och video inte stöds, vilket framstår mindre som ett förbiseende än som en avsiktlig gräns för första utgåvan. Om OpenAI lanserar den videoyta som företaget har demonstrerat på andra håll i ChatGPT, minskar det kapacitetsgap som gör SeedRealtime intressant avsevärt.
• Någon oberoende mätning av SeedRealtime. En latenssiffra från tredje part eller ett parameterantal skulle göra det möjligt att jämföra de två på något annat än ambition.
Det praktiska omdömet för den som bygger nu är kort. GPT-Live-1 är den enda av dessa två som du kan driftsätta, och till 0,05 USD per minut, fakturerat per sekund, med tolv röster och en dokumenterad endpoint, är den ett rimligt standardval för konversationsröst. SeedRealtime är den mer intressanta modellen och kan mycket väl vara den mer kapabla; den är också för närvarande en demonstration av hur en konvergerad ljud- och bildarkitektur ser ut snarare än en produkt du kan sätta framför en kund. Sortera in den under sådant du bör bevaka, inte sådant du bör bygga på.
