
GPT-Live-1 vs Gemini 3.5 Live Translate: En lanserad generalist mot en specialist på förhandsversioner
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
De här två modellerna jämförs eftersom båda gör realtidstal tillgängligt i ett API, och jämförelsen faller samman i samma stund som man läser modellkorten. GPT-Live-1 är en generell full-duplex röstmodell som OpenAI flyttade över till utvecklar-API:et den 10 september 2026, tre månader efter att den lanserades i ChatGPT den 8 juli. Gemini 3.5 Live Translate är en specialiserad ljud-till-ljud-översättningsmodell som Google DeepMind släppte den 9 juni 2026, och dess modell-ID bär fortfarande ordet preview. En av dessa kan man sätta framför betalande kunder i dag enligt en publicerad taxa. Den andra kan Google ändra under fötterna på en utan ett utfasningsmeddelande. Det är den asymmetrin, inte benchmark-arket, som bör avgöra valet.
Två olika maskiner med samma etikett
Det är värt att vara rättfram om hur lite dessa överlappar varandra. Gemini 3.5 Live Translate utför översättning. Den tar emot strömmande ljud på ett språk och returnerar strömmande ljud på ett annat, samtidigt som den bevarar talarens röst och ton, över 70 språk och mer än 2 000 språkpar, med automatisk språkidentifiering och dubbelriktad funktion. Den för inte ett samtal, anropar inte en funktion eller svarar inte på en fråga. Det är en simultantolkningsmotor.
GPT-Live-1 har motsatt utformning. Det är en samtalsmodell: den lyssnar och talar samtidigt, fattar många gånger per sekund beslut om att fortsätta lyssna, pausa, avbryta eller anropa ett verktyg, och lämnar över tungt arbete – webbsökning, djupare resonemang, agentiska uppgifter – till en separat resonemangsmodell via Responses API medan samtalet fortsätter. OpenAI:s eget publicerade WebRTC-exempel kopplar den delegeringen till GPT-5.6 Terra. Översättning är en av de saker den kan göra; det är inte en funktion som Googles modell har någon motsvarighet till i den andra riktningen.
Så den praktiska frågan är snävare än rubrikmatchen antyder: om det du bygger är tolkning är Googles modell specialbyggd och OpenAIs är generell. Om det du bygger är en röstagent som ibland översätter är GPT-Live-1 den enda av de två som ens tillhör rätt produktkategori.
Vad var och en kostar per ljudminut
Det är här specialisten gör skäl för sitt uppehälle, och aritmetiken är genuint besvärlig för OpenAI.
• GPT-Live-1 — $0.05 per minut för röst, faktureras per sekund i stället för att avrundas uppåt till nästa hela minut. Resonemang och verktygsanrop som utförs av den delegerade backend-tjänsten debiteras separat enligt den modellens normala priser.
• Gemini 3.5 Live Translate – 3,50 USD per miljon ljudindatatokens och 21,00 USD per miljon ljudutdatatokens, med fakturering beräknad till 25 tokens per sekund ljud. Sammantaget landar det på ungefär 0,037 USD per minut översatt ljud.
Enbart räknat i rena översättningsminuter är Google omkring en fjärdedel billigare. Det är ingen avrundningsskillnad i stor skala: 10 000 tolkade minuter i månaden kostar cirka 500 dollar på GPT-Live-1:s röstlager, mot ungefär 368 dollar på Gemini 3.5 Live Translate. Och skillnaden är verklig snarare än en artefakt av ändringen i mätningen, eftersom de två modellerna fakturerar i genuint olika enheter.
Det finns en hake i andra riktningen. Rubriken på $0.05 för GPT-Live-1 är bara priset för röstlagret. Om din agent översätter och dessutom slår upp något, eller eskalerar en svår mening till en resonemangsmodell, betalar du för den delegeringen ovanpå — och den delegerade modellen prissätts per token precis som vilken annan frontier-modell som helst. En arbetsbelastning med enbart översättning utlöser aldrig det. En arbetsbelastning med översättning plus något annat gör det, och vinnaren i jämförelsen per minut är inte längre självklar.

Förhandsgranskningsetiketten är risken som ingen prisar in
Modell-ID:t för Gemini 3.5 Live Translate är gemini-3.5-live-translate-preview. Det släpptes till Gemini Live API och Google AI Studio som en offentlig förhandsversion, och samtidigt i Google Translate-appen på Android och iOS samt en privat förhandsversion i Google Meet för utvalda Workspace-kunder. Förhandsversion betyder vad det alltid har betytt hos Google: ingen stabilitetsgaranti, inget offentliggjort utfasningsfönster, inget åtagande om att priset du betalar överlever nästa version.
För en konsumentapp är det okej. För de arbetsbelastningar som modellen faktiskt riktar sig till – live-tolkning i ett callcenter, en mötesprodukt, en reseprodukt – är det den enskilt största integrationsrisken i stacken. Du bygger ett produktionsberoende av en modell som Google uttryckligen inte har förbundit sig till.
GPT-Live-1 har det omvända problemet, och det är mindre men inte noll. Den är allmänt tillgänglig, till en publicerad taxa, med en dokumenterad slutpunkt, och den försvinner inte. Men dess API-yta är smal på ett sätt som förvånar team som antar att den passar rakt in i en befintlig OpenAI-integration: det finns exakt ett modell-ID, en slutpunkt och ingen väg genom Chat Completions, Responses, Realtime, Batch, Assistants eller finjustering. Det enda sättet in är Live Sessions-slutpunkten på v1/live/sessions över WebRTC, med händelsehantering på en datakanal. Det är en ny integration, inte en parameterändring.

Språk, och var generalisten ärligt talat är svagare
Googles siffra är 70-plus språk med bevarande av röst och ton. OpenAI:s egen dokumentation är påtagligt mindre säker på sin egen täckning: lanseringsmaterialet noterar att modellen för vissa språk kan ha en brytning eller uppvisa brister i språkflytet, och man publicerar inte något språkantal som konkurrerar med Googles.
Det är inte en leverantör som håller igen – det är så en generalistisk samtalsmodell ser ut bredvid en specialist som har tränats på problemet. Om din produkts värdeerbjudande är "vi tolkar 40 språk väl", är specialisten det ärliga valet och generalisten kommer att få dig att skämmas i den långa svansen. Om din produkt är en röstagent för en engelsktalande marknad med en översättningsfunktion påklistrad, kommer generalistens språkliga luckor aldrig att bli ett problem.
Båda modellerna vattenmärker genererat ljud med SynthID, vilket spelar roll om du befinner dig i en jurisdiktion eller har ett kundavtal som kräver proveniens för syntetiskt tal. Den punkten jämnar ut sig.

Där delegationsarkitekturen ändrar bygget
Den strukturella skillnaden mellan dessa två är att GPT-Live-1 egentligen är två modeller med en söm i mitten. Röstlagret håller samtalet levande; en separat resonemangsmodell sköter tänkandet. Den sömmen är där din ingenjörsinsats hamnar, och det är också där kostnadsmodellen blir komplicerad.
Det är värt att veta att den delegerade halvan är en vanlig textmodell som du kan routa precis som vilken annan som helst. GPT-5.6 Terra, backend i OpenAI:s eget exempel, serveras via OrcaRouter till $2.00 per miljon indatatoken och $12.00 per miljon utdatatoken, med ett kontextfönster på 1M token och både /v1/chat/completions och /v1/responses exponerade. Om du vill byta ut resonemangshjärnan bakom en röstagent – mot en billigare modell vid enkla samtal, eller en starkare vid eskaleringar – har den halvan av stacken alternativ, eftersom det är ett vanligt API-anrop som ligger sida vid sida med ungefär 190 andra modeller på en enda nyckel.
Rösthalvan gör det inte. GPT-Live-1 finns inte på OrcaRouter, och inte heller Gemini 3.5 Live Translate; båda finns endast hos leverantören som gjorde dem. Det som gör att en router förtjänar sin plats i en arkitektur som den här är allt nedströms ljudet: textmodellerna som sköter hämtningen, sammanfattningen, CRM-återskrivningen och eskaleringen, vilket är den halvan av räkningen som du faktiskt kan konsolidera till en nyckel och en faktura.
Vad man faktiskt ska välja
• Välj Gemini 3.5 Live Translate om översättning är produkten, priset per minut betyder mer än avtalsstabilitet och du kan hantera att en förhandsmodell ändras under dig. Budgetera ungefär 0,037 USD per minut och behåll ett abstraktionslager ovanpå anropet så att en GA-modell kan ersätta den utan omskrivning.
• Välj GPT-Live-1 om du behöver en konversationsagent som råkar översätta, om du behöver function calling och verktygsanvändning i röstslingan, eller om ett inköpsteam kommer att fråga vad som händer när modellen fasas ut och du behöver ett bättre svar än "ingenting, förmodligen."
• Välj inte någon av dem för att den vann ett benchmark. Benchmarkarna på båda sidorna är inte jämförbara — OpenAIs full-duplex-siffror är dess egna, inte reproducerade av någon tredje part, och Googles språkliga påståenden är otestade mot en generalist på samma ljudset.
En framåtblickande kommentar: de två ytorna konvergerar snarare än kolliderar. Googles översättningsmodell finns redan inuti Gemini Live, och GPT-Live-1:s röstlager är uttryckligen utformat för att nya frontier-modeller ska kunna släppas in bakom det. Den rimliga förväntningen är att generalistens översättning förbättras inom ett par releasecykler och att specialistens integrationshistoria blir mindre av en chansning. Om du bygger idag och beslutet är jämnt är det ett argument för det billigare, mer utbytbara alternativet, och för att hålla ljudvägen isolerad bakom ett gränssnitt oavsett.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
