Titelkort med texten "Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate" och undertexten "Den ena levererar en siffra, den andra levererar en karta".
Guides & Insights

Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: Den ena levererar ett nummer, den andra levererar en karta

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

De två ledande modellerna för realtidsöversättning av tal är oense om vad de är villiga att bli mätta på, och den oenigheten är mer användbar än någon specifikationsjämförelse. Qwen3.8-LiveTranslate, som släpptes den 19 september 2026, leder med en enda hård siffra: genomsnittlig fördröjning på 2,3 sekunder, ned från 2,8 i föregående generation. Gemini 3.5 Live Translate, leverantörens tal-till-tal-modell som tillkännagavs i juni 2026 och fortfarande bär ett förhandsvisnings-ID för modellen, leder med räckvidd – över 70 språk, automatisk identifiering, byte mitt i samtalet och integrering i leverantörens Translate- och Meet-appar. Det ena företaget publicerade en latenssiffra som det kan hållas ansvarigt för. Det andra publicerade ett språkantal. Om du väljer mellan dem är det viktigare att förstå varför dessa är olika typer av löften än vilken lista som är längre.

Två arkitekturer som är överens om målet och inget annat

Båda modellerna finns för att döda samma beteende: den tursbaserade tolken som väntar på att du ska avsluta en mening innan den säger något. Det är den pausen som får maskintolkning att kännas som maskintolkning.

Qwen3.8-LiveTranslate kommer dit med en Interleave-arkitektur på en Hybrid MoE-stomme, uppdelad i en Thinker-modul som vecklar in ljud, video, källtext och översättning i en enda kausal sekvens, och en Talker-modul som återsyntetiserar översättningen i den ursprungliga talarens klangfärg. Påståendet är att slå samman igenkänning, översättning och syntes till en enda sekvens eliminerar den latens och semantiska förlust som en trestegspipeline betalar vid varje modulgräns.

Gemini 3.5 Live Translate intar samma end-to-end-position från andra hållet: den är byggd på Gemini 3 Pro som en nativ ljud-till-ljud-modell och strömmar kontinuerligt via Gemini Live API i stället för att köra en diskret ASR → MT → TTS-kaskad. I praktiken håller du en beständig dubbelriktad WebSocket, skickar upp ljudchunkar på 100 ms och hämtar ner översatta ljudchunkar. Ingen av modellerna gör det gamla. Båda gör nu det nya. Skillnaderna ligger helt i andra ordningens detaljer.

Latensjämförelsen är inte så jämn som den ser ut

Google beskriver Gemini 3.5 Live Translate som att ligga "några sekunder efter" talaren. Företaget har inte publicerat någon LAAL-siffra, eller någon annan namngiven, reproducerbar latensmetrik, för modellen. Qwen har publicerat 2,3 sekunder och definierat vad det innebär.

Den här asymmetrin slätas rutinmässigt ut till "båda ligger på omkring två till tre sekunder." Den tolkningen har inget stöd i vad något av företagen har sagt. Googles formulering är förenlig med 2 sekunder och förenlig med 4; företaget har helt enkelt avböjt att låta sig låsas fast. Den jämförelse som faktiskt kan göras i dag är:

Publicerad latensmetrik — Qwen3.8-LiveTranslate: LAAL 2,3 s, enligt leverantörens uppgifter. Gemini 3.5 Live Translate: ingen publicerad.

Oberoende latensmätning — ingen för någon av modellerna. Ingen tredje part har publicerat en direkt jämförelse.

Den ärliga slutsatsen är att Qwen i fråga om latens har framfört ett falsifierbart påstående och Google ett vagt sådant. Det är en poäng till Qwens fördel när det gäller transparens och exakt noll poäng till dess fördel när det gäller prestanda, tills någon mäter båda. Om latens är den avgörande faktorn för din driftsättning stöder det nuvarande bevisläget inte ett köpbeslut i någon riktning.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

60 språk mot 70-plus är fel resultattavla

Språkräkningarna citeras ständigt och de vilseleder åt båda hållen.

Qwen3.8-LiveTranslate känner igen 60 källspråk och ger talad utdata på 29 av dem. Gemini 3.5 Live Translate stöder över 70 språk med automatisk detektering, och i Google Meet utökas det till över 2 000 språkkombinationer, där den tidigare övre gränsen var engelskbaserad översättning mellan fem språk.

Läs det andra numret noga innan du behandlar det som en trefaldig vinst. Googles siffra på över 2 000 räknar ordnade par – varje källspråk korsat med varje målspråk – vilket är ett legitimt och genuint användbart mått på täckning men inte jämförbart med antalet för ett enskilt språk. Och Googles lista, även om den är bredare, är starkt viktad mot språk med stora talarpopulationer: afrikaans, arabiska, bengaliska, nederländska, engelska, franska, tyska, hindi, indonesiska, italienska, japanska, koreanska, malajiska, persiska, polska, portugisiska, ryska, spanska, swahili, tamilska, telugu, thailändska, turkiska, ukrainska, urdu, vietnamesiska, zulu. Qwens 29 språk med talad utdata är ännu snävare, och ingen av leverantörernas listor är ett seriöst svar på den långa svansen – de regionala dialekterna och lågresursspråken där tolkningsverktyg historiskt har misslyckats som mest. Båda företagen säger att de arbetar på det. Ingen av dem har levererat det.

Där de två faktiskt går isär: rummet fullt av människor

Det enda stället där modellerna ger genuint olika löften är hanteringen av flera talare, och det är den skillnad som med störst sannolikhet avgör en verklig driftsättning.

Qwen3.8-LiveTranslate levererar talardiarisering i realtid: varje mening tillskrivs en talare när den kommer in, och röstreplikering beskrivs som stabil över turväxlingar. Qwen rapporterar själv en diariseringsfelkvot på 9,7 % på sin egen långa flertalartestmängd, mot 30,6 % för Seed LiveInterpret 2.0 — en leverantörsjämförelse i en leverantörsutförd utvärdering, så behandla det som ett påstående med en siffra kopplad till sig snarare än som ett resultat. Modellen matar också ut källtext och översättning på samma tidslinje, vilket är det som gör synkroniserade tvåspråkiga undertexter möjliga utan ett separat aligneringssteg.

Gemini 3.5 Live Translate lägger betoningen på det motsatta. Dess dokumenterade styrka är bevarandet av prosodi – att behålla talarens tonhöjd, tempo, intonation och känslomässiga register, så att den översatta rösten förmedlar originalets känsla. Dess dokumenterade svagheter är just där diarisering skulle hjälpa: inkonsekvent röstkloning som kan glida efter långa pauser eller hamna på fel kön, svag turtagning utan tydlig signal om meningsslut, problem med starka accenter och med nära besläktade språkpar som spanska och portugisiska, samt bristfällig hantering av bakgrundsbrus. Google begränsar dessutom rena ljudsessioner till 15 minuter om de inte förlängs, och märker varje genererad ljudström med en SynthID-vattenstämpel som för närvarande inte kan tas bort.

Tillskrivning av flera talare – Qwen: diarisering i realtid, uppger 9,7 % DER. Gemini: dokumenterat svag turtagning, inget påstående om diarisering.

Rösttrohet — Qwen: återgivning av källtimmer via Talker-modulen. Gemini: bevarande av prosodi, tonhöjd och tempo; dokumenterad kloningsdrift.

Tvåspråkig utdata — Qwen: källtext och översättning sänds ut på samma tidslinje. Gemini: valfri transkribering av indata och utdata, konfigurerad per session.

Vattenmärkning — Qwen: inget angivet. Gemini: SynthID på allt genererat ljud, ingen borttagningsväg.

Sessionslängd — Qwen: ej angivet. Gemini: 15-minutersgräns för rena ljudsessioner.

Indatatyper — Qwen: ljud och bild. Gemini: endast ljud, ingen textinmatning.

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

Vad var och en faktiskt kostar att driva

Qwen3.8-LiveTranslate prissätts per miljon tokens över WebSocket Realtime API. I regionen Singapore: 7,50 USD för ljudinmatning, 0,55 USD för bildinmatning, 20,00 USD för textutmatning, 30,00 USD för ljudutmatning. I Beijing: ¥40 / ¥3,3 / ¥100 / ¥160 per miljon — ungefär 5,65 USD / 0,47 USD / 14,13 USD / 22,61 USD. Kontextfönstret är 53 248 tokens, och hastighetsgränsen är 10 förfrågningar per minut och 100 000 tokens per minut i båda regionerna.

Taket på 10 RPM är den mest betydelsefulla siffran i prislistan. De kommersiella villkoren för Gemini 3.5 Live Translate publiceras inte på samma sätt, vilket i sig är en signal om mognad: Google distribuerar Gemini 3.5 Live Translate via Live API och AI Studio i offentlig förhandsvisning, Google Meet i en privat förhandsvisning för utvalda Workspace-kunder, och Translate-appen på Android och iOS. Förhandsvisningens priser och gränser för anropsfrekvens kan ändras utan föregående meddelande, och Google har inte åtagit sig något GA-datum.

Så kostnadsjämförelsen just nu står mellan en modell med ett publicerat pris och ett hårt samtidighetstak, och en modell utan publicerat pris och med ett ospecificerat tak. Om du behöver modellera enhetsekonomi det här kvartalet är det bara en av dem som går att budgetera.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

Vad ett oberoende test skulle behöva visa

Allt ovan bygger på de två leverantörernas egna tillkännagivanden, eftersom ingen har kört dessa modeller mot varandra. Ett resultat som verkligen skulle avgöra den här duellen kräver fyra saker, och ingen av dem finns ännu:

• LAAL uppmätt på samma sätt på båda modellerna, på samma ljud, i samma språkpar — Qwens siffra på 2,3 s kan inte jämföras med något som Google har avstått från att uppge.

• Diariseringsfelkvot på en gemensam flertalarkorpus, inte på Qwens eget Omnilingua-MSpeaker-set.

• Stabilitet vid röstkloning över långa sessioner, vilket är just där Geminis egen dokumentation flaggar för drift och Qwen kommer med sitt starkaste påstående.

• Beteende vid samtidighetsgränserna — om Qwens 10 RPM håller under verklig mötesbelastning och om Geminis förhandsgranskningskvoter överlever kontakten med produktionen.

Tills det testet finns är den försvarbara positionen snäv: Qwen har publicerat mer och utlovat fler specifika saker; Google har bredare språktäckning och en distributionsräckvidd som ingen modell som enbart är API-baserad kan matcha.

Vilken ska man välja?

Utgå från formen på ditt problem, inte från resultattavlan, för resultattavlan går ännu inte att lita på.

Om din arbetsbelastning involverar flera parter och attribuering spelar roll – mötestranskription, en panel, en rättssal, allt där att veta vem som sade en översatt mening är en del av värdet – är Qwen3.8-LiveTranslate den enda av de två som gör anspråk på förmågan, och Geminis dokumenterade svaghet när det gäller turtagning pekar i samma riktning. Om din arbetsbelastning omfattar många språk, är konsumentinriktad och redan finns i Googles ekosystem, är Gemini 3.5 Live Translates över 70 språk och dess närvaro i Translate-appen och Meet fördelar som ingen konkurrent med enbart API kan matcha när det gäller distribution.

Om du bygger en produkt snarare än köper en demo bör du notera att båda är snäva specialister. Ingen av dem kör en agentloop, ingen av dem sammanfattar, och Qwen3.8-LiveTranslate stöder uttryckligen inga funktionsanrop, ingen strukturerad utdata, ingen kontextcachning och ingen finjustering. Tolken är fronten av din pipeline, inte hela. OrcaRouter är inte platsen att anropa någon av översättningsmodellerna idag — ingen av dem finns i vår katalog, och vi säger hellre det än antyder något annat. Vad vi däremot erbjuder är den halvan av stacken som konsumerar transkriptionen: en nyckel över 200-plus modeller till leverantörens listpris med noll påslag som förs vidare, så att sammanfattaren, ordlistetillämparen eller den nedströms agenten som läser transkriptionen kan bytas ut eller redundansväxlas utan att röra ett andra leverantörsavtal.

Botten av den

Qwen3.8-LiveTranslate och Gemini 3.5 Live Translate är tillräckligt nära varandra i grunderna för att marknadsföringen har blivit det som skiljer dem åt: den ena publicerade en latenssiffra och en prislista, den andra publicerade en språkkarta och ett ekosystem. Ingen av dem har genomgått ett oberoende test. Den version av den här jämförelsen som är värd att läsa är den som skrivs efter att någon har kört båda på samma ljud – och med tanke på hur snabbt den här kategorin rör sig är det kanske inte långt borta.

Jämförda i den här artikeln3

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen