Titelkort som visar Qwen3.8-LiveTranslate med underrubriken "Den halvsekund som sätter AI-tolkning i mänsklig takt" och tre statistikchips: genomsnittlig fördröjning 2,8 s till 2,3 s, 60 källspråk, 29 språk för talad utdata.
Engineering & Research

Möt Qwen3.8-LiveTranslate: Halvsekunden som får AI-tolkning att gå i mänsklig takt

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen3.8-LiveTranslate lanserades den 19 september 2026, och hela tillkännagivandet kan reduceras till en enda subtraktion. Genomsnittlig fördröjning — LAAL, den genomsnittliga förskjutningen mellan ett ord som lämnar talarens mun och dess översättning som når lyssnarens öra — sjunker från 2,8 sekunder i den tidigare generationen till 2,3 sekunder. Professionella mänskliga tolkar arbetar med en öron-till-röst-fördröjning på ungefär 2 till 3 sekunder. Det är hela historien: inte att en maskin blev snabbare, utan att dess fördröjning nu ligger inom det intervall där lyssnare slutar lägga märke till en maskin överhuvudtaget. Lanseringssiffrorna anger den tidigare generationens FLEURS-översättningskvalitet till 83,0 xCOMET-XXL; den här uppges vara 85,7. Båda siffrorna är tillverkarens, framtagna i tillverkarens egen utvärderingsmiljö, och ingen oberoende part har ännu reproducerat dem — vilket är det enskilt viktigaste förbehållet i den här artikeln.

Det som gör släppet värt att läsa bortom rubriken är mekanismen. Qwen kortade inte latensen genom att göra en snabbare igenkännare eller en enklare syntetiserare. Den tog bort skarvarna mellan dem.

Vad som faktiskt ändrades: sömmarna är borta

Klassisk simultantolkning är en pipeline i tre steg som har satts samman på samma sätt i ett decennium: automatisk taligenkänning transkriberar strömmen, maskinöversättning omvandlar transkriptionen och text-till-tal läser resultatet högt. Varje steg är en separat modell med sin egen latensbudget, och varje överlämning förlorar något – prosodi i det första, talaridentitet i det tredje, och en fast fördröjning på några hundra millisekunder vid varje gräns där en modul måste vänta på tillräckligt många tokens för att vara säker.

Qwen3.8-LiveTranslate ersätter den kaskaden med vad leverantören kallar en Interleave-arkitektur byggd på en hybrid MoE-stomme, uppdelad i två samverkande moduler:

Thinker — arrangerar video, ljud, källtext och översättning i en enda kausal sekvens, sammanflätade i tidsordning, och producerar förståelse plus översättning end-to-end i ett enda svep i stället för i tre.

Talker — tar den översatta texten tillsammans med det ursprungliga ljudet och syntetiserar tal som behåller källtalarens klang, så att den dubbade rösten är igenkännbar som personen som talade.

Det arkitektoniska påståendet är att eftersom igenkänning, översättning och syntes delar en och samma sekvensmodelleringsram i stället för att skicka meddelanden över modulgränser, slutar systemet betala intermodulskatten två gånger per yttrande. Det är en rimlig förklaring till var de 0,5 sekunderna kom ifrån, och det är också precis den typ av påstående som är billigt att hävda och dyrt att verifiera. Betrakta det som leverantörens förklaring, inte som ett etablerat resultat.

De tre förmågorna som är genuint nya

Språktäckningen rörde sig inte: 60 källspråk känns igen, 29 tillgängliga för talad utdata — samma antal som Qwen3.5-LiveTranslate. De intressanta tilläggen handlar helt och hållet om vad som händer när mer än en person talar.

Talardiarisering i realtid — varje mening tillskrivs en talare i samma stund som den sägs, och replikering av röstklang beskrivs som mer stabil över turbyten. Qwen uppger själv en diariseringsfelfrekvens på 9,7 % på sin egen långa testuppsättning med flera talare, mot 30,6 % för Seed LiveInterpret 2.0. Båda siffrorna kommer från Qwen.

Källa och översättning i samma bildruta — modellen skickar ut den ursprungliga transkriptionen och den översatta texten på en och samma tidslinje, vilket är vad som gör ett tvåspråkigt undertextpar på skärmen möjligt utan en andra aligneringsomgång.

Disambiguering med lång kontext — tidigare kontext förs vidare så att namn, tilltalsord och domäntermer förblir konsekventa. Det här är det som spelar störst roll i praktiken: det klassiska misslyckandet vid simultantolkning är inte ett felaktigt ord, utan att samma person återges på tre olika sätt under ett och samma möte.

Diarisering är den punkt som verkligen särskiljer här. Gemini 3.5 Live Translate, Googles konkurrerande modell för tal-till-tal i realtid, har dokumenterade problem med turväxling – den kan ha svårt att veta när en talare faktiskt har slutat. Qwen hävdar den motsatta egenskapen som en funktion. Inget av företagen har publicerat en direkt jämförelse som skulle avgöra saken.

Screenshot of Alibaba Qwen team's own announcement page for Qwen3.8-LiveTranslate, showing the release headline, the Interleave architecture description with Thinker and Talker modules, and the stated average lagging figure of 2.3 seconds.

Att läsa benchmarkpåståendena ärligt

Qwen testades på två uppsättningar, och de är värda att hålla åtskilda eftersom de mäter olika saker.

FLEURS, 70 språkriktningar — det offentliga, vitt använda flerspråkiga ljudbenchmarket. Qwen hävdar att man är ledande jämfört med både sin föregångare och vad man kallar nuvarande etablerade realtidstolkningssystem när det gäller översättningskvalitet, genomsnittlig fördröjning, taligenkänningsnoggrannhet och talsynteskvalitet. Jämförelsen 85,7 mot 83,0 i xCOMET-XXL finns här.

Omnilingua-MSpeaker, 14 språkriktningar – Qwens egen utvärderingsuppsättning för långt ljud med flera talare. Företaget hävdar bättre trohet, flyt och koncishet samt en lägre diariseringsfelkvot. Ett leverantörsbyggt benchmark är inte värdelöst, men det är inte heller något bevis: det utformades av dem vars modell betygsätts i det.

Den ärliga sammanfattningen är att FLEURS är verkligt och offentligt, så 85,7 är åtminstone kontrollerbart i princip; Omnilingua-MSpeaker är det inte, så diariseringsvinsten är ett påstående tills någon kör om det. Ingen tredje part har publicerat siffror för Qwen3.8-LiveTranslate vid tidpunkten för skrivandet, och modellen är bara några timmar gammal.

Vad API:et kostar, och en siffra som kommer att bita dig

Qwen3.8-LiveTranslate har stängda vikter och är endast tillgänglig via API. Den körs över ett WebSocket Realtime-API under modell-ID:t qwen3.8-livetranslate-flash-realtime, inte över en vanlig HTTP-slutpunkt. Prissättningen är per miljon tokens, och eftersom ljudtokens är täta ser de angivna priserna häpnadsväckande ut jämfört med textmodeller tills man kommer ihåg vad en ljudtoken är:

Singapore-regionen — ljudinmatning 7,50 $, bildinmatning 0,55 $, textutmatning 20,00 $, ljudutmatning 30,00 $ per miljon tokens.

Beijing-regionen — ¥40 ljudinmatning, ¥3,3 bildinmatning, ¥100 textutmatning, ¥160 ljudutmatning per miljon tokens, vilket motsvarar ungefär $5,65 / $0,47 / $14,13 / $22,61 enligt aktuella växelkurser.

Kontext — 53 248 tokens totalt, uppdelat i 49 152 maximal indata och 4 096 maximal utdata.

Hastighetsbegränsningar – 10 förfrågningar per minut och 100 000 token per minut, identiska i båda regionerna.

Den där frekvensbegränsningen är siffran att stryka under. Tio förfrågningar per minut är generöst för en handfull mötesrum och inte i närheten av tillräckligt för en driftsättning i ett kontaktcenter eller en direktsändning med tusentals samtidiga strömmar. Qwen har hållit prissättningen för gränssnittet i stort sett oförändrad jämfört med föregående generation – priserna i Beijing är oförändrade och Singapore är marginellt billigare – men en modell som arkitektoniskt är redo för skala tillhandahålls som en förhandsversion. Den som planerar produktionstrafik bör se taket på 10 RPM som den bindande begränsningen, inte priset per token.

Single-column scoreboard for Qwen3.8-LiveTranslate listing average lag (LAAL) 2.3 seconds, languages 60 source and 29 spoken, context 53,248 tokens, input audio plus image, output text plus audio, and weights closed and API-only, with a footer reading 'All figures vendor-reported; no independent replication yet.'

Att anropa det är inte som att anropa en chattmodell

Realtime API är händelsestyrt, vilket är en annan mental modell än en completion-endpoint. Du öppnar en socket och tar emot session.created, skickar sedan en session.update-händelse för att konfigurera sessionen innan något ljud överförs.

target_language är obligatoriskt och måste anges före den första ljudchunken — det finns inget implicit standardmål.

source_language är valfritt och autodetekteras som standard.

output_modalities väljer ["text"] för endast transkript eller ["text","audio"] för översatt tal.

input_audio_buffer.append skickar base64-kodade PCM-chunks uppåt; response.text.delta och response.audio.delta kommer tillbaka ned, med response.done som markerar slutet av en tur.

Två praktiska anmärkningar. För det första kan en webbläsare inte ange en Authorization-header vid en WebSocket-handskakning, så anslutningen måste öppnas på serversidan och ljudet vidarebefordras till klienten via din egen socket – detta är inte något man kopplar direkt in i en frontend. För det andra varnar Qwen uttryckligen för att uppsättningen av parametrar och händelser skiljer sig från den tidigare LiveTranslate-generationen, så all kod som skrivits mot Qwen3.5-LiveTranslate behöver ses över på nytt i stället för att bara pekas om. En slutpunkt för kostnadsfri provperiod körs på omni.qwen.ai/live-translate om du vill höra fördröjningen innan du satsar ingenjörstid.

Vad det medvetet inte gör

Qwen listar en uppsättning funktioner som otillgängliga, och listan är klargörande. Inget funktionsanrop. Inga strukturerade utdata. Ingen webbsökning. Ingen prefixfortsättning, kontextcachning eller batchinferens. Ingen finjustering.

Detta är en specialist, inte en generalist som spelar tolk. Den kommer inte att köra din agentloop, och den kommer inte att vara modellen som sammanfattar mötet. Designa därefter: tolken producerar en transkription och en översatt ljudström, och allt nedströms om det – åtgärdspunktsutdragaren, ordlisteupprätthållaren, CRM-återskrivningen – är en separat textmodells uppgift.

Den uppdelningen är där en router gör sig förtjänt av sin plats. Qwen3.8-LiveTranslate finns i sig tillgängligt via leverantörens eget API och flera tredjepartsplattformar; det finns inte i OrcaRouters katalog i dag, och vi tänker inte låtsas något annat. Det OrcaRouter däremot erbjuder är den omgivande stacken – inklusive Alibabas egen flaggskeppsmodell Qwen3.8-Max, en sparse mixture-of-experts-modell med 2,4 biljoner parametrar och en kontext på 1 miljon tokens till $2.00 per miljon indatatokens och $6.00 per miljon utdatatokens, fakturerat till leverantörens listpris utan påslag. Att hålla tolken och modellerna som konsumerar dess utdata bakom en enda slutpunkt och en enda nyckel innebär att transkriberingspipen inte behöver ett andra avtal när du byter ut sammanfattaren, och automatisk redundans håller den nedströms halvan av systemet vid liv när en enskild leverantör strular – vilket, vid 10 förfrågningar per minut, är ett scenario som är värt att planera för i stället för att upptäcka.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing the $2.00 per million token input price, the $6.00 output price, the 1M token context window, and text, image and video input tags.

Vad du ska titta på härnäst

Två saker skulle göra den här releasen från ett välargumenterat påstående till ett fastställt faktum. Den första är en oberoende latensmätning: LAAL är ett väldefinierat mått, och vem som helst med teständpunkten och en stoppursrigg kan ta fram en siffra som Qwen inte har tagit fram. Den andra är Qwens egen uttalade färdplan – att komma närmare latensgolvet, långtidsminne över sessioner och täckning av långsvansspråk och regionala dialekter. Det är långsvansposten man bör ställa dem till svars för, eftersom 60 källspråk är en aktningsvärd siffra som i tysthet utesluter de flesta av världens talare, och gapet mellan en demo som fungerar på mandarin och engelska och en som fungerar på yoruba eller quechua är där produkter för realtidstolkning historiskt har kört fast.

För närvarande är den rimliga hållningen att Qwen3.8-LiveTranslate är den första modellen för simultantolkning vars huvudnummer ställs mot mänskliga tolkar i stället för mot dess egen föregångare – och den inramningen är ett mycket svårare test att klara än det den ersätter. Den har ännu inte klarat det. Den har bara anmält sig frivilligt till det.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen