
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Två halvor av en röststack, omprissatta med åtta dagars mellanrum
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 36 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 181 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Gemini 3.8 Live är Googles tal-till-tal-modell som släpptes den 15 september 2026 som gemini-3.8-live och gemini-3.8-live-extended-thinking på Live API. Qwen-Audio-3.1-TTS är Alibabas text-till-tal-modell, tillkännagavs på Apsara-konferensen i Hangzhou den 23 september 2026, åtta dagar senare, med en prissänkning på omkring 70 % för talsyntes kopplad till den. Det åtta dagar långa gapet är anledningen till att den här jämförelsen är värd att läsa nu i stället för i juli. Ingenting med de två produkternas roller förändrades – den ena lyssnar och talar, den andra läser text högt – men båda halvorna av en produktionsröstpipeline byggdes om eller prissattes om inom loppet av en enda tvåveckorsperiod, och aritmetiken som brukade avgöra den här matchen förändrades i tysthet.
Två halvor, uppdaterade med åtta dagars mellanrum
Börja med det som gör detta par ovanligt: de två modellerna konkurrerar inte. En röstprodukt har en mun och den har ett öra, och dessa är en av varje. Gemini 3.8 Live sluter kretsen — ljud och video in, ljud ut, avbrott hanteras, verktygsanrop körs under samtalet. Qwen-Audio-3.1-TTS tar en sträng och en referensröst och returnerar ett framförande. Den är bättre som mun än som något annat, och den försöker inte vara ett öra.
Det som gör tidsstyrningen i september intressant är att de två meddelandena riktar sig mot motsatta ändar av samma budgetpost. Googles lansering den 15 september var en berättelse om kapacitet utan någon prisförändring kopplad; Alibabas meddelande den 23 september var mest en marginalberättelse, med ny kapacitet på köpet. Ett team som byggde en hybridpipeline i augusti har inom loppet av åtta dagar fått en anledning att ompröva båda benen – och bara ett av dessa ben blev billigare.
Vad utgåvan 3.1 faktiskt förändrade på Qwen-sidan
Alibaba lanserade inte en enda modell den 23 september. 3.1-generationen omfattar fem slutpunkter — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next och Qwen-Audio-3.1-Realtime — och endast en av dem, den vanliga TTS-nivån, är en drop-in för alla som redan anropar 3.0 TTS-modellen.
På den nivån förändrades tre saker, och en av dem är en verklig migreringskostnad. Framförandekontrollen flyttades från ett fast vokabulär med 86 inline-taggar till instruktioner i naturligt språk: du beskriver den känsla, det tempo och den stil du vill ha i stället för att infoga rätt hakparentes på rätt plats. Tvärspråkig klangfärgsöverföring introducerades, vilket låter en referensröst behålla sin identitet över mandarin, kantonesiska, engelska och japanska. Och modellen tolererar nu brusigt eller ekande referensljud direkt, utan ett separat brusreduceringssteg. Språktäckningen är oförändrad vid ett av leverantören rapporterat antal på 16 språk plus 20 kinesiska dialektregioner, och — detta är värt att påpeka eftersom det slätas över på andra håll — Alibabas eget material säger att 3.1-nivån lägger till sju språk, vilket inte går ihop med de 16 som den publicerade täckningen för juligenerationen listade. Behandla båda antalen som leverantörsrapporterade tills du kontrollerar de specifika språk du behöver mot Model Studio.
Den genuint nya produkten i släppet är Qwen-Audio-3.1-TTS-Next, som Alibaba kallar en "Audiogen"-modell: en enda körning som producerar röst, ljudeffekter och bakgrundsambiens tillsammans, för dialog med flera talare, poddmontage och scenarbete. Den har ett listpris på $0,848 per miljon indatatoken och $1,696 per miljon utdatatoken på Beijing-noden, med ett tak på 3 000 tecken indata, 240 sekunder genererat ljud för poddar och 120 sekunder i övriga fall, tre förfrågningar per sekund, och tar emot upp till tre referensklipp på 30 sekunder vardera. Den hanterar endast kinesiska och engelska. Om din pipeline är en enda berättarröst som läser ett manus är den produkten irrelevant för dig; om den är två programledare och en musikbädd är den anledningen att över huvud taget titta på det här släppet.
Fogen är det du faktiskt väljer
Eftersom de två modellerna inte utför samma uppgift är beslutet inte ett bake-off. Det är en fråga om var du lägger överlämningen, och hur mycket du är villig att betala för att skarven ska vara osynlig.
Det finns två ärliga arkitekturer. Den första är ett enda nätverk: Gemini 3.8 Live hanterar hela turen, hör den som ringer, bestämmer vad som ska sägas och säger det, och du accepterar rösten den ger dig – som du varken kan klona eller sätta ditt varumärke på. Den andra är en kaskad: igenkänning, sedan resonemang, sedan Qwen-Audio-3.1-TTS som mun, vilket ger dig tusen röster, inklusive en som spelats in av din egen talang, till priset av latens över två eller tre leverantörsgränser och den prosodi som går förlorad när en mening delas upp över ett API-anrop.
De flesta team hamnar till slut med båda, och det är inte ett bristande mod. Använd realtidsmodellen där latensen känns — avbrott, bekräftelse, "mm-hm" som talar om för den som ringer att du fortfarande är kvar — och syntesmodellen där kvaliteten hörs: den långa återuppläsningen av en policy, bekräftelsenumret som läses i ett medvetet tempo, den varumärkesröst som måste vara identisk vid varje enskilt samtal. Hybriden är det korrekta svaret för en stor klass av produkter. Det är också där kostnadsmodellen blir svår, eftersom du nu mäter två olika enheter.

Pris per ljudtimme, vilket är den enda enheten som båda passar
Google fakturerar Live API per minut; Alibaba fakturerar Qwen TTS-nivåerna per tecken och per token. För att jämföra dem måste man välja en normaliserare, och den enda försvarbara för röst är timmen färdigt ljud.
• Mätning in — Gemini 3.8 Live per minut ljud, $0,005 in och $0,018 ut jämfört med Qwen-Audio-3.1-TTS per miljon tecken, där 3.0 Plus-nivån ligger nära $27,60 och Flash-nivån nära $15 före sänkningen, och TTS Flash-nivån listas till 1,5 yuan per miljon indatatoken och 12 yuan per miljon utdatatoken efter den
• Mätning ut — Gemini 3.8 Live tvåvägssamtal kostar cirka $1,38 för en timmes samtal i verklig tid enligt listpris, före eventuell cachning, jämfört med Qwen-Audio-3.1-TTS en enkelriktad ström, där 3.1-Next-nivån ligger på $0,848 per miljon indatatoken och $1,696 per miljon utdata på Beijing-noden
• Hör den som ringer — Gemini 3.8 Live ja, inbyggd ljud- och videoinmatning jämfört med Qwen-Audio-3.1-TTS nej, text in och ljud ut
• Röster — Gemini 3.8 Live en röst, inte klonbar, inte varumärkesanpassningsbar jämfört med Qwen-Audio-3.1-TTS över tusen med zero-shot-kloning från brusigt referensljud
• Språk — Gemini 3.8 Live ett leverantörsrapporterat antal på 97, växlas mitt i samtalet jämfört med Qwen-Audio-3.1-TTS ett leverantörsrapporterat antal på 16 plus 20 kinesiska dialektregioner, med klangfärgsöverföring mellan mandarin, kantonesiska, engelska och japanska
• Framförandekontroll — Gemini 3.8 Live prompt och samtalskontext jämfört med Qwen-Audio-3.1-TTS instruktion i naturligt språk, vilket ersätter 3.0-generationens 86 inline-taggar
• Oberoende poäng — Gemini 3.8 Live 82,6 på Artificial Analysis Speech to Speech Index för Extended Thinking-varianten och 76,0 för standardvarianten jämfört med Qwen-Audio-3.1-TTS ingen; det närmaste Qwen-talet är 1 259 Elo för föregående generations 3.0 Plus-nivå i Provider Voice Arena, vilket är en poängsättning av föregångaren och inte av den här modellen
Den procentuella sänkningen anges mot priser som varierar beroende på region och nivå, så de 70 % som anges i rubriken är inte ett löfte om din trafik, och Alibaba Cloud har också ändrat mätningen av realtidstranskribering på Singapore-noden från varaktighetsbaserad till tokenbaserad mätning – vilket är en mindre förutsägbar grund, eftersom både tystnad och kontext över flera turer blåser upp tokenförbrukningen. Läs den nya prislistan mot din egen ljudfil.

Vad uppgraderingen till 3.1 inte avgör
Här är delen som är lätt att få fel i båda riktningarna. Förbättringarna i 3.1 gör inte Qwen-Audio-3.1-TTS till en kandidat för det jobb som Gemini 3.8 Live utför — instruktionsbaserad styrning, klangfärgsöverföring och tolerans mot brusiga indata gör den alla till en bättre mun, och ingen av dem ger den ett öra. På samma sätt säger Gemini 3.8 Lives benchmarkposition ingenting om huruvida din varumärkesröst överlever en mening på kantonesiska.
Det finns också ett hål i bevisningen som en prissänkning gör mer frestande att ignorera. Qwen-Audio-3.1-TTS har ingen oberoende poäng. De 1 259 Elo som visas bredvid Qwen-namnet i Provider Voice Arena tillhör Qwen-Audio-3.0-TTS-Plus, modellen som ersätts, uppmätt på 1 447 prover. Efterträdarens egen rad i Arena finns ännu inte. Om din godkännandeprocess kräver en tredjepartssiffra – och för en varumärkesröst borde den förmodligen det – är den nyare modellen den som saknar den, och den billigare nivån är den du ännu inte kan försvara. Den enda händelsen som skulle avgöra detta är att Qwen-Audio-3.1-TTS dyker upp i en blindlyssningspanel.
Där en nyckel hjälper och inte hjälper
En konsekvens av 3.1-släppet är lätt att missa eftersom den ser ut som en promptteknikdetalj snarare än en infrastrukturdetalj. Att ersätta 86 hårdkodade taggar med fritextinstruktioner förvandlar dina leveransdirektiv till textartefakter. Du genererar dem nu, versionshanterar dem och validerar om vart och ett av dem mot den nya modellens tolkning — och felsättet är drift, inte ett fel, eftersom två formuleringar av "varm men inte sentimental" inte kommer att landa identiskt.
Det är ett textinferensproblem inlindat runt en talpipeline, och det är där vi är användbara. OrcaRouter routar inte Qwen-Audio-3.1-TTS eller någon Qwen-Audio-modell, och vi routar inte heller Gemini 3.8 Live-slutpunkterna — ingen av halvorna i den här stacken kan anropas via oss, och inget här bör läsas som ett påstående att så är fallet. Det vi däremot tillhandahåller är lagret som skriver och kontrollerar riktningstexten: qwen/qwen3.8-flash och google/gemini-3.8-flash bland fler än 200 modeller från en enda nyckel till leverantörens listpris utan påslag, med ett routing-DSL som komponerar flera modeller till ett anrop och automatisk failover när en uppströmstjänst försämras. När du är på väg att återvalidera tiotusen leveransprompter mot en modell som just har ändrat hur den läser dem, är att generera varianterna och poängsätta dem för konsistens den delen som borde vara ett kontrakt, inte fyra.
Vad du bör mäta innan du väljer
Tre experiment svarar mer än någon styrelse. Kör en referensröst och ett stycke av ditt eget manus genom Qwen-Audio-3.1-TTS och lyssna efter om den instruktionsbaserade styrningen ger dig samma framförande två gånger — det är migreringsrisken, och den är billigare att mäta än att planera kring. Kör en riktig samtalsinspelning med ditt eget bakgrundsbrus genom Gemini 3.8 Live och kontrollera om turtagningen håller när den som ringer avbryter mitt i ett ord — det är vad tal-till-tal-indexet försöker kvantifiera, och det överlever inte kontakt med en riktig telefonlinje tillräckligt tillförlitligt för att tas på tro. Och räkna på din egen volym i ljudtimmar i stället för i de enheter de två leverantörerna fakturerar i, för i just den här kombinationen var den förväntade prisskillnaden mellan "billig kinesisk TTS" och "Googles flaggskepp" aldrig så stor som den ser ut, och efter den 23 september är den ännu mindre.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
