Ett genererat hero-kort för "Gemini 3.8 TTS vs Qwen Audio 3.0 TTS" på en vit bakgrund med mjuka blå- och cyanfärgade gradientaccenter. Det vänstra kortet "Qwen-Audio-3.0-TTS-Plus" listar Elo 1 259, 15 arena-röster, 16 språk + 20 dialekter och $27,6 per 1 miljon tecken; det högra kortet "Gemini 3.8 Flash TTS" listar Elo 1 260, 8 arena-röster, 130 språk och $33,0 per 1 miljon tecken. En sidfotsrad lyder "Elo per Artificial Analysis Provider Voice Arena, sept. 2026." OrcaRouter-logotypen är sammansatt i det nedre högra hörnet.
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Två olika svar på ”Få det att låta rätt”

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En Elo-poäng skiljer dessa två modeller åt på Artificial Analysis Provider Voice Arena, och de tar sig dit genom att lösa helt olika problem. Qwen-Audio-3.0-TTS-Plus ligger på plats 3 med en Elo på 1 259 över 1 447 sampel och 15 arena-röster, släppt i september 2026 och listad till 27,60 USD per miljon tecken. Gemini 3.8 Flash TTS ligger på plats 2 med 1 260 över 1 999 sampel och 8 arena-röster, släppt den 23 september 2026 och listad till 33,00 USD per miljon tecken. Statistiskt omöjliga att skilja åt, tjugo procent isär i pris, och byggda på motsatta teorier om vad som gör syntetiskt tal bra.

Det intressanta är teorin. Qwens svar är inline-styrning: 86 framförandetaggar som du strösslar genom texten så att modellen vet var den ska andas, betona och skifta register. Googles svar är ett regilager: radvisa instruktioner, iscensättning för två talare och en liten uppsättning icke-verbala signaler. Om du redan har byggt en pipeline som skickar ut SSML-liknande annoteringar kommer en av dessa att passa och den andra inte, och den kompatibiliteten spelar större roll än en enda Elo-poäng.

Var de två faktiskt sitter på brädet

Att läsa Provider Voice Arena ärligt kräver att man tittar på intervallen, inte på rankningarna.

• Qwen-Audio-3.0-TTS-Plus — rang 3, Elo 1 259, 1 447 prover, 15 arenaröster, september 2026, 27,6 USD per 1 miljon tecken.

• Gemini 3.8 Flash TTS – rang 2, Elo 1 260, 1 999 prover, 8 arena-röster, september 2026, 33,0 USD per 1 miljon tecken.

• Cartesia Sonic 3.6 — plats 1, Elo 1 273, 1 757 prover, 8 arenaröster, augusti 2026, 49,0 $ per 1 miljon tecken.

De tre främsta är en och samma grupp. De publicerade intervallen för de två främsta sträcker sig sjutton punkter åt vardera sidan, vilket är bredare än hela spridningen mellan första- och tredjeplatsen, så ordningen mellan dem är inte något stabilt bevis. Vad resultattavlan däremot fastställer är att alla tre tillhör ledargruppen och att inget under dem är nära — plats 10, Gemini 3.1 Flash TTS, ligger på 1 199.

Den enda asymmetrin värd att notera är antalet röster i arenan. Qwen ställer upp med 15 röster mot Geminis 8, så Qwen-poängen är ett genomsnitt över ett bredare urval av leverantörens egen produkt. Det slår åt båda hållen: det är en rättvisare uppskattning av hur Qwens katalog låter överlag, och det ger Qwen fler möjligheter att ställa upp med en svag röst som drar ner genomsnittet. Ingen av tolkningarna ändrar slutsatsen att de två står lika.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 leveranstaggar mot ett riktningslager

Detta är den väsentliga skillnaden och den avgör de flesta integrationer.

Qwen-Audio-3.0-TTS levereras med 86 inline-taggar för framförande – anteckningar inbäddade i texten som styr hur ett textavsnitt läses upp. Det är en markup-metod: ditt manus bär framförandet. Det är välbekant för alla som har arbetat med SSML, och det fungerar bra tillsammans med verktyg som genererar text programmatiskt, eftersom kontrollen är en strängtransformation snarare än ett API-anrop.

Gemini 3.8 Flash TTS tar den andra vägen. Du regisserar en replik på samma sätt som du skulle regissera en skådespelare — tempo, betoning, känslomässigt register — som en separat instruktion snarare än som inline-markering. Scener med två talare kan iscensättas i ett enda anrop. Och en liten uppsättning icke-verbala signaler skrivs in i manuset: <laughs>, <sigh>, <gasp> som inline-signaler, plus |mhm| och |yeah| för backchannel-ljud.

Så båda modellerna accepterar anteckningar i texten; skillnaden är storleken på vokabulären och var resten av styrningen ligger. Qwens är bredare och plattare – 86 taggar, alla i texten. Googles är smalare i texten och bredare utanför den, med framföranderegi och talarplacering som parametrar på anropsnivå. Om du portar ett system som redan skickar ut rik inline-markup är Qwen den kortare portningen. Om du ändå bygger regi-logiken i applikationskoden är Googles uppdelning renare.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Språktäckning kontra dialekttäckning

Täckningssiffrorna är inte jämförbara, och att jämföra dem naivt är ett misstag.

Gemini 3.8 Flash TTS täcker 130 språk som automatiskt identifieras från texten; Flash-Lite TTS täcker 101. Det är bredd över språkfamiljer, vilket är vad du vill ha för en lokaliseringsomgång som måste nå en lång svans av marknader.

Qwen-Audio-3.0-TTS täcker 16 språk plus 20 kinesiska dialektregioner. Det är djup inom en enda språkfamilj. Tjugo dialektregioner är inte ett mindre antal än 130 språk så som det ser ut — det är ett annat slags påstående, och för en produkt som betjänar kinesisktalande användare i olika regioner på fastlandet är det ett mer användbart sådant. En modell med 130 språk och en enda mandarinröst betjänar inte en användare i Sichuan på samma sätt som en modell med 20 dialektregioner gör.

Vad som spelar roll beror helt och hållet på din målgrupp. Om ditt krav är ”åtminstone någorlunda godtagbar på tjugo marknader”, Gemini. Om det är ”verkligen rätt på den kinesiska marknaden”, Qwen.

Pris, och vad siffran per tecken döljer

• Qwen-Audio-3.0-TTS-Plus — $27.60 per 1 miljon tecken på leaderboardens normaliserade bas; Flash-varianten ligger på omkring $15 per 1 miljon tecken med en uppgiven latens för första paketet på cirka 300 ms.

• Gemini 3.8 Flash TTS – 33,00 USD per 1 miljon normaliserade tecken; faktureras av Google med 0,50 USD per miljon inkommande texttokens och 9,00 USD per miljon utgående audiotokens fram till och med den 31 december 2026, därefter 1,00 USD och 18,00 USD.

• {{1}}Gemini 3.8 Flash-Lite TTS{{/1}} — {{2}}$22,10 per 1 miljon normaliserade tecken{{/2}} på {{3}}plats 6 med en Elo på 1 235{{/3}}; faktureras till {{4}}$6,00 per miljon ljudtokens{{/4}} {{5}}till och med den 31 december 2026{{/5}}.

Båda siffrorna per tecken är Artificial Analysis-normaliseringar, inte leverantörslistpriser – Qwen fakturerar via Alibaba Cloud Model Studio och Google fakturerar i tokens, och ingen av dem publicerar ett pris per tecken för dessa modeller. Använd dem för kvoten, som är ungefär 1,2x till Qwens fördel, och inte som offerter.

Nivåerna skiljer sig till formen. Qwen delas upp i Plus och Flash, där Flash-nivån byter bort kvalitet mot ett löfte om första paketet på ~300 ms. Google delas upp i Flash och Flash-Lite och sedan vidare i Standard, Batch och Flex samt Priority – 4,50, 9,00 och 16,20 USD per miljon ljudtokens på Flash TTS. Googles modell belönar att klassificera din arbetsbelastning; Qwens belönar att välja en kvalitetsnivå i förväg.

Tillgänglighet är den andra verkliga skillnaden. Gemini 3.8 Flash TTS är allmänt tillgänglig på Gemini Developer API. Qwen-Audio-3.0-TTS är stängd och endast värdbaserad, tillhandahålls via Alibaba Cloud Model Studio utan öppna vikter. Om du behöver köra modellen själv är ingen av dessa för dig — men om din infrastruktur redan finns på Alibaba Cloud är Qwen-modellen den som inte har någon egress-fråga att lösa.

Leverantörsanspråk på båda sidor

Ingen av modellerna har ett oberoende riktmärke bortom arenan, och båda leverantörerna har publicerat påståenden som bör märkas som sådana.

Googles, för Gemini 3.8 Flash TTS: etta på Hume AI Voice Design Benchmark med 71,4, etta inom accentmodellering med 60,8, etta och tvåa på Hume Overall Quality Index för Flash och Flash-Lite, samt topplaceringar i blindpreferens som uppges för japanska, brasiliansk portugisiska, vietnamesiska, modern standardarabiska, mexikansk spanska och hindi. Körningarna är inte offentliga.

Alibabas, för Qwen-Audio-3.0-TTS: framförandesystemet med 86 taggar, de 20 dialektregionerna och siffran på cirka 300 ms för första paketet på Flash-varianten. Även oreproducerat.

Arena-Elo är det enda oberoende insamlade kvalitetsmåttet i den här artikeln, och det visar att de två ligger lika i toppen av tabellen.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Vad Gemini tillför som Qwen inte gör

Röstskapande är den tydligaste luckan. Gemini 3.8 Flash TTS stöder röstdesign från en beskrivning i naturligt språk och röstreplikering från ett 30-sekundersprov, med samtyckesverifiering och en SynthID-vattenstämpel plus C2PA-uppgifter på utdata. Anpassade röster finns i två former: 200 tillståndsbevarande röster per projekt med en livstid på ett år, eller tillståndslösa röster som adresseras av ett voicekey_... handtag som löper ut efter sju dagar. Röstremixning listas som kommande.

Kontroll av utdataformat är den andra. WAV 24 kHz mono 16-bitars teckenförsedd PCM på unary-slutpunkten, PCM utan header (audio/l16) på strömningsslutpunkten, plus audio/mulaw och audio/alaw och en konfigurerbar samplingsfrekvens. För telefonirelaterat arbete tar stöd för mulaw bort ett transkodningssteg.

Vilken ska man ringa?

Välj Qwen-Audio-3.0-TTS om dina användare talar kinesiska och dialektäckning är kravet, om du vill ha ett rikt vokabulär för inline-markering som din generator kan skicka direkt, eller om du redan finns på Alibaba Cloud och vill ha den kortaste vägen till en fungerande endpoint. Den är också den billigare av de två på normaliserad basis, och Flash-varianten är ännu billigare om ~300 ms för första paketet är acceptabelt.

Välj Gemini 3.8 Flash TTS om du behöver bredd över många språk snarare än djup i ett, om du behöver skapa eller replikera en specifik röst, om du behöver mulaw- eller alaw-utdata, eller om "allmänt tillgänglig snarare än enbart hostad" är ett upphandlingskrav.

Inget av dem är ett dåligt val och inget av dem är klart bättre — vilket är poängen med en skillnad på en Elo-poäng. Beslutet handlar om kompatibilitet, inte kvalitet.

Det är också argumentet för att inte binda sig hårt vid någon av dem ännu. OrcaRouter ger dig 200+ modeller bakom en enda nyckel till leverantörens listpris utan påslag, så en prisändring från något av labben når din faktura samma dag i stället för vid förnyelse, och automatisk failover innebär att en syntesendpoint som vacklar under belastning faller vidare till en annan i stället för att tappa förfrågan. Vi hostar inte Qwen-Audio-3.0-TTS — den tillhandahålls via Alibaba Cloud Model Studio — och vi hostar inte Gemini 3.8 TTS-endpoints, som kommer från Googles API. Det vi tillhandahåller är textlagret och routningen ovanpå det, vilket är det som låter dig köra båda på verklig trafik i en månad innan du väljer.

Siffran att hålla koll på är nästa arena-revision. Med 1 447 sampel på Qwen och 1 999 på Gemini är båda intervallen fortfarande tillräckligt breda för att en enda månads röster skulle kunna skilja dem åt – eller bekräfta att oavgjort är svaret.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen