
Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: Twee verschillende antwoorden op "Laat het goed klinken"
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Eén Elo-punt scheidt deze twee modellen op de Artificial Analysis Provider Voice Arena, en dat bereiken ze door volledig verschillende problemen op te lossen. Qwen-Audio-3.0-TTS-Plus staat op rang 3 met een Elo van 1.259 over 1.447 samples en 15 arenastemmen, uitgebracht in september 2026 en aangeboden voor $27,60 per miljoen tekens. Gemini 3.8 Flash TTS staat op rang 2 met 1.260 over 1.999 samples en 8 arenastemmen, uitgebracht op 23 september 2026 en aangeboden voor $33,00 per miljoen tekens. Statistisch niet van elkaar te onderscheiden, twintig procent prijsverschil, en gebouwd op tegengestelde theorieën over wat synthetische spraak goed maakt.
Het antwoord van Qwen is inline-besturing: 86 voordrachttags die je door de tekst strooit, zodat het model weet waar het moet ademen, waar de klemtoon moet liggen en waar het van register moet wisselen. Het antwoord van Google is een regielaag: regel-voor-regelinstructies, enscenering met twee sprekers, en een kleine set non-verbale signalen. Als je al een pipeline hebt gebouwd die SSML-achtige annotaties uitstuurt, zal een van deze passen en de andere niet, en die compatibiliteit is belangrijker dan een enkel Elo-punt.
Waar de twee daadwerkelijk op het bord staan
Het eerlijk lezen van de Provider Voice Arena vereist dat je naar de intervallen kijkt, niet naar de rangen.
• Qwen-Audio-3.0-TTS-Plus — rang 3, Elo 1.259, 1.447 samples, 15 arenastemmen, september 2026, $27,6 per 1 miljoen tekens.
• Gemini 3.8 Flash TTS — rang 2, Elo 1.260, 1.999 samples, 8 arena-stemmen, september 2026, $33,0 per 1 miljoen tekens.
• Cartesia Sonic 3.6 — rang 1, Elo 1.273, 1.757 samples, 8 arenastemmen, augustus 2026, $49,0 per 1 miljoen tekens.
De top drie vormen één cluster. De gepubliceerde intervallen voor de twee bovenste lopen zeventien punten naar beide zijden, wat breder is dan de volledige spreiding tussen de eerste en de derde plaats, dus de onderlinge rangorde vormt geen stabiel bewijs. Wat de ranglijst wel vaststelt, is dat alle drie in de kopgroep zitten en dat niets onder hen in de buurt komt — rang 10, Gemini 3.1 Flash TTS, staat op 1.199.
De enige asymmetrie die het vermelden waard is, is het aantal stemmen in de arena. Qwen levert 15 stemmen tegenover Gemini's 8, dus de Qwen-score is een gemiddelde over een bredere steekproef van het eigen product van de leverancier. Dat snijdt aan twee kanten: het is een eerlijkere schatting van hoe de catalogus van Qwen in het algemeen klinkt, en het geeft Qwen meer kansen om een zwakke stem te leveren die het gemiddelde naar beneden haalt. Geen van beide interpretaties verandert de conclusie dat de twee gelijk staan.

86 levering-tags tegen een richtingslaag
Dit is het inhoudelijke verschil en het bepaalt de meeste integraties.
Qwen-Audio-3.0-TTS wordt geleverd met 86 inline delivery-tags — annotaties die in de tekst zijn ingebed en bepalen hoe een tekstdeel wordt uitgesproken. Het is een markup-benadering: je script draagt de voordracht. Dat is herkenbaar voor iedereen die met SSML heeft gewerkt, en het laat zich goed combineren met tooling die tekst programmatisch genereert, omdat het controleoppervlak een stringtransformatie is in plaats van een API-aanroep.
Gemini 3.8 Flash TTS neemt de andere route. Je regisseert een zin zoals je een acteur zou regisseren — tempo, nadruk, emotioneel register — als een aparte instructie in plaats van als inline-opmaak. Scènes met twee sprekers kunnen in één enkele aanroep worden opgevoerd. En een kleine reeks non-verbale signalen staat in het script geschreven: <laughs>, <sigh>, <gasp> als inline-signalen, plus |mhm| en |yeah| voor backchannel-geluiden.
Dus beide modellen accepteren annotatie in de tekst; het verschil is de omvang van het vocabulaire en waar de rest van de aansturing zit. Qwen is breder en platter — 86 tags, allemaal in de tekst. Google is nauwer in de tekst en breder erbuiten, met voordrachtsregie en sprekersopstelling als parameters op callniveau. Als je een systeem port dat al rijke inline-opmaak uitstuurt, is Qwen de kortere port. Als je de regielogica toch in applicatiecode bouwt, is de splitsing van Google schoner.

Taaldekking versus dialectdekking
De dekkingscijfers zijn niet vergelijkbaar, en ze naïef vergelijken is een fout.
Gemini 3.8 Flash TTS ondersteunt 130 talen, automatisch gedetecteerd op basis van de tekst; Flash-Lite TTS ondersteunt er 101. Dat is breedte over taalfamilies, precies wat je wilt voor een lokalisatieronde die een lange staart aan markten moet bereiken.
Qwen-Audio-3.0-TTS dekt 16 talen plus 20 Chinese dialectregio's. Dat is diepgang binnen één taalfamilie. Twintig dialectregio's is niet een kleiner aantal dan 130 talen op de manier waarop het lijkt — het is een ander soort claim, en voor een product dat Chineessprekende gebruikers in de regio's op het vasteland bedient, is het de nuttigere. Een model met 130 talen en één Mandarijn-stem bedient een gebruiker in Sichuan niet zoals een model met 20 dialectregio's dat doet.
Wat ertoe doet, hangt volledig af van je publiek. Als je eis is: 'op zijn minst acceptabel in twintig markten', dan Gemini. Als die is: 'echt correct in de Chinese markt', dan Qwen.
Prijs, en wat het cijfer per teken verbergt
• Qwen-Audio-3.0-TTS-Plus — $27,60 per 1 miljoen tekens op de genormaliseerde basis van het leaderboard; de Flash-variant kost ongeveer $15 per 1 miljoen tekens, met een opgegeven latentie van het eerste pakket van ongeveer 300 ms.
• Gemini 3.8 Flash TTS — $33,00 per 1 mln genormaliseerde tekens; door Google gefactureerd tegen $0,50 per miljoen teksttokens in en $9,00 per miljoen audiotokens uit tot en met 31 december 2026, daarna $1,00 en $18,00.
• Gemini 3.8 Flash-Lite TTS — $ 22,10 per 1 miljoen genormaliseerde tekens op rang 6 met een Elo van 1.235; tot en met 31 december 2026 gefactureerd tegen $ 6,00 per miljoen audiotokens.
Beide prijzen per teken zijn normalisaties van Artificial Analysis, geen officiële lijstprijzen van de leveranciers — Qwen factureert via Alibaba Cloud Model Studio en Google factureert in tokens, en geen van beide publiceert een tarief per teken voor deze modellen. Gebruik ze voor de verhouding, die ongeveer 1,2x in het voordeel van Qwen uitvalt, en niet als offertes.
De tiers verschillen in vorm. Qwen splitst in Plus en Flash, waarbij de Flash-tier kwaliteit inruilt voor een claim van ~300 ms op het eerste pakket. Google splitst in Flash en Flash-Lite, en vervolgens verder in Standard, Batch en Flex, en Priority — $4,50, $9,00 en $16,20 per miljoen audiotokens op Flash TTS. Het model van Google beloont het classificeren van je workload; dat van Qwen beloont het vooraf kiezen van een kwaliteitstier.
Beschikbaarheid is het andere echte verschil. Gemini 3.8 Flash TTS is algemeen beschikbaar op de Gemini Developer API. Qwen-Audio-3.0-TTS is gesloten en alleen gehost, aangeboden via Alibaba Cloud Model Studio zonder open gewichten. Als je het model zelf wilt draaien, is geen van beide iets voor jou — maar als je infrastructuur al op Alibaba Cloud draait, is het Qwen-model degene waarbij je geen egress-verhaal hoeft uit te werken.
Claims van leveranciers aan beide zijden
Geen van beide modellen heeft een onafhankelijke benchmark buiten de arena, en beide leveranciers hebben claims gepubliceerd die als zodanig gelabeld zouden moeten worden.
Van Google, voor Gemini 3.8 Flash TTS: eerste op de Hume AI Voice Design Benchmark met 71,4, eerste op accentmodellering met 60,8, eerste en tweede op de Hume Overall Quality Index voor Flash en Flash-Lite, en volgens eigen zeggen topposities in blinde voorkeur voor het Japans, Braziliaans Portugees, Vietnamees, Modern Standaardarabisch, Mexicaans Spaans en Hindi. De runs zijn niet openbaar.
Alibaba's, voor Qwen-Audio-3.0-TTS: het voordrachtsysteem met 86 tags, de 20 dialectregio's, en de ~300 ms waarde voor het eerste pakket op de Flash-variant. Ook niet gereproduceerd.
De arena Elo is het enige onafhankelijk verzamelde kwaliteitsgetal in dit artikel, en het geeft aan dat de twee bovenaan het klassement staan.

Wat Gemini toevoegt en Qwen niet
Stemcreatie is de duidelijkste leemte. Gemini 3.8 Flash TTS ondersteunt stemontwerp op basis van een beschrijving in natuurlijke taal en stemreplicatie op basis van een voorbeeld van 30 seconden, met verificatie van toestemming en een SynthID-watermerk plus C2PA-credentials op de uitvoer. Aangepaste stemmen zijn er in twee vormen: 200 stateful stemmen per project met een levensduur van één jaar, of stateless stemmen die worden aangesproken via een voicekey_...-handle die na zeven dagen verlopen. Stemremixing staat vermeld als binnenkort beschikbaar.
De controle over het uitvoerformaat is de tweede. WAV 24 kHz mono 16-bits signed PCM op het unary-endpoint, headerless PCM (audio/l16) op het streaming-endpoint, plus audio/mulaw en audio/alaw en een configureerbare samplefrequentie. Voor werk dat aan telefonie grenst, verwijdert ondersteuning voor mulaw een transcoderingsstap.
Wie te bellen
Kies Qwen-Audio-3.0-TTS als je gebruikers Chineestalig zijn en dialectdekking de vereiste is, als je een rijke vocabulaire voor inline-opmaak wilt die je generator rechtstreeks kan uitsturen, of als je al op Alibaba Cloud zit en de kortste weg naar een werkend endpoint wilt. Het is ook de goedkoopste van de twee op genormaliseerde basis, en de Flash-variant is nog goedkoper als ~300 ms voor het eerste pakket acceptabel is.
Kies Gemini 3.8 Flash TTS als je breedte over veel talen nodig hebt in plaats van diepgang in één taal, als je een specifieke stem moet maken of repliceren, als je mulaw- of alaw-uitvoer nodig hebt, of als "algemeen beschikbaar in plaats van alleen gehost" een inkoopvereiste is.
Geen van beide is een slechte keuze en geen van beide is duidelijk beter — dat is nu juist het punt van een verschil van één Elo-punt. De beslissing gaat over compatibiliteit, niet over kwaliteit.
Dat is ook het argument om je nog niet hard aan een van beide te binden. OrcaRouter geeft je meer dan 200 modellen achter één sleutel tegen de listprijs van de provider, zonder markup, zodat een tariefwijziging van een van beide labs dezelfde dag nog op je factuur terechtkomt in plaats van bij de verlenging, en automatische failover betekent dat een synthese-endpoint dat onder belasting hapert doorschakelt naar een ander in plaats van het verzoek te laten vallen. Wij hosten Qwen-Audio-3.0-TTS niet — dat wordt geleverd via Alibaba Cloud Model Studio — en we hosten de Gemini 3.8 TTS-endpoints niet, die van Google's API komen. Wat wij bieden is de tekstlaag en de routing daarboven, en dat is wat je in staat stelt om beide een maand lang op echt verkeer te draaien voordat je kiest.
Het getal om in de gaten te houden is de volgende arena-revisie. Met 1.447 samples voor Qwen en 1.999 voor Gemini zijn beide intervallen nog steeds breed genoeg dat één maand aan stemmen hen zou kunnen scheiden — of bevestigen dat de gelijke stand het antwoord is.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
