Een gegenereerde hero-kaart voor 'Gemini 3.8 Live vs Qwen-Audio-3.1-TTS' op een witte achtergrond met zachte blauw- en cyaangradiëntaccenten. Onder een kop met de tekst 'Twee helften, acht dagen na elkaar vernieuwd' staan twee panelen. Het linkerpaneel behandelt '15 sep 2026 — Gemini 3.8 Live en Extended Thinking op de Live'. Het rechterpaneel behandelt '20 sep 2026 — Qwen-Audio-3.1-TTS bij Apsara, synthese ~70% ingekort'. Een voetregel luidt: 'Ze ontmoeten elkaar in het midden van een, niet bij dezelfde klus.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: Twee helften van een spraakstack, acht dagen na elkaar opnieuw geprijsd

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Gemini 3.8 Live is Google's spraak-naar-spraakmodel, uitgebracht op 15 september 2026 als gemini-3.8-live en gemini-3.8-live-extended-thinking op de Live API. Qwen-Audio-3.1-TTS is Alibaba's tekst-naar-spraakmodel, aangekondigd op de Apsara-conferentie in Hangzhou op 23 september 2026, acht dagen later, met daaraan gekoppeld een prijsverlaging van ongeveer 70% op spraaksynthese. Dat gat van acht dagen is de reden dat deze vergelijking nu de moeite waard is om te lezen in plaats van in juli. Niets aan de rollen van de twee producten is veranderd — de een luistert en praat, de ander leest tekst hardop voor — maar beide helften van een productie-spraakpijplijn werden binnen één enkele periode van twee weken herbouwd of opnieuw geprijsd, en de rekensom die dit duel vroeger beslechtte, is stilletjes verschoven.

Twee helften, acht dagen na elkaar vernieuwd

Begin met wat deze combinatie ongebruikelijk maakt: de twee modellen concurreren niet met elkaar. Een spraakproduct heeft een mond en een oor, en deze twee zijn elk één van beide. Gemini 3.8 Live sluit de lus — audio en video erin, audio eruit, onderbrekingen worden afgehandeld, tool-aanroepen draaien onder het gesprek door. Qwen-Audio-3.1-TTS neemt een string en een referentiestem en levert een performance. Het is beter als mond dan als wat dan ook, en het probeert geen oor te zijn.

Wat de timing in september interessant maakt, is dat de twee aankondigingen op tegenovergestelde uiteinden van dezelfde budgetlijn zijn gericht. De lancering van Google op 15 september was een capaciteitenverhaal zonder enige prijsbeweging; de aankondiging van Alibaba op 23 september was vooral een margeverhaal, met nieuwe capaciteiten die meeliftten. Een team dat in augustus een hybride pijplijn had gebouwd, heeft binnen een tijdsbestek van acht dagen een reden gekregen om beide benen opnieuw tegen het licht te houden — en slechts één van die benen werd goedkoper.

Wat de 3.1-release daadwerkelijk heeft veranderd aan de Qwen-kant

Alibaba bracht op 23 september niet slechts één model uit. De 3.1-generatie omvat vijf endpoints — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next en Qwen-Audio-3.1-Realtime — en slechts één daarvan, de gewone TTS-variant, is een drop-in voor iedereen die al het 3.0-TTS-model aanroept.

Op dat niveau zijn drie dingen veranderd, en één daarvan is een echte migratiekostenpost. De regie over de voordracht is verschoven van een vaste woordenschat van 86 inline-tags naar instructies in natuurlijke taal: je beschrijft de emotie, het tempo en de stijl die je wilt, in plaats van het juiste haakje op de juiste plek in te voegen. Cross-linguale timbre-overdracht is gearriveerd, waardoor één referentiestem zijn identiteit kan behouden in Mandarijn, Kantonees, Engels en Japans. En het model verdraagt nu direct ruisige of galmende referentie-audio, zonder een aparte denoise-stap. De taaldekking is ongewijzigd op een door de leverancier gerapporteerde 16 talen plus 20 Chinese dialectregio's, en — dit is het vermelden waard, want het wordt elders weggepoetst — Alibaba's eigen materiaal zegt dat het 3.1-niveau zeven talen toevoegt, wat niet te rijmen valt met de 16 die de gepubliceerde dekking van de juli-generatie vermeldde. Behandel beide aantallen als door de leverancier gerapporteerd totdat je de specifieke talen die je nodig hebt controleert aan de hand van Model Studio.

Het echt nieuwe product in deze release is Qwen-Audio-3.1-TTS-Next, dat Alibaba een "Audiogen"-model noemt: één doorgang die stem, geluidseffecten en achtergrondambiance tegelijk produceert, voor dialogen met meerdere sprekers, het samenstellen van podcasts en scenewerk. Het kost $0,848 per miljoen inputtokens en $1,696 per miljoen outputtokens op de Beijing-node, met een maximum van 3.000 tekens input, 240 seconden gegenereerde audio voor podcasts en 120 seconden in andere gevallen, drie verzoeken per seconde, en accepteert maximaal drie referentieclips van elk 30 seconden. Het ondersteunt alleen Chinees en Engels. Als je pijplijn één verteller is die een script voorleest, is dat product niet relevant voor je; als het twee presentatoren en een muziekbed is, is het juist de reden om deze release überhaupt te bekijken.

De naad is het ding dat je eigenlijk kiest

Omdat de twee modellen niet hetzelfde werk doen, is de beslissing geen bake-off. Het is een kwestie van waar je de overdracht plaatst, en hoeveel je bereid bent te betalen om de naad onzichtbaar te maken.

Er zijn twee eerlijke architecturen. De eerste is één netwerk: Gemini 3.8 Live verwerkt de hele beurt, hoort de beller, beslist wat er gezegd moet worden en zegt het, en u accepteert de stem die het u geeft — die u niet kunt klonen en niet van een eigen merk kunt voorzien. De tweede is een cascade: herkenning, dan redenering, dan Qwen-Audio-3.1-TTS als de mond, waardoor u over duizend stemmen beschikt, waaronder een die is ingesproken door uw eigen stemtalent, ten koste van latentie over twee of drie leveranciersgrenzen heen en de prosodie die verloren gaat wanneer een zin over een API-aanroep wordt opgesplitst.

De meeste teams komen uiteindelijk op beide uit, en dat is geen gebrek aan lef. Gebruik het realtime-model waar latentie voelbaar is — onderbreking, bevestiging, de "mm-hm" die een beller duidelijk maakt dat je er nog bent — en het synthesemodel waar kwaliteit hoorbaar is: het langdurige teruglezen van een beleid, het bevestigingsnummer dat in een bedachtzaam tempo wordt voorgelezen, de merkstem die bij elk afzonderlijk gesprek identiek moet zijn. De hybride is het juiste antwoord voor een grote klasse van producten. Het is ook waar het kostenmodel lastig wordt, want je meet nu twee verschillende eenheden.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Geprijsd per audio-uur, de enige eenheid waarin beide passen

Google factureert de Live API per minuut; Alibaba factureert de Qwen TTS-tiers per teken en per token. Om ze te vergelijken moet je een normalisator kiezen, en de enige verdedigbare maatstaf voor spraak is het uur afgewerkte audio.

• Inkomend gefactureerd — Gemini 3.8 Live per minuut audio, $ 0,005 in en $ 0,018 uit versus Qwen-Audio-3.1-TTS per miljoen tekens, waarbij de 3.0 Plus-tier rond $ 27,60 en de Flash-tier rond $ 15 liggen vóór de verlaging, en de TTS Flash-tier na de verlaging wordt vermeld tegen 1,5 yuan per miljoen invoertokens en 12 yuan per miljoen uitvoertokens.
• Uitgaand gefactureerd — een tweerichtingsgesprek met Gemini 3.8 Live kost ongeveer $ 1,38 voor een uur kloktijd aan gesprek tegen lijstprijs, vóór eventuele caching, versus Qwen-Audio-3.1-TTS, een eenrichtingsstream, waarbij de 3.1-Next-tier op de Beijing-node $ 0,848 per miljoen invoertokens en $ 1,696 per miljoen uitvoertokens kost.
• Hoort de beller — Gemini 3.8 Live ja, native audio- en video-invoer versus Qwen-Audio-3.1-TTS nee, tekst in en audio uit
• Stemmen — Gemini 3.8 Live één stem, niet kloonbaar, niet voor branding geschikt versus Qwen-Audio-3.1-TTS meer dan duizend, met zero-shot-cloning op basis van ruisrijke referentieaudio
• Talen — Gemini 3.8 Live volgens de leverancier 97, midden in het gesprek gewisseld versus Qwen-Audio-3.1-TTS volgens de leverancier 16 plus 20 Chinese dialectregio's, met timbre-overdracht voor Mandarijn, Kantonees, Engels en Japans
• Voordrachtscontrole — Gemini 3.8 Live prompt- en gesprekscontext versus Qwen-Audio-3.1-TTS instructie in natuurlijke taal, die de 86 inline-tags van de 3.0-generatie vervangt
• Onafhankelijke score — Gemini 3.8 Live 82,6 op de Artificial Analysis Speech to Speech Index voor de Extended Thinking-variant en 76,0 voor de standaardvariant versus Qwen-Audio-3.1-TTS geen; het dichtstbijzijnde Qwen-cijfer is 1.259 Elo voor de 3.0 Plus-tier van de vorige generatie in de Provider Voice Arena, wat een score van de voorganger is en niet van dit model

De procentuele korting wordt afgezet tegen tarieven die per regio en tier verschillen, dus het kopcijfer van 70% is geen belofte over je verkeer, en Alibaba Cloud is op het knooppunt in Singapore voor realtime-transcriptie ook overgestapt van meting op basis van duur naar meting op basis van tokens — wat een minder voorspelbare basis is, aangezien zowel stilte als multi-turncontext het tokenverbruik opblazen. Leg de nieuwe tariefkaart naast je eigen audio.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Wat de 3.1-upgrade niet oplost

Dit is het onderdeel dat in beide richtingen gemakkelijk fout gaat. De verbeteringen in 3.1 maken Qwen-Audio-3.1-TTS niet tot een kandidaat voor de taak die Gemini 3.8 Live uitvoert — instructiegestuurde controle, timbreoverdracht en tolerantie voor ruisige invoer maken het allemaal een betere mond, en geen ervan geeft het een oor. Evenmin zegt de benchmarkpositie van Gemini 3.8 Live je iets over de vraag of je merkstem een zin in het Kantonees overleeft.

Er is ook een gat in het bewijs dat een prijsverlaging verleidelijker maakt om te negeren. Qwen-Audio-3.1-TTS heeft geen onafhankelijke score. De 1.259 Elo die naast de naam op de Provider Arena staat, is van Qwen-Audio-3.1-TTS-Plus, het model dat wordt vervangen, gemeten op 1.447 samples. De eigen Arena-rij van de opvolger bestaat nog niet. Als je goedkeuringsproces een cijfer van een derde partij vereist — en voor een merkstem zou dat waarschijnlijk moeten — dan is het nieuwere model het model zonder dat cijfer, en de goedkopere tier is degene die je nog niet kunt verdedigen. De enige gebeurtenis die dit zou beslechten, is Qwen-Audio-3.1-TTS op een blindeluisterpanel.

Waar één sleutel wel en niet helpt

Eén gevolg van de 3.1-release is gemakkelijk te missen, omdat het lijkt op een prompt-engineeringdetail in plaats van een infrastructuurdetail. Het vervangen van 86 hardgecodeerde tags door instructies in vrije vorm verandert je leveringsaanwijzingen in tekstartefacten. Je genereert ze nu, versioneert ze en valideert ze allemaal opnieuw tegen de interpretatie van het nieuwe model — en de faalmodus is drift, geen fout, omdat twee formuleringen van "warm maar niet sentimenteel" niet identiek zullen landen.

Dat is een tekstinferentieprobleem dat om een spraakpijplijn heen zit, en dat is waar wij nuttig zijn. OrcaRouter routeert Qwen-Audio-3.1-TTS noch enig Qwen-Audio-model, en we routeren de Gemini 3.8 Live-endpoints evenmin — geen van beide helften van deze stack is via ons aanroepbaar, en niets hier mag worden gelezen als een bewering dat dit wel zo is. Wat we wél leveren, is de laag die de regietekst schrijft en controleert: qwen/qwen3.8-flash en google/gemini-3.8-flashnaast meer dan 200 modellen van een enkele sleutel tegen de lijstprijs van de provider zonder markup, met een routing-DSL die meerdere modellen in één aanroep samenbrengt en automatische failover wanneer een upstream verslechtert. Wanneer je op het punt staat tienduizend regieprompts opnieuw te valideren tegen een model dat net heeft veranderd hoe het ze leest, is het genereren van de varianten en het scoren ervan op consistentie het onderdeel dat één contract zou moeten zijn, niet vier.

Wat u moet meten voordat u kiest

Drie experimenten zeggen meer dan welke directie dan ook. Haal één referentiestem en één alinea van je eigen script door Qwen-Audio-3.1-TTS en luister of de op instructies gebaseerde aansturing je twee keer dezelfde voordracht oplevert — dat is het migratierisico, en het is goedkoper om te meten dan om eromheen te plannen. Haal een echte gespreksopname met je eigen achtergrondgeluid door Gemini 3.8 Live en controleer of de beurtwisseling overeind blijft wanneer de beller midden in een woord onderbreekt — dat is wat de spraak-naar-spraak-index probeert te kwantificeren, en die doorstaat het contact met een echte telefoonlijn niet betrouwbaar genoeg om op goed vertrouwen te worden aangenomen. En maak de berekening voor je eigen volume in audio-uren in plaats van in de eenheden waarin de twee leveranciers factureren, want bij deze specifieke combinatie was het verwachte prijsverschil tussen "goedkope Chinese TTS" en "Google flagship" nooit zo groot als het lijkt, en na 23 september is het nog kleiner.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt