Hero-titelkaart voor 'GPT-Live-1 vs Qwen-Audio-3.0-TTS', met als ondertitel 'De ene voert een gesprek, de andere leest een script voor', met een badge met de tekst 'Geen vervangers - verschillende taken, verschillende rekeningen' en drie kaarten: 'Qwen-Audio-3.0-TTS Plus — Elo 1.232, vierde op de AA Provider Voice Arena, $27,6 per 1 mln. tekens', 'GPT-Live-1 — $0,05 per spraakminuut, volledige duplex, $3,00 per uur open lijn' en 'Het addertje — ongeveer 16 tekens per seconde aan de vertellerskant, tekst in en audio uit', boven een onderbalk met de tekst 'Qwen-cijfers volgens Artificial Analysis; GPT-Live-1-cijfers door Ope​nAI gerapporteerd.' Het OrcaRouter-logo is rechtsonder in het beeld samengevoegd.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: Een gesprek en een verteller zijn niet hetzelfde regelitem

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Zet GPT-Live-1 en Qwen-Audio-3.0-TTS naast elkaar op prijs per uur audio, en het verschil lijkt beslissend: Aliba​ba's Qwen-Audio-3.0-TTS-Plus zet spraak om tegen $27,6 per miljoen tekens, ongeveer $1,66 aan audio per uur, terwijl Ope​nAI's GPT-Live-1 $3,00 rekent voor een uur continue open lijn. De verteller is goedkoper, dus de verteller wint — behalve dat dit de verkeerde vergelijking is, en de reden dat die verkeerd is, is het nuttigste dat iemand uit deze confrontatie kan halen. Qwen-Audio-3.0-TTS is een tekst-naar-spraakmodel. GPT-Live-1 is een full-duplex gespreksmodel. Een van de twee leest voor wat je hebt geschreven. De andere moet meerdere keren per seconde beslissen of je uitgepraat bent.

De ene rendert, de andere converseert

Tekst-naar-spraak neemt tekst en levert audio op. Er is geen invoeraudio, geen beurt om te nemen, geen idee van onderbroken worden en geen transcript om terug te geven, want het model heeft nooit iets gehoord. Het kostenmodel is een drukpers: pagina's erin, audio eruit, kwaliteit en doorvoer zijn de enige twee getallen die ertoe doen, en je kunt beide meten voordat je uitbrengt.

Een full-duplex gespreksmodel verwerkt inkomende audio terwijl het uitgaande audio produceert. Zijn taak omvat de delen van een gesprek die niets met woorden te maken hebben — pauzeren wanneer de gebruiker pauzeert, doorgaan tijdens een backchannel zoals "ja" in plaats van die als een onderbreking te behandelen, midden in een zin de beurt overdragen, en een toolaanroep doen zonder de draad te verliezen. GPT-Live-1 doet dat allemaal en levert naast de sessie ook transcripties van spraakherkenning, wat het alleen kan omdat het de hele tijd meeluisterde.

Als je product artikelen hardop voorleest, documentatie naar audio converteert of een video inspreekt, is GPT-Live-1 het verkeerde hulpmiddel tegen vier keer de prijs per uur. Als je product een telefoongesprek aanneemt, is Qwen-Audio-3.0-TTS een derde van een pijplijn die nog steeds een ASR-model en een taalmodel nodig heeft om een gesprek te worden.

Waar Qwen-Audio-3.0-TTS echt het beste antwoord is

Het pleidooi voor Alibaba's model is geen marketing. Uitgebracht op 20 juli 2026 door Alibaba's Tongyi Lab en beschikbaar gesteld als een gehoste, gesloten API via Alibaba Cloud Model Studio, veroverde de Plus-tier de eerste plaats in Artificial Analysis' text-to-speech-arena toen hij verscheen. Een ranglijst is echter een bewegend doelwit, en deze is opgeschoven: sinds september 2026 staat Qwen-Audio-3.0-TTS-Plus vierde op de Provider Voice Arena met een Elo van 1.232 op basis van 2.306 samples, achter Cartesia Sonic 3.6 met 1.275, Inworld Realtime TTS-2 met 1.244 en Speechify's Simba 3.2 met 1.233 — drie modellen uit augustus en juli die later zijn uitgekomen. Vierde van ruim twintig, met de koppositie verdwenen en het prijsvoordeel intact, is nog steeds een sterke positie. Het is alleen niet de positie die de berichtgeving over de lancering beschreef.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

Het loopt voorop in 10 van de 16 talen die het ondersteunt, voegt 20 Chinese dialectgebieden toe, ondersteunt het klonen van stemmen op basis van korte samples, waaronder cross-linguaal klonen, en bevat 86 inline-tags voor emotie en voordracht.

De kanttekeningen zijn specifiek genoeg om de planning op af te stemmen.

• Doorvoer — Plus genereert ongeveer 16 tekens per seconde, tegenover 30,2 voor Simba 3.2, 27 voor Gemini 3.1 Flash TTS en ongeveer 120 voor Sonic 3.5. Voor batch-rendering is dit onzichtbaar; voor een liveproduct is het het getal dat je buffer bepaalt.

• Prijsdocumentatie — de veel geciteerde $27,6 per miljoen tekens komt niet in elke momentopname overeen met Aliba​ba's eigen prijspagina, die op bepaalde momenten lagere cijfers voor beide tariefniveaus heeft vermeld. Controleer het huidige getal op accountniveau voordat je een prognose maakt, niet dat van de ranglijst.

• Stemmenbibliotheek — ondanks 16 ondersteunde talen zijn de openbare vooraf ingestelde stemmen vrijwel uitsluitend Chinees en Engels. De andere veertien talen bestaan via de kloonworkflow in plaats van kant-en-klaar.

• Feature-gating — de 86 inline-emotietags werken alleen in de unidirectionele streamingmodus, waardoor de expressieve controle niet in elk integratiepad behouden blijft.

• Niveaus — Flash mikt op ongeveer 300 ms first-packetlatentie voor realtimegebruik; Plus is het kwaliteitsniveau. Het zijn verschillende producten met dezelfde naam, en het verkeerde kiezen is een veelgemaakte eerste fout.

De eerlijke versie van de cascaderekening

Dit is wat de vergelijking per uur weglaat. Een conversationeel product dat op een TTS-model is gebouwd, is een cascade: een ASR-model zet de spraak van de beller om in tekst, een taalmodel bepaalt wat er gezegd moet worden, en het TTS-model spreekt het uit. Drie leveranciers, drie rekeningen, drie latencybudgetten die bij elkaar opgeteld worden, en bij elke grens een overdracht waar prosodie sterft. Het TTS-deel kan $1,66 per uur audio kosten. De andere twee delen zijn waar het geld en de fouten werkelijk zitten — en het cascademodel kan geen pauze horen midden in een zin die het al aan het uitspreken is.

GPT-Live-1 voegt de drie onderdelen samen tot één sessie en één meter, tegen $0,05 per minuut spraak, waarbij de redeneerbackend apart wordt gefactureerd. Twee details houden die factuur eerlijk. Sessie-initialisatie factureert vooraf 15 seconden spraak, die met de latere duur worden verrekend in plaats van eraan toegevoegd. En de backend is een tweede meter: elke gedelegeerde redeneeraanroep, toolaanroep en webzoekopdracht wordt gefactureerd tegen de normale tarieven van dat model, dus als je delegatie richt op een frontier-redeneermodel dat bij elke beurt zoekt, levert dat een dure aanroep op achter een goedkope spraaklaag.

Wat de onafhankelijke benchmarks over de twee zeggen, is leerzaam juist omdat ze verschillende dingen meten en geen van beide het onderwerp mooier voorstelt dan het is. Qwen-Audio-3.0-TTS-Plus staat vierde op kwaliteit en bijna onderaan op doorvoer. GPT-Live-1 staat zevende van de elf in de Speech to Speech Index van Artificial Analysis op 69,8% — achter de GPT-Realtime-2.1 die het vervangt, op 73,9% — terwijl het aan de onderkant van de bandbreedte voor kosten per uur inputaudio van de index wordt geprijsd, $4,42 tegenover $10,75 voor GPT-Realtime-2.1. Geen van beide modellen wint de eerste plaats in zijn eigen categorie. Beide zijn goedkoper dan het model dat ze moesten verslaan.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Die tweede meter is waar een routeringslaag een ontwerpbeslissing wordt in plaats van een optimalisatie. OrcaRouter bevat noch GPT-Live-1 noch Qwen-Audio-3.0-TTS — de spraaklaag ligt in beide gevallen buiten ons bereik, en daarvan routeren we niets. De redeneerpoot is dat niet. Ongeveer 190 modellen van elf upstreamproviders zitten achter één sleutel tegen de lijstprijs van de provider zonder markup, en een prijsverlaging van een provider gaat dezelfde dag in in plaats van bij de volgende contractvernieuwing. Voor een cascade dekt dat de middelste poot volledig: houd twee ASR-opties en drie reasoners achter één endpoint, A/B-test ze tegen elkaar op echt verkeer, en laat automatische failover een slechte middag bij een upstream opvangen zonder een gesprek te laten vallen.

Stemklonen is de commercieel meest nuttige mogelijkheid van Qwen-Audio-3.0-TTS en het grootste compliance-oppervlak. Tien seconden referentie-audio is genoeg om een spreker na te bootsen, taaloverstijgend, wat transformatief is voor lokalisatie en een risico vormt overal waar identiteit ertoe doet. OpenAI bracht GPT-Live-1 uit zonder klonen en zonder aangepaste stemmen — 12 API-stemmen om uit te kiezen, en dat is de lijst.

Die asymmetrie is makkelijk over het hoofd te zien in een functievergelijking en moeilijk over het hoofd te zien in een risicobeoordeling. Een product dat altijd maar in één van twaalf leveranciersstemmen spreekt, heeft een veel korter antwoord op de vraag "wiens stem is dat, en wie heeft daarmee ingestemd" dan een product dat elke stem op basis van een sample kan reproduceren. Als je cloning nodig hebt, is de beslissing over de pijplijn al voor je genomen, en wordt de vraag wat daar de regels voor bepaalt. Als je dat niet nodig hebt, is de beperking van GPT-Live-1 het lezen waard als een beheersmaatregel die je niet zelf hoefde te bouwen.

Welke moet ik kopen

Koop Qwen-Audio-3.0-TTS als de output content is: voice-over, lokalisatie, toegankelijkheidsaudio, nasynchronisatie, of elke workflow waarin de tekst bestaat voordat de audio er is en kwaliteit per gerenderd uur de maatstaf is. Begin met Flash als je realtime weergave nodig hebt, stap over naar Plus wanneer de stem zelf het eindproduct is, en prijs de cloning-workflow apart van de presetstemmen.

Koop GPT-Live-1 als de input een persoon is. Supportlijnen, boekingsflows, intakegesprekken, alles waarbij de eerste lettergreep van de gebruiker binnenkomt terwijl het model midden in een zin zit en het systeem zich als een luisteraar moet gedragen in plaats van als een spreker. Het kost meer per uur audio, en het is de enige van de twee die onderbroken kan worden.

De twee vullen elkaar veel vaker aan dan dat ze rivalen zijn: tal van producten willen dat Qwen-Audio-3.0-TTS een document voorleest en een duplexmodel de daaropvolgende oproep afhandelt. Wat ze niet zouden moeten delen, is een kostenmodel. Per uur audio is de juiste maatstaf voor precies één ervan.