
Realtime-Venus vs Qwen-Audio-3.0-TTS: de een leest je script voor, de ander moet naar je luisteren
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
De verleidelijke vergelijking tussen Realtime-Venus en Qwen-Audio-3.0-TTS is de prijs per uur audio, en die levert een helder antwoord op dat volledig onjuist is. Qwen-Audio-3.0-TTS-Plus genereert spraak voor ongeveer $27,6 per miljoen tekens, wat neerkomt op bijna $1,66 voor een uur voltooide audio. Realtime-Venus, het 9B full-duplexsysteem dat het Venus Team van Ant Group samen met Tsinghua University heeft gebouwd, heeft helemaal geen prijs omdat er geen gehoste dienst is — maar zelf gehost zou het je een continu draaiende GPU-node kosten, wat per uur minstens een orde van grootte meer is. De renderer wint op de rekensom. De rekensom meet twee verschillende producten: Qwen-Audio-3.0-TTS neemt tekst en retourneert audio, en Realtime-Venus neemt audio en video en retourneert een gesprek. De vraag die hen werkelijk onderscheidt, is niet wat ze uitvoeren. Het is of er iets moet terugpraten.
De input is het hele verschil
Qwen-Audio-3.0-TTS, op 20 juli 2026 uitgebracht door Alibaba Clouds Tongyi Lab, is een tekst-naar-spraakmodel dat als een gehoste API wordt aangeboden, zonder open gewichten. Tekst gaat erin via een HTTP-endpoint en audio komt eruit. Er is geen audiotoevoerpad, geen beurt om te nemen, geen transcript om terug te geven, en geen concept van onderbroken worden — het model heeft nog nooit iets gehoord. Het hele kostenmodel is een drukpers: tekens erin, audio eruit.
Realtime-Venus daarentegen staat permanent te luisteren. De audiovisuele checkpoint bevat een SigLIP2-visuele encoder voor het streamen van frames en een Whisper-Medium-audio-encoder die een Qwen3-8B-backbone voedt, en beide checkpoints draaien een interactielus van één seconde die voortdurend de conversatiestatus bijwerkt en bepaalt of er gesproken moet worden of dat het stil moet blijven. Het produceert spraak via discrete S3-tokens en een streaming flow-matching-decoder in plaats van een afzonderlijke synthesestap, en het kan tekst samen met de golfvorm teruggeven.
Dat is geen functieverschil. Het is het verschil tussen een component en een systeem. Zet de twee naast elkaar: de ene kan in een pipeline worden gestopt die al een spraakherkenner en een taalmodel voorgeschakeld heeft. De andere vervangt alle drie.
Een uitgewerkte casus maakt het concreet
Neem een supportlijn. Een klant belt, beschrijft een probleem slecht, pauzeert midden in een zin om een accountnummer te vinden, wordt onderbroken door een aankondiging op de achtergrond, en stelt dan een vervolgvraag voordat de medewerker klaar is met antwoorden.
Een systeem dat op Qwen-Audio-3.0-TTS is gebouwd, behandelt dit als drie leveranciers en drie facturen: een herkenner zet de spraak van de beller om in tekst, een taalmodel bepaalt wat er gezegd moet worden, en Qwen-Audio-3.0-TTS spreekt het uit. Elke stap voegt latentie toe, en elke grens is waar prosodie sterft. De kritieke fout is structureel — de TTS-poot kan de pauze midden in een zin die hij al uitspreekt niet horen, dus de barge-in moet door iets ervoor worden afgehandeld.
Realtime-Venus verwerkt hetzelfde gesprek als één model, zonder externe spraakactiviteitsdetector, zonder overdracht. De cijfers van Full-Duplex-Bench v1.5 — 75% respons op onderbrekingen en continueringspercentages van 97% bij backchannels, 88% bij tot anderen gerichte spraak en 86% bij achtergrondspraak — zijn precies de statistieken die dit scenario beschrijven. Ze zijn ook zelfgerapporteerd, uit het eigen technische rapport van het model, zonder externe reproductie. Lees ze als een ontwerpclaim, niet als een meting.
Stemkwaliteit: de een heeft een Elo, de ander heeft niets.
Dit is het meest onevenwichtige deel van de vergelijking, en het bevoordeelt Alibaba met een ruime marge.
• Onafhankelijke score — Qwen-Audio-3.0-TTS-Plus staat tweede op de Provider Voice Arena van Artificial Analysis met een Elo van 1.259 over 1.544 samples per 18 september 2026, achter Cartesia Sonic 3.6 met 1.277 en voor Inworld Realtime TTS-2 met 1.247 en Speechify Simba 3.2 met 1.241.
• Waar het begon — de eigen releasekolom van de arena vermeldt dit model als een notering van september 2026, wat de tier is zoals die momenteel wordt gescoord en niet de lanceringsdatum van 20 juli 2026. Telkens wanneer het verschoof, is het steeds in de top twee blijven staan.
• Realtime-Venus — geen arena-inschrijving, geen stemevaluatie door derden, niets. Het enige stemgerelateerde cijfer is een zelfgerapporteerde VoiceBench AlpacaEval-score van 4,81 waarvan het rapport zegt dat die overeenkomt met het beste vergelijkingscijfer.
• Wat dat betekent — niemand buiten de auteurs heeft beoordeeld of Realtime-Venus goed klinkt. Dat is geen minpunt; het is simpelweg onbekend, en onbekend is iets anders dan slecht. Maar als stemkwaliteit het eindproduct is, is het kopen van een Elo-beoordeeld model beter dan een onbeoordeeld model op goed vertrouwen te nemen.


Taal, stemmen en expressieve controle
Het model van Alibaba is gebouwd voor een breed scala aan voordrachten. Het beschikt over meer dan duizend stemmen, bestrijkt zestien talen, waaronder twintig Chinese dialectregio's, en biedt 86 inline-tags voor emotie en voordracht — een bedieningsoppervlak dat je in de tekst zelf schrijft, plus instructies voor voordracht in natuurlijke taal. De uitvoer gaat tot 48 kHz, tegen 24 kHz in de vorige generatie, en één synthese kan maximaal drie minuten duren. De Flash-tier mikt op ongeveer 300 milliseconden tot het eerste pakket voor realtime weergave; de Plus-tier is het kwaliteitsniveau en genereert met ongeveer zestien tekens per seconde, wat traag genoeg is om van belang te zijn in een liveproduct en onzichtbaar is bij batchrendering.
Realtime-Venus documenteert Engels en Chinees, levert één referentiestem mee met de gewichten, en geeft je een token-naar-waveform-decoder in plaats van een stemmenbibliotheek. Expressiviteit in de zin van Qwen — tags, instructies, duizend presets — heeft hier geen equivalent. Wat het in plaats daarvan heeft, is het vermogen om zijn voordracht te veranderen op basis van wat het hoort, wat een ander soort expressieve controle is en veel moeilijker op een specificatieblad te zetten.
De kosten van elk pad, eerlijk gezegd
Er is een echte kanttekening bij het Alibaba-getal voordat iemand erop begroot. De veel geciteerde $27,6 per miljoen tekens komt niet in elke momentopname overeen met Alibaba's eigen prijspagina, en de niveaus worden afzonderlijk geprijsd. Controleer het cijfer op accountniveau in plaats van een vergelijkingstabel te vertrouwen, inclusief deze.
Realtime-Venus heeft geen lijstprijs, omdat er niets te koop is. De kosten zijn twee 9B-checkpoints in BF16 — ongeveer achttien gigabyte aan gewichten per stuk, nog voordat activeringsgeheugen erbij komt — plus een doorlopende streaming-lus, wat betekent dat een GPU-node per maand factureert, of er nu iemand aanroept of niet. Bij een constant volume is dat per gesprek goedkoper dan een op verbruik afgerekende spraak-API. Bij intermitterend volume is het veel slechter, en het omslagpunt is de enige financiële kwestie die ertoe doet.
Er is een derde pad waar veel teams terecht zullen komen, en het is de moeite waard om het te benoemen, omdat het de vorm van de beslissing verandert. Als je een cascade aanhoudt, is het enige been dat een gehost model moet zijn, het middelste — de redenering. OrcaRouter bevat noch Qwen-Audio-3.0-TTS noch Realtime-Venus; beide spraaklagen vallen buiten wat wij aanbieden, en we zeggen dat liever dan iets anders te suggereren. Het redeneerbeen is wat wij wél dekken: bijna 200 tekstmodellen achter één sleutel tegen de lijstprijs van de provider zonder opslag, automatische failover tussen upstreams zodat een slechte middag bij één provider een live gesprek niet laat vallen, een routing-DSL die meerdere modellen samenvoegt tot één aanroep, en model fusion wanneer een beslissing meer dan één mening verdient. In een cascade is dat het been dat je het liefst wilt kunnen omwisselen zonder contractonderhandeling, en het been waar een prijsverlaging van een leverancier dezelfde dag landt in plaats van bij verlenging.

Klonen snijdt aan twee kanten
Qwen-Audio-3.0-TTS kan een stem klonen op basis van een korte referentie-opname, taaloverstijgend, en is gedocumenteerd als robuust tegen ruisende of galmende input. Dat is de commercieel meest nuttige capaciteit in de vergelijking en het grootste compliance-oppervlak. Een product dat elke spreker kan reproduceren op basis van tien seconden audio heeft een veel langer antwoord op "van wie is die stem, en wie heeft daarvoor toestemming gegeven" dan een product dat alleen maar in de presets van een leverancier spreekt.
Realtime-Venus levert samen met de gewichten een referentiestem mee. Je kunt ermee klonen als je de audio en de trainingsrun hebt, maar niets in de release is erop gebouwd om dat gemakkelijk te maken — wat, voor een self-hosted deployment binnen een compliancegrens, misschien wel de veiligere standaard is.
Welke je eigenlijk koopt
Koop Qwen-Audio-3.0-TTS wanneer de audio de output is. Narratie, lokalisatie, toegankelijkheid, nasynchronisatie, elke workflow waarin de tekst bestaat voordat het geluid dat doet en kwaliteit per gerenderd uur de maatstaf is. Begin met Flash als het afspelen live is, stap over naar Plus wanneer de stem zelf het product is, en bepaal de prijs voor de cloning-workflow apart van de presetbibliotheek.
Kies Realtime-Venus wanneer de invoer een persoon is en het systeem zich als een luisteraar moet gedragen. Camerabewuste assistentie, handsfree interactie, alles waarbij een mens midden in een zin gaat onderbreken en verwacht dat het systeem het afhandelt. De ruil is hard: je doet afstand van een Elo-gewaardeerde stem, duizend presets en elke gehoste optie, en in ruil daarvoor krijg je de enige van de twee die jou kan horen.
De meeste producten willen beide, op verschillende plekken. Wat ze niet zouden moeten delen, is een kostenmodel — prijs per uur audio is de juiste maatstaf voor precies één van deze twee modellen, en dat is niet het model dat het gesprek voert.
