Hero-titelkaart voor 'GPT-Live-1 vs Cartesia Sonic 3.6', met als ondertitel 'De best klinkende stem is niet degene die jou kan horen', met drie kaarten met de tekst 'Cartesia Sonic 3.6: 1.275 Elo, #1 op beide Artificial Analysis spraakarena's', 'GPT-Live-1: 70,3% op de Speech to Speech Index, gedeeld zesde van 14', 'Verschillende scoreborden, omdat ze verschillende dingen meten', boven een voetstrook met de tekst 'Arenacijfers volgens Artificial Analysis; GPT-Live-1-interactiviteitscijfers gerapporteerd door OpenAI.' Het OrcaRouter-logo is in de rechteronderhoek gecompositeerd.
Guides & Insights

GPT-Live-1 vs Cartesia Sonic 3.6: De nummer-1 TTS-ranglijst meet geen onderbreking

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Cartesia Sonic 3.6 leidt momenteel beide tekst-naar-spraakarena's van Artificial Analysis — 1.275 Elo op de Provider Voice-ranglijst en ook eerste op de Controlled Voice-ranglijst, vóór elke commerciële engine met een groter platform eromheen. GPT-Live-1 staat op geen van beide in de ranglijst, omdat het geen tekst-naar-spraakmodel is. Het staat gedeeld zesde van de veertien op een andere ranglijst van Artificial Analysis, de Speech to Speech Index, met 70,3%. Samen gelezen beschrijven die twee feiten de werkelijke tweedeling tussen deze producten: Sonic 3.6 is zeer waarschijnlijk de betere stem, en GPT-Live-1 is de enige van de twee die kan horen dat de beller begint te praten en weer stopt.

Beide zijn live en beide zijn commercieel beschikbaar — Sonic 3.6 op Cartesia's eigen API sinds de stabiele snapshot op 27 augustus 2026 verscheen, GPT-Live-1 op OpenAI's developer-API sinds 10 september 2026, voor $0,05 per spraakminuut. Kiezen tussen beide is geen kwaliteitsbeslissing. Het is een beslissing over welke helft van een spraakagent je koopt.

Twee arena's, twee vragen, en waarom de splitsing echt is

Artificial Analysis beheert zijn spraakranglijsten op een manier die het waard is te begrijpen voordat iemand je een van beide Elo's voorschotelt. De Provider Voice-arena rangschikt engines op basis van de eigen native stemmen van elke leverancier — hij meet de stem die je daadwerkelijk direct uit de doos krijgt, en dat is het getal waar een koper om geeft. De Controlled Voice-arena kloont elk model op dezelfde acht referentiestemmen, zodat luisteraars de synthese-engine vergelijken in plaats van het stemtalent. Sonic 3.6 staat bij beide bovenaan, wat zeldzamer is dan het klinkt: de twee ranglijsten hebben het grootste deel van 2026 verschillende winnaars gehad.

Geen van beide boards bevat één enkel voorbeeld van een model dat wordt onderbroken. Ze meten hoe spraak in isolatie voor een luisteraar klinkt. De Speech to Speech Index is anders opgebouwd — hij weegt spraakredenering, agentische prestaties, arena-voorkeur en taaksucces tot één cijfer, en laat alleen modellen toe die native speech-to-speech zijn. Cartesia heeft daar geen inzending. Niet omdat Sonic 3.6 slecht is, maar omdat een tekst-naar-spraak-engine niets in te dienen heeft.

Dus de 1.275 en de 70,3% zijn geen concurrerende cijfers, en elke vergelijking die ze op één lijn zet, liegt stilletjes tegen je. Wat ze samen aantonen, is dat kwaliteit niet langer de as is waarop deze beslissing draait.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

Dimensie voor dimensie

• Soort — GPT-Live-1: full-duplex spraak-naar-spraak, één model voor de hele cyclus vs Cartesia Sonic 3.6: streaming tekst-naar-spraak, gecombineerd met Ink-2 spraakherkenning voor agenten

• Onafhankelijke kwaliteit — GPT-Live-1: 70,3% op de Speech to Speech Index, gedeelde zesde plaats van veertien tegenover Cartesia Sonic 3.6: 1.275 Elo op het Provider Voice-board, op basis van 1.755 samples, en ook eerste op het Controlled Voice-board

• Onderbrekingsafhandeling — GPT-Live-1: een eigenschap van het model, die meerdere keren per seconde beslist of het de beurt afstaat versus Cartesia Sonic 3.6: een integratiepatroon, waarbij de client de synthesecontext annuleert en vertrouwt op tijdstempels op woordniveau om op het juiste moment af te snijden

• Prijs — GPT-Live-1: $ 0,05 per stemminuut, per seconde gefactureerd, met de reasoning-backend apart afgerekend, tegenover Cartesia Sonic 3.6: ongeveer $ 49 per miljoen tekens bij creditplannen, plus $ 0,06 per minuut aan agentgespreksduur en $ 0,014 per minuut voor een Cartesia-telefoonnummer

• Latentie — GPT-Live-1: geen cijfer op modelniveau gepubliceerd; latentie bij beurtwisseling opgegeven als 0,798 seconden in OpenAI's eigen tests versus Cartesia Sonic 3.6: minder dan 90 milliseconden tot eerste audio, door de leverancier opgegeven en niet onafhankelijk end-to-end gemeten

• Doorvoer — GPT-Live-1: gelijktijdige sessies, beperkt tot 25 op tier 1 en 500 op tier 5, zonder gratis tier, tegenover Cartesia Sonic 3.6: ongeveer 132 tekens per seconde, ruwweg het dubbele van de v3-snelheid van ElevenLabs in dezelfde vergelijking, met een gratis tier van 20.000 maandelijkse credits

• Talen — GPT-Live-1: ongelijke vloeiendheid buiten de grote talen in de lanceringsdekking vs. Cartesia Sonic 3.6: 44 talen verdeeld over 61 locales, met Odia en Urdu toegevoegd in deze release

• Stembesturing — GPT-Live-1: twaalf presets, toon en tempo via prompting, geen klonen vs Cartesia Sonic 3.6: meer dan 500 presetstemmen, direct klonen, professioneel klonen op hogere tiers, tijdstempels per woord en foneem, en geen SSML — het model past het tempo aan op basis van de tekst zelf

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Barge-in is een eigenschap van de architectuur, geen afvinkvakje

Wat kopers bij deze vergelijking het vaakst fout doen, is ondersteuning voor onderbreking als een booleaanse waarde behandelen. Cartesia's documentatie is openhartig over hoe hun versie werkt: wanneer de beller door de agent heen praat, stuurt de client een annulering voor de huidige synthesecontext, en de tijdstempels op woordniveau die op de WebSocket-verbinding worden geretourneerd, zijn wat je in staat stelt het afspelen bij de juiste lettergreep te stoppen. Dat is een competent ontwerp, en zo gaan de meeste productie-spraakagenten tegenwoordig met barge-in om.

Het is nog steeds een ontwerp waarin de beslissing om te stoppen met praten door je applicatie werd genomen, met behulp van een spraakactiviteitssignaal, ongeacht welke latentie de roundtrip toelaat. GPT-Live-1 verplaatst die beslissing het model in. Het beslist continu of het moet blijven luisteren, pauzeren, de beurt nemen of deze overdragen, wat de reden is dat de eigen cijfers van Open​AI 80,1% interactiviteit rapporteren tegenover 45,4% voor GPT-Realtime-2.1 op Full Duplex Bench v1.5, met een latentie voor beurtwisseling van 0,798 seconden tegenover 1,41. Die cijfers zijn van Open​AI, gepubliceerd bij de release en door niemand buiten het bedrijf gereproduceerd — maar het architectonische verschil erachter is niet omstreden, en het is het enige wat een cascade niet kan benaderen door te tunen.

Waar de cascade wint, is alles wat na de zin komt. Cartesia's tijd-tot-eerste-audio van minder dan 90 milliseconden is een leverancierscijfer en het meet het model, niet het gesprek: het getal dat een beller ervaart, omvat ook spraakherkenning, beurtdetectie, de generatietijd van het taalmodel, netwerktransport en audiobuffering. Dat is precies waarom een cascade de moeite waard is om te bouwen wanneer je elke fase moet kunnen beheersen — een snel klein model voor eenvoudige beurten, een frontier-model voor de moeilijke, en een synthesizer die je nooit laat wachten.

Die middelste fase is het enige deel van beide stacks dat echt overdraagbaar is, en het is het deel dat zowel de kwaliteit als de kosten van het gesprek bepaalt. Ongeveer 190 modellen van elf upstreamproviders zitten achter één OrcaRouter-sleutel tegen de listprijs van de provider, zonder opslag, en de routing-DSL laat één enkel endpoint eenvoudige beurten naar een goedkoop model sturen en de ingewikkelde op te schalen naar een frontier-model — het patroon dat een voice-agent eigenlijk wil, toegepast op de fase die het meest varieert. Noch Sonic 3.6 noch GPT-Live-1 is bereikbaar via een routinglaag; de voice-lagen behoren toe aan hun leveranciers.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

Het geld beheren

De twee prijsmodellen sluiten niet op elkaar aan, dus het loont de moeite om de omrekening goed uit te voeren. Spraak gaat met ongeveer 150 woorden per minuut, en het Engels telt gemiddeld ongeveer vijfeneenhalve tekens per woord, dus een minuut gesproken tekst is ongeveer 800 tot 900 tekens. Bij $49 per miljoen tekens kost Cartesia's synthese ongeveer vier cent per minuut audio.

Dan komt de rest van de cascade binnen. Cartesia rekent $0,06 per minuut aan gespreksduur van de voice-agent en $0,014 per minuut als je het telefoonnummer gebruikt, bovenop de tekens. Voeg spraakherkenning en een taalmodel voor de tekst toe, en je zit al boven de tien cent per minuut voordat iemand iets moeilijks heeft gezegd. De $0,05 per stemminuut van GPT-Live-1 dekt het luisteren, de beurtwisseling en het spreken, terwijl het gedelegeerde redeneren apart wordt gefactureerd tegen het normale tarief van het backendmodel — wat voor een reserveringsgesprek met een zoekopdracht of twee eraan vast een reëel bedrag is, geen afrondingsfout.

Het omslagpunt ligt bij volume en bij moeilijkheidsgraad. Korte, repetitieve oproepen met een hoog volume — bevestigingen, meldingen, eenvoudige opzoekingen — begunstigen de cascade, omdat een goedkoop model dat een gescripte vraag beantwoordt het goedkoopste is in deze vergelijking. Oproepen waarin de beller van het script afwijkt, door de agent heen praat of midden in de zin van gedachten verandert, begunstigen het end-to-endmodel, omdat de faalmodus van de cascade daar niet een fout antwoord is, maar een ongemakkelijk antwoord.

Welke moet je kiezen?

Kies Cartesia Sonic 3.6 als je de best scorende stem wilt die beschikbaar is en je bereid bent de gesprekslogica zelf in handen te nemen. Het is de juiste keuze voor narratie, voor grootschalige gescripte agents, voor teams met een bestaande spraakherkenningspijplijn, en voor iedereen die de timestamps op woordniveau nodig heeft die nauwkeurige onderbrekingsafhandeling mogelijk maken. Je krijgt een gratis tier, meer dan 500 stemmen, cloning, 44 talen en de top van beide kwaliteitsranglijsten, en je behoudt de controle over elke fase.

Kies GPT-Live-1 als de onderbreking het product is. Alles waarbij over je heen gepraat worden de normale gang van zaken is in plaats van een uitzondering, en waarbij een beurtwisseling van 0,8 seconde het wint van een start van 90 milliseconden bij een zin die nog niemand afgemaakt had. Je accepteert een gesloten, gehost model per minuut met twaalf stemmen en zonder stemklonen, en je accepteert dat de onafhankelijke kwaliteitsscore ervan middenmoot is.

De verleiding is om 1.275 af te zetten tegen 70,3% en het als beslecht te beschouwen. Dat is het niet, en het verschil tussen die twee getallen is de hele argumentatie: het ene meet hoe een stem klinkt, het andere meet of het de moeite waard is om ermee te praten.