En hjältetitelkort för 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — rösten som lyssnar vs kungen av arenorna', med ett vänsterkort 'Cartesia Sonic 3.6 — Provider #1 · Elo 1,282 · $49 / 1M tecken' och ett högerkort 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1,123 · $25 / 1M tecken', en statistikmarkör 'Delade kronor — Provider vs Controlled-arenor', och OrcaRouter-logotypen längst ner till höger.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: Rösten som lyssnar vs Arenornas kung

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns två konkurrerande teorier om varför en syntetisk röst känns mänsklig, och just nu är de två bästa kommersiella exemplen på vardera Inworld Realtime TTS-2 och Cartesia Sonic 3.6. Cartesias teori är att mänskligheten ligger i ljudet: gör klangen, prosodin och tajmingen omöjliga att skilja från en persons, så kommer lyssnarna att ranka dig först — vilket Sonic 3.6 gjorde i augusti, när den hoppade till toppen av Artificial Analysis's Provider Voice-arena på Elo 1 282. Inworlds teori är att mänskligheten ligger i lyssnandet: TTS-2 anpassar sitt framförande efter det faktiska ljudet i konversationen som kom före, så den inte bara låter som en person, den svarar som en. Den här veckan kolliderade de två teorierna på resultattavlan: samma omräkning som placerade Inworld Realtime TTS-2 på #2 på providerlistan, på Elo 1 252, placerade den också på #1 på Controlled Voice-arenan — den lista som Cartesia hade lett — på 1 123 mot Sonic 3.6:s 1 119. En modell innehar providerkronan. Den andra tog precis den kontrollerade.

Detta är ingen match där den ena sidan är uppenbart fel. De två modellerna byggdes för överlappande men inte identiska uppgifter, och prisskillnaden — Sonic 3.6 till $49,0 per miljon tecken mot $25 on demand för Inworld Realtime TTS-2 — är tillräckligt påtaglig för att beslutet ska ha en budgetkomponent såväl som en kvalitetskomponent.

Två teorier om en människoliknande röst

I augusti 2026 släppte Cartesia Sonic 3.6 i det tysta, en punktrelease som förbättrade Sonic 3.5 utan att priset eller arkitekturberättelsen ändrades. Förbättringen syntes där Cartesia behövde den: modellen klättrade till Elo 1 282 på Provider Voice-arenan hos Artificial Analysis – där varje modell använder sina egna röster – och höll topplaceringen på Controlled Voice-arenan genom hela augusti. På den kontrollerade listan klonas varje modell till samma åtta referensröster, vilket gör att utmärkelsen är ett omdöme om själva syntesmotorn, oberoende av rösttalangerna. Efter den här veckans omvärdering i samband med Inworlds GA-släpp leder Cartesia fortfarande providerlistan, men Sonic 3.6 ligger nu tvåa på den kontrollerade listan med Elo 1 119 – fyra poäng bakom Inworld Realtime TTS-2 på 1 123.

Inworld Realtime TTS-2 kommer från en annan tradition. Dess föregångarserie TTS 1.5 låg i början av 2026 nära toppen i samma arenor, och forskningsförhandsversionen av TTS-2 hade Elo 1 209 på leverantörslistan i juni. GA-modellen har klättrat sedan dess: på de nuvarande listorna ligger den på 1 252 på Provider Voice (#2, bakom Sonic 3.6:s 1 282) och på 1 123 på Controlled Voice (#1). Flaggskeppets verkliga särskiljare är dock inte dess Elo; det är att modellen tar de tidigare turerna i en konversation som ljudinmatning och låter det forma hur den levererar nästa replik. Cartesia kalibrerar känslan utifrån transkriptet. Inworld lyssnar på hur det sista sades.

Resultattavlan, ärligt märkt.

Elo-siffrorna kommer från Artificial Analysis talarenor, avlästa från live-tavlorna i september 2026. Latenssiffrorna är leverantörsrapporterade om inte annat anges, och ingen oberoende latensgranskning har publicerats för någon av modellerna.

• Oberoende kvalitet — Cartesia Sonic 3.6: Elo 1 282 (#1, Provider Voice) och 1 119 (#2, Controlled Voice) mot Inworld Realtime TTS-2: Elo 1 252 (#2, Provider Voice) och 1 123 (#1, Controlled Voice)

• Pris per 1M tecken — 49,0 USD (enligt Artificial Analysis) jämfört med 25 USD på begäran, 20,8 USD som viktat genomsnitt enligt Artificial Analysis, ned till 12,50 USD vid volym (leverantör).

• Tid till första ljud — under 90 ms (enligt leverantören) jämfört med under 200 ms i median och under 100 ms vid p99 i Inworlds lanseringstester (enligt leverantören); Inworlds låg-latens-svar på Sonic är den separata TTS-2 Flash-nivån med ~25 ms tid till första byte.

• Språk — 42 lokaliserade jämfört med 100+ språk för leveransstyrning, med Inworlds påstående om one-voice-identity som sträcker sig till 200+ språkområden (enligt leverantören)

• Omedelbar röstkloning — ~10 sekunders ljud jämfört med 5–15 sekunder, plus ett betaprogram för professionell kloning som kräver ~10 minuters ljud för kloner med högre kvalitet

• Leveransstyrning — inline transkripttaggar som [laughter], plus volym- och hastighetsmodulering jämfört med styrning på vanlig engelska som "[calm, reassuring]" eller [whisper], instruktioner på förfrågningsnivå och tre stabilitetslägen från Stable till Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Varför "lyssnar på konversationen" är en annan axel.

Poängtavlan ovan mäter hur en röst låter i isolering. Den dimension där de två modellerna verkligen skiljer sig åt syns inte på någon topplista, eftersom den bara finns över flera turer.

Inworld Realtime TTS-2 är byggd för situationen där en person precis har sagt något till den. Modellen tar in ljudet från tidigare turer – inte bara en utskrift av dem – resonerar kring ton, tempo och känslomässigt tillstånd, och väljer ett svarstillstånd innan den talar. Om en uppringare är frustrerad ändras leveransen; om de är avslappnade ändras den tillbaka. Det är därför Inworld marknadsför modellen för agenter, följeslagare och spel snarare än för berättarröst: funktionen är meningslös i ett engångssamtal från text till ljud, och meningsfull i en konversation.

Cartesia Sonic 3.6 fungerar annorlunda. Det är en snabb, högkvalitativ streamingmotor, och Cartesias eget påstående är automatisk emotionell kalibrering från transkriptet — den läser orden och modulerar därefter. Det den inte gör är att lyssna på ljudet från tidigare turer. Inom ett enda yttrande kan de två låta jämförbara; över en konversation modellerar Inworld något som Sonic inte försöker sig på. Om din produkt är ett enstaka voiceover-yttrande, är den modelleringen overhead. Om det är en liveagent, är det produkten.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Snabbhet, pris och Flash-varningen

När det enbart gäller latens har Cartesia haft skryträtten: under 90 ms till första ljud är en uppgift från leverantören, men det är den siffra företaget har levererat sedan Sonic 3-generationen, och ingen har publicerat en granskning som motsäger den. Inworlds flaggskepp svarar i en liknande samtalsklass på under 200 ms, vilket är fullt tillräckligt för liveagenter. Den verkliga latenssatsningen från Inworld är Flash-nivån som släpptes tillsammans med GA-modellen – en separat modell på ~25 ms till första byte, inriktad på högvolymslaster där kostnad och latens i Sonic-klass väger tyngre än uttrycksfullhet. Haken är att Flash är en nedbantad medlem av familjen: direktkloning och inbyggda icke-verbala uttryck finns, men ingen professionell kloning och ingen fullständig styrning via naturligt språk.

Prisnedgångar åt andra hållet. Sonic 3.6 kostar 49,0 dollar per miljon tecken – ungefär dubbelt så mycket som Inworlds 25 dollar för on demand-prissättning, och nästan fyra gånger den högsta nivån på 12,50 dollar. Kvalitetsgapet mellan dem, på de plattformar där båda förekommer, motiverar inte den multiplikatorn för en köpare med hög volym. För en röstagent i realtid som genererar tusentals tecken per konversation, är skillnaden per tecken skillnaden mellan en sund enhetskalkyl och en tunn sådan.

Vilken ska man välja?

Välj Cartesia Sonic 3.6 om du vill åt leverantörslistans krona — den högst poängsatta rösten med sina egna inbyggda röster, Elo 1 282, för korta fristående yttranden som assistentsvar, spelrader och statusuppläsningar. För 49 dollar per miljon tecken betalar du för kronan, och den förblir modellen att slå på den listan.

Välj Inworld Realtime TTS-2 om produkten är en konversation med flera turer där talet ska svara på personen i andra änden — supportsamtal, en följeslagare, en intervju, en handledningssession. Den toppar nu den kontrollerade listan, där varje modell talar med samma åtta referensröster, och den gör det till ungefär halva priset samtidigt som den lyssnar på konversationens ljud.

Bygg in växeln i routingen om du inte i förväg kan veta vilken typ av röst ett samtal behöver. Ingen av modellerna finns på OrcaRouter i skrivande stund — Sonic nås via Cartesias eget API och flera tredjepartsplattformar, Inworld via sitt eget API — men ett routinglager är precis den struktur som gör att en konversation kan börja med en röst och växla över till den andra, där varje leverantörs listpris förs vidare med 0 % påslag. Den dag en av dessa plattformar ändrar sig igen — och det gjorde de den här veckan — blir valet en konfigurationsändring i stället för en omskrivning.

Den korta versionen

Det här är ett äkta vägskäl, och det ärliga svaret är att vägskälet handlar om turtagning, inte ljudkvalitet. Om du behöver den högst poängsatta fristående rösten med egna inbyggda röster, innehar Cartesia Sonic 3.6 leverantörskronan på Elo 1 282 och kostar 49 dollar per miljon tecken. Om du behöver en röst som svarar på hur den tilltalas, blev Inworld Realtime TTS-2 allmänt tillgänglig (GA) den här veckan till 25 dollar on demand, leder den kontrollerade listan där de två möts med samma röster och har en funktion för konversationsmedvetenhet som ingen arena mäter fullt ut. Topplistorna är nu delade mellan de två modellerna – vilket är den ärligaste tänkbara bilden av en marknad där ”bäst” beror på testet.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.