Karta tytułowa hero dla 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — głos, który słucha, vs król aren', z lewą kartą 'Cartesia Sonic 3.6 — Provider #1 · Elo 1,282 · $49 / 1M znaków' i prawą kartą 'Inworld Realtime TTS-2 — Controlled #1 · Elo 1,123 · $25 / 1M znaków', chipem ze statystykami 'Podzielone korony — areny Provider vs Controlled' oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: Głos, który słucha vs Król aren

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Istnieją dwie konkurujące ze sobą teorie wyjaśniające, dlaczego syntetyczny głos sprawia wrażenie ludzkiego, a obecnie dwoma najlepszymi komercyjnymi przykładami, po jednym dla każdej teorii, są Inworld Realtime TTS-2 oraz Cartesia Sonic 3.6. Teoria Cartesii zakłada, że człowieczeństwo tkwi w samym audio: spraw, by barwa, prozodia i timing były nieodróżnialne od ludzkich, a słuchacze postawią cię na pierwszym miejscu — co też zrobił Sonic 3.6 w sierpniu, wskakując na szczyt areny Provider Voice serwisu Artificial Analysis z wynikiem Elo 1 282. Teoria Inworlda zakłada, że człowieczeństwo tkwi w słuchaniu: TTS-2 uzależnia swoją wypowiedź od rzeczywistego audio rozmowy, która ją poprzedziła, więc nie tylko brzmi jak człowiek, ale też odpowiada jak człowiek. W tym tygodniu obie teorie zderzyły się na tablicy wyników: to samo ponowne przeliczenie wyników, które umieściło Inworld Realtime TTS-2 na 2. miejscu tablicy dostawców z Elo 1 252, umieściło go też na 1. miejscu areny Controlled Voice — tablicy, której wcześniej przewodziła Cartesia — z wynikiem 1 123 wobec 1 119 dla Sonic 3.6. Jeden model dzierży koronę dostawców. Drugi właśnie zdobył tę kontrolowaną.

To nie jest pojedynek, w którym jedna strona jest ewidentnie w błędzie. Oba modele zostały stworzone do nakładających się, ale nie identycznych zadań, a różnica w cenie — Sonic 3.6 za 49,0 USD za milion znaków wobec 25 USD na żądanie za Inworld Realtime TTS-2 — jest na tyle realna, że decyzja ma zarówno komponent budżetowy, jak i jakościowy.

Dwie teorie głosu brzmiącego jak ludzki

Cartesia po cichu wypuściło Sonic 3.6 w sierpniu 2026 roku — wydanie punktowe, które ulepszyło Sonic 3.5 bez zmiany ceny ani narracji o architekturze. Poprawa ujawniła się tam, gdzie Cartesia jej potrzebowała: model osiągnął Elo 1 282 na arenie Provider Voice serwisu Artificial Analysis — gdzie każdy model korzysta z własnych, natywnych głosów — i utrzymał pierwsze miejsce na arenie Controlled Voice przez cały sierpień. Na tablicy kontrolnej każdy model jest klonowany na tych samych ośmiu mówcach referencyjnych, więc to zwycięstwo jest oceną samego silnika syntezy, niezależną od talentu głosowego. Po ponownym przeliczeniu wyników Inworld w związku z ogólną dostępnością w tym tygodniu, Cartesia nadal prowadzi na tablicy dostawców, ale Sonic 3.6 zajmuje obecnie 2. miejsce na tablicy kontrolnej z Elo 1 119, cztery punkty za Inworld Realtime TTS-2 z wynikiem 1 123.

Inworld Realtime TTS-2 wywodzi się z innej tradycji. Jego poprzednia linia, TTS 1.5, na początku 2026 roku znajdowała się w czołówce tych samych rankingów, a badawcza wersja zapoznawcza TTS-2 osiągnęła w czerwcu Elo 1 209 w rankingu dostawców. Model GA od tego czasu awansował: w obecnych rankingach zajmuje 1 252 na Provider Voice (2. miejsce, za Sonic 3.6 z wynikiem 1 282) oraz 1 123 na Controlled Voice (1. miejsce). Prawdziwym wyróżnikiem flagowego modelu nie jest jednak Elo; chodzi o to, że przyjmuje on wcześniejsze tury rozmowy jako wejście audio i pozwala im kształtować sposób, w jaki wypowiada kolejną kwestię. Cartesia kalibruje emocje na podstawie transkrypcji. Inworld wsłuchuje się w to, jak wypowiedziano ostatnią rzecz.

Tablica wyników, uczciwie oznaczona

Wyniki Elo pochodzą z aren mowy Artificial Analysis i zostały odczytane z tablic wyników na żywo we wrześniu 2026 r. Dane dotyczące opóźnień pochodzą od producentów, o ile nie zaznaczono inaczej, a dla żadnego z modeli nie opublikowano niezależnego audytu opóźnień.

• Niezależna jakość — Cartesia Sonic 3.6: Elo 1,282 (#1, Provider Voice) i 1,119 (#2, Controlled Voice) vs Inworld Realtime TTS-2: Elo 1,252 (#2, Provider Voice) i 1,123 (#1, Controlled Voice)

• Cena za 1 milion znaków — 49,0 USD (według Artificial Analysis) vs 25 USD na żądanie, 20,8 USD średnio ważone według Artificial Analysis, do 12,50 USD przy wolumenie (u dostawcy)

• Czas do pierwszego dźwięku — poniżej 90 ms (deklaracja producenta) wobec mediany poniżej 200 ms oraz poniżej 100 ms dla p99 w testach premierowych Inworld (deklaracja producenta); niskoopóźnieniową odpowiedzią Inworld na Sonic jest osobny poziom TTS-2 Flash z czasem do pierwszego bajtu ~25 ms

• Języki — 42 zlokalizowane vs 100+ języków do sterowania dostawą, przy czym deklaracja Inworld o jednej tożsamości głosowej obejmuje 200+ lokalizacji (dane producenta)

• Natychmiastowe klonowanie głosu — ~10 sekund nagrania w porównaniu z 5–15 sekundami, plus beta profesjonalnego klonowania, która wymaga ~10 minut nagrania do uzyskiwania klonów o wyższej wierności

• Kontrola wypowiedzi — tagi umieszczane bezpośrednio w transkrypcji (np. [śmiech]), modulacja głośności i tempa, sterowanie w języku naturalnym (np. „[spokojny, uspokajający]” lub [szept]), instrukcje na poziomie żądania oraz trzy tryby stabilności (od Stable do Expressive).

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Dlaczego „listens to the conversation” to inna oś?

Powyższa tabela wyników mierzy, jak głos brzmi w izolacji. Wymiar, w którym oba modele naprawdę się różnią, nie jest widoczny na żadnej liście rankingowej, ponieważ przejawia się dopiero na przestrzeni wielu tur rozmowy.

Inworld Realtime TTS-2 został stworzony z myślą o sytuacji, w której osoba właśnie coś do niego powiedziała. Model przetwarza audio poprzednich wypowiedzi — nie tylko ich transkrypcję — analizuje ton, tempo i stan emocjonalny, a zanim zacznie mówić, wybiera odpowiedni stan odpowiedzi. Jeśli rozmówca jest sfrustrowany, sposób przekazu się zmienia; jeśli jest zrelaksowany, wraca do normy. Dlatego Inworld reklamuje ten model dla agentów, towarzyszy i gier, a nie do narracji: ta funkcja jest bez znaczenia w jednorazowym wywołaniu tekst-na-audio, a ma znaczenie w rozmowie.

Cartesia Sonic 3.6 działa inaczej. To szybki, wysokiej jakości silnik streamingowy, a według samej Cartesii automatyczna kalibracja emocjonalna odbywa się na podstawie transkryptu — czyta słowa i odpowiednio moduluje głos. Nie słucha natomiast dźwięku poprzednich tur. W obrębie jednej wypowiedzi oba rozwiązania mogą brzmieć porównywalnie; w rozmowie Inworld modeluje coś, czego Sonic nie podejmuje. Jeśli Twój produkt to voiceover oparty na pojedynczej wypowiedzi, takie modelowanie jest narzutem. Jeśli to agent działający na żywo, to modelowanie jest produktem.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Szybkość, cena i zastrzeżenie dotyczące Flasha

Jeśli chodzi o czystą latencję, Cartesia dzierży laur zwycięzcy: czas do pierwszego dźwięku poniżej 90 ms jest deklarowany przez producenta, ale to wartość, którą firma dostarcza od generacji Sonic 3, i nikt nie opublikował żadnego zaprzeczającego audytu. Flagowy model Inworld odpowiada w podobnej, konwersacyjnej klasie, poniżej 200 ms, co jest wystarczające dla agentów na żywo. Prawdziwym atutem Inworld w kwestii latencji jest poziom Flash, który pojawił się wraz z modelem GA — osobny model o czasie do pierwszego bajtu ~25 ms, stworzony z myślą o dużych obciążeniach, gdzie koszt i latencja klasy Sonic liczą się bardziej niż ekspresyjność. Zastrzeżenie jest takie, że Flash to okrojony członek rodziny: natychmiastowe klonowanie i wbudowane elementy niewerbalne, ale bez profesjonalnego klonowania i pełnego sterowania językiem naturalnym.

Ceny układają się jednak odwrotnie. Sonic 3.6 kosztuje 49,0 USD za milion znaków — mniej więcej dwukrotnie więcej niż stawka Inworld w wysokości 25 USD za korzystanie na żądanie i prawie czterokrotnie więcej niż najwyższy próg taryfowy wynoszący 12,50 USD. Różnica jakości między nimi, w zestawieniach, w których oba występują, nie uzasadnia takiej wielokrotności dla nabywcy o dużym wolumenie. Dla agenta głosowego działającego w czasie rzeczywistym, generującego tysiące znaków podczas jednej rozmowy, różnica w cenie za znak to różnica między zdrową ekonomiką jednostkową a taką o minimalnej marży.

Które wybrać

Wybierz Cartesia Sonic 3.6, jeśli korona w rankingu dostawców jest tym, czego chcesz — to najwyżej oceniany głos wykorzystujący własne natywne głosy, Elo 1 282, do krótkich, samodzielnych wypowiedzi, takich jak odpowiedzi asystenta, kwestie z gier i odczyty statusu. Za $49 za milion znaków płacisz za koronę i pozostaje modelem do pokonania w tym rankingu.

Wybierz Inworld Realtime TTS-2jeśli produkt jest rozmową wieloturową, w której wypowiedź powinna odpowiadać rozmówcy po drugiej stronie — rozmowy z infolinią wsparcia, towarzysz, wywiad, sesja korepetycji. Obecnie prowadzi w kontrolowanym rankingu, w którym każdy model mówi tymi samymi ośmioma głosami referencyjnymi, i robi to mniej więcej o połowę taniej, jednocześnie słuchając audio rozmowy.

Wbuduj przełącznik w warstwę routingu, jeśli z góry nie możesz wiedzieć, jakiego rodzaju głosu będzie potrzebować połączenie. Żaden z tych modeli nie jest w OrcaRouter w momencie pisania tego tekstu — do Sonica można dotrzeć przez własne API Cartesii i kilka zewnętrznych platform, a do Inworld przez jego własne API — ale warstwa routingu to dokładnie taka struktura, która pozwala rozpocząć rozmowę na jednym głosie i awaryjnie przełączyć ją na drugi, przy czym cena katalogowa każdego dostawcy jest przekazywana dalej z zerowym narzutem. Gdy jedna z tych platform znowu się odwróci — a w tym tygodniu właśnie to zrobiła — wybór staje się zmianą konfiguracji, a nie przepisaniem kodu.

Krótka wersja

To jest prawdziwy fork, a szczera odpowiedź brzmi: ten fork dotyczy przejmowania głosu w rozmowie, a nie jakości audio. Jeśli potrzebujesz najlepiej ocenianego samodzielnego głosu wykorzystującego natywne głosy dostawcy, Cartesia Sonic 3.6 dzierży koronę wśród dostawców z wynikiem Elo 1282 i kosztuje 49 dolarów za milion znaków. Jeśli potrzebujesz głosu, który reaguje na sposób, w jaki się do niego mówi, Inworld Realtime TTS-2 osiągnął w tym tygodniu ogólną dostępność (GA) za 25 dolarów na żądanie, prowadzi na kontrolowanej tablicy wyników, na której oba modele mierzą się na tych samych głosach, i oferuje funkcję świadomości konwersacyjnej, której żadna arena w pełni nie mierzy. Tablice wyników są teraz podzielone między oba modele — co jest najbardziej uczciwym możliwym obrazem rynku, na którym „najlepszy” zależy od testu.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.