Główna karta tytułowa „GPT-Live-1 vs Cartesia Sonic 3.6" z podtytułem „Najlepiej brzmiący głos to nie ten, który potrafi cię usłyszeć", zawierająca trzy karty o treści „Cartesia Sonic 3.6: 1275 Elo, #1 na obu arenach mowy Artificial Analysis", „GPT-Live-1: 70,3% w Speech to Speech Index, ex aequo 6. miejsce na 14", „Różne tablice wyników, bo mierzą różne rzeczy", a powyżej paska stopki o treści „Dane aren według Artificial Analysis; wskaźniki interaktywności GPT-Live-1 raportowane przez OpenAI". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

GPT-Live-1 vs Cartesia Sonic 3.6: Numer jeden wśród tablic TTS nie mierzy przerywania

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Cartesia Sonic 3.6 obecnie prowadzi w obu arenach syntezy mowy Artificial Analysis — z wynikiem 1 275 Elo na tablicy Provider Voice i pierwszym miejscem również na tablicy Controlled Voice, przed każdym komercyjnym silnikiem, wokół którego zbudowano większą platformę. GPT-Live-1 nie jest sklasyfikowany w żadnej z tych aren, ponieważ nie jest modelem syntezy mowy. Zajmuje ex aequo szóste miejsce na czternaście na innej tablicy Artificial Analysis, Speech to Speech Index, z wynikiem 70,3%. Odczytane razem, te dwa fakty opisują rzeczywisty podział między tymi produktami: Sonic 3.6 jest bardzo prawdopodobnie lepszym głosem, a GPT-Live-1 jest jedynym z tych dwóch, który potrafi usłyszeć, kiedy dzwoniący zaczyna mówić, a kiedy przestaje.

Oba działają i oba są dostępne w sprzedaży komercyjnej — Sonic 3.6 w API samej Cartesii od 27 sierpnia 2026 r., gdy pojawił się jego stabilny snapshot, GPT-Live-1 w developerskim API OpenAI od 10 września 2026 r., w cenie 0,05 USD za minutę głosu. Wybór między nimi nie jest decyzją o jakości. To decyzja o tym, którą połowę agenta głosowego kupujesz.

Dwie areny, dwa pytania i dlaczego ten podział jest prawdziwy

Artificial Analysis prowadzi swoje rankingi mowy w sposób, który warto zrozumieć, zanim ktoś przytoczy ci którąkolwiek z ocen Elo. Arena Provider Voice klasyfikuje silniki, używając natywnych głosów każdego dostawcy — mierzy głos, który faktycznie otrzymujesz od razu, a to liczba, która liczy się dla kupującego. Arena Controlled Voice klonuje każdy model na te same osiem głosów referencyjnych, aby słuchacze porównywali silnik syntezy, a nie talent głosowy. Sonic 3.6 prowadzi w obu, co jest rzadsze, niż to brzmi: przez większość 2026 r. te dwa rankingi miały różnych zwycięzców.

Żadna z tablic nie zawiera ani jednej próbki modelu, który został przerwany. Mierzą one, jak mowa brzmi w izolacji dla słuchacza. Speech to Speech Index jest zbudowany inaczej — łączy rozumowanie mowy, wydajność agentową, preferencje areny i sukces zadania w jedną wartość, a dopuszcza wyłącznie modele, które są natywnie speech-to-speech. Cartesia nie ma tam żadnego wpisu. Nie dlatego, że Sonic 3.6 jest zły, ale dlatego, że silnik text-to-speech nie ma nic do zgłoszenia.

Zatem 1 275 i 70,3% nie są konkurującymi liczbami, a każde porównanie, które stawia je w jednym wierszu, po cichu cię okłamuje. To, co wspólnie ustalają, oznacza, że jakość przestała być osią, wokół której obraca się ta decyzja.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

Dimension by dimension

• Rodzaj — GPT-Live-1: pełnodupleksowa komunikacja mowa do mowy, jeden model dla całej pętli vs Cartesia Sonic 3.6: strumieniowa synteza mowy, w połączeniu z rozpoznawaniem mowy Ink-2 dla agentów

• Niezależna jakość — GPT-Live-1: 70,3% w Speech to Speech Index, ex aequo szóste miejsce na czternaście vs Cartesia Sonic 3.6: 1 275 Elo w rankingu Provider Voice, z 1 755 próbek, oraz pierwsze miejsce również w rankingu Controlled Voice

• Obsługa przerwań — GPT-Live-1: właściwość modelu, która wiele razy na sekundę decyduje, czy ustąpić turę, kontra Cartesia Sonic 3.6: wzorzec integracji, w którym klient anuluje kontekst syntezy i polega na znacznikach czasu na poziomie słów, aby uciąć w odpowiednim momencie

• Cena — GPT-Live-1: $0.05 za minutę głosową, rozliczane za sekundę, backend rozumowania rozliczany osobno, w porównaniu z Cartesia Sonic 3.6: około $49 za milion znaków w planach kredytowych, plus $0.06 za minutę czasu trwania rozmowy agenta i $0.014 za minutę za numer telefonu Cartesia

• Opóźnienie — GPT-Live-1: nie opublikowano wartości na poziomie modelu; opóźnienie przejmowania tury podano jako 0,798 sekundy w testach własnych OpenAI w porównaniu z Cartesia Sonic 3.6: poniżej 90 milisekund do pierwszego dźwięku, deklarowane przez dostawcę i niezmierzone niezależnie od początku do końca

• Przepustowość — GPT-Live-1: jednoczesne sesje, z limitem 25 na poziomie 1 i 500 na poziomie 5, bez darmowego poziomu, w porównaniu z Cartesia Sonic 3.6: około 132 znaków na sekundę, czyli około dwukrotnie więcej niż tempo ElevenLabs v3 w tym samym porównaniu, z darmowym poziomem obejmującym 20 000 miesięcznych kredytów

• Języki — GPT-Live-1: nierówna płynność poza głównymi językami objętymi premierą vs Cartesia Sonic 3.6: 44 języki w 61 lokalizacjach, z dodanymi w tym wydaniu orija i urdu

• Sterowanie głosem — GPT-Live-1: dwanaście presetów, ton i tempo poprzez promptowanie, brak klonowania vs Cartesia Sonic 3.6: ponad 500 presetowych głosów, natychmiastowe klonowanie, profesjonalne klonowanie w wyższych planach, znaczniki czasu słów i fonemów oraz brak SSML — model dostosowuje tempo na podstawie samego tekstu

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Barge-in to cecha architektury, a nie pole do odhaczenia

Najczęstszym błędem, jaki popełniają nabywcy w tym porównaniu, jest traktowanie obsługi przerwań jako wartości logicznej. Dokumentacja Cartesia szczerze opisuje, jak działa jej wersja: gdy dzwoniący mówi jednocześnie z agentem, klient wysyła żądanie anulowania bieżącego kontekstu syntezy, a znaczniki czasu na poziomie słów zwracane przez połączenie WebSocket pozwalają zatrzymać odtwarzanie na właściwej sylabie. To kompetentne rozwiązanie i tak właśnie większość produkcyjnych agentów głosowych obsługuje dziś przerywanie.

To wciąż rozwiązanie, w którym decyzję o zakończeniu mówienia podejmowała twoja aplikacja, na podstawie sygnału aktywności głosowej, przy dowolnym opóźnieniu, na jakie pozwala komunikacja w obie strony. GPT-Live-1 przenosi tę decyzję do wnętrza modelu. Model nieustannie decyduje, czy dalej słuchać, zrobić pauzę, przejąć turę czy ją oddać, dlatego własne dane Open​AI podają 80,1% interaktywności w porównaniu z 45,4% dla GPT-Realtime-2.1 w Full Duplex Bench v1.5, przy opóźnieniu przejmowania tury wynoszącym 0,798 sekundy w porównaniu z 1,41. Te liczby pochodzą od Open​AI, zostały opublikowane wraz z wydaniem i nikt spoza firmy ich nie odtworzył — ale różnica architektoniczna, która się za nimi kryje, nie jest kwestionowana, a to jedyna rzecz, której kaskada nie zdoła przybliżyć poprzez strojenie.

To, w czym kaskada wygrywa, to wszystko, co następuje po zdaniu. Czas do pierwszego dźwięku poniżej 90 milisekund podawany przez Cartesię to wartość dostawcy i dotyczy modelu, a nie rozmowy: wartość, której doświadcza dzwoniący, obejmuje także rozpoznawanie mowy, wykrywanie tur, czas generowania modelu językowego, przesył przez sieć i buforowanie dźwięku. Właśnie dlatego warto budować kaskadę, gdy potrzebujesz kontrolować każdy etap — szybki mały model do prostych tur, model frontierowy do trudnych oraz syntezator, który nigdy nie każe ci czekać.

Ten środkowy etap to jedyna część któregokolwiek ze stosów, która jest naprawdę przenośna, i to ta część decyduje zarówno o jakości, jak i o koszcie połączenia. Około 190 modeli od jedenastu dostawców upstream znajduje się za jednym kluczem OrcaRouter w cenie katalogowej dostawcy z zerową marżą, a DSL routingu pozwala pojedynczemu punktowi końcowemu wysyłać proste tury do taniego modelu i eskalować te skomplikowane do modelu frontier — wzorzec, którego tak naprawdę chce agent głosowy, zastosowany do etapu, który zmienia się najbardziej. Ani Sonic 3.6, ani GPT-Live-1 nie są osiągalne przez warstwę routingu; warstwy głosowe należą do ich dostawców.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

Zarządzanie pieniędzmi

Te dwa modele cenowe nie są spójne, więc przeliczenie warto wykonać porządnie. Tempo mowy wynosi około 150 słów na minutę, a angielski ma średnio około pięciu i pół znaku na słowo, więc minuta wypowiedzi to około 800 do 900 znaków. Przy 49 dolarów za milion znaków synteza Cartesii kosztuje około czterech centów za minutę dźwięku.

Potem nadchodzi reszta kaskady. Cartesia pobiera 0,06 USD za minutę czasu trwania rozmowy agenta głosowego i 0,014 USD za minutę, jeśli korzystasz z jej numeru telefonu — do tego dochodzą opłaty za znaki. Dodaj rozpoznawanie mowy i model językowy dla tekstu, a przekroczysz 10 centów za minutę, zanim ktokolwiek powie coś trudnego. Stawka GPT-Live-1 wynosząca 0,05 USD za minutę głosu obejmuje słuchanie, przejmowanie tur i mówienie, a delegowane rozumowanie jest rozliczane osobno według standardowej stawki modelu backendowego — co w przypadku rozmowy rezerwacyjnej z jednym czy dwoma wyszukiwaniami jest realną kwotą, a nie błędem zaokrąglenia.

Punkt przejścia zależy od wolumenu i poziomu trudności. Krótkie, powtarzalne rozmowy o dużym wolumenie — potwierdzenia, powiadomienia, proste wyszukiwania — sprzyjają kaskadzie, ponieważ tani model odpowiadający na pytanie według skryptu jest najtańszym elementem tego porównania. Rozmowy, w których dzwoniący wychodzi poza skrypt, mówi jednocześnie z agentem lub zmienia zdanie w połowie zdania, sprzyjają modelowi end-to-end, ponieważ tryb awarii kaskady nie polega tam na błędnej odpowiedzi, lecz na niezręcznej.

Który wybrać

Wybierz Cartesia Sonic 3.6, jeśli chcesz najlepiej oceniany dostępny głos i jesteś gotów samodzielnie zarządzać logiką rozmowy. To właściwy wybór do narracji, do agentów skryptowych o dużym natężeniu ruchu, dla zespołów z istniejącym pipeline'em rozpoznawania mowy oraz dla każdego, kto potrzebuje znaczników czasu na poziomie słów, które umożliwiają precyzyjną obsługę przerwań. Otrzymujesz darmowy plan, ponad 500 głosów, klonowanie, 44 języki i czołówkę obu rankingów jakości, a kontrolę nad każdym etapem zachowujesz dla siebie.

Wybierz GPT-Live-1, jeśli przerwanie jest produktem. Wszędzie tam, gdzie przerywanie jest normą, a nie przypadkiem brzegowym, i gdzie przekazanie tury w 0,8 sekundy bije 90-milisekundowy start odpowiedzi na zdanie, którego nikt nie zdążył dokończyć. Akceptujesz zamknięty, hostowany model rozliczany za minutę, z dwunastoma głosami i bez klonowania, i akceptujesz, że jego niezależny wynik jakości plasuje się w środku stawki.

Kusi, by odczytać 1 275 w zestawieniu z 70,3% i uznać sprawę za rozstrzygniętą. Nie jest tak, a różnica między tymi dwiema liczbami to cały argument: jedna mierzy, jak brzmi głos, druga – czy warto z nim rozmawiać.