
GPT-Live-1 vs Inworld Realtime TTS-2: Wojna cenowa o głosy, premia za słuchanie
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Inworld Realtime TTS-2 osiągnął ogólną dostępność z czymś, czego rynkowi głosowemu brakowało: opublikowanym cennikiem. Model flagowy kosztuje 25 USD za milion znaków w trybie na żądanie, jego szybszy brat Inworld Realtime TTS-2 Flash kosztuje 15 USD, a oba w progach wolumenowych schodzą do 12,50 USD i 7 USD. Zajmując Elo 1,244 i drugie miejsce w arenie mowy Artificial Analysis, sprawia to, że model flagowy jest mniej więcej o połowę tańszy od obecnego lidera areny i stanowi jeden z najtańszych sposobów na kupienie głosu z pierwszej piątki. GPT-Live-1 to drugi model w tym porównaniu i odwrotna propozycja — 0,05 USD za minutę głosu, bez udziału znaków i bez możliwości kupienia go bez jednoczesnego kupienia słuchania, zarządzania turami i obsługi przerwań, które są dołączone.
Najciekawsze w ich porównaniu jest to, że różnica cen wydaje się ogromna, a potem w dużej mierze znika. W syntezie trwa wojna cenowa. W konwersacji nie.
Co Inworld faktycznie wypuścił
Linia TTS-2 rozpoczęła się jako podgląd badawczy w maju 2026 r. od konkretnego twierdzenia: że jest to model, który nie generuje mowy w izolacji. Przyjmuje wcześniejsze tury rozmowy jako wejście audio, rozumuje o tonie i tempie oraz dostosowuje sposób, w jaki odpowiada. To pozycjonowanie — świadomość konwersacyjna, a nie czystsze audio — odróżniało go od silników narracyjnych, które dominowały w syntezie mowy przez cały 2025 rok.
Ogólna dostępność przekształciła wersję zapoznawczą w rodzinę i dodała cennik. Flash to opcja nastawiona na przepustowość: Inworld podaje około 20 milisekund czasu do pierwszego bajtu po stronie serwera w 90. percentylu wobec 100 milisekund dla modelu flagowego i medianę poniżej 200 milisekund do pierwszego dźwięku. To dane dostawcy z własnej dokumentacji Inworld; jedyny będący w obiegu pomiar strony trzeciej, pochodzący od Coval, wskazuje dla Flasha około 25 milisekund, a dla modelu flagowego wartości w niskich setkach. Żaden z nich nie został niezależnie zaudytowany od początku do końca.
Najbardziej warta uwagi funkcja nie ma nic wspólnego z opóźnieniem. Inworld dodał tryb dosłowny, dzięki któremu numery zamówień, kody potwierdzenia, adresy i numery seryjne są odczytywane znak po znaku, zamiast być normalizowane do czegoś, co brzmi naturalnie, ale jest błędne. Dla agenta głosowego, który właśnie przyjął rezerwację, ten jeden znacznik to różnica między działającym produktem a demem, które zostaje przekazane człowiekowi.

Dimension by dimension
• Rodzaj — GPT-Live-1: pełny duplex mowa-na-mowę w jednym modelu vs Inworld Realtime TTS-2: model zamiany tekstu na mowę, z duplexem dostępnym osobno przez Inworld Realtime API
Cena jednostkowa — GPT-Live-1: 0,05 USD za minutę głosu, rozliczane za sekundę, backend rozumowania rozliczany osobno vs Inworld Realtime TTS-2: 25 USD za milion znaków w trybie na żądanie, 20 USD w planie Creator i 12,50 USD w najwyższym planie, a Flash za 15, 10 i 7 USD
• Niezależna jakość — GPT-Live-1: 70,3% w Speech to Speech Index, ex aequo szóste miejsce na czternaście w porównaniu z Inworld Realtime TTS-2: Elo 1 244 na podstawie 1 091 próbek i drugie miejsce w Artificial Analysis Provider Voice arena, a Flash z Elo 1 211 na podstawie 1 626 próbek i szósty
• Przerwanie — GPT-Live-1: natywne, ustalane wewnątrz modelu wiele razy na sekundę vs Inworld Realtime TTS-2: nie jest właściwością modelu TTS; API Inworld Realtime obsługuje barge-in z opóźnieniem przerwania wynoszącym około 100 milisekund, przez pojedynczy socket komunikujący się za pomocą protokołu OpenAI Realtime
• Opóźnienie — GPT-Live-1: 0,798 sekundy opóźnienia przejmowania tury w testach przeprowadzonych przez OpenAI, brak opublikowanego czasu do pierwszego dźwięku vs Inworld Realtime TTS-2: 100 milisekund po stronie serwera w 90. percentylu, Flash przy 20, z medianą poniżej jednej sekundy do pierwszego fragmentu audio w całym potoku Realtime API
• Języki — GPT-Live-1: główne języki dobrze obsługiwane, poza nimi nierównomiernie vs Inworld Realtime TTS-2: ponad 200 lokalizacji, w tym 15 na poziomie jakości Tier 1 i 79 kolejnych na poziomie Tier 2 oraz jedna tożsamość głosu zachowana we wszystkich z nich
Głosy i klonowanie — GPT-Live-1: dwanaście presetów, brak klonowania vs Inworld Realtime TTS-2: 282 wbudowane głosy, natychmiastowe klonowanie zero-shot z 5–15 sekund autoryzowanego audio, profesjonalne klonowanie i pełne sterowanie emisją wyłącznie w modelu flagowym
• Wdrożenie — GPT-Live-1: tylko w modelu hostowanym, jeden punkt końcowy, brak darmowego planu, współbieżność ograniczona do 25–500 sesji vs Inworld Realtime TTS-2: hostowane API oraz dostępny warunkowo kontener on-premises wymagający H100, a także darmowy plan na żądanie obejmujący do około 70 minut syntezy

Kwestia duplexu, odpowiedziana precyzyjnie
Łatwo byłoby napisać to porównanie jako „jedno słucha, drugie tylko mówi”, ale byłoby ono błędne w sposób, który ma znaczenie. Modele zamiany tekstu na mowę Inworld działają w trybie tekst na wejściu, dźwięk na wyjściu. Inworld sprzedaje jednak również Realtime API, które działa przez jedno połączenie WebSocket, WebRTC lub SIP i jest pełnodupleksowe w rozumieniu istotnym dla twórcy: obsługuje semantyczne wykrywanie aktywności głosowej z regulowanym parametrem eagerness, obsługuje ręczne sterowanie turami i przerywa przy wtrąceniu się w około 100 milisekund. Jest zgodne protokolarnie z interfejsem OpenAI Realtime, co sprawia, że migracja staje się zadaniem konfiguracyjnym, a nie przepisaniem.
To, czym Inworld's Realtime API nie jest, to natywny model speech-to-speech. To kaskada — wymienny model rozpoznawania mowy, wybrany przez Ciebie model językowy i syntezator — orkiestrowana w ramach jednego połączenia. To uzasadniony wybór architektoniczny i taki sam, jakiego dokonuje większość produkcyjnych agentów głosowych. Jest po prostu inny niż GPT-Live-1, gdzie pojedynczy model decyduje, kiedy oddać turę.
Praktyczna różnica uwidacznia się, gdy dzwoniący przerywa w połowie zdania. W kaskadzie przerwanie zostaje wykryte, generowanie zostaje anulowane i rozpoczyna się nowa tura — sekwencja, która działa dobrze i kosztuje cię rundę komunikacji. W modelu end-to-end decyzja była już podejmowana w sposób ciągły. Ten pierwszy to system, który szybko reaguje. Ten drugi to system, który nigdy nie przestał słuchać.

Przeliczam to, bo jednostki ukrywają odpowiedź
Mowa płynie w tempie około 150 słów na minutę, a angielski ma średnio około pięciu i pół znaków na słowo, więc minuta wypowiedzi mówionej to około 800 do 900 znaków. Przy cenie 25 USD za milion, Inworld Realtime TTS-2 wytwarza minutę mowy za około dwa centy. W przypadku Flasha przy 15 USD to niecałe półtora centa.
W zestawieniu z 0,05 USD za minutę głosu w GPT-Live-1 wygląda to na jednostronne zwycięstwo — dopóki nie wycenisz całej reszty tego, co robi GPT-Live-1. Realtime API firmy Inworld nadal potrzebuje rozpoznawania mowy i modelu językowego — oba rozliczane osobno i oba wnoszące własne opóźnienie. Dolicz to, a koszt kaskady za minutę przekroczy pięć centów w przypadku każdej rozmowy, w której pojawia się prawdziwe pytanie. Dopłata w modelu end-to-end nie dotyczy głosu. Dotyczy naprzemienności mówienia i wynosi w przybliżeniu tyle, ile kosztował etap rozpoznawania mowy, którego już nie kupujesz.
Tam, gdzie kaskada wygrywa zdecydowanie, jest wolumen bez rozmowy. Połączenia powiadamiające, potwierdzenia dostawy, przypomnienia o wizytach, skryptowe IVR — wszystko, gdzie tekst jest znany przed rozpoczęciem połączenia i nikt nie zamierza przerywać. Tam rozliczanie za znaki od 7 do 15 dolarów za milion jest po prostu tańsze niż dwukierunkowe połączenie rozliczane za minutę, a płacenie za naprzemienność mówienia, której nigdy nie wykorzystujesz, to marnotrawstwo.
Istnieje też ścieżka pośrednia, którą podział na dwa modele skrywa. Jeśli i tak składasz kaskadę, warstwa mowy nie musi pochodzić od dedykowanego dostawcy głosu: własne modele TTS OpenAI oraz podglądowe modele TTS Gemini od Google to zwykłe punkty końcowe API i są routowane. Około 190 modeli od jedenastu dostawców upstream stoi za jednym kluczem OrcaRouter w cenie katalogowej dostawcy, bez marży — dzięki temu model syntezy może trafić do tego samego katalogu, na ten sam klucz i ten sam rachunek, co model rozumowania, który zasila, z automatycznym przełączaniem awaryjnym, gdy któryś punkt końcowy ulegnie degradacji w trakcie wdrożenia. To najmniej efektowny etap stosu głosowego i najłatwiejszy do skonsolidowania. Ani Realtime TTS-2 od Inworld, ani punkt końcowy Live Sessions w GPT-Live-1 nie są dostępne w ten sposób; te dwa należą do swoich dostawców.
Który wybrać
Wybierz Inworld Realtime TTS-2, jeśli liczy się wolumen, a rozmowa przebiega według scenariusza. Agenci o wysokiej przepustowości, powiadomienia, produkty wielojęzyczne, w których znaczenie ma 200 lokalizacji i jedna zachowana tożsamość głosu, albo dowolne wdrożenie wymagające kontenera on-premises. Otrzymujesz głos z czołowej dwójki areny za około połowę ceny lidera, darmowy plan do prototypowania, klonowanie, którego GPT-Live-1 w ogóle nie oferuje, oraz Realtime API, które sprawnie obsługuje przerwania w wzorcu kaskadowym, który prawdopodobnie już stosujesz.
Wybierz GPT-Live-1, jeśli przerwanie jest produktem. Połączenia, które wychodzą poza scenariusz, dzwoniący, którzy wchodzą agentowi w słowo, przepływy pracy, w których naprzemienność mówienia decyduje o tym, czy mamy rozmowę, czy menu. Płacisz stawkę za minutę, która nie spada, gdy mowa tanieje, rezygnujesz z klonowania i 200 języków, a w zamian odzyskujesz płynne przejścia.
Wojna cenowa w syntezie jest prawdziwa i to dobra wiadomość dla każdego, kto buduje agenta głosowego — jeden z pięciu najlepszych głosów kosztuje teraz jedną piątą tego, co osiemnaście miesięcy temu. To po prostu nie rozstrzyga tego porównania, ponieważ to, za co GPT-Live-1 pobiera opłaty, nie jest tym, co przecenia Inworld.
