Wygenerowana karta hero dla „Gemini 3.8 TTS vs Inworld Realtime TTS-2” na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa karta „Gemini 3.8 Flash TTS” podaje Elo 1260 na miejscu 2, 8 głosów areny, deklarowane 130 języków oraz 16,50 USD za 1 mln znaków po normalizacji; prawa karta „Inworld Realtime TTS-2” podaje Elo 1245 na miejscu 4, 8 głosów areny, tylko angielski, 20,80 USD za 1 mln znaków po normalizacji oraz pierwsze miejsce w Controlled Voice Arena. Wiersz stopki brzmi: „Elo według Artificial Analysis Provider Voice Arena, wrzesień 2026; ceny według Google i Inworld.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 TTS kontra Inworld Realtime TTS-2: To, w którą tablicę wyników wierzysz, zmienia odpowiedź

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Umieść Gemini 3.8 Flash TTS i Inworld Realtime TTS-2 obok siebie na Artificial Analysis Provider Voice Arena, a odpowiedź wydaje się oczywista: pozycja 2 kontra pozycja 4, Elo 1 260 kontra 1 245, po 8 głosów w arenie każdy oraz znormalizowana cena 16,50 USD za milion znaków wobec 20,80 USD. Dostawca wygrywa pod względem pozycji i ceny, a 15-punktowa różnica i tak mieści się w przedziałach ufności obu wierszy.

Przejdź do drugiej tablicy publikowanej przez Artificial Analysis, a kolejność się odwraca. Inworld Realtime TTS-2 zajmuje górny wiersz na Controlled Voice Arena z Elo 1,123, a jego wariant Flash ma 1,075. To nie jest różnica wynikająca z zaokrąglenia — wygrywa inny model, a powodem jest to, że obie tablice nie mierzą tego samego. Jeśli wybierasz głos do produktu, wiedza o tym, które z tych dwóch pytań faktycznie zadaje twój przypadek użycia, jest całą decyzją.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

Dwie tablice, dwa różne pytania

Provider Voice Arena ocenia własne natywne głosy modelu — te, które dostawca udostępnia i hostuje. Controlled Voice Arena utrzymuje ten sam głos i ocenia, jak dobrze każdy model radzi sobie, gdy zostanie poproszony o mówienie głosem, który nie jest jego własnym. Ci sami sędziowie, ten sam rodzaj ślepego porównania, inna zmienna.

To rozróżnienie przekłada się na dwa różne zadania:

• Ranking dostawców odpowiada na pytanie „czy ten model brzmi dobrze od razu po wyjęciu z pudełka”. To właściwa tablica dla produktu, który jest dostarczany z ustalonym zestawem głosów narratora i nigdy niczego nie klonuje.

• Ranking kontrolowany odpowiada na pytanie „czy ten model stosuje się do specyfikacji głosu”. To właściwa tablica dla produktu, w którym głos należy do klienta — sklonowany głos marki, licencjonowany aktor, tożsamość dla poszczególnych dzierżawców.

Modele Google prowadzą w pierwszym. Modele Inworld prowadzą w drugim. Oba stwierdzenia są prawdziwe jednocześnie i żadne nie jest sprzecznością, co jest dokładnie powodem, dla którego pojedyncza odpowiedź na pytanie „który model TTS jest najlepszy” jest zwykle oznaką, że autor wybrał jedną tablicę i nie spojrzał na drugą.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

Co pozycja numer jeden Inworld oznacza w praktyce

Wynik zajmujący pierwsze miejsce w kategorii Controlled to twierdzenie o wierności instrukcji, a wierność instrukcji to właściwość, która rozstrzyga, czy klonowanie jest w ogóle użyteczne.

Ścieżka klonowania Inworld występuje w dwóch formach. Klonowanie natychmiastowe działa na podstawie krótkiej próbki — według danych dostawcy od 5 do 15 sekund audio referencyjnego — a profesjonalny poziom klonowania jest w fazie beta i wymaga rzędu dziesięciu minut. Oba te parametry pochodzą od dostawcy i żaden z nich nie został niezależnie zweryfikowany przez arenę; to, co mierzy arena, to zachowanie modelu, gdy już ma głos, a nie jakość etapu klonowania, który go wytworzył.

Twierdzenia dotyczące opóźnień przypisane tej rodzinie należą do tej samej kategorii. Wartość czasu do pierwszego bajtu w wariancie Flash — 25 milisekund, podana na podstawie pomiaru strony trzeciej — oraz wartości p99 dla pełnego modelu pochodzą od samego Inworld, a arena nie ma nic do powiedzenia na temat żadnej z nich. Są wiarygodne jak na model zorientowany na czas rzeczywisty i są niezweryfikowane, co jest właściwym sposobem ich traktowania.

A więc praktyczny wniosek jest taki: jeśli Twój produkt klonuje głosy, wynik Controlled od Inworld jest bardziej istotnym z tych dwóch wyników i to on sprawia, że niższa pozycja w rankingu Provider nie jest dyskwalifikująca. Jeśli Twój produkt nie klonuje głosów, ta przewaga jest dla Ciebie niewidoczna, a to tablica Provider jest tą, którą należy odczytywać.

Drabina cenowa ma trzy szczeble, a najtańszy z nich jest subskrypcją.

Porównywanie jednej ceny z jedną ceną wypacza to zestawienie, ponieważ Inworld nie ma ceny — ma drabinkę.

• Na żądanie — Realtime TTS-2 w cenie 25,00 USD za milion znaków, Flash w cenie 15,00 USD. To stawka, jaką widzi użytkownik rozliczany za faktyczne użycie, i jest to własna, publikowana stawka dostawcy.

• Creator plan — 20,00 USD i 10,00 USD za te same dwa modele, co daje 20% i 33% zniżki za zobowiązanie się do planu zamiast rozliczania za zużycie. Dane zgłoszone przez dostawcę; to poziom, który najbardziej warto ponownie sprawdzić na aktualnej stronie cennika, zanim się zobowiążesz, ponieważ warunki planów zmieniają się szybciej niż stawki cennikowe.

• Znormalizowane — przeliczenie areny na milion znaków daje $20.80 dla Realtime TTS-2 i $10.40 dla Flash, co jest arytmetyką tablicy, a nie wyceną któregokolwiek z dostawców.

Dla porównania, stawki Google są oparte na tokenach i mają charakter promocyjny: 0,50 USD za milion tokenów tekstowych na wejściu i 9,00 USD za milion tokenów audio na wyjściu do 31 grudnia 2026 r., a następnie 18,00 USD; Flash-Lite TTS to 0,50 USD i 6,00 USD, a następnie 12,00 USD. Po normalizacji są to 16,50 USD i 11,00 USD.

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

Przeczytaj oba razem, a obraz jest ciekawszy niż „Google jest tańszy". Według liczb publikowanych dzisiaj Flash TTS jest najtańszy z trzech modeli, a wariant Flash od Inworld jest drugim najtańszym — oba modele Flash są tak blisko siebie, że niewielka zmiana proporcji dźwięku do tekstu może odwrócić to, który z nich rozlicza się taniej. 1 stycznia 2027 r., gdy stawka Google się podwoi, kolejność się ustali i Inworld stanie się tańszą opcją na każdym szczeblu swojej drabiny. Kto porównuje te dwa we wrześniu i decyduje się w grudniu, ten porównuje niewłaściwe liczby.

Gdzie każde z nich jest lepszą odpowiedzią

Te dwa modele są na tyle zbliżone pod względem jakości, że czynniki je różniące mają charakter strukturalny, więc uczciwa wersja to lista warunków, a nie werdykt.

Wybierz Gemini 3.8 Flash TTS, gdy to Ty decydujesz o głosie. Projektowanie głosu na podstawie opisu tekstowego, dialog dwuosobowy w jednym wywołaniu, stylizacja na poziomie tur oraz najszerszy zakres językowy spośród tych dwóch według własnych danych Google — czego Inworld nie dorównuje w tym porównaniu. Jest również tańszym modelem obecnie, a jego siostrzany model Flash-Lite daje drugą opcję cenową w ramach tego samego API.

Wybierz Inworld Realtime TTS-2, gdy głos należy do klienta. Czołowy wiersz Controlled Voice, ścieżka natychmiastowego klonowania mierzona w sekundach audio referencyjnego, profesjonalny poziom klonowania dla przypadków, które wymagają więcej, oraz orientacja na czas rzeczywisty poparta publikowanymi przez dostawcę deklaracjami dotyczącymi pierwszego bajtu — z zastrzeżeniem, że są to deklaracje dostawcy. Zgodnie z własną dokumentacją dostawcy obsługuje wyłącznie język angielski, co jest twardym ograniczeniem, jeśli potrzebujesz czegokolwiek innego.

Żaden z tych modeli nie jest hostowany przez OrcaRouter i warto to powiedzieć wprost, zamiast sugerować coś przeciwnego: miejscem, w którym można wywołać Gemini 3.8 Flash TTS, jest własne API Google oraz powierzchnie, które Google wskazał 23 września, a miejscem, w którym można wywołać Inworld Realtime TTS-2, jest własna platforma Inworld. OrcaRouter służy do wszystkiego wokół tego wyboru — ponad 200 modeliza jednym kluczem po cenach katalogowych dostawcy, bez marży, dzięki czemu zmiana stawek dostawcy, taka jak ta ze stycznia, jest po naszej stronie widoczna tego samego dnia, automatyczne przełączanie awaryjne, dzięki czemu oceniany model nie musi być zależnością produkcyjną, oraz DSL routingu do łączenia modeli w jedno wywołanie, gdy żaden pojedynczy głos nie udźwignie całego zadania.

Powód, dla którego warto utrzymywać oba te elementy w grze, jest taki, że styczniowa zmiana stawki i rozróżnienie między Controlled a Provider to dwa odrębne powody, dla których odpowiedź może się zmienić. Potok, który potrafi wywołać tylko jeden z nich, nie może podążyć za żadnym.