
StepAudio 3 TTS kontra Qwen-Audio-3.0-TTS: Jeden z nich ma wynik Arena, i to nie jest ten nowy.
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Oto całe porównanie w jednej linii. Qwen-Audio-3.0-TTSznajduje się w Text-to-Speech Arena z wynikiem Elo 1 234 dla swojego poziomu Plus — wynik zdobyty w 2 502 anonimowych odsłuchach. StepAudio 3 TTS, wydany przez StepFun 15 września 2026 r., w ogóle nie występuje na tej liście. Jego poprzednik owszem: StepAudio 2.5 TTS ma Elo 1 209 na podstawie 1 306 głosów.
Zatem uczciwe pytanie nie brzmi: „co brzmi lepiej”. Chodzi o to, czy 25-punktowa różnica w Elo, zmierzona na poprzedniej generacji, przetrwa premierę, o której StepFun mówi, że poprawiła prozodię i obniżyła cenę o ponad połowę. Nikt jeszcze nie przeprowadził tego głosowania, a wszystko poniżej jest ułożone wokół tej luki w dowodach, zamiast udawać, że jej nie ma.
Tablica, tak jak faktycznie brzmi dzisiaj
Warto zobaczyć prawdziwe rankingi, ponieważ kilka krążących opracowań powołuje się na ich nieaktualną wersję. Arena odsłuchu w ciemno szereguje modele syntezy według tego, którą próbkę głosujący preferowali. Spójrz wzdłuż górnego wiersza tablicy głosów dostawców:
• Cartesia Sonic 3.6 — Elo 1 277, sierpień 2026, 49,0 USD za milion znaków
• Inworld Realtime TTS-2 — Elo 1 243, sierpień 2026, 20,8 USD za milion znaków
• SpeechifyAI Simba 3.2 — Elo 1 238, lipiec 2026, 6,6 USD za milion znaków
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1 234, lipiec 2026, 27,6 USD za milion znaków, 8 głosów w arenie
• VUI Labs Luna TTS — Elo 1,229, czerwiec 2026, 80,0 USD za milion znaków
• Inworld Realtime TTS-2 Flash — Elo 1,213, sierpień 2026, 10,4 USD za milion znaków
• StepFun StepAudio 2.5 TTS — Elo 1209, sierpień 2026, 85,0 USD za milion znaków, 8 głosów w arenie
• Google Gemini 3.1 Flash TTS — Elo 1204, kwiecień 2026, 18,3 USD za milion znaków

Z tej listy od razu wynikają dwie rzeczy. Po pierwsze, poziom Plus Qwen nie jest liderem — zajmuje czwarte miejsce, za Cartesia, Inworld i Speechify, a liczba 1,234, którą cytuje się jako koronę, to wynik ze środka tabeli w rankingu, który od tego czasu się zmienił. Po drugie, StepAudio 2.5 TTS został ponownie przetestowany w sierpniu 2026 r. i zajął siódme miejsce, 25 Elo za Qwenem, przy ponad trzykrotnie wyższej cenie.
I trzecia rzecz, która liczy się bardziej niż wszystko inne: spójrz na przedziały ufności. Poziom Plus Qwena jest podany jako −14/+14 na 2 502 próbkach. StepAudio 2.5 TTS jest podany jako −16/+16 na 1 306 próbkach. Te przedziały nakładają się. Luka 25 punktów między dwoma modelami, których marginesy błędu wynoszą 14 i 16 punktów w obie strony, nie jest udowodnioną różnicą jakości — to dwa modele, których arena obecnie nie potrafi rozróżnić, uszeregowane w kolejności, którą kilkaset dodatkowych głosów mogłoby odwrócić.

Ile kosztuje cię brakujący punkt danych
StepAudio 3 TTS to model, którym StepFun zastąpił StepAudio 2.5 TTS, a premiera zapowiada kontrolę nad barwą głosu, intonacją, rytmem i pauzami oddechowymi, a także zachowaniami paralingwistycznymi — śmiechem, wahaniem, jąkaniem się, powtórzeniami, autokorektą — realizowanymi przez architekturę strumieniową, w której generowanie i odtwarzanie nakładają się na siebie.
To dokładnie zbiór cech, które mierzy arena. To także dokładnie powód, dla którego brak wyniku jest frustrujący, a nie fatalny: benchmark, który odpowiedziałby na to pytanie, istnieje, jest publicznie prowadzony i po prostu nie został ponownie uruchomiony od czasu premiery nowego modelu. Każdy, kto mówi, że StepAudio 3 TTS brzmi lepiej niż Qwen-Audio-3.0-TTS, ekstrapoluje z poprzednika, który przegrał o margines mieszczący się w granicach jego własnych przedziałów błędu.
Cena to część, która jest w pełni udokumentowana, i mocno się zmieniła.
StepAudio 3 TTS rozlicza się stawką 2,5 juana za 10 000 znaków na własnej platformie StepFun. StepAudio 2.5 TTS rozliczano stawką 5,8. W samej kolumnie cenowej areny opartej na liczbie znaków starszy model kosztował 85,00 USD za milion znaków; 2,5 juana za 10 000 znaków przekłada się na około 35 USD za milion przy niedawnych kursach wymiany — to przeliczenie jest nasze, a nie publikowanym wskaźnikiem, i warto je powtórzyć dla własnego regionu i kursu walutowego. To obniżka o blisko 60% w tej samej pozycji.
To nadal więcej niż w przypadku Qwen. Qwen-Audio-3.0-TTS-Plus jest wyceniany na 27,6 USD za milion znaków, a poziom Flash jest jeszcze tańszy — Alibaba Cloud Model Studio rozlicza syntezę według znaków wejściowych, a nie według wytworzonego dźwięku; za dane wyjściowe nie pobiera się osobnej opłaty. Platformy zewnętrzne wymieniające poziom Flash podają stawki na poziomie górnych kilkunastu dolarów za milion, choć zróżnicowanie regionalne sprawia, że żadna pojedyncza liczba z nagłówka nie jest wiarygodna.
A więc kształt tego jest taki: StepFun w przybliżeniu o połowę obniżył koszt syntezy, nadrobił większość dystansu do Qwen i go nie przekroczył. Jeśli cena za znak jest twoim wiążącym ograniczeniem, argument się zawęża, ale odpowiedź się nie zmienia. Jeśli nie jest, cena przestała być powodem, by wybierać którykolwiek z tych modeli.
Zasób głosów i pokrycie językowe nie są nawet zbliżone.
To tutaj porównanie przestaje być kwestią uznaniową i staje się kwestią specyfikacji.
• Zasób głosów — Qwen-Audio-3.0-TTS: ponad 1000 głosów w ramach swoich poziomów, podczas gdy StepAudio 3 TTS nie ma porównywalnej opublikowanej liczby
• Języki — Qwen-Audio-3.0-TTS: 16 języków plus 20 chińskich dialektów, przy czym poziom Flash jest dostrojony pod języki o niskich zasobach i autentyczność dialektów, w porównaniu z StepAudio 3 TTS, który stawia na chiński, bez deklaracji równoważnego pokrycia
• Rozmiar żądania — Qwen-Audio-3.0-TTS: 20 000 znaków na żądanie, a StepAudio 3 TTS: nie opublikowano
• Opóźnienie — Qwen-Audio-3.0-TTS Flash celuje w opóźnienie pierwszego pakietu w granicach 200 ms według własnej dokumentacji Alibaby, w porównaniu ze streamingiem StepAudio 3 TTS, dla którego nie opublikowano wartości
• Tiering — Qwen-Audio-3.0-TTS Plus dla ekspresyjności i Flash dla czasu rzeczywistego, sześć flagowych głosów przypisanych na stałe do jednego lub drugiego poziomu vs StepAudio 3 TTS z pojedynczym poziomem
• Panel sterowania — wskazówki Qwen-Audio-3.0-TTS dotyczące sposobu wypowiedzi w języku naturalnym oraz osadzone w tekście wejściowym znaczniki ekspresji, takie jak [excited], [laughing], [whispers], w porównaniu z prozodią wnioskowaną z kontekstu przez model StepAudio 3 TTS
• Klonowanie głosu — StepAudio 3 TTS: stała opłata 9,9 juana za sklonowany głos na wszystkich poziomach TTS w porównaniu z klonowaniem Qwen-Audio-3.0-TTS przez Alibaba Cloud Model Studio
• Wyjście — Qwen-Audio-3.0-TTS domyślna częstotliwość próbkowania 24 kHz vs StepAudio 3 TTS nieopublikowana
Ten wiersz panelu sterowania to prawdziwa różnica projektowa i nie chodzi tu o jakość. Tagi ekspresji Qwena są jawne i synchroniczne: wpisujesz emocję w tekst, a model ją renderuje, co czyni je testowalnymi i przyjaznymi dla testów regresyjnych. Opis StepFun dotyczy modelu, który wnioskuje właściwe zawahanie lub śmiech z kontekstu, co brzmi lepiej, gdy jest trafny, ale znacznie trudniej go jednoznacznie określić, gdy jest błędny. Wybierz zależnie od tego, czy wolisz samodzielnie tworzyć wykonanie, czy je delegować.

Jak podjąć decyzję bez pomiaru
Nie da się dojść do odpowiedzi na podstawie opublikowanych liczb, ponieważ decydująca liczba nie istnieje. Pozostaje testowanie, a testowanie tych dwóch ma określony kształt, który warto uwzględnić przy planowaniu.
Oba są komercyjnymi API dostępnymi wyłącznie jako usługa hostowana — Qwen-Audio-3.0-TTS za pośrednictwem Alibaba Cloud Model Studio, StepAudio 3 TTS za pośrednictwem otwartej platformy StepFun. Żaden z nich nie jest modelem o otwartych wagach, więc nie ma możliwości samodzielnego hostowania, aby je ocenić. Aby zachować precyzję co do tego, co OrcaRouter tu obejmuje: modele zamiany tekstu na mowę w naszym katalogu na dziś to rodzina OpenAI tts-1, gpt-4o-mini-tts oraz podglądowe wersje Gemini TTS od Google. Żaden z modeli z tego artykułu się w nim nie znajduje, podobnie jak Qwen-Audio-3.0-TTS — niczego tutaj nie należy odczytywać jako twierdzenia, że je udostępniamy.
Częścią, która rzeczywiście działa na OrcaRouter, jest tekstowa połowa potoku. Skrypty, które odczytuje twoja warstwa syntezy, są generowane przez model językowy, a to właśnie ten komponent zmienia się najczęściej, kosztuje najwięcej przy ponownym zawieraniu umowy i najłatwiej pozostawić go bez przypięcia — prawie 200 modeli tekstowych za jednym API, automatyczne przełączanie awaryjne, DSL routingu, który łączy kilka z nich w jedno wywołanie, oraz fuzja modeli, gdy osąd jednego modelu nie wystarcza, z ceną katalogową dostawcy przekazywaną bez marży. Jeśli przeprowadzasz ślepą ocenę między tymi dwoma modelami syntezy, wygeneruj korpus przez jeden punkt końcowy, aby obaj kandydaci czytali identyczne dane wejściowe, i utrzymuj warstwę syntezy za interfejsem, który możesz podmienić.
Co to oznacza dla decyzji
Wybierz dziś Qwen-Audio-3.0-TTS, jeśli potrzebujesz szerokiego zakresu — ponad tysiąc głosów, 16 języków i 20 dialektów, udokumentowany limit żądania wynoszący 20 000 znaków, poziom opóźnienia i poziom ekspresyjności, docelowy czas pierwszego pakietu 200 ms oraz stawka niższa niż w StepFun. To model, za którym stoi pomiar i który oferuje szerszą powierzchnię możliwości, a jego czwarte miejsce w Elo to realny wynik, nawet jeśli nie jest koroną, za jaką bywa podawany.
Wybierz StepAudio 3 TTS, jeśli budujesz z myślą o chińskim jako pierwszym języku, chcesz jeden poziom zamiast decyzji o wyborze poziomu, chcesz klonowanie za stałą, publicznie podaną opłatę i jesteś gotów na wczesne wdrożenie modelu, który nie został poddany ślepym testom. Płacisz około 27% więcej za znak niż w przypadku poziomu Plus Qwena, w zamian za deklarowaną poprawę prozodii o generację względem modelu, który plasował się 25 Elo niżej, przy nakładających się przedziałach błędów.
Co by to rozstrzygnęło, to jedno ponowne uruchomienie areny z StepAudio 3 TTS w puli. Dopóki to głosowanie się nie odbędzie, to model poddany pomiarom zestawiony z modelem, którego nie poddano pomiarom, a 25 punktów, które dzielą ich poprzedników, mieści się w szumie — co nie jest rankingiem i nie powinno być sprzedawane jako ranking.
