Główna karta tytułowa dla „GPT-Live-1 vs Qwen-Audio-3.0-TTS”, z podtytułem „Jeden prowadzi rozmowę, drugi odczytuje skrypt”, z plakietką o treści „To nie zamienniki — inne zadania, inne rachunki” oraz trzema kartami: „Qwen-Audio-3.0-TTS Plus — Elo 1232, czwarte miejsce w AA Provider Voice Arena, 27,6 USD za 1 mln znaków”, „GPT-Live-1 — 0,05 USD za minutę głosu, pełny dupleks, 3,00 USD za godzinę otwartego połączenia” i „Haczyk — około 16 znaków na sekundę po stronie narratora, tekst na wejściu, dźwięk na wyjściu”, nad paskiem stopki o treści „Dane Qwen według Artificial Analysis; dane GPT-Live-1 według OpenAI.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: Rozmowa i narrator to nie ta sama pozycja

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Postaw GPT-Live-1 i Qwen-Audio-3.0-TTS obok siebie pod względem ceny za godzinę audio, a różnica wydaje się rozstrzygająca: Qwen-Audio-3.0-TTS-Plus od Alibaby generuje mowę po 27,6 USD za milion znaków, czyli około 1,66 USD za godzinę audio, podczas gdy GPT-Live-1 od OpenAI nalicza 3,00 USD za godzinę ciągłego otwartego połączenia. Narrator jest tańszy, więc narrator wygrywa — tyle że to błędne porównanie, a powód, dla którego jest błędne, to najużyteczniejsza rzecz, jaką można wynieść z tego starcia. Qwen-Audio-3.0-TTS to model zamiany tekstu na mowę. GPT-Live-1 to pełnodupleksowy model konwersacyjny. Jeden z nich czyta to, co napisałeś. Drugi musi kilka razy na sekundę zdecydować, czy skończyłeś mówić.

Jeden renderuje, drugi rozmawia

Synteza mowy przyjmuje tekst i zwraca dźwięk. Nie ma wejścia audio, nie ma tury do wykonania, nie ma pojęcia bycia przerwanym ani transkryptu do zwrócenia, ponieważ model niczego nie słyszał. Jej model kosztów to prasa drukarska: strony na wejściu, dźwięk na wyjściu, jakość i przepustowość to jedyne dwie liczby, które się liczą, a obie można zmierzyć przed wdrożeniem.

Model konwersacyjny działający w trybie pełnego dupleksu przetwarza przychodzące audio, jednocześnie generując audio wychodzące. Do jego zadań należą te części rozmowy, które nie mają nic wspólnego ze słowami — pauzowanie, gdy użytkownik robi pauzę, mówienie dalej w odpowiedzi na przytaknięcie w rodzaju „yeah” zamiast traktowania go jako przerwania, oddawanie głosu w połowie zdania i wywoływanie narzędzia bez gubienia wątku. GPT-Live-1 robi to wszystko i wraz z sesją zwraca transkrypcje rozpoznawania mowy, co jest możliwe tylko dlatego, że słuchał przez cały czas.

Jeśli Twój produkt czyta artykuły na głos, konwertuje dokumentację na audio lub podkłada narrację do wideo, GPT-Live-1 jest niewłaściwym narzędziem przy czterokrotnie wyższej cenie za godzinę. Jeśli Twój produkt odbiera połączenie telefoniczne, Qwen-Audio-3.0-TTS to jedna trzecia pipeline'u, który wciąż potrzebuje modelu ASR i modelu językowego, aby stać się rozmową.

Tam, gdzie Qwen-Audio-3.0-TTS jest naprawdę najlepszą odpowiedzią

To, co przemawia za modelem firmy Alibaba, to nie marketing. Wydany 20 lipca 2026 r. przez Tongyi Lab firmy Alibaba i udostępniony jako hostowane, zamknięte API za pośrednictwem Alibaba Cloud Model Studio, wariant Plus zajął pierwsze miejsce na arenie text-to-speech Artificial Analysis, gdy się pojawił. Ranking jest jednak ruchomym celem i ten się przesunął: według stanu na wrzesień 2026 r. Qwen-Audio-3.0-TTS-Plus zajmuje czwarte miejsce w Provider Voice Arena z wynikiem Elo 1 232 na 2 306 próbek, za Cartesia Sonic 3.6 z 1 275, Inworld Realtime TTS-2 z 1 244 i Simba 3.2 od Speechify z 1 233 — trzy modele z sierpnia i lipca, które wydano po nim. Czwarte miejsce na ponad dwadzieścia, po utracie prowadzenia i z nienaruszoną przewagą cenową, to wciąż silna pozycja. To po prostu nie ta pozycja, którą opisywały materiały z premiery.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

Przoduje w 10 z 16 obsługiwanych języków, dodaje 20 regionów dialektalnych chińskiego, obsługuje klonowanie głosu na podstawie krótkich próbek, w tym klonowanie międzyjęzykowe, oraz zawiera 86 osadzonych znaczników emocji i sposobu wypowiedzi.

Zastrzeżenia są wystarczająco konkretne, by uwzględnić je w planach.

• Przepustowość — Plus generuje około 16 znaków na sekundę, w porównaniu z 30,2 dla Simba 3.2, 27 dla Gemini 3.1 Flash TTS i około 120 dla Sonic 3.5. Przy renderowaniu wsadowym jest to niewidoczne; w produkcie działającym na żywo to liczba, która decyduje o wielkości bufora.

• Dokumentacja cenowa — powszechnie cytowana stawka 27,6 USD za milion znaków nie zgadza się ze stroną cennika samej firmy Alibaba w każdej migawce, która w niektórych momentach podawała niższe kwoty dla obu poziomów. Sprawdź aktualną liczbę na poziomie konta, zanim zaczniesz prognozować, a nie liczbę z rankingu.

• Biblioteka głosów — mimo 16 obsługiwanych języków publiczne głosy presetowe są niemal wyłącznie chińskie i angielskie. Pozostałe czternaście języków jest dostępnych poprzez proces klonowania, a nie od ręki.

• Ograniczanie funkcji — 86 wbudowanych znaczników emocji działa wyłącznie w trybie strumieniowania jednokierunkowego, więc kontrola ekspresyjna nie przetrwa każdej ścieżki integracji.

• Poziomy — Flash celuje w około 300 ms opóźnienia pierwszego pakietu na potrzeby zastosowań czasu rzeczywistego; Plus to poziom jakościowy. To różne produkty o tej samej nazwie, a wybór niewłaściwego to częsty pierwszy błąd.

Szczera wersja ustawy kaskadowej

Oto, co pomija porównanie w przeliczeniu na godzinę. Produkt konwersacyjny oparty na modelu TTS to kaskada: model ASR zamienia mowę dzwoniącego na tekst, model językowy decyduje, co powiedzieć, a model TTS wypowiada to na głos. Trzej dostawcy, trzy rachunki, trzy budżety opóźnień, które się sumują, i przekazanie na każdej granicy, na której umiera prozodia. Etap TTS może kosztować 1,66 USD za godzinę audio. Pozostałe dwa etapy to miejsce, w którym naprawdę tkwią pieniądze i błędy — a model kaskadowy nie jest w stanie usłyszeć pauzy w środku zdania, które już wypowiada.

GPT-Live-1 sprowadza trzy filary do jednej sesji i jednego licznika, w cenie 0,05 USD za minutę głosu, przy czym backend rozumowania jest rozliczany osobno. Dwa szczegóły sprawiają, że ten rachunek jest uczciwy. Inicjalizacja sesji nalicza z góry 15 sekund głosu, zaliczane na poczet późniejszego czasu trwania, a nie dodawane do niego. A backend to drugi licznik: każde delegowane wywołanie rozumowania, wywołanie narzędzia i wyszukiwanie w sieci są rozliczane według zwykłych stawek tego modelu, więc skierowanie delegacji do czołowego modelu rozumującego, który wyszukuje przy każdej turze, generuje drogie wywołanie za tanią warstwą głosową.

To, co niezależne gremia mówią o tych dwóch, jest pouczające właśnie dlatego, że mierzą różne rzeczy i żadne nie schlebia swojemu obiektowi. Qwen-Audio-3.0-TTS-Plus jest czwarty pod względem jakości i blisko dna pod względem przepustowości. GPT-Live-1 jest siódmy na jedenaście w Speech to Speech Index firmy Artificial Analysis z wynikiem 69,8% — za GPT-Realtime-2.1, który zastępuje, z wynikiem 73,9% — a jednocześnie jest wyceniany na najniższym końcu zakresu kosztu za godzinę dźwięku wejściowego w tym indeksie: 4,42 USD w porównaniu z 10,75 USD w przypadku GPT-Realtime-2.1. Żaden z modeli nie zdobywa pierwszego miejsca w swojej kategorii. Oba są tańsze niż to, co miały pobić.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Ten drugi licznik to miejsce, w którym warstwa routingu staje się decyzją projektową, a nie optymalizacją. OrcaRouter nie obsługuje ani GPT-Live-1, ani Qwen-Audio-3.0-TTS — warstwa głosowa w obu przypadkach jest poza naszym zasięgiem i nie routujemy z niej niczego. Ale z częścią rozumującą jest inaczej. Około 190 modeli od jedenastu dostawców upstream stoi za jednym kluczem, w cenie katalogowej dostawcy, bez żadnej marży, a obniżka cen u dostawcy wchodzi tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku kaskady pokrywa to środkową część w całości: trzymaj dwie opcje ASR i trzy modele rozumujące za jednym punktem końcowym, testuj je przeciwko sobie metodą A/B na prawdziwym ruchu, a automatyczne przełączanie awaryjne pozwoli przetrwać zły dzień u dostawcy bez zrywania połączenia.

Klonowanie głosu to funkcja Qwen-Audio-3.0-TTS o największej użyteczności komercyjnej i zarazem jego największy obszar zgodności. Dziesięć sekund audio referencyjnego wystarczy, aby międzyjęzykowo odtworzyć mówcę, co jest przełomowe dla lokalizacji i stanowi obciążenie wszędzie tam, gdzie liczy się tożsamość. Ope​nAI wypuściło GPT-Live-1 bez klonowania i zupełnie bez głosów niestandardowych — do wyboru jest 12 głosów API i to cała lista.

Tę asymetrię łatwo pominąć w porównaniu funkcji, a trudno pominąć w przeglądzie ryzyka. Produkt, który odzywa się wyłącznie jednym z dwunastu głosów dostawcy, ma znacznie krótszą odpowiedź na pytanie „czyj to głos i kto na niego wyraził zgodę” niż produkt, który potrafi odtworzyć dowolny głos z próbki. Jeśli potrzebujesz klonowania, decyzja o potoku przetwarzania została już podjęta za ciebie, a pytanie brzmi, co nim rządzi. Jeśli nie, ograniczenie GPT-Live-1 warto odczytać jako kontrolę, której nie musiałeś zbudować.

Który kupić?

Kup Qwen-Audio-3.0-TTS, jeśli wynikiem są treści: narracja, lokalizacja, audio na potrzeby dostępności, dubbing lub dowolny przepływ pracy, w którym tekst istnieje przed dźwiękiem, a miarą jest jakość na wyrenderowaną godzinę. Zacznij od Flash, jeśli potrzebujesz odtwarzania w czasie rzeczywistym, przejdź na Plus, gdy sam głos jest produktem końcowym, a proces klonowania wyceniaj osobno od głosów presetowych.

Kup GPT-Live-1, jeśli wejściem jest człowiek. Linie wsparcia, ścieżki rezerwacji, wywiady wstępne — wszystko, gdzie pierwsza sylaba użytkownika dociera, gdy model jest w połowie zdania, a system musi zachowywać się jak słuchacz, a nie odtwarzacz. Kosztuje więcej za godzinę audio i tylko jego z tych dwóch można przerwać.

Te dwa rozwiązania znacznie częściej się uzupełniają, niż ze sobą rywalizują: wiele produktów chce, aby Qwen-Audio-3.0-TTS czytał dokument, a model dupleksowy obsługiwał połączenie, które po tym następuje. Tym, czego nie powinny współdzielić, jest model kosztowy. Koszt na godzinę audio to właściwa metryka dokładnie dla jednego z nich.