
Realtime-Venus kontra Qwen-Audio-3.0-TTS: jeden czyta twój skrypt, drugi musi cię usłyszeć
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
The tempting comparison between Realtime-Venus and Qwen-Audio-3.0-TTS is price per hour of audio, and it produces a clean answer that is entirely wrong. Qwen-Audio-3.0-TTS-Plus renders speech at roughly $27.6 per million characters, which works out near $1.66 for an hour of finished audio. Realtime-Venus, the 9B full-duplex system Ant Group's Venus Team built with Tsinghua University, has no price at all because it has no hosted service — but self-hosted it would cost you a GPU node running continuously, which is at least an order of magnitude more per hour. The renderer wins on the arithmetic. The arithmetic is measuring two different products: Qwen-Audio-3.0-TTS takes text and returns audio, and Realtime-Venus takes audio and video and returns a conversation. The question that actually separates them is not what they output. It is whether anything has to talk back.
Dane wejściowe to cała różnica.
Qwen-Audio-3.0-TTS, wydany 20 lipca 2026 r. przez Tongyi Lab należącego do Alibaba Cloud, to model zamiany tekstu na mowę udostępniany jako hostowane API, bez otwartych wag. Tekst trafia do niego przez punkt końcowy HTTP, a na wyjściu pojawia się dźwięk. Nie ma ścieżki wejścia audio, nie ma tury do wykonania, nie ma transkrypcji do zwrócenia ani pojęcia przerwania — model nigdy niczego nie słyszał. Jego cały model kosztowy to prasa drukarska: znaki na wejściu, dźwięk na wyjściu.
Natomiast Realtime-Venus słucha nieprzerwanie. Audio-wizualny checkpoint zawiera wizualny enkoder SigLIP2 do strumieniowania klatek oraz enkoder audio Whisper-Medium zasilający szkielet Qwen3-8B, a oba checkpointy działają w jednosekundowej pętli interakcji, która stale aktualizuje stan konwersacji i decyduje, czy mówić, czy milczeć. Generuje mowę za pomocą dyskretnych tokenów S3 i strumieniowego dekodera flow-matching, a nie osobnego etapu syntezy, i może zwracać tekst wraz z przebiegiem fali.
To nie jest różnica w funkcjach. To różnica między komponentem a systemem. Postaw oba obok siebie, a jeden z nich można wstawić do potoku, który ma już na wejściu moduł rozpoznawania mowy i model językowy. Drugi zastępuje wszystkie trzy.
Konkretny przykład czyni to namacalnym
Weźmy linię wsparcia. Klient dzwoni, źle opisuje problem, pauzuje w połowie zdania, żeby znaleźć numer konta, przerywa mu komunikat z tła, a potem zadaje dodatkowe pytanie, zanim konsultant skończy odpowiadać.
System zbudowany na Qwen-Audio-3.0-TTS obsługuje to jako trzech dostawców i trzy rachunki: moduł rozpoznawania mowy zamienia mowę dzwoniącego na tekst, model językowy decyduje, co powiedzieć, a Qwen-Audio-3.0-TTS to wypowiada. Każdy przeskok dodaje opóźnienie, a każda granica to miejsce, w którym umiera prozodia. Krytyczna awaria ma charakter strukturalny — odnoga TTS nie słyszy pauzy w środku zdania, które już wypowiada, więc barge-in musi obsłużyć coś przed nią.
Realtime-Venus obsługuje tę samą rozmowę jako jeden model, bez zewnętrznego detektora aktywności głosowej, bez przekazywania. Jego wyniki z Full-Duplex-Bench v1.5 — 75% odpowiedzi na przerwania oraz wskaźniki kontynuacji 97% przy sygnałach podtrzymujących, 88% przy mowie skierowanej do innych i 86% przy mowie w tle — to dokładnie te metryki, które opisują ten scenariusz. Są one również samodzielnie raportowane, z własnego raportu technicznego modelu, bez zewnętrznego odtworzenia. Czytaj je jako twierdzenie projektowe, a nie pomiar.
Jakość głosu: jeden ma Elo, drugi nie ma nic.
To najbardziej jednostronna część porównania i zdecydowanie faworyzuje Alibaba.
• Niezależny wynik — Qwen-Audio-3.0-TTS-Plus zajmuje drugie miejsce w Provider Voice Arena serwisu Artificial Analysis z wynikiem Elo 1 259 na podstawie 1 544 próbek na dzień 18 września 2026, za Cartesia Sonic 3.6 z wynikiem 1 277 i przed Inworld Realtime TTS-2 z 1 247 oraz Speechify Simba 3.2 z 1 241.
• Gdzie się zaczęło — własna kolumna wydań areny wymienia ten model jako wpis z września 2026 r., co jest poziomem według obecnego punktowania, a nie datą premiery 20 lipca 2026 r. Ilekroć się przesuwał, przez cały czas utrzymywał się w pierwszej dwójce.
• Realtime-Venus — brak wpisu w arenie, brak oceny głosu przez podmioty trzecie, nic. Jego jedyną wartością związaną z głosem jest samodzielnie zgłoszony wynik VoiceBench AlpacaEval wynoszący 4,81, który raport opisuje jako dorównujący najlepszemu wynikowi porównawczemu.
• Co to oznacza — nikt poza autorami nie ocenił, czy Realtime-Venus brzmi dobrze. To nie jest punkt przeciwko niemu; to po prostu niewiadoma, a niewiadoma to co innego niż zły. Jeśli jednak jakość głosu jest tym, co ma być dostarczone, kupienie modelu z oceną Elo jest lepsze niż branie modelu bez oceny na wiarę.


Język, głosy i kontrola ekspresji
Model Alibaby powstał z myślą o szerokim zakresie możliwości wypowiedzi. Oferuje ponad tysiąc głosów, obsługuje szesnaście języków — w tym dwadzieścia regionów dialektów chińskich — i udostępnia 86 znaczników inline do sterowania emocjami i sposobem mówienia: interfejs sterowania, który wpisuje się w sam tekst, a także instrukcje sposobu mówienia w języku naturalnym. Wyjście sięga do 48 kHz, w porównaniu z 24 kHz w poprzedniej generacji, a pojedyncza synteza może trwać do trzech minut. Wariant Flash celuje w około 300 milisekund do pierwszego pakietu na potrzeby odtwarzania w czasie rzeczywistym; wariant Plus to wariant jakościowy i generuje około szesnastu znaków na sekundę, co jest wystarczająco wolne, by miało znaczenie w produkcie działającym na żywo, ale niewidoczne przy renderowaniu wsadowym.
Realtime-Venus dokumentuje język angielski i chiński, dostarcza jeden głos referencyjny wraz z wagami i daje dekoder przekształcający tokeny w przebieg fali zamiast biblioteki głosów. Ekspresyjność w rozumieniu Qwen — tagi, instrukcje, tysiąc presetów — nie ma tu odpowiednika. Zamiast tego ma możliwość zmiany sposobu mówienia w odpowiedzi na to, co słyszy, co jest innym rodzajem kontroli ekspresji i znacznie trudniej ująć to w specyfikacji technicznej.
Koszt każdej ścieżki, szczerze mówiąc.
Jest jednak realne zastrzeżenie co do liczby dla Alibaba, zanim ktokolwiek zacznie na jej podstawie planować budżet. Powszechnie podawane 27,6 USD za milion znaków nie zgadza się ze stroną cenową samego Alibaba w każdej migawce, a poszczególne poziomy mają osobne ceny. Sprawdź tę kwotę na poziomie konta, zamiast ufać tabeli porównawczej, w tym tej.
Realtime-Venus nie ma ceny katalogowej, ponieważ nie ma czego kupić. Koszt to dwa punkty kontrolne 9B w BF16 — około osiemnastu gigabajtów wag każdy, zanim dojdzie pamięć aktywacji — plus ciągła pętla strumieniowania, co oznacza węzeł GPU rozliczany miesięcznie, niezależnie od tego, czy ktokolwiek go wywoła. Przy stałym wolumenie jest to tańsze na rozmowę niż API głosowe rozliczane za użycie. Przy wolumenie sporadycznym jest znacznie gorzej, a punkt przecięcia jest jedynym pytaniem finansowym, które ma znaczenie.
Istnieje trzecia ścieżka, na którą trafi wiele zespołów, i warto ją nazwać, bo zmienia kształt tej decyzji. Jeśli zostajesz przy kaskadzie, jedynym etapem, który musi być modelem hostowanym, jest środkowy — czyli rozumowanie. OrcaRouter nie udostępnia ani Qwen-Audio-3.0-TTS, ani Realtime-Venus; obie warstwy głosowe są poza tym, co oferujemy, i wolimy powiedzieć to wprost, niż sugerować inaczej. Etap rozumowania to właśnie ten, który obsługujemy: blisko 200 modeli tekstowych za jednym kluczem, w cenie katalogowej dostawcy i bez żadnej marży, automatyczne przełączanie awaryjne między dostawcami, dzięki czemu zły dzień u jednego z nich nie przerywa trwającej rozmowy, DSL routingu, który łączy kilka modeli w jedno wywołanie, a także fuzję modeli, gdy decyzja zasługuje na więcej niż jedną opinię. W kaskadzie to właśnie ten etap najchętniej wymieniałbyś bez negocjowania umowy — i ten, w którym obniżka ceny od dostawcy obowiązuje tego samego dnia, a nie dopiero przy odnowieniu.

Klonowanie ma dwie strony
Qwen-Audio-3.0-TTS potrafi sklonować głos na podstawie krótkiej próbki referencyjnej, również w różnych językach, a zgodnie z dokumentacją jest odporny na hałaśliwe lub pogłosowe sygnały wejściowe. To pojedyncza najbardziej komercyjnie użyteczna możliwość w porównaniu i największy obszar zgodności. Produkt, który potrafi odtworzyć dowolnego mówcę na podstawie dziesięciu sekund nagrania, ma znacznie dłuższą odpowiedź na pytanie „czyj to głos i kto na niego wyraził zgodę” niż taki, który odzywa się wyłącznie za pomocą ustawień wstępnych dostawcy.
Realtime-Venus dostarcza referencyjny głos wraz z wagami. Możesz za jego pomocą klonować, jeśli masz audio i przebieg treningu, ale nic w wydaniu nie zostało zbudowane wokół ułatwiania tego — co w przypadku wdrożenia samodzielnie hostowanego w obrębie granicy zgodności jest prawdopodobnie bezpieczniejszym ustawieniem domyślnym.
Który tak naprawdę kupujesz?
Kup Qwen-Audio-3.0-TTS, gdy dźwięk jest wynikiem. Narracja, lokalizacja, dostępność, dubbing, każdy przepływ pracy, w którym tekst istnieje, zanim powstanie dźwięk, a metryką jest jakość na wyrenderowaną godzinę. Zacznij od Flash, jeśli odtwarzanie odbywa się na żywo, przejdź na Plus, gdy sam głos jest produktem, a przepływ klonowania wyceń osobno od biblioteki presetów.
Sięgnij po Realtime-Venus, gdy wejściem jest osoba, a system ma zachowywać się jak słuchacz. Asysta świadoma kamery, interakcja bez użycia rąk, cokolwiek, gdzie człowiek przerwie w połowie zdania i oczekuje, że system sobie z tym poradzi. Kompromis jest wyraźny: rezygnujesz z głosu z rankingiem Elo, tysiąca presetów i jakiejkolwiek opcji hostowanej, a w zamian dostajesz jedyny z tych dwóch, który potrafi cię usłyszeć.
Większość produktów chce obu, w różnych miejscach. Tym, czego nie powinny dzielić, jest model kosztów — cena za godzinę audio to właściwa metryka dokładnie dla jednego z tych dwóch modeli i nie jest to ten, który prowadzi rozmowę.
