
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: Co dały dwa miesiące
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 495 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 186 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Qwen-Audio-3.0-TTS został wydany 20 lipca 2026 r. i od razu trafił na szczyt niezależnych rankingów mowy — wariant Plus osiągnął 1238 punktów Elo w rankingu Provider Voice Arena firmy Artificial Analysis, co dało mu drugie miejsce w zestawieniu. Dziewięć tygodni później, 23 września 2026 r., dostawca ogłosił Qwen-Audio-3.1-TTS na konferencji Apsara w Hangzhou, wraz z obniżką ceny o około 70%. Taki timing sprawia, że jest to nietypowe porównanie: zastępowany model nie jest przestarzały — ma za sobą benchmarki, jest sprawdzony i wciąż znajduje się blisko czołówki. Prawdziwe pytanie nie brzmi więc: który jest lepszy. Brzmi: co konkretnie się zmieniło, czy cokolwiek z tego ma znaczenie dla Twojego obciążenia, oraz co dzieje się z wynikiem, któremu już ufasz, gdy następca nie został w ogóle oceniony.
Dwa miesiące, pięć punktów końcowych, jedna rodzina
Alibaba nie wypuściła tylko jednego modelu. Wydanie 3.1 obejmuje pięć modeli: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next i Qwen-Audio-3.1-Realtime. Dla każdego, kto obecnie wywołuje Qwen-Audio-3.0-TTS, tylko jeden z nich jest zamiennikiem drop-in — zwykły poziom TTS — a jeden to prawdziwie nowy produkt, a nie aktualizacja.
Ten drugi warto zrozumieć, nawet jeśli nigdy go nie wywołasz. Qwen-Audio-3.1-TTS-Next to model, który Alibaba nazywa „Audiogen": jedno przejście, które z tekstu, znaczników czasu i dźwięku referencyjnego tworzy razem mowę, efekty dźwiękowe i tło dźwiękowe. Dialogi wielomówcowe, montaż podcastów, pejzaże dźwiękowe scen, wyjście 48 kHz. Dokumentacja Alibaba Cloud Model Studio jasno wymienia jego ograniczenia — 3000 znaków na wejściu, 240 sekund wygenerowanego dźwięku w przypadku podcastów i 120 sekund w pozostałych przypadkach, 3 żądania na sekundę, wyjście w formacie WAV, MP3 lub PCM, a także obsługa maksymalnie trzech klipów referencyjnych po 30 sekund każdy w formatach WAV, MP3 lub OGG Opus. Wprowadzanie surowego dźwięku referencyjnego PCM nie jest obsługiwane. Cena w węźle pekińskim wynosi 0,848 USD za milion tokenów wejściowych i 1,696 USD za milion tokenów wyjściowych, z wyłączeniem stawek promocyjnych, a model obsługuje wyłącznie język chiński i angielski.
Jeśli korzystasz z 3.0-TTS, a twoim zadaniem jest „zamienić ten skrypt na głos”, nic z tego nie zmienia twojej integracji. Jeśli twoim zadaniem jest „złożyć podcast z dwoma prowadzącymi z podkładami muzycznymi”, 3.1-TTS-Next to inna kategoria produktu i być może powód, by w ogóle spojrzeć na to wydanie.
Aktualizacja, linia po linii

• Języki — Qwen-Audio-3.1-TTS: 16 języków według danych podanych przez producenta, o siedem więcej niż w poprzedniej generacji. Qwen-Audio-3.0-TTS: 16 języków zgodnie z publikowanymi informacjami o wydaniu z lipca.
• Chińskie dialekty — Qwen-Audio-3.1-TTS: 20 regionów dialektalnych, przeniesione. Qwen-Audio-3.0-TTS: 20 regionów dialektalnych.
• Międzyjęzykowy transfer barwy głosu — Qwen-Audio-3.1-TTS: tak, jeden głos przenoszony między mandaryńskim, kantońskim, angielskim i japońskim. Qwen-Audio-3.0-TTS: niedostępne.
• Kontrola sposobu wypowiedzi — Qwen-Audio-3.1-TTS: sterowanie emocjami, tempem i stylem za pomocą instrukcji. Qwen-Audio-3.0-TTS: 86 znaczników wypowiedzi w tekście.
• Zaszumione audio referencyjne — Qwen-Audio-3.1-TTS: obsługuje bezpośrednio zaszumione lub zawierające echo audio referencyjne, bez osobnego trybu odszumiania. Qwen-Audio-3.0-TTS: oczekuje czystego audio referencyjnego.
• Niezależny wynik — Qwen-Audio-3.1-TTS: jeszcze brak. Qwen-Audio-3.0-TTS-Plus: 1,238 Elo w rankingu Provider Voice Arena serwisu Artificial Analysis według stanu na sierpień 2026 r.
Liczba języków się nie zgadza, i to ma znaczenie.
To drobiazg, który wszędzie indziej zostanie zatuszowany, więc warto go odnotować. Materiał premierowy Alibaby podaje, że poziom TTS 3.1 dodaje siedem języków. Opublikowane doniesienia o lipcowej generacji 3.0 — w tym nasze własne artykuły porównawcze z tego miesiąca — wymieniały 16 języków dla poziomu 3.0. Siedem dodane do szesnastu daje dwadzieścia trzy, a nie szesnaście, a Alibaba nie opublikowała wyjaśnienia, jak pogodzić te dwie liczby.
Możliwe wyjaśnienia są mało efektowne: liczba 3.1 może obejmować inny zbiór, wartość 3.0 mogła zostać zawyżona przy premierze, a „dodaje siedem” może opisywać warstwę ASR, a nie TTS. Nie wiemy, który z nich. Wiemy natomiast, że liczba języków po obu stronach tego porównania to wartość podana przez dostawcę, która nigdy nie została niezależnie zweryfikowana, a każdy, kto cytuje „16 języków” jako twardy fakt o którymkolwiek z tych modeli, cytuje slajd marketingowy. Zanim zaczniesz planować na podstawie liczby języków, sprawdź konkretne języki, których potrzebujesz, w dokumentacji Model Studio.

Sterowanie instrukcjami to zmiana, którą faktycznie widać w kodzie.
Ze wszystkiego w wydaniu TTS 3.1 to właśnie to zmienia sposób, w jaki piszesz swoje prompty. Generacja 3.0 kontrolowała sposób mówienia za pomocą 86 tagów inline — stałego słownika, którego trzeba było się nauczyć, wstawiać go we właściwych miejscach i który robił dokładnie to, co mówił, i nic więcej. Poziom 3.1 zastępuje to instrukcją w języku naturalnym: opisujesz emocję, tempo i styl, jakie chcesz uzyskać, a model je interpretuje.
Praktyczna różnica polega na ekspresyjności kontra przewidywalności. Słownik tagów to kontrakt — ten sam tag za każdym razem daje tę samą interpretację, czego właśnie chcesz w potoku produkcyjnym, w którym głos musi być spójny w dziesięciu tysiącach klipów. Swobodna instrukcja jest szersza, ale luźniejsza, i dziedziczy typowy problem wrażliwości na prompt: dwa sformułowania „ciepły, ale nie sentymentalny” nie zabrzmią identycznie, podobnie jak dwa wywołania tego samego sformułowania w różne dni.
Jeśli Twój obecny pipeline jest zbudowany na tych 86 tagach, aktualizacja nie jest darmowa. Wymieniasz deterministyczną powierzchnię kontrolną na probabilistyczną, a praca związana z przeniesieniem to nie wywołanie API — to ponowna walidacja każdego szablonu promptu, jaki posiadasz, pod kątem interpretacji nowego modelu. Zaplanuj na to budżet, zanim zaplanujesz budżet na oszczędności.
Międzyjęzykowy transfer barwy dźwięku i do czego właściwie służy
Jeden głos referencyjny, przenoszony przez język mandaryński, kantoński, angielski i japoński, zachowujący swoją tożsamość, gdy zmienia się język. Na papierze wygląda to jak punkt na liście funkcji. W praktyce rozwiązuje konkretny i kosztowny problem: pojedynczego prezentera, który musi istnieć w więcej niż jednym języku, nie brzmiąc przy tym jak inna osoba w każdym z nich.
Tradycyjnym obejściem jest zatrudnienie osobnego aktora głosowego dla każdego języka i pogodzenie się z tym, że Twój głos marki to teraz cztery głosy dzielące jeden scenariusz. Alternatywą było klonowanie jednego mówcy do każdego języka — czyli dokładnie ten proces, w którym sklonowane głosy mają tendencję do dryfowania: akcent się przenosi, barwa traci pełnię, a słuchacze zauważają to w ciągu jednego zdania. Transfer barwy między językami to twierdzenie, że żaden z tych kompromisów nie jest konieczny.
Jest również w tej chwili całkowicie niezweryfikowana. Nie istnieje żaden niezależny test odsłuchowy Qwen-Audio-3.1-TTS w jakimkolwiek języku, a własne dema firmy Alibaba są jedynym dowodem, że transfer się utrzymuje. Jeśli ta możliwość jest powodem, dla którego rozważasz aktualizację, przetestuj ją na własnym audio referencyjnym, zanim podejmiesz decyzję — to pięciominutowy eksperyment i jedyny, który odpowiada na to pytanie.
Jaki wpływ ma obniżka ceny na rachunek 3.0
Alibaba obniżył ceny usług głosowych w całej ofercie: synteza o około 70%, usługi realtime o około 85%, rozpoznawanie nawet o 95%. Korekta weszła w życie w Alibaba Cloud Model Studio 22 września 2026 r. o 00:00 czasu pekińskiego, obejmując regiony Pekin i Singapur, i dotyczy punktów końcowych 3.1 TTS oraz 3.0 realtime. Po korekcie poziom TTS Flash jest wyceniany na 1,5 juana za milion tokenów wejściowych i 12 juanów za milion tokenów wyjściowych; poziom realtime Flash jest wyceniany na 1,5 za tekst wejściowy, 6 za dźwięk wejściowy, 4,5 za tekst wyjściowy i 12 za połączone wyjście tekstowo-audio, za milion tokenów.
Oto część, która ma znaczenie, jeśli już korzystasz z 3.0-TTS. Poziom 3.0 Plus przez cały sierpień oscylował w okolicach 27,60 USD za milion znaków w Artificial Analysis, a poziom Flash był blisko 15 USD. Jeśli obniżka o ~70% dotyczy poziomu, którego używasz, Twój rachunek za ten sam zakres pracy spadnie do około jednej trzeciej tego, co było — bez zmiany ani jednej linii kodu. To jest niezwykłe w tym wydaniu: dla klienta 3.0 obniżka ceny jest warta więcej niż aktualizacja modelu i pojawia się niezależnie od tego, czy przeprowadzasz migrację.
Dwie uwagi, o których warto pamiętać. Obniżki procentowe podaje się względem stawek, które różnią się w zależności od regionu i poziomu, więc nagłówkowe 70% nie jest obietnicą dotyczącą konkretnie Twojego ruchu. A Alibaba Cloud zmienił rozliczanie transkrypcji w czasie rzeczywistym w węźle singapurskim z pomiaru opartego na czasie trwania na pomiar oparty na tokenach — 0,93 USD za milion tokenów wejściowych i 0,70 USD za milion tokenów wyjściowych — co jest podstawą mniej przewidywalną, gdy cisza, szum i kontekst wieloturnowy zawyżają zużycie tokenów. Nowy cennik skonfrontuj z własnym materiałem audio, a nie z komunikatem prasowym.
Gdzie Qwen-Audio-3.0-TTS wciąż jest właściwym wyborem
Trzy przypadki, i to nie przypadki brzegowe.
Gdy potrzebujesz liczby, której możesz bronić. Qwen-Audio-3.0-TTS-Plus ma niezależne Elo wynoszące 1 238 — ten sam ranking pokazuje we wrześniu 1 259 dla tego modelu, wciąż drugie miejsce, więc wynik raczej dryfował w górę, niż spadał — z areny ślepych odsłuchów, za którą stoją tysiące głosów. Qwen-Audio-3.1-TTS nie ma żadnego wyniku z areny. Jeśli Twój proces zatwierdzania wymaga dowodów od stron trzecich, to starszy model je ma, a obniżka ceny tego nie zmienia.

Gdy determinizm wygrywa z ekspresyjnością. Jeśli Twój potok produkcyjny opiera się na powierzchni sterowania z 86 tagami, masz system, którego działanie możesz logicznie analizować. Sterowanie oparte na instrukcjach jest wydajniejsze i mniej przewidywalne, a koszt migracji jest realny.
Gdy nic w aktualizacji nie dotyczy Twojego obciążenia pracą. Jeśli syntezujesz mandaryński i angielski przy umiarkowanej ilości, z czystym głosem referencyjnym i stałym zestawem tagów sposobu mówienia, to międzyjęzykowy transfer barwy dźwięku, odporność na zaszumione dane wejściowe i siedem dodatkowych języków rozwiązują problemy, których nie masz. Skorzystaj z obniżki ceny, zachowaj model.
Uruchamianie obu bez uruchamiania dwóch integracji
Kłopotliwa część przejścia z jednej generacji na kolejną polega na tym, że często chcesz mieć oba modele aktywne naraz — 3.0 dla ścieżki produkcyjnej z wynikiem, który za nią stoi, 3.1 dla nowych języków i funkcji transferu, oraz sposób kierowania ruchu między nimi bez ponownego wdrażania. Oba to zamknięte, hostowane interfejsy API w Alibaba Cloud Model Studio, więc za jedną funkcją stoją dwa punkty końcowe, dwa limity szybkości i dwa tryby awarii.
Szczera uwaga o tym, gdzie jesteśmy: OrcaRouter nie kieruje ruchu do Qwen-Audio-3.1-TTS ani żadnego modelu Qwen-Audio, a w ogóle nie obsługujemy punktów końcowych mowy Alibaby. To, co zapewniamy, to warstwa wnioskowania tekstowego wokół potoku takiego jak ten — jeden klucz API do ponad 200 modeli przy 0% marży, cena katalogowa dostawcy przekazywana wprost, więc obniżka ceny u dostawcy trafia na naszą stronę jeszcze tego samego dnia, a nie po cyklu zmiany cennika. Jeśli usługą napędzającą Twój potok mowy jest generator skryptów, narzędzie do streszczania lub planer treści, oznacza to jedną umowę zamiast kilku, automatyczne przełączenie awaryjne, gdy usługa nadrzędna traci sprawność, oraz DSL routingu do składania modeli w jedno wywołanie. Nie oznacza to, że wywołujesz głos Qwena przez nas, a każda strona sugerująca inaczej myli się co do naszego własnego katalogu.
Uczciwe podsumowanie
Qwen-Audio-3.1-TTS to prawdziwe ulepszenie z trzema istotnymi dodatkami — sterowaniem sposobem mówienia opartym na instrukcjach, transferem barwy głosu między językami i odpornością na złe audio referencyjne — a do tego obniżka ceny, która jest warta więcej niż każdy z nich. Qwen-Audio-3.0-TTS nie zostaje zastąpiony w taki sposób, w jaki zwykle dzieje się to z dwumiesięcznym modelem: wciąż utrzymuje niezależny wynik benchmarku, którego jego następca nie zdobył, i wciąż obejmuje zakres chińskich dialektów, na którym opiera się większość wyróżników tej rodziny.
A więc decyzja jest węższa, niż sugeruje marketing. Jeśli generujesz na dużą skalę, zmiana cen już cię dotyczy. Jeśli potrzebujesz nowych języków lub transferu barwy głosu, najpierw przeprowadź migrację i zweryfikuj tę funkcję na własnym audio. Jeśli potrzebujesz wyniku jakości, którego można bronić, poczekaj, aż Qwen-Audio-3.1-TTS pojawi się na arenie ślepych odsłuchów — to jedyne wydarzenie, które mogłoby rozstrzygnąć tę sprawę, a dopóki to nie nastąpi, uczciwe stanowisko jest takie, że nowszy model jest tańszy, a starszy jest sprawdzony.
