Karta tytułowa bohatera artykułu „AuK-Flash & AuK — WYDANE PO CICHU, WRZESIEŃ 2026”, z niebieską pastylką z napisem „WYDANE PO CICHU — WRZ 2026”, nagłówkiem „AuK-Flash & AuK”, podtytułem „Nowy model generowania i edycji mowy od Tencent wylądował na Hugging Face z prawdziwymi wagami — i bez żadnego ogłoszenia”, trzema chipami z napisami „rodzina 1.5B”, „licencja MIT” i „destylacja 4-krokowa”, oraz linią pomocniczą: „Repozytoria na żywo ~7 września 2026 — wagi prawdziwe, repozytorium kodu 404, brak niezależnych ewaluacji”. Logo OrcaRouter jest skomponowane w prawym dolnym rogu.
Guides & Insights

AuK-Flash i AuK: Tencent po cichu wydał otwarty model mowy, który generuje, edytuje i rozdziela dźwięk

Autor

Elias Hawthorne

Data publikacji

Powrót do wszystkich wpisów

Tencent opublikował w tym tygodniu dwa z najbardziej wpływowych otwartych modeli mowy 2026 roku i prawie nikomu o tym nie powiedział. Około 7 września organizacja Tencent na Hugging Face udostępniła AuK — „fundamentalny model 1.5B do generowania i edycji mowy”, jak czytamy w jego karcie modelu — oraz AuK-Flash, destylowany czterostopniowy wariant tego samego modelu, oba na licencji MIT. Żadnemu z repozytoriów nie towarzyszy wpis na blogu Tencent, ogłoszenie w mediach społecznościowych ani komunikat prasowy; między nimi oba pobrano zaledwie kilkadziesiąt razy, repozytorium kodu, do którego prowadzą linki z kart, jest nieosiągalne, a w zindeksowanym internecie nie istnieje żaden niezależny benchmark. Ten tekst przedstawia, co faktycznie można ustalić z dwóch repozytoriów, plików konfiguracyjnych i własnej strony projektu Tencent — a co pozostaje niezweryfikowane.

To twierdzenie warto traktować poważnie nawet bez niezależnych danych liczbowych, ponieważ zakres jest nietypowy. AuK nie jest kolejnym modelem klonowania głosu. Za pośrednictwem jednego interfejsu instrukcji w języku naturalnym oferuje syntezę mowy zero-shot i sterowaną instrukcjami, edycję sięgającą do treści wypowiedzi, sposobu jej wygłoszenia oraz otaczających ją dźwięków niewerbalnych, a także ulepszanie mowy, separację mowy i separację muzyki. W tej dziedzinie historycznie budowano osobny model specjalistyczny dla każdego z tych zadań. Zakład Tencentu, oparty na jednym generatywnym szkielecie, jest taki, że pojedynczy model może wykonać wszystkie te zadania — a AuK-Flash może zrobić to wystarczająco szybko, aby nadawał się do użycia niemal w czasie rzeczywistym.

Dwa punkty kontrolne, jedno wydanie

Znaczniki czasu w API Hugging Face opowiadają historię repozytorium, które pozostało prywatne, zanim zostało opublikowane. Bazowe repozytorium tencent/AuK zostało utworzone 18 sierpnia 2026 roku, a tencent/AuK-Flash 21 sierpnia; oba były ostatnio modyfikowane 8 września, a karta modelu zawiera wpis z aktualnościami datowany na 7 września — „[2026/09/07] AuK jest teraz open-source. Kod i wagi modelu są publicznie dostępne.” Naturalna interpretacja jest taka, że Tencent zbudował repozytoria w drugiej połowie sierpnia, upublicznił je około 7 września i ponownie zmodyfikował kartę 8 września. Nic o tym modelu nie pojawia się w żadnym miejscu w zindeksowanym internecie, a liczniki pobrań wskazują kilkadziesiąt — więc „ciche wydanie” nie jest wyborem retorycznym, lecz dosłownym stanem rzeczy.

A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'

Oba checkpointy to ta sama architektura na różnych etapach jej życia. AuK jest nauczycielem: bazowym modelem ukierunkowanym na generowanie wysokiej jakości. AuK-Flash jest uczniem zdystylowanym do szybkiej, czteroetapowej inferencji, co czyni go bardziej interesującym celem wdrożeniowym i sprawia, że to właśnie on wysuwa się na prowadzenie w tytule tego tekstu. Na stronie projektu Tencenta rodzina modeli przedstawiona jest jako mająca około 1,5 miliarda parametrów, trenowana na danych, które karta modelu opisuje jedynie jako „miliony godzin zróżnicowanych danych audio”, a strona projektu doprecyzowuje jako około 1,95 miliona godzin efektywnego nadzoru w ramach około 3,03 miliarda instancji instrukcja–audio. Na stronie projektu widnieją również oznaczenia Shanghai Jiao Tong University i Tencent Hunyuan, co sytuuje AuK w linii badawczej otwartych modeli Tencent Hunyuan, a nie w rodzinie produktów komercyjnych. Po pre-treningu nastąpiło nie tylko dalsze trenowanie: Tencent opisuje etap post-treningu, który łączy optymalizację preferencji na podstawie ludzkich opinii do swobodnej edycji z opartym na nagrodach uczeniem przez wzmacnianie do generowania mowy.

Tabela wariantów w karcie modelu jednoznacznie pokazuje, który jest który: AuK to „model bazowy do generowania wysokiej jakości", a AuK-Flash to „model destylowany do szybkiego wnioskowania w 4 krokach". Oba można pobrać z Hugging Face oraz z ModelScope w przestrzeni nazw Tencent-Hunyuan, a oba są objęte licencją MIT — jedną z najbardziej liberalnych licencji, jakie może mieć wydanie otwartych wag, co ma znaczenie dla każdego, kto chce zbudować na ich bazie produkt.

Co tak naprawdę robi jeden model sterowany instrukcjami

Interfejs AuK to pojedyncze pole monitu: przekazujesz modelowi instrukcję w języku naturalnym oraz, gdy zadanie tego wymaga, referencję audio, a on zwraca audio. Pogrupowane według własnej taksonomii karty, pięć rodzin zadań to:

• Generowanie mowy — TTS typu zero-shot, który klonuje głos z klipu referencyjnego, oraz „instruct TTS”, który syntezuje mowę na podstawie samego opisu głosu („ciepły kobiecy głos, nieco wolniejszy”), bez żadnego referencyjnego audio.

• Edycja treści — przepisywanie tego, co zostało powiedziane: zastępowanie, wstawianie lub usuwanie słów w istniejącym nagraniu, a także edycja tekstu piosenki, która przepisuje słowa klipu wokalnego, zachowując melodię i głos wykonawcy.

• Edycja akustyczna — wysokość dźwięku w półtonach, tempo mowy i głośność w decybelach, każdy parametr regulowany na istniejącym klipie przy zachowaniu tożsamości i treści.

• Edycja paralingwistyczna — emocje, barwa głosu (do opisu), usuwanie akcentu, dodawanie lub usuwanie dźwięków niewerbalnych, takich jak oddechy, śmiech i kaszel, oraz przekształcanie normalnej mowy w szept i odwrotnie.

• Ulepszanie i separacja — poprawa mowy (odszumianie i usuwanie pogłosu), separacja mowy według kolejności mówienia, separacja muzyki, która wyciąga głos śpiewający z miksu, oraz ekstrakcja docelowego mówcy identyfikowana na podstawie tego, co mówi dany mówca.

Ta lista to właśnie prawdziwy wyróżnik. Większość najbardziej zaawansowanych otwartych systemów mowy w 2026 roku jest mocna w jednym lub dwóch z tych obszarów — klonowanie głosu i TTS to najbardziej zatłoczony segment — a w pozostałych słaba albo w ogóle ich nieobsługująca. AuK stawia na szerokość: te same wagi, ten sam format instrukcji w generowaniu, edycji i separacji, czyli zakres, który zwykle trafia na rynek dopiero jako zbiór dostrojonych modeli specjalistycznych.

Jak to jest zbudowane

Łączne czytanie repozytoriów i strony projektu daje spójny obraz architektury. AuK nie jest autoregresyjnym modelem językowym audio, który czyta tekst i generuje tokeny. Jest to system dyfuzyjny typu flow-matching na wzór modeli obrazowych, składający się z trzech części:

• Multimodalny duży model językowy — Qwen/Qwen2.5-Omni-3B, pobierany osobno — odczytuje instrukcję oraz wszelkie referencyjne audio i generuje kondycjonowanie semantyczne.

Audio VAE trenowane wspólnie na mowie, ogólnym audio i muzyce koduje i dekoduje przy 24 kHz przez 50 Hz latenty akustyczne; konfiguracja repozytorium identyfikuje je jako BigVGANFlowVAE z wymiarem latentnym 64 i 480-krotnym zmniejszeniem próbkowania oraz udostępnia jako osobny plik vae.safetensors.

• Rdzeń generatywny to hybrydowy Transformer z przepływem wyprostowanym (rectified-flow): dwustrumieniowe bloki MMDiT, które utrzymują warunkowanie tekstowe i audio oddzielnie, a następnie ujednolicone jednostrumieniowe bloki DiT, które je mieszają, trenowane przy użyciu celu dopasowania przepływu (flow-matching). Opublikowana konfiguracja pokazuje model o szerokości 1536, z 24 głowami, 10 warstwami dwustrumieniowymi i 20 warstwami jednostrumieniowymi.

AuK-Flash to ten sam transformer po destylacji. Tencent opisuje proces dwuetapowy — inicjalizację spójności na poziomie trajektorii, a następnie cel DMD „odseparowany od rutowania zadań” — zwieńczony nadzorem regresji czystych predykcji. Według strony projektu efektem jest jakość generacji zbliżona do modelu nauczyciela w czterech krokach próbkowania, bez prowadzenia bez klasyfikatora podczas inferencji, przy około 4,5-krotnym przyspieszeniu w czasie zegarowym względem pełnego modelu w tych samych warunkach. To deklaracje producenta, niepotwierdzone, ale właśnie one są konkretnym powodem, dla którego wariant AuK-Flash wybierze twórca.

Co twierdzi Tencent i co czytelnik może sprawdzić

Strona projektu zawiera mocne twierdzenia jakościowe — AuK jest „liderem" w generowaniu i edycji oraz „konkurencyjny" w zadaniach renowacji na poziomie sygnału, takich jak poprawa jakości i separacja — i wymienia zestawy benchmarków, na których się opiera: Seed-TTS-Eval i InstructTTSEval do generowania, MMAE-Speech, SpeechEditBench i Ming-Freeform-Audio-Edit do edycji, DNSMOS i UTMOS do oceny jakości percepcyjnej oraz DNS Challenge, CHiME-4 i Libri2Mix do poprawy jakości i separacji. Na stronie nie opublikowano żadnych wyników liczbowych, nie ma za nią żadnej publikacji naukowej, a żadna strona trzecia nie zweryfikowała tych rezultatów. Każde z tych twierdzeń pochodzi wyłącznie od dostawcy i należy je tak traktować, dopóki nie pojawi się niezależne badanie potwierdzające.

A screenshot of the AuK project page (auk-project.github.io) headed 'AuK: An Open-Source Foundational Model for Speech Generation and Editing' with GitHub, Hugging Face and ModelScope buttons and an AuK / AuK-Flash selector; a subtitle reading 'One model for every speech task'; the intro line 'AuK is a 1.5B-parameter foundational model that answers a natural-language instruction with edited or generated audio. A multimodal language model reads the instruction alongside optional reference audio; a 50 Hz VAE supplies acoustic latents; a hybrid transformer fuses both streams under a flow-matching objective'; an Abstract that begins 'We introduce AuK, an open-source foundational model that unifies speech generation and editing through a common interface of natural-language instructions and audio context' and describes roughly 3.03 billion instruction-audio instances and 1.95 million hours of supervision across five task families plus a 4.5x wall-clock speedup claim for AuK-Flash; and a figure titled 'Performance comparison with SOTA models across speech generation, editing, enhancement and separation' referencing Seed-TTS-Eval, InstructTTSEval, MMAE-Speech, SpeechEditBench, Ming-Freeform-Audio-Edit, DNS Challenge, CHiME-4 and Libri2Mix.

Dwa inne twierdzenia należy obarczyć zastrzeżeniem, ponieważ nie przetrwały bezpośredniego sprawdzenia 9 września 2026 r. Po pierwsze, karta twierdzi, że kod jest publicznie dostępny, i linkuje do github.com/Tencent-Hunyuan/AuK z instrukcjami instalacji, Gradio, ComfyUI i dostrajania — ale to repozytorium w chwili pisania zwraca HTTP 404 i nie znajduje się wśród publicznych repozytoriów organizacji Tencent-Hunyuan. Kod może po prostu wciąż być sukcesywnie udostępniany; tak czy inaczej „kod jest dostępny” to obecnie deklaracja karty, a nie coś, na czym czytelnik może faktycznie polegać. Po drugie, karta wskazuje na demonstracyjne Spaces na Hugging Face i ModelScope: studio ModelScope odpowiada, ale Space na Hugging Face po sprawdzeniu wymagało autoryzacji, więc dema są co najwyżej częściowo publiczne.

Co tu jest, czego brakuje

Dokonanie bilansu 9 września 2026 roku oddziela prawdziwe wydanie od kompletnego.

• Prezentujemy — dwa zestawy wag do pobrania na licencji MIT: tencent/AuK dla modelu bazowego oraz tencent/AuK-Flash dla zdystylowanego wariantu czterokrokowego. Każdy zestaw ma około 6,1 GB i obejmuje transformator dyfuzyjny z dołączonym VAE. Zestawy są również dostępne na Hugging Face i ModelScope.

• Obecnie — niezwykle szeroki zakres zadań w ramach jednego interfejsu opartego na instrukcjach: generowanie, edycja treści oraz edycja akustyczna i paralingwistyczna, ulepszanie i separacja — wszystko w jednej rodzinie modeli.

• Przedstawiamy — konkretną historię o „szybkości”: AuK-Flash po destylacji działa w czterech krokach i nie wymaga sterowania bez klasyfikatora, uzyskując deklarowane przez producenta 4,5× przyspieszenie w rzeczywistym czasie działania.

• Brak — ogłoszenie. Żaden wpis na blogu Tencent, post w mediach społecznościowych, komunikat prasowy ani wpis na kanale Hunyuan nie wskazuje jeszcze na żadne z repozytoriów.

• Brak artykułu lub raportu technicznego. Blok cytowania na stronie projektu to tylko placeholder — bez autorów i identyfikatora arXiv — a za twierdzeniami o wynikach benchmarków nie stoją żadne opublikowane liczby.

• Brak — dostępny kod. Repozytorium GitHub i Cookbook, do których prowadzą {{1}}linki na karcie{{/1}}, zwracają 404 w momencie sprawdzania stanu, więc obecnie jedynym uruchamialnym artefaktem są wagi plus {{2}}cokolwiek społeczność wokół nich zgromadzi.{{/2}}

• Brak — serwowania i niezależnej ewaluacji. Żaden dostawca wnioskowania nie hostuje AuK, nie istnieje żadne hostowane API, a przy pobraniach liczonych w dziesiątkach nikt jeszcze nie opublikował reprodukcji.

An infographic titled 'AuK-Flash — the state of play', with six rows reading 'Release: Sept 7, 2026 — quiet, no announcement', 'Weights: ~6.1 GB transformer + VAE, MIT (HF + ModelScope)', 'Family: 1.5B speech foundation — AuK base + AuK-Flash distilled', 'Inference: AuK-Flash 4 steps, no CFG — ~4.5x faster (vendor)', 'Encoder: Qwen2.5-Omni-3B, downloaded separately', 'Independent evals: none yet', and a footer reading 'Specs from the AuK model card, config and project site, Sept 2026 — all vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Uruchamiasz AuK-Flash dzisiaj, czy czekasz?

Jeśli chcesz samodzielnie uruchomić AuK-Flash, ścieżka pobierania jest jednoznaczna, w przeciwieństwie do kodu: pobierz tencent/AuK-Flash i tencent/AuK (wariant bazowy jest opcjonalny, chyba że potrzebujesz modelu nauczyciela), pobierz także Qwen/Qwen2.5-Omni-3B, ponieważ checkpoint zawiera tylko wagi transformatora dyfuzyjnego i fuzji warstw. Enkoder multimodalny i VAE są ładowane w czasie działania z osobnych plików, a w karcie modelu zaznaczono, że brakujące klucze text_encoder podczas ładowania są normalne. Prawdziwym ograniczeniem jest sprzęt: model to transformator dyfuzyjny o ~1,5 mld parametrów (sam checkpoint waży ~6,1 GB), uruchamiany razem z enkoderem multimodalnym o ~3 mld parametrów i VAE, więc rozsądnym punktem wyjścia jest GPU z 24 GB pamięci, a nie laptop. Notatki o pamięci w konfiguracji, wspominające o tym, że gradient checkpointing obniża szczytowe zużycie pamięci podczas treningu z ok. 91 GB do 75 GB, dotyczą uczenia i nie powinny być odczytywane jako wymagania dla wnioskowania. Jeśli chodzi o oprogramowanie, konfiguracja ma domyślnie ustawiony backend flash-attention, ale CLI do wnioskowania może przełączyć się na zwykły backend attention oparty na torch, co eliminuje etap kompilacji flash-attn przy pierwszym uruchomieniu.

Czy warto to zrobić dzisiaj, zależy od tego, co budujesz. Uczciwa ocena sytuacji jest taka, że to model do obserwowania i testowania w piaskownicy, a nie do wpinania jeszcze w produkcyjny potok — bez artykułu, bez dostępnego kodu i bez niezależnej ewaluacji, twierdzenia o możliwościach opierają się wyłącznie na słowie Tencent. Dla zespołu, który dziś potrzebuje generowania, edycji lub separacji mowy przez API, pragmatycznym wyborem jest model faktycznie udostępniany — i właśnie taką rolę pełni OrcaRouter wśród modeli mających endpointy: jedno API do ponad 200 modeli z cenami dostawców przekazywanymi bez narzutu, więc cena dostawcy jest twoją ceną od pierwszego dnia, oraz automatyczne przełączanie awaryjne, dzięki któremu niesprawdzony nowicjusz może być przetestowany na fragmencie prawdziwego ruchu bez stawiania całego potoku na szali. Żadne z tego nie dotyczy jeszcze AuK ani AuK-Flash, ponieważ nic ich nie udostępnia. Gdy dostawca zacznie hostować AuK, ekonomia routera stanie się tanim sposobem jego ewaluacji; do tego czasu pozostaje samodzielne hostowanie wag lub czekanie.

Często zadawane pytania

Czy AuK lub AuK-Flash są dostępne przez API?

Nie. Obie to wydania zawierające wyłącznie wagi. Żaden dostawca inferencji ich nie hostuje i nie istnieje żadne hostowane API, więc obecnie nie ma czego wywołać — jedyny sposób, by z nich korzystać, to pobrać wagi i uruchomić je samodzielnie.

Jaka jest różnica między AuK a AuK-Flash?

Ta sama rodzina modeli na dwóch etapach. AuK to model bazowy, ukierunkowany na generowanie wysokiej jakości; AuK-Flash to jego destylowany wariant, dostrojony do szybkiego wnioskowania w czterech krokach bez guidance wolnego od klasyfikatora, który — według Tencent — działa około 4,5× szybciej niż model bazowy w porównywalnych warunkach. Ta wartość przyspieszenia pochodzi od producenta i nie została zmierzona niezależnie.

Czy AuK-Flash może być używany komercyjnie?

Wagi są udostępniane na licencji MIT, która pozwala na wykorzystanie komercyjne pod warunkiem zachowania noty licencyjnej — to najmniej restrykcyjna z powszechnych licencji dla otwartych wag. Osobne repozytorium kodu, do którego prowadzi link z karty modelu, jest nieosiągalne na dzień 9 września 2026 r., więc praktyczna odpowiedź w kwestii ponownego wykorzystania kodu pozostaje otwarta, dopóki się ono nie pojawi.

Co obejrzeć

• Repozytorium kodu — github.com/Tencent-Hunyuan/AuK — jest najcenniejszym brakującym elementem. Gdy się pojawi, szablony instrukcji z Cookbooka zmienią powyższą listę zadań z czystego marketingu w coś, co można uruchomić.

• Niezależne uruchomienie — pierwsza reprodukcja przez stronę trzecią rozstrzygnie, czy twierdzenia o „wiodącej” generacji i edycji przetrwają kontakt z prawdziwym dźwiękiem oraz czy czterokrokowy AuK-Flash naprawdę zbliża się do modelu bazowego.

Artykuł — cytowanie na stronie projektu jest tylko placeholderem, co zwykle oznacza, że wkrótce pojawi się zgłoszenie na arXiv; przepis na trenowanie, wyniki benchmarków i szczegóły dotyczące dystylacji znajdują się właśnie tam.

• Wpis o serwowaniu — pierwszy dostawca inferencji, który hostuje AuK, przekształca go z katalogu wag w wywoływalny model z ceną, a wtedy można go wypróbować przez router, zamiast samodzielnie go hostować.

AuK i AuK-Flash są prawdziwe, ale niedokończone — tak jak zwykle bywają najciekawsze otwarte wydania: wagi są uczciwe, a historia wokół nich nie została jeszcze napisana. Dodaj tencent/AuK-Flash do zakładek, traktuj każde twierdzenie o możliwościach jako zgłoszone przez dostawcę, dopóki nie pojawi się publikacja naukowa lub niezależny benchmark, i sprawdź, czy najbliższe dni przyniosą kod, który zmieniłby to z obiecującego artefaktu w coś, co da się zbudować.