
AuK-Flash e AuK: Tencent ha rilasciato in sordina un modello vocale aperto che genera, modifica e separa l'audio.
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Tencent ha pubblicato questa settimana due dei modelli vocali open source più significativi del 2026 senza dirlo praticamente a nessuno. Intorno al 7 settembre, l'organizzazione Tencent su Hugging Face ha reso pubblico AuK — "un modello foundation da 1,5B per la generazione e il montaggio vocale", come recita la sua stessa model card — e AuK-Flash, la variante distillata a quattro passi dello stesso modello, entrambi con licenza MIT. Non c'è alcun post sul blog di Tencent, nessun annuncio social e nessun comunicato stampa associato a nessuno dei due repository; tra i due, sono stati scaricati poche decine di volte, il repository del codice a cui le card rimandano non è raggiungibile, e nessun benchmark indipendente esiste in alcun punto del web indicizzato. Questo articolo spiega cosa è realmente conoscibile dai due repository, dai file di configurazione e dalla pagina di progetto di Tencent stessa — e cosa rimane ancora non verificato.
L'affermazione merita di essere presa sul serio anche senza numeri indipendenti, perché la portata è insolita. AuK non è l'ennesimo modello di clonazione vocale. Attraverso una singola interfaccia di istruzioni in linguaggio naturale, promette text-to-speech zero-shot e basato su istruzioni, editing che interviene su ciò che viene detto, su come viene detto e sui suoni non verbali che lo circondano, oltre a miglioramento del parlato, separazione del parlato e separazione musicale. Il settore ha storicamente costruito un modello specialista diverso per ciascuno di questi compiti. La scommessa di Tencent, in un unico backbone generativo, è che un singolo modello possa fare tutto questo — e che AuK-Flash possa farlo abbastanza velocemente per un uso quasi in tempo reale.
Due checkpoint, una release
I timestamp dell'API Hugging Face raccontano la storia di un repository rimasto privato prima di essere pubblicato. Il repository di base tencent/AuK è stato creato il 18 agosto 2026 e tencent/AuK-Flash il 21 agosto; entrambi sono stati modificati l'ultima volta l'8 settembre, e la model card riporta una notizia datata 7 settembre — "[2026/09/07] AuK è ora open-source. Codice e pesi del modello sono disponibili pubblicamente." La lettura naturale è che Tencent abbia creato i repository tra metà e fine agosto, li abbia resi pubblici intorno al 7 settembre e abbia ritoccato di nuovo la card l'8 settembre. Non appare nulla su questo modello nel web indicizzato, e i contatori di download sono nell'ordine delle decine — quindi "rilascio silenzioso" non è una scelta retorica, è la situazione letterale.
![A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'](https://cms.orcarouter.ai/api/media/file/2-723.png)
I due checkpoint condividono la stessa architettura, colti in due diversi momenti del loro ciclo di vita. AuK è l'insegnante: un modello di base pensato per la generazione di alta qualità. AuK-Flash è lo studente: distillato per un'inferenza rapida in quattro passaggi, il che lo rende la destinazione di deploy più interessante e il motivo per cui apre il titolo. Nella pagina del progetto di Tencent, la famiglia di modelli viene presentata come composta da circa 1,5 miliardi di parametri, addestrata su quelli che la scheda descrive semplicemente come "milioni di ore di dati audio eterogenei" e che la pagina del progetto specifica essere circa 1,95 milioni di ore di supervisione effettiva, distribuite su circa 3,03 miliardi di istanze istruzione-audio. La pagina del progetto riporta anche i marchi della Shanghai Jiao Tong University e di Tencent Hunyuan, collocando AuK all'interno della linea di ricerca sui modelli open di Tencent Hunyuan, piuttosto che in una famiglia di prodotti commerciali. L'addestramento non è l'unica fase successiva al pre-training: Tencent descrive una fase di post-training che combina l'ottimizzazione delle preferenze basata sul feedback umano per l'editing a campo aperto con l'apprendimento per rinforzo basato su ricompense per la generazione vocale.
La tabella delle varianti nella scheda del modello è inequivocabile su quale sia quale: AuK è "il modello base per la generazione di alta qualità," AuK-Flash è "il modello distillato per l'inferenza rapida in 4 passaggi." Entrambi sono scaricabili da Hugging Face e da ModelScope sotto il namespace Tencent-Hunyuan, ed entrambi sono rilasciati con licenza MIT — tra le licenze più permissive che un rilascio open-weights possa avere, il che è rilevante per chiunque voglia costruirci un prodotto sopra.
Ciò che un modello basato su istruzioni fa realmente
L'interfaccia di AuK è una singola casella di prompt: si fornisce al modello un'istruzione in linguaggio naturale e, quando l'attività lo richiede, un riferimento audio, e questo restituisce audio. Raggruppate secondo la tassonomia della scheda, le cinque famiglie di attività sono:
• Generazione vocale — TTS zero-shot che clona una voce da una clip di riferimento, e "instruct TTS" che sintetizza il parlato da una sola descrizione vocale ("una voce femminile calda, leggermente più lenta"), senza alcun audio di riferimento.
• Modifica dei contenuti — riscrittura di ciò che viene detto: sostituzione, inserimento o rimozione di parole in una registrazione esistente, e modifica dei testi che riscrive le parole di una clip cantata mantenendo la melodia e la voce del cantante.
• Modifica acustica — tono in semitoni, velocità di parlato e volume in decibel, ciascuno regolabile su una clip esistente, preservando identità e contenuto.
• Editing paralinguistico — emozione, timbro (a una descrizione), de-accentazione, aggiunta o rimozione di suoni non verbali come respiri, risate e colpi di tosse, e conversione tra parlato normale e sussurro.
{{1}}Miglioramento e separazione{{/1}} — {{2}}miglioramento del parlato (rimozione del rumore e del riverbero){{/2}}, {{3}}separazione del parlato per ordine di intervento{{/3}}, {{4}}separazione musicale che estrae la voce cantata da un mix{{/4}} ed estrazione del parlante di interesse identificato da ciò che dice.
Quell'elenco è il vero elemento distintivo. I sistemi vocali aperti più capaci del 2026 sono forti in uno o due di questi aspetti — clonazione vocale e TTS sono l'ambito più affollato — e deboli o assenti sul resto. La scommessa di AuK è l'ampiezza: gli stessi pesi, lo stesso formato di istruzioni, in generazione, editing e separazione, cioè un tipo di portata che di norma viene distribuita solo come insieme di modelli specialistici ottimizzati.
Come è costruito
Leggendo i repository e la pagina del progetto insieme si ottiene un quadro architetturale coerente. AuK non è un modello linguistico audio autoregressivo del tipo che legge testo ed emette token. È un sistema di diffusione flow-matching nello stile dei modelli per immagini, composto da tre parti:
• Un grande modello linguistico multimodale — Qwen/Qwen2.5-Omni-3B, scaricato separatamente — legge l'istruzione e qualsiasi audio di riferimento e produce il condizionamento semantico.
Un VAE audio addestrato congiuntamente su parlato, audio generale e musica codifica e decodifica a 24 kHz attraverso latenti acustici a 50 Hz; la configurazione del repository lo identifica come un BigVGANFlowVAE con una dimensione latente di 64 e un sottocampionamento di 480 volte, e lo distribuisce come file separato vae.safetensors.
• Il nucleo generativo è un Transformer ibrido a flusso rettificato: blocchi MMDiT a doppio flusso che mantengono separati il condizionamento testuale e quello audio, seguiti da blocchi DiT unificati a flusso singolo che li combinano, addestrati con un obiettivo di flow matching. La configurazione rilasciata mostra un modello con larghezza 1.536, 24 teste, 10 strati a doppio flusso e 20 strati a flusso singolo.
AuK-Flash è lo stesso transformer dopo la distillazione. Tencent descrive un processo in due fasi — inizializzazione della consistenza a livello di traiettoria, poi un obiettivo DMD "task-routing decoupled" — completato con supervisione di regressione a predizione pulita. Il risultato, secondo la pagina del progetto, è una qualità di generazione vicina a quella del teacher in quattro passi di campionamento, senza guida classifier-free all'inferenza, con un'accelerazione di circa 4,5× in tempo reale rispetto al modello completo in condizioni equivalenti. Queste sono affermazioni del fornitore, non riprodotte, ma sono la ragione concreta per cui AuK-Flash è la variante a cui uno sviluppatore ricorrerebbe.
Cosa afferma Tencent, e cosa un lettore può verificare
La pagina del progetto avanza forti affermazioni qualitative — AuK è "leader" nella generazione e nell'editing e "competitiva" nei task di restauro a livello di segnale, come enhancement e separazione — e elenca le suite di benchmark alla base: Seed-TTS-Eval e InstructTTSEval per la generazione, MMAE-Speech, SpeechEditBench e Ming-Freeform-Audio-Edit per l'editing, DNSMOS e UTMOS per la qualità percettiva, e DNS Challenge, CHiME-4 e Libri2Mix per enhancement e separazione. Nessun punteggio numerico è pubblicato sulla pagina, non c'è un paper dietro e nessuna terza parte ha riprodotto alcunché di tutto ciò. Ognuna di queste affermazioni è dichiarata dal fornitore e va letta in quest'ottica finché non esista una verifica indipendente.

Due ulteriori affermazioni vanno segnalate perché non hanno superato un controllo diretto in data 9 settembre 2026. In primo luogo, la scheda afferma che il codice è disponibile pubblicamente e collega a github.com/Tencent-Hunyuan/AuK per le istruzioni di installazione, Gradio, ComfyUI e fine-tuning — ma quel repository restituisce un HTTP 404 al momento della stesura, e non figura tra i repository pubblici dell'organizzazione Tencent-Hunyuan. Il codice potrebbe semplicemente essere ancora in fase di distribuzione; in ogni caso, "il codice è disponibile" è attualmente solo un'affermazione della scheda, non qualcosa su cui un lettore possa agire. In secondo luogo, la scheda indica demo Spaces su Hugging Face e ModelScope: lo studio ModelScope risponde, ma lo Space Hugging Face, al controllo, ha mostrato una barriera di autorizzazione, quindi le demo sono al massimo parzialmente pubbliche.
Cosa c'è, cosa manca
Fare il punto al 9 settembre 2026 separa un vero rilascio da uno completo.
• Disponibili — due set di pesi scaricabili con licenza MIT: tencent/AuK per il modello base e tencent/AuK-Flash per la variante distillata in quattro passi, ciascuno di circa 6,1 GB per il trasformatore di diffusione, più una VAE inclusa, replicati su Hugging Face e ModelScope.
• Presente — una gamma di attività insolitamente ampia sotto un'unica interfaccia di istruzioni: generazione, modifica di contenuti, modifica acustica e paralinguistica, miglioramento e separazione, tutto in un'unica famiglia di modelli.
• Presentazione — una storia concreta di "velocità": AuK-Flash viene distillato in quattro step senza classifier-free guidance, con un'accelerazione di 4,5× del tempo di esecuzione, dichiarata dal fornitore.
• Mancante — un annuncio. Nessun post sul blog Tencent, post sui social, comunicato stampa o post sul canale Hunyuan punta ancora a nessuno dei due repository.
• Mancante — un articolo o un rapporto tecnico. Il blocco di citazione nella pagina del progetto è un segnaposto senza autori e senza identificativo arXiv, e non ci sono numeri pubblicati a sostegno delle affermazioni sul benchmark.
• Mancante — codice accessibile. Il repository GitHub e il Cookbook a cui la scheda rimanda restituiscono 404 al momento del controllo dello stato, quindi oggi l'unico artefatto eseguibile sono i pesi più tutto ciò che la community assembla attorno ad essi.
• Mancano — servizio di inferenza e valutazione indipendente. Nessun provider di inferenza ospita AuK, non esiste alcuna API ospitata e, con i download nell'ordine delle decine, nessuno ha ancora pubblicato una riproduzione.

Eseguire AuK-Flash oggi, o aspettare?
Se vuoi eseguire AuK-Flash da solo, il percorso di download è esplicito anche se il codice non lo è: fai pull di tencent/AuK-Flash e tencent/AuK (la base è opzionale a meno che tu non voglia il teacher), e anche di Qwen/Qwen2.5-Omni-3B, perché il checkpoint contiene solo i pesi del diffusion-transformer e del layer-fusion — l'encoder multimodale e la VAE vengono caricati da file separati in fase di esecuzione, e la scheda del modello segnala che la mancanza di chiavi text_encoder durante il caricamento è prevista. L'hardware è il vero vincolo. Si tratta di un diffusion transformer da ~1.5B il cui checkpoint da solo è di ~6.1 GB, affiancato da un encoder multimodale da ~3B e da una VAE, quindi una GPU da 24 GB è il punto di partenza ragionevole, non un modello da laptop; le note sulla memoria nella configurazione, che menzionano come il gradient checkpointing riduca i picchi di addestramento da circa 91 GB a 75 GB, riguardano l'addestramento e non vanno interpretate come requisiti per l'inferenza. Per quanto riguarda il software, la configurazione predefinita usa il backend flash-attention, ma la CLI di inferenza può ripiegare su un semplice backend di attenzione torch, il che elimina il passaggio di compilazione di flash-attn per una prima esecuzione.
Se valga la pena farlo oggi dipende da ciò che stai costruendo. Lo stato onesto delle cose è che questo è un modello da tenere d'occhio e da testare in una sandbox, non da inserire ancora in una pipeline di produzione: senza paper, senza codice accessibile e senza valutazione indipendente, le rivendicazioni sulle capacità poggiano interamente sulla parola di Tencent. Per un team che oggi vuole generazione, editing o separazione vocale tramite API, la scelta pragmatica è un modello che sia effettivamente servito, ed è proprio il ruolo che OrcaRouter svolge tra i modelli che dispongono di endpoint: un'unica API per oltre 200 modelli con i prezzi di listino dei provider applicati senza alcun ricarico, così il prezzo del fornitore è il tuo prezzo fin dal primo giorno, e failover automatico, così una novità non ancora comprovata può essere provata su una fetta di traffico reale senza scommetterci la pipeline. Nessuna di queste cose si applica ancora ad AuK o AuK-Flash, perché nessun servizio li espone. Nel momento in cui un provider ospiterà AuK, l'economia del router diventerà il modo economico per valutarlo; fino ad allora la scelta è self-hosting dei pesi o attendere.
Domande frequenti
AuK o AuK-Flash è disponibile tramite un'API?
No. Entrambe sono release basate solo sui pesi. Nessun provider di inferenza le ospita e non esiste alcuna API hosted, quindi oggi non c'è nulla da chiamare: l'unico modo per usarle è scaricare i pesi ed eseguirli da soli.
Qual è la differenza tra AuK e AuK-Flash?
La stessa famiglia di modelli in due stadi. AuK è il modello di base, pensato per la generazione di alta qualità; AuK-Flash è la sua variante distillata, ottimizzata per un'inferenza rapida in quattro passi senza guida classifier-free, che secondo Tencent è circa 4,5 volte più veloce del modello base a parità di condizioni. Questo dato sulla velocità è dichiarato dal produttore e non è stato misurato in modo indipendente.
AuK-Flash può essere utilizzato commercialmente?
I pesi sono rilasciati sotto licenza MIT, che ne consente l'uso commerciale a condizione che l'avviso di licenza sia conservato — la licenza open-weights comune meno restrittiva. Il repository di codice separato a cui la scheda rimanda non è raggiungibile al 9 settembre 2026, quindi la risposta pratica per il riutilizzo del codice è ancora aperta finché non apparirà.
Cosa guardare
• Il repository di codice — github.com/Tencent-Hunyuan/AuK — è l’artefatto mancante di maggior valore. Quando apparirà, i modelli di istruzioni del Cookbook trasformeranno l’elenco di attività sopra da marketing in qualcosa di eseguibile.
• Una prova indipendente — la prima riproduzione da parte di terzi stabilirà se le affermazioni "leader" sulla generazione e sull'editing sopravvivono al contatto con l'audio reale, e se AuK-Flash a quattro passi si avvicina davvero al modello base.
• Un articolo — la citazione nella pagina del progetto è un segnaposto, il che di solito significa che è in arrivo una sottomissione su arXiv; la ricetta di training, i numeri dei benchmark e i dettagli della distillazione si trovano tutti lì.
Una voce di catalogo per il serving — il primo provider di inferenza a ospitare AuK lo trasforma da una directory di pesi in un modello chiamabile con un prezzo, ed è in quel momento che diventa testabile tramite un router piuttosto che come progetto di self-hosting.
AuK e AuK-Flash sono reali ma incompleti, come spesso accade per le release open più interessanti: i pesi sono onesti e la storia che li circonda non è ancora stata scritta. Aggiungi ai preferiti tencent/AuK-Flash, considera ogni affermazione sulle capacità come una dichiarazione del fornitore finché non arriva un paper o un benchmark indipendente, e verifica se nei prossimi giorni arriverà il codice che trasformerebbe questo da un artefatto promettente in qualcosa di davvero realizzabile.
