
AuK: Tencent ha silenziosamente reso open source un modello vocale da 1.5B che tratta ogni attività audio come un comando testuale.
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Ecco una frase che nessun singolo strumento vocale scaricabile oggi farà in un solo passaggio: prendi questa registrazione, sostituisci la parola "house" con "home", alza il tono di un semitono, elimina il respiro prima dell'ultima frase, ripulisci il rumore di fondo, e poi rileggi il risultato con una voce completamente nuova descritta solo come "un uomo di mezza età dalla voce calda con un leggero accento cantonese". La risposta di Tencent a quella frase è AuK, un "modello fondazionale per la generazione e la modifica del parlato" da 1,5 miliardi di parametri, reso open-source questa settimana senza post di lancio né comunicato stampa — e la cui controparte distillata AuK-Flash ora arriva con l'unica cosa che mancava a questa storia quando l'abbiamo scritta per la prima volta: un rapporto tecnico con i numeri. "AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing" (arXiv:2609.08936, cs.SD, inviato il 2026-09-08) è ora citato sia nella scheda del modello su Hugging Face sia nel README di GitHub, con l'articolo datato 2026-09-08 e la notizia del repository del codice datata 2026/09/09. Ciò che il rapporto non fa è risolvere la questione che importava — ogni cifra in esso è di Tencent, calcolata su baseline scelte da Tencent, e al 2026-09-10 nessuno al di fuori dell'azienda ne ha riprodotta una sola.
Questo è un articolo su ciò che sappiamo finora, rivisto una volta. Tencent non ha ancora annunciato AuK su nessuno dei suoi canali principali che possiamo trovare, quindi il quadro è il seguente: le schede dei modelli e i repository Hugging Face per AuK e AuK-Flash, il repository del codice sotto l'organizzazione Tencent-Hunyuan, il sito del progetto su auk-project.github.io e ora il paper. Quest'ultima aggiunta cambia ciò che è conoscibile — l'architettura, la ricetta di addestramento e i numeri di valutazione sono descritti in dettaglio per la prima volta — senza cambiare ciò che è verificato. Considera tutti i dati numerici di seguito come riportati dal fornitore, perché è esattamente quello che sono, e nota che i confronti del report sono interamente contro altri modelli open, non contro le piattaforme vocali ospitate e chiuse con cui AuK competerebbe realmente.
Cosa è stato effettivamente rilasciato, e con quanto poco rumore
La cronologia resta il riepilogo più onesto del rilascio, con una correzione rispetto alla nostra prima lettura. I repository Hugging Face sono stati creati a metà agosto — AuK il 2026-08-18 — ma sono rimasti inattivi fino a questa settimana. Quando abbiamo letto la scheda del modello AuK il 2026-09-09, la sua unica riga di aggiornamento era datata 2026-09-07; un giorno dopo quella stessa riga riporta 2026/09/09 e indirizza i lettori al paper e alle demo Spaces. Il repository GitHub, che contiene il codice di inferenza e training, è stato creato il 2026-08-19 e l'ultimo push risale al 2026-09-09. In altre parole: prima i pesi, poi il codice, poi un report tecnico — tre rilasci scaglionati in quattro giorni, e ancora nessun annuncio dai canali principali di Tencent al momento della stesura.
• I pesi si trovano su Hugging Face nell'organizzazione tencent e sono rispecchiati su ModelScope sotto Tencent-Hunyuan — due mirror, stessa licenza MIT.
• Ogni repository del modello contiene un singolo checkpoint safetensors oltre a una config e una VAE: auk_base.safetensors da 6,12 GB e vae.safetensors da 0,64 GB per AuK; la stessa struttura per AuK-Flash. La scheda del modello richiede di scaricare anche Qwen/Qwen2.5-Omni-3B, l'encoder di testo che AuK carica separatamente in fase di esecuzione.
• La narrativa del "nessuno se n'è accorto" è scaduta, e rapidamente. Il repository del codice era fermo a zero stelle e zero fork quando abbiamo controllato il 2026-09-09; entro il 2026-09-10 mostra 216 stelle, 12 fork e la sua prima issue aperta. La scheda AuK riporta circa trenta download nell'ultimo mese con 26 mi piace. Ciò che non è cambiato: i tab di discussione sono vuoti, e la scheda nota ancora che il checkpoint non è distribuito da alcun provider di inferenza.
• Sia le schede dei modelli, sia il README e gli Space demo collegati al paper su Hugging Face e ModelScope. Lo Space di Hugging Face non era raggiungibile pubblicamente senza accesso quando abbiamo verificato, quindi considera il percorso "provalo nel tuo browser" come non confermato per gli utenti anonimi.

La scheda Hugging Face qui sopra costituisce ancora l'intera superficie pubblica di una release installabile: una scheda del modello, una configurazione, due file safetensors e una licenza. Ciò che è stato aggiunto in seguito è il livello di documentazione che la circonda — un paper, una tabella di benchmark e un blocco di citazione — e nessuno di questi elementi cambia il fatto che dietro non vi siano né un changelog, né un thread di discussione, né un elenco di provider di inferenza.
Il concept: un'unica interfaccia di istruzioni, sedici task vocali.
L'affermazione di AuK non è che sia il miglior modello di sintesi vocale mai rilasciato. È che la generazione è solo una delle cinque famiglie di compiti vocali su cui il modello è stato addestrato attraverso un'unica interfaccia in linguaggio naturale, in cui una richiesta è un messaggio di chat che può contenere testo più un file audio di riferimento opzionale. L'articolo formalizza esattamente la tassonomia che il sito del progetto stava già pubblicizzando:
• Generazione vocale — TTS zero-shot (pronuncia questo testo con la voce del clip di riferimento) e TTS basato su istruzioni (genera parlato a partire dalla sola descrizione di una voce, senza alcun audio di riferimento).
• Modifica dei contenuti — riscrivi ciò che è stato detto: sostituisci, inserisci o elimina parole in una registrazione esistente; e modifica dei testi, che riscrive i testi cantati preservando melodia e voce.
• Modifica acustica — tonalità in semitoni, variazione della velocità di parlato e volume in decibel.
• Editing paralinguistico — cambiamenti emotivi, modifiche del timbro a partire da una descrizione, de-accentazione, aggiunta o rimozione di suoni non verbali (respiri, risate, colpi di tosse) e conversione tra parlato normale e sussurro mantenendo la voce del parlante.
• Miglioramento e separazione — denoising e dereverberazione del parlato, separazione del parlato per ordine di intervento, separazione musica/vocale ed estrazione del parlante target identificata da ciò che dice il parlante.
Il caso instruction-TTS è quello che separa questo prodotto da una tipica release di voice cloning: AuK leggerà una frase con una voce che esiste solo come descrizione testuale — l'esempio della stessa documentazione specifica una donna sulla ventina che parla con un partner appena rientrato a casa, calorosa, premurosa e leggermente civettuola, con un timbro dolce e morbido e una leggera intonazione ascendente a fine frase, il tutto senza alcun clip di riferimento allegato. Ciò elimina la necessità di una registrazione di riferimento, che è il costo di accesso abituale del cloning. Il report quantifica per la prima volta questo compito, ed è uno dei pochi casi in cui AuK batte nettamente il campo invece di prevalere di misura.
All'interno del "1.5B": il numero sottovaluta il runtime.
Il conteggio dei parametri di AuK si riferisce al diffusion transformer, non all'intera pipeline, e il paper ora specifica entrambe le componenti. Il backbone è un trasformatore ibrido a flusso rettificato — trenta livelli composti da dieci blocchi MMDiT a doppio flusso seguiti da venti blocchi DiT unificati a flusso singolo, dimensione nascosta 1536, 24 teste di attenzione di dimensione 64, larghezza intermedia SwiGLU di 3072, da cui deriva la cifra di "circa 1,5 miliardi di parametri". Attorno ad esso si trovano due componenti caricati separatamente: un LLM multimodale (Qwen/Qwen2.5-Omni-3B) che trasforma l'istruzione e qualsiasi audio di riferimento in condizionamento semantico, e un VAE audio causale a 24 kHz — la config lo chiama BigVGANFlowVAE — che gestisce latenti a 64 dimensioni a una frequenza di 50 Hz, con larghezze dei canali dell'encoder fino a 768 e del decoder fino a 1536. Quindi l'intero runtime è composto dal backbone di ~1,5B più un encoder da 3B più il VAE, e le istruzioni di download sono esplicite sul fatto che l'encoder è un checkpoint separato con termini propri.
Training, secondo il report, si è svolto in fasi e a una scala che il sito del progetto lasciava solo intravedere: un warm-up di sola generazione di 50.000 aggiornamenti, poi 600.000 aggiornamenti congiunti di generazione ed editing, su circa 3,03 miliardi di istanze istruzione–audio che rappresentano circa 1,95 milioni di ore di supervisione effettiva, su 256 GPU, con ulteriori 1,24 milioni di aggiornamenti sul VAE. Il post-training ha combinato l'ottimizzazione delle preferenze basata sul feedback umano con l'apprendimento per rinforzo basato su ricompense, costruito su 818 gruppi di preferenze informativi e 9.080 candidati valutati, pool di prompt RL di 10.000 prompt zero-shot e 5.000 prompt di istruzione, 30.000 campioni style-judge e un modello di ricompensa ottimizzato a partire da Qwen2.5-Omni-7B. È uno stack di post-training serio per un rilascio open da 1,5B, ed è anche un promemoria del fatto che "open weights" descrive l'artefatto, non la potenza di calcolo che lo ha prodotto — un punto da tenere a mente quando si valuta se si potrebbe riprodurlo.

Ogni dato in quella scheda tecnica è letto dai repository e dal sito web di Tencent piuttosto che misurato da noi, e l'articolo non ha cambiato questo — ha solo spostato più di quelle voci da "dichiarato" a "documentato". L'unico numero che è stato effettivamente testato da quando abbiamo pubblicato per la prima volta è l'attività del repository stesso, che è passata da zero stelle a qualche centinaio in un giorno.

Il sito del progetto resta il luogo in cui vivono il diagramma dell'architettura e il co-branding accademico, ed è ancora il modo più economico per vedere la forma del modello: un modello linguistico multimodale per il condizionamento semantico, un VAE a 50 Hz per l'acustica e un trasformatore ibrido con un obiettivo di flow-matching. La sua sezione benchmark, che alla nostra prima occhiata elencava un apparato di valutazione senza punteggi, ora ha un documento a cui fare riferimento.
Il rapporto tecnico arriva, e i numeri sono di Tencent
Questa è la sostanza dell'aggiornamento. L'articolo riporta risultati su sette suite di valutazione — lo stesso elenco che il sito del progetto aveva pubblicizzato senza numeri — e sulla maggior parte degli assi di generazione e modifica dei contenuti, AuK è in testa nel campo open. Leggeteli come una tabella di benchmark del vendor, perché è esattamente ciò che sono: tencent ha eseguito ogni confronto, scelto ogni baseline e non ha ancora pubblicato alcun codice per riprodurre l'harness.
Zero-shot TTS su Seed-TTS-Eval: AuK ottiene una media di 2.65 WER con una similarità del parlante di 0.795, contro Qwen3-TTS a 3.07 e 0.745, Seed-TTS a 3.65 e 0.778, e VoxCPM2 a 3.65 e 0.767. AuK-Flash si attesta a 2.85 e 0.790. I migliori split singoli sono 1.02 WER sul test set inglese e 5.91 su quello cinese difficile.
• TTS controllato da istruzioni su InstructTTSEval: AuK ottiene 83.37 in cinese e 81.60 nell'aderenza alle descrizioni in inglese, contro Qwen3-TTS-VD con 81.10 e 82.40 e MOSS-VoiceGenerator con 80.00 e 82.00. AuK-Flash è a 78.80 in cinese, ma eguaglia il miglior punteggio inglese del settore con 82.40.
• Editing dei contenuti su SpeechEditBench: 91.83 di accuratezza contro il 76.46 di Ming-UniAudio, e 71.33 sulla prosodia contro 26.50 — i due divari più ampi dell'intero report.
• Editing guidato da istruzioni su Ming-Freeform-Audio-Edit, configurazione completa: l'errore di parola scende da 10.46 a 3.09 sul cinese e da 14.28 a 3.96 sull'inglese rispetto a Ming-UniAudio, con l'accuratezza di editing che sale da 79.62 a 91.47 e da 70.98 a 85.25. Sulle modifiche acustiche lo stesso confronto porta l'errore di parola da 5.01 a 2.02 in cinese e da 10.75 a 3.48 in inglese.
• Editing paralinguistico su MMAE-Speech: tasso di aderenza alle istruzioni 48.23 e riscrittura del contenuto 88.11, contro Step-Audio-EditX a 43.52 e 77.27, e Ming-UniAudio a 34.13 e 76.01. AuK-Flash registra il miglior recall del modello di editing nella tabella con 13.85.
• Restauro, dove il modello è competitivo piuttosto che dominante: DNS Challenge word error desincronizzato 2.66 con similarità del parlante 0.99 contro RE-USE a 3.31; CHiME-4 word error 7.98 contro RE-USE a 10.71; Libri2Mix word error 9.12 contro MossFormer2-SS a 9.34; e VCTKSR word error 3.06 con similarità 0.97.
• La VAE stessa, valutata separatamente: AuK-VAE raggiunge 4.143 PESQ sul parlato, 3.833 su audio generale e 3.884 sulla musica, contro MiniMax-H3-AudioVAE con 3.633, 2.835 e 2.801 — una vittoria netta che conta più di quanto sembri, perché un latente acustico lossy limita ogni compito costruito sopra di esso.
Il pattern che emerge da questi punti elenco è più interessante delle vittorie da titolo. AuK è molto avanti su tutto ciò che significa "cambiare ciò che viene detto o come suona, mantenendo tutto il resto" — editing dei contenuti, prosodia, modifiche acustiche, ricostruzione. È molto più vicino al campo sull'editing emotivo e paralinguistico, dove la sua accuratezza emotiva SpeechEditBench di 9.94 è appena distinguibile dal 3.43 di Ming-UniAudio su un benchmark in cui entrambi sono deboli, e il suo punteggio acustico complessivo di 37.07 si colloca nello stesso intervallo dei baseline. Quindi "un modello per ogni task vocale" è l'inquadramento di Tencent; ciò che il report mostra realmente è un modello che eccelle in diversi di essi ed è semplicemente presente per il resto.
Due checkpoint: AuK e AuK-Flash
Tencent ha distribuito due varianti sotto la stessa licenza MIT. AuK è il modello base a piena qualità e il report fissa le sue impostazioni di campionamento a 32 valutazioni di funzione con una scala di classifier-free guidance di 2,0. AuK-Flash è la versione distillata: inizializzazione di consistenza e obiettivo Decoupled DMD instradato per attività, con generazione in quattro passi fissi e guidance completamente disattivata, che il paper riporta come uno speedup di 4,5× in wall-clock rispetto al modello completo in condizioni corrispondenti. I numeri del paper tengono Flash vicino al modello completo nella maggior parte dei compiti di generazione — 2,85 di errore medio sulle parole e 0,790 di similarità su Seed-TTS-Eval — ed è questo che rende l'affermazione sulla velocità degna di essere verificata piuttosto che scartata: una diffusione a quattro passi con qualità vicina a quella dell'insegnante è ciò che renderebbe interattivo un editor vocale da 1,5B su una singola GPU. Detto questo, "condizioni corrispondenti" è l'espressione usata da Tencent per descrivere il proprio benchmark, e un numero di 4,5× misurato dagli autori è esattamente il tipo di affermazione che richiede una verifica da parte di terzi prima di influenzare qualsiasi decisione di acquisto.
Cosa puoi eseguire oggi
La portata pratica è più ampia di un tipico rilascio silenzioso di pesi, perché il codice è arrivato insieme a esso. L'installazione è destinata a Python 3.10 tramite uv o Conda, e il README offre opzioni di installazione aggiuntive che includono Gradio, nodi ComfyUI o lo stack di fine-tuning. Lo strumento a riga di comando auk-infer copre ogni attività con la stessa forma di messaggio: --instruction è sempre richiesto, e --audio è opzionale a seconda dell'attività. Un server Gradio (auk-gradio) espone i modelli con un selettore, e ci sono nodi ComfyUI personalizzati con un flusso di lavoro riutilizzabile, sebbene l'integrazione sia documentata con un limite di 30 secondi sulla sequenza complessiva di sorgente e destinazione. Un'API Python replica la CLI, e una pipeline di fine-tuning leggera addestra su JSONL di coppie istruzione-audio usando lo stesso formato di messaggio dell'inferenza. Il README descrive anche un Prompt Enhancer che trasforma richieste in forma libera in comandi auk-infer pronti da eseguire; richiede un endpoint di chat compatibile con OpenAI e ripiega su un modello locale SenseVoiceSmall per il riconoscimento vocale quando non sono impostate credenziali ASR cloud. Una limitazione attuale è documentata chiaramente: Qwen3-Omni non è ancora supportato come percorso dell'encoder, quindi il checkpoint Qwen2.5-Omni-3B resta quello da scaricare.
Ciò che i documenti non ti danno ancora è un requisito hardware minimo. Nessuna cifra di VRAM viene pubblicata per l'inferenza. I file di configurazione contengono una nota sul gradient checkpointing relativa a un picco di ~91 GB che scende a ~75 GB, che descrive il profilo di memoria in fase di addestramento piuttosto che un numero realistico di inferenza single-shot, e il comando di riferimento che carica AuK e AuK-Flash insieme li distribuisce su due GPU — pur notando che entrambi possono condividerne una. Metti in conto il download stesso: circa 6,8 GB per variante più l'encoder Qwen2.5-Omni-3B, poi misura la memoria sulla tua GPU.
Cosa non è confermato
Essere precisi sull'ignoto è ancora lo scopo di occuparsi di un modello così presto, e il rapporto ha rimosso esattamente una voce da questo elenco lasciando intatto il resto:
• Non esiste alcuna esecuzione indipendente che possiamo trovare. Nessun campione vocale di terze parti, nessuna replica dei benchmark, nessuna impressione nei thread di discussione. La prima issue aperta del repository è stata segnalata e rimasta senza risposta, e il conteggio dei download della scheda del modello è ancora nell'ordine delle decine, quindi il divario tra una tabella pubblicata e una riprodotta è attualmente l'intera storia.
• La valutazione è auto-condotta e limitata in un modo specifico. Ogni baseline nel report è un altro modello open-weight — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Nessuna delle piattaforme vocali hosted chiuse con cui un acquirente confronterebbe realmente AuK compare, quindi "leader del settore" qui significa "leader nel campo open selezionato da Tencent".
Il nome "AuK" non viene mai espanso da nessuna parte, né nell'articolo, né nelle card, né nel codice, e collide duramente nelle ricerche con il seabird, l'American University of Kuwait e repository non correlati.
• Il team ora è almeno visibile — il paper conta 33 autori guidati da Ziyang Ma, con affiliazioni che spaziano dall'organizzazione Tencent Hunyuan, alla Shanghai Jiao Tong University, allo Shanghai Innovation Institution e alla Nanyang Technological University — ma chi all'interno di Tencent possiede il modello giorno per giorno, e se si tratti di una linea Hunyuan o di una collaborazione accademica separata, resta non dichiarato.
• La copertura linguistica è ancora solo parzialmente documentata: la scheda AuK-Flash dichiara cinese e inglese e gli esempi di codice mescolano entrambe, ma il modello base non ha un elenco linguistico formale. La situazione delle licenze è analoga — AuK stesso è MIT, mentre il suo encoder Qwen scaricato separatamente ha i propri termini, quindi "modello MIT" e "tutto ciò che serve per eseguirlo è MIT" non sono la stessa affermazione.
Perché un modello vocale unificato open-weights è importante
Leggere la lista di compiti di AuK alla luce di ciò che un builder fa realmente oggi rende la scommessa più chiara di quanto non fosse prima che arrivassero i numeri. Eseguire tutti quei compiti con gli strumenti esistenti significa concatenare diversi modelli specializzati — un checkpoint open per il cloning, uno diverso per l'enhancement, un separatore a parte, e modifica manuale o assistita da modello per il contenuto — oppure noleggiare diverse API proprietarie ospitate, ciascuna con un prezzo per attività e per minuto di audio, e nessuna modificabile nel modo descritto da AuK. Un singolo checkpoint open-weight che tratta tutto ciò come un unico problema di generazione condizionata dal testo è un oggetto genuinamente diverso, e il report ora supporta una versione più netta di quella affermazione rispetto al marketing: la parte di editing è reale, non aspirazionale. Il voice cloning è stato commoditizzato nell'ultimo anno, ma l'editing di contenuto e prosodia guidato da istruzioni è dove le piattaforme proprietarie ospitate guadagnano ancora i loro margini, e un 91.83 contro 76.46 sull'editing dei contenuti è la prima prova che un modello open può conquistare quel terreno.
La doverosa precisazione è che questo è un modello di diffusione con un modello linguistico da 3B aggiunto per il condizionamento, e che eredita i costi di quella forma. La qualità per attività è disomogenea — eccellente dove il compito è "preserva tutto tranne la modifica", più debole sul piano emotivo — e non esiste un endpoint ospitato, nessun supporto al batching e nessuna latenza pubblicata per qualsiasi cosa tranne il confronto interno della variante Flash. Per i componenti di una pipeline vocale che lo circondano — l'LLM che decide cosa dire e l'endpoint chat compatibile con OpenAI di Prompt Enhancer — un'API di routing è la scelta naturale, e OrcaRouter mette a disposizione oltre 200 modelli al prezzo di listino del provider senza alcun ricarico, così che quella metà dello stack richiede una sola chiave e nessun secondo contratto. La metà audio è ancora una GPU che controlli tu e un checkpoint che nessuno al di fuori di Tencent ha verificato.
Chi dovrebbe guardare ora, e chi dovrebbe aspettare?
Per i ricercatori del parlato, i costruttori di strumenti e chiunque abbia il compito di valutare nuovi modelli vocali, il caso per scaricare AuK questa settimana è più forte di quanto non fosse il primo giorno e arriva ancora con la stessa avvertenza. Ora si ottiene un'architettura documentata, una ricetta dall'aspetto riproducibile e una tabella completa di obiettivi da battere — che è esattamente ciò che rende un'affermazione non riprodotta degna di essere attaccata. Il costo di essere precoci rimane un fine settimana di configurazione e una GPU. Per chi sceglie uno stack vocale di produzione, il report cambia la forma della decisione senza risolverla: ora ci sono numeri con cui discutere, ma sono quelli del fornitore, escludono le piattaforme chiuse contro cui si farebbe realmente il benchmark, e non c'è ancora un'API, né un minimo di VRAM, né una track record. Osservate, in ordine: una replica indipendente delle righe di Seed-TTS-Eval e SpeechEditBench; campioni pubblicati o una demo Space raggiungibile; e un provider di inferenza o un'API ospitata che adotti AuK, a quel punto il prezzo pass-through dalla nostra parte è il prezzo di listino del provider, stesso giorno, perché è ciò che significa margine 0%. La domanda interessante non è più se Tencent abbia rilasciato un altro modello TTS — è se un modello aperto possa davvero reggere tutte e cinque quelle famiglie di compiti contemporaneamente, e ora che Tencent ha pubblicato la propria risposta, l'unica cosa rimasta è che qualcun altro la verifichi.
