« Grande carte de titre pour l'article « AuK-Flash & AuK — EXPÉDIÉ EN TOUTE DISCRÉTION, SEPTEMBRE 2026 », avec une pastille bleue indiquant « EXPÉDIÉ EN TOUTE DISCRÉTION — SEPT. 2026 », le titre « AuK-Flash & AuK », le sous-titre « Le nouveau modèle de génération et d'édition vocale de Tencent est arrivé sur Hugging Face avec de vrais poids — et sans aucune annonce », trois étiquettes indiquant « Famille 1,5B », « Licence MIT » et « Distillé en 4 étapes », et un texte complémentaire indiquant « Dépôts en ligne ~7 sept. 2026 — poids réels, dépôt de code en 404, aucune évaluation indépendante ». Le logo OrcaRouter est composé dans le coin inférieur droit. »
Guides & Insights

AuK-Flash et AuK : Tencent a discrètement publié un modèle vocal ouvert capable de générer, d'éditer et de séparer l'audio.

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tencent a publié cette semaine deux des modèles de parole open source les plus marquants de 2026, sans en parler à presque personne. Aux alentours du 7 septembre, l’organisation Tencent sur Hugging Face a rendu publics AuK — « un modèle de fondation de 1,5B pour la génération et l’édition de parole », selon les termes de sa propre fiche de modèle — et AuK-Flash, la variante distillée en quatre étapes du même modèle, tous deux sous licence MIT. Aucun billet de blog Tencent, aucune annonce sur les réseaux sociaux ni aucun communiqué de presse n’accompagne l’un ou l’autre dépôt ; entre les deux, ils n’ont été téléchargés que quelques dizaines de fois, le dépôt de code vers lequel pointent les fiches est inaccessible, et aucun benchmark indépendant n’existe nulle part sur le web indexé. Cet article expose ce qui est réellement connaissable à partir des deux dépôts, des fichiers de configuration et de la page projet de Tencent — et ce qui reste encore non vérifié.

Cette affirmation mérite d'être prise au sérieux même sans chiffres indépendants, car son ampleur est inhabituelle. AuK n'est pas un énième modèle de clonage vocal. Grâce à une interface d'instructions en langage naturel unique, il promet une synthèse vocale zero-shot et basée sur des instructions, une édition qui touche à ce qui est dit, à la manière dont c'est dit et aux sons non verbaux qui l'entourent, ainsi que l'amélioration de la parole, la séparation de la parole et la séparation de la musique. Historiquement, le domaine a construit un modèle spécialisé différent pour chacune de ces tâches. Le pari de Tencent, en un seul backbone génératif, est qu'un modèle unique peut toutes les accomplir — et qu'AuK-Flash peut le faire assez rapidement pour un usage quasi temps réel.

Deux points de contrôle, une version.

Les horodatages de l’API Hugging Face racontent l’histoire d’un dépôt resté privé avant d’être publié. Le dépôt de base tencent/AuK a été créé le 18 août 2026 et tencent/AuK-Flash le 21 août ; tous deux ont été modifiés pour la dernière fois le 8 septembre, et la fiche modèle porte une actualité datée du 7 septembre — « [2026/09/07] AuK est désormais open-source. Le code et les poids du modèle sont disponibles publiquement. » La lecture naturelle est que Tencent a construit les dépôts de la mi-août à la fin août, les a rendus publics vers le 7 septembre, puis a retouché la fiche le 8 septembre. Rien sur le modèle n’apparaît nulle part sur le web indexé, et les compteurs de téléchargement se situent dans les dizaines — donc « sortie discrète » n’est pas un choix rhétorique, c’est littéralement la situation.

A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'

Les deux points de contrôle sont la même architecture à différentes étapes de sa vie. AuK est le modèle enseignant : un modèle de base visant une génération de haute qualité. AuK-Flash est le modèle élève : distillé pour une inférence rapide en quatre étapes, ce qui en fait la cible de déploiement la plus intéressante et la raison pour laquelle il vient en premier dans le titre ici. Sur la page projet de Tencent, la famille de modèles est présentée comme comptant environ 1,5 milliard de paramètres, entraînée sur ce que la fiche décrit seulement comme « des millions d'heures de données audio diverses » et que la page projet précise à environ 1,95 million d'heures de supervision effective, réparties sur environ 3,03 milliards d'instances instruction-audio. La page projet porte également les mentions Shanghai Jiao Tong University et Tencent Hunyuan, ce qui place AuK dans la lignée de recherche des modèles ouverts de Tencent Hunyuan plutôt que dans une famille de produits commerciaux. L'entraînement n'est pas la seule chose survenue après le pré-entraînement : Tencent décrit une étape de post-entraînement qui mêle optimisation des préférences par retour humain pour des tâches d'édition ouvertes et apprentissage par renforcement basé sur les récompenses pour la génération de parole.

Le tableau des variantes dans la fiche du modèle est sans ambiguïté : AuK est « le modèle de base pour la génération de haute qualité », AuK-Flash est « le modèle distillé pour l'inférence rapide en 4 étapes ». Les deux sont téléchargeables depuis Hugging Face et ModelScope sous l'espace de noms Tencent-Hunyuan, et les deux portent la licence MIT — parmi les licences les plus permissives qu'une sortie de poids ouverts puisse avoir, ce qui importe pour quiconque veut construire un produit par-dessus.

Ce que fait réellement un modèle piloté par instructions

L'interface d'AuK est une boîte de prompt unique : vous donnez au modèle une instruction en langage naturel et, lorsque la tâche l'exige, une référence audio, et il renvoie de l'audio. Regroupées selon la taxonomie propre à la carte, les cinq familles de tâches sont :

• Génération de parole — TTS zero-shot qui clone une voix à partir d'un clip de référence, et « instruct TTS » qui synthétise la parole à partir d'une simple description vocale (« une voix féminine chaleureuse, légèrement plus lente »), sans aucun audio de référence.

• Édition de contenu — réécriture de ce qui est dit : remplacement, insertion ou suppression de mots dans un enregistrement existant, et édition de paroles qui réécrit les mots d'un extrait chanté tout en conservant la mélodie et la voix du chanteur.

• Édition acoustique — hauteur en demi-tons, débit de parole et volume en décibels, chacun réglable sur un clip existant tout en préservant l’identité et le contenu.

• Édition paralinguistique — émotion, timbre (à une description), désaccentuation, ajout ou suppression de sons non verbaux comme les respirations, les rires et les toux, et conversion entre la parole normale et le chuchotement.

• Amélioration et séparation — amélioration de la parole (débruitage et déréverbération), séparation de la parole selon l'ordre d'intervention, séparation musicale qui extrait la voix chantée d'un mixage, et extraction du locuteur cible identifié par ce que dit le locuteur.

Cette liste est le véritable différenciateur. Les systèmes vocaux ouverts les plus performants en 2026 excellent sur une ou deux de ces fonctions — le clonage vocal et la TTS étant le segment saturé — et se révèlent faibles, voire inexistants, sur le reste. Le pari d'AuK repose sur l'ampleur : les mêmes poids, le même format d'instructions, pour la génération, l'édition et la séparation — une portée qui, d'ordinaire, n'est fournie que sous la forme d'une collection de modèles spécialisés affinés.

Comment c'est construit

La lecture des dépôts et de la page du projet donne une image cohérente de l’architecture. AuK n’est pas un modèle de langage audio autorégressif du genre qui lit du texte et émet des jetons. C’est un système de diffusion par appariement de flux, dans la lignée des modèles d’images, avec trois parties :

• Un grand modèle de langage multimodal — Qwen/Qwen2.5-Omni-3B, téléchargé séparément — lit l'instruction et tout audio de référence et produit le conditionnement sémantique.

Un VAE audio entraîné conjointement sur la parole, l'audio général et la musique encode et décode à 24 kHz via des latents acoustiques de 50 Hz ; la config du dépôt l'identifie comme un BigVGANFlowVAE avec une dimension latente de 64 et un sous-échantillonnage de 480 fois, et le fournit sous forme de fichier vae.safetensors séparé.

• Le cœur génératif est un Transformer hybride à flux rectifié : des blocs MMDiT à double flux qui maintiennent séparés le conditionnement textuel et audio, suivis de blocs DiT unifiés à flux unique qui les combinent, entraînés selon un objectif de flow matching. La configuration publiée montre un modèle de largeur 1 536 avec 24 têtes, 10 couches à double flux et 20 couches à flux unique.

AuK-Flash est ce même transformer après distillation. Tencent décrit un processus en deux étapes — initialisation de cohérence au niveau des trajectoires, puis un objectif DMD « découplé du routage de tâches » — complété par une supervision par régression sur les prédictions propres. Selon la page du projet, le résultat est une qualité de génération proche de celle du professeur en quatre étapes d’échantillonnage, sans guidance sans classifieur à l’inférence, avec une accélération d’environ 4,5× en temps d’horloge à conditions égales par rapport au modèle complet. Ce sont des affirmations du fournisseur, non reproduites, mais elles constituent la raison concrète pour laquelle AuK-Flash est la variante vers laquelle un développeur se tournerait.

Ce que Tencent affirme, et ce qu'un lecteur peut vérifier

La page du projet avance de fortes affirmations qualitatives — AuK serait « leader » en matière de génération et d'édition, et « compétitif » sur les tâches de restauration au niveau du signal comme l'amélioration et la séparation — et liste les suites de benchmarks qui les sous-tendent : Seed-TTS-Eval et InstructTTSEval pour la génération, MMAE-Speech, SpeechEditBench et Ming-Freeform-Audio-Edit pour l'édition, DNSMOS et UTMOS pour la qualité perceptuelle, et DNS Challenge, CHiME-4 et Libri2Mix pour l'amélioration et la séparation. Aucun score chiffré n'est publié sur la page, aucun article scientifique ne la sous-tend, et aucun tiers n'en a reproduit les résultats. Chacune de ces affirmations provient du fournisseur et doit être lue comme telle tant qu'une exécution indépendante n'existe pas.

A screenshot of the AuK project page (auk-project.github.io) headed 'AuK: An Open-Source Foundational Model for Speech Generation and Editing' with GitHub, Hugging Face and ModelScope buttons and an AuK / AuK-Flash selector; a subtitle reading 'One model for every speech task'; the intro line 'AuK is a 1.5B-parameter foundational model that answers a natural-language instruction with edited or generated audio. A multimodal language model reads the instruction alongside optional reference audio; a 50 Hz VAE supplies acoustic latents; a hybrid transformer fuses both streams under a flow-matching objective'; an Abstract that begins 'We introduce AuK, an open-source foundational model that unifies speech generation and editing through a common interface of natural-language instructions and audio context' and describes roughly 3.03 billion instruction-audio instances and 1.95 million hours of supervision across five task families plus a 4.5x wall-clock speedup claim for AuK-Flash; and a figure titled 'Performance comparison with SOTA models across speech generation, editing, enhancement and separation' referencing Seed-TTS-Eval, InstructTTSEval, MMAE-Speech, SpeechEditBench, Ming-Freeform-Audio-Edit, DNS Challenge, CHiME-4 and Libri2Mix.

Deux autres affirmations méritent d'être signalées, car elles n'ont pas résisté à une vérification directe le 9 septembre 2026. Premièrement, la fiche indique que le code est disponible publiquement et renvoie vers github.com/Tencent-Hunyuan/AuK pour l'installation, Gradio, ComfyUI et les instructions de fine-tuning — mais, à l'heure où nous écrivons ces lignes, ce dépôt renvoie une erreur HTTP 404 et ne fait pas partie des dépôts publics de l'organisation Tencent-Hunyuan. Il se peut que le code soit simplement encore en cours de déploiement ; quoi qu'il en soit, « le code est disponible » reste pour l'instant une affirmation de la fiche, et non un élément sur lequel le lecteur peut s'appuyer. Deuxièmement, la fiche renvoie à des Spaces de démonstration sur Hugging Face et ModelScope : le studio ModelScope répond, mais l'espace Hugging Face exigeait une autorisation lors de la vérification ; les démos ne sont donc au mieux que partiellement publiques.

Ce qui est là, ce qui manque

Faire le point le 9 septembre 2026 sépare une vraie version d'une version complète.

• Disponibles — deux ensembles de poids téléchargeables sous licence MIT : tencent/AuK pour le modèle de base et tencent/AuK-Flash pour la variante distillée en quatre étapes, chacun d’environ 6,1 Go pour le transformateur de diffusion plus un VAE inclus, hébergés en miroir sur Hugging Face et ModelScope.

• Présent — une surface de tâches inhabituellement étendue sous une interface d'instruction unique : génération, édition de contenu, édition acoustique et paralinguistique, amélioration et séparation, le tout dans une seule famille de modèles.

• Présent — un cas concret de « rapidité » : AuK-Flash se distille en quatre étapes, sans guidage sans classifieur, avec une accélération de 4,5× du temps d’exécution réel annoncée par le fournisseur.

• Il manque une annonce. Aucun article de blog Tencent, publication sur les réseaux sociaux, communiqué de presse ou publication sur le canal Hunyuan ne pointe encore vers l'un ou l'autre des dépôts.

• Manquant — un article ou un rapport technique. Le bloc de citation sur la page du projet est un espace réservé, sans auteurs ni identifiant arXiv, et aucun chiffre publié ne vient étayer les affirmations du benchmark.

Manquant — code accessible. Les liens de la carte vers le dépôt GitHub et le Cookbook renvoient une erreur 404 au moment de la vérification de l’état, donc aujourd’hui le seul artefact exécutable est constitué des poids, plus tout ce que la communauté assemble autour d’eux.

• Manquant — service et évaluation indépendante. Aucun fournisseur d'inférence n'héberge AuK, aucune API hébergée n'existe, et avec des téléchargements se comptant par dizaines, personne n'a encore publié de reproduction.

An infographic titled 'AuK-Flash — the state of play', with six rows reading 'Release: Sept 7, 2026 — quiet, no announcement', 'Weights: ~6.1 GB transformer + VAE, MIT (HF + ModelScope)', 'Family: 1.5B speech foundation — AuK base + AuK-Flash distilled', 'Inference: AuK-Flash 4 steps, no CFG — ~4.5x faster (vendor)', 'Encoder: Qwen2.5-Omni-3B, downloaded separately', 'Independent evals: none yet', and a footer reading 'Specs from the AuK model card, config and project site, Sept 2026 — all vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Lancer AuK-Flash aujourd'hui, ou attendre

Si vous souhaitez exécuter AuK-Flash vous-même, le chemin de téléchargement est explicite même si le code ne l'est pas : récupérez tencent/AuK-Flash et tencent/AuK (la base est facultative, sauf si vous voulez le modèle teacher), ainsi que Qwen/Qwen2.5-Omni-3B, car le checkpoint ne contient que les poids du diffusion transformer et de la fusion de couches — l'encodeur multimodal et le VAE sont chargés depuis des fichiers séparés à l'exécution, et la fiche du modèle signale que l'absence de clés text_encoder au chargement est un comportement attendu. La vraie contrainte, c'est le matériel. Il s'agit d'un diffusion transformer d'environ 1,5 milliard de paramètres — dont le checkpoint pèse à lui seul environ 6,1 Go — qui s'exécute aux côtés d'un encodeur multimodal d'environ 3 milliards de paramètres et d'un VAE : une GPU de 24 Go est donc le point de départ raisonnable, pas un modèle pour ordinateur portable. Les notes sur la mémoire de la config, qui mentionnent que le gradient checkpointing ramène les pics de mémoire d'entraînement d'environ 91 Go à 75 Go, concernent l'entraînement et ne doivent pas être lues comme des exigences d'inférence. Côté logiciel, la config utilise par défaut le backend flash-attention, mais la CLI d'inférence peut revenir à un backend d'attention torch classique, ce qui supprime l'étape de compilation de flash-attn lors d'une première exécution.

La question de savoir si cela vaut la peine de le faire aujourd'hui dépend de ce que vous construisez. Le constat honnête est que ce modèle est à surveiller et à tester dans un bac à sable, pas encore à brancher sur un pipeline de production — sans article, sans code accessible et sans évaluation indépendante, les affirmations concernant ses capacités reposent entièrement sur la parole de Tencent. Pour une équipe qui a besoin aujourd'hui de génération, d'édition ou de séparation vocale via une API, un modèle réellement servi est le choix pragmatique, ce qui est précisément le rôle que joue OrcaRouter pour les modèles qui disposent d'endpoints : une API pour plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés tels quels sans aucune marge, si bien que le prix d'un fournisseur est votre prix dès le premier jour, et un basculement automatique, pour qu'un nouveau venu non éprouvé puisse être testé sur une partie du trafic réel sans que le pipeline soit mis en jeu. Rien de tout cela ne s'applique encore ni à AuK ni à AuK-Flash, parce que rien ne les sert. Dès qu'un fournisseur héberge AuK, l'économie du routeur devient le moyen peu coûteux de l'évaluer ; jusque-là, le choix se résume à auto-héberger les poids ou à attendre.

Foire aux questions

Est-ce que AuK ou AuK-Flash sont disponibles via une API ?

Non. Les deux sont des versions uniquement avec poids. Aucun fournisseur d'inférence ne les héberge et aucune API hébergée n'existe, donc il n'y a rien à appeler aujourd'hui — la seule façon de les utiliser est de télécharger les poids et de les exécuter vous-même.

Quelle est la différence entre AuK et AuK-Flash ?

La même famille de modèles à deux stades. AuK est le modèle de base, destiné à une génération de haute qualité ; AuK-Flash est sa variante distillée, optimisée pour une inférence rapide en quatre étapes sans guidance sans classifieur, que Tencent dit tourner environ 4,5× plus vite que le modèle de base dans des conditions comparables. Ce chiffre de vitesse est annoncé par le fournisseur et n'a pas été mesuré de manière indépendante.

AuK-Flash peut-il être utilisé à des fins commerciales ?

Les poids sont publiés sous la licence MIT, qui autorise un usage commercial à condition que l’avis de licence soit conservé — la licence open weights commune la moins restrictive. Le référentiel de code séparé vers lequel renvoie la fiche n’est pas accessible au 9 septembre 2026 ; la réponse pratique concernant la réutilisation du code reste donc ouverte jusqu’à sa publication.

Que regarder

• Le dépôt de code — github.com/Tencent-Hunyuan/AuK est l'artefact manquant ayant la plus haute valeur. Lorsqu'il apparaîtra, les modèles d'instructions du Cookbook transformeront la liste de tâches ci-dessus d'un argument marketing en quelque chose d'exécutable.

• Une exécution indépendante — la première reproduction par un tiers tranchera la question de savoir si les affirmations de « leader » en matière de génération et d’édition survivent au contact avec l’audio réel, et si AuK-Flash en quatre étapes se rapproche réellement du modèle de base.

• Un article — la citation de la page du projet est un espace réservé, ce qui signifie généralement qu'une soumission arXiv est à venir ; la recette d'entraînement, les résultats des benchmarks et les détails de la distillation y figurent tous.

Une offre d'inférence — le premier fournisseur d'inférence à héberger AuK le transforme d'un répertoire de poids en un modèle appelable avec un prix ; c'est à ce moment qu'il devient testable via un routeur, plutôt qu'un projet à auto-héberger.

AuK et AuK-Flash sont réels mais inachevés, à la manière des versions open source les plus intéressantes : les poids sont honnêtes, et l’histoire qui les entoure n’a pas encore été écrite. Ajoutez tencent/AuK-Flash à vos favoris, considérez toute affirmation de capacité comme une simple déclaration du fournisseur tant qu’un article ou un benchmark indépendant n’est pas paru, et vérifiez si les prochains jours apporteront le code qui ferait passer cet artefact prometteur à une version exploitable.