Une carte de titre « hero » générée pour AuK, montrant le logotype « AuK » au-dessus des lignes de sous-titre « Le modèle de parole open-source 1.5B de Tencent » et « Une seule instruction en langage naturel pour chaque tâche audio — cloner, éditer, améliorer, séparer. », avec une forme d'onde d'un bleu doux en cours d'édition par un fin curseur de texte et quatre icônes plates étiquetées Clonage vocal, Éditer, Améliorer et Séparer, le logo OrcaRouter étant composé dans le coin inférieur droit.
Guides & Insights

AuK : Tencent a discrètement publié en open source un modèle vocal de 1,5 milliard de paramètres qui traite chaque tâche audio comme une commande texte

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici une phrase qu'aucun outil de synthèse vocale téléchargeable aujourd'hui ne peut réaliser en une seule passe : prenez cet enregistrement, remplacez le mot « house » par « home », élevez la hauteur d'un demi-ton, supprimez la respiration avant la dernière phrase, éliminez le bruit de fond, puis relisez le résultat avec une toute nouvelle voix décrite uniquement comme « un homme chaleureux d'âge moyen avec un léger accent cantonais ». La réponse de Tencent à cette phrase est AuK, un « modèle fondamental pour la génération et l'édition de parole » de 1,5 milliard de paramètres, passé en open source cette semaine sans article de lancement ni communiqué de presse — et dont la version distillée, AuK-Flash, est désormais accompagnée de l'unique chose qui manquait à cette histoire lors de notre premier article : un rapport technique avec des chiffres. « AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing » (arXiv:2609.08936, cs.SD, soumis le 2026-09-08) est désormais cité à la fois sur la fiche du modèle Hugging Face et dans le README GitHub, la liste de l'article étant datée du 2026-09-08 et la ligne d'actualité du dépôt de code du 2026/09/09. Ce que le rapport ne fait pas, c'est trancher la question qui importait — chaque chiffre qu'il contient est propre à Tencent, calculé par rapport à des références choisies par Tencent, et au 2026-09-10, personne en dehors de l'entreprise n'en a reproduit un seul.

Ceci est un article de type « ce que l'on sait jusqu'à présent », révisé une fois. Tencent n'a toujours pas annoncé AuK sur aucun de ses canaux principaux que nous puissions trouver, donc le bilan est le suivant : les fiches et dépôts de modèles Hugging Face pour AuK et AuK-Flash, le dépôt de code sous l'organisation Tencent-Hunyuan, le site du projet à auk-project.github.io, et maintenant l'article. Ce dernier ajout change ce qui est connaissable — l'architecture, la recette d'entraînement et les chiffres d'évaluation sont décrits en détail pour la première fois — sans changer ce qui est vérifié. Traitez tous les chiffres ci-dessous comme étant rapportés par le fournisseur, car c'est exactement ce qu'ils sont, et notez que les comparaisons du rapport sont entièrement faites avec d'autres modèles ouverts, et non avec les plateformes vocales hébergées fermées avec lesquelles AuK serait réellement en concurrence.

Ce qui a réellement été livré, et avec quelle discrétion.

La chronologie reste le résumé le plus honnête de la sortie, avec une correction par rapport à notre premier passage. Les dépôts Hugging Face ont été créés à la mi-août — AuK le 2026-08-18 — mais sont restés silencieux jusqu'à cette semaine. Lorsque nous avons consulté la fiche du modèle AuK le 2026-09-09, sa ligne d'actualité unique était datée du 2026-09-07 ; un jour plus tard, cette même ligne indique 2026/09/09 et oriente les lecteurs vers l'article et les demo Spaces. Le dépôt GitHub, qui contient le code d'inférence et d'entraînement, a été créé le 2026-08-19 et sa dernière mise à jour remonte au 2026-09-09. En d'autres termes : les poids, puis le code, puis un rapport technique — trois publications échelonnées en quatre jours, et toujours aucune annonce sur les canaux principaux de Tencent à l'heure où nous écrivons.

• Les poids sont hébergés sur Hugging Face sous l’organisation tencent et sont également répliqués sur ModelScope sous Tencent-Hunyuan — deux miroirs, même licence MIT.

• Chaque dépôt de modèle contient un unique checkpoint safetensors, ainsi qu’une configuration et un VAE : auk_base.safetensors de 6,12 Go et vae.safetensors de 0,64 Go pour AuK ; même disposition pour AuK-Flash. La fiche du modèle demande également de télécharger Qwen/Qwen2.5-Omni-3B, l’encodeur de texte qu’AuK charge séparément au moment de l’exécution.

• Le cadrage « personne n'a remarqué » a expiré, et rapidement. Le dépôt de code affichait zéro étoile et zéro fork lors de notre vérification le 2026-09-09 ; au 2026-09-10, il affiche 216 étoiles, 12 forks et sa première issue ouverte. La carte AuK signale environ trente téléchargements au cours du dernier mois, avec 26 likes. Ce qui n'a pas changé : les onglets de discussion sont vides, et la carte indique toujours que le checkpoint n'est déployé par aucun fournisseur d'inférence.

• Les deux fiches de modèle, le README et le lien vers l'article démontrent les Spaces sur Hugging Face et ModelScope. L'espace Hugging Face n'était pas accessible publiquement sans connexion lors de notre vérification, donc considérez le parcours « essayez-le dans votre navigateur » comme non confirmé pour les utilisateurs anonymes.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

La carte Hugging Face ci-dessus constitue toujours toute la surface publique d'une version installable : une fiche de modèle, une configuration, deux fichiers safetensors et une licence. Ce qui a été ajouté depuis, c'est la couche de documentation qui l'entoure — un article, un tableau de référence et un bloc de citation — et rien de tout cela ne change le fait qu'il n'y a ni changelog, ni fil de discussion, ni liste de fournisseurs d'inférence derrière elle.

Le pitch : une interface d'instructions, seize tâches vocales.

L'affirmation d'AuK n'est pas que ce modèle est le meilleur modèle de synthèse vocale jamais publié. Elle consiste à dire que la génération n'est qu'une des cinq familles de tâches vocales que le modèle a été entraîné à accomplir via une interface unique en langage naturel, où une requête est un message de chat pouvant contenir du texte ainsi qu'un fichier audio de référence facultatif. L'article formalise exactement la taxonomie que le site du projet présentait déjà :

• Génération de la parole — TTS zéro-shot (prononcer ce texte avec la voix du clip de référence) et TTS par instructions (générer de la parole à partir d'une simple description vocale, sans aucun audio de référence).

• Édition de contenu — réécrire ce qui a été dit : remplacer, insérer ou supprimer des mots dans un enregistrement existant ; et édition de paroles, qui réécrit les paroles chantées en préservant la mélodie et la voix.

• Édition acoustique — hauteur en demi-tons, ajustement de la vitesse de parole et volume en décibels.

• Édition paralinguistique — changements d'émotion, modifications du timbre à partir d'une description, dé-accentuation, ajout ou suppression de sons non verbaux (respirations, rires, toux), et conversion entre parole normale et chuchotement tout en conservant le locuteur.

• Amélioration et séparation — débruitage et déréverbération de la parole, séparation de la parole par ordre de prise de parole, séparation musique/voix, et extraction du locuteur cible identifié par ce qu'il dit.

Le cas de la TTS par instructions est ce qui distingue cette version d'un clonage vocal classique : AuK lira une phrase avec une voix qui n'existe que sous forme de description textuelle — l'exemple même de la documentation décrit une femme d'une vingtaine d'années s'adressant à son partenaire qui vient de rentrer à la maison, chaleureuse, attentionnée et légèrement coquette, avec un timbre doux et sucré et une intonation légèrement ascendante en fin de phrase, le tout sans clip de référence. Cela supprime le besoin d'un enregistrement de référence, qui constitue le coût d'entrée habituel du clonage. Le rapport chiffre cette tâche pour la première fois, et c'est l'un des rares domaines où AuK bat nettement la concurrence plutôt que de la devancer de justesse.

Dans le « 1.5B » : le nombre sous-estime le temps d’exécution.

Le nombre de paramètres d’AuK décrit le transformer de diffusion, pas l’ensemble du pipeline, et l’article précise désormais les deux parties. Le backbone est un Transformer à flux rectifié hybride — trente couches composées de dix blocs MMDiT à double flux suivis de vingt blocs DiT unifiés à flux unique, taille cachée 1536, 24 têtes d’attention de dimension 64, largeur intermédiaire SwiGLU de 3072, d’où vient le chiffre d’« environ 1,5 milliard de paramètres ». Autour de lui se trouvent deux composants chargés séparément : un LLM multimodal (Qwen/Qwen2.5-Omni-3B) qui transforme l’instruction et tout audio de référence en conditionnement sémantique, et un VAE audio causal de 24 kHz — que la configuration nomme BigVGANFlowVAE — qui traite des latents de dimension 64 à une cadence de 50 Hz, avec des largeurs de canaux d’encodeur allant jusqu’à 768 et un décodeur jusqu’à 1536. Donc, l’exécution complète comprend le backbone de ~1,5B plus un encodeur de 3B plus le VAE, et l’instruction de téléchargement précise explicitement que l’encodeur est un checkpoint séparé avec ses propres conditions.

Selon le rapport, l'entraînement s'est déroulé par étapes et à une échelle que le site du projet ne laissait qu'entrevoir : un échauffement de 50 000 mises à jour en génération seule, puis 600 000 mises à jour combinées de génération et d'édition, sur environ 3,03 milliards d'instances instruction–audio représentant environ 1,95 million d'heures de supervision effective, réparties sur 256 GPU, avec 1,24 million de mises à jour supplémentaires sur le VAE. Le post-entraînement combinait l'optimisation des préférences par feedback humain avec l'apprentissage par renforcement basé sur des récompenses, construit sur 818 groupes de préférences informatifs et 9 080 candidats évalués, des pools de prompts RL de 10 000 prompts zero-shot et 5 000 prompts de suivi d'instructions, 30 000 échantillons de jugement de style, et un modèle de récompense affiné à partir de Qwen2.5-Omni-7B. C'est un stack de post-entraînement sérieux pour une version open de 1,5B, et c'est aussi un rappel que « open weights » décrit l'artefact, pas la puissance de calcul qui l'a produit — un point à garder en tête lorsqu'on évalue si l'on pourrait le reproduire.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Chaque chiffre de cette fiche technique est lu à partir des dépôts et du site Web de Tencent plutôt que mesuré par nous, et l'article n'a pas changé cela — il a simplement déplacé davantage de ces lignes de « revendiquées » à « documentées ». Le seul chiffre qui a réellement été testé depuis notre première publication est l'activité du dépôt lui-même, qui est passée de zéro étoile à quelques centaines en une journée.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

Le site du projet reste là où se trouvent le schéma d'architecture et le co-branding académique, et c'est toujours le moyen le plus simple de voir la forme du modèle : un modèle de langage multimodal pour le conditionnement sémantique, un VAE à 50 Hz pour l'acoustique, et un transformateur hybride sous un objectif de flow-matching. Sa section de benchmarks, qui listait un dispositif d'évaluation sans scores lors de notre première consultation, a désormais un article auquel se référer.

Le rapport technique tombe, et les chiffres sont ceux de Tencent.

Voici l’essentiel de la mise à jour. L’article rapporte des résultats sur sept suites d’évaluation — la même liste que le site du projet avait annoncée sans chiffres — et sur la plupart des axes de génération et d’édition de contenu, AuK est en tête du champ ouvert. Considérez ceci comme un tableau de benchmarks de fournisseur, car c’est bien ce que c’est : tencent a réalisé toutes les comparaisons, choisi toutes les références, et n’a encore publié aucun code permettant de reproduire le harnais.

• TTS zero-shot sur Seed-TTS-Eval : AuK atteint en moyenne un WER de 2,65 avec une similarité de locuteur de 0,795, contre Qwen3-TTS à 3,07 et 0,745, Seed-TTS à 3,65 et 0,778, et VoxCPM2 à 3,65 et 0,767. AuK-Flash obtient 2,85 et 0,790. Les meilleurs scores sur des sous-ensembles individuels sont un WER de 1,02 sur l'ensemble de test anglais et de 5,91 sur l'ensemble difficile chinois.

• TTS contrôlé par instructions sur InstructTTSEval : AuK obtient 83,37 en chinois et 81,60 en anglais pour le suivi de descriptions, contre Qwen3-TTS-VD avec 81,10 et 82,40 et MOSS-VoiceGenerator avec 80,00 et 82,00. AuK-Flash atteint 78,80 en chinois mais égale le meilleur score anglais du domaine avec 82,40.

• Édition de contenu sur SpeechEditBench : 91,83 de précision contre 76,46 pour Ming-UniAudio, et 71,33 en prosodie contre 26,50 — les deux écarts les plus importants de tout le rapport.

• Édition guidée par instructions sur Ming-Freeform-Audio-Edit, configuration complète : le taux d'erreur de mots chute de 10,46 à 3,09 en chinois et de 14,28 à 3,96 en anglais par rapport à Ming-UniAudio, avec une précision d'édition qui passe de 79,62 à 91,47 et de 70,98 à 85,25. Pour les éditions acoustiques, la même comparaison fait passer le taux d'erreur de mots de 5,01 à 2,02 en chinois et de 10,75 à 3,48 en anglais.

• Édition paralinguistique sur MMAE-Speech : taux de suivi des instructions de 48.23 et réécriture de contenu de 88.11, par rapport à Step-Audio-EditX (43.52 et 77.27) et Ming-UniAudio (34.13 et 76.01). AuK-Flash enregistre le meilleur rappel de modèle d’édition du tableau, avec 13.85.

• Restauration, où le modèle est compétitif plutôt que dominant : DNS Challenge erreur de mot désynchronisée de 2,66 avec une similarité de locuteur de 0,99 contre RE-USE à 3,31 ; CHiME-4 erreur de mot 7,98 contre RE-USE à 10,71 ; Libri2Mix erreur de mot 9,12 contre MossFormer2-SS à 9,34 ; et VCTKSR erreur de mot 3,06 avec une similarité de 0,97.

Le VAE lui-même, évalué séparément : AuK-VAE atteint 4.143 PESQ sur la parole, 3.833 sur l'audio général et 3.884 sur la musique, contre MiniMax-H3-AudioVAE à 3.633, 2.835 et 2.801 — un sans-faute qui importe plus qu'il n'y paraît, car un latent acoustique avec pertes plafonne chaque tâche construite par-dessus.

Le schéma qui se dégage de ces points est plus intéressant que les victoires en titre. AuK est très en avance sur tout ce qui signifie « changer ce qui est dit ou la façon dont cela sonne, et garder tout le reste » — édition de contenu, prosodie, modifications acoustiques, reconstruction. Il est beaucoup plus proche du domaine sur l’émotion et l’édition paralinguistique, où sa précision émotionnelle SpeechEditBench de 9,94 est à peine distincte de celle de Ming-UniAudio, qui obtient 3,43 sur un benchmark où les deux sont faibles, et où son score acoustique global de 37,07 se situe dans la même fourchette que les lignes de base. Ainsi, « un modèle pour chaque tâche vocale » est le cadrage de Tencent ; ce que le rapport montre réellement, c’est un modèle qui est excellent sur plusieurs de ces tâches et simplement présent sur le reste.

Deux checkpoints : AuK et AuK-Flash

Tencent a publié deux variantes sous la même licence MIT. AuK est le modèle de base pleine qualité, et le rapport fixe ses paramètres d'échantillonnage à 32 évaluations de fonction avec une échelle de guidage sans classifieur de 2,0. AuK-Flash est la version distillée : initialisation par cohérence et objectif DMD découplé à routage par tâche, générant en quatre étapes fixes avec le guidage entièrement désactivé, ce que l'article présente comme une accélération de 4,5× en temps d'horloge par rapport au modèle complet dans des conditions comparables. Les chiffres de l'article maintiennent Flash à un niveau proche sur la plupart des tâches de génération — 2,85 d'erreur moyenne sur les mots et 0,790 de similarité sur Seed-TTS-Eval — c'est ce qui rend la revendication de vitesse digne d'être testée plutôt que rejetée : une diffusion en quatre étapes d'une qualité proche de celle de l'enseignant, c'est ce qui rendrait un éditeur de parole de 1,5B interactif sur un seul GPU. Cela dit, « conditions comparables » est l'expression de Tencent pour décrire le benchmark de Tencent, et un chiffre de 4,5× mesuré par les auteurs est exactement le type d'affirmation qui nécessite un tiers avant de changer une quelconque décision d'achat.

Ce que vous pouvez exécuter aujourd'hui

La surface pratique est plus large qu'un simple drop de poids silencieux, car le code est arrivé avec lui. L'installation cible Python 3.10 via uv ou Conda, et le README propose des cibles d'installation supplémentaires qui intègrent Gradio, les nœuds ComfyUI ou la pile de fine-tuning. L'outil en ligne de commande auk-infer couvre toutes les tâches avec la même forme de message : le paramètre --instruction est toujours requis, et --audio est optionnel selon la tâche. Un serveur Gradio (auk-gradio) expose les modèles avec un sélecteur, et il y a des nœuds personnalisés ComfyUI avec un workflow réutilisable, bien que l'intégration soit documentée avec une limite de séquence de 30 secondes (source plus cible). Une API Python reflète la CLI, et un pipeline de fine-tuning léger s'entraîne sur du JSONL de paires instruction-plus-audio en utilisant le même format de message que l'inférence. Le README décrit également un Prompt Enhancer qui transforme des requêtes en texte libre en commandes auk-infer prêtes à l'emploi ; il attend un endpoint de chat compatible OpenAI et se replie sur un modèle local SenseVoiceSmall pour la reconnaissance vocale lorsqu'aucun identifiant cloud ASR n'est défini. Une limitation actuelle est documentée clairement : Qwen3-Omni n'est pas encore pris en charge comme chemin d'encodeur, donc le checkpoint Qwen2.5-Omni-3B reste celui à télécharger.

Ce que les docs ne vous donnent toujours pas, c'est un plancher matériel. Aucun chiffre de VRAM n'est publié pour l'inférence. Les fichiers de configuration comportent une note sur le gradient-checkpointing concernant un pic d'environ 91 Go qui retombe à environ 75 Go, ce qui décrit l'enveloppe mémoire du temps d'entraînement plutôt qu'un chiffre réaliste d'inférence en un seul passage, et la commande de référence qui charge AuK et AuK-Flash ensemble les répartit sur deux GPU — tout en notant que les deux peuvent partager un seul. Prévoyez le budget pour le téléchargement lui-même : environ 6,8 Go par variante plus l'encodeur Qwen2.5-Omni-3B, puis mesurez la mémoire sur votre propre GPU.

Qu'est-ce qui n'est pas confirmé ?

Être précis à propos de l’inconnu reste le but même de couvrir un modèle aussi tôt, et le rapport a retiré exactement un élément de cette liste tout en laissant le reste intact :

• Aucune exécution indépendante n'existe que nous puissions trouver. Aucun échantillon vocal tiers, aucune réplication de benchmark, aucune impression dans les fils de discussion. La première issue ouverte du dépôt est déposée et sans réponse, et le nombre de téléchargements de la fiche du modèle est encore de quelques dizaines, de sorte que l'écart entre un tableau publié et un tableau reproduit constitue actuellement toute l'histoire.

• L'évaluation est menée en interne et restreinte d'une manière bien précise. Chaque référence du rapport est un autre modèle à poids ouverts — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Aucune des plateformes vocales hébergées et fermées auxquelles un acheteur comparerait réellement AuK n'y figure, donc « mène le terrain » signifie ici « mène le terrain ouvert sélectionné par Tencent ».

• Le nom « AuK » n'est toujours jamais développé nulle part dans le document, les cartes ou le code, et il entre fortement en collision dans les recherches avec l'oiseau de mer, l'American University of Kuwait et des dépôts sans rapport.

L'équipe est désormais au moins visible — l'article compte 33 auteurs menés par Ziyang Ma, avec des affiliations couvrant l'organisation Tencent Hunyuan, Shanghai Jiao Tong University, Shanghai Innovation Institution et Nanyang Technological University — mais qui, chez Tencent, détient le modèle au quotidien, et s'il s'agit d'une gamme Hunyuan ou d'une collaboration académique distincte, reste non précisé.

• La couverture linguistique n'est encore que partiellement documentée : la fiche AuK-Flash déclare le chinois et l'anglais, et les exemples de code mélangent les deux, mais le modèle de base ne dispose d'aucune liste de langues formelle. La licence présente la même forme — AuK lui-même est sous licence MIT, tandis que son encodeur Qwen téléchargé séparément est soumis à ses propres conditions, si bien que « modèle MIT » et « tout le nécessaire sous licence MIT pour l'exécuter » ne sont pas des affirmations équivalentes.

Pourquoi un modèle de parole unifié à poids ouverts est important

Lisez la liste de tâches d'AuK par rapport à ce que fait réellement un créateur aujourd'hui, et le pari devient plus clair qu'avant l'arrivée des chiffres. Réaliser toutes ces tâches avec les outils existants signifie enchaîner plusieurs modèles spécialisés — un checkpoint ouvert pour le clonage, un autre pour l'amélioration, un séparateur distinct, et une édition manuelle ou assistée par modèle pour le contenu — ou louer plusieurs API hébergées fermées, chacune facturée par tâche et par minute d'audio, et aucune d'entre elles modifiable de la manière que décrit AuK. Un seul checkpoint à poids ouverts qui traite tout cela comme un problème de génération conditionnée par le texte est un objet réellement différent, et le rapport soutient désormais une version plus précise de cette affirmation que le marketing : la partie édition est réelle, pas simplement une aspiration. Le clonage vocal s'est banalisé au cours de l'année écoulée, mais l'édition de contenu et de prosodie pilotée par des instructions est là où les plateformes hébergées fermées gagnent encore leur marge, et un score de 91.83 contre 76.46 sur l'édition de contenu est la première preuve qu'un modèle ouvert peut conquérir ce terrain.

La qualification honnête est qu'il s'agit d'un modèle de diffusion avec un modèle de langage de 3B boulonné pour le conditionnement, et il hérite des coûts de cette architecture. La qualité par tâche est inégale — excellente là où la tâche est « préserver tout sauf la modification », plus mince sur l'émotion — et il n'y a pas de point de terminaison hébergé, pas de solution de traitement par lots ni de latence publiée pour autre chose que la comparaison interne de la variante Flash. Pour les éléments d'un pipeline vocal autour de lui — le LLM qui décide ce qui doit être dit, et le point de terminaison compatible OpenAI de Prompt Enhancer — une API de routage est la solution naturelle, et OrcaRouter donne accès à plus de 200 modèles au prix catalogue du fournisseur sans majoration, de sorte que cette moitié de la pile nécessite une seule clé et aucun second contrat. La moitié audio reste un GPU que vous contrôlez et un checkpoint que personne en dehors de Tencent n'a audité.

Qui doit regarder maintenant, et qui doit attendre

Pour les chercheurs en parole, les développeurs d'outils et tous ceux dont le travail consiste à évaluer de nouveaux modèles vocaux, {{1}}l'argument en faveur du téléchargement d'AuK cette semaine est plus solide qu'au premier jour, et il s'accompagne toujours de la même réserve{{/1}}. Vous obtenez désormais {{2}}une architecture documentée, une recette qui semble reproductible et un tableau complet des cibles à battre{{/2}} — {{3}}ce qui est précisément ce qui rend une affirmation non reproduite digne d'être attaquée{{/3}}. {{4}}Le coût de l'adoption précoce reste un week-end de configuration et un GPU{{/4}}. Pour quiconque choisit une stack vocale de production, {{5}}le rapport modifie les termes de la décision sans la trancher{{/5}} : il y a désormais des chiffres avec lesquels débattre, mais {{6}}ils émanent du fournisseur, ils excluent les plateformes fermées qui constitueraient votre véritable base de comparaison, et il n'y a toujours ni API, ni plancher de VRAM, ni historique éprouvé{{/6}}. À surveiller, dans l'ordre : {{7}}une réplication indépendante des lignes Seed-TTS-Eval et SpeechEditBench{{/7}} ; {{8}}des échantillons publiés ou un Space de démo accessible{{/8}} ; et {{9}}un fournisseur d'inférence ou une API hébergée qui se met à proposer AuK, auquel cas le prix refacturé de notre côté est le prix catalogue du fournisseur, le jour même, car c'est ce que signifie une marge de 0 %{{/9}}. La question intéressante n'est plus de savoir {{10}}si Tencent a livré un autre modèle TTS{{/10}} — mais {{11}}si un seul modèle ouvert peut réellement tenir ces cinq familles de tâches à la fois, et maintenant que Tencent a publié sa propre réponse, il ne reste plus qu'à quelqu'un d'autre de la vérifier{{/11}}.