Een gegenereerde hero-titelkaart voor AuK met het woordmerk "AuK" boven de ondertitelregels "Tencent's open-source 1.5B-spraakmodel" en "Eén natuurlijke-taalinstructie voor elke audiotaak — klonen, bewerken, verbeteren, scheiden.", met een zachte blauwe golfvorm die wordt bewerkt door een dunne tekstcursor-beweging en vier platte pictogrammen met het label Stemklonen, Bewerken, Verbeteren en Scheiden, met het OrcaRouter-logo rechtsonder samengesteld.
Guides & Insights

AuK: Tencent heeft stilletjes een 1.5B-spraakmodel als open source uitgebracht dat elke audiotaak als een tekstcommando behandelt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Hier is een zin die geen enkel spraakprogramma dat je vandaag kunt downloaden in één keer zal doen: neem deze opname, vervang het woord 'house' door 'home', verhoog de toonhoogte met een halve toon, verwijder de ademhaling vóór de laatste zinsnede, filter de achtergrondruis eruit, en lees het resultaat daarna opnieuw voor in een gloednieuwe stem die alleen wordt omschreven als 'een warme man van middelbare leeftijd met een licht Kantonees accent'. Het antwoord van Tencent op die zin is AuK, een 'foundation model' van 1,5 miljard parameters voor spraakgeneratie en -bewerking, dat deze week open-source is gegaan zonder lanceerpost en zonder persbericht — en waarvan het gedistilleerde zustermodel AuK-Flash nu wordt geleverd met het enige dat dit verhaal miste toen we er voor het eerst over schreven: een technisch rapport met cijfers erbij. 'AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing' (arXiv:2609.08936, cs.SD, ingediend op 2026-09-08) wordt nu vermeld op zowel de Hugging Face-modelkaart als de GitHub-README, met de papervermelding gedateerd 2026-09-08 en de eigen nieuwsregel van de coderepository gedateerd 2026/09/09. Wat het rapport niet doet, is de vraag beslechten die ertoe deed — elk cijfer erin is van Tencent zelf, gedraaid tegen baselines die Tencent koos, en per 2026-09-10 heeft niemand buiten het bedrijf ook maar één ervan gereproduceerd.

This is a what-we-know-so-far piece, revised once. Tencent still has not announced AuK on any of its main channels that we can find, so the record is: the Hugging Face model cards and repositories for AuK and AuK-Flash, the code repository under the Tencent-Hunyuan org, the project site at auk-project.github.io, and now the paper. That last addition changes what is knowable — the architecture, the training recipe and the evaluation numbers are described in detail for the first time — without changing what is verified. Treat everything numeric below as vendor-reported, because that is exactly what it is, and note that the report's comparisons are entirely against other open models, not the closed hosted speech platforms AuK would actually compete with.

Wat er daadwerkelijk uitkwam, en hoe geruisloos

De tijdlijn is nog steeds de meest eerlijke samenvatting van de release, met één correctie ten opzichte van onze eerste doorgang. De Hugging Face-repositories zijn half augustus aangemaakt — AuK op 2026-08-18 — maar bleven tot deze week stil. Toen we de AuK-modelkaart op 2026-09-09 lazen, dateerde de enige nieuwsregel van 2026-09-07; een dag later vermeldt diezelfde regel 2026/09/09 en wijst lezers op het paper en de demo Spaces. De GitHub-repository, die de inferentie- en trainingscode bevat, is op 2026-08-19 aangemaakt en voor het laatst gepusht op 2026-09-09. Met andere woorden: eerst de weights, dan de code, daarna een technisch rapport — drie gefaseerde releases in vier dagen, en nog steeds geen aankondiging via de belangrijkste kanalen van Tencent op het moment van schrijven.

De gewichten staan op Hugging Face onder de tencent-org en worden gespiegeld op ModelScope onder Tencent-Hunyuan — twee mirrors, dezelfde MIT-licentie.

• Elke modelrepository bevat een enkele safetensors-checkpoint plus een config en een VAE: auk_base.safetensors van 6,12 GB en vae.safetensors van 0,64 GB voor AuK; dezelfde indeling voor AuK-Flash. Op de modelkaart wordt gevraagd om ook Qwen/Qwen2.5-Omni-3B te downloaden, de tekstencoder die AuK afzonderlijk tijdens runtime laadt.

• Het frame "niemand heeft het gemerkt" is verlopen, en snel. De coderepository stond op nul sterren en nul forks toen we op 2026-09-09 keken; op 2026-09-10 vertoont deze 216 sterren, 12 forks en de eerste openstaande issue. De AuK card rapporteert ongeveer dertig downloads in de afgelopen maand, met 26 likes. Wat niet is veranderd: de discussietabbladen zijn leeg, en de kaart merkt nog steeds op dat het checkpoint niet door een inferentieprovider is ingezet.

Zowel de modelkaarten, de README als de paper-link-demo-Spaces op Hugging Face en ModelScope. De Hugging Face Space was niet openbaar bereikbaar zonder inloggen toen we het controleerden, dus behandel het pad 'try it in your browser' als onbevestigd voor anonieme gebruikers.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

De Hugging Face-kaart hierboven is nog steeds het volledige publieke oppervlak van een installeerbare release: een modelkaart, een config, twee safetensors-bestanden en een licentie. Wat sindsdien is toegevoegd, is de documentatielaag eromheen — een paper, een benchmarktabel en een citatieblok — en dat verandert niets aan het feit dat er geen changelog, geen discussiethread en geen inference-providerlijst achter zit.

De pitch: één instructie-interface, zestien spraaktaken

De bewering van AuK is niet dat het het beste tekst-naar-spraakmodel is dat ooit is uitgebracht. Het is dat generatie slechts een van vijf families van spraaktaken is waarvoor het model is getraind via een enkele natuurlijke-taalinterface, waarbij een verzoek een chatbericht is dat tekst plus een optioneel referentieaudiobestand kan bevatten. Het artikel formaliseert precies de taxonomie die de projectsite al adverteerde:

• Spraakgeneratie — zero-shot TTS (spreek deze tekst uit met de stem van het referentiefragment) en instructie-TTS (spraak genereren op basis van uitsluitend een stemomschrijving, zonder enige referentieaudio).

• Contentbewerking — herschrijven van wat er is gezegd: woorden in een bestaande opname vervangen, invoegen of verwijderen; en liedtekstbewerking, die gezongen teksten herschrijft terwijl de melodie en de stem behouden blijven.

• Akoestische bewerking — toonhoogte in semitonen, spraaksnelheidsschaling en volume in decibels.

Paralinguïstische bewerking — emotieveranderingen, klankkleurveranderingen vanuit een beschrijving, accentverwijdering, het toevoegen of verwijderen van non-verbale geluiden (ademhalingen, lachen, hoesten), en het omzetten tussen normale spraak en fluisteren met behoud van de spreker.

• Verbetering en scheiding — spraakontruising en dereverberatie, spraakscheiding op basis van spreekvolgorde, scheiding van muziek en zang, en doelspreker-extractie, geïdentificeerd door wat de spreker zegt.

Het instruction-TTS-scenario is wat deze release onderscheidt van een typische stemkloningsrelease: AuK leest een zin voor in een stem die alleen bestaat als tekstbeschrijving — het eigen voorbeeld in de documentatie specificeert een vrouw van in de twintig die spreekt tegen een partner die net thuis is gekomen, warm, zorgzaam en licht koket, met een zacht zoet timbre en een licht stijgende toon aan het zinseinde, en dit alles zonder referentieclip. Daarmee vervalt de noodzaak van een referentie-opname, die doorgaans de kostbare drempel vormt bij klonen. Het rapport geeft die taak voor het eerst een concreet cijfer, en het is een van de weinige onderdelen waar AuK het veld ronduit verslaat in plaats van er net aan voorbijgaat.

Binnen de "1.5B": het getal doet de runtime tekort.

Het parameteraantal van AuK beschrijft de diffusion transformer, niet de hele pipeline, en het paper vermeldt nu beide helften expliciet. De backbone is een hybride rectified-flow Transformer — {{1}}dertig lagen bestaande uit tien dual-stream MMDiT-blokken gevolgd door twintig unified single-stream DiT-blokken, hidden size 1536, 24 attention heads van dimensie 64, SwiGLU intermediate width 3072{{/1}}, en daar komt het cijfer van 'ruwweg 1,5 miljard parameters' vandaan. Er omheen zitten twee afzonderlijk geladen componenten: een multimodale LLM ({{2}}Qwen/Qwen2.5-Omni-3B{{/2}}) die de instructie en eventuele referentie-audio omzet in semantische conditionering, en een causale 24 kHz-audio-VAE — de config noemt het {{3}}BigVGANFlowVAE{{/3}} — die 64-dimensionale latents draait op een framerate van 50 Hz, met encoder-kanaalbreedtes tot 768 en een decoder tot 1536. De volledige runtime is dus de ~1,5B-backbone plus een 3B-encoder plus de VAE, en de downloadinstructie vermeldt expliciet dat de encoder een aparte checkpoint is met eigen voorwaarden.

De training verliep volgens het rapport in fases en op een schaal waar de projectsite alleen maar op zinspeelde: een opwarmfase met uitsluitend generatie van 50.000 updates, daarna 600.000 gecombineerde generatie- en bewerkingsupdates, op ruwweg 3,03 miljard instructie-audio-instanties die ongeveer 1,95 miljoen uur effectieve supervisie vertegenwoordigen, verspreid over 256 GPU's, met nog eens 1,24 miljoen updates op de VAE. De post-training combineerde preferentie-optimalisatie op basis van menselijke feedback met beloningsgebaseerde reinforcement learning, gebouwd op 818 informatieve voorkeurgroepen en 9.080 beoordeelde kandidaten, RL-promptpools van 10.000 zero-shot- en 5.000 instructievolgende prompts, 30.000 stijlbeoordelaarsamples en een beloningsmodel dat is verfijnd op basis van Qwen2.5-Omni-7B. Dat is een serieuze post-trainingstack voor een open release van 1,5B, en het is ook een herinnering dat "open weights" het artefact beschrijft, niet de rekenkracht die het heeft voortgebracht — een punt om in gedachten te houden bij de afweging of je het zou kunnen reproduceren.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Elk cijfer in dat specificatieblad is afkomstig uit Tencent's eigen repositories en website in plaats van door ons gemeten, en het paper veranderde dat niet — het verplaatste alleen meer van die regels van 'geclaimd' naar 'gedocumenteerd'. Het enige getal dat daadwerkelijk is getest sinds we voor het eerst publiceerden, is de activiteit van de repository zelf, die in één dag van nul sterren naar een paar honderd ging.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

De projectsite blijft de plek waar het architectuurdiagram en de academische co-branding te vinden zijn, en het is nog steeds de goedkoopste manier om de vorm van het model te zien: een multimodaal taalmodel voor semantische conditionering, een 50 Hz VAE voor akoestiek, en een hybride transformer met een flow-matching-doelstelling. De benchmark-sectie, die toen we voor het eerst keken een evaluatie-opzet zonder scores vermeldde, heeft nu een paper om naar te verwijzen.

Het technische rapport komt binnen, en de cijfers zijn van Tencent zelf.

Dit is de kern van de update. Het paper rapporteert resultaten over zeven evaluatiesuites — dezelfde lijst die de projectsite eerder zonder cijfers had aangeprezen — en op de meeste generatie- en contentbewerkingsassen voert AuK het open veld aan. Lees dit als een leveranciersbenchmarktabel, want dat is het: tencent voerde elke vergelijking uit, koos elke baseline en heeft nog geen code gepubliceerd om de testomgeving te reproduceren.

Zero-shot TTS op Seed-TTS-Eval: AuK scoort gemiddeld 2,65 WER met 0,795 sprekersimilariteit, tegenover Qwen3-TTS (3,07 en 0,745), Seed-TTS (3,65 en 0,778) en VoxCPM2 (3,65 en 0,767). AuK-Flash komt uit op 2,85 en 0,790. De beste individuele splits zijn 1,02 WER op de Engelse testset en 5,91 op de Chinese moeilijke set.

• Instructiegestuurde TTS op InstructTTSEval: AuK scoort 83.37 op Chinees en 81.60 op het volgen van Engelse beschrijvingen, versus Qwen3-TTS-VD op 81.10 en 82.40 en MOSS-VoiceGenerator op 80.00 en 82.00. AuK-Flash is 78.80 op Chinees, maar evenaart de beste Engelse score van het veld met 82.40.

• Contentbewerking op SpeechEditBench: 91,83 nauwkeurigheid tegenover Ming-UniAudio's 76,46, en 71,33 op prosodie tegenover 26,50 — de twee grootste verschillen in het hele rapport.

• Instructiegeleide bewerking op Ming-Freeform-Audio-Edit, volledige instelling: woordfout daalt van 10,46 naar 3,09 in het Chinees en van 14,28 naar 3,96 in het Engels ten opzichte van Ming-UniAudio, terwijl de bewerkingsnauwkeurigheid stijgt van 79,62 naar 91,47 en van 70,98 naar 85,25. Bij akoestische bewerkingen brengt dezelfde vergelijking de woordfout van 5,01 naar 2,02 in het Chinees en van 10,75 naar 3,48 in het Engels.

Paralinguïstische bewerking op MMAE-Speech: instructie-opvolging 48.23 en inhoudsherschrijving 88.11 tegenover Step-Audio-EditX met 43.52 en 77.27, en Ming-UniAudio met 34.13 en 76.01. AuK-Flash behaalt de beste recall van het bewerkingsmodel in de tabel met 13.85.

• Restauratie, waarbij het model concurrerend is in plaats van dominant: DNS Challenge gedesynchroniseerde woordfout 2.66 met 0.99 sprekersovereenkomst tegenover RE-USE op 3.31; CHiME-4 woordfout 7.98 tegenover RE-USE op 10.71; Libri2Mix woordfout 9.12 tegenover MossFormer2-SS op 9.34; en VCTKSR woordfout 3.06 met 0.97 overeenkomst.

• De VAE zelf, afzonderlijk geëvalueerd: AuK-VAE behaalt 4.143 PESQ op spraak, 3.833 op algemene audio en 3.884 op muziek, tegen MiniMax-H3-AudioVAE op 3.633, 2.835 en 2.801 — een volledige overwinning die meer betekent dan het lijkt, omdat een verlieslatende akoestische latent elke taak beperkt die erop is gebouwd.

Het patroon in die bullets is interessanter dan de grote overwinningen. AuK loopt ver voorop op alles wat neerkomt op 'verander wat er wordt gezegd of hoe het klinkt, en behoud al het andere' — inhoudelijke bewerking, prosodie, akoestische bewerkingen, reconstructie. Het ligt veel dichter bij het veld op het gebied van emotie- en paralinguïstische bewerking, waar de emotienauwkeurigheid van 9,94 op SpeechEditBench nauwelijks te onderscheiden is van de 3,43 van Ming-UniAudio op een benchmark waar beide zwak presteren, en de algemene akoestische score van 37,07 in hetzelfde bereik ligt als de baselines. Dus 'één model voor elke spraaktaak' is de framing van Tencent; wat het rapport in werkelijkheid laat zien is één model dat in een aantal daarvan uitblinkt en bij de rest slechts aanwezig is.

Twee checkpoints: AuK en AuK-Flash

Tencent bracht twee varianten uit onder dezelfde MIT-licentie. AuK is het basismodel van volledige kwaliteit, en het rapport stelt de sampling-instellingen vast op 32 functie-evaluaties met een schaal van 2,0 voor classifier-vrije guidance. AuK-Flash is de gedistilleerde versie: met consistentie-initialisatie en een taakgerouteerde gedecoupleerde DMD-doelfunctie genereert deze in vier vaste stappen met guidance volledig uitgeschakeld, wat het paper rapporteert als een 4,5× versnelling in verstreken tijd ten opzichte van het volledige model onder overeenkomende omstandigheden. De eigen cijfers van het paper laten Flash bij de meeste generatietaken dicht bij het volledige model liggen — 2,85 gemiddelde woordfout en 0,790 gelijkenis op Seed-TTS-Eval — en dat is precies wat de snelheidsclaim de moeite waard maakt om te testen in plaats van af te wijzen: vierstapsdiffusie met een kwaliteit die dicht bij die van het teacher-model ligt, is wat een 1,5B-spraakeditor op één GPU interactief zou laten aanvoelen. Dat gezegd zijnde, "overeenkomende omstandigheden" is de term die Tencent gebruikt voor zijn eigen benchmark, en een 4,5× getal dat door de auteurs is gemeten, is precies het soort bewering dat een derde partij nodig heeft voordat het ook maar enige inkoopbeslissing verandert.

Wat je vandaag kunt uitvoeren

Het praktische bereik is breder dan een typische stille gewichtsdrop, omdat de code ermee is meegeleverd. De installatie is gericht op Python 3.10 via uv of Conda, en de README biedt extra installatieopties die Gradio, ComfyUI-nodes of de fine-tuning-stack insluiten. Het commandoregelprogramma auk-infer bestrijkt elke taak met dezelfde berichtstructuur: een --instruction is altijd vereist, en --audio is optioneel afhankelijk van de taak. Een Gradio-server (auk-gradio) stelt de modellen beschikbaar met een selector, en er zijn ComfyUI-custom-nodes met een herbruikbare workflow, hoewel de integratie is gedocumenteerd met een limiet van 30 seconden voor bron-plus-doelsequenties. Een Python-API spiegelt de CLI, en een lichtgewicht fine-tuning-pijplijn traint op JSONL van instructie-plus-audioparen met hetzelfde berichtformaat als bij inferentie. De README beschrijft ook een Prompt Enhancer die vrijvormige verzoeken omzet in kant-en-klare auk-infer-commando's; deze verwacht een OpenAI-compatibel chat-eindpunt en valt terug op een lokaal SenseVoiceSmall-model voor spraakherkenning wanneer er geen cloud-ASR-referenties zijn ingesteld. Een huidige beperking is duidelijk gedocumenteerd: Qwen3-Omni wordt nog niet ondersteund als encoderpad, dus de Qwen2.5-Omni-3B-checkpoint blijft degene die je moet downloaden.

Wat de documentatie je nog steeds niet geeft, is een hardware-ondergrens. Er wordt geen VRAM-cijfer gepubliceerd voor inferentie. De configuratiebestanden bevatten een opmerking over gradient-checkpointing over een piek van ~91 GB die daalt naar ~75 GB, wat het geheugenprofiel tijdens de training beschrijft in plaats van een realistisch getal voor eenmalige inferentie, en het referentiecommando dat AuK en AuK-Flash samen laadt, verspreidt ze over twee GPU's — terwijl wordt opgemerkt dat beide één GPU kunnen delen. Reken op de download zelf: ongeveer 6,8 GB per variant plus de Qwen2.5-Omni-3B-encoder, en meet daarna het geheugen op je eigen GPU.

Wat is niet bevestigd

Precies zijn over het onbekende is nog steeds het punt van het zo vroeg behandelen van een model, en het rapport verwijderde precies één item van deze lijst terwijl de rest intact bleef:

Er is geen onafhankelijke run te vinden. Geen voice samples van derden, geen benchmark-replicatie, geen indrukken uit discussiethreads. De eerste open issue van de repository is ingediend en onbeantwoord, en het downloadaantal van de modelkaart staat nog steeds in de tientallen, dus de kloof tussen een gepubliceerde tabel en een gereproduceerde is momenteel het hele verhaal.

• De evaluatie is zelf uitgevoerd en op één specifieke manier beperkt. Elke baseline in het rapport is een ander open-weight model — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Geen van de gesloten, gehoste spraakplatforms waartegen een koper AuK daadwerkelijk zou afwegen, verschijnt, dus "leidt het veld" betekent hier "leidt het open veld dat Tencent heeft geselecteerd".

De naam "AuK" wordt nog steeds nergens voluit geschreven in het paper, de kaarten of de code, en hij botst in zoekopdrachten hard met de zeevogel, de American University of Kuwait en niet-gerelateerde repositories.

{{1}}Het team is nu tenminste zichtbaar{{/1}} — het paper telt 33 auteurs onder leiding van Ziyang Ma, met affiliaties bij de Tencent Hunyuan-organisatie, Shanghai Jiao Tong University, het Shanghai Innovation Institution en de Nanyang Technological University — maar wie er binnen Tencent dagelijks eigenaar is van het model, en of het om een Hunyuan-lijn gaat of om een aparte academische samenwerking, blijft onvermeld.

• Taaldekking is nog steeds slechts gedeeltelijk gedocumenteerd: de AuK-Flash-kaart vermeldt Chinees en Engels en de codevoorbeelden mengen beide, maar het basismodel heeft geen formele taallijst. Hetzelfde geldt voor licenties — AuK zelf is MIT, terwijl de afzonderlijk gedownloade Qwen-encoder zijn eigen voorwaarden kent, dus 'MIT-model' en 'MIT alles wat je nodig hebt om het te draaien' zijn niet dezelfde uitspraak.

Waarom een uniform open-weights spraakmodel belangrijk is

Leg AuK's takenlijst naast wat een bouwer vandaag de dag daadwerkelijk doet, en de weddenschap wordt duidelijker dan voordat de cijfers binnenkwamen. Al die taken met bestaande tools uitvoeren betekent het aan elkaar rijgen van verschillende specialistische modellen — één open checkpoint voor klonen, een andere voor verbetering, een aparte separator, en handmatige of modelondersteunde bewerking van inhoud — of het huren van verschillende gesloten gehoste API's, elk geprijsd per taak en per minuut audio, en geen ervan bewerkbaar op de manier die AuK beschrijft. Een enkel open-weight checkpoint dat al deze zaken behandelt als één tekstgestuurd generatieprobleem is een echt ander object, en het rapport ondersteunt nu een scherpere versie van die bewering dan de marketing deed: de bewerkingshelft is echt, niet slechts een ambitie. Stemklonen is het afgelopen jaar gecommoditiseerd, maar instructiegestuurde inhouds- en prosodiebewerking is waar de gesloten gehoste platforms nog steeds hun marge verdienen, en een 91,83 tegen 76,46 op inhoudsbewerking is het eerste bewijs dat een open model dat terrein kan veroveren.

De eerlijke kanttekening is dat dit een diffusiemodel is met een 3B-taalmodel dat eraan vastgemaakt is voor conditionering, en dat het de kosten van die vorm erft. De kwaliteit per taak is ongelijkmatig — uitstekend wanneer de taak is "behoud alles behalve de bewerking", zwakker op het gebied van emotie — en er is geen gehost eindpunt, geen verhaal over batchen en geen gepubliceerde latentie, behalve de interne vergelijking van de Flash-variant. Voor de onderdelen van een voice-pipeline eromheen — de LLM die bepaalt wat er gezegd moet worden, en het OpenAI-compatibele chat-eindpunt van de Prompt Enhancer — is een routing-API de natuurlijke keuze, en OrcaRouter biedt 200+ modellen aan tegen de lijstprijs van de provider zonder opslag, zodat de helft van de stack genoeg heeft aan één sleutel en geen tweede contract. De audiohelft is nog steeds een GPU die je beheert en een checkpoint dat niemand buiten Tencent heeft gecontroleerd.

Wie moet er nu kijken, en wie moet er wachten?

Voor spraakonderzoekers, toolbouwers en iedereen wiens werk het is om nieuwe stemmodellen te evalueren, is de reden om AuK deze week te downloaden sterker dan op dag één en gaat nog steeds gepaard met dezelfde kanttekening. Je krijgt nu een gedocumenteerde architectuur, een reproduceerbaar ogend recept en een volledige tabel met doelen om te verslaan — en dat is precies wat een niet-gereproduceerde claim de moeite waard maakt om aan te vallen. De kosten van vroeg zijn blijven een weekend installatiewerk en een GPU. Voor iedereen die een productie-spraakstack kiest, verandert het rapport de vorm van de beslissing zonder die te beslechten: er zijn nu cijfers om over te discussiëren, maar ze zijn van de leverancier, ze sluiten de gesloten platforms uit waartegen je daadwerkelijk zou benchmarken, en er is nog steeds geen API, geen VRAM-ondergrens en geen track record. Let in deze volgorde op: een onafhankelijke replicatie van de Seed-TTS-Eval- en SpeechEditBench-rijen; gepubliceerde samples of een bereikbare demo-Space; en een inference-provider of gehoste API die AuK oppikt, waarna de doorberekende prijs aan onze kant de lijstprijs van de provider is, op dezelfde dag, want dat is wat 0% opslag betekent. De interessante vraag is niet langer of Tencent weer een TTS-model heeft uitgebracht — het is of één open model echt al die vijf taakfamilies tegelijk kan vasthouden, en nu Tencent zijn eigen antwoord heeft gepubliceerd, blijft er maar één ding over: dat iemand anders het controleert.