Tarjeta de título para una comparación entre AuK y AuK-Flash, que dice "AuK vs AuK-Flash: ¿32 pasos de muestreo o 4?" con el subtítulo "Generación y edición de voz: modelo base vs estudiante destilado" y tres iconos que dicen: 24 kHz, NFE 4 vs 32 y 6.12 GB.
Guides & Insights

AuK vs AuK-Flash: 32 pasos de muestreo o 4, y por qué a veces gana el estudiante.

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Ambos checkpoints pesan exactamente 6,122 GB. Ambos se distribuyen bajo MIT. Ambos utilizan el mismo codificador de instrucciones de 3 mil millones de parámetros, descargado por separado, y el mismo VAE de 637 MB.AuK y AuK-Flash no se diferencian en casi nada de lo que aprovisionas, y sí en una cosa que notas en cada llamada: cuántas veces se ejecuta el muestreador. AuK, el modelo fundacional de generación y edición de voz de 1.5B con pesos abiertos que el equipo Hunyuan de Tencent y los coautores académicos de la Universidad Jiao Tong de Shanghái y la NTU publicaron en Hugging Face el 9 de septiembre, realiza 32 evaluaciones de función con guía sin clasificador a 2,0. AuK-Flash, el alumno destilado, realiza cuatro, con la guía completamente desactivada, para una aceleración de 4,5× en tiempo de reloj, según se afirma. La lectura obvia es que Flash es el asiento económico que tomas cuando la latencia pesa más que la calidad. Esa lectura es errónea, y las propias tablas de evaluación del proveedor son las que la contradicen: en las filas de comparación directa del informe técnico, Flash obtiene la puntuación más alta en la métrica de proporción de edición de MMAE-Speech, en la columna paralingüística de SpeechEditBench, en el seguimiento de instrucciones en inglés, en la similitud del hablante en la edición acústica y en las cuatro filas de calidad perceptual del realce. No es una degradación. Es una compensación distinta, y de qué lado quieras estar depende de cuál de las dos tareas estés ejecutando realmente.

¿Qué es lo que realmente difiere entre ellos?

Quita el marketing y la elección se reduce a un archivo de configuración. El runtime de AuK es un Transformer híbrido de flujo rectificado — bloques MMDiT de doble flujo que alimentan bloques DiT unificados de flujo único — que ejecuta un solucionador Euler bfloat16 a 24 kHz, con latentes de 64 dimensiones a 50 Hz. AuK-Flash ejecuta la arquitectura idéntica con un muestreador destilado acoplado, producido mediante inicialización de consistencia más DMD desacoplado enrutado por tareas. Todos los demás componentes son compartidos.

Pasos de muestreo — AuK: 32 evaluaciones de función, configurables. AuK-Flash: 4, fijos.

Guía sin clasificador — AuK: escala 2.0, ajustable. AuK-Flash: ninguna (CFG=0).

Tamaño del checkpoint — AuK: auk_base.safetensors de 6.122 GB. AuK-Flash: auk_flash.safetensors de 6.122 GB. Idénticos hasta el megabyte.

Runtime compartido — un VAE de 637 MB más el codificador Qwen/Qwen2.5-Omni-3B, descargados por separado y utilizados por ambos.

Velocidad declarada — AuK-Flash: 4.5× más rápida en tiempo real que el profesor de 32-NFE con hardware, duración y tamaño de lote equivalentes.

Licencia — MIT para ambas, lo que por una vez significa lo que dice.

Ese mismo tamaño de checkpoint es el detalle que reencuadra toda la comparación. Las variantes destiladas suelen comprar su velocidad siendo más pequeñas. AuK-Flash no es más pequeña. No ahorras disco, no ahorras tiempo de transferencia y — dado que el codificador y la VAE son compartidos y el DiT tiene el mismo ancho — no ahorras VRAM de forma significativa al elegir el modelo estudiante. El único recurso que Flash te devuelve es tiempo. Aun así, vale la pena mencionar una trampa de presupuesto: el «1.5B» del nombre del modelo describe el backbone de difusión, y el archivo en disco es de 6.122 GB. Prevé el espacio para el archivo.

Donde AuK-Flash realmente supera al modelo completo

Esta es la parte en la que el instinto de "destilado = peor" se equivoca, y se mantiene en varias familias de tareas no relacionadas en las tablas del informe. Empecemos por la percepción. En el conjunto de mejora del DNS Challenge, Flash obtiene un UTMOS de 4,05 frente al 3,86 de AuK; en CHiME-4, 3,91 frente a 3,72; en Libri2Mix, 4,03 frente a 3,87; en VCTKSR, 4,05 frente a 3,93. Flash también gana la columna de error de reconocimiento en dos de esos cuatro conjuntos, con un WER de CHiME-4 de 7,84 frente a 7,98 y un WER de VCTKSR de 2,92 frente a 3,06. La naturalidad evaluada por humanos es el único eje en el que el estudiante está consistentemente por delante, y el informe lo dice explícitamente: el modelo completo ofrece una mayor precisión lingüística y fidelidad de edición, mientras que Flash "a menudo ofrece una mejor calidad perceptiva".

Los triunfos no se limitan a la mejora. En la métrica de tasa de edición de MMAE-Speech — si una edición aterriza en la magnitud prevista — Flash obtiene 13,85 frente a los 12,44 de AuK. En la columna paralingüística de SpeechEditBench, anota 39,25 frente a 38,50. En la tarea de descripción-a-habla en inglés de InstructTTSEval, obtiene 82,40 frente a 81,60, lo que empata con el mejor modelo de referencia en esa fila. En la edición acústica del conjunto Ming-Freeform, mantiene la mayor similitud de hablante de la familia: 0,79 en chino y 0,75 en inglés, frente a 0,78 y 0,74 del modelo base. En otras palabras, la preservación de la identidad del hablante es una de las cosas que cuatro pasos te aportan: el resumen del propio informe señala que el modelo completo ofrece un menor error medio de reconocimiento, mientras que Flash preserva mejor la identidad del hablante. Si trabajas en conversión de voz, doblaje o realce de audio, donde el timbre importa más que el error de palabra, el modelo alumno es la mejor opción.

A two-column scoreboard comparing AuK and AuK-Flash across six dimensions. AuK: 32 configurable sampling steps, CFG scale 2.0, Seed-TTS-Eval WER 2.65 average, editing accuracy 91.83, enhancement UTMOS 3.86, checkpoint size 6.122 GB. AuK-Flash: 4 fixed sampling steps, no guidance (CFG 0), Seed-TTS-Eval WER 2.85 average, editing accuracy 87.50, enhancement UTMOS 4.05, checkpoint size 6.122 GB. Footer reads "Vendor-reported figures, AuK technical report; no independent reproduction yet."

Donde los 32 pasos aún se justifican

Las ventajas del modelo base se concentran exactamente en el lugar que cabría esperar de un modelo de difusión con mayor presupuesto de muestreo: cualquier cosa en la que la salida tenga que ser lingüísticamente correcta.

En Seed-TTS-Eval, el WER promedio de AuK es 2,65 frente al 2,85 de Flash, con una similitud de hablante de 0,795 frente a 0,790. La dispersión dentro de ese promedio es más informativa que el propio promedio. Ambos están prácticamente empatados en el conjunto de prueba en inglés — 1,02 y 1,03 — y se separan en chino, 1,02 frente a 1,10, y nuevamente en el subconjunto chino difícil, 5,91 frente a 6,43. El chino es donde los pasos adicionales dan sus frutos.

El mismo patrón aparece en el seguimiento de instrucciones. En la tarea de descripción-a-voz en chino de InstructTTSEval, la brecha es amplia: 83,37 para AuK frente a 78,80 para Flash, y el informe señala que el modelo base lidera en las tres métricas en chino de esa suite, mientras que la «principal ventaja» de Flash «es su resultado de DSD en inglés más sólido». La lengua, no la arquitectura, es la línea divisoria.

{{1}}La fidelidad de edición es lo que más las separa.{{/1}} {{2}}La precisión de edición de contenido de SpeechEditBench es de 91,83 para AuK frente a 87,50 para Flash: la mayor diferencia individual de toda la comparación.{{/2}} {{3}}La edición acústica es casi igual de desigual: 37,07 frente a 30,26.{{/3}} {{4}}En la suite Ming-Freeform, AuK obtiene una WER más baja en casi todos los aspectos relevantes:{{/4}} {{5}}3,09 frente a 3,34 en edición completa en chino,{{/5}} {{6}}y una diferencia mucho mayor, de 3,96 frente a 4,84, en edición completa en inglés.{{/6}} {{7}}Si tu producto reescribe las palabras de una grabación —edición de letras, sustitución de contenido, inserción y eliminación—, el modelo de 32 pasos es el que mantiene la transcripción fiel, y la diferencia de 8× en el número de pasos merece la pena pagarla.{{/7}}

Ambos modelos también son, según las cifras del propio informe, aún débiles en la edición emocional: la precisión de emoción de SpeechEditBench es 9.94 para AuK y 6.29 para Flash. Eso no es un artefacto de destilación. Es una familia de tareas que nadie ha resuelto, y elegir al estudiante no te hará peor en ello de lo que ya eres.

El 4.5× es un número de muestra, no un número de extremo a extremo.

He aquí la aritmética que la aceleración del titular esconde, y es lo más útil que hay que entender antes de comprometer una arquitectura con Flash.

AuK-Flash ejecuta 4 pasos de muestreo, mientras que AuK ejecuta 32. Eso supone 8× menos pasos. El proveedor reporta una velocidad 4,5× mayor en tiempo de reloj. La diferencia entre esas dos cifras es todo lo que rodea al bucle de muestreo, y está dominada por el codificador: un modelo multimodal Qwen2.5-Omni-3B que ambos checkpoints cargan y que ambos deben ejecutar en cada solicitud. Ese codificador tiene aproximadamente el doble del tamaño del backbone de difusión, y su costo es fijo. Flash no puede acelerarlo, porque Flash no forma parte de él.

Entonces, la versión honesta de la afirmación es esta: 4.5× es lo que se obtiene en la porción de difusión en condiciones equiparables, y tu ganancia de extremo a extremo será la proporción del tiempo real que ocupe el bucle de muestreo. Si ejecutas generación de formato largo en la que dominan 32 pasos sobre muchos fotogramas latentes, te acercarás a la cifra publicada. Si tu carga de trabajo son clips cortos con un preprocesamiento intensivo de instrucciones, o si procesas solicitudes pequeñas en lote, una fracción mayor de cada llamada se reparte en el codificador compartido y tu aceleración real será materialmente menor que 4.5×. Mide tu propia combinación antes de dejar que un presupuesto de latencia dependa de ello. Nadie ha publicado todavía esa cifra de extremo a extremo, incluido el proveedor, que no reporta cifras absolutas de latencia ni requisitos de VRAM en absoluto.

Lo que cuesta la destilación, en palabras de los propios autores

El informe técnico es inusualmente franco sobre dónde falla el estudiante, y esos modos de fallo son más útiles para un implementador que la tabla de benchmarks.

Los objetivos de guía del profesor resultaron ser el problema. Usar objetivos CFG en la rama de consistencia "puede exponer al estudiante de pocos pasos a predicciones sobresaturadas", lo que, según los autores, causa sobreimpulso y recorte audible. Por separado, un programa DMD desacoplado uniforme "degrada la separación de múltiples hablantes y vocal", con algunas salidas del estudiante que retroceden hacia la mezcla sin procesar: la destilación borra la separación que se suponía que el modelo debía realizar. El DMD enrutado por tareas es la solución descrita, y es por eso que el informe se cuida de acotar esa debilidad particular a la variante uniforme. Si la separación de voz es una parte central de tu canalización, este es el párrafo con el que debes probar antes de confiar en ello.

Dos restricciones adicionales son operativas más que estadísticas. El Prompt Enhancer de la pipeline asigna expresiones coloquiales sobre velocidad, volumen y tono a un conjunto fijo de valores admitidos, y rechaza cualquier cosa que no pueda asignar antes de que se ejecute la inferencia acústica; por lo tanto, las solicitudes no admitidas fallan temprano en lugar de degradarse con elegancia. Además, el repositorio solo acepta Qwen/Qwen2.5-Omni-3B como ruta de codificador; el README indica que Qwen3-Omni no está actualmente soportado, por lo que un codificador más nuevo no es una actualización directa. La integración de ComfyUI impone un límite de 30 segundos en las secuencias de fuente más destino.

Ejecutar ambos es la configuración prevista.

El ejemplo multi-GPU del propio repositorio coloca AuK en un dispositivo y AuK-Flash en otro — cuda:0 y cuda:1 —, lo cual es una señal clara de que Tencent espera que coexistan en lugar de competir. También es la respuesta correcta para la mayoría de los stacks de voz en producción, porque los dos modelos son fuertes en áreas disjuntas. Enruta las solicitudes que requieren mucha edición y las solicitudes en chino a AuK; enruta la mejora, la separación, el seguimiento de instrucciones en inglés y cualquier cosa interactiva a AuK-Flash. Ambos cargan el mismo codificador y el mismo VAE, así que pagas por ese runtime compartido una vez y cambias entre checkpoints detrás de él.

Esa es una decisión de enrutamiento en la capa del modelo, y tiene la misma forma que la que OrcaRouter aplica en la capa de API para los modelos alojados. Donde ambos se encuentran hoy es la costura en el propio pipeline de AuK: el Prompt Enhancer requiere un endpoint de chat compatible con OpenAI para convertir una instrucción aproximada en el vocabulario compatible del modelo, y el respaldo ASR opcional necesita una ruta de transcripción. Apunta cualquiera de los dos a un endpoint de chat compatible con OpenAI y obtienes una sola clave para más de 200 modelos, el precio de lista del proveedor trasladado con un margen del 0 % y conmutación por error automática si un backend se cae — lo cual importa precisamente porque este es un lanzamiento de hace dos días sin API alojada ni reproducción independiente, y no quieres una dependencia no probada asentada sobre un endpoint fijo.

No obstante, deja claro qué no está disponible. Ni AuK ni AuK-Flash son ofrecidos por ningún proveedor de inferencia alojado — las tarjetas de Hugging Face lo dicen directamente — y ninguno de los dos es enrutable a través de OrcaRouter hoy. Esta es una decisión de autoalojamiento de principio a fin.

A decision card headed "Which AuK checkpoint should you run?" with two columns. Pick AuK: content and lyric editing, Chinese speech generation, edit and transcript fidelity, best raw WER 2.65. Pick AuK-Flash: enhancement and separation, voice conversion and dubbing, English instruction TTS, 8x fewer sampling steps. A bar beneath both reads "Same encoder, same VAE, same 6.122 GB - run both."

Lo que aún se desconoce

Casi todo sobre este lanzamiento está reportado por el proveedor. La aceleración de 4.5×, las cifras de WER, las columnas de SpeechEditBench y las filas de UTMOS provienen todas del informe técnico del propio equipo de AuK, arXiv 2609.08936, presentado el 8 de septiembre; no hay reproducción independiente, ninguna entrada en tablas de clasificación de terceros ni resultado de un banco de pruebas neutral. La señal de adopción es igualmente escasa: al 10 de septiembre, los dos repositorios de Hugging Face muestran 30 descargas en el último mes y aproximadamente dos docenas de «me gusta» cada uno, mientras que el repositorio de GitHub muestra 217 estrellas, 12 bifurcaciones y tres contribuyentes. Eso es un lanzamiento de investigación, no una moda.

img src="4.png" alt="Captura de pantalla del README del repositorio de Tencent-Hunyuan AuK en GitHub que muestra el aviso de código abierto del 9 de septiembre de 2026 y la tabla de variantes de AuK y AuK-Flash"> p>El lanzamiento en sí fue silencioso de una manera que vale la pena decir claramente, porque es fácil sobreinterpretar. No hubo anuncio de Hunyuan, ni entrada de blog, ni página de precios, ni evento de lanzamiento. La única declaración fechada del proveedor es una sola línea en el README del repositorio — [2026/09/09] Publicamos AuK como código abierto. Los metadatos del repositorio de Hugging Face muestran que los Spaces se crearon antes, a mediados de agosto, y que los pesos se modificaron por última vez el 9 y 10 de septiembre, por lo que el empaquetado ocurrió antes que el anuncio. Lo que se puede saber del repositorio: pesos con licencia MIT para ambas variantes, un informe técnico, instrucciones de descarga funcionales para Hugging Face y ModelScope, y una lista de tareas documentada. Lo que no está confirmado: si alguna de las cifras reportadas sobrevive a un banco de pruebas independiente, si aparecerá un endpoint alojado, y si el checkpoint de Flash sigue siendo el predeterminado recomendado una vez que otras personas lo hayan ejecutado.

Screenshot of the Tencent-Hunyuan/AuK repository on GitHub, captured September 10 2026, showing the README News entry dated 2026/09/09 reading "We open-source AuK. Code and model weights are publicly available.", the README headline "AuK: An Open-Source Foundational Model for Speech Generation and Editing", and repository counts of 217 stars, 12 forks and 3 contributors.

¿Cuál elegir?

Si estás creando contenido o editando letras, o procesando habla en chino en cualquier forma, toma AuK y acepta los 32 pasos. Sus ventajas allí son grandes, consistentes en dos suites de edición independientes, y exactamente el tipo de fallo de corrección — una palabra incorrecta en la transcripción — que los usuarios notan de inmediato.

Si estás desarrollando mejora, separación, conversión de voz o cualquier cosa en la que una persona espera el resultado, elige AuK-Flash. Es más rápido por un amplio margen en el bucle de muestreo, se impone de manera contundente en las filas de calidad perceptiva y preserva mejor la identidad del hablante que el modelo del que fue destilado. La brecha de calidad que existe se concentra en tareas que probablemente no estés ejecutando.

Si estás construyendo un producto de voz que abarca ambos, ejecuta ambos. Mismo disco, mismo codificador, misma licencia, una diferencia de configuración — y el patrón de despliegue que el repositorio ya demuestra. Lo único que merece la pena esperar es tu propia medición de latencia de extremo a extremo: el 4,5× es real, pero pertenece al muestreador, y solo tu combinación de cargas de trabajo te dice cuánto de ello llega a tus usuarios.