
AuK vs AuK-Flash: 32 passos de amostragem ou 4, e por que o aluno às vezes vence
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
Ambos os checkpoints pesam exatamente 6,122 GB. Ambos são distribuídos sob a licença MIT. Ambos são movidos pelo mesmo codificador de instruções de 3 bilhões de parâmetros, baixado separadamente, e pela mesma VAE de 637 MB. AuK e AuK-Flash diferem em quase nada do que você provisiona — e em uma coisa que você sente em cada chamada: quantas vezes o sampler é executado. AuK, o modelo fundacional de geração e edição de fala de peso aberto de 1,5B que o time Hunyuan da Tencent e coautores acadêmicos da Shanghai Jiao Tong e da NTU disponibilizaram no Hugging Face em 9 de setembro, gasta 32 avaliações de função com orientação sem classificador em 2,0. AuK-Flash, o aluno destilado, gasta quatro, com a orientação totalmente desligada, para uma aceleração alegada de 4,5× no tempo real (wall-clock). A leitura óbvia é que Flash é o assento econômico que você escolhe quando a latência supera a qualidade. Essa leitura está errada, e são as próprias tabelas de avaliação do fornecedor que a contradizem: nas comparações diretas (head-to-head) do relatório técnico, Flash obtém a maior pontuação na métrica de razão de edição do MMAE-Speech, na coluna paralinguística do SpeechEditBench, no cumprimento de instruções em inglês, na similaridade do locutor em edição acústica e em todas as quatro linhas de qualidade perceptual de aprimoramento. Não é um downgrade. É um trade-off diferente, e de que lado você quer ficar depende de qual das duas tarefas você está realmente executando.
O que realmente difere entre eles
Remova o marketing e a escolha se reduz a um arquivo de configuração. O runtime da AuK é um Transformer de fluxo retificado híbrido — blocos MMDiT de fluxo duplo alimentando blocos DiT unificados de fluxo único — executando um solver Euler bfloat16 a 24 kHz, latentes de 64 dimensões a 50 Hz. O AuK-Flash executa a mesma arquitetura com um amostrador destilado acoplado, produzido por inicialização de consistência mais DMD Desacoplado roteado por tarefa. Todos os outros componentes são compartilhados.
• Etapas de amostragem — AuK: 32 avaliações de função, configurável. AuK-Flash: 4, fixo.
• Classifier-free guidance — AuK: scale 2.0, tunable. AuK-Flash: none (CFG=0).
• Tamanho do checkpoint — AuK: auk_base.safetensors com 6.122 GB. AuK-Flash: auk_flash.safetensors com 6.122 GB. Idênticos ao megabyte.
• Runtime compartilhado — um VAE de 637 MB mais o codificador Qwen/Qwen2.5-Omni-3B, baixados separadamente e usados por ambos.
• Velocidade declarada — AuK-Flash: 4,5× mais rápido em wall-clock do que o professor de 32-NFE com hardware, duração e tamanho de lote equivalentes.
• Licença — MIT para ambos, o que, por uma vez, significa o que diz.
Esse tamanho de checkpoint idêntico é o detalhe que reformula toda a comparação. Variantes destiladas geralmente compram sua velocidade sendo menores. AuK-Flash não é menor. Você não economiza disco, não economiza tempo de transferência e — como o codificador e o VAE são compartilhados e o DiT tem a mesma largura — você não economiza VRAM de forma significativa ao escolher o aluno. O único recurso que o Flash devolve para você é tempo. Vale mencionar uma armadilha de orçamento, de qualquer forma: o "1.5B" no nome do modelo descreve o backbone de difusão, e o arquivo em disco tem 6.122 GB. Provisione para o arquivo.
Onde o AuK-Flash realmente supera o modelo completo.
Esta é a parte em que o instinto de "destilado = pior" se engana, e isso se sustenta em várias famílias de tarefas não relacionadas entre si nas tabelas do relatório. Comecemos pela percepção. No conjunto de aprimoramento do DNS Challenge, o Flash registra UTMOS 4,05 contra 3,86 do AuK; no CHiME-4, 3,91 contra 3,72; no Libri2Mix, 4,03 contra 3,87; no VCTKSR, 4,05 contra 3,93. O Flash também vence na coluna de erro de reconhecimento em dois desses quatro conjuntos, com WER de 7,84 no CHiME-4 contra 7,98 e WER de 2,92 no VCTKSR contra 3,06. A naturalidade avaliada por humanos é o único eixo em que o aluno está consistentemente à frente, e o relatório afirma isso explicitamente: o modelo completo oferece maior precisão linguística e fidelidade de edição, enquanto o Flash "frequentemente oferece melhor qualidade perceptiva".
As vitórias não se limitam ao aprimoramento. Na métrica de taxa de edição do MMAE-Speech — se uma edição atinge a magnitude pretendida — a Flash marca 13,85 contra 12,44 da AuK. Na coluna paralinguística do SpeechEditBench, é 39,25 contra 38,50. Na tarefa de descrição-para-fala em inglês do InstructTTSEval, é 82,40 contra 81,60, o que empata com o melhor baseline daquela linha. Na edição acústica na suíte Ming-Freeform, ela mantém a maior similaridade de locutor da família, 0,79 em chinês e 0,75 em inglês, contra 0,78 e 0,74 da base. A preservação da identidade do locutor, em outras palavras, é uma das coisas que quatro passos compram — o resumo do próprio relatório é que o modelo completo apresenta menor erro médio de reconhecimento, enquanto a Flash preserva melhor a identidade do locutor. Se você está fazendo conversão de voz, dublagem ou trabalhos de aprimoramento em que o timbre importa mais do que o erro de palavra, o aluno é o melhor modelo.

Onde os 32 passos ainda se justificam
As vantagens do modelo base se concentram exatamente no lugar que você esperaria de um modelo de difusão com mais orçamento de amostragem: qualquer coisa em que a saída precisa ser linguisticamente correta.
No Seed-TTS-Eval, {{1}}o WER médio da AuK é 2.65 contra 2.85 da Flash, com similaridade de locutor em 0.795 contra 0.790{{/1}}. {{2}}A dispersão dentro dessa média é mais informativa do que a própria média{{/2}}. Ambos estão efetivamente empatados no conjunto de teste em inglês — {{3}}1.02 e 1.03{{/3}} — e divergem no chinês, {{4}}1.02 contra 1.10{{/4}}, e novamente no subconjunto chinês difícil, {{5}}5.91 contra 6.43{{/5}}. É no chinês que os passos extras compensam.
O mesmo padrão aparece no seguimento de instruções. Na tarefa de descrição-para-fala em chinês do InstructTTSEval, a diferença é grande: 83.37 para AuK contra 78.80 para Flash, e o relatório observa que o modelo base lidera em todas as três métricas chinesas dessa suíte, enquanto a "principal vantagem" do Flash é seu resultado mais forte de DSD em inglês. A linguagem, não a arquitetura, é a linha divisória.
{{1}}A fidelidade de edição é o que mais os diferencia.{{/1}} A precisão de edição de conteúdo do SpeechEditBench é de 91,83 para o AuK contra 87,50 para o Flash — {{2}}a maior diferença individual da comparação.{{/2}} A edição acústica é quase tão desequilibrada, com 37,07 contra 30,26. Na suíte Ming-Freeform, o AuK apresenta WER menor em quase todos os aspectos que importam: 3,09 contra 3,34 na edição completa em chinês, e uma margem muito maior, de 3,96 contra 4,84, na edição completa em inglês. Se o seu produto reescreve as palavras em uma gravação — edições de letras, substituição de conteúdo, inserção e exclusão — o modelo de 32 passos é o que mantém a transcrição fiel, e vale a pena pagar pela diferença de 8× nos passos.
Ambos os modelos também são, pelos próprios números do relatório, ainda fracos em edição emocional: a precisão de emoção do SpeechEditBench é 9,94 para AuK e 6,29 para Flash. Isso não é um artefato de destilação. É uma família de tarefas que ninguém resolveu, e escolher o aluno não vai fazer você pior nisso do que já é.
O 4,5× é um número do sampler, não um número de ponta a ponta.
Aqui está a aritmética que o ganho de velocidade estampado nas manchetes esconde, e é a coisa mais útil de se entender antes de comprometer uma arquitetura com o Flash.
AuK-Flash executa 4 etapas de amostragem, enquanto AuK executa 32. Isso é 8× menos etapas. O fornecedor relata 4,5× mais rápido em tempo de parede. A diferença entre esses dois números é tudo ao redor do loop de amostragem, e é dominada pelo codificador: um modelo multimodal Qwen2.5-Omni-3B que ambos os checkpoints carregam e que ambos devem executar em toda solicitação. Esse codificador tem aproximadamente o dobro do tamanho do backbone de difusão, e seu custo é fixo. Flash não pode acelerá-lo, porque Flash não faz parte dele.
Então, a versão honesta da afirmação é esta: 4,5× é o que você obtém na parte de difusão sob condições equivalentes, e seu ganho de ponta a ponta será a parcela do seu tempo de relógio que o loop de amostragem realmente ocupa. Se você executa geração de formato longo, em que 32 passos sobre muitos quadros latentes dominam, você ficará próximo do número publicado. Se sua carga de trabalho são clipes curtos com pré-processamento intenso de instruções, ou se você processa pequenas solicitações em lote, uma fração maior de cada chamada fica no codificador compartilhado e sua aceleração real será consideravelmente menor que 4,5×. Meça a sua própria combinação antes de deixar um orçamento de latência depender disso. Ninguém publicou esse número de ponta a ponta ainda — incluindo o fornecedor, que não divulga nenhum valor absoluto de latência nem requisitos de VRAM.
O que a destilação custa, nas próprias palavras dos autores
O relatório técnico é incomumente sincero sobre onde o aluno falha, e esses modos de falha são mais úteis para quem o implementa do que a tabela de benchmark.
Os alvos de orientação do professor acabaram sendo o problema. Usar alvos de CFG no ramo de consistência "pode expor o aluno de poucas etapas a previsões supersaturadas", o que, segundo os autores, causa overshoot e clipping audível. Separadamente, um agendamento uniforme de DMD Desacoplado "degrada a separação de múltiplos falantes e vocais", com algumas saídas do aluno regredindo em direção à mistura não processada — a destilação apaga a separação que o modelo deveria realizar. O DMD com roteamento por tarefa é a correção descrita, e é por isso que o relatório tem o cuidado de limitar essa fraqueza específica à variante uniforme. Se a separação de fala é uma parte central do seu pipeline, este é o parágrafo para testar antes de confiar nele.
Mais duas restrições são operacionais, e não estatísticas. O Prompt Enhancer do pipeline mapeia expressões coloquiais sobre velocidade, volume e tom para um conjunto fixo de valores suportados, e rejeita qualquer coisa que não consiga mapear antes que a inferência acústica seja executada — portanto, solicitações não suportadas falham cedo, em vez de degradarem graciosamente. E o repositório só aceita Qwen/Qwen2.5-Omni-3B como caminho de codificador; o README afirma que o Qwen3-Omni não é suportado atualmente, então um codificador mais novo não é um upgrade direto. A integração com o ComfyUI tem um limite de 30 segundos para sequências de fonte mais destino.
Executar ambos é a configuração pretendida.
O próprio exemplo multi-GPU do repositório coloca o AuK em um dispositivo e o AuK-Flash em outro — cuda:0 e cuda:1 — o que é um sinal claro de que a Tencent espera que eles coexistam em vez de competirem. Também é a resposta certa para a maioria das pilhas de fala em produção, porque os dois modelos são fortes em áreas distintas. Encaminhe solicitações com muita edição e em chinês para o AuK; encaminhe aprimoramento, separação, seguimento de instruções em inglês e qualquer coisa interativa para o AuK-Flash. Ambos carregam o mesmo encoder e a mesma VAE, então você paga por esse runtime compartilhado uma única vez e alterna entre os checkpoints por trás dele.
Essa é uma decisão de roteamento na camada de modelo, e tem a mesma forma daquela que o OrcaRouter aplica na camada de API para modelos hospedados. Onde as duas se encontram hoje é a emenda no pipeline da própria AuK: o Prompt Enhancer requer um endpoint de chat compatível com OpenAI para transformar uma instrução bruta no vocabulário suportado pelo modelo, e o fallback opcional de ASR precisa de um caminho de transcrição. Aponte qualquer um para um endpoint de chat compatível com OpenAI e você obtém uma chave em mais de 200 modelos, preço de tabela do provedor repassado com margem de 0% e failover automático se um backend cair — o que importa justamente porque esta é uma versão lançada há dois dias, sem API hospedada e sem reprodução independente, e você não quer uma dependência não comprovada sobre um endpoint fixo.
Seja claro sobre o que não está disponível, no entanto. Nem AuK nem AuK-Flash são servidos por nenhum provedor de inferência hospedado — os cartões do Hugging Face dizem isso diretamente — e nenhum deles pode ser roteado pelo OrcaRouter hoje. Esta é uma decisão de auto-hospedagem de ponta a ponta.

O que ainda não se sabe
Quase tudo sobre este lançamento é relatado pelo fornecedor. O aumento de velocidade de 4,5×, os números de WER, as colunas do SpeechEditBench e as linhas do UTMOS vêm todos do relatório técnico da própria equipe AuK, arXiv 2609.08936, submetido em 8 de setembro — não há reprodução independente, nenhuma entrada em leaderboard de terceiros e nenhum resultado de harness neutro. O sinal de adoção é igualmente fraco: em 10 de setembro, os dois repositórios do Hugging Face mostram 30 downloads no último mês e cerca de duas dúzias de curtidas cada, enquanto o repositório do GitHub mostra 217 estrelas, 12 forks e três contribuidores. Isso é uma publicação de pesquisa, não uma tendência.
img src="4.png" alt="Captura de tela do README do repositório GitHub do Tencent-Hunyuan AuK mostrando o aviso de código aberto de 9 de setembro de 2026 e a tabela de variantes AuK e AuK-Flash"> p>O lançamento em si foi silencioso de uma forma que vale a pena afirmar com clareza, pois é fácil interpretar além do que foi dito. Não houve anúncio do Hunyuan, nem post de blog, nem página de preços, nem evento de lançamento. A única declaração datada do fornecedor é uma única linha no README do repositório — [2026/09/09] Disponibilizamos o AuK como código aberto. Os metadados do repositório do Hugging Face mostram que os espaços foram criados antes, em meados de agosto, e os pesos foram tocados pela última vez em 9 e 10 de setembro; portanto, o empacotamento ocorreu antes do anúncio. O que é possível saber pelo repositório: pesos licenciados sob MIT para ambas as variantes, um relatório técnico, instruções de download funcionais para Hugging Face e ModelScope, e uma lista de tarefas documentada. O que não é confirmado: se algum dos números relatados sobrevive a uma avaliação independente, se um endpoint hospedado aparecerá e se o checkpoint Flash continua sendo o padrão recomendado depois que outras pessoas o executarem.

Qual escolher
Se você está criando conteúdo ou editando letras, ou servindo fala em chinês de qualquer forma, adote o AuK e aceite os 32 passos. Suas vantagens nesse contexto são grandes, consistentes em duas suítes de edição independentes, e exatamente o tipo de falha de correção — uma palavra errada na transcrição — que os usuários percebem imediatamente.
Se você está construindo aprimoramento, separação, conversão de voz ou qualquer coisa com um humano esperando pela saída, use AuK-Flash. Ele é mais rápido por uma ampla margem no loop de amostragem, vence as linhas de qualidade perceptiva de forma inequívoca e preserva a identidade do locutor melhor do que o modelo do qual foi destilado. A diferença de qualidade que existe está concentrada em tarefas que você provavelmente não está executando.
Se você está construindo um {{1}}produto de fala que abrange ambos{{/1}}, rode ambos. {{2}}Mesmo disco, mesmo codificador, mesma licença, uma diferença de configuração{{/2}} — e {{3}}o padrão de implantação que o repositório já demonstra{{/3}}. A única coisa que vale a pena aguardar é {{4}}a sua própria medição de latência de ponta a ponta{{/4}}: {{5}}o 4,5× é real, mas ele pertence ao amostrador{{/5}}, e {{6}}somente a sua combinação de cargas de trabalho diz quanto disso chega aos seus usuários{{/6}}.
