
AuK-Flash e AuK: Tencent lançou discretamente um modelo de fala aberto que gera, edita e separa áudio
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A Tencent lançou esta semana dois dos modelos de fala aberta mais relevantes de 2026 e não contou quase a ninguém. Por volta de 7 de setembro, a organização Tencent no Hugging Face tornou públicos o AuK — "um modelo de fundação de 1,5B para geração e edição de fala", nas palavras de sua própria model card — e o AuK-Flash, a variante destilada de quatro passos do mesmo modelo, ambos sob licença MIT. Não há postagem no blog da Tencent, nenhum anúncio social e nenhum press release vinculado a nenhum dos repositórios; entre os dois, foram baixados algumas dezenas de vezes, o repositório de código para o qual as model cards apontam não está acessível, e nenhum benchmark independente existe em qualquer lugar da web indexada. Este artigo expõe o que é de fato possível saber a partir dos dois repositórios, dos arquivos de configuração e da própria página do projeto da Tencent — e o que ainda não foi verificado.
A afirmação merece ser levada a sério mesmo sem números independentes, porque o escopo é incomum. AuK não é outro modelo de clonagem de voz. Por meio de uma única interface de instruções em linguagem natural, ele promete síntese de texto para fala zero-shot e baseada em instruções, edição que alcança o que é dito, como é dito e os sons não verbais ao redor, além de aprimoramento de fala, separação de fala e separação musical. Historicamente, o campo construiu um modelo especialista diferente para cada uma dessas tarefas. A aposta da Tencent, em um único backbone generativo, é que um único modelo pode fazer todas elas — e que o AuK-Flash pode fazê-lo rápido o suficiente para uso quase em tempo real.
Dois checkpoints, um release.
Os registros de data e hora da API do Hugging Face contam uma história de um repositório que permaneceu privado antes de ser lançado. O repositório base tencent/AuK foi criado em 18 de agosto de 2026, e o repositório tencent/AuK-Flash em 21 de agosto; ambos foram modificados pela última vez em 8 de setembro, e o model card traz uma notícia datada de 7 de setembro — “[2026/09/07] AuK agora é open-source. O código e os pesos do modelo estão disponíveis ao público.” A leitura natural é que a Tencent criou os repositórios entre meados e o fim de agosto, tornou-os públicos por volta de 7 de setembro e voltou a mexer no card em 8 de setembro. Nada sobre o modelo aparece em lugar algum na web indexada, e os contadores de downloads estão na casa das dezenas — portanto, “lançamento silencioso” não é uma escolha retórica, é a situação literal.
![A screenshot of the Hugging Face repository page for tencent/AuK-Flash, showing the model name under the Tencent organization with the tags Text-to-Speech, Chinese, English, speech, zero-shot-tts, voice-cloning, speech-generation, speech-editing, speech-enhancement, source-separation, speech-separation, instruction-guided, diffusion, distillation and few-step-inference, License mit; the model card headed 'AuK-Flash: Fast 4-Step Speech Generation and Editing' with a news line dated [2026/09/07] reading 'AuK is now open-source. Code and model weights are publicly available. Try it on the Demo Space or the ModelScope Space'; a Contents list covering News, Introduction, Model Architecture, Supported Tasks, Download the weights, Citation and License; a right rail showing the base model tencent/AuK in the model tree and an Inference Providers panel; and the Introduction opening 'AuK is a 1.5B foundation model for speech generation and editing. Trained on millions of hours of diverse audio data, AuK supports zero-shot and instruction-based TTS.'](https://cms.orcarouter.ai/api/media/file/2-723.png)
Os dois checkpoints são a mesma arquitetura em diferentes momentos de sua vida. AuK é o professor: um modelo base voltado para geração de alta qualidade. AuK-Flash é o aluno: destilado para inferência rápida em quatro passos, e é isso que o torna o alvo de implantação mais interessante e a razão pela qual encabeça o título aqui. Na página do projeto da Tencent, a família de modelos é apresentada como tendo aproximadamente 1,5 bilhão de parâmetros, treinada com o que a ficha do modelo descreve apenas como "milhões de horas de dados de áudio diversos" e que a página do projeto especifica como cerca de 1,95 milhão de horas de supervisão efetiva em aproximadamente 3,03 bilhões de instâncias de instrução-áudio. A página do projeto também traz as marcas da Shanghai Jiao Tong University e da Tencent Hunyuan, situando o AuK na linha de pesquisa de modelos abertos da Tencent Hunyuan, em vez de em uma família de produtos comerciais. O treinamento não é a única coisa que acontece após o pré-treinamento: a Tencent descreve uma etapa de pós-treinamento que combina otimização de preferências com feedback humano para edição aberta com aprendizado por reforço baseado em recompensas para geração de fala.
A tabela de variantes no card é inequívoca sobre qual é qual: AuK é "o modelo base para geração de alta qualidade", AuK-Flash é "o modelo destilado para inferência rápida em 4 passos." Ambos podem ser baixados do Hugging Face e do ModelScope sob o namespace Tencent-Hunyuan, e ambos possuem a licença MIT — uma das licenças mais permissivas que um lançamento de pesos abertos pode ter, o que importa para qualquer pessoa que queira construir um produto em cima deles.
O que um modelo orientado por instruções realmente faz
A interface do AuK é uma única caixa de prompt: você entrega ao modelo uma instrução em linguagem natural e, quando a tarefa exige, uma referência de áudio, e ele retorna áudio. Agrupadas pela taxonomia do próprio card, as cinco famílias de tarefas são:
• Geração de fala — TTS zero-shot que clona uma voz a partir de um clipe de referência, e "instruct TTS" que sintetiza fala apenas a partir de uma descrição de voz ("uma voz feminina calorosa, ligeiramente mais lenta"), sem nenhum áudio de referência.
• Edição de conteúdo — reescrever o que é dito: substituir, inserir ou remover palavras em uma gravação existente, e edição de letras, que reescreve as palavras de um clipe de canto mantendo a melodia e a voz do cantor.
• Edição acústica — tom em semitons, velocidade de fala e volume em decibéis, cada um ajustável em um clipe existente enquanto a identidade e o conteúdo são preservados.
Edição paralinguística — emoção, timbre (conforme uma descrição), remoção de sotaque, adição ou remoção de sons não verbais, como respiração, riso e tosse, e conversão entre fala normal e sussurro.
• Aprimoramento e separação — aprimoramento de fala (remoção de ruído e de reverberação), separação de fala por ordem de fala, separação musical que extrai a voz cantada de uma mixagem e extração do falante-alvo identificada pelo que o falante diz.
Essa lista é o verdadeiro diferencial. A maioria dos sistemas de fala abertos mais capazes de 2026 é forte em um ou dois desses aspectos — clonagem de voz e TTS são o espaço mais concorrido — e fraca ou ausente nos demais. A aposta da AuK é a abrangência: os mesmos pesos, o mesmo formato de instrução, em geração, edição e separação, que é o tipo de escopo que normalmente só é entregue como uma coleção de modelos especialistas ajustados.
Como é construído
Ler os repositórios e a página do projeto em conjunto dá uma visão consistente da arquitetura. AuK não é um modelo de linguagem de áudio autorregressivo do tipo que lê texto e emite tokens. É um sistema de difusão por flow matching no molde dos modelos de imagem, com três partes:
• Um modelo de linguagem multimodal de grande escala — Qwen/Qwen2.5-Omni-3B, baixado separadamente — lê a instrução e qualquer áudio de referência e produz o condicionamento semântico.
Um VAE de áudio treinado conjuntamente em fala, áudio geral e música codifica e decodifica a 24 kHz através de latentes acústicos de 50 Hz; a configuração do repositório o identifica como um BigVGANFlowVAE com dimensão latente de 64 e um downsample de 480 vezes, e o disponibiliza como um arquivo vae.safetensors separado.
O núcleo generativo é um Transformer híbrido de fluxo retificado: blocos MMDiT de fluxo duplo que mantêm a condicionamento de áudio e texto separados, seguidos por blocos DiT unificados de fluxo único que os combinam, treinados sob um objetivo de correspondência de fluxo. A configuração divulgada mostra um modelo de 1.536 de largura com 24 cabeças, 10 camadas de fluxo duplo e 20 camadas de fluxo único.
AuK-Flash é o mesmo transformer após a destilação. A Tencent descreve um processo em duas etapas — inicialização de consistência em nível de trajetória, seguida por um objetivo DMD “desacoplado do roteamento de tarefas” — finalizado com supervisão de regressão de predição limpa. O resultado, segundo a página do projeto, é uma qualidade de geração próxima à do professor em quatro passos de amostragem, sem orientação sem classificador na inferência, com uma aceleração de aproximadamente 4,5× no tempo de relógio (wall-clock) em comparação ao modelo completo em condições equivalentes. Essas são alegações do fornecedor, não reproduzidas, mas são a razão concreta pela qual o AuK-Flash é a variante a que um desenvolvedor recorreria.
O que a Tencent afirma, e o que um leitor pode verificar.
A página do projeto faz afirmações qualitativas fortes — a AuK é "líder" em geração e edição e "competitiva" em tarefas de restauração no nível de sinal, como realce e separação — e lista as suítes de benchmark por trás delas: Seed-TTS-Eval e InstructTTSEval para geração, MMAE-Speech, SpeechEditBench e Ming-Freeform-Audio-Edit para edição, DNSMOS e UTMOS para qualidade perceptiva, e DNS Challenge, CHiME-4 e Libri2Mix para realce e separação. Nenhuma pontuação numérica é publicada na página, não há artigo por trás dela, e nenhum terceiro reproduziu qualquer parte disso. Cada uma dessas afirmações é relatada pelo fornecedor e deve ser lida dessa forma até que uma execução independente exista.

Duas outras alegações precisam ser sinalizadas, pois não sobreviveram a uma verificação direta em 9 de setembro de 2026. Primeiro, o cartão afirma que o código está publicamente disponível e fornece o link github.com/Tencent-Hunyuan/AuK para instalação, Gradio, ComfyUI e instruções de ajuste fino — mas esse repositório retorna HTTP 404 no momento em que escrevo, e ele não está entre os repositórios públicos da organização Tencent-Hunyuan. O código pode simplesmente ainda estar em fase de disponibilização; de qualquer forma, "o código está disponível" é atualmente a afirmação do cartão, não algo que o leitor possa usar. Segundo, o cartão aponta para Spaces de demonstração no Hugging Face e no ModelScope: o studio do ModelScope responde, mas o Space do Hugging Face retornou uma barreira de autorização quando verificado, portanto as demonstrações são, na melhor das hipóteses, parcialmente públicas.
O que está aqui, o que está faltando
Fazer um balanço em 9 de setembro de 2026 separa um lançamento real de um completo.
• Presente — dois conjuntos de pesos para download sob licença MIT: tencent/AuK para o modelo base e tencent/AuK-Flash para a variante destilada de quatro passos, cada um com cerca de 6,1 GB para o transformer de difusão mais um VAE incluído, espelhados no Hugging Face e no ModelScope.
• Presente — uma superfície de tarefas excepcionalmente ampla sob uma única interface de instrução: geração, edição de conteúdo, acústica e paralinguística, aprimoramento e separação, tudo em uma única família de modelos.
• Presente — uma história concreta de "velocidade": a AuK-Flash é destilada para quatro passos, sem o uso de orientação sem classificador, com uma aceleração wall-clock de 4.5× alegada pelo fornecedor.
• Ausente — um anúncio. Nenhuma publicação no blog da Tencent, post em redes sociais, comunicado de imprensa ou post no canal Hunyuan aponta até agora para qualquer um dos repositórios.
• Falta — um artigo ou relatório técnico. O bloco de citação na página do projeto é um espaço reservado sem autores e sem identificador arXiv, e não há números publicados por trás das alegações de benchmark.
• Em falta — código acessível. O repositório do GitHub e o Cookbook para os quais o cartão fornece links retornam 404 na verificação atual, então hoje o único artefato executável são os pesos, além do que a comunidade montar ao redor deles.
• Ausente — serviço de inferência e avaliação independente. Nenhum provedor de inferência hospeda a AuK, não existe API hospedada e, com downloads na casa das dezenas, ninguém publicou uma reprodução ainda.

Executando AuK-Flash hoje, ou esperando
Se você quiser executar o AuK-Flash por conta própria, o caminho de download é explícito, mesmo que o código não o seja: faça pull de tencent/AuK-Flash e tencent/AuK (a base é opcional, a menos que você queira o teacher), e também faça pull de Qwen/Qwen2.5-Omni-3B, porque o checkpoint contém apenas os pesos do diffusion-transformer e da fusão de camadas — o encoder multimodal e a VAE são carregados de arquivos separados em tempo de execução, e o card observa que é esperado que faltem chaves do text_encoder durante o carregamento. O hardware é a restrição real. Este é um diffusion transformer de ~1,5B cujo checkpoint sozinho tem ~6,1 GB, rodando junto com um encoder multimodal de ~3B e uma VAE, então uma GPU de 24 GB é o ponto de partida razoável, em vez de um modelo para notebook; as notas de memória da configuração, que mencionam o gradient checkpointing reduzindo os picos de treinamento de cerca de 91 GB para 75 GB, dizem respeito ao treinamento e não devem ser lidas como requisitos de inferência. Quanto ao software, a configuração usa o backend flash-attention por padrão, mas a CLI de inferência pode fazer fallback para um backend de atenção torch simples, o que elimina a etapa de compilação do flash-attn na primeira execução.
Se isso vale a pena fazer hoje depende do que você está construindo. Para ser honesto, a situação atual é que este é um modelo para observar e testar em um sandbox, não um modelo para ser integrado a um pipeline de produção ainda — sem paper, sem código acessível e sem avaliação independente, as alegações de capacidade se apoiam inteiramente na palavra da Tencent. Para uma equipe que hoje quer geração, edição ou separação de fala por meio de uma API, um modelo que é de fato servido é a escolha pragmática, que é precisamente o papel da OrcaRouter entre os modelos que têm endpoints: uma API para mais de 200 modelos, com os preços de tabela dos provedores repassados sem margem, de modo que o preço do fornecedor é o seu preço desde o primeiro dia, e failover automático, para que um recém-chegado não comprovado possa ser testado em uma fatia do tráfego real sem apostar o pipeline nele. Nada disso se aplica a AuK ou AuK-Flash ainda, porque nada os serve. No momento em que um provedor hospedar AuK, a lógica econômica do roteador se torna a forma barata de avaliá-lo; até lá, a escolha é auto-hospedar os pesos ou esperar.
Perguntas frequentes
O AuK ou AuK-Flash está disponível através de uma API?
Não. Ambos são lançamentos apenas com pesos. Nenhum provedor de inferência os hospeda e não existe API hospedada, portanto não há nada para chamar hoje — a única maneira de usá-los é baixar os pesos e executá-los você mesmo.
Qual é a diferença entre AuK e AuK-Flash?
A mesma família de modelos em dois estágios. AuK é o modelo base, voltado para geração de alta qualidade; AuK-Flash é sua variante destilada, otimizada para inferência rápida em quatro passos, sem orientação livre de classificador. Segundo a Tencent, essa versão roda cerca de 4,5× mais rápido do que o modelo base em condições equivalentes. Esse valor de aceleração é divulgado pelo fornecedor e não foi medido de forma independente.
O AuK-Flash pode ser usado comercialmente?
Os pesos são disponibilizados sob a licença MIT, que permite uso comercial com o aviso de licença preservado — a menos restritiva das licenças comuns de pesos abertos. O repositório de código separado para o qual o card aponta não está acessível em 9 de setembro de 2026; portanto, a resposta prática para reutilização de código continua em aberto até que ele apareça.
O que assistir
• O repositório de código — github.com/Tencent-Hunyuan/AuK é o artefato ausente de maior valor. Quando ele aparecer, os modelos de instrução do Cookbook transformam a lista de tarefas acima de material de marketing em algo executável.
• Uma execução independente — a primeira reprodução por terceiros decidirá se as alegações de ser “líder” em geração e edição sobrevivem ao contato com áudio real, e se o AuK-Flash de quatro etapas realmente se aproxima do modelo base.
Um artigo — a citação na página do projeto é um espaço reservado, o que geralmente significa que uma submissão ao arXiv está por vir; a receita de treinamento, os números de benchmark e os detalhes da destilação estão todos lá.
• Uma listagem de serviço — o primeiro provedor de inferência a hospedar AuK o transforma de um diretório de pesos em um modelo chamável com preço, momento em que se torna testável por meio de um roteador, em vez de um projeto de auto-hospedagem.
AuK e AuK-Flash são reais, mas inacabados, como costumam ser os lançamentos abertos mais interessantes: os pesos são honestos, e a história em torno deles ainda não foi escrita. Marque tencent/AuK-Flash nos favoritos, trate toda alegação de capacidade como reportada pelo fornecedor até que um artigo ou um benchmark independente chegue, e verifique se os próximos dias trazem o código que transformaria isso de um artefato promissor em algo construível.
