Um cartão de título de herói para a comparação 'AuK-Flash vs MathForm-8B' com o subtítulo 'Dois especialistas silenciosos em cérebros Qwen emprestados', mostrando um chip central rotulado como 'cérebro Qwen emprestado' ramificando-se para um bloco de saída de fala AuK-Flash e um bloco de saída Lean-4 MathForm-8B, com o logotipo do OrcaRouter composto no canto.
Guides & Insights

AuK-Flash vs MathForm-8B: Dois Especialistas Discretos com Cérebros Qwen Emprestados

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

AuK-Flash e MathForm-8B têm mais em comum do que provavelmente imagina qualquer um dos dois laboratórios — e nada disso é a tarefa que executam. O MathForm-8B é o modelo de autoformalização de 8B da OpenBMB — um fine-tuning do Qwen3-8B sob licença Apache-2.0 que transforma matemática em linguagem natural em declarações Lean 4 que um compilador pode verificar. O AuK-Flash é o modelo de fala destilado da Tencent — um gerador de difusão sob licença MIT para síntese e edição de fala que encaminha suas instruções por um codificador Qwen2.5-Omni-3B antes de produzir som. Um converte prosa matemática em texto formal verificável; o outro converte texto e instruções em áudio. Ambos compartilham a mesma estratégia arquitetônica a partir de direções opostas: nenhum treina um cérebro de linguagem geral do zero — cada um encapsula um modelo aberto existente e concentra o esforço real na modalidade de saída. Ambos também foram lançados da mesma forma — pesos publicados silenciosamente no Hugging Face, sem comunicado à imprensa — e são exatamente o tipo de lançamento restrito e auto-hospedado que um benchmark de modelos de fronteira não consegue capturar.

O padrão que os une

Observe as duas trilhas de lançamento lado a lado — elas são quase imagens espelhadas. O repositório AuK-Flash da Tencent está datado de 21 de agosto no Hugging Face (o AuK base, seu irmão, de 18 de agosto); o anúncio de código aberto — código, pesos e links de demonstração — só saiu esta semana, com data de 7 de setembro no cartão do Hugging Face e 9 de setembro no repositório do GitHub vinculado. O repositório MathForm-8B da OpenBMB apareceu em 14 de agosto sem nenhum anúncio. Em ambos os casos, o cartão do modelo é o lançamento, os pesos são liberados sob uma licença permissiva e não há API hospedada para experimentar — você baixa o checkpoint e o executa no hardware que controla. Para um leitor decidindo o que adotar, esse formato compartilhado importa mais do que a diferença de domínio: ambos são apostas de que um modelo aberto com escopo restrito pode atender a um nicho que um generalista atende mal, e ambos pedem que você forneça a avaliação que o fornecedor não apresentou.

O placar honesto

Como os dois modelos não se sobrepõem em nenhum benchmark, o placar é um retrato de duas apostas diferentes, em vez de um ranking. A origem dos dados importa em cada linha — as alegações do AuK-Flash são declarações do card da Tencent feitas há dias e não reproduzidas; os números do MathForm-8B são reportados pela OpenBMB a partir do arXiv 2608.14221 e não reproduzidos:

• O que é — AuK-Flash: modelo de ~1,5B da Tencent para geração e edição de fala, destilado em uma variante de difusão de 4 passos. MathForm-8B: autoformalizador de 8B da OpenBMB que converte matemática informal em Lean 4.

• Saída — AuK-Flash: áudio de 24 kHz — fala, fala editada, fontes separadas. MathForm-8B: declarações Lean 4 com cabeçalho e teorema nomeado.

• Construção — AuK-Flash: transformer de difusão destilado para um NFE fixo de 4 / CFG 0, com Qwen2.5-Omni-3B como codificador de instruções. MathForm-8B: Qwen3-8B ajustado com SFT e depois RL no conjunto de dados FormalVerse, com ~367 mil exemplos.

• Idioma de entrada — AuK-Flash: chinês e inglês (conforme o cartão do modelo). MathForm-8B: inglês, no registro de enunciados de problemas de matemática.

Lançamento — AuK-Flash: repositórios em 18/21 de agosto; anúncio de código aberto de 7 a 9 de setembro. MathForm-8B: repositório em 14 de agosto; sem anúncio até o momento.

• Evidência — AuK-Flash: ainda nenhuma além da lista de capacidades do cartão. MathForm-8B: reportado pelo fornecedor 88.06% Pass@8 sob verificação de sintaxe e 72.37% sob verificação de consistência, com FATE-H 63% e FATE-X 37% nos conjuntos de consistência difíceis.

A two-column scoreboard comparing AuK-Flash and MathForm-8B: AuK-Flash with 24 kHz audio output, Qwen2.5-Omni-3B encoder, speech generation and editing specialty, MIT license, no hosted API, vendor-card-only evidence; MathForm-8B with Lean 4 statement output, a fine-tune of Qwen3-8B, math autoformalization specialty, Apache-2.0, no hosted API, and vendor-reported Pass@8 of 88.06 under syntax check and 72.37 under consistency check; a footer notes AuK-Flash claims are Tencent-reported and MathForm-8B figures are OpenBMB-reported and unreproduced.

O placar em seis linhas: ambos são especialistas de pesos abertos com cérebros Qwen emprestados e escassa evidência independente — eles diferem no que produzem, não em como foram lançados.

AuK-Flash: discurso como saída do especialista

A afirmação de "cérebro emprestado" para o AuK-Flash é literal, não retórica. O checkpoint que a Tencent publica contém o transformador de difusão e os pesos de fusão de camadas; o modelo que realmente entende a sua instrução — Qwen2.5-Omni-3B — é baixado separadamente e carregado em tempo de execução, e o mesmo vale para o BigVGANFlowVAE, que converte o latente de volta em uma forma de onda de 24 kHz. Portanto, o que a Tencent treinou não é um modelo de linguagem, mas sim um gerador condicional de flow-matching: dado um plano semântico do codificador Qwen, ele renderiza áudio em poucas etapas. AuK-Flash é a versão destilada em quatro etapas desse gerador, e seu repositório — cerca de 6,1 GB para o checkpoint Flash em BF16 mais um VAE de 637 MB — vem com uma CLI, um mecanismo Python, nós para Gradio e ComfyUI e um script de fine-tuning. A lista de capacidades é ampla para um modelo de fala: TTS zero-shot e por instrução, edição de conteúdo e letras, alterações de tom/velocidade/volume e emoção/timbre, remoção de sotaque, conversão de sussurros, aprimoramento e separação de fontes, tudo por trás de uma interface de instrução em linguagem natural em chinês e inglês. Se cada uma funciona como descrito não foi testado fora da Tencent; a afirmação sobre a arquitetura — um pequeno Qwen que entende, um modelo de difusão destilado que produz som — é visível no próprio repositório.

A screenshot of the Hugging Face model page for tencent/AuK-Flash, showing the model card title 'AuK-Flash: Fast 4-Step Speech Generation and Editing', the MIT license tag, and the text-to-speech and diffusion tags.

A página do repositório tencent/AuK-Flash — pesos licenciados sob MIT para o modelo de fala destilado em 4 etapas, com o codificador Qwen2.5-Omni-3B e o VAE carregados de arquivos separados em tempo de execução.

MathForm-8B: prova formal como a saída do especialista

MathForm-8B é o mesmo padrão um domínio adiante. A OpenBMB pegou o Qwen3-8B — um modelo generalista treinado em 119 idiomas — e dedicou toda a sua capacidade a um único formato de saída: uma declaração de teorema em Lean 4 derivada de um problema em linguagem natural. O estágio de SFT no FormalVerse ensina o mapeamento do informal para o formal; um estágio de RL então o refina contra o veredito do compilador Lean, e é por isso que o modelo reporta não uma pontuação vaga de qualidade, mas um Pass@8 sob verificação de sintaxe e uma aprovação mais rigorosa sob verificação de consistência semântica. Os números do fornecedor são fortes — 88,06% e 72,37% em seis benchmarks, superando as linhas de base especializadas de 7B–32B do artigo — e tão carentes de reprodução independente quanto as alegações do AuK-Flash. O repositório é Apache-2.0, servido via Transformers, vLLM ou SGLang, e abre mão essencialmente de tudo pelo que o Qwen3-8B é conhecido em troca: sem chat geral em 119 idiomas, um orçamento de saída de aproximadamente 16 mil tokens para Lean e nenhuma capacidade documentada fora da formalização.

A screenshot of the Hugging Face model page for openbmb/MathForm-8B, showing the model card title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', base model Qwen3-8B in the metadata, and the Apache-2.0 license.

O repositório openbmb/MathForm-8B — pesos Apache-2.0 para o autoformalizador, listando Qwen3-8B como seu modelo base. Esta é toda a superfície pública do MathForm-8B.

A verificação é o tema que nenhum benchmark captura.

Coloque as duas saídas lado a lado e uma estranha simetria aparece. Todo o design do MathForm-8B existe porque a matemática em linguagem natural não tem sinal de correção — o compilador Lean fornece um, então o modelo é treinado contra um veredito de aprovação/reprovação que ele pode realmente sentir. O domínio do AuK-Flash tem o mesmo problema com uma solução diferente: não há compilador para "este clipe soa como o falante, em um sussurro, com a tosse removida", então o sinal de aprovação/reprovação é o ouvido humano. Nenhum benchmark agregado mede isso — um Elo em texto ou uma pontuação de qualidade em fala sintetizada diz pouco sobre se a promessa central do especialista (Lean verificado, ou fala editável e clonável) se sustenta no seu fluxo de trabalho. A consequência prática é que ambos os modelos devem ser avaliados da maneira que o fornecedor não pôde avaliá-los: MathForm-8B executando sua saída através do Lean, AuK-Flash ouvindo sua saída em seus próprios dados. Até que alguém faça isso, as alegações principais nos dois cartões são direções, não resultados.

Para quem cada um se destina, e quem deve esperar

• Escolha o MathForm-8B quando sua carga de trabalho termina na formalização — converter bancos de problemas, construir corpora Lean, alimentar automação de provas — e você quiser o especialista aberto mais forte neste porte. Não é um modelo geral, então combine-o com um para tudo ao redor da etapa formal.

• {{1}}Escolha o AuK-Flash{{/1}} {{2}}quando sua carga de trabalho resulta em áudio{{/2}} — {{3}}uma voz para falar o seu texto, uma gravação para editar, um mix para separar{{/3}} — {{4}}e você quer um modelo aberto que trate a geração e a edição como uma única operação{{/4}}. {{5}}Além dele, reserve orçamento para o encoder Qwen{{/5}}, {{6}}e para o seu próprio teste de escuta{{/6}}.

• Aguarde ambos se você precisar de uma infraestrutura comprovada e suportada: nenhum dos dois tem resultados independentes, nenhum tem uma API hospedada, e ambos têm apenas dias ou semanas de existência. O padrão a copiar é arquitetural — um pequeno cérebro de linguagem emprestado mais uma cabeça de saída especializada é muito mais barato de treinar e iterar do que um generalista completo — e é um padrão que você pode adotar no seu próprio fine-tuning, independentemente de executar ou não esses dois checkpoints.

Ambos os lançamentos também ilustram por que uma camada de roteamento merece seu lugar em uma stack mista: quando seu pipeline passa de um modelo de raciocínio geral para um especialista como um desses, o objetivo do roteador é que você não prenda a arquitetura a uma única resposta. Uma API que abrange mais de 200 modelos, failover automático se um provedor degradar e preços de tabela dos provedores repassados com markup de 0% significam que você pode manter o generalista na rota padrão e chamar o especialista apenas para o subconjunto de requisições que precisam dele — e trocar o especialista no dia em que um modelo melhor for lançado.

A comparação a ter em mente não é {{1}}AuK-Flash contra MathForm-8B{{/1}} — eles jamais competirão pela mesma requisição. A disputa real é dos dois contra a suposição de que um generalista de fronteira é o único modelo que vale a pena rodar. {{2}}Edição de fala e formalização verificada{{/2}} são dois domínios em que um modelo pequeno, focado e aberto, de cérebro emprestado, pode superar um modelo muito maior que nunca foi direcionado para o problema — o que é precisamente a aposta que a Tencent e a OpenBMB acabam de publicar, e é precisamente o que ainda precisa de prova independente.