Um cartão de título hero gerado para AuK mostrando o wordmark "AuK" acima das linhas de subtítulo "O modelo de fala 1.5B de código aberto da Tencent" e "Uma instrução em linguagem natural para cada tarefa de áudio — clonar, editar, aprimorar, separar.", com uma forma de onda azul suave sendo editada por um cursor de texto fino e quatro ícones planos rotulados como Clonar Voz, Editar, Aprimorar e Separar, com o logotipo do OrcaRouter composto no canto inferior direito.
Guides & Insights

AuK: Tencent disponibilizou silenciosamente em código aberto um modelo de fala de 1,5B que trata cada tarefa de áudio como um comando de texto.

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Aqui está uma frase que nenhuma ferramenta de síntese de fala que você pode baixar hoje fará em uma única passada: pegue esta gravação, troque a palavra "house" por "home", aumente o tom em um semitom, remova a respiração antes da última frase, limpe o ruído de fundo e, em seguida, releia o resultado com uma voz totalmente nova descrita apenas como "um homem de meia-idade afável com um leve sotaque cantonês". A resposta da Tencent a essa frase é o AuK, um "modelo de fundação para geração e edição de fala" de 1,5 bilhão de parâmetros que se tornou open-source nesta semana, sem post de lançamento e sem comunicado à imprensa — e cujo irmão destilado, AuK-Flash, agora vem com a única coisa que faltava a esta história quando a escrevemos pela primeira vez: um relatório técnico com números anexados. "Relatório Técnico do AuK: Um Modelo Fundacional de Código Aberto para Geração e Edição de Fala" (arXiv:2609.08936, cs.SD, enviado em 2026-09-08) agora é citado tanto no cartão do modelo no Hugging Face quanto no README do GitHub, com a listagem do artigo datada de 2026-09-08 e a linha de novidades do repositório de código datada de 2026/09/09. O que o relatório não faz é resolver a questão que importava — cada número nele é da própria Tencent, calculado em relação a baselines escolhidos pela Tencent, e até 2026-09-10 ninguém fora da empresa reproduziu um único deles.

Esta é uma matéria do tipo "o que sabemos até agora", revisada uma vez. A Tencent ainda não anunciou o AuK em nenhum de seus canais principais que conseguimos encontrar, então o registro é: os model cards e repositórios do Hugging Face para AuK e AuK-Flash, o repositório de código sob a organização Tencent-Hunyuan, o site do projeto em auk-project.github.io e agora o paper. Essa última adição muda o que é cognoscível — a arquitetura, a receita de treinamento e os números de avaliação são descritos em detalhes pela primeira vez — sem mudar o que é verificado. Trate tudo o que for numérico abaixo como relatado pelo fornecedor, porque é exatamente isso que é, e observe que as comparações do relatório são inteiramente contra outros modelos abertos, não as plataformas de fala hospedadas e fechadas com as quais o AuK realmente competiria.

O que realmente foi lançado, e com que discrição

A linha do tempo ainda é o resumo mais honesto do lançamento, com uma correção em relação à nossa primeira passagem. Os repositórios do Hugging Face foram criados em meados de agosto — AuK em 2026-08-18 — mas permaneceram inativos até esta semana. Quando lemos o model card do AuK em 2026-09-09, sua única linha de notícias estava datada de 2026-09-07; um dia depois, essa mesma linha lê 2026/09/09 e aponta os leitores para o paper e para os demo Spaces. O repositório do GitHub, que contém o código de inferência e treinamento, foi criado em 2026-08-19 e teve seu último push em 2026-09-09. Em outras palavras: pesos, depois código, depois um relatório técnico — três lançamentos escalonados em quatro dias, e ainda sem anúncio nos canais principais da Tencent até o momento desta escrita.

• Os pesos estão hospedados no Hugging Face sob a organização tencent e são espelhados no ModelScope sob Tencent-Hunyuan — dois espelhos, mesma licença MIT.

Cada repositório de modelo contém um único checkpoint safetensors, além de uma configuração e uma VAE: auk_base.safetensors com 6,12 GB e vae.safetensors com 0,64 GB para AuK; a mesma estrutura para AuK-Flash. A ficha do modelo pede que você também baixe Qwen/Qwen2.5-Omni-3B, o codificador de texto que AuK carrega separadamente em tempo de execução.

• O enquadramento "ninguém notou" expirou, e rapidamente. O repositório de código permanecia com zero estrelas e zero forks quando verificamos em 2026-09-09; em 2026-09-10, ele mostra 216 estrelas, 12 forks e sua primeira issue aberta. O cartão AuK relata cerca de trinta downloads no último mês com 26 curtidas. O que não mudou: as abas de discussão estão vazias, e o cartão ainda nota que o checkpoint não está implantado por nenhum provedor de inferência.

• Ambos os cartões de modelo, o README e o link do artigo demonstram Spaces no Hugging Face e no ModelScope. O Space do Hugging Face não estava publicamente acessível sem login quando verificamos, então trate o caminho "experimente no navegador" como não confirmado para usuários anônimos.

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

O cartão do Hugging Face acima ainda é toda a superfície pública de um lançamento instalável: um cartão de modelo, uma configuração, dois arquivos safetensors e uma licença. O que foi adicionado desde então é a camada de documentação ao redor disso — um artigo, uma tabela de benchmark e um bloco de citação — e nada disso muda o fato de que não há changelog, nem thread de discussão e nem listagem de provedores de inferência por trás disso.

A proposta: uma interface de instrução, dezesseis tarefas de fala

A afirmação da AuK não é que este seja o melhor modelo de texto-para-fala já lançado. É que a geração é apenas uma das cinco famílias de tarefas de fala para as quais o modelo foi treinado através de uma única interface de linguagem natural, onde uma solicitação é uma mensagem de chat que pode conter texto além de um arquivo de áudio de referência opcional. O artigo formaliza exatamente a taxonomia que o site do projeto já anunciava:

• Geração de fala — TTS zero-shot (fale este texto na voz do clipe de referência) e TTS por instrução (gere fala a partir de uma descrição de voz apenas, sem nenhum áudio de referência).

• Edição de conteúdo — reescrever o que foi dito: substituir, inserir ou excluir palavras em uma gravação existente; e edição de letras, que reescreve letras cantadas preservando a melodia e a voz.

• Edição acústica — tom em semitons, escalonamento da velocidade de fala e volume em decibéis.

• Edição paralinguística — mudanças de emoção, mudanças de timbre a partir de uma descrição, remoção de sotaque, adição ou remoção de sons não verbais (respirações, risadas, tosses) e conversão entre fala normal e sussurro mantendo o falante.

Melhoria e separação — remoção de ruído e reverberação do sinal de voz, separação de falantes por ordem de fala, separação de música e voz, e extração do falante alvo identificado pelo conteúdo da sua fala.

O caso de TTS por instrução é o que separa isto de um lançamento típico de clonagem de voz: a AuK lerá uma frase com uma voz que existe apenas como descrição textual — o próprio exemplo da documentação especifica uma mulher de vinte e poucos anos falando com um parceiro que acabou de chegar em casa, calorosa, carinhosa e levemente coquete, com um timbre doce e suave e um tom ligeiramente ascendente no final da frase, tudo sem nenhum clipe de referência anexado. Isso elimina a necessidade de uma gravação de referência, que é o custo de acesso usual da clonagem. O relatório atribui um número a essa tarefa pela primeira vez, e é um dos poucos lugares em que a AuK supera a concorrência de forma inequívoca, em vez de apenas levar vantagem por pouco.

Dentro do "1.5B": o número subestima o tempo de execução.

A contagem de parâmetros do AuK descreve o transformer de difusão, não o pipeline inteiro, e o artigo agora detalha as duas metades. O backbone é um Transformer híbrido de fluxo retificado — trinta camadas compostas por dez blocos MMDiT de fluxo duplo seguidas por vinte blocos DiT unificados de fluxo único, dimensão oculta 1536, 24 cabeças de atenção de dimensão 64, largura intermediária SwiGLU de 3072, que é de onde vem o valor de "aproximadamente 1,5 bilhão de parâmetros". Ao redor dele ficam dois componentes carregados separadamente: um LLM multimodal (Qwen/Qwen2.5-Omni-3B) que transforma a instrução e qualquer áudio de referência em condicionamento semântico, e um VAE de áudio causal de 24 kHz — o config o chama de BigVGANFlowVAE — que processa latentes de 64 dimensões a uma taxa de quadros de 50 Hz, com larguras de canal do encoder de até 768 e um decoder de até 1536. Portanto, o runtime completo é o backbone de ~1,5B mais um encoder de 3B mais o VAE, e a instrução de download deixa explícito que o encoder é um checkpoint separado com seus próprios termos.

O treinamento, segundo o relatório, ocorreu em etapas e em uma escala que o site do projeto apenas insinuava: um aquecimento somente de geração com 50.000 atualizações, depois 600.000 atualizações conjuntas de geração e edição, em cerca de 3,03 bilhões de instâncias de instrução–áudio, representando aproximadamente 1,95 milhão de horas de supervisão efetiva, distribuído por 256 GPUs, além de 1,24 milhão de atualizações na VAE. O pós-treinamento combinou a otimização de preferência por feedback humano com o aprendizado por reforço baseado em recompensa, com base em 818 grupos de preferência informativos e 9.080 candidatos avaliados, pools de prompts de RL com 10.000 prompts zero-shot e 5.000 prompts de seguimento de instrução, 30.000 amostras de avaliador de estilo e um modelo de recompensa com fine-tuning a partir do Qwen2.5-Omni-7B. Esse é um stack de pós-treinamento sério para um lançamento aberto de 1,5B, e também é um lembrete de que "pesos abertos" descreve o artefato, não o poder computacional que o produziu — um ponto que vale a pena reter ao avaliar se você conseguiria reproduzi-lo.

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

Cada figura nessa folha de especificações é lida dos próprios repositórios e site da Tencent, em vez de medida por nós, e o artigo não mudou isso — apenas moveu mais dessas linhas de "alegado" para "documentado". O único número que foi realmente testado desde que publicamos pela primeira vez é a atividade do próprio repositório, que passou de zero estrelas para algumas centenas em um dia.

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

O site do projeto continua sendo onde ficam o diagrama da arquitetura e o co-branding acadêmico, e ainda é a maneira mais barata de ver o formato do modelo: um modelo de linguagem multimodal para condicionamento semântico, um VAE de 50 Hz para acústica e um transformador híbrido sob um objetivo de flow-matching. A seção de benchmarks, que listava um aparato de avaliação sem pontuações quando olhamos pela primeira vez, agora tem um artigo de referência.

O relatório técnico chega, e os números são da própria Tencent.

Esta é a substância da atualização. O artigo relata resultados em sete suítes de avaliação — a mesma lista que o site do projeto vinha divulgando sem números — e na maioria dos eixos de geração e edição de conteúdo, a AuK lidera o campo aberto. Leia-os como uma tabela de benchmark do fornecedor, porque é isso que eles são: a tencent executou todas as comparações, escolheu todas as linhas de base e ainda não publicou nenhum código para reproduzir o harness.

• TTS zero-shot no Seed-TTS-Eval: AuK atinge média de 2,65 WER com 0,795 de similaridade de locutor, contra Qwen3-TTS com 3,07 e 0,745, Seed-TTS com 3,65 e 0,778 e VoxCPM2 com 3,65 e 0,767. AuK-Flash fica em 2,85 e 0,790. As melhores divisões individuais são 1,02 WER no conjunto de teste em inglês e 5,91 no conjunto difícil em chinês.

• TTS controlado por instruções no InstructTTSEval: AuK pontua 83.37 em chinês e 81.60 em seguimento de descrição em inglês, contra Qwen3-TTS-VD com 81.10 e 82.40 e MOSS-VoiceGenerator com 80.00 e 82.00. AuK-Flash atinge 78.80 em chinês, mas empata com a melhor pontuação em inglês do campo, com 82.40.

• Edição de conteúdo no SpeechEditBench: 91,83 de precisão contra 76,46 da Ming-UniAudio, e 71,33 em prosódia contra 26,50 — as duas maiores lacunas em todo o relatório.

• Edição guiada por instruções no Ming-Freeform-Audio-Edit, configuração completa: a taxa de erro de palavras cai de 10,46 para 3,09 em chinês e de 14,28 para 3,96 em inglês em comparação com o Ming-UniAudio, com a precisão de edição subindo de 79,62 para 91,47 e de 70,98 para 85,25. Em edições acústicas, a mesma comparação reduz o erro de palavras de 5,01 para 2,02 em chinês e de 10,75 para 3,48 em inglês.

• Edição paralinguística em MMAE-Speech: taxa de seguimento de instruções 48,23 e reescrita de conteúdo 88,11 contra Step-Audio-EditX com 43,52 e 77,27, e Ming-UniAudio com 34,13 e 76,01. AuK-Flash apresenta o melhor recall de modelo de edição na tabela, com 13,85.

• Restauração, onde o modelo é competitivo em vez de dominante: DNS Challenge: erro de palavra dessincronizado de 2,66 e similaridade de locutor de 0,99, contra 3,31 do RE-USE; CHiME-4: erro de palavra de 7,98, contra 10,71 do RE-USE; Libri2Mix: erro de palavra de 9,12, contra 9,34 do MossFormer2-SS; e VCTKSR: erro de palavra de 3,06 e similaridade de 0,97.

• O próprio VAE, avaliado separadamente: o AuK-VAE atinge 4.143 PESQ em fala, 3.833 em áudio geral e 3.884 em música, contra 3.633, 2.835 e 2.801 do MiniMax-H3-AudioVAE — uma varredura completa que importa mais do que parece, porque um latente acústico com perdas limita todas as tarefas construídas sobre ele.

O padrão nesses itens é mais interessante do que as vitórias de manchete. A AuK está muito à frente em tudo o que significa "mudar o que é dito ou como soa, e manter todo o resto" — edição de conteúdo, prosódia, edições acústicas, reconstrução. Ela está muito mais próxima do restante do campo em edição de emoção e paralinguística, onde sua precisão de emoção de 9,94 no SpeechEditBench é quase indistinguível dos 3,43 da Ming-UniAudio em um benchmark no qual ambas são fracas, e sua pontuação acústica geral de 37,07 situa-se na mesma faixa das linhas de base. Portanto, "um modelo para cada tarefa de fala" é o enquadramento da Tencent; o que o relatório realmente mostra é um modelo excelente em várias dessas tarefas e meramente presente nas demais.

Dois checkpoints: AuK e AuK-Flash

Tencent lançou duas variantes sob a mesma licença MIT. AuK é o modelo base de qualidade total, e o relatório define suas configurações de amostragem em 32 avaliações de função com uma escala de guidance sem classificador de 2,0. AuK-Flash é a versão destilada: inicialização de consistência e um objetivo Decoupled DMD com roteamento por tarefa, gerando em quatro passos fixos com o guidance totalmente desativado, o que o artigo relata como uma aceleração de 4,5× no tempo decorrido em relação ao modelo completo em condições equivalentes. Os números do próprio artigo mantêm Flash próximo na maioria das tarefas de geração — 2,85 de erro médio de palavras e 0,790 de similaridade no Seed-TTS-Eval — e é isso que torna a alegação de velocidade digna de teste, e não de descarte: difusão em quatro passos com qualidade próxima à do professor é o que tornaria um editor de fala de 1,5B interativo em uma única GPU. Dito isso, “condições equivalentes” é a expressão da Tencent para descrever o benchmark da Tencent, e um número de 4,5× medido pelos autores é exatamente o tipo de alegação que precisa de um terceiro antes de mudar qualquer decisão de compra.

O que você pode executar hoje

A superfície prática é mais ampla do que um lançamento discreto típico, porque o código veio junto com ela. A instalação tem como alvo o Python 3.10 via uv ou Conda, e o README oferece alvos de instalação adicionais que incluem Gradio, nós do ComfyUI ou a pilha de fine-tuning. A ferramenta de linha de comando auk-infer cobre todas as tarefas com o mesmo formato de mensagem: um --instruction é sempre obrigatório, e --audio é opcional dependendo da tarefa. Um servidor Gradio (auk-gradio) expõe os modelos com um seletor, e há nós personalizados do ComfyUI com um fluxo de trabalho reutilizável, embora a integração seja documentada com um limite de 30 segundos para a sequência de origem mais destino. Uma API Python espelha a CLI, e um pipeline leve de fine-tuning treina em JSONL de pares de instrução mais áudio usando o mesmo formato de mensagem da inferência. O README também descreve um Prompt Enhancer que transforma solicitações de formato livre em comandos auk-infer prontos para execução; ele espera um endpoint de chat compatível com OpenAI e recorre a um modelo local SenseVoiceSmall para reconhecimento de fala quando nenhuma credencial de ASR em nuvem está configurada. Uma limitação atual está documentada claramente: Qwen3-Omni ainda não é suportado como caminho de encoder, então o checkpoint Qwen2.5-Omni-3B continua sendo o que deve ser baixado.

O que a documentação ainda não fornece é um piso de hardware. Nenhum valor de VRAM é publicado para inferência. Os arquivos de configuração trazem uma nota sobre gradient checkpointing mencionando um pico de ~91 GB que cai para ~75 GB, o que descreve o envelope de memória em tempo de treinamento, e não um número realista de inferência de passada única. Além disso, o comando de referência que carrega AuK e AuK-Flash juntos os distribui entre duas GPUs — embora observe que ambos podem compartilhar uma só. Reserve orçamento para o download em si: cerca de 6,8 GB por variante, mais o encoder Qwen2.5-Omni-3B; depois meça a memória na sua própria GPU.

O que não está confirmado

Ser preciso sobre o desconhecido ainda é o objetivo de cobrir um modelo tão cedo, e o relatório removeu exatamente um item desta lista enquanto deixava o restante intacto:

• Não existe nenhuma execução independente que possamos encontrar. Nenhuma amostra de voz de terceiros, nenhuma replicação de benchmark, nenhuma impressão em tópicos de discussão. O primeiro problema aberto do repositório está registrado e sem resposta, e a contagem de downloads do model card ainda está na casa das dezenas, então a lacuna entre uma tabela publicada e uma reproduzida é atualmente toda a história.

• A avaliação é autoexecutada e limitada de uma forma específica. Cada baseline no relatório é outro modelo de pesos abertos — Qwen3-TTS, Seed-TTS, VoxCPM2, Ming-UniAudio, Step-Audio-EditX, MOSS-VoiceGenerator, RE-USE, MossFormer2-SS. Nenhuma das plataformas de fala hospedadas e fechadas que um comprador realmente compararia com AuK aparece, então "lidera o campo" aqui significa "lidera o campo aberto selecionado pela Tencent".

O nome "AuK" continua sem ser expandido em lugar algum no artigo, nos cartões ou no código, e colide fortemente em buscas com a ave marinha, a American University of Kuwait e repositórios não relacionados.

• A equipe agora está ao menos visível — o artigo reúne 33 autores liderados por Ziyang Ma, com afiliações que abrangem a organização Tencent Hunyuan, a Universidade Jiao Tong de Xangai, a Instituição de Inovação de Xangai e a Universidade Tecnológica de Nanyang — mas quem, dentro da Tencent, é o responsável diário pelo modelo, e se ele faz parte da linha Hunyuan ou de uma colaboração acadêmica separada, permanece não declarado.

• A cobertura de idiomas ainda está apenas parcialmente documentada: o cartão AuK-Flash declara chinês e inglês e os exemplos de código misturam ambos, mas o modelo base não tem uma lista formal de idiomas. O licenciamento tem o mesmo formato — o próprio AuK é MIT, enquanto seu codificador Qwen baixado separadamente tem seus próprios termos, então "modelo MIT" e "MIT tudo o que você precisa para executá-lo" não são a mesma afirmação.

Por que um modelo de fala unificado de pesos abertos é importante

Leia {{1}}a lista de tarefas da AuK{{/1}} {{2}}comparada com o que um builder realmente faz hoje{{/2}} {{3}}e a aposta fica mais clara do que era antes de os números chegarem{{/3}}. {{4}}Fazer todos esses trabalhos com as ferramentas existentes{{/4}} {{5}}significa encadear vários modelos especializados{{/5}} — {{6}}um checkpoint aberto para clonagem{{/6}}, {{7}}um diferente para aprimoramento{{/7}}, {{8}}um separador à parte{{/8}}, {{9}}e edição manual ou assistida por modelo para conteúdo{{/9}} — {{10}}ou alugar várias APIs hospedadas fechadas{{/10}}, {{11}}cada uma precificada por tarefa e por minuto de áudio{{/11}}, {{12}}e nenhuma delas editável da forma que a AuK descreve{{/12}}. {{13}}Um único checkpoint de pesos abertos{{/13}} {{14}}que trata tudo isso como um único problema de geração condicionada por texto{{/14}} {{15}}é um objeto genuinamente diferente{{/15}}, {{16}}e o relatório agora sustenta uma versão mais forte dessa afirmação do que o marketing fazia{{/16}}: {{17}}a parte de edição é real, não aspiracional{{/17}}. {{18}}A clonagem de voz virou commodity no último ano{{/18}}, {{19}}mas a edição de conteúdo e prosódia dirigida por instruções é onde as plataformas hospedadas fechadas ainda ganham sua margem{{/19}}, {{20}}e um 91,83 contra 76,46 em edição de conteúdo é a primeira evidência de que um modelo aberto pode conquistar esse terreno{{/20}}.

A qualificação honesta é que este é um modelo de difusão com um modelo de linguagem de 3B acoplado para condicionamento, e ele herda os custos desse formato. A qualidade por tarefa é desigual — excelente onde a tarefa é "preservar tudo exceto a edição", mais fraca em emoção — e não há endpoint hospedado, nenhuma solução de loteamento e nenhuma latência publicada, exceto pela comparação interna da variante Flash. Para as peças de um pipeline de voz ao redor dele — o LLM que decide o que deve ser dito e o endpoint de chat compatível com OpenAI do Prompt Enhancer — uma API de roteamento é o ajuste natural, e o OrcaRouter disponibiliza mais de 200 modelos pelo preço de tabela do provedor, sem margem, então essa metade da pilha precisa de uma única chave e nenhum segundo contrato. A metade de áudio ainda é uma GPU que você controla e um checkpoint que ninguém fora da Tencent auditou.

Quem deve olhar agora e quem deve esperar

Para pesquisadores de fala, construtores de ferramentas e qualquer pessoa cujo trabalho é avaliar novos modelos de voz, o argumento para baixar o AuK esta semana é mais forte do que no primeiro dia e ainda vem com a mesma ressalva. Agora você tem uma arquitetura documentada, uma receita de aparência reproduzível e uma tabela completa de metas a superar — exatamente o que torna uma afirmação não reproduzida digna de ser atacada. O custo de chegar cedo continua sendo um fim de semana de configuração e uma GPU. Para quem está escolhendo uma stack de voz de produção, o relatório muda a forma da decisão sem resolvê-la: agora há números para contestar, mas eles são do fornecedor, excluem as plataformas fechadas contra as quais você realmente faria benchmark, e ainda não há API, nem piso de VRAM, nem histórico. Observe, em ordem: uma replicação independente das linhas Seed-TTS-Eval e SpeechEditBench; amostras publicadas ou um Space de demonstração acessível; e um provedor de inferência ou API hospedada adotando o AuK — nesse ponto, o preço de repasse do nosso lado é o preço de tabela do provedor, no mesmo dia, porque é isso que margem de 0% significa. A questão interessante não é mais se a Tencent lançou outro modelo de TTS — é se um único modelo aberto consegue realmente sustentar todas essas cinco famílias de tarefas ao mesmo tempo, e agora que a Tencent publicou sua própria resposta, a única coisa que resta é alguém verificar isso.