
LLaDA2.2-mini: Pesos do Diffusion Agent da Ant inclusionAI Surgiram Silenciosamente em 5 de Setembro
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
Às 05:16 UTC de 5 de setembro de 2026, surgiu um repositório do Hugging Face chamado inclusionAI/LLaDA2.2-mini e, até o momento em que este texto é escrito, isso é praticamente toda a história do lançamento: os pesos estão publicados, a ficha do modelo foi escrita e o fornecedor — a inclusionAI, laboratório do Ant Group por trás da linha de modelos de difusão LLaDA — não disse nada sobre o assunto. Sem post de lançamento, sem divulgação nas redes sociais, sem nenhuma entrada na tabela de modelos do README do GitHub inclusionAI/LLaDA2.X, onde o LLaDA2.2-flash, de maior porte, está sozinho. Vinte e quatro horas após o repositório aparecer, o contador de downloads marcava zero. Este é um artigo do tipo "o que sabemos até agora" sobre o LLaDA2.2-mini, e a disciplina desse formato é importante aqui, porque quase todos os números interessantes associados ao modelo são números que a inclusionAI digitou na própria ficha. Este artigo separa o que é verificável de forma independente sobre o lançamento daquilo que é relatado pelo fornecedor, e aponta as perguntas em aberto em vez de escamoteá-las.
A versão curta, para quem só quer ter uma ideia geral: o LLaDA2.2-mini é o irmão menor do modelo de linguagem de difusão LLaDA2.2-flash que a inclusionAI anunciou em julho de 2026, agora disponível como um checkpoint de mistura de especialistas de 16 bilhões de parâmetros que ativa apenas 1,4 bilhão de parâmetros por token, suporta contexto de 128K e é treinado para trabalho agêntico — chamada de ferramentas, correção em múltiplas rodadas — usando um decodificador de difusão que pode inserir e excluir tokens no meio da geração. É Apache-2.0. E, como os pesos têm apenas um dia e não vieram acompanhados de nenhum anúncio, nenhuma das estruturas habituais existe ainda: nenhuma avaliação independente, nenhuma API hospedada que possamos encontrar, nenhum guia de implantação além do que a própria ficha do modelo recomenda. O que você pode verificar hoje é a arquitetura, a licença e os números que a inclusionAI escolheu publicar.
O lançamento é um repositório, não um evento.
Comece pelo que pode ser verificado sem confiar em ninguém. A API do Hugging Face registra que inclusionAI/LLaDA2.2-mini foi criado em 5 de setembro de 2026 e modificado pela última vez no mesmo dia. Ele é licenciado sob Apache-2.0, usa o formato safetensors com tensores bf16, inclui um template de chat e exige trust_remote_code porque a arquitetura de difusão é distribuída como código de modelagem personalizado. O repositório irmão, inclusionAI/LLaDA2.2-flash, foi criado em 16 de julho de 2026, acumulou milhares de downloads e dezenas de curtidas nas semanas seguintes e foi anunciado publicamente. O mini não tem nem o anúncio nem a adoção — em seu primeiro dia registrou curtidas de um dígito e nenhum download.

A única atenção de terceiros que o mini atraiu até agora é uma página agregadora que republicou o cartão do modelo poucas horas após o repositório surgir; ela é um espelho do cartão, não uma fonte independente, e não traz nenhuma informação que o próprio repositório não tenha. Esse é todo o registro público até 6 de setembro. O enquadramento que importa para um leitor que decide se deve prestar atenção: a inclusionAI já lançou silenciosamente pesos de difusão duas vezes na mesma semana — este modelo em 5 de setembro e os checkpoints de geração LLaDA-Image no dia anterior —, então um lançamento silencioso de repositório parece ser um padrão de lançamento estabelecido do laboratório, não um acidente. Nada nesse padrão nos diz se um anúncio está por vir.
O que LLaDA2.2-mini realmente é
A arquitetura é o aspecto mais interessante do modelo, e está totalmente descrita no cartão. O LLaDA2.2-mini é um modelo de linguagem de difusão com mistura de especialistas, construído sobre a espinha dorsal do LLaDA2.0-mini. Modelos de linguagem de difusão invertem o ciclo de geração usual: em vez de um modelo autorregressivo prever um token por vez, um LLM de difusão parte de um bloco de tokens mascarados ou ruidosos e refina o bloco inteiro em paralelo, removendo o ruído até obter uma sequência coerente. A geração do LLaDA2.2 adiciona o que a inclusionAI chama de edição de Levenshtein: dois tokens de controle, DELETE e INSERT, que permitem ao decodificador alterar o comprimento e a estrutura da sequência que está produzindo, em vez de apenas o conteúdo — removendo um trecho redundante que já escreveu ou abrindo um ponto de inserção onde um novo contexto (por exemplo, o resultado de uma ferramenta) precisa ser encaixado. Esse é o mecanismo que a família de modelos usa para fazer a decodificação por difusão funcionar em loops de múltiplos turnos com uso de ferramentas, nos quais um modelo autorregressivo pode simplesmente aguardar o próximo turno do usuário, mas um modelo de difusão por blocos precisa revisar o que já gerou.
As especificações relevantes, todas direto do cartão: 16 bilhões de parâmetros totais, excluindo embeddings, 1,4 bilhão ativos por token através de um MoE de 256 especialistas com 8 especialistas roteados por token; 20 camadas, 16 cabeças de atenção, 4 cabeças KV; um vocabulário de 157.184 tokens; embeddings posicionais rotativos; e uma janela de contexto de 128K. Uma técnica chamada Block Routing restringe quais especialistas disparam no nível do bloco de difusão, e é assim que o modelo mantém um contexto de 128K viável em uma única GPU de consumo. O cartão o posiciona para uma GPU de 24GB ou mais e recomenda o SGLang como backend de servir para cargas de trabalho agênticas de contexto longo.

Acima é onde o lançamento se posiciona na linha do tempo da família — a linhagem que torna "LLaDA2.2-mini" legível. O LLaDA2.0, em novembro de 2025, foi o primeiro modelo de linguagem por difusão escalado para 100 bilhões de parâmetros; o LLaDA2.1, em fevereiro de 2026, adicionou edição de tokens para acelerar a difusão de texto; a geração LLaDA2.2, em julho de 2026, anunciada com o LLaDA2.2-flash e seu relatório técnico, direcionou a família para agentes. A mini é a peça dessa geração que permaneceu uma promessa até agora: a cobertura do lançamento de julho já mencionava uma variante mais leve de 16B do flash para implantação mais barata, mas os pesos autônomos só foram disponibilizados em 5 de setembro.
Os números no cartão, rotulados como o que são
A tabela de benchmark no model card é da própria inclusionAI, impressa no dia em que os pesos foram publicados, e nenhum laboratório independente reproduziu qualquer parte dela — a Artificial Analysis não tem entrada para o LLaDA2.2-mini, e não encontramos nenhuma execução de terceiros. Leia os números como alegações do fornecedor com uma direção, não como fatos medidos. Dentro desse enquadramento, a história que o card conta é consistente: o LLaDA2.2-mini é um especialista em contextos longos e em uso agêntico, e sacrifica alguns pontos em benchmarks gerais para chegar lá.
• Média agentic — 59,00, a partir de τ²-Bench 57,50, Claw-Eval 57,16 e PinchBench 62,33 (relatado pelo fornecedor).
• Chamada de funções — 47.68 no BFCL v4, acima de 25.05 e 28.44 para LLaDA2.0-mini e LLaDA2.1-mini, respectivamente; 69.02 no BFCL v3 mais antigo.
• Contexto longo — 34,99 no LongBench v2, mais que o dobro dos 15,51 e 12,13 que os minis anteriores conseguiram, o que é o retorno concreto da janela de 128K.
• Geral — uma média geral de 46,47, com AIME 2026 em 35,05, OlympiadBench 61,11, LiveCodeBench v6 28,14, GPQA-Diamond 44,41 e IFBench 24,93 — vários deles ligeiramente abaixo dos minis anteriores, o custo visível de gastar o orçamento de treinamento em comportamento agêntico em vez disso.

Esse último ponto merece ser considerado com calma, porque é a razão honesta pela qual uma equipe escolheria este modelo em vez de um generalista mais forte no papel. O LLaDA2.2-mini não afirma ser o melhor modelo pequeno em matemática ou em seguir instruções; ele afirma ser bom naquilo em que os modelos de difusão eram historicamente ruins — trabalho sustentado, de múltiplas rodadas, com uso de ferramentas — mantendo o número de parâmetros ativos baixo o suficiente para fazer diferença em uma única GPU. O salto no BFCL v4 e o salto no LongBench v2 são os números que sobreviveriam a uma execução independente se a ficha técnica estiver amplamente correta.
Executando-o e o andaime ausente.
No papel, o caminho para executar o LLaDA2.2-mini é simples, pois o lançamento é nativo do Transformers: a ficha do modelo mostra como carregá-lo com AutoModelForCausalLM e trust_remote_code=True em transformers ≥ 5.2.0, em seguida chamar generate com parâmetros específicos de difusão — um tamanho de bloco de 32 e temperatura 0.0 são os padrões recomendados, e a ficha sugere um tamanho de saída de 32.768 tokens para a maioria das consultas. Para atender agentes com contexto longo, a ficha aponta para o SGLang, e os usuários da China continental contam com um espelho no ModelScope. O que ainda não existe é o ecossistema ao redor: nenhuma API hospedada em provedor algum que possamos verificar, nenhuma compilação GGUF que possamos encontrar e um suporte de frameworks ainda em consolidação — o trabalho da comunidade na arquitetura LLaDA2 no llama.cpp é recente, portanto as opções de quantização são escassas.
Essa combinação — um paradigma de decodificação genuinamente novo, com um dia de existência, somente self-hosted — é exatamente a situação em que uma camada de roteamento se justifica sem fingir que o novo modelo está pronto para produção. A forma responsável de experimentar o LLaDA2.2-mini é executá-lo você mesmo em um caminho de teste enquanto a produção permanece em um modelo maduro, e é para isso que serve a configuração do OrcaRouter: uma API para mais de 200 modelos ao preço de tabela do provedor com 0% de markup, failover automático para que o travamento do checkpoint de um dia não derrube um fluxo de trabalho, e o DSL de roteamento para compor uma chamada de difusão self-hosted com modelos autorregressivos hospedados atrás de uma única chave. Quando — se — um provedor listar o LLaDA2.2-mini, o mesmo repasse se aplica e o preço que você vê é o do próprio provedor. Até lá, a posição honesta sobre disponibilidade é: baixe os pesos Apache-2.0 do Hugging Face ou do ModelScope e execute-os você mesmo.
O que assistir em seguida
Três coisas transformariam este “o que sabemos até agora” em uma história real, e todas as três estão ausentes hoje. Primeiro, um anúncio: se o padrão do LLaDA2.2-flash se mantiver, um post de lançamento e a cobertura do relatório técnico poderiam acompanhar o lançamento silencioso do repositório, e isso provavelmente adicionaria detalhes de treinamento que o model card omite. Segundo, uma execução independente: a média de 59,00 em benchmarks de agentes e a pontuação de 47,68 no BFCL v4 são as afirmações que mais valem a pena reproduzir, porque os benchmarks de agentes são aqueles em que a escolha do harness mais altera as pontuações. Terceiro, maturidade de serving: guias de serving do SGLang, um caminho via vLLM e quantizações da comunidade diriam se a pegada de 1,4B de parâmetros ativos é tão barata de operar na prática quanto a ficha técnica sugere. Nada disso existe em 6 de setembro. Os pesos são reais, a licença é permissiva e a arquitetura é genuinamente uma forma diferente de rodar um agente — mas a evidência de que é um bom agente é, por enquanto, o model card de um único fornecedor.
