
LLaDA-Image-Turbo: Ant Group disponibilizou discretamente um gerador de imagens aberto em 4 etapas
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1542Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
Em 4 de setembro de 2026, o laboratório de código aberto do Ant Group, inclusionAI, disponibilizou os pesos do LLaDA-Image-Turbo e do LLaDA-Image no Hugging Face sem post de lançamento, sem comunicado à imprensa e — até o momento em que este texto foi escrito — sem licença declarada em nenhum dos quatro repositórios que criou. O LLaDA-Image-Turbo é o membro rápido dessa versão: um checkpoint destilado que, segundo o model card, transforma um prompt ou uma instrução de edição em uma imagem de 1024×1024 em quatro etapas de amostragem, contra cinquenta no modelo-base LLaDA-Image do qual foi destilado. O que torna essa publicação discreta digna de leitura é uma única linha relatada pelo fornecedor no model card — estado da arte entre modelos de código aberto no Qwen-Image-Bench — e o que torna difícil agir com base nela é tudo ao redor dessa linha que a versão ainda não diz.
Este é um relatório de primeiro dia, não uma análise. Os checkpoints são reais e podem ser baixados, o código de inferência baseado em Diffusers roda a partir de um repositório clonado, e o artigo de apoio, LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes, foi publicado no arXiv em 3 de setembro de 2026. Mas não há anúncio da inclusionAI nem da Ant Group para reconciliar com isso, e no momento em que este texto foi escrito, o repositório LLaDA-Image-Turbo mostrava dois downloads — por todas as medidas visíveis, ninguém fora do laboratório ainda o executou. Tudo abaixo está dividido de acordo: o que os repositórios realmente contêm, o que o artigo afirma e o que precisaria acontecer antes de LLaDA-Image-Turbo ser algo em que uma equipe de produção devesse apostar.
O que realmente foi lançado
Quatro checkpoints entraram no ar no Hugging Face sob a organização inclusionAI na madrugada de 4 de setembro de 2026 (UTC): LLaDA-Image, o modelo Base de cinquenta passos em BF16; LLaDA-Image-FP8; LLaDA-Image-Turbo, o checkpoint rápido destilado em BF16; e LLaDA-Image-Turbo-FP8. A linha de notícias do próprio model card, datada de 2026-09-04, é todo o anúncio formal: "Disponibilizamos os checkpoints LLaDA-Image Base e Turbo juntamente com o código de inferência." Um repositório no GitHub sob a mesma organização contém o código de inferência, e o artigo no arXiv foi publicado no dia anterior.
Os repositórios não são stubs. Cada repositório Turbo contém um pipeline Diffusers completo — um gerador de diffusion-transformer fragmentado, um tokenizador de imagem SigVQ, um conector query-former, um agendador e um codificador de texto de nove fragmentos — portanto, "o modelo" aqui não é um nome de espaço reservado, mas dezenas de gigabytes de pesos executáveis. A família é descrita como um modelo de geração e edição de imagens de 6 bilhões de parâmetros; lido estritamente, o número de 6B refere-se ao backbone diffusion-transformer treinado do zero, com um módulo de modelo de linguagem de difusão congelado da linha LLaDA2 do laboratório (o codificador de texto de nove fragmentos) adicionando compreensão por cima.

Por que a parte de quatro etapas é a manchete
Para um modelo de difusão de imagens, o custo se concentra principalmente nas etapas de amostragem. Cada etapa é uma passagem completa pela rede, então a diferença entre um modelo de cinquenta etapas e um modelo de quatro etapas é, aproximadamente, uma ordem de magnitude no custo computacional por imagem, antes mesmo de considerar resolução, tamanho do lote ou hardware. Esse é exatamente o propósito da linha “Turbo” nesta versão. A inclusionAI destilou o LLaDA-Image no LLaDA-Image-Turbo com uma técnica que chama de Twin-DMD, e o checkpoint destilado opera em duas a quatro etapas, sendo quatro as recomendadas, com escala de orientação de 1,0 em comparação aos 5,0 do modelo Base. Mesmo objeto de pipeline, mesmo prompt, mesma saída de 1024×1024 — uma fração das passagens de remoção de ruído.
A ressalva é a padrão para modelos de imagem destilados, e aqui ela é mais acentuada do que o habitual: a destilação troca um pouco de fidelidade por velocidade, e a inclusionAI não publicou nenhum número de benchmark para o LLaDA-Image-Turbo. As pontuações do Qwen-Image-Bench na ficha do modelo pertencem ao checkpoint Base de cinquenta passos. Portanto, a diferença real de qualidade entre o LLaDA-Image-Turbo em quatro passos e o LLaDA-Image em cinquenta passos não é quantificada pelo fornecedor nem testada por mais ninguém — o que faz de "Turbo" uma alegação de velocidade que só é possível verificar executando o modelo.
Um checkpoint que gera e edita
A aposta arquitetural por trás da família é a unificação. Um único conjunto de pesos lida com geração de texto para imagem, geração condicionada por VQ, edição de imagem de referência e renderização de texto em chinês–inglês — sem um backbone de edição separado, e é por isso que a metade de "edição" do lançamento não é distribuída como um modelo próprio. No modo de edição, a imagem de referência é desviada do módulo de linguagem e injetada diretamente no modelo de difusão, enquanto o módulo de linguagem processa apenas a instrução; a ficha técnica afirma preservação fiel do conteúdo com mudanças visuais precisas, além de geração fotorrealista e texto tipograficamente limpo em ambos os idiomas.
Dois detalhes técnicos merecem registro mesmo no primeiro dia. O gerador é um transformer de difusão de 6B treinado do zero com RMSNorm sem parâmetros e o otimizador Muon, detalhes que o artigo relata em vez de passar por cima. E a história do treinamento no artigo é uma inversão deliberada da receita usual de imagem-texto: o pré-treinamento e o treinamento intermediário somente com imagens constroem primeiro um forte prior visual, e só então o laboratório introduz a supervisão de linguagem pareada e o treinamento conjunto de geração-edição. Essa ordenação — e os "Fully Open Training Recipes" no título do artigo — é o gancho de pesquisa. Observe a lacuna entre o enquadramento do artigo e o plano de lançamento da Hugging Face: os pesos e o código de inferência estão marcados como concluídos, mas o código de treinamento ainda está marcado como "em breve".

Lendo a afirmação 53.53 / 53.38
O número que vai circular é a linha do benchmark: no Qwen-Image-Bench, um benchmark de texto-para-imagem com trilhas separadas em inglês e chinês, a inclusionAI reporta que o LLaDA-Image marca 53,53 no total na trilha em inglês e 53,38 na trilha em chinês, o que ela classifica como um novo estado da arte entre os modelos de código aberto em ambas. Se lermos com precisão, três limites aparecem. O resultado é reportado pelo fornecedor, na avaliação do próprio laboratório, e ainda não foi reproduzido em lugar nenhum. Ele pertence ao modelo base LLaDA-Image de cinquenta passos, e não ao LLaDA-Image-Turbo, o checkpoint sobre o qual este lançamento supostamente trata. E "estado da arte em código aberto" é uma categoria que muda a cada mês — é uma afirmação sobre onde o modelo se posiciona diante de seus pares abertos, não uma afirmação sobre a fronteira fechada.
O que a figura lhe diz é por que a família existe. Um modelo chinês-inglês de texto-para-imagem e edição que lidera um benchmark aberto em ambas as trilhas é direcionado diretamente ao mercado acelerado de modelos de imagem abertos — o mesmo segmento onde os checkpoints da família Qwen-Image, e um fluxo constante de outros pesos abertos, têm ditado o ritmo. Se o LLaDA-Image-Turbo reproduzir mesmo a maior parte da qualidade do modelo Base em quatro etapas, ele se torna um dos modelos de imagem abertos mais baratos de executar que tem uma alegação de qualidade crível por trás de si. "Se" é quem faz o trabalho nessa frase.
As lacunas que impedem um navio silencioso de ser uma lancha.
Um anúncio. A linha de 2026-09-04 na ficha do modelo é a única declaração do fornecedor. Não há postagem no blog da inclusionAI, nenhum comunicado da Ant Group, nenhuma postagem em redes sociais, nenhuma cobertura da imprensa além de agregadores — o que por si só é um sinal que merece ser respeitado, em vez de ser mascarado.
• Uma licença. Nenhum dos quatro repositórios do Hugging Face possui uma tag de licença, e o repositório do GitHub não tem arquivo LICENSE — apenas uma nota bilíngue LEGAL.md dizendo que os comentários em chinês no código prevalecem sobre os traduzidos. Você não pode presumir direitos comerciais sobre pesos sem licença declarada, independentemente de quão "aberto" o título do artigo pareça. Para qualquer pessoa cujo uso seja comercial, esta é a primeira pergunta, e atualmente não tem resposta.
• Números Turbo. Nenhum valor de benchmark, latência ou qualidade é publicado especificamente para o LLaDA-Image-Turbo. O placar acima é o do modelo Base; o checkpoint destilado é uma afirmação não quantificada até que o fornecedor ou uma execução independente preencha essa lacuna.
• Verificação independente e acesso hospedado. Downloads e curtidas não passam de um dígito; não existe nenhuma reprodução independente e nenhum provedor de inferência que consigamos encontrar — incluindo o OrcaRouter — está servindo o modelo até agora. Hoje, o que existe são apenas pesos no Hugging Face e nada mais.
O que fazer com um navio silencioso de um dia
Se você é pesquisador ou uma equipe que faz auto-hospedagem, este é um lançamento para clonar e executar esta semana: pesos abertos, um pipeline Diffusers, uma variante BF16 e uma FP8 para trocar memória por qualidade, e um artigo que conta como ele foi treinado antes mesmo de o código de treinamento chegar. Se seu uso é comercial, a lacuna de licença vem primeiro — um modelo de imagem de quatro etapas com uma alegação plausível de qualidade não vale um risco jurídico, e a atitude responsável é avaliar em sua própria GPU e esperar a linha da licença antes de colocá-lo em qualquer lugar perto de um produto.
Quatro coisas transformariam este navio tranquilo em um lançamento sobre o qual vale a pena construir, e nenhuma delas aconteceu até 4 de setembro de 2026:
• Um anúncio real da inclusionAI ou do Ant Group, nomeando a família e os seus termos.
• Uma licença declarada nos repositórios — Apache-2.0 corresponderia à prática mais ampla de pesos abertos do laboratório e removeria o bloqueio comercial.
Pontuações publicadas do LLaDA-Image-Turbo, ou uma reprodução independente do resultado do Qwen-Image-Bench do modelo Base.
• Um provedor hospedado adotando-o, que é também o momento em que o modelo adquire um preço por imagem e se torna algo que uma API de roteamento pode entregar em uma única chamada.

Quando esse último sinal disparar — se disparar — a matemática de preços é simples: o provedor define o preço de tabela, e uma API de roteamento que repassa os preços de tabela do provedor diretamente, com markup de 0%, é o que mantém esse preço ativo do seu lado no mesmo dia, sem renegociação e sem segundo contrato. Mas esse dia não chegou para o LLaDA-Image-Turbo, e nada neste artigo deve ser lido como se tivesse chegado. Hoje o resumo honesto é curto: um laboratório sério lançou discretamente um modelo sério e aberto de imagem, com uma alegação real de qualidade e várias questões em aberto, e a forma mais rápida de descobrir quais partes da alegação sobrevivem ao contato com a realidade é executar você mesmo o checkpoint de quatro etapas.
