
Hy Image3.5 vs LLaDA-Image: Alugar o endpoint ou ser dono dos pesos?
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Há duas maneiras de comprar um modelo de imagem 2K em setembro de 2026, e elas não são tanto dois produtos quanto dois modelos de negócio. Hy Image3.5 preview, disponível desde 22 de setembro de 2026, é um endpoint medido: US$ 0,024 por imagem na tabela de preços internacionais da Tencent, ¥ 0,15 no mercado interno, cobrado com base na saída entregue, e você nunca toca em uma GPU. LLaDA-Image, do grupo de modelos abertos inclusionAI e lançado em 4 de setembro de 2026, é um checkpoint para download: uma família unificada de geração e edição de classe 7B sob uma licença Apache-2.0, disponível no Hugging Face sem nenhum endpoint hospedado associado. Cem mil imagens 2K por mês custam cerca de US$ 2.400 da primeira maneira. A segunda maneira não custa nada por imagem e custa uma quantia em dinheiro que você mesmo precisa calcular, porque os pesos são gratuitos e o hardware não é.
Essa é toda a comparação, e quase todo erro cometido a respeito dela vem de comparar as duas como se a coluna de preço fosse a única diferença. Não é. Uma delas pode ser descontinuada debaixo de você. Uma delas pode passar por fine-tuning. Uma delas vem com o benchmark do próprio fornecedor e nenhuma pontuação independente; a outra vem com um relatório técnico, um repositório público e cerca de mil downloads.
Duas afirmações atribuídas ao LLaDA-Image que não são coerentes entre si
Antes que a comparação valha alguma coisa, dois detalhes na ficha do LLaDA-Image precisam ser sinalizados, e não resolvidos, porque ambos são conflitos genuínos no registro público e escolher um lado em silêncio seria um erro pior do que dizer isso.
A primeira é a contagem de parâmetros. O próprio texto da ficha do modelo descreve "uma família competitiva de modelos unificados de geração e edição de imagens de código aberto com 6B de parâmetros". A barra lateral dessa mesma página informa o tamanho do modelo Safetensors como 7B de parâmetros em BF16. Ambos os números estão na mesma página, publicados pela mesma organização, e nada na ficha concilia os dois. Trate a classe como "aproximadamente sete bilhões de parâmetros, com um número de seis bilhões na descrição" e não cite nenhum dos dois como definitivo. Qualquer pessoa que lhe diga a contagem exata está adivinhando a partir da mesma ficha que você pode ler.
O segundo é a licença. O cartão traz Licença: apache-2.0 hoje. Nossa própria cobertura anterior desta família disse que nenhum dos cartões lançados trazia uma etiqueta de licença e que não havia arquivo LICENSE no repositório. Ambas as afirmações podem ser verdadeiras em momentos diferentes — uma etiqueta pode ser adicionada — mas não vamos fingir que sempre foram as mesmas, e uma licença que apareceu após o lançamento é um fato materialmente diferente de uma licença que veio junto com os pesos. Se a licença for essencial para o seu caso de uso, verifique o repositório você mesmo no momento do download e verifique se o código de treinamento, que o cartão descreve como "em breve", chega sob os mesmos termos.

O que as duas arquiteturas estão realmente vendendo
LLaDA-Image não é um modelo de difusão no sentido usual, e essa é a parte interessante. Ele combina um transformer de difusão com um modelo de visão-linguagem congelado — LLaDA2.0-mini — e um conector RQA entre eles, e é publicado como uma família, em vez de um único checkpoint: Base em 50 passos para qualidade, Turbo em dois a quatro passos para vazão, cada um em BF16 e FP8. São quatro checkpoints, e as contagens de passos são a razão pela qual uma implantação auto-hospedada pode sequer ser viabilizada com orçamento limitado: um modelo 7B de 50 passos é uma proposta de hardware diferente de um de 2 a 4 passos. O relatório técnico é público e a receita de treinamento é descrita como totalmente aberta, o que é uma afirmação de transparência mais forte do que a maioria dos lançamentos de pesos abertos faz.
O Hy Image3.5 preview tem a forma oposta por design. É um único endpoint com um único comportamento: texto-para-imagem e imagem-para-imagem na mesma chamada, edição multiturno que carrega turnos anteriores como contexto, até cinco imagens de referência por requisição, um teto de saída de 2K e o identificador hy-image-v3.5-preview. Não há nada a escolher, nada a ajustar e nada a baixar. O conjunto de recursos é mais amplo logo de saída — a edição conversacional multiturno com contexto retido é um recurso real que a família aberta não divulga — e você não tem controle sobre nada disso.
• Base de custos — Hy Image3.5 preview custa $0.024 por imagem 2K, medido na saída entregue; LLaDA-Image tem pesos gratuitos, além do que sua GPU custar para rodar.
• O que você recebe — Hy Image3.5 preview é uma API hospedada com edição com múltiplos turnos e cinco imagens de referência; LLaDA-Image são quatro checkpoints (Base e Turbo, BF16 e FP8) e uma receita de treinamento.
• Passos para uma imagem — Hy Image3.5 preview é uma única chamada, sem parâmetro de passos exposto; LLaDA-Image tem 50 passos no Base ou de 2 a 4 no Turbo, que você mesmo define.
• Pesos — Hy Image3.5 preview não publica nenhum; LLaDA-Image publica a família completa.
• Licença — Hy Image3.5 preview é um serviço comercial regido pelos termos da Tencent; LLaDA-Image carrega uma tag apache-2.0 que a nossa própria cobertura anterior não viu.
• Evidência — A prévia do Hy Image3.5 tem um teste cego GSD do fornecedor e nenhum Elo independente; o LLaDA-Image tem um valor de 53,53 no Qwen-Image-Bench relatado pelo autor em inglês e 53,38 em chinês, e também nenhum Elo independente.
As coisas que apenas um destes consegue fazer
Comece pelo que os pesos lhe proporcionam, porque é mais do que uma preferência de licenciamento. Um checkpoint é um ativo: não pode ser descontinuado, ter seu preço alterado, sofrer limitação de taxa ou ser desligado, e um pipeline fixado a um arquivo específico ainda funcionará daqui a três anos. Ele pode passar por fine-tuning com seu próprio material, o que, para uma equipe com um estilo próprio ou um conjunto específico de caracteres, é a diferença entre fazer prompts para o modelo de outra pessoa e treinar o seu próprio. Ele funciona offline, o que importa se o material for trabalho de cliente sob um termo de confidencialidade. E sua vazão é uma função do hardware que você comprou, e não de uma fila à qual você se juntou.
Em contrapartida, um endpoint lhe proporciona uma ausência de trabalho. Ninguém na sua equipe aprende uma stack de serving, ninguém dimensiona uma GPU, ninguém descobre em produção que o checkpoint FP8 precisa de um runtime diferente do BF16, e ninguém é responsabilizado quando o job falha às 3 da manhã. O modelo da Tencent também carrega uma capacidade que a família aberta não reivindica: edição multiturno que retém a conversa, que é precisamente o mecanismo por trás de manter um personagem ao longo de uma longa série de edições. O suporte à edição do LLaDA-Image é real — é uma família unificada de geração e edição —, mas o estado conversacional entre turnos não é algo que o card anuncia.
A colocação honesta é que eles não estão competindo em qualidade de forma alguma. Estão competindo para ver quem carrega o risco operacional, e as duas respostas são "Tencent" e "você".
O que foi realmente medido, em ambos os lados
Nenhum dos dois modelos tem uma colocação independente. O ranking de texto para imagem da Artificial Analysis, consultado em 23 de setembro de 2026, não traz nenhuma linha de prévia do Hy Image3.5 nem linha do LLaDA-Image. Onde o ranking de fato tem a Tencent é na geração anterior: HunyuanImage 3.0 Instruct com 964 de Elo e HunyuanImage 3.0 com 945, classificados em 65º e 70º entre 156 modelos — que é a única medição de terceiros de qualquer coisa desta família, e é de uma geração atrás.
O que cada lado oferece em vez disso é o seu próprio trabalho. O da Tencent é o teste de preferência cega no estilo GSD, realizado com várias centenas de designers profissionais da própria empresa, relatando cerca de trinta por cento acima do Hy Image3.0, paridade com o Seedream 5.0 Pro e uma ligeira vantagem sobre o Nano-Banana Pro e o Qwen-Image-3.0-Pro. Executado pelo fornecedor, com participantes do fornecedor, conjunto de prompts não publicado — um método real com um conflito de interesses real, e as duas metades dessa frase devem ser ditas juntas.
A pontuação do LLaDA-Image no Qwen-Image-Bench é de 53,53 em inglês e 53,38 em chinês, um número relatado pelos autores em um benchmark escolhido pelos próprios autores. Não é mais independente que o teste da Tencent; é não auditada de modo diferente. O model card também lista cinco Spaces da comunidade e uma contagem mensal de downloads em torno de mil, o que mostra que a família aberta tem tração real, mas modesta — não é um modelo que a área já adotou, e quem diz o contrário não olhou para o número.

Para onde o dinheiro realmente vai, em grande volume
Faça as contas do lado do aluguel com honestidade, porque é o único lado com uma tarifa publicada. Cem mil imagens 2K por mês a US$ 0,024 dá US$ 2.400. Meio milhão por mês dá US$ 12.000, ou cerca de US$ 144.000 por ano, e nessa escala um modelo de imagem de classe 7B auto-hospedado deixa de ser uma opção de entusiasta e passa a ser um item óbvio no orçamento. Abaixo de aproximadamente dez mil imagens por mês, a conta não fecha desse jeito de forma alguma: US$ 240 contra o custo de uma GPU, da energia, do armazenamento, da pilha de serviço e da atenção de alguém não é uma disputa acirrada, e o endpoint com cobrança por uso vence em todos os eixos, inclusive naquele que você não está contabilizando.
O ponto de cruzamento não é um número que alguém possa lhe entregar, porque o lado auto-hospedado depende do hardware que você já possui, da utilização que você realmente alcança e se a GPU está fazendo outra coisa quando não está gerando imagens. O que pode ser dito com precisão é o formato da curva: o modelo medido é linear em volume e o modelo auto-hospedado é uma função degrau, então a questão não é qual é mais barato, mas onde seu volume fica em relação ao degrau.
Um endpoint, independentemente do caminho que escolher
O OrcaRouter não encaminha nenhum destes. Não hospedamos nenhum modelo de imagem da Tencent — as únicas entradas da Tencent no catálogo são a linha Hy3, somente de texto — e absolutamente nada da inclusionAI, portanto o Hy Image3.5 preview significa a nuvem própria da Tencent e os produtos próprios da Tencent, e o LLaDA-Image significa os pesos publicados e qualquer runtime para o qual você os aponte. Dizer isso com clareza é mais útil do que uma página de modelo que deixa a questão ambígua.
O que uma camada de roteamento oferece de bom nesta decisão é a terceira opção que ela torna barata. Se você está ponderando $2.400 por mês contra a compra de uma GPU, o intermediário útil é saber quanto custa a mesma carga de trabalho entre os modelos que você pode acessar hoje sem contrato — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, a família Imagen 4 e grok/grok-imagine-image estão todos atrás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor com 0% de markup, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e o failover automático significa que uma tarde ruim de um provedor não é a sua indisponibilidade. Isso não substitui nenhum dos dois modelos nesta comparação. É o que impede que a comparação seja uma escolha binária feita no escuro.

A única pergunta que decide isso
Pergunte se sua carga de trabalho tem um formato que os pesos conseguem capturar e o endpoint não. Se você está gerando em conformidade com um estilo da casa, um conjunto fixo de caracteres ou material próprio de um cliente, e tem o volume e o hardware para fazer um modelo de classe 7B valer a pena, então o LLaDA-Image é o ativo mais duradouro, e a tag Apache-2.0 — verifique-a no momento do download, dado o histórico acima — é o que o torna utilizável. Você está comprando opcionalidade e pagando por ela em operações.
Se sua carga de trabalho tiver picos, se ninguém na equipe quiser assumir uma stack de serving, se edição multiturno com contexto retido for a funcionalidade de que você realmente precisa, ou se seu volume for inferior a dez mil imagens por mês, então US$ 0,024 por imagem 2K entregue é um bom preço para o problema de outra pessoa, e o rótulo de prévia é o principal a manter em vista. A única coisa que vale a pena fazer antes de 7 de outubro de 2026 — enquanto Miora, WorkRally e OnSolo estão rodando a janela gratuita — é passar seu próprio conjunto de prompts pelo modelo da Tencent e anotar a taxa de aceitação, porque esse número, e não os trinta por cento, é o que decide se o lado medido vale o seu medidor.
