Cartão de título de destaque com o texto 'Hy Image3.5 vs LLaDA-Image - o endpoint contra o checkpoint', com o subtítulo 'Duas formas de comprar um modelo de imagem 2K em setembro de 2026, e quem carrega o risco operacional'. A coluna da esquerda, 'Hy Image3.5 preview - alugar', lista: acesso via um endpoint cobrado por uso, sem pesos; US$ 0,024 por imagem 2K cobrados pela saída entregue; um limite máximo de 2K e até 5 imagens de referência; edição multiturno com contexto retido, sim; ajustável por fine-tuning, não; pode ser descontinuado enquanto você depende dele, sim. A coluna da direita, 'LLaDA-Image - possuir', lista: acesso via checkpoints baixáveis, sem endpoint hospedado; pesos gratuitos mais sua própria GPU; uma família de Base 50-step e Turbo 2-4 step em BF16 e FP8; edição multiturno com contexto retido não anunciada; ajustável por fine-tuning, sim; pode ser descontinuado enquanto você depende dele, não. Um rodapé diz: 'Números da Tencent reportados pelo fornecedor. O LLaDA-Image faz parte da família aberta da inclusionAI; sua ficha traz uma tag apache-2.0 e informa 6B em texto corrido contra 7B na barra lateral. O OrcaRouter não roteia nenhum dos dois.' O logotipo do OrcaRouter está composto no canto inferior direito.
Guides & Insights

Hy Image3.5 vs LLaDA-Image: Alugar o endpoint ou ser dono dos pesos?

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há duas maneiras de comprar um modelo de imagem 2K em setembro de 2026, e elas não são tanto dois produtos quanto dois modelos de negócio. Hy Image3.5 preview, disponível desde 22 de setembro de 2026, é um endpoint medido: US$ 0,024 por imagem na tabela de preços internacionais da Tencent, ¥ 0,15 no mercado interno, cobrado com base na saída entregue, e você nunca toca em uma GPU. LLaDA-Image, do grupo de modelos abertos inclusionAI e lançado em 4 de setembro de 2026, é um checkpoint para download: uma família unificada de geração e edição de classe 7B sob uma licença Apache-2.0, disponível no Hugging Face sem nenhum endpoint hospedado associado. Cem mil imagens 2K por mês custam cerca de US$ 2.400 da primeira maneira. A segunda maneira não custa nada por imagem e custa uma quantia em dinheiro que você mesmo precisa calcular, porque os pesos são gratuitos e o hardware não é.

Essa é toda a comparação, e quase todo erro cometido a respeito dela vem de comparar as duas como se a coluna de preço fosse a única diferença. Não é. Uma delas pode ser descontinuada debaixo de você. Uma delas pode passar por fine-tuning. Uma delas vem com o benchmark do próprio fornecedor e nenhuma pontuação independente; a outra vem com um relatório técnico, um repositório público e cerca de mil downloads.

Duas afirmações atribuídas ao LLaDA-Image que não são coerentes entre si

Antes que a comparação valha alguma coisa, dois detalhes na ficha do LLaDA-Image precisam ser sinalizados, e não resolvidos, porque ambos são conflitos genuínos no registro público e escolher um lado em silêncio seria um erro pior do que dizer isso.

A primeira é a contagem de parâmetros. O próprio texto da ficha do modelo descreve "uma família competitiva de modelos unificados de geração e edição de imagens de código aberto com 6B de parâmetros". A barra lateral dessa mesma página informa o tamanho do modelo Safetensors como 7B de parâmetros em BF16. Ambos os números estão na mesma página, publicados pela mesma organização, e nada na ficha concilia os dois. Trate a classe como "aproximadamente sete bilhões de parâmetros, com um número de seis bilhões na descrição" e não cite nenhum dos dois como definitivo. Qualquer pessoa que lhe diga a contagem exata está adivinhando a partir da mesma ficha que você pode ler.

O segundo é a licença. O cartão traz Licença: apache-2.0 hoje. Nossa própria cobertura anterior desta família disse que nenhum dos cartões lançados trazia uma etiqueta de licença e que não havia arquivo LICENSE no repositório. Ambas as afirmações podem ser verdadeiras em momentos diferentes — uma etiqueta pode ser adicionada — mas não vamos fingir que sempre foram as mesmas, e uma licença que apareceu após o lançamento é um fato materialmente diferente de uma licença que veio junto com os pesos. Se a licença for essencial para o seu caso de uso, verifique o repositório você mesmo no momento do download e verifique se o código de treinamento, que o cartão descreve como "em breve", chega sob os mesmos termos.

Screenshot of the Hugging Face model card for inclusionAI/LLaDA-Image, showing License: apache-2.0, tags including Text-to-Image, Diffusers, Safetensors, LLaDAImagePipeline, image-generation, image-editing and arxiv:2609.03796, model-scope badges for Base, Base-FP8, Turbo and Turbo-FP8, the description text 'LLaDA-Image is a competitive 6B-parameter open-source unified image generation and editing model family', and a right rail listing 1,021 downloads last month, Safetensors with model size 7B params at BF16 tensor type, an inference-providers panel reading 'This model isn't deployed by any Inference Provider', a model tree with 1 finetune and 3 quantizations, 5 Spaces, and a collection updated 19 days ago with the paper published 20 days ago.

O que as duas arquiteturas estão realmente vendendo

LLaDA-Image não é um modelo de difusão no sentido usual, e essa é a parte interessante. Ele combina um transformer de difusão com um modelo de visão-linguagem congelado — LLaDA2.0-mini — e um conector RQA entre eles, e é publicado como uma família, em vez de um único checkpoint: Base em 50 passos para qualidade, Turbo em dois a quatro passos para vazão, cada um em BF16 e FP8. São quatro checkpoints, e as contagens de passos são a razão pela qual uma implantação auto-hospedada pode sequer ser viabilizada com orçamento limitado: um modelo 7B de 50 passos é uma proposta de hardware diferente de um de 2 a 4 passos. O relatório técnico é público e a receita de treinamento é descrita como totalmente aberta, o que é uma afirmação de transparência mais forte do que a maioria dos lançamentos de pesos abertos faz.

O Hy Image3.5 preview tem a forma oposta por design. É um único endpoint com um único comportamento: texto-para-imagem e imagem-para-imagem na mesma chamada, edição multiturno que carrega turnos anteriores como contexto, até cinco imagens de referência por requisição, um teto de saída de 2K e o identificador hy-image-v3.5-preview. Não há nada a escolher, nada a ajustar e nada a baixar. O conjunto de recursos é mais amplo logo de saída — a edição conversacional multiturno com contexto retido é um recurso real que a família aberta não divulga — e você não tem controle sobre nada disso.

• Base de custos — Hy Image3.5 preview custa $0.024 por imagem 2K, medido na saída entregue; LLaDA-Image tem pesos gratuitos, além do que sua GPU custar para rodar.

• O que você recebe — Hy Image3.5 preview é uma API hospedada com edição com múltiplos turnos e cinco imagens de referência; LLaDA-Image são quatro checkpoints (Base e Turbo, BF16 e FP8) e uma receita de treinamento.

• Passos para uma imagem — Hy Image3.5 preview é uma única chamada, sem parâmetro de passos exposto; LLaDA-Image tem 50 passos no Base ou de 2 a 4 no Turbo, que você mesmo define.

• Pesos — Hy Image3.5 preview não publica nenhum; LLaDA-Image publica a família completa.

• Licença — Hy Image3.5 preview é um serviço comercial regido pelos termos da Tencent; LLaDA-Image carrega uma tag apache-2.0 que a nossa própria cobertura anterior não viu.

• Evidência — A prévia do Hy Image3.5 tem um teste cego GSD do fornecedor e nenhum Elo independente; o LLaDA-Image tem um valor de 53,53 no Qwen-Image-Bench relatado pelo autor em inglês e 53,38 em chinês, e também nenhum Elo independente.

As coisas que apenas um destes consegue fazer

Comece pelo que os pesos lhe proporcionam, porque é mais do que uma preferência de licenciamento. Um checkpoint é um ativo: não pode ser descontinuado, ter seu preço alterado, sofrer limitação de taxa ou ser desligado, e um pipeline fixado a um arquivo específico ainda funcionará daqui a três anos. Ele pode passar por fine-tuning com seu próprio material, o que, para uma equipe com um estilo próprio ou um conjunto específico de caracteres, é a diferença entre fazer prompts para o modelo de outra pessoa e treinar o seu próprio. Ele funciona offline, o que importa se o material for trabalho de cliente sob um termo de confidencialidade. E sua vazão é uma função do hardware que você comprou, e não de uma fila à qual você se juntou.

Em contrapartida, um endpoint lhe proporciona uma ausência de trabalho. Ninguém na sua equipe aprende uma stack de serving, ninguém dimensiona uma GPU, ninguém descobre em produção que o checkpoint FP8 precisa de um runtime diferente do BF16, e ninguém é responsabilizado quando o job falha às 3 da manhã. O modelo da Tencent também carrega uma capacidade que a família aberta não reivindica: edição multiturno que retém a conversa, que é precisamente o mecanismo por trás de manter um personagem ao longo de uma longa série de edições. O suporte à edição do LLaDA-Image é real — é uma família unificada de geração e edição —, mas o estado conversacional entre turnos não é algo que o card anuncia.

A colocação honesta é que eles não estão competindo em qualidade de forma alguma. Estão competindo para ver quem carrega o risco operacional, e as duas respostas são "Tencent" e "você".

O que foi realmente medido, em ambos os lados

Nenhum dos dois modelos tem uma colocação independente. O ranking de texto para imagem da Artificial Analysis, consultado em 23 de setembro de 2026, não traz nenhuma linha de prévia do Hy Image3.5 nem linha do LLaDA-Image. Onde o ranking de fato tem a Tencent é na geração anterior: HunyuanImage 3.0 Instruct com 964 de Elo e HunyuanImage 3.0 com 945, classificados em 65º e 70º entre 156 modelos — que é a única medição de terceiros de qualquer coisa desta família, e é de uma geração atrás.

O que cada lado oferece em vez disso é o seu próprio trabalho. O da Tencent é o teste de preferência cega no estilo GSD, realizado com várias centenas de designers profissionais da própria empresa, relatando cerca de trinta por cento acima do Hy Image3.0, paridade com o Seedream 5.0 Pro e uma ligeira vantagem sobre o Nano-Banana Pro e o Qwen-Image-3.0-Pro. Executado pelo fornecedor, com participantes do fornecedor, conjunto de prompts não publicado — um método real com um conflito de interesses real, e as duas metades dessa frase devem ser ditas juntas.

A pontuação do LLaDA-Image no Qwen-Image-Bench é de 53,53 em inglês e 53,38 em chinês, um número relatado pelos autores em um benchmark escolhido pelos próprios autores. Não é mais independente que o teste da Tencent; é não auditada de modo diferente. O model card também lista cinco Spaces da comunidade e uma contagem mensal de downloads em torno de mil, o que mostra que a família aberta tem tração real, mas modesta — não é um modelo que a área já adotou, e quem diz o contrário não olhou para o número.

A single-panel card titled 'Hy Image3.5 preview vs LLaDA-Image - two unaudited claims and one empty column', subtitled 'Neither model has a third-party placement; both sides are reporting their own work'. Five rows: 'Independent board - no Hy Image3.5 preview row, no LLaDA-Image row, on the 156-model Artificial Analysis text-to-image board'; 'Tencent's own test - GSD-style blind preference with several hundred of its own designers, roughly +30% over Hy Image3.0 and parity with Seedream 5.0 Pro'; 'LLaDA-Image's own numbers - Qwen-Image-Bench 53.53 English and 53.38 Chinese, author-reported on a benchmark the authors chose'; 'Traction for the open family - about 1,021 downloads in the last month and 5 community Spaces on the model card'; 'Previous Tencent generation - HunyuanImage 3.0 Instruct 964 Elo at rank 65 and HunyuanImage 3.0 945 Elo at rank 70, the only third-party measurement in the family'. A footer reads: 'Tencent and inclusionAI figures are vendor-reported and unreproduced by us. Board figures per Artificial Analysis, read 23 September 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Para onde o dinheiro realmente vai, em grande volume

Faça as contas do lado do aluguel com honestidade, porque é o único lado com uma tarifa publicada. Cem mil imagens 2K por mês a US$ 0,024 dá US$ 2.400. Meio milhão por mês dá US$ 12.000, ou cerca de US$ 144.000 por ano, e nessa escala um modelo de imagem de classe 7B auto-hospedado deixa de ser uma opção de entusiasta e passa a ser um item óbvio no orçamento. Abaixo de aproximadamente dez mil imagens por mês, a conta não fecha desse jeito de forma alguma: US$ 240 contra o custo de uma GPU, da energia, do armazenamento, da pilha de serviço e da atenção de alguém não é uma disputa acirrada, e o endpoint com cobrança por uso vence em todos os eixos, inclusive naquele que você não está contabilizando.

O ponto de cruzamento não é um número que alguém possa lhe entregar, porque o lado auto-hospedado depende do hardware que você já possui, da utilização que você realmente alcança e se a GPU está fazendo outra coisa quando não está gerando imagens. O que pode ser dito com precisão é o formato da curva: o modelo medido é linear em volume e o modelo auto-hospedado é uma função degrau, então a questão não é qual é mais barato, mas onde seu volume fica em relação ao degrau.

Um endpoint, independentemente do caminho que escolher

O OrcaRouter não encaminha nenhum destes. Não hospedamos nenhum modelo de imagem da Tencent — as únicas entradas da Tencent no catálogo são a linha Hy3, somente de texto — e absolutamente nada da inclusionAI, portanto o Hy Image3.5 preview significa a nuvem própria da Tencent e os produtos próprios da Tencent, e o LLaDA-Image significa os pesos publicados e qualquer runtime para o qual você os aponte. Dizer isso com clareza é mais útil do que uma página de modelo que deixa a questão ambígua.

O que uma camada de roteamento oferece de bom nesta decisão é a terceira opção que ela torna barata. Se você está ponderando $2.400 por mês contra a compra de uma GPU, o intermediário útil é saber quanto custa a mesma carga de trabalho entre os modelos que você pode acessar hoje sem contrato — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, a família Imagen 4 e grok/grok-imagine-image estão todos atrás de um único endpoint compatível com OpenAI pelo preço de tabela do provedor com 0% de markup, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, e o failover automático significa que uma tarde ruim de um provedor não é a sua indisponibilidade. Isso não substitui nenhum dos dois modelos nesta comparação. É o que impede que a comparação seja uma escolha binária feita no escuro.

A single-panel card titled 'The crossover is not a number anyone can hand you', subtitled 'Metered pricing is the only side of this comparison with a published rate card'. Six rows: '10,000 images a month - about $240 metered, against a GPU, its power, its storage and somebody's attention'; '100,000 images a month - about $2,400 metered'; '500,000 images a month - about $12,000 a month, roughly $144,000 a year'; 'The shape of the curve - the metered model is linear in volume, the self-hosted model is a step function'; 'The question - not which is cheaper, but where your volume sits relative to the step'; 'Before 7 October 2026 - run your own prompt set through the free window on Miora, WorkRally and OnSolo and write down the accept rate'. A footer reads: 'Hy Image3.5 preview pricing per Tencent ($0.024 per 2K image, billed on delivered output). OrcaRouter routes neither model; we host no Tencent or inclusionAI image model.' The OrcaRouter logo is composited in the bottom-right corner.

A única pergunta que decide isso

Pergunte se sua carga de trabalho tem um formato que os pesos conseguem capturar e o endpoint não. Se você está gerando em conformidade com um estilo da casa, um conjunto fixo de caracteres ou material próprio de um cliente, e tem o volume e o hardware para fazer um modelo de classe 7B valer a pena, então o LLaDA-Image é o ativo mais duradouro, e a tag Apache-2.0 — verifique-a no momento do download, dado o histórico acima — é o que o torna utilizável. Você está comprando opcionalidade e pagando por ela em operações.

Se sua carga de trabalho tiver picos, se ninguém na equipe quiser assumir uma stack de serving, se edição multiturno com contexto retido for a funcionalidade de que você realmente precisa, ou se seu volume for inferior a dez mil imagens por mês, então US$ 0,024 por imagem 2K entregue é um bom preço para o problema de outra pessoa, e o rótulo de prévia é o principal a manter em vista. A única coisa que vale a pena fazer antes de 7 de outubro de 2026 — enquanto Miora, WorkRally e OnSolo estão rodando a janela gratuita — é passar seu próprio conjunto de prompts pelo modelo da Tencent e anotar a taxa de aceitação, porque esse número, e não os trinta por cento, é o que decide se o lado medido vale o seu medidor.