Scheda del titolo principale che recita «Hy Image3.5 vs LLaDA-Image – l'endpoint contro il checkpoint», con sottotitolo «Due modi per acquistare un modello di immagini 2K a settembre 2026, e chi si assume il rischio operativo». La colonna di sinistra, «Hy Image3.5 preview – noleggio», elenca: accesso tramite un endpoint a consumo, senza pesi; 0,024 $ per immagine 2K, fatturati sull'output consegnato; un tetto di 2K e fino a 5 immagini di riferimento; editing multi-turno con contesto conservato: sì; fine-tuning possibile: no; può essere deprecato mentre lo usi: sì. La colonna di destra, «LLaDA-Image – possesso», elenca: accesso tramite checkpoint scaricabili, senza endpoint ospitato; pesi gratuiti più la tua GPU; una famiglia di modelli Base a 50 step e Turbo a 2-4 step in BF16 e FP8; editing multi-turno con contesto conservato: non pubblicizzato; fine-tuning possibile: sì; può essere deprecato mentre lo usi: no. Un piè di pagina recita: «I dati di Tencent sono dichiarati dal fornitore. LLaDA-Image fa parte della famiglia aperta di inclusionAI; la sua scheda riporta un tag apache-2.0 e dichiara 6B nel testo, contro 7B nella barra laterale. OrcaRouter non instrada né l'uno né l'altro.» Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Hy Image3.5 vs LLaDA-Image: Noleggiare l'endpoint o possedere i pesi

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ci sono due modi per acquistare un modello di immagini 2K a settembre 2026, e non sono tanto due prodotti quanto due modelli di business. Hy Image3.5 preview, attivo dal 22 settembre 2026, è un endpoint a consumo: 0,024 $ per immagine secondo il listino internazionale di Tencent, 0,15 ¥ a livello nazionale, fatturato sull'output consegnato, e non tocchi mai una GPU. LLaDA-Image, del gruppo di modelli aperti inclusionAI e rilasciato il 4 settembre 2026, è un checkpoint scaricabile: una famiglia unificata di generazione e modifica di classe 7B con etichetta Apache-2.0, ospitata su Hugging Face senza alcun endpoint ospitato collegato. Centomila immagini 2K al mese costano circa 2.400 $ con il primo metodo. Il secondo non costa nulla per immagine e una somma di denaro che devi calcolare da solo, perché i pesi sono gratuiti e l'hardware no.

Questo è tutto il confronto, e quasi ogni errore commesso al riguardo deriva dal confrontare i due come se la colonna del prezzo fosse l'unica differenza. Non lo è. Uno di questi può essere deprecato sotto di te. Uno di questi può essere messo a punto. Uno di questi viene fornito con un benchmark del fornitore stesso e nessun punteggio indipendente; l'altro viene fornito con un rapporto tecnico, un repository pubblico e circa mille download.

Due affermazioni legate a LLaDA-Image che non concordano con se stesse

Prima che il confronto valga qualcosa, due dettagli sulla scheda LLaDA-Image vanno segnalati anziché risolti, perché entrambi sono autentici conflitti nella documentazione pubblica e scegliere in silenzio una parte sarebbe un errore peggiore che dirlo.

Il primo è il numero di parametri. La prosa della scheda del modello descrive «una competitiva famiglia di modelli open-source unificati da 6B parametri per la generazione e la modifica di immagini». La barra laterale sulla stessa pagina riporta la dimensione del modello Safetensors come 7B parametri in BF16. Entrambi i numeri sono sulla stessa pagina, pubblicati dalla stessa organizzazione, e nulla nella scheda li concilia. Considera la classe come «all'incirca sette miliardi di parametri, con una cifra di sei miliardi nella descrizione» e non citare nessuno dei due come definitivo. Chiunque ti dica il conteggio esatto sta tirando a indovinare dalla stessa scheda che puoi leggere.

Il secondo è la licenza. La scheda riporta License: apache-2.0 oggi. La nostra precedente trattazione di questa famiglia diceva che nessuna delle schede rilasciate riportava un tag di licenza e che non c'era alcun file LICENSE nel repository. Entrambe le affermazioni possono essere vere in momenti diversi — un tag può essere aggiunto — ma non abbiamo intenzione di far finta che siano sempre state identiche, e una licenza comparsa dopo il rilascio è un fatto sostanzialmente diverso da una licenza distribuita insieme ai pesi. Se la licenza è essenziale per il tuo caso d'uso, controlla tu stesso il repository nel momento in cui scarichi, e verifica se il codice di addestramento, che la scheda descrive come in arrivo, viene fornito alle stesse condizioni.

Screenshot of the Hugging Face model card for inclusionAI/LLaDA-Image, showing License: apache-2.0, tags including Text-to-Image, Diffusers, Safetensors, LLaDAImagePipeline, image-generation, image-editing and arxiv:2609.03796, model-scope badges for Base, Base-FP8, Turbo and Turbo-FP8, the description text 'LLaDA-Image is a competitive 6B-parameter open-source unified image generation and editing model family', and a right rail listing 1,021 downloads last month, Safetensors with model size 7B params at BF16 tensor type, an inference-providers panel reading 'This model isn't deployed by any Inference Provider', a model tree with 1 finetune and 3 quantizations, 5 Spaces, and a collection updated 19 days ago with the paper published 20 days ago.

Che cosa vendono realmente le due architetture

LLaDA-Image non è un modello di diffusione nel senso usuale e questa è la parte interessante. Abbina un diffusion transformer a un modello vision-language congelato — LLaDA2.0-mini — e un connettore RQA tra i due, ed è pubblicato come una famiglia anziché come un singolo checkpoint: Base a 50 step per la qualità, Turbo a due-quattro step per la velocità di elaborazione, ciascuno in BF16 e FP8. Sono quattro checkpoint, e i conteggi degli step sono il motivo per cui un deployment self-hosted può essere reso sostenibile con un budget contenuto: un modello 7B a 50 step è una proposta hardware diversa da uno a 2-4 step. Il rapporto tecnico è pubblico e la ricetta di addestramento è descritta come completamente aperta, il che è una dichiarazione di trasparenza più forte di quella della maggior parte delle release open-weight.

Hy Image3.5 preview è intenzionalmente la forma opposta. È un unico endpoint con un unico comportamento: text-to-image e image-to-image nella stessa chiamata, editing multi-turno che porta con sé i turni precedenti come contesto, fino a cinque immagini di riferimento per richiesta, un limite massimo di output a 2K e l'identificatore hy-image-v3.5-preview. Non c'è nulla da scegliere, nulla da mettere a punto e nulla da scaricare. L'insieme delle capacità è più ampio fin da subito — l'editing conversazionale multi-turno con contesto conservato è una vera funzionalità che la famiglia open non pubblicizza — e non hai alcun controllo su nulla di tutto ciò.

• Base di costo — Hy Image3.5 preview è $0,024 per immagine 2K conteggiato sull'output consegnato; LLaDA-Image è a pesi gratuiti più quanto costa far funzionare la tua GPU.

• Cosa ottieni — Hy Image3.5 preview è un'API ospitata con editing multi-turno e cinque immagini di riferimento; LLaDA-Image è composto da quattro checkpoint (Base e Turbo, BF16 e FP8) e da una ricetta di training.

• Passi per un'immagine — Hy Image3.5 preview è una singola chiamata senza alcun parametro step esposto; LLaDA-Image è di 50 passi su Base oppure da 2 a 4 su Turbo, che imposti tu stesso.

• Pesi — l'anteprima di Hy Image3.5 non ne pubblica alcuno; LLaDA-Image pubblica l'intera famiglia.

• Licenza — Hy Image3.5 preview è un servizio commerciale regolato dai termini di Tencent; LLaDA-Image porta un tag apache-2.0 che i nostri stessi resoconti precedenti non avevano rilevato.

• Prove — Hy Image3.5 preview ha un test cieco GSD del fornitore e nessun Elo indipendente; LLaDA-Image ha una cifra Qwen-Image-Bench riportata dall'autore di 53,53 in inglese e 53,38 in cinese, e anche nessun Elo indipendente.

Le cose che solo uno di questi può fare

Inizia da ciò che i pesi ti offrono, perché è più di una preferenza di licenza. Un checkpoint è un asset: non può essere deprecato, riprezzato, limitato nella frequenza o disattivato, e una pipeline agganciata a un file specifico funzionerà ancora tra tre anni. Può essere sottoposto a fine-tuning sul tuo materiale, il che, per un team con uno stile interno o un set di caratteri specifico, è la differenza tra fare prompting al modello di qualcun altro e addestrare il proprio. Funziona offline, il che conta se il materiale è lavoro per clienti sotto un vincolo di riservatezza. E il suo throughput è una funzione dell'hardware che hai acquistato anziché di una coda a cui ti sei unito.

Di contro, un endpoint ti garantisce l'assenza di lavoro. Nessuno del tuo team impara uno stack di serving, nessuno dimensiona una GPU, nessuno scopre in produzione che il checkpoint FP8 richiede un runtime diverso da quello BF16, e nessuno è chiamato a risponderne quando il job fallisce alle 3 del mattino. Il modello Tencent porta con sé anche una capacità che la famiglia open non rivendica: l'editing multi-turno che conserva la conversazione, che è esattamente il meccanismo alla base del mantenimento di un personaggio lungo una lunga serie di modifiche. Il supporto all'editing di LLaDA-Image è reale — è una famiglia unificata di generazione ed editing — ma lo stato conversazionale tra i turni non è qualcosa che la scheda pubblicizzi.

La formulazione onesta è che questi non competono affatto sulla qualità. Competono su chi si fa carico del rischio operativo, e le due risposte sono «Tencent» e «tu».

Che cosa è stato effettivamente misurato, da entrambe le parti

Nessuno dei due modelli ha una posizione indipendente. La classifica text-to-image di Artificial Analysis, consultata il 23 settembre 2026, non contiene alcuna riga relativa a Hy Image3.5 preview né a LLaDA-Image. Laddove la classifica include Tencent, si tratta della generazione precedente: HunyuanImage 3.0 Instruct a 964 Elo e HunyuanImage 3.0 a 945, classificati al 65º e 70º posto su 156 modelli — che è l'unica misurazione di terze parti di qualcosa in questa famiglia, e risale a una generazione fa.

Ciò che ciascuna parte offre, invece, è il proprio lavoro. Quello di Tencent è il test di preferenza alla cieca in stile GSD, condotto con diverse centinaia di designer professionisti della stessa azienda, che riporta circa il trenta per cento in più rispetto a Hy Image3.0, parità con Seedream 5.0 Pro e un leggero vantaggio su Nano-Banana Pro e Qwen-Image-3.0-Pro. Eseguito dal fornitore, con campione fornito dal fornitore, set di prompt non pubblicato — un metodo reale con un reale conflitto di interessi, ed entrambe le metà di quella frase vanno dette nello stesso respiro.

Il punteggio di LLaDA-Image su Qwen-Image-Bench è 53,53 in inglese e 53,38 in cinese, un numero riportato dagli autori su un benchmark scelto dagli autori stessi. Non è più indipendente del test di Tencent; è non verificato in modo diverso. La scheda elenca anche cinque Spaces della community e un numero di download mensili intorno al migliaio, il che ti dice che la famiglia open ha una trazione reale ma modesta — non è un modello che il settore ha già adottato, e chiunque ti dica il contrario non ha guardato il numero.

A single-panel card titled 'Hy Image3.5 preview vs LLaDA-Image - two unaudited claims and one empty column', subtitled 'Neither model has a third-party placement; both sides are reporting their own work'. Five rows: 'Independent board - no Hy Image3.5 preview row, no LLaDA-Image row, on the 156-model Artificial Analysis text-to-image board'; 'Tencent's own test - GSD-style blind preference with several hundred of its own designers, roughly +30% over Hy Image3.0 and parity with Seedream 5.0 Pro'; 'LLaDA-Image's own numbers - Qwen-Image-Bench 53.53 English and 53.38 Chinese, author-reported on a benchmark the authors chose'; 'Traction for the open family - about 1,021 downloads in the last month and 5 community Spaces on the model card'; 'Previous Tencent generation - HunyuanImage 3.0 Instruct 964 Elo at rank 65 and HunyuanImage 3.0 945 Elo at rank 70, the only third-party measurement in the family'. A footer reads: 'Tencent and inclusionAI figures are vendor-reported and unreproduced by us. Board figures per Artificial Analysis, read 23 September 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Dove vanno davvero i soldi, in grandi volumi

Valuta onestamente la parte in affitto, perché è l'unica parte con una tariffa pubblicata. Centomila immagini 2K al mese a 0,024 $ fanno 2.400 $. Mezzo milione al mese fa 12.000 $, ovvero circa 144.000 $ all'anno, e a quella scala un modello di immagini self-hosted di classe 7B smette di essere un'opzione da hobbista e inizia a essere una voce di costo ovvia. Al di sotto di circa diecimila immagini al mese, i conti non tornano affatto in quel modo: 240 $ contro il costo di una GPU, dell'energia, dello storage, dello stack di serving e dell'attenzione di qualcuno non è una scelta difficile, e l'endpoint a consumo vince su tutti i fronti, compreso quello che non stai conteggiando.

Il punto di pareggio non è un numero che qualcuno possa darti, perché il lato self-hosted dipende dall'hardware che già possiedi, dall'utilizzo che effettivamente raggiungi e dal fatto che la GPU stia facendo qualcos'altro quando non genera immagini. Ciò che si può dire con precisione è la forma della curva: il modello a consumo è lineare rispetto al volume e il modello self-hosted è una funzione a gradini, quindi la domanda non è quale sia più economico, ma dove si colloca il tuo volume rispetto al gradino.

Un endpoint, qualunque strada tu prenda

OrcaRouter non instrada nessuno di questi. Non ospitiamo alcun modello di immagini Tencent — le uniche voci Tencent nel catalogo sono la linea Hy3 di solo testo — e assolutamente nulla da inclusionAI, quindi Hy Image3.5 preview significa il cloud di Tencent stessa e i prodotti Tencent di prima parte, e LLaDA-Image significa i pesi pubblicati e qualunque runtime a cui li si punti. Dirlo chiaramente è più utile di una pagina modello che lo lascia ambiguo.

Ciò a cui serve un livello di routing in questa decisione è la terza opzione che rende poco costosa. Se stai soppesando 2.400 $ al mese contro l'acquisto di una GPU, l'intermedio utile è sapere quanto costa lo stesso carico di lavoro tra i modelli che puoi raggiungere oggi senza un contratto — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, la famiglia Imagen 4 e grok/grok-imagine-image stanno tutti dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di markup, così un cambio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno, e il failover automatico significa che un pomeriggio storto di un provider non è la tua interruzione di servizio. Non è un sostituto per nessuno dei due modelli in questo confronto. È ciò che impedisce che il confronto si riduca a una scelta a due vie fatta al buio.

A single-panel card titled 'The crossover is not a number anyone can hand you', subtitled 'Metered pricing is the only side of this comparison with a published rate card'. Six rows: '10,000 images a month - about $240 metered, against a GPU, its power, its storage and somebody's attention'; '100,000 images a month - about $2,400 metered'; '500,000 images a month - about $12,000 a month, roughly $144,000 a year'; 'The shape of the curve - the metered model is linear in volume, the self-hosted model is a step function'; 'The question - not which is cheaper, but where your volume sits relative to the step'; 'Before 7 October 2026 - run your own prompt set through the free window on Miora, WorkRally and OnSolo and write down the accept rate'. A footer reads: 'Hy Image3.5 preview pricing per Tencent ($0.024 per 2K image, billed on delivered output). OrcaRouter routes neither model; we host no Tencent or inclusionAI image model.' The OrcaRouter logo is composited in the bottom-right corner.

L'unica domanda che decide tutto

Chiediti se il tuo carico di lavoro ha una forma che i pesi possono catturare e l'endpoint no. Se stai generando secondo uno stile aziendale, un set di caratteri fisso o il materiale di un cliente, e hai il volume e l'hardware per far sì che un modello di classe 7B si ripaghi, allora LLaDA-Image è l'asset più duraturo e il tag Apache-2.0 — verificalo al momento del download, vista la storia di cui sopra — è ciò che lo rende utilizzabile. Stai comprando l'opzionalità e la paghi in operazioni.

Se il tuo carico di lavoro è a picchi, se nessuno nel team vuole gestire uno stack di serving, se l'editing multi-turno con contesto mantenuto è la funzionalità di cui hai davvero bisogno, o se il tuo volume è inferiore a diecimila immagini al mese, allora $0.024 per immagine 2K consegnata è un buon prezzo per il problema di qualcun altro, e l'etichetta di anteprima è la cosa principale da tenere d'occhio. L'unica cosa che vale la pena fare prima del 7 ottobre 2026 — mentre Miora, WorkRally e OnSolo stanno gestendo la finestra gratuita — è far passare il tuo set di prompt attraverso il modello tencent e annotare il tasso di accettazione, perché quel numero, non il trenta per cento, è quello che decide se il lato a consumo valga il suo contatore.