
Hy Image3.5 vs LLaDA-Image: Noleggiare l'endpoint o possedere i pesi
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ci sono due modi per acquistare un modello di immagini 2K a settembre 2026, e non sono tanto due prodotti quanto due modelli di business. Hy Image3.5 preview, attivo dal 22 settembre 2026, è un endpoint a consumo: 0,024 $ per immagine secondo il listino internazionale di Tencent, 0,15 ¥ a livello nazionale, fatturato sull'output consegnato, e non tocchi mai una GPU. LLaDA-Image, del gruppo di modelli aperti inclusionAI e rilasciato il 4 settembre 2026, è un checkpoint scaricabile: una famiglia unificata di generazione e modifica di classe 7B con etichetta Apache-2.0, ospitata su Hugging Face senza alcun endpoint ospitato collegato. Centomila immagini 2K al mese costano circa 2.400 $ con il primo metodo. Il secondo non costa nulla per immagine e una somma di denaro che devi calcolare da solo, perché i pesi sono gratuiti e l'hardware no.
Questo è tutto il confronto, e quasi ogni errore commesso al riguardo deriva dal confrontare i due come se la colonna del prezzo fosse l'unica differenza. Non lo è. Uno di questi può essere deprecato sotto di te. Uno di questi può essere messo a punto. Uno di questi viene fornito con un benchmark del fornitore stesso e nessun punteggio indipendente; l'altro viene fornito con un rapporto tecnico, un repository pubblico e circa mille download.
Due affermazioni legate a LLaDA-Image che non concordano con se stesse
Prima che il confronto valga qualcosa, due dettagli sulla scheda LLaDA-Image vanno segnalati anziché risolti, perché entrambi sono autentici conflitti nella documentazione pubblica e scegliere in silenzio una parte sarebbe un errore peggiore che dirlo.
Il primo è il numero di parametri. La prosa della scheda del modello descrive «una competitiva famiglia di modelli open-source unificati da 6B parametri per la generazione e la modifica di immagini». La barra laterale sulla stessa pagina riporta la dimensione del modello Safetensors come 7B parametri in BF16. Entrambi i numeri sono sulla stessa pagina, pubblicati dalla stessa organizzazione, e nulla nella scheda li concilia. Considera la classe come «all'incirca sette miliardi di parametri, con una cifra di sei miliardi nella descrizione» e non citare nessuno dei due come definitivo. Chiunque ti dica il conteggio esatto sta tirando a indovinare dalla stessa scheda che puoi leggere.
Il secondo è la licenza. La scheda riporta License: apache-2.0 oggi. La nostra precedente trattazione di questa famiglia diceva che nessuna delle schede rilasciate riportava un tag di licenza e che non c'era alcun file LICENSE nel repository. Entrambe le affermazioni possono essere vere in momenti diversi — un tag può essere aggiunto — ma non abbiamo intenzione di far finta che siano sempre state identiche, e una licenza comparsa dopo il rilascio è un fatto sostanzialmente diverso da una licenza distribuita insieme ai pesi. Se la licenza è essenziale per il tuo caso d'uso, controlla tu stesso il repository nel momento in cui scarichi, e verifica se il codice di addestramento, che la scheda descrive come in arrivo, viene fornito alle stesse condizioni.

Che cosa vendono realmente le due architetture
LLaDA-Image non è un modello di diffusione nel senso usuale e questa è la parte interessante. Abbina un diffusion transformer a un modello vision-language congelato — LLaDA2.0-mini — e un connettore RQA tra i due, ed è pubblicato come una famiglia anziché come un singolo checkpoint: Base a 50 step per la qualità, Turbo a due-quattro step per la velocità di elaborazione, ciascuno in BF16 e FP8. Sono quattro checkpoint, e i conteggi degli step sono il motivo per cui un deployment self-hosted può essere reso sostenibile con un budget contenuto: un modello 7B a 50 step è una proposta hardware diversa da uno a 2-4 step. Il rapporto tecnico è pubblico e la ricetta di addestramento è descritta come completamente aperta, il che è una dichiarazione di trasparenza più forte di quella della maggior parte delle release open-weight.
Hy Image3.5 preview è intenzionalmente la forma opposta. È un unico endpoint con un unico comportamento: text-to-image e image-to-image nella stessa chiamata, editing multi-turno che porta con sé i turni precedenti come contesto, fino a cinque immagini di riferimento per richiesta, un limite massimo di output a 2K e l'identificatore hy-image-v3.5-preview. Non c'è nulla da scegliere, nulla da mettere a punto e nulla da scaricare. L'insieme delle capacità è più ampio fin da subito — l'editing conversazionale multi-turno con contesto conservato è una vera funzionalità che la famiglia open non pubblicizza — e non hai alcun controllo su nulla di tutto ciò.
• Base di costo — Hy Image3.5 preview è $0,024 per immagine 2K conteggiato sull'output consegnato; LLaDA-Image è a pesi gratuiti più quanto costa far funzionare la tua GPU.
• Cosa ottieni — Hy Image3.5 preview è un'API ospitata con editing multi-turno e cinque immagini di riferimento; LLaDA-Image è composto da quattro checkpoint (Base e Turbo, BF16 e FP8) e da una ricetta di training.
• Passi per un'immagine — Hy Image3.5 preview è una singola chiamata senza alcun parametro step esposto; LLaDA-Image è di 50 passi su Base oppure da 2 a 4 su Turbo, che imposti tu stesso.
• Pesi — l'anteprima di Hy Image3.5 non ne pubblica alcuno; LLaDA-Image pubblica l'intera famiglia.
• Licenza — Hy Image3.5 preview è un servizio commerciale regolato dai termini di Tencent; LLaDA-Image porta un tag apache-2.0 che i nostri stessi resoconti precedenti non avevano rilevato.
• Prove — Hy Image3.5 preview ha un test cieco GSD del fornitore e nessun Elo indipendente; LLaDA-Image ha una cifra Qwen-Image-Bench riportata dall'autore di 53,53 in inglese e 53,38 in cinese, e anche nessun Elo indipendente.
Le cose che solo uno di questi può fare
Inizia da ciò che i pesi ti offrono, perché è più di una preferenza di licenza. Un checkpoint è un asset: non può essere deprecato, riprezzato, limitato nella frequenza o disattivato, e una pipeline agganciata a un file specifico funzionerà ancora tra tre anni. Può essere sottoposto a fine-tuning sul tuo materiale, il che, per un team con uno stile interno o un set di caratteri specifico, è la differenza tra fare prompting al modello di qualcun altro e addestrare il proprio. Funziona offline, il che conta se il materiale è lavoro per clienti sotto un vincolo di riservatezza. E il suo throughput è una funzione dell'hardware che hai acquistato anziché di una coda a cui ti sei unito.
Di contro, un endpoint ti garantisce l'assenza di lavoro. Nessuno del tuo team impara uno stack di serving, nessuno dimensiona una GPU, nessuno scopre in produzione che il checkpoint FP8 richiede un runtime diverso da quello BF16, e nessuno è chiamato a risponderne quando il job fallisce alle 3 del mattino. Il modello Tencent porta con sé anche una capacità che la famiglia open non rivendica: l'editing multi-turno che conserva la conversazione, che è esattamente il meccanismo alla base del mantenimento di un personaggio lungo una lunga serie di modifiche. Il supporto all'editing di LLaDA-Image è reale — è una famiglia unificata di generazione ed editing — ma lo stato conversazionale tra i turni non è qualcosa che la scheda pubblicizzi.
La formulazione onesta è che questi non competono affatto sulla qualità. Competono su chi si fa carico del rischio operativo, e le due risposte sono «Tencent» e «tu».
Che cosa è stato effettivamente misurato, da entrambe le parti
Nessuno dei due modelli ha una posizione indipendente. La classifica text-to-image di Artificial Analysis, consultata il 23 settembre 2026, non contiene alcuna riga relativa a Hy Image3.5 preview né a LLaDA-Image. Laddove la classifica include Tencent, si tratta della generazione precedente: HunyuanImage 3.0 Instruct a 964 Elo e HunyuanImage 3.0 a 945, classificati al 65º e 70º posto su 156 modelli — che è l'unica misurazione di terze parti di qualcosa in questa famiglia, e risale a una generazione fa.
Ciò che ciascuna parte offre, invece, è il proprio lavoro. Quello di Tencent è il test di preferenza alla cieca in stile GSD, condotto con diverse centinaia di designer professionisti della stessa azienda, che riporta circa il trenta per cento in più rispetto a Hy Image3.0, parità con Seedream 5.0 Pro e un leggero vantaggio su Nano-Banana Pro e Qwen-Image-3.0-Pro. Eseguito dal fornitore, con campione fornito dal fornitore, set di prompt non pubblicato — un metodo reale con un reale conflitto di interessi, ed entrambe le metà di quella frase vanno dette nello stesso respiro.
Il punteggio di LLaDA-Image su Qwen-Image-Bench è 53,53 in inglese e 53,38 in cinese, un numero riportato dagli autori su un benchmark scelto dagli autori stessi. Non è più indipendente del test di Tencent; è non verificato in modo diverso. La scheda elenca anche cinque Spaces della community e un numero di download mensili intorno al migliaio, il che ti dice che la famiglia open ha una trazione reale ma modesta — non è un modello che il settore ha già adottato, e chiunque ti dica il contrario non ha guardato il numero.

Dove vanno davvero i soldi, in grandi volumi
Valuta onestamente la parte in affitto, perché è l'unica parte con una tariffa pubblicata. Centomila immagini 2K al mese a 0,024 $ fanno 2.400 $. Mezzo milione al mese fa 12.000 $, ovvero circa 144.000 $ all'anno, e a quella scala un modello di immagini self-hosted di classe 7B smette di essere un'opzione da hobbista e inizia a essere una voce di costo ovvia. Al di sotto di circa diecimila immagini al mese, i conti non tornano affatto in quel modo: 240 $ contro il costo di una GPU, dell'energia, dello storage, dello stack di serving e dell'attenzione di qualcuno non è una scelta difficile, e l'endpoint a consumo vince su tutti i fronti, compreso quello che non stai conteggiando.
Il punto di pareggio non è un numero che qualcuno possa darti, perché il lato self-hosted dipende dall'hardware che già possiedi, dall'utilizzo che effettivamente raggiungi e dal fatto che la GPU stia facendo qualcos'altro quando non genera immagini. Ciò che si può dire con precisione è la forma della curva: il modello a consumo è lineare rispetto al volume e il modello self-hosted è una funzione a gradini, quindi la domanda non è quale sia più economico, ma dove si colloca il tuo volume rispetto al gradino.
Un endpoint, qualunque strada tu prenda
OrcaRouter non instrada nessuno di questi. Non ospitiamo alcun modello di immagini Tencent — le uniche voci Tencent nel catalogo sono la linea Hy3 di solo testo — e assolutamente nulla da inclusionAI, quindi Hy Image3.5 preview significa il cloud di Tencent stessa e i prodotti Tencent di prima parte, e LLaDA-Image significa i pesi pubblicati e qualunque runtime a cui li si punti. Dirlo chiaramente è più utile di una pagina modello che lo lascia ambiguo.
Ciò a cui serve un livello di routing in questa decisione è la terza opzione che rende poco costosa. Se stai soppesando 2.400 $ al mese contro l'acquisto di una GPU, l'intermedio utile è sapere quanto costa lo stesso carico di lavoro tra i modelli che puoi raggiungere oggi senza un contratto — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, la famiglia Imagen 4 e grok/grok-imagine-image stanno tutti dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider con 0% di markup, così un cambio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno, e il failover automatico significa che un pomeriggio storto di un provider non è la tua interruzione di servizio. Non è un sostituto per nessuno dei due modelli in questo confronto. È ciò che impedisce che il confronto si riduca a una scelta a due vie fatta al buio.

L'unica domanda che decide tutto
Chiediti se il tuo carico di lavoro ha una forma che i pesi possono catturare e l'endpoint no. Se stai generando secondo uno stile aziendale, un set di caratteri fisso o il materiale di un cliente, e hai il volume e l'hardware per far sì che un modello di classe 7B si ripaghi, allora LLaDA-Image è l'asset più duraturo e il tag Apache-2.0 — verificalo al momento del download, vista la storia di cui sopra — è ciò che lo rende utilizzabile. Stai comprando l'opzionalità e la paghi in operazioni.
Se il tuo carico di lavoro è a picchi, se nessuno nel team vuole gestire uno stack di serving, se l'editing multi-turno con contesto mantenuto è la funzionalità di cui hai davvero bisogno, o se il tuo volume è inferiore a diecimila immagini al mese, allora $0.024 per immagine 2K consegnata è un buon prezzo per il problema di qualcun altro, e l'etichetta di anteprima è la cosa principale da tenere d'occhio. L'unica cosa che vale la pena fare prima del 7 ottobre 2026 — mentre Miora, WorkRally e OnSolo stanno gestendo la finestra gratuita — è far passare il tuo set di prompt attraverso il modello tencent e annotare il tasso di accettazione, perché quel numero, non il trenta per cento, è quello che decide se il lato a consumo valga il suo contatore.
