
GPT-Image-2.5 contro LLaDA-Image: un'API da $30 al milione di token contro un modello di diffusione gratuito da 6B.
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0455Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0247Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0247Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0157Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2646Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1849Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1541Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1251Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0547Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligenza49Codice
Chiedi quanto dovrebbe costare la generazione di immagini e due laboratori hanno costruito le due risposte opposte a distanza di una settimana l'uno dall'altro. L'8 settembre 2026 OpenAI ha rilasciato GPT-Image-2.5 — il modello dietro ChatGPT Images 2.5, venduto tramite API come GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst — con un listino a token di 8 dollari per milione di token di input immagine e 30 dollari per milione di token di output immagine. Cinque giorni prima, il 4 settembre, inclusionAI (il laboratorio sostenuto da Ant Group dietro la famiglia linguistica LLaDA) ha rilasciato in sordina LLaDA-Image, un generatore ed editor di immagini diffusion-transformer da sei miliardi di parametri i cui pesi sono scaricabili a costo zero. Uno è il modello di immagini commercialmente più potente che OpenAI abbia mai messo dietro un contatore di token; l'altro è un tentativo di dimostrare che un modello di immagini forte può essere costruito con una ricetta di addestramento aperta e regalato. Confrontarli è meno una sfida testa a testa che una decisione su quale definizione di costo si stia effettivamente pagando.
Quasi ogni numero riguardante GPT-Image-2.5 è dichiarato dal fornitore e nessuno di essi ha ancora superato un controllo indipendente: OpenAI afferma che Flare riduce la latenza fino al 50% rispetto a GPT-Image-2 e che i test di terze parti condotti dalla società di agenti Manus hanno misurato una generazione 2–4× più veloce, ma al 9 settembre 2026 nessuno dei due modelli GPT-Image-2.5 compare nelle classifiche immagini di Artificial Analysis. Anche il dato di punta di LLaDA-Image non è stato riprodotto in modo indipendente — inclusionAI riporta 53.53 in inglese / 53.38 in cinese su Qwen-Image-Bench, primo tra i modelli open-weights al momento del rilascio — e, poiché il modello non dispone di un'API ospitata, non può affatto comparire nelle classifiche riservate alle API. Entrambi i lati di questo confronto poggiano sulle dichiarazioni dei rispettivi creatori, un aspetto da tenere presente per tutto il resto di questo articolo.
Due modelli che condividono a malapena una categoria.
GPT-Image-2.5 è un modello di immagini ospitato e chiuso, nella stessa linea di ChatGPT Images 2.0 dell'aprile 2026. È multimodale in ingresso e produce immagini che, secondo OpenAI, sono più nitide nei dettagli fini, più naturali nell'illuminazione e nella texture, e più stabili nelle modifiche multi-turno: l'endpoint Sunburst esiste specificamente per lavori di produzione ad alta intensità di editing, dove una generazione più lenta è accettabile in cambio di un controllo più stretto sulle istruzioni, mentre Flare è l'opzione predefinita veloce per la generazione ad alto volume. Gli output arrivano fino a 2048×2048 e 3840×2160, gli sfondi trasparenti sono supportati e ogni output include metadati di provenienza C2PA oltre a una filigrana invisibile.
LLaDA-Image è un rilascio open in stile ricerca basato su una scommessa completamente diversa. Mentre GPT-Image-2.5 è servito dall'infrastruttura di OpenAI, LLaDA-Image è un insieme di pesi che esegui tu stesso: un diffusion transformer (DiT) da 6 miliardi di parametri sul lato generazione — la scheda del modello registra circa 7 miliardi di parametri se si conta anche il lato linguistico — abbinato a LLaDA 2.0-mini, un modello linguistico a diffusione mixture-of-experts da 16B totali / 1B attivi, come lato "comprensione" che trasforma prompt testuali o istruzioni di modifica nel segnale che il DiT segue. L'affermazione insolita nel rapporto arXiv (2609.03796) è la ricetta di addestramento: più del 90% di circa 220 milioni di campioni cumulativi di pre-addestramento e addestramento intermedio sono costituiti solo da immagini, con un modello visione-linguaggio congelato che estrae semantica da immagini non etichettate come segnale di auto-condizionamento, così il modello "impara prima a disegnare, poi a obbedire." La risoluzione progressiva porta l'addestramento da 256×256 a 512×512 fino al fine-tuning a 1024×1024, seguito da addestramento misto text-to-image e modifica, e da una distillazione a pochi passi TwinFlow che produce la variante LLaDA-Image-Turbo.
In cosa ciascuno è davvero bravo
La proposta di GPT-Image-2.5 è precisione e controllo a qualità commerciale. L'annuncio di OpenAI sottolinea la fedeltà al riferimento — mantenere riconoscibile una persona, un animale domestico o un prodotto quando si cambia l'ambientazione o lo stile — e una modifica che cambia solo ciò che hai chiesto di cambiare, mantenuta attraverso molti cicli di modifica in un'unica conversazione. La resa del testo all'interno delle immagini viene evidenziata specificamente, inclusa l'eliminazione dei caratteri cinesi distorti che affliggevano i modelli di generazione di immagini precedenti. Sono esattamente le capacità che un team di prodotto, marchio o pubblicità incontra ripetutamente.
La proposta di LLaDA-Image è un singolo set di pesi che esegue generazione bilingue ed editing guidato da istruzioni con una ricetta aperta. inclusionAI riporta rendering del testo nativo in cinese e inglese, un percorso di editing che inietta immagini di riferimento tramite un design a doppio percorso pensato per preservare il contenuto non modificato e — su Qwen-Image-Bench — i migliori punteggi open-weights al momento del rilascio. Le avvertenze oneste del rilascio sono che la qualità percettiva dell'editing è ancora inferiore a quella degli editor specializzati e il conteggio degli oggetti resta debole. È un modello aperto generalista, non un prodotto commerciale finito.

La classifica non è volutamente una gara sulla qualità dell'immagine — i due modelli non sono mai stati sottoposti alla stessa valutazione. Quello che mostra è dove vanno a finire i soldi e il controllo.
Il prezzo di un'immagine è il numero che nessuna delle due parti ti darà
OpenAI pubblica una scheda tariffaria a token per GPT-Image-2.5 identica a quella di GPT-Image-2: 8 dollari per milione di token di input immagine, 30 dollari per milione di token di output immagine, input immagine in cache a 2 dollari e token di testo fatturati separatamente a 5 dollari per milione. Ciò che non pubblica è quanti token consuma una determinata immagine, il che significa che non esiste un prezzo ufficiale per singola immagine né un calcolatore di costi. Al prezzo indicato da AA per il predecessore nella sua classifica — circa 211 dollari per 1.000 immagini per GPT Image 2 a qualità "alta" — un modello di punta con tariffazione a token è uno strumento costoso su larga scala, ma quella cifra si riferisce a GPT-Image-2, non alla 2.5, e il costo per singola immagine del nuovo modello è realmente sconosciuto al di fuori di OpenAI.
LLaDA-Image ha il problema opposto di onestà. I pesi non costano nulla e la scheda riporta il tag Apache-2.0, ma il prezzo reale è l'infrastruttura: un transformer di diffusione da 6B richiede una GPU seria per la variante Base a 50 passi, e i checkpoint FP8 (circa 49 GB in un layout diffusers) sono l'opzione pratica per la maggior parte degli utenti. La distillazione a 2–4 passi di LLaDA-Image-Turbo è la concessione a quella realtà. Gli strumenti della community si sono mossi in fretta — una pull request di SGLang aggiunge text-to-image, editing, sequence-parallel e supporto FP8, e un pacchetto di nodi RebelAI ComfyUI supporta l'inferenza locale quantizzata INT8 e GGUF — ma "modello gratuito" significa ancora "tu sei il fornitore di hosting". Per un team che dispone già di capacità GPU, il costo marginale di LLaDA-Image è vicino allo zero; per tutti gli altri, il costo totale di servirlo può superare le bollette API a consumo una volta che si conta il tempo di ingegneria.
La via onesta se vuoi entrambi
Per la maggior parte dei team non si tratta di scegliere tra l'uno o l'altro. Una pipeline di produzione può usare un'API hosted come GPT-Image-2.5 per il lavoro rivolto ai clienti, denso di modifiche e che non deve fallire, e tenere un modello aperto come LLaDA-Image per esperimenti, processi batch offline e qualsiasi cosa che non possa inviare prompt a terze parti. Questa suddivisione è esattamente il tipo di problema per cui è progettato un livello di routing: un'unica API che raggiunge i modelli hosted che usi davvero, con il prezzo di listino del provider applicato senza alcun ricarico, così che in seguito provare un modello open-weight tramite una rotta hosted costi quanto andare direttamente dal provider. Al 9 settembre 2026 nessuno dei due modelli è nel catalogo di OrcaRouter: GPT-Image-2.5 è al momento disponibile solo tramite l'API OpenAI (la generazione precedente, GPT-Image-2, è instradata), e LLaDA-Image è disponibile solo come pesi, senza inferenza hosted. L'intento progettuale resta valido a prescindere dal catalogo attuale.

Su quale dovresti costruire?
Se il tuo lavoro è la {{1}}generazione di immagini commerciali{{/1}} dove una modifica fallita costa un rapporto con il cliente — scatti di prodotto, creative di campagna, immagini coerenti con i riferimenti, lunghe sessioni di modifica multi-turno — GPT-Image-2.5 è il modello il cui intero design è pensato per quel compito, e l'endpoint Sunburst è il motivo per prestare attenzione ancor prima che esistano punteggi indipendenti. I rischi sono l'opacità del prezzo per immagine e il fatto che ogni affermazione sulla qualità provenga dalla stessa OpenAI. Se il tuo lavoro è {{2}}ricerca{{/2}}, sperimentazione ad alto volume, generazione bilingue cinese-inglese, o qualsiasi cosa che debba girare nel tuo ambiente o sui tuoi dati, LLaDA-Image è la release più interessante — pesi genuinamente open con una ricetta pubblicata, al costo di essere la tua stessa infrastruttura e convivere con punteggi non riprodotti. I modelli escono a una settimana di distanza e sono a un mondo di distanza nel modello operativo; la scelta giusta è quella che corrisponde al costo che sei realmente in grado di pagare.

