
GPT-Image-2 vs Flux 3: Confronto tra un modello attivo e una roadmap
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Questo non è un normale post modello-contro-modello, perché GPT-Image-2 e Flux 3 non sono nello stesso stato di esistenza. GPT-Image-2, rilasciato il 21 aprile 2026, è invocabile tramite l'API di OpenAI da inizio maggio, e questa settimana ha guadagnato una nuova capacità — la generazione di immagini con sfondo trasparente nell'API, annunciata il 20 agosto e disponibile ora. Flux 3 è il modello multimodale di base di Black Forest Labs, annunciato il 23 luglio 2026, e il livello immagine non ha ancora un endpoint pubblico, nessun ID del modello e nessun listino prezzi al momento in cui scriviamo. Uno di questi puoi chiamarlo alle 3 di notte con una chiave valida; per l'altro puoi iscriverti per essere messo in lista d'attesa. Il confronto utile, quindi, non è "quale sia migliore" — è ciò che il modello rilasciato fa effettivamente oggi, ciò che la roadmap promette per quello non ancora rilasciato, e come uno sviluppatore dovrebbe trattare un modello promesso che continua a slittare mentre uno attivo continua a migliorare.
Una di queste ha un endpoint.
Parti dalla disponibilità, perché decide tutto il resto. Black Forest Labs ha presentato Flux 3 il 23 luglio come un singolo modello addestrato congiuntamente su previsione di immagini, video, audio e azioni robotiche, costruito su un approccio di flow-matching che il laboratorio chiama Self-Flow. Oltre il 95% della potenza di calcolo di quel training sarebbe andata alla previsione video, e questo si vede in ciò che è stato effettivamente rilasciato: solo Flux 3 Video è arrivato alla disponibilità generale, il 4 agosto, con un'API a pagamento. La pagina del modello per il livello immagini riporta ancora un'etichetta "in arrivo" con un modulo di richiesta, non un pulsante per iniziare — nessun endpoint, nessun parametro documentato, nessun costo per immagine e nessun benchmark eseguibile da chiunque.
GPT-Image-2, al contrario, è in produzione da quattro mesi. OpenAI ha aperto l'accesso alle API all'inizio di maggio, e l'identificatore del modello, gpt-image-2, è abbastanza stabile da permettere che uno snapshot fissato, gpt-image-2-2026-04-21, coesista con esso. È attualmente il modello text-to-image numero uno su entrambe le principali classifiche indipendenti — 1.381 Elo sulla leaderboard text-to-image di Arena (la build media) e 1.369 Elo per la build alta su Artificial Analysis — e renderizza testo multilingue, incluso CJK, basa la generazione sulla ricerca web e produce output fino a 4K. Quattro mesi di traffico di produzione fanno la differenza tra un'affermazione e un track record.
Il recente cambiamento lato GPT-Image-2.
L'evento che rende questo confronto tempestivo non ha nulla a che fare con Flux 3. Il 20 agosto, OpenAI ha introdotto un'anteprima con sfondo trasparente per GPT-Image-2 nell'Images API: impostando lo sfondo su "transparent", l'endpoint restituisce un PNG o WebP con un vero canale alfa, già ritagliato e pronto per la composizione. È una funzionalità mirata proprio al lavoro di produzione che anche la roadmap dell'immagine di Flux 3 sta vendendo — foto di prodotto, icone, asset di marketing — ed è arrivata come parametro su un endpoint già attivo, non come nuovo modello. Quindi, mentre il mondo attende un endpoint per le immagini di Flux 3 che dice ancora "coming soon", l'incumbent ha appena chiuso uno dei gap che lo escludevano dalle pipeline di compositing.
La funzionalità è disponibile solo tramite API — non esiste un interruttore ChatGPT — ed è un parametro, non un nuovo prodotto. Entrambi gli endpoint dell'API Images, generazione e modifica, accettano un campo background con i valori "transparent", "opaque" e "auto" (il default, in cui decide il modello). Il canale alfa sopravvive solo nell'output PNG o WebP, quindi la richiesta fissa esplicitamente il formato di output. Il riferimento API di OpenAI stesso continua a indicare il supporto della trasparenza per gpt-image-2 e per la sua snapshot gpt-image-2-2026-04-21 come "in anteprima" — è l'etichetta del fornitore, non un annuncio di rilascio — e la sua indicazione è di mantenere il prompt privo di qualsiasi sfondo descritto, così che il modello rispetti davvero la richiesta di trasparenza. Nessun nuovo endpoint, nessun nuovo ID di modello, nessuna scheda tariffaria separata: la stessa chiamata gpt-image-2 che restituiva un PNG opaco ora restituisce un ritaglio.

Cosa promette l'immagine Flux 3, e cosa viene effettivamente distribuito
Il foglio tecnico del livello immagine Flux 3 è una roadmap del fornitore, quindi trattalo come tale. Black Forest Labs ha promesso sintesi e modifica di immagini in vari stili e risoluzioni, migliore gestione di prompt complessi, rendering di testo multilingue ad alta precisione, trasferimento di stile zero-shot da immagini di riferimento, coerenza di personaggi e marchio senza fine-tuning e modifica non distruttiva che preserva texture e illuminazione. Sono le cose giuste da promettere — sono esattamente le funzionalità su cui competono gli attuali leader di mercato — ma nessuna di esse è testabile oggi perché nessuna ha un endpoint.
Ciò che è effettivamente richiamabile da BFL è il livello video e la vecchia linea di immagini FLUX. Flux 3 Video viene venduto a $0,17 al secondo in HD e $0,29 al secondo in FHD per i rendering completi, con una modalità bozza a $0,06 al secondo. I suoi stessi numeri dichiarati sono un Elo di 1.135 per text-to-video e di 1.051 per image-to-video, e vittorie di preferenza su Luma Ray 3.2, Runway Gen-4.5, Grok Imagine Video e Kling v3 Pro — il tutto dichiarato dal fornitore e non riprodotto, e nulla di ciò si trasferisce comunque al livello immagini. Per le immagini fisse, l'attuale offerta di BFL rimane la linea FLUX.2, che si attesta a 1.226 Elo sulla stessa classifica Artificial Analysis dove GPT-Image-2 è in testa con 1.369. Questo divario è il contesto pratico per “L'immagine Flux 3 sta arrivando”: l'attuale API per immagini di BFL è indietro di circa 140 Elo rispetto a quella di OpenAI, e il modello promesso è ciò di cui BFL ha bisogno per colmarlo.

Prezzi: esiste solo una vera scheda prezzi.
Non esiste un prezzo per le immagini di Flux 3, perché non esiste un prodotto di immagini Flux 3. Gli unici numeri pubblicati sono le tariffe per token di GPT-Image-2: $5 per milione di token di input testuale, $8 per milione di token di input immagine e $30 per milione di token di output immagine, con l'API Batch che costa circa la metà per tempi di consegna fino a 24 ore. OpenAI non pubblica i token per immagine, quindi le cifre per singola immagine sono conversioni, non preventivi: circa $0,006 per una 1024×1024 a bassa qualità, circa $0,05 per una media, circa $0,21 ad alta qualità, e fino a circa $0,41 per un render 4K ad alta risoluzione. Per fare un confronto, questo è l'unico lato del registro che è reale; la colonna delle immagini di Flux 3 è una cella vuota.

Cosa dovrebbe fare un costruttore con un modello promesso
La postura sensata quando il modello di un concorrente continua a slittare è costruire su ciò che esiste e rendere il futuro un cambio di configurazione piuttosto che una ri-architettura. GPT-Image-2 è instradabile oggi tramite OrcaRouter — una sola API key, il prezzo di listino di OpenAI passato con markup 0%, failover automatico tra provider — così una pipeline che genera asset con esso può in seguito puntare lo stesso endpoint all'API di Flux 3 image il giorno in cui un endpoint esisterà davvero, e instradare una parte del traffico verso di essa con il routing DSL senza toccare il codice chiamante. Ottieni il modello già disponibile ora, e quando quello promesso arriverà lo valuti rispetto a una baseline funzionante invece che rispetto a un comunicato stampa. L'attesa non ti costa nulla; costruire sul nulla mentre aspetti ti costa tutto.
Il verdetto è sbilanciato per progettazione. Se hai bisogno di generazione di immagini in questo trimestre, GPT-Image-2 è la scelta e non c'è una seconda domanda: è il numero uno indipendente, ha appena aggiunto l'output con sfondo trasparente nell'API e ha un'API pubblica e un prezzo stabile. Flux 3 image è un motivo per tenere d'occhio Black Forest Labs, non un motivo per bloccare un progetto. Segui l'apertura dell'accesso anticipato e i primi benchmark indipendenti; nel momento in cui esiste un endpoint, il confronto in questo post diventa un test che puoi effettivamente eseguire.
