Scheda titolo hero per GPT-Image-2 vs Flux 3, titolo 'GPT-Image-2 vs Flux 3' con sottotitolo 'Un modello live, una roadmap', due schede che mostrano GPT-Image-2 con un badge 'API pubblica da maggio 2026' e Flux 3 con un badge 'Livello immagini: in arrivo', logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

GPT-Image-2 vs Flux 3: Confronto tra un modello attivo e una roadmap

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questo non è un normale post modello-contro-modello, perché GPT-Image-2 e Flux 3 non sono nello stesso stato di esistenza. GPT-Image-2, rilasciato il 21 aprile 2026, è invocabile tramite l'API di Ope​nAI da inizio maggio, e questa settimana ha guadagnato una nuova capacità — la generazione di immagini con sfondo trasparente nell'API, annunciata il 20 agosto e disponibile ora. Flux 3 è il modello multimodale di base di Black Forest Labs, annunciato il 23 luglio 2026, e il livello immagine non ha ancora un endpoint pubblico, nessun ID del modello e nessun listino prezzi al momento in cui scriviamo. Uno di questi puoi chiamarlo alle 3 di notte con una chiave valida; per l'altro puoi iscriverti per essere messo in lista d'attesa. Il confronto utile, quindi, non è "quale sia migliore" — è ciò che il modello rilasciato fa effettivamente oggi, ciò che la roadmap promette per quello non ancora rilasciato, e come uno sviluppatore dovrebbe trattare un modello promesso che continua a slittare mentre uno attivo continua a migliorare.

Una di queste ha un endpoint.

Parti dalla disponibilità, perché decide tutto il resto. Black Forest Labs ha presentato Flux 3 il 23 luglio come un singolo modello addestrato congiuntamente su previsione di immagini, video, audio e azioni robotiche, costruito su un approccio di flow-matching che il laboratorio chiama Self-Flow. Oltre il 95% della potenza di calcolo di quel training sarebbe andata alla previsione video, e questo si vede in ciò che è stato effettivamente rilasciato: solo Flux 3 Video è arrivato alla disponibilità generale, il 4 agosto, con un'API a pagamento. La pagina del modello per il livello immagini riporta ancora un'etichetta "in arrivo" con un modulo di richiesta, non un pulsante per iniziare — nessun endpoint, nessun parametro documentato, nessun costo per immagine e nessun benchmark eseguibile da chiunque.

GPT-Image-2, al contrario, è in produzione da quattro mesi. Ope​nAI ha aperto l'accesso alle API all'inizio di maggio, e l'identificatore del modello, gpt-image-2, è abbastanza stabile da permettere che uno snapshot fissato, gpt-image-2-2026-04-21, coesista con esso. È attualmente il modello text-to-image numero uno su entrambe le principali classifiche indipendenti — 1.381 Elo sulla leaderboard text-to-image di Arena (la build media) e 1.369 Elo per la build alta su Artificial Analysis — e renderizza testo multilingue, incluso CJK, basa la generazione sulla ricerca web e produce output fino a 4K. Quattro mesi di traffico di produzione fanno la differenza tra un'affermazione e un track record.

Il recente cambiamento lato GPT-Image-2.

L'evento che rende questo confronto tempestivo non ha nulla a che fare con Flux 3. Il 20 agosto, Ope​nAI ha introdotto un'anteprima con sfondo trasparente per GPT-Image-2 nell'Images API: impostando lo sfondo su "transparent", l'endpoint restituisce un PNG o WebP con un vero canale alfa, già ritagliato e pronto per la composizione. È una funzionalità mirata proprio al lavoro di produzione che anche la roadmap dell'immagine di Flux 3 sta vendendo — foto di prodotto, icone, asset di marketing — ed è arrivata come parametro su un endpoint già attivo, non come nuovo modello. Quindi, mentre il mondo attende un endpoint per le immagini di Flux 3 che dice ancora "coming soon", l'incumbent ha appena chiuso uno dei gap che lo escludevano dalle pipeline di compositing.

La funzionalità è disponibile solo tramite API — non esiste un interruttore ChatGPT — ed è un parametro, non un nuovo prodotto. Entrambi gli endpoint dell'API Images, generazione e modifica, accettano un campo background con i valori "transparent", "opaque" e "auto" (il default, in cui decide il modello). Il canale alfa sopravvive solo nell'output PNG o WebP, quindi la richiesta fissa esplicitamente il formato di output. Il riferimento API di OpenAI stesso continua a indicare il supporto della trasparenza per gpt-image-2 e per la sua snapshot gpt-image-2-2026-04-21 come "in anteprima" — è l'etichetta del fornitore, non un annuncio di rilascio — e la sua indicazione è di mantenere il prompt privo di qualsiasi sfondo descritto, così che il modello rispetti davvero la richiesta di trasparenza. Nessun nuovo endpoint, nessun nuovo ID di modello, nessuna scheda tariffaria separata: la stessa chiamata gpt-image-2 che restituiva un PNG opaco ora restituisce un ritaglio.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Cosa promette l'immagine Flux 3, e cosa viene effettivamente distribuito

Il foglio tecnico del livello immagine Flux 3 è una roadmap del fornitore, quindi trattalo come tale. Black Forest Labs ha promesso sintesi e modifica di immagini in vari stili e risoluzioni, migliore gestione di prompt complessi, rendering di testo multilingue ad alta precisione, trasferimento di stile zero-shot da immagini di riferimento, coerenza di personaggi e marchio senza fine-tuning e modifica non distruttiva che preserva texture e illuminazione. Sono le cose giuste da promettere — sono esattamente le funzionalità su cui competono gli attuali leader di mercato — ma nessuna di esse è testabile oggi perché nessuna ha un endpoint.

Ciò che è effettivamente richiamabile da BFL è il livello video e la vecchia linea di immagini FLUX. Flux 3 Video viene venduto a $0,17 al secondo in HD e $0,29 al secondo in FHD per i rendering completi, con una modalità bozza a $0,06 al secondo. I suoi stessi numeri dichiarati sono un Elo di 1.135 per text-to-video e di 1.051 per image-to-video, e vittorie di preferenza su Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video e Kling v3 Pro — il tutto dichiarato dal fornitore e non riprodotto, e nulla di ciò si trasferisce comunque al livello immagini. Per le immagini fisse, l'attuale offerta di BFL rimane la linea FLUX.2, che si attesta a 1.226 Elo sulla stessa classifica Artificial Analysis dove GPT-Image-2 è in testa con 1.369. Questo divario è il contesto pratico per “L'immagine Flux 3 sta arrivando”: l'attuale API per immagini di BFL è indietro di circa 140 Elo rispetto a quella di Ope​nAI, e il modello promesso è ciò di cui BFL ha bisogno per colmarlo.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Prezzi: esiste solo una vera scheda prezzi.

Non esiste un prezzo per le immagini di Flux 3, perché non esiste un prodotto di immagini Flux 3. Gli unici numeri pubblicati sono le tariffe per token di GPT-Image-2: $5 per milione di token di input testuale, $8 per milione di token di input immagine e $30 per milione di token di output immagine, con l'API Batch che costa circa la metà per tempi di consegna fino a 24 ore. Ope​nAI non pubblica i token per immagine, quindi le cifre per singola immagine sono conversioni, non preventivi: circa $0,006 per una 1024×1024 a bassa qualità, circa $0,05 per una media, circa $0,21 ad alta qualità, e fino a circa $0,41 per un render 4K ad alta risoluzione. Per fare un confronto, questo è l'unico lato del registro che è reale; la colonna delle immagini di Flux 3 è una cella vuota.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Cosa dovrebbe fare un costruttore con un modello promesso

La postura sensata quando il modello di un concorrente continua a slittare è costruire su ciò che esiste e rendere il futuro un cambio di configurazione piuttosto che una ri-architettura. GPT-Image-2 è instradabile oggi tramite OrcaRouter — una sola API key, il prezzo di listino di OpenAI passato con markup 0%, failover automatico tra provider — così una pipeline che genera asset con esso può in seguito puntare lo stesso endpoint all'API di Flux 3 image il giorno in cui un endpoint esisterà davvero, e instradare una parte del traffico verso di essa con il routing DSL senza toccare il codice chiamante. Ottieni il modello già disponibile ora, e quando quello promesso arriverà lo valuti rispetto a una baseline funzionante invece che rispetto a un comunicato stampa. L'attesa non ti costa nulla; costruire sul nulla mentre aspetti ti costa tutto.

Il verdetto è sbilanciato per progettazione. Se hai bisogno di generazione di immagini in questo trimestre, GPT-Image-2 è la scelta e non c'è una seconda domanda: è il numero uno indipendente, ha appena aggiunto l'output con sfondo trasparente nell'API e ha un'API pubblica e un prezzo stabile. Flux 3 image è un motivo per tenere d'occhio Black Forest Labs, non un motivo per bloccare un progetto. Segui l'apertura dell'accesso anticipato e i primi benchmark indipendenti; nel momento in cui esiste un endpoint, il confronto in questo post diventa un test che puoi effettivamente eseguire.