
FLUX 3 Image vs FLUX 3: due nomi, due prodotti, a nove settimane di distanza
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Dal 1° ottobre 2026, "FLUX 3" significa due cose diverse, e il secondo significato è quello con un listino prezzi. FLUX 3 Image è il livello per le immagini che è entrato in funzione quel giorno su api.bfl.ai/v1/flux-3-image, con tariffazione per immagine a partire da $0,041. FLUX 3 è la cosa più grande a cui appartiene — il modello multimodale unificato che Black Forest Labs ha annunciato il 23 luglio 2026 e che da allora ha rilasciato a pezzi, di cui video e una testa di azione per la robotica sono le parti già in produzione. Questo non è un confronto tra un modello di punta e il suo fratello minore. È un confronto tra un'intera famiglia e una delle sue tre parti funzionanti.
È facile perdere questa distinzione, e la stessa denominazione di BFL non aiuta: la pagina della famiglia, la documentazione video, i termini di licenza e il riferimento API dicono tutti FLUX 3 in punti in cui intendono qualcosa di più ristretto. Se hai letto una scheda tecnica di FLUX 3 e ne sei uscito incerto se descriva un modello di immagini, un modello video o un programma di ricerca, non è che tu sia stato distratto. Entrambi i nomi sono in uso attivo per sottoinsiemi sovrapposti della stessa release.
Le due date che contano
• 23 luglio 2026 — FLUX 3 annunciato con l'etichetta Early Access. Una singola architettura Self-Flow che copre la generazione di immagini, video e audio oltre alla previsione delle azioni. La divulgazione del calcolo è la parte interessante: oltre il 95% della potenza di calcolo per l'addestramento è stata destinata al video, e meno dello 0,5% dei token è stato assegnato all'audio.
• 1° ottobre 2026 — il tier delle immagini si apre come endpoint a consumo. Il che lascia un intervallo di circa dieci settimane tra l'annuncio e l'arrivo della modalità a cui la maggior parte delle persone pensava si riferisse "FLUX 3".
Leggere quella ripartizione del calcolo ti dice quale fosse, secondo Black Forest Labs, il problema difficile. Una famiglia di modelli che spende quasi tutto il suo budget di addestramento sul video non sta ottimizzando per le immagini statiche e trattando il movimento come un'estensione. È il contrario, e il livello delle immagini ha ereditato qualunque cosa abbia prodotto l'addestramento video-first.

In cosa consiste ciascun livello e quanto costa
Tre delle quattro modalità annunciate a luglio sono state rilasciate. Il livello per le immagini è il più recente ed è l'unico a comportarsi come una convenzionale API a pagamento.
• FLUX 3 Image — una POST, un header x-key e un URL di polling in risposta. Prezzo per immagine in base al livello di risoluzione: $0,041 a 768sq, $0,048 a 1K (predefinito), $0,07 a 1,5K, $0,10 a 2K e $0,607 a 4K. Uno sconto di lancio del 50% è attivo fino alle 15:00 UTC dell'8 ottobre. Riferimenti e lunghezza del prompt sono inclusi; le richieste non riuscite e quelle moderate non vengono fatturate. Accetta fino a dieci immagini di riferimento, ciascuna tra 256×256 pixel e 16 megapixel.
• FLUX 3 Video — disponibile a livello generale e tariffato al secondo anziché per immagine. Text-to-video e image-to-video costano $0.06/s in Draft HD, $0.17/s HD, $0.29/s FHD, $0.40/s QHD e $0.80/s UHD, con il video-to-video più alto su tutta la linea. Le clip arrivano fino a 20 secondi con audio sincronizzato nativo, e le modalità includono keyframe-to-video e continuation. La modalità Draft è solo HD. L'output QHD e UHD è arrivato il 10 settembre 2026.
• FLUX 3 Action — un modello world-action da 7B, e l'unica parte di FLUX 3 di cui puoi scaricare i parametri. Tre checkpoint sono comparsi su Hugging Face il 22 settembre 2026: un checkpoint base, una variante per il braccio SO-101 e una variante DROID. L'accesso è riservato ai partner anziché aperto, con la manipolazione robotica come uso dimostrato.
• Cosa non è ancora stato rilasciato — un backbone open-weight FLUX 3. I livelli self-hosting di BFL coprono ancora solo FLUX.2 [klein] e FLUX.2 [dev]. Nello specifico per il livello immagini, esistono pesi commerciali con licenza negoziata e i pesi aperti pubblici sono descritti come disponibili tra qualche settimana.
Il confronto dei costi che nessuno fa

I prezzi per immagine e per secondo sembrano incomparabili, ed è esattamente per questo che vale la pena fare il calcolo una volta.
Cinque secondi di video generato da testo in HD standard costano $0,85. Cinque secondi in UHD costano $4,00. Una singola immagine fissa 4K dal livello immagini costa $0,607 di listino, oppure $0,3035 entro la finestra di lancio — e sebbene il "4K" del livello immagini indichi un budget di pixel anziché un fotogramma fisso (l'output di esempio di BFL è 5456 × 3072, circa 16,8 megapixel, contro gli 8,3 di UHD 2160p), è lo stesso ordine di risoluzione che il livello video fa pagare al secondo per il movimento.
La conseguenza è che generare un singolo keyframe UHD costa una frazione di quanto costa generare un secondo di video UHD, e il keyframe è ciò che genereresti ripetutamente mentre iteri. Se la tua pipeline è «ottieni il fotogramma giusto, poi lo animi», il livello immagine è la metà economica di più di un ordine di grandezza, ed è la metà che è disponibile da meno tempo.
C'è un'avvertenza sul lato immagini che il lato video non ha. Una chiamata per un'immagine 4K può richiedere diversi minuti, e il campione restituito è scaricabile per un'ora. La lentezza e la reperibilità per un'ora costituiscono una forma operativa diversa da un job video, ed è il tipo di dettaglio che decide se una pipeline batch necessita di una coda.
Le bounding box esistono con uno di questi due nomi
Le superfici di controllo non sono condivise tra i livelli, e questa è la differenza pratica più netta tra il nome e la famiglia.
Il livello immagine accetta un array JSON aggiunto al prompt, con coordinate su una griglia da 0 a 1000 su entrambi gli assi e ogni riquadro scritto [top, left, bottom, right]. Si passa una tabella di elementi che portano un id, un bbox e una desc, e una didascalia globale che cita quegli id — gli esempi di BFL usano nomi come animal_1. Lo stesso sistema di coordinate guida la modifica: mantieni una regione, sposta una regione, generane una nuova in un riquadro di destinazione oppure rimuovi un riquadro di origine. Più operazioni vanno in un'unica richiesta, con ref_image_0 che indica la prima voce nell'elenco dei riferimenti. I pixel al di fuori dei riquadri modificati, dice la documentazione, «di solito restano identici» — una cautela da leggere alla lettera.
Il grounding è attivo per impostazione predefinita nel livello immagine: prima della generazione viene eseguita una ricerca web e immagini. Le dimensioni di output vengono arrotondate a multipli di 16 e il valore effettivo viene restituito come output_mp.
Niente di tutto ciò appare nei parametri del livello video. FLUX 3 Video ha la propria storia di controllo — keyframe, continuazione, condizionamento del primo e dell'ultimo fotogramma — ma nessun linguaggio di coordinate. Le parti condividono un'architettura, non un'interfaccia.
Leggendo attentamente i confronti del fornitore stesso
Black Forest Labs ha pubblicato i risultati di preferenza per FLUX 3 Video, e vale la pena citarli con la loro provenienza allegata. Le esecuzioni sono eseguite dal fornitore, preliminari, e valutate come tassi di vittoria su output 720p da 10 secondi:
• Rispetto a Luma Ray 3.2 — preferenza del 93% per FLUX 3 Video.
• Contro Runway Gen-4.5 — 77%.
• Contro Grok Imagine Video — 69%.
• Contro Kling v3 Pro — 60%.
• Contro Happy Horse v1 e v1.1 — 59% e 57%.
• Contro Seedance 2.0 e Gemini Omni Flash — all'incirca il 52% ciascuno, che in sostanza è un pareggio statistico anche se il numero è superiore alla metà.
La forbice dal 93% fino al 52% lungo quell'elenco è più informativa di qualsiasi singola riga. Nessuno al di fuori di BFL ha eseguito questi confronti, e i risultati sotto il 55% in fondo sono quelli che ti dicono dove il modello è davvero contestato.
Non esistono affatto numeri equivalenti per FLUX 3 Image. Le classifiche text-to-image e di editing di Artificial Analysis sono state controllate il 1º ottobre e di nuovo il 2 ottobre 2026, e nessuna delle due riporta una voce FLUX 3 Image. La linea FLUX.2 è ancora il punto in cui si fermano i punteggi pubblicati da BFL: FLUX.2 [max] a 1021 Elo nella classifica di generazione e 996 in quella di editing, con FLUX.2 [dev] fissato come ancora a 1000 su entrambe. Il tier image ha un giorno di vita e non è misurato.
![Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present](https://cms.orcarouter.ai/api/media/file/4-1496.png)
Scegliere tra i nomi
La scelta riguarda meno quale modello sia migliore e più in quale dei tre livelli rilasciati rientra il vostro problema.
Se hai bisogno di fotogrammi fissi con controllo spaziale, FLUX 3 Image è l'unico tier dotato di un linguaggio di coordinate, e a 0,048 $ per immagine a 1K è abbastanza economico da poterlo valutare sul serio invece di discuterne. Parti da lì, metti alla prova l'affermazione "di solito restano identici" sui tuoi fotogrammi, e osserva il salto di 6,07× nel listino da 2K a 4K quando dimensioni i batch.
Se hai bisogno di movimento, FLUX 3 Video è un prodotto maturo a consumo, con livelli di risoluzione fino a UHD e clip da 20 secondi dotate di audio sincronizzato. Confrontalo con i modelli che è pensato per sostituire, non con il livello immagine: non sono alternative l'uno all'altro.
Se hai bisogno dei pesi, oggi la risposta è FLUX 3 Action nell'ambito di un accordo di partnership, e altrimenti FLUX.2. Né il tier video né quello image sono scaricabili, e il rilascio aperto del tier image è un'intenzione dichiarata senza una data.
Né FLUX 3 né FLUX 3 Image figurano nel catalogo di OrcaRouter, quindi chiamare l'uno o l'altro significa rivolgersi direttamente a Black Forest Labs. Ciò che un router neutrale rispetto ai fornitori fa guadagnare in una pipeline costruita attorno a questa famiglia è lo strato che circonda la chiamata di generazione: la passata di riscrittura del prompt, il controllo di visione che confronta un render con il brief, il classificatore che smista gli output in accettati e rifiutati. Questi passaggi cambiano molto più spesso di quanto cambi il modello di immagini, e sostituire un fornitore dietro un unico endpoint compatibile con OpenAI — con i prezzi di listino dei fornitori passati senza ricarico, failover automatico quando un backend si degrada e un DSL di routing quando vuoi fissare o ripiegare deliberatamente — è la differenza tra una pipeline che segue il mercato e una che deve essere ridistribuita ogni volta che un modello viene deprecato.
La chiusura onesta è una convenzione di denominazione. Quando qualcuno dice FLUX 3 e ti porge un listino prezzi, intende l'endpoint per le immagini. Quando lo dice e ti porge una scheda tecnica sull'allocazione dei token audio, intende l'annuncio di luglio. Il divario tra quei due documenti è di nove settimane e tre livelli rilasciati, e continua ancora ad allargarsi.
