
FLUX 3 Image vs Bernini-Diffusers-v2: un endpoint a pagamento contro un repo scaricabile
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 223 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
FLUX 3 Image e Bernini-Diffusers-v2 sono entrambi modelli per immagini che puoi ottenere per intero già oggi, e nessuno dei due è un prodotto che puoi noleggiare. FLUX 3 Image è andato live il 1º ottobre 2026 su api.bfl.ai/v1/flux-3-image con una scheda tariffaria pubblicata e nessun punteggio pubblicato. Bernini-Diffusers-v2 è approdato su Hugging Face il 13 agosto 2026 sotto Apache-2.0 con punteggi pubblicati e nessun modo di richiamarlo se non le tue GPU. Uno arriva con una fattura. L'altro arriva con un pin di versione di Python.
Questa divisione è l'intero confronto, e vale la pena essere precisi al riguardo, perché la solita contrapposizione «hosted vs open weights» qui non si adatta. Bernini non è un modello open-weights che puoi inserire in uno stack di inferenza esistente. È un sistema a due stadi — un planner Qwen2.5-VL-7B davanti a un decoder di diffusione Wan2.2-T2V-A14B — e la sua release v2 è una correzione del programma di addestramento, non un nuovo livello di capacità. FLUX 3 Image è un singolo endpoint con una quantità insolita di superficie di controllo avvitata sopra: spatial grounding, una griglia di coordinate 0–1000 e un editing circoscritto a riquadri in cui indichi quali regioni sopravvivono. Cose di forma diversa.
Cosa sia in realtà ognuno
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — lo stack planner-plus-renderer di ByteDance, caricato su Hugging Face il 13 agosto 2026 senza alcun annuncio di accompagnamento. Il repository è taggato image-text-to-video e dipende da diffusers. Attività elencate: da testo a immagine, da immagine a immagine, da testo a video, da video a video, da riferimento a video e da riferimento a immagine. Non c'è alcuna inferenza ospitata né alcun listino prezzi — il percorso per iniziare è hf download e un'app Gradio.
• Il divario distributivo — FLUX 3 Image è un servizio a consumo che si invoca. Bernini è un repository che si installa. Prima che valga la pena porsi qualsiasi domanda sulla qualità, uno dei due richiede una GPU di classe Hopper e l'altro richiede una carta di credito.
È sul licensing che questi due divergono maggiormente
Bernini-Diffusers-v2 è Apache-2.0 a livello di repository. Per una pipeline self-hosted questo conta enormemente: nessun contatore per immagine, nessun accordo commerciale negoziato, nessuna rendicontazione dell'utilizzo. Paghi l'elettricità e il tempo dello scheduler, e il costo marginale della decimillesima immagine è identico a quello della prima.
FLUX 3 Image non è a pesi aperti, e Black Forest Labs è esplicita sul fatto che ciò è temporaneo. I pesi commerciali sono disponibili oggi con una licenza BFL negoziata, e il rilascio pubblico dei pesi aperti è descritto come previsto nelle prossime settimane. È una promessa con una forma ma senza data, ed è la cosa più importante in questa pagina da ricontrollare invece che dare per scontata. Se stai scegliendo uno stack di immagini per i prossimi due anni, la questione della licenza probabilmente supera quella dell'Elo — ma solo se sei pronto a gestire tu stesso uno stack di diffusione video-native a due stadi.
Superficie di controllo: bounding box rispetto al potenziamento del prompt
Questa è la parte del confronto che è davvero interessante, perché i due modelli risolvono "farlo andare esattamente lì" in modi completamente diversi.
FLUX 3 Image accetta un array JSON aggiunto al prompt. Le coordinate seguono una griglia 0–1000 su entrambi gli assi, e ogni box è scritto come [alto, sinistra, basso, destra]. Fornisci una tabella di elementi, ciascuno con un id, un bbox e una desc, più una didascalia globale che cita quegli id per nome. Nell'esempio di BFL stesso gli id si presentano come animal_1 e silhouette_1; la didascalia vi fa riferimento direttamente. Sopra la chiamata di generazione c'è grounding, attivo per impostazione predefinita, che esegue una ricerca web e di immagini prima di generare.
FLUX 3 Image estende poi lo stesso sistema di coordinate all'editing. Invece di inviare una maschera, invii una serie di operazioni con ambito di riquadro: Mantieni (dal riquadro di origine allo stesso riquadro, con origine da ref_image_0), Sposta (dal riquadro di origine a un nuovo riquadro di destinazione), Nuovo (nessuna origine, riquadro di destinazione generato da una descrizione — aggiungere, sostituire o ricolorare) e Rimuovi (dal riquadro di origine a una destinazione nulla). Più operazioni vanno in un'unica richiesta.
La precisazione è importante. La documentazione di BFL dice che i pixel al di fuori delle caselle modificate "di solito rimangono identici". Di solito. È un'affermazione di conservazione con una cautela incorporata nella formulazione, che è il modo onesto di presentarla e anche il motivo per cui dovresti fare test sui tuoi fotogrammi invece di fidarti di una demo.
Bernini non ha un linguaggio di coordinate equivalente rivolto all'utente. Il suo editing guidato da riferimento è migliorato nella v2 grazie a un cambiamento nell'addestramento — il modulo connettore viene riscaldato per migliaia di passi prima che inizi il co-addestramento — e ByteDance riferisce che tale cambiamento si manifesta come un editing guidato da riferimento migliore e prestazioni OpenS2V migliori. È una correzione di qualità all'interno di un'architettura esistente, non una nuova interfaccia di controllo. Se il tuo flusso di lavoro dipende dal dire al modello quale rettangolo lasciare in pace, solo una di queste due risposte risponde alla domanda.

Cosa i numeri supportano e cosa non supportano
La pagina di Bernini-Diffusers-v2 presenta una tabella a sette metriche che confronta la v2 con la v1, e ogni cifra riportata è dichiarata dal fornitore. La direzione è mista, cosa che vale la pena dire ad alta voce:
• In aumento — OpenS2V 63,83 (da 62,30), VBench 84,46 (da 84,37), Bernini-rv2v 3,55 (da 3,48).
• Flat — EditVerse 8.02, invariato, e Bernini-v2v 3.49, invariato.
• Non attivo — OpenVE 3.96, da 4.03.
La pagina afferma inoltre che v2 si colloca nel primo livello tra i principali modelli commerciali a codice chiuso in un'arena interna di confronti a coppie in cieco condotti da esseri umani. Ciò non è verificabile dall'esterno di ByteDance e va letto come un'affermazione di marketing, non come una misurazione. I tre reali movimenti sono quelli elencati sopra, e sono autodichiarati rispetto al v1 dello stesso laboratorio.
FLUX 3 Image non ha ancora alcun numero. La board text-to-image di Artificial Analysis e la sua board di editing sono state entrambe controllate il 1° ottobre e il 2026-10-02 e non riportano alcuna riga FLUX 3 Image — le voci BFL su quelle board si fermano alla riga FLUX.2, dove FLUX.2 [max] si trova a 1021 Elo sulla board di generazione e a 996 su quella di editing. FLUX.2 [dev] ancora entrambe le board esattamente a 1000. Quindi l'affermazione onesta sulla qualità di FLUX 3 Image in questo momento è che nessuno al di fuori di Black Forest Labs ha pubblicato un punteggio per esso, e il punto di riferimento disponibile più vicino è la generazione che lo precede.
Quell'asimmetria è la trappola pratica in questo confronto. I numeri di Bernini sono forniti dall'azienda, ma esistono e sono indicativi. Quelli di FLUX 3 Image sono assenti. L'assenza non è un fallimento — il modello ha un giorno — ma significa che l'unica prova a sostegno della dichiarazione di FLUX 3 Image sulle capacità di editing proviene attualmente dall'azienda che lo vende.
Il lato del prezzo, che non è affatto simmetrico
FLUX 3 Image è prezzato per immagine in base alla fascia di risoluzione, e il listino prezzi del fornitore ne elenca cinque:
• 768sq — $0,041 di listino, $0,0205 durante la finestra di lancio.
• 1K (predefinito) — $0,048 di listino, $0,024 in offerta.
• 1.5K — $0.07 di listino, $0.035 in offerta.
• 2K — $0,10 di listino, $0,05 in offerta.
• 4K — 0,607 $ di listino, 0,3035 $ in offerta.

Le immagini di riferimento e la lunghezza del prompt sono incluse senza costi aggiuntivi, e le richieste rifiutate, non riuscite o soggette a moderazione non vengono fatturate — il che qui conta più del solito, perché una chiamata 4K è lenta e la tentazione di abbandonare una richiesta è concreta. Il prezzo di lancio va dalle 15:00 UTC del 1° ottobre alle 15:00 UTC dell'8 ottobre. Il salto del prezzo di listino da 2K a 4K è di un fattore 6,07, molto più ripido del rapporto tra il numero di pixel, quindi il livello di risoluzione che scegli è la principale decisione di costo in tutta l'API.
I livelli seguono un budget di pixel anziché un frame fisso. L'output di esempio di BFL è 5456 × 3072, circa 16,8 megapixel, rispetto a UHD 2160p a 8,3 megapixel — quindi "4K" qui indica un budget, e le dimensioni dell'output vengono arrotondate a multipli di 16, con il valore effettivo restituito come output_mp.
Il prezzo di Bernini è zero per immagine e non zero per ora. Otto GPU per l'inferenza con parallelismo di sequenza, si consiglia silicio di classe Hopper, Python 3.11.2 con PyTorch 2.7.1 e CUDA 12.6. Il punto di pareggio rispetto a 0,048 $ per immagine a 1K si colloca nell'ordine delle migliaia di immagini al mese, a seconda interamente di quanto pagate per la potenza di calcolo — ed è un numero reale, non retorico. Se già gestite un'infrastruttura di inferenza, l'immagine marginale di Bernini è quasi gratuita. In caso contrario, l'endpoint FLUX 3 Image è drasticamente più economico che allestire uno stack di diffusione a due stadi.
Routing: nessuno di questi due è nel nostro catalogo
Detto chiaramente, perché è il genere di affermazione che invecchia in fretta. OrcaRouter non instrada FLUX 3 Image, e non instrada Bernini-Diffusers-v2. Chiamare FLUX 3 Image significa chiamare direttamente Black Forest Labs al loro endpoint. Chiamare Bernini significa distribuirlo da soli.
Ciò a cui serve davvero un router compatibile con OpenAI, in una pipeline come questa, è tutto ciò che sta da entrambe le parti della chiamata all'immagine. Una passata di captioning o di riscrittura del prompt, un modello di visione che confronta il render con il brief, un modello video che anima lo still approvato, un piccolo modello testuale che classifica l'output — questi sono i passaggi in cui poter scambiare un provider con una sola stringa, su una sola chiave, e far sì che le richieste passino automaticamente a un altro quando uno è degradato, elimina una quantità non trascurabile di manutenzione. OrcaRouter applica il prezzo di listino dei provider senza alcun ricarico, quindi quando un fornitore taglia una tariffa la modifica è attiva lo stesso giorno invece di aspettare che un rivenditore riprezzi, e il DSL di routing ti permette di fissare un modello specifico o definire l'ordine di fallback senza toccare il codice dell'applicazione. Niente di tutto questo rende FLUX 3 Image instradabile. Significa solo che il resto della pipeline non deve preoccuparsi di quale modello abbia prodotto lo still.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Su quale basarsi
Tre domande separano nettamente questi casi e non hanno una risposta condivisa.
Hai bisogno di controllare dove va ogni cosa? FLUX 3 Image è l'unico dei due con un linguaggio a coordinate, e le sue operazioni di modifica delimitate da riquadri — mantieni, sposta, aggiungi, rimuovi — sono un'interfaccia genuinamente diversa dalla modifica tramite istruzioni testuali. Se il tuo lavoro è il compositing, il layout o le immagini di prodotto in cui le regioni devono sopravvivere, questo è decisivo e la cautela in «di solito rimangono identiche» è qualcosa che verifichi anziché dare per scontato.
Hai bisogno di sapere quanto è valido prima di impegnarti? Bernini ha numeri, tutti dichiarati dal fornitore, e una direzione di marcia mista. FLUX 3 Image non ne ha. Se non puoi eseguire una tua valutazione, stai scegliendo tra un modello misurato e uno non misurato, e quello misurato è l'architettura più vecchia.
Riesci a far funzionare uno stack di diffusione a due stadi? Questo è il vero scoglio per Bernini. Un planner Qwen2.5-VL-7B che alimenta un decoder Wan2.2-T2V-A14B, su GPU Hopper, con un hook prompt-enhancer che punta a un endpoint compatibile con OpenAI. La licenza è permissiva e la bolletta del calcolo non lo è. Se non puoi, la domanda è irrilevante e 0,048 $ per immagine è la risposta.
La cosa che cambierebbe più rapidamente questa pagina è l'apertura da parte di BFL dei pesi di FLUX 3 Image, che l'azienda ha dichiarato essere questione di settimane. Questo trasforma l'asimmetria di licenza da decisiva a lieve e lascia la differenza nella superficie di controllo come il vero confronto. Fino ad allora, il riassunto accurato è che si tratta di due buoni modelli con modelli di distribuzione opposti, e la scelta si fa su licenza e controllo molto prima che sulla qualità.
