
FLUX 3 Image vs Bernini-Diffusers-v2: En prissatt endpoint mot ett nedladdningsbart repo
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
FLUX 3 Image och Bernini-Diffusers-v2 är båda bildmodeller som du kan få tillgång till i sin helhet idag, och ingen av dem är en produkt du kan hyra. FLUX 3 Image lanserades den 1 oktober 2026 på api.bfl.ai/v1/flux-3-image med en publicerad prislista och ingen publicerad poäng. Bernini-Diffusers-v2 släpptes på Hugging Face den 13 augusti 2026 under Apache-2.0 med publicerade poäng och inget sätt att anropa den förutom dina egna GPU:er. Den ena kommer med en faktura. Den andra kommer med en pinnad Python-version.
Den uppdelningen är hela jämförelsen, och det är värt att vara precis om den, eftersom den vanliga ramen "hostad vs öppna vikter" inte passar här. Bernini är inte en modell med öppna vikter som du bara kan släppa in i en befintlig inferensstack. Det är ett tvåstegssystem – en Qwen2.5-VL-7B-planerare framför en Wan2.2-T2V-A14B-diffusionsavkodare – och dess v2-släpp är en träningsschemarättning, inte en ny kapacitetsnivå. FLUX 3 Image är en enda slutpunkt med en ovanligt stor mängd kontrollmöjligheter påkruvade: rumslig grundning, ett koordinatnät på 0–1000 och ruta-avgränsad redigering där du anger vilka regioner som ska finnas kvar. Olika typer av saker.
Vad var och en faktiskt är
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — ByteDance-stacken med planerare och renderare, pushad till Hugging Face den 13 augusti 2026 utan något medföljande tillkännagivande. Repositoriet är taggat image-text-to-video och är beroende av diffusers. Listade uppgifter: text-till-bild, bild-till-bild, text-till-video, video-till-video, referens-till-video och referens-till-bild. Det finns ingen hostad inferens och ingen prislista — vägen för att komma igång är hf download och en Gradio-app.
• Distributionsgapet — FLUX 3 Image är en mätarbaserad tjänst som du anropar. Bernini är ett kodförråd som du driftsätter. Innan någon kvalitetsfråga är värd att ställas kräver en av dessa en GPU av Hopper-klass och den andra ett kreditkort.
Licensiering är där dessa två skiljer sig åt som allra mest.
Bernini-Diffusers-v2 är Apache-2.0 på repositorienivå. För en självhostad pipeline spelar det enorm roll: ingen mätning per bild, inget förhandlat kommersiellt avtal, ingen användningsrapportering. Du betalar för el och schemaläggningstid, och marginalkostnaden för den tiotusende bilden är densamma som för den första.
FLUX 3 Image har inte öppna vikter, och Black Forest Labs är tydliga med att detta är tillfälligt. Kommersiella vikter finns tillgängliga idag under en förhandlad BFL-licens, och den publika lanseringen med öppna vikter beskrivs komma under de kommande veckorna. Det är ett löfte med en form men inget datum, och det är det enskilt viktigaste på den här sidan att dubbelkolla snarare än att anta. Om du väljer en bildstack för de kommande två åren väger förmodligen licensfrågan tyngre än Elo-frågan — men bara om du är beredd att själv driva en tvåstegs videonativ diffusionsstack.
Styryta: avgränsningsrutor kontra promptförbättring
Det här är den del av matchningen som är genuint intressant, eftersom de två modellerna löser "få det att gå exakt dit" på helt olika sätt.
FLUX 3 Image tar en JSON-array som läggs till i prompten. Koordinaterna löper på ett 0–1000-rutnät på båda axlarna, och varje box skrivs som [top, left, bottom, right]. Du tillhandahåller en tabell med element, vart och ett med ett id, en bbox och en desc, plus en global caption som refererar till dessa id:n vid namn. I BFL:s eget exempel läses id:na som animal_1 och silhouette_1; captionen refererar till dem direkt. Ovanför genereringsanropet finns grounding, på som standard, vilket kör en webb- och bildsökning före genereringen.
FLUX 3 Image utökar sedan samma koordinatsystem till redigering. I stället för att skicka en mask skickar du en uppsättning rutbaserade operationer: Behåll (källruta till samma ruta, med källa från ref_image_0), Flytta (källruta till en ny målruta), Ny (ingen källa, målruta genererad från en beskrivning — lägg till, ersätt eller färga om) och Ta bort (källruta till ett nullmål). Flera operationer går i en och samma förfrågan.
Förbehållet spelar roll. BFL:s dokumentation säger att pixlar utanför de redigerade boxarna "vanligtvis förblir identiska". Vanligtvis. Det är ett bevarandepåstående med ett förbehåll inbyggt i formuleringen, vilket är det ärliga sättet att leverera ett sådant, och också anledningen till att du bör testa på dina egna bildrutor i stället för att lita på en demo.
Bernini har inget motsvarande användarvänt koordinatspråk. Dess referensstyrda redigering förbättrades i v2 på grund av en träningsändring – connector-modulen värmas upp i tusentals steg innan samträning börjar – och ByteDance rapporterar att ändringen visar sig som bättre referensstyrd redigering och OpenS2V-prestanda. Det är en kvalitetsfix i en befintlig arkitektur, inte ett nytt kontrollgränssnitt. Om ditt arbetsflöde är beroende av att tala om för modellen vilken rektangel som ska lämnas ifred, är det bara ett av dessa två svar som besvarar frågan.

Vad siffrorna stöder och inte stöder
Bernini-Diffusers-v2:s sida innehåller en tabell med sju mätvärden som jämför v2 med v1, och varje siffra i den är leverantörsrapporterad. Riktningen är blandad, vilket är värt att säga högt:
• Upp — OpenS2V 63,83 (från 62,30), VBench 84,46 (från 84,37), Bernini-rv2v 3,55 (från 3,48).
• Platt — EditVerse 8.02, oförändrad, och Bernini-v2v 3.49, oförändrad.
• Nere — OpenVE 3.96, från 4.03.
Sidan anger också att v2 ligger i det första skiktet bland ledande kommersiella modeller med sluten källkod i en intern blind mänsklig parvis arena. Det går inte att verifiera utanför ByteDance och bör läsas som ett marknadsföringspåstående, inte som en mätning. De tre verkliga rörelserna är de som listas ovan, och de är självrapporterade mot samma labbs egen v1.
FLUX 3 Image har inga siffror alls ännu. Artificial Analysiss text-till-bild-tavla och dess redigeringstavla kontrollerades båda den 1 oktober och 2026-10-02 och innehåller ingen rad för FLUX 3 Image – BFL-posterna på dessa tavlor slutar vid FLUX.2-raden, där FLUX.2 [max] ligger på 1021 Elo på genereringstavlan och 996 på redigeringstavlan. FLUX.2 [dev] förankrar båda tavlorna på exakt 1000. Så det ärliga uttalandet om FLUX 3 Image-kvalitet just nu är att ingen utanför Black Forest Labs har publicerat en poäng för den, och den närmaste tillgängliga referenspunkten är generationen före den.
Den asymmetrin är den praktiska fällan i den här jämförelsen. Berninis siffror är leverantörsdrivna, men de finns och de är riktningsgivande. FLUX 3 Images saknas. Frånvaro är inte misslyckande – modellen är en dag gammal – men det innebär att det enda beviset för FLUX 3 Images redigeringspåstående för närvarande kommer från företaget som säljer den.
Prissidan, som inte alls är symmetrisk
FLUX 3 Image prissätts per bild efter upplösningsnivå, och leverantörens prislista listar fem av dem:
• 768sq — $0.041 i listpris, $0.0205 under lanseringsfönstret.
• 1K (standard) — 0,048 $ listpris, 0,024 $ erbjudandepris.
• 1,5K — $0,07 listpris, $0,035 erbjudandepris.
• 2K — 0,10 $ i listpris, 0,05 $ i erbjudande.
• 4K — $0.607 ordinarie pris, $0.3035 på erbjudande.

Referensbilder och promptlängd ingår utan extra kostnad, och avvisade, misslyckade eller modererade förfrågningar faktureras inte – vilket spelar större roll än vanligt här, eftersom ett 4K-anrop är långsamt och frestelsen att överge en förfrågan är verklig. Lanseringspriset gäller från 15:00 UTC den 1 oktober till 15:00 UTC den 8 oktober. Listprishoppet från 2K till 4K är en faktor på 6,07, långt brantare än förhållandet i antal pixlar, så den upplösningsnivå du väljer är det största kostnadsbeslutet i hela API:et.
Nivåerna följer en pixelbudget snarare än en fast bildruta. BFL:s exempelutdata är 5456 × 3072, ungefär 16,8 megapixlar, jämfört med UHD 2160p på 8,3 megapixlar — så "4K" betecknar här en budget, och utdatamåtten avrundas till multiplar av 16, där det faktiska värdet returneras som output_mp.
Berninis pris är noll per bild och icke-noll per timme. Åtta GPU:er för sekvensparallell inferens, Hopper-klassig hårdvara rekommenderas, Python 3.11.2 med PyTorch 2.7.1 och CUDA 12.6. Brytpunkten mot 0,048 USD per bild vid 1K infaller någonstans vid tusentals bilder per månad, helt beroende på vad du betalar för beräkningskraft – och det är ett verkligt tal, inte ett retoriskt. Om du redan kör inferensinfrastruktur är Berninis marginella bild nästan gratis. Om du inte gör det är FLUX 3 Image-slutpunkten dramatiskt mycket billigare än att sätta upp en tvåstegs diffusionsstack.
Routing: ingen av dessa finns i vår katalog
Värt att säga rakt ut, eftersom det är den typen av påstående som snabbt blir inaktuellt. OrcaRouter dirigerar inte FLUX 3 Image, och det dirigerar inte Bernini-Diffusers-v2. Att anropa FLUX 3 Image innebär att anropa Black Forest Labs direkt på deras egen slutpunkt. Att anropa Bernini innebär att man själv måste driftsätta det.
Vad en OpenAI-kompatibel router faktiskt är till för, i en pipeline som den här, är allt på båda sidor om bildanropet. Ett steg för bildbeskrivning eller prompt-omskrivning, en visionsmodell som kontrollerar renderingen mot briefen, en videomodell som animerar den godkända stillbilden, en liten textmodell som klassificerar utdata – det är stegen där möjligheten att byta leverantör med en enda sträng, på en enda nyckel, och få förfrågningar att automatiskt växla över när en är degraderad, tar bort en hel del underhåll. OrcaRouter förmedlar leverantörens listpris vidare utan påslag, så när en leverantör sänker ett pris är ändringen live samma dag i stället för att vänta på att en återförsäljare sätter nytt pris, och routnings-DSL:en låter dig låsa en specifik modell eller definiera reservordning utan att röra applikationskoden. Inget av det gör FLUX 3 Image routbar. Det betyder bara att resten av pipelinen inte behöver bry sig om vilken modell som producerade stillbilden.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
Vilken ska man bygga vidare på?
Tre frågor skiljer dessa åt på ett tydligt sätt, och de har inget gemensamt svar.
Behöver du kontrollera var saker hamnar? FLUX 3 Image är den enda av de två med ett koordinatspråk, och dess boxbegränsade redigeringsoperationer — behåll, flytta, lägg till, ta bort — är ett genuint annat gränssnitt än redigering med textinstruktioner. Om ditt arbete är compositing, layout eller produktbilder där regioner måste överleva, är det avgörande och förbehållet i "vanligtvis förblir identiska" är något man testar snarare än antar.
Behöver du veta hur bra den är innan du bestämmer dig? Bernini har siffror, alla rapporterade av leverantören, och en blandad utveckling. FLUX 3 Image har inga. Om du inte kan göra din egen utvärdering väljer du mellan en modell med mätvärden och en utan, och den med mätvärden är den äldre arkitekturen.
Kan du driva en tvåstegs diffusionsstack? Det är den verkliga grinden för Bernini. En Qwen2.5-VL-7B-planerare som matar en Wan2.2-T2V-A14B-avkodare, på Hopper-GPU:er, med en hook för promptförstärkning som pekar på en OpenAI-kompatibel endpoint. Licensen är tillåtande och beräkningsnotan är det inte. Om du inte kan det är frågan irrelevant och $0,048 per bild är svaret.
Det enda som skulle förändra den här sidan snabbast är om BFL öppnar vikterna för FLUX 3 Image, vilket företaget har sagt är veckor bort. Det gör licensasymmetrin från avgörande till mild och lämnar skillnaden i kontroll-yta som den faktiska jämförelsen. Fram till dess är den korrekta sammanfattningen att detta är två bra modeller med motsatta distributionsmodeller, och valet görs utifrån licensiering och kontroll långt innan det görs utifrån kvalitet.
