Hero-titelkort för GPT-Image-2 vs Flux 3, rubrik 'GPT-Image-2 vs Flux 3' med underrubrik 'En live-modell, en färdplan', två kort som visar GPT-Image-2 med ett märke 'Publikt API sedan maj 2026' och Flux 3 med ett märke 'Bildnivå: kommer snart', OrcaRouter-logotyp i nedre högra hörnet.
Guides & Insights

GPT-Image-2 vs Flux 3: Att jämföra en live-modell med en färdplan

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det här är inte ett vanligt modell-mot-modell-inlägg, eftersom GPT-Image-2 och Flux 3 inte befinner sig i samma tillstånd av existens. GPT-Image-2 släpptes den 21 april 2026, har kunnat anropas via Ope​nAI:s API sedan början av maj, och fick en ny funktion den här veckan — generering av bilder med transparent bakgrund i API:et, tillkännagiven den 20 augusti och tillgänglig nu. Flux 3 är den multimodala grundmodellen från Black Forest Labs, tillkännagiven den 23 juli 2026, och bilddelen har fortfarande ingen publik slutpunkt, inget modell-ID och ingen prislista i skrivande stund. Den ena av dessa kan du anropa klockan 3 på natten med en giltig nyckel; för den andra kan du anmäla dig till en väntelista. Den användbara jämförelsen är alltså inte "vilken är bättre" — utan vad den släppta modellen faktiskt gör idag, vad färdplanen lovar för den som inte släppts ännu, och hur en utvecklare bör behandla en utlovad modell som fortsätter att skjutas upp medan en live-modell ständigt förbättras.

En av dessa har en slutpunkt.

Börja med tillgänglighet, eftersom det avgör allt annat. Black Forest Labs presenterade Flux 3 den 23 juli som en enda modell tränad gemensamt på bild-, video-, ljud- och robotaktionsprediktion, byggd på en flow-matching-metod som laboratoriet kallar Self-Flow. Över 95 % av den träningsberäkningen rapporterades gå till videoprediktion, vilket syns i det som faktiskt levererades: endast Flux 3 Video nådde allmän tillgänglighet den 4 augusti, med ett prissatt API. Bildnivåns modellsida bär fortfarande en "kommer snart"-etikett med ett ansökningsformulär, inte en kom igång-knapp – ingen slutpunkt, inga dokumenterade parametrar, ingen kostnad per bild och inget riktmärke någon kan köra.

GPT-Image-2, däremot, har varit i produktion i fyra månader. Ope​nAI öppnade API-åtkomst i början av maj, och modellens identifierare, gpt-image-2, är tillräckligt stabil för att en fast ögonblicksbild, gpt-image-2-2026-04-21, samexisterar med den. Den är för närvarande den bästa text-till-bild-modellen på båda stora oberoende listorna — 1 381 Elo på Arenas text-till-bild-ledartavla (mediumbygget) och 1 369 Elo för högbygget på Artificial Analysis — och den renderar flerspråkig text inklusive CJK, förankrar genereringen i webbsökning och producerar upp till 4K-utdata. Fyra månaders produktionstrafik är skillnaden mellan ett påstående och en bevisad meritlista.

Den senaste ändringen på GPT-Image-2-sidan.

Händelsen som gör denna matchning aktuell har inget med Flux 3 att göra. Den 20 augusti öppnade OpenAI en förhandsvisning med genomskinlig bakgrund för GPT-Image-2 i Images API: ställ in bakgrunden på "transparent" så returnerar slutpunkten en PNG eller WebP med en riktig alfakanal, färdig att kompositeras. Det är en funktion som riktar sig rakt mot det produktionsarbete som även Flux 3 image:s färdplan säljer in — produktbilder, ikoner, marknadsföringsmaterial — och den kom som en parameter på en redan live slutpunkt snarare än en ny modell. Så medan världen väntar på en Flux 3 image-slutpunkt som fortfarande säger "kommer snart", har den etablerade aktören just täppt till en av de luckor som höll den utanför compositing-pipelines.

Funktionen är enbart tillgänglig via API — det finns ingen ChatGPT-växel — och det är en parameter, inte en ny produkt. {{1}}Båda Images API-slutpunkterna, generering och redigering, accepterar ett bakgrundsfält med värdena "transparent", "opaque" och "auto" (standardvärdet, där modellen bestämmer).{{/1}} Alfakanalen överlever endast i PNG- eller WebP-utdata, så anger begäran utdataformatet uttryckligen. Ope​nAI:s egen API-referens markerar fortfarande transparensstödet för gpt-image-2 och dess gpt-image-2-2026-04-21-snapshot som "i förhandsvisning" — det är leverantörens etikett, inte ett lanseringstillkännagivande — och dess vägledning är att hålla prompten fri från alla beskrivna bakgrunder så att modellen faktiskt respekterar begäran om transparens. {{2}}Ingen ny slutpunkt, inget nytt modell-ID, ingen separat prislista: samma gpt-image-2-anrop som tidigare returnerade en ogenomskinlig PNG returnerar nu ett utklipp.{{/2}}

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Vad Flux 3 image lovar, och vad som faktiskt levereras

Specifikationen för Flux 3-bildnivån är en leverantörs färdplan, så behandla den som en sådan. Black Forest Labs har lovat bildsyntes och redigering över stilar och upplösningar, förbättrad hantering av komplexa promptar, högnoggrann flerspråkig textåtergivning, zero-shot-stilöverföring från referensbilder, karaktärs- och varumärkeskonsistens utan finjustering, och icke-destruktiv redigering som bevarar textur och belysning. Det är rätt saker att lova – de är exakt de funktioner som dagens marknadsledare konkurrerar på – men ingen av dem är testbar idag eftersom ingen av dem har en slutpunkt.

Det som faktiskt går att anropa från BFL är videonivån och den äldre FLUX-bildlinjen. Flux 3 Video kostar $0,17 per sekund i HD och $0,29 per sekund i FHD för fullständiga renderingar, med ett utkastläge på $0,06 per sekund. Dess egna rapporterade siffror är 1 135 i Elo för text-till-video och 1 051 för bild-till-video, samt preferensvinster över Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video och Kling v3 Pro — allt leverantörsrapporterat och ej oberoende verifierat, och inget av det överförs till bildnivån ändå. För stillbilder är nuvarande BFL-utbud fortfarande FLUX.2-linjen, som ligger på 1 226 i Elo på samma Artificial Analysis-tavla där GPT-Image-2 leder på 1 369. Det gapet är den praktiska kontexten för "Flux 3 image är på väg": dagens BFL-bild-API ligger ungefär 140 Elo efter Ope​nAI:s, och den utlovade modellen är vad BFL behöver för att sluta det.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Prissättning: det finns endast ett riktigt priskort.

Det finns inget Flux 3-bildpris, eftersom det inte finns någon Flux 3-bildprodukt. De enda publicerade siffrorna är GPT-Image-2:s tokenpriser: 5 dollar per miljon textinmatningstokens, 8 dollar per miljon bildinmatningstokens och 30 dollar per miljon bildutmatningstokens, med Batch API som körs på ungefär halva priset för upp till 24 timmars behandlingstid. Ope​nAI publicerar inte tokens-per-bild, så siffror per bild är omvandlingar, inte offerter: ungefär 0,006 dollar för en 1024×1024-bild med låg kvalitet, cirka 0,05 dollar för en medelhög, cirka 0,21 dollar vid hög kvalitet och upp till cirka 0,41 dollar för en 4K-högrender. Som jämförelse är det den sida av balansräkningen som är verklig; Flux 3-bildkolumnen är en tom cell.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Vad en byggare bör göra med en utlovad modell

Det sunda förhållningssättet när en konkurrents modell fortsätter att försenas är att bygga vidare på det som finns och göra framtiden till en konfigurationsändring snarare än en omarkitektur. GPT-Image-2 kan dirigeras idag via OrcaRouter — en API-nyckel, OpenAI:s listpris vidarebefordrat med 0 % påslag, automatisk failover mellan leverantörer — så en pipeline som genererar tillgångar med den kan senare låta samma endpoint peka mot Flux 3 images API den dag en endpoint faktiskt finns, och dirigera en del av trafiken till den med routing-DSL:et utan att röra anropskoden. Du får den levererade modellen nu, och när den utlovade landar utvärderar du den mot en fungerande baslinje istället för mot ett pressmeddelande. Väntan kostar dig ingenting; att bygga på ingenting medan du väntar kostar dig allt.

Slutsatsen är medvetet ensidig. Om du behöver bildgenerering det här kvartalet, är GPT-Image-2 valet, och det råder ingen tvekan — den är den oberoende ettan, den har precis lagt till utdata med transparent bakgrund i API:t och den har ett offentligt API och ett stabilt pris. Flux 3 image är en anledning att hålla ett öga på Black Forest Labs, inte en anledning att avvakta med ett projekt. Följ öppnandet av early access och de första oberoende benchmarkresultaten; så fort en endpoint finns blir jämförelsen i det här inlägget ett test du faktiskt kan köra.