
GPT-Image-2 vs Flux 3: Porównanie dostępnego modelu z mapą drogową
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
To nie jest zwykły wpis porównujący model z modelem, ponieważ GPT-Image-2 i Flux 3 nie są w tym samym stanie istnienia. GPT-Image-2, wydany 21 kwietnia 2026 roku, jest wywoływalny przez API OpenAI od początku maja i w tym tygodniu zyskał nową możliwość — generowanie obrazów z przezroczystym tłem w API, ogłoszone 20 sierpnia i dostępne już teraz. Flux 3 to multimodalny model bazowy Black Forest Labs, ogłoszony 23 lipca 2026 roku, a warstwa obrazów wciąż nie ma publicznego endpointu, identyfikatora modelu ani cennika w chwili pisania tego tekstu. Jeden z nich można wywołać o 3:00 w nocy z ważnym kluczem; na drugi można się zapisać na listę oczekujących. Użyteczne porównanie nie brzmi zatem „który jest lepszy” — ale co wydany model faktycznie robi dziś, co mapa drogowa obiecuje w przypadku niewydanego oraz jak twórca powinien traktować obiecany model, który ciągle się opóźnia, podczas gdy działający na żywo cały czas się poprawia.
Jedna z nich ma punkt końcowy.
Zacznij od dostępności, bo to ona decyduje o wszystkim innym. Black Forest Labs zaprezentowało Flux 3 23 lipca jako pojedynczy model trenowany wspólnie na przewidywaniu obrazu, wideo, audio i działań robotów, zbudowany na podejściu flow-matching, które laboratorium nazywa Self-Flow. Według doniesień ponad 95% mocy obliczeniowej tego treningu przeznaczono na przewidywanie wideo, co widać po tym, co faktycznie trafiło na rynek: ogólną dostępność osiągnął tylko Flux 3 Video — 4 sierpnia, z płatnym API. Strona modelu w wersji obrazowej nadal nosi etykietę „wkrótce” z formularzem aplikacyjnym, zamiast przycisku „Zacznij” — bez punktu końcowego, bez udokumentowanych parametrów, bez kosztu za obraz i bez benchmarku, który ktokolwiek mógłby uruchomić.
GPT-Image-2 z kolei jest w produkcji od czterech miesięcy. OpenAI udostępniło dostęp do API na początku maja, a identyfikator modelu, gpt-image-2, jest na tyle stabilny, że współistnieje z nim przypięta migawka, gpt-image-2-2026-04-21. Jest obecnie najlepszym modelem text-to-image na obu głównych niezależnych listach rankingowych — 1381 Elo na liście rankingowej Arena (wersja średnia) i 1369 Elo dla wersji wysokiej na Artificial Analysis — a także renderuje wielojęzyczny tekst, w tym CJK, opiera generowanie na wyszukiwaniu w sieci i tworzy obrazy o rozdzielczości do 4K. Cztery miesiące ruchu produkcyjnego to różnica między deklaracją a udokumentowanym dorobkiem.
Najnowsza zmiana po stronie GPT-Image-2
Wydarzenie, które sprawia, że to zestawienie jest na czasie, nie ma nic wspólnego z Flux 3. 20 sierpnia OpenAI udostępniło w Images API podgląd z przezroczystym tłem dla GPT-Image-2: ustaw tło na „transparent”, a endpoint zwróci plik PNG lub WebP z prawdziwym kanałem alfa, z wyciętym obiektem, gotowy do komponowania. To funkcja skierowana wprost do pracy produkcyjnej, którą jako atut oferuje też roadmapa Flux 3 image — zdjęcia produktowe, ikony, materiały marketingowe — i trafiła do już działającego endpointu jako parametr, a nie jako nowy model. Tak więc gdy świat czeka na endpoint Flux 3 image, który wciąż pokazuje „coming soon”, dotychczasowy lider właśnie zamknął jedną z luk, które trzymały go z dala od potoków kompozytowania.
{{1}}Ta funkcjonalność jest dostępna wyłącznie przez API — nie ma przełącznika w ChatGPT — i jest parametrem, a nie nowym produktem.{{/1}} {{2}}Oba punkty końcowe Images API, generowanie i edycja, przyjmują pole background z wartościami "transparent", "opaque" i "auto" (wartość domyślna, gdy decyzję podejmuje model).{{/2}} {{3}}Kanał alfa jest zachowywany tylko w plikach wyjściowych PNG lub WebP, dlatego żądanie jawnie wymusza format wyjściowy.{{/3}} {{4}}Dokumentacja API samego OpenAI wciąż oznacza obsługę przezroczystości dla gpt-image-2 i jego migawki gpt-image-2-2026-04-21 jako "in preview" — to etykieta dostawcy, a nie ogłoszenie pełnej dostępności — a zgodnie z jej zaleceniem prompt powinien być wolny od jakiegokolwiek opisanego tła, aby model faktycznie respektował żądanie przezroczystości.{{/4}} {{5}}Żadnego nowego punktu końcowego, żadnego nowego identyfikatora modelu, żadnej osobnej karty cenowej: to samo wywołanie gpt-image-2, które zwracało nieprzezroczysty PNG, teraz zwraca wycięty obiekt.{{/5}}

Co obiecuje obraz Flux 3, a co faktycznie jest dostarczane
{{1}}Arkusz specyfikacji poziomu obrazowego Flux 3 to mapa drogowa producenta, więc należy go tak traktować.{{/1}} {{2}}Black Forest Labs obiecało syntezę i edycję obrazów w różnych stylach i rozdzielczościach, lepszą obsługę złożonych promptów, dokładne wielojęzyczne renderowanie tekstu, transfer stylu zero-shot z obrazów referencyjnych, spójność postaci i marki bez dostrajania oraz nieniszczącą edycję zachowującą teksturę i oświetlenie.{{/2}} {{3}}To właściwe rzeczy, które należy obiecywać {{/3}}—{{4}}to dokładnie te funkcje, którymi rywalizują obecni liderzy rynku—{{/4}} {{5}}ale żadna z nich nie jest dziś testowalna {{/5}}{{6}}ponieważ żadna z nich nie ma punktu końcowego.{{/6}}
Z BFL faktycznie wywołać można warstwę wideo i starszą linię obrazów FLUX. Flux 3 Video kosztuje 0,17 USD za sekundę w HD i 0,29 USD za sekundę w FHD dla pełnych renderów, a tryb szkicu to 0,06 USD za sekundę. Jej własne raportowane wyniki to 1 135 Elo dla tekstu na wideo i 1 051 dla obrazu na wideo, a także zwycięstwa w preferencjach nad Luma Ray 3.2, Runway Gen-4.5, Grok Imagine Video i Kling v3 Pro — wszystko to dane producenta bez niezależnego potwierdzenia, i żadne z nich nie przekłada się na warstwę obrazu. Dla obrazów statycznych obecna oferta BFL pozostaje linią FLUX.2, która osiąga 1 226 Elo na tej samej tablicy wyników Artificial Analysis, na której prowadzi GPT-Image-2 z 1 369 Elo. Ta różnica to praktyczny kontekst dla „Flux 3 image is coming”: dzisiejsze API obrazów BFL jest około 140 Elo za API OpenAI, a obiecany model jest tym, czego BFL potrzebuje, aby tę różnicę zniwelować.

Cennik: istnieje tylko jedna prawdziwa karta cenowa.
Nie ma ceny obrazu Flux 3, ponieważ nie ma produktu obrazowego Flux 3. Jedyne opublikowane liczby to stawki tokenów GPT-Image-2: 5 USD za milion tokenów wejściowych tekstu, 8 USD za milion tokenów wejściowych obrazu oraz 30 USD za milion tokenów wyjściowych obrazu, przy czym Batch API kosztuje mniej więcej połowę przy realizacji do 24 godzin. OpenAI nie publikuje liczby tokenów na obraz, więc kwoty na obraz są przeliczeniami, a nie wycenami: około 0,006 USD za obraz o niskiej jakości 1024×1024, około 0,05 USD za obraz średniej jakości, około 0,21 USD przy wysokiej jakości i do około 0,41 USD za render w wysokiej rozdzielczości 4K. Dla porównania: to jedyna realna strona zestawienia; kolumna obrazów Flux 3 pozostaje pustą komórką.

Co powinien zrobić budowniczy z obiecanym modelem
Rozsądna postawa, gdy model konkurencji wciąż się opóźnia, to budować na tym, co już istnieje, i uczynić przyszłość zmianą konfiguracji, a nie przebudową architektury. {{1}}GPT-Image-2 można już dziś kierować przez OrcaRouter — jeden klucz API, cena listowa OpenAI przenoszona z zerową marżą, automatyczne przełączanie awaryjne między dostawcami{{/1}} — {{2}}dlatego potok generujący zasoby tym modelem będzie mógł później skierować ten sam endpoint do API Flux 3 image, gdy tylko taki endpoint faktycznie powstanie, i przekierować na niego część ruchu za pomocą DSL routingu, bez modyfikowania kodu wywołującego{{/2}}. {{3}}Dostajesz już dziś działający model, a gdy ten obiecany w końcu trafi na rynek, ocenisz go względem działającej bazy odniesienia, a nie względem komunikatu prasowego. Czekanie nic cię nie kosztuje; budowanie na niczym podczas czekania kosztuje cię wszystko{{/3}}.
Ten werdykt jest z założenia jednostronny. Jeśli w tym kwartale potrzebujesz generowania obrazów, GPT-Image-2 to właściwy wybór i nie ma co do tego wątpliwości — to numer jeden w niezależnych rankingach, właśnie dodał w API obsługę przezroczystego tła, ma publiczne API i stabilną cenę. Flux 3 image to powód, by mieć oko na Black Forest Labs, a nie powód, by wstrzymywać projekt. Śledź otwarcie wczesnego dostępu i pierwsze niezależne benchmarki; gdy tylko pojawi się endpoint, porównanie z tego wpisu stanie się testem, który naprawdę możesz uruchomić.
