Karta hero dla GPT-Image-2 vs Flux 3, nagłówek 'GPT-Image-2 vs Flux 3' z podtytułem 'Jeden działający model, jedna mapa drogowa', dwie karty pokazujące GPT-Image-2 z odznaką 'Publiczne API od maja 2026' oraz Flux 3 z odznaką 'Poziom obrazów: wkrótce', logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-Image-2 vs Flux 3: Porównanie dostępnego modelu z mapą drogową

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

To nie jest zwykły wpis porównujący model z modelem, ponieważ GPT-Image-2 i Flux 3 nie są w tym samym stanie istnienia. GPT-Image-2, wydany 21 kwietnia 2026 roku, jest wywoływalny przez API Ope​nAI od początku maja i w tym tygodniu zyskał nową możliwość — generowanie obrazów z przezroczystym tłem w API, ogłoszone 20 sierpnia i dostępne już teraz. Flux 3 to multimodalny model bazowy Black Forest Labs, ogłoszony 23 lipca 2026 roku, a warstwa obrazów wciąż nie ma publicznego endpointu, identyfikatora modelu ani cennika w chwili pisania tego tekstu. Jeden z nich można wywołać o 3:00 w nocy z ważnym kluczem; na drugi można się zapisać na listę oczekujących. Użyteczne porównanie nie brzmi zatem „który jest lepszy” — ale co wydany model faktycznie robi dziś, co mapa drogowa obiecuje w przypadku niewydanego oraz jak twórca powinien traktować obiecany model, który ciągle się opóźnia, podczas gdy działający na żywo cały czas się poprawia.

Jedna z nich ma punkt końcowy.

Zacznij od dostępności, bo to ona decyduje o wszystkim innym. Black Forest Labs zaprezentowało Flux 3 23 lipca jako pojedynczy model trenowany wspólnie na przewidywaniu obrazu, wideo, audio i działań robotów, zbudowany na podejściu flow-matching, które laboratorium nazywa Self-Flow. Według doniesień ponad 95% mocy obliczeniowej tego treningu przeznaczono na przewidywanie wideo, co widać po tym, co faktycznie trafiło na rynek: ogólną dostępność osiągnął tylko Flux 3 Video — 4 sierpnia, z płatnym API. Strona modelu w wersji obrazowej nadal nosi etykietę „wkrótce” z formularzem aplikacyjnym, zamiast przycisku „Zacznij” — bez punktu końcowego, bez udokumentowanych parametrów, bez kosztu za obraz i bez benchmarku, który ktokolwiek mógłby uruchomić.

GPT-Image-2 z kolei jest w produkcji od czterech miesięcy. OpenAI udostępniło dostęp do API na początku maja, a identyfikator modelu, gpt-image-2, jest na tyle stabilny, że współistnieje z nim przypięta migawka, gpt-image-2-2026-04-21. Jest obecnie najlepszym modelem text-to-image na obu głównych niezależnych listach rankingowych — 1381 Elo na liście rankingowej Arena (wersja średnia) i 1369 Elo dla wersji wysokiej na Artificial Analysis — a także renderuje wielojęzyczny tekst, w tym CJK, opiera generowanie na wyszukiwaniu w sieci i tworzy obrazy o rozdzielczości do 4K. Cztery miesiące ruchu produkcyjnego to różnica między deklaracją a udokumentowanym dorobkiem.

Najnowsza zmiana po stronie GPT-Image-2

Wydarzenie, które sprawia, że to zestawienie jest na czasie, nie ma nic wspólnego z Flux 3. 20 sierpnia Ope​nAI udostępniło w Images API podgląd z przezroczystym tłem dla GPT-Image-2: ustaw tło na „transparent”, a endpoint zwróci plik PNG lub WebP z prawdziwym kanałem alfa, z wyciętym obiektem, gotowy do komponowania. To funkcja skierowana wprost do pracy produkcyjnej, którą jako atut oferuje też roadmapa Flux 3 image — zdjęcia produktowe, ikony, materiały marketingowe — i trafiła do już działającego endpointu jako parametr, a nie jako nowy model. Tak więc gdy świat czeka na endpoint Flux 3 image, który wciąż pokazuje „coming soon”, dotychczasowy lider właśnie zamknął jedną z luk, które trzymały go z dala od potoków kompozytowania.

{{1}}Ta funkcjonalność jest dostępna wyłącznie przez API — nie ma przełącznika w ChatGPT — i jest parametrem, a nie nowym produktem.{{/1}} {{2}}Oba punkty końcowe Images API, generowanie i edycja, przyjmują pole background z wartościami "transparent", "opaque" i "auto" (wartość domyślna, gdy decyzję podejmuje model).{{/2}} {{3}}Kanał alfa jest zachowywany tylko w plikach wyjściowych PNG lub WebP, dlatego żądanie jawnie wymusza format wyjściowy.{{/3}} {{4}}Dokumentacja API samego OpenAI wciąż oznacza obsługę przezroczystości dla gpt-image-2 i jego migawki gpt-image-2-2026-04-21 jako "in preview" — to etykieta dostawcy, a nie ogłoszenie pełnej dostępności — a zgodnie z jej zaleceniem prompt powinien być wolny od jakiegokolwiek opisanego tła, aby model faktycznie respektował żądanie przezroczystości.{{/4}} {{5}}Żadnego nowego punktu końcowego, żadnego nowego identyfikatora modelu, żadnej osobnej karty cenowej: to samo wywołanie gpt-image-2, które zwracało nieprzezroczysty PNG, teraz zwraca wycięty obiekt.{{/5}}

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Co obiecuje obraz Flux 3, a co faktycznie jest dostarczane

{{1}}Arkusz specyfikacji poziomu obrazowego Flux 3 to mapa drogowa producenta, więc należy go tak traktować.{{/1}} {{2}}Black Forest Labs obiecało syntezę i edycję obrazów w różnych stylach i rozdzielczościach, lepszą obsługę złożonych promptów, dokładne wielojęzyczne renderowanie tekstu, transfer stylu zero-shot z obrazów referencyjnych, spójność postaci i marki bez dostrajania oraz nieniszczącą edycję zachowującą teksturę i oświetlenie.{{/2}} {{3}}To właściwe rzeczy, które należy obiecywać {{/3}}—{{4}}to dokładnie te funkcje, którymi rywalizują obecni liderzy rynku—{{/4}} {{5}}ale żadna z nich nie jest dziś testowalna {{/5}}{{6}}ponieważ żadna z nich nie ma punktu końcowego.{{/6}}

Z BFL faktycznie wywołać można warstwę wideo i starszą linię obrazów FLUX. Flux 3 Video kosztuje 0,17 USD za sekundę w HD i 0,29 USD za sekundę w FHD dla pełnych renderów, a tryb szkicu to 0,06 USD za sekundę. Jej własne raportowane wyniki to 1 135 Elo dla tekstu na wideo i 1 051 dla obrazu na wideo, a także zwycięstwa w preferencjach nad Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video i Kling v3 Pro — wszystko to dane producenta bez niezależnego potwierdzenia, i żadne z nich nie przekłada się na warstwę obrazu. Dla obrazów statycznych obecna oferta BFL pozostaje linią FLUX.2, która osiąga 1 226 Elo na tej samej tablicy wyników Artificial Analysis, na której prowadzi GPT-Image-2 z 1 369 Elo. Ta różnica to praktyczny kontekst dla „Flux 3 image is coming”: dzisiejsze API obrazów BFL jest około 140 Elo za API Ope​nAI, a obiecany model jest tym, czego BFL potrzebuje, aby tę różnicę zniwelować.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Cennik: istnieje tylko jedna prawdziwa karta cenowa.

Nie ma ceny obrazu Flux 3, ponieważ nie ma produktu obrazowego Flux 3. Jedyne opublikowane liczby to stawki tokenów GPT-Image-2: 5 USD za milion tokenów wejściowych tekstu, 8 USD za milion tokenów wejściowych obrazu oraz 30 USD za milion tokenów wyjściowych obrazu, przy czym Batch API kosztuje mniej więcej połowę przy realizacji do 24 godzin. Ope​nAI nie publikuje liczby tokenów na obraz, więc kwoty na obraz są przeliczeniami, a nie wycenami: około 0,006 USD za obraz o niskiej jakości 1024×1024, około 0,05 USD za obraz średniej jakości, około 0,21 USD przy wysokiej jakości i do około 0,41 USD za render w wysokiej rozdzielczości 4K. Dla porównania: to jedyna realna strona zestawienia; kolumna obrazów Flux 3 pozostaje pustą komórką.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Co powinien zrobić budowniczy z obiecanym modelem

Rozsądna postawa, gdy model konkurencji wciąż się opóźnia, to budować na tym, co już istnieje, i uczynić przyszłość zmianą konfiguracji, a nie przebudową architektury. {{1}}GPT-Image-2 można już dziś kierować przez OrcaRouter — jeden klucz API, cena listowa Ope​nAI przenoszona z zerową marżą, automatyczne przełączanie awaryjne między dostawcami{{/1}} — {{2}}dlatego potok generujący zasoby tym modelem będzie mógł później skierować ten sam endpoint do API Flux 3 image, gdy tylko taki endpoint faktycznie powstanie, i przekierować na niego część ruchu za pomocą DSL routingu, bez modyfikowania kodu wywołującego{{/2}}. {{3}}Dostajesz już dziś działający model, a gdy ten obiecany w końcu trafi na rynek, ocenisz go względem działającej bazy odniesienia, a nie względem komunikatu prasowego. Czekanie nic cię nie kosztuje; budowanie na niczym podczas czekania kosztuje cię wszystko{{/3}}.

Ten werdykt jest z założenia jednostronny. Jeśli w tym kwartale potrzebujesz generowania obrazów, GPT-Image-2 to właściwy wybór i nie ma co do tego wątpliwości — to numer jeden w niezależnych rankingach, właśnie dodał w API obsługę przezroczystego tła, ma publiczne API i stabilną cenę. Flux 3 image to powód, by mieć oko na Black Forest Labs, a nie powód, by wstrzymywać projekt. Śledź otwarcie wczesnego dostępu i pierwsze niezależne benchmarki; gdy tylko pojawi się endpoint, porównanie z tego wpisu stanie się testem, który naprawdę możesz uruchomić.