
Ideogram 4.5 vs GPT Image 2.5: Ideogram sam sprowokował tę walkę
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 261 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Większość porównań modeli przygotowuje ten, kto je pisze. To przygotował Ideogram. Strona premiery Ideogram 4.5, dostępna od 30 września 2026 r., zawiera demonstrację edycji obok siebie i wymienia swoich przeciwników w podpisie: „te same edycje na Ideogram 4.5 vs. GPT Image 2.5 Sunburst, Nano Banana Pro i Nano Banana 2”. Następnie formułuje twierdzenie o tym, co zobaczy widz — „wyniki GPT Image i Nano Banana stają się bezużyteczne po kilku edycjach, podczas gdy Ideogram 4.5 pozostaje czysty edycja po edycji”.
To jest niezwykle bezpośrednie. Dostawca wybierający cel benchmarku i z góry informujący cię o wyniku zasługuje na potraktowanie poważnie w jednym sensie, a sceptycznie w innym. GPT Image 2.5 jest najsilniejszą rzeczą na niezależnych rankingach w obu kategoriach obrazów, więc to właściwy przeciwnik, jakiego należało wybrać. A jest to wydanie z dwoma identyfikatorami — Flare i Sunburst, oba wydane 8 września 2026 — z publicznymi wynikami areny, którym Ideogram 4.5 obecnie nie dorównuje. Interesujące pytanie nie brzmi, kto wygrywa arenę. Chodzi o to, czy twierdzenie Ideogramu mierzy coś, czego arena nie mierzy.
Gdzie dokładnie stoją oba modele
• Ideogram 4.5 — wydany 30 września 2026. Model precyzyjnej edycji; generowanie i edycja przy czterech prędkościach renderowania; natywne 2K; edycje demonstrowane w rozdzielczości źródłowej do 4 016 × 6 016 (24,2 MP). Generowanie obrazów z tekstu: 34. spośród 167 przy 1 014 ± 11 Elo (2 247 głosów); edycja obrazów: 23. przy 1 064 ± 11 Elo (2 382 głosy). 0,03–0,22 USD za obraz w zależności od ustawienia prędkości.
• GPT Image 2.5 Sunburst — wydany 8 września 2026 r. jako nastawiona na precyzję połowa dwuczęściowej aktualizacji obrazów OpenAI, identyfikator API gpt-image-2.5-sunburst. Generowanie obrazu z tekstu Nr 1 z wynikiem 1 197 ± 9 Elo (14 023 głosy); edycja obrazów Nr 1 z wynikiem 1 182 ± 8 Elo (17 899 głosów). Cena 210,70 USD za 1 000 obrazów według przelicznika rankingu.
• GPT Image 2.5 Flare — szybsza połowa tego samego wydania, identyfikator gpt-image-2.5-flare. Nr 2 na obu rankingach: 1 190 w kategorii tekst-na-obraz, 1 162 w edycji. Ta sama cena 210,70 USD za 1000.
Postaw obok siebie dwie liczby dotyczące edycji, a różnica wynosi 118 Elo — 1 182 kontra 1 064 — przy przedziałach ufności ± i ±11. Przedziały się nie pokrywają. Na tablicy mierzącej preferencje dotyczące edycji w jednym przebiegu Sunburst wygrywa, i wygrywa, mając za sobą około siedmiu i pół razy więcej głosów.
Co ranking mierzy, a czego nie mierzy
To jest ta część, która decyduje, czy twierdzenie Ideogramu przetrwa zetknięcie z dowodami.
Arena edycyjna Artificial Analysis opiera się na ślepym porównywaniu preferencji ludzi w parach: głosujący widzą ten sam obraz źródłowy i tę samą instrukcję, otrzymują dwa edytowane wyniki bez etykiet i wybierają lepszy. To mocna metoda odpowiadania na pytanie: „który z tych dwóch wyników wygląda bardziej tak, jak wymagała instrukcja”.
To nie potrafi zmierzyć tego, co reklamuje Ideogram. Głosujący oceniający jedną edycję nie może zobaczyć, czy model po cichu zmienił tapetę, przesunął twarz o dwa milimetry albo ponownie wyrenderował ziarno w pozostałej części kadru. Wada, którą Ideogram twierdzi, że naprawia, staje się widoczna dopiero w sekwencji — czwarta tura, siódma tura, dziesiąta tura — a żadna mainstreamowa arena nie przedstawia sekwencji głosującym. Wynik 1064 Elo mówi, że pojedyncze edycje Ideogramu są dobre. Nie mówi zupełnie nic o tym, czy pozostają dobre.
To działa w obie strony w przypadku Ideogramu, a uczciwa wersja jest taka: ranking nie potwierdza twierdzenia o dryfie, ale też go nie obala. Obala natomiast niejawne, silniejsze twierdzenie, które czytelnik mógłby wynieść ze strony premiery — że 4.5 jest lepszym edytorem, i kropka. W zestawieniu z rankingiem jest niżej sklasyfikowanym edytorem o marginesie większym niż jego słupki błędów.

Co każde z nich robi, czego nie robi drugie
• Edycja w rozdzielczości źródłowej — wyróżniające twierdzenie inżynieryjne Ideogram 4.5. Jego strona pokazuje edycję zastosowaną do źródła 4 016 × 6 016 bez skalowania w dół, z obietnicą, że granica edycji jest zachowana na tyle dobrze, by wkleić wycinek z powrotem do oryginału. W pracy drukarskiej to różnica między materiałem gotowym do przekazania a kompromisem.
• Szeroki zakres parametrów — GPT Image 2.5. OpenAI dodał xhigh i max do skali jakości i uczynił przezroczyste tła pełnoprawnym parametrem, z ustawieniem tła na transparent, opaque lub auto oraz wyjściem PNG lub WebP. Przezroczyste wyjście było brakującym elementem w GPT Image 2 i stało się flagową funkcją w parze 2.5.
• Szybka ścieżka — Flare istnieje specjalnie po to, by być szybkim domyślnym wyborem. OpenAI twierdzi, że opóźnienie jest nawet o 50% niższe niż w poprzedniej generacji; Sunburst jest celowo wolniejszy i skierowany do edycji, które muszą przetrwać wnikliwą analizę.
• Struktura cen — Ideogram rozlicza za obraz na podstawie szybkości renderowania ($0,03 do $0,22). OpenAI rozlicza na podstawie tokenów według tego samego cennika co GPT Image 2 — $8 za milion tokenów wejściowych obrazu, $30 za milion tokenów wyjściowych obrazu — dlatego niezależne przeliczenie na pojedynczy obraz daje około $0,21 w przypadku wysokiej jakości obrazu 1024 × 1024.
Linie cen przecinają się w niezręcznym miejscu. Przy ustawieniach Low i Medium Ideogramu 4.5 jest on dramatycznie tańszy za obraz niż para od OpenAI. Przy High — czyli tam, gdzie znajduje się demonstracja dryfu i gdzie uruchomiłbyś źródło 24-megapikselowe — obie wartości są zbliżone do tej samej liczby. Porównanie, które faktycznie przeprowadzi większość nabywców, to wysokiej jakości Ideogram 4.5 kontra wysokiej jakości Sunburst, a w tym porównaniu cena jest w przybliżeniu remisowa przy deficycie 118 punktów Elo na mierzonej tablicy.
Co jest w porządku, jeśli teza o dryfie jest prawdziwa. Na tym polega cały zakład.


Różnica w dostępności, której nikt nie promuje
Jedna praktyczna asymetria działa w odwrotnym kierunku niż wskazuje tablica wyników. Dwa identyfikatory GPT Image 2.5 są nowsze niż cokolwiek w katalogu OrcaRouter — nasza linia obrazów OpenAI to dziś GPT-Image-1.5 w cenie 8/32 USD za milion tokenów i GPT-Image-2 w cenie 8/30 USD, obie w cenie katalogowej dostawcy bez marży dodanej. Para 2.5 pojawiła się w cenniku OpenAI w tej samej cenie 8/30 USD co GPT-Image-2, co oznacza, że w momencie, gdy staną się możliwe do routowania, trafią w tę samą cenę przekazywaną dalej, a nie w nową, a kwestia kosztów między nimi staje się kwestią wydajności tokenowej, a nie tego, do którego dostawcy się zwracasz.
Ideogram 4.5 jest dostępny w API samego Ideogramu oraz na platformach partnerskich. Nie ma go w naszym katalogu. Ma to znaczenie dla porównania w nudny sposób: jeden z tych dwóch modeli można podpiąć bez zmian do klienta zgodnego z OpenAI, a drugi to nowa integracja. Jeśli już wywołujesz GPT-Image-2 przez endpoint w formacie OpenAI, kosztem wypróbowania Sunburst jest zmiana identyfikatora modelu; kosztem wypróbowania Ideogram 4.5 jest druga umowa i drugi klient, zanim jeszcze w ogóle przejdziesz do oceny jakości.
Warstwa routingu nie usuwa tej różnicy — usuwa jedynie okablowanie po stronie, która jest już kompatybilna, i pozwala skierować część ruchu do nowego uczestnika bez dedykowania mu ścieżki produkcyjnej. Failover ma tu większe znaczenie niż zwykle, ponieważ to, co chciałbyś testować, to model, którego kluczowa teza nie ma niezależnej weryfikacji, a którego rozmiary prób są jedną piątą rozmiarów prób konkurenta.
Jak to rozstrzygnąć
Nie przeprowadzaj tego porównania na pojedynczych obrazach. To metoda areny i niewłaściwe narzędzie — powie ci, że Sunburst wygrywa, co już wiedziałeś.
Uruchom to na sekwencjach. Weź pięć lub dziesięć obrazów z własnej pracy, zapisz ten sam łańcuch sześciu lub ośmiu stopniowych edycji i wykonaj identyczny łańcuch na Ideogram 4.5 (High) oraz na Sunburst (max). Następnie porównaj turę pierwszą z turą ósmą dla każdego modelu, w regionach, których nigdy nie prosiłeś modelu, żeby ich dotknął. Policz piksele, które się zmieniły. Ta liczba — rozbieżność w niezmienionych regionach w obrębie sekwencji — to jest to, na czym Ideogram twierdzi, że wygrywa, a o ile mi wiadomo, nikt jej nie publikuje dla żadnego z tych dwóch modeli.
Następnie wyceń oba przebiegi na ukończoną sekwencję. W tym momencie będziesz mieć odpowiedź wartą więcej niż 118 Elo, ponieważ będzie dotyczyć twoich obrazów, a nie panelu głosujących.
Czym tak naprawdę jest to starcie
Ideogram 4.5 nie wziął udziału w konkursie, który wygrywa na rankingach, i najwyraźniej zdaje sobie z tego sprawę — dlatego strona premiery demonstruje zachowanie, zamiast podawać miejsce w rankingu. Demonstrowane zachowanie jest wystarczająco realne, by warto było je przetestować, i wystarczająco konkretne, by dało się je sfalsyfikować: albo powtarzane edycje zachowują spójność, albo nie, a dziesięcioturowy test na własnych plikach rozstrzyga to w ciągu jednego popołudnia.
Rozsądna interpretacja na dziś jest taka, że GPT Image 2.5 Sunburst jest lepszym edytorem według jedynego istniejącego niezależnego miernika, z przewagą wykraczającą poza przedziały błędu i ze znacznie większą liczbą dowodów stojących za tym wynikiem — a Ideogram 4.5 sprzedaje węższą, niezmierzoną właściwość w cenie, która jest niższa przy niskich ustawieniach i w przybliżeniu równa przy ustawieniu, od którego zależy jego obietnica. Jeśli wierność w trybie wieloturowej rozmowy jest wąskim gardłem twojego procesu produkcyjnego, test jest tani, a model na niego zasługuje. Jeśli nie, tablica wyników już odpowiedziała.
