
Grok Imagine Image 2.0: #4 w Artificial Analysis, za jedną trzecią ceny
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Imagine Image 2.0 znalazł się na 4. miejscu w rankingu Text to Image Leaderboard serwisu Artificial Analysis, a liczba, która się liczy, to nie miejsce — to cena obok niego. Model ma 1153,66 Elo, za trzema pozycjami: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) i GPT Image 2 (high). Wyprzedza model każdego innego laboratorium, w tym MAI-Image-2.6 firmy Microsoft i model Nano Banana 2. To czyni go najwyżej sklasyfikowanym generatorem obrazów poza tą trójką i najtańszą opcją w tej pierwszej czwórce — i to z dużą przewagą: Artificial Analysis wycenia go na 60 USD za 1000 obrazów w porównaniu z około 211 USD za trzy pozycje powyżej. Sam model pochodzi z 7 sierpnia 2026 r. — zmieniło się to, gdzie umieszcza go niezależny ranking, oraz to, co to robi z określeniem „nr 2 na świecie”, którego twórca użył przy premierze.
Co tak naprawdę mierzy pozycja #4
Tablica liderów Text to Image firmy Artificial Analysis to ślepa arena preferencji ludzi: głosujący widzą wyniki dla tego samego promptu bez etykiet modeli i wybierają lepszy, a uzyskane Elo jest publikowane niezależnie od jakiegokolwiek dostawcy. Wpis Grok Imagine Image 2.0 wskazuje #4 z 1 153,66 Elo przy 95-procentowym przedziale ufności od 1 141,66 do 1 165,66. Żadna z tych liczb nie pochodzi od xAI. (Jeden szczegół porządkowy wart poznania, gdy czyta się tablicę: Artificial Analysis podaje twórcę modelu jako SpaceXAI.)
Cena jest ciekawszą połową tej historii. Ta sama strona przedstawia wykres jakości w zależności od ceny wraz z linią Pareto oznaczającą modele, które dają najwięcej Elo na dolara, a według własnych opublikowanych danych tego rankingu Grok Imagine Image 2.0 to model z najwyższym wynikiem wśród wycenionych poniżej 100 USD za 1000 obrazów. Następny model wyżej pod względem jakości, GPT Image 2 (high), kosztuje 211 USD za 1000 — około trzy i pół raza więcej za mniej więcej 17 dodatkowych punktów Elo. To twierdzenie o stosunku ceny do wydajności, a nie twierdzenie o byciu najlepszym modelem, i to właśnie tę wersję tej historii niezależne dane faktycznie potwierdzają.
Pozycja na froncie jest realna, ale wąska, i warto powiedzieć to wprost. MAI-Image-2.6 od Microsoftu znajduje się o jedną pozycję niżej, przy 38,90 USD za 1000, a Muse Image od Meta to 10 USD za 1000 przy 1111 Elo. Przedziały Elo na tej tablicy wynoszą około ±12 punktów, więc #4 i #5 — oddzielone o 6,5 Elo — mieszczą się wzajemnie w swoich przedziałach błędu. Traktuj tę pozycję jako „pierwszą piątkę”, a nie jako ustalone miejsce.
Awans o 14 miejsc to dystans do poziomu, który Grok Imagine Image 2.0 zastąpił. Poprzedni poziom jakości xAI, grok-imagine-image-quality, zajmuje 18. miejsce na tej samej liście z wynikiem 1 043,21 Elo, a oryginalny grok-imagine-image jest na 29. miejscu z wynikiem 1 017,86. To około 110 punktów Elo i 14 miejsc w rankingu dzielących model, który xAI obecnie wskazuje w dokumentacji jako swój domyślny model do obrazów, od tego, który zastępuje.
Na jakim etapie jest obecnie twierdzenie o „świecie nr 2”
W momencie premiery xAI podało drugie miejsce zarówno na rankingach Arena text-to-image, jak i image-editing, z około 1320 Elo i oznaczeniem Preliminary. Były to liczby, które xAI podkreśliło we własnym ogłoszeniu — nie niezależna ewaluacja, którą zleciło — i od tego czasu się zmieniły: migawka z 10 sierpnia umieściła model na #3 z 1316 Elo, za MAI-Image-2.6 i GPT Image 2. Miejsce #2 w edycji obrazów pozostaje własnym cytatem xAI.
Artificial Analysis to inny ranking z inną metodą i innym gronem głosujących, a teraz plasuje ten model na 4. miejscu. Te dwa rankingi tak naprawdę nie są ze sobą sprzeczne — odmiennie próbkują ludzkie preferencje, a oba są migawkami rankingów, które zmieniają się z tygodnia na tydzień. Uczciwym podsumowaniem sześciu tygodni niezależnego rankingu jest to, że Grok Imagine Image 2.0 konsekwentnie znajduje się w pierwszej piątce i nigdy nie jest do końca miejscem nr 2, które ogłosiło xAI.
Co tak naprawdę oferuje Grok Imagine Image 2.0
xAI pozycjonuje Grok Imagine Image 2.0 jako środowisko do edycji, a nie kolejny generator do jednorazowego tworzenia obrazów. Zestaw funkcji:
• Magic Wand — edycje na poziomie regionu, które pozostawiają resztę klatki nietkniętą
• Segmentacja — precyzyjny wybór obszaru do korekty kolorów, wymiany lub dopasowania
• Usuwanie tła — eksport obiektu z przezroczystym tłem
• Wejście wielu obrazów — do pięciu obrazów źródłowych na edycję; dokumentacja xAI wymienia obecnie pięć, w miejsce trzech, do których API było ograniczone w momencie premiery
• Smart Resize — przekształca jeden obraz w 9 proporcji (od pionowego 1:2 do poziomego 2:1), tworząc nową zawartość kadru zamiast kadrowania
• Szablony — gotowe przepływy pracy do fotografii produktowej, zdjęć portretowych, aukcji e-commerce, zasobów gier i plakatów marketingowych
API udostępnia kontrolki, których aplikacja konsumencka nie pokazuje: proporcje obrazu — w tym 21:9 i 5:2, obie nowe w wersji 2.0 — rozdzielczość (domyślnie 1K, opcjonalnie 2K) oraz parametr jakości przyjmujący wartości low, medium lub auto. Po stronie konsumenckiej model jest udostępniany jako domyślny tryb Quality Mode na grok.com/imagine, iOS i Androidzie, a od 13 sierpnia jest także wymieniany na platformie Runway, gdzie dołączył do modeli obrazów i wideo, które Runway już hostuje. Ta pozycja na liście to oświadczenie dostawcy i partnera, a nie niezależna ocena, ale była pierwszym sygnałem dystrybucji przez podmioty trzecie po premierze.
Jeśli chodzi o renderowanie tekstu nagłówków, xAI twierdzi, że model „planuje typografię i układ tak, jak zrobiłby to projektant”, zachowując zwarte, wieloczęściowe kompozycje w nienaruszonym stanie i ostro renderując drobny tekst. Zachowuje również tożsamość obiektu i ustawienia podczas wieloetapowych, iteracyjnych edycji.
Co wykazał pierwszy niezależny test
Porównanie oparte na sześciu promptach, z jednym ziarnem losowania i bez wybierania najlepszych wyników, przeprowadzone z gpt-image-2, wykazało wyraźny podział, którego nie podważa nic w nowej pozycji w rankingu.
Grok wygrywa:fotorealizm i zachowanie tożsamości. Anatomia dłoni na portrecie była poprawna, z detalami skóry na poziomie porów, podpowierzchniowym rozpraszaniem światła oraz naturalnym refleksem świetlnym i światłem krawędziowym. W zadaniu rotacji geometrycznej o 45 stopni Grok utrzymał tożsamość twarzy powyżej progu ArcFace 0.5, podczas gdy gpt-image-2 dryfował bardziej.
Grok przegrywa: obszary krytyczne dla produkcji. Poproszony o nagłówek plakatu filmowego w uproszczonym chińskim, wygenerował znaki tradycyjnego chińskiego — co nazwano „twardą dyskwalifikacją” dla procesów lokalizacji i publikacji. Prośba o fuzję stylów w akwareli zwróciła fotorealistyczny obraz z jedynie lekką teksturą malarską — „dyskwalifikacja na poziomie kategorii”. Lokalne edycje zrealizowały wszystkie trzy zapytania, ale nie zachowały widoku okna i nieprawidłowo zakotwiczyły rozjaśnienie.
Podsumowanie: Grok Imagine Image 2.0 „przoduje w fotorealizmie i tożsamości, a pozostaje w tyle pod względem niezawodności edycji, tekstu wielojęzycznego i prawdziwego transferu stylu”. Ranking uśrednia preferencje z tysięcy ślepych porównań; nie powie ci, czy model poprawnie odtworzy twój chiński nagłówek. Pojedynczy test z sześcioma promptami również nie stanowi zbioru dowodów — ale między tymi dwoma konkretne niepowodzenie jest bardziej użytecznym sygnałem dla zespołu dostarczającego zlokalizowane materiały.
API i matematyka cen
Narracja dla deweloperów zmieniła się od premiery. grok-imagine-image-2.0 to obecnie model, który xAI dokumentuje jako przeznaczony do generowania obrazów, edycji pojedynczego obrazu i edycji wielu obrazów, i to właśnie jego xAI poleca na własnej stronie modelu w przypadku obrazów. Ze stron modelu i cennika dostawcy zniknął komunikat z czasów premiery: „wkrótce dostęp do API dla deweloperów”.
• grok-imagine-image-2.0: od $0.04 za obraz, rozliczane według jakości faktycznie dostarczonej
• grok-imagine-image (1.0): 0,02 USD za obraz, nie podlega poniższej zmianie
• grok-imagine-image-quality: $0,05 za obraz, wycofanie 2 listopada 2026
Jakość to dźwignia kosztów. Auto — wartość domyślna, gdy parametr zostanie pominięty — obecnie daje niski poziom w przypadku generowania i średni w przypadku edycji, więc żądanie generowania jest rozliczane według niskiej stawki, a edycja według średniej. Przypisanie niskiego lub średniego poziomu sprawia, że rachunek jest przewidywalny, a nie zależny od tego, którą ścieżkę wybierze usługa.
Ten ostatni punkt ma termin. Przewodnik migracyjny xAI mówi, że slug grok-imagine-image-quality zostaje wycofany 2 listopada 2026 r., po 60-dniowym okresie powiadomienia, który rozpoczął się 2 września. Od tej daty slug nadal będzie się rozwiązywał, ale żądania będą obsługiwane przez grok-imagine-image-2.0 z jakością ustawioną na low — to przekierowanie zgodnościowe, a nie twarde wyłączenie. Ponieważ poziom low jest o 0,01 USD na obraz tańszy niż stary poziom jakości przy każdej rozdzielczości, zespoły, które nic nie zmienią, odczują spadek ceny i cichą zmianę jakości wyników. Świadoma migracja — poprzez wskazanie grok-imagine-image-2.0 i przypięcie jakości tam, gdzie liczy się stabilność wyników — to wersja, której chcesz. Ta data i zachowanie przekierowania pochodzą z dokumentacji samego xAI — podane przez dostawcę, nieprzetestowane niezależnie.
W zestawieniu z opcjami OpenAI jest to w równym stopniu różnica w modelu cenowym, co różnica w cenie. gpt-image-2 jest rozliczany za tokeny — 8 USD za milion tokenów wejściowych obrazu i 30 USD za milion tokenów wyjściowych obrazu według opublikowanych stawek OpenAI — więc koszt na obraz zmienia się wraz z rozdzielczością i szczegółowością. Reprezentatywna wartość Artificial Analysis wynosząca 211 USD za 1 000 obrazów dla GPT Image 2 (high) w porównaniu z 60 USD w przypadku Grok to to wahanie pokazane jako jedna liczba. Stała cena za obraz jest znacznie łatwiejsza do prognozowania w skali, co w głównej mierze tłumaczy, dlaczego model na czwartym miejscu w ogóle zasługuje na uwagę.
Wypróbowanie tego bez stawiania całego przedsięwzięcia na szali
Rozsądną reakcją na Grok Imagine Image 2.0 jest nadal „wypróbuj, ale jeszcze się nie wiąż”. Jego pozycja mieści się w nakładających się przedziałach ufności, jeden niezależny test wskazał realne słabości w tekście zlokalizowanym i transferze stylu, a xAI w listopadzie wycofuje znajdujący się pod nim slug. To dokładnie argument za routingiem, a nie za podłączaniem bezpośredniej integracji.
W OrcaRouter grok-imagine-image — model obrazu xAI w naszym katalogu znajduje się pod tym samym endpointem zgodnym z OpenAI co gpt-image-2, więc przełączanie się między modelami obrazu xAI i OpenAI to zmiana ciągu modelu: żadnej drugiej umowy, żadnego nowego SDK. OrcaRouter przekazuje ceny katalogowe dostawców bez marży, więc obniżka ceny u dostawcy obowiązuje tutaj tego samego dnia, a automatyczne przełączanie awaryjne może kierować błędy, limity szybkości lub odmowy do modelu zapasowego, zamiast do twojej ścieżki produkcyjnej. Jedno szczere zastrzeżenie, niezmienione od pierwotnej recenzji: najnowszy poziom jakości xAI to osobna pozycja, odrębna od modelu obrazu Grok już obecnego w naszym katalogu, więc sprawdź aktualną listę modeli, zamiast zakładać, że dany wariant Grok można dziś trasować.
Co obejrzeć dalej
1. Migracja z 2 listopada.To, czy zespoły jawnie przejdą na grok-imagine-image-2.0, czy też trafią na przekierowanie i jego niskiej jakości ustawienie domyślne, jest największą rzeczą, którą xAI może jeszcze zrobić źle w przypadku tego modelu — a przekierowanie czyni ten błąd niewidocznym, chyba że odczytasz pole modelu w swoich odpowiedziach.
2. Czy #4 się utrzyma. Przewaga nad MAI-Image-2.6 wynosi 6,5 Elo przy przedziałach ±12 punktów, więc kilka tysięcy dodatkowych głosów mogłoby zmienić kolejność w tabeli w jedną lub drugą stronę. Wzrost o 110 Elo względem poprzedniego poziomu wygląda na trwały; dokładna pozycja już nie.
3. Jak duża część funkcji dla użytkownika końcowego jest dostępna w API. Generowanie, edycja i edycja wielu obrazów są udokumentowane. Szablony oraz nazwany przepływ pracy Smart Resize pozostają funkcjami aplikacji i właśnie w tej luce tkwi pozostałe zastrzeżenie „tylko dla użytkownika końcowego”.
Konkluzja: Grok Imagine Image 2.0 to prawdziwy, zdolny model, który został już niezależnie sklasyfikowany — na 4. miejscu w Text to Image Leaderboard serwisu Artificial Analysis, jako najlepsza znajdująca się tam pozycja spoza OpenAI, około 110 punktów Elo przed poziomem, który zastąpił, oraz na froncie cenowo-jakościowym tego rankingu przy 60 USD za 1000 obrazów wobec około 211 USD dla modeli OpenAI bezpośrednio nad nim. Narracja „nr 2 na świecie” była od zawsze premierową migawką xAI, a niezależne rankingi nigdy tak naprawdę tego nie mówiły. Jego dwie najwyraźniejsze niezależne słabości — zgodność z uproszczonym chińskim i niezawodność przenoszenia stylu — dotyczą funkcji, których zespoły najczęściej potrzebują od API do obrazów. Przetestuj go od razu w zadaniach fotorealistycznych z zachowaniem tożsamości; wstrzymaj się z nim w przypadku potoków, które dostarczają zlokalizowany tekst lub zasoby stylizowane, a jeśli już wywołujesz wycofywany slug „quality”, przeprowadź migrację przed 2 listopada.
