
GPT-6.1 Sol vs Grok 4.7: najniższa stawka za tokeny wyjściowe w tym gronie, a najdroższa rozmowa
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Grok 4.7, następca Grok 4.6 od xAI, zadebiutował 21 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. GPT-6.1 Sol, średniopółkowe odświeżenie oferty OpenAI, pojawił się osiem dni później, 29 września, w cenie 2,00 USD za tokeny wejściowe i 10,00 USD za tokeny wyjściowe. Stawki za tokeny wejściowe są identyczne, stawka za tokeny wyjściowe jest o 40% niższa w przypadku Grok 4.7 — i na tym kończy się większość porównań. To złe miejsce, by się zatrzymywać, bo ten sam niezależny panel zmierzył już oba modele kompleksowo, od początku do końca: Grok 4.7 spalił około 240 milionów tokenów wyjściowych, kończąc Artificial Analysis Intelligence Index; GPT-6.1 Sol spalił 67 milionów. Pomnóż niższą stawkę przez trzy i pół raza większy wolumen, a model z niższą ceną za token kosztuje 3,74 USD za ukończone zadanie wobec 0,72 USD.
Dwa modele, osiem dni różnicy i cennik, który się odwraca
Grok 4.7 to najmocniejszy model xAI do kodowania i pracy z wiedzą: okno kontekstu 500 000 tokenów, do 450 000 tokenów wyjściowych w pojedynczej odpowiedzi według własnej specyfikacji dostawcy, dane wejściowe tekstowe, obrazowe i plikowe oraz konfigurowalny wysiłek rozumowania na poziomach niski, średni (domyślny), wysoki i bardzo wysoki. xAI nie ujawniło liczby parametrów, a jego data odcięcia pretreningu jest podawana jako czerwiec 2026 r., z dodatkowym treningiem do sierpnia.
GPT-6.1 Sol to jednostopniowe odświeżenie OpenAI w ramach poziomu GPT-6 Sol, pozycjonowane poniżej GPT-6 Astra i powyżej GPT-6 Luna: 1 050 000 tokenów kontekstu — około dwukrotnie więcej niż w modelu Grok — z limitem wyjściowym 128 000 tokenów, który stanowi około jednej trzeciej limitu modelu Grok, datą odcięcia wiedzy 30 kwietnia 2026 r. oraz takim samym wejściem tekstowym, obrazowym i plikowym. Jego drabinka rozumowania obejmuje zakres od poziomu „niski” do poziomu „maks.” z domyślnym ustawieniem „średni”, a nie akceptuje już wartości „brak” w ogóle.
Jedna linia na wymiar, obie strony w każdym:
• Wejście — GPT-6.1 Sol 2,00 USD za 1 mln vs Grok 4.7 2,00 USD za 1 mln; identycznie
• Wyjście — GPT-6.1 Sol 10,00 USD za 1 mln vs Grok 4.7 6,00 USD za 1 mln; Grok jest o 40% tańszy
• Wejście z pamięci podręcznej — GPT-6.1 Sol 0,10 USD za 1 mln vs Grok 4.7 0,50 USD za 1 mln; Sol jest pięciokrotnie tańszy, czyli odwrotnie, niż sugeruje wiersz o wyjściu
• Okno kontekstu — 1 050 000 tokenów vs 500 000
• Maksymalne wyjście w jednej odpowiedzi — 128 000 tokenów vs deklarowane 450 000
• Próg długiego kontekstu — ponowna wycena całego żądania powyżej 272 000 tokenów wejściowych: 2× na wejściu i w pamięci podręcznej oraz 1,5× na wyjściu vs podwojenie każdej stawki powyżej 200 000 tokenów wejściowych, również dla całego żądania
• Wysiłek rozumowania — niski, średni (domyślny), wysoki, xhigh, max vs niski, średni (domyślny), wysoki, xhigh
• Wagi i parametry — zamknięte, nieujawnione vs zamknięte, nieujawnione; żaden nie daje checkpointu
• Indeks inteligencji przy maksymalnym publikowanym wysiłku — GPT-6.1 Sol 51,8 przy max vs Grok 4.7 46,4 przy xhigh
• Koszt na zadanie w indeksie, niezależnie — 0,72 USD vs 3,74 USD
• Tokeny wyjściowe w przebiegu indeksu — 67 mln vs 240 mln, wobec mediany tablicy wynoszącej około 81 mln
Dwa wiersze na tej liście to całe porównanie. Stawka Grok 4.7 za tokeny wyjściowe jest naprawdę niższa, a jego stawka za cache jest naprawdę pięć razy wyższa; wygenerował też trzy i pół raza więcej tokenów do zmierzenia. Cennik, czytany osobno, wskazuje w jedną stronę. Pomiar wskazuje w drugą, o czynnik

Gdzie Grok 4.7 faktycznie ma przewagę
Byłoby nieuczciwe przedstawiać ten artykuł jako pogrom, ponieważ Grok 4.7 wygrywa w rzeczywistych ewaluacjach. Oceniono je obok siebie przy maksymalnym opublikowanym wysiłku na Artificial Analysis v4.3.2 — Grok przy xhigh, Sol przy max, różnica w konfiguracji, o której warto pamiętać przez cały czas:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 vs GPT-6.1 Sol Elo 1575,1. Przewaga 140 punktów Elo w ekonomicznie wartościowej pracy opartej na wiedzy oraz największe pojedyncze niezależne zwycięstwo modelu z niższą stawką w cenniku.
• AutomationBench-AA — Grok 4.7 0,6556 vs GPT-6.1 Sol 0,6487. W praktyce remis, nominalnie na korzyść Groka.
• SciCode — Grok 4.7 0,5741 vs GPT-6.1 Sol 0,5417. Przewaga 3,2 punktu w kodowaniu naukowym.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 vs GPT-6.1 Sol 0,5606. 30-punktowa strata i największa różnica w tym zestawieniu.
• Humanity's Last Exam — Grok 4.7 0,4314 vs GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, rozumowanie na długim kontekście — Grok 4.7 0,7667 vs GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 vs GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 vs GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 vs GPT-6.1 Sol 0,3171.
W trzech z dziewięciu ewaluacji zwycięża Grok 4.7 albo jest remis, w tym w tej, z którą najtrudniej jest polemizować: GDPval-AA został zaprojektowany, aby wyceniać mającą wartość ekonomiczną pracę zawodową, a 140-punktowa przewaga w Elo to nie szum. Jeśli twoje obciążenie pracą jest tego rodzaju, jaki GDPval miał reprezentować — analiza oparta na dużej liczbie dokumentów, profesjonalne produkty końcowe, decyzje wymagające osądu z poprawną odpowiedzią — model niskokosztowy jest również lepszym modelem w neutralnym rankingu, a kara za koszt na zadanie jest tym, co za to płacisz.
Własne liczby premierowe xAI są duże i, jak wszystkie dane premierowe dostawców, niezreplikowane. CursorBench 4.0 na poziomie 46,3% przy xhigh w porównaniu z 40,4% Grok 4.6; Terminal-Bench 4.0 na poziomie 38,0% wobec 20,3%, największy pojedynczy deklarowany wzrost w tym wydaniu; DeepSWE v1.1 na poziomie 71,0% przy high wobec 65,2%; EEBench na poziomie 64,0% wobec 53,0%. To środowisko testowe xAI, ustawienia xAI, raportowanie xAI — i zwróć uwagę, że deklaracja 38,0% dla Terminal-Bench 4.0 kontrastuje z wynikiem 0,2576 niezależnej tablicy wyników dla tego samego modelu na tym samym benchmarku, co jest rodzajem rozbieżności, której należy się spodziewać między dostrojoną konfiguracją dostawcy a neutralnym przebiegiem z maksymalnym wysiłkiem.
Dane OpenAI dotyczące GPT-6.1 Sol zasługują na takie samo zdyskontowanie i mają tę samą słabość. Jedyną liczbą w tym porównaniu, której nie podał żaden z dostawców, jest koszt ukończonego zadania, ponieważ oblicza się go na podstawie zmierzonego zużycia tokenów, a nie z tabeli wyników. To właśnie ta liczba się ostała.
Dlaczego 240 milionów tokenów o tym decyduje
Artificial Analysis w swoim podsumowaniu opisuje gadatliwość modelu Grok 4.7, a dowodem jest liczba tokenów stojąca za przebiegiem indeksu: 240 milionów tokenów wyjściowych wobec mediany rankingowej wynoszącej blisko 81 milionów, czyli około trzy razy więcej niż produkuje typowy model w tym samym zestawie. GPT-6.1 Sol z 67 milionami plasuje się znacznie poniżej mediany. Połącz oba stosunki — 3,6× wolumen przy 0,6× cenie — a tańsza stawka za wyjście oznacza więcej tokenów, a nie mniejszy rachunek; dokładnie tak wygląda różnica kosztu na zadanie wynosząca $3,74 wobec $0,72.
Buforowanie zmienia rozmiar efektu, ale nie jego kierunek — i to jest szczegół, na którym ludzie się potykają. Buforowane wejście Grok 4.7 kosztuje 0,50 USD za milion wobec 0,10 USD w Sol — pięć razy drożej w linii, w której żyją długie historie agentów i powtarzane prompty systemowe. Obciążenie zdominowane przez ponowne odczytywanie dużego, stabilnego prefiksu sprawia więc, że oba modele są bliżej siebie, niż sugerowałoby 6 USD wobec 10 USD, a gdy nałoży się na to jeszcze gadatliwość Groka, są dalej od siebie, niż sugerują stawki za wejście. Linia pamięci podręcznej i linia tokenów wskazują tu w tym samym kierunku, co jest nietypowe i sprawia, że to zestawienie jest czystsze, niż sugerują karty stawek.
Klauzule długiego kontekstu warto wyceniać osobno, ponieważ uruchamiają się przy różnych progach. GPT-6.1 Sol zmienia cenę całego żądania powyżej 272 000 tokenów wejściowych; Grok 4.7 robi to samo powyżej 200 000. W przypadku wywołania na 250 000 tokenów Grok ma już podwojoną stawkę — 4,00 USD i 12,00 USD przy odczycie z pamięci podręcznej za 1,00 USD — podczas gdy Sol nadal stosuje standardowe 2,00 USD i 10,00 USD. Między 200 000 a 272 000 tokenów model z tańszym cennikiem jest tym droższym, i to znacznie, a ten przedział jest częsty w pracy z dokumentami.
Tam, gdzie Grok naprawdę wygrywa strukturą, a nie wynikiem, jest pułap wyjściowy. Maksymalna odpowiedź 450 000 tokenów w porównaniu z 128 000 u Sola to zupełnie inna klasa artefaktu: cała wygenerowana baza kodu, długi transkrypt, synteza długości książki w jednym wywołaniu. Jeśli dziś dobijasz do limitów wyjściowych, ta linia rozstrzyga porównanie i nic z powyższej arytmetyki kosztów nie ma zastosowania — nie można kupić zdolności, której drugi model nie ma, za żadną cenę.
Oba znajdują się na jednym klawiszu – to jest właśnie ta przydatna część.
Grok 4.7 jest dostępny w OrcaRouter w cenie katalogowej samego xAI — 2,00 USD i 6,00 USD za milion tokenów, z odczytem z pamięci podręcznej za 0,50 USD, a próg 200 000 tokenów do 4,00 USD i 12,00 USD jest przekazywany dokładnie tak, jak podaje xAI — a GPT-6.1 Sol trafił na nasze trasy w dniu premiery w cenie OpenAI: 2,00 USD i 10,00 USD, z danymi wejściowymi z pamięci podręcznej po 0,10 USD i progiem 272 000 tokenów bez zmian. Do żadnego z nich nic nie jest doliczane: platforma przekazuje cenę katalogową dostawcy bez zmian, zamiast doliczać marżę, co oznacza, że obniżka ceny przez dostawcę po którejkolwiek stronie obowiązuje tutaj tego samego dnia, w którym obowiązuje tam, bez drugiej faktury i bez pośrednika w postaci resellera.

W przypadku tej konkretnej pary jest to warte więcej niż wygoda. Te dwa modele nie zgadzają się co do tego, w czym są dobre — Grok 4.7 prowadzi w Elo dla pracy zawodowej i w kodowaniu naukowym, GPT-6.1 Sol prowadzi w wykonywaniu w terminalu, wiarygodności faktograficznej i wyszukiwaniu długiego kontekstu — a granica między tymi obciążeniami jest widoczna w Twoim własnym ruchu, zanim będzie widoczna w benchmarku. Wysyłanie żądań w kształcie GDPval w jedną stronę, a długohoryzontowych uruchomień agentów w drugą, za jednym punktem końcowym, z automatycznym przełączaniem awaryjnym między oboma i regułą routingu, którą zmieniasz w konfiguracji, a nie we wdrożeniu, jest tańszym sposobem na znalezienie tej granicy niż projekt ewaluacyjny. Fuzja modeli, w której panel modeli odpowiada razem, to inna opcja oferowana przez platformę, jeśli wolisz w ogóle nie wybierać przy każdym żądaniu.

Połączenie
• Praca agentowa i terminalowa z długimi wynikami, pętle z buforowanym prefiksem — GPT-6.1 Sol. Trzydzieści punktów w Terminal-Bench 4.0, linia cache pięć razy tańsza i jedna piąta kosztu na ukończone zadanie.
• Profesjonalna praca wiedzowa, analiza dokumentów, zadania wymagające osądu — Grok 4.7 dzięki 140-punktowej przewadze w Elo GDPval-AA, z rachunkiem za tokeny ujętym w budżecie, a nie założonym.
• Kodowanie naukowe — Grok 4.7, nieznacznie, w podziale SciCode na tablicy wyników. Sprawdź to na własnym zestawie; 3,2 punktu mieści się w zakresie, który może przesunąć inny zestaw promptów.
• Pojedyncze odpowiedzi powyżej 128 000 tokenów wyjściowych — Grok 4.7, i nie ma arytmetyki, która mogłaby to zastąpić.
• Żądania od 200 000 do 272 000 tokenów wejściowych — GPT-6.1 Sol, ponieważ Grok 4.7 już podwoił całe swoje żądanie, a Sol nie.
• Najtańsza możliwa rozmowa — żaden z tych dwóch. Oba to modele w cenie frontier z frontierowymi apetytami na tokeny; porównanie dotyczy tego, który z nich ukończy twoje zadanie, a nie który jest tani w teorii.
• Jeśli porównanie kończy się na „Grok jest tańszy za token” — zakończyło się o krok za wcześnie. Następnym krokiem jest liczba tokenów, a ona wynosi 240 milionów przeciwko 67.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
