Karta tytułowa hero do artykułu porównującego GPT-6 Sol Pro z Grok 4.7, z napisem „GPT-6 Sol Pro vs Grok 4.7” i podtytułem „Dwa razy większa rozwlekłość, jedna trzecia ceny”.
Guides & Insights

GPT-6 Sol Pro vs Grok 4.7: Dwa razy większa gadatliwość, jedna trzecia ceny

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa najtańsze modele z pogranicza frontier z września 2026 roku pojawiły się w odstępie jednego dnia, a ciekawą rzeczą w nich nie jest to, który z nich jest mądrzejszy. GPT-6 Sol — model, po który ludzie sięgają, gdy szukają GPT-6 Sol Pro, czyli ten sam model z reasoning.mode ustawionym na pro, a nie osobny produkt — trafił do sprzedaży 22 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych. Grok 4.7 od tego dostawcy trafił do sprzedaży 21 września w tej samej cenie 2,00 USD za tokeny wejściowe i 6,00 USD za tokeny wyjściowe. W neutralnym środowisku testowym Artificial Analysis oba dzieli różnica dwóch punktów indeksu i około dwóch dolarów na ukończone zadanie, a powodem tej różnicy nie są możliwości. Chodzi o to, ile tokenów każde z nich spala, żeby tam dotrzeć.

Sol wygenerował 77 milionów tokenów wyjściowych, uruchamiając Intelligence Index. Grok 4.7 wygenerował 240 milionów. Ten stosunek — nieco ponad trzy do jednego — to całe porównanie i odwraca wniosek, jaki daje tabela cen za token.

Dwie karty stawek i gdzie ta tania nie jest tania

Obaj dostawcy sami publikują te liczby; żaden nie został niezależnie wyceniony na nowo.

• Dane wejściowe — GPT-6 Sol 2,00 USD za milion tokenów vs Grok 4.7 2,00 USD za milion tokenów

• Wyjście — GPT-6 Sol 10,00 USD za milion tokenów vs Grok 4.7 6,00 USD za milion tokenów

• Wejście z pamięci podręcznej — GPT-6 Sol 0,20 USD za milion tokenów vs Grok 4.7 0,50 USD za milion tokenów; odczyt z pamięci podręcznej Sol jest dwa i pół raza tańszy, co jest odwrotnością tego, co sugeruje podana w nagłówku stawka za wyjście

• Okno kontekstowe — GPT-6 Sol 1 050 000 tokenów vs Grok 4.7 500 000 tokenów

• Dopłata za długi kontekst — GPT-6 Sol wycenia żądanie powyżej 272 000 tokenów wejściowych według 2× stawek za wejście i pamięć podręczną oraz 1,5× stawki za wyjście dla całego żądania, podczas gdy Grok 4.7 podwaja każdą stawkę przy 200 000 tokenów wejściowych, również dla całego żądania

• Data graniczna wiedzy — GPT-6 Sol 20 kwietnia 2026 vs Grok 4.7, którego datę graniczną pretreningu podano jako czerwiec 2026, z treningiem uzupełniającym do sierpnia

• Wysiłek rozumowania — GPT-6 Sol: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maks. vs Grok 4.7: niski, średni (domyślny), wysoki, bardzo wysoki

• Modalność — oba przyjmują dane wejściowe w postaci tekstu i obrazu oraz zwracają tekst

To na pozycji odczytu z pamięci podręcznej kupujący powinien się skupić. Stawka Grok 4.7 za wyjście jest o 40% niższa, ale jego stawka za buforowane wejście jest o 150% wyższa, a to właśnie w buforowanym wejściu mieszczą się długie historie agentów i powtarzane prompty systemowe. Obciążenie, które w większości polega na ponownym odczytywaniu dużego, stabilnego kontekstu, sprawi, że oba modele okażą się znacznie bliżej siebie, niż sugeruje porównanie $6 z $10.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Niezależny rekord i ta jedna liczba, która o nim decyduje

Artificial Analysis to jedyny zestaw testowy, który zmierzył oba modele, a jego liczby warto zestawić obok siebie, ponieważ rozbieżność jest pouczająca.

• Indeks Inteligencji — GPT-6 Sol 48 przy maksymalnym wysiłku vs Grok 4.7 46 przy xhigh; oba znacznie powyżej mediany 25 dla porównywalnych modeli

• Koszt na zadanie indeksowania — GPT-6 Sol 1,06 USD vs Grok 4.7 3,74 USD

• Tokeny wyjściowe dla przebiegu indeksu — GPT-6 Sol 77M vs Grok 4.7 240M, w porównaniu z medianą 88M

• Szybkość generowania — Grok 4.7 zmierzono na 39 tokenów na sekundę, co samo środowisko testowe określa jako wyraźnie wolne; wyniku Sola na tej samej tablicy wyników nie podano w tym samym wierszu podsumowania

• Coding Agent Index — GPT-6 Sol 57 po 2,99 USD za zadanie vs Grok 4.7 56 z własnym harnessem Grok Build, o dziewięć punktów więcej niż Grok 4.6

Dwa punkty różnicy w indeksie, trzy i pół razy większy koszt na zadanie. To nie anomalia cenowa — to arytmetyka gadatliwości. Grok 4.7 to model, który myśli na głos długo; środowisko testowe oznacza go jako „bardzo gadatliwy” na tle mediany 88 mln tokenów, a koszt podąża za tokenami, nie za cennikiem.

Porównanie agentów kodujących niesie ze sobą zastrzeżenie, które tabela wyników ukrywa. Wynik 56 Grok 4.7 jest mierzony w wewnętrznym środowisku Grok Build firmy xAI, które stanowi konfigurację dostarczaną przez xAI i tę, względem której prowadzi ona testy porównawcze. Wynik 57 Sol jest mierzony w neutralnym środowisku. Przewaga własnego środowiska rzędu jednego lub dwóch punktów mieści się w zakresie, który tłumaczy wybór środowiska, co oznacza, że uczciwa interpretacja jest taka, że te dwa modele są na równi w kodowaniu agentowym — a nie że Sol jest o jeden punkt z przodu.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Co twierdzi każdy z dostawców, a czego nie pokazał żaden z nich

Materiały premierowe xAI są konkretne i opowiadają historię o długim horyzoncie: Grok 4.7 opiera się na większym modelu bazowym niż Grok 4.6 i przeszedł dłuższy cykl uczenia ze wzmocnieniem ukierunkowany na zadania, które „mogą zajmować godziny”, wyostrzając samoweryfikację, obsługę długiego kontekstu i zachowanie w środowisku Grok Bot. Podawane przez producenta liczby obejmują Terminal-Bench 4.0 na poziomie 38,0% wobec 20,3% w Grok 4.6, CursorBench 4.0 na poziomie 46,3% oraz DeepSWE v1.1 na poziomie 71,0%. Każda z tych wartości to pomiar samego xAI i żadna nie została niezależnie odtworzona; krążący niezależny wynik Terminal-Bench 4.0 jest istotnie niższy niż wynik producenta, co jest typowym kształtem tej luki.

Twierdzenia OpenAI dotyczące GPT-6 Sol są tymi już omówionymi powyżej i mają tę samą etykietę. Dane podane przez dostawcę to 33,2% w AutomationBench przy poziomie wysiłku xhigh w porównaniu z 26,9% Claude Opus 5 przy poziomie max, przy mniej więcej 9% kosztu na zadanie, oraz 68,8% w DeepSWE v1.1 przy maksymalnym wysiłku — w granicach 1,1 punktu od Claude Fable 5 przy xhigh, przy około 80% niższym koszcie na zadanie. Zwróć uwagę na cel porównania: własne wykresy OpenAI zestawiają Sol z modelami Anthropic, a nie z Grok 4.7. Żaden z dostawców nie opublikował bezpośredniego porównania z drugim.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Gdzie warstwa routingu zasługuje na swoje miejsce

OrcaRouter nie ma w ofercie żadnego z tych modeli w tym zestawieniu — Grok 4.7 i GPT-6 Sol są nieobecne w naszym katalogu, więc nie ma tu żadnego twierdzenia o ich cenie u nas. To, ile warta jest warstwa routingu w tej konkretnej parze, rozstrzyga się na poziomie trybu awarii, a nie cennika. Powód, by sięgnąć po Grok 4.7, to jego długohoryzontowe zachowanie agentowe; powód, by tego nie robić, to fakt, że prędkość wyjściowa na poziomie 39 tokenów na sekundę sprawia, iż długie uruchomienie agenta staje się na tyle wolne, że ma to znaczenie, a wolne uruchomienie to takie, które może przekroczyć limit czasu. Automatyczne przełączanie awaryjne między dostawcami oznacza, że długie zadanie można skierować do dowolnego modelu, który jest faktycznie dostępny, bez ryzyka, że ta prędkość stanie się pojedynczym punktem awarii, a DSL routingu wyraża wybór modelu jako regułę wewnątrz wywołania zamiast jako migrację — co ma tu znaczenie, ponieważ właściwa odpowiedź dla tej pary zależy od tego, czy zadanie jest żarłoczne tokenowo, czy wrażliwe na opóźnienia, a to jest właściwość żądania, a nie kwartału.

Reguła decyzyjna

• Kodowanie agentowe przy stałym budżecie — GPT-6 Sol. Poziom możliwości na neutralnym indeksie kodowania, przy mniej więcej jednej trzeciej kosztu na zadanie, bo osiąga ten poziom przy jednej trzeciej liczby tokenów.

• Zadania o długim horyzoncie, w których liczy się długość przebiegu — Grok 4.7. To wydanie zostało wytrenowane specjalnie do wielogodzinnej pracy, a liczby podawane przez dostawcę dla SWE-Marathon i CursorBench zmierzają dokładnie w tym kierunku.

• Wolumen wrażliwy na opóźnienia — na podstawie obecnych danych ani jedno, ani drugie. Koszt na zadanie Sola to lepsza liczba, ale zmierzone 39 tokenów na sekundę w Grok 4.7 to realne ograniczenie dla wszystkiego, co interaktywne.

• Obciążenia długiego kontekstu w większości obsługiwane z pamięci podręcznej — GPT-6 Sol, w wierszu odczytu z pamięci podręcznej, a nie w wierszu danych wyjściowych. Przy $0.20 w porównaniu z $0.50 za milion tokenów z pamięci podręcznej, a do tego okno dwukrotnie większe, argument jest tym mocniejszy, im większa część Twojego promptu pozostaje stała.

• Jeśli Twoje porównanie zostało zbudowane na podstawie cennika stawek za token — zbuduj je od nowa na podstawie kosztu na zadanie. 6,00 USD w porównaniu z 10,00 USD za wyjście to najmniej informująca para liczb w tym artykule i to właśnie od niej zaczyna się każda istniejąca strona.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie