
GPT-6 Sol Pro vs Grok 4.7: Dwa razy większa gadatliwość, jedna trzecia ceny
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 986 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 196 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Dwa najtańsze modele z pogranicza frontier z września 2026 roku pojawiły się w odstępie jednego dnia, a ciekawą rzeczą w nich nie jest to, który z nich jest mądrzejszy. GPT-6 Sol — model, po który ludzie sięgają, gdy szukają GPT-6 Sol Pro, czyli ten sam model z reasoning.mode ustawionym na pro, a nie osobny produkt — trafił do sprzedaży 22 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych. Grok 4.7 od tego dostawcy trafił do sprzedaży 21 września w tej samej cenie 2,00 USD za tokeny wejściowe i 6,00 USD za tokeny wyjściowe. W neutralnym środowisku testowym Artificial Analysis oba dzieli różnica dwóch punktów indeksu i około dwóch dolarów na ukończone zadanie, a powodem tej różnicy nie są możliwości. Chodzi o to, ile tokenów każde z nich spala, żeby tam dotrzeć.
Sol wygenerował 77 milionów tokenów wyjściowych, uruchamiając Intelligence Index. Grok 4.7 wygenerował 240 milionów. Ten stosunek — nieco ponad trzy do jednego — to całe porównanie i odwraca wniosek, jaki daje tabela cen za token.
Dwie karty stawek i gdzie ta tania nie jest tania
Obaj dostawcy sami publikują te liczby; żaden nie został niezależnie wyceniony na nowo.
• Dane wejściowe — GPT-6 Sol 2,00 USD za milion tokenów vs Grok 4.7 2,00 USD za milion tokenów
• Wyjście — GPT-6 Sol 10,00 USD za milion tokenów vs Grok 4.7 6,00 USD za milion tokenów
• Wejście z pamięci podręcznej — GPT-6 Sol 0,20 USD za milion tokenów vs Grok 4.7 0,50 USD za milion tokenów; odczyt z pamięci podręcznej Sol jest dwa i pół raza tańszy, co jest odwrotnością tego, co sugeruje podana w nagłówku stawka za wyjście
• Okno kontekstowe — GPT-6 Sol 1 050 000 tokenów vs Grok 4.7 500 000 tokenów
• Dopłata za długi kontekst — GPT-6 Sol wycenia żądanie powyżej 272 000 tokenów wejściowych według 2× stawek za wejście i pamięć podręczną oraz 1,5× stawki za wyjście dla całego żądania, podczas gdy Grok 4.7 podwaja każdą stawkę przy 200 000 tokenów wejściowych, również dla całego żądania
• Data graniczna wiedzy — GPT-6 Sol 20 kwietnia 2026 vs Grok 4.7, którego datę graniczną pretreningu podano jako czerwiec 2026, z treningiem uzupełniającym do sierpnia
• Wysiłek rozumowania — GPT-6 Sol: brak, niski, średni (domyślny), wysoki, bardzo wysoki, maks. vs Grok 4.7: niski, średni (domyślny), wysoki, bardzo wysoki
• Modalność — oba przyjmują dane wejściowe w postaci tekstu i obrazu oraz zwracają tekst
To na pozycji odczytu z pamięci podręcznej kupujący powinien się skupić. Stawka Grok 4.7 za wyjście jest o 40% niższa, ale jego stawka za buforowane wejście jest o 150% wyższa, a to właśnie w buforowanym wejściu mieszczą się długie historie agentów i powtarzane prompty systemowe. Obciążenie, które w większości polega na ponownym odczytywaniu dużego, stabilnego kontekstu, sprawi, że oba modele okażą się znacznie bliżej siebie, niż sugeruje porównanie $6 z $10.

Niezależny rekord i ta jedna liczba, która o nim decyduje
Artificial Analysis to jedyny zestaw testowy, który zmierzył oba modele, a jego liczby warto zestawić obok siebie, ponieważ rozbieżność jest pouczająca.
• Indeks Inteligencji — GPT-6 Sol 48 przy maksymalnym wysiłku vs Grok 4.7 46 przy xhigh; oba znacznie powyżej mediany 25 dla porównywalnych modeli
• Koszt na zadanie indeksowania — GPT-6 Sol 1,06 USD vs Grok 4.7 3,74 USD
• Tokeny wyjściowe dla przebiegu indeksu — GPT-6 Sol 77M vs Grok 4.7 240M, w porównaniu z medianą 88M
• Szybkość generowania — Grok 4.7 zmierzono na 39 tokenów na sekundę, co samo środowisko testowe określa jako wyraźnie wolne; wyniku Sola na tej samej tablicy wyników nie podano w tym samym wierszu podsumowania
• Coding Agent Index — GPT-6 Sol 57 po 2,99 USD za zadanie vs Grok 4.7 56 z własnym harnessem Grok Build, o dziewięć punktów więcej niż Grok 4.6
Dwa punkty różnicy w indeksie, trzy i pół razy większy koszt na zadanie. To nie anomalia cenowa — to arytmetyka gadatliwości. Grok 4.7 to model, który myśli na głos długo; środowisko testowe oznacza go jako „bardzo gadatliwy” na tle mediany 88 mln tokenów, a koszt podąża za tokenami, nie za cennikiem.
Porównanie agentów kodujących niesie ze sobą zastrzeżenie, które tabela wyników ukrywa. Wynik 56 Grok 4.7 jest mierzony w wewnętrznym środowisku Grok Build firmy xAI, które stanowi konfigurację dostarczaną przez xAI i tę, względem której prowadzi ona testy porównawcze. Wynik 57 Sol jest mierzony w neutralnym środowisku. Przewaga własnego środowiska rzędu jednego lub dwóch punktów mieści się w zakresie, który tłumaczy wybór środowiska, co oznacza, że uczciwa interpretacja jest taka, że te dwa modele są na równi w kodowaniu agentowym — a nie że Sol jest o jeden punkt z przodu.

Co twierdzi każdy z dostawców, a czego nie pokazał żaden z nich
Materiały premierowe xAI są konkretne i opowiadają historię o długim horyzoncie: Grok 4.7 opiera się na większym modelu bazowym niż Grok 4.6 i przeszedł dłuższy cykl uczenia ze wzmocnieniem ukierunkowany na zadania, które „mogą zajmować godziny”, wyostrzając samoweryfikację, obsługę długiego kontekstu i zachowanie w środowisku Grok Bot. Podawane przez producenta liczby obejmują Terminal-Bench 4.0 na poziomie 38,0% wobec 20,3% w Grok 4.6, CursorBench 4.0 na poziomie 46,3% oraz DeepSWE v1.1 na poziomie 71,0%. Każda z tych wartości to pomiar samego xAI i żadna nie została niezależnie odtworzona; krążący niezależny wynik Terminal-Bench 4.0 jest istotnie niższy niż wynik producenta, co jest typowym kształtem tej luki.
Twierdzenia OpenAI dotyczące GPT-6 Sol są tymi już omówionymi powyżej i mają tę samą etykietę. Dane podane przez dostawcę to 33,2% w AutomationBench przy poziomie wysiłku xhigh w porównaniu z 26,9% Claude Opus 5 przy poziomie max, przy mniej więcej 9% kosztu na zadanie, oraz 68,8% w DeepSWE v1.1 przy maksymalnym wysiłku — w granicach 1,1 punktu od Claude Fable 5 przy xhigh, przy około 80% niższym koszcie na zadanie. Zwróć uwagę na cel porównania: własne wykresy OpenAI zestawiają Sol z modelami Anthropic, a nie z Grok 4.7. Żaden z dostawców nie opublikował bezpośredniego porównania z drugim.

Gdzie warstwa routingu zasługuje na swoje miejsce
OrcaRouter nie ma w ofercie żadnego z tych modeli w tym zestawieniu — Grok 4.7 i GPT-6 Sol są nieobecne w naszym katalogu, więc nie ma tu żadnego twierdzenia o ich cenie u nas. To, ile warta jest warstwa routingu w tej konkretnej parze, rozstrzyga się na poziomie trybu awarii, a nie cennika. Powód, by sięgnąć po Grok 4.7, to jego długohoryzontowe zachowanie agentowe; powód, by tego nie robić, to fakt, że prędkość wyjściowa na poziomie 39 tokenów na sekundę sprawia, iż długie uruchomienie agenta staje się na tyle wolne, że ma to znaczenie, a wolne uruchomienie to takie, które może przekroczyć limit czasu. Automatyczne przełączanie awaryjne między dostawcami oznacza, że długie zadanie można skierować do dowolnego modelu, który jest faktycznie dostępny, bez ryzyka, że ta prędkość stanie się pojedynczym punktem awarii, a DSL routingu wyraża wybór modelu jako regułę wewnątrz wywołania zamiast jako migrację — co ma tu znaczenie, ponieważ właściwa odpowiedź dla tej pary zależy od tego, czy zadanie jest żarłoczne tokenowo, czy wrażliwe na opóźnienia, a to jest właściwość żądania, a nie kwartału.
Reguła decyzyjna
• Kodowanie agentowe przy stałym budżecie — GPT-6 Sol. Poziom możliwości na neutralnym indeksie kodowania, przy mniej więcej jednej trzeciej kosztu na zadanie, bo osiąga ten poziom przy jednej trzeciej liczby tokenów.
• Zadania o długim horyzoncie, w których liczy się długość przebiegu — Grok 4.7. To wydanie zostało wytrenowane specjalnie do wielogodzinnej pracy, a liczby podawane przez dostawcę dla SWE-Marathon i CursorBench zmierzają dokładnie w tym kierunku.
• Wolumen wrażliwy na opóźnienia — na podstawie obecnych danych ani jedno, ani drugie. Koszt na zadanie Sola to lepsza liczba, ale zmierzone 39 tokenów na sekundę w Grok 4.7 to realne ograniczenie dla wszystkiego, co interaktywne.
• Obciążenia długiego kontekstu w większości obsługiwane z pamięci podręcznej — GPT-6 Sol, w wierszu odczytu z pamięci podręcznej, a nie w wierszu danych wyjściowych. Przy $0.20 w porównaniu z $0.50 za milion tokenów z pamięci podręcznej, a do tego okno dwukrotnie większe, argument jest tym mocniejszy, im większa część Twojego promptu pozostaje stała.
• Jeśli Twoje porównanie zostało zbudowane na podstawie cennika stawek za token — zbuduj je od nowa na podstawie kosztu na zadanie. 6,00 USD w porównaniu z 10,00 USD za wyjście to najmniej informująca para liczb w tym artykule i to właśnie od niej zaczyna się każda istniejąca strona.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
