
Grok 4.7 vs Kimi K3: Połowa ceny, połowa kontekstu, zero wag
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Weź miesiąc pracy nad kodowaniem agentowym zużywający 300 milionów tokenów i przepuść go przez oba modele według ich cen katalogowych, a wybór przestaje wyglądać jak spór o benchmarki. Grok 4.7, który SpaceXAI udostępniło 21 września 2026 r., pobiera 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. Kimi K3, który Moonshot AI udostępniło 16 lipca 2026 r., pobiera 3 i 15 dolarów. W tym hipotetycznym miesiącu — powiedzmy 200 mln tokenów wejściowych i 100 mln wyjściowych — Grok 4.7 kosztuje około 1000 dolarów, a Kimi K3 około 2100 dolarów. Ta różnica to nie kwestia zaokrąglenia; to budżet na drugi model. W zamian Kimi K3 daje okno kontekstowe o rozmiarze 1 000 000 tokenów zamiast 500 000, natywne wejście wideo oraz obrazów, a także wagi do pobrania. Grok 4.7 daje szybszy, tańszy, zamknięty model, który został wyraźnie wytrenowany do długoterminowej pracy w terminalu, na którą celuje również Kimi K3. Oba są klasy frontier. To nie ten sam zakup.
Te dwa modele, w skrócie
Grok 4.7 to graniczny model SpaceXAI do kodowania i pracy z wiedzą, zbudowany na większym modelu bazowym niż Grok 4.6 i poddany dłuższemu treningowi z uczeniem ze wzmocnieniem, ukierunkowanemu na zadania, które mogą zajmować godziny. Jest zastrzeżony — brak wag, brak pobierania — obsługuje okno kontekstu o rozmiarze 500 000 tokenów, przyjmuje tekst i obrazy, a zwraca tekst, i obsługuje poziomy wysiłku rozumowania od niskiego do xhigh. Jego sztandarową obietnicą są szybkość i cena: SpaceXAI pozycjonuje go jako około dwa razy szybszego od porównywalnych modeli za około połowę ceny.
Kimi K3 to flagowy otwarty model typu mieszanka ekspertów (MoE) firmy Moonshot AI, pierwszy otwarty model w klasie trzech bilionów parametrów: 2,8 biliona parametrów łącznie, z 104 miliardami aktywnymi na token, zbudowany na Kimi Delta Attention i wagach MXFP4 uwzględniających kwantyzację. Przyjmuje tekst, obrazy i wideo, obsługuje kontekst 1 000 000 tokenów, działa z rozumowaniem zawsze włączonym i konfigurowalnym nakładem, a jego wagi można pobrać na licencji Kimi K3 — użycie komercyjne dozwolone, z ograniczeniami. Z założenia jest to model, który możesz zabrać ze sobą do domu.
Na tym polega cała różnica strukturalna między nimi. Jeden to tani, szybki, zamknięty endpoint. Drugi to droższy, wolniejszy, otwarty artefakt z dwukrotnie większym kontekstem. Wszystko poniżej jest konsekwencją tego.
Co tak naprawdę porównują benchmarki
W tym miejscu większość opracowań porównujących Grok 4.7 z Kimi K3 się myli, więc warto powiedzieć to wprost: publikowane liczby obu modeli w dużej mierze nie mierzą tych samych rzeczy, a co najmniej jedna para, która wygląda na porównywalną, taka nie jest.
Zacznij od pary, która jest naprawdę myląca. Materiały premierowe Kimi K3 podają wynik 88,3 w Terminal-Bench 2.1. Materiały premierowe Grok 4.7 podają Terminal-Bench 4.0 na poziomie 38,0%. To różne wersje benchmarku z różnymi zestawami zadań i różnym sposobem punktowania, a zestawienie ich obok siebie sugerowałoby, że Kimi K3 jest ponad dwukrotnie lepszym modelem agentowym. To nie jest możliwa do obrony interpretacja i nikt nie powinien jej powtarzać. Obie liczby są też raportowane przez dostawcę — żadnej nie odtworzono niezależnie.
To, co można porównać, to niezależny kompozyt, i tam oba są blisko siebie. W aktualnym Artificial Analysis Intelligence Index, w wersji v4.3.2, Kimi K3 uzyskuje 44 — drugie miejsce spośród 113 modeli, najwyższa pozycja dowolnego modelu o otwartych wagach na liście. Grok 4.7 uzyskuje 46, szesnaste miejsce spośród 655. Różnica dwóch punktów, przy czym pozycję Kimi K3 uzyskano przy maksymalnym wysiłku rozumowania. W łączonym kompozycie te modele są sobie równe.
• Niezależny kompozyt — Grok 4.7: 46 w AA Intelligence Index v4.3.2 vs Kimi K3: 44 w tej samej wersji. W praktyce remis.
• Okno kontekstu — Grok 4.7: 500 000 tokenów vs Kimi K3: 1 000 000 tokenów. Prawdziwa, bezwarunkowa przewaga Kimi K3 i jedyna różnica w specyfikacji bez żadnego zastrzeżenia.
• Modalności wejściowe — Grok 4.7 tekst i obraz vs Kimi K3 tekst, obraz i wideo. Kimi K3 jest szerszy, jeśli w Twoim obciążeniu jest wideo.
• Wagi — Grok 4.7 zastrzeżone, brak możliwości pobrania vs Kimi K3 otwarte wagi na licencji Kimi K3. W przypadku wymogu wdrożenia lokalnego (on-premise) lub w środowisku odizolowanym (air-gapped) to jedyna pozycja, która ma znaczenie.
• Cena za milion tokenów — Grok 4.7: 2 USD za wejście / 6 USD za wyjście vs Kimi K3: 3 USD za wejście / 15 USD za wyjście, przy czym stawka Kimi za buforowane dane wejściowe wynosi 0,30 USD za milion. Grok 4.7 jest tańszy pod każdym względem, a na wyjściu – drastycznie tańszy.
• Kontrola nakładu rozumowania — Grok 4.7 od niskiego po xhigh vs Kimi K3 zawsze włączone z konfigurowalnym nakładem. Funkcjonalnie podobne; różnica polega na tym, że Grok 4.7 pozwala zmniejszyć nakład rozumowania.
• Dowody agentowe raportowane przez dostawcę — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (wszystkie raportowane przez dostawcę) w porównaniu z Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena pierwsze miejsce z 1 679 Elo (raportowane przez dostawcę w momencie premiery). Nieporównywalne — patrz wyżej.


Gdzie faktycznie trafiają pieniądze
Cennik nie oddaje w pełni tej różnicy, ponieważ oba modele zużywają tokeny inaczej. Grok 4.7 to rozwlekły model rozumujący — Artificial Analysis zmierzyło 240 milionów tokenów wyjściowych wygenerowanych podczas uruchamiania swojego Intelligence Index, wobec mediany 92 milionów wśród modeli. Kimi K3 reprezentuje przeciwny rodzaj kosztowności: to duży, stale aktywny model rozumujący, a przy cenie 15 USD za milion tokenów wyjściowych kupujesz właśnie rozwlekłość.
Zatem uczciwy model kosztów to nie „2 USD/6 USD kontra 3 USD/15 USD”. To liczba tokenów wyjściowych na ukończone zadanie pomnożona przez stawkę za tokeny wyjściowe plus tokeny wejściowe, z uwzględnieniem każdej ponownej próby, pomnożone przez stawkę za tokeny wejściowe. Model, który rozwiązuje zadanie w jednym długim przebiegu przy 6 USD za milion, może pokonać model, który potrzebuje trzech prób przy 15 USD za milion, a także może z nim przegrać, jeśli przebiegi taniego modelu są wystarczająco długie. To pomiar, który przeprowadzasz we własnym repozytorium, a nie taki, który ktokolwiek publikuje dla ciebie.
Jedna asymetria jest warta poznania, zanim to uruchomisz: Grok 4.6, poprzednik modelu Grok 4.7, stosuje klif cenowy przy 200 000 tokenów wejściowych, w którym żądanie przekraczające tę granicę powoduje ponowne rozliczenie całego żądania po podwójnej stawce. Praca z długim kontekstem po stronie Grok wymaga sprawdzenia tego w aktualnym cenniku modelu, który wdrażasz, ponieważ okno 500 000 tokenów i klif przy 200 000 tokenów źle ze sobą współdziałają. Cennik Kimi K3 jest stały, co jest mniej rzucającą się w oczy zaletą z tych dwóch.
Gdzie każde z nich się psuje
Oba modele mają tryb awarii, którego materiał premierowy nie wysuwa na pierwszy plan, i są to różne awarie.
Słabym punktem Kimi K3 jest niezawodność pod długotrwałym obciążeniem. Społeczność i niezależne testy przy premierze informowały, że jego wydajność w zadaniach agentowych spada w miarę wydłużania przebiegów — mocne wyniki pojedynczych prób, słabsze wskaźniki sukcesu przy dłuższym działaniu — a jego prędkość generowania oscyluje wokół 37–38 tokenów na sekundę, co jest wolne jak na interaktywne kodowanie. Moonshot musiał także wkrótce po premierze wstrzymać nowe subskrypcje konsumenckie, ponieważ popyt przerósł możliwości, co wiele mówi o zapasie mocy obsługi po stronie hostowanej.
Grok 4.7 ma odwrotny profil: jest szybki, tani i zamknięty, co oznacza, że nie możesz go zbadać, nie możesz uruchomić go samodzielnie i nie możesz zabezpieczyć się na wypadek wycofania. SpaceXAI już publicznie zapowiedział kolejność Grok 4.8, Grok 4.9 i Grok 5 po tej wersji, a Grok 4.6 przetrwał około pięciu tygodni, zanim został zastąpiony. Cokolwiek zbudujesz na Grok 4.7, powinno być zbudowane tak, aby identyfikator modelu był wartością konfiguracyjną, a nie założeniem.
Istnieje jeszcze trzecia kwestia, która nie jest porażką żadnego z tych modeli: żaden z nich nie jest właściwym rozwiązaniem do dwutygodniowego autonomicznego działania, a obaj dostawcy zademonstrowali dokładnie coś takiego. Opublikowane 16-dniowe i 48-godzinne demonstracje autonomicznego kodowania są prowadzone przez dostawców, na zadaniach wybranych przez dostawców, bez niezależnego odtworzenia. Warto o nich wiedzieć, ale nie warto planować na ich podstawie.

Uruchamianie obu i dlaczego to jest prawdziwa odpowiedź
Luka kosztowa i luka kontekstowa wskazują w przeciwnych kierunkach, co jest argumentem przeciw wybieraniu jednego z nich. Kimi K3 uzasadnia swoją cenę w pracy w skali repozytorium, gdzie okno 1M oznacza, że nie dzieli się danych wejściowych na fragmenty, oraz w przypadku wszystkiego, co musi być hostowane samodzielnie. Grok 4.7 uzasadnia swoją cenę przy dużej skali — pętle agentowe o wysokiej liczbie tur, potoki intensywnie wykorzystujące wywołania narzędzi i długie sesje terminalowe, w których dominują szybkość i koszt wyników.
Kimi K3 jest dostępny w OrcaRouter, co sprawia, że ten podział to decyzja dotycząca routingu, a nie zakupów. Znajduje się w katalogu w cenie katalogowej Moonshot, a ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez marży (0%), obniżka ceny przez dostawcę obowiązuje tutaj tego samego dnia, w którym zostaje ogłoszona, a nie dopiero przy kolejnym odnowieniu umowy. W przypadku obciążeń, w których przebieg długiego kontekstu i przebieg wykonawczy powinny współpracować, a nie konkurować — jeden model trzyma całe repozytorium w zasięgu wzroku, drugi działa na jego podstawie — DSL routingu łączy kilka modeli w jedno wywołanie, a fuzja modeli pozwala panelowi modeli odpowiadać wspólnie, gdy zadanie jest warte dodatkowego wydatku. Jeden klucz API obejmuje Kimi K3 oraz ponad 200 innych modeli, więc wykonawcza połowa tego podziału może pochodzić z modelu, który jest najtańszy i najszybszy w danym zadaniu, a nie z tego, który akurat ma kontekst.
Trzeba wyjaśnić jedną rzecz: otwarte wagi Kimi K3 można pobrać, ale OrcaRouter kieruje ruch do hostowanego punktu końcowego. Jeśli Twoje wymaganie rzeczywiście dotyczy wnioskowania on-premise, to jest to projekt samodzielnego hostowania na własnym sprzęcie, a nie decyzja o routingu — i to jedyny scenariusz, w którym to porównanie ma tylko jedną poprawną odpowiedź.
Werdykt i jedna liczba, którą warto zapamiętać
Jeśli wybierasz na podstawie kosztu i szybkości, Grok 4.7 wygrywa i to bezapelacyjnie: o połowę niższa cena danych wejściowych, mniej niż połowa ceny danych wyjściowych, szybsza obsługa i regulacja rozumowania, którą możesz zmniejszyć. Jeśli wybierasz na podstawie kontekstu, szerokości modalności lub możliwości posiadania modelu, Kimi K3 wygrywa według tych samych kryteriów. Jeśli wybierasz wyłącznie na podstawie możliwości, niezależny kompozyt mówi, że różnią się o dwa punkty, i powinieneś zdecydować na podstawie własnej oceny, a nie na podstawie wykresu premiery któregokolwiek dostawcy.
Liczba, której trzeba się trzymać, to ta z góry: $2/$6 w porównaniu z $3/$15. Wszystko inne w tym porównaniu podlega negocjacjom, a ten stosunek nie.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
