
GPT-6.1 Sol vs Kimi K3: Pobieranie istnieje i wciąż nie jest tanią opcją
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Kimi K3 jest kontrprzykładem, który zwykle rozstrzyga tego typu spór. Moonshoot AI wypuściło w lipcu 2026 model o 2,8 biliona parametrów i opublikowało wagi — moonshotai/Kimi-K3 jest na Hugging Face, bez ograniczeń, z ponad milionem pobrań i ostatnią rewizją we wrześniu. Nie ma tu więc gwiazdki „otwarty z założenia, wstrzymany do czasu wzmocnienia zabezpieczeń”, nie ma dwutygodniowego opóźnienia, które trzeba przeczekać. GPT-6.1 Sol, którego OpenAI udostępniło 29 września 2026 r., jest zamknięty i dostępny wyłącznie przez API — i zawsze taki pozostanie. A w niezależnym rankingu model do pobrania uzyskuje 43,6 wobec 51,8 modelu zamkniętego, kosztując 2,00 USD za ukończone zadanie indeksowe w porównaniu z 0,72 USD. Otwarte wagi mają być tanią furtką awaryjną; w tym zestawieniu są droższą stroną transakcji, a powodem nie jest licencja.
Czym jest każdy model
Kimi K3 to rzadki model mieszanki ekspertów (sparse mixture-of-experts) o łącznej liczbie 2 800 miliardów parametrów i około 104 miliardach — jakieś 3,7% — aktywnych na token. Ma okno kontekstowe o rozmiarze 1 048 576 tokenów, przyjmuje tekst i obrazy jako dane wejściowe, a zwraca tekst. Opublikowany checkpoint to artefakt FP8 i jest to naprawdę duży plik do pobrania; wdrożenie produkcyjne na własnym sprzęcie to decyzja na poziomie klastra, a nie pojedynczej stacji roboczej. Twierdzenie architektoniczne Moonshoot dotyczy hybrydowego schematu liniowej uwagi, który — jak przekonuje — jest znacznie szybszy przy dekodowaniu długiego kontekstu, a do tego dochodzą prace nad połączeniami resztkowymi i routingiem, dzięki którym model o 2,8 biliona parametrów w ogóle dało się obsługiwać.
GPT-6.1 Sol to odświeżenie średniej klasy od OpenAI — poniżej GPT-6 Astra, powyżej GPT-6 Luna — z oknem 1 050 000 tokenów, limitem wyjścia 128 000 tokenów, obsługą tekstu, obrazów i plików oraz datą odcięcia wiedzy 30 kwietnia 2026 r. Rozumowanie działa low od max z medium jako wartością domyślną; none — poziom akceptowany przez poprzedni GPT-6 Sol — jest kategorycznie odrzucany, a własna notatka migracyjna OpenAI kieruje deweloperów do low zamiast niego. Cena wynosi 2,00 USD i 10,00 USD za milion tokenów, przy czym wejście z pamięci podręcznej kosztuje 0,10 USD.
Jedna linia na wymiar, obie strony w każdym:
• Wejście — GPT-6.1 Sol 2,00 USD za 1 mln vs Kimi K3 3,00 USD za 1 mln
• Wyjście — GPT-6.1 Sol 10,00 USD za 1 mln vs Kimi K3 15,00 USD za 1 mln
• Wejście z pamięci podręcznej — GPT-6.1 Sol 0,10 USD za 1 mln vs Kimi K3 0,30 USD za 1 mln
• Okno kontekstowe — 1 050 000 tokenów vs 1 048 576 tokenów; różnica 0,1%, nieistotna
• Maksymalne wyjście — 128 000 tokenów w obu przypadkach
• Parametry całkowite i aktywne — nieujawnione vs 2800 miliardów łącznie, 104 miliardy aktywne na token
• Modalność — tekst, obraz i plik na wejściu, tekst na wyjściu vs tekst i obraz na wejściu, tekst na wyjściu
• Wagi — zamknięte, tylko przez API vs otwarte, bez ograniczeń, ponad 1 mln pobrań
• Klauzula długiego kontekstu — zmienia cenę całego żądania powyżej 272 000 tokenów wejściowych na 2× wejście i pamięć podręczną oraz 1,5× wyjście vs brak równoważnej klauzuli na opublikowanej karcie
• Indeks inteligencji, niezależny, maksymalny wysiłek — 51,8 vs 43,6
• Koszt na zadanie indeksu, niezależny — 0,72 USD vs 2,00 USD
• Tokeny wyjściowe w przebiegu indeksu — 67 milionów vs 160 milionów, wobec mediany rankingu wynoszącej 140 milionów dla jej klasy porównawczej
Jedyna ewaluacja, w której K3 wygrywa, i dlaczego to ma znaczenie
Przed arytmetyką — wyjątek, bo jest prawdziwy. Oceniany ewaluacja po ewaluacji przy maksymalnym wysiłku na Artificial Analysis v4.3.2, GPT-6.1 Sol prowadzi w siedmiu z dziesięciu i nie remisuje w żadnej, ale modelem, który wygrywa ewaluację rozumowania na długim kontekście, jest K3:
• AA-LCR v1.1 — Kimi K3 0.887 vs GPT-6.1 Sol 0.830. Sześciopunktowa przewaga w ocenie opracowanej specjalnie do rozumowania na długich danych wejściowych.
• SciCode — Kimi K3 0.595 vs GPT-6.1 Sol 0.542. K3 również prowadzi w zakresie kodowania naukowego.
• Terminal-Bench 4.0 — Kimi K3 0.126 vs GPT-6.1 Sol 0.561. 43-punktowa różnica w drugą stronę i zdecydowanie największa rozbieżność w tym zestawieniu.
• Humanity's Last Exam — Kimi K3 0.469 vs GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 vs GPT-6.1 Sol 41.5; pod względem wiarygodności faktograficznej te dwa modele nie należą do tej samej klasy.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 vs GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 vs GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 i 0.234; Sol 0.649, 0.310 i 0.317.
Wynik AA-LCR jest tym, który warto traktować poważnie, ponieważ jest to jedyna liczba, która przeczy narracji o koszcie na zadanie, i wskazuje na obciążenie, w przypadku którego odpowiedź wyglądająca na tanią jest błędna w obu kierunkach. Jeśli Twój ruch to bardzo długie dane wejściowe, skromna generowana odpowiedź i intensywne ponowne wykorzystywanie stabilnego prefiksu — kształt, w którym rozwlekłość nigdy nie ma szansy dać o sobie znać — kombinacja w K3, na którą składają się najwyższej klasy wynik w długim kontekście, wejście obrazowe i możliwy do pobrania checkpoint, pasuje lepiej niż to, co oferuje Sol, a wartość kosztu na zadanie dla przebiegu indeksowego nie ma do ciebie zastosowania. To jest uczciwa wersja stwierdzenia „otwarte wagi są warte dopłaty”: czasami otwarty model jest po prostu lepszym modelem do danego zadania, a tutaj jest tak na jednej osi.
Warto też nazwać, co łączy te dwa zwycięstwa. K3 jest mocny tam, gdzie zadanie można rozwiązać w jednym długim akcie czytania lub rozumowania, a słaby tam, gdzie trzeba je wykonać w wielu małych krokach i sprawdzić. Różnica 43 punktów w Terminal-Bench i 22-punktowa luka w zakresie wszechwiedzy to to samo odkrycie widziane z dwóch stron: ciągłe wykonywanie zadań w trybie agentowym nie jest tym, pod kątem czego optymalizowano ten model.
Arytmetyka, która tak naprawdę o tym decyduje
Cennik K3 to 1,5× cennika Sol w każdej pozycji, a zmierzony koszt na ukończone zadanie indeksowe to 2,8×, przy czym różnicę między 1,5 a 2,8 całkowicie wyjaśnia liczba tokenów. Pomiar samego zarządu to 160 milionów tokenów wyjściowych dla K3 wobec 67 milionów dla Sol w tym samym zestawie dziesięciu ewaluacji. K3 generuje 2,4 razy więcej danych wyjściowych przy 1,5-krotności ceny, a 2,4 × 1,5 to 3,6 — wartość 2,00 USD wobec 0,72 USD podana przez zarząd jest nieco łagodniejsza niż czysty stosunek, ponieważ wkład danych wejściowych i pamięci podręcznej nieco ją niweluje, ale co do kierunku nie ma sporu.
Własny marketing Moonshoot jest z tym sprzeczny w sposób, który warto uważnie przeczytać. Firma twierdzi, że K3 emituje mniej tokenów wyjściowych niż jego poprzednik, a prace architektoniczne — schemat uwagi, konstrukcja residualna — są wymierzone wprost w koszt dekodowania długiego kontekstu. Oba te stwierdzenia mogą być prawdziwe, podczas gdy model nadal jest dwa razy bardziej rozwlekły niż mediana benchmarku w ogólnym zestawie. Te dwa twierdzenia dotyczą różnych rzeczy: wydajności względem poprzedniego Kimi i wydajności względem całej dziedziny. Tylko to drugie jest tym, według czego jesteś rozliczany, i to właśnie ono jest mierzone przez niezależną radę.
Buforowanie łagodzi to. Obie stawki za buforowane dane wejściowe stanowią jedną dziesiątą stawki za niebuforowane dane wejściowe danego modelu — 0,30 USD dla K3, 0,10 USD dla Sol — więc wiersz cache nie zmienia kolejności, ale oznacza, że obciążenie z dużą liczbą żądań i małą liczbą odpowiedzi zawęża lukę do mniej więcej stosunku z cennika, a nie do zmierzonego stosunku dla zadania. A klauzula długiego kontekstu Sol działa w przeciwnym kierunku: powyżej 272 000 tokenów wejściowych ponownie wycenia całe żądanie na 4,00 USD i 15,00 USD, przy cache na poziomie 0,20 USD, co jest jedynym przedziałem, w którym płaski cennik K3 wygrywa bezapelacyjnie. Warto o tym wiedzieć z dwóch powodów, ponieważ jest to również przedział, w którym wynik K3 dla długiego kontekstu jest najlepszą liczbą w tym porównaniu.

Ile tak naprawdę są tu warte otwarte wagi?
Trzy rzeczy – i warto je rozdzielić, ponieważ „open weights” zwykle używa się jako jednego argumentu, gdy tymczasem są trzy.
Po pierwsze, możesz odejść. Jeśli Moonshoot zostanie przejęty, zmieni licencję na przyszłe wersje, oznaczy K3 jako przestarzałe lub podniesie cenę swojego API, pobrany już punkt kontrolny nadal działa. Dla tego laboratorium nie jest to hipotetyczne: Moonshoot zawiesił nowe subskrypcje w ciągu około 48 godzin od wcześniejszego wydania, aby chronić jakość usług dla istniejących płacących klientów, co jest żywą demonstracją, że dostęp do API jest decyzją w zakresie polityki, a nie właściwością. Nic z tego nie pojawia się w tabeli kosztów na zadanie, a wszystko to jest realne.
Drugi powód jest taki, że możesz przypiąć wersję. Stała, dostrojona wersja, działająca w ramach granicy, którą kontrolujesz, jest czymś, co można pokazać audytorowi, a czego API nie zapewni. W przypadku ruchu objętego regulacjami jest to warte więcej niż cennik.
Trzecia — ta, którą zwykle się zakłada — jest taka, że będzie taniej. Nie jest. Checkpoint to artefakt FP8 z 2,8 biliona parametrów, a opublikowane wytyczne wdrożeniowe są zorientowane na konfiguracje wieloakceleratorowe, a nie na pojedynczy węzeł. Zespół, który już eksploatuje klaster tej klasy, ma tu realną opcję, a kalkulacja zmienia się całkowicie, ponieważ koszt krańcowy tokena staje się kosztem energii elektrycznej. Zespół, który tego nie robi, porównuje rachunek za API z zakupem kapitałowym, a rachunek za API wygrywa z dużą przewagą. Uczciwe podsumowanie jest takie, że otwarte wagi dają tu możliwość odejścia, a nie możliwość taniego uruchamiania.
Oba na jednym klawiszu, co jest tym elementem, który sprawia, że wymiana jest użyteczna.
Kimi K3 jest dostępny w OrcaRouter w cenie katalogowej samego Moonshoot — 3,00 USD i 15,00 USD za milion tokenów, z odczytem z pamięci podręcznej po 0,30 USD, bez zmian względem cennika dostawcy — a GPT-6.1 Sol trafił na nasze trasy w cenie OpenAI w dniu premiery: 2,00 USD i 10,00 USD, z danymi wejściowymi z pamięci podręcznej po 0,10 USD, a próg 272 000 tokenów przekazano dokładnie tak, jak podano. Do żadnej z tych cen nic nie jest dodawane. Platforma przekazuje ceny katalogowe dostawców bez narzutu, zamiast je podnosić, więc zmiana stawek Moonshoot i zmiana stawek OpenAI pojawiają się u nas tego samego dnia, co u dostawcy — bez drugiej umowy i bez pośrednika.

Powód, który ma większe znaczenie dla tej pary niż dla większości, jest taki, że te dwa modele należą do różnych trybów awarii. GPT-6.1 Sol to model, który uruchamiasz do długotrwałego wykonywania, pętli narzędziowych i niezawodności faktograficznej; Kimi K3 to model, który uruchamiasz dla bardzo długich danych wejściowych, gdzie chcesz uzyskać najlepszy wynik dla długiego kontekstu i chcesz punkt kontrolny jako zabezpieczenie na wypadek czyjejś decyzji biznesowej. To nie są konkurencyjne wybory, to dwie trasy dla tego samego ruchu. Utrzymywanie obu za jednym punktem końcowym, z automatycznym przełączaniem awaryjnym między nimi i regułą, która przenosi pracę z długimi danymi wejściowymi do K3, a pracę wykonawczą do Sol, jest tym, co zamienia „mamy zapasowy model o otwartych wagach” ze zdania w dokumencie projektowym w coś, co działa o trzeciej nad ranem podczas wywołania, które zawodzi.

Gdzie każdy należy
• Agenci terminalowi, kodowanie na skalę repozytorium, wieloetapowe wykonywanie — GPT-6.1 Sol, przy 43-punktowej różnicy w Terminal-Bench 4.0. To nie jest nawet blisko.
• Odpowiedzi tam, gdzie halucynacja jest kosztowna — GPT-6.1 Sol, przy 22-punktowej różnicy w AA-Omniscience.
• Bardzo długie dane wejściowe z krótką wygenerowaną odpowiedzią — Kimi K3. Najlepszy wynik rozumowania na długim kontekście w tym porównaniu, obsługa obrazów i gadatliwość, która nigdy nie ma szansy się ujawnić.
• Hostowanie u siebie lub stos inferencji, który musisz móc zamrozić — Kimi K3, i to tylko wtedy, gdy już eksploatujesz ten sprzęt. Checkpoint jest produktem końcowym; ekonomika jego uruchamiania to osobna kwestia.
• Zabezpieczenie na wypadek zmiany warunków przez dostawcę — Kimi K3, i to jest jedyny argument, na który GPT-6.1 Sol nie potrafi odpowiedzieć za żadną cenę.
• Wybór na podstawie cennika — ani K3, ani Sol nie jest tanią opcją w tym porównaniu, a żaden z nich nie jest tanią opcją w linii GPT-6. Jeśli faktura jest decydującym kryterium, model, którego szukasz, jest niżej na liście cen, a nie w tej tabeli.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
