Wygenerowana dwukolumnowa tablica wyników porównawczych zatytułowana „GPT-6.1 Sol vs Kimi K3 – tablica wyników”. Lewa kolumna „GPT-6.1 Sol”: wiersze o treści „Indeks inteligencji: 51,8”, „Koszt na zadanie indeksowe: 0,72 $”, „Tokeny wyjściowe w przebiegu indeksu: 67 mln”, „AA-LCR długi kontekst: 0,83”, „Okno kontekstowe: 1 050 000”, „Wagi: zamknięte”. Prawa kolumna „Kimi K3”: wiersze o treści „Indeks inteligencji: 43,6”, „Koszt na zadanie indeksowe: 2,00 $”, „Tokeny wyjściowe w przebiegu indeksu: 160 mln”, „AA-LCR długi kontekst: 0,89”, „Okno kontekstowe: 1 048 576”, „Wagi: otwarte na Hugging Face”. Stopka o treści „Niezależne wartości według Artificial Analysis v4.3.2 przy maksymalnym wysiłku”.
Guides & Insights

GPT-6.1 Sol vs Kimi K3: Pobieranie istnieje i wciąż nie jest tanią opcją

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kimi K3 jest kontrprzykładem, który zwykle rozstrzyga tego typu spór. Moonsh​oot AI wypuściło w lipcu 2026 model o 2,8 biliona parametrów i opublikowało wagi — moonshotai/Kimi-K3 jest na Hugging Face, bez ograniczeń, z ponad milionem pobrań i ostatnią rewizją we wrześniu. Nie ma tu więc gwiazdki „otwarty z założenia, wstrzymany do czasu wzmocnienia zabezpieczeń”, nie ma dwutygodniowego opóźnienia, które trzeba przeczekać. GPT-6.1 Sol, którego Open​AI udostępniło 29 września 2026 r., jest zamknięty i dostępny wyłącznie przez API — i zawsze taki pozostanie. A w niezależnym rankingu model do pobrania uzyskuje 43,6 wobec 51,8 modelu zamkniętego, kosztując 2,00 USD za ukończone zadanie indeksowe w porównaniu z 0,72 USD. Otwarte wagi mają być tanią furtką awaryjną; w tym zestawieniu są droższą stroną transakcji, a powodem nie jest licencja.

Czym jest każdy model

Kimi K3 to rzadki model mieszanki ekspertów (sparse mixture-of-experts) o łącznej liczbie 2 800 miliardów parametrów i około 104 miliardach — jakieś 3,7% — aktywnych na token. Ma okno kontekstowe o rozmiarze 1 048 576 tokenów, przyjmuje tekst i obrazy jako dane wejściowe, a zwraca tekst. Opublikowany checkpoint to artefakt FP8 i jest to naprawdę duży plik do pobrania; wdrożenie produkcyjne na własnym sprzęcie to decyzja na poziomie klastra, a nie pojedynczej stacji roboczej. Twierdzenie architektoniczne Moonsh​oot dotyczy hybrydowego schematu liniowej uwagi, który — jak przekonuje — jest znacznie szybszy przy dekodowaniu długiego kontekstu, a do tego dochodzą prace nad połączeniami resztkowymi i routingiem, dzięki którym model o 2,8 biliona parametrów w ogóle dało się obsługiwać.

GPT-6.1 Sol to odświeżenie średniej klasy od Open​AI — poniżej GPT-6 Astra, powyżej GPT-6 Luna — z oknem 1 050 000 tokenów, limitem wyjścia 128 000 tokenów, obsługą tekstu, obrazów i plików oraz datą odcięcia wiedzy 30 kwietnia 2026 r. Rozumowanie działa low od max z medium jako wartością domyślną; none — poziom akceptowany przez poprzedni GPT-6 Sol — jest kategorycznie odrzucany, a własna notatka migracyjna Open​AI kieruje deweloperów do low zamiast niego. Cena wynosi 2,00 USD i 10,00 USD za milion tokenów, przy czym wejście z pamięci podręcznej kosztuje 0,10 USD.

Jedna linia na wymiar, obie strony w każdym:

• Wejście — GPT-6.1 Sol 2,00 USD za 1 mln vs Kimi K3 3,00 USD za 1 mln
• Wyjście — GPT-6.1 Sol 10,00 USD za 1 mln vs Kimi K3 15,00 USD za 1 mln
• Wejście z pamięci podręcznej — GPT-6.1 Sol 0,10 USD za 1 mln vs Kimi K3 0,30 USD za 1 mln
• Okno kontekstowe — 1 050 000 tokenów vs 1 048 576 tokenów; różnica 0,1%, nieistotna
• Maksymalne wyjście — 128 000 tokenów w obu przypadkach
• Parametry całkowite i aktywne — nieujawnione vs 2800 miliardów łącznie, 104 miliardy aktywne na token
• Modalność — tekst, obraz i plik na wejściu, tekst na wyjściu vs tekst i obraz na wejściu, tekst na wyjściu
• Wagi — zamknięte, tylko przez API vs otwarte, bez ograniczeń, ponad 1 mln pobrań
• Klauzula długiego kontekstu — zmienia cenę całego żądania powyżej 272 000 tokenów wejściowych na 2× wejście i pamięć podręczną oraz 1,5× wyjście vs brak równoważnej klauzuli na opublikowanej karcie
• Indeks inteligencji, niezależny, maksymalny wysiłek — 51,8 vs 43,6
• Koszt na zadanie indeksu, niezależny — 0,72 USD vs 2,00 USD
• Tokeny wyjściowe w przebiegu indeksu — 67 milionów vs 160 milionów, wobec mediany rankingu wynoszącej 140 milionów dla jej klasy porównawczej

Jedyna ewaluacja, w której K3 wygrywa, i dlaczego to ma znaczenie

Przed arytmetyką — wyjątek, bo jest prawdziwy. Oceniany ewaluacja po ewaluacji przy maksymalnym wysiłku na Artificial Analysis v4.3.2, GPT-6.1 Sol prowadzi w siedmiu z dziesięciu i nie remisuje w żadnej, ale modelem, który wygrywa ewaluację rozumowania na długim kontekście, jest K3:

• AA-LCR v1.1 — Kimi K3 0.887 vs GPT-6.1 Sol 0.830. Sześciopunktowa przewaga w ocenie opracowanej specjalnie do rozumowania na długich danych wejściowych.
• SciCode — Kimi K3 0.595 vs GPT-6.1 Sol 0.542. K3 również prowadzi w zakresie kodowania naukowego.
• Terminal-Bench 4.0 — Kimi K3 0.126 vs GPT-6.1 Sol 0.561. 43-punktowa różnica w drugą stronę i zdecydowanie największa rozbieżność w tym zestawieniu.
• Humanity's Last Exam — Kimi K3 0.469 vs GPT-6.1 Sol 0.529.
• AA-Omniscience — Kimi K3 19.7 vs GPT-6.1 Sol 41.5; pod względem wiarygodności faktograficznej te dwa modele nie należą do tej samej klasy.
• GDPval-AA v2.1 — Kimi K3 Elo 1536.5 vs GPT-6.1 Sol Elo 1575.1.
• MMMU-Pro — Kimi K3 0.805 vs GPT-6.1 Sol 0.860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0.583, 0.22 i 0.234; Sol 0.649, 0.310 i 0.317.

Wynik AA-LCR jest tym, który warto traktować poważnie, ponieważ jest to jedyna liczba, która przeczy narracji o koszcie na zadanie, i wskazuje na obciążenie, w przypadku którego odpowiedź wyglądająca na tanią jest błędna w obu kierunkach. Jeśli Twój ruch to bardzo długie dane wejściowe, skromna generowana odpowiedź i intensywne ponowne wykorzystywanie stabilnego prefiksu — kształt, w którym rozwlekłość nigdy nie ma szansy dać o sobie znać — kombinacja w K3, na którą składają się najwyższej klasy wynik w długim kontekście, wejście obrazowe i możliwy do pobrania checkpoint, pasuje lepiej niż to, co oferuje Sol, a wartość kosztu na zadanie dla przebiegu indeksowego nie ma do ciebie zastosowania. To jest uczciwa wersja stwierdzenia „otwarte wagi są warte dopłaty”: czasami otwarty model jest po prostu lepszym modelem do danego zadania, a tutaj jest tak na jednej osi.

Warto też nazwać, co łączy te dwa zwycięstwa. K3 jest mocny tam, gdzie zadanie można rozwiązać w jednym długim akcie czytania lub rozumowania, a słaby tam, gdzie trzeba je wykonać w wielu małych krokach i sprawdzić. Różnica 43 punktów w Terminal-Bench i 22-punktowa luka w zakresie wszechwiedzy to to samo odkrycie widziane z dwóch stron: ciągłe wykonywanie zadań w trybie agentowym nie jest tym, pod kątem czego optymalizowano ten model.

Arytmetyka, która tak naprawdę o tym decyduje

Cennik K3 to 1,5× cennika Sol w każdej pozycji, a zmierzony koszt na ukończone zadanie indeksowe to 2,8×, przy czym różnicę między 1,5 a 2,8 całkowicie wyjaśnia liczba tokenów. Pomiar samego zarządu to 160 milionów tokenów wyjściowych dla K3 wobec 67 milionów dla Sol w tym samym zestawie dziesięciu ewaluacji. K3 generuje 2,4 razy więcej danych wyjściowych przy 1,5-krotności ceny, a 2,4 × 1,5 to 3,6 — wartość 2,00 USD wobec 0,72 USD podana przez zarząd jest nieco łagodniejsza niż czysty stosunek, ponieważ wkład danych wejściowych i pamięci podręcznej nieco ją niweluje, ale co do kierunku nie ma sporu.

Własny marketing Moonsh​oot jest z tym sprzeczny w sposób, który warto uważnie przeczytać. Firma twierdzi, że K3 emituje mniej tokenów wyjściowych niż jego poprzednik, a prace architektoniczne — schemat uwagi, konstrukcja residualna — są wymierzone wprost w koszt dekodowania długiego kontekstu. Oba te stwierdzenia mogą być prawdziwe, podczas gdy model nadal jest dwa razy bardziej rozwlekły niż mediana benchmarku w ogólnym zestawie. Te dwa twierdzenia dotyczą różnych rzeczy: wydajności względem poprzedniego Kimi i wydajności względem całej dziedziny. Tylko to drugie jest tym, według czego jesteś rozliczany, i to właśnie ono jest mierzone przez niezależną radę.

Buforowanie łagodzi to. Obie stawki za buforowane dane wejściowe stanowią jedną dziesiątą stawki za niebuforowane dane wejściowe danego modelu — 0,30 USD dla K3, 0,10 USD dla Sol — więc wiersz cache nie zmienia kolejności, ale oznacza, że obciążenie z dużą liczbą żądań i małą liczbą odpowiedzi zawęża lukę do mniej więcej stosunku z cennika, a nie do zmierzonego stosunku dla zadania. A klauzula długiego kontekstu Sol działa w przeciwnym kierunku: powyżej 272 000 tokenów wejściowych ponownie wycenia całe żądanie na 4,00 USD i 15,00 USD, przy cache na poziomie 0,20 USD, co jest jedynym przedziałem, w którym płaski cennik K3 wygrywa bezapelacyjnie. Warto o tym wiedzieć z dwóch powodów, ponieważ jest to również przedział, w którym wynik K3 dla długiego kontekstu jest najlepszą liczbą w tym porównaniu.

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

Ile tak naprawdę są tu warte otwarte wagi?

Trzy rzeczy – i warto je rozdzielić, ponieważ „open weights” zwykle używa się jako jednego argumentu, gdy tymczasem są trzy.

Po pierwsze, możesz odejść. Jeśli Moonsh​oot zostanie przejęty, zmieni licencję na przyszłe wersje, oznaczy K3 jako przestarzałe lub podniesie cenę swojego API, pobrany już punkt kontrolny nadal działa. Dla tego laboratorium nie jest to hipotetyczne: Moonsh​oot zawiesił nowe subskrypcje w ciągu około 48 godzin od wcześniejszego wydania, aby chronić jakość usług dla istniejących płacących klientów, co jest żywą demonstracją, że dostęp do API jest decyzją w zakresie polityki, a nie właściwością. Nic z tego nie pojawia się w tabeli kosztów na zadanie, a wszystko to jest realne.

Drugi powód jest taki, że możesz przypiąć wersję. Stała, dostrojona wersja, działająca w ramach granicy, którą kontrolujesz, jest czymś, co można pokazać audytorowi, a czego API nie zapewni. W przypadku ruchu objętego regulacjami jest to warte więcej niż cennik.

Trzecia — ta, którą zwykle się zakłada — jest taka, że będzie taniej. Nie jest. Checkpoint to artefakt FP8 z 2,8 biliona parametrów, a opublikowane wytyczne wdrożeniowe są zorientowane na konfiguracje wieloakceleratorowe, a nie na pojedynczy węzeł. Zespół, który już eksploatuje klaster tej klasy, ma tu realną opcję, a kalkulacja zmienia się całkowicie, ponieważ koszt krańcowy tokena staje się kosztem energii elektrycznej. Zespół, który tego nie robi, porównuje rachunek za API z zakupem kapitałowym, a rachunek za API wygrywa z dużą przewagą. Uczciwe podsumowanie jest takie, że otwarte wagi dają tu możliwość odejścia, a nie możliwość taniego uruchamiania.

Oba na jednym klawiszu, co jest tym elementem, który sprawia, że wymiana jest użyteczna.

Kimi K3 jest dostępny w OrcaRouter w cenie katalogowej samego Moonsh​oot — 3,00 USD i 15,00 USD za milion tokenów, z odczytem z pamięci podręcznej po 0,30 USD, bez zmian względem cennika dostawcy — a GPT-6.1 Sol trafił na nasze trasy w cenie Open​AI w dniu premiery: 2,00 USD i 10,00 USD, z danymi wejściowymi z pamięci podręcznej po 0,10 USD, a próg 272 000 tokenów przekazano dokładnie tak, jak podano. Do żadnej z tych cen nic nie jest dodawane. Platforma przekazuje ceny katalogowe dostawców bez narzutu, zamiast je podnosić, więc zmiana stawek Moonsh​oot i zmiana stawek Open​AI pojawiają się u nas tego samego dnia, co u dostawcy — bez drugiej umowy i bez pośrednika.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

Powód, który ma większe znaczenie dla tej pary niż dla większości, jest taki, że te dwa modele należą do różnych trybów awarii. GPT-6.1 Sol to model, który uruchamiasz do długotrwałego wykonywania, pętli narzędziowych i niezawodności faktograficznej; Kimi K3 to model, który uruchamiasz dla bardzo długich danych wejściowych, gdzie chcesz uzyskać najlepszy wynik dla długiego kontekstu i chcesz punkt kontrolny jako zabezpieczenie na wypadek czyjejś decyzji biznesowej. To nie są konkurencyjne wybory, to dwie trasy dla tego samego ruchu. Utrzymywanie obu za jednym punktem końcowym, z automatycznym przełączaniem awaryjnym między nimi i regułą, która przenosi pracę z długimi danymi wejściowymi do K3, a pracę wykonawczą do Sol, jest tym, co zamienia „mamy zapasowy model o otwartych wagach” ze zdania w dokumencie projektowym w coś, co działa o trzeciej nad ranem podczas wywołania, które zawodzi.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Gdzie każdy należy

• Agenci terminalowi, kodowanie na skalę repozytorium, wieloetapowe wykonywanie — GPT-6.1 Sol, przy 43-punktowej różnicy w Terminal-Bench 4.0. To nie jest nawet blisko.
• Odpowiedzi tam, gdzie halucynacja jest kosztowna — GPT-6.1 Sol, przy 22-punktowej różnicy w AA-Omniscience.
• Bardzo długie dane wejściowe z krótką wygenerowaną odpowiedzią — Kimi K3. Najlepszy wynik rozumowania na długim kontekście w tym porównaniu, obsługa obrazów i gadatliwość, która nigdy nie ma szansy się ujawnić.
• Hostowanie u siebie lub stos inferencji, który musisz móc zamrozić — Kimi K3, i to tylko wtedy, gdy już eksploatujesz ten sprzęt. Checkpoint jest produktem końcowym; ekonomika jego uruchamiania to osobna kwestia.
• Zabezpieczenie na wypadek zmiany warunków przez dostawcę — Kimi K3, i to jest jedyny argument, na który GPT-6.1 Sol nie potrafi odpowiedzieć za żadną cenę.
• Wybór na podstawie cennika — ani K3, ani Sol nie jest tanią opcją w tym porównaniu, a żaden z nich nie jest tanią opcją w linii GPT-6. Jeśli faktura jest decydującym kryterium, model, którego szukasz, jest niżej na liście cen, a nie w tej tabeli.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie