
GPT-6 Luna vs Kimi K3: czterokrotnie większa przepustowość, jedna trzydziesta ceny, jeden prawdziwy wyjątek
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dwa modele, oba wydane w ciągu ostatnich trzech miesięcy, oba pozycjonowane jako tania półka w rodzinie modeli frontier, i oba błędnie rozumieją, co oznacza „tania półka”, w ten sam sposób — a właściwie wcale nie. Kimi K3 to flagowy model Moonshot AI o otwartych wagach, publicznie dostępny na licencji Modified MIT od 27 lipca 2026 r., w cenie 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, z odczytami z pamięci podręcznej po 0,30 USD. GPT-6 Luna to poziom masowy tego dostawcy, ogólnie dostępny od 22 września 2026 r. w cenie 0,10 USD i 0,50 USD, z odczytami z pamięci podręcznej po jednym cencie. Trzydzieści razy więcej na wejściu, trzydzieści razy więcej na wyjściu, a do tego licencja po jednej stronie, której druga nie może zaoferować za żadną cenę.
To jednak nie cennik decyduje o tym zestawieniu, ponieważ nie jest wystarczająco zbliżony, by wymagać decyzji. Decyduje o tym liczba, której żaden z dostawców nie umieszcza w nagłówku: zmierzona prędkość generowania. Kimi K3 generuje 38,7 tokena na sekundę. GPT-6 Luna generuje 153,9. To czterokrotna różnica, a w przypadku każdego obciążenia, w którym model jest komponentem wewnątrz pętli, a nie punktem końcowym, z którym rozmawia człowiek, czterokrotna różnica przepustowości zmienia architekturę, a nie rachunek.
Czym właściwie jest ta dwójka
Kimi K3 to model typu mixture-of-experts o 2,8 biliona parametrów, z 104 miliardami parametrów aktywnych na token, oknem kontekstowym wynoszącym 1 048 576 tokenów, limitem wyjściowym 1 048 576 tokenów oraz wagami opublikowanymi na Hugging Face na licencji Modified MIT. Jest to model o otwartych wagach z najwyższym wynikiem w niezależnym rankingu — pierwszy wśród 112 modeli o otwartych wagach — i zajmuje pierwsze miejsce w rankingu WebDev Code Arena z wynikiem 1 679 Elo. Moonshot podaje 88,3% w Terminal-Bench 2.0, co jest wynikiem dostawcy, a nie niezależnie odtworzonym.
GPT-6 Luna to najmniejszy poziom w generacji GPT-6 OpenAI, plasujący się poniżej GPT-6 Sol w cenie 2,00 USD/10,00 USD i znacznie poniżej flagowego GPT-6 Astra w cenie 10,00 USD/50,00 USD. Tekst i obrazy na wejściu, tekst na wyjściu, okno 1 050 000 tokenów z maksymalnym wejściem 922 000 i limitem wyjścia 128 000 tokenów, a także możliwość wyboru nakładu rozumowania od none przez low, medium, high, xhigh i max, domyślnie medium. Jest zamknięty, z pojedynczym identyfikatorem i dostępny dla każdego, kto ma klucz API.
Jeden to pobranie. Drugi to endpoint. Oba są wyceniane pod kątem wolumenu. Taki jest kształt tego porównania.
Karty, linia po linii
Jedna linia na wymiar, obie strony w każdym:
• Wejście za 1 mln — GPT-6 Luna 0,10 USD vs Kimi K3 3,00 USD
• Wyjście za 1 mln — GPT-6 Luna 0,50 USD vs Kimi K3 15,00 USD
• Wejście z pamięci podręcznej za 1 mln — GPT-6 Luna 0,01 USD vs Kimi K3 0,30 USD, czyli jedna dziesiąta własnej stawki za dane wejściowe w przypadku obu kart
• Klauzula długiego kontekstu — GPT-6 Luna podwaja wejście i pamięć podręczną oraz podnosi wyjście 1,5× powyżej 272 000 tokenów wejściowych, stosowana do całego żądania, w przeciwieństwie do Kimi K3, który nie ma opublikowanej równoważnej klauzuli na swojej karcie
• Okno kontekstowe — GPT-6 Luna 1 050 000 tokenów z maksymalnym wejściem 922 000 vs Kimi K3 1 048 576 tokenów
• Maksymalna długość wyjścia — GPT-6 Luna 128 000 tokenów vs Kimi K3 1 048 576 tokenów, ośmiokrotnie wyższy limit
• Indeks Inteligencji, niezależny — GPT-6 Luna 37 przy maksymalnym wysiłku vs Kimi K3 44 przy maksymalnym wysiłku, ta sama wersja indeksu
• Wynik dla domyślnego poziomu wysiłku — GPT-6 Luna 29 przy domyślnym ustawieniu średnim vs Kimi K3 mierzony przy swoim maksymalnym ustawieniu
• Koszt za zadanie Index, niezależnie — GPT-6 Luna około 0,07 USD vs Kimi K3 2,00 USD
• Tokeny wyjściowe w przebiegu indeksu — GPT-6 Luna 150M vs Kimi K3 160M, wobec mediany tablicy wynoszącej 88M; oba są znacznie bardziej rozwlekłe niż model o medianie tablicy
• Szybkość generowania, niezależna — GPT-6 Luna 153,9 tokenów/s vs Kimi K3 38,7 tokenów/s
• Wagi — GPT-6 Luna zamknięte, tylko przez API, a Kimi K3 publicznie na Hugging Face od 27 lipca 2026
• Licencja — GPT-6 Luna nie dotyczy vs Kimi K3 Modified MIT, który nie jest tym samym instrumentem co MIT
• Łączna liczba parametrów — GPT-6 Luna nieujawniona vs Kimi K3 2 800 miliardów, z czego 104 miliardy są aktywne na token
• Wyróżniające dowody — wywoływanie narzędzi i pętle agentowe GPT-6 Luna po jednej dziesiątej centa za tysiąc buforowanych tokenów wejściowych w porównaniu z Kimi K3 Code Arena WebDev #1 przy 1 679 Elo, Terminal-Bench 2.0 88,3% według dostawcy, najwyższy wynik wśród modeli o otwartych wagach na niezależnym rankingu
• W OrcaRouter — GPT-6 Luna nie ma w naszym katalogu vs Kimi K3 możliwy do routowania w cenie katalogowej Moonshot

Przepustowość to specyfikacja, której nikt nie umieszcza w nagłówkach
Model generujący 38,7 tokena na sekundę i model generujący 153,9 tokena na sekundę to nie ten sam produkt z innymi metkami cenowymi. To różne produkty.
Weźmy zadanie, w którym model musi wygenerować odpowiedź o długości 1500 tokenów — streszczenie, ekstrakcję strukturalną, poprawkę kodu wraz z jej objaśnieniem. Przy 153,9 tokena na sekundę wygenerowanie tej odpowiedzi zajmuje około dziesięciu sekund. Przy 38,7 tokena na sekundę zajmuje około trzydziestu dziewięciu sekund. Żadna z tych wartości nie uwzględnia czasu wnioskowania ani opóźnień sieci, więc rzeczywista różnica jest proporcjonalnie większa niż czterokrotna, a nie mniejsza.
Teraz umieść to w pętli. Agent, który wykonuje trzydzieści wywołań modelu, aby ukończyć jedno zadanie — planuje, wybiera narzędzie, odczytuje wynik, decyduje o następnym kroku, powtarza — generuje w tych wywołaniach może 15 000 tokenów wyjściowych. GPT-6 Luna spędza na generowaniu około 97 sekund. Kimi K3 — około 388. To różnica między zadaniem, na które użytkownik czeka, a zadaniem, które użytkownik planuje, i żaden poziom permisywności licencji tego nie zmieni.
Gadatliwość pogłębia problem szybkości, zamiast go kompensować. Kimi K3 wygenerował 160 milionów tokenów wyjściowych podczas ukończenia niezależnego indeksu, w porównaniu z 150 milionami GPT-6 Luna — więc w tym badaniu wolniejszy model generował również nieco więcej tokenów, a nie mniej. Oba modele są podobnie gadatliwe; po prostu nie są równie szybkie, a na karcie rozliczanej za wyjście gadatliwość jest kosztowna podwójnie.
Warto powiedzieć wprost, że to nie jest wada Kimi K3. Model o 2,8 biliona parametrów, z których 104 miliardy są aktywne, wykonuje więcej pracy na token niż model niższej klasy, a wskaźnik przepustowości jest miarą tej pracy. Istotne pytanie brzmi, czy Twoje obciążenie wymaga tej pracy. Jeśli tak, 38,7 tokena na sekundę to cena tej możliwości. Jeśli nie, płacisz trzydzieści razy więcej za namysł, o który nie prosiłeś.
Gdzie znajduje się siedem punktów K3
Kimi K3 uzyskuje 44 punkty w niezależnym Intelligence Index przy maksymalnym wysiłku. GPT-6 Luna uzyskuje 37 punktów przy tym samym ustawieniu. Siedem punktów w złożonym wskaźniku, w którym jeden punkt mieści się w szumie ponownego przebiegu — a pod względem kosztu na ukończone zadanie te dwa dzieli około dwudziestoośmiokrotna różnica: 2,00 USD wobec około 0,07 USD.
Te siedem punktów nie są równomiernie rozłożone. Reputacja Kimi K3 koncentruje się na kodowaniu i pracy nad oprogramowaniem w trybie agentowym i to jest powód, dla którego ten model istnieje: w rankingu WebDev Code Arena model zajmuje pierwsze miejsce z 1 679 Elo, a podawany przez producenta wynik 88,3% w Terminal-Bench 2.0 to pomiar dotyczący agentów kodujących. Pozycja samego GPT-6 Luna w kodowaniu to krok wstecz, a nie naprzód — jego Coding Agent Index wynosi 41, o dwa punkty poniżej GPT-5.6 Luna, którego zastąpił, przy czym spadki koncentrują się w SWE-Atlas-QnA i DeepSWE v1.1. Jeśli twoja praca polega na tym, że agent pisze oprogramowanie, pracując na prawdziwym repozytorium, to siedmiopunktowa luka we wskaźniku i dwupunktowa regresja międzypokoleniowa wskazujące ten sam kierunek, a argument za tanią warstwą staje się znacznie słabszy.
Tam, gdzie tych siedmiu punktów nie ma, znajduje się klasa pracy, na którą wyceniono GPT-6 Luna. Klasyfikacja, ekstrakcja, routing, masowe streszczanie, wewnętrzna pętla agenta, który potrzebuje szybkiego tak/nie — na tych zadaniach oba modele dadzą to samo użyteczne wyjście w przeważającej większości przypadków, a różnica nie przetrwa kontaktu z twoim własnym zestawem ewaluacyjnym. Indeks mierzy kompozyt, który mocno waży rozumowanie długoterminowe i kodowanie, a żadne z nich nie jest tym, czego wymaga decyzja o routingu.
Jedno zastrzeżenie, które warto dołączyć do liczb indeksu po obu stronach: ta tablica to ocena krocząca, a jej aktualizacja ma znaczenie. Wcześniejsze migawki tego samego rankingu umieszczały Kimi K3 istotnie wyżej niż 44, które pokazuje nasz dzisiejszy odczyt, ponieważ kompozyt, harness i zestaw modeli – wszystkie się zmieniają. Każde porównanie, które opiera się na dokładnej różnicy między dwoma modelami w indeksie kroczącym, opiera się na czymś, co nie utrzyma się w miejscu. Uczciwa interpretacja jest taka, że te dwa modele znajdują się w sąsiadujących przedziałach możliwości, na szczytach swoich możliwości, a indeks nie jest w stanie powiedzieć, który jest lepszy do twojego zadania.
Wyjątek: co Modified MIT faktycznie ci daje
Licencja Kimi K3 to jedyny wymiar, w którym GPT-6 Luna nie ma odpowiedzi za żadną cenę, i zasługuje na więcej precyzji, niż zwykle dostaje sformułowanie „otwarte wagi”.
Wagi są publicznie dostępne na Hugging Face, a licencja to Modified MIT, nie MIT. To rozróżnienie ma znaczenie: licencja Modified MIT zazwyczaj nakłada warunki — często wymóg wyświetlania informacji o autorstwie, gdy model jest używany w produkcie powyżej pewnej skali — a każdy, kto planuje zbudować komercyjny produkt na tych wagach, powinien przeczytać sam dokument licencji, a nie opierać się na nazwie rodziny, do której jest podobna. Nie jest to powód, by jej unikać. Jest to powód, by nie opisywać jej jako MIT w dokumencie zakupowym.
To, co daje pobranie, jest realne i ma swoje granice. Daje dolny pułap kosztów w tym sensie, że stały przydział GPU może pobić rachunek oparty na zużyciu przy wystarczającej skali. Daje niezależność od planu rozwoju dostawcy — model, który hostujesz, nie może zostać wycofany znienacka. Daje możliwość dostrajania na własnym rozkładzie. A także daje opcję utrzymania promptów w obrębie własnych granic, co w przypadku niektórych zespołów kończy porównanie, zanim w ogóle wspomni się o cenie.
To, ile to kosztuje, to sprzęt. Model typu mixture-of-experts o 2,8 biliona parametrów i 104 miliardach aktywnych parametrów nie jest modelem, który działa na stacji roboczej. Serwowanie go przy przepustowości produkcyjnej to zobowiązanie na skalę klastra z kosztem kapitałowym, kosztem operacyjnym i profilem opóźnień, które posiadasz, a nie wynajmujesz. To nie jest argument przeciwko samodzielnemu hostowaniu Kimi K3 — to argument, że prawidłowe porównanie to nie 15,00 USD za milion tokenów wyjściowych kontra 0,00 USD, ale 15,00 USD za milion tokenów wyjściowych kontra pełny koszt na token, który obejmuje krzem i ludzi. Dla niewielkiej liczby organizacji ta liczba jest niższa. Dla większości nie jest, a punkt przecięcia jest dalej, niż się wydaje z powodu licencji.
Uruchamianie jednego z nich lub obu
Kimi K3 jest dostępny w OrcaRouter w cenie katalogowej Moonshot, w ramach rozliczenia pass-through, co oznacza, że zmiana stawek dostawcy jest u nas aktywna tego samego dnia. Automatyczne przełączanie awaryjne to funkcja, która szczególnie w przypadku tego modelu ma swoje uzasadnienie: pogorszenie się działania samodzielnie hostowanego lub zewnętrznego punktu końcowego Kimi K3 to dokładnie ten scenariusz, w którym chcesz, aby trasa przełączyła się bez wdrożenia, a model generujący 38,7 tokena na sekundę ma mniejszy zapas na wchłonięcie wolnego upstreamu niż model szybki.
GPT-6 Luna nie znajduje się w naszym katalogu na moment pisania tego tekstu i jest dostępny przez własne API OpenAI, więc zespół, który chce mieć oba, używa jednego klucza do Kimi K3 obok tego, czego już używa do OpenAI. To także ta para, w której routing DSL robi coś, czego nie potrafi sztywno zakodowany podział: reguła, która kieruje kodowanie i prace długoterminowe do Kimi K3, a wszystko konsumowane przez programy i krótkie do GPT-6 Luna, wyraża granicę, która przesuwa się za każdym razem, gdy którykolwiek z dostawców wypuści coś nowego, i przesuwa się jako konfiguracja, a nie jako ścieżka kodu. Fuzja modeli to druga konfiguracja, którą warto tu wymienić — panel złożony z jednego wolnego, starannego modelu i jednego szybkiego, taniego modelu odpowiadających razem, gdzie tani członek wykonuje pracę masową, a drogi rozstrzyga przypadki, które mają znaczenie, to kształt, do którego ta para modeli pasuje wyjątkowo dobrze, ponieważ asymetria kosztów między nimi jest wystarczająco duża, że wydanie wywołania Kimi K3 na niewielki ułamek ruchu jest przystępne cenowo.

Który i kiedy
Wybierz GPT-6 Luna, jeśli Twoje obciążenie jest masowe, konsumowane przez programy i wrażliwe na opóźnienia. Klasyfikacja, ekstrakcja, routing, zbiorcze podsumowywanie, wewnętrzna pętla agenta. Przy $0.10/$0.50 z jednocentowym odczytem z pamięci podręcznej i czterokrotnie większą przepustowością Kimi K3, rachunek nie pozostawia wątpliwości, a różnica w opóźnieniach nie jest marginalna. Ustaw parametr wysiłku jawnie, ponieważ domyślnie jest ustawiony na średni, a podawana liczba 37 to wartość dla maksymalnego wysiłku, i utrzymuj długie wywołania po właściwej stronie granicy 272 000 tokenów.
Wybierz Kimi K3, jeśli potrzebujesz wag, jeśli Twoja praca polega na kodowaniu agentowym na prawdziwym repozytorium, gdzie jego pozycja w WebDev i raportowane przez dostawcę 88,3% w Terminal-Bench 2.0 to dowody, które mają znaczenie, jeśli potrzebujesz pułapu wyjścia powyżej 128 000 tokenów lub jeśli Twoja organizacja nie może wysyłać promptów do zamkniętego punktu końcowego. Zaakceptuj 38,7 tokena na sekundę jako część umowy i przeczytaj warunki Modified MIT, zamiast zakładać je z góry.
Błąd, do którego skłania to porównanie, polega na traktowaniu trzydziestokrotnego wskaźnika jako odpowiedzi na pytanie o możliwości. To odpowiedź na pytanie o tokeny. Kwestię możliwości rozstrzyga to, czy potrzebujesz wag, czy szybkości, a te dwie odpowiedzi wskazują w przeciwnych kierunkach.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
