
Intern-S2-397B vs Kimi K3: model naukowy 397B i gigant rozumowania 2,8T
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Intern-S2-397B i Kimi K3 znajdują się po przeciwnych stronach linii otwartych wag, która określi resztę 2026 roku: specjalista naukowy do pobrania kontra niezależnie potwierdzony generalista długiego kontekstu. Intern-S2-397B to naukowy model multimodalny o 403 miliardach parametrów, który InternLM wydał na licencji Apache-2.0 13 września 2026 roku — bez cennika, bez niezależnego wyniku i ze ścieżką wizyjną trenowaną na surowych stronach literatury naukowej. Kimi K3 to flagowy model mieszaniny ekspertów Moonshot AI o 2,8 biliona parametrów, który zadebiutował w lipcu 2026 roku w cenie 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, udostępnił swoje wagi 27 lipca na zmodyfikowanej licencji MIT i ma za sobą sześć tygodni niezależnej ewaluacji. Niezwykłe w tym zestawieniu jest to, że oba modele mają tę samą ambicję długiego horyzontu — nie przestawać pracować nad dużym, chaotycznym zadaniem — i rozwiązują ją w przeciwnych kierunkach.
Oba ambitne, przeciwstawne mechanizmy
Ambicja jest wspólna: każdy model chce być tym, co działa dalej, gdy zadanie jest długie. Osiągają to w różny sposób, a różnica ma charakter architektoniczny.
Odpowiedź Kimi K3 to kontekst. Okno o rozmiarze 1 048 576 tokenów zarówno na wejściu, jak i na wyjściu oznacza, że całe repozytorium, cały data room albo pętla agenta o pięćdziesięciu krokach może zmieścić się w jednej rozmowie. Stack inferencyjny Mooncake od Moonshot podobno utrzymuje współczynniki trafień pamięci podręcznej powyżej 90% w obciążeniach związanych z kodowaniem, dzięki czemu cena 15 USD za milion tokenów wyjściowych staje się w praktyce możliwa do utrzymania. Kimi K3 udostępnia kontrolkę reasoning_effort najwyższego poziomu i nie przyjmuje żadnych parametrów próbkowania, domyślnie rozumuje na maksymalnej głębokości oraz oczekuje, że w wieloetapowych pętlach narzędziowych będziesz dosłownie odtwarzać wcześniejsze reasoning_content i tool_calls, w przeciwnym razie jakość spada.
Odpowiedź Intern-S2-397B to specjalizacja plus kontrola na poziomie wag. Jego kontekst — 256K rozumowania tekstowego i 64K multimodalnego, obie wartości z karty modelu — to inna kategoria okna: wystarczająca na pokaźny artykuł lub długą sesję badawczą, ale nie na zbiór roboczy o milionie tokenów. Zamiast tego oferuje ścieżkę wizyjną, która natywnie odczytuje literaturę naukową — ryciny, układ, notację symboliczną i prozę razem — oraz wejście dla szeregów czasowych, które generuje prognozy, a obok tego myślenie domyślnie włączone i przełączane na żądanie. Jeśli twoje długie zadanie ma charakter naukowy, model został wytrenowany dokładnie do niego; jeśli twoim długim zadaniem jest baza kodu, to nie jest model z oknem na milion tokenów do tego.
• Kontekst — Kimi K3: 1 048 576 tokenów na wejściu i wyjściu vs Intern-S2-397B: 256K tekstu / 64K multimodalnych.
• Skala — Kimi K3: 2,8 bln łącznie, ~104 mld aktywnych na token vs Intern-S2-397B: 403 mld łącznie, 512 ekspertów / 10 aktywnych.
• Interfejs sterowania — Kimi K3: pokrętło reasoning_effort, brak parametrów próbkowania vs Intern-S2-397B: przełącznik enable_thinking oraz pełna kontrola na poziomie wag na licencji Apache-2.0.
• Dane wejściowe — Kimi K3: tekst, obraz vs Intern-S2-397B: tekst, obraz, szeregi czasowe.
• Wagi — Kimi K3: otwarte na licencji Modified MIT (27 lipca) vs Intern-S2-397B: otwarte na licencji Apache-2.0 (13 września).
• Niezależne dowody — Kimi K3: sześć tygodni wyników od stron trzecich vs Intern-S2-397B: jeszcze brak.
Asymetria dowodów jest prawdziwą różnicą.
Kimi K3 przeszedł niezależne testy i uzyskał wyniki, na których można się oprzeć. Artificial Analysis umieszcza go na poziomie ok. 45 w swoim obecnym Intelligence Index, z GPQA Diamond w niskich dziewięćdziesiątkach, HLE na poziomie ok. 45, niezależnie zmierzonym przypominaniem długiego kontekstu na poziomie 88,7 oraz wynikiem w kodowaniu na poziomie ok. 75. Utrzymuje pierwsze miejsce w Frontend Code Arena (Elo w okolicach 1670) i uzyskał 91,2 w BrowseComp, najwyższy wynik w tym benchmarku wyszukiwania długiego horyzontu — choć sam Moonshot ostrzega, że K3 „wciąż ustępuje najpotężniejszym modelom własnościowym”, a kilka pozycji z dnia premiery wciąż jest raportowanych przez dostawcę.
Dowodem Intern-S2-397B jest jego własna tabela z premiery, uzyskana za pomocą OpenCompass, VLMEvalKit i AgentCompass, opublikowana na kilka godzin przed tym, jak to czytasz. Każda liczba pochodzi od samego dostawcy i nie została odtworzona przez nikogo innego: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 oraz TerminalBench 2.1 z wynikiem 64.04 — wynik, który według karty znacząco przegrywa ze starszą zamkniętą generacją. Jego naukowe wiersze to liczby, które przemawiają za specjalistycznym rozwiązaniem: 55.71 w Biology-Instructions, 63.28 w SciReasoner 1.5, 53.95 w Mol-Instructions, 62.35 w MolecularIQ. Te dwie bazy dowodowe nie stykają się, dlatego uczciwe ujęcie tego starcia to nie „kto wygrywa”, lecz „jakiego rodzaju dowodów potrzebuje twoje obciążenie”.

Ile kosztuje każdy z nich, edycja open-weights
Oba modele mają otwarte wagi, co zmienia kwestię kosztów z typowej narracji o rozliczaniu za zużycie kontra darmowość w porównanie dwóch propozycji hostingowych. Kimi K3 ma opublikowaną cenę API — 3,00 / 15,00 USD za milion tokenów według cennika Moonshot, przekazywaną przez OrcaRouter z 0% narzutu, a do tego cennik odczytu z pamięci podręcznej — i można go również pobrać: wydanie otwartych wag z 96 shardami, które do obsługi wymaga sprzętu klasy supernode, czyli 64 lub więcej akceleratorów. Praktyczną grupą odbiorców samodzielnie hostowanego K3 są zespoły z budżetami na centra danych. Intern-S2-397B nie ma w ogóle opublikowanej ceny API; karta modelu wskazuje na oficjalne Intern API, a rzeczywista ekonomia to ta związana z samodzielnym hostingiem: około 807 GB wag w 188 shardach w formacie BF16, solidny węzeł wielo-GPU, a wersja FP8 zmniejsza ślad pamięciowy o około połowę.
Oba modele można wywołać przez ten sam styk, jeśli zastosujesz routing: Kimi K3 jest dostępny w OrcaRouter w cenie katalogowej Moonshot z 0% marży, natomiast Intern-S2-397B nie jest routowany — zupełnie nowy checkpoint Apache-2.0, a droga do niego to własne API dostawcy albo wdrożenie self-hosted. Wartość routingu w tym zestawieniu polega na utrzymaniu ruchu ogólnego przeznaczenia z długim kontekstem na kluczu, który już masz, a pracy wsadowej o charakterze naukowym na modelu, który uruchamiasz, z automatycznym przełączaniem awaryjnym między nimi. DSL sprawia, że ta granica jest konfiguracją, a nie drugą integracją.

Werdykt
Wybierz Kimi K3, gdy zadanie to praca generalisty z długim kontekstem — kodowanie całego repozytorium, długotrwałe pętle agentowe, praca z wiedzą wymagająca miliona tokenów pamięci roboczej — i chcesz mieć za tym niezależny ranking. To model o silniejszych dowodach pod każdym względem, jego otwarte wagi są prawdziwe (Modified MIT, 27 lipca), a jeśli już obsługujesz infrastrukturę klasy supernode, ekonomia kosztu na token z buforowaniem jest korzystna.
Wybierz Intern-S2-397B, gdy zadanie ma charakter naukowy: prace z dużą liczbą rysunków, diagramy molekularne, zeskanowana literatura, sygnały szeregów czasowych oraz dane, które muszą pozostać w twoim obwodzie, albo wagi, które chcesz dostroić na zastrzeżonych wynikach. Apache-2.0 to umożliwia, a żadne wynajmowane API nie, a naukowe pozycje w karcie są innym gatunkiem niż to, pod co kiedykolwiek dostrajano model ogólnego przeznaczenia. Zaplanuj budżet na sprzęt, przeprowadź własną ocenę i każdą opublikowaną liczbę na jego temat traktuj jako twierdzenie, dopóki ktoś spoza InternLM nie odtworzy którejś z nich.

