Wygenerowana karta hero porównująca Intern-S2-397B i Kimi K3, pokazująca po lewej stronie stronę literatury naukowej ze schematem molekularnym zasilającym kartę otwartych wag o 403 miliardach parametrów, a po prawej długą wstęgę dokumentu zasilającą flagowy model o 2,8 biliona parametrów z licznikiem kontekstu 1M, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Intern-S2-397B vs Kimi K3: model naukowy 397B i gigant rozumowania 2,8T

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Intern-S2-397B i Kimi K3 znajdują się po przeciwnych stronach linii otwartych wag, która określi resztę 2026 roku: specjalista naukowy do pobrania kontra niezależnie potwierdzony generalista długiego kontekstu. Intern-S2-397B to naukowy model multimodalny o 403 miliardach parametrów, który InternLM wydał na licencji Apache-2.0 13 września 2026 roku — bez cennika, bez niezależnego wyniku i ze ścieżką wizyjną trenowaną na surowych stronach literatury naukowej. Kimi K3 to flagowy model mieszaniny ekspertów Moonshot AI o 2,8 biliona parametrów, który zadebiutował w lipcu 2026 roku w cenie 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, udostępnił swoje wagi 27 lipca na zmodyfikowanej licencji MIT i ma za sobą sześć tygodni niezależnej ewaluacji. Niezwykłe w tym zestawieniu jest to, że oba modele mają tę samą ambicję długiego horyzontu — nie przestawać pracować nad dużym, chaotycznym zadaniem — i rozwiązują ją w przeciwnych kierunkach.

Oba ambitne, przeciwstawne mechanizmy

Ambicja jest wspólna: każdy model chce być tym, co działa dalej, gdy zadanie jest długie. Osiągają to w różny sposób, a różnica ma charakter architektoniczny.

Odpowiedź Kimi K3 to kontekst. Okno o rozmiarze 1 048 576 tokenów zarówno na wejściu, jak i na wyjściu oznacza, że całe repozytorium, cały data room albo pętla agenta o pięćdziesięciu krokach może zmieścić się w jednej rozmowie. Stack inferencyjny Mooncake od Moonshot podobno utrzymuje współczynniki trafień pamięci podręcznej powyżej 90% w obciążeniach związanych z kodowaniem, dzięki czemu cena 15 USD za milion tokenów wyjściowych staje się w praktyce możliwa do utrzymania. Kimi K3 udostępnia kontrolkę reasoning_effort najwyższego poziomu i nie przyjmuje żadnych parametrów próbkowania, domyślnie rozumuje na maksymalnej głębokości oraz oczekuje, że w wieloetapowych pętlach narzędziowych będziesz dosłownie odtwarzać wcześniejsze reasoning_content i tool_calls, w przeciwnym razie jakość spada.

Odpowiedź Intern-S2-397B to specjalizacja plus kontrola na poziomie wag. Jego kontekst — 256K rozumowania tekstowego i 64K multimodalnego, obie wartości z karty modelu — to inna kategoria okna: wystarczająca na pokaźny artykuł lub długą sesję badawczą, ale nie na zbiór roboczy o milionie tokenów. Zamiast tego oferuje ścieżkę wizyjną, która natywnie odczytuje literaturę naukową — ryciny, układ, notację symboliczną i prozę razem — oraz wejście dla szeregów czasowych, które generuje prognozy, a obok tego myślenie domyślnie włączone i przełączane na żądanie. Jeśli twoje długie zadanie ma charakter naukowy, model został wytrenowany dokładnie do niego; jeśli twoim długim zadaniem jest baza kodu, to nie jest model z oknem na milion tokenów do tego.

• Kontekst — Kimi K3: 1 048 576 tokenów na wejściu i wyjściu vs Intern-S2-397B: 256K tekstu / 64K multimodalnych.

• Skala — Kimi K3: 2,8 bln łącznie, ~104 mld aktywnych na token vs Intern-S2-397B: 403 mld łącznie, 512 ekspertów / 10 aktywnych.

• Interfejs sterowania — Kimi K3: pokrętło reasoning_effort, brak parametrów próbkowania vs Intern-S2-397B: przełącznik enable_thinking oraz pełna kontrola na poziomie wag na licencji Apache-2.0.

• Dane wejściowe — Kimi K3: tekst, obraz vs Intern-S2-397B: tekst, obraz, szeregi czasowe.

• Wagi — Kimi K3: otwarte na licencji Modified MIT (27 lipca) vs Intern-S2-397B: otwarte na licencji Apache-2.0 (13 września).

• Niezależne dowody — Kimi K3: sześć tygodni wyników od stron trzecich vs Intern-S2-397B: jeszcze brak.

Asymetria dowodów jest prawdziwą różnicą.

Kimi K3 przeszedł niezależne testy i uzyskał wyniki, na których można się oprzeć. Artificial Analysis umieszcza go na poziomie ok. 45 w swoim obecnym Intelligence Index, z GPQA Diamond w niskich dziewięćdziesiątkach, HLE na poziomie ok. 45, niezależnie zmierzonym przypominaniem długiego kontekstu na poziomie 88,7 oraz wynikiem w kodowaniu na poziomie ok. 75. Utrzymuje pierwsze miejsce w Frontend Code Arena (Elo w okolicach 1670) i uzyskał 91,2 w BrowseComp, najwyższy wynik w tym benchmarku wyszukiwania długiego horyzontu — choć sam Moonshot ostrzega, że K3 „wciąż ustępuje najpotężniejszym modelom własnościowym”, a kilka pozycji z dnia premiery wciąż jest raportowanych przez dostawcę.

Dowodem Intern-S2-397B jest jego własna tabela z premiery, uzyskana za pomocą OpenCompass, VLMEvalKit i AgentCompass, opublikowana na kilka godzin przed tym, jak to czytasz. Każda liczba pochodzi od samego dostawcy i nie została odtworzona przez nikogo innego: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 oraz TerminalBench 2.1 z wynikiem 64.04 — wynik, który według karty znacząco przegrywa ze starszą zamkniętą generacją. Jego naukowe wiersze to liczby, które przemawiają za specjalistycznym rozwiązaniem: 55.71 w Biology-Instructions, 63.28 w SciReasoner 1.5, 53.95 w Mol-Instructions, 62.35 w MolecularIQ. Te dwie bazy dowodowe nie stykają się, dlatego uczciwe ujęcie tego starcia to nie „kto wygrywa”, lecz „jakiego rodzaju dowodów potrzebuje twoje obciążenie”.

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

Ile kosztuje każdy z nich, edycja open-weights

Oba modele mają otwarte wagi, co zmienia kwestię kosztów z typowej narracji o rozliczaniu za zużycie kontra darmowość w porównanie dwóch propozycji hostingowych. Kimi K3 ma opublikowaną cenę API — 3,00 / 15,00 USD za milion tokenów według cennika Moonshot, przekazywaną przez OrcaRouter z 0% narzutu, a do tego cennik odczytu z pamięci podręcznej — i można go również pobrać: wydanie otwartych wag z 96 shardami, które do obsługi wymaga sprzętu klasy supernode, czyli 64 lub więcej akceleratorów. Praktyczną grupą odbiorców samodzielnie hostowanego K3 są zespoły z budżetami na centra danych. Intern-S2-397B nie ma w ogóle opublikowanej ceny API; karta modelu wskazuje na oficjalne Intern API, a rzeczywista ekonomia to ta związana z samodzielnym hostingiem: około 807 GB wag w 188 shardach w formacie BF16, solidny węzeł wielo-GPU, a wersja FP8 zmniejsza ślad pamięciowy o około połowę.

Oba modele można wywołać przez ten sam styk, jeśli zastosujesz routing: Kimi K3 jest dostępny w OrcaRouter w cenie katalogowej Moonshot z 0% marży, natomiast Intern-S2-397B nie jest routowany — zupełnie nowy checkpoint Apache-2.0, a droga do niego to własne API dostawcy albo wdrożenie self-hosted. Wartość routingu w tym zestawieniu polega na utrzymaniu ruchu ogólnego przeznaczenia z długim kontekstem na kluczu, który już masz, a pracy wsadowej o charakterze naukowym na modelu, który uruchamiasz, z automatycznym przełączaniem awaryjnym między nimi. DSL sprawia, że ta granica jest konfiguracją, a nie drugą integracją.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

Werdykt

Wybierz Kimi K3, gdy zadanie to praca generalisty z długim kontekstem — kodowanie całego repozytorium, długotrwałe pętle agentowe, praca z wiedzą wymagająca miliona tokenów pamięci roboczej — i chcesz mieć za tym niezależny ranking. To model o silniejszych dowodach pod każdym względem, jego otwarte wagi są prawdziwe (Modified MIT, 27 lipca), a jeśli już obsługujesz infrastrukturę klasy supernode, ekonomia kosztu na token z buforowaniem jest korzystna.

Wybierz Intern-S2-397B, gdy zadanie ma charakter naukowy: prace z dużą liczbą rysunków, diagramy molekularne, zeskanowana literatura, sygnały szeregów czasowych oraz dane, które muszą pozostać w twoim obwodzie, albo wagi, które chcesz dostroić na zastrzeżonych wynikach. Apache-2.0 to umożliwia, a żadne wynajmowane API nie, a naukowe pozycje w karcie są innym gatunkiem niż to, pod co kiedykolwiek dostrajano model ogólnego przeznaczenia. Zaplanuj budżet na sprzęt, przeprowadź własną ocenę i każdą opublikowaną liczbę na jego temat traktuj jako twierdzenie, dopóki ktoś spoza InternLM nie odtworzy którejś z nich.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.