Wygenerowana karta hero porównująca Intern-S2-397B i Grok 4.6, pokazująca po lewej stronie otwarty model naukowy z otwartymi wagami, przełącznikiem rozumowania oznaczonym enable_thinking i przebiegiem czasowym, a po prawej zamknięty punkt końcowy w chmurze z pokrętłem wysiłku rozumowania i ikonami narzędzi po stronie serwera, oznaczona kontrastem między samodzielnie hostowaną kontrolą Apache-2.0 a API rozliczanym za $2 / $6, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Intern-S2-397B vs Grok 4.6: Kto może kręcić gałkami

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Intern-S2-397B i Grok 4.6 zostały wydane około miesiąc od siebie i odpowiadają na to samo zasadnicze pytanie w przeciwny sposób: kto ma kontrolować rozumowanie. Grok 4.6, flagowy model x​AI, który zadebiutował 12 sierpnia 2026 r., sprzedaje ci pokrętło — konfigurowalną kontrolę wysiłku rozumowania w zamkniętym API w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, z oknem 500 000 tokenów i narzędziami serwerowymi x​AI rozliczanymi dodatkowo. Intern-S2-397B, naukowy model multimodalny o 403 miliardach parametrów, który zespół InternLM z Shanghai AI Laboratory udostępnił na licencji Apache-2.0 13 września, daje ci całą maszynę — wagi, przełącznik myślenia, ścieżkę wizyjną, głowicę szeregów czasowych — i oczekuje, że uruchomisz ją samodzielnie. Jeden jest wynajmowany z pokrętłami; drugi posiadasz na własność. Porównanie, które ma tu znaczenie, nie dotyczy tego, który model osiąga wyższe wyniki w tabeli benchmarków; chodzi o to, jakiego rodzaju kontroli faktycznie potrzebuje twoje obciążenie i ile kosztuje każdy z tych rodzajów.

Dwie różne tarcze

Najczystszym sposobem, by odróżnić te dwa modele, jest spojrzenie na to, gdzie znajdują się elementy sterujące rozumowaniem. Grok 4.6 udostępnia ustawienie wysiłku rozumowania przez API xAI, a wokół niego znajduje się zestaw narzędzi po stronie serwera — wywoływanie funkcji, wyszukiwanie w sieci, wyszukiwanie w X, wykonywanie kodu — którymi xAI zarządza i rozlicza je osobno. Dostrajasz wysiłek, łączysz w łańcuch narzędzia, które ci daje, i nigdy nie dotykasz wag. Zachowanie modelu jest własnością xAI i problemem xAI; twoją dźwignią jest parametr w żądaniu.

Intern-S2-397B daje ci inny zestaw dźwigni, które znajdują się niżej w stosie. Myślenie jest domyślnie włączone, a wyłącza się je dla danego żądania za pomocą enable_thinking=False. Ponieważ model jest objęty licencją Apache-2.0, możesz również pobrać wagi i dostroić samo zachowanie rozumowania na własnych danych, a następnie udostępnić wynik na LMDeploy, vLLM lub SGLang. Zakres danych wejściowych jest szerszy niż w API tekstowo-obrazowym: przyjmuje sygnały szeregów czasowych i generuje prognozy — funkcja obecnie obsługiwana wyłącznie przez LMDeploy — i został wytrenowany do długoterminowej pracy agenta w środowiskach sandbox. Kompromis jest równie jasny — taki poziom kontroli ma sens tylko wtedy, gdy jesteś gotowy obsługiwać sprzęt i stos serwowania, który się z tym wiąże.

• Kontrola rozumowania — Grok 4.6: regulacja wysiłku rozumowania w zamkniętym API vs Intern-S2-397B: przełącznik enable_thinking oraz pełna kontrola na poziomie wag na licencji Apache-2.0.

• Narzędzia — Grok 4.6: wyszukiwanie w sieci po stronie serwera x​AI, wyszukiwanie w X i wykonywanie kodu, rozliczane osobno vs Intern-S2-397B: wywoływanie narzędzi, które podłączasz samodzielnie, plus ścieżka prognozowania szeregów czasowych przez LMDeploy.

• Wejścia — Grok 4.6: tekst, obraz, plik vs Intern-S2-397B: tekst, obraz, szereg czasowy.

• Kontekst — Grok 4.6: 500 000 tokenów vs Intern-S2-397B: 256K na rozumowanie tekstowe, 64K na multimodalność; obie wartości pochodzą z karty modelu.

• Cena — Grok 4.6: $2.00 / $6.00 za 1 mln tokenów, z przejściem na $4.00 / $12.00 po przekroczeniu 200 tys. tokenów w porównaniu z Intern-S2-397B: brak cennika stawek; własny hosting lub oficjalne API Intern.

Co tak naprawdę obejmują te liczby

Każdy podany poniżej wynik Intern-S2-397B pochodzi od samego InternLM, został uzyskany za pomocą OpenCompass, VLMEvalKit i AgentCompass i opublikowany wraz z wagami, bez niezależnej reprodukcji. Liczby Grok 4.6 to coś innego: narosły w publicznej arenie i Artificial Analysis po premierze modelu, więc noszą etykietę strony trzeciej.

Po stronie niezależnych pomiarów Grok 4.6 plasuje się na 44. miejscu w aktualnym Artificial Analysis Intelligence Index, z wynikiem 94,9 w GPQA Diamond, 61,0 w Humanity's Last Exam i wynikiem kodowania 76,8, a Artificial Analysis szacuje jego wynik w TerminalBench 2.1 na około 80,3. Po stronie dostawcy karta Intern-S2-397B podaje 89,77 w MMLU Pro, 93,56 w HMMT-2026, 81,68 w MMMU Pro i 68,54 w SWE-bench-Pro, obok naukowych wierszy, w których wygląda jak zupełnie inny gatunek: 55,71 w Biology-Instructions, 63,28 w SciReasoner 1.5, 53,95 w Mol-Instructions, 62,35 w MolecularIQ. Jedna liczba w tabeli dostawcy, która powinna sprawić, że twórca agentów się wzdrygnie, to TerminalBench 2.1 na poziomie 64,04 — wynik, który według samych twórców modelu znacząco przegrywa ze starszą zamkniętą generacją, dokładnie w tej dziedzinie pracy terminalowej, w której model frontierowy do wynajęcia taki jak Grok 4.6 jest najsilniejszy.

Odczytuj ten podział jako portret, a nie ranking. Intern-S2-397B to specjalista naukowy, który jest kompetentnym modelem ogólnym; Grok 4.6 to generalista, który tylko przelotnie interesuje się nauką. To, że wiersze naukowe są nierówne, jest oczekiwane — żaden flagowy model ogólny nie był wstępnie trenowany na surowych stronach literatury naukowej z rycinami, układem i notacją symboliczną razem, i właśnie wokół tego paradygmatu zbudowano Intern-S2-397B. Nic w żadnej z obu baz dowodowych nie potwierdza twierdzenia „Intern-S2-397B jest tak samo dobry jak Grok 4.6 w dowolnym rozumowaniu”, a nic w dowodach dotyczących Grok 4.6 nie sugeruje, że został dostrojony do analizy sekwencji multiomicznych.

Cena kontroli

Grok 4.6 ma cenę, którą można wpisać do arkusza kalkulacyjnego: 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, a stawka rośnie do 4,00 USD / 12,00 USD, gdy prompt przekroczy 200 000 tokenów, plus opcjonalny poziom priorytetowy dla szybszych odpowiedzi. Jest dostępny przez OrcaRouter w cenie katalogowej x​AI przekazywanej z zerowym narzutem, więc zmiana stawki w x​AI trafia tutaj tego samego dnia bez różnicy ze strony pośrednika — wynajmowane pokrętło pozostaje wyceniane tak, jak wycenia je dostawca.

Intern-S2-397B nie ma w ogóle publikowanej stawki za token. Karta modelu odwołuje się do oficjalnego API Intern, ale ekonomia, którą ludzie faktycznie chcą porównywać, to ta związana z self-hostingiem: checkpoint o 403 mld parametrów, około 807 GB wag w 188 shardach w BF16, czyli poważny węzeł wielo-GPU, przy czym wersja FP8 w przybliżeniu o połowę zmniejsza zajętość. Jeśli już posiadasz tę moc obliczeniową, koszt krańcowy kolejnego zapytania naukowego zbliża się do kosztu energii elektrycznej i to jest cały sens pozycji Apache-2.0. Jeśli jej nie posiadasz, „darmowy” model jest pilotażem w ramach nakładów inwestycyjnych, a nie pozycją budżetową.

To, co daje router w tym konkretnym zestawieniu, to styk, a nie cena. Grok 4.6 działa na kluczu, który już masz na potrzeby ogólnego ruchu produkcyjnego; Intern-S2-397B nie jest routingowany na OrcaRouter — to zupełnie nowy checkpoint, a droga do niego prowadzi przez własne API dostawcy albo wdrożenie hostowane samodzielnie. Kieruj ogólne rozumowanie wrażliwe na opóźnienia do modelu rozliczanego za użycie, zostaw naukową pracę wsadową na modelu, który sam uruchamiasz, a automatyczne przełączanie awaryjne niech cię zabezpiecza, gdy punkt końcowy którejkolwiek ze stron nie działa prawidłowo. Granica między nimi staje się regułą routingu zamiast drugiej integracji.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

Który wybrać

Wybierz Grok 4.6, gdy zadanie jest ogólne, rozumowanie musi wracać szybko i poprawnie, a nie chcesz być właścicielem stosu, który je wytwarza. Jego okno 500K, zmierzony wynik GPQA Diamond na poziomie 94.9 i zestaw narzędzi to funkcje produkcyjne, a stawka $2/$6 to cena za to, że niczym nie musisz zarządzać.

Wybierz Intern-S2-397B, gdy dane wejściowe mają charakter naukowy — gęsto ilustrowany artykuł, diagram molekularny, sygnał szeregu czasowego — oraz gdy rozumowanie musi odbywać się na danych, które nie mogą opuścić twojego środowiska, albo na zachowaniu, które chcesz samodzielnie dostroić. Apache-2.0 to umożliwia; żadne wynajmowane API tego nie potrafi. Zaplanuj budżet na sprzęt, nie spodziewaj się przez jakiś czas niezależnego rankingu, a każdą liczbę na jego karcie traktuj jako twierdzenie, dopóki ktoś spoza InternLM nie odtworzy choćby jednej z nich.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.