
Intern-S2-397B vs Grok 4.6: Kto może kręcić gałkami
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Intern-S2-397B i Grok 4.6 zostały wydane około miesiąc od siebie i odpowiadają na to samo zasadnicze pytanie w przeciwny sposób: kto ma kontrolować rozumowanie. Grok 4.6, flagowy model xAI, który zadebiutował 12 sierpnia 2026 r., sprzedaje ci pokrętło — konfigurowalną kontrolę wysiłku rozumowania w zamkniętym API w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, z oknem 500 000 tokenów i narzędziami serwerowymi xAI rozliczanymi dodatkowo. Intern-S2-397B, naukowy model multimodalny o 403 miliardach parametrów, który zespół InternLM z Shanghai AI Laboratory udostępnił na licencji Apache-2.0 13 września, daje ci całą maszynę — wagi, przełącznik myślenia, ścieżkę wizyjną, głowicę szeregów czasowych — i oczekuje, że uruchomisz ją samodzielnie. Jeden jest wynajmowany z pokrętłami; drugi posiadasz na własność. Porównanie, które ma tu znaczenie, nie dotyczy tego, który model osiąga wyższe wyniki w tabeli benchmarków; chodzi o to, jakiego rodzaju kontroli faktycznie potrzebuje twoje obciążenie i ile kosztuje każdy z tych rodzajów.
Dwie różne tarcze
Najczystszym sposobem, by odróżnić te dwa modele, jest spojrzenie na to, gdzie znajdują się elementy sterujące rozumowaniem. Grok 4.6 udostępnia ustawienie wysiłku rozumowania przez API xAI, a wokół niego znajduje się zestaw narzędzi po stronie serwera — wywoływanie funkcji, wyszukiwanie w sieci, wyszukiwanie w X, wykonywanie kodu — którymi xAI zarządza i rozlicza je osobno. Dostrajasz wysiłek, łączysz w łańcuch narzędzia, które ci daje, i nigdy nie dotykasz wag. Zachowanie modelu jest własnością xAI i problemem xAI; twoją dźwignią jest parametr w żądaniu.
Intern-S2-397B daje ci inny zestaw dźwigni, które znajdują się niżej w stosie. Myślenie jest domyślnie włączone, a wyłącza się je dla danego żądania za pomocą enable_thinking=False. Ponieważ model jest objęty licencją Apache-2.0, możesz również pobrać wagi i dostroić samo zachowanie rozumowania na własnych danych, a następnie udostępnić wynik na LMDeploy, vLLM lub SGLang. Zakres danych wejściowych jest szerszy niż w API tekstowo-obrazowym: przyjmuje sygnały szeregów czasowych i generuje prognozy — funkcja obecnie obsługiwana wyłącznie przez LMDeploy — i został wytrenowany do długoterminowej pracy agenta w środowiskach sandbox. Kompromis jest równie jasny — taki poziom kontroli ma sens tylko wtedy, gdy jesteś gotowy obsługiwać sprzęt i stos serwowania, który się z tym wiąże.
• Kontrola rozumowania — Grok 4.6: regulacja wysiłku rozumowania w zamkniętym API vs Intern-S2-397B: przełącznik enable_thinking oraz pełna kontrola na poziomie wag na licencji Apache-2.0.
• Narzędzia — Grok 4.6: wyszukiwanie w sieci po stronie serwera xAI, wyszukiwanie w X i wykonywanie kodu, rozliczane osobno vs Intern-S2-397B: wywoływanie narzędzi, które podłączasz samodzielnie, plus ścieżka prognozowania szeregów czasowych przez LMDeploy.
• Wejścia — Grok 4.6: tekst, obraz, plik vs Intern-S2-397B: tekst, obraz, szereg czasowy.
• Kontekst — Grok 4.6: 500 000 tokenów vs Intern-S2-397B: 256K na rozumowanie tekstowe, 64K na multimodalność; obie wartości pochodzą z karty modelu.
• Cena — Grok 4.6: $2.00 / $6.00 za 1 mln tokenów, z przejściem na $4.00 / $12.00 po przekroczeniu 200 tys. tokenów w porównaniu z Intern-S2-397B: brak cennika stawek; własny hosting lub oficjalne API Intern.
Co tak naprawdę obejmują te liczby
Każdy podany poniżej wynik Intern-S2-397B pochodzi od samego InternLM, został uzyskany za pomocą OpenCompass, VLMEvalKit i AgentCompass i opublikowany wraz z wagami, bez niezależnej reprodukcji. Liczby Grok 4.6 to coś innego: narosły w publicznej arenie i Artificial Analysis po premierze modelu, więc noszą etykietę strony trzeciej.
Po stronie niezależnych pomiarów Grok 4.6 plasuje się na 44. miejscu w aktualnym Artificial Analysis Intelligence Index, z wynikiem 94,9 w GPQA Diamond, 61,0 w Humanity's Last Exam i wynikiem kodowania 76,8, a Artificial Analysis szacuje jego wynik w TerminalBench 2.1 na około 80,3. Po stronie dostawcy karta Intern-S2-397B podaje 89,77 w MMLU Pro, 93,56 w HMMT-2026, 81,68 w MMMU Pro i 68,54 w SWE-bench-Pro, obok naukowych wierszy, w których wygląda jak zupełnie inny gatunek: 55,71 w Biology-Instructions, 63,28 w SciReasoner 1.5, 53,95 w Mol-Instructions, 62,35 w MolecularIQ. Jedna liczba w tabeli dostawcy, która powinna sprawić, że twórca agentów się wzdrygnie, to TerminalBench 2.1 na poziomie 64,04 — wynik, który według samych twórców modelu znacząco przegrywa ze starszą zamkniętą generacją, dokładnie w tej dziedzinie pracy terminalowej, w której model frontierowy do wynajęcia taki jak Grok 4.6 jest najsilniejszy.
Odczytuj ten podział jako portret, a nie ranking. Intern-S2-397B to specjalista naukowy, który jest kompetentnym modelem ogólnym; Grok 4.6 to generalista, który tylko przelotnie interesuje się nauką. To, że wiersze naukowe są nierówne, jest oczekiwane — żaden flagowy model ogólny nie był wstępnie trenowany na surowych stronach literatury naukowej z rycinami, układem i notacją symboliczną razem, i właśnie wokół tego paradygmatu zbudowano Intern-S2-397B. Nic w żadnej z obu baz dowodowych nie potwierdza twierdzenia „Intern-S2-397B jest tak samo dobry jak Grok 4.6 w dowolnym rozumowaniu”, a nic w dowodach dotyczących Grok 4.6 nie sugeruje, że został dostrojony do analizy sekwencji multiomicznych.
Cena kontroli
Grok 4.6 ma cenę, którą można wpisać do arkusza kalkulacyjnego: 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, a stawka rośnie do 4,00 USD / 12,00 USD, gdy prompt przekroczy 200 000 tokenów, plus opcjonalny poziom priorytetowy dla szybszych odpowiedzi. Jest dostępny przez OrcaRouter w cenie katalogowej xAI przekazywanej z zerowym narzutem, więc zmiana stawki w xAI trafia tutaj tego samego dnia bez różnicy ze strony pośrednika — wynajmowane pokrętło pozostaje wyceniane tak, jak wycenia je dostawca.
Intern-S2-397B nie ma w ogóle publikowanej stawki za token. Karta modelu odwołuje się do oficjalnego API Intern, ale ekonomia, którą ludzie faktycznie chcą porównywać, to ta związana z self-hostingiem: checkpoint o 403 mld parametrów, około 807 GB wag w 188 shardach w BF16, czyli poważny węzeł wielo-GPU, przy czym wersja FP8 w przybliżeniu o połowę zmniejsza zajętość. Jeśli już posiadasz tę moc obliczeniową, koszt krańcowy kolejnego zapytania naukowego zbliża się do kosztu energii elektrycznej i to jest cały sens pozycji Apache-2.0. Jeśli jej nie posiadasz, „darmowy” model jest pilotażem w ramach nakładów inwestycyjnych, a nie pozycją budżetową.
To, co daje router w tym konkretnym zestawieniu, to styk, a nie cena. Grok 4.6 działa na kluczu, który już masz na potrzeby ogólnego ruchu produkcyjnego; Intern-S2-397B nie jest routingowany na OrcaRouter — to zupełnie nowy checkpoint, a droga do niego prowadzi przez własne API dostawcy albo wdrożenie hostowane samodzielnie. Kieruj ogólne rozumowanie wrażliwe na opóźnienia do modelu rozliczanego za użycie, zostaw naukową pracę wsadową na modelu, który sam uruchamiasz, a automatyczne przełączanie awaryjne niech cię zabezpiecza, gdy punkt końcowy którejkolwiek ze stron nie działa prawidłowo. Granica między nimi staje się regułą routingu zamiast drugiej integracji.

Który wybrać
Wybierz Grok 4.6, gdy zadanie jest ogólne, rozumowanie musi wracać szybko i poprawnie, a nie chcesz być właścicielem stosu, który je wytwarza. Jego okno 500K, zmierzony wynik GPQA Diamond na poziomie 94.9 i zestaw narzędzi to funkcje produkcyjne, a stawka $2/$6 to cena za to, że niczym nie musisz zarządzać.
Wybierz Intern-S2-397B, gdy dane wejściowe mają charakter naukowy — gęsto ilustrowany artykuł, diagram molekularny, sygnał szeregu czasowego — oraz gdy rozumowanie musi odbywać się na danych, które nie mogą opuścić twojego środowiska, albo na zachowaniu, które chcesz samodzielnie dostroić. Apache-2.0 to umożliwia; żadne wynajmowane API tego nie potrafi. Zaplanuj budżet na sprzęt, nie spodziewaj się przez jakiś czas niezależnego rankingu, a każdą liczbę na jego karcie traktuj jako twierdzenie, dopóki ktoś spoza InternLM nie odtworzy choćby jednej z nich.


