
Intern-S2 vs Gemini 3.1 Pro: Multimodalny pojedynek, który InternLM faktycznie zmierzył
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Większość porównań w tej serii wymaga łączenia twierdzeń dwóch dostawców. To jedno nie. Intern-S2, udostępniony dzisiaj przez InternLM model multimodalny Apache-2.0 o 397 miliardach parametrów, oraz Gemini 3.1 Pro, flagowy model rozumowania Google, oba występują jako zmierzone kolumny w tej samej tabeli wyników — co czyni to najuczciwszym bezpośrednim porównaniem w zestawie i, nieprzypadkowo, tym, w którym model otwarty ma najwięcej do wyjaśnienia. Gemini 3.1 Pro odczytuje tekst, obrazy, dźwięk i wideo, utrzymuje kontekst 1 mln tokenów i od momentu wejścia w wersję podglądową 19 lutego 2026 r. jest rozkładany na czynniki pierwsze przez niezależne laboratoria i ruch produkcyjny. Intern-S2 odczytuje tekst, obrazy i szeregi czasowe, został dziś rano przesłany na Hugging Face i nie ma żadnego wyniku od stron trzecich. W wierszach, w których zmierzono oba modele, model Google wygrywa w większości z nich.
Oba odczytują obrazy. I na tym podobieństwa się kończą.
Słowo „multimodalny” sprawia, że te modele brzmią jak równorzędne sobie. Nie są sobie równe, a różnica tkwi w tym, na co każdy z nich został zbudowany, by patrzeć.
Ścieżka wizyjna Intern-S2 została wytrenowana do przetwarzania surowych stron literatury naukowej — rycin, równań, diagramów strukturalnych, układu — jako pojedynczej współdzielonej reprezentacji, zamiast najpierw wyodrębniać z nich tekst. Jej multimodalne benchmarki mają charakter naukowy: VQA z mikroskopii biologicznej, teledetekcja, odpowiadanie na pytania dotyczące wykresów naukowych. Przyjmuje również dane szeregów czasowych i może generować prognozy, co jest typem danych wejściowych, którego niemal żaden ogólny model flagowy w ogóle nie obsługuje.
Multimodalność Gemini 3.1 Pro jest uniwersalna i szersza rodzajowo: tekst, obraz, dźwięk i wideo w jednym modelu, nastawiona na cały zakres zadań produkcyjnych, w których wskazujesz modelowi plik i zadajesz pytanie. Nagranie ze spotkania, zrzut ekranu interfejsu, wykres w pliku PDF, klip wideo — wszystko wchodzi w grę, a każde z nich ma za sobą sześć miesięcy publicznej ewaluacji.
Jeśli Twoim danymi wejściowymi jest rycina naukowa, Intern-S2 został stworzony specjalnie do tego i ma liczby od dostawcy, by uzasadnić swoje stanowisko. Jeśli Twoim danymi wejściowymi jest cokolwiek innego, Gemini 3.1 Pro obsługuje dźwięk i wideo, a Intern-S2 nie obsługuje żadnego z nich. To rozstrzyga znaczną część pytań „którego powinienem użyć”, zanim cena lub benchmarki w ogóle wejdą w grę, a każdy, kto twierdzi, że te dwa są wymienne, nie przeczytał listy danych wejściowych.
Co pokazuje wspólny stół, czytany uczciwie
Ponieważ InternLM przeprowadził benchmarki dla obu, jest to jedno z niewielu miejsc, w których bezpośrednie porównanie jest uzasadnione, a nie poskładane z różnych źródeł. Zastrzeżenie pozostaje bez zmian i warto je raz przytoczyć: wszystkie wyniki Intern-S2 są raportowane przez dostawcę, uzyskane przez InternLM na jego własnym zestawie testowym za pośrednictwem OpenCompass, VLMEvalKit i AgentCompass, bez niezależnego odtworzenia. Liczby Gemini w tej tabeli również pochodzą z porównania przeprowadzonego przez InternLM, choć Gemini ma poza tą tabelą obszerny niezależny dorobek.
• Wiedza multimodalna — Gemini 3.1 Pro 83,99 w MMMU Pro w porównaniu z Intern-S2 81,68.
• QA dotyczące wykresów naukowych — Gemini 3.1 Pro 71,18 w ChartQAPro vs Intern-S2 71,12. Remis do dwóch miejsc po przecinku.
• Teledetekcja — Gemini 3.1 Pro 54,27 w XLRS-Bench vs Intern-S2 51,38.
• Mikroskopia VQA — Gemini 3.1 Pro 71,02 na MicroVQA vs Intern-S2 69,67.
• Naukowe zadania multimodalne — Intern-S2 60,74 w SFE vs Gemini 3.1 Pro 59,57. Jedyne multimodalne zwycięstwo Intern-S2.
• Wiedza ogólna — Gemini 3.1 Pro 91,00 w MMLU Pro vs Intern-S2 89,77.
• Matematyka w szkole średniej — Gemini 3.1 Pro 94,70 na HMMT-2026 vs Intern-S2 93,56.
• Rozumowanie na podstawie literatury naukowej — Intern-S2 55,71 w Biology-Instructions vs Gemini 3.1 Pro 13,87, oraz 53,95 vs 38,84 w Mol-Instructions.
• Zadania olimpiady naukowej — Intern-S2 87,00 w FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.
• Mistrzostwo terminala — Gemini 3.1 Pro 73,80 w TerminalBench 2.1 vs Intern-S2 64,04.
Uczciwa interpretacja: Gemini 3.1 Pro wygrywa szerokie multimodalne wiersze niewielką przewagą, Intern-S2 wygrywa wiersze dotyczące głębokiej literatury naukowej ogromną przewagą, a żaden z tych wyników nie jest zaskakujący, biorąc pod uwagę, na jakich danych każdy z nich był trenowany. To, jak niewielkie są przegrane w obszarze multimodalności, jest prawdopodobnie ciekawszym odkryciem — otwarty checkpoint wydany tego samego dnia, który na MMMU Pro i ChartQAPro osiąga wynik w granicach dwóch punktów od sześciomiesięcznego zamkniętego modelu flagowego, to dla InternLM silniejszy wynik niż jakiekolwiek jego spektakularne wyniki naukowe.
Kontekst, wynik i pytanie podglądu
Kwestia długiego wejścia rozdziela się klarownie. Gemini 3.1 Pro ma okno kontekstowe 1M tokenów z limitem wyjścia 64K — wystarczające dla długiego zestawu dokumentów i obszernej odpowiedzi. Intern-S2 jest oceniany na maksymalnie 256K tokenów w rozumowaniu tekstowym i 64K w trybie multimodalnym, a nie publikuje limitu wyjścia; traktuj jego użyteczne okno jako mniejsze niż okno Gemini, dopóki ktoś nie zmierzy go niezależnie.
Jest jedno zastrzeżenie operacyjne po stronie Google, które należy uwzględnić w każdym uczciwym porównaniu. Gemini 3.1 Pro to wciąż model w wersji zapoznawczej, a nie wydanie GA. Modele w wersji zapoznawczej wiążą się z niższymi oczekiwaniami co do niezawodności, a siedmiodniowy panel wskaźnika błędów na stronie modelu to stałe przypomnienie, by omijać niestabilność, zamiast budować na niej ścieżkę krytyczną. Intern-S2 to pełne wydanie na licencji Apache-2.0 z wagami, które można przypiąć — co, wbrew intuicji, czyni zupełnie nowy otwarty model operacyjnie stabilniejszym z tych dwóch w najważniejszym sensie: nikt nie może zmienić go pod tobą.
• Kontekst — Intern-S2: 256K tekstu / 64K multimodalnie, oceniany w porównaniu z Gemini 3.1 Pro i 1M tokenów.
• Dane wejściowe — Intern-S2: tekst, obraz, szeregi czasowe vs Gemini 3.1 Pro: tekst, obraz, audio, wideo.
• Wagi — Intern-S2 Apache-2.0, do pobrania, w przeciwieństwie do zamkniętego Gemini 3.1 Pro.
• Dojrzałość — Intern-S2 ma zaledwie kilka godzin, brak niezależnego wyniku w porównaniu z Gemini 3.1 Pro preview od lutego 2026, intensywnie i niezależnie testowanym.
• Cena — Intern-S2 brak publicznego cennika; samodzielny hosting lub oficjalne API Intern vs Gemini 3.1 Pro $2.00 za milion tokenów wejściowych / $12.00 za milion tokenów wyjściowych, rosnące do $4.00/$18.00 powyżej 200K tokenów wejściowych.

Cena i gdzie mieszka każde z nich
Gemini 3.1 Pro rozlicza 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych w warstwie standardowej, a gdy pojedyncze żądanie przekroczy 200 tys. tokenów wejściowych, stawka rośnie do 4,00/18,00 USD — premia za długi kontekst, która daje o sobie znać dokładnie wtedy, gdy korzystasz z okna 1M uzasadniającego wybór tego modelu. Można go routować w OrcaRouter po tej samej cenie katalogowej, przekazywanej z 0% marży, na kluczu, który obsługuje także ponad 200 innych modeli; ten pass-through ma tu znaczenie, bo zmiana ceny Google trafia na naszą stronę tego samego dnia, a nie dopiero po cyklu aktualizacji cennika. DSL routingu jest najprzydatniejszą częścią w tym konkretnym zestawieniu: możesz kierować zadania z obrazami i wideo do Gemini 3.1 Pro, a partie dokumentów naukowych do samodzielnie hostowanego Intern-S2, i trzymać jedne i drugie za jednym punktem końcowym, bez drugiej umowy i bez zmian w kodzie.
Intern-S2 nie ma opublikowanej ceny API. Samodzielne hostowanie wag Apache-2.0 to droga, którą faktycznie wybierze większość zespołów, a przy 403B parametrów to poważne zobowiązanie sprzętowe. Oficjalne API Intern istnieje dla zespołów, które wolą nie uruchamiać GPU, ale bez publicznego cennika porównania kosztów z Gemini za $2/$12 nie da się przeprowadzić na papierze — trzeba poprosić o przydział i samemu wykonać obliczenia.

Połączenie
Wybierz Gemini 3.1 Pro, jeśli potrzebujesz ogólnego modelu multimodalnego, który obsługuje dźwięk i wideo, utrzymuje milion tokenów, ma za sobą miesiące niezależnej walidacji i można go dziś wynająć w rozliczeniu za tokeny. To model lepiej udokumentowany i o szerszych możliwościach, a oznaczenie preview to zastrzeżenie dotyczące niezawodności, a nie możliwości.
Wybierz Intern-S2, jeśli Twoje dane wejściowe multimodalne mają charakter naukowy, a Twoje dane nie mogą opuścić Twojej infrastruktury. To jedyny z tych dwóch, który natywnie czyta surowe strony literatury, prognozuje na podstawie sygnałów szeregów czasowych i można go dostroić na zastrzeżonych danych eksperymentalnych w ramach permisywnej licencji. Pogódź się z tym, że jesteś pierwszą osobą, która go uruchamia, oraz że tabelę benchmarków przemawiającą na jego korzyść napisali ludzie, którzy go stworzyli.

Żaden z modeli nie wygrywa tu jednoznacznie, a tabela dowodzi tego lepiej, niż mógłby zrobić to werdykt. Jeden jest generalistą, który akurat dobrze sobie radzi w nauce; drugi to instrument naukowy, który akurat jest konkurencyjny w ogólnych zadaniach multimodalnych — a w przypadku otwartego udostępnienia tego samego dnia „konkurencyjny” to bardziej zaskakujący wynik.
Aby objąć obie części tego porównania bez drugiej umowy: jeden klucz API obejmujący ponad 200 modeli stawia zamknięty flagowy model multimodalny i każdą alternatywę za jednym punktem końcowym, dzięki czemu możesz kierować zadania związane z obrazem i wideo w jedną stronę, a partie dokumentów w drugą.
