Wygenerowana karta hero porównująca Intern-S2 i Gemini 3.1 Pro, pokazująca stronę z ryciną naukową i wykres zasilające model multimodalny po lewej stronie oraz cztery ikony wejściowe dla obrazu, dźwięku, wideo i tekstu wokół zamkniętej karty API po prawej, oznaczona kontrastem między naukową multimodalnością Apache-2.0 a zamkniętym flagowym modelem multimodalnym ogólnego przeznaczenia o kontekście 1M, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: Multimodalny pojedynek, który InternLM faktycznie zmierzył

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Większość porównań w tej serii wymaga łączenia twierdzeń dwóch dostawców. To jedno nie. Intern-S2, udostępniony dzisiaj przez InternLM model multimodalny Apache-2.0 o 397 miliardach parametrów, oraz Gemini 3.1 Pro, flagowy model rozumowania Goog​le, oba występują jako zmierzone kolumny w tej samej tabeli wyników — co czyni to najuczciwszym bezpośrednim porównaniem w zestawie i, nieprzypadkowo, tym, w którym model otwarty ma najwięcej do wyjaśnienia. Gemini 3.1 Pro odczytuje tekst, obrazy, dźwięk i wideo, utrzymuje kontekst 1 mln tokenów i od momentu wejścia w wersję podglądową 19 lutego 2026 r. jest rozkładany na czynniki pierwsze przez niezależne laboratoria i ruch produkcyjny. Intern-S2 odczytuje tekst, obrazy i szeregi czasowe, został dziś rano przesłany na Hugging Face i nie ma żadnego wyniku od stron trzecich. W wierszach, w których zmierzono oba modele, model Goog​le wygrywa w większości z nich.

Oba odczytują obrazy. I na tym podobieństwa się kończą.

Słowo „multimodalny” sprawia, że te modele brzmią jak równorzędne sobie. Nie są sobie równe, a różnica tkwi w tym, na co każdy z nich został zbudowany, by patrzeć.

Ścieżka wizyjna Intern-S2 została wytrenowana do przetwarzania surowych stron literatury naukowej — rycin, równań, diagramów strukturalnych, układu — jako pojedynczej współdzielonej reprezentacji, zamiast najpierw wyodrębniać z nich tekst. Jej multimodalne benchmarki mają charakter naukowy: VQA z mikroskopii biologicznej, teledetekcja, odpowiadanie na pytania dotyczące wykresów naukowych. Przyjmuje również dane szeregów czasowych i może generować prognozy, co jest typem danych wejściowych, którego niemal żaden ogólny model flagowy w ogóle nie obsługuje.

Multimodalność Gemini 3.1 Pro jest uniwersalna i szersza rodzajowo: tekst, obraz, dźwięk i wideo w jednym modelu, nastawiona na cały zakres zadań produkcyjnych, w których wskazujesz modelowi plik i zadajesz pytanie. Nagranie ze spotkania, zrzut ekranu interfejsu, wykres w pliku PDF, klip wideo — wszystko wchodzi w grę, a każde z nich ma za sobą sześć miesięcy publicznej ewaluacji.

Jeśli Twoim danymi wejściowymi jest rycina naukowa, Intern-S2 został stworzony specjalnie do tego i ma liczby od dostawcy, by uzasadnić swoje stanowisko. Jeśli Twoim danymi wejściowymi jest cokolwiek innego, Gemini 3.1 Pro obsługuje dźwięk i wideo, a Intern-S2 nie obsługuje żadnego z nich. To rozstrzyga znaczną część pytań „którego powinienem użyć”, zanim cena lub benchmarki w ogóle wejdą w grę, a każdy, kto twierdzi, że te dwa są wymienne, nie przeczytał listy danych wejściowych.

Co pokazuje wspólny stół, czytany uczciwie

Ponieważ InternLM przeprowadził benchmarki dla obu, jest to jedno z niewielu miejsc, w których bezpośrednie porównanie jest uzasadnione, a nie poskładane z różnych źródeł. Zastrzeżenie pozostaje bez zmian i warto je raz przytoczyć: wszystkie wyniki Intern-S2 są raportowane przez dostawcę, uzyskane przez InternLM na jego własnym zestawie testowym za pośrednictwem OpenCompass, VLMEvalKit i AgentCompass, bez niezależnego odtworzenia. Liczby Gemini w tej tabeli również pochodzą z porównania przeprowadzonego przez InternLM, choć Gemini ma poza tą tabelą obszerny niezależny dorobek.

• Wiedza multimodalna — Gemini 3.1 Pro 83,99 w MMMU Pro w porównaniu z Intern-S2 81,68.

• QA dotyczące wykresów naukowych — Gemini 3.1 Pro 71,18 w ChartQAPro vs Intern-S2 71,12. Remis do dwóch miejsc po przecinku.

• Teledetekcja — Gemini 3.1 Pro 54,27 w XLRS-Bench vs Intern-S2 51,38.

• Mikroskopia VQA — Gemini 3.1 Pro 71,02 na MicroVQA vs Intern-S2 69,67.

• Naukowe zadania multimodalne — Intern-S2 60,74 w SFE vs Gemini 3.1 Pro 59,57. Jedyne multimodalne zwycięstwo Intern-S2.

• Wiedza ogólna — Gemini 3.1 Pro 91,00 w MMLU Pro vs Intern-S2 89,77.

• Matematyka w szkole średniej — Gemini 3.1 Pro 94,70 na HMMT-2026 vs Intern-S2 93,56.

• Rozumowanie na podstawie literatury naukowej — Intern-S2 55,71 w Biology-Instructions vs Gemini 3.1 Pro 13,87, oraz 53,95 vs 38,84 w Mol-Instructions.

• Zadania olimpiady naukowej — Intern-S2 87,00 w FrontierScience-Olympiad vs Gemini 3.1 Pro 79,00.

• Mistrzostwo terminala — Gemini 3.1 Pro 73,80 w TerminalBench 2.1 vs Intern-S2 64,04.

Uczciwa interpretacja: Gemini 3.1 Pro wygrywa szerokie multimodalne wiersze niewielką przewagą, Intern-S2 wygrywa wiersze dotyczące głębokiej literatury naukowej ogromną przewagą, a żaden z tych wyników nie jest zaskakujący, biorąc pod uwagę, na jakich danych każdy z nich był trenowany. To, jak niewielkie są przegrane w obszarze multimodalności, jest prawdopodobnie ciekawszym odkryciem — otwarty checkpoint wydany tego samego dnia, który na MMMU Pro i ChartQAPro osiąga wynik w granicach dwóch punktów od sześciomiesięcznego zamkniętego modelu flagowego, to dla InternLM silniejszy wynik niż jakiekolwiek jego spektakularne wyniki naukowe.

Kontekst, wynik i pytanie podglądu

Kwestia długiego wejścia rozdziela się klarownie. Gemini 3.1 Pro ma okno kontekstowe 1M tokenów z limitem wyjścia 64K — wystarczające dla długiego zestawu dokumentów i obszernej odpowiedzi. Intern-S2 jest oceniany na maksymalnie 256K tokenów w rozumowaniu tekstowym i 64K w trybie multimodalnym, a nie publikuje limitu wyjścia; traktuj jego użyteczne okno jako mniejsze niż okno Gemini, dopóki ktoś nie zmierzy go niezależnie.

Jest jedno zastrzeżenie operacyjne po stronie Google, które należy uwzględnić w każdym uczciwym porównaniu. Gemini 3.1 Pro to wciąż model w wersji zapoznawczej, a nie wydanie GA. Modele w wersji zapoznawczej wiążą się z niższymi oczekiwaniami co do niezawodności, a siedmiodniowy panel wskaźnika błędów na stronie modelu to stałe przypomnienie, by omijać niestabilność, zamiast budować na niej ścieżkę krytyczną. Intern-S2 to pełne wydanie na licencji Apache-2.0 z wagami, które można przypiąć — co, wbrew intuicji, czyni zupełnie nowy otwarty model operacyjnie stabilniejszym z tych dwóch w najważniejszym sensie: nikt nie może zmienić go pod tobą.

• Kontekst — Intern-S2: 256K tekstu / 64K multimodalnie, oceniany w porównaniu z Gemini 3.1 Pro i 1M tokenów.

• Dane wejściowe — Intern-S2: tekst, obraz, szeregi czasowe vs Gemini 3.1 Pro: tekst, obraz, audio, wideo.

• Wagi — Intern-S2 Apache-2.0, do pobrania, w przeciwieństwie do zamkniętego Gemini 3.1 Pro.

• Dojrzałość — Intern-S2 ma zaledwie kilka godzin, brak niezależnego wyniku w porównaniu z Gemini 3.1 Pro preview od lutego 2026, intensywnie i niezależnie testowanym.

• Cena — Intern-S2 brak publicznego cennika; samodzielny hosting lub oficjalne API Intern vs Gemini 3.1 Pro $2.00 za milion tokenów wejściowych / $12.00 za milion tokenów wyjściowych, rosnące do $4.00/$18.00 powyżej 200K tokenów wejściowych.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Cena i gdzie mieszka każde z nich

Gemini 3.1 Pro rozlicza 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych w warstwie standardowej, a gdy pojedyncze żądanie przekroczy 200 tys. tokenów wejściowych, stawka rośnie do 4,00/18,00 USD — premia za długi kontekst, która daje o sobie znać dokładnie wtedy, gdy korzystasz z okna 1M uzasadniającego wybór tego modelu. Można go routować w OrcaRouter po tej samej cenie katalogowej, przekazywanej z 0% marży, na kluczu, który obsługuje także ponad 200 innych modeli; ten pass-through ma tu znaczenie, bo zmiana ceny Goog​le trafia na naszą stronę tego samego dnia, a nie dopiero po cyklu aktualizacji cennika. DSL routingu jest najprzydatniejszą częścią w tym konkretnym zestawieniu: możesz kierować zadania z obrazami i wideo do Gemini 3.1 Pro, a partie dokumentów naukowych do samodzielnie hostowanego Intern-S2, i trzymać jedne i drugie za jednym punktem końcowym, bez drugiej umowy i bez zmian w kodzie.

Intern-S2 nie ma opublikowanej ceny API. Samodzielne hostowanie wag Apache-2.0 to droga, którą faktycznie wybierze większość zespołów, a przy 403B parametrów to poważne zobowiązanie sprzętowe. Oficjalne API Intern istnieje dla zespołów, które wolą nie uruchamiać GPU, ale bez publicznego cennika porównania kosztów z Gemini za $2/$12 nie da się przeprowadzić na papierze — trzeba poprosić o przydział i samemu wykonać obliczenia.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Połączenie

Wybierz Gemini 3.1 Pro, jeśli potrzebujesz ogólnego modelu multimodalnego, który obsługuje dźwięk i wideo, utrzymuje milion tokenów, ma za sobą miesiące niezależnej walidacji i można go dziś wynająć w rozliczeniu za tokeny. To model lepiej udokumentowany i o szerszych możliwościach, a oznaczenie preview to zastrzeżenie dotyczące niezawodności, a nie możliwości.

Wybierz Intern-S2, jeśli Twoje dane wejściowe multimodalne mają charakter naukowy, a Twoje dane nie mogą opuścić Twojej infrastruktury. To jedyny z tych dwóch, który natywnie czyta surowe strony literatury, prognozuje na podstawie sygnałów szeregów czasowych i można go dostroić na zastrzeżonych danych eksperymentalnych w ramach permisywnej licencji. Pogódź się z tym, że jesteś pierwszą osobą, która go uruchamia, oraz że tabelę benchmarków przemawiającą na jego korzyść napisali ludzie, którzy go stworzyli.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Żaden z modeli nie wygrywa tu jednoznacznie, a tabela dowodzi tego lepiej, niż mógłby zrobić to werdykt. Jeden jest generalistą, który akurat dobrze sobie radzi w nauce; drugi to instrument naukowy, który akurat jest konkurencyjny w ogólnych zadaniach multimodalnych — a w przypadku otwartego udostępnienia tego samego dnia „konkurencyjny” to bardziej zaskakujący wynik.

Aby objąć obie części tego porównania bez drugiej umowy: jeden klucz API obejmujący ponad 200 modeli stawia zamknięty flagowy model multimodalny i każdą alternatywę za jednym punktem końcowym, dzięki czemu możesz kierować zadania związane z obrazem i wideo w jedną stronę, a partie dokumentów w drugą.