
Intern-S2 vs Gemini 3.1 Pro: InternLM이 실제로 측정한 멀티모달 맞대결
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
이 시리즈의 대부분의 맞대결은 두 벤더의 주장을 서로 이어 붙여야 한다. 이번 것은 그럴 필요가 없다. InternLM이 오늘 공개한 3970억 파라미터 Apache-2.0 멀티모달 모델 Intern-S2와 Google의 플래그십 추론 모델 Gemini 3.1 Pro는 둘 다 같은 벤치마크 표에 측정된 열로 등장한다 — 이로써 이번은 이 세트에서 가장 공정한 일대일 비교이며, 우연히도 오픈 모델이 가장 많은 것을 해명해야 하는 비교이기도 하다. Gemini 3.1 Pro는 텍스트, 이미지, 오디오, 비디오를 읽고, 100만 토큰 컨텍스트를 보유하며, 2026년 2월 19일 프리뷰에 들어간 이후 독립 연구소와 실제 프로덕션 트래픽에 의해 철저히 뜯겨져 왔다. Intern-S2는 텍스트, 이미지, 시계열을 읽고, 오늘 아침 Hugging Face에 업로드되었으며, 어떤 종류의 제3자 점수도 없다. 둘 다 측정된 행에서는 Google의 모델이 그중 이기는 쪽이 더 많다.
둘 다 이미지를 읽습니다. 유사점은 거기서 끝입니다.
"멀티모달"이라는 말은 이 모델들을 서로 대등한 것처럼 들리게 만든다. 하지만 이들은 대등하지 않으며, 그 차이는 각각이 무엇을 보도록 만들어졌는가에 있다.
Intern-S2의 비전 경로는 과학 문헌의 원시 페이지(그림, 수식, 구조 도표, 레이아웃)를 텍스트로 먼저 파싱해내기보다 하나의 공유 표현으로 소비하도록 훈련되었습니다. 그 멀티모달 벤치마크는 과학 분야입니다: 생물학 현미경 VQA, 원격 탐사, 과학 차트 질문 응답. 또한 시계열 데이터를 입력받아 예측을 생성할 수 있는데, 이는 거의 어떤 범용 플래그십도 전혀 다루지 못하는 입력 유형입니다.
Gemini 3.1 Pro의 멀티모달성은 범용적이고 종류도 더 넓습니다: 텍스트, 이미지, 오디오, 비디오를 하나의 모델에서 처리하며, 모델에 파일을 지정하고 질문을 던지는 모든 생산 작업을 겨냥합니다. 회의 녹음, UI 스크린샷, PDF 속 차트, 비디오 클립 — 모두 다룰 수 있는 대상이며, 모두 6개월간의 공개 평가를 거쳤습니다.
입력이 과학 도표라면, Intern-S2는 바로 그 용도로 만들어졌으며 그 주장을 뒷받침할 벤더 수치도 갖추고 있다. 입력이 그 밖의 다른 것이라면, Gemini 3.1 Pro는 오디오와 비디오를 입력으로 받지만 Intern-S2는 둘 다 입력으로 받지 않는다. 이는 가격이나 벤치마크가 고려되기 전에 "어느 것을 써야 하나"라는 질문의 상당 부분을 해결해 주며, 두 모델이 서로 바꿔 써도 된다고 말하는 사람은 입력 목록을 읽지 않은 것이다.
공유된 표가 보여주는 것, 정직하게 읽어보면
InternLM이 둘 모두를 벤치마크했기 때문에, 이곳은 직접 비교가 짜맞춘 것이 아니라 정당한 몇 안 되는 경우 중 하나입니다. 유의점은 변함없으며 한 번은 언급할 가치가 있습니다: 모든 Intern-S2 수치는 벤더가 보고한 것으로, InternLM이 자체 하네스에서 OpenCompass, VLMEvalKit, AgentCompass를 통해 실행했으며 독립적으로 재현된 바 없습니다. 그 표에 있는 Gemini의 수치도 InternLM이 수행한 그 비교에서 나온 것이지만, Gemini는 그 외부에 광범위한 독립 기록을 갖고 있습니다.
• 멀티모달 지식 — MMMU Pro에서 Gemini 3.1 Pro 83.99 vs Intern-S2 81.68.
• 과학 차트 QA — ChartQAPro에서 Gemini 3.1 Pro 71.18 대 Intern-S2 71.12. 소수점 두 자리까지 막상막하.
• 원격 탐사 — XLRS-Bench에서 Gemini 3.1 Pro 54.27 대 Intern-S2 51.38.
• 현미경 VQA — MicroVQA에서 Gemini 3.1 Pro 71.02 대 Intern-S2 69.67.
• 과학적 멀티모달 작업 — SFE에서 Intern-S2 60.74 대 Gemini 3.1 Pro 59.57. Intern-S2의 유일한 멀티모달 승리.
• 일반 지식 — MMLU Pro에서 Gemini 3.1 Pro 91.00 대 Intern-S2 89.77.
• 고등학교 수학 — HMMT-2026에서 Gemini 3.1 Pro 94.70 대 Intern-S2 93.56.
• 과학 문헌 추론 — Biology-Instructions에서 Intern-S2 55.71 대 Gemini 3.1 Pro 13.87, Mol-Instructions에서는 53.95 대 38.84.
• 과학 올림피아드 문제 — FrontierScience-Olympiad에서 Intern-S2 87.00 vs Gemini 3.1 Pro 79.00.
• 터미널 숙달도 — TerminalBench 2.1에서 Gemini 3.1 Pro 73.80 대 Intern-S2 64.04.
솔직히 읽자면: Gemini 3.1 Pro는 폭넓은 멀티모달 항목들에서 근소한 차이로 이기고, Intern-S2는 심층 과학 문헌 항목들에서 압도적인 차이로 이긴다. 그리고 각각이 무엇으로 학습되었는지를 고려하면 어느 결과도 놀랍지 않다. 멀티모달 패배의 근소함은 따져보면 더 흥미로운 발견이다 — 같은 날 공개된 오픈 체크포인트가 MMMU Pro와 ChartQAPro에서 6개월 된 폐쇄형 플래그십에 2점 이내로 따라붙는다는 것은 InternLM에게 있어 자신의 어떤 압도적인 과학 수치보다도 더 강력한 결과다.
컨텍스트, 출력 및 미리보기 질문
장문 입력 이야기는 명확하게 갈린다. Gemini 3.1 Pro는 64K 출력 상한과 함께 1M 토큰 컨텍스트 윈도우를 갖추고 있어, 긴 문서 세트와 상당한 분량의 답변을 감당하기에 충분하다. Intern-S2는 텍스트 추론의 경우 최대 256K 토큰, 멀티모달의 경우 64K로 평가되며, 출력 상한을 공개하지 않는다. 누군가 독립적으로 측정하기 전까지는 그 사용 가능한 윈도우를 Gemini의 것보다 작다고 간주하라.
정직한 비교라면 어디에나 들어가야 할 운영상의 주의점이 Google 쪽에 하나 있습니다. Gemini 3.1 Pro는 아직 GA 릴리스가 아니라 프리뷰 모델입니다. 프리뷰 모델은 신뢰성 기대치가 더 낮으며, 모델 페이지의 7일 오류율 패널은 그 위에 핵심 경로를 구축하기보다 불안정성을 우회하라고 늘 상기시켜 줍니다. Intern-S2는 가중치를 고정할 수 있는 완전한 Apache-2.0 릴리스입니다. 이는 역설적이게도, 가장 중요한 의미에서, 갓 출시된 오픈 모델이 둘 중 운영상 더 안정적인 쪽이 되게 합니다: 누구도 당신 모르게 그것을 바꿔놓을 수 없기 때문입니다.
• 컨텍스트 — Intern-S2 256K 텍스트 / 64K 멀티모달, Gemini 3.1 Pro 1M 토큰과 비교 평가.
• 입력 — Intern-S2: 텍스트, 이미지, 시계열 vs Gemini 3.1 Pro: 텍스트, 이미지, 오디오, 비디오.
• 가중치 — Intern-S2 Apache-2.0, 다운로드 가능 vs Gemini 3.1 Pro는 폐쇄형.
• 성숙도 — Intern-S2는 공개된 지 몇 시간밖에 되지 않았고, 2026년 2월 이후 Gemini 3.1 Pro preview와 비교한 독립적 점수가 없으며, 철저하고 독립적으로 테스트됨.
• 가격 — Intern-S2는 공개 요금표가 없음; 자체 호스팅 또는 공식 Intern API 대 Gemini 3.1 Pro는 백만 토큰당 입력 $2.00 / 출력 $12.00이며, 입력 토큰 200K 초과 시 $4.00/$18.00로 상승.

가격과 각각이 어디에 있는지
Gemini 3.1 Pro는 표준 티어에서 입력 토큰 백만 개당 $2.00, 출력 토큰 백만 개당 $12.00을 청구하며, 요청이 입력 토큰 20만 개를 넘으면 $4.00/$18.00으로 올라갑니다. 이는 선택의 근거가 되는 100만 토큰 윈도를 실제로 사용할 때 정확히 부담으로 다가오는 장문 컨텍스트 프리미엄입니다. 동일한 정가로 OrcaRouter에서 라우팅할 수 있으며 0% 마크업으로 그대로 전달됩니다. 200개 이상의 다른 모델도 함께 실리는 키에서 말이죠. 여기서 이 패스스루가 중요한 이유는 Google의 가격 변동이 재가격 주기를 거친 뒤가 아니라 같은 날 우리 쪽에 반영되기 때문입니다. 이 특정 조합에서 유용한 부분은 라우팅 DSL입니다. 이미지와 비디오 작업은 Gemini 3.1 Pro로, 과학 문서 배치는 자체 호스팅 Intern-S2로 보내면서, 별도의 계약이나 코드 변경 없이 둘 다 하나의 엔드포인트 뒤에 유지할 수 있습니다.
Intern-S2는 공개된 API 가격이 없습니다. Apache-2.0 가중치를 자체 호스팅하는 것이 대부분의 팀이 실제로 선택하게 될 경로이며, 403B 파라미터에서는 상당한 하드웨어 투자가 필요합니다. 공식 Intern API는 GPU를 직접 운영하고 싶지 않은 팀을 위해 존재하지만, 공개된 요금표가 없으면 Gemini의 $2/$12와의 비용 비교는 종이 위에서 할 수 있는 일이 아닙니다 — 할당량을 요청하고 직접 계산해야 합니다.

전화
오디오와 비디오를 입력받고, 100만 토큰을 수용하며, 수개월간의 독립적 검증을 거쳤고, 현재 토큰 단위로 임대할 수 있는 범용 멀티모달 모델이 필요하다면 Gemini 3.1 Pro를 선택하십시오. 이 모델은 더 잘 입증되었고 더 폭넓은 역량을 갖춘 모델이며, 프리뷰 배지는 역량상의 유의사항이 아니라 신뢰성상의 유의사항입니다.
멀티모달 입력이 과학적이고 데이터가 인프라를 떠날 수 없다면 Intern-S2를 선택하세요. 이것은 두 가지 중 원시 문헌 페이지를 기본적으로 읽고, 시계열 신호로부터 예측하며, 허용적 라이선스 하에 독점 실험 데이터로 미세 조정할 수 있는 유일한 모델입니다. 이것을 처음 실행하는 사람이 당신이라는 점과, 이것을 지지하는 벤치마크 표가 이것을 만든 사람들에 의해 작성되었다는 점을 받아들이세요.

어느 모델도 이 싸움에서 완승하지 못하며, 그 표가 어떤 평결보다 이를 더 잘 입증한다. 하나는 우연히 과학에 강한 범용 모델이고, 다른 하나는 우연히 일반 멀티모달 작업에서도 경쟁력이 있는 과학 도구다. 그리고 같은 날 공개된 오픈 릴리스에서 '경쟁력 있다'는 쪽이 더 놀라운 결과다.
두 번째 계약 없이 이 비교의 양쪽 측면을 모두 확보하려면: 200개 이상의 모델을 아우르는 API 키 하나는 폐쇄형 멀티모달 플래그십과 모든 대안을 하나의 엔드포인트 뒤에 배치하므로, 이미지 및 비디오 작업은 한쪽으로, 문서 배치는 다른 쪽으로 라우팅할 수 있습니다.
