'Mistral Large 4 vs Gemini 3.1 Pro' 기사를 위한 생성된 타이틀 카드로, 제목은 굵은 기하학적 산세리프체로 표시되고, 그 아래에는 '여덟 달, 두 방향'이라는 부제목이 있으며, 위에는 세 개의 플랫 라인 아이콘 한 줄 — 달력 페이지, 터미널 창, 이미지 프레임 — 이 있고, 흰색 배경에 파란색과 청록색 그라데이션 악센트가 더해지며 오른쪽 아래 모서리에는 OrcaRouter 로고가 있다.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: 8개월, 두 가지 방향

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Gemini 3.1 Pro는 2026년 2월 19일부터 시장에 나와 있으며, 올가을에 출시된 모델들과 비교되는 순위를 포함해 모든 순위에서 여전히 최상위권에 가깝게 랭크된다. Mistral Large 4는 기껏해야 3주밖에 되지 않았다 — 2026년 10월 6일에 발표된 프리뷰로, 가중치는 10월 말로 예고되었고 라이선스는 명시되지 않았다. 10월 6일에 확인한 Artificial Analysis의 Intelligence Index에서 8개월 된 Gemini 3.1 Pro는 신규 모델의 38.4점에 맞서 29.7점을 기록한다. 그것이 이 비교의 정직한 출발점이며, 출시 날짜가 시사하는 것과는 정반대다.

그 설명은 신비롭지 않다. Gemini 3.1 Pro는 Google이 정식 릴리스로 승격한 적 없는 프리뷰 라인의 플래그십이며, Artificial Analysis의 해당 페이지에는 "Gemini 3.1 Pro Preview"라고 표기되어 있다 — 더 낮은 지수가 최상위 GPQA Diamond 옆에 놓여 있는 바로 그 페이지다. 이는 폭넓음을 위해 만들어진 모델이다: 매우 큰 컨텍스트 윈도, 폭넓은 모달리티 세트, 그리고 지식 질문에 강한 추론. Mistral Large 4는 완전히 다른 세계 지도를 염두에 두고 만들어졌으며, 가격도 그에 맞게 책정되어 있다.

각각이 무엇인지

Gemini 3.1 Pro는 Google의 프런티어 멀티모달 추론 모델이며, API ID는 gemini-3.1-pro-preview이고, 1,048,576 토큰 컨텍스트 창과 65,536 토큰 출력 상한을 갖습니다. 텍스트, 이미지, 비디오, 오디오 및 파일을 입력으로 받습니다. Google 자체 요금으로 OrcaRouter의 카탈로그에서 제공됩니다. Google 문서에는 프리뷰가 아닌 Gemini 3.1 Pro가 나열되어 있지 않으며, 프리뷰 이름이 곧 제품입니다.

Mistral Large 4는 1.05조 개 매개변수의 희소 전문가 혼합(MoE) 모델로, 490억 개의 활성 매개변수와 전용 16억 개 매개변수 비전 인코더를 갖추고 있으며, API ID mistral-large-4-0으로 "Mistral Large 4 Preview"라는 이름으로 제공됩니다. Mistral의 문서에는 100만 토큰 컨텍스트 창이 명시되어 있지만, Artificial Analysis는 자사가 테스트 중인 구성에서 524,288로 읽습니다. 최대 출력은 공개되지 않았습니다. Mistral은 이를 자사 최대이자 가장 성능이 뛰어난 모델이라고 설명하며, 가중치는 10월 말에 공개된다고 밝혔습니다.

출처가 함께 붙은 숫자들

두 모델 모두 독립적이므로, 아래 비교는 벤더 대 벤더가 아니라 동일 하네스 방식입니다:

• 인텔리전스 인덱스 v4.3 — Mistral Large 4 Preview 38.4 vs Gemini 3.1 Pro 29.7

• 인덱스 작업당 비용 — $1.13 vs $1.30

• 장문맥 추론 — 81.3% vs 82.0%

• GPQA Diamond — 프리뷰에서는 미공개 vs 94.1%

• 인류 최후의 시험 — 35.0% vs 47.0%

• Terminal-Bench 4.0 — 26.8% vs 4.0%

• SciCode — 54.2% 대 58.7%

• AutomationBench, 비즈니스 워크플로 — 59.9% vs 35.4%

• MMMU-Pro, 멀티모달 추론 — 76.4% vs 82.4%

• 컨텍스트 창 — 표기 1M / 테스트 524,288 vs 제공 1,048,576

• 출력 상한 — 미공개 vs 65,536 토큰

• 백만 토큰당 가격, 입력 / 출력 — 정가 $1.36 / $4.18, 프로모션가 $0.68 / $2.09, 200K 토큰 미만 $2.00 / $12.00 및 초과 $4.00 / $18.00 대비

• 가중치 — 공개 약속, 라이선스 미명시, 독점 대비

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

가장 눈에 띄는 단 하나의 행은 Terminal-Bench 4.0이다. Gemini 3.1 Pro는 4.0%를 기록한다. 오타도 아니고, 표의 환각도 아니다. 이는 2월에 나온 모델이 그보다 나중에 등장한 터미널 에이전트 하네스에서 실행된 결과를 반영한다. 같은 테스트에서 Mistral Large 4의 26.8%는 6배 더 높다. 오래된 에이전트 코딩 수치를 근거로 Gemini를 배제해 온 사람이라면 GPQA Diamond를 근거로 다시 후보에 넣어야 하고, 인덱스 순위를 근거로 Mistral을 배제한 사람이라면 터미널 행을 먼저 봐야 한다.

Gemini 3.1 Pro가 여전히 더 나은 패를 쥐고 있는 곳

지식과 폭넓음. 94.1%의 GPQA Diamond는 이 글 전체에서, 양쪽 진영을 통틀어 가장 높은 수치이며, 이는 대학원 수준의 과학 벤치마크입니다 — 모델이 말재주로 도달할 수 있는 숫자가 아닙니다. Humanity's Last Exam에서는 47.0% 대 35.0%, 그리고 신규 모델을 근소하게 앞서는 SciCode 점수도 같은 이야기를 합니다. 어려운 질문에 지식 코퍼스를 바탕으로 정확하게 답하는 것이 워크로드라면, Gemini 3.1 Pro는 출시 8개월이 지난 지금도 더 강력한 모델입니다.

모달리티 폭은 두 번째 장점입니다. Gemini 3.1 Pro는 텍스트와 이미지뿐 아니라 비디오와 오디오도 처리합니다. Mistral Large 4는 텍스트와 이미지를 처리합니다. 여러분의 파이프라인이 녹화된 회의, 화면 녹화 또는 센서 오디오를 입력으로 받는다면, 여기서 전체 입력을 볼 수 있는 모델은 단 하나뿐입니다.

출력 상한은 세 번째입니다. 65,536 토큰은 공개된 보장 상한이며, Mistral은 프리뷰에 대해서는 상한을 전혀 공개하지 않았습니다. 출시 게시물에서 명시되지 않은 출력 한도보다 프로덕션에서 더 큰 문제를 일으킬 가능성이 큰 것은 없습니다.

Gemini의 컨텍스트 윈도우는 실제로 1,048,576 토큰으로 제공되는 반면, Mistral의 1M은 벤더가 제시한 수치이고 독립적으로 측정된 값은 524,288이다. 윈도우의 맨 끝단에서 작동하는 워크로드라면, 표기된 수치와 측정된 수치의 차이는 곧 재작성을 의미한다.

Mistral Large 4가 결정을 바꾸는 지점

에이전트 작업, 특히 터미널을 다루는 모든 작업은 두 모델이 더 이상 비교 가능하지 않게 되는 지점이다. Mistral 자체 출시 게시물은 DeepSWE v1.1에서 61.7%, SWE-Atlas-QnA에서 59.4%, Terminal-Bench 4.0에서 28.3%를 Coding Agent Index 49.8%로 묶고, 해당 종합 척도에서 DeepSeek V4 Pro 0813과 Qwen3.8 Max를 앞섰다고 분명히 밝힌다. Mistral의 표현을 빌리면 이 세 수치는 Artificial Analysis가 자사 하네스를 공개하기 전에 비공개로 평가한 숫자이며, 아직 공개 지수에는 없고, 그때까지는 공급업체 발표로 표시해야 한다.

독립적인 증거도 같은 방향을 가리킨다. Gmail, Sheets, Slack, Salesforce에 걸친 657개의 비즈니스 워크플로를 아우르는 AutomationBench에서 Mistral Large 4는 59.9%를 기록하며 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro를 앞섰고, 동일한 하네스에서는 Gemini 3.1 Pro가 아예 등장하지 않는데, 이는 해당 벤치마크가 Gemini 3.1 Pro보다 나중에 나왔기 때문이다. Surge AI가 진행한 블라인드 인간 연구에서 Mistral Large 4 Preview는 코딩 품질 부문에서 5개 모델 중 3.74점으로 2위를 차지해 GLM-5.3과 Kimi K3보다 앞섰고, Claude Opus 5에만 뒤졌다.

미스트랄의 글에서 가장 날카로운 주장은 사이버 관련 주장이며, 정확히 짚고 넘어갈 가치가 있다: 실제 취약점을 재현한 뒤 패치하도록 모델에 요구하는 Artificial Analysis Cyber Index 테스트에서 82%를 기록했는데, 이는 모든 모델 중 최고라고 설명되며, Cybench의 40개 경쟁 과제에서는 93%, 그리고 Mistral은 Cyber Index 전체에서 전 세계 상위 5위에 들면서 중국 밖에서 개발된 오픈 웨이트 모델을 선도한다고 주장한다. 이는 독립 지수에서 공급업체가 인용한 수치다. 이들의 실질적 강점은 Mistral이 모델이 작업을 거부하기보다 수행하도록 만들었다는 점이다.

표에서 가장 저렴한 항목도 Mistral의 것이지만, 다만 근소하게 그렇다: 작업당 $1.13 대 $1.30으로, 프로모션 요율이 만들어내고 요금표라면 지워버릴 13%의 우위다. Gemini 3.1 Pro는 2026년 요금이 적용된 2026년 모델이며, 이 모델로 인덱스 작업을 실행하는 비용도 크지 않다.

아무도 벤치마크하지 않는 타이브레이커

테이블이 보여줄 수 없는 두 가지가 작용하고 있다. 첫 번째는 라이선싱이다. Gemini 3.1 Pro는 독점적이며 앞으로도 그럴 것이다; Mistral Large 4는 프리뷰로, 그 전체적인 홍보 포인트는 자체 정책에 따라, 자체 하드웨어에서, 유럽 법 아래에서 실행할 수 있는 다운로드 가능한 아티팩트가 된다는 것이다 — Mistral은 자체 데이터센터의 3,800대 Grace Blackwell GPU에서 이를 훈련했고 그곳에서 프리뷰를 서비스한다. 그 주장은 저장소가 나타나고 라이선스에 이름이 붙기 전까지는 아무 가치가 없다. 그것이 실현되는 날에는 대단히 큰 가치가 있다.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

두 번째는 운영 위험입니다. 아직 개선 중인 프리뷰는 당신이 사용하는 동안에도 바뀝니다. OrcaRouter에서는 이 비교의 양쪽 모두 하나의 OpenAI 호환 엔드포인트를 통해 공급자 정가에 0% 마크업으로 이용할 수 있습니다 — Gemini 3.1 Pro는 Google 요금으로 카탈로그에 라이브 상태이고, Mistral Large 4는 우리가 제공하는 경로가 아니므로 Mistral 자체 API와 여러 서드파티 플랫폼을 통해 접근해야 합니다. 여기서 유용한 부분은 라우팅 DSL입니다: 분류와 추출은 그 주에 더 저렴한 모델로 보내고, 어려운 잔여 작업은 에스컬레이션하며, 프리뷰의 안 좋은 날은 당신의 온콜 로테이션이 흡수하는 대신 자동 페일오버가 흡수하도록 하세요.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

판결

어떤 모델이 더 나은지가 아니라, 워크로드가 무엇인지를 물어라. 지식 작업, 오디오 및 비디오 입력, 보장된 출력 상한, 그리고 제공되는 백만 토큰 창을 기준으로 보면 Gemini 3.1 Pro는 여전히 더 강력한 모델이며, 그 나이는 결점이 아니다 — 그것은 다른 사람들이 8개월 동안 이 모델의 한계를 찾아낸 시간이다. 에이전트형 코딩, 터미널 작업, 보안 운영에서는 Mistral Large 4가 인덱스 순위가 오해를 불러일으킬 만큼 큰 격차로 앞서 있으며, 두 모델 중 결국 자체 호스팅이 가능해질 수 있는 유일한 모델이다.

주목해야 할 판가름 변수는 10월 말이다. 가중치가 허용적 라이선스로 공개된다면, Mistral Large 4는 Gemini 3.1 Pro와 가격을 놓고 경쟁하는 것을 멈추고 통제권을 놓고 경쟁하기 시작한다. 그리고 그것은 다른 싸움이다. 가중치가 제한적 라이선스로 공개된다면, 이 글의 답은 크게 달라지지 않는다. 하지만 그 이유는 달라진다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트