'Mercury 2.5 Preview vs Gemini 3.1 Pro'를 위한 히어로 타이틀 카드로, 부제는 '6개월 간격의 두 프리뷰'입니다. 'Mercury 2.5 Preview' 라벨이 붙은 왼쪽 패널에는 번개 모양, '256K 컨텍스트' 필, '텍스트 전용' 태그, '$0.04 인트로' 필이 표시됩니다. 'Gemini 3.1 Pro' 라벨이 붙은 오른쪽 패널에는 멀티모달 글리프 세트(이미지, 오디오, 비디오), '1M 컨텍스트' 필, '출시 시 AA Index 57' 배지, '$2.00 / $12.00' 필이 표시됩니다. 두 패널 사이에는 얇은 'vs' 배지가 있습니다. OrcaRouter 로고는 오른쪽 하단 모서리에 합성되어 있습니다.
Guides & Insights

Mercury 2.5 Preview vs Gemini 3.1 Pro: 두 개의 프리뷰, 여섯 달 간격

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이번 맞대결에 나선 두 모델은 이름에 "preview"라는 단어를 담고 있지만, 공통점은 거기까지다. Mercury 2.5 Preview와 Gemini 3.1 Pro는 둘 다 지금 API로 호출할 수 있는 추론 모델이지만, 수명 주기의 정반대 지점에 있는 프리뷰다. 플래그십 추론 모델인 Gemini 3.1 Pro는 2026년 2월 19일부터 프리뷰로 제공되어 왔으며, 그 뒤에는 6개월간의 독립 평가, 공개 리더보드 순위, 프로덕션 트래픽이 쌓여 있다. 출시 시점 기준 Artificial Analysis Intelligence Index 57, 텍스트·이미지·오디오·비디오에 걸친 멀티모달 입력, 100만 토큰 컨텍스트, 토큰 백만 개당 $2.00 / $12.00의 가격을 갖췄다. Mercury 2.5 Preview는 2026년 8월 31일에 출시된 Inception의 diffusion LLM으로, 이제 이틀째다. 텍스트 전용 모델로 256K 컨텍스트와 주장상 초당 1,107개 토큰, 정가 $0.20 / $0.75(9월 8일까지 할인 적용 시 약 $0.04 / $0.15)를 내세우지만, 독립 벤치마크는 단 하나도 없다. 둘 다 "프리뷰"라고 부르는 것은 실제 질문을 가린다. 핵심은 6개월간 쌓은 검증 데이터라는 선두가, 근본적으로 더 빠른 텍스트 생성 방식에 비해 얼마만큼의 가치를 지니느냐다.

각 모델이 실제로 무엇인지

Gemini 3.1 Pro는 폐쇄형 멀티모달 범용 추론 플래그십 모델입니다. 텍스트, 이미지, 오디오, 비디오를 읽을 수 있으며, 64K 출력 상한을 가진 1M 토큰 컨텍스트 창을 처리하고 추론 깊이를 동적으로 조정합니다. 벤더는 작업 복잡도에 따라 확장되는 4계층 추론 강도를 설명합니다. ARC-AGI-2 77.1%, GPQA Diamond 94.3%, SWE-bench Verified 80.6%, Terminal-Bench 2.0 68.5%라는 출시 수치는 벤더가 보고한 것이지만, 6개월간의 독립적 검증을 거친 결과입니다. 여기에는 Artificial Analysis가 더 엄격한 지수 척도로 재측정해 모델이 약 46.5를 기록한 것도 포함됩니다. 그러한 재측정은 성숙한 모델이 당연히 받는 것입니다. 지수가 더 엄격해질 만큼 충분히 테스트된 것입니다. Mercury 2.5 Preview는 확산 모델로, 토큰을 하나씩 생성하는 대신 병렬로 생성하고 정제합니다. 조정 가능한 추론, 병렬 도구 호출, 스키마에 맞춘 JSON을 갖추고 있으며, Inception이 지칭하는 지연 시간이 누적되는 워크로드(검색 에이전트, 음성 파이프라인, 코딩 서브에이전트)를 위해 설계되었습니다. Mercury 2 대비 10포인트 이상의 향상을 포함한 모든 품질 주장은 벤더의 자체 주장이며, 제3자가 측정한 바가 없습니다.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

스펙 대비

가격 — Mercury 2.5 Preview: 1M 입력/출력당 $0.20 / $0.75, 9월 8일까지 프로모션 가격 약 $0.04 / $0.15. Gemini 3.1 Pro: 1M당 $2.00 / $12.00, 입력 200K 초과 시 $4.00 / $18.00로 인상됩니다.

컨텍스트 / 출력 — Mercury 2.5 Preview: 256K 컨텍스트. Gemini 3.1 Pro: 1M 컨텍스트, 최대 출력 64K.

입력 — Mercury 2.5 Preview: 텍스트만. Gemini 3.1 Pro: 텍스트, 이미지, 오디오, 비디오, 파일.

아키텍처 — Mercury 2.5 프리뷰: 확산 LLM, 병렬 토큰 생성. Gemini 3.1 Pro: 자동회귀, 동적 추론 깊이.

속도 — Mercury 2.5 Preview: 1,107 토큰/초를 주장. Gemini 3.1 Pro: 이에 필적할 만한 헤드라인 수치는 없음.

근거 — Mercury 2.5 Preview: 공급업체 보고만 제공됨. Gemini 3.1 Pro: 출시 시 AA Index 57(새 척도로는 46.5), 그리고 긴 독립 평가 기록.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

멀티모달리티 격차가 결정적인 차이입니다.

대부분의 애플리케이션에서 이 비교는 가격이나 벤치마크가 등장하기 전에 이미 결정됩니다. Mercury 2.5 Preview는 볼 수 없기 때문입니다. Gemini 3.1 Pro는 스크린샷, 다이어그램, 오디오, 비디오를 읽습니다. PDF, 차트, 회의 녹화, 또는 UI를 가리키며 이미 텍스트가 아닌 무언가에 대한 답을 원할 때 사용하는 모델이 바로 그것입니다. Mercury 2.5 Preview는 설계상 텍스트 전용입니다. 텍스트를 병렬로 생성하는 확산 언어 모델에는 이미지나 오디오 입력 경로가 전혀 없습니다. 문서 중심 애플리케이션, 비전 에이전트, 또는任何 멀티모달 제품을 고려한다면 Gemini 3.1 Pro가 여기서 유일한 후보입니다. 그 이상도 이하도 아닙니다. Mercury 2.5 Preview의 텍스트 전용 제약은 작은 글씨로 적힌 주의사항이 아닙니다. 그것은 해당 모델이 어떤 작업에조차 적합할지를 결정짓는 경계선입니다.

6개월간의 테스트 대 이틀

증거에 비추어 볼 때, 이것은 경쟁 구도가 아니며 그 이유를 분명히 말하는 것이 중요합니다. Gemini 3.1 Pro는 6개월 동안 독립 연구소들에 의해 면밀히 분석되어 왔고, 그 점수는 책정되고, 재측정되고, 논쟁의 대상이 되어 왔습니다. 이것이 모델에게 '신뢰할 수 있음'이 의미하는 바입니다. Mercury 2.5 Preview에 대한 정보 출처는 단 하나, 바로 제작사뿐이며, 그 출처는 Mercury 2보다 10포인트 이상의 지능 향상과 프런티어의 비용 최적화 등급과의 동등성을 주장합니다. 두 주장 모두 사실일 수 있습니다. 어느 것도 Inception 외부의 누구에 의해 확인되지는 않았으며, 모델이 너무 새로운 만큼 이는 당연한 일입니다. 비대칭성의 핵심은 한쪽이 더 낫다는 것이 아니라, 한쪽은 검증 가능하고 다른 쪽은 아직 그렇지 않다는 점입니다.

수성의 속도가 실제로 강점이 되는 곳

Mercury 2.5 Preview에 대한 정직한 평가는 좁고, 텍스트 전용이며, 실재적이다. 병렬 토큰 생성은 자기회귀 모델이 따라올 수 없는 방식으로 지연 시간의 계산 구조를 바꾼다. Gemini 3.1 Pro를 포함한 자기회귀 모델은 본질적으로 직렬이기 때문이다. 음성 파이프라인의 경우, 아이러니하게도 입력과 출력은 오디오지만 그 사이의 사고는 텍스트다. 빠른 텍스트 추론 계층이야말로 음성 에이전트가 반응이 빠르다고 느껴지게 만드는 요소다. 반복적인 도구 호출을 수행하는 검색 에이전트와 작업당 여러 개의 작은 완성 단위를 쏟아내는 코딩 하위 에이전트에게 있어 호출별 지연 시간은 누적되어 체감 속도가 된다. 출시 가격(입력 $0.04, 출력 $0.15)에서 Mercury 2.5 Preview는 Gemini 3.1 Pro의 표준 출력 요금보다 약 80배 저렴하다. 따라서 단순히 더 빠를 뿐만 아니라 대량 텍스트 추론에서는 비용 등급 자체가 다르다. 이 모든 문장마다 반드시 따라붙어야 할 단서가 있다. 속도는 주장된 것이고, 품질 동등성도 주장된 것이며, 독립적인 측정은 존재하지 않는다는 것이다.

가격: Gemini의 장문 맥락 프리미엄 대비 Mercury의 티저

Gemini 3.1 Pro의 요금표에는 대표 수치를 비교하기 전에 알아둘 만한 세부 사항이 있습니다. 200K 입력 토큰을 초과하는 요청은 백만 개당 $2.00 / $12.00에서 $4.00 / $18.00로 점프합니다. 1M 컨텍스트 모델에서 그 긴 컨텍스트 프리미엄은 예외적인 경우가 아닙니다. 이는 이 모델이 유명해진 바로 그 컨텍스트 창을 실제로 사용하는 대가입니다. Mercury 2.5 Preview에는 그런 단계가 없으며, 256K 컨텍스트가 긴 컨텍스트 영역에 자주 도달할 가능성도 낮습니다. 하지만 Mercury의 저렴한 가격은 9월 8일에 만료되는 유인책일 뿐이고, Gemini의 가격은 안정적으로 공개된 요금입니다. 비교할 때는 Mercury의 정가 $0.20 / $0.75를 Gemini의 표준 등급과 비교하세요. 할인된 수치와 비교하지 마세요. 할인은 테스트를 유도하기 위한 것이지, 계획을 세울 때 기준으로 삼을 가격이 아닙니다.

라우팅 결정

두 모델 모두 현재 라우팅이 가능하며, 그렇기에 각 모델을 다루는 방식도 달라야 합니다. Gemini 3.1 Pro는 OrcaRouter에서 google/gemini-3.1-pro-preview로 제공되며, 공급업체의 리스트 가격이 0% 마크업으로 전가되므로 표준 및 장문 컨텍스트 티어 비용은 공급업체가 공시한 가격과 정확히 일치하고, 하나의 API 키로 200개 이상의 다른 모델도 함께 쓸 수 있습니다. 프리뷰 배지는 베팅 대상이 아니라 라우팅으로 우회할 대상입니다. 모델 페이지의 오류율 패널이 존재하는 데는 이유가 있으며, 자동 장애 조치 덕분에 성능이 저하된 프리뷰 응답은 코드 변경 없이 두 번째 공급업체로 라우팅됩니다. Mercury 2.5 Preview는 아직 OrcaRouter에 없으며, Inception이 자체 API와 여러 타사 플랫폼을 통해 제공합니다. 아직 장애 조치 뒤에 둘 수 없는 이틀 된 모델은 테스트 후보이지 프로덕션 의존성이 아닙니다. 공급업체가 등재하는 날에는 동일한 전가가 적용되고 인트로 할인도 당일에 반영됩니다. 그때가 바로 이 대결이 결정이 아닌 라우팅 규칙이 되는 시점입니다.

솔직한 평가는 이 두 프리뷰가 서로 다른 질문에 답한다는 것입니다. Gemini 3.1 Pro는 {{1}}"오늘 내 제품을 어떤 모델 위에 구축해야 하는가"{{/1}}라는 질문에 답합니다. 멀티모달, 긴 컨텍스트, 독립적 테스트를 거쳤고 안정적이며, 가격도 그 모든 가치를 반영합니다. Mercury 2.5 Preview는 {{2}}"텍스트 추론이 물리적으로 얼마나 빨라질 수 있는가"{{/2}}라는 질문에 답합니다. 이 모델에서 가장 흥미로운 부분은 속도 아키텍처이며, 그와 함께 제공되는 품질이 진짜인지 여부는 독립 연구소의 확인을 기다리고 있습니다. 워크로드가 멀티모달이거나 긴 컨텍스트라면 선택은 이미 정해져 있습니다. 텍스트 전용이고 지연 시간이 누적되며 가격에 민감한 워크로드라면 Mercury 2.5 Preview가 지켜볼 만한 선택지이며, 9월 8일이 바로 그 대결을 지켜볼 날짜입니다.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube