
Grok 4.7 vs Gemini 3.1 Pro: 리더보드는 바뀌었지만, 모델은 그대로였다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
2026년 2월 19일, Artificial Analysis는 "Gemini 3.1 Pro Preview: AI의 새로운 선두주자"라는 제목의 글을 발표했다. 이 모델은 10개 평가 중 6개에서 1위를 차지했고 Claude Opus 4.6을 4점 차로 앞섰다. 오늘 그 같은 모델의 페이지를 보면 숫자는 30, 200개 중 69위다. 공급업체는 아무것도 바꾸지 않았다. 바뀐 것은 잣대다. Artificial Analysis는 2026년 9월 19일 Intelligence Index를 v4.3.2로 개정하며 카탈로그의 모든 모델을 다른 평가 세트에 비추어 다시 채점했고, 2월의 선두주자는 9월의 중위권이 되었지만 모델 자체는 프리뷰 상태로 그대로 남아 있었다. 이것이 2026년 9월 21일 공급업체가 출시한 Grok 4.7과의 비교의 배경이며, 이 대결이 어느 모델이 더 똑똑한가보다 이 둘 중 어느 쪽을 다음 달에도 같은 것으로 믿고 의지할 수 있는가에 더 가까운 이유다.
이들 각각이 실제로 무엇인지
Gemini 3.1 Pro는 Google의 최신 Pro 등급 모델이지만, 한 번도 정식 출시(GA)된 적이 없습니다. 2026년 2월 19일에 gemini-3.1-pro-preview로 출시되었고, Google의 지원 중단 목록에는 여전히 "종료일 미정"으로 기재되어 있습니다. 즉, 이제 7개월째 프리뷰 상태인데, 그동안 Google은 그 아래에 Flash 라인업을 출시했습니다: 5월에 3.5 Flash, 7월에 3.6, 8월에 3.7, 9월에 3.8. Gemini 3 Pro보다 새로운 GA Pro 모델은 없습니다. 이 모델은 1,048,576토큰 입력 창과 65,536토큰 출력 상한을 갖추고 있으며, 텍스트, 이미지, 비디오, 오디오, PDF를 입력받아 텍스트를 출력하고, 예산 파라미터와 minimal 설정 없이 낮음, 보통, 높음의 thinking-level 제어를 제공합니다. 가중치는 비공개입니다.
Grok 4.7은 출시된 지 하루밖에 되지 않았으며, 역시 클로즈드 웨이트입니다. 500k 토큰 컨텍스트를 보유하는데, 이는 Gemini의 절반입니다. 또한 텍스트와 이미지를 입력받으므로 비디오나 오디오는 전혀 입력할 수 없으며, 이는 이 비교에서 가장 두드러진 단일 역량 차이입니다. 200k 프롬프트 토큰 미만 기준으로 100만 입력 토큰당 $2.00, 100만 출력 토큰당 $6.00으로 책정되어 있고, 이 기준을 넘으면 $4.00와 $12.00로 올라가며, 캐시 읽기는 $0.50와 $1.00입니다. xAI는 또한 출력 속도가 약 두 배이고 가격도 두 배인 더 빠른 변형도 제시합니다. 여기에서 확인한 문서에는 이 모델의 최대 출력 수치가 공개되어 있지 않습니다.
통치자가 움직였다. 그것이 이야기의 전부다.
두 모델 모두 현재 Artificial Analysis Intelligence Index v4.3.2에서 평가됩니다. 이 지수는 Terminal-Bench 2.1을 Terminal-Bench 4.0으로, tau3-Banking을 AutomationBench-AA로 대체했고, GDPval-AA Elo 척도를 재정박했습니다. 지수가 적용되었을 때 모든 모델의 수치가 움직였습니다. Gemini 3.1 Pro의 수치는 대부분보다 더 크게 움직였는데, 2월 당시의 강점이 새 지수에서 폐지되거나 가중치가 조정된 평가들에 집중되어 있었기 때문입니다. 오늘 두 열을 나란히 놓고 보면:
• 종합 — Grok 4.7 (xhigh): Artificial Analysis Intelligence Index v4.3.2에서 46. Gemini 3.1 Pro Preview: 동일 리비전에서 30, 200개 중 69위.
• 긴 컨텍스트 — Grok 4.7: 500k 윈도우, AA-LCR v1.1 77%. Gemini 3.1 Pro: 1M 윈도우 — 두 배 더 크며 — 65K 출력 상한은 긴 컨텍스트 에이전트 세션에서 보통 필요한 양의 약 절반에 불과합니다.
• 입력 모달리티 — Grok 4.7: 텍스트 및 이미지. Gemini 3.1 Pro: 텍스트, 이미지, 동영상, 오디오 및 PDF. 비교할 수준이 아니며, 벤치마크 격차가 아니라 역량 격차입니다.
• 속도 — Grok 4.7: 아직 공개된 측정값이 없습니다. Gemini 3.1 Pro: 초당 출력 토큰 124.4개로 200개 중 39위이며, Google AI Studio를 통한 첫 토큰 도달 시간은 63.62초입니다.
• 가격, 표준 티어 — Grok 4.7: 100만 토큰당 입력 $2.00 / 출력 $6.00. Gemini 3.1 Pro: 입력 $2.00 / 출력 $12.00. 동일한 입력, 두 배의 출력.
• 가격, 장문 컨텍스트 등급 — Grok 4.7: 200k 프롬프트 토큰에서 $4.00 / $12.00로 두 배로 증가. Gemini 3.1 Pro: 동일한 200k 경계에서 $4.00 / $18.00로 상승. 동일한 입력, 50% 더 많은 출력.
• 성숙도 — Grok 4.7: 출시 하루째로, 벤더 벤치마크는 대부분 재현되지 않았다. Gemini 3.1 Pro: 시장에 나온 지 7개월이지만 여전히 프리뷰 빌드로 GA 확정도, 서비스 종료 일정도 없다.

미리보기 문제는 이제 실제 문제가 되었습니다.
7개월짜리 프리뷰는 아무 문제도 없었다면 위험이라기보다 기이한 일이었을 것이다. 그런데 문제가 생겼다. 2026년 9월 18일부터 사용자들은 Gemini 3.1 Pro가 AI Studio 모델 선택기에서 사라졌다고 보고하기 시작했으며, 이 글을 쓰는 시점까지 Google 직원의 응답도, 지원 중단 공지도, 명시된 원인도 없었다 — 확인된 서비스 종료가 아니라 해결되지 않은 가용성 사고인 셈이다. 이를 발표 이력과 나란히 놓아 보자. Google은 2026년 5월 I/O에서 Gemini 3.5 Pro가 "다음 달 출시된다"고 말했고, 8월 말 언론 보도에서는 내부 후보 모델들이 "Flash 시리즈보다 충분히 낫지 않았다"는 이유로 해당 모델이 폐기되었다고 전했다. Google 자체의 Pro 페이지는 여전히 "3.5 Pro 출시 예정"을 광고하고 있는데, 이는 한 화면 안에 담긴 모순이다. 결말이 어찌 되든, 실무적으로 해석하자면 Gemini 3.1 Pro는 GA 일정도 없고 후속 모델도 명시되지 않았으며 현재 가용성에 물음표가 달린 프리뷰 엔드포인트라는 것이다.
Grok 4.7의 위험은 거울상이며 정도도 더 작습니다. 출시된 지 하루밖에 되지 않아 수치가 빈약합니다. Artificial Analysis는 속도나 지연 시간 측정치를 전혀 공개하지 않았고, 이 모델에 대한 xAI 자체 벤치마크 스위트도 독립적으로 재현되지 않았습니다. 의문의 여지가 없는 것은 이 모델이 일반 제공되고, 가격이 책정되었으며, 문서화되어 있고, 정체성이 안정적이라는 점입니다. 정체성은 안정적이지만 수치가 입증되지 않은 모델은, 수치는 공개되었지만 가용성이 안정적이지 않은 모델보다 훨씬 더 기반으로 삼아 구축하기 쉬운 대상입니다.
분할이 실제로 초래하는 비용
문서 파이프라인용으로 선택한다고 가정해 보자. 100k 입력 토큰과 8k 출력 기준으로 Grok 4.7은 입력 $0.20, 출력 $0.048이 든다 — 약 25센트다. Gemini 3.1 Pro는 입력 $0.20, 출력 $0.096이 든다 — 약 30센트다. 두 모델은 서로 20퍼센트 이내 차이다, 그리고 문서가 스캔본, PDF, 오디오 또는 비디오라면 Gemini는 둘 중에서 이런 것들을 읽을 수 있는 유일한 모델이다. 그것은 벤치마크 논쟁이 아니다; 해당 워크로드에서는 비교를 끝내 버린다.
이제 긴 컨텍스트 에이전트를 위해 선택한다고 가정해 보자. 300k 입력과 8k 출력에서 Grok 4.7은 입력 $1.20, 출력 $0.096으로 약 $1.30이 든다. Gemini 3.1 Pro는 입력 $1.20, 출력 $0.144로 약 $1.35가 든다. 사실상 동일하다 — 그리고 여기서 Gemini의 1M 윈도와 65K 출력 상한이 결정을 내리는 제약이 된다. 65K 상한은 장기 에이전트 실행이 무너지는 지점이기 때문이다. 이 맞대결에서 어느 모델도 저렴한 선택지가 아니며, 프런티어 기준으로도 어느 쪽도 비싸지 않다.

움직이는 표적을 우회하는 경로 설정
OrcaRouter는 Gemini 3.1 Pro를 제공합니다, 공급자의 요율로 자체 모델 페이지에 등록되어 있습니다 — 입력 $2.00, 출력 $12.00, 1M 윈도우와 최대 출력 65k — 우리가 공급자 정가를 0% 마진으로 그대로 전달하기 때문입니다. 이런 경우에 그것은 마케팅 문구가 아닙니다: Google은 9월에 가용성이 흔들렸던 가격 미정의 프리뷰 빌드를 보유하고 있고, 라우터가 하는 유용한 일은 그 뒤에 있는 것이 바뀌는 동안 통합을 안정적으로 유지하는 것입니다. 자동 페일오버는 응답을 멈춘 프리뷰 엔드포인트가 장애가 아니라 라우팅 이벤트가 되게 합니다, 그리고 라우팅 DSL을 사용하면 멀티모달 모델을 텍스트 전용 모델과 한 번의 호출로 조합할 수 있습니다 — 이는 바로 이 조합이 시사하는 형태로, Gemini가 영상을 읽고 Grok이 그 대본에 대해 추론을 수행하는 것입니다. Grok 4.7은 이 글을 쓰는 시점에 OrcaRouter 카탈로그에 없습니다; 오늘 그것을 호출하려면 xAI 자체 API와 이를 취급하는 서드파티 플랫폼을 거쳐야 합니다.
구축할 가치가 있는 패턴은 이렇다: 동영상, 오디오 또는 PDF를 반드시 받아들여야 하는 작업에는 Gemini 3.1 Pro를 유지하고, 그 프리뷰 상태는 피해야 할 이유가 아니라 우회해야 할 운영상 위험으로 취급하라. 더 낮은 출력 가격과 더 높은 종합 점수가 적용되고, 오늘 통합하는 모델이 6개월 뒤에도 여전히 호출하게 될 모델인 텍스트 및 이미지 작업에는 Grok 4.7을 투입하라. 하지 말아야 할 한 가지는 69위 순위를 그 모델에 대한 판정으로 읽는 것이다 — 그것은 벤치마크 개정에 대한 판정이며, Gemini 3.1 Pro를 강등시킨 바로 그 개정은 Google이 손대지 않은 수십 개 모델도 함께 강등시켰다.
전화
현재 지수에서 Grok 4.7은 Gemini 3.1 Pro를 16점 앞서며, 출력 가격은 표준 티어에서 절반이고 롱컨텍스트 티어에서는 3분의 1 더 저렴합니다. 워크로드가 텍스트와 이미지라면, 그것만으로 결정하기에 충분합니다. 워크로드가 비디오, 오디오 또는 스캔 문서라면 Gemini 3.1 Pro가 둘 중 유일한 후보이며 비교는 거기서 끝납니다. 점수가 아니라 기능을 사는 것입니다. 두 모델 모두에 따라붙어야 할 단서는 성능이 아니라 출처에 관한 것입니다. 하나는 GA 일정도 없고 뒤에 9월 가용성 사고가 있는 7개월 된 프리뷰이고, 다른 하나는 헤드라인 숫자만 있고 그 외에는 독립적 재현이 전혀 없는 하루 된 모델입니다. 어느 쪽도 확정된 선택이 아닙니다. 둘 다 확정하기보다는 라우팅할 가치가 있습니다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
