
GPT-6 대 Gemini 3.1 Pro: Google의 Pro 티어는 2월 이후 새 모델을 출시하지 않았다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Gemini 3.1 Pro는 Google의 가격표에 7개월 반 동안 올라 있었고 한 번도 프리뷰 상태를 벗어난 적이 없습니다. 2026년 2월 19일에 발표되었고, 여전히 Gemini 3.1 Pro Preview라는 이름의 엔드포인트로 제공되고 있으며, 오늘 기준으로 일반 제공(GA) 약속도, 서비스 종료 날짜도 없습니다. 이 두 날짜가 바로 해당 모델이 공급사 자체 계획에서 어디에 놓여 있는지 알려 줄 날짜입니다. 반면 GPT-6 Sol은 2026년 9월 22일에 출시되었고, 2026년 10월 7일에는 주간 사용자 12억 명 이상을 대상으로 한 ChatGPT 글로벌 롤아웃의 유료 등급을 뒷받침하는 모델이 되었습니다.
그러니까 이 헤드라인 비교는 두 플래그십 등급 사이의 비교가 아니다. 그것은 실제 출시된 제품과 끝이 정해지지 않은 프리뷰 사이의 비교이며, 그 차이는 벤치마크 격차보다 더 큰 가치가 있는 것으로 드러난다. Artificial Analysis의 Intelligence Index v4.3.2에서 둘을 나란히 놓아 보면, Google의 7개월 된 프리뷰는 GPT-6 Sol의 47.6에 맞서 29.7점을 기록하는데, 완료된 인덱스 작업당 비용은 1.25배 더 많이 청구한다 — $1.30 대 $1.04. 이 두 수치는 모두 사실이고, 둘 다 여기에 돈을 쓰기 전에 단서를 붙여야 한다.
이것을 무시하지 않고 읽을 가치가 있게 만드는 것은, 이 프리뷰가 실제로 승리를 거둔다는 점이다. 그것은 GPQA Diamond, τ²-Bench 에이전트 도구 사용, 그리고 한 가지 장문맥 측정에서 GPT-6 Sol을 이긴다. 또한 오디오와 비디오를 입력으로 받는데, GPT-6 Sol은 그렇지 않다. 4번의 대결 중 2번을 여전히 가져가는 7개월 된 프리뷰는 무시할 모델이 아니다. 그것은 능력이 아니라 수명 주기가 문제인 모델이다.
숫자들, 그리고 그 숫자들과 함께 따라다녀야 하는 개정 관련 주의사항
Artificial Analysis는 자사의 평가 스위트를 다시 실행하고 현재 지수 개정판에 따라 점수를 다시 게시합니다. 즉, 같은 모델이 언제 확인하느냐에 따라 서로 다른 두 숫자를 가질 수 있습니다. Gemini 3.1 Pro의 경우 그 변동 폭은 유난히 큽니다. 이 모델에 대한 이전 보도에서는 더 오래된 개정판에서 57을 보고했지만, 오늘날 현재 페이지에서는 v4.3.2에서 29.7을 보고합니다. 두 수치 모두 실제이며, 둘 다 같은 웹사이트에 있습니다.
그게 중요한 이유는 같은 리비전의 수치만 서로 뺄 수 있기 때문입니다. 여기서는 29.7과 47.6을 한 쌍으로 써야 합니다. 둘 다 v4.3.2에서 나온 값이니까요 — Claude Opus 5.5에 57.6, GPT-6 Astra에 52.7을 기록하는 동일한 실행입니다. 동일 실행 기준 판독값, 차원당 한 줄:
• 인텔리전스 지수, v4.3.2 — GPT-6 Sol 47.6 대 Gemini 3.1 Pro 29.7
• 완료된 인덱스 작업당 비용 — Gemini 3.1 Pro $1.30 대 GPT-6 Sol $1.04; 구형 모델은 완성된 답변당 25% 더 비쌉니다
• 입력 가격 — 양쪽 모두 1M당 $2.00, 헤드라인 가격은 동일
• 출력 가격 — GPT-6 Sol $10.00 대 Gemini 3.1 Pro $12.00; Sol이 17% 더 저렴합니다
• 장문 컨텍스트 조항 — GPT-6 Sol은 272,000 입력 토큰을 초과하면 전체 요청 가격을 $4.00/$15.00로 재산정합니다; Gemini 3.1 Pro는 200,000을 초과하면 $4.00/$18.00로 인상됩니다
• 컨텍스트 창 — GPT-6 Sol 1,050,000 토큰 대 Gemini 3.1 Pro 1,048,576, 사실상 동일
• 최대 출력 — GPT-6 Sol 128,000 토큰 대 Gemini 3.1 Pro 65,536; Sol이 거의 두 배
• 입력 모달리티 — GPT-6 Sol 텍스트, 이미지, 파일 대 Gemini 3.1 Pro 텍스트, 이미지, 오디오, 비디오, PDF

거기 두 줄은 더 자세히 짚어볼 가치가 있습니다. 상식적인 해석을 뒤집기 때문입니다. 작업당 비용 줄은 더 저렴해 보이는 요금표가 완성된 작업당 비용은 더 비싼 모델의 것임을 말해 줍니다 — Gemini 3.1 Pro의 $12 출력 요금에 그 추론량까지 더하면, 대표 요금인 $2 입력이 시사하는 것보다 더 많은 작업을 해냅니다. 그리고 장문 컨텍스트 구간은 양쪽 모두 다시 읽어볼 만합니다. Gemini 3.1 Pro의 구간은 200,000 토큰에서 시작해 GPT-6 Sol의 272,000보다 낮지만, 출력 요금은 $18.00로 재책정하는 반면 Sol은 $15.00로 재책정합니다. 어느 쪽도 정액 요금표가 아니며, 교차점도 서로 맞지 않습니다.
미리보기가 여전히 우위를 점하는 곳
Google의 모델은 유물이 아니다. 두 카드가 지닌 평가를 가져와라:
• GPQA Diamond — Gemini 3.1 Pro 94.1% vs GPT-6 Sol, 이 리비전에서는 비교 가능한 수치가 공개되지 않음
• τ²-Bench 에이전트 도구 사용 — Gemini 3.1 Pro 95.6% vs GPT-6 Sol, 같은 리더보드에 공개되지 않음
• 장문 컨텍스트 회상 — Gemini 3.1 Pro 82.0% vs GPT-6 Sol 83.7%, 1.7점 차이
• SciCode — Gemini 3.1 Pro 58.7% vs GPT-6 Sol 57.6%, 사실상 동일한 수준
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4.0% vs GPT-6 Sol 43.9%; 이 프리뷰가 경쟁력이 없는 유일한 범주

94.1%의 GPQA Diamond와 95.6%의 에이전트 도구 사용 점수는 레거시 수치가 아니라 최전선 수치이며, 바로 이 때문에 17.9점의 지수 격차는 실질적인 거리를 과장한다. 이 지수는 10개 평가를 종합한 합성 지표이며, Gemini 3.1 Pro의 손실은 스위트가 소프트웨어 엔지니어링에 크게 가중치를 둔 부분에 집중되어 있다 — 4.0%의 Terminal-Bench 4.0은 58.7%의 SciCode와 73.8%의 Terminal-Bench 2.1 옆에서 치명적인 이상치다. 한 모델이 한 에이전트 벤치마크에서는 최상위권에 가깝고 그 후속 벤치마크에서는 최하위권에 가까운 점수를 낸다는 것은 그 모델의 한계가 아니라 훈련 시점을 말해준다.
오디오 및 비디오 입력은 또 다른 구체적인 장점이며, 이는 점진적 차이가 아니라 일종의 관문이다. 여러분의 파이프라인이 회의 녹음이나 화면 캡처를 입력으로 받는다면, Gemini 3.1 Pro는 여기에 진입할 수 있지만 GPT-6 Sol은 그럴 수 없다. 아무리 뛰어난 인덱스 리더십도 그것을 대신할 수 없다.
“아직 미리보기”가 당신에게 구체적으로 어떤 대가를 치르게 하는가
프리뷰 상태는 겉치레 라벨이 아니며, 그 비용은 무언가 위에 구축한 뒤에야 드러나는 종류의 비용이다.
프리뷰 엔드포인트는 일반 제공(GA) 약속을 수반하지 않습니다. 즉, 공급업체가 계획을 세울 수 있는 일정에 맞춰 해당 모델이 계속 제공될 것이라고 약속하지 않았다는 뜻입니다. 또한 종료 날짜도 수반하지 않는데, 이는 좋은 쪽으로 해석하면 — 아무것도 단종되지 않는다는 뜻이지만 — 반대로 읽힐 수도 있습니다: Google은 2월부터 이 상태에 있는 모델의 수명 주기를 공개하지 않았으며, 같은 기간 내내 Flash 등급 모델을 출시해 왔습니다. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, 3.6 및 3.8 Flash 라인: Pro 등급은 그대로였고, 후속 모델은 대신 Gemini 4 Argon으로 등장했는데, Google은 2026년 9월 30일 지명된 보안 파트너 그룹을 대상으로 단계적 롤아웃을 발표했으며 여기에도 일반 제공 날짜는 붙지 않았습니다.
그것이 바로 이 비교가 실제로 다루고 있는 패턴입니다. Gemini 3.1 Pro Preview 위에 오래가는 파이프라인을 구축한다면, 여러분은 자사 공급업체조차 언제 정식 출시되거나 교체되거나 퇴출될지 밝히지 않은 모델 위에 구축하는 셈입니다. GPT-6 Sol의 입지는 정반대입니다. 공개된 요금표를 갖춘 일반 제공 API 제품이며, 2026년 10월 7일부터는 여러분의 동료 대부분이 사용하는 앱의 기본값이기도 합니다. 공급업체가 보고했고 아직 재현되지 않은 내용으로, OpenAI는 ChatGPT에서 GPT-6가 Intelligent UI라고 부르는 기능을 통해 텍스트, 그래픽, 차트, 대화형 컨트롤을 사용해 답변을 구성하며, 웹 검색이 필요한 답변은 GPT-5.6 Instant보다 44% 더 빨리 시작되고, Extra High 노력 수준은 GPT-5.6의 Medium과 같은 속도로 응답을 시작한다고 말합니다. 그중 어느 것도 API 통합을 바꾸지는 않습니다. 그 모든 것이 GPT-6가 이제 상시 기본값이 되고 그 프리뷰는 그렇지 않은 이유입니다.
이 논거에는 단순한 버전도 있다. 당신은 완료된 작업당 25% 더 많은 비용을 지불하면서, 더 낮은 역량 점수로, 수명 주기가 공개되지 않은 모델을 쓰고 있다. 반론도 사실이다 — 당신은 GPQA Diamond에서 94.1%와 오디오 입력을 얻고 있다 — 하지만 그것은 특정 워크로드에 대한 특정 논거일 뿐, 더 오래된 모델을 선호할 일반적인 이유는 아니다.
베팅하지 않고 미리보기를 테스트하는 것
Gemini 3.1 Pro의 위치에 있는 모델에서 피해야 할 실수는 "이걸 써야 할까"를 하나의 이분법적 결정으로 취급하는 것입니다. 그렇지 않습니다. Gemini 3.1 Pro Preview와 GPT-6 Sol은 모두 OrcaRouter의 카탈로그에 있습니다 — 하나의 OpenAI 호환 엔드포인트와 하나의 키 뒤에, 제공업체 정가 대비 0% 마크업으로 자리하고 있습니다. 따라서 이 프리뷰는 실제 요청 경로에 넣고 여러분의 워크로드와 대조해 측정한 뒤, 별도의 벤더 계약이나 코드 변경 없이 유지하거나 버릴 수 있는 대상입니다.
자동 장애 조치는 프리뷰 수명 주기에 있는 모델에 대해 이를 안전하게 만드는 장치입니다. 오디오 및 비디오 트래픽은 입력을 받을 수 있는 두 모델 중 유일한 Gemini 3.1 Pro로 라우팅하고, 소프트웨어 엔지니어링 및 장문 출력 트래픽은 GPT-6 Sol로 라우팅하세요. 그리고 프리뷰 엔드포인트가 지원 중단되거나, 속도 제한에 걸리거나, 조용히 가격이 바뀌는 경우 요청이 실패하는 대신 일반 제공 모델에 도착하도록 폴백을 구성하세요. 그것이 7개월 된 프리뷰가 얻는 구조입니다 — 회피가 아니라, 그것에 의존하지 않는 경로입니다.
더 나아가고 싶다면, routing DSL은 여러 모델을 하나의 논리적 호출로 구성하므로, 요청을 Gemini 3.1 Pro와 GPT-6 Sol에 시도해 보고 한 업체의 기준이 아니라 여러분 자신의 기준으로 답변을 선택할 수 있습니다. 모델 퓨전은 반대 방향으로 같은 일을 합니다. 즉, 여러 모델 패널이 하나의 질문에 답하는 방식인데, 이는 프로덕션 경로에 프리뷰를 투입하기 전에 그 프리뷰의 특정 강점이 비용을 지불할 가치가 있는 부분인지 알아보는 합리적인 방법입니다.

그 평결, 그리고 주목해야 할 숫자
새로운 작업에는 GPT-6 Sol이 배포를 좌우하는 여섯 가지 기준 중 네 가지에서 더 안전한 선택이며, 동일한 리비전에서 17.9 인덱스 포인트 더 높은 점수를 받으면서 완료된 작업당 비용은 더 저렴합니다. 오디오나 비디오 입력이 필요한 워크로드, 또는 94.1% GPQA Diamond가 구매의 핵심인 경우에는 Gemini 3.1 Pro Preview가 여전히 우세하며, 프리뷰 라벨은 외면할 이유라기보다 관리해야 할 위험입니다.
주목할 숫자는 지수가 아니다. 그것은 Gemini 3.1 Pro의 엔드포인트 이름에 있는 날짜다. 프리뷰 접미사가 떨어져 나가거나 — Argon이 실제 API 식별자와 함께 정식 출시되면 — 이 비교의 구도는 완전히 달라지고, Pro 티어의 마지막 릴리스와 오늘 사이의 7개월 격차가 바로 이 기사의 주제가 된다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
