
GPT-6 Astra vs Gemini 3.1 Pro: 새로운 플래그십 대 6개월 된 가성비 제품
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128지능49코딩
모든 뉘앙스를 제쳐두고, 이 맞대결의 전체를 두 숫자로 요약하면 다음과 같습니다: Google의 Gemini 3.1 Pro는 200K 토큰 이하 프롬프트에 대해 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $12.00를 청구하며, OpenAI의 GPT-6 Astra는 입력 $10.00, 출력 $50.00의 단일 요금을 부과합니다. 달력상으로도 더 저렴한 모델이 훨씬 더 오래된 모델입니다. Gemini 3.1 Pro는 2026년 2월 19일에 출시되었고 GPT-6 Astra는 2026년 9월 3일에 출시되었습니다. 그 때문에 이 비교는 반대 방향에서도 이례적입니다. 보통은 기존 모델이 비싸고 신규 모델이 가격을 낮추는 법이니까요. 그런데 여기서 신규 모델은 입력 비용이 5배나 비쌉니다. 핵심 질문은 과연 GPT-6 Astra가 구글이 6개월 반 동안 Pro 등급 업데이트 없이도 여전히 건재한 Gemini 3.1 Pro보다 다섯 배는 더 나은 모델이냐는 것입니다.
둘 다 각 제조사의 최상위 제품 라인에 속하지만, 관리 방식은 매우 다르다. Gemini 3.1 Pro는 구글의 현재 Pro 플래그십이다. 2월에 프리뷰로 출시되어 오늘까지도 '프리뷰'로 명명되어 있으며, 구글이 Flash 라인을 세 차례 업데이트하고 'Gemini 4'를 언급하기 시작하는 동안 한 번도 리프레시되지 않았다. GPT-6 Astra는 OpenAI의 최신 플래그십이자 내부 Preparedness Framework에서 처음으로 'Critical' 등급을 받은 모델로, 단계적 롤아웃, 기업용 옵트인, 그리고 제조사가 세대적 도약이라고 설명하는 자체 보고 벤치마크 주장과 함께 등장했다. 두 모델 중 하나는 6개월 동안 변화 없이 저렴한 가격을 유지해 왔다. 다른 하나는 출시된 지 이틀밖에 안 된 모델이며, 가격은 프런티어가 전진한 듯 높게 책정되어 있다. 이 둘 사이에서 선택해야 하는 개발자에게 진짜 질문은 두 가지 상태 중 어느 쪽이 자신의 워크로드에 더 잘 맞느냐는 것이다. 종이 스펙상으로는 가격 차이가 시사하는 것보다 두 모델이 훨씬 가깝기 때문이다.
두 개의 가격 표, 두 가지 길이 이론
Google은 Gemini 3.1 Pro의 가격을 프롬프트 길이에 따라 차등 적용한다. 200K 입력 토큰까지는 입력 $2/출력 $12이며, 그 이후에는 입력 $4/출력 $18로 올라간다. 캐시 읽기는 $0.20~$0.40, 배치 사용 시에는 절반 가격이다. 즉, 짧은 프롬프트는 저렴하고 긴 프롬프트는 더 비싸다는 것이다. 이는 Google이 대부분의 트래픽이 될 것으로 예상하는 검색 및 그라운딩(grounding) 워크로드에 맞춰 설계된 가격 모델이다. 반면 OpenAI는 GPT-6 Astra를 입력 $10/출력 $50으로 고정 가격을 책정하고, 캐시 입력은 $1.00이다. 그 대신 매우 긴 프롬프트에는 다른 종류의 페널티를 적용한다. 입력 토큰이 약 272K를 초과하면 입력은 2배, 출력은 1.5배로 다시 계산되어, 실질적으로 입력 $20/출력 $75가 된다. 두 모델은 긴 컨텍스트에 대해 서로 다른 지점에서 추가 비용을 부과한다. Gemini는 200K까지는 저렴하다가 이후 완만하게 비싸지고, Astra는 272K까지는 고정이다가 이후 급격히 비싸진다. 따라서 300K 토큰 작업은 Gemini 3.1 Pro보다 GPT-6 Astra에서 훨씬 비싸다. 반면 50K 토큰 작업은 Gemini가 4~5배 더 저렴하다. 컨텍스트 하한 부근을 사용하는 워크로드에서는 Astra의 가격이 정당화되기 어렵다. 진짜로 높은 컨텍스트 한도가 필요한 워크로드에서는 두 공급업체 모두 할증을 부과하지만, OpenAI의 할증이 더 가파르다.
Gemini 3.1 Pro가 진정으로 앞서는 분야
구글의 플래그십 모델에는 OpenAI의 어떤 모델도 따라올 수 없는 세 가지 장점이 있다. 그런데 Astra 출시를 둘러싼 소음이 너무 커서 이 장점들은 쉽게 놓치기 쉽다. 첫째는 입력 모달리티다. Gemini 3.1 Pro는 텍스트, 이미지, 오디오, 비디오, PDF를 하나의 프롬프트에 담아 처리한다. 반면 GPT-6 Astra는 텍스트와 이미지만 입력받고 텍스트로만 출력한다. 전작과 동일한 모달리티 범위다. 둘째는 네이티브 그라운딩이다. Gemini는 Google Search, Maps, 코드 실행이 API에 내장된 채로 제공된다. 이는 에이전틱 리서치와 파라메트릭 리콜이 아닌 최신의 검증된 정보를 필요로 하는 모든 작업에서 실질적인 기능 차이를 만들어 낸다. 셋째는 200K 토큰 이하의 모든 사용에 적용되는 가격이다. 배치 요금 $1/$6을 포함해, 두 모델 중 어느 것으로든 대규모 오프라인 작업을 실행하기에 압도적으로 저렴한 선택지다. 이런 장점들은 추론 벤치마크에는 전혀 나타나지 않는다. 점수만 인용하는 플래그십 간 비교에서 이 장점들이 묻혀 버리는 이유가 정확히 그 때문이다.
나란히 보는 사양 시트
• 출시됨 — GPT-6 Astra: 2026년 9월 3일. Gemini 3.1 Pro: 2026년 2월 19일 (아직 "프리뷰").
• 가격 (≤200K 프롬프트) — GPT-6 Astra: 1M당 $10.00 / $50.00 균일 요금. Gemini 3.1 Pro: 1M당 $2.00 / $12.00.
• 가격 (긴 프롬프트) — GPT-6 Astra: 272K 입력 초과 시 1M당 ~$20.00 / $75.00. Gemini 3.1 Pro: 200K 입력 초과 시 1M당 $4.00 / $18.00.
• 컨텍스트 / 출력 상한 — GPT-6 Astra: 입력 약 1.05M, 출력 128K. Gemini 3.1 Pro: 입력 1M, 출력 약 65K.
• 입력 — GPT-6 Astra: 텍스트 + 이미지. Gemini 3.1 Pro: 텍스트, 이미지, 오디오, 비디오, PDF.
• 그라운딩 / 도구 — GPT-6 Astra: 웹 검색, 파일 검색, 코드 실행. Gemini 3.1 Pro: 네이티브 Google Search, Maps, 코드 실행, 함수 호출.
• 추론 제어 — GPT-6 Astra: 추론 노력 최저–최대. Gemini 3.1 Pro: 추론 노력 조절 가능.
여섯 달이 보이는 곳
Gemini 3.1 Pro는 출시 당시 Artificial Analysis Intelligence Index를 주도했지만, 더 이상 그렇지 않다. 늦여름 플래그십 모델들 — Claude Opus 5, GPT-5.6 Sol, 그리고 지금의 GPT-6 Astra — 모두 현재 지수 척도에서 그보다 높게 측정되었고, Google은 Pro급 답변을 내놓지 않았다. 가장 극적인 격차는 ARC-AGI-3에서 나타난다. 이 벤치마크는 일반적인 chain-of-thought로는 풀 수 없도록 설계된 것이다. OpenAI는 자체 하네스에서 Astra에 대해 99.9%를 보고했고, 독립 ARC Prize의 표준 하네스 실행에서는 62.7%로 측정되었다. 반면 독립 실행들에서는 Gemini 3.1 Pro가 1% 미만으로 나타났는데, 이는 Astra 이전 프런티어의 나머지 모델들과 같은 거의 0에 가까운 수준이다. 원래 ARC-AGI-2에서 Gemini 3.1 Pro에 대한 Google 자체 수치는 출시 당시 강력한 77.1%였다. 후속 벤치마크는 다른 체제이며, OpenAI의 새로운 패러다임이 진정으로 6개월 된 모델을 뒤처지게 만드는 유일한 영역이다.
더 미묘한 성능 저하는 긴 컨텍스트 신뢰성이다. 독립적인 멀티-니들 테스트(MRCR v2)에 따르면, Gemini 3.1 Pro는 128K에서는 정확하게 정보를 찾아내지만 1M 윈도우 상한에 가까워질수록 급격히 저하된다. 이는 Google이 출시 후 6개월 동안 완전히 해결하지 못한 붕괴 패턴이다. Astra의 1.05M 컨텍스트는 새롭고 실제 규모에서 검증되지 않았지만, OpenAI가 가장 적극적으로 공들였다고 주장하는 영역이며, 여기에는 Gemini의 약 65K보다 훨씬 더 큰 생성 결과물을 단일 응답에 담을 수 있게 해주는 128K 출력 상한도 포함된다. 작업 부하가 처음부터 끝까지 충실하게 읽혀야 하는 하나의 거대한 컨텍스트라면, 선택은 측정된 저하가 입증된 모델과 아직 아무도 상한 동작을 스트레스 테스트하지 않은 모델 사이의 문제다. 어느 방향으로도 편안한 선택은 아니다.

실용적인 결정
대부분의 프로덕션 워크로드 — 문서 기반 RAG, 근거 중심 리서치, 멀티모달 입력, 200K 토큰 미만에 해당하는 모든 것 — 에서 Gemini 3.1 Pro는 현재 경제적으로 합리적인 선택이며, 그 격차는 좁지 않습니다. 입력 비용이 5배 저렴하고 모달리티 및 근거 확보 측면에서 우위를 점한 상황에서, GPT-6 Astra는 그러한 워크로드가 결코 사용하지 않을 추론 헤드룸에 막대한 프리미엄을 지불하고 있는 셈입니다. 에이전틱 코딩, 장기적 안목의 컴퓨터 사용, 그리고 진정으로 128K 생성 산출물이나 신뢰할 수 있는 1M에 가까운 컨텍스트가 필요한 문제의 경우, GPT-6 Astra가 평가 대상 모델입니다. 다만 솔직한 전제 조건이 있다면, 그 헤드라인 수치는 OpenAI의 것이며, 독립적인 첫날 평가는 토큰 효율성에서는 강점을 보여주지만 역량 격차가 마케팅이 시사하는 것보다 작다는 것을 드러냅니다. Gemini의 6개월 동결이 결정적인 맥락입니다: 여러분은 Google이 개선을 중단한 저렴하고 유능하며 성숙한 모델과, OpenAI가 적극적으로 앞으로 나아가고 있는 비싸고 갓 출시된 모델 사이에서 선택하고 있는 것입니다.
기 때문에둘 다 호스팅되어 있고 둘 다 가까이 두고 싶을 만큼 가치가 있, 실용적인 답은 교체가 아니라 라우팅(routing)입니다. Gemini 3.1 Pro는 OrcaRouter에서 Google 정가로 제공되며, 마크업 없는 패스스루로 전달되므로 라우터를 거쳐도 $2/$12의 경제성이 유지됩니다. 그리고 라우팅 DSL은 200K 미만 쿼리와 긴 프롬프트 사이의 분기를 수동 결정이 아닌 규칙으로 만들어 주어, 짧은 근거 기반 쿼리는 Gemini로 보내고 GPT-6 Astra는 그 요금을 정당화하는 작업에만 사용하도록 남겨 둡니다. 이 글을 쓰는 시점 기준으로 GPT-6 Astra는 아직 OrcaRouter에 없습니다. 어떤 제공업체가 gpt-6-astra를 서비스하기 시작하면 모델 페이지에는 같은 날 OpenAI 정가가 표시되며, 이미 여러 제공업체에 걸쳐 워크로드를 살려 두는 페일오버 규칙은 하루 이틀 된 모델에 전체 파이프라인을 걸지 않고도 측정된 트래픽 일부에서 Astra를 채택할 수 있게 해 주는 바로 그 메커니즘입니다.


평결
GPT-6 Astra와 Gemini 3.1 Pro의 대결은, Google이 6개월 동안 내버려 둔 모델과 OpenAI가 이틀 전에 출시한 모델 간의 대결입니다. 가격 격차는 대부분 그 비대칭성을 반영할 뿐, 같은 규모의 성능 격차를 반영하지는 않습니다. {{1}}저렴하고, 멀티모달이며, 근거 기반의 대규모 추론{{/1}}이 필요하다면, Gemini 3.1 Pro는 이 비교에서 명백한 승자이며, 몇 달째 그렇습니다. {{2}}새로운 패러다임의 추론, 큰 출력 상한, 또는 컨텍스트 창 상단 정보를 안정적으로 활용할 진지한 기회{{/2}}가 필요하다면, GPT-6 Astra는 그러한 기능을 사용하는 워크로드에서 프리미엄 가격만 한 값어치를 합니다. {{3}}OpenAI의 출시 성능표가 아닌, 여러분 자신의 작업으로 측정했을 때의 이야기입니다{{/3}}. 6개월 된 가성비 모델과 이틀 된 플래그십을 나이 차이가 중요하지 않은 것처럼 취급하는 것은, 어느 방향이든 실수입니다. 나이 차이가 바로 이 이야기의 전부입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
