
GPT-6 Luna vs Gemini 3.1 Pro: 입력 가격 20배의 7개월 된 프리뷰
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 프런티어 추론 모델에 "Preview"라는 레이블이 붙은 것은 Gemini 3.1 Pro가 2026년 2월 19일에 출시된 이후부터입니다. 7개월이 지난 지금도 여전히 프리뷰 상태이고, 여전히 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $12.00이며, 여전히 제품 페이지가 회사의 프런티어 추론 모델이라고 소개하는 바로 그 모델입니다. 2026년 9월 22일, 이 벤더는 GPT-6 Luna를 정식 출시(GA)된 소형 티어로 $0.10과 $0.50에 내놓았습니다. 두 요금표를 나란히 놓고 보면, 더 새롭고 더 저렴한 GA 모델이 입력 기준 20배, 출력 기준 24배 더 저렴하며 — 그리고 더 높은 점수를 기록합니다 — 두 벤더의 마케팅 부서가 모두 신경 쓰는 독립 지수에서 말입니다.
마지막 절은 잠시 속도를 늦춰 살펴볼 만한 부분이다. GPT-6 Luna는 최대 노력 설정에서 Artificial Analysis Intelligence Index 37점을 기록한다. Gemini 3.1 Pro Preview는 동일 개정판에서 30점을 기록한다. 대량 처리 효율성 전략으로 판매되는 모델이 프런티어 추론 시스템으로 판매되는 모델보다 7점 앞서 있으며, 입력 가격은 20분의 1 수준이다. 이는 저렴한 모델이 비싼 모델을 따라잡은 사례가 아니다. 이 특정 축에서는 저렴한 모델이 그저 앞서 있고, 비싼 모델은 7개월째 프리뷰 상태다.
자연스러운 결론—Gemini 3.1 Pro의 가격이 지나치게 높다는 결론—역시 완전히 맞는 것은 아니다. 그리고 이 글의 나머지 부분은 Google의 모델이 자신의 요금표에 걸맞은 값을 하는 세 가지 지점에 관한 것이다. 왜냐하면 그 지점들은 실재하며 결코 작지 않기 때문이다.
그것을 결정짓는 다섯 가지
세부 내용에 앞서, 요약하자면:
• GPT-6 Luna는 가격에서 입력 기준 약 20배, 출력 기준 24배 우위를 보이고, 캐시된 입력에서는 큰 격차로 앞서며, 동일한 최대 노력 조건의 범용 지수에서는 7점 앞선다.
• Gemini 3.1 Pro는 입력 모달리티에서 우위를 점합니다 — 오디오와 비디오를 받아들이는데, GPT-6 Luna는 그렇지 않습니다 — 그리고 7개월 동안 사용 가능했다는 점에서도 앞서는데, 이는 프리뷰치고는 긴 프로덕션 기록입니다.
• 출력 상한은 어느 쪽도 서로 비슷하지 않습니다: GPT-6 Luna는 최대 128,000개 토큰을, Gemini 3.1 Pro는 최대 65,000개 토큰을 출력합니다.
• 두 모델 모두 전체 요청의 가격을 다시 산정하는 장문 컨텍스트 등급 경계를 지니고 있는데, GPT-6 Luna의 경우 272,000 입력 토큰, Gemini 3.1 Pro의 경우 약 200,000입니다.
• 기본 노력 설정의 함정은 Luna에만 적용됩니다. Luna의 37은 최대 노력 점수이고, 기본값인 중간 설정은 29점으로 Gemini 3.1 Pro의 30점보다 낮습니다.
두 요율표와 그 사이의 계산
각 차원당 한 줄, 각 줄에 양쪽 모두:
• 1M당 입력 — GPT-6 Luna $0.10 vs Gemini 3.1 Pro $2.00
• 출력 1M당 — GPT-6 Luna $0.50 vs Gemini 3.1 Pro $12.00
• 캐시된 입력 — GPT-6 Luna 1M당 $0.01, Gemini 3.1 Pro 1M당 $0.20 대비 90% 할인, 90% 할인
• 롱컨텍스트 경계 — GPT-6 Luna는 272K 입력 토큰 초과 vs Gemini 3.1 Pro는 약 200K 입력 토큰 초과
• 롱컨텍스트 효과 — GPT-6 Luna 2x 입력 및 캐시, 출력 1.5배, 전체 요청 기준 vs Gemini 3.1 Pro $4.00 입력 / $18.00 출력, 역시 전체 요청 기준
• 컨텍스트 창 — GPT-6 Luna 1,050,000 토큰 vs Gemini 3.1 Pro 1M 토큰
• 최대 출력 — GPT-6 Luna 128,000 토큰 vs Gemini 3.1 Pro 65,000 토큰
• 입력 모달리티 — GPT-6 Luna 텍스트 및 이미지 vs Gemini 3.1 Pro 텍스트, 이미지, 오디오, 비디오 및 파일
• AA Intelligence Index — GPT-6 Luna, 최대 노력 설정 시 37, 기본 설정 시 29 vs Gemini 3.1 Pro 30
• 출력 속도 — GPT-6 Luna 초당 153.9 토큰 vs Gemini 3.1 Pro는 스냅샷에 따라 초당 약 115~143 토큰
• 추론 끄기 스위치 — GPT-6 Luna는 none부터 max까지 vs Gemini 3.1 Pro는 추론 우선, 비추론 모드가 노출되지 않음
• 상태 — 2026-09-22부터 일반 제공되는 GPT-6 Luna vs 2026-02-19부터 프리뷰 중인 Gemini 3.1 Pro

흥미로운 행은 가격이 아닙니다. 그것은 맨 아래의 두 행입니다. Gemini 3.1 Pro의 프리뷰 라벨은 형식적인 문제가 아닙니다. 그것은 Google이 당신에게 보장해야 하는 것을 바꿉니다. 프리뷰 모델은 GA 모델이 받는 지원 중단 공지 없이 변경되거나, 가격이 다시 책정되거나, 철회될 수 있으며, 7개월째 변하지 않은 가격은 아무도 서면으로 남긴 적 없는 약속입니다. Google의 모델이 더 안전한 프로덕션 선택이라는 아래의 모든 내용은 그 단서에 비추어 읽어야 합니다. 왜냐하면 "7개월의 안정성"과 "안정성 보장 없는 7개월"은 같은 7개월이기 때문입니다.
Google의 모델이 추가로 20배를 얻는 지점
세 가지입니다. 그리고 첫 번째는 일부 팀에게는 비교 자체를 아예 끝내버리는 부분입니다.
모달리티. Gemini 3.1 Pro는 오디오와 비디오 입력을 받습니다. GPT-6 Luna는 텍스트와 이미지를 입력으로 받습니다. 여러분의 파이프라인이 통화 녹음, 화면 캡처 또는 비디오를 입력으로 받는다면, 이 맞대결에서 가격 차이가 중요해지는 경우는 없습니다. 왜냐하면 두 모델 중 하나는 그 작업을 수행할 수 없기 때문입니다. 그것은 포인트 릴리스로 좁혀지는 벤치마크 격차가 아닙니다. 그것은 있거나 없는 능력이며, Google의 요금표가 실제 조달과 맞닥뜨려도 살아남는 단 하나의 가장 강력한 이유입니다.
출력 상한, 다른 방향에서. 출력 상한은 입력 모달리티와 반대 방향으로 작용하며, 이 상한은 OpenAI에 유리합니다. GPT-6 Luna는 한 응답에서 최대 128,000 토큰을 출력하고, Gemini 3.1 Pro는 최대 65,000 토큰을 출력합니다. 전체 문서, 대규모 리팩터링, 다중 파일 패치처럼 긴 구조화 산출물을 생성한다면, Google의 상한은 OpenAI의 약 절반이며, 65,000 토큰에서 잘리는 파이프라인은 토큰당 비용을 얼마로 지불하든 망가진 것입니다.
멀티모달 최전선 작업. Gemini 3.1 Pro의 포지셔닝은 멀티모달이기도 한 추론 모델이라는 것이며, 그 실질적인 결과는 다이어그램, 차트, 화면 녹화를 대상으로 추론해야 하는 작업이 텍스트 우선의 소형 등급이 아니라 이 모델로 배정된다는 점이다. GPT-6 Luna도 이미지를 받아들이므로, 경계는 오디오와 비디오만이 아니다 — 구글의 모델은 시각 및 오디오 추론을 주요 사용 사례로 삼아 만들어진 반면, OpenAI의 모델은 처리량을 위해 만들어졌다는 것이다.
저렴한 등급이 실제로 밀리는 지점, 그리고 그곳은 당신이 예상하는 곳이 아니다
이 조합에서 함정은 effort 기본값이며, 여기서는 더 약한 상대를 만났을 때보다 더 아프게 작용한다. GPT-6 Luna의 대표 지수 점수 37은 최대 추론 노력에서 측정된다. 기본값은 medium이고, medium에서는 29점을 기록한다 — 1점 아래, Gemini 3.1 Pro의 30점. 그래서 이 글을 시작하며 제시한 7점 우위는 한 모델의 상한과 다른 모델의 상한을 비교한 것이고, GPT-6 Luna를 설치하고 구성을 그대로 두는 팀은 Google의 모델보다 아주 약간 뒤처지며, 7개월 더 오래되었고, 여전히 프리뷰 상태이고, 가격은 20분의 1인 모델을 운영하는 셈이다.
대부분의 워크로드에서는 여전히 그것이 올바른 트레이드오프입니다 — 지수 1포인트는 역량 차이가 아니지만, 20배 가격 차이는 역량 차이입니다. 하지만 그것은 요금표가 광고하는 트레이드오프와는 다른 트레이드오프이며, effort 파라미터를 찾아보지 않고서는 보이지 않습니다.
저렴한 티어가 손해를 보는 두 번째 지점은 장문맥 연산입니다. 두 모델 모두 한계를 넘으면 초과분에 할증을 붙이는 대신 전체 요청 가격을 다시 매기며, 두 한계 모두 문제가 될 만큼 낮습니다: GPT-6 Luna에서는 272,000 입력 토큰, Gemini 3.1 Pro에서는 약 200,000입니다. GPT-6 Luna의 조항은 입력과 캐시를 두 배로 만들고 출력을 50% 인상합니다. Gemini 3.1 Pro의 조항은 전체 호출을 입력 $4.00, 출력 $18.00으로 변경합니다. 둘 다 한계적 할증이 아니며, 가격으로 판매되는 모델에서 그 조항이 곧 가격입니다.
세 번째는 장황함인데, 이는 요율표에는 절대 등장하지 않는 비용 항목이다. Artificial Analysis는 인덱스 실행 전반에서 GPT-6 Luna가 1억 5천만 개의 출력 토큰을 생성한 것을 측정했으며, 이는 중앙값 8,500만 개와 대비된다. 이 모델은 말이 많고, 백만 출력 토큰당 $0.50라면 간결한 모델이 $42.50를 썼을 상황에서 $75어치의 토큰을 쓴 셈이다. 그래도 대안보다 여전히 10배 저렴하다. 이는 또한 작업당 비용 수치와 토큰당 비용 수치가 서로 다른 이야기를 하는 이유이며, 절감액을 모델링하기 전에 자신의 출력량을 측정해야 하는 이유이기도 하다.
그들 간의 마이그레이션이 어떤 모습인지
Google의 모델은 벤더 자체 API와 여러 타사 플랫폼을 통해 접근할 수 있고, GPT-6 Luna는 OpenAI 자체 API를 통해 접근할 수 있습니다. 이 글을 쓰는 시점에서 이 둘 중 표준화하기에 더 단순한 쪽은 어느 쪽도 아닙니다. 둘 다 OpenAI 호환 chat completions 인터페이스를 제공하므로 문제는 호출 형태가 아니라 매개변수입니다. GPT-6 Luna의 effort 단계 체계, 272,000토큰 조항, 그리고 Chat Completions에서 함수 호출이 reasoning effort를 none으로 설정한 상태에서 실행되어야 한다는 요구 사항은 모두 Gemini 3.1 Pro가 공유하지 않는 동작입니다. 모델 문자열만 바꾸는 포팅은 작동하는 호출을 만들어내지만 잘못된 비용 프로필을 낳습니다.
Gemini 3.1 Pro Preview는 OrcaRouter에서 Google의 정가로 제공됩니다, 패스스루 가격 정책 아래에서는 Google의 요금 변경이 같은 날 우리 쪽에 반영됩니다. GPT-6 Luna는 이 글을 쓰는 시점에 저희 카탈로그에 없습니다. 오디오나 비디오가 필요한 모든 작업에는 Google의 모델을, 대량 텍스트에는 OpenAI의 모델을 사용하는 팀이라면, 이는 Gemini 3.1 Pro를 위한 단일 키를 이미 OpenAI에 사용하고 있는 것과 나란히 쓸 수 있다는 뜻입니다. 라우팅 결정이 두 개의 코드 경로가 아니라 구성으로 표현됩니다. 이 조합이야말로 그 점이 가장 중요한 페어링입니다. 두 모델은 서로 전혀 대체할 수 없기 때문입니다: 멀티모달 프리뷰와 텍스트 전용 GA 소형 티어 중에서 선택해야 하는 라우트는 두 공급업체 중 하나가 출시할 때마다 다시 결정해야 하는 라우트입니다.

무엇이 이것을 바꿀까요?
현재의 이 비교는 이례적인 순간의 스냅숏이다: 9월의 GA 모델이 2월의 프리뷰 모델을 일반 지수에서 입력 가격의 20분의 1로 앞서면서도, 모달리티와 프리뷰가 결코 온전히 얻지 못하는 성숙도에서는 뒤처진다. 세 가지가 이 구도를 바꿀 것이며, 각각은 추측하기보다 지켜볼 가치가 있다.
첫 번째는 Gemini 3.1 Pro가 프리뷰를 벗어나는 것입니다. GA 출시가 이루어지면 지원 중단 정책, 안정적인 요금표, 그리고 가격 변동이 뒤따를 가능성이 매우 큽니다 — Google은 7개월간의 프리뷰 기간 내내 $2.00/$12.00을 유지해 왔고, 나머지 시장이 그 주변에서 절반으로 줄어드는 와중에도 그렇게 했습니다. 그리고 그러한 자제는 신중하게 고려된 입장이라기보다 GA 일정을 기다리는 출시 가격과 더 일관됩니다.
두 번째는 OpenAI가 Luna 노력 단계 체계를 확장할지, 아니면 기본값을 변경할지 여부다. GPT-6 Luna의 최대 노력 점수와 기본 노력 점수 사이의 22포인트 격차는 이 글에서 가장 큰 설정 민감도이며, 기본값 변경은 해당 파라미터를 한 번도 건드리지 않은 모든 호출자에게 모델의 실효 성능을 바꾸게 된다.
세 번째는 모달리티 격차다. 이것은 여기서 정도의 문제가 아닌 유일한 차원이며, 이 격차 때문에 단순한 가격 비교가 되지 않는다. 이 모델 중 하나가 다른 하나는 할 수 없는 일을 할 수 있게 되기 전까지, 스무 배 격차는 서로 다른 두 가지 작업을 가리키는 실제 수치다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
