
GPT-6 Luna vs Grok 4.6: 가격 차이는 20배, 진짜 차이는 윈도우다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
같은 페이지에 올려놓으면 GPT-6 Luna와 Grok 4.6의 첫 비교는 저절로 완성된다. Luna는 백만 입력 토큰당 $0.10, 백만 출력 토큰당 $0.50에 책정되어 있다. Grok 4.6은 $2.00과 $6.00, 캐시 읽기는 $0.50에 책정되어 있다. 입력에서는 20배, 출력에서는 12배, 그리고 해당 공급업체 모델의 캐시 입력 요율은 50배 더 높다. 이것이 표면 가격이며, 표면 가격만 놓고 보면 답은 이미 정해져 있다.
이 글의 나머지를 쓸 가치가 있는 이유는 두 모델이 가격보다 더 구조적인 무언가에 대해 의견을 달리하기 때문이다. Grok 4.6은 500,000토큰 컨텍스트 윈도우를 지원하며, 프롬프트가 200,000토큰을 넘으면 전체 요청의 요금을 다시 산정한다. GPT-6 Luna는 1,050,000토큰을 지원하며 272,000에서 요금을 다시 산정한다. 두 임계값은 모두 한계 요율이 아니라 절벽이다. 하나를 넘으면 선을 넘은 부분만이 아니라 전체 요청이 더 높은 금액으로 청구된다. 그 두 절벽이 어디에 자리하느냐, 그리고 각 절벽의 잘못된 쪽에 놓인 롱컨텍스트 워크로드에 어떤 일이 일어나느냐가 이 비교를 결정짓는 데 20배라는 헤드라인보다 더 큰 비중을 차지한다.
두 모델, 두 가지 매우 다른 자세
Grok 4.6은 2026년 8월 12일 출시된 xAI의 모델로, 범용 프런티어 릴리스입니다. 텍스트 입력, 텍스트 출력, 500,000토큰 윈도, 독립 보드에서 high effort 기준으로 공개된 작업당 비용 $1.86, 측정 속도 초당 57.7 출력 토큰을 갖췄습니다. 많은 일을 잘하고 공급업체가 빠르게 출시하기 때문에 팀이 도입하는 유형의 모델입니다.
GPT-6 Luna는 정반대의 자세다. OpenAI는 2026년 9월 22일 GPT-6 패밀리의 볼륨 티어로 이를 출시했으며, $2.00/$10.00의 GPT-6 Sol 아래, 그리고 $10.00/$50.00의 플래그십 GPT-6 Astra 아래에 위치한다. 텍스트와 이미지를 입력받고 텍스트를 출력하며, 1,050,000토큰 창에 최대 입력 922,000토큰, 출력 상한 128,000토큰, 그리고 none부터 low, medium, high, xhigh, max까지 이어지는 추론 사다리를 갖추고 있으며 기본값은 medium이다. 누구든 폭넓은 범용성 때문에 도입하는 모델이 아니다. 워크로드 밑에 두는 모델이다.
그래서 솔직하게 정리하면, 기준은 “이 중 어느 것이 더 나은가”가 아닙니다. “이 중 어느 것이 당신이 가진 업무의 형태에 맞게 가격이 책정되어 있는가”입니다. 그리고 그 두 형태는 정말로 서로 다릅니다.
카드, 줄별로
각 차원당 한 줄, 각 줄에 양쪽 모두:
• 1M당 입력 — GPT-6 Luna $0.10 vs Grok 4.6 $2.00
• 1M당 출력 — GPT-6 Luna $0.50 vs Grok 4.6 $6.00
• 1M당 캐시 입력 — GPT-6 Luna $0.01 대 Grok 4.6 $0.50, 자체 입력 요금의 10분의 1 대 xAI의 4분의 1
• 장문 컨텍스트 임계값 — GPT-6 Luna 272,000 입력 토큰 대 Grok 4.6 200,000 프롬프트 토큰
• 장문 컨텍스트 요율 — GPT-6 Luna는 전체 요청 가격을 입력 $0.20, 출력 $0.75, 캐시 $0.02로 재책정하는 반면, Grok 4.6은 전체 요청 가격을 입력 $4.00, 출력 $12.00, 캐시 $1.00로 재책정합니다
• 컨텍스트 윈도우 — GPT-6 Luna 1,050,000 토큰 대 Grok 4.6 500,000 토큰
• 최대 출력 — GPT-6 Luna 128,000 토큰 vs Grok 4.6은 카드에 별도의 상한으로 공개되지 않음
• Intelligence Index, 독립 — 인덱스 리비전 v4.3.2 기준, 최대 노력에서 GPT-6 Luna 37 대 높은 노력에서 Grok 4.6 44
• 기본 노력 점수 — 기본 medium에서 GPT-6 Luna 29 대 medium에서 Grok 4.6 43, 여기서 보드도 이를 측정합니다
• Index 작업당 비용, 독립 실행 — GPT-6 Luna 약 $0.07 vs Grok 4.6 고강도 설정 시 $1.86
• 인덱스 실행 시 출력 토큰 — GPT-6 Luna 150M 대 Grok 4.6 94M, 리더보드 중앙값 88M 대비
• 출력 속도, 독립적 — 높은 부하에서 GPT-6 Luna 153.9 tokens/sec vs Grok 4.6 57.7 tokens/sec
• 첫 토큰까지의 시간, 독립 — Grok 4.6 38.63초, 엔드투엔드 47.31초; GPT-6 Luna는 사용자가 기다릴 수 있는 시간에 첫 토큰을 반환합니다
• 사이버 역량, 독립적 — Grok 4.6은 리더보드의 사이버 평가에서 57점을 기록했으며, 비교 가능한 GPT-6 Luna 수치는 공개되지 않음
• OrcaRouter에서 — GPT-6 Luna는 저희 카탈로그에 없음 vs Grok 4.6은 xAI 정가로 라우팅 가능

20만 대 27만 2천이 논쟁의 전부다
두 창 옆에 있는 두 임계값을 읽으면 비교가 스스로 재구성됩니다.
Grok 4.6의 절벽은 500,000토큰 윈도우 안의 200,000토큰, 즉 40% 지점에 있습니다. GPT-6 Luna의 절벽은 1,050,000토큰 안의 272,000토큰, 즉 26% 지점에 있습니다. 따라서 더 저렴한 모델은 가격 재조정이 더 늦게 시작될 뿐만 아니라, 임계점 이후 윈도우가 완전히 소진되기 전까지 남는 여유가 두 배 이상 많습니다.
구체적으로 말하면, 450,000토큰 요청은 두 모델 모두에 들어갑니다. GPT-6 Luna에서는 장문맥 등급 요금으로 $0.20와 $0.75가 청구됩니다. Grok 4.6에서는 $4.00와 $12.00가 청구됩니다. 즉 같은 프롬프트에 대해 입력은 20배, 출력은 16배입니다. 그리고 그것은 Grok 4.6이 처리할 수 있는 요청이므로, 선택은 이론적인 것이 아니라 실질적인 것입니다.
반대의 경우가 사람들을 허를 찌르는 부분입니다. 190,000토큰 요청은 두 임계값 모두 아래에 있어 두 모델 모두 표준 요율로 청구됩니다: $0.10/$0.50 대 $2.00/$6.00, 정확히 20배와 12배입니다. 210,000토큰 요청은 Grok 4.6의 기준선 위에 있고 GPT-6 Luna의 기준선 아래에 있습니다. Grok 4.6에서는 $4.00/$12.00로, Luna에서는 $0.10/$0.50로 청구됩니다 — 프롬프트 길이의 20,000토큰 차이만으로 생겨난 40배와 24배의 격차이며, 두 모델에는 아무 변화도 없습니다.
그것은 Grok 4.6을 피할 이유가 아니다. 그것은 당신의 프롬프트가 실제로 어디에 도달하는지 알아야 할 이유다. 평균 180,000토큰이고 220,000까지 치솟는 워크로드는 서로 다른 두 요금표를 지불하는 셈이며, 그런 일이 처음 발생하는 달에는 청구 오류처럼 보일 것이다.
독립 이사회에서 가격 격차가 무엇을 사는가
Grok 4.6은 높은 노력에서 Artificial Analysis Intelligence Index 44점을 기록한다. GPT-6 Luna는 최대 노력에서 37점을 기록한다. 재실행의 노이즈 안에 단일 점수가 들어가는 종합 지표에서 7점 차이 — 그리고 두 모델은 완료된 작업당 비용에서 약 26배, $1.86 대 약 $0.07로 벌어져 있다.
그 숫자 쌍과 관련해서는 두 가지를 구분해서 볼 가치가 있다.
첫째는 노력(effort) 기본값이다. GPT-6 Luna의 37은 최대 노력 설정의 수치이고, 기본값은 중간(medium)이며 여기서는 29점을 기록한다. Grok 4.6의 44는 높은 노력 설정의 수치이고, 이 벤치마크는 중간 설정에서도 측정하는데 거기서는 43점을 기록한다. 따라서 기본 설정에서의 동일 조건 비교는 29 대 43, 즉 7점이 아니라 14점 차이며, 두 모델을 모두 배포하고 아무것도 바꾸지 않는 팀이 실제로 겪게 되는 것은 바로 이 14점 차 버전이다. Grok 4.6은 높음에서 중간으로 갈 때 1점을 잃는다. GPT-6 Luna는 8점을 잃는다. 노력 다이얼은 비싼 모델보다 저렴한 모델에 훨씬 더 큰 비용을 치르게 하며, 그 비대칭성은 헤드라인 지수 수치에서는 보이지 않는다.
두 번째는 장황함이며, 여기서 방향은 가격 비율이 시사하는 것과 반대다. GPT-6 Luna는 인덱스를 완료하는 데 1억 5천만 개의 출력 토큰을 생성했고, Grok 4.6은 9천 4백만 개를 생성했다. 출력 토큰당 비용이 12분의 1인 모델이 더 낮은 점수에 도달하는 데 60% 더 많은 토큰을 썼다. 출력 기준 가격표에서 이는 작업당 비용 격차가 26배인 경우와 더 작은 경우의 차이이며, 이것이 바로 정가만을 기준으로 한 모든 비교가 저가 등급에 대한 주장을 과장하게 만드는 이유다.
Grok 4.6은 같은 보드에서 사이버 역량 점수 57점도 공개합니다. 비교할 만한 GPT-6 Luna 수치가 없으므로 그 차원은 한쪽만 있는 셈입니다. 하지만 이는 당신의 워크로드가 보안 도구를 다루는 경우 중요해지는 종류의 항목이며, 더 저렴한 모델에 이 수치가 없다는 것은 가정으로 메워야 할 공백이라기보다 정보입니다.
지연 시간, 두 값이 가깝지 않고 같은 방향도 아닌 경우
Grok 4.6의 독립적인 지연 시간 수치는 높은 노력 설정에서 첫 토큰까지 38.63초, 종단 간 47.31초입니다. 이는 말하기 전에 진지한 추론을 수행하는 모델의 수치이며, 커서를 지켜보는 사람과는 양립할 수 없습니다. 해당 모델에 대한 자체 목록에는 7일 기간 동안 p50 첫 토큰 시간이 6.71초, p95가 10.00초로 기록되어 있는데, 이는 응답의 다른 지점을 측정한 것이며 독립적인 수치와 비교할 수 없습니다 — 두 숫자는 서로 불일치하는 것이 아니라 서로 다른 질문에 답하고 있는 것입니다.
GPT-6 Luna는 초당 153.9개의 출력 토큰으로 실행되며, 대화형 인터페이스를 뒷받침할 수 있을 만큼 첫 토큰을 빠르게 반환합니다. 높은 추론 강도에서 Grok 4.6의 처리량보다 거의 세 배에 달합니다. 배치 작업에서는 그 차이가 실제 시간을 아껴 주는 편의일 뿐입니다. 사용자가 기다리는 무엇이든, 그 차이는 제품과 프로토타입을 가르는 차이입니다.
그 조합은 이례적이며 뚜렷이 이름 붙일 가치가 있다. 저렴한 모델이 빠른 쪽이고, 비싼 모델이 느린 쪽이며, 동일한 노력 수준에서 비싼 모델이 종합 점수에서 7점 앞선다. 이는 한 번 깊이 생각하도록 만들어진 모델과, 아주 여러 번 빠르게 답하도록 만들어진 모델의 특징이다. 작업 부하가 과제당 한 번의 호출이라면 Grok 4.6의 지연 시간은 감당할 만하다. 과제당 천 번의 호출이라면 그렇지 않다.
xAI 측에서 실제로 여러분이 구매하고 있는 것
Grok 4.6은 완료된 작업당 비용이 GPT-6 Luna보다 약 26배 더 들고, 동일한 노력 조건에서 지수 7점 앞선다. 이는 범용 워크로드에는 좋지 않은 교환 비율이고, 특정 부류의 작업에는 합리적인 비율이다.
세 가지가 그것을 정당화한다. 57이라는 사이버 점수는 GPT-6 Luna가 이에 상응하는 역량을 공개하지 않은 부분이다. Luna의 1억 5천만 토큰에 맞선 9,400만 토큰 인덱스 실행은 출력이 파서가 아니라 사람에 의해 소비되는 모든 작업에서 실질적인 간결성 이점이다. 그리고 이 모델은 8월 12일부터 프로덕션에서 사용되어 왔으며, 이는 GPT-6 Luna가 존재해 온 기간보다 6주 더 길다. 이것은 벤치마크는 아니지만 실적 기록이고, 이미 이 모델을 기반으로 구축한 팀에게는 떠날 때의 마이그레이션 비용이 떠나는 대가의 일부다.
그에 반해, GPT-6 Luna의 강점은 주로 20배의 요금이 아니다. 그것은 100만 토큰 창 안의 272,000토큰 임계값, 추론을 완전히 중단하라는 지시를 받을 수 있는 능력, 100만 개당 1센트의 캐시된 입력 요율, 그리고 이를 엔드포인트가 아니라 구성 요소로 사용할 수 있게 해주는 처리량 수치다. 이들은 저가 티어의 구조적 속성이며, 반대편의 어떤 지수 우위도 이를 대체하지 못한다.
그중 하나 또는 둘 다 실행하기
Grok 4.6이 xAI의 정가로 OrcaRouter에서 제공됩니다, 패스스루 가격 책정 아래에서 공급업체 요금 변경을 리셀러가 재협상하기를 기다리는 대신 같은 날 우리 측에 반영합니다. 자동 페일오버는 특히 이 모델에서 그 가치를 입증하는 부분입니다: 200,000토큰 절벽이 있는 500,000토큰 윈도우는 요청이 때때로 경계선의 잘못된 쪽에 떨어지는 워크로드이고, 배포 없이 업스트림 간을 이동하는 라우트는 토큰당 1센트의 일부보다 더 가치가 있습니다.
이 글을 쓰는 시점에 GPT-6 Luna는 우리 카탈로그에 없으며, OpenAI 자체 API를 통해 접근합니다. 따라서 둘 다 원하는 팀은 이미 OpenAI에 사용 중인 키와 함께 Grok 4.6용 키 하나를 운영하게 됩니다. 이 조합에 딱 들어맞는 부분은 라우팅 DSL입니다: 토큰 임계값을 넘는 프롬프트는 그 절벽을 넘어서는 모델로 보내고, 그 아래의 모든 것은 가격이 12분의 1인 모델로 보내는 규칙을 애플리케이션의 분기문이 아니라 구성으로 표현할 수 있습니다 — 이 둘처럼 임계값이 흔한 프롬프트 크기에 가까울 때 이 점이 중요합니다.

어느 것, 그리고 언제
워크로드가 대용량이고 프로그램이 소비하며 짧다면 GPT-6 Luna를 선택하세요. 분류, 추출, 라우팅, 대량 요약, 에이전트의 내부 루프에 적합합니다. $0.10/$0.50에 1센트 캐시 읽기라면, 동일한 effort에서 7 index 포인트를 위해 완료된 작업당 비용이 26배인 모델과 비교할 때 계산은 비교가 되지 않습니다. effort 파라미터를 명시적으로 설정하세요 — 기본값은 medium이고 대표 수치 37은 최대 effort 수치입니다 — 그리고 긴 호출은 272,000 토큰 미만으로 유지하세요.
사이버 역량이 필요하다면, 출력을 사람이 읽고 그 간결함에 값을 치를 가치가 있다면, 또는 GPT-6 Luna가 처리할 수 있는 30만~50만 토큰 규모의 작업 부하가 있지만 그 길이에서 그것이 어떻게 작동하는지 가장 먼저 알아내는 팀이 되고 싶지 않다면 Grok 4.6을 선택하세요. 20만 토큰 절벽은 명시적으로 예산에 반영하고, 높은 추론 강도에서는 이를 대화형 인터페이스 뒤에 두지 마세요. 첫 토큰까지 38초는 지연 시간 수치가 아니라, 그 모델이 무엇을 위한 것인지에 대한 선언입니다.
이 비교가 불러오는 실수는 20배라는 비율을 결정으로 취급하는 것이다. 한 가지 워크로드 형태에서는 그것이 결정이다. 다른 형태에서는 결정이 200,000 및 272,000 토큰에서 내려지며, 가격 비율은 나중에 읽게 되는 세부 사항일 뿐이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
