
Grok 4.7 vs Grok 4.6: 동일한 $2/$6 가격, 그 이면의 다른 모델
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 1009 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
SpaceXAI는 Grok 4.7을 2026년 9월 21일에 출시했으며, 가장 먼저 주목할 점은 바뀌지 않은 것, 즉 가격입니다. Grok 4.7의 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러입니다. 이는 정확히 Grok 4.6이 2026년 8월 12일 출시 이후 유지해 온 가격과 같습니다. 동일한 요금표, 동일한 500,000토큰 컨텍스트 윈도우, 동일한 텍스트 및 이미지 입력 — 그런데도 이 두 모델은 에이전트 작업에 중요한 평가에서 차이가 큽니다. SpaceXAI가 자체 공개한 수치에 따르면, Grok 4.7은 Terminal-Bench 4.0에서 Grok 4.6을 거의 두 배 앞섭니다. 38.0% 대 20.3%입니다. 이것이 이 비교의 전체적인 모습입니다: 거의 모든 이득이 한 곳에 집중되는 동일 가격의 세대 교체이며, 프로덕션 팀을 괴롭혔던 Grok 4.6의 부분들은 여전히 남아 있습니다.
두 모델 사이에 실제로 무엇이 달라졌나요?
SpaceXAI 자체의 이번 릴리스 설명은 범위가 좁으며, 형용사보다는 그 윤곽을 그대로 인용할 가치가 있다. Grok 4.7은 Grok 4.6보다 더 큰 기본 모델을 기반으로 하며, "완료하는 데 몇 시간이 걸릴 수 있는" 작업을 겨냥한 더 긴 강화 학습 실행을 거쳤다. 회사 측은 그 실행이 세 가지를 더 예리하게 다듬었다고 말한다: 자기 검증, 긴 문맥 처리, Grok Bot 환경 내에서의 동작이다. 새로운 아키텍처, 새로운 모달리티, 또는 다른 서빙 스택에 대한 주장은 없다.
그러한 프레이밍이 중요한 것은 벤치마크 향상이 어디에서 나타날지 예측해 주기 때문이며, 실제로 그 향상은 정확히 그곳에서 나타난다. 어려운 수시간짜리 작업에 대한 더 긴 RL 패스는 지식 퀴즈에 미치는 영향보다 터미널 및 저장소 작업에 훨씬 더 큰 영향을 준다. Grok 4.7이 Grok 4.6보다 더 폭넓은 모델이기를 바랐다면, 릴리스 노트는 그렇지 않다고 말한다 — 그것은 동일한 모델 형태로, 에이전트 작업의 고난도 영역 쪽으로 더 훈련된 것이다.
파라미터 이야기는 이 중 공급업체 공개가 아닌 유일한 부분이다. 머스크는 9월 초에 Grok 4.7이 약 2.1조 개의 파라미터를 갖고 있으며 Grok 4.6의 1.5조 개 대비 40% 증가한 수치라고 말했고, 그 수치는 이후 곳곳에서 반복되어 왔다. 이는 SpaceXAI 사양서에는 한 번도 등장한 적이 없다. 이를 확정된 사양이 아니라 기본 모델에 대해 널리 전달된 주장으로 취급하고, 아키텍처가 희소할 때 파라미터 수는 서빙 비용이나 능력에 대해 거의 말해주지 않는다는 점을 유의하라. Grok 라인의 아키텍처가 바로 그렇다.
출처 표기가 함께 있는 벤치마크 격차
이 섹션의 모든 수치는 SpaceXAI의 발사 자료에서 나온 것입니다. 집필 시점에 이를 독립적으로 재현한 사례는 없으며, 이를 읽는 정직한 방식은 유난히 구체적이기까지 한 주장 묶음으로 보는 것입니다. 그 덕분에 나중에 검증할 수는 있지만, 지금 검증된 것은 아닙니다.
• Terminal-Bench 4.0 — Grok 4.7 38.0%(벤더 보고) vs Grok 4.6 20.3%. 이번 릴리스에서 단일 최대 차이이며, "더 어려운 작업에서 더 긴 RL"이라는 주장과 일치하는 항목입니다.
• CursorBench 4.0 — Grok 4.7 46.3%(벤더 보고 기준) vs Grok 4.6 40.4%. 실질적인 향상이지만, 6점 미만으로 크지 않다 — 자율 터미널 세션보다 일상적인 편집기 작업에 더 가까운 벤치마크에서의 결과다.
• DeepSWE v1.1 — Grok 4.7은 높은 추론 강도에서 71.0%(공급업체 보고)를 기록해 Grok 4.6의 65.2%와 대비됩니다. 다시 한 번 탄탄하지만 눈에 띌 만큼 대단하지는 않은 개선입니다.
• EEBench — Grok 4.7 64.0%(벤더 보고). 함께 공개된 Grok 4.6 수치가 없으므로, 이것만으로는 업그레이드에 대해 알 수 있는 바가 없다.
• AA-Briefcase v1.1 — 전문 지식 노동 평가에서 1,657 Elo(공급업체 보고)를 기록한 Grok 4.7.
목록을 하나의 집합으로 읽어 보면 패턴은 일관됩니다: Grok 4.7은 작업이 길고 에이전트형일 때 의미 있게 더 낫고, 작업이 짧을 때는 약간 더 낫습니다. Terminal-Bench의 상승폭은 대략 두 배이며, 에디터 작업에서의 이득은 한 자릿수 퍼센트입니다. 워크로드가 자동완성 형태라면, 작은 개선을 위해 같은 $2/$6를 지불하는 것입니다. 워크로드가 "두 시간 동안 실행하고 돌아오기" 형태라면, 이번 릴리스는 바로 당신을 겨냥한 것입니다.
독립적인 측정이 지금까지 말해주는 것
독립적인 수치가 하나 있는데, 잘못 읽기 쉬우므로 신중하게 짚고 넘어갈 가치가 있습니다. Artificial Analysis는 Grok 4.7에 Intelligence Index v4.3.2 기준 46점을 부여하며, 이는 보드에 등재된 655개 모델 중 16위에 해당합니다. Grok 4.6은 같은 척도에서 44점입니다. 종합 지수에서의 2점 차이는 Terminal-Bench가 보여주는 두 배의 향상이 아니며, 이러한 불일치는 모순이라기보다 정보를 제공하는 것입니다. 즉, 이 지수는 추론, 지식, 수학, 코딩을 혼합하기 때문에 하나의 에이전트적 영역에서의 큰 향상이 모델이 바꾸지 않은 다른 모든 요소에 의해 희석됩니다.
같은 페이지에서 나온 두 가지 추가 세부 정보는 헤드라인 점수보다 더 유용합니다. 첫째, Grok 4.7은 이 지수를 실행하는 동안 2억 4천만 개의 출력 토큰을 생성했으며, 이는 중앙값 9,200만 개와 대비됩니다. Grok 4.7은 장황한 추론 모델이고, 백만 개당 6달러의 출력 요율에서는 그 장황함이 하나의 비용 항목이 됩니다. 둘째, 이 지수의 종합 점수는 Grok 4.7을 같은 가격대에서 가장 강력한 모델 중 하나로 위치시킵니다. 이는 구매자에게 실제로 중요한 비교입니다. Artificial Analysis는 모델 페이지에 Grok 4.7의 채워진 가격을 게시하지 않았으므로, 그곳에서 작업당 비용 수치를 가져오지 마십시오. 공급업체의 $2/$6을 사용하십시오.

어느 모델도 해결하지 못한 가격 절벽
다음은 프로덕션 팀들이 미워하게 된 Grok 4.6 요금표의 일부이며, Grok 4.7도 이를 바꾸지 않았습니다. 입력 토큰 200,000개 미만에서는 요금이 입력 $2, 출력 $6입니다. 그 이상이면 요청 전체가 입력 $4, 출력 $12로 재산정됩니다. 초과된 토큰만이 아니라 — 요청 전체입니다. 210,000토큰 호출은 199,000토큰 호출보다 두 배 비용이 듭니다, 고작 11,000토큰을 더 썼을 뿐인데.
두 모델 모두 500,000토큰 컨텍스트 창을 갖추고 있어서 그 절벽에서 발을 헛디디기 십상입니다. 장문 컨텍스트 에이전트 실행과 전체 저장소 프롬프트는 바로 Grok 4.7이 최적화된 워크로드이며, 이는 이 모델의 최고 사용 사례가 두 배 인상을 촉발할 가능성이 가장 큰 사례이기도 하다는 뜻입니다. 더 긴 에이전트 세션을 더 잘 처리하기 때문에 작업을 Grok 4.7로 옮기려 한다면, 옮긴 뒤가 아니라 옮기기 전에 요금 재조정을 예산에 반영하세요.
고려해야 할 속도 등급도 있습니다. SpaceXAI는 Grok 4.7의 빠른 변형을 제공하는데, 이는 출력 속도를 두 배로 높이고 표시 가격도 두 배로 올립니다. 이는 대화형 코딩에는 합당한 거래지만, 배치 작업에는 형편없는 거래입니다 — 동일한 작업을 동일한 품질로 처리하는 데 아무도 지켜보지 않는 실제 시간 단축을 위해 두 배의 비용을 치르는 셈이니까요.
재작성 없이 Grok 4.6에서 마이그레이션하기
실질적인 좋은 소식은 이것이 플랫폼 마이그레이션이 아니라 모델 교체라는 점입니다. 두 모델 모두 텍스트와 이미지를 입력받아 텍스트를 반환하고, 둘 다 low부터 xhigh까지 동일한 reasoning-effort 레벨을 사용하며, 요청 형태는 SpaceXAI가 Grok 4.5부터 제공해 온 것과 같습니다. effort 파라미터와 함께 Grok 4.6을 호출하는 코드는 Grok 4.7을 호출하기 위해 구조를 변경할 필요가 없습니다.
교체가 공짜가 아닌 지점은 평가에 있다. Grok 4.7의 이득은 긴 에이전트 실행에 집중되어 있으므로, 짧은 단일 턴 프롬프트로 구성된 테스트 스위트는 거의 아무것도 보여주지 못한다 — CursorBench 정도의 개선을 보고 업그레이드가 수고할 가치가 없다고 결론 내리겠지만, 정작 그 근거는 당신의 테스트 스위트가 전혀 다루지 않는 작업에 있다. 이것을 실제로 판가름할 측정은 여러 단계 작업에 걸친 작업 완료다: 수용된 패치, 도입된 회귀, 완료된 작업당 도구 호출 수, 그리고 실행이 인간의 구제를 필요로 하는 빈도. 이것들이 바로 공급업체 자체 수치가 가리키는 축이며, 발표된 어떤 벤치마크도 당신의 코드베이스에 대해 다루지 않는 것들이다.
장황함은 두 번째로 측정해야 할 항목입니다. 표준 인덱스에서 2억 4천만 개의 토큰을 출력하는 모델은 이전 모델보다 당신의 워크로드에서 더 많은 토큰을 출력할 것이며, 백만 출력당 6달러의 비용에서는 동일 가격 업그레이드의 가치를 조용히 없앨 수 있습니다. 도입하기 전에 일주일 동안 완료된 작업당 출력 토큰을 추적하세요.

어느 것을 불러야 하나요
이 결정은 정말로 간단합니다. 모델 비교에서는 드문 일이죠. Grok 4.6은 짧은 턴의 비용 민감한 트래픽, 즉 채팅, 분류, 요약, 에디터 규모의 코드 지원에서 여전히 올바른 선택입니다. 이 경우 Grok 4.7의 이점은 작고, 그 장황함은 부담입니다. Grok 4.7은 그것이 만들어진 작업 부하, 즉 작업이 몇 시간씩 실행되고 자기 검증이 완료된 작업과 막힌 작업을 가르는 장기적인 에이전트 코딩 및 터미널 작업에 맞는 올바른 선택입니다.
여기서 둘 다 실행하는 것은 타협이 아니라 정답이며, 비용도 저렴합니다. Grok 4.6은 OrcaRouter의 카탈로그에 SpaceXAI의 정가로, 0% 마크업이 그대로 적용되어 제공되므로 위의 $2/$6 요금표가 곧 지불하는 금액입니다. 그리고 저희는 공급자의 정가를 마크업하지 않고 그대로 전달하기 때문에, 공급업체의 가격 변경은 반영되는 당일 저희 쪽에도 적용됩니다. API 키 하나로 Grok 4.6과 200개 이상의 다른 모델을 이용할 수 있으므로, 작업별로 이들 사이에서 트래픽을 옮기는 것은 두 번째 계약이 아니라 설정 변경에 불과합니다. 신뢰하기 전에 프로덕션 경로에서 Grok 4.7을 시험해 보고 싶다면, 더 안전한 패턴은 폴백을 Grok 4.6 — 오늘 바로 라우팅할 수 있는 모델 — 에 유지하고, 새 모델이 오작동할 때 공급자 간 자동 장애 조치가 요청을 되돌리도록 하는 것입니다.

다음에 볼 콘텐츠
이 비교를 결정지을 두 가지가 있으며, 둘 다 아직 일어나지 않았습니다. 첫째는 Terminal-Bench 4.0 수치의 독립적 재현입니다. 38%는 누군가 다시 돌려볼 만큼 큰 폭의 도약이며, 이 수치가 유지된다면 에이전트 파이프라인에서 Grok 4.7의 사례는 마케팅이 아니라 실질적 근거로 강력합니다. 둘째는 나머지 Grok 로드맵입니다. SpaceXAI는 이번 릴리스 뒤에 Grok 4.8, Grok 4.9, Grok 5를 공개적으로 배치했으며, Grok 4.6 자체의 수명은 약 5주였습니다. Grok 4.7을 장기 플랫폼 전제로 받아들이는 것은 팀들이 Grok 4.5에서 저지른 실수를 반복하는 일이 될 것입니다.
당분간, 동일 가격 업그레이드는 실재하며 나아갈 방향은 분명하다. 기억해야 할 수치는 $2/$6로 장기적인 터미널 작업에서는 대략 두 배가 되고 다른 영역에서는 거의 변하지 않는 모델을 얻을 수 있다는 점이다 — 그리고 그것은 세대적 도약이라기보다 구체적이고 유용하며 검증 가능한 주장이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
