Grok 4.7 출시일 기사용 타이틀 카드에는 'Grok 4.7 — 출시일 질문'이라는 제목과 '아직 출시되지 않음. xAI가 실제로 말한 내용은 다음과 같습니다.'라는 부제, 그리고 '초기 훈련 완료', 'SpaceX 데이터 반영', '머스크: 3~4주'라는 세 개의 칩, 하단에는 '~2.1T 파라미터 — 주장이지 사양이 아님'이라는 문구가 있습니다.
Guides & Insights

Grok 4.7, Artificial Analysis Intelligence Index에서 46점을 기록하며 SpaceXAI를 상위 4위로 끌어올려

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok 4.7, Artificial Analysis Intelligence Index에서 46점을 기록하며 SpaceXAI를 상위 4위로 끌어올려

Grok 4.7이 출시되었습니다. SpaceXAI가 2026년 9월 21일 월요일에 이를 출시했습니다. 가격은 Grok 4.6과 동일한 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러이며, 동일한 50만 토큰 컨텍스트 윈도, 더 늦은 지식 컷오프, 새로운 최상위 추론 레벨을 갖췄습니다. 현재 Cursor와 Grok Build, 공급사 자체 API, 그리고 서드파티 코딩 하네스, 모델 라우터, 클라우드 플랫폼을 통해 사용할 수 있습니다. 7월 8일 출시된 Grok 4.5는 더 저렴한 옵션으로 그 아래에 남아 있으며, 여전히 넘어야 할 모델들은 변함없습니다: Claude Fable 5.1, Claude Opus 5, GPT-5.6 Sol은 모두 Artificial Analysis의 v4.3.2 Intelligence Index에서 Grok 4.7보다 위에 있습니다. 여기서 Grok 4.7의 첫 독립 점수인 46은 Grok 4.6보다 2점 높고 Claude Fable 5.1보다 7점 낮습니다. 동일 평가자의 장기 지식 작업용 AA-Briefcase 보드에서 Grok 4.7은 4위에 올랐습니다. 세 개의 Claude 항목 뒤, xhigh effort의 Claude Opus 5 앞이며, 작업당 비용은 Claude Opus 5의 약 절반입니다. 이는 이번 릴리스에서 격차가 아니라 가격 대비 성능의 승리로 읽히는 첫 독립적 결과입니다. 11일이 지나면서 판도는 중심보다 주변부에서 확장되었습니다: 10월 1일부터 Grok 자체 웹 및 모바일 앱 내부로 순차 배포되고 있으며, 이제 모드 선택기에서 가장 어려운 두 항목에 이 모델의 이름을 올립니다. 또한 OrcaRouter에는 SpaceXAI 자체 가격인 $2/$6로 등록되어 있습니다.

그것이 출시입니다. 더 유용한 숫자들은 같은 날 도착했는데, 이 이야기에서 벤더가 아닌 유일한 평가자로부터 나왔습니다. Artificial Analysis는 Grok 4.7에 대한 첫 독립 평가를 발표했고, 그 결과는 세 부분으로 나뉩니다 — Intelligence Index에서 46점으로 Grok 4.6보다 겨우 2점 앞서고, Coding Agent Index에서 56점으로 9점 앞서며, AA-Briefcase에서 1,657 Elo로 111점 앞섭니다. 이 세 숫자는 서로 다른 방향을 가리키며, 그 사이의 격차가 이번 릴리스에서 가장 흥미로운 점입니다. 이어지는 내용은 출시된 사양, 각 행에 필요한 라벨을 붙인 벤더 자체의 벤치마크 표, 그리고 제대로 읽은 독립 점수들입니다 — 여기에는 SpaceXAI가 한 번도 다루지 않은 준비성 관련 유보에 대해 이들이 말하는 바도 포함됩니다.

SpaceXAI가 9월 21일에 출시한 것

명세부터 시작하자. 전임 모델의 것과 유난히 비슷하기 때문이다. Grok 4.7의 가격은 Grok 4.6과 동일하다 — 입력 토큰 200,000개 미만일 때 백만 입력 토큰당 2달러, 백만 출력 토큰당 6달러이고, 요청이 그 임계값을 넘으면 입력 4달러, 출력 12달러로 오른다. Grok 4.6이 도입한 것과 같은 구조다. 컨텍스트 윈도는 500,000토큰이다. 지식 컷오프는 2026년 5월로, Grok 4.6의 2026년 2월 1일보다 세 달 늦다. 추론 강도는 low, medium, high, xhigh의 네 단계로 나뉘며, 공개된 수치는 xhigh 기준으로 제시된다. 고속 변형은 두 배의 가격에 두 배의 출력 속도로 작동한다.

그 이면에서 xAI는 새로운 아키텍처라기보다 세 가지 변화를 설명한다. 기반 모델은 Grok 4.6의 것보다 크다. 강화학습 실행은 더 길었고, 완료하는 데 여러 시간이 걸리는 과제에 가중치를 두었다. 그리고 이 모델은 자체 작업을 검증하고 긴 문맥을 더 잘 유지하도록, Grok Bot 하네스에 대한 네이티브 이해를 포함해 훈련되었다. 회사 자체의 한 줄 요약은 "동급 모델보다 두 배 빠르고, 절반 가격"이다 — 이는 측정치라기보다 경쟁사에 관한 포지셔닝 주장이며, 그렇게 읽을 가치가 있다.

가용성은 첫날부터 광범위했고, 그 이후 두 번 더 확대되었다. 출시 당시: Cursor와 Grok Build, 벤더 자체 API, 타사 코딩 하네스, 모델 라우터 및 클라우드 플랫폼; SpaceXAI의 자체 Grok Build 페이지는 이제 "Grok 4.7로 빌드를 시작하세요"라고 분명히 명시하고 있다. 9월 28일 아마존 웹 서비스(AWS)는 동일한 500,000 토큰 컨텍스트 윈도우와 동일한 네 가지 추론 노력 수준을 갖춘 모델을 Amazon Bedrock에 추가했으며, 교차 리전 추론 프로필을 통해 제공된다. 따라서 이 모델은 이제 벤더의 API뿐만 아니라 하이퍼스케일러의 자체 카탈로그를 통해서도 접근할 수 있다. 그런 다음 10월 1일에는 Grok의 소비자용 웹 및 모바일 앱 내에서 롤아웃되기 시작했고, 이틀 후인 지금도 여전히 그 상태에 머물러 있다. 마지막 단계는 유난히 조용하다: SpaceXAI는 "Grok 4.5를 iOS, Android, Web 및 X에 출시"라는 제목의 블로그 게시물로 Grok 4.5에 대한 동등한 단계를 발표했지만, Grok 4.7에 대해서는 아무것도 게시하지 않았다. 따라서 변경 사항은 선언된 것이 아니라 제품에서 가시적으로 확인된다. 이것은 출시된 것이 아니라 서버 측에서 이루어졌으며, 이는 앱 목록에서 확인된다: Grok의 iOS 및 Android 목록 모두 10월 1일에 업데이트되었다 — App Store 빌드는 1.4.47로, 그날 출시되었으며 릴리스 노트에는 "채팅, 음성 및 Imagine 개선 사항"만 언급되어 있고, Play 목록도 같은 날 업데이트되었다. 변경 사항은 바이너리에 내장된 것이 아니라 백엔드에서 푸시된다. 롤아웃이 문서화된 것이 아니라 보고되고 있기 때문에, 정확한 범위는 날짜가 지정된 AWS 게시물이 뒷받침하는 Bedrock 목록보다 확립하기가 더 어렵다. 그리고 보고 내용은 이미 표류했다: 이를 추적하는 계정들은 이제 Grok 4.7을 모든 모드 — Fast, Expert, Build, Heavy — 에 걸친 기본 모델로 설명하는데, 이는 grok.com이 실제로 제공하는 것과 일치하지 않는 목록이다. 벤더 설명이 아니라 추적자들의 자체 보고로 읽어야 한다. 선정된 사이버 보안 파트너는 모델의 레드팀 기능에 초대 전용으로 접근할 수 있다.

이 글에서 남긴 기록에 대한 정정이 하나 있습니다. 두 달 동안 돌았던 파라미터 수 — 약 2.1조 개로, Grok 4.6의 1.5조 개보다 약 40% 높은 — 는 여전히 어떤 사양표에도 없습니다. xAI는 Grok 4.7의 파라미터 수를 공개하지 않았고, Artificial Analysis는 모델 크기를 비공개로 표기하고 있습니다. 그 수치는 언제나 창업자의 주장이었고, 이번 출시도 그것을 사양으로 바꾸지 못했습니다.

벤치마크 표는 xAI 자체의 것입니다 — 여기에 포함되지 않은 것이 있습니다

아래 목록의 모든 수치는 벤더의 발표에서 나온 것이며, 그중 어느 것도 독립적으로 재현되지 않았습니다. 이 점을 전제로 읽으십시오. 이는 xAI가 선택한 평가에 대한 xAI의 수치이고, 출시 당일 공개된 것이며, 어떤 출시든 첫 주는 벤더 벤치마크가 가장 신뢰하기 어려운 시기입니다. 비교 열도 벤더 자체의 것입니다 — Grok 4.6 (high), GPT-5.6 Sol (max), Claude Fable 5.1 (max)이며, 각각 벤더가 선택한 노력 수준에서 실행되었습니다.

• CursorBench 4.0 — Grok 4.7 46.3%, Grok 4.6 40.4%, GPT-5.6 Sol 41.7%, Claude Fable 5.1 51.8%. 벤더 보고.

• DeepSWE v1.1 — 높은 노력 수준에서 Grok 4.7 71.0%, Grok 4.6 65.2%, GPT-5.6 Sol 72.7%, Claude Fable 5.1 70.0%. 공급업체 보고 기준.

• Terminal-Bench 4.0 — Grok 4.7 37.6%, Grok 4.6 20.3%, GPT-5.6 Sol 37.3%, Claude Fable 5.1 57.9%. 벤더 보고치이며, 수정되었습니다: Grok 4.7 항목은 출시일 표에서는 38.0%로 표기되었고 오늘 벤더 페이지에서는 37.6%로 표기됩니다.

• EEBench — Grok 4.7 64.0%, Grok 4.6 53.0%, GPT-5.6 Sol 39.4%, Claude Fable 5.1 56.4%. 공급업체 보고 기준.

• Harvey Legal Agent — Grok 4.7 19.6%, Grok 4.6 15.8%, GPT-5.6 Sol 2.5%, Claude Fable 5.1 6.7%. 공급업체 보고 기준.

• HealthBench Professional — Grok 4.7 56.7%, Grok 4.6 48.5%, GPT-5.6 Sol 60.5%, Claude Fable 5.1 62.1%. 공급업체 보고.

• AA Briefcase v1.1 — Grok 4.7 1,657, Grok 4.6 1,546, GPT-5.6 Sol 1,487, Claude Fable 5.1 1,678. 이 표에서 더 이상 벤더 전용이 아닌 유일한 행입니다. Artificial Analysis의 자체 AA-Briefcase 보드는 xhigh 에포트의 Grok 4.7에 대해 동일한 1,657을, high의 Grok 4.6에 대해 1,546을 게시합니다. 비교 열은 여전히 벤더가 선택한 모델과 에포트 수준입니다.

• GDPval Elo — Grok 4.7 1,695, Grok 4.6 1,605, GPT-6 Astra 1,542, Claude Fable 5.1 1,735. 업체 보고 기준.

그 집합을 정직하게 읽은 결과는 “Grok 4.7이 이긴다”가 아니다. Grok 4.7은 여덟 개 전부에서 Grok 4.6을 앞서는데, 이는 후속 버전이 사용자에게 마땅히 보여줘야 할 최소한이다. 다른 모델들과 비교하면 성적은 양면적이다: CursorBench, Terminal-Bench, EEBench에서는 GPT-5.6 Sol보다 앞서고, DeepSWE에서는 뒤처진다. CursorBench, Terminal-Bench, HealthBench 및 두 가지 Elo 방식 지표 모두에서는 Claude Fable 5.1보다 뒤처지고, EEBench와 Harvey 법률 에이전트 평가에서는 앞선다. 또한 벤치마크 결과에서 노력 수준이 얼마나 큰 비중을 차지하는지도 보여준다 — 다른 항목은 모두 xhigh로 인용된 표 안에서, DeepSWE의 71.0%는 높은 노력 수준에서 나온 수치다.

안전성은 공급업체의 주장이 유난히 구체적인 유일한 영역이다. xAI는 Grok 4.7이 완전히 새로운 안전장치 스택을 기반으로 구축되었다고 말하며, 거부 및 탈옥 저항성에 관해 회사가 테스트한 모델 중 가장 강력하다고 평가한다. LatchBio의 생물안전 벤치마크에서는 62.4%를 보고했고, HackerBench v0.3에서는 위험한 이중용도 프롬프트의 3.3%를 통과시키면서 정당한 보안 작업은 거의 차단하지 않는다고 보고했다. 이는 공급업체 자체 릴리스에 대해 공급업체가 보고한 평가이며, 이를 재현한 제3자는 없다.

이 글에서 벤더의 수치가 아닌 첫 번째 수치는 9월 21일 Artificial Analysis가 발표한 세 가지 수치이며, 이들은 서로 시사하는 바가 있게 엇갈린다. Intelligence Index에서 Grok 4.7은 v4.3.2 스케일의 xhigh effort에서 46점을 기록해 해당 리더보드에서 16위인 반면, Grok 4.6은 44점이다. 그 2점 상승은 Artificial Analysis가 SpaceXAI를 이 지수의 상위 4개 연구소에 포함시키기에 충분하다고 말하는 수치다. 이 순위를 정확히 해석해야 한다: 그것은 이 모델이 아니라 한 연구소의 최고 모델에 관한 진술이며, 이 모델 자체는 여전히 Claude Fable 5의 50점보다 4점 낮고, Claude Fable 5.1과 GPT-6 Astra가 공동으로 받은 53점보다 7점 낮다. 2점 상승은 동일 모델의 effort 레벨 사이에서도 나타나는 범위에 속한다. 이는 후속 모델이 전작보다 높은 점수를 받는 것이 후속 모델이 가능성 자체를 바꾸는 것과 같지 않다는 점을 일러준다. 이 숫자를 읽을 때 한 가지 더 유의할 점: 스케일 버전이 중요하다. Artificial Analysis가 지수를 재산정했기 때문에, 대부분의 7월과 8월 보도에 등장하는 61/62/63 값은 폐기된 2026년 9월 이전 스케일의 것이며, 이 수치들과 비교할 수 없다.

Coding Agent Index는 두 번째 수치이며, 실제로 움직인 것도 이 수치다. SpaceXAI 자체 Grok Build 하네스에서 xhigh effort로 실행할 때 Grok 4.7은 Grok 4.6의 47에 맞서 56점을 기록한다 — 2점이 아니라 9점 차이다 — 이는 네이티브 하네스에서 평가된 모델 중 4위로, Claude Fable 5.1, GPT-6 Astra, Claude Opus 5보다 뒤이고 GPT-5.6 Sol보다 앞이다. 이 지수는 303개 태스크에 걸친 DeepSWE v1.1, Terminal-Bench 4.0, SWE-Atlas-QnA의 동일 가중 합성 지표이며, 세 구성 요소 모두 향상됐다: DeepSWE는 65%에서 73%로, Terminal-Bench는 18%에서 33%로, SWE-Atlas-QnA는 58%에서 63%로. 이것은 xAI가 설명한 수정 — 여러 시간짜리 작업에 가중치를 둔 더 긴 강화 학습 — 이 효과가 있었다는 첫 독립적 증거이며, 코딩 에이전트를 선택하는 팀이 가장 비중 있게 따져야 할 수치다. 왜냐하면 이 수치는 공급업체 자체 표가 아니라 모델이 실제로 함께 제공되는 하네스에서 측정되기 때문이다.

유의할 점은 그 9점에 드는 비용이다. Artificial Analysis의 자체 실행에서는 Intelligence Index에서 2억 4천만 개의 출력 토큰이 생성되었는데, 이는 자사가 추적하는 모델들의 중앙값 9,400만 개에 맞서는 수치로 두 배가 넘으며, Index 작업 하나를 평가하는 비용은 3.74달러로 산정되었다. 출력 토큰 100만 개당 6달러인 상황에서 장황함은 에이전트 루프의 경제성을 좌우하는 항목이므로, 중앙값의 두 배가 넘는 출력으로 사들인 9점 상승은 무료 업그레이드가 아니라 실질적인 맞교환이다. 같은 측정은 또한 헤드라인 점수를 하나의 결론으로 읽어서는 안 된다는 뜻이기도 하다. 토큰당 기준으로 Grok 4.7이 Grok 4.6보다 갖는 우위는 지수 차이가 시사하는 것보다 작으며, Intelligence Index를 구성하는 일반 지식 평가에서는 훨씬 더 큰 청구서를 내는 사실상 동일한 모델에 가깝다. 다음 섹션의 AA-Briefcase 결과는 그에 대한 예외이며, 그것도 상당히 큰 예외다.

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

두 번째 독립 보드: AA-Briefcase, 그리고 작업당 절반의 비용이 무엇을 가져다주는가

Artificial Analysis는 같은 날 Grok 4.7에 대한 세 번째 수치를 발표했는데, 그것은 코드보다 지식 노동에 관한 것이다. 장기 지평의 에이전트형 지식 노동을 위한 자체 보드인 AA-Briefcase — 4개의 여러 주에 걸친 프로젝트 시나리오와 91개의 채점된 산출물로 구성됨 — 에서 xhigh effort의 Grok 4.7은 1,657 Elo를 기록해 보드 4위이며, 오직 Anthropic 항목들만 앞서 있다: max effort의 Claude Fable 5.1(1,678), max effort의 Claude Opus 5(1,673), xhigh의 Claude Fable 5.1(1,669). 이는 max effort의 Claude Opus 5보다 16 Elo 뒤처지고, xhigh에서는 xhigh의 Claude Opus 5(1,649)보다 8 Elo 앞선다. 이 순위를 정확히 읽어야 한다: “오직 Anthropic 모델들 뒤에 있다”는 Artificial Analysis 스스로 사용한 프레이밍이며, 그것은 정확하다 — 하지만 4위는 2위가 아니고, 그 위의 세 행은 모두 같은 공급업체다.

이전 세대 대비 상승폭은 이번 릴리스에서 가장 큰 단일 변동이다. high effort의 Grok 4.6(1,546)에 대비해 xhigh의 Grok 4.7은 AA-Briefcase에서 111 Elo를 얻는다 — Intelligence Index에서의 2포인트 상승의 50배가 넘는다. Artificial Analysis는 이를 거의 전적으로 분석 품질 덕분으로 돌린다: 해당 부문에서 1,994 Elo로 Grok 4.6의 1,690을 앞서는 반면, 프레젠테이션 품질은 1,499로 1,519에 비해 소폭 하락한다. 이는 뚜렷이 읽히는 특징이다: 모델이 분석에 대해 더 잘 추론하고 결과물의 형식은 약간 더 나쁘게 잡는다. 같은 방향은 Artificial Analysis가 Hugging Face에 공개한 실사 시나리오인 AA-Briefcase-Lite에 대해 인용한 수치에서도 나타난다 — 분석 품질은 1,698에서 1,994로 상승하고, 프레젠테이션은 1,531에서 1,499로 하락했다. 그 비교에는 두 가지 주의할 점이 있다. AA-Briefcase-Lite는 명시적으로 시연용이다: Artificial Analysis 자체 방법론 페이지에 따르면 공개된 다섯 번째 시나리오는 "공식 AA-Briefcase 결과에 포함되지 않는다." 그리고 이에 대해 인용된 품질 수치는 메인 보드에 게시된 xhigh 행과 일치하므로, Lite 단락은 별도의 스코어보드라기보다 진행 방향을 보여주는 예시로 취급하라.

비용 항목은 이 결과가 의사 결정을 바꾸는 지점이다. AA-Briefcase의 작업당 비용 지표는 전체 제출을 실행하는 총비용을 91개 작업으로 나눈 값이다. Artificial Analysis가 공개한 총계를 나눠 보면 Grok 4.7의 xhigh에서 작업당 약 $9.30, Claude Opus 5의 max effort에서 약 $17.79가 나온다 — 16-Elo 격차에 대해 약 절반이다. Artificial Analysis 자체의 결과 요약에 따르면 Grok 4.7은 "Opus 5의 작업당 비용의 약 50%로 Opus 5 바로 뒤에" 랭크된다. 이는 이 글의 나머지 부분이 설명하는 것과 같은 트레이드오프이며, 다른 방향에서 같은 답에 도달한다: Grok 4.7은 프런티어를 앞서는 것이 아니라, 그보다 더 낮은 가격으로 파고든다. 두 가지 단서가 붙는데, 둘 다 솔직하다. 토큰 청구서는 현실이다 — AA-Briefcase-Lite에서 Artificial Analysis는 예시 덱을 생성하는 API 비용을 Grok 4.7의 xhigh에서 약 $8, Grok 4.6의 xhigh에서 약 $4.40으로 산정했다. 따라서 후속 모델은 같은 작업에서 자신이 대체하는 모델보다 약 80% 더 든다. 그리고 작업당 수치는 정가 기준 토큰 사용량과 대표적인 캐시 적중률로 계산되므로, 여러분의 캐싱에 따라 달라진다: 그것은 청구서의 모델일 뿐, 여러분의 청구서가 아니다.

Grok 4.7이 Grok 4.6과 경쟁 모델들 사이에서 어디에 위치하는지

• 100만 토큰당 가격 — Grok 4.7은 입력 200K 미만일 때 $2 입력 / $6 출력, 초과 시 $4/$12; Grok 4.6도 동일.

• 컨텍스트 윈도우 — 두 모델 모두 500,000 토큰.

• 지식 컷오프 — Grok 4.7은 2026년 5월, Grok 4.6은 2026년 2월 1일.

• 추론 노력 — Grok 4.7의 low / medium / high / xhigh 대 Grok 4.6의 공개된 수준.

• 독립 점수 — Artificial Analysis의 v4.3.2 Intelligence Index에서 xhigh 노력 수준으로 46점, 44점 대비. Artificial Analysis에 따르면, 이는 SpaceXAI를 해당 지수의 상위 4개 연구소에 올려놓기에 충분하다.

독립 코딩 점수 — Artificial Analysis Coding Agent Index에서 56 대 47, 각 모델은 자체 네이티브 하네스 기준. 네이티브 하네스 모델 중 4위이며, GPT-5.6 Sol보다 앞선다.

• 독립적 지식 노동 점수 — xhigh effort에서 1,657 Elo로, high에서의 Grok 4.6의 1,546 Elo와 대비된다. Artificial Analysis의 AA-Briefcase 보드 기준. 종합 4위로, Anthropic의 세 항목 뒤이자 xhigh에서의 Claude Opus 5보다 앞선다.

• AA-Briefcase 작업당 비용 — 동일한 보드에서 최대 노력으로 설정한 Claude Opus 5의 약 $17.79와 비교해 약 $9.30입니다. 16-Elo 격차에 대해 작업당 비용은 대략 절반입니다.

• Index 실행당 출력 토큰 — Artificial Analysis가 추적하는 모델들의 중앙값 9,400만 개에 맞서는 2억 4,000만 개. 이 개선은 공짜가 아니다.

• 벤더 코딩 평가 — CursorBench 4.0 46.3% 대 40.4%.

• 서빙 속도 — Grok 4.6의 표준 서빙과 비교해 두 배의 출력 속도를 제공하는 대신 두 배의 가격을 받는 고속 변형.

• 안전성 — 새로운 세이프가드 스택으로, LatchBio의 바이오안전성 벤치마크에서 62.4%를 기록했다고 보고되었습니다. Grok 4.6은 그러한 주장 없이 출시되었습니다.

그리고 같은 스코어보드에서의 경쟁 구도: Claude Fable 5.1이 53, Claude Opus 5가 51, GPT-5.6 Sol이 47, Kimi K3가 44. 머스크 자신의 예측, 즉 Grok 4.7이 "Opus 5.0과 대략 동등하며 5.1은 아닐 것"이라는 예측 아래 이제 숫자가 놓였고, 그 숫자는 그가 말한 곳에 안착했다: 프런티어 위가 아니라 아래에. Claude Fable 5.1과의 측정된 격차는 7점이며, 가격 격차는 반대 방향으로 흐른다. Claude Fable 5.1은 백만 토큰당 $10/$50로 책정된 반면 Grok 4.7은 $2/$6이다 — 입력 가격은 5배, 출력 가격은 8배 이상이다. 이것이 팀이 요구받는 실제 트레이드오프이며, 역량 승리가 아니라 가격 대비 성능 트레이드오프다. AA-Briefcase는 이 글에서 순서가 바뀌는 유일한 보드다: 거기서는 xhigh의 Grok 4.7이 xhigh의 Claude Opus 5를 1,657 대 1,649로 앞서지만, 여전히 최대 노력의 Opus 5(1,673)와 Claude Fable 5.1(1,678)에는 뒤진다. 또한 선을 긋기 전에 세 가지 독립 점수를 나란히 놓아볼 가치가 있다. 왜냐하면 그것들은 같은 방향을 가리키지 않기 때문이다: 일반 지능에서는 7점 뒤지고, 코딩 에이전트 지수에서는 GPT-5.6 Sol을 앞서며, 지식 작업에서는 전임자보다 111 Elo 앞서고, 그 이득을 출력 토큰으로 지불한다. 그 사실 중 어느 것이 당신의 선택을 결정하는지는 워크로드가 코딩 에이전트인지, 지식 산출물인지, 채팅 프롬프트인지에 달려 있으며, 그것이 단일 순위보다 더 유용한 구분이다.

유출이 맞힌 것, 그리고 유출이 해결하지 못한 한 가지

이 기사가 9월까지 추적한 자료들은 실재했으며, 이번 출시는 그런 부류의 증거가 어떤 가치를 지니는지 시험하는 무대로 그것들을 바꿔 놓는다. 다음은 그 장부다.

• 카탈로그 풀 리퀘스트는 가격을 정확히 맞혔다. 오픈소스 에이전트 클라이언트의 Zen 및 Go 카탈로그에 Grok 4.7을 추가하는 9월 21일 제출물은 — 05:36 UTC에 열렸고, 07:46 UTC에 컴플라이언스 봇이 풀 리퀘스트 템플릿 섹션이 누락되었다는 이유로 자동 종료했으며, 병합되지 않았다 — 해당 모델을 Grok 4.6의 공개 요율로 기재했다. 결과적으로 그것은 정확히 맞았다: $2/$6, 변동 없음. 하지만 결과보다 메커니즘이 더 중요하다. 기여자는 바로 위 모델의 요율을 복사했고, 그 복사는 우연히 올바른 추측이었다. 그것은 권위가 아니라 운이며, 같은 풀 리퀘스트의 역량 주장 역시 아무런 정보를 담고 있지 않았다. 제안은 옳을 수 있지만 여전히 증거는 아니다.

• 프로비저닝 흔적은 진짜였으며 릴리스는 아니었다. 커뮤니티 추적자들이 9월 16–17일에 보고한 Google Cloud Console의 모델 할당량 페이지에 있는 grok-4.7 행과, Grok Bot 구성 오류에서 드러난 날짜가 붙은 grok-4-7-0907 빌드 슬러그는 둘 다 준비 중인 모델을 가리켰다. 어느 쪽에도 누구도 날짜를 붙이지 않았고, 어느 쪽도 발표는 아니었다. 그것들이 입증하는 것은 제3자 인프라가 준비되고 있었다는 점이다 — 돌이켜 보면 이는 정확했으며, 여전히 일정은 아니었다.

• 파라미터 수는 결코 확인된 적이 없었다. 대략 2.1조로, Grok 4.6보다 약 40% 높으며, 머스크가 9월 2일에 거듭 언급했다 — 그리고 출시 당시 모든 사양서에서 여전히 빠져 있었다. 이것은 이 모든 과정에서 사실로 받아들여질 만큼 널리 퍼졌지만 공급업체의 출처는 전혀 없었던 숫자에 관한 가장 명백한 사례이다.

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

위 카드는 이 기사가 마지막으로 확인했을 당시의 출시 전 상태를 기록하고 있다: 모델 ID도, 출시일도, 공개된 벤치마크도 없었다. 그 카드의 모든 행은 이후 9월 21일 발표로 대체되었으며, 이 카드와 출시된 모델 사이의 격차야말로 지난 6주간의 실제 이야기이기 때문에 여기에 남겨 둔다 — 출시 당일까지 확정된 사양을 전혀 내놓지 않은 프런티어급 출시였다.

• 준비성에 관한 단서는 여전히 미해결 문제이며, 이제 부분적인 증거가 생겼다. 머스크는 9월 중순에 Grok 4.7이 고난도 작업에서 "조기에 마무리"되며 답변 검증이 "충분히 엄격하지 않다"고 말했는데, 그는 이를 장문 응답에 대한 강화학습 페널티가 너무 높게 설정된 탓으로 돌리면서 "아마도"라는 단서를 붙였다. 출시 발표는 이 문제를 다루지 않는다. xAI가 내놓은 해결책은 간접적이다. 다시간 규모 작업에 가중치를 둔 더 긴 강화학습과 더 나은 자기 검증은 조기 종료 문제를 해결하기 위해 바로 하게 될 변화다. Coding Agent Index 결과는 이것이 효과를 냈다는 첫 외부 신호다. Grok 4.6의 47에 맞선 56이며, Terminal-Bench 4.0은 18%에서 33%로 거의 두 배가 되었는데, 이는 바로 장기 지평의 다단계 영역에 해당한다. 이것이 명쾌한 답은 아닌데, 같은 하네스 점수들이 훨씬 더 많은 출력 토큰을 들여 성능 향상을 사들이는 것이기도 하기 때문이다. 모델이 여전히 길고 어려운 작업을 포기하는지는 API 접근 권한이 있는 누구나 시험해볼 수 있으며, 이는 여전히 가장 먼저 시험해볼 가치가 있는 항목이다.

• SpaceX 코퍼스는 여전히 검증되지 않았다. 보도된 학습 보충 자료 — Starlink 텔레메트리, Raptor 연소실 압력 로그, Starship 재진입 텔레메트리, 내부 Slack 스레드, Jira 티켓, GitHub 저장소, ERP 기록 — 는 머스크가 말한 내용에 대한 커뮤니티 보도이지 회사 공시가 아니다. 출시 발표는 더 큰 기본 모델과 더 긴 강화학습 실행을 설명하며, 코퍼스에 관해서는 아무 말도 하지 않는다. 그것이 그 안에 들어 있다 하더라도, 어떤 사양서도 그것을 확인해 주지 않을 것이다. 유일한 증거는 그 모델이 실제 엔지니어링 작업에서 동종 모델들이 할 수 없는 일을 해내는지 여부일 것이다.

네 번이나 빗나간 타임라인, 그리고 시장이 제대로 짚어낸 것

Grok 4.7은 다섯 개의 서로 다른 일정으로 공개적으로 약속되었고, 처음 네 개는 지나갔다. 7월 24–25일 머스크는 약 4주라고 말했으며, 이는 8월 22일을 의미했다. 8월 12일 그는 "3~4주"로 수정했고, 이는 9월 2–9일을 의미했다. 9월 2일 그는 대략 열흘로 좁혔고, 9월 12일을 가리켰다. 9월 11일, 그 기한이 다한 날 그는 "며칠만 더"라고 말했다. 다섯 번째는 애초에 기한이 아니었다 — Google Cloud 할당량 페이지의 grok-4.7 행 — 그리고 그것이 가장 정확에 가까웠다: 모델은 9월 21일에 출시되었는데, 이는 누구든 공언했던 마지막 날짜 직후였고, 그보다 앞선 아티팩트에는 날짜가 붙어 있지 않았다.

예측 시장은 달력은 정확히 맞혔고 모델은 잘못 예측했다. Kalshi의 "SpaceXAI가 9월 18일 전에 Grok 4.7을 출시할까?"는 9월 18일 03:59 UTC에 거래를 중단했으며, 마지막으로 65¢에 거래되었고, 1,785건의 계약이 거래되었으며 1,211건이 미결제 상태였다. 두 주요 시장의 모든 결제된 계약 — Kalshi의 8월 14일, 21일, 28일, 31일과 9월 4일, 8일, 11일 윈도우, 그리고 Polymarket의 9월 12일과 9월 14일 계약 — 은 No로 해결되었다. Polymarket의 "다음 Grok 모델(4.7 이상)이 9월 18일까지 출시될까?"는 11일 동안 42%에서 88.5% 사이를 오간 후 9월 15일 64%를 기록했다. 시장은 트윗으로 인한 급등에 역배팅한 것이 옳았고, 9월 18일 윈도우가 아무것도 없이 마감될 것이라고 예측한 것도 옳았다. 시장은 모델에 대해 3일 일렀는데, 이는 날짜가 정해진 계약이 가격을 매길 수 없는 유일한 것이다.

조회수는 기준점을 잡는 메모로 남겨 둘 만하다. 머스크의 9월 2일 카운트다운인 "10일 후 공개된다"는 1,029만 조회수를 기록했고, 틀렸다. 그의 9월 11일 번복은 205만 조회수를 기록했고, 역시 틀렸다. 그의 9월 13–14일 로드맵 게시물은 약 199만 조회수를 기록했으며 가장 정확에 가까웠다 — 그는 처음부터 자체 구축한 C++ 스택으로 훈련된 약 2조 5,000억 매개변수 모델인 Grok 4.8을 Grok 4.7보다 "눈에 띄는 개선"이라고 설명했다. 이 모든 과정에서 도달 범위는 정확성이 아니라 확신을 따라갔다.

로드맵 항목 중 두 가지는 이제 예측이 아니라 현재 진행 중인 질문이다. Grok 4.8은 어디에도 모델 ID도, 가격도, 컨텍스트 윈도도, 벤치마크 항목도 없다. 그리고 Grok 4.7이 조용히 Grok 4.8로 "리브랜딩"되었다는 해석 — 4.7이 늦어지던 중 머스크가 4.8을 언급한 것을 한 매체가 해석한 것 — 은 반대 방향으로 판가름 났다: 4.7은 4.7로 출시되었고, Index에서 Grok 4.6의 44에 대비해 46을 기록했는데, 이는 후속 모델의 증가분이지 재출시가 아니다.

오늘 Grok을 호출하는 팀에게 이것이 의미하는 바

실질적인 그림은 9월 21일에 바뀌었고, 가능한 한 가장 극적이지 않은 방식으로 바뀌었다. 동일한 가격, 동일한 컨텍스트 윈도우에 새로운 모델 ID, Index 2포인트 상승, 코딩 에이전트 9포인트 상승, 지식 작업에서 111포인트 상승이다. 그 이후의 두 가지 변화는 겉보기보다 더 중요하다. Grok 앱은 이제 이 모델을 개발자에게만이 아니라 일반 사용자에게도 제공하며, 이쪽의 카탈로그에도 이제 그것이 등재되어 있다 — 이 둘이 합쳐져 이 글 끝에서 설명하는 라우팅 계층을 계획에서 기본값으로 바꾼다. 당신의 비용 모델이 $2/$6의 Grok 4.6을 기준으로 구축되었다면, 토큰당 가격은 Grok 4.7에서도 여전히 맞다 — 그러나 토큰 수는 그렇지 않다. Artificial Analysis 자체의 실행은 Intelligence Index에서 2억 4천만 개의 출력 토큰을 소모했는데, 이는 추적하는 모델들의 중앙값 9,400만 개와 대비된다. 따라서 요금표가 동일하더라도 같은 요청에 두 배 훨씬 넘는 비용이 들 수 있으며, 이는 가격표에는 결코 드러나지 않는 종류의 변화다. 이번 릴리스가 무료라고 결론 내리기 전에, 실제 에이전트 루프의 가격을 백만 토큰당 요율이 아니라 출력 토큰 기준으로 산정하라. 전환하려는 이유가 벤더가 주장하는 가격 대비 성능 최전선이라면, 그에 대한 가장 강력한 증거는 이제 벤더의 표가 아니라 AA-Briefcase다: 그 보드에서 4위로 작업당 비용이 Claude Opus 5의 대략 절반이며, 이는 Claude Fable 5.1과의 Intelligence Index 7포인트 격차, 그리고 입력에서는 5배, 출력에서는 8배 이상으로 반대 방향으로 벌어진 가격 격차와 맞선다. 그리고 당신의 워크로드가 특히 코딩 에이전트라면, 그 근거는 Index가 시사하는 것보다 더 강력하다: Grok Build 하네스에서 Coding Agent Index 56점은 GPT-5.6 Sol을 앞서는 것으로, 일반 지능 46점과는 다른 차원이다. 그중 어느 것이 더 중요한지는 전적으로 당신의 워크로드에 달려 있으며, SpaceXAI 밖의 누구도 당신의 워크로드에서 Grok 4.7을 실행해 본 적이 없다.

OrcaRouter의 카탈로그에서 Grok 라인업은 이제 Grok 4.6, Grok 4.5, Grok 4.3과 함께 Grok 4.7을 제공하며, 공급자의 정가에 0% 마크업을 붙여 청구됩니다 — 입력 토큰 100만 개당 $2, 출력 100만 개당 $6, 캐시된 입력 읽기는 $0.50이며, 요청이 입력 토큰 200,000개를 넘으면 SpaceXAI가 부과하는 것과 동일하게 입력 $4, 출력 $12로 단계가 올라갑니다. 요금표를 그대로 통과시키는 것이 사주는 것은 바로 이것입니다. 비용 모델의 토큰당 가격이 곧 청구서의 토큰당 가격이고, 이 제품군의 모든 모델이 하나의 키로 응답하므로, 워크로드를 Grok 4.6에서 Grok 4.7로 옮기는 것은 두 번째 계약이 아니라 문자열 변경에 불과합니다. 그 페이지에는 500,000토큰 컨텍스트 윈도와, Grok 4.6 통합이 이미 대상으로 삼고 있는 동일한 OpenAI 호환 표면 — Chat Completions와 Responses —이 담겨 있습니다.

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

그 라우팅 계층은 독립적인 수치가 벤더의 것과 같은 날 나온 모델을 평가하는 저위험 방식이기도 합니다. 위의 벤치마크 목록은 여전히 벤더 자체의 것입니다 — 벤더가 선택한 평가, 벤더가 선택한 노력 수준, 벤더가 선택한 비교 열 — 그리고 그중 어느 것도 재현되지 않았습니다. 달라진 점은 세 가지 Artificial Analysis 점수가 벤더의 것이 아니라는 사실입니다. 그래서 질문은 "이 중에 진짜가 있기는 한가"에서 "이 결과 중 어느 것이 내 워크로드와 비슷한가"로 옮겨갔습니다: 중위권 일반 지능을 나타내는 46, 네이티브 하네스 코딩 에이전트 중 4위를 나타내는 56, 또는 프런티어의 작업당 비용 절반으로 지식 작업에서 4위를 나타내는 1,657. 그리고 경제성을 결정하는 숫자는 전혀 벤치마크가 아니라 한 번의 실행이 소비하는 출력 토큰이며, 이는 자체 트래픽으로만 가격을 매길 수 있습니다 — Artificial Analysis의 측정에서 Index 실행당 2억 4천만 개로 중앙값 9,400만 개와 대비되고, 공개된 AA-Briefcase-Lite 시나리오에서 예시 덱 세트당 약 $8 대 $4.40입니다. 자동 페일오버를 사용하면 실제 트래픽을 새 모델로 보내고, 토큰 청구액이나 조기 포기 동작이 광고된 것보다 나쁘다고 판명되면 여전히 응답하는 공급자로 폴백할 수 있습니다 — 이는 검증되지 않은 모델을 테스트하는 것과 파이프라인을 거기에 거는 것의 차이입니다.

먼저 알아내는 방법(효과가 있었던 확인)

이 섹션은 기다리는 동안 지켜볼 신호들의 목록이었습니다. 이제 기다림은 끝났으니, 실제로 일어난 일과 대조해 평가한 같은 목록을 여기 소개합니다.

• 모델 목록이 확인이었고, 그것이 움직였다. 6주 동안 이 글의 조언은 트윗이 아니라 공급업체의 모델 목록을 주시하라는 것이었습니다. Grok 4.7이 실제가 되는 순간 목록에 가격과 컨텍스트 윈도우가 함께 붙은 모델 ID가 추가될 것이기 때문입니다. 바로 그 일이 일어났습니다: grok-4.7이 이제 500K 컨텍스트 윈도우, 200K 입력 이하 $2/$6 가격 및 초과 시 $4/$12, 2026년 5월 지식 컷오프, 네 가지 에포트 레벨과 함께 나타납니다. 모든 머스크 윈도우, 모든 케이던스 논쟁, 모든 시장 날짜가 그 목록을 움직이지 못했습니다; 릴리스가 그것을 움직였습니다.

• 서드파티 카탈로그가 발표보다 앞서는데, 그것들은 배포가 아니라 제안이다. 9월 21일자 카탈로그 풀 리퀘스트는 지금까지 중 이것을 가장 명확히 보여준 사례이며, 그 종료 과정은 시사하는 바가 크다. 한 기여자가 모델을 준비했고, 두 시간 뒤 봇이 누락된 템플릿 섹션을 이유로 그 변경을 닫았으며, 그 모델은 그로부터 이틀 뒤에 출시되었다. 그런 부류의 산출물은 타임스탬프가 찍힌 의도로 읽어야 한다. 그것은 분명히 발표보다 앞서는 것이지만, 가용성을 뜻하지는 않는다.

• OrcaRouter 모델 카탈로그를 확인하세요. 이제 상황이 바뀌었습니다. 9월 내내 이 글의 조언은 orcarouter.ai의 grok-4.7 모델 페이지가 "오늘 우리를 통해 호출할 수 있다"는 신호가 될 것이라는 내용이었습니다. 모델은 제공업체가 온보딩한 뒤에야 목록에 오르기 때문입니다. 이제 카탈로그에는 Grok 4.7이 공급업체 요율로 마크업 없이 등재되어 있으므로, 독자가 확인하라고 안내받았던 검사에는 답이 있습니다: 오늘 하나의 API를 통해 라우팅할 수 있습니다.

• 소비자 측 가시성 측면에서, Grok 앱은 이제 API 콘솔을 절대 열지 않을 사용자들 앞에 Grok 4.7을 내세웠다. 10월 2일에 다시 읽어보면, grok.com이 로그아웃한 방문자에게 제공하는 선택기 데이터는 여전히 네 항목 중 두 항목에서 이 모델을 이름으로 명시한다 — Expert는 "Thinks hard · Grok 4.7"로, Heavy는 "Team of Experts · Grok 4.7"로 표시되며 — 반면 앱이 기본으로 열리는 모드인 Fast는 "Quick responses"로만 설명되고 Auto는 Fast와 Expert 중에서 선택하는 것으로 설명된다. 네 항목은 Auto, Fast, Expert, Heavy이다. Build는 그중 하나가 아니다: Grok Build는 자체 페이지에 있는 별도의 터미널 제품이며, 그 페이지가 바로 이 모델의 Build 귀속이 실제로 나오는 곳이다 — 방문자에게 "install now and start building with Grok 4.7"라고 안내한다. 따라서 10월 1일에 유포되고 10월 2일에 반복된 주장 — 즉 Grok 4.7이 이제 "Fast, Expert, Build and Heavy" 전반의 기본 모델이라는 주장 — 은 앱이 제공하지 않는 모드를 나열하고 앱이 기본으로 여는 모드를 빠뜨리며, 이는 벤더의 해석이 아니라 트래커들의 해석이다. 왜냐하면 SpaceXAI는 이 롤아웃에 관해 전혀 아무것도 게시하지 않았기 때문이다. 그에 상응하는 Grok 4.5 단계는 자체 블로그 글을 받았지만, 이번 단계는 바뀌지 않은 뉴스 페이지 밑에서 조용히 바뀐 제품을 두고 있다.

현재 상황

Grok 4.7은 2026년 9월 21일에 출시되었으며, 백만 입력 토큰당 2달러, 백만 출력 토큰당 6달러에 50만 토큰 컨텍스트 윈도우와 2026년 5월 지식 컷오프를 갖췄습니다. 이후 11일 동안 바뀐 것은 모델 자체가 아니라 제공처 지형입니다. Amazon Bedrock은 9월 28일에 이를 추가했고, Grok 자체의 웹 및 모바일 앱 내부에서는 10월 1일부터 순차 배포가 시작되어 10월 2일까지도 여전히 배포 중이었으며, 이제 OrcaRouter에 SpaceXAI 자체 요율로 마크업 없이 등재되어 있습니다. 독립 점수들은 출시 당일 나왔지만 여전히 서로 엇갈립니다. Artificial Analysis의 v4.3.2 Intelligence Index에서 xhigh 노력 수준으로 46점으로, Grok 4.6보다 2점 높아 SpaceXAI를 해당 지수의 상위 4개 연구소에 올려놓기에 충분했습니다. Grok Build 하네스의 Coding Agent Index에서 56점으로 Grok 4.6보다 9점 높고, GPT-5.6 Sol보다 앞선 네이티브 하네스 모델 중 4위입니다. 그리고 AA-Briefcase에서 Elo 1,657로 Grok 4.6보다 111점 높고, 세 개의 Anthropic 항목 뒤에서 4위이며, 작업당 비용은 Claude Opus 5의 약 절반입니다. 공급업체의 출시 표에 있는 모든 벤치마크는 공급업체 자체 측정치이며 재현되지 않았습니다. 단 하나의 예외가 있습니다. Artificial Analysis 자체의 AA-Briefcase 보드는 동일한 1,657을 게시하고 있으며, 공급업체는 이후 자체 Terminal-Bench 항목을 38.0%에서 37.6%로 하향 수정했습니다. 코딩 및 지식 노동의 향상은 실제이며 출력 토큰 비용이 듭니다. Index 실행당 2억 4천만 토큰으로 중앙값 9,400만 토큰보다 많고, AA의 공개 실사 시나리오에서 예시 덱 세트당 약 8달러로 4.40달러보다 높습니다. 이 수치가 이번 출시가 저렴한지를 결정합니다. 두 달 동안 떠돌던 약 2.1조 매개변수 수치는 여전히 공급업체 출처가 없으며, 조기 포기 관련 유의점은 직접적으로 다뤄지지 않았습니다. 다만 Grok Build 하네스에서 Terminal-Bench가 18%에서 33%로 뛴 것은 수정이 효과가 있었다는 첫 외부 증거입니다. 이 글에서 독자들에게 주시하라고 한 두 신호가 모두 포착되었습니다. 공급업체의 모델 목록에 가격과 컨텍스트 윈도우가 붙은 grok-4.7이 추가되었고, 이곳의 카탈로그도 동일한 요율로 이를 등재합니다. 따라서 가장 유리한 선택은 9월보다 더 단순합니다. $2/$6의 Grok 4.6이 답이었고, $2/$6의 Grok 4.7은 더 새로운 모델 ID, 더 나은 코딩 및 지식 노동 점수, 훨씬 더 큰 토큰 청구서, 그리고 두 가지 가장 어려운 모드에서 이 모델을 이름으로 내세우는 소비자 앱을 갖춘 같은 답입니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트