
Grok 4.6 출시일: 8월 12일에 동일한 $2/$6 가격으로 출시되었습니다.
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0340지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2134지능69코딩
2026년 8월 12일 수요일, 이 페이지가 중심으로 삼았던 질문은 더 이상 질문이 아니게 되었습니다.Grok 4.6이 출시되었기 때문입니다. 2026년 2월 이 스타트업을 인수해 7월에 리브랜딩한 후 지금까지 Grok을 운영해 온 SpaceXAI는 이 모델을 동일한 $2/$6 가격으로,Grok 4.5와 같은 V9 기반으로, 동일한 500K 토큰 컨텍스트 창으로 출시했으며, 머스크는 X에서 이를 "대박"이라고 불렀습니다. 이번 출시로 이 페이지의 이전 버전이 추적하던 두 가지 질문이 해결되었습니다. 모델이 존재한다는 것과, 이것은 규모 확장이 아니라 동일한 규모의 사후 학습 리프레시라는 점입니다. 해결되지 않은 유일한 것은 공식적으로 공개되지 않은 파라미터 수입니다.
한 주 전에는 솔직한 헤드라인이 "모델이 아직 출시되지 않았다"는 것이었다. 머스크가 7월 27일에 설정한 "8월 7일경" 목표는 미뤄졌고, 동일한 규모로 읽히는 것은 여전히 예측에 불과했다. 이 페이지는 그 모델을 규모 변경 없는 새로고침(refresh)으로 보는 것이 가장 적합하며, 규모 변경 없는 새로고침은 대개 가격 인상 없이 출시된다고 주장했다. 출시일은 그 예측의 비즈니스 측면을 정확히 확인해 주었다 — 토큰 100만 개당 $2/$6/$0.50, Grok 4.5와 동일 — 그리고 이제 첫 독립 측정 결과가 나왔다. 아래는 출시된 내용, 지금까지의 수치가 말해주는 것, 그리고 여전히 공급업체가 주장하는 사항이다.
8월 12일에 무엇이 출시되었나요?
Grok 4.6이 SpaceXAI API에서 모델 ID grok-4.6으로, 그리고 Grok Build, Cursor, Grok Bot 앱에서 제공됩니다. Cursor와 Grok Build 사용자는 첫 주 동안 포함 사용량이 두 배로 제공됩니다. 이 모델은 확장된 chain-of-thought를 갖춘 추론 모델로, 텍스트와 이미지 입력을 받아 텍스트를 생성하며, 기본값보다 높은 새로운 xhigh 추론 노력 설정을 추가합니다.
이 API는 OpenAI 호환 엔드포인트를 유지하면서 서버 측에 웹 검색, X 검색, 코드 실행이라는 세 가지 도구를 추가합니다. 이미 OpenAI 호환 엔드포인트를 통해 Grok 4.5와 통신 중이라면, 전환은 클라이언트 재작성이 아닌 모델 문자열 변경만으로 충분하다는 뜻입니다.
이 페이지가 예측한 것 — 그리고 실제로 일어난 것
이전 버전의 주장은 머스크의 "SFT & RL이 크게 개선된 1.5T 모델"이라는 말이 동일한 규모의 리프레시를 가리키고, 가격은 유지될 것이라는 것이었다. 이번 출시는 이 사업적 예측의 두 측면 모두를 확인시켜 주었다:
• 가격: 백만 토큰당 $2 / $6 / $0.50(캐시 적중) — Grok 4.5와 동일. "가격 변동 없음" 예측이 적중했다.
• 컨텍스트: 500K 토큰, Grok 4.5와 동일.
• 규모: 아직 공식적으로 공개되지 않았습니다. 모델 카드에는 매개변수 수가 나오지 않아, 머스크의 1.5T 수치는 검증된 사양이 아닌 현재로서는 최선의 주장일 뿐입니다. 초기 보도에서 돌았던 2T 수치는 Grok 4.7의 2.1T를 잘못 인용한 것입니다.

독립 수치 — Artificial Analysis Intelligence Index 기준 61
첫 번째 서드파티 측정 결과가 나왔으며, 좋은 결과입니다. Artificial Analysis는 Grok 4.6을 Intelligence Index에서 61점으로 평가했습니다 — GPT-5.6 Sol의 최대 추론 구성과 동률이며, Claude Fable 5(62)보다 1점 뒤지고, Claude Opus 5(63)보다 2점 뒤지며, Kimi K3(60)보다 앞섭니다. 이는 Grok 4.5의 56보다 5점 오른 것으로, 사후 훈련 개선으로는 큰 상승입니다.
이 수치에는 두 가지 주의할 점이 있다. 인덱스는 종합 지표라서 개별 차원들은 더 엇갈린다. 그리고 Grok 4.6은 시작이 느리다. 첫 토큰 생성까지 42초가 걸리는데, 같은 가격대의 중앙값은 약 2.9초다. 초당 출력 토큰 수는 약 68개로 클래스 평균보다 느리다. 장기 실행 에이전트에게는 그저 잡음일 뿐이지만, 대화형 채팅에서는 전체 경험을 좌우한다.
지능-비용 파레토 프론티어에서의 평가는 매우 유리합니다. 작업당 약 0.84달러로, 일반적인 AA-Briefcase 워크로드를 약 53턴과 약 0.5B 입력 토큰으로 완료하는 반면, Claude Opus 5 Max는 약 103턴과 약 2B 입력 토큰이 필요합니다. 이는 단순히 저렴한 모델이 아니라, 진정한 프론티어 가성비 모델입니다.
여전히 공급업체가 명시한 것은 무엇입니까?
SpaceXAI의 출시 주장 — "GPT-5.6 Sol 및 Claude Fable 5와 견줄 만한 지능," 나열된 모든 평가에서 Grok 4.5보다 개선, "더 긴 보충 훈련 실행, 더 강력한 엔지니어링 데이터, 확장된 강화 학습"에 기인 — 은 공급업체의 주장일 뿐 아직 독립적으로 검증되지 않았습니다. 출시 벤치마크 표(CursorBench, FrontierCode, APEX-Agents, Terminal-Bench, 그리고 GDPval-AA v2에서 홍보된 1,753 Elo)는 xAI가 보고한 것으로, 해당 수치 중 어느 것도 해당 모델을 판매하지 않는 연구소에서 재현되지 않았습니다.
첫 번째 서드파티 판독 결과가 (예비) 나왔습니다.
지금까지의 유일한 독립 아레나 결과는 예비적이지만 실제다. LMArena는 Grok 4.6(grok-4.6-high)을 #43으로 텍스트 전체 리더보드에 2,448표 기준 1,464 Elo로 등재했다 — 예비로 표시되었고, Grok 4.5의 데뷔 점수 1,468보다 4점 낮다. 표본이 너무 작아 LMArena가 추적하는 프론티어 테이블에는 맞지 않으며, 2주간 지속된 점수가 필요하다.
Agent 라이브 세션 리더보드는 아직 게시되지 않았습니다. 게시된다면, 사전에 최적화할 수 없는 첫 번째 읽기가 될 것입니다.

가격 계산
$2/$6 기준으로, Grok 4.6은 현재 세대 프런티어 API 중 가장 저렴합니다. $5/$30인 GPT-5.6 Sol과 비교하면 입력은 60%, 출력은 80% 더 저렴합니다. 출력에서의 격차가 더 크기 때문에, "절반 가격"이라는 마케팅 표현은 출력 중심 코딩 워크로드에서의 절감 효과를 과소평가합니다.
세부 사항: 200K 입력 토큰을 초과하는 요청은 $4 / $12 / $1 등급으로 단계가 올라가며, 더 빠른 변형 버전은 두 배의 비용이 듭니다. 전환의 경우 산술적으로 거의 차이가 없습니다. Grok 4.5와 Grok 4.6은 가격과 컨텍스트가 동일하므로, 두 모델 간 전환은 예산 결정이 아닌 구성 변경일 뿐입니다.
OrcaRouter가 공급업체 정가를 0% 마크업으로 그대로 전달하기 때문에, grok-4.6 엔드포인트의 $2/$6는 SpaceXAI 자체 가격이지 재판매 요금이 아닙니다. 공급업체 가격 인하는 당일 바로 여기에 반영되며, 두 번째 공급업체로의 장애 조치는 조달 절차가 아닌 라우팅 규칙입니다.
Grok 4.7과 Grok 5는 여전히 앞서 있습니다.
Grok 4.7은 다음 단계이며, 머스크의 설명은 변함없다: "2.1T 모델"로, Grok 4.6보다 "모든 면에서 낫지만, 서빙 속도가 약간 느리다." 8월 5일에 그는 3~4주 후라고 밝혔으며, 이는 8월 말이나 9월 초에 해당한다. 그 일정은 머스크가 언급한 것이고, 말할 때마다 계속 늦춰져 왔으므로 방향성 정도로만 간주하라.
Grok 5는 연말에 있으며 — 8월 4일 실적 발표에 따르면 — "사실상 SpaceX가 지금까지 생성한 모든 데이터"로 훈련되었습니다.
다음에 확인할 사항
네 가지 사항이 상황을 명확히 해줄 것이며, 각각은 현재 미정 상태로 보입니다.
• LMArena Agent 리더보드, 8월 13일 기준 미공개.
• 모델을 판매하지 않는 제3자가 재현한 코딩 및 에이전트 수치 — DeepSWE, CursorBench, APEX-Agents
• 더 빠른 변형이 널리 보급되었을 때의 실제 가격과 지연 시간.
지금까지 각 특정 날짜가 며칠씩 늦춰졌다는 점을 고려할 때, Grok 4.7의 8월 말 타임라인이 유지될지 여부.
그리고 결정에 실제로 중요한 것은 바로 당신 자신의 작업량입니다. 리더보드 순위는 당신의 과제에 대한 가설일 뿐, 그에 대한 결과가 아닙니다.
자주 묻는 질문
Grok 4.6은 실제로 언제 출시되었나요?2026년 8월 12일, SpaceXAI API와 Grok Build, Cursor, 그리고 Grok Bot 앱에서 출시되었습니다. 머스크의 7월 27일 "8월 7일경" 목표는 5일 미뤄졌으며, 8월 4일 실적 발표에서의 "다음 주"라는 표현이 정확한 시기였습니다.
Grok 4.6의 가격은 얼마인가요? 토큰 100만 개당 $2 / $6 / $0.50 — Grok 4.5와 동일하며 GPT-5.6 Sol의 $5/$30보다 훨씬 낮습니다. 입력 토큰이 200K를 초과하면 $4 / $12 / $1로 인상되며, 더 빠른 변형은 두 배의 비용이 듭니다.
Grok 4.6은 2T 모델인가요? 파라미터 수는 공개되지 않았습니다. 머스크의 1.5T 수치가 현재 가장 신뢰할 만한(검증되지 않은) 주장으로 남아 있으며, 유포된 2T 수치는 Grok 4.7의 2.1T가 4.6으로 잘못 알려진 것입니다.
Grok 4.6은 GPT-5.6 Sol만큼 좋은가? Artificial Analysis Intelligence Index 기준으로 두 모델은 61점(최대 추론 구성)으로 동률입니다. 공급업체는 해당 모델이 GPT-5.6 Sol 및 Claude Fable 5와 비슷한 수준이라고 주장합니다. 첫 토큰 생성 시간(time-to-first-token)은 현저히 느리지만 가격은 훨씬 저렴하며, 에이전트(agentic) 측면의 이점은 독립적인 검증을 기다리고 있습니다.
이 상황이 당신에게 의미하는 바
실용적인 조치는 이 페이지의 출시 전 버전과 동일합니다. 이미 OpenAI 호환 엔드포인트를 통해 Grok 4.5와 통신하는 코드가 있다면, Grok 4.6은 동일한 가격의 구성 변경입니다. 모델 문자열만 바꾸고 예산 라인은 유지한 채, 빌드가 새롭기 때문에 평가를 다시 실행하세요. 그렇지 않다면, 단일 통과 가격 책정 엔드포인트를 사용하면 프로덕션 경로를 첫 주 벤치마크에 걸지 않고도 새 프런티어 모델로 전환할 수 있습니다. 그 첫 주 벤치마크가 바로 그러한 예비 아레나 수치들입니다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
