Grok 4.5 해설 영상의 히어로 타이틀 카드: 헤드라인 'Grok 4.5란 무엇인가?'를 서브헤드 '최상위 점수가 아닌 토큰 경제성을 내세운 V9 플래그십' 위에 배치하고, 이어서 세 개의 카드에 '컨텍스트 - 500K 토큰', '1M당 정가 - $2.00 / $6.00', 'AA Intelligence - 39'를 적으며, 하단 푸터 줄에 'Grok 4.5는 2026년 7월 8일에 출시되었습니다. 가격은 xAI 문서 기준, AA 수치는 Artificial Analysis Intelligence Index v4.3.2 기준입니다.'를 넣고, 오른쪽 아래 모서리에 OrcaRouter 로고를 둡니다.
Guides & Insights

Grok 4.5는 무엇인가? 최고 점수 대신 토큰 경제성을 내세운 V9 플래그십

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok 4.5는 해당 공급업체 — 현재 SpaceXAI 브랜드로 제품을 출시하고 마케팅하는 회사 — 가 2026년 7월 8일에 공개한 1조 5,000억 개 파라미터 규모의 전문가 혼합(MoE) 추론 모델입니다. 텍스트와 이미지를 입력받아 텍스트를 반환하며, 500,000토큰 컨텍스트 창을 갖추고, 100만 입력 토큰당 $2.00, 100만 출력 토큰당 $6.00로 책정되어 있습니다. 이 모델은 "완료된 작업당 토큰"을 출시 슬라이드 전면에 내세운 모델이며, 이후 이 연구소가 두 개의 더 새로운 플래그십을 그 위에 구축한 모델이기도 합니다.

그 마지막 절이 바로 이 페이지를 써야 하는 전체 이유다. "Grok 4.5"를 검색하면 7월의 출시 보도가 나온다: Cursor 파트너십, "Opus-class"라는 표현, 초당 80토큰 주장. 하지만 9월 말에 개발자가 실제로 품고 있는 질문, 즉 Grok 4.6과 Grok 4.7이 같은 정가에 존재하는 상황에서 Grok 4.5가 여전히 무언가에 연결해 둘 가치가 있는지에 대한 명쾌한 답은 나오지 않는다. 그래서 이 페이지는 뉴스 기사가 아니라 참조 항목이다: 이 모델이 무엇인지, 어디에 위치하는지, 측정 가능하게 무엇을 잘하는지, 측정 가능하게 무엇을 못하는지, 그리고 누가 다른 것을 골라야 하는지. 여기서 어떤 것도 출시로 규정되지 않는다, 왜냐하면 출시가 아니기 때문이다.

출처에 관하여, 이런 페이지에서는 평소보다 더 중요하므로: 아래의 모든 수치는 출처가 어디인지에 따라 표시되어 있습니다. xAI가 자사 모델에 대해 발표한 수치는 공급업체 보고로 표시됩니다. Artificial Analysis의 수치는 독립적인 측정치이며, 2026년 9월 23일 모델 페이지에서 직접 읽은 것입니다. 어떤 수치가 1차 출처에서 확인될 수 없는 경우, 이 페이지는 추정하는 대신 그렇게 명시합니다.

Grok 4.5가 자체 제품군에서 차지하는 위치 — 그리고 그것은 최상위가 아니다

Grok 4.5 관련 보도에서 단연 가장 흔한 실수는 이를 플래그십으로 다루는 것입니다. 약 5주 동안은 그랬습니다. 그 이후 xAI는 2026년 8월 12일에 Grok 4.6을, 9월 초에 Grok 4.7을 출시했으며, 두 모델 모두 여전히 백만 토큰당 $2.00와 $6.00의 가격이 책정되어 있습니다. Grok 4.5는 이제 스택의 중간에 위치합니다: 저렴한 등급보다 성능이 뛰어나고, 최전선보다 두 세대 뒤처져 있으며, — 중요한 부분인데 — 현재 Grok 라인업에서 캐시 입력 요금이 후속 모델보다 저렴한 유일한 모델입니다. xAI 자체 가격표에 따르면, Grok 4.5는 백만 토큰당 $0.30에 캐시되고, Grok 4.6과 Grok 4.7은 모두 $0.50에 캐시됩니다.

다음은 공급업체의 가격 문서에 현재 나열된 라인업이며, 모든 수치는 백만 토큰당이고 모두 공급업체가 공개한 값입니다:

• Grok 4.20(세 가지 변형: 멀티 에이전트, 추론, 비추론) — 1M 컨텍스트, 입력 $1.25 / 출력 $2.50, 캐시 $0.20, 2026년 3월 31일 출시

• Grok 4.3 — 100만 컨텍스트, 입력 $1.25 / 출력 $2.50, 캐시 $0.20, 배치 할인까지; Grok 컨텍스트 100만 토큰을 얻는 가장 저렴한 방법

• Grok 4.5 — 500K 컨텍스트, 입력 $2.00 / 출력 $6.00, 캐시 $0.30, 2026년 7월 8일 출시

• Grok 4.6 — 500K 컨텍스트, $2.00 입력 / $6.00 출력, $0.50 캐시, 2026년 8월 12일 출시

• Grok 4.7 — 500K 컨텍스트, 입력 $2.00 / 출력 $6.00, 캐시 $0.50, 2026년 9월 초 출시

• Grok Build 0.1 — 256K 컨텍스트, 입력 $1.00 / 출력 $2.00, 범용 모델이 아닌 코딩 전문 모델

그 목록에서 두 가지 사실이 나온다. 첫째, Grok 4.5는 플래그십이 아니게 되었을 때 가격 인하를 받지 않았다 — 플래그십 가격을 유지했으며, 이는 같은 돈으로 Grok 4.6이 이제 확실히 더 나은 가치라는 뜻이다. 단, 더 저렴한 캐시 요금을 특별히 원하거나 4.5 스냅샷에 묶여 있는 경우는 제외한다. 둘째, Grok 4.5는 Grok 4.3 및 4.20 패밀리의 절반 컨텍스트를 두 배의 입력 가격에 제공한다. V9 파운데이션이 그 이유다: 1.5조 개 매개변수, Grok 4.3 크기의 약 세 배이며, 더 큰 기본 모델이 윈도우를 희생해 성능을 얻은 것이다.

예산 안에서 긴 컨텍스트가 정말로 필요하다면, 이 제품군 안에서 정직한 답은 Grok 4.3이고 Grok 4.5가 아닙니다. 그 절충 — 성능 대 컨텍스트 창 — 은 Grok 라인을 정의하는 결정이며, 더 새로운 숫자가 모든 면에서 더 낫다고 가장하기보다는 이를 분명히 말할 가치가 있습니다.

사양 시트

Screenshot of the xAI developer documentation model page for grok-4.5, showing the model identifier and aliases grok-4.5-latest and grok-build-latest, the description 'intelligent coding model for agentic software, engineering, and workflow tasks', an At a glance block giving modalities 'Text, Image to Text' and a 500,000-token context window, capability rows for function calling, structured outputs and reasoning, and the pricing rows $2.00 input, $0.30 cached input and $6.00 output per million tokens, above a collapsed 'Higher context pricing' note about requests exceeding the 200K context window.

이것들은 xAI가 자체 모델 페이지에 게시하는 사양이며, 제3자 추정치가 아닙니다:

• 모델 식별자 — grok-4.5, 별칭 grok-4.5-latestgrok-build-latest

• 모달리티 — 텍스트와 이미지 입력, 텍스트 출력. 이미지는 입력으로 허용되며, 모델이 이미지를 생성하지는 않습니다

• 컨텍스트 윈도우 — 500,000 토큰으로, 500K 입력에 별도의 출력 허용량이 추가되는 방식이 아니라 프롬프트와 응답이 함께 공유합니다

• 라이선스 — 독점적입니다. 공개 가중치도, 다운로드 가능한 체크포인트도 없습니다. Grok 4.5는 API를 통하거나 공급업체 자체 제품을 통해 접근할 수 있습니다.

• 정가 — 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00, 캐시된 입력 $0.30

• 롱 컨텍스트 가격 — 프롬프트 토큰이 200,000개 이상일 때 요율은 입력 $4.00 / 출력 $12.00 / 캐시 $0.60으로 올라가며, 더 높은 요율은 요청 내 모든 토큰에 적용됩니다. 임계값을 초과한 토큰에만 적용되는 것이 아닙니다. 이는 페이지에서 놓치면 가장 비용이 많이 드는 단 하나의 세부 사항입니다

• 추론 제어 — 네 단계, 낮음, 중간, 높음매우 높음, 기본값은 높음. 추론은 완전히 끌 수 없으며, 추론 토큰은 출력 토큰으로 청구됩니다

• 도구 및 형식 지원 — 함수 호출과 구조화된 출력은 네이티브로 지원됩니다. 서버 측 검색 도구는 토큰 사용량에 추가로 청구됩니다; 공급업체의 모델 페이지에서 현재 호출당 요금을 확인할 수 없었고, 그것들이 존재한다는 것만 확인했습니다.

• 요청 제한 — 초당 150회 요청 및 분당 5천만 토큰

• Batch API — Grok 4.3과 달리 Grok 4.5에서는 지원되지 않습니다

• 서비스 제공 리전 — 출시 시점에는 us-east-1 및 us-west-2. 유럽 제공은 첫날에는 명시적으로 제공되지 않았으며, 공급업체는 2026년 7월 중순으로 예상된다고 설명했습니다. 우리는 서비스가 개시된 정확한 날짜를 확인해 주는 이후의 1차 출처 진술을 찾지 못했으므로, 여기서는 EU 일정을 미확인으로 간주하십시오.

조용히 넘기기보다 기록해 둘 만한 불일치가 하나 있습니다: OrcaRouter 자체 카탈로그의 grok/grok-4.5 항목은 캐시 읽기 요율을 백만당 $0.50로 표시하는데, 이는 벤더의 가격표가 Grok 4.5에 대해 표시하는 $0.30이 아니라 xAI가 Grok 4.6과 Grok 4.7에 부과하는 요금과 일치합니다. 가격에 관한 권위는 벤더의 문서에 있습니다. 우리 페이지는 후속 모델의 캐시 요율을 싣고 있는 것으로 보이며, 여기서 조용히 반복되기보다 문제로 표시되었습니다.

Grok 4.5가 측정 가능할 정도로 잘하는 것

출시 당시의 대표 주장은 토큰 경제성이었는데, 이는 출시 페이지에서 점수만 제시된 것이 아니라 그 뒤에 메커니즘이 존재하는 유일한 주장이다. SWE-bench Pro에서 xAI는 Grok 4.5가 해결된 작업당 평균 15,954개의 출력 토큰을 사용하는 반면, 최대 노력으로 실행되는 Claude Opus 4.8은 67,020개를 사용한다고 보고한다 — 같은 작업을 끝내는 데 약 4.2배 더 적은 토큰이다. 해결된 작업당 출력 토큰이 더 적다는 것은 더 저렴한 모델과 더 저렴하고 실시간 기준으로 더 빠른 모델의 차이다. 왜냐하면 출력 토큰이야말로 당신이 기다리는 것이기 때문이다. 벤더가 보고했고, 벤더 자체 하네스에서 측정되었으며, 누구도 독립적으로 재현하지 않았다 — 그러나 이것은 체리피킹한 백분율이 아니라 구조적인 주장이다.

모델과 함께 공개되어 전반적으로 벤더가 보고한 수치인 벤더의 벤치마크 표는, 동일한 모델들을 기준으로 보면 다음과 같습니다:

• DeepSWE 1.0 — Grok 4.5 62.0%, Claude Fable 5의 66.1%와 GPT-5.5의 64.31%에는 뒤지지만, Claude Opus 4.8의 55.75%보다는 앞선다

• SWE Marathon, 해결률 — Grok 4.5 29.0%, Claude Opus 4.8의 26.0%와 Claude Fable 5의 24.0%를 앞섰습니다. 이는 Grok 4.5가 해당 분야를 선도한 유일한 코딩 벤치마크입니다.

• Terminal-Bench 2.1 — Grok 4.5 83.3%, Claude Fable 5의 84.3%, GPT-5.5의 83.4%와 사실상 동등한 수준이며, Claude Opus 4.8의 78.9%를 앞선다

• DeepSWE 1.1 — Grok 4.5 53%, Claude Fable 5의 70%와 GPT-5.5의 67%에 뒤처짐

• SWE-bench Pro — Grok 4.5 64.7%, Claude Fable 5의 80.4%와 Claude Opus 4.8의 69.2%에 뒤처짐

솔직히 해석하자면, Grok 4.5는 장기적 과제 해결과 과제 완료의 경제성에서는 이기고, 더 어려운 단일 시도 코딩 벤치마크에서는 진다. 이 모델은 에이전트 루프에는 좋고, 단일 시도의 어려운 문제에는 평범하다 — 그리고 그 구분은 토큰 효율 수치가 예측하는 바로 그대로다.

A single-column scoreboard card for Grok 4.5 titled 'Grok 4.5 - the scoreboard' with six rows reading: AA Intelligence Index 39 (#52 of 212); Output speed 55.1 tok/s (#126 of 212); Time to first token 10.94 s; Context window 500K tokens; Price per 1M $2.00 / $6.00, $0.30 cached; SWE-bench Pro 64.7% (vendor). Footer: 'Price and spec rows per xAI docs; AA Index and speed per Artificial Analysis Intelligence Index v4.3.2; SWE-bench Pro vendor-reported.'

독립적인 그림은 더 빈약하며, 바로 이 지점에서 이 페이지는 신중해야 한다. Artificial Analysis는 현재 Grok 4.5 (high)를 Intelligence Index 점수 39, 212개 모델 중 #52위, 지수 버전 v4.3.2로 표시한다. 이는 비교 가능한 모델의 중앙값 25보다 높지만, 선두 근처는 아니다. 7월 보도에서 이 모델에 대해 54 또는 56 점이 인용된 것을 보았다면, 이를 39와 비교하지 마라. Artificial Analysis는 출시 이후 지수를 개정했으며, 두 숫자는 서로 다른 개정판에서 나온 것이다. 이것이 바로 벤치마크 표를 신뢰할 수 없게 만드는 오래된 수치 비교이며, 이 페이지가 점수와 함께 지수 버전을 명시하는 이유이다.

Grok 4.5가 측정 가능할 정도로 잘 못하는 것

Artificial Analysis는 출력 속도가 초당 55.1토큰이라고 보고하며, 212개 모델 중 126위로 중앙값 74보다 낮습니다 — 출시 당시 xAI가 제시한 초당 80토큰과는 거리가 멀고, 현재 가장 빠른 모델들이 기록하는 초당 약 340토큰과는 더욱 멀리 떨어져 있습니다. 또한 첫 토큰까지 걸리는 시간은 10.94초로 중앙값 3.86초에 비해 느립니다. 이 두 수치는 기본적으로 높음으로 설정되며 끌 수 없는 추론 모델의 실제 비용을 함께 보여줍니다: 기다려야 하고, 그러고 나서야 느리게 말합니다. 추론 수준을 기본값으로 두면 Grok 4.5는 키에 있는 가장 느린 모델처럼 느껴질 것입니다.

측정된 부정적 요소 세 가지를 더, 의사결정에 영향을 미쳐야 하는 정도 순으로:

• Artificial Analysis는 Grok 4.5를 더 이상 지원되지 않음(deprecated)으로 표시했으며, 해당 모델에 대해서는 기본 10,000토큰 입력 워크로드만 계속 벤치마킹한다고 밝혔습니다. 이는 제3자가 당신이 고려 중인 모델을 더 이상 완전하게 측정하지 않고 있으며, 대신 Grok 4.6을 권장한다고 말하는 것입니다. 리더보드에서의 deprecated는 API에서 사용할 수 없다는 뜻이 아니라, 독립적인 증거 기반이 고정되었다는 뜻입니다.

• xAI 자체 표에 따르면, 그것은 어려운 단일 샷 코딩에 가장 가까운 두 벤치마크인 DeepSWE 1.1과 SWE-bench Pro 모두에서 Claude Fable 5와 GPT-5.5에게 진다.

• 입력 가격은 두 배인데 컨텍스트는 Grok 4.3의 절반이고, 배치 API는 아예 없습니다. 워크로드가 장문 문서 처리나 오프라인 배치 추론이라면, Grok 4.5는 같은 제품군 안에서도 잘못된 모델입니다

환각과 보정에 관해, 이 페이지는 현재의 독립적인 수치를 확인할 수 없었습니다. 7월 보도에서는 환각률이 약 54%로 유포되었지만, 우리가 확인한 Artificial Analysis 모델 페이지에서는 그 수치를 검증할 수 없었고, 공급업체의 페이지에도 나타나지 않습니다. 출처를 확인할 수 없는 수치를 반복하기보다, 여기서는 측정되지 않은 것으로 기록합니다.

누가 Grok 4.5를 선택해야 하고, 누가 다른 것을 선택해야 할까요?

Grok 4.5를 선택하세요 완료된 작업당 비용이 토큰당 비용보다 더 중요한 에이전트 루프를 실행 중이고, V9의 토큰 경제 동작이 귀하의 워크로드에서 유지된다는 것을 이미 측정한 경우입니다. 또한 크고 안정적이며 반복적으로 적중되는 프리픽스에 대해 $0.30의 캐시 입력 요율을 제공하는 Grok 패밀리 스냅샷이 필요할 때도 올바른 선택입니다. 이 캐시 요율은 Grok 4.6과 Grok 4.7이 부과하는 요율보다 실제로 더 저렴하며, 캐시가 많은 워크로드에서는 그 차이가 두 세대 분량의 역량을 능가할 수 있습니다.

거의 모든 다른 용도에는 대신 Grok 4.6 또는 Grok 4.7을 선택하세요. 동일한 정가, 동일한 500K 윈도, 더 최신 학습, 더 나은 독립 평가 점수, 그리고 Artificial Analysis 자체의 권장 사항까지 갖췄습니다. "최고의 Grok을 원한다"는 말에서 오늘 정답이 4.5인 경우는 없습니다.

컨텍스트가 제약이라면 Grok 4.3을 선택하세요. 100만 토큰에 $1.25 및 $2.50이며, Grok 4.5에는 없는 배치 할인도 제공됩니다. 장문 문서 RAG와 전체 저장소 분석은 여전히 이 모델의 영역입니다.

제품군 밖에서 다른 것을 고르세요 과제당 가격이 아니라 최고 점수를 기준으로 최적화하고 있다면 — Claude Fable 5는 xAI 자체 비교표의 모든 코딩 벤치마크에서 1위이고, GPT-5.5는 DeepSWE 1.0과 1.1에서 Grok 4.5보다 앞서 있습니다. 오픈 웨이트를 원하고 더 작은 모델을 감수할 수 있다면, 그것은 완전히 다른 구매이며 어떤 Grok 모델도 그 자리를 두고 경쟁하지 않습니다.

두 번째 계약 없이 Grok 4.5 호출하기

Grok 4.5가 xAI의 정가로 OrcaRouter에서 서비스 중입니다. 제공사 요율을 마크업 없이 그대로 전달하기에, 위의 $2.00과 $6.00이 바로 지불하시는 금액이며, 공급사 가격 변경은 그쪽에 적용되는 같은 날 우리 쪽에도 반영됩니다. 이 점은 이 특정 모델에서 평소보다 더 중요합니다. 대부분의 독자에게 놓인 선택은 "Grok 4.5 아니면 아무것도 아님"이 아니라 "Grok 4.5냐, Grok 4.6이냐, Grok 4.3이냐"이고, 한 제품군의 세 모델을 비교하는 일이야말로200개 이상의 모델을 아우르는 단일 엔드포인트가 값싸게 만들어 주는 바로 그것이기 때문입니다. 키 하나, 두 번째 계약 없음, 그리고 통합이 아니라 문자열 변경만으로 끝나는 A/B 테스트.

여기서 페일오버 논거는 유난히 구체적입니다. Grok 4.5는 여전히 라우팅 가능하지만, 더 이상 독립 추적 기관들이 전면적으로 벤치마킹하지도 않고 더 이상 공급업체의 플래그십도 아닙니다 — 유일한 경로로 삼기보다는 폴백 체인에 두고 싶을 법한 모델이죠. 공급자 간 자동 페일오버는, 생태계가 이미 지나가기 시작한 스냅샷에 프로덕션 경로를 걸지 않고도 이 모델이 잘하는 일에 계속 활용할 수 있게 해주는 메커니즘입니다.

이 페이지가 하지 않을 일은 선택이 명백한 척하는 것입니다. Grok 4.5는 특정 강점을 지닌 좋은 모델이지만, 같은 돈으로 이제 더 새로운 모델을 살 수 있는 제품군에 속해 있습니다. 오늘 처음 시작한다면, 솔직한 권장은 Grok 4.6입니다. 이미 에이전트 루프에서 Grok 4.5를 실행 중이고, 예산으로 잡아 둔 토큰 수 안에서 작업을 끝내고 있다면, 솔직한 권장은 아무것도 바꾸지 말고 한 분기 뒤에 다시 측정하라는 것입니다.

Screenshot of the OrcaRouter model page for Grok 4.5 (grok/grok-4.5), showing the SpaceXAI provider label, the Featured badge, capability tags for Vision, Tools, JSON and Reasoning, the 500K-token context window, the $2.00 per million input and $6.00 per million output pricing rows, and the benchmark table sourced from Artificial Analysis.

Grok 4.5는 오늘 OrcaRouter에서 라우팅할 수 있으며, Grok 4.6, Grok 4.7, Grok 4.3도 마찬가지입니다. OrcaRouter는 제공업체의 정가를 마크업 없이 그대로 전달하므로, 공급업체 가격 변경이 그쪽에 반영되는 바로 그날 우리 쪽에도 반영되며, 두 Grok 모델 간에 워크로드를 옮기는 것은 두 번째 계약이 아니라 문자열 변경입니다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트