Grok 4.5 vs GPT-6 Astra의 히어로 타이틀 카드, 부제 '가격표는 여섯 배, 청구서는 세 배', 통계 카드 '가격표: 1M당 $2.00 / $6.00 vs $10.00 / $50.00', '작업당 비용: $1.04 vs $3.26', '첫 토큰: 10.94초 vs 342.30초', 푸터 '벤더 요금표와 독립 수치는 2026년 9월 23일 기준', 그리고 오른쪽 하단 corner에 OrcaRouter 로고.
Guides & Insights

Grok 4.5 vs GPT-6 Astra: 정가의 6배, 청구서의 3배

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok 4.5GPT-6 Astra를 각자의 요금표에 나란히 놓고 보면 격차는 터무니없어 보인다: 입력 토큰 백만 개당 $2.00 대 $10.00, 출력 백만 개당 $6.00 대 $50.00. 같은 두 모델을 Artificial Analysis의 Intelligence Index에 돌려 보면 격차는 팀이 실제로 논쟁할 수 있는 수준으로 좁혀진다 — 완료된 작업당 $1.04 대 $3.26. 표기가격 배수는 입력에서 5배, 출력에서 8.3배다. 실제 토큰 수로 측정한 청구서 배수는 3배를 조금 넘는다. 그리고 이 두 모델이 가장 크게 차이나는 차원은 그 둘 중 어느 쪽도 아니다. 그것은 첫 토큰을 기다리는 시간이며, 독립 측정치는 10.94초 대 342.30초이다.

그것이 한 문단에 담긴 이 맞대결의 전부이며, 이 페이지가 어느 쪽으로도 대관식이 아닌 이유다. GPT-6 Astra는 명확하고 재현 가능한 격차로 더 지능적인 모델이다. Grok 4.5는 실제로는 존재하지만 가격표가 시사하는 것보다 상당히 더 작은 격차로 더 저렴한 쪽이다. 나머지 모든 것—속도, 토큰 효율성, 컨텍스트, 코딩 벤치마크—은 갈리거나, 무승부이거나, 서로 다른 두 개의 자로 측정되는 것으로 드러난다.

이 둘 중 어느 것도 새로운 모델이 아닙니다

분명히 짚고 넘어갈 만하다. 많은 비교 페이지가 마치 둘 다 지난주에 나온 것처럼 읽히기 때문이다.

xAI는 2026년 7월 8일에 Grok 4.5를 출시했습니다. 이 모델은 1조 5천억 개 파라미터의 V9 파운데이션을 기반으로 하며, 정적인 코드만이 아니라 개발자 세션 데이터로 Cursor와 공동 학습되었는데, 여기서 에이전트형 코딩이라는 명성이 나옵니다. 500,000토큰 컨텍스트 창을 갖추고 있습니다. 자사 모델 목록에는 오늘날에도 여전히 이 모델이 두 후속 모델과 함께 올라 있습니다 — xAI는 이후 Grok 4.6과 Grok 4.7을 출시했습니다 — 따라서 Grok 4.5를 Grok 라인의 최상위가 아니라 $2/$6 등급으로 취급하세요.

OpenAI는 2026년 9월 3일 GPT-6 Astra를 발표했으며, 이후 며칠에 걸쳐 단계적으로 출시되었고, 여전히 OpenAI의 플래그십입니다: 1M 토큰 컨텍스트 윈도(OrcaRouter의 카탈로그에는 입력 1,050,000개와 최대 출력 128,000개가 기재되어 있음), 2026년 4월 30일 지식 컷오프, 그리고 장기적 에이전트 작업 — 컴퓨터 사용, 연구, 과학 및 사이버보안 작업 — 에 확고히 포지셔닝하고 있습니다. OpenAI 자체 설명에 따르면 이는 자사의 "Critical" 사이버보안 임계값을 통과한 첫 모델이며, 이는 또한 관리자가 이를 활성화할 때까지 기업용 액세스가 기본적으로 꺼져 있는 이유이기도 합니다.

둘 다 각 공급업체의 API에서 일반 제공 중입니다. 어느 쪽도 출시를 앞두고 있지 않습니다. 이번 주에 달라진 점은 오직 그중 하나를 둘러싼 패밀리뿐이며, 이는 비교가 아니라 추천을 바꾸는 내용이라 이 글의 마지막에서 다룹니다.

아무도 견적을 내지 않는 등급까지 포함한 요금표

• 입력, 단문 컨텍스트 — Grok 4.5 1M당 $2.00 vs GPT-6 Astra 1M당 $10.00

• 출력, 짧은 컨텍스트 — Grok 4.5 1M당 $6.00 vs GPT-6 Astra 1M당 $50.00

• 캐시된 입력 — Grok 4.5 1M당 $0.30 vs GPT-6 Astra 1M당 $1.00

• 장문맥 입력 — Grok 4.5 1M당 $4.00 대 GPT-6 Astra 1M당 $20.00

• 긴 컨텍스트 출력 — Grok 4.5 1M당 $12.00 vs GPT-6 Astra 1M당 $75.00

• 컨텍스트 윈도우 — Grok 4.5 500,000 토큰 vs GPT-6 Astra 1,000,000 토큰

중요한 조항은 거의 어떤 비교 페이지에도 적혀 있지 않은 조항이다. Grok 4.5에서는 요청의 프롬프트가 200,000토큰에 도달하면 요청 전체가 더 높은 등급의 요율로 재산정된다. xAI의 문서는 그것이 "요청 내 모든 토큰에 대해 더 높은 요율로 청구되며", 기준을 넘어선 토큰만 그런 것이 아니라고 분명히 밝힌다. 따라서 500,000토큰 윈도는 실제로 존재하지만, 그중 대략 상위 60%는 두 배로 청구된다. OpenAI의 Astra 가격 페이지도 동일한 숏/롱 2열 구조를 보여 주지만 전환 지점이 어디인지는 밝히지 않으므로, 대규모로 작업할 때 적용되는 것은 롱 컨텍스트 열이라고 간주하고, 경계는 자신의 청구서로 확인하라.

Screenshot of xAI's own documentation page for Grok 4.5 (docs.x.ai, model id grok-4.5) captured 23 September 2026, showing 'At a glance' with Modalities Text, Image to Text, a Context window of 500,000 and Pricing of $2.00 and $6.00, supported Capabilities of function calling, structured outputs and reasoning, and a Pricing block giving Input Tokens $2.00 / 1M tokens, Cached tokens $0.30 / 1M tokens and Output Tokens $6.00 / 1M tokens, above a 'Higher context pricing' control reading 'We charge different rates for requests which exceed the 200K context window'.

Astra의 수치 위에는 두 가지 서비스 수준 배수가 있습니다: Batch와 Flex는 표준 요율의 절반으로 실행되고, Fast 모드는 두 배로 실행됩니다 — 짧은 컨텍스트에서 입력 $20.00, 출력 $100.00. Grok 4.5는 xAI의 요금표에 배치 등급이 없습니다; 그 레버는 캐시 할인과 2배의 우선 처리입니다.

이 모든 것에 대한 우리의 입장은 의도적으로 지루합니다: OrcaRouter는 공급업체의 정가를 0% 마크업으로 그대로 전달하므로, 위의 두 요금표는 어느 공급업체가 변경하든 그 당일 우리 쪽에서도 그대로 적용되며, 캐시된 토큰은 정가가 아니라 공급업체의 캐시 요율로 청구됩니다. 맞춰야 할 두 번째 숫자는 없습니다.

워크로드에 실제로 드는 비용

여기서는 정가만으로는 판단하기 어렵습니다. 두 모델이 같은 작업을 끝내는 데 사용하는 토큰 수가 같지 않기 때문입니다. 120,000토큰의 저장소 컨텍스트와 25,000토큰의 답변이 필요한 코딩 에이전트 작업을 예로 들어 보겠습니다. Grok 4.5에서는 입력에 $0.24, 출력에 $0.15로 총 $0.39입니다. GPT-6 Astra에서는 $1.20과 $1.25로 총 $2.45입니다. 6.3배 차이입니다.

이제 프롬프트를 장문 컨텍스트 한계선 너머로 밀어붙여 보세요: 입력 300,000토큰, 출력 20,000토큰. Grok 4.5는 $1.20에 $0.24를 더한 $1.44를 청구합니다. GPT-6 Astra는 $6.00에 $1.50를 더한 $7.50를 청구합니다. 격차는 5.2배로 줄어드는데, 두 공급업체 모두 입력 단가를 두 배로 올리고 Astra의 출력 배수는 최상위 티어에서 좁아지기 때문입니다.

그 둘 중 어느 것도 Artificial Analysis가 측정하는 항목이 아니며, Artificial Analysis의 수치가 더 유용한 쪽이다. 전체 Intelligence Index를 돌려보면, 완료된 작업당 평균 비용은 high effort의 Grok 4.5가 $1.04, max effort의 GPT-6 Astra가 $3.26이다. 입력 가격이 5배 차이 나는데도 배수가 3.1배로 떨어지는 이유는 토큰 효율성이다: 인덱스 전반에서 Grok 4.5는 77M개의 출력 토큰을 생성했고 Astra는 60M개를 생성했다. Astra가 더 간결한 모델이라, 가격에서 벌려 놓은 격차의 일부를 좁힌다. 예산 문서에 "5배 더 저렴하다"고 계속 써 왔다면, 청구서에 나타날 숫자는 3배다.

속도는 무승부다. 지연 시간은 아니다.

이것은 우리를 놀라게 한 발견이며, 저렴한 모델이 빠른 모델이라는 직관에 반한다.

Artificial Analysis는 Grok 4.5를 초당 출력 토큰 55개, GPT-6 Astra를 58개로 측정합니다. 이는 동일한 인덱스 리비전에서 5% 차이이며, AA 자체 요약은 두 모델 모두 평균보다 느리다고 설명합니다 — 비교 중앙값은 초당 74토큰입니다. 처리량이 선택 기준이라면, 이 두 모델은 구분되지 않습니다. 억지로 승자를 만들어내기보다 분명히 말하세요: 두 모델 모두에 대해 같은 방식으로 측정된 단 하나의 속도 수치에서는 두 모델이 동등합니다.

지연 시간이 이 둘을 극명하게 갈라놓습니다. AA는 Grok 4.5의 첫 답변 토큰까지 걸리는 시간을 10.94초, 종단 간 20.01초로 측정합니다. GPT-6 Astra는 342.30초, 종단 간 350.91초입니다. 이는 약 31배에 달하며, 동기 요청에서는 스피너가 돌아가는 것과 커피 한 잔 마시고 오는 것의 차이입니다.

그것에 근거해 누구든 예산을 편성하기 전에 솔직한 두 가지 주의점이 있다. 첫째, 그 수치들은 추론을 포함한 값이다 — AA의 "첫 답변 토큰까지 걸리는 시간"은 의도적으로 모델의 사고 시간을 계산에 넣는다 — 따라서 이는 어려운 과제를 설명하는 것이지, 채팅 턴을 설명하는 것이 아니다. 둘째, 이들은 동일한 노력 조건이 아니다: Astra의 공개된 진입 값은 최대 노력이고, Grok 4.5의 값은 high이며, 노력 설정은 바로 이 숫자를 움직이는 다이얼이다. GPT-6 Astra에 대한 OrcaRouter 자체 목록은 실제 트래픽에서 p50 첫 토큰까지 시간 8.31초, p95 10.00초를 보여주는데, 이는 완전히 다른 측정 지점이다 — 벤치마크 과제의 첫 답변 토큰이 아니라 실제 프로덕션 호출의 첫 토큰이다. 이 둘은 비교할 수 없으며, 비교로서 같은 문장에 놓여서도 안 된다.

Two-column comparison scoreboard for Grok 4.5 vs GPT-6 Astra. Grok 4.5 column: AA Index 39 (high), price per 1M $2.00 / $6.00, cached input $0.30, cost per task $1.04, speed 55 tok/s, first answer token 10.94s. GPT-6 Astra column: AA Index 53 (max), price per 1M $10.00 / $50.00, cached input $1.00, cost per task $3.26, speed 58 tok/s, first answer token 342.30s. Footer: 'Index, cost, speed and latency per Artificial Analysis, index v4.3.2, read 23 September 2026. Prices per the vendors' own rate cards.'

코딩 벤치마크: 인용하기 전에 버전을 확인하세요

이 맞대결을 검색해 보면 Grok 4.5의 Terminal-Bench 2.1에서의 83.3%가 GPT-6 Astra의 Terminal-Bench 4.0에서의 57.9%와 맞세워져 있는 것을 확인할 수 있습니다. 이 둘은 같은 이름을 쓰고 있는 서로 다른 벤치마크입니다. 비교할 수 없으며, 이 둘을 나란히 쌓아 놓은 비교 페이지들은 아무것도 알려주지 않습니다.

두 업체가 공개한 코딩 수치 대부분이 이 문제를 안고 있다. xAI의 Grok 4.5 시트에는 SWE-bench Pro 64.7%, Terminal-Bench 2.1 83.3%, DeepSWE 1.0 62.0%, DeepSWE 1.1 53%가 보고되어 있다. OpenAI의 Astra 시트에는 Terminal-Bench 4.0 57.9%, OSWorld 2.0 72.6%, FrontierMath Tier 4 97.6%, ARC-AGI-3 99.9%가 보고되어 있다. 모두 벤더가 보고한 수치이며, 서로 겹치는 항목은 거의 없다.

두 모델이 진정으로 동일한 하네스에서 만나는 단 한 곳이 있습니다: Datacurve의 DeepSWE v1.1로, 이는 모든 모델을 113개의 독창적이고 오염 없는 과제에서 동일한 mini-swe-agent 스캐폴드를 통해 실행합니다. 그곳에서 GPT-6 Astra는 과제당 약 $6.52의 비용으로 74.1%를 기록하는 반면, Grok 4.5는 53%에 머뭅니다. 이는 이 페이지에서 가장 깔끔한 단일 결과이며, Astra에 결정적으로 유리합니다. Grok 4.5에만 해당하는 추가 주의사항이 하나 더 있습니다: xAI의 CursorBench 수치는 이전 코드베이스가 학습에 유출된 것으로 밝혀진 후 공개 비교에서 제외되었으므로, 이 모델에 대한 모든 CursorBench 수치는 사용할 수 없는 것으로 간주하십시오.

에이전틱 행동과 도구 호출

이 둘은 같은 목적지로 가는 경로가 서로 다르며, 그 차이는 점수가 아니라 구조적인 것이다.

GPT-6 Astra의 개발자 대상 기능은 여러분이 오케스트레이터를 구축하고 있다고 가정합니다. 이는 비동기 도구 호출을 지원하여 도구를 기다리는 동안에도 모델이 다른 작업을 계속할 수 있게 합니다. 또한 WebSockets를 통한 작업 중 조정을 지원하여 진행 중인 실행을 다시 시작하지 않고도 방향을 바꿀 수 있습니다. 그리고 대화 중간에 추론 노력을 조정할 수 있습니다. Codex에서는 이전 컨텍스트를 검색 가능하게 유지하면서 컨텍스트 창 전반에 걸쳐 노트를 보존하는 컨텍스트 보존 메커니즘을 추가합니다. OpenAI의 자체 시스템 카드에는 이 모델이 이전 모델보다 모니터링하기 더 어렵다고 명시되어 있다고 하며, 이는 도구 호출 로그와 시스템 상태를 — 모델의 설명이 아니라 — 감사 증거로 삼아야 하는 이유입니다.

Grok 4.5의 에이전트 관련 이야기는 새로운 프리미티브에 관한 것이라기보다 어디에서 훈련되었는지에 더 관한 것이다. 실제 다중 파일 편집 및 디버깅 세션에서 Cursor와의 공동 훈련은 xAI가 소프트웨어 작업에서의 토큰 효율성의 공로를 돌리는 부분이며, 이것이 이 모델이 범용 플래그십이 아니라 코딩 환경에서 기본값으로 등장하는 이유다. 함수 호출, 구조화된 출력, 스트리밍, 프롬프트 캐싱이 모두 지원된다. 도구 호출은 OpenAI 호환 형태를 따르므로, 기존 클라이언트에 넣는 것은 base-URL 변경만 하면 된다.

두 모델이 동일한 노력 수준으로 등장하는 공유된 독립적 에이전트 벤치마크가 없으므로, 여기서 우리가 억지로 승자를 만들어내지는 않겠습니다. 말할 수 있는 것은 Astra의 도구 호출 표면이 장기 지평 작업에서 둘 중 더 표현력이 풍부하고, Grok 4.5의 작업당 토큰 경제성은 대량 작업에서 더 매력적이라는 점입니다.

Grok 4.5를 선택하세요, 만약

• {{1}}작업당 비용이 결정을 좌우하는 대량 또는 고빈도 작업을 실행 중이며, AA Intelligence Index에서 39점이 품질 기준을 충족하는 경우.{{/1}}

• 프롬프트가 200,000 토큰 이내에 있습니다. 바로 이 구간에서 Grok 4.5의 가격 우위가 가장 극대화되며, 장문 컨텍스트 재가격 책정이 결코 발동되지 않습니다.

• 실질적인 효과를 내는 캐시 할인을 원하신다면. 캐시된 입력 토큰 백만 개당 $0.30로, Astra의 $1.00과 맞붙어 반복 프리픽스 워크로드 — 긴 시스템 프롬프트, 공유 리포지토리 컨텍스트 — 가 빠르게 저렴해집니다.

• 어려운 작업에서 1분 이내의 첫 토큰 지연 시간이 필요하고, 몇 분씩 기다릴 여유가 없는 경우입니다.

다음의 경우 GPT-6 Astra를 선택하세요

• 과업이 곧 제품이고, 청구서는 오답에 비하면 반올림 오차에 불과하다. 이 곡선의 끝에서 14 인덱스 포인트는 마케팅이 아니라 실제 역량 차이다.

• 당신은 실제로 500,000 토큰을 훌쩍 넘어서까지 작업하고 있습니다. Astra의 윈도우는 Grok 4.5의 약 두 배이며, 둘 중 가격 재조정 조항 없이 그 수치에 도달하는 것은 Astra뿐입니다.

• 컴퓨터 사용, 딥 리서치, 또는 사이버보안 태세가 필요합니다 — OpenAI의 Critical 임계값과 함께 제공되는 엔터프라이즈 기본 비활성화 제어를 포함해서요.

• 당신은 곧바로 이어지는 요청-응답 호출보다는 비동기 도구 호출과 실행 중 조정(mid-run steering)을 원하는 오케스트레이터 코드를 작성하고 있습니다.

이번 주에 무엇이 움직였고, 그것이 권고 사항을 바꾸는 이유

2026년 9월 22일, OpenAI는 GPT-6 Sol과 GPT-6 Luna를 백만 토큰당 $2.00/$10.00 및 $0.10/$0.50에 출시하며, 이 요금이 프로모션이 아닌 영구적인 것이라고 설명했습니다. Sol은 코딩과 분석을 위한 중간 등급 모델로, Astra 입력 가격의 약 5분의 1 수준입니다.

그 점은 바로 이 결정에 중요합니다. Grok 4.5를 GPT-6 Astra와 비교하며 저울질한 이유가 가격이었다면, OpenAI 쪽에서 정직한 비교 대상은 더 이상 Astra가 아닙니다 — Astra는 플래그십이고, 이제 Sol이 Grok 4.5가 실제로 경쟁하는 등급을 차지합니다. Grok 4.5는 출력에서 여전히 Sol보다 저렴하며($6.00 대 $10.00), 입력에서는 Sol과 동일하므로($2.00씩), 그 자리에서 밀려난 것은 아닙니다. 하지만 이번 주 이전에 작성된 비교는 가성비 모델을 플래그십과 비교해 놓고 그 결과를 가격 이야기라고 부른 셈입니다.

xAI 측도 마찬가지입니다. xAI 자체 모델 목록에는 grok-4.5와 함께 grok-4.6 및 grok-4.7이 포함되어 있으므로, Grok 4.5는 현재의 최전선이라기보다 한 제품군 안의 하나의 선택지입니다.

Screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured 23 September 2026, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a p50 time to first token of 8.31s and p95 of 10.00s over seven days, traffic of 300.7M tokens over seven days, a 1M-token context with 128K maximum output, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, the catalogue date 2026-09-04, and the English-language interface with the language switcher on EN.

이것이 바로 선택이 아니라 라우팅을 해야 하는 진짜 근거다. 실무자들의 사례 글에서 계속 등장하는 2-모델 스택, 즉 대량의 작업은 저렴한 모델로 보내고 어려운 꼬리는 비싼 모델로 에스컬레이션하는 구성은 라우팅 결정이며, 재작성이 아니라 설정으로 표현할 수 있는 결정이다. OrcaRouter는 두 모델을 하나의 API와 하나의 키 뒤에 두고, 제공사 정가를 0% 마크업으로 그대로 전달하며, 제공사 간 자동 페일오버를 지원하고, 임계값 미만의 작업을 grok/grok-4.5로 보내되 openai/gpt-6-astra로 에스컬레이션할 수 있게 해주는 라우팅 DSL을 제공한다 — 작업이 실패하거나 규모 기준선을 넘을 때 말이다. 프로덕션 파이프라인을 걸지 않고도 좁은 트래픽 구간에서 비싼 경로를 시험해볼 수 있다.

간략 버전

GPT-6 Astra가 더 나은 모델입니다. 그 차이는 근소하지 않으며, 이 페이지가 그렇지 않은 척한다면 가치가 없을 것입니다 — 동일한 인덱스 리비전에서 53 대 39, 두 모델 모두 치른 단 하나의 코딩 벤치마크에서 74.1% 대 53%.

Grok 4.5는 더 저렴한 모델이지만, 완료된 작업당 3.1배 저렴할 뿐, 가격표가 시사하는 5배에서 8.3배만큼은 아니다. Astra가 거기에 도달하는 데 더 적은 토큰을 쓰기 때문이다. 그리고 두 모델 모두에 대해 동일하게 측정된 단 하나의 속도 수치에서는 두 모델이 동일한 수준이다.

결정해야 할 것은 어떤 모델이 승리하느냐가 아니다. 14포인트 지수 격차가 당신의 특정 워크로드에서 약 세 배에 달하는 비용을 지불할 가치가 있는지 — 그리고 그 답이 당신이 보내는 모든 요청에 대해 동일한지 여부다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트