GPT-6.1 Sol 대 Grok 4.7 비교를 위한 생성된 히어로 카드로, 제목은 '토큰당 40% 더 저렴, 청구서는 5.2배'이며, 세 개의 배지는 'Grok 4.7 출력: 1M당 $6.00', 'GPT-6.1 Sol 출력: 1M당 $10.00', '인덱스 실행의 출력 토큰: 67M 대 240M'이고, 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

GPT-6.1 Sol vs Grok 4.7: 이 자리에서 가장 저렴한 출력 단가, 그리고 가장 값비싼 대화

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok 4.7은 xAI가 Grok 4.6의 후속으로 내놓은 모델로, 2026년 9월 21일에 등장했으며 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00의 가격이 책정되었습니다. GPT-6.1 Sol은 OpenAI가 중간 등급 라인을 새로 갱신한 모델로, 8일 뒤인 9월 29일에 등장했으며 입력 $2.00, 출력 $10.00의 가격이 매겨졌습니다. 입력 요금은 동일하고 출력 요금은 Grok 4.7이 40% 더 저렴하며, 대부분의 비교는 바로 여기서 멈춥니다. 하지만 그것은 멈추기에 잘못된 지점입니다. 동일한 독립 평가 위원회가 이제 두 모델을 처음부터 끝까지 측정했기 때문입니다. Grok 4.7은 Artificial Analysis Intelligence Index를 완수하는 데 약 2억 4천만 개의 출력 토큰을 태웠고, GPT-6.1 Sol은 6,700만 개를 태웠습니다. 더 저렴한 요금에 3.5배의 볼륨을 곱하면, 토큰당 가격이 더 낮은 모델은 완료된 작업 한 건당 $3.74가 드는 반면 $0.72가 듭니다.

8일 차이를 둔 두 모델, 그리고 뒤집히는 요금표

Grok 4.7은 x​AI의 가장 강력한 코딩 및 지식 노동 모델입니다: 500,000토큰 컨텍스트 창, 공급업체 자체 목록에 따르면 단일 응답에서 최대 450,000 출력 토큰, 텍스트, 이미지 및 파일 입력, 그리고 추론 강도를 다음 수준 중에서 설정할 수 있습니다: 낮음, 중간 (기본값), 높음 및 매우 높음. x​AI는 파라미터 수를 공개하지 않았으며, 사전 학습 컷오프는 2026년 6월로, 추가 학습은 8월까지로 보고됩니다.

GPT-6.1 Sol은 Open​AI가 GPT-6 Sol 티어를 한 단계 끌어올린 리프레시 모델로, GPT-6 Astra 아래, GPT-6 Luna 위에 위치합니다: 1,050,000 토큰의 컨텍스트—Grok의 약 두 배—와 Grok의 약 3분의 1에 해당하는 128,000 토큰 출력 상한, 2026년 4월 30일 지식 컷오프, 그리고 동일한 텍스트, 이미지 및 파일 입력을 갖춥니다. 추론 사다리는 low부터 max까지이며 기본값은 medium이고, none은 더 이상 전혀 허용하지 않습니다.

각 차원당 한 줄, 각 줄에 양쪽 모두:

• 입력 — GPT-6.1 Sol 100만 토큰당 $2.00 vs Grok 4.7 100만 토큰당 $2.00; 동일
• 출력 — GPT-6.1 Sol 100만 토큰당 $10.00 vs Grok 4.7 100만 토큰당 $6.00; Grok이 40% 더 저렴
• 캐시 입력 — GPT-6.1 Sol 100만 토큰당 $0.10 vs Grok 4.7 100만 토큰당 $0.50; Sol이 5배 더 저렴, 출력 항목이 암시하는 바와 정반대
• 컨텍스트 창 — 1,050,000 토큰 vs 500,000
• 한 응답에서 최대 출력 — 128,000 토큰 vs 주장된 450,000
• 장문 컨텍스트 단계 — 272,000 입력 토큰 초과 시 전체 요청에 대해 입력 및 캐시는 2배, 출력은 1.5배로 재산정 vs 200,000 입력 토큰 초과 시 모든 요율이 2배, 역시 전체 요청에 적용
• 추론 노력 — 낮음, 중간(기본), 높음, xhigh, 최대 vs 낮음, 중간(기본), 높음, xhigh
• 가중치 및 파라미터 — 비공개, 미공개 vs 비공개, 미공개; 어느 쪽도 체크포인트를 제공하지 않음
• 공개된 최대 추론 노력에서의 Intelligence Index — GPT-6.1 Sol은 최대에서 51.8 vs Grok 4.7은 xhigh에서 46.4
• Index 작업당 비용, 독립적 — $0.72 vs $3.74
• Index 실행 시 출력 토큰 — 6,700만 vs 2억 4,000만, 리더보드 중앙값 약 8,100만과 대비

그 목록의 두 줄이 전체 비교의 전부다. Grok 4.7의 출력 요율은 실제로 더 낮고, 캐시 항목은 실제로 다섯 배 더 높다. 그리고 측정 대상 토큰을 3.5배 생성했다. 요율표만 단독으로 읽으면 한쪽을 가리킨다. 측정 결과는 다섯 배 차이로 다른 쪽을 가리킨다.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Grok 4.7이 실제로 앞서 있는 부분

이 글을 완승으로 다루는 것은 부정직할 것이다. 왜냐하면 Grok 4.7이 실제 평가에서 이기기 때문이다. Artificial Analysis v4.3.2에서 공개된 최대 노력으로 나란히 채점한 결과 — Grok은 xhigh, Sol은 max, 이 구성 차이는 끝까지 염두에 둘 만하다:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715.4 vs GPT-6.1 Sol Elo 1575.1. 경제적으로 가치 있는 지식 노동에서 140점 Elo 우위이며, 더 저렴한 요금제 모델에게는 가장 큰 단일 독립적 승리입니다.
• AutomationBench-AA — Grok 4.7 0.6556 vs GPT-6.1 Sol 0.6487. 사실상 무승부이며, 명목상으로는 Grok의 우세입니다.
• SciCode — Grok 4.7 0.5741 vs GPT-6.1 Sol 0.5417. 과학적 코딩에서 3.2점 우위입니다.
• Terminal-Bench 4.0 — Grok 4.7 0.2576 vs GPT-6.1 Sol 0.5606. 30점 열세이며, 이 조합에서 가장 큰 격차입니다.
• Humanity's Last Exam — Grok 4.7 0.4314 vs GPT-6.1 Sol 0.5292.
• AA-LCR v1.1, 장문맥 추론 — Grok 4.7 0.7667 vs GPT-6.1 Sol 0.83.
• AA-Omniscience — Grok 4.7 32.0 vs GPT-6.1 Sol 41.5.
• GDP.pdf — Grok 4.7 0.20 vs GPT-6.1 Sol 0.31.
• CritPt — Grok 4.7 0.1771 vs GPT-6.1 Sol 0.3171.

9개 평가 중 3개는 Grok 4.7의 승리이거나 무승부입니다. 여기에는 가장 반박하기 어려운 평가도 포함됩니다. GDPval-AA는 경제적으로 가치 있는 전문 업무에 가격을 매기도록 설계되었으며, 140점의 Elo 우위는 노이즈가 아닙니다. 당신의 워크로드가 GDPval이 대표하도록 만들어진 종류라면 — 문서 중심 분석, 전문적 산출물, 정답이 있는 판단 — 요금표가 더 저렴한 모델이 중립 보드에서 더 나은 모델이기도 하며, 작업당 비용 페널티는 그 대가로 지불하는 것입니다.

xAI 자체의 출시 수치는 크며, 모든 벤더의 출시 수치가 그렇듯 재현된 바 없다. CursorBench 4.0은 46.3%로 xhigh에서 Grok 4.6의 40.4%를 상회했고, Terminal-Bench 4.0은 38.0% 대 20.3%로 이번 릴리스에서 주장된 단일 최대 향상폭이며, DeepSWE v1.1은 71.0%로 high에서 65.2%를 상회했고, EEBench는 64.0% 대 53.0%였다. 이는 모두 xAI의 하네스, xAI의 설정, xAI의 보고다. 그리고 38.0%라는 Terminal-Bench 4.0 주장은 동일 모델, 동일 벤치마크에 대한 독립 게시판의 0.2576과 맞서 있다는 점에 주목하라. 이는 벤더의 튜닝된 구성과 중립적인 최대 노력 실행 사이에서 마땅히 예상해야 할 종류의 불일치다.

OpenAI가 GPT-6.1 Sol에 대해 내놓은 수치도 같은 할인을 받아 마땅하고 같은 약점을 갖는다. 이 비교에서 어느 공급업체도 내놓지 않은 단 하나의 숫자는 완료된 과업당 비용인데, 이는 점수표가 아니라 측정된 토큰 소비량으로부터 계산되기 때문이다. 살아남는 것은 바로 그 수치다.

왜 2억 4천만 토큰이 그것을 결정하는가

Artificial Analysis는 자체 요약에서 Grok 4.7의 장황함을 설명하며, 인덱스 실행의 근거가 되는 토큰 수가 그 증거입니다: 출력 토큰 2억 4천만 개로, 약 8,100만 개에 가까운 보드 중앙값과 대비되며, 같은 스위트에서 일반적인 모델이 생성하는 양의 약 세 배입니다. GPT-6.1 Sol의 6,700만 개는 중앙값을 훨씬 밑돕니다. 두 비율을 함께 놓고 보면 — 0.6배의 가격으로 3.6배의 볼륨 — 더 저렴한 출력 단가는 더 작은 청구서가 아니라 더 많은 토큰을 사들이는 것이며, 이는 작업당 비용 $3.74 대 $0.72의 차이가 정확히 보여주는 모습입니다.

캐싱은 효과의 크기를 바꾸지만 방향은 바꾸지 않으며, 바로 이 점이 사람들을 헷갈리게 하는 세부 사항이다. Grok 4.7의 캐시된 입력은 백만 토큰당 $0.50이고 Sol은 $0.10이다 — 긴 에이전트 이력과 반복되는 시스템 프롬프트가 존재하는 영역에서는 다섯 배 더 비싸다. 따라서 크고 안정적인 프리픽스를 반복해서 다시 읽는 작업 부하에서는 두 모델이 $6 대 $10이 시사하는 것보다 더 가깝게 느껴지고, Grok의 장황함이 그 위에 더해지면 입력 요율이 시사하는 것보다 더 멀어진다. 여기서는 캐시 라인과 토큰 라인이 같은 방향을 가리키는데, 이는 이례적이며 이 조합을 요금표가 암시하는 것보다 더 깔끔하게 만든다.

롱 컨텍스트 조항은 서로 다른 지점에서 발동하므로 별도로 가격을 책정할 가치가 있다. GPT-6.1 Sol은 입력 토큰이 272,000개를 초과하면 전체 요청 가격을 다시 산정한다; Grok 4.7도 200,000개를 초과하면 마찬가지다. 250,000토큰 호출에서 Grok은 이미 두 배로 뛰었다 — 캐시 읽기 $1.00와 함께 $4.00 및 $12.00 — 반면 Sol은 여전히 표준 $2.00 및 $10.00이다. 200,000~272,000 토큰 구간에서는 요금표가 더 저렴한 모델이 훨씬 더 비싼 쪽이 되며, 이 구간은 문서 작업에서 흔하다.

Grok이 점수보다 구조에서 진정으로 앞서는 지점은 출력 상한이다. 최대 450,000토큰 응답 대 Sol의 128,000은 차원이 다른 산출물이다: 한 번의 호출로 전체 코드베이스를 생성하거나, 긴 대화 기록을 만들거나, 책 한 권 분량의 종합을 해내는 것이다. 오늘 출력 한도에 부딪히고 있다면, 그 항목이 비교를 좌우하며 위의 비용 계산은 전혀 적용되지 않는다 — 다른 모델이 갖지 못한 능력은 어떤 요금으로도 살 수 없기 때문이다.

둘 다 하나의 키에 있다는 점이 유용한 부분이에요.

Grok 4.7은 OrcaRouter에서 x​AI 자체 정가로 제공됩니다 — 백만 토큰당 $2.00 및 $6.00, $0.50 캐시 읽기, 그리고 200,000토큰을 넘으면 $4.00 및 $12.00로 오르는 단계가 x​AI가 나열한 그대로 전달됩니다 — 그리고 GPT-6.1 Sol은 출시 당일 우리 라우트에 Open​AI의 가격으로 들어왔습니다. $2.00 및 $10.00, 캐시된 입력 $0.10, 272,000토큰 단계는 변동 없이. 둘 중 어느 쪽에도 추가되는 것은 없습니다: 플랫폼은 공급자 정가에 마진을 붙이지 않고 그대로 전달하며, 이는 어느 쪽이든 공급업체의 가격 인하가 그곳에서 적용되는 같은 날 여기에서도 적용된다는 의미입니다. 두 번째 청구서도, 중간에 리셀러도 없습니다.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

이 특정한 쌍에 대해서는 편의성보다 더 가치가 있습니다. 두 모델은 자신들이 잘하는 것에 대해 의견이 다릅니다 — Grok 4.7은 전문 업무 Elo와 과학 코딩에서 앞서고, GPT-6.1 Sol은 터미널 실행, 사실적 신뢰성 및 장문맥 검색에서 앞서며 — 이러한 워크로드 사이의 경계는 벤치마크에서 보이기 전에 귀하의 자체 트래픽에서 보입니다. GDPval 형태의 요청을 한쪽으로, 장기 지평의 에이전트 실행을 다른 쪽으로 보내면서, 하나의 엔드포인트 뒤에서 둘 모두에 걸친 자동 장애 조치와 배포가 아닌 구성에서 변경하는 라우팅 규칙을 사용하는 것은, 평가 프로젝트보다 그 경계를 찾는 더 저렴한 방법입니다. Model fusion은, 여러 모델 패널이 함께 답변하는 방식인데, 요청마다 전혀 선택하고 싶지 않다면 플랫폼이 제공하는 다른 옵션입니다.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

전화

• 장문 출력 에이전트형 및 터미널 작업, 캐시된 접두사 루프 — GPT-6.1 Sol. Terminal-Bench 4.0에서 30점, 캐시 라인은 5배 더 저렴하고 완료된 작업당 비용은 5분의 1.
• 전문 지식 업무, 문서 분석, 판단 작업 — 140점의 GDPval-AA Elo 우위를 바탕으로 한 Grok 4.7, 토큰 청구액은 가정이 아니라 예산에 반영.
• 과학 코딩 — 해당 보드의 SciCode 부문에서 근소한 차이로 Grok 4.7. 자체 스위트와 비교해 보세요; 3.2점은 다른 프롬프트 세트로도 움직일 수 있는 범위 안입니다.
• 128,000 출력 토큰을 초과하는 단일 응답 — Grok 4.7, 그리고 이를 대체할 산술은 없습니다.
• 200,000~272,000 입력 토큰 사이의 요청 — GPT-6.1 Sol, 왜냐하면 Grok 4.7은 이미 전체 요청을 두 배로 늘렸고 Sol은 그렇지 않기 때문입니다.
• 가능한 가장 저렴한 대화 — 이 둘 중 어느 쪽도 아닙니다. 둘 다 프런티어 가격이 책정된 모델이며 프런티어급 토큰 소비량을 지녔습니다; 비교는 어느 쪽이 추상적으로 저렴한가가 아니라 어느 쪽이 당신의 작업을 끝내는가에 관한 것입니다.
• 비교가 "Grok이 토큰당 더 저렴하다"로 끝난다면 — 그것은 한 단계 너무 일찍 끝난 것입니다. 다음 단계는 토큰 수이며, 2억 4천만 대 67입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트