Claude Sonnet 5.5 vs Grok 4.6이라는 제목의 히어로 카드, 부제는 요율표는 한 가지를 말하고 토큰 청구서는 다른 것을 말한다, 출력 $10 vs $6, 작업당 비용 $7.60 vs $1.86, Index 56 vs 44를 표시하는 필, 하단에는 Artificial Analysis v4.3.2와 공급업체 가격을 인용.
Guides & Insights

Claude Sonnet 5.5 vs Grok 4.6: 요금표가 말하는 것과 토큰 청구서가 말하는 것은 다르다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

헤드라인 산수는 기사가 시작되기도 전에 결론이 난 듯 보인다. Grok 4.6은 입력 토큰 백만 개당 2달러, 출력 토큰 백만 개당 6달러가 든다; Claude Sonnet 5.5는 2달러와 10달러가 든다. Space​XAI의 모델은 출력에서 40% 더 저렴하고, 입력에서는 동일하며, 2026년 8월 12일부터 일반 제공되어 왔다 — 그 특이점이 소문이 아니라 문서로 남을 만큼 충분히 오래. Anthro​pic의 모델은 이 글을 쓰기 하루 전인 2026년 9월 28일에 등장했으며, 이 등급에서 단연 가장 최신이다.

그런 다음 독립적인 효율 수치에 이르면 순서가 뒤집힌다. Artificial Analysis는 GPT 및 Claude급 모델을 Intelligence Index와 함께 작업당 비용 기준으로 측정하는데, v4.3.2 개정판에서는 여기 있는 두 모델이 Grok 4.6의 경우 지수 작업당 $1.86, Claude Sonnet 5.5의 경우 $7.60이다. 단가표가 더 저렴한 모델이 운영 비용은 네 배 더 비싼 모델이다. 왜 그런지, 그리고 그 역전이 언제 성립하고 언제 성립하지 않는지 따져보는 것이 이 비교의 전부다.

두 모델, 각자의 패밀리에서 두 가지 포지션

Grok 4.6은 Grok 라인의 현재 플래그십입니다. SpaceXAI 자체 개발자 문서에서도 이를 최신 모델로 기재하고 있으며, Grok 4.5를 이어받아 동일한 500,000토큰 컨텍스트 창, 동일한 텍스트·이미지·파일 입력 표면, 동일한 기본 가격을 제공합니다. 설정 가능한 추론 강도, 네이티브 도구 호출, 구조화된 출력, 전체 샘플링 표면을 지원하며, 일급 OpenAI Responses 모델로서 변환 계층 없이 기존 에이전트 프레임워크에 바로 통합됩니다. Artificial Analysis는 이 모델의 Intelligence Index를 44로 산정하고 자사가 측정하는 216개 모델 중 31위로 평가했으며, GPQA Diamond 수치는 94.9%입니다.

Two-column scoreboard for Claude Sonnet 5.5 and Grok 4.6 across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, verbosity 410M output tokens. Right column Grok 4.6: input $2.00 per million, output $6.00 per million, 500K-token context, AA Intelligence Index 44, cost per Index task $1.86, verbosity 94M output tokens. A footer line reads Index, cost per task and verbosity per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5는 Anthropic의 5.5 세대에서 두 번째로 등장한 모델이자, 회사가 자사 라인업에서 속도와 지능의 최고 조합으로 내세운 모델입니다. 이 모델은 claude-sonnet-5-5/라는 이름으로 Claude API와 3대 주요 클라우드에서 제공되며, 128K 동기식 출력 상한을 갖춘 1M 토큰 컨텍스트 윈도우를 지원하고, 입력, 출력 및 캐싱에 대해 Claude Sonnet 5의 $2 / $10 요금을 유지하며, 제로 데이터 보존으로도 이용할 수 있습니다. 동일한 지수 리비전에서 56점을 기록하며 216개 중 3위를 차지합니다.

그래서 둘은 사실 같은 시장에 있는 게 아니다. 하나는 7주째 저렴한 요율로 판매 중인 50만 토큰 프런티어 모델이다. 다른 하나는 토큰당 비용이 전작보다 더 들지 않으면서 종합 점수는 12점 더 높은 100만 토큰 범용 등급이다. 그래도 이 비교는 해 볼 가치가 있다. 둘 다 입력 $2 모델이고, 바로 그 지점에서 조달 결정이 실제로 시작되기 때문이다.

아무도 슬라이드에 넣지 않는 4배의 격차

요금표는 토큰에 가격을 매긴다. 청구서는 작업 단위로 표시되며, 모델이 답에 도달하는 데 소비하는 토큰 수는 상수가 아니라 설계상의 선택이다. 바로 여기서 이 둘이 갈리며, 측정된 수치는 극명하다:

• 출력 요금 — Claude Sonnet 5.5 백만 토큰당 $10 vs Grok 4.6 백만 토큰당 $6

• Intelligence Index 작업당 비용 — Claude Sonnet 5.5 $7.60 vs Grok 4.6 $1.86

• Index에서의 장황함 — Claude Sonnet 5.5 410M 출력 토큰 vs Grok 4.6 94M

• 지능 지수 — Claude Sonnet 5.5 56 대 Grok 4.6 44, 둘 다 v4.3.2 기준

• 출력 속도 — Grok 4.6은 초당 67.7토큰으로 측정되었으며, 이는 중앙값 82.7과 대비됩니다. Anthropic은 Claude Sonnet 5.5가 Claude Sonnet 5보다 출력을 30%+ 더 빠르게 생성한다고 보고했으며, Artificial Analysis는 Claude Sonnet 5를 초당 78.7토큰으로 측정했습니다.

verbosity 라인이 메커니즘이다. 네 배의 토큰을 생성하는 모델이 작업당 네 배의 비용이 들기 위해 67% 더 높은 출력 속도가 필요한 것은 아니다 — 하지만 도움이 되며, 여기서 두 효과는 같은 방향을 가리킨다. Anthropic의 자체적인 설명은 이 해석을 반박하기보다는 지지한다: 출시 자료에서는 Claude Sonnet 5.5가 동일한 토큰당 가격에서 Claude Sonnet 5보다 "작업당 최대 30% 더 저렴하다"고 주장하는데, 이는 속도가 아니라 토큰 수에 관한 주장이다. 훨씬 더 간결한 외부 기준선과 비교하면, 같은 속성이 모델의 가장 큰 비용 위험이 된다.

이 모든 것도 지수 격차를 없애주지 않는다. 종합 점수 12점은 실질적인 역량 차이이며, 실패하는 더 저렴한 작업은 더 저렴한 것이 아니다. 다만 이것이 뜻하는 바는, 정직한 질문은 "어느 요율이 더 낮은가"가 아니라 "더 어려운 작업은 토큰을 얼마나 소모하는가"라는 것이다. 그리고 그 숫자는 자신의 워크로드를 직접 실행해야만 존재한다.

Artificial Analysis model page for Claude Sonnet 5 (Adaptive Reasoning, Max Effort), released June 2026, showing an Intelligence Index of 38, an output speed of 78.7 tokens per second against an average of 83, a cost of $2.00 per million input tokens and $10.00 per million output tokens, $5.09 per Intelligence Index task, a verbosity of 370M output tokens, and a 1M-token context window.

맥락, 노력, 그리고 통합의 형태

두 번째 차이는 아키텍처에 관한 것이며, 이는 둘 중 어느 것을 아무것도 다시 작성하지 않고 채택할 수 있는지를 결정합니다.

OrcaRouter model page for grok/grok-4.6, attributed to SpaceXAI and dated 2026-08-12, showing a 500K-token context window, text, image and file input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 3.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5는 Claude Sonnet 5에 비해 여섯 가지 동작을 변경하며, 그중 다섯 가지는 호환성을 깨뜨립니다. 다음을 보내면 thinking: {"type": "disabled"}/는 이제 400을 반환하므로 다음으로 대체해야 합니다: between_tools/. 강제 도구 사용 — tool_choice/가 "any"/이거나 이름이 지정된 도구 — 는 즉시 거부되므로, 스키마에 유효한 호출을 강제하는 루프는 다음으로 이동해야 합니다: auto/로, 엄격한 도구 사용 또는 구조화된 출력과 함께. 이전 computer_20251124/ 컴퓨터 사용 도구는 Claude API와 Google Cloud에서 거부됩니다. 사고 블록은 이제 이를 생성한 모델과 계정에 연결되므로, 대화는 Claude Sonnet 5에서 추론을 앞으로 이어 갈 수 있지만 다른 모델 패밀리로 옆으로 가져갈 수는 없습니다. 그리고 advisor 도구는 더 이상 Claude Opus 4.8, Claude Opus 4.7 또는 Claude Sonnet 5를 Sonnet 5.5 실행기 뒤의 advisor로 허용하지 않습니다.

Grok 4.6은 그런 것을 전혀 요구하지 않습니다. 이는 샘플링 표면이 그대로 유지된 OpenAI 형식 모델이며, Grok 4.5에서의 마이그레이션은 모델 문자열 변경에 불과합니다. 다만 자체 비용 구조에는 함정이 하나 있는데, 이는 Anthropic의 것과 정반대입니다. $2 / $6 요금은 최대 200,000 입력 토큰까지 적용되고, 그 이상은 모두 $4 / $12로 청구됩니다. Claude Sonnet 5.5는 전체 1M 윈도우에 걸쳐 표준 요금을 부과합니다.

두 구조를 나란히 놓으면, 선택은 어느 업체가 더 저렴한지의 문제가 아니게 된다:

• 짧은 프롬프트, 밀도 높은 출력 — Grok 4.6의 더 효율적인 토큰 습관과 낮은 출력량이 결정적으로 우위를 점한다

• 매우 긴 입력 — Claude Sonnet 5.5의 고정 1M 요금은 컨텍스트 한도에 훨씬 이르기 전부터 두 배로 오르는 티어를 앞서기 시작합니다

• 대용량 단일 출력 — Sonnet 5.5의 128K 상한은 Grok 4.6과 동일하며, output-300k-2026-03-24/ 헤더

• 기존 OpenAI 형식 코드 — Grok 4.6은 변경 필요 없음; Sonnet 5.5는 위의 도구 사용 및 사고 작업이 필요함

둘 다 하나의 자격 증명에 넣기

두 공급업체 비교를 머릿속에 담아두는 건 쉽다. 막상 실행에 옮기면 비용이 숨어 있는 지점이 드러난다. 계정 두 개, 한도 두 세트, 청구 인터페이스 두 개, 그리고 의미가 있으려면 두 번 측정해야 하는 토큰 수까지.

OrcaRouter는 이를 200개 이상의 모델을 포괄하는 하나의 OpenAI 호환 엔드포인트로 통합하며, 제공업체의 정가를 그대로 전달하고 마크업이 없어, Grok이나 Claude 측의 공급업체 요금 변경이 다음 계약 갱신 때가 아니라 같은 날 여기에 반영됩니다. 전체 Grok 4.x 라인은 공급업체 자체 요금으로 카탈로그에 있습니다., 그리고 Claude Sonnet 5는 6월 30일부터 Anthropic의 $2 / $10으로 라우팅 가능했습니다. — 대부분의 Claude API 트래픽이 여전히 사용하는 모델로, 초당 150개의 출력 토큰과 약 5초의 p50 첫 토큰 시간으로 측정됩니다.

특히 Claude Sonnet 5.5는 아직 우리 카탈로그에 없습니다. 그때까지 그것에 이르는 경로는 벤더 자체 API이며, 누구도 하나의 종합 점수 외에는 독립적으로 벤치마크한 적 없는 모델에 워크로드를 걸지 않고 시험하는 방법은 자동 페일오버 뒤에서 트래픽의 일정 비율을 보내는 것입니다, Grok 4.6 또는 Claude Sonnet 5가 떨어뜨리는 부분을 받아내면서. 완전히 새로운 등급을 시도하는 것은 마이그레이션 프로젝트가 아니라 라우팅 결정입니다.

숫자를 어떻게 처리할까

Grok 4.6은 작업이 짧고 출력이 밀도 높으며 통합이 이미 OpenAI를 사용하는 상황에서 선택할 수 있는 더 나은 모델입니다. 이 가격대의 다른 무엇보다 작업당 측정 가능할 만큼 더 군더더기 없고, 샘플링 제어가 그대로 유지되며, 7주간 이용 가능했다는 것은 다른 사람들이 이미 그 실패 모드를 찾아냈다는 뜻입니다.

Claude Sonnet 5.5는 입력이 엄청나게 많을 때, 복합 점수가 바로 당신이 구매하려는 대상일 때, 또는 작업이 충분히 에이전트적이어서 12포인트 지수 격차와 128K 출력 상한이 작업당 비용의 4배 차이보다 더 중요할 때 더 나은 모델입니다. 마이그레이션 체크리스트는 실제로 존재하며, 이는 모델 문자열 한 줄 수정이 아니라 하루치 작업입니다.

이 문제를 결판지을 것은 두 방식 모두에서 실행한, 자체 트래픽에 대한 작업당 토큰 측정입니다. 이 글에서 결과를 좌우하는 모든 수치 — $1.86 대 $7.60, 94M 대 410M — 는 바로 그 하나의 수치를 대신하는 대리 지표이며, 그 수치는 그중에서 스스로 산출할 수 있는 유일한 수치입니다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트