
Claude Sonnet 5.5 vs GPT-6 Sol: 이제 $2 등급에 플래그십이 두 개 들어 있다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
Claude Sonnet 5.5와 GPT-6 Sol은 동일한 가격으로 책정되어 있다 — 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러 — 그리고 2026년 9월 말에 엿새 간격으로 출시되었다. 그 우연이 흥미로운 부분은 아니다. 흥미로운 부분은 Artificial Analysis가 자사의 v4.3.2 Intelligence Index로 두 모델을 모두 측정했을 때, 중급 Anthropic 모델이 OpenAI가 자사의 플래그십으로 판매해 온 모델을 앞섰다는 점이다: Claude Sonnet 5.5는 56, GPT-6 Sol은 47이다. 같은 리비전에서, Sonnet 5.5가 대체하는 모델인 Claude Sonnet 5는 38에 머문다.
그러므로 이것은 더 이상 저렴한 등급과 비싼 등급을 비교하는 것이 아닙니다. 같은 가격의 두 모델, 즉 두 연구소에서 나온 모델을 비교하는 것이며, Anthropic의 모델과 그 자체의 전임자 사이에는 18점 차이가 있고, OpenAI의 최상위 출시작을 상대로는 Anthropic에 유리한 9점 차이가 있습니다. 아래의 모든 내용은 그 격차 중 어느 것이 실제 워크로드와 맞닥뜨렸을 때 살아남는지, 그리고 어느 것이 벤치마크 아티팩트인지 알아내려는 시도입니다.
각 모델이 실제로 무엇인지
Claude Sonnet 5.5는 Anthropic의 5.5 세대에 속한 두 번째 모델로, 2026년 9월 28일에 출시되었으며, 이를 예고했던 Claude Opus 5.5 출시로부터 닷새 후에 나왔습니다. 이 모델은 claude-sonnet-5-5라는 id를 Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry 전반에서 사용하며, 이 등급의 100만 토큰 컨텍스트 창과 128K 출력 상한을 그대로 유지하고, Claude Sonnet 5의 가격도 정확히 그대로 유지합니다. 입력 $2, 출력 $10, 캐시 읽기 100만 토큰당 $0.20, 5분 캐시 쓰기 $2.50입니다. 첫날부터 데이터 무보존(zero data retention)으로 제공되며, Anthropic의 지원 종료 약속은 2027년 9월 28일까지 이어집니다.

GPT-6 Sol은 혼란스럽게도 GPT-5.6 Sol이라고 불리는 모델의 후속 모델이다 — OrcaRouter가 여전히 입력 $4, 출력 $20에 접근 가능하다고 표시하고 있고, Artificial Analysis가 이후 GPT-6 Sol을 가리키는 표시와 함께 deprecated로 분류한 바로 그 모델이다. 새 모델은 2026년 9월 22일에 입력 $2 / 출력 $10, 1,050,000토큰 컨텍스트 윈도우, 128K 출력 상한, 그리고 계층형 요금제로 출시되었다: $2 / $10의 대표 요금은 최대 272,000 입력 토큰까지 적용되고, 그 초과분은 모두 $4 / $15로 청구된다.
그 마지막 세부 사항은 "동일한 가격 책정"이라는 프레이밍이 처음으로 깨지는 지점이다.
가격 동률은 짧은 프롬프트에서만 성립합니다
두 요금표 모두 $2와 $10을 제시하며, 출시일 비교는 거의 대부분 거기서 멈췄습니다. 청구서를 좌우하는 조건들을 기준으로 둘을 나란히 놓아 보겠습니다:
• 대표 요금 — Claude Sonnet 5.5 $2 / $10 vs GPT-6 Sol $2 / $10
• 장문맥 요금 — Sonnet 5.5는 전체 1M 윈도우에 표준 요금을 청구하며; GPT-6 Sol은 입력 토큰 272,000개 초과 시 $4 / $15로 두 배가 됩니다
• 컨텍스트 윈도우 — 1,000,000 토큰 vs 1,050,000 토큰
• 최대 출력 — 동기 API에서는 둘 다 128K 토큰; Sonnet 5.5는 output-300k-2026-03-24헤더
• 배치 할인 — Sonnet 5.5의 입력 및 출력 50% 할인; 동등성을 가정하지 말고 Sol에 대한 OpenAI의 현재 약관을 확인하세요
• 캐시 읽기 — 두 가지 모두 백만 개당 $0.20
800,000토큰 규모의 리포지토리 전수 조사는 GPT-6 Sol에서 토큰당 비용이 Claude Sonnet 5.5의 두 배입니다. 그리고 그것이 바로 두 모델이 마케팅하는 워크로드입니다. 프롬프트가 짧다면 요금표는 정말로 대등하며 가격이 무엇을 결정해서는 안 됩니다. 프롬프트가 길다면, 이미 가격이 결정해 버렸습니다.
Anthropic 자체의 점수판, 주의 깊게 읽어 보세요
Anthropic은 Claude Sonnet 5, Claude Opus 5.5, GPT-6 Sol을 대상으로 한 4개 열 비교표를 공개했다. 아직 제3자가 재현하지 못한, 벤더가 보고한 수치는 다음과 같다:

• Terminal-Bench 4.0 — Sonnet 5.5 70.6% 대 Sonnet 5 10.3%
• FrontierCode 1.1, 메인 — Max effort에서 Sonnet 5.5 46.2%, Sonnet 5 42.4%, Opus 5.5 54.4%, GPT-6 Sol 49.3%
• CursorBench 4.0 — Sonnet 5.5 55.5% 대 Sonnet 5 34.1% 대 Opus 5.5 57.8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 대 Sonnet 5 1449 대 Opus 5.5 1846 대 GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 대 Sonnet 5 1359 대 Opus 5.5 1822 대 GPT-6 Sol 1483
• Humanity's Last Exam, 도구 사용 시 — Sonnet 5.5 64.5% vs Sonnet 5 54.9% vs Opus 5.5 67.7%
• OSWorld 2.1, 부분 — Sonnet 5.5 80.1% vs Sonnet 5 57.0% vs Opus 5.5 81.8%
• Chartography, 도구 없음 — Sonnet 5.5 61.6% vs Sonnet 5 15.6% vs Opus 5.5 64.4% vs GPT-6 Sol 53.6%
그 행들 중 두 개에는 각주가 달려 있고, 둘 다 중요하다. GPT-6 Sol의 GDPval-AA, AA-Briefcase, Chartography 수치는 OpenAI 측의 이미지 이해 수정 이후에 측정된 것으로 Anthropic이 표시해 두었으며, Sonnet 5.5의 FrontierCode 수치는 Max-effort 결과인데 Anthropic은 이것이 같은 평가에서 자사의 Xhigh 결과보다 낮았다고 밝힌다. 자사가 직접 운영하는 벤치마크에서 경쟁사와 자신을 비교하면서 양쪽 모두에 각주를 다는 것은 중립적이지 않다. 그것은 해당 사안에 관해 이용할 수 있는 최선의 증거일 뿐이며, 측정과는 같은 것이 아니다.
독립적인 수치가 말하는 것, 그리고 말하지 않는 것
Artificial Analysis가 첫 번째 독립 실행을 발표했습니다: v4.3.2에서 Index 56, Index 작업당 비용 $7.60, 그리고 중앙값 88M 대비 410M 출력 토큰이라는 장황성 수치입니다. 그 장황성 수치는 현재 받고 있는 것보다 더 많은 주목을 받을 가치가 있습니다. 이는 모델이 답에 이르는 과정에서 매우 많은 토큰을 소비하는 경향이 있음을 의미하며, Anthropic 자체 표에서 나오지 않은 유일한 효율성 주장의 배후 메커니즘입니다.
Anthropic은 Claude Sonnet 5.5가 Claude Sonnet 5보다 출력을 30% 더 빠르게 생성하며, 동일한 토큰당 요율에서 "작업당 최대 30% 더 적은 비용"이 든다고 말한다. 이 두 주장을 합치면 더 저렴한 단가표가 아니라 같은 일을 더 적은 토큰으로 해내는 모델을 설명하는 셈이다. 그것이 실제로 성립하는지는 바로 410M 토큰 장황성 측정이 확인하려는 것이며, 독립적인 실행 한 번으로 결론을 내리기에는 충분하지 않다. 하지만 마케팅 문구와 측정된 토큰 수가 서로 반대 방향을 가리킨다고 말하기에는 충분하고, 청구서에 찍히는 쪽은 측정된 수치다.
독립 인덱스가 아직 담고 있지 않은 점도 유념하세요. Anthropic 외의 누구에게서도 공개된 OSWorld, Terminal-Bench 또는 CursorBench 재현 결과는 없습니다. 그리고 56은 종합 점수입니다. 그 안의 열 가지 평가 중 무엇이 Sol의 47점과의 격차를 만들어냈는지는 전혀 말해주지 않습니다. 9점의 종합 점수 우위는 당신의 워크로드가 의존하는 단 하나의 평가에서의 15점 손실을 감출 수 있습니다.
요금표로는 보여줄 수 없는 방식으로 그것들이 서로 달라지는 지점
가격과 지수 점수는 쉬운 두 축입니다. 이전(migration)을 결정하는 것은 행동적인 축이며, 여기서 두 모델은 큰 차이가 있습니다.

Claude Sonnet 5.5는 기본적으로 적응형 사고를 켜며, 기본 노력 수준은 high입니다. 또한 이전 세대가 허용했던 세 가지를 제거합니다: thinking: {"type": "disabled"}를 보내면 이제 400을 반환하며, 다음으로 대체해야 합니다: between_tools; 강제 도구 사용 — tool_choice를 "any" 또는 이름이 지정된 도구로 설정하면 곧바로 400을 반환합니다. 그리고 이전 computer_20251124 컴퓨터 사용 도구는 도구 집합(toolset)이 대신 채택되면서 Claude API와 Google Cloud에서 거부됩니다. 또한 사고 블록은 이제 이를 생성한 모델에 묶여 있으므로, 대화가 Claude Sonnet 5에서 Claude Sonnet 5.5로 이동해도 추론을 그대로 유지할 수 있지만, 다시 그 추론을 가지고 밖으로 이동할 수는 없습니다.
에이전트 루프가 tool_choice: "any"를 설정해 스키마에 유효한 호출을 강제하면, Claude Sonnet 5.5는 auto로 전환하여 엄격한 도구 사용 또는 구조화된 출력을 사용할 때까지 요청을 거부합니다. 이는 실제 마이그레이션 작업이며, 한 줄짜리 모델 ID 교체를 오후 한나절로 만들어 버리는 종류의 일입니다.
GPT-6 Sol로 전환하는 비용은 성격이 다릅니다. 그것이 대체하는 모델이 여전히 카탈로그에 남아 있고 여전히 호출되고 있기 때문입니다. GPT-5.6 Sol은 철수된 것이 아닙니다. Artificial Analysis에서는 사용 중단(deprecated)으로 분류되어 있고, 새 모델보다 두 배 비싼 가격이 책정되어 있으며, 여전히 트래픽을 받고 있습니다. OrcaRouter의 자체 측정에 따르면 주당 약 9,500만 토큰을 처리하고 있으며, 이는 아직 마이그레이션하지 않은 통합이 얼마나 많은지를 보여주는 합리적인 대리 지표입니다. GPT-6 Sol로 이동하는 것은 나중에 내릴 수 있는 가격 결정입니다. 지금 당장 내릴 필요는 없습니다.
하나의 키에 대해 비교를 실행하는 중
두 공급업체를 비교할 때의 실질적인 문제는 보통 두 개의 계정, 두 개의 SDK 경로, 두 세트의 속도 제한을 거쳐야 뭔가를 알 수 있다는 점입니다. OrcaRouter는 이를 해결하기 위해 존재합니다: 하나의 OpenAI 호환 엔드포인트, 200개 이상의 모델, 제공업체 목록 가격을 마크업 없이 그대로 전달, 그리고 제공업체 간 자동 장애 조치.
여기서 중요한 두 모델 모두 오늘 이 플랫폼에서 라우팅할 수 있습니다. GPT-6 Sol은 $2 / $10 가격으로 카탈로그에 올라와 있으며 롱컨텍스트 티어도 그대로 유지됩니다. 그리고 Claude Sonnet 5 — 대부분의 Claude API 트래픽이 여전히 사용하는 모델로, 측정 기준 초당 출력 토큰 150개, 첫 토큰 p50 시간 약 5초 — 는 6월 30일부터 Anthropic 자체 가격인 $2 / $10으로 플랫폼에 올라와 있습니다.
Claude Sonnet 5.5 자체는 아직 우리 카탈로그에 없습니다. 그 말이 사실이긴 하지만, 그 모델에 이르는 정직한 경로는 벤더 자체의 API와 Anthropic이 나열한 세 개의 클라우드이며, 그것을 평가하는 정직한 방법은 손실을 감수할 수 있는 트래픽의 일부에 붙여 보는 것입니다. 바로 그것이 라우팅 계층의 목적입니다. 일정 비율을 승격하고 실패율을 지켜보며, 이전 모델을 롤백 계획이 아니라 폴백으로 유지하는 것.
어느 것이 프로덕션에 들어가나요?
워크로드의 형태를 기준으로 선택하세요, 종합 점수가 아니라.
Claude Sonnet 5.5는 긴 컨텍스트 작업, Anthropic의 tool-use 및 computer-use 인터페이스에 맞춰 이미 작성된 모든 것, 그리고 프롬프트가 일상적으로 25만 토큰을 넘어가는 팀에게 더 나은 선택이다 — 정액제 윈도우는 그곳에서 어떤 index delta보다 더 가치가 있다. 마이그레이션에 체크리스트가 따라붙는다는 점을 받아들이세요: 강제 도구 사용, thinking 토글, advisor 도구 페어링, 그리고 computer-use 도구 변경.
GPT-6 Sol은 OpenAI 형태의 스택에서 더 안전한 연속성 선택이며, 프롬프트가 짧고 통합이 이미 구축되어 있다면 더 저렴한 선택입니다. 그 장점은 성능이 아니라 — 종합 지표에서는 뒤처지지만 — 이전 모델이 여전히 서비스 중이고 마이그레이션에 마감 기한이 없다는 점입니다.
오늘날 이용 가능한 수치로 보면, Claude Sonnet 5.5는 독립 지수와 장문 컨텍스트 경제성에 대한 일대일 비교에서 이기고, 공개된 어떤 측정치도 아직 공급업체 자체 표의 신뢰도 이상으로는 감지할 수 없는 부분에서는 아무것도 뒤지지 않는다. 이는 출시 자료가 내세우는 것보다 좁은 주장이며, 바로 그 주장에 따라 행동할 가치가 있다.
답을 바꿀 수 있는 것은 에이전트형 평가에 대한 두 번째 독립 실행과, 두 모델 모두에 대해 동일한 작업에서 발표된 작업당 토큰 수 수치입니다. 둘 다 존재하기 전까지는 종합 지수는 실행 비용이 더 저렴한 모델의 9점 우위이며, 9점의 종합 우위는 귀하의 워크로드에서의 9점 우위와 같지 않습니다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
