GPT-6.1 Sol 대 Claude Opus 5.5를 위한 생성된 히어로 카드로, 제목은 '실질적인 격차, 불균등하게 분포'이며, 두 개의 정보 카드는 'GPT-6.1 Sol: 인텔리전스 지수 51.8, 인덱스 작업당 $0.72, 장문맥 회상률 83.0%'와 'Claude Opus 5.5: 인텔리전스 지수 57.6, 인덱스 작업당 $5.98, 장문맥 회상률 84.7%'를 표시하고, 푸터는 '수치는 Artificial Analysis 기준, Intelligence Index v4.3.2, 두 모델 모두 최대 노력 설정에서 측정되었습니다.'라고 읽으며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: 실질적인 격차, 불균등하게 분포

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

5.8점 격차는Claude Opus 5.5와 GPT-6.1 Sol 사이에서 Artificial Analysis Intelligence Index상 이 세트의 어떤 조합보다도 크며, 그중 대부분과 달리 이 격차는 설정 변경으로 좁혀지지 않는다. 2026년 9월 22일 출시되어 입력 100만 토큰당 $4.00, 출력 100만 토큰당 $20.00으로 책정된 Claude Opus 5.5는 57.6점을 기록한다. 2026년 9월 29일 $2.00와 $10.00으로 출시된 GPT-6.1 Sol은 51.8점을 기록한다. Claude Opus 5.5는 대부분의 프런티어 모델들을 서로 갈라놓는 격차보다 더 큰 차이로 앞서는 고득점 모델이며, 그 점수에 도달하는 데 작업당 비용은 8.3배 더 든다 — $5.98 대 $0.72. 지금까지는 비싼 모델이 그냥 이기고 있으며, 이는 이 비교에서 가장 흥미롭지 않은 판본이다. 이 비교를 읽을 가치가 있게 만드는 것은 5.8점이 전체 스위트에 고르게 퍼져 있지 않다는 점이다. 장문 문서와 장시간 세션 작업의 대부분을 좌우하는 단 하나의 축에서는 두 모델이 서로 2점 이내에 있다.

둘 다 같은 시장 위치에 있는 플래그십 모델이다. 1M급 컨텍스트 윈도, 128K 출력 상한, 텍스트·이미지·파일 입력을 갖췄고, 한쪽은 확장 사고를, 다른 쪽은 5단계 노력 사다리를 갖추고 있다. Claude Opus 5.5는 Claude Opus 5를 잇는 모델로, 고난도 추론과 코딩, 장기 지평의 에이전트 작업에 포지셔닝되어 있다. GPT-6.1 Sol은 GPT-6 Astra보다 한 단계 아래에 있으며, 에이전트 코딩과 컴퓨터 사용, 문서 중심의 전문 업무에 포지셔닝되어 있다. 두 모델은 같은 작업들을 겨냥한다. 측정 결과는 그 모든 작업에서 두 모델이 똑같이 뛰어나지는 않다는 것을 보여준다.

5.8점이 실제로 있는 곳

지수 합성치는 그 구성 요소를 숨긴다. 개별 평가를 하나씩 꺼내 보면, 그 격차는 더 이상 격차처럼 보이지 않고 하나의 프로필처럼 보이기 시작한다.

• Humanity's Last Exam — Claude Opus 5.5 61.4% vs GPT-6.1 Sol 52.9%, 추상적 추론에서 8.5포인트 격차

• SciCode — Claude Opus 5.5 66.9% vs GPT-6.1 Sol 54.2%, 연구급 코드에서 12.7포인트 차이

• 장문맥 회상 — Claude Opus 5.5 84.7% vs GPT-6.1 Sol 83.0%, 긴 입력에서 사실을 검색하는 데 있어 1.7포인트 차이

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6%, 동일 리비전에서 공개되지 않은 Sol 수치 대비

• 컨텍스트 윈도우 — GPT-6.1 Sol 1,050,000 토큰 대 Claude Opus 5.5 1,000,000 토큰, 두 모델 모두 출력 상한은 128,000 토큰

• 인덱스 작업당 비용 — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72

분포가 곧 이야기다. 과제가 추상적 추론인 경우—어려운 시험 문제, 베낄 기존 답이 없는 연구급 코딩 문제—에서는 Claude Opus 5.5가 결정적으로 앞서 있으며, 12.7포인트의 SciCode 격차는 잡음이 아니다. 과제가 매우 긴 입력에서 올바른 구절을 찾아 활용하는 것인 경우에는 두 모델이 사실상 동등하며, GPT-6.1 Sol은 50,000토큰 더 많은 용량으로 그 위치를 지키고 있다. 프로덕션 LLM 작업의 상당 부분은 두 번째 종류다: 검색 증강 응답, 계약 및 서류 검토, 로그와 녹취록 분석, 대규모 저장소에 대한 코드 리뷰. 그 작업은 첫 두 항목이 아니라 세 번째 항목으로 측정되며, 그 항목에서 프리미엄은 1.7포인트를 더 살 뿐이다.

인덱스 행을 정직하게 읽기

두 가지 주의사항은 페이지 하단이 아니라 그 숫자들 옆에 있어야 합니다.

구성이 다릅니다. Artificial Analysis는 Claude Opus 5.5를 "Max, Default Fallback" 구성으로, GPT-6.1 Sol을 최대 effort로 차트에 표시합니다. 둘 다 각 모델이 공개된 설정 중 가장 강력한 설정이므로 비교는 공정하지만, 이는 두 기본 제공 기본값이 아니라 두 가지 상한선을 비교한 것입니다. 호스팅 API에서 Claude Opus 5.5 자체의 기본값은 차트에 사용된 실행과 다를 수 있으며, GPT-6.1 Sol의 기본 effort는 medium입니다.

Terminal-Bench 행은 한쪽이 의도적으로 비어 있습니다. Claude Opus 5.5의 59.6%는 그것이 발표된 Artificial Analysis 개정판에서 나온 것입니다. 이에 상응하는 GPT-6.1 Sol 수치는 일치하는 개정판에서 제공되지 않습니다. 동일한 벤치마크의 다른 실행에서 나온 숫자를 인용하는 것은 잘못된 비교가 될 것이며, 정직한 조치는 대략 맞는 무언가로 셀을 채우기보다 셀을 비워 두는 것입니다.

장황함은 여기서도 더 저렴한 형제 모델들을 상대할 때와 같은 방향으로 작용한다: Claude Opus 5.5는 인덱스 스위트에서 260M 출력 토큰을 내보내는 반면 GPT-6.1 Sol은 67M으로, 이미 두 배 높은 요율에서 3.9× 차이다. 요율표가 입력 2×, 출력 2×를 보여주는데도 작업당 8.3× 비율이 나오는 이유가 바로 여기에 있다. 이 프리미엄이 8.3×인 것은 모델 비용이 8.3×이기 때문이 아니라, 비용이 2×이면서 3.9× 더 오래 생각하기 때문이다.

그것을 지불해야 하는 이유

귀하의 업무가 앞의 두 항목과 비슷하다면, 계산은 간단하며 Claude Opus 5.5에 유리합니다. 연구급 과학 코드에서 12.7점 격차, 또는 난도 높은 추상 추론에서 8.5점 격차는 사람 없이 티켓을 닫는 에이전트와 매 세 단계마다 사람이 필요한 에이전트 사이의 차이입니다. 대규모 코드베이스에서의 에이전트형 코딩은 두 벤더 모두 가장 먼저 언급하는 워크로드이며, 격차가 가장 큰 워크로드입니다. 실패하면 엔지니어의 20분을 잡아먹는 실행을 피하기 위해 작업당 $0.72 대신 $5.98을 지불하는 것은 고민할 필요가 없는 선택입니다.

점수와 전혀 관계없는 두 번째 논거가 있다. Claude Opus 5.5는 출시된 지 15일 되었고, 8일 된 모델에게는 없는 제3자 평가, 리뷰, 배포 경험을 축적했다. 프로덕션 경로에서는 주변 지식의 성숙도가 해당 지수가 값을 매기지 않는 가치를 지닌다.

반대 논거, 그리고 그것을 결정짓는 숫자

반론은 장문맥 행이다. 트래픽의 주된 형태가 "큰 입력, 짧은 응답"이라면 — 그리고 수많은 팀에게 그렇다 — 당신이 과금되는 축은 당신이 소비하는 축이 아니다. 장문맥 리콜에서 두 모델은 8.3배의 가격 비율에서 1.7점 차이이며, 더 저렴한 모델이 더 큰 윈도우를 갖는다. 바로 그 경우에 프리미엄은 실제이고, 측정되며, 워크로드가 결코 사용하지 않는 기능에 지출된다.

그렇다면 결정적인 숫자는 그 인덱스가 아니다. 그것은 회상이 아니라 SciCode처럼 보이는 작업의 비중이다. 그 질문에 자체 로그로 답할 수 있는 팀은 자체 로그로 답해야 한다. 벤치마크 스위트는 여러 작업이 섞인 구성을 대변하는 대리물이며, 그 혼합이 변수다.

둘 다 하나의 키에 있고, 그게 바로 이 질문에 답할 수 있게 해주는 거야

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5는 OrcaRouter에서 자체 $4.00 / $20.00에 제공되며 캐시 읽기는 $0.20입니다. GPT-6.1 Sol은 OrcaRouter에서 $2.00 / $10.00에 제공되며, 프롬프트 토큰 272,000개를 초과하면 $4.00 / $15.00로 올라가고 캐시 읽기는 $0.10입니다. 둘 다 공급자 정가로, 추가 금액 없이, 하나의 키와 하나의 청구서로 이용할 수 있습니다.

이 조합에서는 이 점이 평소보다 더 중요합니다. 두 모델은 서로 대체재가 아니라 하나의 라우팅 결정이기 때문입니다. 장문 문서와 대용량 작업은 GPT-6.1 Sol로 보내고, 어려운 추론과 코드 수정 작업은 Claude Opus 5.5에 맡기십시오. 그러면 두 모델 모두 동일한 자격 증명을 사용하는 동일한 엔드포인트 뒤에서 동작합니다. 경로가 저하되면 자동 장애 조치가 호출을 실패시키는 대신 다른 경로로 옮겨 주며, 라우팅이 선언적이기 때문에 애플리케이션 단위가 아니라 작업 클래스 단위로 표현할 수 있습니다. 이 분할을 테스트하는 것은 마이그레이션이 아니라 구성 변경입니다.

마지막으로 말할 가치가 있는 것은 이 비교의 유효 기간에 관한 것이다. 두 모델 모두 나온 지 며칠 또는 몇 주밖에 되지 않았다. GPT-6.1 Sol은 독립적인 구성이 하나 공개되어 있고, Claude Opus 5.5도 하나가 공개되어 있다. 모델당 단일 실행은 스냅샷일 뿐이며, 흥미로운 실패 모드는 이 수치 중 하나가 틀렸다는 것이 아니다 — 중간 수준의 노력 구성이나 두 번째 평가자가 프로파일을 다시 그린다는 것이다. 그때까지는 구성 요소들이 제시하는 해석이 가장 방어 가능하다: 어려운 추론과 연구 코드에서는 결정적인 격차, 긴 문맥 작업에서는 작은 격차, 그리고 전자와 유사한 워크로드 부분으로 정당화되어야 하는 8.3× 청구서다.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트