'GPT-6.1 Sol 대 GPT-5.6 Sol - 스코어보드'라는 제목의 생성된 2단 비교 스코어보드. 왼쪽 열 'GPT-6.1 Sol': '지능 지수: 51.8', '지수 작업당 비용: $0.72', '입력 / 출력: $2.00 / $10.00', '캐시된 입력: $0.10', '지수 실행 시 출력 토큰: 67M', '최소 노력 수준: 낮음' 행. 오른쪽 열 'GPT-5.6 Sol': '지능 지수: 47.0', '지수 작업당 비용: $1.99', '입력 / 출력: $4.00 / $20.00', '캐시된 입력: $0.40', '지수 실행 시 출력 토큰: 90M', '최소 노력 수준: 없음' 행. 바닥글에는 '최대 노력 기준 Artificial Analysis v4.3.2에 따른 독립적 수치; 공급업체 정가.'라고 적혀 있다.
Guides & Insights

GPT-6.1 Sol vs GPT-5.6 Sol: 지수 4.5점, 청구서는 절반, 두 가지 회귀

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

OpenAI는 출시했습니다 GPT-6.1 Sol을 2026년 9월 29일, 11주 후에 GPT-5.6 Sol이 2026년 7월 9일에 이전 세대의 플래그십으로 출시되었습니다. 두 제품 모두 아직 판매 중이고, 둘 다 여전히 호출 가능하며, 중립 보드에서 두 제품의 차이는 4.8점입니다 — Artificial Analysis의 Intelligence Index에서 51.8 대 47.0이며, 둘 다 동일한 10개 평가 제품군에서 최대 추론 노력으로 측정되었습니다. 가격 차이는 점수 차이보다 훨씬 큽니다: 완료된 지수 작업당 $0.72 대 $1.99, 그리고 백만 토큰당 $2.00/$10.00 대 $4.00/$20.00. 이것이 짧은 버전입니다. 긴 버전은 업그레이드가 균일하지 않으며 두 평가가 뒤로 이동했다는 것입니다.

각 모델이 무엇인지, 그리고 무엇이 무엇을 대체했는지

GPT-5.6 Sol은 5.6 라인의 정점이었습니다 — 폐쇄형, API 전용 모델로 1,050,000토큰 컨텍스트 창, 128,000토큰 출력 상한, 텍스트, 이미지 및 파일 입력, 그리고 다음으로 이어지는 추론 사다리를 갖추고 있었습니다: none부터 max. Open​AI는 이를 가장 어려운 작업을 위해 구축된 등급이라고 설명했습니다: 장기적 에이전트 워크플로, 다중 파일 소프트웨어 엔지니어링, 심층 추론 등이며, 그에 맞게 백만 토큰당 $4.00 및 $20.00, 캐시 입력 $0.40, 캐시 쓰기 $5.00으로 가격이 책정되었습니다. 272,000 입력 토큰을 초과하면 $8.00 및 $30.00으로 재책정되었고, 배치 등급은 $2.50 및 $15.00이었습니다.

GPT-6.1 Sol은 그 뒤에 나온 세대의 중간 등급으로, GPT-6 Astra 아래, GPT-6 Luna 위에 있으며, 이제 Open​AI가 비용에 민감한 개발자들에게 권하는 모델입니다. 1,050,000토큰 컨텍스트 창과 128,000토큰 출력 상한을 유지하고, 지식 컷오프를 2026년 4월 20일에서 4월 30일로 연장했으며, effort 사다리를 6단계에서 5단계로 줄였습니다 — low, medium (기본값), high, xhigh, max. none 값은 GPT-5.6 Sol이 허용했던 것이지만 이제 오류를 반환하며, Open​AI의 마이그레이션 안내는 대체 값이 low이며, 자동 업그레이드가 아니라고 분명히 밝히고 있습니다.

이 점은 잠시 짚고 넘어갈 만합니다. 이번 릴리스에서 비용을 절감하는 대신 오히려 돈이 드는 유일한 변경 사항이기 때문입니다. 저렴하고 빠른 비추론 호출을 얻기 위해 none을 선택했던 파이프라인은 이제 두 모델 계열 어느 쪽에서도 그런 구성을 사용할 수 없습니다. GPT-6.1 Sol에서 가장 저렴한 단계는 추론 단계이며, 추론 토큰은 보이든 보이지 않든 출력 토큰으로 청구됩니다.

사다리, 한 칸씩

독립 평가 위원회는 두 모델의 모든 노력 설정에 대해 점수와 실행 비용을 공개하며, 이는 정면 비교를 단일 비교보다 더 유용한 것으로 바꿔 줍니다. 동등한 설정끼리 나란히 맞추면:

• 에포트 단계, GPT-6.1 Sol — 최대 51.8, 인덱스 작업당 $0.72; xhigh 51.0, $0.39; high 50.2, $0.32; medium(기본값) 47.8, $0.21 • 출력 속도 — GPT-6.1 Sol은 초당 59.7토큰, GPT-5.6 Sol은 87.8토큰
• 첫 청크까지의 시간 — GPT-6.1 Sol은 332초, GPT-5.6 Sol은 더 빠른 수치, 보드 중앙값은 약 4초
• 인덱스 실행 시 출력 토큰 — GPT-6.1 Sol은 6,720만, GPT-5.6 Sol은 9,000만
• 입력 / 출력 가격 — $2.00 / $10.00 vs $4.00 / $20.00
• 캐시 입력 — $0.10 vs $0.40; 캐시 쓰기 $2.50 vs $5.00
• 배치 요금 — GPT-6.1 Sol은 공개되지 않음, GPT-5.6 Sol은 $2.50 / $15.00
• 롱 컨텍스트 단계 — 입력 토큰이 272,000개를 초과하면 GPT-6.1 Sol은 전체 요청에 대해 $4.00 / $15.00로 재책정되며, GPT-5.6 Sol은 $8.00 / $30.00
• 에포트 하한 — 낮음 vs 없음

그 목록에서 두 가지가 나옵니다. 첫째는 가격 인하가 프로모션이 아니라 구조적이라는 점입니다. GPT-6.1 Sol의 표준 요금 $2.00 및 $10.00은 GPT-5.6 Sol의 배치 요금 $2.50 및 $15.00보다 낮으므로, 구형 모델의 할인 등급조차 신형 모델의 정가보다 비쌉니다. 둘째는 이번 업그레이드가 지연 시간에서 선형적인 개선이 아니라는 점입니다. GPT-6.1 Sol은 출력을 약 3분의 1 더 느리게 생성하며, 보드의 장문 프롬프트 테스트에서 첫 청크까지 332초가 걸렸습니다. 이는 GPT-6 Sol의 107초와 같은 자릿수이고 보드 중앙값의 약 80배입니다. GPT-5.6 Sol로 인터랙티브 제품을 구축했다면, 이는 어떤 벤치마크와도 무관한 기능적 회귀이며, 해결책은 파라미터가 아니라 아키텍처에 있습니다.

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

두 개의 평가가 잘못된 방향으로 움직였습니다

종합 상승폭은 4.8점이다. 구성 요소들이 일률적으로 긍정적인 것은 아니며, 이사회의 평가별 점수도 이를 보여준다:

• SciCode — GPT-6.1 Sol 0.542 대 GPT-5.6 Sol 0.571. 과학 코딩에서 2.9포인트 퇴행.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 대 GPT-5.6 Sol Elo 1611.3. 경제적으로 가치 있는 지식 노동에서 36포인트 Elo 퇴행.
• Humanity's Last Exam — GPT-6.1 Sol 0.529 대 GPT-5.6 Sol 0.495. 3.4포인트 상승.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 대 GPT-5.6 Sol 0.399. 16포인트 상승으로, 이 비교 쌍에서 가장 큰 단일 변화.
• AA-Omniscience — GPT-6.1 Sol 41.5 대 GPT-5.6 Sol 22.0으로, 이는 단순한 기억 인출보다는 지식 신뢰성과 환각에 관한 것이다.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — 나머지 다섯 가지로, 이들이 종합 점수를 완성하며 나머지 4.8포인트 상승이 여기서 나온다.

터미널 작업에서 의미 있게 더 뛰어나고, 사실 신뢰성에서 상당히 더 뛰어나며, 과학 코딩과 전문 업무 Elo에서는 측정 가능하게 더 나쁜 모델은 엄밀히 더 나은 모델이 아니다. 그것은 프런티어의 다른 지점이며, 의도적으로 그 지점에 놓인 것이다: GPT-6.1 Sol에 대한 Open​AI 자체의 출시 프레이밍은 최대 점수가 아니라, 플래그십에 가까운 품질에서 완료된 작업당 비용이다. 당신의 워크로드가 SciCode형이거나 GDPval형이라면, 종합 수치는 당신에게 적용되는 수치가 아니며, 당신에게 적용되는 것은 그 성능 저하이다.

GPT-5.6 Sol은 여전히 공개된 장문맥 결과를 갖고 있습니다.

구형 모델이 신형 모델에는 없는 수치를 가진 유일한 부분은 GPT-6.1 Sol의 요금표가 바뀌는 컨텍스트 구간에서의 검색 정확도다. GPT-5.6 Sol은 256,000~512,000토큰 범위에서 91.5%의 공개된 MRCR v2 8-needle 결과를 보유하고 있다. GPT-6.1 Sol에는 공개된 대응 결과가 없으며, 272,000 입력 토큰을 초과하면 전체 요청의 요금이 입력 및 캐시 2배, 출력 1.5배로 다시 책정된다.

그 두 사실을 종합하면, 새 모델의 경제성이 가장 취약한 영역은 바로 기존 모델이 유일하게 문서화된 강점을 가진 영역이다. 절감 효과가 사라지는 것은 아니다 — 재가격된 티어의 $4.00와 $15.00은 GPT-5.6 Sol 자체의 롱컨텍스트 티어의 $8.00와 $30.00과 비교해 여전히 절반이다 — 하지만 반값이라는 이야기는 일반 워크로드에 관한 이야기이고, 롱컨텍스트 검색 파이프라인은 그런 것이 아니다. 그것이 당신의 워크로드라면, 공개된 91.5%를 내세운 $4.00 및 $20.00의 GPT-5.6 Sol이 계속 머무를 만한 방어 가능한 선택지다.

GPT-5.6 Sol의 다른 공개 결과는 그대로 유지되며, 일부 팀이 옮기지 않는 이유다: 웹 리서치 에이전트 부문 BrowseComp 90.4, Terminal-Bench 2.1은 88.8 및 88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0은 62.6. 이는 Open​AI가 보고한 수치이며, Open​AI를 대상으로 한 것이고, 7월에 보고되었다. 그 이후 달라진 점은 이제 평가 보드가 두 모델을 하나의 스위트에서 동일한 설정 세트로 점수화하며, 구형 모델은 종합 점수와 비용에서 밀린다는 것이다.

마이그레이션 자체는 문자열 변경이며, 단 한 가지 예외가 있습니다

동일한 공급업체, 동일한 API 표면, 순위에서 인접, 동일한 컨텍스트 윈도와 출력 상한 — 따라서 대부분의 스택에서 이는 모델 식별자와 절반으로 떨어지는 가격에 불과합니다. 예외는 구체적이므로, 전환하기 전에 짚고 넘어갈 가치가 있습니다.

코드에서 reasoning.effort를 none 또는 minimal로 설정하면, 저하되는 대신 실패하게 되며 low가 문서화된 대체값입니다. 트래픽이 입력 토큰 272,000개를 초과한다면, 절감 효과를 산정하기 전에 재가격이 적용된 티어를 확인하세요. 제품이 첫 토큰까지의 시간에 의존한다면, 출시하기 전에 측정하세요. 왜냐하면 해당 보드의 332초 수치는 반올림 오차가 아니기 때문입니다. 그리고 평가에 SciCode 형태나 GDPval 형태의 슬라이스가 포함되어 있다면, 종합 점수를 믿기보다 두 모델 모두에서 그 슬라이스를 실행하세요.

두 모델 모두 OrcaRouter에서 OpenAI 자체 정가로 제공됩니다 — GPT-6.1 Sol은 $2.00와 $10.00, 캐시 입력은 $0.10, GPT-5.6 Sol은 $4.00와 $20.00, 캐시 입력은 $0.40 — 패스스루 모델을 따르므로 OpenAI 가격 변경이 리셀러가 재협상한 후가 아니라 적용되는 당일 우리 측에 반영됩니다. 가격표가 마크업되지 않고 그대로 전달되기 때문에, 이 글의 계산은 여러분이 실제로 얻게 되는 계산입니다: 동일한 작업당 $0.72 모델, 동일한 반값 인하, 어느 쪽에도 플랫폼 프리미엄이 추가되지 않습니다.

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

두 모델을 하나의 엔드포인트 뒤에 두는 실질적인 이점은 비교가 계속 살아 있다는 것입니다. 새 트래픽은 GPT-6.1 Sol로 보내고, GPT-5.6 Sol은 구성 변경 하나만으로 폴백이자 장문 컨텍스트 경로로 유지하며, 자동 페일오버가 두 달 된 플래그십의 가용성과 Enterprise 지원이 아직 자리 잡는 중인 기간을 커버하도록 하십시오. 청구서를 절반으로 줄이면서 두 하위 벤치마크를 후퇴시키는 마이그레이션은 한 번 결정하고 잊어버릴 일이 아닙니다. 그것은 경로별로 결정할 일이며, 라우팅 계층이 바로 그것을 저렴하게 만들어 줍니다.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

각자가 속한 곳

• 일반 에이전트 및 터미널 작업 — GPT-6.1 Sol. Terminal-Bench 4.0에서 16점 앞서고 가격은 절반이라면 고민할 필요가 없습니다.
• 사실적 신뢰성, 검색 기반 답변 제품 — AA-Omniscience에서 거의 20점 격차를 보이는 GPT-6.1 Sol.
• 과학적 코딩 — 먼저 자체 평가를 확인하세요. 리더보드에는 2.9점의 성능 저하가 나타나지만, 종합 점수는 이를 드러내지 않습니다.
• 경제적으로 가치 있는 지식 노동 — 같은 주의가 필요합니다. GDPval-AA Elo 성능 저하는 36점입니다.
• 272,000개 토큰 초과 장문맥 검색 — GPT-6.1 Sol이 해당 구간에서 공개된 수치를 내놓기 전까지는 GPT-5.6 Sol.
• 상호작용형, 지연 시간에 민감한 인터페이스 — 마이그레이션 전에 측정하세요. 출력은 더 빠르지만 첫 토큰은 훨씬 느립니다.
• 가장 저렴한 비추론 호출 — 어느 쪽도 아닙니다. 그 구성은 이 제품군에서 더 이상 존재하지 않습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트