'GPT-5 Codex vs GPT-5.6 Sol — 코딩 전문가 vs 그것을 집어삼킨 플래그십' 타이틀 카드: 큰 네이비 헤드라인, 서브타이틀 줄, 그리고 두 개의 라운드 카드 — GPT-5 Codex ($1.25 / 100만 개당 $10 · 코딩 전문가) 및 GPT-5.6 Sol ($5 / 100만 개당 $30 · 플래그십 제너럴리스트) — 오른쪽 하단에 OrcaRouter 로고가 합성됨.
Guides & Insights

GPT-5 Codex vs GPT-5.6 Sol: 코딩 전문가 vs 그것을 삼켜버린 플래그십

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

O​penAI가 2026년 7월 9일에 G​PT-​5.6 제품군을 출시했을 때, 독립형 Codex 앱을 조용히 폐기하고 코딩 에이전트 모드를 ChatGPT에 통합했습니다. O​penAI가 GPT-5.6 Sol에 대해 작성한 모델 페이지는 코딩 전문가에게서 따온 직무 설명처럼 읽혔습니다 — "심층 다단계 추론, 대규모 소프트웨어 엔지니어링, 장기 지평 에이전트 워크플로우." 그래서 GPT-5 Codex와 GPT-5.6 Sol 사이의 대결은 일상적인 사양 대결이 아닙니다. 이는 전문가가 방금 자신의 제품 카테고리를 흡수한 주력 모델이 자신을 쓸모없게 만들었는지 묻는 것입니다.

짧은 대답은 '아니요'입니다. 하지만 그 이유는 "Codex가 여전히 좋다"는 것보다 더 흥미롭습니다. GPT-5 Codex는 API에서 계속 제공되며, 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $10입니다. 이는 CLI, IDE, GitHub 자동화에 맞춰 조정되고 독립적으로 측정된 점수를 보유한 특수 목적의 소프트웨어 엔지니어링 에이전트입니다. GPT-5.6 Sol은 입력 비용이 4배, 출력 비용이 3배 더 비싸며($5 / $30), 가장 최신의 범용 플래그십 모델로, 더 높은 코딩 수치를 보여주지만 대부분은 벤더가 보고한 수치입니다. 이 두 모델의 대결에서 실제로 중요한 것은 가격, 컨텍스트, 그리고 코딩을 잘하는 전문가와 범용 모델 간의 차이입니다. 아래의 모든 내용은 출처별로 표시되어 있습니다.

각 모델이 무엇인지

GPT-5 Codex는 모델 페이지에 명시된 그대로입니다: "소프트웨어 엔지니어링 및 코딩 워크플로우에 최적화된 GPT-5의 특수 버전"입니다. 2025년 9월에 출시되었으며, O​penAI 코딩 에이전트의 기반이 되는 API 모델입니다. 이 에이전트는 프로젝트를 처음부터 구축하고, 기능 작업을 수행하며, 대규모 리팩토링을 진행하고, 코드를 검토하고, 조정 가능한 추론 노력(reasoning-effort) 수준으로 다중 파일 변경을 계획합니다. 텍스트와 이미지 입력(UI 작업용 스크린샷)을 처리하며, 400K 토큰의 컨텍스트와 128K 출력 상한을 갖추고 있어 CLI, IDE 확장, GitHub, 클라우드 작업 등 에이전트형 코딩 애플리케이션을 명시적으로 대상으로 합니다.

GPT-5.6 Sol은 G​PT-​5.6 시리즈의 플래그십 등급으로, 2026년 7월 9일에 출시되었으며 지식 컷오프는 2026년 2월입니다. O​penAI가 가장 어려운 일반 작업에 투입하는 모델로, 심층 다단계 추론, 대규모 소프트웨어 엔지니어링, 장기 실행 에이전트, 컴퓨터 사용, 그리고 멀티 에이전트 '울트라' 추론 모드를 처리합니다. 컨텍스트는 1.05M 토큰으로 GPT-5 Codex의 2.6배이며, 동일한 128K 출력 상한을 갖고 텍스트, 이미지, 파일 입력을 지원합니다. Sol은 ChatGPT 내부에서도 실행되므로, 오늘날 O​penAI가 제품 측면에서 'Codex'를 언급할 때는 일반적으로 Sol이 에이전트형 코딩 작업을 수행하는 것을 의미합니다.

가격: 좁혀지지만 결코 닫히지 않는 4x/3x 격차

헤드라인 수치는 둘 다 공급업체 정가 기준입니다: GPT-5 Codex는 백만 토큰당 $1.25 / $10 (캐시 읽기 $0.125), GPT-5.6 Sol은 $5 / $30 (캐시 읽기 $0.50)입니다. 이는 입력 가격의 4배, 출력 가격의 3배입니다. 일상적인 코딩 하루에 천만 토큰을 입력/출력 75/25 비율로 사용할 경우, GPT-5 Codex는 약 $34, GPT-5.6 Sol은 약 $112가 청구됩니다. 그 차이는 이론상의 것이 아닙니다.

두 가지가 그 격차를 좁힙니다. 첫째, 캐싱: 두 모델 모두 캐시된 입력을 새 입력보다 훨씬 저렴하게 책정하며, 에이전트 루프는 동일한 저장소 컨텍스트를 끊임없이 다시 읽으므로 상당한 비율의 토큰이 저렴한 등급을 이용할 수 있습니다. 둘째, 효율성: O​penAI는 5.6세대가 이전 세대보다 약 54% 적은 출력 토큰으로 에이전트 작업을 완료한다고 주장합니다. Sol이 동일한 작업에 출력 토큰의 절반만 필요로 한다면 작업당 격차는 약 3.3배에서 약 2배로 줄어듭니다 — 이는 실질적인 절약이지만 4배의 입력 가격 차이를 없애지는 못하며, 독립적으로 측정된 것이 아니라 O​penAI가 보고한 효율성 주장입니다.

Sol은 또한 계층형 입력 가격을 제공합니다. OrcaRouter의 모델 페이지에서 기본 요금 $5/$30는 최대 32K 입력 토큰까지의 요청에 적용되며, 더 큰 요청은 상위 요금제인 $10/$45로 청구됩니다. 이것이 롱컨텍스트 세금입니다. 즉, 대형 저장소 에이전트가 만드는 바로 그 요청입니다. 따라서 실질적인 가격 비교는 표면적인 3~4배가 시사하는 것보다 훨씬 더 워크로드에 의존적입니다.

The OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the flagship description, $5.00 input / $30.00 output per 1M tokens, the 1.05M-token context window, and seven-day telemetry (p50 TTFT 3.82s, ~465 tok/s, 39.0M tokens/7d).

컨텍스트와 호출 방법

컨텍스트 격차는 두 번째 실질적 분기점입니다. 400K 토큰은 상당한 규모의 코드베이스를 포괄하며, Codex는 전문가로서 그 창 안에서 효율적으로 작동하도록 설계되었습니다. 하지만 1.05M 토큰의 Sol 컨텍스트는 모델에 넘겨줄 수 있는 범위를 바꿉니다. 전체 모노레포, 긴 에이전트 추적 기록, 온보딩 위키와 코드까지 포함할 수 있습니다. 전체 저장소를 한 번의 요청으로 제공하는 팀에게 더 큰 창은 '모델이 관련 파일을 볼 수 있는 것'과 '모델이 관련 파일과 이를 import하는 모든 것을 볼 수 있는 것' 사이의 차이를 만들어 줍니다. 이는 또한 $1.25 입력 토큰과 $5 입력 토큰의 차이이기도 하며, 그래서 컨텍스트 결정은 곧 비용 결정입니다.

두 모델 모두 동일한 두 가지 API 형태 — O​penAI Chat Completions와 Responses API — 를 지원하며, 둘 다 도구/함수 호출 및 구조화된 출력을 지원합니다. OrcaRouter에서는 둘 다 하나의 O​penAI 호환 엔드포인트 뒤에 있어, 둘 사이를 전환하는 것은 통합 변경이 아닌 모델 이름 변경입니다.

벤치마크가 엇갈리는 지점 — 그리고 정직성에 대한 메모

흥미로운 점은 두 모델이 거의 벤치마크를 공유하지 않는다는 것이다. GPT-5 Codex는 진정으로 독립적인 점수를 보유하고 있다: Artificial Analysis는 이를 Intelligence Index 36.1, Coding Index 38.9, Math Index 98.7, LiveCodeBench 84.0, SWE-Bench Verified 74.5%로 측정했다. GPT-5.6 Sol의 대표 수치들 — Terminal-Bench 2.1 88.8, max reasoning에서 Artificial Analysis Coding Agent Index 80, Agents' Last Exam 53.6 — 은 O​penAI가 출시 당시 공개한 것들로, 독립적인 평가 기관에 의해 재현된 적이 없다. "88.8 대 84.0"은 공정한 대결이 아니다. 한쪽 숫자는 검증을 거쳤고 다른 쪽은 제조사의 주장일 뿐이기 때문이다. 솔직히 요약하면: Sol은 한 세대 더 새로운 모델이고 상한선이 분명히 더 높지만, 두 모델이 가진 점수 중 독립 연구소가 검증한 유일한 코딩 점수는 더 저렴하고 오래된 전문가 모델의 것이다.

Comparison scoreboard for GPT-5 Codex vs GPT-5.6 Sol. Left column GPT-5 Codex: Input price $1.25/1M, Output price $10.00/1M, Context 400K, Released Sep 2025, Coding bench LiveCodeBench 84.0, Cache read $0.125. Right column GPT-5.6 Sol: Input price $5.00/1M, Output price $30.00/1M, Context 1.05M, Released Jul 2026, Coding bench Terminal-Bench 2.1 88.8, Cache read $0.50. Footer: 'Codex figures per Artificial Analysis; Sol figures OpenAI-reported.' OrcaRouter logo composited bottom-right.

O​penAI 자체가 이의를 제기하는 벤치마크도 있습니다. SWE-Bench Pro에서 GPT-5.6 Sol은 64.6%, Claude Fable 5는 80%로 선두를 달리고 있습니다 — 그리고 O​penAI는 이 벤치마크의 타당성에 공개적으로 의문을 제기했습니다. 그 벤치마크에서 흥미로운 신호는 점수가 아니라, 주요 벤더가 이제 자사의 낮은 점수는 벤치마크의 잘못이라고 주장한다는 사실입니다. 코딩 팀에게 이는 어떤 점수판이든(우리 것 포함) 신뢰하기 전에 자체 저장소에서 모델을 테스트해야 한다는 것을 상기시켜 줍니다.

속도: 트래픽 주의사항

OrcaRouter의 7일간의 텔레메트리에서 GPT-5.6 Sol은 3,900만 토큰의 트래픽에 대해 첫 토큰까지의 중앙값 시간이 3.82초, 초당 약 465개의 출력 토큰을 보여줍니다. GPT-5 Codex의 페이지는 여전히 텔레메트리를 "수집 중"입니다. 라우터를 통과하는 트래픽이 너무 적어서 아직 평균을 낼 것이 없습니다. 그 적은 트래픽 자체가 정보입니다. 시장의 눈에는 코딩 에이전트 API 작업이 이미 더 새로운 모델로 옮겨갔습니다. 이것은 GPT-5 Codex가 느리거나 고장 났다는 뜻이 아닙니다. "어느 쪽이 더 빠른가"는 실제 트래픽을 충분히 흘려보내기 전까지는 라우터 데이터로는 답할 수 없다는 뜻입니다.

어떤 것을 선택해야 할까요?

GPT-5 Codex를 선택하세요…

여러분의 워크로드는 진정으로 코딩 중심입니다: 코드를 편집하고, 풀 리퀘스트를 검토하고, 리팩터링하고, 테스트를 작성하며, IDE나 CLI 환경에서 작업하는 에이전트를 실행합니다. 여러분은 전문가의 집중력, 4배 더 저렴한 입력 비용, 그리고 이번 대결에서 유일하게 독립적으로 검증된 코딩 점수를 원합니다. 또한, OpenAI의 에이전틱 코더 의미론(추론 노력 노브, 도구 사용 루프)을 원하지만, 사용하지 않을 범용 능력에 플래그십 가격을 지불하고 싶지 않은 경우 GPT-5 Codex가 올바른 선택입니다.

GPT-5.6 Sol을 선택하세요, 만약…

당신의 작업은 코딩과 어려운 일반 추론, 장기 지평 에이전트, 컴퓨터 사용, 또는 파일 중심 입력을 혼합하거나, 아니면 모든 것을 위한 하나의 플래그십을 원하는 경우일 것입니다. 1.05M 컨텍스트, 멀티 에이전트 울트라 모드, 더 새로운 트레이닝, 그리고 ChatGPT 및 Codex 제품 통합은 모두 Sol에 유리합니다. 코딩 수치는 서류상 더 높고, 벤더가 신뢰하는 벤치마크에서 OpenAI가 출시한 최고의 코딩 에이전트입니다. 그 폭에 대해 토큰당 3~4배를 지불하고 있는 셈입니다. 토큰 효율성 이야기는 Sol이 실제로 이기는 작업에서 그 격차를 좁힙니다.

대답은 종종 둘 다입니다 — 작업별로 라우팅하세요

두 모델 모두 OrcaRouter에서 0% 마크업으로 제공되므로, 가장 강력한 구성은 애초에 선택 문제가 아닙니다. 코딩 관련 트래픽은 GPT-5 Codex(전문가용 $1.25 / $10)로 돌리고, 플래그십 수준의 폭넓은 역량이 필요한 작업만 $5 / $30인 GPT-5.6 Sol로 에스컬레이션하세요. 필요한 것은 API 키 하나, O​penAI 호환 엔드포인트 하나, 라우팅 시 모델 이름 변경, 그리고 공급자에게 일시적 장애가 발생했을 때의 자동 페일오버뿐입니다. 여기서 패스스루가 특히 중요한 이유는, 예산에 책정한 $1.25 / $10 및 $5 / $30가 공급자의 정가이므로 향후 O​penAI가 가격을 인하하면 발표 당일에 저희 엔드포인트에도 바로 반영되고, 라우팅 로직을 변경할 필요가 없기 때문입니다.

The OrcaRouter model page for GPT-5 Codex (openai/gpt-5-codex), showing the $1.25 input / $10.00 output per 1M pricing, the 400K-token context window, the description of the specialized software-engineering model, and 'Collecting...' telemetry placeholders on thin traffic.

이것이 제기하는 질문들

GPT-5.6 Sol이 GPT-5 Codex를 대체했나요?

제품에서는 그렇습니다. 독립형 Codex 앱은 5.6 출시 시점에 ChatGPT에 통합되었으며, Sol이 그곳에서 코딩 에이전트 모드를 구동하는 엔진입니다. API에서는 아닙니다. GPT-5 Codex는 여전히 자체 가격으로 제공되는 활성 모델이며, 많은 에이전트 파이프라인이 여전히 이를 실행합니다. 목적에 맞게 특화되어 있고 비용이 저렴하기 때문입니다.

솔의 코딩이 정말로 코덱스의 것보다 나은가요?

OpenAI가 공개한 수치로 보면, 그렇습니다 — Terminal-Bench 2.1에서 88.8 대 Codex의 LiveCodeBench에서 84.0 — 하지만 그것들은 서로 다른 벤치마크이고, Sol의 수치는 벤더가 보고한 반면 Codex의 수치는 독립적으로 측정되었습니다. 자신의 저장소에서 테스트하세요; 그것이 유일하게 의미 있는 점수입니다.

왜 아직도 GPT-5 Codex를 실행하는 사람이 있을까요?

가격과 적합성. Sol 입력 가격의 1/4 수준에서, 일반 플래그십의 폭넓은 기능이 필요 없는 전용 코딩 에이전트 파이프라인은 백만 토큰당 실질적인 비용을 절약하며, 전문가의 특화된 초점 덕분에 코딩 작업에 집중시키기 위한 프롬프트 조정도 줄어든다.

이 매치업이 생각해 볼 가치가 있는 이유는 OpenAI가 그 답을 자사 제품에 내장했기 때문입니다. 이 회사는 1년 동안 코딩 전문가 모델을 판매한 다음, 전문가의 왕관을 차지할 만큼 코딩을 잘하는 범용 플래그십에 그 모델을 흡수시켰습니다. 그러면서도 전문가 모델은 플래그십 가격의 일부만 받고 API에 남겨 두었습니다. 그것은 속임수가 아니라 '플래그십 비용을 지불하지 않고 코딩 에이전트를 원한다'는 요구를 위한 가격 하한선입니다. GPT-5 Codex는 저렴하고, 특화되었으며, 독립적으로 측정된 전문가 모델입니다. GPT-5.6 Sol은 더 새롭고, 더 광범위하며, 더 비싼 플래그십으로, 코딩 성능에 대한 주장은 직접 자신의 작업으로 확인해야 합니다. 대부분의 프로덕션 팀은 정직한 답이 둘 다라는 것을 발견할 것입니다. 둘 다 하나의 패스스루 엔드포인트에 있으므로, 둘 사이의 라우팅은 마이그레이션이 아니라 설정입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube