
GPT-6.1 Sol vs GPT-6 Sol: 일주일의 추가 작업으로 얻은 것, 그리고 얻지 못한 것
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
만약 GPT-6 Sol을 오늘 프로덕션에서 사용 중이고 GPT-6.1 Sol로 마이그레이션할 가치가 있는지 판단하려 한다면, 답은 전적으로 귀하의 비용 중 어느 쪽이 더 큰지에 달려 있습니다 — 그리고 두 모델은 답이 거의 "둘 다"가 되지 않도록 구축되었습니다. GPT-6 Sol은 2026년 9월 22일에 입력 토큰 100만 개당 $2.00, 캐시된 토큰 $0.20, 출력 $10.00에 출시되었습니다. GPT-6.1 Sol은 2026년 9월 29일에 입력 $2.00, 캐시 $0.10, 출력 $10.00에 출시되었으며, 더 낮은 추론 노력으로 복잡한 소프트웨어 엔지니어링 작업에서 공급업체가 보고한 6.4퍼센트포인트 향상을 보였습니다. 입력 및 출력 가격은 변하지 않았습니다. 캐시 요율은 절반으로 줄었습니다. 그 한 줄의 변화가 전체 재무적 근거이며, 나머지 모든 것은 이 릴리스 수명의 현 시점에서 정확히 한 출처에서 나오는 역량 논거입니다.
세 가지가 바뀌었습니다. 그중 하나는 법안입니다.
마케팅을 걷어내면 이 두 배포 간의 차이는 머릿속에 담아둘 수 있을 만큼 짧다.
• 캐시된 입력 — GPT-6.1 Sol에서는 백만 토큰당 $0.10, GPT-6 Sol에서는 $0.20. 주장이 아니라 측정된 수치이며, 산술로 드러나는 유일한 변화다.
• 벤더가 밝힌 성능 — OpenAI에 따르면 더 낮은 추론 강도와 비용으로 DeepSWE v1.1에서 6.4점 앞서고, 최대 강도에서 Terminal-Bench Science 0.1 점수는 두 배 이상, 최대 강도에서 OSWorld 2.0 오프라인 세트는 7점, 중간 강도에서 AutomationBench는 4.8점 앞서며, 의도적으로 오류를 유도하는 프롬프트 세트에서 사실 오류율은 11.4%에서 7.7%로 떨어진다. 이 모든 것은 재현되지 않았다.
• 추론 사다리 — GPT-6.1 Sol은 low, medium, high, xhigh 및 max를 지원하며, none은 지원하지 않는다. GPT-6 Sol은 여섯 가지를 모두 지원한다. 이것이 코드를 깨뜨리는 차이이며, 아무도 출시 글에 넣지 않는 바로 그 항목이다.
그 외의 모든 것은 동일하거나 거의 비슷합니다: 동일한 1,050,000토큰 컨텍스트 창, 동일한 128,000토큰 출력 상한, 동일한 $2.50 캐시 쓰기 요율, 동일한 272K토큰 재가격 책정 임계값—이 임계값을 넘으면 전체 요청이 입력 및 캐시에는 2배, 출력에는 1.5배로 청구됩니다—, 도구 호출을 위한 동일한 Responses-API 요구 사항, 그리고 동일한 파인튜닝 지원 부재. 지식 컷오프는 2026년 4월 20일에서 4월 30일로 이동했습니다 — 10일인데, 이는 재구축이라기보다 얼마나 큰 개조였는지를 알려주는 종류의 수치입니다.
캐시 라인이 보기보다 더 가치 있는 이유

절반으로 줄어든 캐시 읽기는 제품 리프레시의 선두에 내세우기에는 이상한 일이다. 에이전트 트래픽이 실제로 어떤 모습인지 보기 전까지는. 에이전트 루프는 매 턴마다 안정적인 접두사—시스템 프롬프트, 도구 스키마, 검색된 컨텍스트, 대화 기록—를 다시 전송하고, 긴 세션에서는 같은 접두사에 대해 수십 번에서 수백 번까지 요금이 청구된다. 바로 그 트래픽에서 캐시 요율은 더 이상 반올림 오차가 아니라 청구서의 지배적인 항목이 된다.
긴 에이전트 세션 하나의 수치를 계산해 보자. 40턴에 걸쳐 재사용되는 120,000토큰 프리픽스를 가정하면, 세션당 캐시된 입력 토큰이 480만 개이고, 여기에 적당한 150,000개의 새 출력 토큰이 더해진다. GPT-6 Sol에서는 캐시 읽기에 $0.96, 출력에 $1.50가 청구된다 — 세션당 대략 $2.46이다. GPT-6.1 Sol에서는 같은 세션이 캐시 읽기에 $0.48, 출력에 같은 $1.50가 청구된다: 약 $1.98이다. 세션당 차이는 48센트이며, 그것만으로는 결정을 내릴 만한 차이가 아니다. 한 달에 10만 세션에 걸쳐 곱하면 $48,000이 된다 — 그건 결정을 내릴 만하다.
두 가지 주의사항이 그것을 정직하게 유지합니다. 캐시된 읽기는 접두사가 실제로 적중할 때만 캐시 요율로 청구되므로, 실제 절감액은 적중률에 차이를 곱한 값이지 차이 자체가 아닙니다. 그리고 표준 요율이 적용되려면 접두사가 272,000 토큰 미만이어야 합니다: 그 선을 넘으면 전체 요청의 가격이 입력 및 캐시는 2배, 출력은 1.5배로 다시 매겨지며, 이는 접두사에서의 10센트 절감을 압도할 수 있습니다. 긴 컨텍스트 세션은 캐시 계산이 브로셔에 설명된 대로 보일 가능성이 가장 적은 경우입니다.
벤치마크 격차는 실재하며, 그것은 한 곳에서 비롯된다
OpenAI의 출시 게시물은 자사 평가에 대해 이례적으로 구체적이다. 이는 유리한 점이지만, 그 수치 하나하나가 벤더가 자사 모델을 채점한 결과라는 점은 불리한 점이다. 이들 전반에 걸친 패턴은 일관된다. 통용되는 비교는 언제나 GPT-6 Astra를 상대로 한 것이고, Astra와의 비교는 언제나 비용 비교다. DeepSWE v1.1에서는 약 5분의 1 비용으로 Astra와 동등하다고 주장한다. GDP.pdf에서는 작업당 약 5분의 1 비용으로 Astra의 최첨단 성능에 근접한다. OSWorld 2.0에서는 작업당 약 7분의 1 비용으로 Astra와 2.1점 차이다. 사실성에서는 작업당 5분의 1 미만 비용으로 Astra와 1.9점 차이다. 이는 초안 작성의 우연이 아니다. 그것은 제품 명제이며, 능력 리더십이 아니라 가격에 관한 명제다.
OpenAI가 자신의 프레이밍을 벗어나는 단 하나의 대목은 인정할 만하다: Terminal-Bench Science 0.1에서 OpenAI는 GPT-6 Astra가 테스트된 모델 중 여전히 최고 점수인 68.1%를 보유하며 가장 어려운 과학 연구에 사용해야 한다고 분명히 밝힌다. 더 비싼 형제 모델을 언제 사야 하는지 알려주는 출시 글은 어느 정도 규율이 담긴 출시 글이다.
특히 GPT-6 Sol에 대해서만 말하자면, 이 구성에서 비교의 정직한 현주소는 이렇습니다 — 두 모델 모두에 대한 독립적인 점수는 없습니다. Artificial Analysis는 최대 추론 노력에서 GPT-6 Sol을 완전히 평가했습니다: Intelligence Index 48, 인덱스 작업당 $1.06, 보드 중앙값 8,800만 개 대비 생성된 출력 토큰 7,700만 개, 그리고 작업당 $2.99의 Coding Agent Index 57. 9월 30일 기준으로 GPT-6.1 Sol 항목은 전혀 없습니다; 해당 모델의 슬러그는 404를 반환하고 그 문자열은 라이브 리더보드에 나타나지 않습니다. 따라서 오늘 이용 가능한 유일한 측정된 제3자 비교는 GPT-6 Sol과 다른 연구소 모델들 사이의 비교입니다 — GPT-6 Sol과 자체 후속 모델 사이의 비교가 아닙니다. 지금 여러분에게 6.1 대 6.0 차트를 보여주는 사람은 OpenAI의 슬라이드를 보여주는 것입니다.
마이그레이션은 문자열 변경이다. 그렇지 않은 경우만 빼면.
GPT-6 제품군에 대한 OpenAI 자체의 마이그레이션 지침은 식별자를 바꾸기 전에 읽어 볼 가치가 있습니다. 그 안의 두 가지 항목이 작동하는 코드를 망가뜨리기 때문입니다. 첫 번째는 추론 사다리입니다: 어떤 요청이 reasoning_effort: "none"을 보내면 GPT-6.1 Sol은 이를 거부하며, 문서화된 해결책은 low에서 시작해 가장 낮은 설정이 동등하다고 가정하기보다 대표 작업에서 비교하는 것입니다. none을 지연 시간 기준선으로 사용하던 워크플로는 그 기준선을 잃습니다. 두 번째는 도구 호출입니다: GPT-6.1 Sol은 Chat Completions를 지원하지만 이를 통한 도구 호출은 지원하지 않습니다 — 도구를 사용하려면 Responses API가 필요합니다. 스택이 /v1/chat/completions에서 함수를 호출한다면, 문자열을 바꾸는 것이 아니라 엔드포인트를 이식하는 것입니다. 이미 GPT-6 Sol을 사용 중인 개발자를 위한 공급업체 자체의 지침은 전환하기 전에 해당 지침을 검토하라는 것이며, 이는 일주일 간격이 시사하는 드롭인 업데이트가 아니라는 합당한 신호입니다.
나머지 매개변수는 다음과 같이 동작합니다: 추론 강도, 구조화된 출력, 스트리밍, 프롬프트 캐싱 및 도구 세트가 모두 그대로 유지되며, 동일한 272K 재가격 규칙이 두 모델에 동일하게 적용됩니다. model을(를) gpt-6.1-sol로 설정하고, 지원되는 곳에서는 강도 설정을 유지하고, temperature, top_p 및 top_logprobs을(를) 강도가 none이 아닐 때마다 제거하세요 — 마지막 항목은 두 모델 모두에 적용되며, 모든 추론 모델 마이그레이션 후 400 오류의 흔한 원인입니다.
프로덕션 경로를 그것에 걸지 않고 마이그레이션하기

현실적인 마이그레이션은 컷오버가 아니라 섀도 런입니다. 프로덕션 트래픽의 일부를 새 식별자로 보내고, 기존 식별자는 응답을 처리하는 경로로 남겨 둔 채, 자체 작업에서 비교하십시오. 이것은 라우팅 문제이며, 호출하는 플랫폼이 작업의 형태를 바꾸는 유일한 지점입니다. OrcaRouter는 오늘 GPT-6 Sol을 OpenAI의 자체 정가에 마크업 없이 제공합니다 — $2.00 / $0.20 / $10.00 카드, 272K 재가격 규칙 포함 — 따라서 비교의 베이스라인 암은 다른 모든 것과 동일한 키에서 라이브이고, 6.1 암은 호출 가능해지는 즉시 별도의 계약이나 별도의 SDK 없이 라우트 세트에 추가할 수 있습니다. 그때까지 정직한 입장은 GPT-6 Sol이 호출 가능한 모델이라는 것이며, 그렇지 않은 듯 암시하기보다 분명히 말할 가치가 있습니다: openai/gpt-6.1-sol은 오늘 저희 공개 카탈로그 엔드포인트에서 "model not found"를 반환합니다. 자동 장애 조치는 새 경로가 실제로 적용될 때 섀도 런을 안전하게 만드는 것입니다 — 새 경로에서 오류가 발생하면 요청은 기존 경로에서 완료되고, 사용자가 아니라 로그에서 알게 됩니다.
지금 움직여야 할 팀: 긴 에이전트 세션에서 캐시된 입력이 비용을 지배하는 팀, 그리고 워크플로가 이미 Responses API를 사용하며 none을(를) 절대 보내지 않는 팀. 그들에게 이것은 거의 무료 업그레이드에 가깝습니다 — 벤더는 기능 향상을 보고하고, 캐시 비율은 절반으로 줄어들며, 마이그레이션은 문자열 하나입니다. 기다려야 할 팀: 지연 시간이 중요한 경로에 none이(가) 있는 팀, 도구 호출이 Chat Completions를 통해 실행되는 팀, 그리고 확정하기 전에 OpenAI 외부의 수치가 필요한 모든 사람. 마지막 그룹의 경우 기다림에는 공개된 종료일이 없으며, 그 시간에 할 합리적인 일은 비교에 필요할 평가 세트를 구축하는 것입니다 — 독립적인 점수가 도착할 때 그것은 다른 누군가의 트래픽에 대한 것이기 때문입니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
