생성된 히어로 타이틀 카드는 'GPT-6 Sol and GPT-6 Luna'라고 적혀 있고, 오버라인 'Model launch - September 2026' 아래에 있으며, 부제는 'Half the price per token is not half the cost per task.'입니다. 네 개의 칩에는 각각 'GPT-6 Sol: $2.00 / $10.00 per 1M', 'GPT-6 Luna: $0.10 / $0.50 per 1M', 'Sol: index 48 at $1.06 per task', 'Luna: index 37 at $0.07 per task'라고 적혀 있습니다. 그리고 각주에는 'Prices per OpenAI; index and cost per task per Artificial Analysis, Sept 22, 2026.'라고 되어 있습니다. 실제 OrcaRouter 로고가 오른쪽 하단에 합성되어 있습니다.
Guides & Insights

GPT-6 Sol과 GPT-6 Luna: 더 저렴한 토큰이 항상 더 저렴한 작업은 아니다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

벤더는 출시했다: GPT-6 SolGPT-6 Luna를 2026년 9월 22일에, 그리고 어디서나 헤드라인은 가격이다: Sol은 백만 입력 토큰당 $2.00, 출력은 $10.00, Luna는 $0.10과 $0.50, 둘 다 GPT-5.6 SolGPT-5.6 Luna가 현재 프로모션 요율로 부과하는 가격의 대략 절반이며, 둘 다 플래그십 GPT-6 Astra의 $10.00/$50.00보다 훨씬 아래에 있다. 벤더 자신의 발표문은 "우리는 또한 캐싱과 추론을 더 효율적으로 만들었다."라는 말로 시작한다. 그것을 할인 이야기로 읽는 데 따르는 문제는 실제로 청구서에 반영되는 단위가 토큰이 아니라는 점이다. 그것은 작업이다. 그리고 같은 날 발표된 첫 독립 측정치는 두 신규 모델이 바로 그 단위에서 서로 반대 방향으로 움직이고 있음을 보여준다 — 그중 GPT-6 Luna는 입력 기준으로 둘 중 20배 더 저렴한데도, 자체 전임 모델 대비 둘 중 더 나쁜 성적을 내고 있다. 이 모델들 중 하나는 순수한 업그레이드이고 다른 하나는 진정한 트레이드오프인데, 벤더의 발표는 이 둘을 구분하지 않는다.

숫자를 다루기 전에, 이 글의 출처 규칙을 밝힌다. 여기에는 매우 다른 비중으로 다뤄야 할 두 갈래 증거가 있기 때문이다. 가격, 컨텍스트 윈도, 캐시 요율, 지식 컷오프는 OpenAI 자체 API 문서와 가격표에서 가져왔으며, 2026년 9월 23일에 확인했다. 서비스 티어와 캐시 쓰기 항목은 발표문만 보고 가져온 것이 아니라 제3자 비용 추적기와 대조해 검증했다. OpenAI의 벤치마크 표 — AutomationBench, DeepSWE 1.1, OSWorld 2.0, Agents' Last Exam, 그리고 내부 사실성 평가 — 는 공급업체가 보고한 수치이며 재현되지 않았고, 아래에서 이 표들에서 가져온 모든 수치는 그렇게 표시했다. 독립적인 수치는 Artificial Analysis에서 나왔으며, 이 회사는 출시일에 두 모델을 자사의 Intelligence Index와 Coding Agent Index에서 실행했다. 의사 결정을 위해서는 이 수치들을 신뢰해야 한다. 두 수치가 서로 어긋나는 경우, 이 글은 둘을 평균 내지 않고 그 사실을 밝힌다.

한 문단으로 보는 출시

Sol과 Luna는 GPT-6 패밀리의 중간 및 하위 등급 모델로, GPT-6 Astra를 뒷받침한 방법으로 훈련되었으며 대부분의 성능에 더 빠르고 저렴하게 도달하는 방법으로 포지셔닝되었습니다. OpenAI가 강조하는 기준은 원시 성능이 아니라 작업당 비용입니다. OpenAI에 따르면 GPT-6 Sol은 자체 내부 사실성 평가에서 GPT-5.6 Sol보다 실수가 약 절반 수준이며, GPT-6 Luna는 더 높은 추론 노력에서 작업 비용이 약 100분의 1이면서 GPT-5.6 Sol의 사실성과 맞먹습니다. 둘 다 텍스트와 이미지 입력을 받아 텍스트를 생성하고, 둘 다 128K 출력 상한을 가진 1,050,000토큰 컨텍스트 창을 갖추고 있으며 — Artificial Analysis는 동일 모델에 대해 872k를 제시하므로 해당 창의 상한은 공급업체가 밝힌 것으로 간주하세요 — 둘 다 추론 노력을 none부터 max까지 노출합니다. 이는 GPT-6 Astra가 제공하지 않는 수준인데, Astra에는 none이 없기 때문입니다. 모델 ID는 gpt-6-solgpt-6-luna입니다. 이용은 API, Plus, Pro, Business, Enterprise 및 Edu 계정을 위한 ChatGPT Work와 Codex, 그리고 같은 날 두 모델 모두의 일반 제공을 발표한 Amazon Bedrock을 통해 가능합니다. 무료 및 Go 사용자는 데스크톱 앱에서 Luna를 이용할 수 있으며, 아직 어느 모델도 일반 Chat 모드에는 없습니다.

네 개의 독립적인 숫자가 말하는 것, 그리고 그것들이 서로 다른 이유

GPT-6 Sol부터 시작하겠습니다. 그 이야기는 단순하기 때문입니다. Artificial Analysis는 이 모델에 지능 지수 48점, 측정된 212개 모델 중 18위를 부여했으며, 지수 작업당 $1.06으로 GPT-5.6 Sol의 $1.99에 맞섭니다. 즉 동일한 지수 점수에 비용은 약 절반이고, 작업당 비용 개선은 사라지지 않고 그대로 유지됩니다. 코딩 에이전트 지수는 55에서 57로 상승하며, Terminal-Bench 4.0은 37%에서 43%로, SWE-Atlas-QnA는 54%에서 58%로 오르고, 파레토 프런티어에서 작업당 비용은 $2.99입니다. 환각률은 92%에서 60%로 떨어지고, 답변을 보류하는 행동은 양상이 완전히 달라졌습니다. 이전 세대가 99%의 질문에 답했던 반면 이제는 83%의 질문에 답하고, 그 대신 오답은 4분의 1 줄어들며 정확도는 59%에서 54%로 소폭 하락합니다. 이는 모르는 것에 대해서는 입을 다물도록 훈련된 모델이며, AA-Omniscience 지수가 22에서 27로 오른 것은 바로 그 사실을 점수로 표현한 것입니다.

이제 GPT-6 Luna의 차례인데, 이야기가 달라진다. Artificial Analysis가 매긴 점수는 인텔리전스 지수에서 37 — GPT-5.6 Luna가 받은 점수와 동일한 수치다. 지수 작업당 비용은 $0.18에서 $0.07로 떨어지며, 약 60% 절감이고 그 절감은 실재한다. 하지만 코딩 에이전트 지수는 43에서 41로 내려가고, SWE-Atlas-QnA는 49%에서 44%로, DeepSWE 1.1은 66%에서 64%로 하락한다. 환각률은 93%에서 77%로 개선되고, 답변 유보 행동은 거의 변하지 않는다 — 정확도는 44% 대 43%, AA-Omniscience는 −10에서 1로. 종합해서 읽으면: 동일한 측정 지능, 작업 비용은 약 40% 수준, 더 나쁜 코딩 에이전트, 그리고 사실상 변하지 않은 답변 품질이다.

그것은 모순이 아니며, 그 이유가 중요합니다. 더 저렴한 토큰이 더 적은 가치를 제공하는 것은 모델이 같은 작업을 끝내기 위해 더 많은 토큰을 쓸 때뿐입니다 — 그리고 독립적인 데이터에 따르면 이 모델들은 더 적게가 아니라 더 많이 씁니다. 인덱스 작업당 출력은 Sol의 경우 29k에서 31k 토큰으로, Luna의 경우 41k에서 51k로 증가했습니다. GPT-6 Luna의 60% 절감은 전적으로 가격 인하에서 나오며, 더 효율적으로 작동해서가 아닙니다. 작업당 토큰 드리프트는 여기서 산술이 여전히 당신에게 유리하게 작용할 만큼 작습니다; 그것은 범주로서 무시할 만큼 작지 않습니다, 왜냐하면 그것이 미래의 가격 인하가 더 수다스러운 모델에 의해 상쇄될 수 있는 메커니즘이기 때문입니다. OpenAI의 자체 프레이밍도 같은 이유로 작업당 비용으로 이동했습니다.

두 건의 성능 후퇴가 두 헤드라인 지수 밖에 자리하고 있으며, 이름을 붙일 만하다. 둘 다 OpenAI의 발표문에는 나오지 않기 때문이다. 지식 노동 산출물을 측정하는 GDPval-AA v2.1에서 GPT-6 Sol은 약 100 Elo를 전작 대비 잃고, GPT-6 Luna는 약 75를 잃는다. GPT-6 Luna는 45 Elo를 AA-Briefcase v1.1에서도 잃는데, 여기서 Sol은 안정세를 유지한다 — Artificial Analysis는 그 격차를 프레젠테이션 품질 저하와 누락된 평가 항목 탓으로 돌린다. 저렴한 등급을 대량 요약, 추출, 분류에 사용한다면, 그 어느 것도 당신에게는 해당하지 않는다. 사람이 결재하는 초안 작성에 사용한다면, 해당한다.

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-6 Luna - the scoreboard'. The left column, GPT-6 Sol, lists Intelligence Index 48, cost per index task $1.06, Coding Agent Index 57, hallucination rate 60%, GDPval-AA about 100 Elo lower, and price per million tokens $2.00 / $10.00. The right column, GPT-6 Luna, lists Intelligence Index 37, cost per index task $0.07, Coding Agent Index 41, hallucination rate 77%, GDPval-AA about 75 Elo lower, and price per million tokens $0.10 / $0.50. A footer line credits Artificial Analysis for the index, cost and hallucination figures as of September 22, 2026 and OpenAI for the prices. The real OrcaRouter logo is composited in the bottom-right corner.

캐싱 변경이 진짜 API 뉴스다

요금표 밑에 파묻혀 있는 변화는 헤드라인에서 내세운 인하보다 프로덕션 청구서에 더 중요한데, 그것이 바로 OpenAI 자체 게시물이 한 구절로 가리키는 발표의 부분이다. 세 가지가 바뀌었고, 세 번째는 두 번 읽어 볼 항목이다.

첫 번째는 할인 자체입니다: 캐시된 입력 읽기는 입력 요금의 10%로 청구됩니다. 즉 90% 할인이며, 이는 새로운 조건이 아니라 해당 패밀리가 이미 적용해 오던 것과 동일한 조건입니다. Sol의 캐시된 입력은 백만당 $0.20이고 Luna는 $0.01입니다. 캐시 쓰기에는 1.25배 프리미엄이 붙어 각각 $2.50과 $0.125이며, 단일 30분 TTL(유효 기간)을 가집니다.

두 번째는 제어입니다. prompt_cache_optionsprompt_cache_breakpoint을 통한 명시적 캐싱 — 재사용 가능한 프롬프트 접두사가 어디에서 끝나는지 공급자가 알아서 추측하기를 바라는 대신 직접 선언할 수 있게 해주는 매개변수 — 은 두 모델 모두에서 사용할 수 있습니다. 이것은 새로운 API 표면이 아닙니다. 새로운 점은 기본 적중률이 올라갔기 때문에 이제 이것을 쓸 가치가 생겼다는 것입니다.

세 번째는 아키텍처를 바꾸는 변화입니다. 추론 노력(reasoning effort)을 바꾸거나 도구를 켜고 끄는 것이 더 이상 캐시된 프리픽스를 무효화하지 않습니다. 이전에는 어려운 단계를 위해 노력을 높였다가 쉬운 단계를 위해 다시 낮추는 에이전트 루프가 다이얼을 돌릴 때마다 전체 컨텍스트를 다시 처리하는 비용을 치렀고, 대화 도중에 도구를 추가하거나 제거한 경우도 마찬가지였습니다. 그 비용은 이제 이 두 모델에서는 사라졌습니다. OpenAI는 GitHub를 인용했는데, GitHub는 이 변경으로 수십억 건의 요청에 걸쳐 새로 처리해야 하는 프롬프트 토큰 비중이 절반 이상 줄었다고 보고했습니다. 이는 벤더가 제공한 수치로 취급하세요 — 그럴듯하지만 독립적으로 감사된 것은 아닙니다.

긴 에이전트 루프에서 계산을 해보면 두 발표의 순위가 뒤집힌다. 30,000토큰 시스템 프롬프트와 도구 스키마를 200턴에 걸쳐 나르는 루프는 600만 토큰의 컨텍스트를 이동시킨다. 캐싱이 없으면 GPT-6 Sol에서 입력 비용은 $12.00이다. 프리픽스가 백만 토큰당 $0.20에 캐시되면, 일회성 쓰기 비용을 더해 $1.20이다 — 요금 인하가 전혀 적용되기 전에, 파라미터 변경만으로 10배 차이다. 발표가 판매한 것은 요금 인하다. 실제로 숫자를 움직이는 것은 캐시 동작이며, 이것이 바로 OpenAI가 이 모델들을 위해 제시하는 워크로드에서 $2.00의 헤드라인 요금이 훨씬 더 저렴한 것처럼 작동하는 이유다.

공지에서 빠뜨린 부분까지 포함한 요금표

대표 요금이 요금표의 전부가 아니며, 세 가지 등급이 특정 워크로드에 대한 결정을 바꿉니다.

Base — GPT-6 Sol 입력 $2.00 / 출력 $10.00; GPT-6 Luna 입력 $0.10 / 출력 $0.50, 백만 토큰당, 최대 272K 입력 토큰 프롬프트 기준.

긴 컨텍스트 — 272K 입력 토큰을 초과하면 전체 요청이 입력 2배, 출력 1.5배로 청구됩니다: Sol은 $4.00/$15.00, Luna는 $0.20/$0.75입니다. 이것은 한계 요율이 아니라 절벽입니다. 프롬프트가 300K 토큰에 달하면 초과분 28K가 아니라 전체 요청에 대해 두 배를 지불하는 것이며, 문서를 임계값 이하에서 두 번의 호출로 나누는 것이 임계값을 넘겨 한 번에 보내는 것보다 종종 더 저렴합니다.

서비스 등급 — Flex는 처리 속도가 느린 대신 요금을 절반으로 줄입니다(Sol의 경우 $1.00/$5.00, Luna의 경우 $0.05/$0.25). Priority는 요금을 두 배로 늘립니다. 둘 다 service_tier 매개변수를 통해 선택됩니다. Flex는 배치성 작업이 있어야 할 곳이지만 실제로는 거의 그렇지 않습니다.

캐시된 입력 — Sol에서는 백만 개당 $0.20, Luna에서는 $0.01로 90% 할인되며, TTL은 30분이고 캐시 쓰기 프리미엄은 1.25배입니다.

컨텍스트 및 출력 — 1,050,000 토큰 윈도우, 최대 128K 출력, 텍스트 및 이미지 입력, 텍스트 출력, 추론 강도 없음~최대, 기본값은 중간입니다.

지식 컷오프 — GPT-6 Sol은 2026년 4월 20일, GPT-6 Luna는 2026년 5월 18일로, 같은 제품군 안에서 한 달 차이가 납니다. 두 모델이 같은 세계관을 공유한다고 가정하기 전에 알아 둘 만한 사실입니다.

OpenAI의 벤치마크 표가 말하는 것과 말하지 않는 것

OpenAI가 공개한 비교는 모두 작업당 비용 기준이며, 모두 Anthropic을 상대로 한 것이고, 모두 벤더가 직접 실행한 것이다. 47개 도구를 사용하는 에이전트 평가인 AutomationBench 1.0.6에서 회사는 xhigh effort의 GPT-6 Sol이 작업당 $0.27로 33.2%를 기록한 반면, Claude Opus 5는 26.9%였고 작업당 비용은 약 11배라고 보고한다. DeepSWE 1.1에서는 max effort의 Sol이 68.8%를 기록했고 Claude Fable 5는 69.9%였으며 — 점수에서는 뒤지지만 작업당 비용은 약 80% 더 낮다 — Luna는 66.6%라고 보고한다. OSWorld 2.0에서 Sol은 xhigh에서 60.5%를 기록해 Opus 5의 60.3%와 비교되며, 역시 작업당 약 80% 더 적은 비용이다. Agents' Last Exam에서 Sol은 56.4%에 도달했으며, OpenAI는 이것이 작업당 비용을 60% 낮추면서 Opus 5의 최고 결과를 앞선다고 말한다.

그 수치들은 하나같이 벤더가 보고한 것이고 재현된 바 없으며, 두 가지 주의사항은 일단 접어두기보다 계속 염두에 둘 가치가 있다. 첫째, OpenAI는 발표 몇 시간 전에 출시된 Claude Opus 5.5가 아니라 Claude Opus 5를 기준으로 벤치마크했으므로, 어느 모델이 실제로 더 낮은 성공적인 작업당 비용을 제공하는지는 아직 동일한 하네스에서의 비교로 확립되지 않았다. 둘째, 작업당 비용은 정답 작업당 비용이 아니다. 83%의 경우에만 답하고 나머지는 유보하는 모델은 유보를 작업으로 계산하는 벤치마크에서 작업당 비용이 저렴해 보일 것이다. 위의 독립적인 유보 데이터가 바로 그것을 정직하게 산정할 수 있게 해준다 — 구 모델이 99%의 질문에 답하던 곳에서 GPT-6 Sol이 83%에 답하는 것은 의도적인 트레이드오프이며, 그것이 좋은 거래인지는 오답이 당신에게 얼마의 비용을 초래하는지에 전적으로 달려 있다.

OpenAI는 더 높은 노력 수준에서 GPT-6 Luna가 대략 작업 비용의 100분의 1로 GPT-5.6 Sol의 사실성과 일치한다고 보고한다. 이는 사실성 비교이지 능력 비교가 아니며, 독립적인 Coding Agent Index는 GPT-6 Luna를 두 점 차이로 아래GPT-5.6 Luna보다, GPT-5.6 Sol은 말할 것도 없이

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing the model's Intelligence Index of 48 alongside its cost per task and its output-token and speed figures for the measured reasoning-effort settings.

이걸 실제로 어떻게 해야 할까

GPT-6 Sol은 단순명료한 선택입니다. 레벨 인덱스 점수에서 작업 비용은 절반이고, 더 나은 코딩 에이전트, 할루시네이션의 대폭 감소, 응답 유보 행동의 실질적 변화가 더해져, 도박이 아니라 일정에 맞춰 진행할 수 있는 업그레이드가 됩니다. GPT-5.6 Sol을 사용 중이라면 이는 마이그레이션이며, 유일한 진짜 질문은 여러분의 프롬프트 중 어느 것이 모든 것에 답하려는 예전 모델의 의지에 의존하느냐입니다.

GPT-6 Luna는 이전하기 전에 시험해 볼 대상이다. 그것은 GPT-5.6 Luna보다 엄격히 더 나은 모델이 아니다. 형태가 다른 모델이다 — 작업당 더 저렴하고, 무엇을 주장할지에 관해 더 안전하며, 에이전트 코딩에서는 측정 가능하게 더 나쁘다. 대량 분류, 추출, 라우팅, 요약에서는 그 맞바꿈이 거의 공짜 이득에 가깝다. 코딩 에이전트에 입력되거나 사람이 승인하는 문서를 만들어 내는 모든 용도에서는, 두 모델 모두로 자체 작업을 돌려보기 전까지 GPT-5.6 Luna를 경로에 유지해야 하는 이유가 2점 Coding Agent 퇴행과 GDPval 하락이다.

그것이 둘 중 어느 하나를 하드와이어링하지 않아야 한다는 주장이기도 합니다. 현재 두 모델 모두 OpenAI 전용이며, 이 티어들이 처리하는 워크로드, 즉 라우팅, 추출, 저비용 분류야말로 동일한 엔드포인트 뒤에 두 번째 공급자를 두면 모델 회귀가 별일 아닌 일로 바뀌는 바로 그런 작업입니다. OrcaRouter는 공급자 정가를 0% 마크업으로 그대로 전달하므로, 벤더 요율 변경은 벤더 측에 적용되는 당일 우리 측에도 적용되며, 라우팅 DSL을 사용하면 쉬운 비중의 트래픽은 더 저렴한 모델 뒤에 GPT-6 Luna를 두고 더 어려운 비중은 GPT-6 Sol로 보낼 수 있으며, 어느 경로든 성능이 저하되면 자동 장애 조치가 이루어집니다. 출시 당일에 승자를 선택하지 않아도 그 출시의 혜택을 누릴 수 있습니다.

솔직한 단서: 2026년 9월 23일 기준으로 GPT-6 Sol과 GPT-6 Luna는 OrcaRouter를 통해 라우팅할 수 없습니다. 우리는 아직 이들을 호스팅하지 않으며, 위의 어떤 내용도 우리가 호스팅한다는 주장으로 읽혀서는 안 됩니다. 오늘 우리 쪽에 있는 것은 비교 세트입니다 — GPT-5.6 Sol은 $4.00/$20.00, GPT-5.6 Luna는 $0.20/$1.20, GPT-6 Astra는 $10.00/$50.00 — 이는 마이그레이션을 확정하기 전에 비용을 산정하는 데 꼭 필요한 것입니다.

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, captured 23 September 2026, showing the model id openai/gpt-5.6-luna with its context window, input and output pricing per million tokens, measured time to first token and recent traffic.

다음에 볼 콘텐츠

이번 출시가 실제로 무엇이었는지를 판가름할 세 가지가 있다. 첫째는 GPT-5.6 Luna의 $0.20/$1.20 요금이 이번 분기를 버텨내는지 여부다. 한 업체의 영구적인 가격은 역사적으로 그것의 끝이라기보다 서막인 경우가 많았기 때문이다. 그리고 같은 날 이루어진 Claude Opus 5.5 공개는 이번 인하를 만들어낸 압박이 사라지지 않았음을 시사한다. 둘째는 응답 회피로의 전환이 현장에서도 유지되는지 여부다. GPT-6 Sol이 여섯 질문 중 하나는 답변하지 않는 것은, 실험실에서는 개선으로 읽히지만 답변이 나올 것을 전제한 파이프라인에서는 고장 난 제품으로 읽히는 종류의 변화다. 셋째는 캐시 동작이 당신의 트래픽에서 실제로 나타나는지 여부인데, 이는 이번 주에 측정할 수 있으며 오직 측정으로만 답할 수 있다. 할인 폭이 충분히 크기 때문에, 가장 긴 프롬프트들의 캐시 적중률을 계측하는 데 한 시간을 쓰는 것이 또 하나의 벤치마크 표보다 더 가치 있다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트