생성된 2열 비교 스코어보드로, 제목은 'GPT-6.1 Sol vs GPT-6 Luna - 스코어보드'입니다. 왼쪽 열 'GPT-6.1 Sol'에는 '지능 지수: 51.8', '지수 작업당 비용: $0.72', '1M당 가격: $2.00 / $10.00', '지수 실행 시 출력 토큰: 67M', 'Terminal-Bench 4.0: 56.1%', '노력 하한: 낮음'이라는 행이 있습니다. 오른쪽 열 'GPT-6 Luna'에는 '지능 지수: 38.1', '지수 작업당 비용: $0.07', '1M당 가격: $0.10 / $0.50', '지수 실행 시 출력 토큰: 144M', 'Terminal-Bench 4.0: 12.6%', '노력 하한: 없음'이라는 행이 있습니다. 바닥글에는 'Artificial Analysis v4.3.2 기준 최대 노력에서의 독립 수치; 벤더 정가.'라고 적혀 있습니다.
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: 13 지수 포인트, 10배의 비용, 그리고 그것이 성립하지 않는 두 가지 평가

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

OpenAI는 GPT-6.1 Sol을 9월 29일에 출시했으며, 이는 GPT-6 Luna가 같은 키노트 주기에서 9월 22일에 나온 지 일주일 후였습니다. 이들은 같은 세대의 양 끝입니다: Luna는 저렴한 등급이고, Sol은 그 위의 중간 등급이며, GPT-6 Astra는 둘 모두 위에 있습니다. 두 모델의 가격 차이는 10배입니다 — 백만 토큰당 $0.10와 $0.50 대 $2.00와 $10.00 — 그리고 독립 리더보드에서의 성능 차이는 최대 추론 강도에서 Intelligence Index 13.7포인트, 51.8 대 38.1입니다. 포인트를 얻기 위해 돈을 열 배 더 내는 것은 현재 OpenAI 라인업에서 거의 최악의 환율입니다. 이 비교를 글 쓸 가치가 있게 만드는 것은 이어지는 마흔 번째 질문입니다: 어느 13포인트인가?

두 모델, 그리고 그 사이의 일주일

GPT-6 Luna는 GPT-6 세대의 소형 모델로, OpenAI가 대량 처리와 지연에 민감한 작업—분류, 추출, 라우팅, 대량 요약, 에이전트의 내부 루프—을 위해 만들었다고 설명하는 모델입니다. 1,050,000토큰 컨텍스트 창과 128,000토큰 출력 상한을 갖추고, 텍스트, 이미지, 파일을 입력으로 받으며, 다음을 포함한 6단계 전체 노력 사다리를 유지합니다: none, 이는 6.1 등급에서 제외된 것입니다. 요금표가 이 모델의 존재 이유입니다: 100만 토큰당 입력 $0.10, 출력 $0.50, 캐시된 입력 $0.01, 캐시 쓰기 $0.125이며, 272,000 입력 토큰을 초과하는 장문 컨텍스트 구간에서는 $0.20, $0.75, 캐시된 경우 $0.02입니다.

GPT-6.1 Sol은 일주일 후 출시된 중간 등급 리프레시입니다. 동일한 윈도우, 동일한 출력 상한, 동일한 입력 모달리티, Luna의 것과 같은 2026년 4월 30일 지식 컷오프, 그리고 노력 단계의 시작 지점은 낮음왜냐하면 없음과 최소가 곧바로 거부되기 때문입니다. 가격은 $2.00 및 $10.00이며 캐시된 입력은 $0.10입니다 — Luna의 입력 요율의 20배, 출력 요율의 20배이고, 캐시 라인은 적중당 10배 더 비쌉니다.

둘 다 판매 중이고, 둘 다 ChatGPT Work와 Codex는 물론 API에서도 사용할 수 있으며, 둘 다 저희 쪽에서는 동일한 키로 호출할 수 있습니다. 이 조합은 선택을 필요로 하지 않습니다.

13개의 지수 포인트가 실제로 무엇을 사들이는가

종합 점수는 비교에서 가장 정보가 적은 숫자입니다. 매우 다르게 동작하는 작업들을 평균 내기 때문입니다. Artificial Analysis v4.3.2에서 최대 노력으로 평가별로 점수를 매기면, 모양은 기울기가 아니라 분할입니다:

• AA-LCR v1.1, 장문맥 추론 — GPT-6 Luna 0.833 vs GPT-6.1 Sol 0.830. Luna가 근소하게 앞섭니다.

• SciCode — GPT-6 Luna 0.546 대 GPT-6.1 Sol 0.542. 이번에도 사실상 동일한 수준이며, 이번에도 더 저렴한 모델이 명목상 앞서 있습니다.

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. 43점 격차로, 두 모델은 터미널 작업에서 서로 다른 리그에 속해 있습니다.

• 인류의 마지막 시험 — GPT-6 Luna 0.385 대 GPT-6.1 Sol 0.529.

• AutomationBench-AA — GPT-6 Luna 0.532 대 GPT-6.1 Sol 0.649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 vs GPT-6.1 Sol Elo 1575.1, 전문 지식 업무에서 138점의 Elo 격차.

• GDP.pdf — GPT-6 Luna 0.228 대 GPT-6.1 Sol 0.310.

• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0.65 vs GPT-6.1 Sol 41.5. 0이 정답 수와 오답 수가 같다는 것을 의미하는 척도에서, Luna는 수위선에 걸쳐 있고 Sol은 그보다 뚜렷이 위에 있습니다.

• MMMU-Pro — GPT-6 Luna 0.797 대 GPT-6.1 Sol 0.860.

• 인덱스 작업당 비용, 독립적 — GPT-6 Luna $0.068 vs GPT-6.1 Sol $0.72; 저렴한 모델이 약 10배 유리

• 인덱스 실행 시 출력 토큰 — GPT-6 Luna 1억 4,400만 대 GPT-6.1 Sol 6,700만, 클래스 중앙값은 Luna 1억, Sol 약 8,100만

평가 열 번 중 두 번은 저렴한 모델에 유리한 무승부입니다. 여덟 번은 비싼 모델의 승리로 돌아가고, 그 여덟 번 중 여섯 번은 격차가 근소하지 않습니다. 이것이 13점에 대한 솔직한 해석입니다. 그것은 균일한 품질 그라데이션이 아니라, Luna가 결코 동급의 모델이 아닌 두 가지 역량 — 지속적인 에이전트 실행과 사실 신뢰성 — 과, 차이가 실제로는 존재하지만 당신의 자체 평가 세트에서는 보이지 않을 만큼 작은 넓은 중간 지대입니다.

AA-LCR 결과에는 한 가지 주의할 점이 있습니다. 그것은 Luna를 가장 돋보이게 하는 수치이기 때문입니다. 0.833의 장문맥 추론은 강력한 점수이고 두 모델은 서로 0.5점 이내에 있습니다. 하지만 이 벤치마크는 긴 입력에 대한 검색과 추론을 측정하는 것이지, 긴 세션에 걸쳐 행동하는 능력을 측정하는 것은 아닙니다. Terminal-Bench 4.0에서의 격차는 '긴 세션에 걸쳐 행동하기'가 점수로 매겨질 때 어떤 모습인지를 보여주며, 그 폭은 43점에 달합니다.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

작업당 비용 산술, 그리고 그것이 더 이상 성립하지 않는 지점

Artificial Analysis는 각 인덱스 실행 비용을 측정된 토큰 소비량을 기준으로 산정하므로, 해당 비용 수치는 요금표를 통한 추론이 아니다. GPT-6 Luna의 실행 비용은 작업당 $0.068이었고, GPT-6.1 Sol의 비용은 $0.72였다. 비율은 10.7배로, 명목상 20배인 가격 비율보다 약간 나쁜데, 이는 Luna가 해당 실행에서 1억 4,400만 개의 출력 토큰을 생성한 반면 Sol은 6,700만 개를 생성했기 때문이다 — 저렴한 모델이 두 배 이상 말이 많아 자신의 이점을 잠식한다. 그럼에도 격차는 작지 않으며, 짧은 답변 작업에서는 더 벌어질 것이다: 출력량이 적으면 Luna의 장황함 페널티는 줄어드는 반면 가격 이점은 고정되어 있기 때문이다.

그 계산이 더 이상 들어맞지 않는 지점은, 해당 지수가 닮지 않은 모든 워크로드입니다. 작업이 일관성을 유지한 채 스무 번의 도구 호출을 필요로 하는 저장소 규모의 편집이라면, 작업에 실패하는 $0.07 모델은 재시도 루프 전체에 벽시계 시간까지 비용으로 지불하게 되고, 한 번에 끝내는 $0.72 모델이 더 저렴합니다. GPT-6.1 Sol의 출시 프레이밍 자체가 전적으로 이 아이디어, 즉 완료된 작업당 비용에 기반하고 있으며, 이것이 올바른 프레임입니다. 관련된 비교는 토큰 단가가 아니라 결과당 기대 비용이며, Luna가 완료할 수 없는 작업에서 그 기대값은 무한합니다.

두 가지 구조적 세부 사항이 경계를 더욱 선명하게 만듭니다. 첫째, 장문 컨텍스트 단계: 두 모델 모두 272,000 입력 토큰을 초과하면 가격이 다시 책정되어 Luna는 $0.20 및 $0.75로, Sol은 $4.00 및 $15.00로 오르므로, 경계에서 절대 격차는 좁혀지기보다 오히려 벌어집니다. 그러나 Luna의 재책정된 요율은 여전히 Sol의 표준 요율보다 한 자릿수 낮습니다. 둘째, 놓치기 쉬운 점: effort 사다리의 모양은 동일하지 않습니다. Luna는 none을 허용하지만 Sol은 허용하지 않습니다. 오류나 타임아웃 시 Sol로 먼저 라우팅하고 Luna로 폴백하는 캐스케이드는 요청의 reasoning.effort를 변경 없이 그대로 전달해서는 안 됩니다. 한 모델에서 유효한 구성이 다른 모델에서는 오류를 반환하기 때문입니다. 이는 모델 품질의 문제가 아니라 라우팅 계층의 문제이며, 라우팅 규칙이 있는 단일 엔드포인트가 흡수해야 하는 바로 그런 종류의 일입니다.

둘 다 운영하는 것이 핵심이지, 안전한 선택이 아니다

두 모델 모두 OrcaRouter에서 OpenAI 자체 정가로 제공되며 아무것도 더해지지 않습니다: GPT-6 Luna는 $0.10 및 $0.50, 캐시된 입력은 $0.01이고, GPT-6.1 Sol은 $2.00 및 $10.00, 캐시된 입력은 $0.10이며, 각 모델의 272,000토큰 구간은 공급업체가 명시한 그대로 정확히 전달됩니다. 플랫폼은 공급자 정가에 마진을 붙이지 않고 그대로 전달하므로, 이 글에 나오는 20배 비율은 양쪽 모두에서 실제로 지불하는 비율입니다.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

여기서 특히 중요한 이유는 이 조합이 아직 작성되기를 기다리는 캐스케이드이기 때문입니다. 분류기, 라우터, 대량 추출 작업, 그리고 저장소 규모의 코딩 에이전트는 같은 모델이 맡을 일이 아니며, 가격 차이가 워낙 커서 어느 방향으로 잘못 선택하든 비용이 큽니다. 한쪽 방향으로는 호출당 20배를 과하게 지불하고, 다른 방향으로는 작업이 실패하는 식입니다. 하나의 키, 두 개의 모델, 그리고 쉬운 트래픽은 Luna로 보내고 작업 클래스가 바뀌거나 Luna의 출력이 검사를 통과하지 못할 때 Sol로 에스컬레이션하는 규칙은 두 번째 벤더 계약이 아니라 우리 쪽의 구성 변경입니다. 자동 페일오버는 둘 중 하나가 성능 저하 상태일 때를 대비하는데, 8일 전에 출시된 모델의 경우 이는 여전히 실제로 일어날 수 있는 가능성입니다.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

결정, 한 번에

• 분류, 추출, 라우팅, 대량 요약, 에이전트 내부 루프 — GPT-6 Luna, 그리고 여기서 읽기를 멈춰라. $0.10/$0.50에 1센트 캐시 읽기라면, 답이 짧고 검증 가능한 작업에서 일반 역량의 13지수 포인트는 청구서 열 배를 지불할 가치가 없다.

• 레포지토리 규모 코딩, 터미널 에이전트, 다단계 실행 — GPT-6.1 Sol. Terminal-Bench 4.0의 43점 격차가 이를 모두 설명한다. 바로 이것이 그 가격이 사는 역량이다.

• 오답의 대가가 큰 지식 노동 관련 질문 — AA-Omniscience 및 GDPval-AA 격차에 관한 GPT-6.1 Sol. Luna의 사실 신뢰성 점수는 턱걸이 수준이다.

• 긴 입력에 짧은 생성 답변 — GPT-6 Luna. 20배 비용이 드는 모델과 동등한 수준으로 긴 컨텍스트를 추론하며, 1억 4,400만 토큰의 장황성 페널티가 적용될 기회조차 없다.

• 이미 none으로 설정된 항목이라면 — Luna에 그대로 머물거나, 변경을 위한 예산을 잡으세요. 그 단계는 GPT-6.1 Sol에는 없습니다.

• 지연에 민감한 영역 — 보드 자체 측정 기준으로 GPT-6 Luna는 초당 출력 토큰 129.4개, 첫 청크까지 100초인 반면 Sol은 59.7, 332를 기록했습니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트