
GPT-6 Luna vs GPT-5.6 Luna: 같은 이름, 절반 가격, 그리고 더 나쁜 결과물
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
두 모델은 한 단어를 공통으로 갖고 있고, 독립적인 점수는 사실상 동일하다. GPT-6 Luna는 Artificial Analysis Intelligence Index에서 37.26에 도달했고, GPT-5.6 Luna는 37.32에 도달했습니다. 0.07점 차이는 측정값이 아니라 노이즈이며, 이 조합에 관한 가장 중요한 단일 사실입니다. 두 모델을 가르는 것은 능력이 아니라, 완료된 인덱스 작업당 $0.0681 대 $0.1783이라는 비용, 그리고 가격 인하가 언급하지 않는 일련의 지식 노동 관련 성능 퇴행입니다.
날짜는 숫자를 읽는 데 중요합니다. GPT-5.6 Luna는 2026년 7월 9일 출시되었으며, 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20이었습니다. GPT-6 Luna는 2026년 9월 22일 출시되었으며, $0.10과 $0.50이었습니다. 이는 입력 요금의 정확히 절반이고 출력 요금은 58% 인하된 것으로, OpenAI는 이를 프로모션이 아니라 영구적인 가격이라고 설명해 왔습니다. 이는 분명한 인하이며, 동시에 이야기의 작은 절반에 불과합니다. 더 큰 절반은 최신 모델이 같은 모델의 가격을 다시 매긴 것이 아니라 다른 모델이라는 점입니다.

마이그레이션이 실제로 가져오는 것, 숫자로 보기
마이그레이션을 좌우하는 기준들 위에 두 가지를 나란히 놓고 보면 그 양상은 고르지 않다. 어떤 항목은 개선되고, 어떤 항목은 퇴보하며, 하나는 크게 개선된다.
• 가격 — GPT-6 Luna는 백만 토큰당 입력 $0.10 / 출력 $0.50, GPT-5.6 Luna는 $0.20 / $1.20. 입력은 절반, 출력은 58% 인하.
• 캐시된 입력 — $0.02 대비 백만 개당 $0.01. 절반으로 줄어든 기준에 동일한 90% 할인이 적용되므로, 반복되는 프리픽스 비용은 7월 비용의 절반입니다.
• 완료된 작업당 비용 — 동일한 스위트에서 $0.1783 대비 $0.0681. 작업 구성이 동일하지 않으므로 토큰 가격 인하보다 더 큰 62% 감소입니다.
작업당 출력 토큰 — 50,537 대 41,235. 새 모델은 완료된 작업당 23% 더 수다스럽고, 출력의 78%는 응답에는 전혀 나타나지 않는 추론입니다.
• 컨텍스트 윈도우 — 1,000,000 대비 1,050,000 토큰. 실질적인 상한은 동일하며, 둘 다 출력을 128,000 토큰으로 제한합니다.
• 유보 — AA-Omniscience에서 환각률이 92.6% 대비 76.7%입니다. 이는 이 세트에서 단일 최대 개선이며, 지식의 향상이 아닙니다: 정확도는 42.7%에서 43.8%로 움직여 사실상 제자리걸음입니다. 더 새로운 모델은 지어내는 대신 답변을 유보하는데, 이는 역량의 변화라기보다 행동의 변화입니다.
• 지식 노동 산출물 — AA-Briefcase v1.1은 1,345.38 Elo에서 1,299.23으로, GDPval-AA v2.1은 1,443.14에서 1,367.09로 하락합니다. 둘 다 각각 약 46점, 76점 하락했습니다.
• 코딩 및 장기적 작업 — Terminal-Bench 4.0은 11.6%에서 12.6%로, SciCode는 53.6%에서 54.6%로 상승하며, 여기서 상승하는 두 행입니다. 이와 대조적으로 Coding Agent Index는 43에서 41로 하락하고 SWE 스타일 에이전트 평가도 같은 방향으로 움직입니다.
• AutomationBench-AA — 53.2% 대 50.2%. 상승했으며, 이 세트의 다른 어떤 에이전트 지표보다도 상승 폭이 큽니다.

회귀는 추론이 아니라 아티팩트에 있습니다.
마지막 두 행에서 나타난 패턴은 이름을 붙일 가치가 있습니다. 그것이 바로 결정의 전부이기 때문입니다. 새 모델은 단일 단계 에이전트 작업은 더 잘하지만, 완성된 문서를 돌려주는 일은 더 못합니다. Artificial Analysis는 지식 노동 성과의 하락을 사실 관계나 추론의 실패보다는 프레젠테이션 품질과 필수 루브릭 요소를 빠뜨린 산출물 탓으로 돌립니다. — 이는 정확히 스모크 테스트는 통과하지만 리뷰에서는 실패하는 종류의 회귀입니다.
두 가지 사실을 종합해 보면, 마이그레이션은 출력을 소비하는 주체에 따라 깔끔하게 갈린다. 파이프라인이 구조화된 출력 — JSON, 분류, 추출된 필드, 라우팅 결정 — 을 읽는다면, 표현 품질 저하는 아무런 비용도 들이지 않고, 답변 보류 개선은 실질적인 이득이며, 62% 작업 비용 절감은 온전히 실현된다. 사람이 결과물 — 보고서, 메모, 고객 대면 문서 — 을 읽는다면, 더 새로운 모델은 당신이 비용을 지불하는 바로 그 부분에서 측정 가능할 만큼 더 나쁘고, 그 절감분은 당신에게 검토자를 한 명 사주는 셈이다.
기권 수치도 같은 대우를 받을 만하다. 모르는 것의 93%에 대해 지어내던 모델이 77%로 줄어드는 것은 가드레일, 컴플라이언스 심사, 또는 확신에 찬 오답이 전파되는 모든 파이프라인 입장에서 실질적으로 다른 대상이다. 그 개선은 실재하고, 독립적으로 측정되었으며, 작업을 새 모델로 옮겨야 한다는, 가격에 전혀 좌우되지 않는 가장 강력한 논거다.
코드에서 무엇이 바뀌고, 무엇이 바뀌지 않나요?
이 정도 규모의 가격 인하가 시사하는 것보다는 적은데, 이것이 좋은 소식이다. 컨텍스트 윈도는 같은 등급이고, 최대 출력은 128,000 토큰으로 동일하며, 이 제품군의 장문 컨텍스트 재가격 조항도 그대로다: 입력 토큰이 272,000개를 초과하는 요청은 입력 및 캐시 요율의 2배, 출력의 1.5배로 청구되며, 이는 기준선을 넘는 부분이 아니라 요청 전체에 적용된다. GPT-5.6 Luna에서 300,000 토큰일 때 비쌌던 요청은 GPT-6 Luna에서도 비싸다 — 요율은 절반이지만 절벽은 그대로이므로, 7월에 분할했어야 할 워크로드는 지금도 분할해야 한다.
에포트 사다리는 비용이 아니라 동작이 달라지는 지점입니다. GPT-6 Luna는 none, low, medium(기본값), high, xhigh, max를 제공하며, 기본값이 중요합니다. 한 모델의 기본 에포트에 맞춰 튜닝된 파이프라인이 다른 모델에도 자동으로 튜닝되는 것은 아닙니다. 설정을 명시적으로 고정한 팀은 영향을 받지 않습니다. 기본값을 사용한 팀은 7월과 다른 구성을 실행하고 있으며, 눈에 보이는 증상은 품질이 아니라 토큰 볼륨으로 나타날 것입니다.
한 가지 함정은 새 모델에서도 사라지지 않기 때문에 다시 언급할 가치가 있습니다. Chat Completions 엔드포인트에서는 reasoning effort가 none으로 설정된 경우에만 함수 호출이 작동합니다. 다른 모든 effort 레벨과 모든 내장 도구는 Responses API가 필요합니다. 모델 문자열을 변경하여 도구 호출 루프를 이식하는 팀은 기본 medium effort에서 도구가 조용히 사용 불가능해지는 것을 발견하게 될 것이며, 해결책은 매개변수가 아니라 호출 표면을 다시 작성하는 것입니다.
오늘 라우팅할 수 있는 것과 없는 것
이것은 벤치마크와 아무 관련이 없는 마이그레이션의 일부입니다. GPT-5.6 Luna는 OrcaRouter에서 정가로 제공됩니다 — 입력 100만 토큰당 $0.20, 출력 100만 토큰당 $1.20, 1,000,000토큰 컨텍스트 윈도우, 최대 출력 128,000토큰, 그리고 자체 모델 페이지의 실제 트래픽에서 측정한 첫 토큰까지의 p50 시간 1.60초입니다. 당사는 제공업체의 정가를 마진 없이 그대로 전달합니다, 따라서 OpenAI가 이 제품군의 가격을 변경한 날 그 변경은 다음 청구 주기가 아니라 당사 쪽에서 즉시 반영되었습니다.

2026년 9월 23일 현재 GPT-6 Luna는 OrcaRouter를 통해 라우팅할 수 없습니다. 사용 가능한 곳은 OpenAI 자체 API와 이 제품군을 제공하는 클라우드 카탈로그들이며, 우리는 서비스할 수 없는 모델을 목록에 올리지 않습니다. 실질적인 결과는 이 마이그레이션을 계획하는 팀이 오늘 가격은 옮길 수 있지만 오늘 라우팅은 옮길 수 없다는 것입니다 — 변경의 두 절반이 서로 다른 날짜에 반영됩니다.
그 사이에 그것이 가능하게 하는 것은 대부분의 팀이 어차피 결국 원하게 될 구성이다. 산출물 자체가 제품인 경로에는 GPT-5.6 Luna를 유지하고, 출력이 코드에 의해 소비되는 곳에는 GPT-6 Luna를 실행하며, 그 경계를 재작성이 아니라 티어로 취급하라. 접근할 수 있는 모델들이 동일한 키로 200개 이상의 모델과 제공자 간 자동 장애 조치를 지원하는 하나의 엔드포인트 뒤에 있기 때문에, 티어를 추가하거나 제거하는 일은 두 번째 통합이 아니라 구성 항목 하나이며 — 에스컬레이션 경로는 더 이상 단일 모델의 가용성에 의존하지 않게 된다.
마이그레이션 결정, 명확히 밝히다
출력이 기계로 판독되고 성공 조건이 검증 가능한 곳으로 작업을 옮기세요. 분류, 추출, 라우팅 결정, 가드레일 호출, 대량 변환 패스, 단일 단계 에이전트 작업은 모두 여기에 해당합니다. 종합 점수는 그대로이고, 답변 보류 동작은 실질적으로 더 나아졌으며, 작업 비용은 약 62% 줄었습니다. Batch가 표준 요금의 절반이고 캐시된 입력이 절반으로 인하된 기본 요금의 10분의 1이라면, 7월에는 간신히 손익분기였던 파이프라인도 이제는 수월하게 운영할 수 있습니다.
사람이 산출물에 최종 승인을 하는 작업을 옮기지 말고, 코딩 에이전트 경로를 맹목적으로 옮기지도 마십시오. AA-Briefcase의 46점 하락과 GDPval의 76점 하락은 2점의 Coding Agent Index 하락과 같은 방향을 가리키는 작은 숫자이며, Artificial Analysis가 설명하는 실패 모드 — 루브릭 요소 건너뛰기, 약화된 프레젠테이션 — 는 자동 검사에 보이지 않습니다. 완성도가 산출물인 경우에는 이전 모델을 유지하십시오.
그리고 0.07점 차이의 지수 동점을 그 자체로 하나의 발견으로 다루십시오. 이것은 더 낮은 가격에 더 똑똑한 모델이 아닙니다. 이것은 더 낮은 가격에 형태가 다른 모델이며, 마이그레이션 계획이 답해야 할 질문은 어느 점수가 더 높은가가 아니라 귀하의 워크로드가 어떤 형태를 소비하는가입니다. 왜냐하면 독립적인 기록상 그 두 점수는 같은 숫자이기 때문입니다.
