GPT-5.6 Luna Max-1
Guides & Insights

GPT-5.6 Luna Max: 개발자들은 Codex에서 실제로 어떻게 사용할까 — 그리고 어디에서 한계가 드러날까

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

8월 1일, 네 줄짜리 설정 파일 하나가 X에서 돌기 시작했습니다. 이 파일은 luna_worker라는 Codex 에이전트를 만들고, 모델을 gpt-5.6-luna로 설정하며, 추론 강도를 max로 두고, GPT-5.6 Sol이 계획을 맡는 동안 당신 작업의 지루한 절반을 그 에이전트에 넘깁니다. 며칠 만에 같은 레시피가 영어, 중국어, 일본어, 한국어, 스페인어, 아랍어로 다시 올라왔고, 같은 아이디어로 만든 플러그인은 나흘 만에 GitHub 스타 1,300개를 넘겼습니다. 또한 그것은, 대략 그것이 바이럴된 바로 그날, 잘못된 연결 방식이기도 했습니다: 그 플러그인 제작자는 동료가 그것이 Codex 서브에이전트로는 작동하지 않는다고 말하자 48시간 안에 자신의 프로젝트에서 GPT-5.6 Luna를 공개적으로 빼냈고, 이틀 뒤에는 완전히 다른 방식으로 연결해 다시 넣었습니다.

그 전체 흐름은 일주일 안에 일어났고, 그것은 누구든 이 모델에 대해 발표한 것 중 가장 유용한 것이다. 그것은 저렴한 노동자 패턴이 실재한다는 것, 그것을 연결하는 뻔한 방식은 잘못된 방식이라는 것, 그리고 그 둘 사이의 차이가 가치의 대부분이라는 것을 알려준다. 이 글에서 기법에 관한 모든 내용은 2026년 7월 30일과 8월 5일 사이에 실무자들이 자신의 결과를 게시한 데서 나온 것이지, 회사의 문서에서 나온 것이 아니다. 그 문서는 GPT-5.6 Luna를 "비용에 민감한 대용량 워크로드"를 위한 모델이라고 설명하며 이에 관한 어떤 것도 말하지 않는다. 수치가 독립적인 제3자에 의해 측정된 경우에는 그렇게 밝히고, 한 개발자의 세션 로그인 경우에도 그렇게 밝히며, 그것들이 서로 모순될 때도 포함한다. 실제로 아주 많이 모순된다.

"Luna Max"란 무엇이며, 왜 대부분의 사람들은 그것을 결코 보지 못하는가

Luna Max라는 모델은 없습니다. 두 개의 다이얼이 있고, Luna Max는 그 두 다이얼의 조합 중 하나입니다: GPT-5.6 패밀리에서 가장 저렴한 티어를 가장 깊은 추론 설정으로 실행한 것입니다. 티어 다이얼은 GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna 중에서 선택합니다. effort 다이얼은 none, low, medium, high, xhigh, max의 여섯 단계가 있으며, 모델이 답하기 전에 얼마나 많이 생각할지를 제어합니다.

거의 아무도 저렴한 등급과 심층 설정을 함께 사용하지 않았는데, 그 이유는 아주 사소한 것이었습니다: max는 기본적으로 숨겨져 있습니다. ChatGPT/Codex 데스크톱 앱에서는 설정 → 구성 → 사용 가능한 추론 강도 뒤에 숨어 있는데, 목록에는 최상위 옵션이 체크 해제된 상태로 제공됩니다. 8월 첫째 주에 여섯 명의 개발자가 각각 동일한 세 번 클릭 해결법을 게시했는데, 이는 얼마나 많은 사람이 Luna를 기본 깊이로 실행하면서 그걸 기준으로 모델을 평가해 왔는지를 잘 보여줍니다. API 쪽에서는 찾을 수 있는 토글이 없습니다: 모델 id gpt-5.6-luna를 전달하고 요청 본문에서 추론 강도를 max로 설정하면, 그게 전부입니다.

벤치마크를 읽기 전에 새겨둘 만한 결과가 하나 있습니다: Artificial Analysis가 이 모델의 지능 점수를 공개할 때, 그 페이지의 제목은 GPT-5.6 Luna (max)입니다. Luna에 대해 모두가 인용하는 독립적인 수치는 최대 노력(max-effort) 구성에서 나온 값입니다. 계속 기본값으로 실행하면서 자신의 경험이 왜 리더보드와 맞지 않는지 궁금했다면, 그 이유가 바로 이것입니다.

아무도 설명해 주지 않는 다이얼: effort는 토큰 가격이 아니라 토큰 수를 바꾼다

추론 노력(reasoning effort)을 높여도 더 비싼 가격 구간으로 이동하지는 않습니다. GPT-5.6 Luna는 모든 노력 설정에서 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20입니다. 달라지는 것은 모델이 답에 도달하기까지 소비하는 토큰 수이며, 최대 설정에서는 그 양이 매우 많습니다.

Artificial Analysis는 자사의 Intelligence Index를 실행하는 과정에서 이를 측정했으며, 그 수치들은 실무자들이 불만을 제기해 온 것에 대한 가장 명확한 독립적 확인입니다:

• 점수 — Artificial Analysis Intelligence Index에서 51점을 기록했으며, 해당 등급에서 벤치마킹하는 모델들의 중앙값은 17입니다.

• 장황함 — 인덱스 실행 동안 130M개의 출력 토큰이 생성되었으며, 이는 중앙값 61M과 대비됩니다. Artificial Analysis는 이 모델을 "매우 장황함"이라고 표시합니다.

• 순수 속도 — 초당 182.5 출력 토큰, 163개 모델 중 16위. 토큰당 빠름.

• 첫 토큰까지 걸리는 시간 — 최대 노력 시 약 136초로, Artificial Analysis는 이 가격대의 추론 모델 중에서도 높은 편에 속한다고 지적합니다.

• 총 지출 — 전체 지수에 대해 모델을 평가하는 데 $174.06이 소요됩니다.

세 번째와 네 번째 줄을 함께 읽어 보세요. 그 한 쌍이 사용자 경험의 전부이기 때문입니다. Luna는 최대 설정에서 토큰을 빠르게 스트리밍하지만 시작하는 데 몇 분이 걸리고, 그다음에는 같은 작업에서 일반적인 모델의 약 두 배에 달하는 토큰을 생성합니다. 그래서 현장 보고에서 가장 흔한 불만이 "틀렸다"가 아니라 "느리다"인 것이며, 저렴한 가격이 비례적으로 저렴한 세션으로 이어지지 않는 이유이기도 합니다. 당신은 높은 토큰 수에 대해 낮은 요율을 사고 있는 셈입니다.

대조적으로: GPT-5.6 Luna에 대한 저희 자체 모델 페이지에서는 실제 트래픽 7일 동안 관측된 첫 토큰까지의 중앙값 시간이 1.78초이고, 95번째 백분위수는 9.26초입니다. 이는 136초라는 수치와 모순되지 않습니다. 동일한 모델을 다양한 effort 설정 전반에서 측정한 것이며, 그중 대부분은 max가 아닙니다. 여러분이 얻게 되는 지연 시간은 호출하는 엔드포인트의 속성이 아니라, 여러분이 설정한 다이얼의 속성입니다.

GPT-5.6 Luna Max-2

Luna Max는 정말 "Sol Medium의 6분의 1 가격"인가요?

이것은 그 패턴을 널리 퍼뜨린 주장이며, 그 시작은 댄 맥아티어에게 있다. 그는 Luna를 최대 추론으로 돌리면 GPT-5.6 Sol 중간 설정, 또는 Claude Opus 5 중간 설정 정도에 도달하면서 비용은 대략 6분의 1이라고 표현했다. 많은 계정이 이를 반복했고, 때로는 유보적인 단서들을 잘라낸 채였다. 따라서 측정된 것과 단지 느낌인 것을 구분해 볼 가치가 있다.

독립적인 스코어보드는 해당 주장의 비용 측면은 강하게 뒷받침하지만, 성능 측면은 일부만 뒷받침한다. 각 등급에서 동일한 벤치마크 스위트를 최대 노력으로 실행했을 때, Artificial Analysis는 Luna를 지수 51, 비용 174달러로, Terra를 지수 55, 비용 1,403달러로, Kimi K3를 지수 57, 비용 2,437달러로, Sol을 지수 59, 비용 2,824달러로 기록했다. Luna는 Sol보다 지수 8점 뒤처지지만, 같은 작업을 처리하는 데 드는 비용은 약 16분의 1이다.

GPT-5.6 Luna Max-3

독립 스코어보드는 8월 13일 더 정교해졌다. DeepSWE가 v1.1을 출시했을 때다 — 이는 장기 지평 엔지니어링 벤치마크의 개정판으로, 5개 언어에 걸쳐 91개 저장소에서 가져온 113개의 원래 작업을 유지하지만 이제는 각 수정을 격리된 컨테이너에서 커밋된 diff를 실행해 평가하므로 악용하기가 더 어렵다. 업데이트된 보드에서 최대 노력으로 실행한 세 가지 GPT-5.6 티어는 모두 7월 글에서 기록했던 위치에 그대로 안착한다: Luna Max는 pass@1 67.2%와 작업당 $0.61, Terra Max는 약 70%, Sol Max는 $8.39로 73% — 약 14배의 비용으로 성공률 6포인트를 얻은 셈이다.

두 번째로 살펴볼 가치가 있는 비교는 Luna 위가 아니라 Luna 아래에 있습니다. Claude Sonnet 5 Max는 동일한 113개 과제에서 54%를 기록하며 Luna Max보다 약 13포인트 뒤처지는데, 과제당 $26.40으로 이는 Luna가 같은 해결에 지불한 금액의 약 44배입니다. Luna Max는 또한 Gemini 3.7 Flash를 능가합니다(같은 리더보드에서 high-effort 구성으로 65%). 이번 라운드를 지적한 커뮤니티 게시물은 Gemini 3.7 Flash Medium과의 격차를 약 1.7포인트로 제시합니다. DeepSWE는 기업 평가가 아닌 Datacurve의 독립 하네스입니다 — GPT-5.6 제품군이 Terminal-Bench 2.1과 DeepSWE에서 최첨단 결과를 세웠다는 회사 자체의 주장은 별개의, 공급업체가 보고한 주장으로 남아 있습니다.

그다음에는 현장 증거가 있는데, 이는 실제로 갈린다. Pawel Huryn은 자체 버그 수정 벤치마크를 돌렸다. 두 개의 실제 코드베이스에 심어둔 105개 버그, 블라인드 심사, 모델당 한 라운드였고, Luna가 최대 노력 설정에서 33개 버그를 1.80달러에 고친 반면 Claude Fable 5는 68달러에 24개를 고쳤다고 보고했다. 반대 방향으로는 Diego Haz가 이틀 동안 동일 조건 세션을 돌린 끝에 이 패턴에 반대하는 결론을 내렸다. Luna는 세션당 평균 1.20달러였고 Sol은 평균 29달러였지만, 그는 Luna의 출력 대부분을 다시 해야 했고 자신의 사용 사례에 출시할 만한 결과를 얻지 못했으며, 이는 절약이 할인이 아니라 착시임을 뜻한다. 같은 하네스를 돌린 또 다른 개발자는 Sol을 중간 설정으로 돌린 것이 Luna를 최대 설정으로 돌린 것보다 약 절반 시간에 확연히 더 나은 결과를 냈다고 보고했다. 단일 3D 장면 작업에 대한 중국어권 비교 대회는 그 양상에 숫자를 붙였다. Sol Medium은 21분 30초에 끝났고 품질 평가가 가장 높았으며 토큰도 가장 적었다. Luna Max는 40분 55초가 걸렸고 약 130k 토큰을 소모했으며 품질 점수가 가장 낮았고 주간 구독 허용량은 절반만 사용했다.

일주일 후 커뮤니티 입장을 솔직하게 요약하자면: Luna Max는 Sol Medium이 아니다. Sol Medium보다 훨씬 저렴하고 더 나쁘며, 그 맞바꿈이 좋은지는 과제가 “더 나쁨”이 문제되지 않을 만큼 충분히 엄격하게 명세되었는지에 전적으로 달려 있다. 바로 그것이 아래의 와이어링 패턴의 용도다.

접촉에서 살아남은 패턴: Sol은 계획하고, Luna는 구현하고, 새로운 Sol이 검토한다

Luna Max를 계속 사용해 온 사람 중에 이를 범용 코딩 에이전트로 쓰는 사람은 없다. 실무자들이 수렴한 모든 버전에서 통하는 구성에는 네 가지 역할이 있다:

• 오케스트레이터 — GPT-5.6 Sol이 높은 노력 수준으로 메인 스레드에 머무릅니다. 요구사항, 아키텍처, 작업 분해, 최종 승인을 담당합니다. 코드는 작성하지 않습니다.

• 일상적 구현 담당자 — 최대 강도로 실행되는 GPT-5.6 Luna, 범위가 정해지고 완전히 명세된 작업: 기계적 리팩터링, 테스트 작성, 모듈 분석, 문서화 작업, 도착점이 명확한 종류의 작업에 적합합니다.

• 강경한 구현자 — 최대 노력으로 작동하는 GPT-5.6 Terra로, Luna의 지시 이탈이 비용을 키우는 컨텍스트가 많은 빌드에 적합합니다.

• 검토자 — 최종 diff만 보고 그 외에는 아무것도 보지 못하는, 새로 만들어진 읽기 전용 GPT-5.6 Sol 인스턴스입니다. "새로 만들어진"의 핵심은 구현의 맥락을 지닌 검토자가 자신의 추론을 승인하기 쉬운 경향이 있다는 점입니다.

참조 구현은 sol-advisor이며, 이는 Dan McAteer가 만든 MIT 라이선스 Codex 플러그인으로, 첫 주에 약 1,400개의 스타를 달성했습니다. 이것은 Codex 플러그인 마켓플레이스에서 DannyMac180/sol-advisor 저장소를 추가한 다음 sol-advisor 플러그인을 추가하여 설치합니다. 현재 형태는 시사하는 바가 큽니다: 네이티브 레인은 Terra/High 구현자와 그 뒤에 오는 새로운 Sol/High 리뷰어를 고정하는 반면, Luna at max는 별도의 사용자에게 표시되는 작업으로 실행되는 명시적 옵트인 레인이며, 기본 Sol 세션이 네이티브 리뷰어를 거치지 않고 그 작업을 직접 검토하고 승인합니다.

아무것도 설치하고 싶지 않다면, 널리 복사된 최소 버전은 다음 위치의 사용자 지정 에이전트 정의입니다: ~/.codex/agents/luna-worker.toml 두 가지 설정을 담고 있습니다 — model = "gpt-5.6-luna"와 model_reasoning_effort = "max" — 여기에 설명과 지침이 더해지는데, 이 지침은 위임된 작업으로만 한정하고 명확한 경계를 설정하며, 전체 목표를 바꾸거나 자체 범위를 넓히는 것을 금지하고, 아키텍처 결정과 모호한 요구 사항은 메인 에이전트에게 되돌려 보냅니다. 널리 퍼진 조언은 Sol이 이 파일을 대신 작성하고, 설치된 Codex 버전에 맞춰 검증하고, 수락하기 전에 diff를 보여주도록 하라는 것인데, 이는 그 레시피를 신뢰하든 아니든 타당합니다.

서브에이전트 함정, 그리고 커뮤니티가 수렴한 해결책

바로 여기에서 이 패턴의 바이럴 버전과 실제 작동하는 버전이 갈라진다.

Codex의 네이티브 서브에이전트 시스템은 GPT-5.6 Luna를 일급 시민으로 취급하지 않는다. McAteer는 단단한 벽에 부딪혔다. Luna는 서브에이전트로 허용되지 않는다는 것이었고, 그는 대신 커스텀 에이전트로 선언하는 방식으로 이를 우회한 뒤, 그 우회의 대가를 공개적으로 지적했다. 커스텀 에이전트는 네이티브 서브에이전트처럼 메인 에이전트와 컨텍스트를 공유하지 않는다는 것이다. 며칠 후 그는 sol-advisor에서 Luna 레인을 아예 제거했는데, Luna가 서브에이전트 역할에서 형편없이 동작한다는 또 다른 Codex 중심 개발자의 발견을 근거로 들었으며, Luna가 v2 멀티 에이전트 프로토콜에 맞춰 후속 학습되지 않았을 것이라는 추정을 깔고 있었다. Diego Haz는 같은 벽을 반대편에서 독립적으로 묘사했다. Sol은 Luna를 서브에이전트로 스폰할 수 없고, 그래서 Luna는 최상위 스레드에 존재해야 하며, 이 때문에 조율이 지저분해진다는 것이다.

현재 다수의 입장이 된 해결책은 그것에 맞서는 것을 그만두는 것이다:

• Luna Max에 하위 에이전트 그래프의 한 슬롯이 아니라 자체 스레드를 부여하세요. Sol 오케스트레이터에게 Luna에서 별도의 최상위 Codex 작업을 생성하고, 모니터링한 뒤, 결과를 다시 가져오도록 지시하세요. 이것은 McAteer가 sol-advisor에 8월 4일 다시 추가한 것이며, 여러 다른 사람들이 독립적으로 도달한 것이기도 합니다.

• 컨텍스트 격리를 그 대가로 받아들이세요. 별도의 스레드는 곧 별도의 히스토리를 뜻합니다. 그것이 바로 지불해야 할 비용이며, 아래의 핸드오프가 네이티브 서브에이전트 구성에서보다 여기서 더 중요한 이유이기도 합니다.

• 억지로 멀티 에이전트 v2에 밀어 넣으려 한다면, 카탈로그가 바로 그것이 필터링되는 이유입니다. 한 개발자가 그 제외 원인을 기본 모델 카탈로그가 Luna를 v1로 표시하기 때문이라는 데까지 추적하고 다음과 같은 우회 방법을 보고했습니다: ~/.codex/models_cache.json을 복사한 다음, Luna의 multi_agent_version을 v2로 설정하고, model_catalog_json이 복사본을 가리키게 한 뒤 Codex를 재시작하고, 그다음 오케스트레이터가 Luna를 최대치로, 빠른 서비스 티어로, 포킹을 끈 상태로 생성하도록 하십시오. 이는 내부 파일에 대한 한 개인의 비공식 해킹으로 취급하십시오 — Codex 업데이트가 깨뜨리는 바로 그런 종류의 것입니다.

핸드오프 패킷: 가장 흔한 불만을 해결하는 다섯 가지 질문

Luna Max에서 가장 많이 보고되는 실패는 지시를 꼼꼼히 따르지 않는다는 점, 특히 실행할 특정 워크플로나 반복 루프를 넘겨줄 때 그러하다는 것입니다. 이 불만은 해당 모델을 좋아하는 개발자와 모델을 포기한 개발자 모두에게서 나타납니다. 실무자들이 계속 도달하는 완화책은 문체 차원의 더 나은 프롬프트가 아니라 더 엄격한 계약입니다. Luna 스레드를 시작하기 전에 다섯 가지에 답하세요:

• 이 에이전트가 완료해야 할 정확한 작업은 무엇인가요? 작업 영역이 아니라, 완료된 상태입니다.

• 어떤 파일, 문서 또는 시스템이 범위에 포함됩니까? 암시가 아니라 열거되어야 합니다.

• 무엇을 변경해서는 안 됩니까? 손대서는 안 되는 인터페이스, 마이그레이션, 구성 및 공개 계약입니다.

• 완료를 입증하는 증거는 무엇인가? 이름이 지정된 테스트, 특정 명령의 출력, 나열된 파일만 수정하는 diff.

• 어떤 결정이 빠졌을 때 멈춰야 하는가? 추측하는 대신 되돌아오게 하는 트리거 — 바로 이것이 지나치게 성급한 저렴한 모델이 아키텍처를 지어내는 것을 막아준다.

여기에는 회사 자체의 프롬프팅 지침도 그에 걸맞은 단서를 붙여 함께 포함할 가치가 있습니다: 회사는 내부 코딩 에이전트 평가에서 더 간결한 시스템 프롬프트가 평가 점수를 10–15% 높이면서 전체 토큰은 41–66%, 비용은 33–67% 줄였다고 보고하며, GPT-5.5나 GPT-5.4에서 물려받은 프롬프트를 그대로 이식하기보다는 감사할 것을 권고합니다. 이는 벤더가 보고한 수치입니다. 그러나 그 방향은 이 분야가 발견한 것과 일치합니다: 목적지를 정확히 설명하고, 모든 발걸음에 대한 서술은 삭제하십시오. 위 문단과의 긴장 관계에 유의하십시오 — 범위와 제약에 관한 정확성은 장황함과 같은 것이 아니며, 커뮤니티의 합의는 Luna Max에 전자가 더 많이, 후자가 더 적게 필요하다는 것입니다.

대비해야 할 실패 모드

• 지시 이탈. 여러 개발자가 이를 확인했습니다: 처음 브리프의 일부를 무시하며, 브리프가 도달해야 할 결과가 아니라 따라야 할 절차일 때 가장 심각합니다.

• 실제 경과 시간 기준의 느림.반복적으로 보고된 사항이며, Artificial Analysis가 max effort에서 측정한 약 136초의 첫 토큰까지 걸리는 시간(time-to-first-token)과 일치합니다. 계속 실행해 둘 수 있는 작업에는 괜찮지만, 대화형 루프에서는 고통스럽습니다.

• 컨텍스트 소모. 한 개발자는 Luna Max가 258k Codex 스레드 윈도우를 놀랄 만큼 빠르게 소진한다고 보고했으며, Codex가 한도 근처에서 압축을 시작하면 할당량 소비가 급증한다고 의심했습니다. 압축 부분은 그의 인상일 뿐 측정된 결과는 아닙니다. 하지만 소모 속도는 Artificial Analysis가 독립적으로 측정한 장황함의 예상된 결과입니다. API 측면에서는 장문 컨텍스트 단계에 유의하세요. 이 모델의 패스스루 가격 체계는 요청이 약 272k 토큰을 넘으면 $0.20/$1.20에서 $0.40/$1.80로 바뀌므로, 계속 커지는 스레드는 총비용만 더 비싸지는 게 아니라 토큰당 비용도 더 비싸집니다.

• 시각적인 모든 것. 이것이 현장 보고서에서 가장 뚜렷한 경계선이다. 널리 읽히는 한 실무자는 Kimi K3 코딩 구독을 해지하고 Luna Max를 택하면서, Luna Max가 자신이 포기한 것만큼이나 좋으면서 훨씬 저렴하다고 평가했지만, 프런트엔드만큼은 분명히 예외로 두었다. 또 다른 이는 더 직설적이었다. 디자인, 그래픽, 서식, 슬라이드 작업을 Luna로 실행하지 말 것. Sol로 계획하고 Luna로 실행하는 분업은 미적인 작업이 아니라 단계별 지시형 작업을 위한 것이다.

• 하위 에이전트 카탈로그.위에서 다뤘습니다 — 멀티 에이전트 실행에서 Luna가 조용히 한 번도 선택되지 않는다면, 실패하는 것이 아니라 필터링되고 있는 것입니다.

• 잘못된 절약. 어떤 벤치마크에도 나타나지 않는 단 하나의 실패 유형: $29 대신 $1.20이 들고, 당신이 손으로 다시 써야 했던 작업물을 만들어낸 세션은 당신에게 $1.20에 오후 시간까지 비용으로 들게 했다.

최대치를 선택하지 말아야 할 때

Max는 무료 업그레이드가 아니며, 지금까지 유효하게 유지되어 온 지침은 설정이라기보다 사다리입니다:

• 명확한 변환 — 필드 이름 변경, 기계적 추출, 서식 지정 작업. Luna에서는 낮음 또는 중간 수준의 노력. 이름이 지정된 테스트 통과를 게이트 조건으로 삼으세요.

• 일상적인 구현 — high 또는 xhigh. Luna 워커에 대한 커뮤니티 기본값이 max가 아니라 xhigh인 바로 그 이유는, max가 애초에 어려운 적이 없었던 작업에 시간과 토큰을 소모하기 때문입니다.

• 경계가 분명하지만 진정으로 어려운 것 — 이것이 바로 max가 실제로 하는 일이다. 추가 추론이 더 나은 결과로 이어지려면, 패킷은 어려우면서도 엄밀하게 규정되어 있어야 한다.

• 모호한 조사 — 다이얼이 아니라 티어를 바꾸세요. 모델이 계획을 덜 세우는 게 아니라 잘못 판단하고 있다면, 더 저렴한 모델에서 더 많이 생각하게 해도 해결되지 않습니다. 그건 Sol의 작업입니다.

• 모호한 브리프 — 모델이 아니라 계약을 고치세요. 어떤 effort 설정도 명시되지 않은 수용 기준을 보완해 주지 못합니다.

구독에 특화된 주의사항으로, 서드파티 가이드에서 나온 것이며 틀리기 쉬운 부분입니다: Codex가 모델별로 부과하는 크레딧 요율은 API 정가와 같은 비율이 아니므로, API 가격 비율을 그대로 가져와 구독 라우팅 규칙으로 사용할 수 없습니다. Plus 티어에서 보고된 5시간 메시지 허용량이 이 점을 잘 보여줍니다 — Sol에서는 대략 15–90개의 로컬 메시지, Terra에서는 20–110개, Luna에서는 50–280개이며, 범위가 이렇게 넓은 것은 "메시지"가 고정된 작업 단위가 아니기 때문입니다. 라우팅 결정이 청구서가 아니라 구독 한도에 의해 좌우된다면, 그 한도를 기준으로 측정하세요.

Codex 그 너머: 사람들은 이걸 또 어디에 쓰고 있을까

저렴한 심층 추론 조합은 코딩 에이전트 밖에서도 유용한 것으로 드러났으며, 다음은 증거가 있는 활용 사례들입니다:

• 브라우저 에이전트. 한 개발자가 GPT-5.6 Luna에서 브라우저 자동화 스택을 돌려 해커 뉴스 상위 15개 글을 열고, 링크된 모든 페이지를 읽고, 보고서를 작성했습니다. 총비용은 3센트였습니다. 장기적이고 위험 부담은 낮으며 토큰 소모는 많은 작업, 바로 이 모델이 가격을 책정한 대상입니다.

• 스킬 체인.두 실무자가 각각 단일 Luna Max 목표에서 두 스킬 파이프라인 — 이미지 생성 → 이미지-to-Three.js 변환기 — 을 구동해 상호작용 가능한 로우폴리 3D 오브젝트를 만들었다고 독립적으로 보고했으며, 둘 다 자신의 주간 사용량 카운터가 거의 움직이지 않았다고 언급했습니다. "시각 작업에 Luna를 사용하지 마세요" 경고와 함께 읽을 만합니다: Luna는 시각 작업을 수행한 도구들을 조율하고 있었던 것이지, 미학 자체를 판단한 것이 아니었습니다.

• 세션 하나를 핫 상태로 유지하기. 이 모델에서 캐시된 입력은 백만 토큰당 $0.02로, 새 입력의 $0.20에 비해 90% 할인되며 — Artificial Analysis가 자사 가격 패널에 명시한 내용 — 캐시 윈도는 약 30분입니다. 여러 가이드가 독립적으로 도달한 실질적 시사점은 다음과 같습니다: 동일한 코드베이스를 계속 다시 읽는 장기 실행 세션 하나가 작업마다 새 세션을 여는 것보다 훨씬 저렴합니다.

• 할당량 차익거래. 이 전체 묶음에서 가장 공격적인 주장이며, 스스로를 주장이라고 분명히 명시하고 있다. 한 개발자의 보고에 따르면, effort는 거의 공짜인데 반해 티어 배수는 크기 때문에, 저렴한 티어에서 최대 effort를 돌리면 200달러 요금제로 3주 동안 49억 토큰을 통과시킬 수 있었고 — API 요율로 치면 여섯 자릿수에 해당한다 — 또한 같은 선택기 안에 Kimi K3, Grok, DeepSeek 모델을 로컬 라우터 뒤에 두어 한 제공자의 한도에 걸려도 작업이 멈추지 않는다고 한다. 아무도 그 토큰 수치를 독립적으로 재현하지는 못했다. 다만 그 뒤에 있는 라우팅 습관이야말로 따라 할 가치가 있는 부분이다.

Codex 구독 없이 동일한 분할을 실행하기

위의 모든 내용은 구독 형태의 이야기입니다. 사람들이 Luna Max에 관심을 갖는 이유는 Luna Max가 주간 한도를 늘려주기 때문입니다. API 측면에서는 동일한 아키텍처가 구축하기 더 단순하고 이해하기도 더 쉽습니다. 허용량을 관리하는 대신 청구서를 지불하기 때문이며, 오케스트레이터/워커 분리는 더 이상 플러그인이 아니라 일반적인 라우팅이 됩니다.

GPT-5.6 Luna는 OrcaRouter를 통해 백만 입력 토큰당 $0.20, 백만 출력 토큰당 $1.20에 이용할 수 있습니다 — 공급자의 정가를 0% 마크업으로 그대로 전달한 것이며, 그래서 7월 30일 인하는 회사가 발표한 날 바로 저희 쪽에서도 반영되었지 청구 주기가 한 번 지난 뒤에야 반영된 게 아닙니다. 이 모델은 호환 API를 통해 /v1/chat/completions 및 /v1/responses에서 제공되므로, reasoning-effort 필드는 직접 연결할 때와 똑같이 요청 본문에 그대로 실려 가고, 모델 id는 openai/gpt-5.6-luna입니다. GPT-5.6 Sol과 GPT-5.6 Terra도 같은 키 뒤에 있으니, 이 패턴에서 중요한 점이 바로 이것입니다: 한 계층에는 오케스트레이터를, 다른 계층에는 워커를 두는 것은 하나의 통합 안에 두 개의 모델 id를 두는 것이지 두 개의 벤더 계약을 맺는 게 아닙니다. 라우팅 DSL을 사용하면 그 분리를 스레드를 수작업으로 붙여 놓는 대신 하나의 호출로 표현할 수 있고, 자동 장애 조치는 할당량 차익거래를 하는 사람들이 로컬 라우터로 해결하는 상황을 커버합니다 — 한 공급자가 성능이 저하되면 요청이 중단되는 대신 다른 곳으로 전달됩니다.

GPT-5.6 Luna Max-4

두 가지 솔직한 주의사항이 있습니다. Codex 전용 체계 — 서브에이전트 그래프, 플러그인 마켓플레이스, 모델 카탈로그, 주간 허용량 — 는 회사의 것이며, 그중 어느 것도 API 키와 함께 제공되지 않습니다. 원하는 패턴이 sol-advisor (Codex 앱 내)라면 Codex 구독이 필요합니다. 그리고 위의 실패 모드들은 전송 방식이 아니라 모델 자체의 속성입니다. 라우팅은 호출 비용과 제공자에 장애가 발생할 때 무슨 일이 일어나는지를 바꿀 뿐, Luna가 지시를 따르는지 여부를 바꾸지는 않습니다.

누가 이것을 따라 해야 하고, 누가 하지 말아야 할까요?

당신의 작업이 볼륨이 크고 기계적으로 명세할 수 있는 종류 — 리팩터링, 테스트 스캐폴딩, 추출, 문서화, 대형 레포에 대한 분석 패스 — 라면, max를 켜고, Luna를 5개 질문 핸드오프와 함께 자체 스레드에 두고, 그 앞에는 계획용 Sol 인스턴스를, 그 뒤에는 검토용 Sol 인스턴스를 두고, 지출이 10분의 1로 줄어들 것으로 예상하세요. 가장 큰 성과를 보고하는 사람들은 모두 그 방식의 변형을 하고 있으며, 독립적인 비용 수치들은 "Sol만큼 좋다"는 프레이밍을 뒷받침하지 않는 경우에도 그 방향을 뒷받침합니다.

당신의 작업이 탐색적이거나 미학적이거나, 진행할수록 더 선명해지는 모호한 브리프로 시작된다면, 현장 보고서는 당신이 결과물을 다시 만드는 데 그 절약분을 두 배로 쓰게 될 것이라고 분명히 말한다. 그리고 당신이 상호작용하며 작업한다면 — 거기 앉아 그것을 지켜본다면 — 최대 노력에서의 2분 콜드 스타트는 가격이 당신을 기쁘게 하는 것보다 당신을 더 괴롭힐 것이다.

주목할 점: 회사가 v2 서브에이전트 프로토콜을 위해 Luna를 포스트트레이닝하는지 여부다. 현재 플레이북의 모든 어색한 부분 — 별도의 스레드, 잃어버린 공유 컨텍스트, 카탈로그 핵, 전체 철회 후 재배선 에피소드 — 은 바로 그 하나의 격차 때문에 존재한다. 그걸 메우면 이 패턴의 최선 버전은 여러 단계 더 단순해진다.

진짜 답을 들을 만한 질문들

최대 추론 노력이 기본값보다 토큰당 비용이 더 많이 드나요?

아니요, 그리고 이것은 해당 설정에 관한 가장 흔한 오해입니다. GPT-5.6 Luna는 effort와 관계없이 백만 토큰당 입력 $0.20, 출력 $1.20로 과금됩니다. max가 바꾸는 것은 소비되는 토큰 수입니다 — 모델은 더 많이 계획하고, 스스로 점검하고, 답변하기 전에 수정합니다. Artificial Analysis는 중간값 모델이 6,100만 개를 출력하는 벤치마크 스위트에서 이 모델이 1억 3,000만 개의 출력 토큰을 출력하는 것을 측정했습니다. 따라서 max-effort 세션은 동일한 작업에서 medium-effort 세션보다 비용이 더 많이 들며, 이는 전적으로 볼륨 때문이고, 첫 토큰을 생성하는 데도 더 오래 걸립니다. Effort는 품질 라벨을 달고 있는 토큰 수 다이얼입니다.

GPT-5.6 Luna가 아직 네이티브 Codex 서브에이전트로 실행될 수 있나요?

2026년 8월 5일 현재, 아닙니다 — 그리고 커뮤니티는 더 이상 시도하지 않습니다. Codex의 네이티브 서브에이전트 경로는 Luna를 받아들이지 않습니다. 사용자 정의 에이전트 우회 방법으로 실행은 되지만 메인 에이전트와의 공유 컨텍스트를 잃습니다. 그리고 이 패턴에 대해 가장 잘 알려진 플러그인을 만든 개발자는 Luna를 제거한 뒤, 오케스트레이터가 모니터링하는 별도로 스폰된 최상위 작업으로 다시 추가했습니다. Luna가 결코 선택되지 않는 멀티 에이전트 실행을 본다면, 그것은 아마도 기본 모델 카탈로그가 Luna를 v2가 아니라 v1로 표시하기 때문에 필터링되는 것일 가능성이 큽니다. 한 개발자가 자기 책임하에 수동으로 패치한 것입니다. 이것은 목록에서 Codex 업데이트로 바뀔 가능성이 가장 높은 단 하나의 항목이므로, 이 방법을 포함한 어떤 레시피도 믿지 말고 설치된 버전을 기준으로 확인하세요.

Claude나 Kimi K3 코딩 구독을 대체할 만큼 충분히 좋은가요?

여러 개발자들이 바로 이 문제 때문에 월 200달러 요금제를 공개적으로 해지했다. 이 의문을 공론화한 게시글은 매일 코딩하는 한 면역학자가 올린 것이었다. 그는 Kimi K3 코딩 구독을 해지했는데, 그것이 나빠서가 아니라 자신의 경험상 GPT-5.6 Luna가 자신의 작업에 못지않게 좋으면서 훨씬 저렴했기에 정당화할 수 없었기 때문이다 — 프런트엔드는 예외로. 독립적인 비용 수치는 이 주장을 무시하기 어렵게 만든다. 동일한 벤치마크 스위트에서 최대 노력 설정의 Kimi K3는 2,437달러로 57점을 기록한 반면, 최대 설정의 GPT-5.6 Luna는 174달러로 51점을 기록했다. 하지만 무엇이든 해지하기 전에 반대 의견을 읽어보라. 짝지은 세션을 측정해 부정적인 결과를 얻은 개발자들은 다른 모델을 테스트한 것이 아니었다. 그들은 다른 종류의 작업 — 개방형, 시각적, 또는 느슨하게 명세된 — 을 테스트했고, 그런 종류의 작업에서는 더 저렴한 모델이 절감분을 상쇄할 만큼 크게 졌다. 방어할 수 있는 답은 Luna Max가 당신의 코딩 작업의 상당 부분을 대체한다는 것이지, 반드시 당신의 최고 코딩 모델을 대체하는 것은 아니라는 점이며, 이를 가장 잘 활용하는 실무자들은 계획하고 점검하기 위해 최전선 등급을 곁에 두는 사람들이라는 것이다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트