GPT-5.6 Luna Max-1
Guides & Insights

GPT-5.6 Luna Max: 개발자들이 Codex에서 실제로 사용하는 방법 — 그리고 한계가 드러나는 지점

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

8월 1일, 네 줄짜리 설정 파일이 X에서 퍼지기 시작했다. 이 파일은 Codex 에이전트를 하나 생성하는데, 그 이름은 luna_worker이고, 모델은 gpt-5.6-luna로, 추론 노력은 max로 설정한 다음, GPT-5.6 Sol이 계획을 유지하는 동안 여러분의 작업 중 지루한 절반을 이 에이전트에 넘긴다. 며칠 안에 같은 레시피가 영어, 중국어, 일본어, 한국어, 스페인어, 아랍어로 다시 게시되었고, 같은 아이디어를 바탕으로 한 플러그인은 4일 만에 GitHub 스타 1,300개를 넘어섰다. 또한 이 방식은, 유행하던 그날쯤, 연결 방법으로는 틀렸다. 해당 플러그인의 작성자는 동료가 Codex 서브에이전트로는 작동하지 않는다고 알려주자, 48시간 안에 공개적으로 자신의 프로젝트에서 GPT-5.6 Luna를 빼냈다. 그리고 이틀 후 완전히 다른 방식으로 연결해 다시 넣었다.

그 전체적인 흐름은 일주일 안에 일어났으며, 이 모델에 대해 누군가 발표한 내용 중 가장 유용한 것이다. 이 흐름은 cheap-worker 패턴이 실재하며, 이를 연결하는 당연한 방식이 틀렸고, 그 둘 사이의 차이가 가치의 대부분임을 말해준다. 이 기사에서 기법에 관한 모든 것은 2026년 7월 30일부터 8월 5일 사이에 실무자들이 게시한 자신의 결과에서 비롯된 것이지, 회사 문서에서 나온 것이 아니다. 회사 문서는 GPT-5.6 Luna를 '비용에 민감하고 대규모인 워크로드'용 모델로 기술할 뿐, 이런 내용은 전혀 언급하지 않는다. 어떤 수치가 독립적인 제3자에 의해 측정된 것이라면 우리는 그렇게 밝히고, 어떤 개발자의 세션 로그에서 나온 것이라면 그것도 밝힌다. 그것들이 서로 모순되는 경우에도 마찬가지다. 실제로 그런 모순이 많다.

"루나 맥스"가 무엇인지, 그리고 왜 대부분의 사람들은 그것을 결코 보지 못하는지

Luna Max라는 모델은 없습니다. 두 개의 다이얼이 있으며, Luna Max는 그 조합 중 하나입니다: GPT-5.6 제품군에서 가장 저렴한 등급을 가장 깊은 추론 설정으로 실행한 것입니다. 등급 다이얼은 GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna 중에서 선택합니다. 노력 다이얼에는 none, low, medium, high, xhigh, max의 여섯 단계가 있으며, 모델이 답변하기 전에 얼마나 많은 사고를 하는지를 결정합니다.

거의 아무도 저렴한 티어와 심층 설정을 함께 사용하지 않았습니다. 그 이유는 평범합니다: max는 기본적으로 숨겨져 있습니다. ChatGPT/Codex 데스크톱 앱에서는 설정 → 구성 → 사용 가능한 추론 노력에서 찾을 수 있으며, 이 목록은 최상위 옵션이 선택 해제된 상태로 제공됩니다. 8월 첫 주에 여섯 명의 개발자가 각각 동일한 3클릭 수정법을 게시했는데, 이는 얼마나 많은 사람들이 Luna를 기본 깊이로 실행하면서 그 상태로 모델을 평가해 왔는지를 잘 보여줍니다. API 쪽에서는 찾을 토글이 없습니다. 모델 ID를 gpt-5.6-luna로 전달하고 추론 노력을 max로 요청 본문에서 설정하면 그게 전부입니다.

벤치마크를 읽기 전에 반드시 새겨둬야 할 한 가지 결과가 있습니다: Artificial Analysis가 이 모델에 대한 지능 점수를 게시할 때, 페이지 제목은 GPT-5.6 Luna (max)입니다. 모두가 Luna에 대해 인용하는 독립적인 수치는 최대 노력(max-effort) 구성입니다. 기본 설정으로 실행해 왔는데 왜 자신의 경험이 리더보드와 일치하지 않는지 궁금했다면, 그 이유가 바로 그것입니다.

아무도 설명하지 않는 다이얼: effort는 토큰 가격이 아닌 토큰 수를 변경합니다

추론 노력을 높여도 더 비싼 가격 등급으로 이동하지 않습니다. GPT-5.6 Luna는 모든 노력 설정에서 입력 토큰 100만 개당 $0.20, 출력 토큰 100만 개당 $1.20입니다. 변화하는 것은 모델이 답변을 얻는 데 사용하는 토큰 수이며, 최대 설정에서는 많은 토큰을 사용합니다.

Artificial Analysis가 Intelligence Index를 실행하는 과정에서 이를 측정했으며, 그 숫자는 실무자들이 불평했던 내용에 대한 가장 명확한 독립적 확인이다:

점수 — Artificial Analysis Intelligence Index 기준 51점으로, 해당 클래스의 벤치마크 대상 모델들의 중앙값 17점과 비교됩니다.

장황함 — 인덱스 실행 기간 동안 61M 중앙값 대비 130M 출력 토큰이 생성되었습니다. Artificial Analysis는 이 모델을 "매우 장황함"으로 표시합니다.

원시 속도 — 초당 출력 토큰 182.5개, 163개 모델 중 16위. 토큰당 속도가 빠릅니다.

첫 토큰까지의 시간 — 최대 노력 시 약 136초로, Artificial Analysis에 따르면 해당 가격대의 추론 모델 중에서도 높은 편에 속합니다.

총 지출 — 전체 인덱스에서 모델을 평가하는 데 $174.06.

세 번째와 네 번째 줄을 함께 읽으세요. 그 두 줄이 전체 사용자 경험이기 때문입니다. Luna는 최대 스트리밍 시 토큰을 빠르게 생성하지만 시작하는 데 몇 분이 걸리며, 같은 작업에서 일반적인 모델이 생성하는 토큰의 약 두 배를 생성합니다. 그래서 현장 보고서에서 가장 흔한 불만은 "틀렸다"가 아니라 "느리다"인 것이며, 저렴한 가격이 비례적으로 저렴한 세션으로 이어지지 않는 이유이기도 합니다. 여러분은 높은 토큰 수에 대해 낮은 요율을 지불하는 것입니다.

대조적으로: GPT-5.6 Luna의 자체 모델 페이지에서 7일간의 실제 트래픽을 기준으로 관측된 첫 번째 토큰까지의 중앙값 시간은 1.78초이며, 95번째 백분위수는 9.26초입니다. 이는 136초 수치와 모순되지 않습니다. 대부분 최대가 아닌 다양한 노력 설정의 혼합으로 측정된 동일한 모델이기 때문입니다. 얻는 지연 시간은 호출하는 엔드포인트가 아니라 설정한 다이얼의 속성입니다.

GPT-5.6 Luna Max-2

Luna Max가 정말 "비용의 6분의 1에 Sol Medium"인가?

이 주장은 패턴이 바이럴하게 만든 내용으로, Dan McAteer에게서 비롯되었습니다. 그는 Luna를 최대 추론 설정에서 GPT-5.6 수준, Sol을 중간 설정에서 Claude Opus 5 수준으로 보았고, 비용은 대략 6분의 1에 불과하다고 했습니다. 이후 많은 계정들이 이 내용을 반복했는데, 때로는 조심스러운 표현을 빼버린 채로 말이죠. 측정된 것과 그저 느낌에 불과한 것을 구분할 필요가 있습니다.

독립적 스코어보드는 비용 측면의 주장을 강력히 뒷받침하지만, 성능 측면의 주장은 부분적으로만 뒷받침합니다. 동일한 벤치마크 스위트를 각 등급에서 최대 노력으로 실행한 결과, Artificial Analysis는 Luna를 인덱스 51($174), Terra를 55($1,403), Kimi K3를 57($2,437), Sol을 59($2,824)로 기록했습니다. Luna는 Sol보다 인덱스 포인트 8이 낮지만, 동일한 작업을 처리하는 비용은 약 16분의 1에 불과합니다.

GPT-5.6 Luna Max-3

독립 스코어보드는 8월 13일에 더욱 엄격해졌습니다. DeepSWE가 v1.1을 출시했기 때문입니다. 이는 장기 엔지니어링 벤치마크의 개정판으로, 5개 언어에 걸친 91개 저장소에서 가져온 113개의 원래 작업을 유지하지만, 이제 각 수정 사항을 격리된 컨테이너에서 커밋된 diff를 실행하여 평가하므로 속이기가 더 어렵습니다. 업데이트된 보드에서 최대 노력의 GPT-5.6 세 등급 모두 7월 기사에서와 같은 위치에 있습니다: Luna Max는 67.2%의 pass@1과 작업당 $0.61, Terra Max는 약 70%, Sol Max는 73%에 $8.39 — 대략 14배의 비용으로 성공률 6포인트를 얻는 셈입니다.

다시 한 번 살펴볼 가치가 있는 비교는 Luna 위가 아니라 아래에 있다. Claude Sonnet 5 Max는 동일한 113개 작업에서 54%를 기록했는데, 이는 Luna Max보다 약 13포인트 뒤처진 것이며 작업당 $26.40로 같은 해결에 Luna가 지불한 비용의 약 44배이다. Luna Max는 또한 같은 보드에서 높은 노력 구성의 65%를 기록한 Gemini 3.7 Flash를 능가한다; 이번 라운드를 지적한 커뮤니티 게시물은 Gemini 3.7 Flash Medium과의 격차를 약 1.7포인트로 본다. DeepSWE는 Datacurve의 독립적인 하네스이지 회사 평가가 아니다 — 회사가 GPT-5.6 제품군이 Terminal-Bench 2.1과 DeepSWE에서 최첨단 결과를 세웠다는 자체 주장은 별개의 공급업체 보고 주장으로 남아 있다.

그다음에는 실제 현장 증거가 있는데, 이는 정말로 양쪽으로 갈린다. Pawel Huryn은 자신만의 버그 수정 벤치마크를 실행했다 — 실제 코드베이스 두 개에 105개의 버그를 심고, 맹검으로 평가하고, 모델당 1라운드를 진행하는 방식 — 그리고 Luna가 최대 노력(max effort)으로 33개의 버그를 1.80달러에 고친 반면, Claude Fable 5는 68달러에 24개를 고쳤다고 보고했다. 반대 방향으로, Diego Haz는 이틀 동안 동일한 조건의 세션을 실행하고 그 패턴에 반대하는 결론을 얻었다: Luna는 세션당 평균 1.20달러였고 Sol은 평균 29달러였지만, 그는 Luna의 출력 대부분을 다시 작업해야 했고 자신의 사용 사례에 대해 출시 가능한 결과물을 얻지 못했다. 따라서 그 절약은 할인이 아니라 환상에 불과하다. 동일한 테스트 하네스를 실행한 또 다른 개발자는 중간 설정의 Sol이 최대 설정의 Luna보다 분명히 더 나은 결과를 약 절반의 시간에 만들어 냈다고 보고했다. 단일 3D 장면 작업에 대한 중국어 벤치마크 대결은 그 양상을 수치로 확인시켜 줬다: Sol Medium은 21분 30초 만에 완료했고 품질 평가가 가장 높았으며 토큰도 가장 적게 사용했다. Luna Max는 40분 55초가 걸렸고 약 13만 개의 토큰을 소모했으며 품질에서 가장 낮은 점수를 받았고 주간 구독 허용량의 절반을 사용했다.

일주일 후 커뮤니티의 입장을 솔직하게 요약하자면: Luna Max는 Sol Medium이 아닙니다. Sol Medium보다 훨씬 저렴하고 더 나쁩니다. 그 트레이드가 좋은지 여부는 전적으로 작업이 '더 나쁘다'가 문제되지 않을 정도로 엄격하게 지정되어 있는지에 달려 있습니다.바로 아래의 배선 패턴이 그러한 용도를 위한 것입니다.

접촉에서 살아남은 패턴: Sol은 계획하고, Luna는 구현하며, 새로운 Sol이 검토한다

루나 맥스를 계속 사용해 온 사람은 누구도 그것을 범용 코딩 에이전트로 사용하지 않습니다. 실무자들이 모든 버전에서 수렴한 효과적인 구성은 네 가지 역할을 가집니다:

Orchestrator — 높은 노력 수준의 GPT-5.6 Sol, 메인 스레드에 머무릅니다. 요구사항, 아키텍처, 작업 분해 및 최종 승인을 담당합니다. 코드를 작성하지 않습니다.

일상 구현자최대 노력으로 설정된 GPT-5.6 Luna는 범위가 한정되고 완전히 명세된 작업, 즉 기계적 리팩터링, 테스트 작성, 모듈 분석, 문서화 작업과 같이 목표가 명확한 작업을 수행합니다.

하드 구현자 — 최대 성능으로 가동되는 GPT-5.6 Terra로, Luna의 명령 드리프트 비용이 커지는 컨텍스트 중심 빌드에 적합합니다.

리뷰어 — 최종 diff만 보고 그 외에는 아무것도 보지 못하는 새롭고 읽기 전용인 GPT-5.6 Sol 인스턴스입니다. "새로움"의 요점은 구현 맥락을 가진 리뷰어가 자신의 추론을 승인하는 경향이 있다는 것입니다.

참조 구현은 sol-advisor로, Dan McAteer가 만든 MIT 라이선스 Codex 플러그인이고 첫 주에 약 1,400개의 스타를 받았습니다. Codex 플러그인 마켓플레이스에서 DannyMac180/sol-advisor 저장소를 추가한 다음 sol-advisor 플러그인을 추가하여 설치합니다. 현재 형태는 시사하는 바가 큽니다: 네이티브 레인은 Terra/High 구현자를 고정한 다음 새로운 Sol/High 리뷰어를 배치하며, 최대 설정의 Luna는 사용자에게 표시되는 별도의 작업으로 실행되는 명시적 옵트인 레인이고, 기본 Sol 세션이 그 작업을 네이티브 리뷰어를 거치지 않고 직접 검토하고 승인합니다.

아무것도 설치하고 싶지 않다면, 널리 복사되는 최소 버전은 다음 위치에 있는 사용자 지정 에이전트 정의입니다: ~/.codex/agents/luna-worker.toml 두 가지 설정을 포함합니다 — model = "gpt-5.6-luna"model_reasoning_effort = "max" — 그리고 설명과 지침이 포함되어 있는데, 이 지침은 위임된 작업만을 명확한 경계를 두고 처리하도록 제한하고, 전체 목표를 변경하거나 자신의 범위를 확장하는 것을 금지하며, 아키텍처 결정과 모호한 요구 사항을 메인 에이전트로 다시 보내도록 합니다. 널리 알려진 조언은 Sol이 이 파일을 작성해 주도록 하고, 설치된 Codex 버전에 대해 검증한 다음, 수락하기 전에 diff를 보여 달라는 것입니다. 이는 레시피를 신뢰하든 그렇지 않든 건전한 방법입니다.

서브에이전트 함정, 그리고 커뮤니티가 합의한 해결책

바로 여기가 이 패턴의 바이럴 버전과 실제 작동하는 버전이 서로 갈라지는 지점입니다.

Codex의 네이티브 하위 에이전트 시스템은 GPT-5.6 Luna를 일급 시민으로 취급하지 않습니다. McAteer는 하드 블록에 부딪혔습니다 — Luna는 하위 에이전트로 허용되지 않습니다 — 그래서 대신 사용자 지정 에이전트로 선언하여 우회했고, 그 우회의 비용을 공개적으로 지적했습니다: 사용자 지정 에이전트는 네이티브 하위 에이전트처럼 메인 에이전트와 컨텍스트를 공유하지 않습니다. 며칠 후 그는 Luna 레인을 sol-advisor에서 완전히 제거했는데, 또 다른 Codex 중심 개발자의 발견을 인용하여 Luna가 하위 에이전트 역할에서 좋지 않게 작동하며 v2 다중 에이전트 프로토콜용으로 사후 훈련되지 않았을 것이라고 추정했습니다. Diego Haz는 같은 벽을 반대쪽에서 독립적으로 설명했습니다: Sol은 Luna를 하위 에이전트로 생성할 수 없으므로 Luna는 최상위 스레드에 있어야 하며, 이로 인해 조정이 지저분해집니다.

현재 다수의 입장이 된 해결책은 그것과 싸우는 것을 그만두는 것입니다:

Luna Max에는 서브에이전트 그래프의 슬롯이 아니라 자체 스레드를 제공하라. Sol 오케스트레이터에게 지시하여 Luna에서 별도의 최상위 Codex 작업을 시작하고, 이를 모니터링한 후 결과를 다시 가져오게 하라. 이것이 McAteer가 sol-advisor에 8월 4일에 다시 추가한 내용이며, 다른 여러 사람들도 독자적으로 도달한 내용이다.

컨텍스트 격리를 대가로 받아들이십시오. 별도의 스레드는 별도의 기록을 의미합니다. 그것이 당신이 치르는 세금이며, 아래의 핸드오프가 네이티브 서브에이전트 설정에서보다 여기에서 더 중요한 이유이기도 합니다.

다중 에이전트 v2로 강제로 넣어야 한다면, 카탈로그가 필터링되는 이유입니다.한 개발자는 기본 모델 카탈로그가 Luna를 v1로 표시하여 제외된 것임을 추적했고, 다음과 같은 해결 방법을 보고했습니다: 복사하세요: ~/.codex/models_cache.json, 설정하세요: Luna의 multi_agent_versionv2, 지정하세요: model_catalog_json을 복사본으로, Codex를 재시작한 다음, 오케스트레이터가 빠른 서비스 티어로 Luna를 최대치로 생성하고 포크를 끄도록 하세요. 이는 한 개인이 내부 파일에 적용한 비공식 해킹으로 간주하세요. Codex 업데이트가 깨뜨리기 쉬운 바로 그런 종류의 것입니다.

인수인계 자료: 가장 흔한 불만 사항을 해결하는 다섯 가지 질문

Luna Max에 대해 가장 많이 보고된 실패 사례는 지시를 정확히 따르지 않는다는 것입니다. 특히 특정 워크플로우나 반복 루프를 실행하도록 지정했을 때 더욱 그렇습니다. 이 불만은 모델을 좋아하는 개발자와 모델을 포기한 개발자 모두에게서 나타납니다. 실무자들이 계속해서 도달하는 완화책은 글쓰기 스타일 측면에서 더 나은 프롬프트가 아니라 더 엄격한 계약입니다. Luna 스레드가 시작되기 전에 다섯 가지에 답하세요:

이 에이전트가 완료해야 할 정확한 작업은 무엇인가요? 작업 영역이 아니라 — 완료된 상태입니다.

어떤 파일, 문서 또는 시스템이 범위에 포함됩니까? 열거된 것이지, 암시된 것이 아닙니다.

변경하지 말아야 할 것은 무엇인가? 변경이 금지된 인터페이스, 마이그레이션, 설정 및 공개 계약입니다.

어떤 증거가 완료를 증명하는가? 명명된 테스트, 특정 명령의 출력, 나열된 파일만 건드리는 diff.

어떤 누락된 결정이 그것을 멈추게 해야 할까? 추측하는 대신 돌아오게 하는 트리거 — 이것이 지나치게 열성적인 저비용 모델이 아키텍처를 발명하는 것을 방지하는 바로 그것이다.

또한 바로 여기서 회사 자체의 프롬프팅 지침을 마땅한 이름표와 함께 접목할 가치가 있습니다. 회사는 내부 코딩 에이전트 평가에서 더 간결한 시스템 프롬프트가 평가 점수를 10–15% 향상시키면서 총 토큰 수를 41–66%, 비용을 33–67% 줄였다고 보고하며, GPT-5.5 또는 GPT-5.4에서 물려받은 프롬프트를 그대로 이식하기보다 감사할 것을 권고합니다. 이는 벤더가 보고한 수치입니다. 그러나 그 방향은 이 분야에서 발견된 것과 일치합니다. 목적지를 정확히 기술하고 모든 발걸음에 대한 서술을 삭제하라는 것입니다. 위 문단과의 긴장 관계에 주목하십시오. 범위와 제약 조건에 대한 정밀함은 장황함과 같은 것이 아니며, 커뮤니티의 합의는 Luna Max가 전자는 더 많이, 후자는 더 적게 필요로 한다는 것입니다.

계획 시 대비해야 할 실패 모드

지침 이탈. 여러 개발자들이 입증한 바에 따르면, 초기 브리프의 일부를 무시하며, 브리프가 달성해야 할 결과보다 따라야 할 절차일 때 가장 심각합니다.

실제 소요 시간이 느림. 반복적으로 보고되었으며, Artificial Analysis가 최대 노력 모드에서 측정한 ~136초의 첫 토큰 생성 시간과 일치합니다. 실행해 두고 기다릴 수 있는 작업에는 괜찮지만, 대화형 반복 작업에서는 고통스럽습니다.

컨텍스트 소진. 한 개발자는 Luna Max가 258k Codex 스레드 창을 놀라울 정도로 빠르게 소모한다고 보고했으며, Codex가 한도에 가까워져 컴팩팅을 시작하면 할당량 소비가 급증할 것이라고 의심했습니다. 컴팩팅 부분은 그의 짐작일 뿐 측정된 결과는 아니지만, 소모 속도는 Artificial Analysis가 독립적으로 측정한 장황함(verbosity)에서 비롯된 예상 가능한 결과입니다. API 쪽에서는 긴 컨텍스트 단계를 유의하세요. 이 모델의 패스스루 가격 체계는 요청이 대략 272k 토큰을 넘어서면 $0.20/$1.20에서 $0.40/$1.80으로 변경됩니다. 따라서 계속 늘어나는 스레드는 총액만 더 커지는 것이 아니라 토큰당 가격도 더 비싸집니다.

시각적인 모든 것. 이것이 현장 보고서에서 가장 뚜렷한 경계선이다. 널리 읽히는 한 실무자는 Kimi K3 코딩 구독을 해지하고 Luna Max로 전환하면서, Luna Max가 해지하던 것만큼 좋고 훨씬 저렴하다고 평가했다 — 단, 프런트엔드에 대해서는 명시적인 예외를 두었다. 다른 이는 더 직설적이었다: 디자인, 그래픽, 서식 또는 슬라이드 작업을 실행하는 데 Luna를 사용하지 말 것. Sol로 계획하고 Luna로 실행하는 분할 방식은 단계별 지시형 작업을 위한 것이지 미학적 작업을 위한 것이 아니다.

하위 에이전트 카탈로그. 위에서 다루었듯이 — Luna가 멀티 에이전트 실행에서 조용히 선택되지 않는다면, 그것은 실패하는 것이 아니라 필터링되고 있는 것입니다.

거짓 경제. 어떤 벤치마크에도 나타나지 않는 유일한 실패 모드: $29 대신 $1.20가 든 세션이 만들어 낸 작업을 손으로 다시 써야 했다면, 실제 비용은 $1.20에 당신의 오후를 더한 것이다.

최대를 추구하지 말아야 할 때

Max는 무료 업그레이드가 아니며, 지금까지 유지되어 온 지침은 설정이 아니라 사다리입니다:

명확한 변환 — 필드 이름 변경, 기계적 추출, 서식 정리. Luna에서 낮거나 중간 정도의 노력. 명명된 테스트 통과를 조건으로 함.

일상적인 구현— high 또는 xhigh. Luna 작업자의 커뮤니티 기본값은 max가 아닌 xhigh입니다. 정확히는 max가 전혀 어렵지 않은 작업에 시간과 토큰을 소모하기 때문입니다.

제한적이지만 진정으로 어려운 — 이것이 max의 실제 작업입니다. 패킷은 추가 추론이 더 나은 결과로 이어지도록, 어렵고 동시에 정밀하게 지정되어야 합니다.

모호한 조사 — 등급을 바꾸지, 다이얼을 바꾸지 마세요. 모델이 계획을 덜 세우는 것이 아니라 잘못 판단하고 있다면, 더 저렴한 모델에서 더 많이 생각하게 해도 해결되지 않습니다. 그것은 Sol의 작업입니다.

모호한 브리핑 — 모델이 아니라 계약을 고치십시오. 노력 설정은 명시되지 않은 승인 기준을 대신할 수 없습니다.

구독에 특화된 주의사항, 서드파티 가이드에서 나온 것으로 쉽게 틀리기 쉬운 점: Codex가 모델별로 부과하는 크레딧 요율은 API 정가 목록과 비율이 동일하지 않으므로, API 가격 비율을 그대로 가져와 구독 라우팅 규칙으로 사용할 수 없습니다. Plus 등급에서 보고된 5시간 메시지 허용량이 이 점을 잘 보여줍니다 — Sol에서 대략 15–90개의 로컬 메시지, Terra에서 20–110개, Luna에서 50–280개이며, 범위가 이렇게 넓은 이유는 '메시지'가 고정된 작업 단위가 아니기 때문입니다. 라우팅 결정이 인보이스가 아닌 구독 상한에 의해 좌우된다면, 상한을 기준으로 측정하세요.

Codex를 넘어: 사람들은 또 무엇에 이것을 겨누고 있을까

값싸고 깊은 추론의 조합은 코딩 에이전트 외부에서도 유용한 것으로 밝혀졌으며, 그 증거가 있는 사용 사례들은 다음과 같습니다:

브라우저 에이전트. 한 개발자가 GPT-5.6 Luna로 브라우저 자동화 스택을 실행해 Hacker News 상위 15개 게시물을 열고, 연결된 모든 페이지를 읽고, 보고서를 작성했다 — 총 비용은 3센트였다. 장기적 작업, 낮은 위험, 높은 토큰 사용량: 이 모델의 가격이 책정된 바로 그 형태다.

스킬 체인. 두 명의 실무자가 각각 독립적으로, 단일 Luna Max 목표에서 이미지 생성과 이미지-투-Three.js 변환기라는 두 가지 스킬 파이프라인을 구동해 인터랙티브한 저폴리 3D 객체를 얻었다고 보고했습니다. 두 사람 모두 주간 사용량 카운터가 거의 움직이지 않았다고 언급했습니다. "시각적 작업에 Luna를 사용하지 말라"는 경고와 함께 읽어볼 만합니다. Luna는 시각적 작업을 실제로 수행한 도구들을 조율했을 뿐, 미학을 직접 평가한 것이 아니기 때문입니다.

세션 하나를 활성 상태로 유지하기. 이 모델의 캐시된 입력은 토큰 100만 개당 $0.02인 반면, 캐시되지 않은 입력은 $0.20입니다. 이는 Artificial Analysis가 가격 패널에 명시한 90% 할인율이며, 캐시 유지 시간은 약 30분입니다. 여러 가이드가 독립적으로 도달한 실질적 시사점은, 동일한 코드베이스를 계속 다시 읽는 하나의 장기 실행 세션이 작업별로 새 세션을 시작하는 것보다 훨씬 저렴하다는 것입니다.

쿼터 차익거래. 이 전체 주장 중에서 가장 공격적이며, 명백히 하나의 주장으로 명시되어 있다. 한 개발자는 노력이 거의 무료인 반면 티어 배율이 크기 때문에, 저가 티어에서 최대 노력으로 실행하면 $200 요금제로 3주 동안 49억 개의 토큰을 처리할 수 있었다고 보고한다. 이는 API 요금 기준으로 여섯 자리(수십만 달러)에 해당한다. 또한 그는 로컬 라우터 뒤에 있는 동일한 선택기에서 Kimi K3, Grok, DeepSeek 모델을 유지하고 있어서, 한 공급자의 한도에 도달해도 작업이 중단되지 않는다고 한다. 아무도 그 토큰 수치를 독립적으로 재현하지 못했다. 하지만 그 뒤에 있는 라우팅 습관이야말로 본받을 만한 부분이다.

Codex 구독 없이 동일한 분할 실행

위의 모든 것은 구독 형태의 이야기입니다. 사람들이 Luna Max에 관심을 갖는 이유는 그것이 주간 상한을 확장하기 때문입니다. API 쪽에서 동일한 아키텍처는 구축하기도 더 간단하고 이해하기도 더 쉽습니다. 허용량을 관리하는 대신 인보이스를 지불하기 때문이며, 오케스트레이터/워커 분할은 더 이상 플러그인이 아니라 일반적인 라우팅이 됩니다.

GPT-5.6 Luna는 OrcaRouter를 통해 입력 백만 토큰당 $0.20, 출력 백만 토큰당 $1.20에 이용할 수 있습니다. 이는 공급업체 공시 가격을 0% 마크업으로 전달한 가격이며, 그 덕분에 7월 30일 인하는 회사가 발표한 바로 그날 우리 측에도 적용되었지, 한 결제 주기 뒤가 아니었습니다. 호환 API를 통해 제공되며, 엔드포인트는 /v1/chat/completions/v1/responses이며, 따라서 reasoning-effort 필드는 직접 호출할 때와 똑같이 요청 본문에 포함되며, 모델 ID는 openai/gpt-5.6-luna. GPT-5.6 Sol과 GPT-5.6 Terra는 같은 키 뒤에 있습니다. 이 패턴에서 중요한 점은 다음과 같습니다. 한 계층의 오케스트레이터와 다른 계층의 워커는 하나의 통합에 포함된 두 모델 ID이지, 두 공급업체 계약이 아닙니다. 라우팅 DSL을 사용하면 이 분할을 수동으로 스레드를 이어 붙이는 대신 하나의 호출로 표현할 수 있으며, 자동 페일오버는 할당량 차익거래 사용자들이 로컬 라우터로 해결하는 경우를 처리합니다 — 어떤 공급업체의 성능이 저하되면 요청은 멈추는 대신 다른 곳으로 이동합니다.

GPT-5.6 Luna Max-4

솔직히 두 가지 주의할 점이 있습니다. Codex 고유의 기능들 — 서브에이전트 그래프, 플러그인 마켓플레이스, 모델 카탈로그, 주간 할당량 — 은 회사 소유이며, 그 어떤 것도 API 키와 함께 제공되지 않습니다. 원하는 패턴이 sol-advisor, 즉 Codex 앱 안에서 쓰이는 패턴이라면, Codex 구독이 필요합니다. 그리고 앞서 언급한 실패 모드들은 모델의 속성이지 전송 방식의 속성이 아닙니다. 라우팅은 호출 비용과 제공자가 중단되었을 때 어떤 일이 발생하는지를 바꿀 뿐, Luna가 사용자의 지시를 따르는지 여부는 바꾸지 않습니다.

이것을 복사해야 하는 사람과 복사하지 말아야 하는 사람

작업량이 많고 기계적으로 명세할 수 있는 일이라면 — 리팩터링, 테스트 스캐폴딩, 추출, 문서화, 대규모 저장소에 대한 분석 패스 — max를 켜고, Luna를 다섯 가지 질문으로 된 핸드오프와 함께 별도 스레드에 두며, 계획을 위해 Sol 인스턴스를 앞에, 검토를 위해 뒤에 배치하면, 한 자릿수 덜 드는 비용을 기대할 수 있습니다. 가장 큰 성과를 보고하는 사람들은 모두 그런 방식의 변형을 사용하고 있으며, 독립 비용 수치들도 'Sol만큼 좋다'는 프레이밍을 뒷받침하지 못하는 경우에도 그 방향성은 뒷받침합니다.

작업이 탐색적이거나 심미적이거나, 진행하면서 점점 더 명확해지는 모호한 브리프에서 시작된다면, 현장 보고서는 절약한 비용을 두 배로 들여 결과물을 다시 작업하게 될 것이라고 분명히 말합니다. 그리고 인터랙티브하게 — 앉아서 지켜보는 방식으로 — 작업한다면, 최대 성능에서의 2분 콜드 스타트는 가격이 주는 만족감보다 더 신경에 거슬릴 것입니다.

주목할 점: 회사가 Luna를 v2 하위 에이전트 프로토콜용으로 사후 학습(post-training)시키는지 여부다. 현재 플레이북의 모든 어색한 부분 — 별도의 스레드, 유실된 공유 컨텍스트, 카탈로그 해킹, retract-and-rewire 전체 에피소드 — 는 바로 그 하나의 공백 때문에 존재한다. 그 공백을 메우면 이 패턴의 최상의 버전은 몇 단계 더 단순해진다.

진짜 답을 받을 가치가 있는 질문

최대 추론 노력은 기본 설정보다 토큰당 비용이 더 많이 드나요?

아니요, 그리고 이것이 이 설정에 대한 가장 흔한 오해입니다. GPT-5.6 Luna는 노력과 무관하게 백만 토큰당 입력 $0.20, 출력 $1.20을 청구합니다. max가 바꾸는 것은 소비되는 토큰 수입니다 — 모델은 답변 전에 더 많은 계획을 세우고, 스스로 점검하고, 수정합니다. Artificial Analysis는 이 모델이 중간값 모델이 61M을 생성하는 벤치마크 스위트에서 130M 출력 토큰을 생성하는 것을 측정했습니다. 따라서 동일한 작업에서 max-effort 세션은 전적으로 볼륨 때문에 medium-effort 세션보다 비용이 더 들고, 첫 토큰을 생성하는 데도 더 오래 걸립니다. Effort는 품질 라벨을 쓰고 있는 토큰 수 다이얼입니다.

GPT-5.6 Luna는 아직 네이티브 Codex 서브에이전트로 실행할 수 있나요?

2026년 8월 5일 기준으로, 아니요 — 그리고 커뮤니티는 시도를 중단했습니다. Codex의 기본 서브에이전트 경로는 Luna를 허용하지 않습니다. 사용자 지정 에이전트 해결책은 실행은 되지만 메인 에이전트와의 공유 컨텍스트가 손실됩니다. 그리고 이 패턴에 대해 가장 잘 알려진 플러그인의 개발자는 Luna를 제거했다가, 오케스트레이터가 모니터링하는 별도로 생성된 최상위 작업으로 다시 추가했습니다. Luna가 선택되지 않는 멀티에이전트 실행을 본다면, 스톡 모델 카탈로그가 이를 v2가 아닌 v1로 표시하기 때문에 필터링되고 있을 가능성이 높습니다. 한 개발자가 자기 책임 하에 수동으로 패치했습니다. 이것은 Codex 업데이트로 변경될 목록에서 가장 가능성이 높은 단일 항목이므로, 이 레시피를 포함한 어떤 레시피도 신뢰하지 말고 설치된 버전에 대해 확인하십시오.

Claude나 Kimi K3 코딩 구독을 대체할 만큼 충분히 좋은가요?

여러 개발자들이 정확히 이 문제로 월 200달러 플랜을 공개적으로 해지했습니다. 이 문제를 수면 위로 끌어올린 게시물은 매일 코딩하는 면역학자가 쓴 것으로, 그는 Kimi K3 코딩 구독을 해지했는데, 그 이유는 품질이 나빠서가 아니라 자신의 경험상 GPT-5.6 Luna가 자기 작업에서 Kimi K3만큼 좋고 훨씬 저렴했기 때문입니다(프론트엔드 제외). 독립적인 비용 수치는 이 주장을 무시하기 어렵게 만듭니다. 동일한 벤치마크 세트에서 Kimi K3는 최대 노력으로 57점을 기록했으며 비용은 2,437달러였고, GPT-5.6 Luna는 최대 노력으로 51점을 기록했으며 비용은 174달러였습니다. 하지만 무엇이든 해지하기 전에 반대 의견을 읽어보세요. 매칭된 세션을 측정하고 부정적인 결과를 얻은 개발자들은 다른 모델을 테스트한 것이 아닙니다. 그들은 다른 종류의 작업, 즉 개방형이거나 시각적이거나 느슨하게 정의된 작업을 테스트한 것이며, 그런 종류의 작업에서는 더 저렴한 모델이 절약분을 상쇄할 만큼 크게 패배했습니다. 방어 가능한 답변은 Luna Max가 여러분의 코딩 작업의 상당 부분을 대체하지만, 반드시 최고의 코딩 모델을 대체하는 것은 아니며, 가장 큰 이점을 얻는 실무자들은 계획과 검토를 위해 최상위 등급을 유지해온 사람들이라는 것입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube