
OpenAI의 Decisions API: GPT-6 Luna, 채팅을 멈추고 하나의 답을 고르다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 393 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 209 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
GPT-6 Luna2026년 9월 22일 OpenAI의 GPT-6 라인업에서 가장 저렴한 단계로 출시되었습니다. 9월 29일에 새로운 것은 대화와는 전혀 무관한, 이 모델이 맡을 작업입니다. OpenAI의 Decisions API는 여러분이 작성한 질문, 여러분이 허용하는 유한한 답변 목록, 그리고 텍스트나 이미지 형태의 컨텍스트 한 조각을 받아 그중 하나의 답변을 반환합니다. 산문이 아닙니다. 해석하고 기대해야 하는 문단도 아닙니다. 단 하나의 선택이며, 그래서 지원 티켓은 다섯 개 대기열 중 하나로 배정되고, 이미지는 하나의 모더레이션 카테고리에 분류되며, 에이전트는 여러분이 정의한 정책에서 다음 행동을 골라냅니다. 이 API는 DevDay 2026에서 발표되었고 현재 제한적 프리뷰로 제공되고 있으며, OpenAI는 향후 며칠 안에 폭넓은 출시를 계획하고 있다고 밝혔습니다.
팀이 이 기능을 기반으로 무언가를 만들기 전에 필요한 정보 대부분은 아직 공개되지 않았다. 호출당 가격도 없고, 한 요청이 얼마나 많은 후보 답변을 담을 수 있는지에 대한 명시된 제한도 없으며, 자체 데이터로 튜닝할 수 있는지에 대한 언급도 없고, 9월 30일 기준으로 OpenAI 자체 개발자 문서 색인, 변경 로그, API 참조 어디에도 이에 대한 항목이 없다. 우리는 세 곳 모두를 확인했다. 이 기능은 현재 OpenAI의 DevDay 요약과 출시 당일 OpenAI 대변인이 기자들에게 말한 내용에 존재한다. 그래서 이 글의 나머지 부분에서는 세 계층을 눈에 띄게 분리해 유지한다: OpenAI가 확인한 것, 출시 당일의 한 측정이 주장하는 것, 그리고 아직 아무도 알 수 없는 것.
제약된 결정이란 실제로 무엇인가
기존의 두 가지 접근 방식은 이 작업을 형편없이 해내며, Decisions API는 그 둘 사이의 간극을 겨냥합니다. 첫 번째는 채팅 모델에 프롬프트를 넣는 것입니다. 목록에서 선택하도록 정성껏 지시문을 작성하면, 모델이 문장을 써 주고, 운이 좋으면 응답에서 토큰 확률을 읽어 신뢰도 점수와 비슷한 것을 얻을 수 있습니다. 작동은 하지만 토큰을 소모하며, 그 신뢰도 숫자는 대략적인 추측에 불과합니다. 두 번째는 작은 분류기를 훈련하는 것입니다. 빠르고 저렴하지만, 레이블이 지정된 데이터가 필요하고 레이블 집합이 바뀔 때마다 재학습을 실행해야 합니다.
결정 모델은 그 둘 사이에 있습니다. 결정 모델은 프롬프트에 새 레이블을 받아들입니다 — 프롬프트가 그러는 것과 같은 방식으로 — 하지만 개발자가 파싱하지 않고도 분기할 수 있는 점수나 선택을 반환합니다. 이는 분류기가 가졌고 채팅 모델은 결코 갖지 못한 속성입니다. OpenAI가 이런 형태에 낯설지 않습니다. OpenAI의 Moderation API는 수년간 텍스트 대신 범주별 점수를 반환해 왔습니다. 다만 여기서 중요한 한 가지 차이가 있습니다. Moderation의 범주는 OpenAI의 것입니다. Decisions API의 범주는 여러분의 것입니다.
제약 조건이 곧 제품이며, 그것이 무엇을 주고 무엇을 주지 않는지 정확히 따져보는 것이 좋습니다. 유한한 출력 공간은 모든 허용 값이 미리 알려져 있다는 뜻이므로, 애플리케이션은 자신이 정의하지 않은 답변을 거부하고, 각 분기에 서로 다른 권한 수준을 부여하며, 신뢰도나 맥락이 부족할 때 사람에게 넘길 수 있습니다. 또한 모든 테스트 케이스에 목표 클래스가 있고 틀렸을 때 측정 가능한 비용이 있으므로, 오프라인 평가를 수월하게 만듭니다. 그것이 주지 않는 것은 정확성입니다. 제약된 모델은 여전히 잘못된 유효 답변을 선택하거나, 오해를 부르는 맥락에 휘둘리거나, 당신이 작성한 범주가 지닌 편향을 물려받을 수 있습니다.
150밀리초라는 주장, 그리고 OpenAI가 공개하지 않은 숫자
OpenAI는 Decisions API가 일반 API를 통해 GPT-6 Luna가 의사 결정을 내리는 것보다 약 10배 더 빠르게 의사 결정을 내린다고 말한다 — 150밀리초 대 약 1.6초 수준이다. 이 수치는 벤더가 주장한 것이며 재현되지 않았다. 출시 후 이틀 동안 이에 대한 독립적인 측정은 없었고, OpenAI 자체 요약에는 “실시간 의사 결정”이라고만 적혀 있다. 지연 시간 분포, 리전, 입력 크기, 동시성 수준, 서비스 수준 계약 중 어느 것도 이 수치와 함께 제공되지 않는다.
우리 자체 트래픽 데이터가 그 테스트를 대체할 수는 없지만, 누락된 분포가 왜 중요한지는 설명해 준다. 9월 30일까지의 7일 동안 OrcaRouter의 일반 chat-completions 경로를 통해 제공되는 GPT-6 Luna는 혼합 워크로드 32억 3천만 토큰에 걸쳐 중앙값 699밀리초, p95 7.6초를 보였다 — 중간값과 꼬리 사이의 격차가 10배가 넘는다. 이는 제약된 결정과는 다른 요청 형태이므로, 150ms 주장과의 비교는 아니다. 단일 대표 p50이 데드라인을 설계하는 기준으로 잘못된 수치인 이유가 바로 여기에 있다. 프리뷰를 테스트한다면 텍스트와 이미지 입력에 대해 중앙값, p95, p99를 각각 기록하고, 네트워크 시간과 재시도를 포함하며, 제품이 실제로 가진 데드라인을 측정하라 — 비동기 큐에 대한 라우팅 결정과 클릭과 결제 사이에 있는 결정은 동일한 지연 예산을 공유하지 않는다.

가격 책정: 기반 모델에 드는 비용, 그리고 그것이 API의 가격이 아닌 이유
OpenAI는 Decisions API에 대한 요금을 공개하지 않았습니다. Luna 토큰 요율이 적용된다고 가정하는 것도 안전하지 않습니다. Decisions API는 자체적인 패키징으로, 한도가 다른 별도의 엔드포인트이며, OpenAI는 "광범위한 출시" 때 더 자세한 내용을 공유하겠다고 밝혔기 때문입니다. 지금 누군가 결정당 비용을 제시한다면, 그것은 추측에 불과합니다.
공개된 것은 그것이 기반으로 하는 모델의 요금표이며, 2026년 9월 30일 OpenAI 가격 페이지에서 확인한 내용입니다:
• 입력 — 백만 토큰당 $0.10이며, 입력 토큰이 272,000개를 초과하면 $0.20이 됩니다
• 출력 — 백만 토큰당 $0.50이며, 입력 토큰이 272,000개를 초과하면 $0.75가 됩니다
• 캐시된 입력 — 백만 토큰당 $0.01이며, 캐시 쓰기는 $0.125로 청구되는데, 이는 캐시되지 않은 요금보다 25% 높은 금액입니다
• 배치 및 Flex 처리 — 표준 요금의 50%, Fast 모드 — 적용 요금의 2배
롱 컨텍스트 경계선은 사람들이 자주 걸려 넘어지는 부분이며, GPT-6 제품군 전반에서 그렇듯 동일하게 작동합니다. 입력 토큰 272,000개를 넘기면 초과분만이 아니라 요청 전체가 더 높은 등급으로 재과금됩니다. 긴 문서나 대용량 이미지 세트를 모델에 넘기는 의사 결정 API는 바로 그 경계선을 넘을 수 있는 유형의 호출이며, 이는 프리뷰의 미공개 한도가 남겨 둔 또 하나의 불확실성입니다.
GPT-6 Luna, 그 나름의 기준으로
API를 걷어내면 그 밑에 있는 모델은 3계단 패밀리의 맨 아래에 위치한 추론 모델로 — $2.00/$10.00의 GPT-6 Sol과 $10.00/$50.00의 플래그십 GPT-6 Astra 아래에 있으며 — 1,050,000토큰 컨텍스트 창, 128,000토큰 출력 상한, 2026년 5월 18일 지식 컷오프, 그리고 none부터 max까지 여섯 개 값에 걸쳐 설정할 수 있는 추론 노력을 갖추고 있다. 텍스트와 이미지 입력을 받아 텍스트를 반환하며, OpenAI 자체 개발자 문서에서 노력의 기본값은 medium이다. 같은 페이지에서 나온 실용적인 주의 사항 하나는 Decisions API와는 무관하지만 Luna를 폴백으로 연결하는 경우 관련이 있는데: Chat Completions에서는 추론 노력이 none로 설정된 경우에만 함수 호출이 작동한다. 다른 노력 설정에서의 도구는 Responses API가 필요하다.
품질에 관해, 독립적인 수치는 Artificial Analysis의 Intelligence Index로, 최대 노력에서 Luna는 37.3인 반면 GPT-6 Sol은 47.5입니다 — 약 10점 차이이며, 이는 입력 기준 20배의 가격 차이를 해석하는 정직한 방식입니다. 두 수치 중 어느 것도 Decisions API에 대한 진술이 아닙니다. Decisions API의 제한된 작업은 전적으로 다른 측정이며 공개된 점수가 없습니다.

Jev, Laya, 그리고 "시스템 원" 프레이밍
Decisions API는 빈 분야에 등장한 것이 아니었다. TypeSafe AI의 Jev는 2026년 9월 15일 Diogo Almeida가 출시한, 9월 21일부터 일반 제공된, 개발자들이 이 범주를 이해할 수 있게 만든 모델이다: 텍스트를 전혀 생성하지 않고 대신 신뢰도 값이 담긴 타입 지정 답변을 반환하며, 백만 입력 토큰당 $0.042이고 출력은 0으로 청구된다. Every가 수행한 Jev의 첫 독립 테스트에서는 37개 문서에 걸친 777개 판단을 0.7초 이내에 약 4분의 1센트로 처리했고, 두 번째 테스트에서는 구절당 중앙값 0.35초를 기록했는데, 이는 고강도 설정에서 Claude Fable 5.1이 기록한 8.83초와 대비된다 — 약 25배 더 빠르고 비용은 약 580분의 1이면서, 의도적으로 심어 놓은 결함 7개 중 6개를 잡아냈지만 Fable 5는 7개를 모두 잡아냈다. "좋지만 완벽하지는 않다"는 Every의 평이었고, 그것이 올바른 한 줄 요약이다. Laya는 같은 형태의 세 번째 진입자로, 토큰 하나도 쓰지 않고 답하는 결정 모델이다.
OpenAI가 Jev 때문에 Decisions API를 만들었는지는 추측에 불과하다. The New Stack은 출시 당일 이를 보도하면서 TypeSafe에 대한 반응을 "유력하다"고 표현했고, OpenAI가 DevDay를 앞두고 발표를 서둘렀을 가능성이 크다고 언급했다. OpenAI는 그런 말을 한 적이 없으며, 시점 — 9월 21일 Jev의 일반 제공(GA), 9월 29일 DevDay — 은 시사하는 바가 있지만 증거는 아니다. 추측이 아닌 것은 두 제품이 구매자가 중요하게 여기는 축에서는 아직 비교할 수 없다는 점이다. Jev는 가격, 호출당 형태, GA 날짜를 공개한다. Decisions API는 그 세 가지 중 어느 것도 공개하지 않는다.
어디에서 실행되는지, 그리고 그 옆에 무엇을 따뜻하게 유지할지
Decisions API는 OpenAI 자체 패키징입니다. 우리 카탈로그에 있는 모델이 아니며 우리가 라우팅하지도 않으므로, 이 특정 엔드포인트를 원하신다면 OpenAI에 있습니다. 이것이 기반으로 하는 모델은 별개입니다: GPT-6 Luna는 OrcaRouter의 라이브 라우트로, OpenAI의 정가 그대로, 마크업을 전혀 붙이지 않고 제공됩니다 — 100만 토큰당 입력 $0.10, 출력 $0.50, 272K 초과 티어는 $0.20/$0.75 — 그리고 9월 30일까지의 7일 동안 0.18%의 오류율로 우리를 통해 32억 3천만 토큰을 처리했습니다.
이는 프리뷰의 위험을 줄이는 방식에 중요합니다. 제약된 결정 엔드포인트를 테스트하는 현명한 방법은 프롬프트 기반 경로를 폴백으로 계속 살려 두는 것입니다. 프리뷰는 예고 없이 한도나 가격을 바꿀 수 있고, 크리티컬 패스에 놓인 결정은 어디론가 갈 곳이 필요하기 때문입니다. 그 폴백을 다른 모델과 같은 키에 두면 두 번째 계약도, 폴백 경로를 위한 코드 변경도 필요 없습니다: 200개 이상의 모델을 위한 단일 API, 자동 페일오버가 한 제공업체가 흔들릴 때 제공업체 전반에서 이루어집니다. 그리고 여러분의 결정이 더 긴 체인의 한 단계라면, 라우팅 DSL이 모델들을 단일 호출로 구성합니다. 이는 바로 Jev 커버리지가 대중화한 오케스트레이터+결정자 패턴입니다 — 더 큰 모델이 계획하고, 작은 모델이 각 단계를 선택하는 것이죠. 그 패턴은 오늘날 우리가 제공하는 모델들로 구성할 수 있습니다. Decisions API 자체는 OpenAI가 개방할 때까지 그 바깥에 머물 것입니다.
누가 움직여야 하고, 누가 기다려야 할까요?
당신의 문제가 잘못된 분기가 저렴하고 되돌릴 수 있는 대량 분류나 라우팅 작업이라면, 이번 주에 프리뷰는 요청 형태 하나와 레이블링된 세트 하나를 투자할 가치가 있습니다. 그 역량은 실재하고, 그 제약은 산문을 파싱하는 것보다 진정한 개선이며, 프리뷰는 오류 비용이 어디에 떨어지는지 알아내기에 가장 저렴한 시점입니다. 당신의 결정이 돈을 승인하거나, 고객에게 메시지를 보내거나, 사용자와 결제 사이에 놓인다면, 이번 주의 어떤 것도 당신의 계산을 바꾸지 않습니다. 모델링할 공개 가격도, 설계에 반영할 공개 한도도, SLA도, 자사 데이터로 이걸 조정할 수 있는지에 대한 언급도 없습니다. 그 네 가지 공백이 바로 '광범위한 롤아웃'이 채워야 하는 것이며, OpenAI가 그것들을 명시할 때까지 Decisions API에 대한 정직한 해석은 빠른 벤더 표방 일정이 붙어 있고 청구서는 없는 유망한 인터페이스입니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
