
OpenAI의 Decisions API가 끝나고 Jev가 시작되는 지점: 첫 외부 클라이언트가 보여주는 것
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 145 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 296 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
2026-10-06 23:05 UTC에 llm-openai-decisions라는 플러그인이 PyPI에 등록되었는데, 그 자체의 README에는 출시 보도에서 한 번도 언급하지 않은 문장이 들어 있다: "Jev와 달리, 새로운 gpt-6-luna 의사결정 모델은 텍스트에 더해 이미지 입력도 지원한다." 저자는 Simon Willison으로, 그는 TypeSafe의 의사결정 모델을 위한 최초의 클라이언트도 작성했으며, 그가 비교하는 대상은 GPT-6 Luna — OpenAI의 Decisions API를 뒷받침하는 모델 — 와 Jev 1.13, TypeSafe의 텍스트 전용 System One 모델이다. 같은 블로그 글에서는 플러그인 자체가 GPT-6 Astra가 OpenAI의 문서를 읽고 작성했다고 언급한다.
API가 나온 지 일주일 뒤에 클라이언트가 출시되는 것의 유용한 점은 바로 이것이다: 클라이언트는 키노트가 아니라 요청 형태에 맞춰 작성되므로, 마케팅 문구가 덮어 버리는 차이를 드러낸다. 여기에는 유출도 없고 확인되지 않은 것도 없다 — 아래의 모든 수치는 OpenAI, TypeSafe 또는 해당 플러그인 자체 저장소가 공개한 페이지에서 가져온 것이며, 모두 2026-10-07에 읽었다. 아직 빠져 있는 것은 엔드포인트 자체에 대한 독립적인 측정이며, 그 공백은 얼버무리지 않고 마지막에 명시한다.
세 개의 표면, 분리된 채 유지되는
먼저 분명히 해야 할 점은 이것들이 세 가지 서로 다른 층위이며, 언론 보도는 이들을 모호하게 뒤섞는다는 것입니다.
• 엔드포인트.OpenAI의 것은 POST /v1/decisions로, Responses API의 한 모드가 아닌 전용 라우트입니다. TypeSafe의 것은 POST /v1/systemone입니다. 둘 다 증거 본문과 타입이 지정된 질문 목록을 받아, 각 질문마다 당신이 붙인 이름을 키로 하는 답변 하나를 반환합니다.
• 모델. Decisions API는 현재 정확히 하나의 모델, gpt-6-luna를 받으며, 이는 또한 OpenAI의 일반 GPT-6 라인의 저가 티어이며 2026-09-22에 일반 텍스트 및 이미지 모델로 출시되었습니다. Jev 1.13은 처음부터 끝까지 결정 모델입니다 — 자유 텍스트를 전혀 출력할 수 없습니다. TypeSafe는 2026-09-15에 이를 출시했으며 2026-09-21부터 일반 제공되어 왔습니다.
• 클라이언트.OpenAI 자체 SDK들은 2026-10-06에 공개 베타로 공개된 이후 이 엔드포인트를 지원해 왔으므로, 이 플러그인이 이를 호출하는 첫 번째 방법은 아닙니다. 이는 우리가 확인할 수 있었던 OpenAI 자체 SDK 외부의 첫 번째 클라이언트이며, 애플리케이션 라이브러리가 아니라 명령줄 도구용으로 작성된 첫 번째 클라이언트입니다.
나란히 있는 두 미터
여기서는 클라이언트의 README가 발표문보다 더 가치가 있는데, 숫자가 문구 바로 옆에 나란히 있기 때문이다.
• 가격 — Decisions API는 입력 토큰 백만 개당 $0.10을 청구하며 출력 요금, 캐시 읽기 요금, 캐시 쓰기 요금은 없습니다. Jev 1.13은 입력 토큰 백만 개당 $0.042를 청구하며 출력은 무료입니다. 둘 다 보내는 것에 대해서만 요금을 부과하고 돌아오는 것에는 아무 요금도 부과하지 않으므로, 어느 가격이든 의사 결정 하나에 드는 비용은 1센트의 일부에 불과하며, 두 가격의 차이는 2.4배일 뿐 청구 모델이 다른 것은 아닙니다.
• 입력 — Decisions API는 텍스트 또는 텍스트와 이미지가 섞인 사용자 메시지를 받으며, 플러그인의 README에 따르면 PNG, JPEG, WebP, GIF 첨부 파일이 지원되고 요청당 최대 128개의 이미지를 담을 수 있습니다. 이미지는 인라인 base64 데이터 URL로 전달해야 합니다. 호스팅된 HTTP 또는 HTTPS 이미지 URL과 file_id 입력은 이 엔드포인트에서 허용되지 않으므로, 플러그인은 URL이나 로컬 경로를 전송 전에 변환합니다. Jev 1.13의 문서는 반대 방향으로 단호합니다: "이미지, 오디오, 비디오 입력 없음"이며, 텍스트가 아닌 입력은 상태에 도달하기 전에 텍스트나 구조화된 필드로 전처리해야 합니다.
• 질문 유형 — OpenAI는 세 가지를 문서화합니다: predicate (명시된 조건이 성립할 확률을 0에서 1 사이로 나타낸 값), choice (목록에서 고른 하나의 값, 그리고 분포와 별도의 신뢰도 필드), 및 score (정렬된 수준 전반에 걸친 확률 가중 평균). TypeSafe의 세 가지는 이름만 다를 뿐 같은 세 가지 아이디어입니다: noul은 예/아니요용, choice, 그리고 score. "Noul"은 베르누이의 줄임말이며, 그 이름은 문화적 차이를 잘 보여주는 표지입니다 — 한쪽 벤더는 평범한 영어 명사를 내놓고, 다른 쪽 벤더는 통계 농담을 내놓습니다.
• 점수 연산 — 두 방식은 정확히 일치하는데, 이는 이것이 두 개의 제품 범주가 아니라 하나의 제품 범주라는 가장 강력한 신호입니다. OpenAI의 문서는 세 가지 심각도 수준에 0.1, 0.7, 0.2의 확률을 입력하고 1.1의 점수를 돌려받습니다 — 가장 가까운 수준으로 맞추기보다 의도적으로 두 수준 사이에 있는 값입니다. TypeSafe의 수준도 같은 방식으로 0부터 인덱싱되며, Jev용 플러그인은 2개에서 10개 사이의 정렬된 수준을 받습니다. OpenAI의 페이지에는 상한이 명시되어 있지 않습니다. 그것은 그들의 문서에 없는 내용일 뿐, 우리가 단정할 수 있는 한계가 아닙니다.
• 예산 — Jev는 자사의 윈도를 정확히 문서화합니다: 요청당 대략 64,000토큰이며, 그중 약 32,000토큰은 상태와 가장 긴 단일 질문을 포괄합니다. 이는 당사 자체 카탈로그가 일반 모델로서 GPT-6 Luna에 대해 담고 있는 1,050,000토큰 컨텍스트와 대비됩니다. OpenAI의 decisions 페이지는 토큰 예산을 전혀 공개하지 않으며, 지역 처리 프리미엄과 장문 컨텍스트 입력 배수가 여전히 요금에 적용된다는 설명만 있습니다.
고객이 발표문이 밝히지 않은 것을 드러내는 것
플러그인과 README에 있는 세 가지 세부 사항은 짚어볼 가치가 있습니다. 각각이 엔드포인트를 어떻게 연결할지를 바꾸기 때문입니다.
첫 번째는 결정이 거부로 반환될 수 있다는 점입니다. OpenAI의 문서는 이를 산문으로 설명하지 않지만, 모든 SDK 샘플이 이에 대해 분기합니다 — answer.type === "refusal" JavaScript에서는, OpenAI::Models::Decision::Answer::Refusal Ruby 케이스입니다 — 그리고 플러그인의 README는 거부된 질문이 다음과 같이 보존된다고 명시합니다: {"name":"...","type":"refusal"}. 따라서 답변 유형은 사실상 세 개가 아니라 네 개의 값이며, 모든 프로덕션 루프는 발표에서 언급되지 않은 네 번째 분기를 처리해야 합니다.
두 번째는 플러그인에 있는 것이 아니라 플러그인에서 빠져 있는 것입니다. Willison 본인의 게시물은 이 작업을 GPT-6 Astra가 새로운 문서를 읽고 그로부터 클라이언트를 구축하는 것으로 설명합니다 — 문서에서 클라이언트로, 한 번에, 인간 튜토리얼 없이. 이제 그것은 클라이언트가 작성되는 일반적인 방식이며, 이는 엔드포인트의 문서가 작동하는 클라이언트를 생성할 만큼 충분히 완전한지에 대한 질문이 편집상의 문제가 아니라 실무적인 문제가 되었음을 의미합니다. 이 엔드포인트의 경우 답은 대체로 '그렇다'이며, 거부 유형이 눈에 보이는 이음새입니다.
세 번째는 질문 배열의 형태다. OpenAI는 공유 입력에 대해 독립적인 질문들을 하나의 요청에 담을 수 있게 해준다. 제품 사진의 손상 여부를 확인하고 같은 호출에서 그 카테고리를 분류하는 식이다. 하지만 나중 질문이 이전 답변에 의존할 때는 별도 요청을 요구한다. Jev도 같은 이유로 같은 입장을 취한다. Jev의 질문들은 하나의 상태에 대해 병렬로 평가되므로, 순차적인 것은 무엇이든 두 번의 호출이 되어야 한다. 두 공급업체 모두 팬아웃을 염두에 두고 설계했으며, 지연 시간 예산이 어디에 쓰이는지에 대해 같은 말을 하고 있다.
이 범주에는 이제 세 개의 구성원이 있으며, 그중 두 개는 일반 모델이 아닙니다.
세 번째 항목에도 이름을 붙일 만하다. 결정 엔드포인트라는 프레임은 세 가지를 모두 놓고 볼 때만 말이 되기 때문이다. 퍼플렉시티는 자체적인 Decisions API를 제공하며, 이를 pplx-decider-v1-27b가 처리한다 — 2026-10-01에 Hugging Face에 가중치가 공개된, Apache 2.0에 따라 배포된 270억 매개변수 결정 모델이다. 이로써 이 범주는 OpenAI와는 확실히 다른 형태를 띠게 된다. Jev 1.13은 폐쇄형이자 텍스트 전용이고, 퍼플렉시티의 decider는 오픈 웨이트이며 이미지를 받아들이며, GPT-6 Luna의 진입은 결정을 위해 만들어진 모델이 아니라 범용 모델을 감싼 하네스다.
오늘 선택하는 독자에게 실질적인 구분은 마케팅에서 말하는 것보다 좁다. 증거가 문장이나 기록이고 호출당 비용이 가장 저렴하고 동작 변동이 가장 적은 것을 원한다면, Jev 1.13은 특화 모델이며 $0.042 요금은 우리가 확인할 수 있었던 세 개의 공개 가격 중 가장 낮다. 증거에 사진이 포함되어 있거나 일상적인 작업에서 이미 알고 있는 모델로부터 결정을 원한다면, Decisions API는 두 개의 폐쇄형 옵션 중 이미지를 받는 유일한 것이다. 오픈 웨이트 옵션은 다른 질문 — 통제와 셀프 호스팅 — 에 답하며, 우리는 이를 테스트하지 않았다.
우리가 실제로 측정할 수 있는 것, 그리고 아무도 가지고 있지 않은 것
OpenAI가 이 엔드포인트에 대해 내세우는 주장은 "텍스트, 이미지 또는 둘 다를 평가하고 Responses API보다 약 10배 빠르게 타입이 지정된 답변을 반환한다"는 것입니다. 이는 공급업체가 주장한 사항일 뿐 재현되지 않았습니다: 리전도, 입력 크기도, 동시성 수준도, 서비스 수준 협약도 없으며, 기준선은 특정 워크로드가 아니라 일반적인 Responses API입니다. 단일 속도 향상 수치는 마감 기한을 세울 근거로 삼기에는 잘못된 숫자입니다.
그 옆에 함께 놓을 수 있는 것은 아래 두 모델에 대한, 2026-10-07에 끝나는 우리 자체의 7일 서빙 윈도우이며, 이는 우리 플레이그라운드 트래픽에서 나온 것입니다. 그리고 그 숫자들이 무엇이 아닌지를 밝히는 것이 중요합니다. 그 숫자들은 일반적인 생성 요청을 설명할 뿐, 결정을 설명하는 것이 아닙니다.
• GPT-6 Luna, 모든 요청 형태: 중앙값 1,448ms, p95 4,912ms, 7일 동안 643,394,111개 토큰에서 1.31% 오류율. 이는 모델이 생성 중일 때 초당 약 125개 출력 토큰의 처리량이 어떤 모습인지를 보여줍니다.
• Jev 1.13: 중앙값 149ms, p95 245ms, 110,193,080개 토큰에서 0.10%의 오류율. 이는 정말로 빠른 엔드포인트이며, 응답을 생성하지 않기 때문에 빠릅니다 — 한 번 인제스트되는 상태에 대한 숫자를 반환할 뿐입니다.
서로 맞대어 읽으면 그 두 행은 비교가 아니라 경고다. 결정 요청은 소수의 토큰만 내보내므로, Decisions API에서는 Luna의 일반 프로필을 지배하는 출력 처리량 수치가 더 이상 구속 제약이 아니게 되고, 중요해지기 시작하는 숫자는 모델이 증거를 읽는 데 걸리는 시간이다. 우리는 decisions 엔드포인트에서 그것을 측정한 적이 없으며, 우리가 알기로는 OpenAI 외부의 누구도 그것을 공개하지 않았다.
더 깊이 측정되지 않은 문제는 캘리브레이션이며, 이것이 이 모든 것이 사용 가능한지를 결정하는 문제다. 가시적 손상에 대한 확률 0.92는, 전체 트래픽에서 0.92 근처로 점수된 사진들이 실제로 약 92%의 경우 손상되어 있을 때에만 라우팅 기준으로 삼을 가치가 있다. OpenAI 문서는 레이블된 예시로부터 임계값을 설정하고, 거짓 양성과 거짓 음성의 비용을 비교해 임계값을 선택하라고 말한다. 이는 올바른 조언이며, 동시에 이 숫자들의 캘리브레이션은 스스로 확립해야 하는 것이라는 고백이기도 하다. 첫 번째 단계로, 이미 정답을 알고 있는 샘플에서 반환된 확률들의 분포를 측정하라. 모든 것이 0.99나 0.01로 반환된다면, 임계값은 아무 일도 하지 않는 것이며 그 엔드포인트는 매우 값비싼 불리언일 뿐이다.
프로덕션 경로를 걸지 않고 둘 중 하나를 시험해 보는 방법
출처를 분명히 밝히면: 이 글의 엔드포인트 계약, 가격 및 이미지 규칙은 OpenAI 자체의 Decisions API 문서와 플러그인의 README에서 가져왔으며, 둘 다 2026-10-07에 확인했습니다. Jev 1.13 사양은 TypeSafe 자체의 모델 문서에서 가져왔습니다. 서빙 수치는 2026-10-07에 끝나는 7일 구간에 대한 자체 플레이그라운드 데이터입니다. 패키지 타임스탬프는 PyPI와 프로젝트의 Git 이력에서 가져왔습니다. 10배 속도 주장은 OpenAI의 것이며 그렇게 표시되어 있습니다. 오픈 웨이트 decider의 라이선스와 릴리스 날짜는 해당 모델 저장소에서 가져왔습니다.
Decisions API 자체는 OpenAI가 직접 패키징한 것이며 저희가 라우팅하지 않습니다. 그 특정 엔드포인트를 원하신다면, 그것이 있는 곳은 OpenAI입니다. 그 아래의 모델들은 별개의 문제입니다. GPT-6 Luna는 OrcaRouter에서 OpenAI 정가 그대로, 마크업 없이 전달되는 라이브 라우트이며, typesafe/jev-1.13도 정가로 동일한 키에서 사용할 수 있으므로, 이 글의 비교는 읽는 것이 아니라 직접 실행해 볼 수 있는 것이 됩니다. 동일한 상태, 동일한 질문, 두 개의 엔드포인트, 관리할 계약 하나, 그리고 두 번째 청구서는 없습니다.
이는 또한 검증되지 않은 표면을 도입하는 현명한 방법이기도 합니다. 결정을 폴백 뒤에 두어 거부, 타임아웃, 또는 사용 중에 바뀌는 베타 한도가 중단이 아니라 프롬프트 기반 호출로 저하되도록 하고, 그 폴백을 기본 호출과 동일한 키에 유지하여 엔드포인트가 일반 제공(GA)으로 나아갈 때 다시 배선할 것이 없도록 하세요. OpenAI는 GA가 앞으로 몇 주 안에 있을 것으로 예상된다고 하며 gpt-6-luna가 그동안 사용 가능한 유일한 모델이라고 말합니다. 이 두 가지는 모두 지금 그 형태에 맞춰 구축하고 계측할 이유이며, 어느 것도 아직 결제 승인을 그 뒤에 둘 이유는 아닙니다.

다음에 볼 콘텐츠
이 글에서 답할 수 없는 질문들을 해결해 줄 세 가지가 있다. decisions 엔드포인트에 대해 공개된 토큰 예산, 그래야 요청을 추측하는 대신 규모를 산정할 수 있다. 어떤 GA 발표든, 바로 그 시점에 input-only 요금은 더 이상 베타 약속이 아니게 된다. 그리고 엔드포인트 자체의 지연 시간과 캘리브레이션에 대한 한 건의 독립적 측정 — 몇천 개의 라벨링된 쌍을 여기에 통과시켜 신뢰성 곡선을 공개하는 첫 번째 사람은 어느 출시 글이 한 것보다 이 범주에 더 크게 기여할 것이다.
그때까지 정직한 요약은 좁고 유용합니다. 결정해야 할 대상이 텍스트라면 Jev 1.13이 더 저렴하고, 우리 트래픽에서는 약 150밀리초 만에 숫자를 반환합니다. 결정해야 할 대상에 이미지가 포함된다면 OpenAI의 Decisions API가 그것을 살펴볼 것이며, 입력 가격은 2.4배이고 박스에는 베타 라벨이 붙어 있습니다. 둘 다 이번 주부터 명령줄에서 호출할 수 있으며, 이는 7일 전 둘 중 어느 쪽이 있었던 위치보다 더 나은 위치입니다.


