
Microsoft-Decision-1: 문장 대신 숫자로 답하는 마이크로소프트 모델
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 79 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
Microsoft-Decision-1의 모델 카드에는 다른 어떤 Microsoft 모델도 지금까지 담지 못한 문구가 있습니다: 텍스트 생성을 위해 설계되지 않음. 이 모델은 Microsoft Foundry에서 2026년 10월 8일에 정식 출시되었으며, 이는 언어 모델의 용도에 대한 의도적인 축소입니다. 여러분은 모델에 상황과 함께 고정된 답변 목록 — 예/아니요, 객관식 세트, 평점 척도, 루브릭 — 이 있는 질문을 주면, 각 옵션에 대해 보정된 확률을 반환합니다. 산문은 없습니다. 설명도 없습니다. 근거 필드도 없습니다. 출력은 JSON 숫자뿐이며 그 외에는 아무것도 없습니다. 이는 오픈 가중치 Qwen3.5-9B를 기반으로 구축되었으며, Microsoft가 포스트 트레이닝했고, Microsoft는 나중에 이 모델을 다른 백본으로 리베이스할 것이라고 하며 MAI와 기타 파트너 모델을 언급했습니다.
그것은 처음 들리는 것보다 더 낯선 제품이다. 2026년 마이크로소프트의 경쟁적 위치는 프런티어 채팅 모델과 Copilot에 달려 있으며, Microsoft-Decision-1은 둘 모두와 정반대다: 중형의 단일 목적 스코어러로, 그 존재 이유 전체가 애플리케이션에 당신 자신의 선택지 중 어느 것이 가장 정답일 가능성이 높은지, 그리고 그것이 얼마나 확신 있는지를 알려주는 것이다. 흥미로운 질문은 그것이 글쓰기를 잘하느냐가 아니다 — 그것은 글쓰기를 명백히 못하며 시도하지도 않는다 — 오히려 선택지들에 대한 확률 분포가 기업이 실제로 실행하는 워크로드에 대해 JSON 모드를 갖춘 또 하나의 범용 모델보다 더 유용한 기본 요소인가이다.
그것이 정확히 하는 일
계약은 한 번의 호출이 들어가고 하나의 분포가 나오는 것이다. Microsoft는 지원되는 질문 형식을 예/아니요, 객관식, 평점, 분류, 루브릭 기반으로 나열한다. 모든 선택지에는 점수가 부여된다. 모델은 최대 32K 토큰의 입력에 대해 단일 호출로 실행되며 — 명시된 컨텍스트 창은 32,768이다 — 실질적인 상한은 입력에 선택지 집합을 더한 것이지 생성 예산이 아니다. 생성이 없기 때문이다.
공개된 사용 사례들은 플랫폼 팀이라면 즉시 알아볼 수 있는 것들입니다:
• AI 출력 평가 — 생성된 응답을 제공된 평가 기준에 따라 채점하거나, 주어진 증거에 근거하고 있는지 판단합니다.
• 분류 및 라우팅 — 요청을 분류하고, 관련성을 판단하고, 대기열을 선별하고, 워크플로 분기를 선택합니다.
• 에이전트 가드레일 — 통합 애플리케이션이 실행을 허용하기 전에 제안된 도구 호출이나 에이전트 작업을 평가합니다.
• 콘텐츠 안전 심사 — 고정된 공급업체 정책이 아니라 애플리케이션이 정의한 임계값을 기준으로 콘텐츠에 플래그를 지정합니다.
• 검색 및 문서 관련성 — 검색된 문서가 주어진 질문에 답하는지 판단합니다.
• 신뢰도 기반 자동화 — 신뢰도가 높은 결과는 자동으로 수용하고 나머지는 담당자에게 에스컬레이션합니다.
주목할 만한 세부 사항은 기권 옵션입니다. Microsoft는 제공된 증거가 불충분할 때 "판단할 수 없음"과 같은 옵션을 명시적으로 지원합니다. 이는 보정된 점수 산출기와 그저 확신만 하는 점수 산출기의 차이입니다. 그리고 점수가 숫자로 반환되므로, 에스컬레이션 임계값은 여러분이 직접 내리는 결정입니다 — 0.7은 무언가를 사람에게 넘기고 0.95는 넘기지 않는 기준을 여러분이 정합니다.
그것이 하지 않을 것
Microsoft는 제외 사항에 대해 이례적으로 명확히 밝히고 있으며, 실제 파이프라인에 이 모델을 투입하려는 사람에게는 이러한 제외 사항이 기능 목록보다 더 중요합니다. Microsoft-Decision-1은 않았습니다. 폐쇄형 질문과 정해진 답변 선택지가 없는 작업이나, 입력에 없는 지식을 요구하는 작업에는 사용하도록 의도되지 않았습니다. 텍스트 전용입니다. 이미지, 오디오, 비디오는 입력되지도 출력되지도 않습니다. 설명이나 근거를 제공하지 않습니다.
그것들을 함께 읽으면 쉽게 걸려 넘어질 수 있는 경계가 드러난다. 이것은 사물을 분류하도록 요청할 수 있는 챗봇이 아니고, 점수를 덧붙일 수 있는 요약기가 아니다. 이것은 토큰 예산을 가진 채점 함수다. 팀 자체의 설명 — 사람에 관한 중대한 결정에서 유일한 자동 의사결정자가 되어서는 안 되며, 신용, 고용, 주거, 보험, 교육, 의료, 법적 권리 "또는 이와 유사하게 중대한 영역"과 관련된 결정의 유일한 근거가 되어서는 안 된다는 — 도 같은 방향을 가리킨다. 이것은 결정 옆에 자리하도록 설계되었지, 결정 그 자체가 되도록 설계되지 않았다.

벤치마크 상황은 아무도 보도하려 하지 않는 이야기다
숫자는 없습니다. Microsoft-Decision-1의 Microsoft Foundry 카탈로그 페이지에는 Benchmarks 탭이 있는데, 수치로는 비어 있습니다. 대신 그 안에 담긴 것은 방법론 문단과 정성적 주장입니다: 이 모델은 "공개 및 커뮤니티 의사결정 벤치마크와 학습에 사용되지 않은 홀드아웃 내부 테스트 세트에서 평가되었으며," Microsoft는 이 모델이 "동일한 방법론으로 평가된 다른 오픈 의사결정 모델보다 앞서고 선도적인 의사결정 모델과 동등한 성능을 발휘한다"고 보고하며, 사용된 지표는 정확도, 보정 오류, 안전 리콜, 거짓 양성률 및 공정성 일관성이었고, 선택지 순서를 다양화하고 대응 통계 검정을 적용했습니다.

그것은 발표된 결과가 전혀 없는 상태에 붙은 진지한 방법론 설명이다. 이는 오늘날 Microsoft-Decision-1에 관한 모든 성능 주장이 공급업체가 보고한 것이며 재현되지 않았음을 의미하고, 그것을 평가하는 누구에게나 정직한 입장은 확률을 애초에 유용하게 만드는 유일한 속성인 캘리브레이션이 Microsoft 외부에서는 검증되지 않았다는 것이다. 회사는 모델이 가장 강하다고 믿는 분야와 가장 약한 분야를 밝히고 있는데, 이는 대표 점수보다 더 유용하다: 추론, 규칙 적용, 프롬프트 형식에 대한 견고성에서 가장 강하고; 분류, 검색, 공정성, 도구 사용 및 대부분의 다국어 작업에서 경쟁력이 있으며; 전문 도메인 지식 작업에서는 더 약하다.
자가 보고한 한계는 기능 목록보다 먼저 읽어볼 가치가 있습니다. 점수는 문구와 선택지 순서에 따라 달라질 수 있으며, 잘 구성되지 않은 질문도 여전히 점수를 반환합니다. 보정은 익숙한 작업 유형에서 가장 강합니다. 오래된 지식에 의존할 수 있고, 설명은 제공하지 않습니다. 다국어 지원 범위에 관해: 일본어, 한국어, 아랍어, 베트남어, 태국어, 터키어, 힌디어, 벵골어, 스와힐리어, 히브리어, 페르시아어, 우크라이나어를 포함해 25개 언어가 지원되는 것으로 나열되어 있지만, Microsoft는 지원 범위, 품질 및 보정이 "언어에 따라 달라질 수 있다"고 밝히며, 비영어 — 특히 저자원 언어 — 를 성능이 떨어지는 영역으로 나열합니다. 기반이 되는 Qwen3.5-9B는 200개 이상의 언어를 지원하며, 사후 학습된 모델은 그 4분의 1을 지원합니다.
어떻게 받는지, 그리고 비용은 얼마인지
Microsoft-Decision-1은 Microsoft Foundry의 "Direct from Azure" 포트폴리오에서 호스팅 API로 배포됩니다. 모델 가중치는 배포되지 않습니다. 이는 오픈 가중치 릴리스가 아니며, 다운로드할 수 있는 Hugging Face 리포지토리도 없습니다. HTTPS 요청을 보낼 수 있는 모든 애플리케이션은 Foundry 엔드포인트와 표준 Azure 인증을 사용하여 통합할 수 있습니다. 배포 목록에는 종량제 또는 예약 프로비저닝 처리량, 표준 SKU에서 서버리스 및 통합 엔드포인트 옵션이 표시되며, 일괄 추론은 비활성화되어 있고, 학습 공개 정보에 따르면 학습 데이터 세트는 2026년 9월에 처음 사용되었으며 수집이 진행 중입니다.
가격은 모델 페이지에 공개되어 있지 않습니다. 카탈로그의 가격 필드는 입력 및 출력 요율을 표시하는 대신 Microsoft의 모델 가격 페이지로 연결되므로, Decision-1 호출의 토큰당 비용은 Azure 가격 책정 화면에서 찾아보거나 청구서에서 확인해야 하는 항목입니다. 이는 대량으로 결정당 비용을 모델링하려는 사람에게 실질적인 공백이며, 추정하기보다 분명히 말할 가치가 있습니다. 실제로 가격을 산정할 때 알아둘 만한 두 가지가 있습니다. 비용에서 출력 토큰이 차지하는 비중은 0%인데, 출력 토큰이 없기 때문입니다. 그리고 배치 추론이 비활성화되어 있으므로 생성 모델에서처럼 배치 채널을 통해 대량 스코어링 실행 비용을 상각할 수 없습니다.
OrcaRouter가 여기서 맡는 역할은 호출의 반대편에 있습니다. 우리는 Microsoft-Decision-1을 호스팅하지 않고, 카탈로그에도 없습니다 — 텍스트가 아니라 확률을 반환하는 모델은 채팅 완성을 라우팅할 대상이 아닙니다. 우리가 제공하는 것은 실제로 생성하는 쪽, 즉 패턴의 절반입니다: 루브릭을 작성하거나, 후보 응답의 초안을 만들거나, Decision-1이 그다음에 채점할 도구 호출을 생성하는 모델들이죠. 이들은 200개가 넘는 모델이 실린 하나의 OpenAI 호환 키 뒤에 있으며, 제공업체 정가를 0% 마크업으로 그대로 전달하므로, 심사 모델의 공급업체 가격 인하는 같은 날 우리 쪽에도 반영됩니다. 한 모델이 글을 쓰고 다른 모델이 채점하는 평가 루프를 구축하고 있다면, 채점 호출은 Microsoft로 가고 생성 호출은 어디로든 갈 수 있습니다 — 단일 심사자가 아니라 패널을 원할 때 여러 모델을 하나의 호출로 구성해 주는 라우팅 DSL을 통하는 경우도 포함해서요.

왜 스코어러는 더 나은 챗봇과는 다른 베팅인가
Microsoft가 여기서 판매하는 패턴은 이미 공개되어 있다. InternLM의 Intern-Decision-4B, Liquid AI의 d1-3B, Convai Innovations의 Laya, 그리고 Jared Palmer의 Kev family는 모두 텍스트를 생성하지 않고 제공된 선택지에 대한 보정된 분포를 반환하며, 그중 대부분은 자체 하드웨어에서 무료로 실행할 수 있는 Apache-2.0 가중치다. Microsoft의 제품은 벤치마크에 의존하지 않는 세 가지 점에서 다르다: Azure 인증, 청구 및 거버넌스가 결합된 관리형 API이므로 Hugging Face 다운로드로는 충족되지 않는 기업 조달 경로에 맞는다; 기반은 해당 분야의 대부분보다 큰 9B 모델이다; 그리고 Responsible AI 평가와 문서화된 평가 방법론을 갖추고 있는데, 이는 규제 대상 배포에서 실제 게이팅 요구 사항인 경우가 많다.
Microsoft-Decision-1에 함께 제공되지 않는 것이 하나 있다면 바로 숫자다. Brier 점수와 기대 보정 오차—0.8이 0.8을 의미하는지 알려주는 두 수치—를 공개하는 오픈 경쟁자들과 달리, Microsoft는 방법론만 공개했고 결과는 공개하지 않았다. 독립적인 보정 테스트가 존재하기 전까지, Microsoft-Decision-1을 사용하는 정당화될 수 있는 방법은 자체 문서가 권장하는 방식이다: 사용 사례를 대표하는 데이터로 검증하고, 오류의 비용을 기준으로 임계값을 설정하고, 항상 기권 옵션을 포함하고, 순서가 답변에 편향을 줄 수 있는 경우에는 선택지 순서를 무작위화하고, 중대한 모든 사안에는 사람을 의사결정 과정에 참여시켜라. 이는 어떤 점수 산출기에게나 좋은 조언이다. 특히 그 보정을 회사 밖의 누구도 측정한 적 없는 점수 산출기에게는 더욱 좋은 조언이다.
