
Decision 3.0 vs Microsoft-Decision-1: 하나는 다운로드이고, 다른 하나는 SKU입니다
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 71 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
9B 등급의 Decision 3.0과 Microsoft-Decision-1은 서류상으로는 같은 제품입니다. 둘 다 Qwen3.5-9B를 포스트트레인하여 고정된 후보 답변 집합에 각각 보정된 확률로 답하는 스코어러로 만듭니다. 토큰을 전혀 생성하지 않으면서 말이죠. 둘 다 같은 작업을 겨냥합니다 — 요청 라우팅, 루브릭에 따른 출력 채점, 에이전트 행동 게이팅, 대기열 트리아지. 둘 다 서로 일주일 이내에 나왔습니다: Microsoft-Decision-1은 2026년 10월 8일 Microsoft Foundry에서 정식 출시되었고 다음 날 발표되었으며, d3-flash는 2026년 10월 10일 17:23 UTC에 Hugging Face에 푸시되었습니다.
차이는 모델에 있지 않다. 차이는 그 모델로 무엇을 하도록 허용되는가에 있다. d3-flash는 다운로드해서 실행하는 83억 9천만 개 매개변수의 Apache-2.0 체크포인트로, 0.59B에서 시작해 26.09B에 이르는 제품군에서 세 번째에 위치한다. Microsoft-Decision-1은 Foundry의 호스팅 엔드포인트이며, 가중치는 전혀 배포되지 않고, Microsoft가 나중에 자체 MAI 모델로 리베이스할 것이라고 밝힌 계열에 속한다. 이들 중 하나는 아티팩트이고, 다른 하나는 서비스다. 이 둘에 관한 거의 모든 실용적 질문은, 벤치마크에 관한 것처럼 보이는 질문들까지 포함해, 그 단 하나의 사실에서 따라 나온다.
결정 모델의 목적에 관한 두 가지 결정
Microsoft의 글은 모델 카드에서는 좀처럼 드물게 범위를 명확히 밝히고 있다. 지원되는 질문 형태는 예/아니오, 객관식, 평점, 분류, 루브릭 기반 채점이다. 제외 대상도 마찬가지로 분명히 나열되어 있다: 텍스트 생성, 개방형 질문 응답, 대화, 번역 또는 요약용으로 설계되지 않았으며, 입력에 없는 지식을 요구하는 작업을 위한 것도 아니다. 이는 최대 32,768개 토큰에 대해 한 번의 패스를 실행하고 디코딩 루프가 없기 때문에 출력 토큰을 0개 생성한다. Microsoft는 또한 제공된 증거가 불충분할 때 "cannot tell"과 같은 기권 옵션을 지원하는데, 이는 출력에 임계값을 적용하는 것을 의미 있게 만드는 세부 사항이다.
d3-flash는 동일한 개념적 틀 안에 자리합니다 — Choice, Noul(예/아니요) 및 Score 질문, 질문당 한 번의 순전파, 선택지당 하나의 확률, 생성 없음 — 그리고 나서 입력 측을 확장합니다. Microsoft-Decision-1이 설계상 텍스트 전용인 반면, d3-flash는 텍스트 또는 JSON을 받아들이고, 요청당 여러 이미지를 각각 최대 1.6메가픽셀로, 그리고 여러 비디오를 초당 2프레임으로 읽습니다. 요청에 있는 모든 질문은 그 요청에 첨부된 모든 이미지와 비디오를 봅니다. 이는 주어진 입력으로 더 많은 일을 하는 더 작은 모델입니다.
그것이 첫 번째 진짜 분기점이며, 취향의 문제가 아닙니다. 당신이 내려야 할 결정이 스크린샷, 영수증, 차트 또는 카메라 클립에 관한 것이라면, Microsoft-Decision-1은 그것을 내릴 수 없습니다. 그것은 품질 격차가 아니라 역량의 경계이며, 어떤 정확도 작업으로도 그것을 메울 수 없습니다.
각각 무엇을 발행하는지, 그리고 어떻게
여기서 두 릴리스는 실로 서로 다른 종류의 증명을 하고 있으며, 숫자를 나란히 비교하기보다는 이들을 분리해서 보는 것이 가치 있다.
Microsoft가 실시했으며약 15만 개의 질문에 걸친 36개 벤치마크 비교, 훈련에서 블라인드로 유지된 이 비교는 라우팅, 랭킹, 장문 컨텍스트, 다국어 및 분포 외 작업, 추론과 안전을 아우르며, 자사 모델이 이들 세트 전반에서 가장 우수했다고 밝혔습니다. 지연 시간은 수치가 아닌 비율로 보고합니다 — p50은 GPT-6 Sol보다 약 35배 빠르고, 2위로 꼽은 H2O-Lightning-4B v1.1보다 2.5배 더 빠릅니다. 견고성은 절차로 문서화합니다: 동일한 요청을 여덟 가지 방식으로 변형했을 때 평균 결정 번복률 1.3%, 선택지 설명을 바꿔 말하거나 선택지를 뒤집거나 섞었을 때 번복 0건입니다. 유해 콘텐츠, 탈옥(jailbreaking) 및 프롬프트 인젝션을 다루는 11개 벤치마크에서 5,250개 요청으로 안전성을 테스트했습니다. 스스로 적용하는 보정 기준을 밝힙니다 — 대표적인 사례에서 90% 예측은 열 번 중 약 아홉 번 맞아야 합니다.
vLLM-SR이 지수를 발표했습니다. Jev Decision Index 0.3.1은 d3를 64.7에, d3-flash를 public-suite 57.79에 두며, 이는 46.76인 Decision 2.0의 9B 모델 대비 11.0의 향상이라고 주장합니다. 또한 140,178개의 모든 공개 요청이 지원되지 않은 요청 없이 답변되었다고 주장하는데, 이는 정확도라기보다 커버리지에 관한 진술입니다. 카드는 d3 자체의 행은 내부 평가인 반면, 그 옆의 비교 행들 — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — 은 라이브 보드 데이터라고 밝힙니다. 그리고 멀티모달 측면에서 d3 계열 모델은 19,140개의 모든 검증 질문에 대한 Perception Test 점수를 보고하며, d3-flash는 세 가지 선택지의 우연 기준선 33.3 대비 73.3입니다.
그래서: Microsoft는 문서화된 방법과 견고성 수치를 갖춘 범위 주장을 내놓지만, 검사별 보정은 없다. vLLM-S는 자사 행과 다른 행들에 대한 출처가 밝혀진 리더보드 순위를 공개하고 영상 결과까지 내놓지만, 역시 보정 수치는 없다. 어느 카드에도 그것이 설명하는 모델에 대한 Brier 점수나 기대 보정 오차(expected-calibration-error) 수치가 없다. 반환된 숫자가 의미를 지닌다는 것이 두 제품의 전체 세일즈 포인트인 만큼, 그것은 둘 중 어느 쪽이든 다음에 내놓을 수 있는 가장 유용한 단 하나다.

유통이 스펙 시트보다 더 많은 것을 좌우한다
이 지점에서 비교는 더 이상 모델에 관한 것이 아니게 된다.
d3-flash를 사용하면 가중치, decision_config.json(베이스 리비전 고정), 파일별 SHA-256 매니페스트, 사용자 정의 모델링 코드, 리드아웃 헤드, 그리고 문서화된 의존성 세트를 얻게 됩니다. 여기에는 transformers==5.17.0 및 선형 어텐션 레이어를 위한 선택적 CUDA 커널 패키지가 포함됩니다. 자체 하드웨어에서 실행하고, 파인튜닝하고, 양자화하고, 에어갭으로 격리할 수도 있습니다. 또한 운영 작업도 떠안게 됩니다: Python 클래스는 엔드포인트가 아니며, 모델 카드에는 상태 + 질문 + 후보 설명을 위한 토큰 예산이 명시되어 있지 않습니다 — max_length는 null입니다(배포된 설정 기준). 따라서 그 상한은 직접 알아내야 하는 몫입니다.
Microsoft-Decision-1을 사용하면 기존 클라우드 계정 내에 엔드포인트가 생기고, 그에 수반되는 인증, 지역 가용성, 프로비저닝 제어를 얻을 수 있으며, 운영 작업은 전혀 하지 않아도 됩니다. 하지만 제어권도 전혀 얻지 못합니다. 다운로드할 리포지토리도, 파인튜닝 경로도, 자체 호스팅 옵션도 없습니다. 모델의 수명 주기는 여러분의 것이 아니라 Microsoft의 것이며, 지원 중단 공지나 다른 백본으로의 리베이스는 여러분이 일정을 잡는 변경이 아니라 받아들여야 하는 변경입니다. Microsoft는 자사 MAI 모델로의 리베이스가 예정되어 있다고 밝혔는데, 이는 빠른 단일 패스 스코어링을 핵심으로 하는 모델에 합리적인 로드맵이며, 동시에 여러분이 벤치마크한 특정 체크포인트가 1년 후에 호출하게 될 체크포인트와 반드시 같지는 않다는 뜻이기도 합니다.
지연 시간 이야기도 주의 깊게 읽어야 합니다. 마이크로소프트의 대표 수치는 훨씬 더 큰 범용 모델을 기준으로 한 비율인데, 이는 그 주장에 맞는 올바른 비교입니다 — 의사결정 모델의 역할은 값비싼 생성 호출을 저렴한 스코어링 호출로 대체하는 것이며, p50에서 GPT-6 Sol 대비 35배라는 수치는 그 주장이 먹혀들 때의 모습입니다. vLLM-SR의 수치는 절대값이고 단일 요청, 단일 GPU 기준이며, 모달리티 세금을 여실히 보여줍니다. AMD Instinct MI325X 한 대에서 d3-flash로 보낸 텍스트 요청은 중앙값 19.1ms가 걸리고, 같은 요청에 이미지를 함께 보내면 149.4ms, 10초짜리 동영상을 함께 보내면 407.6ms가 걸립니다. 두 수치 모두 벤더가 보고한 것이고 서로 다른 하드웨어에서 측정된 것이며, 어느 쪽도 이를 산출한 연구실 밖에서 재현된 적이 없습니다.

선택하는 방법
결정 규칙이 짧다는 것은 두 제품이 실제로 같은 자리를 놓고 경쟁하고 있지 않다는 좋은 신호다.
다음의 경우 선택하세요: Microsoft-Decision-1 결정이 텍스트 전용이고, 이미 Foundry에서 운영 중이며, 배포가 아니라 호출이라는 점이 핵심일 때. 구매할 GPU도, 운영할 컨테이너도, 소유할 모델 라이프사이클도 없습니다. Microsoft의 지원 자료 역시 플랫폼 팀에게는 두 옵션 중 더 활용하기 좋은 쪽입니다. 교란(perturbation), 안전 테스트 횟수, 그리고 기권(abstention) 옵션이 지원된다는 명시는 임계값 정책을 작성하는 데 필요한 요소들이며, 32,768토큰 상한도 빈칸으로 두지 않고 명시되어 있습니다.
을 선택하세요Decision 3.0 — 현실적으로는 d3-flash 또는 d3-mini — 결정의 어느 부분이든 이미지나 클립에 의존한다면, 호스팅된 API가 닿을 수 없는 곳에서 실행해야 한다면, 또는 자체 라벨링된 사례들로 파인튜닝하고 싶다면. Apache-2.0 라이선스와 파일 수준 해시 매니페스트는 이를 이론적인 선택이 아니라 진짜 선택지로 만들어 줍니다. 그 대가로 받아들이는 것은 명시되지 않은 입력 예산, 공개된 캘리브레이션의 부재, 그리고 이 제품군이 출시된 지 며칠밖에 되지 않았고 이를 뒷받침하는 외부 사용 실적이 사실상 전무하다는 사실입니다.
일반 텍스트 경로를 위한 호스팅형 스코어러와 멀티모달 또는 에어갭(air-gapped) 사례를 위한 자체 호스팅형 스코어러를 모두 필요로 하고, 둘 다 동일한 인터페이스를 통해 호출한다면 — 솔직한 입장은 현재 이를 제공하는 공급업체가 없다는 것이며, 두 요청 형식은 통합할 수 있을 만큼 충분히 가깝지만 동일하지는 않다는 것입니다.
OrcaRouter가 자리하는 곳, 그리고 자리하지 않는 곳
typesafe/jev-1.13은 우리 카탈로그의 결정 모델이며, 다음을 통해 제공됩니다: POST /v1/systemone 위의 두 모델이 구현하는 것과 동일한 상태 및 명명된 질문 계약을 따릅니다: 텍스트 입력, 구조화된 JSON 출력, 최대 약 64K 입력 토큰, 비스트리밍, 백만 입력 토큰당 $0.042이며 완료 요금은 없습니다. 완료를 생성하지 않기 때문입니다. 특히, 위의 두 카드 모두 완전히 답변하지 못한 Android 스타일 토큰 예산 질문이 여기에서 답변됩니다.
저희는 이 비교에 포함된 두 모델 중 어느 것도 제공하지 않습니다. Decision 3.0의 체크포인트는 라우팅 가능한 엔드포인트가 아니라 Hugging Face 리포지토리 내 로컬 추론 경로로 제공되며, Microsoft-Decision-1은 Microsoft 자체 플랫폼 및 여러 서드파티 플랫폼을 통해 배포됩니다 — 저희를 통해서가 아닙니다. 여기에 있는 어떤 내용도 두 모델 중 어느 하나에 대한 가용성 주장으로 해석되어서는 안 됩니다.
이 결정에서 라우팅 레이어가 실제로 지니는 가치는 루프의 나머지 절반에 있습니다. 스코어러는 구조상 저렴하지만, 그 출력에 따라 행동하는 모델은 그렇지 않으며, 의사결정 모델을 생성 모델과 짝짓는 것은 보통 두 개의 통합, 두 개의 청구 관계, 두 개의 실패 모드를 의미합니다. 200개가 넘는 모델에 걸쳐 하나의 키로 둘 다 호출하는 것 — 제공업체가 흔들릴 때 자동 장애 조치가 이루어지고, 제공업체 정가가 0% 마크업으로 그대로 전달되어 벤더 가격 변경이 같은 날 반영되는 — 은 호출 지점을 건드리지 않고도 스코어러를 교체할 수 있다는 뜻입니다. 이는 여기서 평소보다 더 중요합니다. 왜냐하면 이 두 모델 모두 아직 초기 단계여서, 이번 주에 내리는 결정은 다음 달에 되돌릴 수 있어야 하는 결정이기 때문입니다.

6개월 후에 이것을 결정지을 질문
두 팀이 같은 주에 동일한 베이스 체크포인트를 같은 형태의 제품으로 포스트트레이닝했고, 그것이 고객에게 어떻게 도달해야 하는지에 대해 상반된 결론을 내렸다. 이는 타이밍이 우연히 겹친 것이라기보다, 그 범주가 어떻게 판매되는지의 갈림길에 가깝다: 가중치로서인지 서비스로서인지, 당신이 소유하는 것인지 호출하는 것인지.
세 가지 신호를 주시하십시오. Microsoft의 MAI 또는 자체 모델로의 리베이스가 현재 판매하고 있는 정확도와 지연 시간 동작을 바꾸는지 — 그리고 고객이 얼마나 사전 통지를 받는지. vLLM-SR이 Decision 3.0에 대한 입력 예산과 보정 수치를 공개하여, 자사 지수의 실행 가능성을 가로막는 간극을 메우는지. 그리고 두 연구소 밖의 누군가가 공개된 d3 가중치를 대상으로 공개 스위트를 실행하는지, 왜냐하면 현재 이 비교를 판가름할 유일한 숫자는 어느 공급업체도 아직 산출하지 않은 숫자이기 때문입니다.
