
Microsoft-Decision-1 vs Intern-Decision-0.8B: 호스팅된 공백에 맞선 반 온스의 탈옥 문제
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 55 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
Start with the column that a launch post would have left out. Intern-Decision-0.8B — InternLM's 852,985,920-parameter decision model, fine-tuned from Qwen3.5-0.8B and uploaded to Hugging Face on 26 September 2026 with no announcement, no paper and a GitHub link that still 404s — is measured at 64.48 on WildJailBreak against a reference of 96.29 for TypeSafe's Jev 1.13. That is not a rounding difference. It is a refusal-robustness collapse in a model whose entire job is to judge inputs, published on the vendor's own card, in a table whose benchmark belongs to a competitor. Set that next to Microsoft-Decision-1, which went generally available on Microsoft Foundry on October 8, 2026 as a text-only scorer post-trained on Qwen3.5-9B with a documented evaluation methodology and not one result printed under it, and you have the real shape of this matchup. One of these models will tell you a number that makes it look bad. The other tells you which metrics it would have used.
그 반전은 스펙 시트보다 더 가치가 있다. 두 모델 모두 상태와 범위가 제한된 질문 집합을 입력받아 여러분의 선택지에 대한 확률을 반환한다 — 어느 쪽도 텍스트를 생성하지 않으며, 그 축에서는 둘이 같은 종류의 도구다. 중요한 차이는 누가 운영하는지, 얼마나 큰지, 얼마나 검증할 수 있는지, 그리고 더 작고 더 조용하며 완전히 다운로드 가능한 모델이 그럼에도 공개하기로 선택한 하나의 안전 항목이다.
각각이 실제로 돌려주는 것
Microsoft-Decision-1은 호스팅형 API이며, 이것이 첫 번째 구조적 차이점입니다. 가중치는 배포되지 않습니다. 다시 말해 다운로드도, 리포지토리도, 파인튜닝 경로도 없으며, 통합은 Azure 인증과 청구 및 거버넌스가 결합된 Foundry 배포를 의미합니다. 이 모델은 최대 32,768 토큰에 대해 한 번의 패스를 실행하고, 예/아니오, 객관식, 평점, 분류 및 루브릭 형태의 질문을 지원하며, 입력은 텍스트 전용이고 출력은 숫자입니다. 증거가 불충분할 때 "판단할 수 없음"과 같은 기권 옵션을 명시적으로 지원하는데, 바로 이것이 임계값을 의미 있게 만듭니다.
Intern-Decision-0.8B는 그 반대의 구성입니다. 업스트림 Qwen 라이선스를 LICENSE-QWEN으로 나란히 보존한 Apache 2.0 가중치로, 약 1.73 GB 규모의 저장소가 세 개의 샤드로 나뉘어 있습니다 — 1.50 GB 언어 샤드, 176 MB 비전 샤드, 25 MB 프로젝터 — 이는 소비자용 GPU 한 장이나 넉넉하게 갖춘 노트북에 들어갑니다. 이 모델은 상태와, 각각 최대 62개의 옵션을 가진 1~16개의 이름 붙은 질문으로 이루어진 스키마를 받아들이고, 선택적으로 최대 여덟 개의 이미지도 받습니다. 그리고 함께 제공되는 inference.py는 대부분의 출시 모델이 신경 쓰지 않는 것보다 더 자세하게 이 계약을 문서화합니다: 옵션은 단일 토큰 심볼 A–Z, 그다음 a–z, 그다음 0–9에 매핑되고, 로짓은 미리 렌더링된 골격에서 각 <decision> 자리표시자 바로 앞 위치에서 읽히며, 소프트맥스는 해당 필드의 합법적인 후보에 대해서만 취해지고, 피팅된 온도가 적용됩니다.
두 라이선스는 같은 구매가 아닙니다. Microsoft-Decision-1은 관리형 엔드포인트를 제공하고, 소유하는 아티팩트는 제공하지 않습니다. Intern-Decision-0.8B는 소유하는 아티팩트를 제공하며, 엔드포인트도, 지원 계약도, 저장소 자체 외의 문서도 없습니다.

상한, 그리고 검증할 수 있는 교정
두 개의 숫자가 대부분의 실제 연동을 좌우하며, 그 둘 모두 소형 모델에 속한다.
첫 번째는 8,192 토큰입니다. Intern-Decision-0.8B의 추론 엔진은 초과 크기 입력을 잘라내는 대신 거부하는데, 이는 스코어러에게 올바른 동작이며 동시에 단단한 벽이기도 합니다: 상태, 스키마, 스켈레톤이 모두 한 번의 패스에 담겨야 하므로 계약을 보존하는 청킹 전략은 없습니다. Microsoft-Decision-1의 상한은 32,768로 네 배 더 높으며, 이는 Python 파일 안의 상수가 아니라 프로비저닝을 다르게 하여 올릴 수 있는 호스팅 한도입니다.
두 번째는 캘리브레이션이며, 여기서는 방향이 반전됩니다. InternLM은 적합된 온도 2.747760550703를 0.8B용으로 공개합니다. 이 값은 1,728개의 지정된 캘리브레이션 사례에 대해 NLL 최소화로 선택되었고, 1,693개는 검증용으로 남겨 두었으며, 카드에는 테스트 스위트 레이블이 이를 선택하는 데 사용되지 않았다고 명시되어 있습니다. 적용되는 변환은 해당 필드의 후보 로짓에 대한 소프트맥스를 적용한 뒤, 그 분포의 로그를 온도로 나눈 값에 다시 한 번 소프트맥스를 적용하는 것입니다. 이 변환은 첫 번째 소프트맥스 이후에 실행되고 순서를 보존하므로 argmax를 전혀 바꿀 수 없습니다 — 신뢰도, yes 확률, 점수 질문의 기댓값을 이동시키고 레이블은 동일하게 둡니다. 파이프라인이 레이블을 읽는다면 온도는 아무 효과가 없습니다. 확률을 읽거나 임계값을 적용하거나 기댓값 계산에 넣는다면, 온도는 의미 있는 숫자와 그렇지 않은 숫자 사이의 차이입니다. 전달할 때 temperature=1은 보정되지 않은 분포를 반환합니다. 직접 적합하고 싶다면 그렇게 하면 됩니다.
Microsoft-Decision-1에는 이에 상응하는 산출물이 없습니다. Benchmarks 탭에는 정확도, 보정 오차, 안전 재현율, 위양성률 및 공정성 일관성이 공개 및 커뮤니티 의사결정 벤치마크와 별도로 보관된 내부 테스트 세트에서 측정되었다고 나와 있으며, 선택지 순서를 바꾸었고, 대응 통계 검정을 적용했으며, 이 모델이 "동일한 방법론으로 평가된 다른 오픈 의사결정 모델들보다 앞서고 선도적인 의사결정 모델들과 동등한 성능을 발휘한다"고 명시되어 있습니다. 인쇄된 보정 오차도 없고, 검사할 temperature도 없으며, 설명된 검증 분할도 없습니다. 확률을 유용하게 만드는 단 하나의 속성, 즉 0.8이 0.8을 의미하는지 여부는 주장만 될 뿐 정량화되지 않습니다.
그 두 문단을 서로 대조해 읽으면 비교는 더 이상 크기 문제가 아니게 된다. 캘리브레이션을 직접 확인할 수 있고 소프트웨어를 실행할 수 있는 8억 개 매개변수 체크포인트는, 평가 팀에게 있어 캘리브레이션이 단 한 문장에 불과한 호스팅된 API보다 다루기 쉬운 대상이다. 이 소형 모델은 또한 기록된 지연 시간 수치도 있다 — InternLM 자체 측정에 따르면 로컬 Hugging Face 경로를 통해 단일 RTX 4090에서 쿼리당 평균 33.98ms, 중앙값 33.44ms, p95 37.50ms — 반면 Microsoft의 것은 자체 배포를 통해 측정해야 하는데, 여기서는 서버리스와 프로비저닝된 처리량 중 무엇을 선택하느냐가 모델 자체보다 그 수치를 더 크게 좌우할 것이다.

소형 모델이 뒤처지는 지점
위의 어느 것도 Intern-Decision-0.8B를 안전한 선택으로 만들지 않으며, 같은 공개 표가 그 이유를 말해 준다. WildJailBreak의 64.48은 Jev의 96.29와 대비하여, 채점자가 신뢰할 수 없는 입력을 접하는 바로 그 범주에서 30점의 거부 견고성 격차를 보여 준다. 결정 모델은 제안된 행동이 허용되는지를 결정하는 구성 요소인 경우가 많으며, 말로 쉽게 넘어가기 쉬운 모델은 그 자리에서 약점이다. 이 결손이 Qwen3.5-0.8B 기반에서 오는지, 결정 튜닝 목표에서 오는지, 아니면 적은 매개변수 수에서 오는지는 저장소가 알려 주지 않으며, 그것을 알려 줄 논문도, 훈련 레시피도, 데이터 공개도 없다.
InternLM의 자체 표의 나머지 부분은 그 열보다 더 후한 평가를 내리지만 여전히 겸손하다. 7개 스위트 평균은 0.8B의 경우 79.38로, 자사의 2B 형제 모델의 84.68과 4B의 90.02와 대비된다 — 이 패밀리는 크기에 따라 가파르게 상승하는데, 이는 이 표가 플래그십을 돋보이게 하려고 역설계되지 않았다는 약간의 신호다. AG News는 88.61을 기록해 Jev의 89.57과 대비되며, 4개 주제 분류에서 사실상 동일한 수준이다. 캘리브레이션 측면에서 0.8B는 Brier 0.530과 기대 캘리브레이션 오류(ECE) 0.066을 보고하는데, Jev의 0.358과 0.095와 대비된다 — 더 나은 ECE, 의미 있게 더 나쁜 정확도. 이는 의도적으로 맞춘 temperature를 가진 작은 모델에게는 그럴듯한 프로필이며, 마케팅 팀이 실수로 공개하려고 선택할 만한 조합은 아니다.
또한 공개 날짜도, 발표도, 세 체크포인트를 모아 놓은 컬렉션도, 어디에도 호스팅된 엔드포인트도, 어떤 종류의 독립적 평가도 없습니다. 데모 Space는 401을 반환합니다. Intern-Decision-0.8B에 대한 올바른 설명은 감사되지 않은 주장이 붙은 공개된 체크포인트입니다 — 이는 대기자 명단이 있는 API보다 나은 상황입니다. 왜냐하면 하루 오후면 측정할 수 있기 때문이지만, 그만큼 검증 부담은 전적으로 여러분 몫이라는 뜻입니다.
선택하기, 그리고 OrcaRouter의 위치
조달이나 규모가 걸림돌이라면 Microsoft-Decision-1을 선택하세요: 무엇이든 프로덕션에 도달하기 전에 Azure 인증, 통합 청구, Responsible AI 평가가 필요한 경우; 32K 컨텍스트가 필요한 경우; 직접 운영하지 않는 엔드포인트가 필요한 경우; 또는 응답 보류 경로를 직접 구현하기보다 설계에 포함하기를 원하는 경우입니다. 그 대가로, 이를 실행할 수 없고, 미세 조정할 수 없고, 그 캘리브레이션을 검사할 수 없으며, 핵심 주장을 직접 측정해야 한다는 점을 받아들이세요.
비용, 메모리 또는 통제가 걸림돌이라면 Intern-Decision-0.8B를 선택하십시오: 1.73 GB에 들어가고, 이미 보유한 하드웨어에서 실행되며, 매번 동일한 레이블을 생성하고, 체크포인트 경로를 변경하여 2B 또는 4B 형제 모델로 교체할 수 있는 Apache-2.0 스코어러를 원한다면. 그 대가로 8,192토큰 장벽, WildJailBreak 열, 그리고 InternLM 외부의 누구도 이 카드에서 어떤 것도 재현하지 못했다는 사실을 받아들이십시오.
정직한 권고는 둘 다 하라는 것입니다. 둘 다 충분히 저렴해서 논쟁할 가치가 거의 없기 때문입니다. 채점 호출 자체는 우리가 라우팅하는 대상이 아닙니다. 텍스트 대신 확률을 반환하는 모델은 채팅 완성이 아니며, 이 둘 중 어느 것도 우리 카탈로그에 없습니다. OrcaRouter가 담당하는 것은 루프의 나머지 절반입니다: 하나의 OpenAI 호환 키 뒤에 있는 200개 이상의 모델이 루브릭을 작성하고, 후보 답변을 생성하거나, 당신의 채점기가 곧 평가할 도구 호출을 내보냅니다. 제공자 목록 가격에 0% 마크업을 붙여 그대로 전달하므로, 생성기에 대한 공급업체의 가격 인하가 같은 날 우리 쪽에도 반영됩니다. 자동 장애 조치가 여기서는 평소보다 더 중요합니다. 보이는 모든 것을 채점하는 파이프라인은 멈춘 호출을 재시도할 여유가 없기 때문입니다. 또한 라우팅 DSL을 사용하면 하나의 판정 프롬프트를 여러 작성자에게 보내고, 단일 작성자를 신뢰하는 대신 그들의 일치를 융합할 수 있습니다.

결론
Microsoft-Decision-1은 2026년 10월 8일 Microsoft Foundry에서 정식 출시되었습니다: 호스팅형, 텍스트 전용, 32,768 토큰, Qwen3.5-9B 기반이며, 벤치마크 표 대신 방법론 문단이 있습니다. Intern-Decision-0.8B는 2026년 9월 26일에 업로드된 1.73 GB Apache-2.0 체크포인트로, Brier 0.530, ECE 0.066, 적합된 temperature 2.747760550703, 4090에서 33.98 ms를 공개합니다 — 그리고 아무도 출력하라고 요청하지 않은 WildJailBreak 점수 64.48까지요. 둘 중 하나를 도입하기 전에 단 한 가지만 검증할 수 있다면, 자체 라벨링된 사례에서 캘리브레이션을 검증하세요. 그 숫자가 두 공급업체 모두 여러분이 찾아내도록 남겨둔 숫자입니다.
