
Microsoft-Decision-1 vs Intern-Decision-2B: 9밀리초 더 빠르고, 측정 가능할 정도로 더 나쁘게 보정됨
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 55 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
InternLM의 자체 표에는 존재해서는 안 될 숫자가 하나 있는데, 바로 그것이 이 비교가 스펙 시트보다 더 가치 있는 이유다. Intern-Decision-2B — 2,213,241,664개 파라미터를 갖추고 Qwen/Qwen3.5-2B에서 파인튜닝되어 2026년 9월 26일 05:36:19 UTC에 아무런 공지도 없이 Hugging Face에 업로드된 모델인데, 33.28 ms라는 단일 RTX 4090 기준 쿼리당 평균 레이턴시를 기록한다. 이는 자사의 8억 5,200만 파라미터 형제 모델이 기록한 33.98 ms보다 근소하게 빠른 속도다. 또한 이 모델은 제품군 내에서 최악의 캘리브레이션을 기록한다. 기대 캘리브레이션 오차는 0.8B의 0.066에 비해 0.100이고, 피팅된 온도는 0.8B의 2.747760550703에 비해 2.100509348278이다. 한편 Microsoft-Decision-1은 2026년 10월 8일부터 Microsoft Foundry에서 일반 제공되고 있지만, 레이턴시 수치도 캘리브레이션 오차도 전혀 공개하지 않는다 — 오직 그 둘을 어떻게 측정했는지 설명하는 방법론 문단 하나만 있을 뿐이다. 그래서 이번 맞대결이 실제로 던지는 질문은 이 둘 중 어느 쪽이 더 나은가가 아니다. 그것은 무엇이든 그 중간 크기를 살 때 당신이 사는 것이 무엇인가이다.
두 모델 모두 결정 스코어러입니다: 상태가 입력되고, 범위가 정해진 질문 세트가 입력되며, 보정된 확률이 출력되고, 생성된 텍스트도, 파싱할 토큰도 없습니다. 그 공유된 계약이 바로 차이점을 또렷하게 드러냅니다. Microsoft-Decision-1은 Qwen3.5-9B 기반의 호스팅형 텍스트 전용 Foundry API로, 32,768토큰 창을 사용하며 분산 가중치도, 파인튜닝 경로도 없습니다. Intern-Decision-2B는 Apache-2.0 체크포인트로, 업스트림 Qwen 라이선스를 LICENSE-QWEN으로 보존하고, 약 4.46GB의 리포지토리와 사용자 정의 추론 코드를 갖추고 있으며, 어디에도 호스팅된 엔드포인트가 없습니다.
중간 사이즈는 실제로 무엇을 위한 걸까
InternLM은 40초 만에 체크포인트 세 개를 올렸다: 0.8B는 05:35:57, 이 체크포인트는 05:36:19, 4B는 05:36:37. 벤더 자체의 7개 스위트 평균에서 이 제품군은 기대할 만한 순서대로 올라간다 — 79.38, 84.68, 90.02 — 이는 2B가 합리적인 구매처럼 보이는 유일한 지점이다. 다른 모든 면에서 그것은 아무도 일부러 선택하지 않았을 크기처럼 보인다.
프롬프트 처리가 결정 호출을 지배하며, 그것이 지연 시간 역전에 대한 기계적인 설명이지 미스터리가 아니다. 스코어러는 상태, 스키마, 옵션 설명에 의해 길이가 정해지는 프롬프트에 대해 정확히 한 번의 순전파를 수행한다 — 모델이 쓰는 어떤 것에 의해서도 결코 길이가 정해지지 않는다, 왜냐하면 모델은 아무것도 쓰지 않기 때문이다. 그 영역에서 파라미터 수는 2차 비용이므로, 가장 작은 체크포인트를 선택하는 통상적인 이유는 적용되지 않는다: 시간을 절약하는 것이 아니라 메모리를 절약하는 것이다. 0.8B의 전체 저장소는 약 1.73 GB인 반면 이 모델은 4.46 GB이며, 그것이 그것을 선호하는 정직한 이유다. 2B의 유일한 실제 주장은 그것이 우연히 가장 빠른 빠른 모델이라는 것인데, 그 차이는 노이즈라고 할 만큼 작다.
Microsoft-Decision-1과 비교해 보면, 그 주장은 거의 무의미합니다. 두 모델은 같은 지연 시간 체계에 있지 않기 때문입니다. 호스팅된 엔드포인트의 속도는 모델의 함수이기 전에 배포 형태 — 동일한 표준 SKU에서 서버리스 대 프로비저닝된 처리량 — 의 함수이며, Microsoft는 비교할 수 있는 호출당 수치를 공개하지 않습니다. Microsoft가 공개하는 것은 오히려 반대 방향으로 작용하는 엄격한 운영 제약입니다: 배치 추론이 비활성화되어 있습니다. 대량 스코어링 실행을 상각할 오프라인 채널이 없으므로, Microsoft-Decision-1 파이프라인은 모든 결정의 인터랙티브 비용을 지불하는 반면, 자체 호스팅 체크포인트는 스코어링 여부와 관계없이 GPU 비용을 지불합니다.
중간이 지는 교정 칼럼
Intern-Decision 카드 세 장을 함께 읽어 보면, 그 패밀리는 더 이상 예측 가능하게 동작하지 않는다. 정확도는 크기에 대해 단조롭지만, 캘리브레이션은 그렇지 않다. 2B는 ECE가 0.100으로, 세 모델 중 가장 약하며, 피팅된 온도는 2.100509348278로 0.8B의 2.747760550703보다 훨씬 낮다. 카드는 다운로드한 크기와 함께 제공되는 추론 모듈을 사용하라고 지시한다. 기본 캘리브레이션은 체크포인트별이기 때문이다. 한 형제 모델에서 다른 형제 모델로 래퍼를 복사하는 사람은 자신도 모르게 잘못된 온도를 적용하게 된다.
그 변환 자체는, 그 0.100을 가중치에 대한 판결로 취급하기 전에 이해할 가치가 있다. 그것은 해당 필드의 후보 로짓들에 대한 소프트맥스이고, 그다음 그 분포의 로그를 온도로 나눈 값에 대한 두 번째 소프트맥스다. 첫 번째 소프트맥스 이후에 실행되고 순서를 보존하므로, argmax를 전혀 바꿀 수 없다. 그것은 신뢰도, yes 확률, 그리고 점수 질문의 기대값을 바꾸지만 레이블은 동일하게 남긴다. 파이프라인이 레이블을 읽는다면, 온도는 아무 효과가 없고 ECE는 흥미거리일 뿐이다. 파이프라인이 확률을 읽는다면 — 임계값을 적용하고, 확률로 순위를 매기고, 기대값 계산에 넣는다면 — 0.100 ECE는 당신이 쓴 의미대로 작동하는 임계값과 그렇지 않은 임계값의 차이다. 올바른 대응은 가중치가 나쁘다고 결론내리는 것이 아니라, 자신의 레이블된 사례에 맞춰 자신만의 온도를 피팅하는 것이다.
Microsoft-Decision-1은 정확히 같은 작업을 요구하지만, 시작점으로 삼을 것은 더 적다. Benchmarks 탭에는 정확도, 보정 오차, 안전 재현율, 오탐률, 공정성 일관성이 공개 및 커뮤니티 의사결정 벤치마크와 홀드아웃 내부 테스트 세트에서 측정되었다고, 선택지 순서를 다양하게 바꾸었다고, 짝지은 통계 검정을 적용했다고, 그리고 그 모델이 "동일한 방법론으로 평가된 다른 오픈 의사결정 모델들보다 앞서며 선도적인 의사결정 모델들과 대등한 성능을 낸다"고 명시되어 있다. ECE도 없다. Brier도 없다. temperature도 없다. 정확도 표도 없다. 전체 가치 제안이 신뢰할 수 있는 확률인 그 모델이, 이 비교에서 공개된 보정 수치가 전혀 없는 모델이다.

계약 경계: 호스팅 모델이 하지 않는 네 가지
두 모델은 겉보기에는 동일한 호출을 받아들이지만, 차이는 그 가장자리에 깃들어 있다.
• 모달리티 — Microsoft-Decision-1은 명시적으로 텍스트 전용이며 이미지, 오디오, 비디오를 받지 않습니다. Intern-Decision-2B는 상태와 함께 최대 8개의 이미지를 받을 수 있어, 호스팅 API가 어떤 정확도로도 제공할 수 없는 스크린샷 분류와 레이아웃 점검의 후보가 됩니다.
• 입력 상한과 실패 모드 — Microsoft-Decision-1은 최대 32,768개 토큰에 대해 단일 호출을 실행합니다. Intern-Decision-2B는 다음을 선언합니다: DecisionEngine(max_length=8192) 그리고 초과 입력을 잘라내지 않고 거부합니다. 이는 스코어러에게 올바른 동작이며 동시에 단단한 장벽입니다. 왜냐하면 상태, 스키마, 스켈레톤이 모두 한 번의 패스에 존재해야 하며, 어떤 청킹 전략도 계약을 보존하지 못하기 때문입니다.
• 질문 형태 — InternLM은 호출당 1~16개의 질문을, 각 질문에 최대 62개의 선택지를 세 가지 필드 유형(choice, score, noul)에 걸쳐 문서화하며, 여기서 noul은 확률을 반환하는 이진 예/아니오이고 score는 사용자가 지정한 척도에서 확률 가중 기댓값을 반환합니다. Microsoft는 형식 — 예/아니오, 다지선다, 평점, 분류, 루브릭 — 과 함께 증거가 불충분할 때 "판단할 수 없음"과 같이 명시적으로 지원되는 기권 옵션을 문서화하는데, 이는 에스컬레이션 로직을 작성하는 누구에게나 해당 페이지에서 가장 유용한 한 줄입니다.
• 가격 — Microsoft-Decision-1 모델 페이지에는 요금이 표시되지 않습니다. 가격 책정은 Microsoft의 가격 정보 페이지로 외부 연결되므로, 결정당 비용은 Azure나 청구서에서 확인해야 하며, 출력 토큰이 없기 때문에 그 비용 중 출력 토큰에 귀속되는 부분은 0%입니다. Intern-Decision-2B는 호출당 비용이 전혀 들지 않고 모든 비용이 GPU 시간에 달려 있으며, 호스팅 제공업체도 없습니다. 저장 용량은 3.76 GB 언어 샤드, 612.5 MB 비전 타워, 50.3 MB 프로젝터에 걸쳐 약 4.46 GB입니다.
무엇이 확인된 사실이고, 무엇이 단지 공급업체의 말뿐인가?
그 두 범주를 분리해 두는 것이 이 패밀리에서 지켜야 할 전체 규율이다. 파일 목록이나 HTTP 응답으로 확인된다: 파라미터 수, 샤드 맵, 라이선스 쌍, 기본 모델, 그 아래의 아키텍처 — 24개 레이어, 2,048 히든 크기, 키-값 헤드 2개에 대응하는 쿼리 헤드 8개, 256의 헤드 차원, 선형 어텐션 레이어 3개마다 전체 어텐션 레이어 1개가 반복되는 패턴, 유지된 멀티 토큰 예측 레이어 1개, 그리고 8,192토큰 엔진 상한 때문에 사실상 무의미해지는 262,144 위치 임베딩 상한을 갖춘 Qwen3_5ForConditionalGeneration.

공급업체가 보고했고 재현되지 않은 것들: 모든 정확도 수치, 모든 지연 시간 수치, 그리고 temperature. 논문도, arXiv 등록도, 출시 게시물도, 변경 로그도, 독립적 평가도 없다. 데모 Space는 401을 반환하는데, 이는 고장 난 것이 아니라 공개되지 않은 상태라는 뜻이다. 모델이 나온 뒤에 나타난 GitHub 저장소 — 커밋 세 개, 학습 코드, 두 개의 추론 백엔드, 10,751개 테스트 행이 포함된 평가 번들, 96개 사례 캘리브레이션 벤치마크, 재현 가이드 — 는 대부분의 조용한 릴리스가 받는 것보다 더 많은 문서이며, 가중치도, 학습 데이터도, 코드 라이선스도 제공하지 않는다. 마이크로소프트는 다르지만 인접한 위치에 있다: 방법론은 실재하고 주장은 정성적이며, 현재 두 회사 모두 핵심 수치를 당신 외에는 누구도 검증할 수 없는 상황이다.
이런 파이프라인에서 OrcaRouter가 어디에 위치하는지
두 모델 모두 우리 카탈로그에 없으며, 이 글의 어떤 내용도 가용성 주장으로 해석되어서는 안 됩니다. 텍스트 대신 확률을 반환하는 모델은 채팅 완성 요청을 라우팅할 대상이 아니며, 이 두 모델 모두 마찬가지입니다. 우리가 실제로 제공하는 것은 그 스코어러들이 존재하는 이유인 루프의 생성 측 절반입니다. 즉, 루브릭을 작성하고, 후보 답변의 초안을 만들고, 스코어러가 실행 전에 채점하는 도구 호출을 내보내는, 하나의 OpenAI 호환 키 뒤에 있는 200개 이상의 모델입니다. 공급자 정가는 0% 마크업으로 전달되므로, 생성 측의 공급자 가격 인하는 같은 날 우리 쪽에도 반영되며, 하나의 심사 모델에 임계값을 걸고 싶지 않다면 라우팅 DSL이 여러 모델을 단일 호출로 구성하고, 모델 퓨전이 이들의 일치도를 채점할 수 있는 필드로 보고합니다. 자동 장애 조치는 단일 공급자가 성능 저하될 때 그 측을 살려 두는데, 이는 이따금 사용자에게 답하는 루프보다 보이는 모든 것을 채점하는 루프에서 더 중요합니다.

결론
Microsoft-Decision-1은 2026년 10월 8일부터 Microsoft Foundry에서 일반 제공되었습니다: 호스팅 방식, 텍스트 전용, 32,768 토큰, Microsoft가 사후 학습한 Qwen3.5-9B 기반, 분산 가중치 없음, 그리고 수치를 하나도 인쇄하지 않고 방법론을 문서화한 벤치마크 섹션 — 지연 시간도 없고, 배치 추론은 꺼져 있습니다. Intern-Decision-2B는 2026년 9월 26일자 Apache-2.0 체크포인트로 2,213,241,664개 파라미터를 가지며, 4090에서 33.28ms로 세 형제 중 가장 빠르고 ECE 0.100으로 가장 보정이 나쁩니다. 적합된 온도는 2.100509348278로, 레이블은 바꿀 수 없지만 임계값을 설정하는 모든 신뢰도는 바꿉니다. 중간 크기를 원한다면, 그에 대한 정직한 근거는 빈약합니다: 4B의 정확도를 위해 2.7GB를 더 지불하거나 0.8B의 설치 공간을 감수하고, 어느 쪽이든 임계값이 프로덕션 근처에 가기 전에 자체 보정을 적합시키십시오.
우리가 제공하는 것은 그 스코어러들이 존재하는 목적이 되는 루프의 생성적 절반, 즉 하나의 OpenAI 호환 키뒤에 있는 200개 이상의 모델이며, 이 모델들은 루브릭을 작성하고, 후보 답변을 초안하고, 스코어러가 실행하기 전에 채점할 도구 호출을 내보냅니다.
