
Microsoft-Decision-1 vs Intern-Decision-4B: 하나는 자사의 캘리브레이션을 공개하고, 다른 하나는 자사의 방법론을 공개한다
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
놓으면 Microsoft-Decision-1 옆에 Intern-Decision-4B능력보다는 각 벤더가 무엇을 공개할 의향이 있었는지에 따라 판가름 나는 비교가 된다. Microsoft의 모델은 2026년 10월 8일 Microsoft Foundry에서 정식 출시되었다: Qwen3.5-9B를 기반으로 Microsoft가 후학습시킨 텍스트 전용 모델이며, 32,768토큰 컨텍스트, 가중치 미배포, 정확도와 캘리브레이션 오차 및 대응 통계 검정을 설명하는 평가 방법론 — 그리고 결과는 단 하나도 없다. InternLM의 Intern-Decision-4B는 2026년 9월 26일 05:36:37 UTC에 아무런 발표도 없이 Hugging Face에 올라왔고, Qwen3.5-4B에서 파인튜닝되었으며, 텍스트는 물론 이미지도 입력으로 받고, 단일 RTX 4090에서 44밀리초에 실행되며, Brier 및 기대 캘리브레이션 오차 수치 전체 표를 제시한다. 둘 다 사용자가 제공한 선택지에 대한 확률 분포를 반환한다. 다만 그것을 얼마나 잘하는지 알려주는 것은 둘 중 하나뿐이다.
그 역전 — 더 크고 자금이 더 넉넉한 모델이 오히려 불투명한 쪽이 되는 — 이 바로 이 맞대결의 전체 구도이며, 대부분의 팀에게는 어떤 스펙 문구보다도 더 빠르게 선택을 결정짓는다.
그들을 가르는 단 하나의 숫자
InternLM은 벤치마크 스위트 전반에서 Intern-Decision-4B에 대해 Brier 0.347과 ECE 0.065를 보고했으며, Jevbench-Easy(100.00), Jevbench-Original(98.61), Jevbench-Hard(73.87), Typed Decision(80.55), ToolACE(96.45), AG News(90.82), WildJailBreak(89.86)에 걸쳐 평균 점수 90.02를 기록했습니다. 이는 공급업체가 자체 하네스에서 보고한 수치이며, 특히 Jevbench 항목들은 해당 프로젝트 자체의 벤치마크 제품군이므로 독립적 검증이 아니라 자기 평가로 읽어야 합니다. 하지만 이들은 명시된 척도를 지닌 숫자이며, 특히 ECE는 반환된 0.8이 조치할 가치가 있는지를 알려주는 수치입니다.
Microsoft는 이에 상응하는 내용을 공개하지 않습니다. Microsoft-Decision-1 카탈로그 페이지의 Benchmarks 탭에는 무엇을 측정했는지 설명하고, 해당 모델이 "선도적인 의사결정 모델과 동등한 성능을 발휘하며, 동일한 방법론으로 평가된 다른 오픈 의사결정 모델보다 앞선다"고 주장합니다. 가장 강한 영역으로는 추론, 규칙 적용, 프롬프트 형식 견고성을 꼽고, 가장 약한 영역으로는 전문 도메인 지식을 꼽습니다. Brier도 없고, ECE도 없고, 정확도 표도 없습니다. 도입 결정을 내릴 때 에스컬레이션 임계값을 정하기 전에 보정 수치가 필요하다면, 이 두 모델 중 하나는 그 수치를 바로 제공하고 다른 하나는 직접 측정하라고 요구합니다.

두 계약이 실제로 다른 점
겉보기에는 이 모델들이 동일한 호출을 받습니다. 상태와 이름이 지정된 질문들의 스키마, 고정된 선택지 집합을 제공하면, 생성된 텍스트를 단 한 토큰도 출력하지 않고 각 선택지에 대한 확률을 돌려받습니다. 차이는 그 계약의 경계에서 드러납니다.
• 모달리티 — Microsoft-Decision-1은 명시적으로 텍스트 전용이며 이미지, 오디오 또는 비디오 콘텐츠를 입력받거나 생성하지 않습니다. Intern-Decision-4B는 상태와 함께 선택적 이미지를 호출당 최대 8개까지 입력받을 수 있으며, 이 덕분에 스크린샷 분류, 문서 레이아웃 점검, 시각적 QA 라우팅의 후보가 됩니다.
• 질문 개수 — InternLM은 세 가지 필드 유형(choice, score, noul)에 걸쳐 호출당 1~16개의 질문, 각 최대 62개의 선택지를 문서화합니다. Microsoft는 형식 — 예/아니오, 객관식, 평점, 분류, 루브릭 — 과 최대 32K 토큰에 걸친 단일 호출을 문서화하지만, 호출당 질문 상한은 문서화하지 않습니다.
• 컨텍스트 — Microsoft는 32,768개의 토큰이라고 명시합니다. Intern-Decision-4B 카드는 자체 한도를 하나의 컨텍스트 숫자가 아닌 질문, 선택지, 이미지로 표시하므로, 두 가지를 단일 수치로 맞춰 비교할 수 없습니다.
• 배포 — Microsoft-Decision-1은 호스팅형 Foundry API이므로 모델 가중치가 배포되지 않으며 다운로드도 제공되지 않습니다. Intern-Decision-4B는 Hugging Face에서 Apache-2.0이며, 업스트림 Qwen 라이선스가 LICENSE-QWEN 파일로 보존되어 있습니다. 즉, 재배포할 경우 해당 라이선스와 업스트림 고지 사항을 유지해야 합니다.
• 비용 구조 — InternLM의 가중치는 실행 비용이 전혀 들지 않으며, RTX 4090 한 장에서 평균 44.16ms, P95 44.60ms로 제시된다. Microsoft의 토큰당 가격은 모델 페이지에 아예 표기되어 있지 않다.
• 거버넌스 — Microsoft는 책임 있는 AI 평가, 문서화된 배포 관행, 그리고 명시적 제외 항목(텍스트 생성, 개방형 질의응답, 대화, 번역 또는 요약 용도가 아님, 사람에 관한 중대한 결정에서 유일한 자동 의사 결정자가 되어서는 안 됨)을 함께 제공한다. InternLM은 출처에 관해 솔직한 모델 카드 — 가중치는 "결정 튜닝으로 수정됨" — 를 제공하지만, 컴플라이언스 패키지라고 할 만한 것은 아무것도 제공하지 않는다.

레이턴시 수치를 비교하기 어려운 두 가지 매우 다른 이유
Microsoft-Decision-1은 지연 시간 수치를 공개하지 않기 때문에 InternLM의 44.16ms 평균과 나란히 놓을 값이 없습니다. 이는 이 점에서 결코 작은 누락이 아닙니다. 이 모델들은 파이프라인 내에서 여러 번 호출되기 위해 존재합니다 — 검색된 문서당 한 번, 제안된 도구 호출당 한 번, 채점되는 응답당 한 번 — 그리고 초당 4개의 결정과 40개의 결정 사이의 차이는 샘플을 채점하는 것과 모든 것을 채점하는 것의 차이입니다. InternLM의 수치는 오늘날 시간 단위로 임대할 수 있는 하드웨어에서 달성 가능합니다. Microsoft의 수치는 자체 Foundry 배포를 통해 측정해야 하며, 선택하는 배포 형태(종량제 서버리스 대 프로비저닝된 처리량)가 모델 자체보다 더 큰 영향을 미칠 것입니다.
이 지점은 또한 OrcaRouter가 맡는 패턴의 절반이 관련되는 곳이며, 그 절반은 생성에 해당하는 쪽뿐입니다. 우리는 Microsoft-Decision-1이나 Intern-Decision-4B를 호스팅하지 않으며, 텍스트 대신 확률을 반환하는 모델은 채팅 완성을 라우팅할 대상이 아니고 둘 다 우리 카탈로그에 없습니다. 우리의 단일 OpenAI 호환 키 뒤에 있는 것은 글을 쓰는 역할을 맡은 200개가 넘는 모델 풀입니다. 한 모델이 작성한 심사 프롬프트, 다른 두 모델이 생성한 후보 답변, 실행되기 전에 점수가 매겨지는 도구 호출이 그렇습니다.제공업체 정가는 0% 마크업으로 그대로 전달됩니다, 따라서 생성 모델의 가격 인하가 같은 날 우리 쪽에도 적용되며, 단일 제공업체가 성능 저하를 겪을 때 자동 장애 조치가 채점 루프의 생성 측을 계속 작동하게 합니다 — 이는 여기서 평소보다 더 중요합니다. 왜냐하면 보이는 모든 것을 채점하는 파이프라인에는 멈춘 호출을 재시도할 여유가 없기 때문입니다.

누가 무엇을 수강해야
다음 중 하나라도 해당하면 Intern-Decision-4B를 선택하세요: 이미지와 텍스트를 모두 채점해야 하거나, 출시 전에 캘리브레이션 수치가 필요하거나, 직접 통제하는 경계 내에서 자체 하드웨어로 모델을 실행할 옵션을 원하거나, 파인튜닝하고 싶은 경우입니다. 마지막 항목은 강조할 가치가 있습니다 — 문서화된 래퍼가 있는 4B 오픈 웨이트 스코어러는 자체 레이블에 맞게 조정할 수 있는 모델이며, Microsoft-Decision-1은 파인튜닝 경로도, 조정할 가중치도 없는 호스팅 API입니다.
선택하세요: Microsoft-Decision-1 — 병목이 성능이 아니라 조달이라면: 무엇이든 프로덕션에 도달하기 전에 Azure 인증, 통합 청구, 거버넌스, 그리고 공급업체의 책임 있는 AI 평가가 필요하며, 4B의 호출당 한도 때문에 복잡해지는 긴 문서를 위해 32K 컨텍스트가 필요합니다. 공개된 벤치마크가 없다는 점은 실질적인 비용이지만, 자체 레이블링된 세트를 두 모델 모두에 돌리고 ECE를 비교하면 오후 한나절이면 없앨 수 있는 비용입니다 — 어느 쪽 공급업체의 표든 신뢰하기 전에 어차피 하게 될 일이기도 합니다.
불편한 답은 이 둘 모두 테스트하기에 충분히 저렴해서 논쟁할 가치가 거의 없다는 것입니다. Intern-Decision-4B는 당신이 아마 이미 가지고 있을 GPU 하나면 됩니다. Microsoft-Decision-1은 Foundry 배포와 직접 라벨링한 결정 샘플이 필요합니다. 두 모델 모두에 데이터를 돌려보고, 당신에게 중요한 하위 집합에서 캘리브레이션을 계산한 뒤, 숫자가 결정하게 하세요 — 이는 딱 맞게도, 바로 이 모델들이 존재하는 이유입니다.
