Microsoft-Decision-1 vs Kev를 위한 생성된 타이틀 카드. 부제는 '재학습할 수 있는 레시피에 맞선 호스팅 스코어러'이며, 칩에는 9B 호스팅 API vs 동결된 베이스 + 33.3M rank-16 LoRA 어댑터, 공개된 벤치마크 없음 vs transfer-v4에서 ECE 0.017, 배포된 가중치 없음 vs Apache-2.0이라고 적혀 있고, 두 세트의 수치 모두 자체 보고임을 명시하는 출처 푸터가 있다.
Engineering & Research

Microsoft-Decision-1 대 Kev: 점수를 사는 것인가, 아니면 그 점수를 만들어내는 레시피를 소유하는 것인가

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Jared Palmer는 자신의 모델 옆에 영수증을 놓았다. Kev 패밀리 — Kev-0.8B, Kev-4B, Kev-9B는 고정된 오픈 웨이트 베이스 체크포인트 위에 rank-16 LoRA 어댑터와 작은 포인터 헤드를 얹어 구축되었으며 — 2026년 9월 24일에 학습 레시피, 단계별 데이터 개수, 평가 수치를 모두 공개하며 출시되었고, 이것을 Microsoft-Decision-1과 비교하는 사람이라면 누구나 알아야 할 솔직한 핵심은 Kev가 자신을 재현하는 방법에 대해 훨씬 더 많은 것을 알려준다는 점이다. Microsoft의 스코어러는 2026년 10월 8일 Microsoft Foundry에서 일반 제공되기 시작했다: Microsoft가 포스트 트레이닝한 Qwen3.5-9B 베이스, 32,768토큰 컨텍스트, 텍스트 전용, 가중치 미배포, 공개된 평가 방법론, 그리고 공개된 결과는 없음. 둘 다 상태와 타입이 지정된 질문 세트를 받아 생성된 텍스트 대신 보정된 분포를 반환한다. 하나는 서비스이고, 다른 하나는 오늘 밤 노트북에서 실행할 수 있는 방법이다.

그 구분이 역량이 아니라 이 맞대결을 결정하는 이유는 다음과 같다: Kev-4B는 자사의 도메인 외 잠금 테스트에서 ECE 0.017을 보고하고 Microsoft-Decision-1은 아무것도 보고하지 않는다. 따라서 스코어러 대 스코어러 비교를 보통 판가름하는 캘리브레이션 논거에서는 한쪽만 자기 입장을 밝히고 있는 셈이다.

Kev가 실제로 게시하는 것

Kev-4B의 카드는 이례적으로 구체적이며, 그 구체성이 바로 핵심이다. 백본은 Qwen3.5-4B-Base로, 명명된 리비전에 고정되어 있으며, 24개의 Gated DeltaNet 선형 어텐션 레이어와 8개의 전체 어텐션 레이어를 은닉 크기 2,560으로 갖추고 있다. 그 위에는 rank-16 LoRA 어댑터 — 어텐션, MLP 및 DeltaNet 프로젝션에 적용된 3,380만 개의 학습 가능한 파라미터 — 와 각 옵션의 종료 토큰을 질문의 최종 토큰과 비교하여 점수를 매기고 소프트맥스를 수행하는 포인터 헤드가 있다. 하나의 온도 T = 2.41이 헤드 파일에 저장되어 로드 시 적용되며, 카드에는 피팅된 값과 파일 해시가 제공된다. 학습은 공개된 레코드 수와 함께 단계적으로 진행되었다: 12,576개의 레코드로 구성된 기본 레시피, 날짜 및 누락된 증거를 위한 1,425개, 5,219개의 실제 CFPB 민원 내러티브, 6,000개의 스킬 레코드, 5,320개의 개발자 도구 레코드가 있으며, 이후 단계에서는 이전 단계를 재생했다. 카드에는 사용되지 않은 항목도 명시되어 있다: "Jev(TypeSafe의 호스팅된 의사결정 모델)의 출력은 사용되지 않았다."

벤치마크 표는 같은 페이지에 제시되어 있으며, 성공 사례보다 더 드문 실패 사례들이 함께 첨부되어 있다. Transfer-v4의 잠금된 도메인 외 테스트: 정확도 0.838, Brier 0.224, ECE 0.017. 14개의 홀드아웃 데이터셋과 3,089개 질문에 걸친 Breadth-v1: 정확도 0.690, ECE 0.029. Hard-v1 테스트: 0.803. Documents-v1 테스트: 0.903. 열 개 선택지가 있는 MMLU-Pro: 0.565. 날짜 연산: 0.65, 저자가 가장 취약한 영역이라고 지목했으며, 부분적 수정책으로 전처리기 플래그가 제시되었고 재측정되지 않았다는 명시적 주석이 있다. 한계 섹션에서는 보정이 단일 분포 내 온도에 불과해 도메인 외에서는 커버리지가 저하되고, 선택지 순서가 답을 뒤집을 수 있으며, 8,192 토큰을 초과하는 길이는 제공되지만 검증되지 않는다고 덧붙인다. 서빙 수치도 공개되어 있다: H100에서 짧은 상태에 대해 여섯 질문에 18.1ms, 캐시된 경우 12.9ms, 상주 GPU 메모리 14.3GB.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

대신 Microsoft가 게시하는 것

Microsoft-Decision-1은 다른 태도로 대부분의 동일한 영역을 다룹니다. 예/아니요, 객관식, 평점, 분류 및 루브릭 질문을 채점하고, '알 수 없음'과 같은 명시적 기권 옵션을 지원하며, JSON 확률을 반환하고, 최대 32K 토큰에 걸쳐 한 번의 호출로 실행됩니다 — 이는 Kev가 검증하는 컨텍스트의 네 배입니다. 이는 Microsoft Foundry에서 Direct from Azure 포트폴리오 아래 호스팅 API로 배포되며, 서버리스 및 통합 엔드포인트 배포, 표준 SKU, Azure 인증 및 통합 청구 경로를 갖추고 있습니다. 일괄 추론은 비활성화되어 있으며, 가중치 다운로드와 미세 조정 경로가 없습니다.

평가 섹션은 공개 및 커뮤니티 의사 결정 벤치마크와 함께 홀드아웃 내부 세트, 정확도 및 교정 오차를 포함한 지표, 옵션 순서 변경, 대응 통계 검정, 그리고 이 모델이 "동일한 방법론으로 평가된 다른 오픈 의사 결정 모델들을 앞서고 선도적인 의사 결정 모델들과 동등한 성능을 발휘한다"는 주장을 설명합니다. 표는 없습니다. 모델 카드는 자신의 한계를 솔직하게 밝히고 있습니다 — 점수는 표현과 옵션 순서에 따라 달라지고, 교정은 익숙한 작업 유형에서 가장 강하며, 설명은 생성되지 않고, 비영어권 커버리지가 가장 약합니다 — 하지만 한계 목록은 교정 측정이 아닙니다. Microsoft-Decision-1에 0.9 자동 승인 임계값을 설정하는 사람은 누구나 그것을 믿음으로 설정하고 프로덕션에서 조정하는 것입니다.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

비교에서 돈이 드는 부분

Kev의 경제성은 이 대결이 진정으로 박빙인 이유다. 레시피는 동결된 베이스에 33.8M 어댑터를 더한 것으로, 즉 학습하는 한계 모델의 비용은 파운데이션 모델 규모의 연산이 아니라 어댑터 규모의 연산이다. 베이스를 메모리에 한 번 올려두고 여러 어댑터를 로드할 수 있다 — 결정 도메인마다 하나씩 — 이는 Microsoft의 호스팅 API가 전혀 표현할 수 없는 배포 형태다. 라우팅 규칙이 범용 판정자의 것과 다르다면, Kev는 그 차이를 학습시킬 수 있게 해준다; Microsoft-Decision-1은 더 나은 프롬프트를 쓰고 기대하게 해준다.

그에 반해 호스팅형 API에는 운영상의 표면이 없습니다. 추적해야 할 어댑터도, 계속 웜 상태로 유지해야 할 서빙 스택도, 검증된 컨텍스트와 서빙되는 컨텍스트 사이의 차이를 고민할 필요도 없으며, 한 데이터셋에서 피팅된 temperature가 여러분의 데이터셋에서는 다르게 작동할 위험도 없습니다. 의사결정 볼륨이 적당한 팀에게는 토큰에 비용이 들더라도 엔지니어링 시간 측면에서 서비스가 더 저렴한 산출물입니다. 하루에 수백만 건의 항목을 스코어링하는 팀에게는 GPU 비용을 지불하는 순간 자체 호스팅 어댑터가 단위 비용에서 이깁니다.

가장 약한 부분에 두 모델 중 어느 것도 사용하지 않는 세 번째 경로가 있으며, 바로 그 지점에 OrcaRouter가 있습니다. 우리는 Microsoft-Decision-1이나 Kev를 호스팅하지 않습니다. 확률을 반환하는 스코어러는 chat-completions 대상이 아니며, 두 모델 모두 우리 카탈로그에 없습니다. 우리가 담당하는 것은 의사결정 파이프라인의 생성적 절반입니다. 즉, 후보 답변을 초안하고, 평가 기준을 작성하거나, 점수가 매겨질 도구 호출을 내보내는 모델입니다. 이 모든 것이 200개 이상의 모델을 포함한 하나의 OpenAI 호환 키 뒤에 있습니다제공자 정가로 0% 마크업만 붙여 그대로 전달됩니다. 따라서 벤더 가격 변경은 같은 날 우리 쪽에도 반영됩니다. 채점 또는 분류 루프를 구축하고 있다면, 작성 호출은 라우팅 가능하고 채점 호출은 그렇지 않으며, 이 경계를 명확히 유지하는 것이 채점 파이프라인이 조용히 채팅 파이프라인이 되는 것을 막아줍니다.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

결정하는 방법

를 선택하세요:Kev 출시하기 전에 수치가 필요할 때, 자체 의사결정 레이블로 파인튜닝하고 싶을 때, 한계 비용 제로로 자체 경계 안에서 스코어링을 실행하고 싶을 때, 또는 여러 의사결정 도메인이 하나의 상주 기본 모델을 공유하게 하고 싶을 때. 공개된 ECE 수치는 여전히 저자가 자체 하네스에서 직접 측정한 값입니다. 감사된 제3자 결과가 아니라 신뢰할 만한 자기 평가로 취급하세요. 하지만 적어도 재현해 볼 수 있는 명시된 척도이며, 이를 재현할 레시피도 바로 거기에 있습니다.

선택하세요 Microsoft-Decision-1게이트가 조달이거나 컨텍스트 길이인 경우: 통합 청구와 책임 있는 AI 패키지를 갖춘 관리형 Azure 엔드포인트, 긴 문서를 위한 32K 입력, 그리고 에스컬레이션할 벤더가 있습니다. 벤치마크 표가 없다고 해서 스캔들인 것은 아닙니다 — 많은 호스팅 모델이 그것 없이 출시됩니다 — 하지만 이는 이 모델의 첫 번째 캘리브레이션 곡선이 사용자들에 의해 그려질 것이라는 뜻이며, 프로덕션 임계값을 이 모델에 적용하기 전에 자신의 레이블링된 데이터로 그중 한 명이 될 계획을 세워야 합니다.