
Microsoft-Decision-1 vs Laya: API 뒤에 25개 언어, 322MB 다운로드 뒤에 100개 이상
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
언어 수를 세어 보면 비교는 이미 판가름 난 듯 보인다. Microsoft-Decision-1은 2026년 10월 8일부터 Microsoft Foundry에서 정식 제공되며, 25개 지원 언어를 나열하고, 적용 범위, 품질 및 보정이 "언어별로 달라질 수 있다"고 분명히 밝히며, 비영어, 특히 저자원 언어를 성능이 떨어지는 영역으로 지목합니다. Laya는 2026년 9월 18일 Convai Innovations가 Apache 2.0에 따라 공개했으며, 100개 이상 언어에 걸친 다국어라고 설명하고, 라우팅을 사용하면 테스트한 51개 언어 중 45개가 사용 가능한 상태를 유지한다고 보고합니다. 반면 영어 전용 형제 모델은 51개 중 23개입니다. 하나는 32,768토큰 컨텍스트를 갖춘 Azure 엔드포인트 뒤의 9B 모델이고, 다른 하나는 무료로 단일 Tesla T4에서 결정당 32.8밀리초로 실행되는 4억 2,100만 파라미터 분류기입니다. 둘 다 토큰 하나를 쓰지 않으며, 둘 다 사용자가 정의한 선택지에 대한 확률을 반환합니다.
하지만 두 모델 카드를 끝까지 읽어 보면, 언어 수는 더 이상 흥미로운 숫자가 아니게 된다. 흥미로운 것은 그 뒤에 있는 캘리브레이션 이야기이며, 두 프로젝트는 그 이야기를 서로 반대 방향으로 들려준다.
Laya는 자사 마케팅을 곤란하게 만드는 수치를 공개한다
Laya 모델 카드는 자체 한계 섹션에서 기본 체크포인트가 typed-decisions 벤치마크에서 제로샷 0.362점을 기록한다고 밝히고 있다 — 이는 0.461의 다수 클래스 기준선보다 낮은 수치다. 이는 해당 테스트에서 "가장 흔한 답"을 추측하는 것보다 모델이 더 나쁘다고 말해주는 카드다. 또한 기본 체크포인트가 제로샷에서 거의 우연 수준에 가깝다고, 대표적인 0.766 typed-decisions 수치는 해당 벤치마크 자체의 분할에서 파인튜닝이 필요하다고, 서수 점수 질문은 가장 약한 기본 요소이며 (SST-5 0.372), 높은 카디널리티 선택 질문은 77개 옵션이 각각 약 3~4개의 토큰만 남기기 때문에 어려움을 겪는다고, noul 이 자체 레이블을 따를 수 있다고, action.act_probability 필드는 AUROC 0.30에서 "아직 사용 가능한 신호를 전달하지 않는다"고 밝히고 있다. Convai의 자체 요약 문장은 어떤 평가에도 가져가야 할 문장이다: Laya는 특화하기 위한 빠른 기반이지, 제로샷 의사결정 엔진이 아니다.
그 솔직함은 들리는 것보다 더 가치가 있습니다. 그것은 Laya가 정확히 무엇을 위한 것인지 알려주기 때문입니다. Laya는 자체 레이블로 미세 조정하는 인코더입니다. 전체 아키텍처는 새 스키마에는 재학습이 필요하지 않도록 구축되었지만, 특정 작업에서 좋은 성능을 내려면 재학습이 필요합니다. 그렇게 사용하면 공개된 수치는 강력합니다. 미세 조정 후 유형화된 결정에서는 Jev의 0.727 대비 0.766, AG News는 0.910 대비 0.950, DAIR Emotion은 0.480 대비 0.595, ECE는 Jev의 0.246 대비 0.081입니다. 다만 과도하게 확신한 상태로 제공되어 temperature 재조정이 필요하다는 솔직한 단서가 있는데, 이는 평균 ECE를 0.466에서 0.081로 이동시킵니다.
Microsoft는 방법론은 공개하고 결과는 공개하지 않는다
Microsoft-Decision-1의 Foundry 페이지는 동일한 실험을 반대 방향으로 수행합니다. 이 페이지는 평가를 자세히 설명합니다 — 공개 및 커뮤니티 의사결정 벤치마크와 비공개 내부 세트, 정확도와 보정 오차를 포함한 지표, 선택지 순서 변경, 짝지은 통계 검정, 비교 대상 모델에 대한 동일한 하네스 — 그리고 해당 모델이 "선도적인 의사결정 모델들과 동등한 성능을 내며, 동일한 방법론으로 평가된 다른 오픈 의사결정 모델들보다 앞선다"고 보고합니다. 또한 강점(추론, 규칙 적용, 프롬프트 형식에 대한 견고성)과 약점(전문 도메인 지식, 비영어)을 밝힙니다.
그러고 나면 아무것도 출력하지 않는다. 정확도 수치도, 캘리브레이션 오차도, 벤치마크별 표도 없다. 스스로 보고한 한계들은 실재하며 유용하다 — 점수는 문구와 선택지 순서에 따라 달라지고, 잘못 구성된 질문도 여전히 점수를 반환하며, 캘리브레이션은 익숙한 작업 유형에서 가장 강하고, 설명은 전혀 생성되지 않는다 — 하지만 한계 목록은 측정이 아니다. 그래서 이 맞교환은 유난히 깔끔하다: Laya는 자신의 데이터로 반증을 시도해 볼 수 있는 숫자를 제공하고, Microsoft는 컴플라이언스 태세와 긴 문서를 넣을 수 있는 32K 컨텍스트를 제공한다.

크기 차이가 실제로 가져다주는 것
Laya의 작음은 여기서 타협이 아니라 설계입니다. 모든 옵션이 자체 [MASK] 토큰에서 점수를 받고 해당 질문의 옵션들에 대해 소프트맥스되기 때문에, 답변 공간은 어휘 헤드에 미리 박아 넣는 대신 요청 시점에 조립됩니다. 이는 오늘 오후에 고안한 스키마에 재학습이 필요 없는 이유이고, 모델이 3억 2,200만~4억 2,100만 개 파라미터 안에 들어오는 이유입니다. 다국어 체크포인트는 영어 체크포인트보다 약 2.2배 빠르게 실행되고, 라우터는 0.5밀리초 미만으로 문자 체계를 감지하며, 배치 처리량은 T4 한 대에서 초당 103~332개 질문에 이릅니다. 모든 티켓, 검색된 모든 문서 또는 제안된 모든 작업에 점수를 매기는 워크로드라면, 그 처리량이 바로 특징이지 파라미터 수가 아닙니다.
그 설계의 비용 역시 마찬가지로 구체적이며, Microsoft의 대안과 비교해 언급할 가치가 있다. 영어 체크포인트는 512토큰 윈도우를 사용하고, 다국어 체크포인트는 1,024토큰을 사용하며 8K까지 확장 가능하다. Microsoft-Decision-1은 32,768을 사용한다. 긴 지원 스레드, 전체 계약서, 또는 여러 페이지 분량의 정책 문서는 Laya의 윈도우에 전혀 들어가지 않으며, 아무리 빠른 속도도 잘림을 보상하지 못한다. Laya는 옵션별로 문서화된 토큰 예산을 가지고 포워드 패스당 하나의 질문 세트에 답한다; Microsoft는 질문별 상한 없이 최대 32K 토큰에 걸친 단일 호출을 문서화한다. 그리고 분류기로서 Laya의 경쟁적 약점은 알아둘 가치가 있다: Banking77에서 Jev의 0.870과 비교해 0.425점을 기록하는데, 이는 특화 패스가 가장 중요한, 세밀하고 카디널리티가 높은 인텐트 문제 유형이다.

토큰당이 아닌 비용 비교
Laya는 사용 시점에 무료입니다 — 자체 호스팅, Apache 2.0, 자체 호스팅 비용이 "$0"으로 명시되어 있죠 — 그리고 실제 가격은 이 모델이 여러분의 작업을 잘 수행하기 전에 지불해야 하는 파인튜닝 실행입니다. Microsoft-Decision-1은 모델 페이지에 적혀 있지 않은 토큰당 요금을 가진 호스팅형 Foundry API이며, 다운로드할 가중치도 없고, 파인튜닝 경로도 없으며, 배치 추론이 비활성화되어 있습니다. 하나는 선행 데이터 라벨링 프로젝트이고, 다른 하나는 종량제 호출입니다. 어느 쪽이 더 저렴한지는 전적으로 볼륨에 달려 있으며, 교차점은 높습니다: 임대한 T4에서 초당 300개 항목을 채점하는 421M 인코더는 일단 훈련되고 나면 결정당 비용을 이기기가 매우 어렵습니다.
OrcaRouter가 두 모델 중 하나로 구축된 파이프라인에서 제자리를 찾는 지점은 바로 여기이며, 이는 생성 측면에만 해당합니다. 우리는 Microsoft-Decision-1도 Laya도 호스팅하지 않습니다. 둘 다 텍스트가 아니라 확률을 반환하고, 둘 다 우리 카탈로그에 없으며, 스코어링 엔드포인트는 채팅 완료 대상이 아닙니다. 우리가 실제로 제공하는 것은 스코어링 대상이 되는 결과물 — 초안 답변, 제안된 도구 호출, Laya의 파인튜닝된 헤드가 판단하는 후보 답변 — 을 생성하는 모델입니다. 즉, 하나의 OpenAI 호환 키 뒤에 200개 이상의 모델이 있고 공급자 정가 그대로, 0% 마크업으로 제공되며, 하나의 서빙 경로가 저하될 때 자동 장애 조치가 함께 제공됩니다. 생성하는 모든 것에 점수를 매기는 루프에서 생성 호출은 실패할 수 있는 부분이며, 장애 조치가 스코어링 큐를 계속 채워 줍니다.

어느 걸 고를까?
다음과 같은 경우 Laya를 선택하세요: 의사 결정이 여러 언어로 들어오는 경우, 토큰당 가격 책정이 중요할 만큼 처리량이 많은 경우, 레이블이 있고 미세 조정에 일주일을 투자할 수 있는 경우, 또는 자체 경계 내부의 하드웨어에서 스코어링을 실행해야 하는 경우. 512~1,024토큰 윈도와, 특화하기 전까지는 기본 체크포인트가 우연 수준에 가깝다는 사실을 받아들이면, 자신이 출발점이라는 점을 솔직히 인정하는 의사 결정 모델을 얻게 됩니다.
선택하세요: Microsoft-Decision-1 입력이 티켓이 아니라 긴 문서라면, 배포 게이트가 다운로드가 아니라 Azure 인증, 통합 청구 및 Responsible AI 패키지라면, 25개 언어가 트래픽을 커버한다면, 또는 모델을 아예 소유하고 싶지 않다면. 그것의 첫 캘리브레이션 곡선을 직접 그려야 한다는 점을 받아들이고, 이를 위해 라벨링된 샘플에 오후 한나절을 배정하세요 — Laya와 달리 이것은 당신이 논쟁할 ECE 수치를 건네주지 않기 때문입니다.
