Laya 대 Decider 비교를 위한 생성된 타이틀 카드로, 이 글 자체의 부제와 어느 쪽 수치가 공급업체 보고인지 어느 쪽이 제3자 수치인지 밝히는 바닥글 줄을 담고 있습니다.
Engineering & Research

Laya vs Decider: 35B 혼합 모델에 맞선 421M 인코더

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Laya와 Decider는 둘 다 오픈 웨이트 비자기회귀 결정 모델로, 유형이 지정된 질문 — 제공된 목록에서의 선택, 정해진 평가 기준상의 점수, 예/아니요 확률 — 에 단일 순전파로 답하며, 크기 스펙트럼의 양 극단에 있다. Convai Innovations는 2026년 9월 18일 Apache 2.0에 따라 Laya를 공개했다: 512토큰 창을 가진 영어용 421M ModernBERT-large 인코더, 100개 이상 언어를 포괄하는 1,024토큰 창의 322M mmBERT-base 다국어 체크포인트, 그리고 문자 체계를 감지해 올바른 모델로 디스패치하는 라우터다. Mapika의 Decider 제품군은 소형 생성 기반의 decider-0.8b와 decider-2b부터, 약 3B 활성 파라미터를 가진 35B 전문가 혼합(mixture-of-experts)인 decider-35b-a3b까지 이어진다. 둘 다 무료로 다운로드할 수 있고, 둘 다 텍스트가 아니라 확률을 반환한다. 이 둘이 서로 대체 가능하지 않은 이유는 대부분의 글이 가장 먼저 내세우는 정확도 수치가 아니다.

두 패밀리, 하나의 아키텍처 승부수

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

공통된 전제는 결정에 디코딩 루프가 필요하지 않다는 것입니다. 생성 모델에게 "이 티켓이 환불 요청인가?"라고 묻는다면, 그 모델은 토큰을 생성해야 합니다. 그리고 토큰을 생성하는 순간, 파싱, 스키마 검증, 그리고 200번에 한 번 중괄호 하나를 잊어버리는 경우를 위한 재시도 경로가 모두 여러분 몫이 됩니다. Laya와 Decider는 모두 단일 순방향 패스에서 답을 직접 읽어 그 과정을 건너뜁니다 — Laya는 양방향 인코더에서, Decider는 프롬프트의 전용 답변 슬롯에 있는 문자 선택지 토큰의 로짓에서 읽습니다.

유사점은 거기서 끝난다. Laya는 언어 라우터 뒤에 있는 두 개의 작은 인코더로, 그 덕분에 421M 및 322M 매개변수 규모에서 512토큰 영어 윈도우와 1,024토큰 다국어 윈도우를 얻는다. Decider는 생성 백본을 유지하고 그 위에 리드아웃을 추가한다: decider-2b는 Qwen3.5-2B-Base를 지도 미세 조정한 뒤 라이브 브라우저 작업과 정확한 게임에 대한 캘리브레이션 인식 강화 패스를 거친 모델이고, decider-35b-a3b는 라우팅된 전문가를 동결하고 Muon으로 블록 행렬을 훈련한다. 실질적인 결과는 Decider가 언어 모델의 세계 지식을 물려받고 Laya는 그렇지 않다는 것이다. 다른 결과는 Decider가 언어 모델의 풋프린트를 물려받는다는 것이다.

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

Mapika의 자체 문서에 따르면 decider-2b는 B300에서 bf16, 배치 크기 1, CUDA 그래프나 컴파일 없이 결정당 중앙값 18ms이고, decider-35b-a3b는 동일한 환경에서 41ms입니다. 약 230토큰의 지원 티켓 컨텍스트와 서너 개의 입력형 질문을 사용하는 GH200에서는 같은 프로젝트가 49ms(이저 모드), CUDA 그래프와 torch.compile 사용 시 4.0ms, 배치 32에서 초당 약 1,370건의 결정을 보고합니다. 이는 프로젝트 자체 문서에 실린 벤더 발표 수치이며, 독립적인 측정값이 아닙니다. Laya의 대표 수치 역시 벤더 발표로, Tesla T4에서 결정당 p50 32.8ms, 배치 크기 10에서 질문당 7.2ms입니다.

두 프로젝트가 서로 다른 규모로 답하는 교정 질문

캘리브레이션은 의사결정 모델에서 가장 중요한 숫자입니다. 확률을 반환하는 핵심 목적은 다운스트림의 누군가가 그 확률에 임계값을 설정한다는 데 있기 때문입니다. 또한 바로 이 지점에서 Laya와 Decider를 직접 비교하면 오해하게 됩니다.

Laya는 자체 모델 카드에 기대 보정 오차가 0.466이라고 명시하고 있으며, 카드에는 질문 유형별로 온도를 다시 적합하면 그 값이 0.081로 바뀐다고 분명히 밝히고 있습니다. 이는 이례적으로 솔직한 공개이며, 또한 배포된 체크포인트가 보정된 산출물이 아니라는 뜻이기도 합니다. 별도 설정 없이 바로 사용했을 때 얻는 숫자는 0.466입니다.

Decider는 전적으로 다른 측정 도구에 대해 보고한다. Decision Index — Jev의 모든 공개 재현을 132,422건의 요청에 걸쳐 실행한 공개 리더보드 — 는 decider-35b-a3b를 Jev의 59.5점 뒤인 전체 4위, 54.3점에 올리고, 이를 32개 항목 중 가장 보정이 잘 된 것으로 보고하며, 보정 오류 3.1점과 95% 이상의 표명 신뢰도에서 0.4%의 오답을 기록했다고 밝힌다. decider-2b는 8.8점과 0.9%를 보고한다. 이는 리더보드에 공개된 수치이며, Index의 10구간 ECE에서 3.1점은 Laya가 자체 평가에서 기록한 0.466과 같은 측정값이 아니다. 이 둘을 표에 나란히 놓는 것은 엄밀함으로 포장된 사과와 오렌지 비교 오류일 것이다. 말할 수 있는 것은 Decider의 작성자는 제3자 리더보드에서 측정되기를 선택했고 Laya의 작성자는 자체적으로 가장 약한 보정 수치를 공개하기로 선택했다는 점이다; 어느 쪽도 상대방의 하네스에 의해 감사되지 않았다.

각각이 차원별로 어디에서 앞서는지

• 백본 — Laya: ModernBERT-large 421M 인코더, 양방향. 결정자: Qwen3.5 생성형 기반 모델, 0.8B~35B-A3B.

• 언어 — Laya: 라우터 뒤에 있는 322M 다국어 체크포인트를 통해 100개 이상 지원. Decider: 영어 전용이며, 이는 한계로 명시됨.

• 컨텍스트 윈도우 — Laya: 영어 512토큰, 다국어 1,024토큰. Decider: 최대 32k 입력 허용, v6 세대에서 16k까지 학습, 30k까지 프로빙.

• 옵션 세트 상한 — Laya: 약 20개 옵션을 넘으면 급격히 저하되며, Banking77에서 Jev의 0.870과 대비되는 0.425입니다. Decider: 이름이 지정된 2~255개 옵션에 대한 Choice, 설명된 2~10개 수준에 대한 Score.

• 제로샷 정확도 — Laya: typed-decisions 벤치마크에서 0.362로, 다수 클래스 기준선인 0.461보다 낮음. Decider: 제로샷 수치로는 공개되지 않음; 프로젝트는 대신 태스크별 결과를 보고함.

• 캘리브레이션 — Laya: 출하 시 ECE 0.466, 질문 유형별 temperature 재적합 후 0.081. Decider: 35B의 Decision Index에서 3.1점, 32개 항목 중 최고.

• 추론 — Laya: 설계상 없음. 결정자: 없음, 명시적으로 밝혀짐 — 그것은 추론기가 아니라 패턴 매칭 판독기다.

• 라이선스 — 둘 모두 Apache 2.0.

Decider를 선택하기 전에 알아두면 좋은 세부 사항이 하나 더 있습니다: 이 프로젝트는 긴 JSON 배열에서 위치로 레코드 하나를 고르는 것이 약한 사례라고 경고하며, 레코드를 키로 지정하는 것을 권장합니다. 그것은 실행해 봐야만 알 수 있는 종류의 한계입니다.

둘 중 하나를 실행하는 데 드는 비용

Laya의 비용 프로필은 파인튜닝 프로젝트입니다. 이 모델은 낮은 처리량 작업이라면 노트북 CPU에서 실행할 수 있을 만큼 작지만, 배포된 영어 체크포인트의 제로샷 점수는 사소한 베이스라인보다 낮습니다. 이는 Laya를 도입하는 것이 라벨링된 세트를 구축하고, 파인튜닝하고, 질문 유형별로 temperature를 재조정하는 일을 떠안는 것과 같다는 뜻입니다. 그 보상은 일단 해내고 나면, 산출물이 421M 파라미터이고 T4에서 수십 밀리초 만에 응답한다는 점입니다. Convai가 자체적으로 파인튜닝한 laya-typed-decisions 체크포인트는 벤치마크의 훈련 분할에서 0.766에 도달합니다 — 이 숫자는 기본 모델보다 파인튜닝에 대해 더 많은 것을 말해주며, 카드에도 그렇게 적혀 있습니다.

Decider의 비용 프로파일은 서빙 결정입니다. 여러분은 GPU를 얼마나 임대할지 선택하고 있으며, 이 패밀리는 진정한 다이얼을 제공합니다. 2B에서 18ms 대 35B-A3B에서 41ms이며, 더 큰 모델은 작은 모델들이 갖지 못한 GPQA, GSM8K, CRUXEval, MMLU에서의 지식과 추론 여유를 확보해 줍니다. 작업이 좁고 레이블이 고정되어 있다면 decider-2b가 더 저렴한 기계입니다. 작업이 모델이 무언가를 알아야 하는 것이라면, mixture에 대한 비용을 지불하게 됩니다.

OrcaRouter가 적합한 곳 — 그리고 그렇지 않은 곳

Laya도 Decider도 OrcaRouter에서 호스팅되는 모델이 아닙니다. 가중치를 직접 내려받아 직접 실행해야 하며, 이 점은 달라지지 않습니다. 달라지는 것은 이 패턴의 나머지 절반입니다. 타입이 지정된 결정 모델이 애플리케이션 전체인 경우는 거의 없습니다. 티켓을 읽거나, 스레드를 요약하거나, 결정이 게이트하는 답변 초안을 작성하는 무언가가 필요합니다. 그 절반은 생성형 호출이며, 바로 OrcaRouter가 만들어진 대상입니다 — 하나의 OpenAI 호환 키 뒤에 200개 이상의 모델을 공급자 정가를 0% 마크업으로 그대로 전달, 따라서 공급업체의 가격 인하가 다음 계약 갱신 때가 아니라 같은 날 청구서에 반영됩니다. 프론티어 모델의 출력에 맞춰 Laya 체크포인트를 파인튜닝하거나, 트리아지용 decider-2b와 어려운 4%를 위한 대형 모델 사이를 라우팅하는 경우, 생성 쪽을 하나의 엔드포인트에 유지하면 결정 쪽과 생성 쪽이 두 개의 계약과 두 개의 SDK를 필요로 하지 않습니다. 자동 장애 조치는 대형 모델이 다운되는 부분인 경우를 처리합니다.

어느 걸 고를까?

입력이 다국어이고, 레이블이 적고, 적당한 하드웨어에서 지연 시간 예산이 수십 밀리초이며, 미세 조정할 준비가 되어 있다면 Laya를 선택하십시오 — 어차피 해야 하기 때문입니다. 입력이 영어이고, 모델이 의사 결정에 어느 정도 세계 지식을 반영해야 하며, 훈련 파이프라인을 실행하기보다 모델 크기를 선택하는 편이 낫다면 Decider를 선택하십시오. 옵션 세트가 레이블 스무 개를 넘어간다면, 결정하기 전에 Laya의 Banking77 수치를 읽어 보십시오; 위치로 지정하는 긴 JSON 문서를 입력으로 쓴다면, 결정하기 전에 Decider의 명시된 한계를 읽어 보십시오.

이 문제를 실제로 결판낼 비교 — 두 모델을 바이트 단위로 동일한 입력, 동일한 프롬프트, 동일한 옵션 순서, 동일한 임계값 스윕에 놓는 비교 — 는 아직 존재하지 않습니다. 그런 비교가 존재하기 전까지는, Laya가 더 나은 비용 곡선을 가지고 있고 Decider가 더 나은 캘리브레이션 근거를 가지고 있다는 것, 그리고 둘 다 아직 충분히 초기 단계여서 자체 데이터로 구축하는 평가가 두 프로젝트의 공개 수치보다 더 가치 있을 것이라는 것이 정직한 입장입니다.

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."