Laya 대 von 비교를 위한 생성된 타이틀 카드로, 이 기사 자체의 부제목과 어느 쪽 수치가 공급업체 보고이고 어느 쪽이 제3자인지 밝히는 각주 줄을 담고 있습니다.
Engineering & Research

Laya vs von: 벤더 벤치마크가 전이되지 않을 때

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

여섯 개의 가능한 레이블이 있는 커밋 유형 분류 작업에서, 찍으면 8.3%인데 von은 26.7%를 기록한다. 같은 모델이 8.8%를 기록해 우연 수준을 겨우 넘는 파일 라우팅 작업. AUC가 0.513인 이진 변경 범위 작업은 동전 던지기와 같다. 이 수치들은 von에 대한 제3자 평가에서 나온 것이다. von은 wfzyx의 오픈소스 System One 모델로, 2026년 9월 18일 Apache 2.0으로 공개된 395M ModernBERT-Large 인코더이며, Convai Innovations의 Laya와 같은 날 나왔다. von 자체의 jabr v2 벤치마크에서는 상황이 반대다. 49개 작업과 869개 사례 전반에서 매크로 정확도 71.5%, 선택 라우팅 83.4%, 그리고 ViZDoom 결과는 18ms 미만에서 평균 킬 9.38로, 5.62킬과 약 115ms의 TypeSafe AI의 Jev와 대비된다. 두 수치 세트 모두 실제다. 그들 사이의 간극은 이 모델 범주에 관해 누구든 공개한 것 중 가장 유용한 것이며, Laya에도 적용된다.

두 개의 모델, 두 개의 백본, 하나의 공통된 실패 모드

von과 Laya는 구조적으로 거의 이웃이라, 전이 문제가 이 둘을 비교하기에 딱 맞는 렌즈인 이유가 바로 여기에 있다. 둘 다 ModernBERT를 기반으로 한 비자기회귀 인코더로, von은 395M 파라미터, Laya의 영어 체크포인트는 421M이다. 둘 다 동일한 세 가지 프리미티브를 노출한다 — choice는 제공된 목록에서, score는 정렬된 루브릭에서, noul은 yes의 보정된 확률로서 — 그리고 둘 다 /v1/systemone 와이어 포맷을 구현하므로, TypeSafe의 Jev용으로 작성된 클라이언트가 대신 로컬 서버를 가리킬 수 있다. 둘 다 Apache 2.0이다. 둘 다 텍스트가 아니라 확률을 반환하며, 어느 쪽에도 환각을 일으킬 디코딩 루프가 없다.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

차이점은 학습 과정에 있습니다. von은 일반 웹 텍스트, 기술 문헌 및 코드로 구성된 2조 개의 토큰으로 사전 학습된 후, 운영 및 엔터프라이즈 워크플로, 보안 및 DevOps, 안전 및 정책 중재, 언어학, 트리아지, 적대적 추론을 아우르는 약 290,000개의 예제로 구성된 균형 잡힌 다중 도메인 코퍼스로 미세 조정되었습니다. 사후 학습은 보정 분포를 사용한 강화 학습을 사용했으며, 람다가 0.5인 교차 엔트로피와 브라이어 점수의 합성 값을 최소화했고, 온도 스케일링은 T=1.1692에서 수렴했습니다. Laya의 영어 체크포인트는 typed-decision 형태에 맞게 미세 조정된 ModernBERT-large로, 512 토큰 창을 갖추고 있으며, 라우터 뒤에서 100개 이상의 언어를 커버하는 322M mmBERT-base 다국어 체크포인트와 함께 Tesla T4에서 결정당 32.8ms p50이 공개되었습니다.

공통된 실패 모드는 둘 다 추론기가 아니라 판독값을 생성하도록 훈련된 인코더라는 점이다. von의 자체 README는 자기회귀 모델이 500–2,000ms의 지연과 비결정적 스키마 파싱 오류를 유발하는 지연 시간에 민감한 파이프라인을 대상으로 한다고 명시한다. 그 framing은 그것이 무엇을 위한 것인지 알려준다: 빠르고 결정적이며 통계적으로 보정된 분류. 하지만 그것이 당신의 분류 작업에서 작동할 것인지는 말해주지 않으며, 독립 벤치마크는 누군가 확인했을 때 벌어지는 일이다.

von 자신의 벤치마크를 솔직하게 읽기

jabr v2 결과는 소유자가 직접 공개한 것이며 독립적으로 감사되지 않았고, 벤치마크의 형태는 점수만큼이나 중요합니다. 49개 과제와 869개 사례는 의사결정 모델 평가에 합리적인 범위이며, 71.5%의 매크로 정확도는 395M 인코더에 강한 수치입니다. 도메인별 분석에서 정보가 드러납니다: 증상 트리아지 100.0%, 홈 서비스 95.7%, 도시 라우팅 94.7%, 선택 라우팅 전체 83.4%입니다. 이들은 훈련 코퍼스가 중심으로 구축된 과제들입니다 — README는 파인튜닝 데이터를 운영 및 엔터프라이즈 워크플로, 보안 및 DevOps, 안전 및 정책 모더레이션, 언어학, 트리아지 및 적대적 추론으로 설명합니다. 증상 트리아지에서의 높은 점수는 모델이 분류를 학습했다는 뜻이 아니라 트리아지 도메인을 학습했다는 뜻입니다.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

ViZDoom 결과는 가장 많이 인용되는 결과이며, 꼼꼼히 읽어볼 가치가 있습니다. "Defend the Center"에서 평균 9.38킬, 8개 시드, 구조화된 장면 텍스트로부터 제로샷, 18ms 미만의 지연 시간으로, 약 115ms에서 Jev의 5.62킬과 비교해 — 66.9% 향상입니다. 이는 놀라운 결과이며, 동시에 빠른 반사적 정책이 정확히 알맞은 형태인 구조화된 텍스트 기반 게임 환경이기도 합니다. System One 패러다임 — 반사적, 병렬적, 결정론적, 통계적으로 보정된 — 에 대한 프로젝트의 규정은 그 과제가 보상하는 바를 공정하게 설명한 것입니다.

그런 다음 제3자 평가는 커밋 유형 분류, 파일 라우팅, 기능 감지, 변경 폭 점수 산정에서 von을 실행했고, 그중 일부에서는 키워드 및 정규식 기준선에 패배했습니다. 이진 작업에서 AUC 0.513은 가장 선명한 수치입니다: 동전 던지기, 즉 보정이 T=1.1692로 조정되었고 README에서 거의 이상적인 기대 보정 오차를 주장하는 모델에서 나온 결과입니다. 두 가지 모두 사실일 수 있습니다. 모델은 훈련된 분포에서는 잘 보정될 수 있지만 한 번도 본 적 없는 분포에서는 쓸모없을 수 있습니다 — 실제로 잘못된 분포에서의 좋은 보정은 명백히 나쁜 보정보다 더 나쁩니다, 왜냐하면 신뢰도 숫자가 믿을 만해 보이기 때문입니다.

동일한 테스트를 Laya에 적용했습니다

Laya도 이와 비슷한 평가를 받은 적이 있으며, 그 결과는 von의 결과와 일치한다. TypeSafe의 typed-decisions 벤치마크에서 Laya는 제로샷으로 0.362점을 기록했는데, 이는 무작위의 0.318과 다수 클래스 기준선의 0.461에 맞선 수치다 — 단순한 답보다 우연에 더 가깝다. 자체 모델 카드에는 결론이 이렇게 적혀 있다: "Laya는 특화하기 위한 빠른 기반이지, 제로샷 의사 결정 엔진이 아니다." 대략 스무 개가 넘는 선택지부터는 급격히 성능이 떨어져 Banking77에서 0.425점을 기록했고, Jev는 0.870점이었다. 한 제3자 테스트에서 100개의 Mars-base 긴급 메시지에 대해 Jev는 100/100점, Laya는 53/100점을 받았다. 브라우저 에이전트 벤치마크에서는 50개 작업 중 0개를 완료했고, 33번의 시도에서 완료를 조기에 선언했으며, 그중 17번은 아무 행동도 하기 전이었다 — 다만 벤치마크 저자들은 이것이 내비게이션이 아니라 지원 티켓과 인보이스 같은 판단 작업을 위해 훈련되었다고 지적하는데, 이는 평결이라기보다 범위에 대한 진술이다.

Laya가 von과 다른 점은 자신에 대해 주장하는 내용에 있습니다. Convai는 카드에 좋지 않은 제로샷 수치와 0.466의 기대 캘리브레이션 오차를 공개했으며, 그 옆에는 질문 유형별 temperature 재적합이 만들어내는 0.081을 함께 실었습니다. von의 README는 보기 좋은 jabr v2 수치와 ViZDoom 승리를 공개합니다. 두 프로젝트 모두 자신들이 한 일에 대해 정직합니다. 다만 그중 하나만이 모델이 나쁜 성적을 내는 벤치마크를 앞세웁니다. 이것은 출처에 관한 관찰이지 비난이 아닙니다. 하지만 공개된 증거를 바탕으로 둘 중 하나를 선택한다면, 당신은 자신의 약한 수치를 보여준 프로젝트와 약한 수치를 다른 곳에서 찾아야 했던 프로젝트를 비교하고 있다는 점을 기억하세요.

스펙 대비, 차원별로

• 백본 — Laya: ModernBERT-large 421M 영어, mmBERT-base 322M 다국어. von: ModernBERT-Large 395M.

• 언어 — Laya: 다국어 체크포인트와 라우터를 통해 100개 이상. von: 영어, 공개된 다국어 체크포인트 없음.

• 컨텍스트 윈도우 — Laya: 영어 512 토큰, 다국어 1,024 토큰. von: 동일한 기준으로는 공개되지 않음; jabr v2 사례는 짧은 구조화 결정문이다.

• 지연 시간 — Laya: T4에서 p50 32.8ms, 배치 10에서 질문당 7.2ms. von: 15ms 미만에서 25ms 미만이라고 주장, ViZDoom 실행에서는 18ms 미만.

• 보고된 정확도 — Laya: 0.362 제로샷, 벤치마크 자체 분할에서 파인튜닝한 0.766, Banking77에서 0.425. von: jabr v2의 49개 태스크 전반에 걸쳐 71.5% 매크로, 83.4% 선택 라우팅, 그리고 독립적인 테스트에서 커밋 유형에 대해 26.7%.

• 보정 — Laya: 출시 시 ECE 0.466, 질문 유형별 온도 재적합 후 0.081. von: RLCD 후속 학습 중 온도가 T=1.1692로 조정되었으며, 자체 분포에서 거의 이상적인 ECE를 달성했다고 주장.

• 서빙 — Laya: pip install laya, 그리고 ONNX, Go, Apple MLX 커뮤니티 포팅. von: Python 및 TypeScript SDK, HTTP 서버는 von serve를 통해, 티켓 분류, 이메일 보안, 모데레이션 및 보안 이벤트 분류를 위한 사전 패키징된 프리셋.

• 하드웨어 — Laya: CPU, CUDA 및 Apple MPS. 제공: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS 및 멀티스레드 CPU.

• 라이선스 — 둘 모두 Apache 2.0.

von에서 진짜 독특한 부분

von의 조합 가능한 패턴들은 그 저장소에서 가장 논의가 부족한 부분입니다. 신뢰도 게이팅, 라우트 디스패치, 복합 스코어링, 2단계 라우팅은 프리셋 — 티켓 트리아지, 이메일 보안, 모더레이션, 보안 이벤트 트리아지 — 과 함께 이름 붙은 패턴으로 제공되며, 이들은 의사결정 모델이 실제 프로덕션에서 필요로 하는 아키텍처를 그대로 담고 있습니다. 단일 선택 호출이 전체 시스템인 경우는 드뭅니다. 유용한 형태는 저렴한 1단계 라우터가 특화된 2단계로 디스패치하고, 불확실한 사례를 에스컬레이션하는 신뢰도 게이트를 두는 것입니다. von은 이를 여러분에게 맡겨두지 않고 문서화된 패턴으로 제공합니다.

이는 생성 측면에서 OrcaRouter가 하는 일과 깔끔하게 맞아떨어집니다. 이 패턴의 두 절반은 보통 서로 다른 팀이 만들기 때문에 이 점은 분명히 말해 둘 가치가 있습니다. von도 Laya도 OrcaRouter에서 호스팅되지 않습니다 — 둘 다 직접 다운로드해서 실행하는 가중치이며 — 여기 어떤 내용도 우리가 그것들을 제공한다는 주장으로 읽혀서는 안 됩니다. 우리 목록에 올라 있는 것은 나머지 절반, 즉 하나의 OpenAI 호환 키 뒤에 있는 200개 이상의 생성 모델이며, 공급자 정가는 0% 마크업으로 그대로 전달됩니다, 따라서 공급업체의 가격 인하가 갱신 시점이 아니라 같은 날 바로 청구서에 반영됩니다. von의 신뢰 게이트가 요청의 4%에 프런티어 모델이 필요하다고 판단하면, 라우팅 DSL이 바로 그 결정을 두 개의 계약과 두 개의 SDK 대신 단일 호출로 구성해 주는 것이며, 자동 페일오버는 값비싼 분기가 단일 장애점이 되지 않도록 해 주는 것입니다.

학습 분포를 벗어난 영역에서는 두 모델 모두 실패하는데, 이 둘을 어떻게 해야 할까?

von 평가에서 얻을 수 있는 실질적인 결론은 von이 나쁜 모델이라는 것이 아니다. 그것은 결정 모델의 공개된 정확도가 자신의 학습 분포에 대한 주장이며, 당신의 문제가 그 분포 안에 있는지 알아내는 유일한 방법은 그것을 테스트해 보는 것이라는 점이다. von 자체 README 벤치마크 표는 크기, 정확도, 지연 시간, 호스팅 측면에서 GLiNER2, 파인튜닝된 Qwen3.5 4B, Laya, TypeSafe의 Jev와 자신을 비교한다 — 이는 유용한 표이며, 동시에 하나를 제외한 모든 정확도 항목이 저자 자신의 하네스에서 나온 표이기도 하다.

둘 중에서 고르자면: 더 넓은 공개 도메인 집합, 약간 더 작은 풋프린트, 트리아지와 모더레이션을 위한 사전 구축된 서빙 패턴, 그리고 빠른 구조화 텍스트 결정을 잘 처리한다는 ViZDoom 증거를 원한다면 von을 선택하라. 다국어 입력이 필요하다면 — von에는 다국어 체크포인트가 없고 Laya의 322M mmBERT 변형은 100개 이상 언어를 커버한다 — Laya를 선택하라. 또는 32.8ms T4 수치와 512토큰 영어 윈도가 당신의 워크로드에 맞는다면 Laya를 선택하라. 자체 트래픽에서 수백 개 예시를 라벨링하고 둘 다를 그 예시들에 대해 실행해 보는 오후를 쓰지 않고서는 어느 쪽도 선택하지 마라. 두 프로젝트의 자체 문서 모두 그 실험을 가리키며, von의 서드파티 결과는 바로 아무도 그 실험을 돌리지 않았을 때 벌어지는 일이다.

이 비교를 바꿔 놓을 단 한 가지는 각 모델에 대한 신뢰도 다이어그램과 함께 동일한 입력에서 수행한 짝지은 평가입니다. 그런 것은 존재하지 않습니다. 그것이 존재하기 전까지, 정직한 순위는 점수가 아니라 증거 품질에 따릅니다: Laya는 자신의 최악의 수치를 공개했고, von은 자신의 최고의 수치를 공개했으며, von에 대한 독립 테스트는 둘 중 어느 쪽이든 외부 검증에 가장 가까운 것입니다.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."