Сгенерированная титульная карточка для сравнения Laya и von, содержащая собственный подзаголовок этой статьи и строку нижнего колонтитула с указанием, чьи показатели предоставлены вендором, а чьи — третьей стороной.
Engineering & Research

Laya против von: когда бенчмарк вендора не переносится

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Задача классификации типов коммитов с шестью возможными метками, где угадывание даёт 8,3%, а von набирает 26,7%. Задача маршрутизации файлов, где та же модель набирает 8,8% — едва выше случайного уровня. Бинарная задача по широте изменений с AUC 0,513, что соответствует подбрасыванию монеты. Эти цифры взяты из сторонней оценки von — открытой модели System One от wfzyx, 395M-энкодера ModernBERT-Large, выпущенного под лицензией Apache 2.0 18 сентября 2026 года, в тот же день, что и Laya от Convai Innovations. На собственном бенчмарке von jabr v2 картина обратная: 71,5% макроточности на 49 задачах и 869 кейсах, маршрутизация выбора — 83,4%, а результат ViZDoom — 9,38 убийств в среднем при менее 18 мс против Jev от TypeSafe AI с 5,62 убийствами и примерно 115 мс. Оба набора чисел реальны. Разрыв между ними — самое полезное, что кто-либо публиковал об этой категории моделей, и он применим также к Laya.

Две модели, два бэкбона, один общий режим отказа

von и Laya архитектурно — близкие соседи, поэтому задача переноса служит подходящей линзой для их сравнения. Оба — неавторегрессионные энкодеры, построенные на ModernBERT: von — с 395 млн параметров, английский чекпоинт Laya — с 421 млн. Оба предоставляют одни и те же три примитива — choice из предоставленного списка, score по упорядоченной рубрике, noul как калиброванную вероятность «да» — и оба реализуют /v1/systemone формат передачи, так что клиент, написанный для Jev от TypeSafe, может вместо этого указать на локальный сервер. Оба распространяются под лицензией Apache 2.0. Оба возвращают вероятности, а не текст, и ни у одного нет цикла декодирования, в котором можно было бы галлюцинировать.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

Различия — в обучающей истории. von был предварительно обучен на 2 триллионах токенов общего веб-текста, технической литературы и кода, затем дообучен на сбалансированном многодомейном корпусе примерно из 290 000 примеров, охватывающем операционные и корпоративные рабочие процессы, безопасность и DevOps, безопасность и модерацию политик, лингвистику, триаж и состязательные рассуждения. На этапе постобучения использовалось обучение с подкреплением с калибровочным распределением (Reinforcement Learning with Calibration Distribution), минимизировавшее композит из кросс-энтропии и показателя Брайера с лямбдой 0,5, а температурное масштабирование сошлось при T=1,1692. Английский чекпоинт Laya — это ModernBERT-large, дообученный под форму типизированного решения, с окном в 512 токенов, наряду с многоязычным чекпоинтом mmBERT-base на 322 млн параметров, покрывающим более 100 языков за маршрутизатором, и опубликованным показателем 32,8 мс p50 на одно решение на Tesla T4.

Общий режим отказа заключается в том, что оба являются энкодерами, обученными выдавать результат, а не рассуждать. В собственном README von прямо сказано, что он нацелен на конвейеры, чувствительные к задержке, где авторегрессионные модели вносят 500–2 000 мс задержки и ошибки недетерминированного разбора схемы. Эта формулировка говорит о том, для чего он предназначен: быстрая, детерминированная, статистически калиброванная классификация. Она не говорит о том, что он сработает на вашей классификации, а независимый бенчмарк — это то, что происходит, когда кто-то это проверяет.

Честно читая собственный бенчмарк von

Результаты jabr v2 опубликованы владельцем и не проходили независимый аудит, и структура бенчмарка значит не меньше, чем оценка. Сорок девять задач и 869 случаев — разумный охват для оценки модели принятия решений, а 71,5% макроточности — сильный показатель для энкодера на 395M. Информативной картина становится при разбивке по доменам: триаж симптомов — 100,0%, бытовые услуги — 95,7%, городская маршрутизация — 94,7%, маршрутизация выбора в целом — 83,4%. Именно вокруг этих задач строился обучающий корпус — в README данные для тонкой настройки описаны как операционные и корпоративные рабочие процессы, безопасность и DevOps, безопасность и модерация политик, лингвистика, триаж и состязательные рассуждения. Высокий результат по триажу симптомов — это утверждение о том, что модель освоила домен триажа, а не о том, что она научилась классифицировать.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

Результат ViZDoom — тот, который цитируют чаще всего, и он заслуживает внимательного прочтения. В среднем 9,38 убийства в «Defend the Center», восемь сидов, zero-shot из структурированного текста сцены, при задержке менее 18 мс, против 5,62 убийства, показанных Jev примерно при 115 мс — улучшение на +66,9%. Это впечатляющий результат, и в то же время это игровая среда, управляемая структурированным текстом, где быстрая рефлекторная политика — именно та форма, которая нужна. То, как проект описывает парадигму System One — рефлекторную, параллельную, детерминированную, статистически калиброванную, — является справедливым описанием того, что вознаграждает эта задача.

Затем сторонняя оценка прогнала von на классификации типов коммитов, маршрутизации файлов, обнаружении признаков и оценке широты изменений, и по некоторым из них он проиграл базовым методам на ключевых словах и регулярных выражениях. AUC 0,513 на бинарной задаче — самая показательная цифра: подбрасывание монеты, у модели, калибровка которой была настроена на T=1,1692 и чей README заявляет почти идеальную ожидаемую ошибку калибровки. Оба утверждения могут быть верны. Модель может быть хорошо откалибрована на распределении, на котором её обучали, и бесполезна на распределении, которого она никогда не видела, — и более того, хорошая калибровка на неправильном распределении хуже, чем явно плохая калибровка, потому что показатели уверенности выглядят заслуживающими доверия.

Тот же тест, применённый к Laya

Laya тоже прошла через версию этой процедуры, и результаты согласуются с результатами von. В бенчмарке TypeSafe для типизированных решений Laya набирает 0.362 в режиме zero-shot против 0.318 для случайного выбора и 0.461 для базовой линии с мажоритарным классом — ближе к случайному угадыванию, чем к тривиальному ответу. В её собственной карточке модели указан вывод: «Laya — быстрая база для специализации, а не zero-shot-движок принятия решений». После примерно двадцати вариантов она резко деградирует, набирая 0.425 на Banking77 против 0.870 у Jev. В одном стороннем тесте на 100 сообщениях о срочности Mars-base Jev набрал 100/100, а Laya — 53/100. В бенчмарке для браузерных агентов она выполнила 0 из 50 задач, преждевременно заявив о завершении в 33 попытках, 17 из которых — до совершения каких-либо действий, — хотя авторы бенчмарка отмечают, что она обучалась для работы, требующей суждений, такой как обработка заявок в поддержку и счетов, а не для навигации; это заявление об области применения, а не вердикт.

Laya отличается от von тем, что она заявляет о себе. Convai опубликовала неприглядный zero-shot показатель и ожидаемую ошибку калибровки 0,466 на карточке — рядом с 0,081, который даёт повторная подгонка температуры для каждого типа вопросов. В README проекта von опубликованы лестный показатель jabr v2 и победа в ViZDoom. Оба проекта честны в том, что они сделали; только один из них начинает с бенчмарка, где модель показывает плохие результаты. Это наблюдение об источниках, а не обвинение — но если вы выбираете между ними на основе опубликованных данных, учтите, что вы сравниваете проект, который показал вам свой слабый показатель, с тем, чей слабый показатель вам пришлось искать в другом месте.

Сопоставление спецификаций, измерение за измерением

• Бэкбон — Laya: ModernBERT-large 421M английский, mmBERT-base 322M многоязычный. от: ModernBERT-Large 395M.

• Языки — Laya: 100+ благодаря многоязычному чекпойнту и маршрутизатору. von: английский, без опубликованного многоязычного чекпойнта.

• Контекстное окно — Laya: 512 токенов для английского, 1 024 для многоязычного. von: не публикуется в тех же терминах; кейсы jabr v2 — это короткие структурированные решения.

• Задержка — Laya: 32,8 мс p50 на T4, 7,2 мс на вопрос при размере батча 10. von: заявлено от менее 15 мс до менее 25 мс, менее 18 мс в прогоне ViZDoom.

• Заявленная точность — Laya: 0,362 zero-shot, 0,766 после дообучения на собственном сплите бенчмарка, 0,425 на Banking77. von: 71,5% макро по 49 задачам jabr v2, 83,4% при маршрутизации выбора и 26,7% по типу коммита в независимом тесте.

• Калибровка — Laya: ECE 0,466 при выпуске, 0,081 после перенастройки температуры по типам вопросов. von: температура масштабирована до T=1,1692 во время постобучения RLCD, заявлено почти идеальное ECE на собственном распределении.

• Сервинг — Laya: pip install laya, а также ONNX, Go и порты сообщества Apple MLX. von: SDK для Python и TypeScript, HTTP-сервер через von serve, готовые пресеты для триажа тикетов, безопасности электронной почты, модерации и триажа событий безопасности.

• Аппаратное обеспечение — Laya: CPU, CUDA и Apple MPS. от: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS и многопоточный CPU.

• Лицензия — Apache 2.0 для обоих.

Та часть фон, которая действительно самобытна.

Композируемые паттерны von — самая недообсуждаемая вещь в его репозитории. Гейтинг по уверенности, диспетчеризация маршрутов, композитный скоринг и двухэтапная маршрутизация поставляются как именованные паттерны наряду с пресетами — триаж тикетов, защита электронной почты, модерация, триаж событий безопасности — и они кодируют архитектуру, которая действительно нужна решающей модели в продакшене. Один choice вызов редко представляет собой всю систему; полезная форма — это дешёвый маршрутизатор первого этапа, который направляет запросы к специализированному второму этапу, с порогом уверенности, который эскалирует неопределённые случаи. von поставляет это как документированный паттерн, а не оставляет на вас.

Это напрямую соотносится с тем, что OrcaRouter делает на генеративной стороне, и об этом стоит сказать прямо, потому что две половины этой схемы обычно создаются разными командами. Ни von, ни Laya не размещены на OrcaRouter — и то, и другое — это веса, которые вы скачиваете и запускаете, — и ничто здесь не должно восприниматься как утверждение, что мы их обслуживаем. В нашем списке находится другая половина: более 200 генеративных моделей за одним ключом, совместимым с OpenAI, по прайс-листовой цене провайдера, передаваемой с 0% наценки, так что снижение цены поставщиком отражается в вашем счёте в тот же день, а не при продлении. Если порог уверенности von определяет, что 4% запросов требуют фронтирной модели, именно DSL маршрутизации объединяет это решение в один вызов вместо двух контрактов и двух SDK, а автоматическое переключение при отказе не даёт дорогой ветке стать единой точкой отказа.

Что делать с двумя моделями, которые обе не справляются за пределами своего обучающего распределения

Практический вывод из оценки von не в том, что von — плохая модель. Он в том, что опубликованная точность модели принятия решений — это утверждение о её обучающем распределении, и единственный способ узнать, входит ли ваша задача в это распределение, — проверить это. Собственная таблица бенчмарков в README von сравнивает её с GLiNER2, дообученной Qwen3.5 4B, Laya и Jev от TypeSafe по размеру, точности, задержке и хостингу — это полезная таблица, а также таблица, в которой все показатели точности, кроме одного, взяты из собственного стенда автора.

Из двух: берите von, если вам нужен более широкий набор опубликованных доменов, немного меньший объём, готовые схемы обслуживания для триажа и модерации, а также подтверждение на ViZDoom того, что он хорошо справляется с быстрыми решениями по структурированному тексту. Берите Laya, если вам нужен многоязычный ввод — у von нет многоязычного чекпоинта, а вариант Laya на 322M mmBERT покрывает более 100 языков — или если показатель 32,8 мс на T4 и английское окно в 512 токенов подходят для вашей рабочей нагрузки. Не берите ни один, не потратив полдня на разметку нескольких сотен примеров из собственного трафика и прогон обоих на них. Документация обоих проектов сама указывает на этот эксперимент, а сторонний результат von — это то, что получается, когда никто его не проводит.

Единственное, что могло бы изменить это сравнение, — это парная оценка на идентичных входных данных с диаграммой надёжности для каждой модели. Её не существует. Пока её нет, честное ранжирование — по качеству доказательств, а не по баллам: Laya опубликовала свой худший показатель, von — свой лучший, а независимый тест von — это самое близкое к внешней проверке, что есть у любого из них.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."