
Laya против von: когда бенчмарк вендора не переносится
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Задача классификации типов коммитов с шестью возможными метками, где угадывание даёт 8,3%, а von набирает 26,7%. Задача маршрутизации файлов, где та же модель набирает 8,8% — едва выше случайного уровня. Бинарная задача по широте изменений с AUC 0,513, что соответствует подбрасыванию монеты. Эти цифры взяты из сторонней оценки von — открытой модели System One от wfzyx, 395M-энкодера ModernBERT-Large, выпущенного под лицензией Apache 2.0 18 сентября 2026 года, в тот же день, что и Laya от Convai Innovations. На собственном бенчмарке von jabr v2 картина обратная: 71,5% макроточности на 49 задачах и 869 кейсах, маршрутизация выбора — 83,4%, а результат ViZDoom — 9,38 убийств в среднем при менее 18 мс против Jev от TypeSafe AI с 5,62 убийствами и примерно 115 мс. Оба набора чисел реальны. Разрыв между ними — самое полезное, что кто-либо публиковал об этой категории моделей, и он применим также к Laya.
Две модели, два бэкбона, один общий режим отказа
von и Laya архитектурно — близкие соседи, поэтому задача переноса служит подходящей линзой для их сравнения. Оба — неавторегрессионные энкодеры, построенные на ModernBERT: von — с 395 млн параметров, английский чекпоинт Laya — с 421 млн. Оба предоставляют одни и те же три примитива — choice из предоставленного списка, score по упорядоченной рубрике, noul как калиброванную вероятность «да» — и оба реализуют /v1/systemone формат передачи, так что клиент, написанный для Jev от TypeSafe, может вместо этого указать на локальный сервер. Оба распространяются под лицензией Apache 2.0. Оба возвращают вероятности, а не текст, и ни у одного нет цикла декодирования, в котором можно было бы галлюцинировать.

Различия — в обучающей истории. von был предварительно обучен на 2 триллионах токенов общего веб-текста, технической литературы и кода, затем дообучен на сбалансированном многодомейном корпусе примерно из 290 000 примеров, охватывающем операционные и корпоративные рабочие процессы, безопасность и DevOps, безопасность и модерацию политик, лингвистику, триаж и состязательные рассуждения. На этапе постобучения использовалось обучение с подкреплением с калибровочным распределением (Reinforcement Learning with Calibration Distribution), минимизировавшее композит из кросс-энтропии и показателя Брайера с лямбдой 0,5, а температурное масштабирование сошлось при T=1,1692. Английский чекпоинт Laya — это ModernBERT-large, дообученный под форму типизированного решения, с окном в 512 токенов, наряду с многоязычным чекпоинтом mmBERT-base на 322 млн параметров, покрывающим более 100 языков за маршрутизатором, и опубликованным показателем 32,8 мс p50 на одно решение на Tesla T4.
Общий режим отказа заключается в том, что оба являются энкодерами, обученными выдавать результат, а не рассуждать. В собственном README von прямо сказано, что он нацелен на конвейеры, чувствительные к задержке, где авторегрессионные модели вносят 500–2 000 мс задержки и ошибки недетерминированного разбора схемы. Эта формулировка говорит о том, для чего он предназначен: быстрая, детерминированная, статистически калиброванная классификация. Она не говорит о том, что он сработает на вашей классификации, а независимый бенчмарк — это то, что происходит, когда кто-то это проверяет.
Честно читая собственный бенчмарк von
Результаты jabr v2 опубликованы владельцем и не проходили независимый аудит, и структура бенчмарка значит не меньше, чем оценка. Сорок девять задач и 869 случаев — разумный охват для оценки модели принятия решений, а 71,5% макроточности — сильный показатель для энкодера на 395M. Информативной картина становится при разбивке по доменам: триаж симптомов — 100,0%, бытовые услуги — 95,7%, городская маршрутизация — 94,7%, маршрутизация выбора в целом — 83,4%. Именно вокруг этих задач строился обучающий корпус — в README данные для тонкой настройки описаны как операционные и корпоративные рабочие процессы, безопасность и DevOps, безопасность и модерация политик, лингвистика, триаж и состязательные рассуждения. Высокий результат по триажу симптомов — это утверждение о том, что модель освоила домен триажа, а не о том, что она научилась классифицировать.

Результат ViZDoom — тот, который цитируют чаще всего, и он заслуживает внимательного прочтения. В среднем 9,38 убийства в «Defend the Center», восемь сидов, zero-shot из структурированного текста сцены, при задержке менее 18 мс, против 5,62 убийства, показанных Jev примерно при 115 мс — улучшение на +66,9%. Это впечатляющий результат, и в то же время это игровая среда, управляемая структурированным текстом, где быстрая рефлекторная политика — именно та форма, которая нужна. То, как проект описывает парадигму System One — рефлекторную, параллельную, детерминированную, статистически калиброванную, — является справедливым описанием того, что вознаграждает эта задача.
Затем сторонняя оценка прогнала von на классификации типов коммитов, маршрутизации файлов, обнаружении признаков и оценке широты изменений, и по некоторым из них он проиграл базовым методам на ключевых словах и регулярных выражениях. AUC 0,513 на бинарной задаче — самая показательная цифра: подбрасывание монеты, у модели, калибровка которой была настроена на T=1,1692 и чей README заявляет почти идеальную ожидаемую ошибку калибровки. Оба утверждения могут быть верны. Модель может быть хорошо откалибрована на распределении, на котором её обучали, и бесполезна на распределении, которого она никогда не видела, — и более того, хорошая калибровка на неправильном распределении хуже, чем явно плохая калибровка, потому что показатели уверенности выглядят заслуживающими доверия.
Тот же тест, применённый к Laya
Laya тоже прошла через версию этой процедуры, и результаты согласуются с результатами von. В бенчмарке TypeSafe для типизированных решений Laya набирает 0.362 в режиме zero-shot против 0.318 для случайного выбора и 0.461 для базовой линии с мажоритарным классом — ближе к случайному угадыванию, чем к тривиальному ответу. В её собственной карточке модели указан вывод: «Laya — быстрая база для специализации, а не zero-shot-движок принятия решений». После примерно двадцати вариантов она резко деградирует, набирая 0.425 на Banking77 против 0.870 у Jev. В одном стороннем тесте на 100 сообщениях о срочности Mars-base Jev набрал 100/100, а Laya — 53/100. В бенчмарке для браузерных агентов она выполнила 0 из 50 задач, преждевременно заявив о завершении в 33 попытках, 17 из которых — до совершения каких-либо действий, — хотя авторы бенчмарка отмечают, что она обучалась для работы, требующей суждений, такой как обработка заявок в поддержку и счетов, а не для навигации; это заявление об области применения, а не вердикт.
Laya отличается от von тем, что она заявляет о себе. Convai опубликовала неприглядный zero-shot показатель и ожидаемую ошибку калибровки 0,466 на карточке — рядом с 0,081, который даёт повторная подгонка температуры для каждого типа вопросов. В README проекта von опубликованы лестный показатель jabr v2 и победа в ViZDoom. Оба проекта честны в том, что они сделали; только один из них начинает с бенчмарка, где модель показывает плохие результаты. Это наблюдение об источниках, а не обвинение — но если вы выбираете между ними на основе опубликованных данных, учтите, что вы сравниваете проект, который показал вам свой слабый показатель, с тем, чей слабый показатель вам пришлось искать в другом месте.
Сопоставление спецификаций, измерение за измерением
• Бэкбон — Laya: ModernBERT-large 421M английский, mmBERT-base 322M многоязычный. от: ModernBERT-Large 395M.
• Языки — Laya: 100+ благодаря многоязычному чекпойнту и маршрутизатору. von: английский, без опубликованного многоязычного чекпойнта.
• Контекстное окно — Laya: 512 токенов для английского, 1 024 для многоязычного. von: не публикуется в тех же терминах; кейсы jabr v2 — это короткие структурированные решения.
• Задержка — Laya: 32,8 мс p50 на T4, 7,2 мс на вопрос при размере батча 10. von: заявлено от менее 15 мс до менее 25 мс, менее 18 мс в прогоне ViZDoom.
• Заявленная точность — Laya: 0,362 zero-shot, 0,766 после дообучения на собственном сплите бенчмарка, 0,425 на Banking77. von: 71,5% макро по 49 задачам jabr v2, 83,4% при маршрутизации выбора и 26,7% по типу коммита в независимом тесте.
• Калибровка — Laya: ECE 0,466 при выпуске, 0,081 после перенастройки температуры по типам вопросов. von: температура масштабирована до T=1,1692 во время постобучения RLCD, заявлено почти идеальное ECE на собственном распределении.
• Сервинг — Laya: pip install laya, а также ONNX, Go и порты сообщества Apple MLX. von: SDK для Python и TypeScript, HTTP-сервер через von serve, готовые пресеты для триажа тикетов, безопасности электронной почты, модерации и триажа событий безопасности.
• Аппаратное обеспечение — Laya: CPU, CUDA и Apple MPS. от: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS и многопоточный CPU.
• Лицензия — Apache 2.0 для обоих.
Та часть фон, которая действительно самобытна.
Композируемые паттерны von — самая недообсуждаемая вещь в его репозитории. Гейтинг по уверенности, диспетчеризация маршрутов, композитный скоринг и двухэтапная маршрутизация поставляются как именованные паттерны наряду с пресетами — триаж тикетов, защита электронной почты, модерация, триаж событий безопасности — и они кодируют архитектуру, которая действительно нужна решающей модели в продакшене. Один choice вызов редко представляет собой всю систему; полезная форма — это дешёвый маршрутизатор первого этапа, который направляет запросы к специализированному второму этапу, с порогом уверенности, который эскалирует неопределённые случаи. von поставляет это как документированный паттерн, а не оставляет на вас.
Это напрямую соотносится с тем, что OrcaRouter делает на генеративной стороне, и об этом стоит сказать прямо, потому что две половины этой схемы обычно создаются разными командами. Ни von, ни Laya не размещены на OrcaRouter — и то, и другое — это веса, которые вы скачиваете и запускаете, — и ничто здесь не должно восприниматься как утверждение, что мы их обслуживаем. В нашем списке находится другая половина: более 200 генеративных моделей за одним ключом, совместимым с OpenAI, по прайс-листовой цене провайдера, передаваемой с 0% наценки, так что снижение цены поставщиком отражается в вашем счёте в тот же день, а не при продлении. Если порог уверенности von определяет, что 4% запросов требуют фронтирной модели, именно DSL маршрутизации объединяет это решение в один вызов вместо двух контрактов и двух SDK, а автоматическое переключение при отказе не даёт дорогой ветке стать единой точкой отказа.
Что делать с двумя моделями, которые обе не справляются за пределами своего обучающего распределения
Практический вывод из оценки von не в том, что von — плохая модель. Он в том, что опубликованная точность модели принятия решений — это утверждение о её обучающем распределении, и единственный способ узнать, входит ли ваша задача в это распределение, — проверить это. Собственная таблица бенчмарков в README von сравнивает её с GLiNER2, дообученной Qwen3.5 4B, Laya и Jev от TypeSafe по размеру, точности, задержке и хостингу — это полезная таблица, а также таблица, в которой все показатели точности, кроме одного, взяты из собственного стенда автора.
Из двух: берите von, если вам нужен более широкий набор опубликованных доменов, немного меньший объём, готовые схемы обслуживания для триажа и модерации, а также подтверждение на ViZDoom того, что он хорошо справляется с быстрыми решениями по структурированному тексту. Берите Laya, если вам нужен многоязычный ввод — у von нет многоязычного чекпоинта, а вариант Laya на 322M mmBERT покрывает более 100 языков — или если показатель 32,8 мс на T4 и английское окно в 512 токенов подходят для вашей рабочей нагрузки. Не берите ни один, не потратив полдня на разметку нескольких сотен примеров из собственного трафика и прогон обоих на них. Документация обоих проектов сама указывает на этот эксперимент, а сторонний результат von — это то, что получается, когда никто его не проводит.
Единственное, что могло бы изменить это сравнение, — это парная оценка на идентичных входных данных с диаграммой надёжности для каждой модели. Её не существует. Пока её нет, честное ранжирование — по качеству доказательств, а не по баллам: Laya опубликовала свой худший показатель, von — свой лучший, а независимый тест von — это самое близкое к внешней проверке, что есть у любого из них.

