Сгенерированная титульная карточка с надписью «Jev vs Laya» над подзаголовком «33 миллисекунды на T4 и случайный бейзлайн», в которой Jev (закрытый, хостируемый zero-shot-движок принятия решений, 0,727) противопоставляется Laya (Apache 2.0, 421M ModernBERT, работает локально, 0,362 zero-shot).
Engineering & Research

Jev против Laya: 33 миллисекунды на T4 и случайный базовый уровень

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В карточке модели Laya есть предложение, которое решает исход этого сравнения, и написали его люди, создавшие Laya. «Laya — это быстрая основа для специализации, а не движок решений для zero-shot». Convai Innovations выпустила Laya 18 сентября 2026 года — через три дня после того, как TypeSafe AI запустила Jev, — под лицензией Apache 2.0, с весами на Hugging Face и pip install laya в качестве точки входа. Она отвечает на типизированные вопросы за один прямой проход, без декодирования токен за токеном, — та же архитектурная ставка, что и у Jev. Главное заявление — задержка p50 в 32,8 миллисекунды на одно решение на Tesla T4, что подаётся как примерно в 7,8 раза быстрее опубликованных у Jev 236–276 мс p50 через его хостируемый API. Заявление правдиво, но при этом сравниваются две разные вещи — локальный GPU против сетевого вызова, — и картина точности под ним — это то, что должно определять, стоит ли его скачивать. В режиме zero-shot Laya набирает 0,362 в бенчмарке типизированных решений от TypeSafe. Случайное угадывание даёт 0,318. Базовая модель по мажоритарному классу набирает 0,461. Laya «из коробки» ближе к случайному угадыванию, чем к тривиальному базовому уровню.

Что такое Laya на самом деле

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

Laya поставляется в виде двух контрольных точек за встроенным маршрутизатором, который направляет каждый вход к нужной из них. Английская контрольная точка — это ModernBERT-large с 421 млн параметров и контекстом в 512 токенов. Многоязычный вариант — mmBERT-base с 322 млн параметров и окном в 1 024 токена для более чем 100 языков. Оба неавторегрессионны: один прямой проход возвращает ответ, поэтому нет цикла декодирования, нет JSON для разбора и нет места, в котором можно было бы выдать текст вне объявленного типа. Это последнее свойство — та же структурная гарантия, которую предлагает Jev, только достигнутая с другой стороны, и она по-настоящему ценна для всех, кто писал логику повторных попыток вокруг модели, которая иногда забывает закрыть фигурную скобку.

Jev — закрытый аналог: первая модель System One от TypeSafe AI, выпущенная 15 сентября 2026 года, доступная на хостинге и в режиме раннего доступа, с тремя типизированными примитивами — Choice: выбор из предоставляемого вами списка, Score: оценка по упорядоченной рубрике и Noul: утверждение «да/нет» с калиброванной вероятностью. Все вопросы оцениваются параллельно на основе одного общего считывания состояния; вывод бесплатен, поскольку выходных токенов нет, а ввод стоит $0,042 за миллион токенов. Его архитектура, число параметров и вычислительные затраты на обучение не раскрываются, и TypeSafe заявила, что детали держат в секрете, а статья, возможно, появится позже.

Утверждение о задержке, измеренное должным образом

Показатель Laya в 32,8 мс p50 на T4 — это реальное число, и хорошее. Сравнение с 236–276 мс у Jev, дающее 7,8-кратную разницу, — вот где нужна осторожность, и собственная карточка Laya на удивление честно объясняет, почему: цифры Jev — это опубликованные сторонние данные, которые Convai никогда не измеряла самостоятельно, и это сравнение противопоставляет локальный прямой проход на GPU вызову API на хостинге, который включает сетевой обмен и ожидание в очереди. Если убрать сеть, архитектурное сравнение — это сравнение двух однопроходных моделей: одна с 421 млн параметров, а другая — с нераскрытым размером, который TypeSafe никогда не публиковала.

Есть ещё одно число, связанное с батчингом, которое стоит знать: при батче из десяти Laya сообщает о 7,2 мс на вопрос. Такова суть продукта. Laya создана для локального запуска при больших объёмах, а порты от сообщества для запуска на устройстве, такие как laya-mlx, распространяют это на Apple Silicon. Вирусные заявления «в 50 раз быстрее, чем Jev» не подтверждаются собственными опубликованными бенчмарками проекта, и честная формулировка такова: это большой разрыв между локальным и облачным выполнением, который отчасти обусловлен архитектурой, а отчасти — просто разницей между вашим GPU и чьим-то чужим API.

Что говорят показатели точности, по порядку

Именно здесь сравнение перестаёт быть лестным, и это стоит изложить по порядку, потому что порядок имеет значение.

• Zero-shot на бенчмарке typed-decisions от TypeSafe — Laya 0.362, случайный выбор 0.318, класс большинства 0.461, Jev 0.727. Laya выше случайного угадывания и ниже тривиального базового уровня.

• Дообучена на собственном обучающем сплите бенчмарка — Laya 0.766 против Jev 0.727. Laya побеждает, и эта победа исходит от чекпоинта, который видел обучающие данные бенчмарка, что делает это утверждением о дообучении, а не о базовой модели.

• Классификация интентов Banking77, где набор вариантов большой, — Laya 0.425 против 0.870 у Jev. Laya резко деградирует после примерно 20 вариантов, а поля Choice в Jev, согласно документации, обрабатывают до 255, прежде чем потребуется двухэтапный шаблон оценки.

• Калибровка — Laya поставляется со средней ожидаемой ошибкой калибровки 0,466, которая улучшается до 0,081 только после перенастройки температуры для каждого типа вопросов. Jev обучен методом, который TypeSafe называет RLCD, Reinforcement Learning for Calibrated Decisions, и выдаёт каждый ответ с распределением вероятностей — хотя TypeSafe также советует пользователям проверять пороги на собственных размеченных данных, а один независимый аудит обнаружил, что калибровка Jev резко варьируется в зависимости от задачи.

Закономерность однозначна. Laya — это сильная база для дообучения и слабый движок принятия решений в режиме zero-shot, и она сама об этом говорит. Jev — это сильный движок принятия решений в режиме zero-shot, калибровку которого всё ещё нужно проверять при каждом развёртывании. Это разные продукты с разными ценовыми структурами, и выбор между ними — это в основном вопрос о том, есть ли у вас размеченные данные и цикл обучения.

Арифметика затрат не той же формы, что у Джева.

Jev стоит $0,042 за миллион входных токенов, при этом вывод бесплатный, что составляет $42 за миллиард, а вызов максимального размера при задокументированном бюджете запроса ~32 000 токенов обходится значительно меньше цента. Независимый тест Every провёл 777 оценок по 37 документам примерно за четверть цента.

Стоимость одного вызова Laya на пределе равна нулю, а в совокупности — нет, и совокупные затраты немаленькие. Модель на 421 млн параметров на T4 дешева в запуске и всё равно требует GPU, а этап дообучения, который делает Laya конкурентоспособной, — именно там сосредоточены основные расходы: разметка данных, запуск обучения, стенд для оценки и повторная подгонка температуры для каждого типа вопросов, которая снижает её ошибку калибровки с 0,466 до 0,081. Для фиксированной таксономии, которая никогда не меняется, это разовая затрата, окупающаяся при больших объёмах. Для таксономии, которая дрейфует, это повторяющаяся затрата, и базовая линия Jev в режиме zero-shot с показателем 0,727 становится гораздо более выгодным решением.

Есть третья стоимость, которую легко упустить: английский чекпоинт Laya имеет контекстное окно в 512 токенов. Это не модель принятия решений с небольшим бюджетом контекста — это модель принятия решений, рассчитанная на один абзац. Бюджет запроса Jev примерно в 32 000 токенов в шестьдесят раз больше, и даже он на порядок ниже, чем у генеративных моделей, с которыми обе сравниваются по цене. Если ваше состояние — это ветка поддержки, а не сообщение поддержки, то окно ни одной из моделей не является ограничением, против которого вам следует оптимизировать.

Вопрос развёртывания — вот в чём настоящая разница.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

Самый сильный аргумент Laya — не латентность. А то, что веса под лицензией Apache 2.0 на Hugging Face означают: решение никогда не покидает вашу инфраструктуру, а у конечной точки никогда не бывает лимита частоты запросов. Когда решение о маршрутизации принимается на основе медицинской карты, юридического документа или истории счёта клиента, это не предпочтение — это решающий фактор, и никакая хостируемая конечная точка ни за какую цену не выиграет этот спор. Jev от TypeSafe доступен в режиме раннего доступа и по списку ожидания, а в его собственной документации отмечается, что лимиты частоты запросов могут меняться без предупреждения.

Контраргумент в том, чем вы жертвуете. Неразглашённая более крупная архитектура Jev выполняет ту работу, которую не в силах выполнить 421 млн параметров Laya: разрыв в zero-shot 0,727 против 0,362 и разрыв на Banking77 0,870 против 0,425 — оба являются показателями того, сколько знаний заключено в модели до её обучения. Ответ Laya таков: вы сами предоставляете эти знания через файн-тюнинг, и на узком фиксированном домене этот ответ работает — результат 0,766 после файн-тюнинга служит доказательством.

Где слой принятия решений находится в реальном стеке

Ни одна из моделей не генерирует текст, поэтому ни одна из них не составляет весь рабочий процесс целиком. Шаблон, для которого обе они предназначены, — это две модели: слой принятия решений, выполняющий типизированный вызов, и генеративная модель, отвечающая за часть, где нужны текст, код или объяснение. OrcaRouter не обслуживает Jev и Laya — Jev это endpoint раннего доступа от TypeSafe, а Laya — это веса, которые вы запускаете сами, — но генеративная половина этого шаблона — как раз то, что мы покрываем: 200+ моделей за одним ключом, совместимым с OpenAI, поцене из прайс-листа провайдера, транслируемой с наценкой 0%, так что изменение цены у вендора становится актуальным на нашей стороне в тот же день. Двухмодельную архитектуру можно протестировать без второго контракта с вендором, а благодаря автоматическому переключению при сбое генеративный путь не становится единой точкой отказа, пока вы решаете, достаточно ли хорошо откалиброван дешёвый слой принятия решений, чтобы автоматизировать на его основе.

Вердикт

Если у вас фиксированная, узкая таксономия, размеченные примеры и требование к приватности или задержке, исключающее использование внешнего API, выбор в пользу Laya легче обосновать, и метрики дообученной модели это подтверждают. Если вам нужно, чтобы решение работало из коробки, если ваши наборы вариантов переваливают за двадцать категорий или если состояние длиннее абзаца, собственная карточка модели Laya говорит, что это не тот продукт для такой задачи, — а оценка zero-shot 0,362 против мажоритарного бейзлайна 0,461 — это число, которое стоит держать в виду, когда кто-то приводит вам показатель задержки 7,8x.

То, что у этих двух общего, полезнее того, что их разделяет. Оба устраняют класс ошибок, возникающих из-за форматирования вывода, и ничего не делают с классом ошибок, проистекающих из суждения. Оба выдают вероятности, и ни у одного из них нет опубликованной диаграммы надёжности, которой можно доверять без проверки. Проверьте калибровку на собственных размеченных случаях, прежде чем автоматизировать работу на основе любого из них, — задержка уже стала товаром широкого потребления, а значение уверенности — это то, что нужно заслужить при каждом развёртывании.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."