
Laya против Kev: два рецепта для локальной модели принятия решений
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
Самое полезное число в сравнении Laya и Kev — это чек. Джаред Палмер обучил семейство Kev примерно за $95 на вычислениях H100 на Modal, плюс около трёх центов на вызовы API для данных оценки, и опубликовал рецепт вместе с весами. Convai Innovations пошла другим путём с Laya: выпущена 18 сентября 2026 года, через три дня после Jev от TypeSafe AI, Apache 2.0, веса на Hugging Face, а именно pip install laya — точка входа, и никакого пайплайна обучения — английский чекпоинт ModernBERT-large на 421M, многоязычный mmBERT-base на 322M и роутер, который выбирает между ними. Kev — это семейство из трёх небольших моделей на 0.8B, 4B и 9B, каждая — замороженная база плюс LoRA-адаптер ранга 16 и небольшая указательная головка. Обе отвечают на типизированные вопросы за один прямой проход, и ни одна не генерирует текст. Выбор между ними — это на самом деле выбор того, каким артефактом вы хотите владеть: чекпоинтом или рецептом.
Что каждый проект на самом деле выпускает
Laya поставляет инференс. Английский чекпоинт — это двунаправленный энкодер с окном в 512 токенов; многоязычный охватывает более 100 языков с окном в 1 024 токена и работает примерно вдвое быстрее; роутер определяет письменность менее чем за половину миллисекунды. Он отвечает на choice, score и noul — выбор из списка, ожидаемый уровень по упорядоченной рубрике и калиброванную вероятность того, что утверждение истинно. Есть и третий чекпоинт, laya-typed-decisions — тот же бэкбон на 421M, дообученный на обучающей части бенчмарка typed-decisions. В карточке модели от самого Convai есть фраза, которая должна определять, как вы читаете каждое число Laya: «Laya — это быстрая база для специализации, а не движок решений в режиме zero-shot».


Kev выпускает метод. В репозитории документируется decision-v7: две эпохи на 10 000 примерах, взятых из десяти публичных наборов данных, 896 сгенерированных примерах политики и 1 680 примерах, построенных на основе 60 сгенерированных структур правил. Голова оценивает каждый предоставленный вариант по отношению к decide токену вопроса и применяет softmax к результату. Поскольку контрольные точки Qwen3.5 сочетают внимание с рекуррентными слоями Gated DeltaNet, которые игнорируют маски внимания, каждый вопрос выполняется как отдельная строка, а общее состояние вычисляется один раз и кэшируется — именно так модель изолирует вопросы друг от друга, не платя за новый предзаполнение для каждого вопроса. Kev повторяет публичный контракт TypeSafe /v1/systemone, поэтому существующий клиент TypeSafe SDK может указывать на локальный сервер Kev, изменив базовый URL. В README указано, что при обучении не использовались никакие выходные данные Jev.
Эти два режима отказа различаются, и в этом вся суть.
Обе модели проигрывают Jev в задачах, требующих знаний, но проигрывают так, что это требует разных мер.
Опубликованные слабые места Laya связаны с формой входных данных. На бенчмарке typed-decisions от TypeSafe она набирает 0,362 в режиме zero-shot против 0,318 при случайном угадывании и 0,461 у базовой линии по мажоритарному классу — это ближе к случайности, чем к тривиальному ответу. После примерно двадцати вариантов она разваливается: 0,425 на Banking77 против 0,870 у Jev. Она настолько чувствительна к порядку, что простое изменение порядка вариантов снизило точность на 13,75 пункта в одном стороннем тесте, оставив долю одинаковых ответов на уровне 42,5 %. А поставляемые чекпойнты идут с недопустимыми температурами — библиотека выдаёт предупреждение при импорте, а значит, указанный в карточке модели показатель калибровки, ожидаемая ошибка калибровки 0,466, — это то число, которое вы фактически получаете до повторной подгонки. Повторная подгонка для каждого типа вопросов снижает этот показатель до 0,081, но это работа, которую выполняете вы, а не та, которую выполняет загрузка. Есть опубликованный пример многоязычного провала, который стоит прочитать целиком: на нелатинских письменностях английский чекпойнт катастрофически переуверен, причём пример с кхмерским показывает точность 0,000 при средней уверенности 0,952.
Опубликованные слабые места Kev касаются знаний и арифметики. Kev-9B набирает 0.837 на своём собственном закрытом тесте на новых источниках — 0.832 у версии 4B и 0.668 у 0.8B — и около 0.822 вне домена на dev-сплите против 0.857 у Jev. Разрыв открывается там, где требуются знания о мире: MMLU около 70% против 90% у Jev, MMLU-Pro 0.515 против 0.840, а арифметика дат с точностью до дня — 60% против 93%. На узком наборе маршрутизации с фиксированными метками он выигрывает — оценка маршрутизации обращений в поддержку дала Kev-9B 0.952 против 0.897 у Jev — но автор прямо оговаривает, что это его собственный стенд, что обучающие данные Jev не раскрыты и что никакое контролируемое сравнение поэтому построить нельзя. Kev также остаётся излишне самоуверенным на новых источниках; установка KEV_TEMPERATURE=2.0 сократила уверенные ошибки с 8.7% до 4.4% в собственных тестах проекта, что говорит о том, что значение по умолчанию — не безопасная настройка.
Практический вывод: сбой Laya вызывается вашим набором опций и форматированием промпта, и вы исправляете его тонкой настройкой и повторной подгонкой. Сбой Kev вызывается вопросами, требующими фактов, и вы исправляете его, ограничивая область применения модели маршрутизацией и классификацией и вынося зависящие от знаний вызовы в другое место. Ни одно из этих исправлений не является флагом конфигурации.
Что нужно, чтобы служить им
• Оборудование — Laya: кодировщики 421M/322M, реалистично на CPU при низкой пропускной способности и менее гигабайта резидентной памяти для порта MLX на Apple silicon. Kev: от 0,8B до 9B, для 9B нужен GPU CUDA с BF16, а архитектура Qwen3.5 требует flash-linear-attention на CUDA и ROCm.
• Задержка — Laya: 32,8 мс p50 на одно решение на Tesla T4, 7,2 мс на вопрос при размере батча 10. Kev: около 300 мс на пять введённых вопросов от 4B-модели на Mac с 32 ГБ в bf16, примерно 40 мс на H100.
• Потолки — Laya: 512-токенное английское окно, 1 024 для многоязычных. Kev: выбор из 1–255 вариантов, оценка по 2–255 уровням, 384 токена состояния обучения, при обслуживании — 8 192.
• Сервер — Laya: Python в том же процессе, плюс community-порты для ONNX, Go и Apple MLX. Kev: локальный сервер, привязанный к 127.0.0.1, без аутентификации, npm SDK и адаптеры LangChain и LlamaIndex.
• Лицензия — Apache 2.0 для обоих.
Две операционные заметки, не отражённые в основных цифрах. Сервер Kev по замыслу обрабатывает только один запрос за раз и не требует аутентификации — это локальный сайдкар, а не то, что вы выставляете наружу. А задержка Kev на Mac существенно хуже, чем на H100, потому что быстрых ядер DeltaNet для MLX пока не существует, — и это как раз та деталь, которая превращает утверждение «работает локально» в утверждение «работает локально на подходящем оборудовании».
Генеративная половина паттерна
Обе эти модели существуют, чтобы заменить один конкретный вызов: обращение к LLM, которое вы делали исключительно для получения метки или вероятности. Они не заменяют вызовы, где вам действительно нужен связный текст. Системе поддержки, использующей Kev-9B для маршрутизации тикета, всё ещё нужна модель, чтобы суммировать ветку и подготовить черновик ответа, и эта модель не будет 9B LoRA с головой-указателем.
Вот тот стык, в котором находится OrcaRouter, а не заявление о хостинге любого из них. Ни Laya, ни Kev нет в нашем списке моделей — это веса, которые вы скачиваете, — и статья вводила бы в заблуждение, если бы подразумевала обратное. Что действительно есть в списке — это более 200 генеративных моделей, доступных через один ключ, совместимый с OpenAI, по прайс-листовой цене провайдера, передаваемой с нулевой наценкой. Если вы используете Kev, чтобы решить, к какому из трёх уровней суммаризации относится запрос, или Laya, чтобы оценить, приемлем ли черновой ответ, генеративная сторона обоих циклов — это одна конечная точка с автоматическим переключением при сбое вместо второго контракта и второго SDK. DSL маршрутизации — это та часть, которая наиболее естественно вписывается в архитектуру с моделью принятия решений: объедините дешёвую и дорогую модели в один вызов и позвольте выходу модели принятия решений выбрать ветвь.
Что посмотреть дальше
Пробел в доказательствах одинаков для обоих, и ни один из проектов его не закроет. Никто не запускал Laya и Kev на байт-идентичных входных данных с одними и теми же промптами, одинаковым порядком вариантов и одинаковым перебором порогов уверенности. Громкие победы Laya получены на её собственном стенде; заявления Kev о почти паритете исходят из стенда его автора; аудит калибровки, который обнаружил, что калибровка Jev резко варьируется в зависимости от задачи — 44,7% точности и 0,325 ожидаемой ошибки калибровки на задаче приоритизации со скрытой политикой, — был проведён третьей стороной, и ни Laya, ни Kev не проходили такой проверки. Пока кто-нибудь этого не сделает, приведённые выше числа — лучшее из доступного, и они не сопоставимы друг с другом.
Если вы принимаете решение сегодня: выбирайте Kev, если вам нужна работающая модель маршрутизации уже на этой неделе на GPU, который вы уже арендуете, и смиритесь с тем, что она не будет знать некоторых вещей. Выбирайте Laya, если ваши входные данные многоязычны или ваш бюджет на оборудование ограничивается ноутбуком, и закладывайте дообучение в бюджет как часть проекта, а не как более позднюю оптимизацию. В любом случае оценивайте качество на собственных размеченных данных, прежде чем ставить порог уверенности перед продакшен-трафиком — оба проекта в своей документации советуют вам это сделать.

