
Jev против Kev: дообучение за $95, которое превосходит Jev в работе с тикетами поддержки
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 578 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Джаред Палмер выпустил Kev 20 сентября 2026 года, через пять дней после того, как TypeSafe AI запустила Jev, и важное число находится не в таблице бенчмарков. Оно в README: всё это стоило около $95 за машинное время H100 в Modal плюс три цента за вызовы API Jev, использованные для генерации оценочных данных. Kev распространяется под лицензией Apache-2.0, допускает самостоятельный хостинг и выпускается в трёх размерах, построенных на базовых весах Qwen3.5 — примерно 0,8B, 4B и 9B — и представляет собой замороженную базу с LoRA-адаптером ранга 16 и pointer head, а не модель принятия решений, обученную с нуля. Он в точности повторяет API типизированных решений Jev: Choice, Score и Noul — настолько близко, что совместим с собственным Python SDK TypeSafe. Jev, в свою очередь, был запущен 15 сентября 2026 года как закрытая хостируемая модель System One от TypeSafe AI, возвращает типизированные ответы с калиброванной уверенностью и вообще без текста и никогда не публиковал свою архитектуру, число параметров, вычислительные затраты на обучение или веса. Поэтому это сравнение на самом деле не сравнение моделей. Это проверка того, сколько ценности Jev сохранится, если воспроизвести её за один день по цене подержанного ноутбука.
Что на самом деле показывают бенчмарки

Главное — Kev подбирается близко, и в одной узкой задаче он побеждает. На закрытом тестовом наборе Kev по новым источникам Kev-9B набрал 0.837 против 0.857 у Jev. В маршрутизации обращений в поддержку по 900 тикетам — набор scienthoon — Kev-9B набрал 0.952 против 0.897 у Jev, и это единственный опубликованный результат, где открытое воспроизведение превосходит модель, которую оно воспроизводит. Kev также немного опережает в некоторых задачах по распознаванию логики. На наборах решений SemiF — структурированном наборе из 144 вопросов — Jev побеждает со счётом 0.965 против 0.917 у Kev-9B.
Там, где Kev проигрывает, он проигрывает с треском. Точность вне домена: Kev-8B — 79,6% против 85,7% у Jev. MMLU: 70% против 90%. MMLU-Pro: 0,515 против 0,840. Арифметика дат с точностью до дня: 60% против 93%. Закономерность последовательная — Kev конкурентоспособен в узкой маршрутизации и классификации, где набор меток невелик и домен фиксирован, но разваливается на всём, что требует знаний о мире или многошаговой арифметики, потому что адаптер ранга 16 на замороженной небольшой базовой модели — не то место, где живут знания о мире.
Каждая из этих цифр взята из собственного стенда Kev или из сторонних трекеров, и README от Palmer прямо говорит, что это не контролируемое сравнение — обучающие данные Jev не раскрываются, поэтому построить его невозможно. В README также указано, что ни одни выходные данные Jev не использовались для обучения. Обе эти оговорки из тех, что повышают доверие к цифрам, а не снижают его: именно тот, кто публикует сравнение, сам говорит вам, чего оно не может доказать.
Что вы получаете за 95 долларов, чего не получите от Jev ни за какие деньги

Именно на сравнении стоимости два продукта окончательно перестают быть сопоставимыми. Jev стоит $0,042 за миллион входных токенов, а вывод бесплатен — и это дёшево так, что по-настоящему трудно превзойти в расчёте на один вызов, — но это хостируемый API раннего доступа со списком ожидания, и TypeSafe заявила, что ограничения частоты запросов могут меняться без предупреждения. Kev — это веса, которые вы скачиваете. Предельная стоимость десятимиллионной классификации — это ваше собственное электричество.
Из этого следуют четыре вещи, и ни одна из них не касается результатов бенчмарков.
• Никакие данные не покидают вашу инфраструктуру. Jev — это хостируемый эндпоинт; каждое состояние, которое вы ему отправляете — обращение в поддержку, строка лога, медицинская карта — уходит в TypeSafe. Kev работает на вашем собственном GPU, что для регулируемых рабочих нагрузок — не предпочтение, а решающий фактор.
• Никаких ограничений скорости, никаких листов ожидания, никакого риска устаревания. В собственной документации TypeSafe отмечается, что ограничения скорости могут измениться без предупреждения. У локальной контрольной точки такого условия нет.
• Вы можете дообучить его. Kev — это база для специализации, а LoRA-рецепт, с помощью которого он был создан, открыт. Если в вашей таксономии маршрутизации есть 40 классов, которые ни одна универсальная модель не обрабатывает хорошо, вы можете обучить модель на собственных метках — именно так поступил Palmer, потратив десятки долларов, а не целую ML-команду.
• Потолок контекста — в вашей власти изменить. Задокументированный бюджет запросов Jev составляет примерно 32 000 токенов, а поля Choice ограничены 255 вариантами. Kev наследует окно Qwen3.5, которое гораздо больше, а ограничение на количество вариантов — это деталь реализации вашего собственного стека обслуживания, а не ограничение вендора.
Что у Джева всё ещё есть, чего нет у Кева
Утверждение о калибровке — это то, что не переносится без проблем, и это сердце предложения TypeSafe. Jev обучается методом, который TypeSafe называет RLCD — обучение с подкреплением для калиброванных решений — который оптимизирует честность значения уверенности, а не предпочтительность ответа. Каждый ответ Jev сопровождается распределением вероятностей по вариантам, так что ваш код может задавать пороги: действовать автоматически в верхней зоне, помечать в средней, эскалировать в нижней.
Kev выдаёт ту же типизированную структуру и те же вероятностные выходные данные, потому что API намеренно совместим. Являются ли эти вероятности калиброванными — другой вопрос, и честный ответ таков: никто не опубликовал диаграмму надёжности ни для одной из моделей. Отдельный аудит калибровки сообщил, что Jev показал точность 44,7% при ожидаемой ошибке калибровки 0,325 в задаче приоритизации со скрытой политикой, что говорит о том, что калибровка Jev резко варьируется в зависимости от задачи, а не является универсальным свойством, — и сама TypeSafe советует пользователям проверять пороги уверенности на собственных размеченных примерах, а не доверять опубликованному поведению.
Ещё одна особенность Jev — он не обучался на Qwen3.5. У 9B-модели с адаптером ранга 16 есть потолок знаний, и разрыв в MMLU-Pro — 0,515 против 0,840 — делает этот потолок видимым. Если вашему решению о маршрутизации иногда требуется знать, что это за вещь, более крупная нераскрытая архитектура Jev выполняет работу, которую адаптер Kev выполнить не может.
Задержка и схема развёртывания
Документированная сквозная задержка Jev составляет 70–500 мс против 3–329 секунд для вызовов передовых LLM в собственном сравнении TypeSafe, и добавление вопросов к вызову почти не влияет на неё, потому что каждый вопрос оценивается параллельно на основе одного общего чтения состояния. Kev-9B на H100 будет того же порядка величины для одного прямого прохода, но сравнение не является сравнением яблок с яблоками ни в ту, ни в другую сторону: задержка самостоятельно размещённой 9B-модели на общей GPU под нагрузкой не такая же, как у размещённой конечной точки, а размещённая конечная точка — это не то же самое, что сервер в вашей собственной стойке. Что можно сказать без оговорок, так это то, что оба варианта достаточно быстры для использования на каждом ходу в цикле агента и что задержка Kev зависит от оборудования, которое вы контролируете, а не от обещанного вам уровня обслуживания.
Честный взгляд на репродукцию
Сам факт того, что Kev вообще существует, — это свидетельство о Jev, и это стоит назвать. Закрытая модель, поведение которой можно аппроксимировать за пять дней за $95, силами одного человека, на общедоступных базовых весах, кое-что говорит о том, какую долю её преимущества составляет архитектура, а какую — обучающие данные и сервинг. Из этого не следует, что Jev легко построить — API-поверхность легко скопировать, а калибровку — нет. Но это означает, что конкурентный ров — не интерфейс, и любой, кто оценивает Jev для продакшн-пути, должен закладывать в оценку возможность того, что дообучение открытой базовой модели позволит им пройти большую часть пути за малую долю обязательств.
Что также является аргументом против того, чтобы уже сейчас ставить производственный путь на кого-то из них. Если вы оцениваете Jev, разумная позиция — попробовать его, не связывая себя обязательствами, — а OrcaRouter не предоставляет Jev, потому что модель TypeSafe находится в раннем доступе и использует собственный формат запросов. Что мы покрываем — так это генеративную половину рабочего процесса, внутри которого находятся эти модели принятия решений: 200+ моделей за одним OpenAI-совместимым ключом по прайс-листовой цене провайдера, передаваемой с наценкой 0%, с автоматическим переключением при сбое. Двухмодельная архитектура, в которой дешёвый слой принятия решений сортирует трафик, а генеративная модель обрабатывает остальное, тестируема на нашей стороне без второго контракта с поставщиком, и если компонент принятия решений окажется плохо откалиброванным на ваших данных, путь аварийного переключения — это то, что не даёт этому превратиться в инцидент.
Вердикт
Если ваша задача принятия решений узкая, ограничена фиксированной предметной областью, выполняется в больших объёмах и чувствительна к приватности, Kev сегодня — более оправданный выбор, и с большим отрывом: вы владеете весами, контролируете путь данных, можете дообучать модель на собственной разметке, а в маршрутизации обращений в службу поддержки 9B-чекпоинт уже превосходит Jev по его собственным опубликованным показателям. Если вашей задаче принятия решений нужны знания о мире, многошаговые арифметические вычисления или значение уверенности, которое вы намерены использовать для автоматизации, то более крупная нераскрытая модель Jev и её RLCD-обучение выполняют реальную работу, и адаптер Kev не заменяет ни то, ни другое.
Единственное, чего не решает ни одно из этих сравнений, — это калибровка, потому что никто не опубликовал диаграмму надёжности ни для одной из моделей. Проверьте это на собственных размеченных примерах, прежде чем автоматизировать что-либо на основе любой из них, — значение уверенности — это та часть обоих продуктов, которую приходится заслуживать при каждом внедрении, а скорость — это та часть, которая уже стала рядовым товаром.

