Титульная карточка с надписью «Jev: модель, которая отказывается писать» и подзаголовком «Модель принятия решений TypeSafe AI возвращает типизированные ответы вместо текста», три подписанные карточки для примитивов Choice, Score и Noul, а также блок статистики, показывающий 777 суждений менее чем за 0,7 секунды при $0,042 за миллион входных токенов.
Guides & Insights

Джев отказывается написать хотя бы одно слово: что делает модель принятия решений TypeSafe AI и что пока никто не проверил

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Jev — первая модель от TypeSafe AI, с которой читатель, скорее всего, столкнётся через таблицу цен, а не через окно чата, потому что окна чата нет. Запущенный 15 сентября 2026 года Диогу Алмейдой — соавтором статьи InstructGPT, работы, которая заставила ChatGPT вести себя как ассистент, — Jev вообще не генерирует текст. Он принимает фрагмент состояния (письмо, строку лога, тикет в поддержку, JSON-объект с игровыми координатами) плюс список типизированных вопросов и возвращает типизированные ответы: выбор из предоставленного вами набора, оценку по рубрике или вероятность «да/нет», причём каждый ответ несёт собственное значение уверенности. Ни прозы, ни кода, ни объяснений. Питч TypeSafe состоит в том, что эта узость и есть продукт, потому что она даёт скорость и цену, которых не может достичь генеративная модель, — в 20–200 раз быстрее и в 40–400 раз дешевле, чем «сопоставимые LLM», согласно собственным материалам компании к запуску, при $0,042 за миллион входных токенов и нулевой плате за выход.

Самое полезное число, опубликованное в первые 48 часов, — не из их числа. Оно взято из Every, где руководитель отдела оценок прогнал Jev по 27 опубликованным статьям Every и ещё 10 аналогам в стиле ИИ, задав 21 вопрос по всем 37 документам сразу: 777 оценок менее чем за 0,7 секунды и примерно за четверть цента. Второй тест, проведённый генеральным директором Every, прогнал 12 синтетических фрагментов — шесть чистых, шесть с намеренно внесёнными дефектами — через четыре проверки письма. Jev показал медианное время 0,35 секунды на фрагмент против 8,83 секунды у Claude Fable 5.1 при высоком уровне усилий: примерно в 25 раз быстрее и примерно в 580 раз дешевле. Он обнаружил шесть из семи внесённых дефектов. Claude Fable 5.1 обнаружил все семь. Вердикт Every был «хорошо, но не идеально», и это честная оценка Jev в одну строку по единственному независимому тесту, опубликованному кем-либо на данный момент, — утверждения о скорости и стоимости выдерживают проверку третьей стороной, утверждение о точности находится на ступеньку ниже фронтира, а выборка достаточно мала, чтобы никто не делал по ней выводов для продакшена.

Несколько замечаний о том, с какими доказательствами работает этот материал, потому что уровни доказательств для настолько новой модели необычно далеки друг от друга. Jev реален и доступен для вызова: есть документированный эндпоинт, Python SDK, алиас модели и опубликованная цена. Запуск анонсирован вендором, а не утёк, и никто не гадает, существует ли он. Но все заявления о производительности, которые TypeSafe выдвигает на первый план, — собственные данные TypeSafe, архитектура не опубликована, веса не выпущены, а панель бенчмарков, стоящая за заголовком о 20-200x, представляет собой набор внутренних оценок рабочих процессов, а не публичный лидерборд. Одна сторонняя организация его протестировала. В этой статье данные вендора, независимые данные и открытые вопросы явно разделены, а не усреднены в консенсус, которого не существует.

Что TypeSafe на самом деле выпустила

Jev — первая среди моделей, которые TypeSafe называет System One; название взято из быстрой, интуитивной половины познания, описанной Даниэлем Канеманом, в отличие от более медленного, рассудительного режима, который имитируют чат-боты. TypeSafe противопоставляет это стандартной схеме, при которой генератор текста принуждают выдавать структурированный вывод, а затем парсят этот текст обратно во что-то, чему может доверять код. Jev полностью пропускает текст. В собственной документации TypeSafe об этом говорится без обиняков: «Большие языковые модели (LLM) предназначены для создания текста, который читают люди. Когда вам нужно, чтобы модель вынесла суждение, которое будет использовать ваш код, возникает несоответствие».

Поверхность вывода состоит из трёх примитивов, и больше ничего нет. Каждый вопрос, который вы задаёте, должен быть одним из них:

• Выбор — выберите один вариант из предоставляемого вами списка, возвращая выбранный вариант, а также вероятность для каждого кандидата и уверенность. Число вариантов ограничено 255 на поле; свыше этого TypeSafe описывает двухэтапную схему: независимая оценка кандидатов, а затем выбор.

• Оценка — поместить состояние на упорядоченную рубрику, возвращая уровень, вероятность для каждого уровня и уверенность. Риск оттока по шкале от 0 до 1 — это пример в документации.

• Noul — словослияние «no» и «null» — единичное утверждение «да/нет», возвращающее калиброванную вероятность его истинности.

A capture of TypeSafe's own documentation introduction page, showing the sentence 'Jev is TypeSafe's flagship model and the first System One model', a table of the three primitives Choice, Score and Noul with what each returns, and the line that adding questions to a call barely changes the response time.

Интересное свойство — не какой-то отдельный примитив, а то, как они сочетаются. Все три можно смешать в одном вызове API, и каждый вопрос оценивается параллельно на основе одного общего чтения одного и того же состояния. В документации TypeSafe говорится, что добавление вопросов «почти не меняет время отклика», и независимый тест подтверждает это на практике — 21 вопрос по 37 документам уложился в те же 0,7 секунды. Именно поэтому цена за одно суждение резко падает: вы платите не за более длинную генерацию, а за один проход.

Практические рамки, согласно документации и сообщениям первых пользователей: примерно 32 000 токенов бюджета запроса, описанного в документации TypeSafe как примерно 150 000 английских символов; на момент запуска нет ввода изображений или аудио; а формат запроса и ответа не соответствует конвенции OpenAI chat-completions, поэтому для обращения к нему нужен специальный клиент, а не просто замена base-URL. Доступ — это лист ожидания раннего доступа плюс браузерная песочница, с code>jev-latest/code> в качестве псевдонима модели.

RLCD означает «калиброванный», а не «предпочтительный».

TypeSafe обучает Jev с помощью метода, который называет RLCD — обучение с подкреплением для калиброванных решений, согласно собственной документации компании. Аббревиатура настолько новая, что в ранних публикациях её расшифровывали непоследовательно, поэтому стоит точно установить, что именно она обозначает, ведь это различие и составляет суть исследовательского утверждения.

RLHF оптимизируется под предпочтения человека. RLVR — под проверяемую корректность, ту, где тест-кейс проходит. RLCD — под калибровку: модель, которая говорит, что уверена на 70%, должна быть права примерно в 70% случаев. Это другая цель, нежели быть правым, и именно поэтому каждый ответ Jev поставляется с приложенным распределением вероятностей, а не просто с ответом. Предполагаемый режим отказа — модель, которая знает, когда она не знает, чтобы ваш код мог решить, что с этим делать.

На практике это даёт вам поверхность управления. Документированный шаблон — это три диапазона уверенности: действовать автоматически в верхнем, помечать или подтверждать в среднем, передавать человеку в нижнем, — при этом пороги находятся в вашем коде, а не в модели. Являются ли эти диапазоны честными — эмпирический вопрос о ваших данных, и именно на него TypeSafe явно предлагает вам ответить самостоятельно, отмечая, что пороги уверенности зависят от конкретного сценария использования и должны проверяться на ваших собственных размеченных примерах. Эта инструкция — самое важное предложение в документации и причина, по которой существует следующий раздел.

Числа, отсортированные по тому, кто их создал.

Именно здесь большинство материалов о Jev теряют строгость, поэтому стоит прямо указать происхождение сведений. Вот что исходит от вендора, что получено от независимого тестировщика, а что просто неизвестно.

• Заявленные поставщиком, невоспроизведённые — ключевые заявления о скорости и стоимости. Сквозная задержка 70–500 мс против 3–329 секунд для вызовов передовых LLM; в 20–200 раз быстрее и в 40–400 раз дешевле; единственный результат рабочего процесса для лучшего случая, заявленный как в 193,6 раза быстрее и в 444,6 раза дешевле. TypeSafe признаёт, что это показатели для лучшего случая, а не универсальные цифры.

• Заявлено поставщиком, и это можно проверить в прайс-листе — $0,042 за миллион входных токенов, то есть $42 за миллиард, при этом вывод бесплатен. Причина бесплатности вывода — механическая, а не промо-акционная: нет авторегрессионного декодирования, которое нужно было бы учитывать, поэтому нет выходных токенов, за которые нужно выставлять счёт. Для сравнения: в тех же материалах запуска типичная цена ввода передовых моделей указана на уровне от $0,20 до $10 за миллион, а вывод часто примерно в пять раз дороже ввода.

По данным вендора, на основе внутреннего бенчмарка — собственного дашборда рабочих процессов TypeSafe: 711 кейсов по четырём задачам, причём эталонные ответы получены из усреднённого суждения GPT-6 Astra и Claude Fable 5.1, а не из эталонной разметки. На этом дашборде Jev показывает совокупный результат 67,8% против 74,1% у лучшего из сравниваемых. В разбивке: инциденты безопасности — 61,7% против 66,2% у Opus 5; наблюдаемость трассировок агентов — 71,6% против 76,6%; обработка счетов — 61,8% против 79,1%; обслуживание клиентов — 76,0% против 78,3%. Jev выигрывает в столбцах стоимости и задержки на этом графике и проигрывает в столбце точности. Сам дашборд отмечает возможную предвзятость тестового стенда, а TypeSafe заявила, что намеренно пропустила публичные таблицы лидеров в пользу единичных оценок, привязанных к обновлениям продукта.

• Независимо измеренная, небольшая выборка — описанные выше тесты Every: 777 оценок менее чем за 0,7 секунды примерно за четверть цента; 1 709 оценок в 11 экспериментах в сумме менее чем за цент; примерно в 25 раз быстрее и в 580 раз дешевле, чем Claude Fable 5.1, при выполнении задачи классификации по 12 отрывкам, при этом пропустив один из семи заложенных дефектов, который обнаружил компаратор. Сам Every пришёл к выводу, что перед запуском в производство хотел бы провести гораздо более тщательную проверку точности.

• Неизвестно — архитектура. На момент запуска нет статьи, нет числа параметров, нет раскрытия вычислительных ресурсов, затраченных на обучение, нет весов. TypeSafe заявила, что детали пока держат в тайне, а статья, возможно, появится позже.

A single-column scoreboard titled 'Jev - the scoreboard' listing six dimensions: latency 70-500 ms claimed, price $0.042 per million input with output free, accuracy 67.8% on the vendor dashboard, independent test 6 of 7 defects caught, context about 32K tokens with no image input, and weights not released.

Закономерность по этим уровням остаётся неизменной, и это не та закономерность, на которую намекает заголовок про 200x. Все независимые и вендорские показатели сходятся в том, что Jev радикально дешевле и радикально быстрее. Ни один показатель нигде, включая собственные показатели TypeSafe, не показывает, что он точнее передовых моделей, с которыми его сравнивают по цене. На собственном дашборде вендора он оказывается примерно на уровне хорошей модели среднего уровня. Сравнение, которое выдерживает проверку, — это не «так же умён, как передовая модель, за сотую часть цены», а «близко по качеству суждений к модели среднего уровня, за долю цента на вызов, и достаточно быстро, чтобы работать на каждом отдельном ходу».

Что означает «нулевая галлюцинация», а что — нет

В материалах запуска TypeSafe есть график, показывающий 0% ошибок при вызове инструментов у Jev на фоне ненулевого показателя у моделей для сравнения, а вместе с моделью идёт фраза «устойчива к галлюцинациям». И то, и другое верно, и оба утверждения уже, чем кажутся при чтении.

Гарантия — структурная. Каждый возможный ответ перечисляется до запуска модели — вы предоставили список вариантов, критерии оценки или утверждение «истина/ложь», — так что нет пространства, в котором можно выдать значение вне объявленного типа. Некорректно сформированный вызов инструмента — не то, что Jev способен породить. Это подлинное инженерное свойство, и для всякого, кто потратил неделю на написание логики повторных попыток при сбоях разбора JSON, оно стоит настоящих денег.

Это не утверждение о правильности. Ответ, валидный по схеме, всё ещё может быть неверным: Jev может уверенно направить жалобу на выставление счетов в техническую очередь, и результат будет безупречно оформлен, оставаясь бесполезным. Алмейда и сам говорил то же самое, признавая, что можно уверенно ошибаться. Полезный способ совместить оба факта состоит в том, что Jev устраняет класс ошибок, возникающих из-за форматирования вывода, и совершенно ничего не делает с классом ошибок, возникающих из-за суждения. А значит, вопрос точности — это целиком вопрос калибровки, и калибровка — это именно то, что вам нужно измерять самостоятельно.

Как проверить утверждение о калибровке на ваших собственных данных

Калибровка — одно из немногих свойств модели, которое можно как следует проверить на нескольких сотнях примеров и без ML-инфраструктуры, и это единственный тест, который имеет значение, прежде чем Jev коснётся production-пути. Процедура коротка.

Возьмите несколько сотен случаев, для которых у вас уже есть метки. Задайте Jev вопрос, который имеет значение — решение о маршрутизации, оценку риска, проверку на дефекты — и сгруппируйте ответы по уровню уверенности, который он сообщил. Затем проверьте, права ли корзина с уверенностью 0.9 примерно в 90% случаев, корзина 0.7 — примерно в 70%, и так далее. Хорошо откалиброванная модель выстраивает диагональную линию. Модель, которая лишь уверена в себе, группирует всё выше 0.9 и оказывается права в 70% случаев, и именно эта форма тихо ломает автоматический конвейер.

Тот же тест подсказывает, какие пороги использовать. Если бакет 0.9 действительно даёт 90% точности на ваших данных, его можно автоматизировать. Если ваш средний диапазон — это каша, вы направляете его человеку или передаёте генеративной модели и позволяете дорогому пути разбираться с неоднозначностью. Это разделение — дешёвая модель на уверенном большинстве, дорогая модель на неопределённом остатке — и есть та самая архитектура, за которую выступает Jev, и именно поэтому модель лучше всего понимать как компонент, а не как замену.

Сколько это стоит: подробный расчёт

Ценообразование достаточно простое для осмысления, что редкость. Ввод стоит $0,042 за миллион токенов. Вывод бесплатен. При задокументированном бюджете запроса примерно в 150 000 символов один вызов максимального размера стоит значительно меньше цента.

Две приведённые цифры дают представление о масштабе. Один из первых пользователей выполнил около 5 000 запросов примерно за $2. Демонстрация Doom — где Jev управлял ботом, используя текстовое описание состояния игры, а не необработанные пиксели, — работала примерно на 10 вызовах в секунду и стоила около $7 в час. А 777 оценок Every по 37 документам обошлись примерно в четверть цента — и именно эта цифра делает интересный сценарий использования наглядным: при такой цене проверка каждого отдельного шага агентного цикла перестаёт быть решением о затратах и становится нормой по умолчанию.

Вот в чём настоящий аргумент в пользу Jev. Проверочный проход на каждом ходу — противоречил ли этот вызов инструмента предыдущему, согласуется ли этот вывод с заявленным намерением пользователя, не должно ли это поднять флаг — всегда был технически возможен с передовой моделью и экономически абсурден в масштабе. При $0,042 за миллион токенов и без платы за вывод тот же проход становится доступным на каждом ходу. Ценность здесь не в том, что Jev думает лучше передовой модели, потому что это не так. Ценность в том, что он думает достаточно дёшево и быстро, чтобы к нему обращались постоянно.

Стоит сказать прямо, потому что это очевидный следующий вопрос: OrcaRouter не обслуживает Jev. Модель TypeSafe находится в раннем доступе, с листом ожидания, и использует собственный формат запросов, поэтому любой, кто её тестирует, обращается напрямую к TypeSafe. А вот где слой маршрутизации действительно уместен — так это в другой половине рабочего процесса. Паттерн, для которого создан Jev, — это две модели, а не одна: Jev принимает типизированное решение, а генеративная модель отвечает за ту часть, где нужен текст, код или объяснение. Именно эту генеративную половину и покрывает OrcaRouter: 197 моделей от 15 провайдеровза одним ключом, совместимым с OpenAI, по прайсовой цене провайдера, передаваемой без наценки — 0%, так что снижение цены вендором отражается на нашей стороне в тот же день, когда оно вступает в силу. Обе половины рабочего процесса в стиле Jev можно протестировать без второго контракта, а когда компонент принятия решений ещё не проверен, именно путь отказоустойчивости не даёт плохому результату калибровки превратиться в производственный инцидент.

A capture of the OrcaRouter models catalogue showing the header '197 models - 15 providers - one API key, one bill', an OpenAI-compatible chat-completions request example, and model cards for DeepSeek V4.1 Flash, OpenAI GPT-6 Astra and Google Gemini 3.8 Flash with their per-million-token input and output prices.

Где Jev не подходит

Ограничения на удивление чётко сформулированы производителем, что делает этот раздел простым для честного изложения. Jev не может генерировать свободный текст. Он не может писать код. Он не может поддерживать разговор. У него нет чат-интерфейса, нет ввода изображений, а бюджет контекста составляет около 32 000 токенов — на порядок меньше, чем у моделей с длинным контекстом, с которыми его сравнивают по цене. Поля выбора ограничены 255 вариантами. А свойство «отсутствие галлюцинаций», как указано выше, относится к формату вывода, а не к истинности.

Сеть подходит для довольно узкого круга задач. Хорошо: классификация и маршрутизация больших объёмов, проходы по защитным ограничениям и верификации, решения с критичной задержкой, параллельная оценка больших наборов документов, а также там, где правильный ответ действительно является выбором, числом на шкале или булевым значением. Плохо: открытая генерация любого рода, рассуждения с длинным контекстом, многоходовой диалог или любая задача, правильный ответ на которую — предложение. Если ваша задача не сводится к типизированному вопросу, Jev — не более дешёвый способ её решить; это вообще не способ её решить.

Есть и справедливая критика этой подачи, которую стоит учитывать в дальнейшем. Называть Jev фронтирной моделью — значит заимствовать кредит доверия, которого модель не заслужила: она не умеет ни программировать, ни вести беседу, ни написать предложение, а сравнительные графики опираются на фронтирные модели как на базовый уровень, тогда как столбец точности рассказывает другую историю. Более обоснованное утверждение — и именно его в действительности подтверждают доказательства — состоит в том, что TypeSafe далеко продвинула фронтир скорости и стоимости для структурированных решений. Это существенное достижение. Но это не то же самое, что создать модель, соперничающую с GPT-6 Astra или Claude Fable 5.1.

Что изменило бы эту картину?

Три вещи, примерно в порядке их значимости.

• Опубликованная статья об архитектуре или открытые веса. Всё, что касается того, как Jev достигает своей скорости, в настоящее время является чёрным ящиком, а утверждение о том, что механизмом является параллельное вычисление — аналогия, которую проводит Алмейда, заключается в замене последовательных вычислений так же, как трансформеры заменили рекуррентные сети — является утверждением, а не продемонстрированным результатом. Пока дизайн не опубликован, скорость — это факт, а объяснение — маркетинг.

• Вторая независимая оценка на большей выборке. Тесты Every — самые сильные из имеющихся доказательств, и они охватывают 12 фрагментов по решающему вопросу точности. Ещё один независимый прогон на нескольких сотнях размеченных случаев позволил бы установить, был ли пропуск одного дефекта из семи шумом или реальной частотой ошибок.

• Аудит калибровки на реалистичных, грязных входных данных. Всё, что было опубликовано до сих пор, использует чистые тестовые стенды. Открытый вопрос для модели, вся ценность которой зиждется на заслуживающих доверия оценках уверенности, заключается в том, как эти оценки ведут себя на по-настоящему неоднозначных случаях — тех, где заколебался бы и человек-проверяющий. Именно это число определяет, безопасно ли строить автоматизацию на Jev, и никто его не публиковал.

А до тех пор разумная позиция — конкретная, а не общая. Jev — это реальная, уже выпущенная, необычно дешёвая модель с настоящим структурным преимуществом в надёжности вывода, профилем точности примерно среднего уровня и заявлением о калибровке, которое правдоподобно, явно рекомендуется её собственным поставщиком для самотестирования и независимо подтверждено лишь на небольшой выборке. Если в вашем рабочем процессе есть шаг, который сводится к вопросу, набираемому вручную и задаваемому достаточно часто, чтобы использование передовой модели было расточительным, это один из самых дешёвых способов задать его — и именно значение уверенности, которое она возвращает, нужно проверить, прежде чем доверять, а не скорость.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно