
Jev против DeepSeek V4.1 Flash: восемь центов за тысячу — это не защитный барьер
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Сравнение, которое решает вопрос о Jev, — не с фронтирной моделью. Оно — с DeepSeek V4.1 Flash, выпущенной 10 сентября 2026 года, за пять дней до того, как TypeSafe AI выпустила Jev, потому что DeepSeek V4.1 Flash — это генеративная модель, которая по-настоящему дешева, и это самое дешёвое в комнате, что способно делать почти всё, что умеет Jev. Независимый тест, опубликованный в сентябре 2026 года, прогнал 77 примеров из BANKING77, стандартного набора для классификации интентов, через обе: Jev показал 7 центов за 1000 классификаций при точности 75%. DeepSeek V4.1 Flash — 8 центов за 1000 при точности 79%. Тот же тест поставил GPT-5.6 Luna на 12 центов и 83%. Генеративная модель с контекстным окном в один миллион токенов, нативным вызовом инструментов и вводом изображений отстала на один цент за тысячу классификаций от специализированной модели принятия решений — и на четыре пункта опередила её по точности. Это тот неудобный факт, который лежит в центре этого противостояния и заставляет переосмыслить, что на самом деле продаёт Jev.
Что делает каждая модель

Jev — это модель принятия решений System One: она вообще не возвращает текст. Вы отправляете состояние и типизированные вопросы — Choice из предоставляемого вами списка, Score по упорядоченной рубрике или Noul (утверждение «да/нет» с калиброванной вероятностью) — а она возвращает типизированные ответы со значениями уверенности. Все вопросы оцениваются параллельно на основе одного общего чтения состояния — поэтому добавление вопросов почти не меняет время ответа и поэтому вывод ничего не стоит: нет выходных токенов, подлежащих тарификации. Ввод стоит $0,042 за миллион токенов, вывод бесплатен, а бюджет запроса — примерно 32 000 токенов. Она была запущена 15 сентября 2026 года компанией TypeSafe AI, основанной Диогу Алмейдой при поддержке посевного раунда на $40 млн во главе с DCVC.
DeepSeek V4.1 Flash — это обычная генеративная модель, и она не делает вид, что это не так. Она была выпущена 10 сентября 2026 года с идентификатором API deepseek-flash, созданная как смесь экспертов с 552 млрд параметров, с асимметричной активацией 8B/16B, контекстным окном в 1 млн токенов и вводом текста и изображений. Она генерирует текст токен за токеном, и именно это свойство делает её дороже за вызов и мощнее за вызов. Она работает со скоростью 208,3 токена в секунду при времени до первого токена 1,13 секунды, а цена составляет $0,30/$1,20 за миллион токенов в часы пик и $0,15/$0,60 вне пика. В Artificial Analysis она занимает индекс 40 — средний уровень, а не фронтир.
Почему математика по каждой классификации даёт именно такой результат
Разница в один цент — не случайность, и она не стабильна. Она проистекает из того, как каждая модель тарифицирует.
• Стоимость одного решения Jev по сути фиксирована — вы платите за один проход по входным данным, $0,042 за миллион токенов, и количество задаваемых вами вопросов почти не влияет на неё. Классификация, которой нужна одна метка, и классификация, которой нужны двадцать меток, стоят почти одинаково.
• Стоимость одного решения DeepSeek V4.1 Flash зависит от объёма вывода. Классификация в короткую метку обходится дёшево; та же задача, где вы запрашиваете обоснование, оценку уверенности и структурированный JSON-конверт, требует в несколько раз больше выходных токенов и, соответственно, стоит в несколько раз дороже.
• Пиковый тариф по сравнению с непиковым удваивает входную цену DeepSeek и удваивает цену вывода. Запустите пакетное задание классификации не в тот час — и разница в один цент превратится в совершенно другое число.
Вот почему независимые оценки разрыва так сильно расходятся. В тесте BANKING77 на 77 примерах получилось 7¢ против 8¢. Другой составной бенчмарк, JevBench, оценил Jev в $0,041 за 1000 и DeepSeek V4.1 Flash в $0,579 за 1000 — четырнадцатикратный разрыв. Третий тест на 83 контактах по продажам показал DeepSeek V4.1 Flash на уровне $0,183 за прогон против $0,0055 у Jev — 33-кратный разрыв. Причина, по которой эти числа различаются на два порядка, в том, что в каждом случае предполагались другой промпт, другая форма вывода и другое время суток. Любой, кто приводит одну цифру в расчёте на классификацию так, будто это свойство модели, а не тестового стенда, что-то продаёт.
Что структура Jev даёт вам такого, чего не может дать генеративная модель
Отличие не в цене. Оно в контракте. Вывод Jev жёстко зафиксирован схемой: поскольку каждый возможный ответ перечисляется до запуска модели — вы предоставили список вариантов, рубрику или утверждение «истина/ложь», — не остаётся места, чтобы выдать значение вне объявленного типа. Некорректный ответ Jev породить не может. DeepSeek V4.1 Flash можно ограничить структурированным выводом с помощью схемы, и на практике он в основном соблюдает это, но гарантия здесь — скорее сильный априор, чем структурное свойство. Если ваш пайплайн выполняет десять миллионов классификаций в месяц, «в основном» и «всегда» — это разные пункты в отчёте об инциденте.
Второе свойство — калибровка. Jev обучается методом, который TypeSafe называет RLCD — обучение с подкреплением для калиброванных решений — и каждый ответ несёт распределение вероятностей, так что ваш код может задавать пороги: автоматически принимать выше, помечать в середине, эскалировать ниже. DeepSeek V4.1 Flash выдаст число уверенности, если вы его попросите, но это сгенерированный токен, а не калиброванный вывод, и сгенерированная уверенность — это утверждение о самом себе, а не измерение. Именно это различие и есть вся причина платить за модель принятия решений, и это единственное, что дешёвая генеративная модель структурно не может обеспечить.
Третий — характер задержки. Задокументированная сквозная задержка Jev составляет 70–500 мс независимо от того, сколько вопросов прикреплено, против 3–329 секунд для вызовов передовых LLM в собственном сравнении TypeSafe. Время до первого токена (TTFT) в 1,13 секунды и пропускная способность 208 токенов/с у DeepSeek V4.1 Flash превосходны для генеративной модели, и именно по этому стандарту его и следует оценивать, — но при паре сотен миллисекунд сгенерированного вывода плюс задержка до первого токена это секунды на одно решение, а не доли секунды. На внутренней панели рабочих процессов TypeSafe Jev выигрывает в столбцах стоимости и задержки и проигрывает в столбце точности: 61,8% против 79,1% при обработке счетов и 76,0% против 78,3% в обслуживании клиентов. Эталонные ответы на панели — это усреднённые суждения моделей, а не наземная истина, и сама панель отмечает возможную предвзятость тестового стенда.
Разрыв контекста реален и однонаправлен.
Один аспект здесь не близок и не является вопросом подачи. DeepSeek V4.1 Flash несёт контекстное окно на один миллион токенов; бюджет запроса Jev составляет примерно 32 000 токенов. Если ваша классификация зависит от чтения целого контракта, длинной ветки поддержки или большого файла кода, DeepSeek V4.1 Flash может это увидеть, а Jev — нет: никакая дешевизна на одно решение не исправляет состояние, которое не помещается. Jev также не принимает изображения или аудио на момент запуска, тогда как DeepSeek V4.1 Flash принимает изображения.
Обратная сторона в том, что узкое окно Jev оценивается так, будто это обуза, а не ограничение, и двухэтапный паттерн в собственной документации TypeSafe — это обходной путь: для полей Choice за пределами ограничения в 255 вариантов оценивайте кандидатов пакетами, а затем выбирайте, сравнивая оценки. Это работает, когда состояние небольшое, а набор вариантов большой. Это не работает, когда состояние большое.
Где каждому место
Обращайтесь к Jev, когда решение действительно имеет замкнутую форму, состояние укладывается в 32K токенов, объём достаточно велик, чтобы секунды на вызов были реальными затратами, а конвейеру нужно значение уверенности, по которому он может ветвиться. Проверки guardrail, проверка на каждом шаге внутри цикла агента, маршрутизация при высоких объёмах и параллельная оценка больших наборов документов — это задокументированные сценарии применения.
Обращайтесь к DeepSeek V4.1 Flash, когда нужно прочитать что-то длинное, когда нужно вместе с меткой выдать обоснование, когда нужно увидеть изображение или когда классификация — это лишь один шаг в более длинном генеративном рабочем процессе, а выделение её второму поставщику добавило бы лишний переход ради экономии в один цент, которую мог бы перечеркнуть плохой промпт. И учтите: «генеративная модель тоже может это сделать» — это правильное описание задачи, а не провал Jev; интересный вопрос — нужна ли вам оценка уверенности, потому что это единственный пункт в сравнении, который генеративная модель не может предложить ни за какую цену.
Запуск слоя принятия решений и генеративного слоя на одном ключе

DeepSeek V4.1 Flash — одна из моделей, которые маршрутизирует OrcaRouter, по прайсовой цене провайдера, передаваемой без наценки — 0%, — так что скидка в непиковые часы действует на нашей стороне в тот же день, когда DeepSeek её запускает, и вам не приходится сверяться с двумя прайс-листами. Сам Jev мы не обслуживаем: модель TypeSafe находится в раннем доступе и использует собственную структуру запросов. Архитектура, на которую указывает это сравнение, — двухмодельная: Jev решает, DeepSeek V4.1 Flash генерирует, — а OrcaRouter покрывает генеративную половину через единый OpenAI-совместимый эндпоинт, с автоматическим переключением при сбое, чтобы непроверенный компонент принятия решений никогда не становился единой точкой отказа. 200+ моделей, один ключ, один счёт.
Вердикт
Если вы пришли сюда, ожидая, что Jev будет кардинально дешевле генеративной модели, честный ответ таков: в сравнении с DeepSeek V4.1 Flash обычно это не так, а на этом конкретном тесте из 77 примеров он оказался на один цент дешевле и на четыре пункта менее точен. Jev продаёт не цену за классификацию. Он продаёт структурную гарантию того, что вывод не может быть некорректно сформирован, калиброванное значение уверенности, по которому ваш код может ветвиться, и нижний порог задержки, измеряемый в миллисекундах, а не в секундах. За эти три вещи стоит платить в пайплайне, который запускается достаточно часто, чтобы это имело значение, — и они не стоят ровно ничего, если ваша задача — прочитать документ на 400 страниц и написать его краткое изложение; это работа DeepSeek V4.1 Flash, и она никогда не была работой Jev.

