Сгенерированная титульная карточка с надписью «Clef» и подзаголовком «модели принятия решений Cloudflare, которые никогда не пишут ни одного токена», с двумя чипами: «веса 30 сент. 2026» и «блог 1 окт. 2026». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Clef намеренно копирует API Jev — и это самое интересное

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Clef — это мультимодальная модель на 27 миллиардов параметров от Cloudflare, которая отвечает на типизированные вопросы и больше ни на что. Вы передаёте ей состояние — текст, JSON, изображение, видеокадр — плюс схему из до 64 именованных вопросов, и она возвращает вероятность для каждого допустимого варианта за один прямой проход. Никакого сгенерированного текста, никакого парсера, никакого цикла декодирования. Cloudflare/clef стоит читать не из-за этой архитектуры, которую она позаимствовала, а из-за выбранного ею формата передачи данных: Cloudflare построила Clef так, чтобы она говорила на языке тела запроса и ответа Jev System One — модели принятия решений, которую TypeSafe выпустила первой, обслуживаемой по тому же пути POST /v1/systemone. Интероперабельность здесь — это весь коммерческий аргумент. Если ваш конвейер уже задаёт вопросы модели принятия решений в такой форме, Clef — это смена URL и строки модели, а не миграция.

Это необычная вещь, которую можно было бы скрыть в посте о релизе, и Cloudflare её не скрывает — карточка модели прямо заявляет, что API «полностью совместим с Jev и SystemOne», а блог начинается с признания заслуг TypeSafe в том, что она сделала эту категорию известной, прежде чем позиционировать Clef как версию второго поколения внутреннего эксперимента. Итак, честное прочтение этого релиза состоит из трёх частей: что вам даёт решение о совместимости, что собственные цифры Cloudflare говорят о том, где Clef выигрывает, а где проигрывает, и что остаётся непроверенным, потому что каждая цифра в этой таблице была получена вендором, который выпускает эту модель.

Категория пришла откуда-то ещё

Пост Cloudflare откровенно говорит о происхождении. Идея модели, возвращающей ограниченные структурированные выходные данные, а не текст, приписывается Jev System One от TypeSafe. Собственный путь Cloudflare начался с более раннего демо, которое заставило диффузионную модель выдавать детерминированные вероятности путём раскрытия logprobs, а также с работы сообщества Мэтта Мастраччи по адаптации механизма вывода к этому шаблону. Clef развивает эту концепцию с другим бэкбоном, специально созданной головой оценки и — часть, важная с коммерческой точки зрения — телом запроса, соответствующим таковому у действующего игрока.

Когда поставщик одновременно копирует формат передачи данных конкурента и сравнивает себя с индексом конкурента, совместимость — это не сноска к модели, а продуктовая стратегия. Замена модели принятия решений за существующим эндпоинтом — самый дешёвый способ для нового игрока добиться того, чтобы его попробовали, и самый дешёвый эксперимент для команды, у которой уже есть один из таких подключённых.

Что на самом деле было выпущено и сколько это стоит

Параметры — 27B, создана путём замораживания Qwen3.8-27B вместе с её визуальным энкодером и обучения головы схемы плюс низкоранговых адаптеров ранга 256.

• Родственная модель — Clef-Flash, тот же рецепт на 9B от Qwen3.5-9B. Отдельная статья, отдельные компромиссы.

• Контекст — 65 536 токенов, согласно странице модели Workers AI и публикации в блоге. Встроенный вспомогательный модуль кодирования по умолчанию использует max_length=16,384, это значение по умолчанию, а не верхний предел, но именно то значение по умолчанию, которое вы получите, если будете использовать загрузчик в том виде, в каком он поставляется.

• Типы вопросов — noul (истина/ложь, возвращающий вероятность истины), выбор (от 2 до 26 именованных вариантов), оценка (от 2 до 26 упорядоченных уровней). От 1 до 64 вопросов на запрос.

• Цена — $0.24 за миллион входных токенов в Workers AI от Cloudflare или самостоятельный хостинг из весов Apache-2.0, которые занимают примерно 55 ГБ и распределены по двенадцати шардам.

• Лицензия — Apache 2.0, на основе базового чекпоинта Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Где он выигрывает, а где нет

Прогон Cloudflare Decision Index — источник всего в этом разделе, и таблица лидеров, на которой он размещён, принадлежит Cloudflare. Ничто из нижеследующего не было независимо воспроизведено. Читайте это как наилучший сценарий от поставщика и обратите внимание, насколько он неравномерен.

Победы сосредоточены там, где и должен побеждать классификатор, обученный внутри компании. Clef берёт макро-F1 по интентам в BANKING77 — 94,2 против 79,7 у Jev, а в CLINC150 с обработкой выхода за пределы области — 97,4 против 89,3: разрыв в тридцать пунктов, самая значимая для принятия решений ячейка таблицы, потому что отказ от классификации — это сложная половина маршрутизации. Он также берёт CRUXEval с 86,7, CLadder с 94,0 и симулятор бытовой техники с 83,0.

Проигрыши столь же реальны, и им место в том же абзаце. В области общих знаний и сложных рассуждений более старый Jev одерживает безоговорочную победу: GPQA Diamond — 78,3 против 48,0, MMLU-Pro — 82,7 против 65,9, BBH — 92,9 против 73,7. Это три крупнейших разрыва в таблице, и все они указывают в одном направлении. Clef также не является лучшей моделью в своём собственном сравнении на наборе PhishNChips из области безопасности, где показатель составляет 79,6, а конкурирующая запись набирает больше.

В четырёх сквозных оценках рабочих процессов, взятых из собственного публичного набора оценок TypeSafe и оценённых по консенсусным меткам, две системы настолько близки, что всё решит бросок монеты. Clef берёт верх в обработке счетов по точным действиям со счётом 64,7 против 61,8, а в наборе по инцидентам безопасности — 62,9 против 61,7; Jev берёт верх в наблюдаемости трассировок агентов — 71,6 против 68,5; обслуживание клиентов — ничья 76,3 против 76,0, которая при такой разнице ничего не значит.

Задержка — это то, где разрыв носит структурный, а не маргинальный характер. Cloudflare сообщает о медиане 209,3 мс и p95 238,6 мс для Clef против 524,1 и 536,0 для Jev. Такой порядок следует из неавторегрессионной архитектуры, а не из особенностей бенчмарка, — поэтому именно этот показатель с наибольшей вероятностью выдержит проверку реальным развёртыванием. Абсолютные миллисекунды были измерены на собственном оборудовании Cloudflare и сами по себе мало что значат.

Самый убедительный факт в релизе — это не строка из бенчмарка. Cloudflare утверждает, что её команда по анализу угроз передала домен в Clef вместе со своим сервисом браузерного рендеринга и получила вердикт по категории за 2,2 секунды против 4,7 секунды у своей самой быстрой универсальной LLM на том же сценарии, причём было возвращено больше классификаций. Внутренний пример из практики, не исследование — но именно такие истории объясняют, почему кто-то вообще стал бы это создавать, а не просто давать запрос универсальной модели.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Две вещи, о которых вам расскажет справочник API, и одна, о которой он умолчит.

Задокументированные ловушки невелики, и их стоит прочитать, прежде чем что-либо портировать. Поле confidence измеряет, насколько сконцентрированы вероятности, а не вероятность того, что ответ правильный: хорошо откалиброванная модель может вернуть правильный ответ с низкой уверенностью, а неправильный — с высокой. А когда два варианта совпадают по оценке, ответ следует порядку вариантов модели, поэтому ставьте предпочитаемый вариант первым. Любой, кто портирует классификатор на основе промпта, не прочитав эти два предложения, будет неправильно читать собственные логи.

Более крупное ограничение нигде не задокументировано, потому что оно структурное. У Clef вообще нет пути генерации текста, а значит, он не может составить ответ, суммировать ветку, вызвать инструмент или поддерживать разговор, и он не придумает категорию, которую вы не объявили. Вся конструкция предполагает, что вы можете заранее перечислить допустимые ответы. Это тихо исключает большой класс проблем, и никакие показатели бенчмарков этого не меняют.

Чего стоит аргумент о совместимости

Здесь релиз перестаёт быть обзором модели и становится вопросом архитектуры. Если Clef говорит на языке формы запроса Jev, то модель за вашей конечной точкой принятия решений — это значение конфигурации, и разумный способ внедрить её — параллельно, а не как замену: запускайте обе на собственном трафике, оставьте ту, что показывает лучшие метрики на ваших данных, и пусть переключение остаётся дешёвым.

Сам Clef в нашем списке маршрутов отсутствует; каталог OrcaRouter возвращает по нему 404, и ничто здесь не должно восприниматься как наше заявление о его доступности. А вот что у нас действительно есть — так это тот, кого он был призван вытеснить. Jev 1.13 от TypeSafe — это заявленный маршрут по цене $0.042 за миллион входных токенов при контексте в 65 536 токенов, обслуживаемый через то же самое POST /v1/systemone тело запроса, так что A/B-тест между ними — это смена строки модели, а не переписывание кода. То, что оба доступны за одним ключом — более 200 моделей, списочная цена провайдера передаётся как есть, без наценки за токены, автоматическое переключение между провайдерами при сбое — как раз и позволяет этому тесту продолжать работать и через неделю после того, как кто-то решит, что это важно, вместо того чтобы он выродился в устаревший комментарий в конфиге. Общая модель, которую вы держите под рукой, чтобы действовать по итогам решений модели-решателя, доступна с того же ключа, а не по второму договору.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

Что могло бы изменить это чтение?

Кто-то за пределами Cloudflare должен заново запустить Decision Index. Набор тестов публичен, а оценки описаны как воспроизводимые, поэтому независимый запуск — это разница между таблицей вендора и фактом; и ячейки, которые важнее всего, — это те, что указывают в противоположных направлениях. 97,4 по определению интентов вне области рядом с 48,0 по GPQA Diamond — это не плавная кривая возможностей; это описывает модель, которая очень хорошо распознаёт паттерны классификации из своего обучающего распределения и гораздо слабее в рассуждениях, которых она не видела. Если это подтвердится при независимом тестировании, это самый важный с операционной точки зрения факт о Clef, и его нет в основных выводах.

Продакшн-трафик тоже должен соответствовать таблице задержек. Медиана в 209 мс, измеренная на одном H200, ничего не говорит о p95 при конкурентной нагрузке, а главное преимущество этой архитектуры в том, что она находится на горячем пути.

И платформа для дообучения должна что-то выдавать. В посте Cloudflare описывается цикл RL — AI Gateway собирает набор данных из вашего собственного трафика, Workers AI генерирует роллауты, Containers служат песочницей для оценки, Trainer обновляет веса, а затем модель заново развёртывается на Workers AI — причём в том же посте, где анонсируются модели, без прикреплённого результата от клиента. Дообученный Clef, который превосходит базовую модель на задаче, для которой базовую модель никогда не обучали, был бы гораздо более весомым доказательством для этой категории, чем любая строка в таблице.

А до тех пор справедливое резюме таково: Cloudflare выпустила настоящую, распространяемую под разрешительной лицензией, действительно быструю модель принятия решений и сделала её тривиально заменяемой на ту, что появилась первой. Это более выигрышная история, чем предлагает большинство открытых релизов, и пока что она всё ещё целиком остаётся собственным рассказом вендора о себе.