
Clef против Qwen3.8-27B: один бэкбон, два контракта вывода
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Clef не способна написать ни одного предложения — и при этом построена на модели, которая это умеет. Cloudflare/clef — это мультимодальная модель принятия решений на 27 миллиардов параметров: вы подаёте ей состояние и схему типизированных вопросов, а она возвращает вероятность для каждого допустимого варианта, не порождая ни единого токена прозы. В её основе лежит Qwen3.8-27B — плотная визуально-языковая модель с открытыми весами, замороженная на месте, к которой пристроена небольшая дополнительная голова. Благодаря этому перед нами одна из немногих страниц «модель против модели», где обе стороны вовсе не соперники: это чекпойнт и его производная, которые делят 55 гигабайт весов и расходятся во мнениях о том, ответ — это то, что вы читаете, или то, чем вы вычисляете.
Веса обеих моделей увидели свет раньше, чем слова о них. Cloudflare создала Cloudflare/clef репозиторий на Hugging Face в 21:15 UTC 30 сентября 2026 года под лицензией Apache-2.0, а на следующий день после полудня опубликовала анонсирующий пост — «Представляем Clef: наши открытые модели принятия решений и новая платформа для RL-дообучения». Примерно восемнадцать часов 55-гигабайтную модель можно было скачать и запустить на собственных edge-GPU Cloudflare, прежде чем её поставщик сказал о ней хоть слово. Не прошло и трёх дней, как у неё появилась страница в библиотеке Ollama, доступная начиная с Ollama 0.35.1, — именно там её и обнаружил этот материал, — а также сборки NVFP4, FP8, EXL3, INT8, Q4 и Q8 от десятка разных загрузчиков.
То, что можно узнать из репозитория, необычайно полно, и стоит отделить это от того, что узнать нельзя. Что можно узнать: архитектуру, базовый чекпойнт, лицензию, работающую референсную реализацию и полную матрицу оценок. Чего узнать нельзя: сохранятся ли какие-либо из этих цифр при повторном прогоне, выполненном кем-то не из Cloudflare. Каждая оценка, приписываемая Clef ниже, взята из собственного прогона вендором набора тестов, размещённого у самого вендора. Эта асимметрия на фоне модели, за которой стоит месяц независимого использования, — честный стержень этого сравнения, а остальная часть материала — о том, где это на самом деле даёт о себе знать.
Два репозитория, бок о бок
Начните со скачивания, потому что суть именно в одинаковости. safetensors Clef составляют 54,97 ГБ по двенадцати шардам. У родительской модели — 55,56 ГБ по восемнадцати. Clef сохраняет визуальный энкодер Qwen3.8-27B — процессор, визуальную башню, весь мультимодальный фронтенд, — так что ничего не срезали, чтобы уменьшить размер. То, что добавил Cloudflare, — это объединённая голова схемы на 256 МБ: четыре слоя шириной 1 024, шестнадцать голов, feedforward-слой шириной 4 096, два маршрутизирующих слоя, которые считывают финальные скрытые состояния основной сети. Рецепт обучения — замороженная основная сеть, эта голова и низкоранговые адаптеры ранга 256, с кросс-энтропией со сглаживанием меток для корректных ответов схемы в паре с потерей Бриера, чтобы отточить калибровку.
Тогда расхождение, которое целиком состоит в том, что модели разрешено выдавать.
• Параметры — Clef 27B, дообучена на основе Qwen/Qwen3.8-27B. Qwen3.8-27B — 27B, плотная, 64 слоя, скрытая размерность 5 120, словарь на 248 320 токенов, 16 × (3 × Gated DeltaNet → FFN), чередующихся с Gated Attention.
• Вывод — Clef: один логит на каждый допустимый вариант, softmax по каждому вопросу, путь генерации отсутствует полностью. Qwen3.8-27B: токены, вызовы инструментов и блок рассуждений, включённый по умолчанию.
• Формы вопросов — Clef принимает от 1 до 64 типизированных вопросов на запрос в трёх формах: noul (вероятность истины), choice (от 2 до 255 именованных вариантов), score (от 2 до 10 упорядоченных уровней, возвращает взвешенное по вероятности значение, которое может оказаться между ними). У Qwen3.8-27B нет такого контракта; вы получаете текст, а парсер пишете сами.
• Лицензия — Apache-2.0 у обоих, именно поэтому сторонняя квантизация случилась за выходные.
• Цена замороженной половины — голова Clef занимает 256 МБ против 54,97 ГБ у бэкбона. Почти весь объём загрузки — это родительская модель. Если Qwen3.8-27B уже есть у вас на диске, вы скачиваете его второй раз, чтобы получить другое мнение о том, как отвечать.

Сколько стоит смена заголовка — в двух цифрах
Оценка Cloudflare — это набор тестов Decision Index 0.2.1, проводимый внутри компании, и он представляет собой таблицу о моделях принятия решений — шесть столбцов: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B и Laya. У Qwen3.8-27B в ней нет строки, а у Clef нет строки в Artificial Analysis Intelligence Index. Таким образом, общей таблицы результатов не существует, и этот материал не станет её выдумывать.
Однако есть один бенчмарк, который прошли обе стороны, и разрыв достаточно велик, чтобы быть самым значимым для принятия решений числом в этом релизе. На GPQA Diamond — научных вопросах уровня выпускника с выбором ответа — Cloudflare измеряет Clef на уровне 48.0. Родительская модель находится на отметке 90.5 в тестовом стенде Artificial Analysis и 89.2 в собственной карточке модели вендора. Это обрыв в сорок пунктов по общим знаниям, и здесь нет никакой загадки: Clef отвечает, оценивая фиксированный набор предложенных ему вариантов, а множественный выбор на общие знания — это примерно так же далеко от «маршрутизируй этот тикет», как только можно направить те же самые веса. Относитесь к этому сравнению как к ориентировочному, а не контролируемому — два тестовых стенда, две лаборатории, и ни один из них не принадлежит ни вендору, ни трекеру. Но направление не вызывает сомнений, и это цена контракта.
Та же закономерность проявляется и в остальных ячейках общего назначения Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 с обработкой запросов вне области — 97.4 у 27B против 89.3 у Jev's — эта последняя — редкая ячейка, где производная модель решительно превосходит более старую модель принятия решений, и это важно, потому что отказ от классификации — сложная половина маршрутизации. Там, где Clef сильна, она сильна именно там, где и должен быть внутрикорпоративный классификатор: BANKING77 macro-F1 по интентам — 94.2, BFCL case-exact — 98.5, API-Bank — 91.9. Там, где она слаба, модель принятия решений, работающая только с текстом, от конкурирующей лаборатории — Jev от TypeSafe — превосходит её на тридцать пунктов на GPQA Diamond, при этом выставляя счёт $0.042 за миллион входных токенов по нашему собственному каталогу, что служит полезным напоминанием: «27B» само по себе не аргумент.
То, что сохраняет родитель, — это всё, о чём не спрашивает Decision Index. На своей собственной карточке и в строках из источников AA наш каталог содержит: Terminal-Bench 2.1 — 73,0, SWE-bench Pro — 61,7, LiveCodeBench v6 — 90,3, OSWorld-Verified — 84,3, DeepSWE 1.1 — 42,2, AA Coding — 68,1 на 35-м месте из 138 отобранных моделей. Ни для одного из них нет строки Clef, потому что Clef не может их выполнить. У него нет механизма вызова инструментов, нет долгосрочного планирования, нет способа выдать патч.
Сколько стоит одно решение — и почему строка вывода и есть весь аргумент
На странице модели Workers AI для Clef указана ровно одна цена за единицу: $0,24 за миллион входных токенов. Строки для выходных данных нет, и причина кроется в самих ответах. Собственный задокументированный пример Ollama — тикет в поддержку, распределённый по трём вопросам — возвращается с "usage": {"input_tokens": 1204, "output_tokens": 3}. Три выходных токена на три вопроса. Включит ли Cloudflare эти три токена в счёт, почти не имеет значения: стоимость вывода решения — это не тариф, а количество вопросов.
Сравните это с тарифной сеткой родителя в нашем собственном каталоге, которая составляет $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов с окном в 262 144 токена. То же состояние в 1 204 токена, то же единственное решение о маршрутизации:
• Clef — 1 204 входных токенов по $0,24 за миллион — это примерно $0,00029 за решение, и около $289 за миллион решений. Число почти не меняется, когда ответ становится сложнее, — только когда состояние становится длиннее.
• Qwen3.8-27B с отключённым режимом размышления — то же состояние стоит около $0.00040 на входе, плюс примерно десять выходных токенов по $2.40 за миллион. Скажем, $0.00042, или $421 за миллион. Clef примерно в 1,5 раза дешевле, но рассказывают не об этом.
• Qwen3.8-27B с включённым режимом размышления — что является значением по умолчанию для этого чекпоинта. Если модель тратит 400 токенов на размышления о том, к какой из четырёх категорий относится письмо для сброса пароля, это ещё $0.00096, и решение оказывается около $0.0014, или $1,357 за миллион. Эти 400 токенов — допущение, а не измерение, и множитель изменяется линейно вместе с ним.
Так что честная версия аргумента о цене уже, чем кажется на первый взгляд. В сравнении с универсальной моделью, работающей с выключенным режимом размышления, Clef выигрывает в долларах примерно в полтора раза — это реально, но не радикально. В сравнении с той же моделью в конфигурации по умолчанию разрыв зависит от многословности, а многословность — это именно то, что есть у языковой модели и чего у архитектуры со скорерами поверх вариантов нет вообще. В этом и состоит структурное утверждение: стоимость Clef ограничена длиной состояния, а стоимость родителя ограничена тем, сколько родитель решает сказать.

Единственное число, которое не близко
Cloudflare сообщает, что медианная задержка запросов для Clef составляет 209,3 мс, а p95 — 238,6 мс; измерения проводились на 43 бенчмарках в ходе собственного прогона Cloudflare на её периферийных GPU. Никто за пределами Cloudflare не воспроизвёл этот результат, и инфраструктура вендора — причина того, что показатель настолько низок: эта модель рассчитана на то, чтобы находиться в одной сети с вызывающей стороной.
Для родителя мы можем сделать лучше, чем число от вендора, потому что это один из наших маршрутов. За семидневный период, закончившийся 2 октября 2026 года, собственный плейграунд OrcaRouter измерил Qwen3.8-27B на уровне p50 1 929 мс и 235,8 выходных токенов в секунду, на 136,3 млн токенов трафика за этот период. Самое интересное — это дневной ряд: p95 держится ровно на 10 000 мс шесть из семи дней, что читается скорее как потолок, а не как измерение, а p50 колеблется между 1 751 мс и 4 296 мс в зависимости от дня. Считайте медиану примерно в девять раз больше, чем у Clef, а хвост считайте неинформативным, пока кто-нибудь не опубликует реальное распределение.
Этот разрыв — не разница в тонкой настройке, и он не закроется. Проход только с prefill плюс параллельная scoring-голова завершается за один прогон; авторегрессионная модель завершается, когда ей больше нечего сказать. Абсолютные показатели вендора для Clef заслуживают обычной скидки, но этот порядок — свойство архитектуры, а не железа Cloudflare.
Для одного из них контекст цитируется тремя способами.
Обе модели принимают текст, JSON, изображения и видео. Окна не одинаковы, и для одного из них значения приводятся непоследовательно — в зависимости от того, где вы читаете.
• Clef, размещённый на хостинге — 65 536 токенов, согласно странице модели Workers AI и посту с анонсом. Именно это число ограничивает того, кто вызывает API, и сама Cloudflare подаёт это в сравнительном ключе: вдвое больше состояния, чем вмещает 32K-окно Jev.
• Clef, на диске — выпущенный config.json объявляет max_position_embeddings в 262 144, потому что замороженный бэкбон принадлежит родителю и всё ещё несёт родительский потолок позиций. Встроенный хелпер encode_record по умолчанию использует max_length=16,384, при этом max_state_tokens доступен для отдельного ограничения состояния. Ни одно из этих трёх чисел не является ошибочным; они отвечают на разные вопросы, а листинг среды выполнения, который заявляет 256K, читает конфиг, а не эндпоинт.
• Qwen3.8-27B — 262 144 нативно, расширяется до 1 000 000 при правильной конфигурации обслуживания, согласно карточке вендора и строке нашего каталога. Как минимум вчетверо больше окна hosted Clef.
Практическое следствие скромнее, чем можно предположить по этому соотношению. Clef потребляет состояние — тикет, счёт, скриншот, — а не разговор, и одно из его преимуществ в том, что можно передать ему большую плоскую полезную нагрузку и задать по ней шестьдесят четыре вопроса, не платя за эту нагрузку снова при каждом вопросе. Родителю нужно окно, потому что ему приходится вмещать историю, результаты работы инструментов и собственные рассуждения. Разные требования — разные потолки.
Оба они видят одни и те же пиксели
Визуальный энкодер наследуется, так что это не случай, когда одна модель мультимодальная, а другая нет. Clef принимает до четырёх изображений на запрос — PNG, JPEG или WebP в кодировке base64, — которые используются всеми вопросами в полезной нагрузке, а видеокадры можно добавлять в виде массивов кадров. Пример с чеком в карточке задаёт вопрос с ответом «да/нет» о том, разборчива ли итоговая сумма, — это тот же замысел в миниатюре. Qwen3.8-27B — нативная визуально-языковая модель с OmniDocBench 1.5 на уровне 91,1, RealWorldQA на уровне 85,9 и CharXiv на уровне 78,8 в карточке производителя.
Разница в том, что вы получаете в ответ. Clef выдаёт решение по каждому полю с привязанной вероятностью — это типизированный ответ о документе. Родительская модель выдаёт описание документа, которое вы затем парсите. Для большого класса задач с документами — проверить эту форму, найти этот пункт, превышает ли эта сумма порог — типизированный ответ и есть вся работа, а описание — это накладные расходы: вы платите за них, а затем выбрасываете.
Где на самом деле проходит черта
• Используйте Clef — ответы можно перечислить заранее, а писать парсер вам не хочется. Маршрутизация, триаж, гейтинг, проверки политик, извлечение полей документа. Закрытые наборы, от 2 до 255 вариантов на вопрос, до 64 вопросов, оцениваемых вместе.
• Возьмите Clef — решение находится на горячем пути, и 209 мс против 1 929 мс меняют то, на что способен конвейер. Это самая сильная причина для перехода, и это причина по задержке, а не по точности.
• Возьмём Clef — вам нужна детерминированность. Вариант, который вы не объявили, не может вернуться, потому что нет шага генерации, который бы его создал.
• Оставьте Qwen3.8-27B — ответ — это не выбор из списка: суммирование, составление черновиков, рассуждение над новой задачей, написание кода, управление инструментами на длинном горизонте. Clef ничего из этого не умеет — и он вам об этом не скажет.
• Оставьте Qwen3.8-27B — вам нужна модель, которая скажет «ни один из этих вариантов». Модель принятия решений оценивает предложенные ей варианты. Передайте ей схему для выставления счетов/технических вопросов/продаж и запрос о конфиденциальности, и она вернёт наименее плохой из этих трёх, а не откажется. Родительская модель выявляет вопрос, который вам не пришло в голову задать.
• Оставьте Qwen3.8-27B — для работы с контекстом или длинными документами. Вчетверо больше размещённого окна — до расширения до миллиона токенов.
Читайте этот список как конвейер, а не как вердикт, потому что именно таков он и есть. Архитектура делает эту связь буквальной: Clef является проходом предзаполнения родителя, но с другим механизмом формирования ответа на выходе. Разумный дизайн ставит Clef впереди — определить маршрут, приоритет, флаг эскалации — и оставляет Qwen3.8-27B позади него, чтобы тот действовал по этому решению. Эти двое — взаимодополняющие компоненты, которые, так уж вышло, делят одну загрузку.
Где запускать каждый из них
Clef размещён в Workers AI от Cloudflare по указанной выше цене $0,24 за миллион входных токенов, а веса под лицензией Apache-2.0 можно запускать локально у себя. Новейшая площадка — запись в библиотеке Ollama: ollama pull clef требует Ollama 0.35.1 или новее, поскольку модель общается через конечную точку /v1/systemone, которую Ollama добавила для моделей принятия решений. Смотрите на теги, а не на заголовок — теги по умолчанию и clef:27b занимают 18 ГБ, это четырёхбитная сборка 55-гигабайтной модели; clef:27b-q8_0 — 30 ГБ, clef:27b-nvfp4 — 18 ГБ, clef:27b-mxfp8 — 31 ГБ, а clef:27b-mlx-bf16 — это полные 55 ГБ для Apple silicon. Собственный Python SDK от TypeSafe будет с ней работать, если направить его на локальный Ollama и передать любой ключ API, который среда выполнения игнорирует. Одно предостережение, которое даст о себе знать в продакшене: confidence измеряет, насколько сконцентрированы вероятности, а не вероятность того, что ответ правильный, а ничьи разрешаются в порядке объявленных вами вариантов.
Родительский элемент нужно разместить за API. Qwen3.8-3.8 маршрутизируется через Orca по цене $0.33 и $1.44 за миллион токенов, и это одна из более чем 200 моделей, доступных через OpenAI-совместимый ключ. Потому что он передаётся по цене $0.33 и $1.44?
Сам Clef не входит в число наших маршрутов — наш публичный каталог по нему ничего не возвращает, и ничто здесь не должно восприниматься как заявление о доступности с нашей стороны. Но у нас действительно есть модель, которая делает паттерн принятия решений достижимым без аккаунта Cloudflare — модель TypeSafeJev 1.13 — это маршрут из каталога по цене $0.042 за миллион входных токенов с контекстом 65 536 токенов, замеренным на p50 в 148 мс в том же семидневном окне, и он использует идентичнуюPOST /v1/systemone форму запроса. Поскольку Clef намеренно совместим с Jev по API, пайплайн, построенный под любой из них, отстоит от другого всего на одно изменение конфигурации — а именно этот случай слой маршрутизации и существует, чтобы сделать бесплатным. Держите оба достижимыми, замеряйте на своих собственных метках и позвольте победителю стать точкой данных, а не архитектурным обязательством. Если модель принятия решений в итоге становится шлюзом для агента, модель, которая действует на основе решения, всё равно должна оставаться достижимой, и эта половина уже находится за тем же ключом.

Что могло бы изменить это чтение?
Три вещи — в порядке возрастания того, насколько сильно они могли бы это изменить.
Третьей стороне нужно повторно запустить Decision Index. Набор тестов общедоступен, и Cloudflare описывает эти оценки как воспроизводимые, так что это выполнимо — и именно за ячейкой CLINC150 out-of-scope стоит следить внимательнее всего, потому что 97,4 у 27B — это либо настоящее преимущество над 89,3 у Jev на самой сложной половине маршрутизации, либо артефакт стенда, собранного внутри компании. Пока никто за пределами Cloudflare этого не знает.
Кто-то должен оценить Cleo и Qwen3.8-27B на одной и той же задаче классификации с одними и теми же метками. Только такое сравнение позволило бы определить, является ли замена головы компромиссом по качеству или улучшением качества для решений на закрытом множестве, и ни у одного вендора нет стимула его проводить. До тех пор разрыв в сорок пунктов по GPQA остаётся лучшим доступным свидетельством того, что было убрано, и это свидетельство о не той задаче.
А задержке Clef нужен p95 при конкурентной нагрузке. Медианные 209 мс измерил сам вендор, на оборудовании, которое вендор контролирует, для модели, вся суть которой в том, что она находится на горячем пути. Соотношение с авторегрессивной родительской моделью — свойство архитектуры, и оно сохранится. А вот абсолютным миллисекундам доверять не стоит — и именно на них держится всё обоснование бизнес-кейса.
Qwen3.8-27B — одна из более чем 200 моделей, доступных через один OpenAI-совместимый ключ — Qwen3.8-27B.
