Титульная карточка с надписью «Clef против Qwen3.8-27B — один бэкбон, два выходных контракта», а под ней две карточки: Clef, 27B-модель принятия решений, по одному логиту на вариант; и Qwen3.8-27B, 27B плотная VLM, токены и вызовы инструментов.
Guides & Insights

Clef против Qwen3.8-27B: один бэкбон, два контракта вывода

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Clef не способна написать ни одного предложения — и при этом построена на модели, которая это умеет. Cloudflare/clef — это мультимодальная модель принятия решений на 27 миллиардов параметров: вы подаёте ей состояние и схему типизированных вопросов, а она возвращает вероятность для каждого допустимого варианта, не порождая ни единого токена прозы. В её основе лежит Qwen3.8-27B — плотная визуально-языковая модель с открытыми весами, замороженная на месте, к которой пристроена небольшая дополнительная голова. Благодаря этому перед нами одна из немногих страниц «модель против модели», где обе стороны вовсе не соперники: это чекпойнт и его производная, которые делят 55 гигабайт весов и расходятся во мнениях о том, ответ — это то, что вы читаете, или то, чем вы вычисляете.

Веса обеих моделей увидели свет раньше, чем слова о них. Cloudflare создала Cloudflare/clef репозиторий на Hugging Face в 21:15 UTC 30 сентября 2026 года под лицензией Apache-2.0, а на следующий день после полудня опубликовала анонсирующий пост — «Представляем Clef: наши открытые модели принятия решений и новая платформа для RL-дообучения». Примерно восемнадцать часов 55-гигабайтную модель можно было скачать и запустить на собственных edge-GPU Cloudflare, прежде чем её поставщик сказал о ней хоть слово. Не прошло и трёх дней, как у неё появилась страница в библиотеке Ollama, доступная начиная с Ollama 0.35.1, — именно там её и обнаружил этот материал, — а также сборки NVFP4, FP8, EXL3, INT8, Q4 и Q8 от десятка разных загрузчиков.

То, что можно узнать из репозитория, необычайно полно, и стоит отделить это от того, что узнать нельзя. Что можно узнать: архитектуру, базовый чекпойнт, лицензию, работающую референсную реализацию и полную матрицу оценок. Чего узнать нельзя: сохранятся ли какие-либо из этих цифр при повторном прогоне, выполненном кем-то не из Cloudflare. Каждая оценка, приписываемая Clef ниже, взята из собственного прогона вендором набора тестов, размещённого у самого вендора. Эта асимметрия на фоне модели, за которой стоит месяц независимого использования, — честный стержень этого сравнения, а остальная часть материала — о том, где это на самом деле даёт о себе знать.

Два репозитория, бок о бок

Начните со скачивания, потому что суть именно в одинаковости. safetensors Clef составляют 54,97 ГБ по двенадцати шардам. У родительской модели — 55,56 ГБ по восемнадцати. Clef сохраняет визуальный энкодер Qwen3.8-27B — процессор, визуальную башню, весь мультимодальный фронтенд, — так что ничего не срезали, чтобы уменьшить размер. То, что добавил Cloudflare, — это объединённая голова схемы на 256 МБ: четыре слоя шириной 1 024, шестнадцать голов, feedforward-слой шириной 4 096, два маршрутизирующих слоя, которые считывают финальные скрытые состояния основной сети. Рецепт обучения — замороженная основная сеть, эта голова и низкоранговые адаптеры ранга 256, с кросс-энтропией со сглаживанием меток для корректных ответов схемы в паре с потерей Бриера, чтобы отточить калибровку.

Тогда расхождение, которое целиком состоит в том, что модели разрешено выдавать.

• Параметры — Clef 27B, дообучена на основе Qwen/Qwen3.8-27B. Qwen3.8-27B — 27B, плотная, 64 слоя, скрытая размерность 5 120, словарь на 248 320 токенов, 16 × (3 × Gated DeltaNet → FFN), чередующихся с Gated Attention.

• Вывод — Clef: один логит на каждый допустимый вариант, softmax по каждому вопросу, путь генерации отсутствует полностью. Qwen3.8-27B: токены, вызовы инструментов и блок рассуждений, включённый по умолчанию.

• Формы вопросов — Clef принимает от 1 до 64 типизированных вопросов на запрос в трёх формах: noul (вероятность истины), choice (от 2 до 255 именованных вариантов), score (от 2 до 10 упорядоченных уровней, возвращает взвешенное по вероятности значение, которое может оказаться между ними). У Qwen3.8-27B нет такого контракта; вы получаете текст, а парсер пишете сами.

• Лицензия — Apache-2.0 у обоих, именно поэтому сторонняя квантизация случилась за выходные.

• Цена замороженной половины — голова Clef занимает 256 МБ против 54,97 ГБ у бэкбона. Почти весь объём загрузки — это родительская модель. Если Qwen3.8-27B уже есть у вас на диске, вы скачиваете его второй раз, чтобы получить другое мнение о том, как отвечать.

A two-column scoreboard for Clef and Qwen3.8-27B across six dimensions: output, parameters, GPQA Diamond (48.0 vs 90.5), hosted context (65,536 vs 262,144 tokens), median latency (209.3 ms vs 1,929 ms) and list price ($0.24 per M in vs $0.33/$2.40 per M). A footer notes Clef's figures are vendor-reported and unreproduced, Qwen's GPQA is per Artificial Analysis, and latency was measured by each side on its own hardware.

Сколько стоит смена заголовка — в двух цифрах

Оценка Cloudflare — это набор тестов Decision Index 0.2.1, проводимый внутри компании, и он представляет собой таблицу о моделях принятия решений — шесть столбцов: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B и Laya. У Qwen3.8-27B в ней нет строки, а у Clef нет строки в Artificial Analysis Intelligence Index. Таким образом, общей таблицы результатов не существует, и этот материал не станет её выдумывать.

Однако есть один бенчмарк, который прошли обе стороны, и разрыв достаточно велик, чтобы быть самым значимым для принятия решений числом в этом релизе. На GPQA Diamond — научных вопросах уровня выпускника с выбором ответа — Cloudflare измеряет Clef на уровне 48.0. Родительская модель находится на отметке 90.5 в тестовом стенде Artificial Analysis и 89.2 в собственной карточке модели вендора. Это обрыв в сорок пунктов по общим знаниям, и здесь нет никакой загадки: Clef отвечает, оценивая фиксированный набор предложенных ему вариантов, а множественный выбор на общие знания — это примерно так же далеко от «маршрутизируй этот тикет», как только можно направить те же самые веса. Относитесь к этому сравнению как к ориентировочному, а не контролируемому — два тестовых стенда, две лаборатории, и ни один из них не принадлежит ни вендору, ни трекеру. Но направление не вызывает сомнений, и это цена контракта.

Та же закономерность проявляется и в остальных ячейках общего назначения Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 с обработкой запросов вне области — 97.4 у 27B против 89.3 у Jev's — эта последняя — редкая ячейка, где производная модель решительно превосходит более старую модель принятия решений, и это важно, потому что отказ от классификации — сложная половина маршрутизации. Там, где Clef сильна, она сильна именно там, где и должен быть внутрикорпоративный классификатор: BANKING77 macro-F1 по интентам — 94.2, BFCL case-exact — 98.5, API-Bank — 91.9. Там, где она слаба, модель принятия решений, работающая только с текстом, от конкурирующей лаборатории — Jev от TypeSafe — превосходит её на тридцать пунктов на GPQA Diamond, при этом выставляя счёт $0.042 за миллион входных токенов по нашему собственному каталогу, что служит полезным напоминанием: «27B» само по себе не аргумент.

То, что сохраняет родитель, — это всё, о чём не спрашивает Decision Index. На своей собственной карточке и в строках из источников AA наш каталог содержит: Terminal-Bench 2.1 — 73,0, SWE-bench Pro — 61,7, LiveCodeBench v6 — 90,3, OSWorld-Verified — 84,3, DeepSWE 1.1 — 42,2, AA Coding — 68,1 на 35-м месте из 138 отобранных моделей. Ни для одного из них нет строки Clef, потому что Clef не может их выполнить. У него нет механизма вызова инструментов, нет долгосрочного планирования, нет способа выдать патч.

Сколько стоит одно решение — и почему строка вывода и есть весь аргумент

На странице модели Workers AI для Clef указана ровно одна цена за единицу: $0,24 за миллион входных токенов. Строки для выходных данных нет, и причина кроется в самих ответах. Собственный задокументированный пример Ollama — тикет в поддержку, распределённый по трём вопросам — возвращается с "usage": {"input_tokens": 1204, "output_tokens": 3}. Три выходных токена на три вопроса. Включит ли Cloudflare эти три токена в счёт, почти не имеет значения: стоимость вывода решения — это не тариф, а количество вопросов.

Сравните это с тарифной сеткой родителя в нашем собственном каталоге, которая составляет $0.33 за миллион входных токенов и $2.40 за миллион выходных токенов с окном в 262 144 токена. То же состояние в 1 204 токена, то же единственное решение о маршрутизации:

• Clef — 1 204 входных токенов по $0,24 за миллион — это примерно $0,00029 за решение, и около $289 за миллион решений. Число почти не меняется, когда ответ становится сложнее, — только когда состояние становится длиннее.

• Qwen3.8-27B с отключённым режимом размышления — то же состояние стоит около $0.00040 на входе, плюс примерно десять выходных токенов по $2.40 за миллион. Скажем, $0.00042, или $421 за миллион. Clef примерно в 1,5 раза дешевле, но рассказывают не об этом.

• Qwen3.8-27B с включённым режимом размышления — что является значением по умолчанию для этого чекпоинта. Если модель тратит 400 токенов на размышления о том, к какой из четырёх категорий относится письмо для сброса пароля, это ещё $0.00096, и решение оказывается около $0.0014, или $1,357 за миллион. Эти 400 токенов — допущение, а не измерение, и множитель изменяется линейно вместе с ним.

Так что честная версия аргумента о цене уже, чем кажется на первый взгляд. В сравнении с универсальной моделью, работающей с выключенным режимом размышления, Clef выигрывает в долларах примерно в полтора раза — это реально, но не радикально. В сравнении с той же моделью в конфигурации по умолчанию разрыв зависит от многословности, а многословность — это именно то, что есть у языковой модели и чего у архитектуры со скорерами поверх вариантов нет вообще. В этом и состоит структурное утверждение: стоимость Clef ограничена длиной состояния, а стоимость родителя ограничена тем, сколько родитель решает сказать.

Cloudflare's Workers AI model page for clef, showing a 65,536-token context window, vision support, and unit pricing of $0.24 per million input tokens with no output line.

Единственное число, которое не близко

Cloudflare сообщает, что медианная задержка запросов для Clef составляет 209,3 мс, а p95 — 238,6 мс; измерения проводились на 43 бенчмарках в ходе собственного прогона Cloudflare на её периферийных GPU. Никто за пределами Cloudflare не воспроизвёл этот результат, и инфраструктура вендора — причина того, что показатель настолько низок: эта модель рассчитана на то, чтобы находиться в одной сети с вызывающей стороной.

Для родителя мы можем сделать лучше, чем число от вендора, потому что это один из наших маршрутов. За семидневный период, закончившийся 2 октября 2026 года, собственный плейграунд OrcaRouter измерил Qwen3.8-27B на уровне p50 1 929 мс и 235,8 выходных токенов в секунду, на 136,3 млн токенов трафика за этот период. Самое интересное — это дневной ряд: p95 держится ровно на 10 000 мс шесть из семи дней, что читается скорее как потолок, а не как измерение, а p50 колеблется между 1 751 мс и 4 296 мс в зависимости от дня. Считайте медиану примерно в девять раз больше, чем у Clef, а хвост считайте неинформативным, пока кто-нибудь не опубликует реальное распределение.

Этот разрыв — не разница в тонкой настройке, и он не закроется. Проход только с prefill плюс параллельная scoring-голова завершается за один прогон; авторегрессионная модель завершается, когда ей больше нечего сказать. Абсолютные показатели вендора для Clef заслуживают обычной скидки, но этот порядок — свойство архитектуры, а не железа Cloudflare.

Для одного из них контекст цитируется тремя способами.

Обе модели принимают текст, JSON, изображения и видео. Окна не одинаковы, и для одного из них значения приводятся непоследовательно — в зависимости от того, где вы читаете.

• Clef, размещённый на хостинге — 65 536 токенов, согласно странице модели Workers AI и посту с анонсом. Именно это число ограничивает того, кто вызывает API, и сама Cloudflare подаёт это в сравнительном ключе: вдвое больше состояния, чем вмещает 32K-окно Jev.

• Clef, на диске — выпущенный config.json объявляет max_position_embeddings в 262 144, потому что замороженный бэкбон принадлежит родителю и всё ещё несёт родительский потолок позиций. Встроенный хелпер encode_record по умолчанию использует max_length=16,384, при этом max_state_tokens доступен для отдельного ограничения состояния. Ни одно из этих трёх чисел не является ошибочным; они отвечают на разные вопросы, а листинг среды выполнения, который заявляет 256K, читает конфиг, а не эндпоинт.

• Qwen3.8-27B — 262 144 нативно, расширяется до 1 000 000 при правильной конфигурации обслуживания, согласно карточке вендора и строке нашего каталога. Как минимум вчетверо больше окна hosted Clef.

Практическое следствие скромнее, чем можно предположить по этому соотношению. Clef потребляет состояние — тикет, счёт, скриншот, — а не разговор, и одно из его преимуществ в том, что можно передать ему большую плоскую полезную нагрузку и задать по ней шестьдесят четыре вопроса, не платя за эту нагрузку снова при каждом вопросе. Родителю нужно окно, потому что ему приходится вмещать историю, результаты работы инструментов и собственные рассуждения. Разные требования — разные потолки.

Оба они видят одни и те же пиксели

Визуальный энкодер наследуется, так что это не случай, когда одна модель мультимодальная, а другая нет. Clef принимает до четырёх изображений на запрос — PNG, JPEG или WebP в кодировке base64, — которые используются всеми вопросами в полезной нагрузке, а видеокадры можно добавлять в виде массивов кадров. Пример с чеком в карточке задаёт вопрос с ответом «да/нет» о том, разборчива ли итоговая сумма, — это тот же замысел в миниатюре. Qwen3.8-27B — нативная визуально-языковая модель с OmniDocBench 1.5 на уровне 91,1, RealWorldQA на уровне 85,9 и CharXiv на уровне 78,8 в карточке производителя.

Разница в том, что вы получаете в ответ. Clef выдаёт решение по каждому полю с привязанной вероятностью — это типизированный ответ о документе. Родительская модель выдаёт описание документа, которое вы затем парсите. Для большого класса задач с документами — проверить эту форму, найти этот пункт, превышает ли эта сумма порог — типизированный ответ и есть вся работа, а описание — это накладные расходы: вы платите за них, а затем выбрасываете.

Где на самом деле проходит черта

• Используйте Clef — ответы можно перечислить заранее, а писать парсер вам не хочется. Маршрутизация, триаж, гейтинг, проверки политик, извлечение полей документа. Закрытые наборы, от 2 до 255 вариантов на вопрос, до 64 вопросов, оцениваемых вместе.

• Возьмите Clef — решение находится на горячем пути, и 209 мс против 1 929 мс меняют то, на что способен конвейер. Это самая сильная причина для перехода, и это причина по задержке, а не по точности.

• Возьмём Clef — вам нужна детерминированность. Вариант, который вы не объявили, не может вернуться, потому что нет шага генерации, который бы его создал.

• Оставьте Qwen3.8-27B — ответ — это не выбор из списка: суммирование, составление черновиков, рассуждение над новой задачей, написание кода, управление инструментами на длинном горизонте. Clef ничего из этого не умеет — и он вам об этом не скажет.

• Оставьте Qwen3.8-27B — вам нужна модель, которая скажет «ни один из этих вариантов». Модель принятия решений оценивает предложенные ей варианты. Передайте ей схему для выставления счетов/технических вопросов/продаж и запрос о конфиденциальности, и она вернёт наименее плохой из этих трёх, а не откажется. Родительская модель выявляет вопрос, который вам не пришло в голову задать.

• Оставьте Qwen3.8-27B — для работы с контекстом или длинными документами. Вчетверо больше размещённого окна — до расширения до миллиона токенов.

Читайте этот список как конвейер, а не как вердикт, потому что именно таков он и есть. Архитектура делает эту связь буквальной: Clef является проходом предзаполнения родителя, но с другим механизмом формирования ответа на выходе. Разумный дизайн ставит Clef впереди — определить маршрут, приоритет, флаг эскалации — и оставляет Qwen3.8-27B позади него, чтобы тот действовал по этому решению. Эти двое — взаимодополняющие компоненты, которые, так уж вышло, делят одну загрузку.

Где запускать каждый из них

Clef размещён в Workers AI от Cloudflare по указанной выше цене $0,24 за миллион входных токенов, а веса под лицензией Apache-2.0 можно запускать локально у себя. Новейшая площадка — запись в библиотеке Ollama: ollama pull clef требует Ollama 0.35.1 или новее, поскольку модель общается через конечную точку /v1/systemone, которую Ollama добавила для моделей принятия решений. Смотрите на теги, а не на заголовок — теги по умолчанию и clef:27b занимают 18 ГБ, это четырёхбитная сборка 55-гигабайтной модели; clef:27b-q8_0 — 30 ГБ, clef:27b-nvfp4 — 18 ГБ, clef:27b-mxfp8 — 31 ГБ, а clef:27b-mlx-bf16 — это полные 55 ГБ для Apple silicon. Собственный Python SDK от TypeSafe будет с ней работать, если направить его на локальный Ollama и передать любой ключ API, который среда выполнения игнорирует. Одно предостережение, которое даст о себе знать в продакшене: confidence измеряет, насколько сконцентрированы вероятности, а не вероятность того, что ответ правильный, а ничьи разрешаются в порядке объявленных вами вариантов.

Родительский элемент нужно разместить за API. Qwen3.8-3.8 маршрутизируется через Orca по цене $0.33 и $1.44 за миллион токенов, и это одна из более чем 200 моделей, доступных через OpenAI-совместимый ключ. Потому что он передаётся по цене $0.33 и $1.44?

Сам Clef не входит в число наших маршрутов — наш публичный каталог по нему ничего не возвращает, и ничто здесь не должно восприниматься как заявление о доступности с нашей стороны. Но у нас действительно есть модель, которая делает паттерн принятия решений достижимым без аккаунта Cloudflare — модель TypeSafeJev 1.13 — это маршрут из каталога по цене $0.042 за миллион входных токенов с контекстом 65 536 токенов, замеренным на p50 в 148 мс в том же семидневном окне, и он использует идентичнуюPOST /v1/systemone форму запроса. Поскольку Clef намеренно совместим с Jev по API, пайплайн, построенный под любой из них, отстоит от другого всего на одно изменение конфигурации — а именно этот случай слой маршрутизации и существует, чтобы сделать бесплатным. Держите оба достижимыми, замеряйте на своих собственных метках и позвольте победителю стать точкой данных, а не архитектурным обязательством. Если модель принятия решений в итоге становится шлюзом для агента, модель, которая действует на основе решения, всё равно должна оставаться достижимой, и эта половина уже находится за тем же ключом.

OrcaRouter's own model page for qwen/qwen3.8-27b, showing a 262,144-token context window and pricing of $0.33 per million input tokens and $2.40 per million output tokens.

Что могло бы изменить это чтение?

Три вещи — в порядке возрастания того, насколько сильно они могли бы это изменить.

Третьей стороне нужно повторно запустить Decision Index. Набор тестов общедоступен, и Cloudflare описывает эти оценки как воспроизводимые, так что это выполнимо — и именно за ячейкой CLINC150 out-of-scope стоит следить внимательнее всего, потому что 97,4 у 27B — это либо настоящее преимущество над 89,3 у Jev на самой сложной половине маршрутизации, либо артефакт стенда, собранного внутри компании. Пока никто за пределами Cloudflare этого не знает.

Кто-то должен оценить Cleo и Qwen3.8-27B на одной и той же задаче классификации с одними и теми же метками. Только такое сравнение позволило бы определить, является ли замена головы компромиссом по качеству или улучшением качества для решений на закрытом множестве, и ни у одного вендора нет стимула его проводить. До тех пор разрыв в сорок пунктов по GPQA остаётся лучшим доступным свидетельством того, что было убрано, и это свидетельство о не той задаче.

А задержке Clef нужен p95 при конкурентной нагрузке. Медианные 209 мс измерил сам вендор, на оборудовании, которое вендор контролирует, для модели, вся суть которой в том, что она находится на горячем пути. Соотношение с авторегрессивной родительской моделью — свойство архитектуры, и оно сохранится. А вот абсолютным миллисекундам доверять не стоит — и именно на них держится всё обоснование бизнес-кейса.

Qwen3.8-27B — одна из более чем 200 моделей, доступных через один OpenAI-совместимый ключ — Qwen3.8-27B.