
Clef против Gemma 4 12B: устройство для принятия решений на 64K токенов против универсальной модели на 256K токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Самое полезное число в сравнении между Clef и Gemma 4 12B — это не оценка в бенчмарке. Это 65 536 против 256 000 — размеры контекстных окон. Cloudflare/clef — это 27-миллиардная мультимодальная модель принятия решений, постобученная на основе Qwen3.8-27B, которая читает состояние и схему типизированных вопросов и возвращает вероятность для каждого допустимого ответа за один неавторегрессионный проход. Gemma 4 12B — чекпойнт Unified, google/gemma-4-12B-it — это безэнкодерная модель вендора на 11,95 миллиарда параметров, работающая по принципу any-to-any и выпущенная летом 2026 года, которая генерирует текст в окне на 256 000 токенов более чем на 140 языках. Поставьте папку с договорами перед обеими — и у модели принятия решений место закончится в четыре раза раньше, потому что её потолок документально составляет 65 536 токенов, тогда как у универсальной модели — 256 000. Эта асимметрия — не сноска. Для целого класса задач маршрутизации — длинных документов, вставленных веток обсуждений, многостраничных форм — она определяет выбор ещё до того, как вообще заходит речь о точности.
Так что это не страница о том, какая модель лучше. Это страница о двух осях, по которым они действительно различаются: какой объём состояния каждая способна удерживать и какую форму ответа каждая физически способна выдать. Всё остальное — либо показатель от вендора, который никто не воспроизвёл, либо сравнение, означающее не то, чем кажется.
Что представляет собой каждый из них, по одному абзацу на каждый
Clef — это 27B-модель принятия решений от Cloudflare, опубликованная под Apache-2.0 с весами на Hugging Face и размещённой конечной точкой на Workers AI. Cloudflare заморозила основу Qwen3.8-27B, включая её визуальный энкодер, присоединила совместную голову схемы плюс низкоранговые адаптеры ранга 256 и обучила её с помощью сглаженной по меткам перекрёстной энтропии для валидных ответов по схеме вместе с потерей Брайера для повышения калибровки. Вы подаёте состояние — текст, JSON, изображения или видеокадры — и от одного до 64 именованных вопросов, каждый из которых имеет тип noul (истина/ложь, возвращает вероятность истины), choice (от 2 до 26 именованных вариантов) или score (от 2 до 26 упорядоченных уровней). В ответ возвращается распределение по каждому вопросу и ничего больше. Пути генерации текста нет вообще.
Gemma 4 12B — это универсальная модель, генерирующая текст. Она не использует энкодер: вместо отдельных визуальных или аудиобашен необработанные патчи изображений и звуковые волны проецируются напрямую в пространство эмбеддингов языковой модели через лёгкие линейные слои — именно это позволяет ей принимать текст, изображения, видео и аудио без отдельного конвейера для каждой модальности. У неё есть настраиваемые режимы размышления, нативный вызов функций, словарь на 262K токенов и гибридная схема внимания, которая чередует скользящее оконное внимание на 1 024 токена с полным глобальным вниманием. Она распространяется под Apache-2.0 вместе с собственными условиями использования от вендора, и это тот самый чекпойнт, который большинство людей имеет в виду, когда говорит «запустите модель такого размера локально».
Об одном стоит сказать прямо, прежде чем идти дальше: ни одна из этих моделей не является маршрутом на OrcaRouter. Наш каталог возвращает 404 для cloudflare/clef и для чекпойнта 12B из того же семейства, и ничто в этом материале не должно восприниматься как заявление о доступности с нашей стороны. Что у нас действительно есть из семейства Gemma — так это две более крупные версии, а их цены указаны ниже.

Список опций — это интерфейс, и у него есть режим отказа.
Структурное различие между этими двумя заключается в том, что происходит с входными данными, которые не подходят.
• Вывод — Clef возвращает вероятность для каждого объявленного варианта, и только для них. Gemma 4 12B возвращает сгенерированный текст.
• Отказ — В Clef нет варианта «ничего из перечисленного», если только вы сами не впишете его в критерии. Gemma 4 12B может описать случай, который не подходит ни под что из того, о чём вы спрашивали.
• Режим отказа — ошибка Clef безмолвна: уверенный выбор внутри вашей схемы, исключение не возникает, ни одна ветка отката не срабатывает. Ошибка универсала обычно громкая: текст, который не поддаётся разбору.
• Тестируемость — фиксированный набор опций делает компонент воспроизводимым и недорогим для аудита. Свободный текст делает его гибким и дорогостоящим для проверки.
Собственные цифры Clef по этой проблеме с отказами — самые слабые из публикуемых ею показателей. На CLINC150 с обработкой выхода за пределы области — детекция интентов, где один из допустимых ответов звучит как «это не относится ни к одной категории», — 27B набирает 97,4 macro-F1, что является лучшим результатом в таблице Cloudflare и причиной, по которой стоит предпочесть 27B его же собрату 9B, набирающему 66,8 на том же бенчмарке. Разрыв в тридцать пунктов между двумя моделями, собранными по одному и тому же рецепту, говорит о том, что поведение при выходе за пределы области — это то, что даёт масштаб на этапе пост-обучения, и именно от этого тихо зависят большинство маршрутизирующих пайплайнов. Задокументированное Cloudflare средство — второй вопрос в схеме: добавить поле noul, спрашивающее, подходит ли состояние вообще, а затем задать для него порог, — что работает и что является вашей задачей, а не задачей модели.
Откуда берутся числа, важнее того, что они говорят.
Каждый показатель Clef в этой статье исходит от Cloudflare: из её карточки модели, её поста о запуске или её прогона Decision Index. Сам набор тестов принадлежит Cloudflare, и таблица лидеров, на которой размещены результаты, тоже принадлежит Cloudflare. Это поставщик, который измеряет свой продукт на контролируемом им оборудовании в сравнении с конкурентом, чей API он намеренно повторяет. Ни одна третья сторона не воспроизвела ничего из этого, и этот материал не собирается делать вид, что это не так.
Колонка Gemma 4 12B — это доказательство иного рода. В собственной карточке производителя опубликованы MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 без инструментов — 77,5%, и LiveCodeBench v6 — 72,0%. Artificial Analysis, независимый трекер, индексирует конфигурацию рассуждений с Intelligence Index 14,18, с указанными $0,10 / $0,30 за миллион токенов и измеренной медианной скоростью вывода около 113 токенов в секунду — а на собственной странице отмечается, что эти показатели зависят от рабочей нагрузки и аппаратного обеспечения.
Честное прочтение таково: эти два столбца вообще несопоставимы. Один — это набор тестов производителя для оценки качества решений, проводимый самим производителем; другой — смесь бенчмарков производителя и независимой оценки универсальной модели. Приводить 97,4 рядом с 77,2 так, будто это столбцы одной и той же таблицы, было бы самым вводящим в заблуждение поступком, какой эта страница могла бы совершить.
Задержка — единственная область, где их хотя бы можно обсуждать в одних и тех же единицах, и даже там оговорки накапливаются. Cloudflare сообщает о Clef: 209,3 мс медианы и 238,6 мс p95 по измерениям на своей собственной инфраструктуре. Artificial Analysis измеряет время 12B до первого чанка примерно в 2,4 секунды в конфигурации рассуждения, которая включает бюджет размышлений, отсутствующий у модели принятия решений. Неавторегрессионный проход за 209 мс против 2,4-секундного старта генерации — это реальное архитектурное различие: один прямой проход против цикла декодирования, — и это сильнейший аргумент Clef в пользу горячего пути. Кроме того, при 27B это модель, которой для достижения такого показателя нужна аппаратура класса H200, а Cloudflare берёт $0,24 за миллион входных токенов, чтобы запускать её для вас.

Что на самом деле даёт вам 64K контекста
Контекст — это то, где данное сравнение становится практичным и где генералист с большим отрывом выигрывает на бумаге.
• Clef — 65 536 токенов, согласно странице модели Workers AI и публикации о запуске; встроенный помощник кодирования по умолчанию использует значение max_length=16,384, которое является значением по умолчанию, а не верхним пределом, но именно его вы получите, если будете использовать загрузчик в том виде, в каком он поставляется.
• Gemma 4 12B — 256 000 токенов, согласно карточке вендора, с вниманием со скользящим окном на 1 024 токена, чтобы снизить затраты на длинный контекст.
• Изображения — Clef оценивает изображения и видеокадры совместно с текстовым состоянием через унаследованный визуальный энкодер. Gemma 4 12B принимает текст, изображения, видео и аудио через свой путь без энкодера.
• Языки — в карточке Clef мультиязычность не заявлена; Gemma 4 12B документирована более чем на 140 языках.
Для тикета, счёта или отрендеренного скриншота 64K — это щедро, и разница чисто теоретическая. Для контракта на 200 страниц, который нужно классифицировать поле за полем, в этом вся суть: универсальная модель может удержать документ, а модель принятия решений — нет. Ответ Clef на это — чанкинг, а разбиение документа на фрагменты до того, как вы примете по нему решение, означает, что вы уже приняли решение, которое должна была принять модель. Это реальное ограничение, и о нём стоит говорить именно как о таковом.
Сколько вы на самом деле заплатите и где
Ни одной из этих моделей нет в нашем каталоге, поэтому вопрос о цене распадается на три варианта.
• Clef — $0,24 за миллион входных токенов в Workers AI от Cloudflare или при самостоятельном хостинге на основе весов Apache-2.0; опубликованная Cloudflare задержка измерялась на одном H200 с torch 2.11 и transformers 5.10.2, а появившиеся в течение двух дней квантованные версии от сообщества позволяют предположить, что её можно сделать ещё меньше ценой некоторой потери точности, которую никто не измерял.
• Gemma 4 12B — здесь вообще нет хостингового маршрута. Вы скачиваете примерно 24 ГБ весов BF16 и обслуживаете их сами либо обращаетесь к сторонней платформе. Цены за токен, которую мы могли бы назвать, не существует.
• Маршрутизируемая замена — Gemma 4 26B A4B, смесь экспертов с 25,2 млрд общих и 3,8 млрд активных параметров, представлена на OrcaRouter по цене $0.06 за миллион входных и $0.33 за миллион выходных токенов при контексте 262 144 токена. Gemma 4 31B — плотный мультимодальный собрат с настраиваемым мышлением и нативным вызовом функций — представлен по цене $0.13 и $0.38. Обе доступны по одному ключу с передачей цены провайдера по прайс-листу без наценки за токен и автоматическим переключением между провайдерами при сбое.
Эта последняя строка — честная версия нашего участия в этом сравнении. Если вам нужен универсал, который читает длинный документ и пишет одно предложение, то дешёвый путь к нему — это размер Gemma 4, который мы действительно обслуживаем, и он стоит меньше за миллион токенов, чем самостоятельный хостинг 12B на арендованных GPU. Если вам нужно ограниченное решение на горячем пути, медианные 209 мс у Clef — это реальное архитектурное свойство, и ближайшее к нему в нашем каталоге — Jev 1.13 от TypeSafe — модель, которую Cloudflare бенчмаркал и у которой скопировал формат передачи, — по цене $0.042 за миллион входных токенов при контексте 65 536 токенов, обслуживаемая через тот же POST /v1/systemone формат. Поскольку оба API-совместимы за тонким адаптером, попробовать Clef против текущего решения — это эксперимент, а не миграция, и эксперимент остаётся дешёвым, когда обе стороны доступны через одну конечную точку.

Решение, сформулированное как решение
Выбирайте Clef, когда ответы перечислимы, состояние укладывается в 64K, решение находится на пути, чувствительном к задержке, и вы готовы сами отвечать за остаточный класс. Показатель 97.4 у модели 27B на детекции интентов вне области — вот почему за неё стоит платить вместо младшей 9B, а её фиксированная форма вывода — то, что делает компонент проверяемым без парсера.
Выбирайте Gemma 4 12B, когда входные данные длинные, когда модальность — аудио или видео, когда ответ должен быть в виде связного текста или когда категории ещё неизвестны — потому что «разложите эту кучу по любым осмысленным группам» — это запрос, который модель принятия решений не может принять, а не тот, с которым она плохо справляется. Это универсал с независимой оценкой за плечами, и для открытых задач это ценнее, чем таблица от поставщика.
И относитесь скептически к обоим наборам цифр по причине, которую эта статья повторяет снова и снова: Cloudflare не был независимо воспроизведён ни на чём, а эта карточка — собственная таблица бенчмарков вендора. Единственное по-настоящему интересное число из этой пары — действительно ли 27B schema head сохраняет свою оценку 97,4 по out-of-scope на данных, на которых её не обучали, — это ровно то число, которое не может окончательно установить ни один из вендоров, а третья сторона могла бы.
