Сгенерированная титульная карточка с надписью «Clef vs Gemma 4 12B», с подзаголовком «модель принятия решений на 64K токенов против универсала на 256K токенов», с плашками «контекст: 65 536 против 256 000» и «вероятности против прозы». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Clef против Gemma 4 12B: устройство для принятия решений на 64K токенов против универсальной модели на 256K токенов

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое полезное число в сравнении между Clef и Gemma 4 12B — это не оценка в бенчмарке. Это 65 536 против 256 000 — размеры контекстных окон. Cloudflare/clef — это 27-миллиардная мультимодальная модель принятия решений, постобученная на основе Qwen3.8-27B, которая читает состояние и схему типизированных вопросов и возвращает вероятность для каждого допустимого ответа за один неавторегрессионный проход. Gemma 4 12B — чекпойнт Unified, google/gemma-4-12B-it — это безэнкодерная модель вендора на 11,95 миллиарда параметров, работающая по принципу any-to-any и выпущенная летом 2026 года, которая генерирует текст в окне на 256 000 токенов более чем на 140 языках. Поставьте папку с договорами перед обеими — и у модели принятия решений место закончится в четыре раза раньше, потому что её потолок документально составляет 65 536 токенов, тогда как у универсальной модели — 256 000. Эта асимметрия — не сноска. Для целого класса задач маршрутизации — длинных документов, вставленных веток обсуждений, многостраничных форм — она определяет выбор ещё до того, как вообще заходит речь о точности.

Так что это не страница о том, какая модель лучше. Это страница о двух осях, по которым они действительно различаются: какой объём состояния каждая способна удерживать и какую форму ответа каждая физически способна выдать. Всё остальное — либо показатель от вендора, который никто не воспроизвёл, либо сравнение, означающее не то, чем кажется.

Что представляет собой каждый из них, по одному абзацу на каждый

Clef — это 27B-модель принятия решений от Cloudflare, опубликованная под Apache-2.0 с весами на Hugging Face и размещённой конечной точкой на Workers AI. Cloudflare заморозила основу Qwen3.8-27B, включая её визуальный энкодер, присоединила совместную голову схемы плюс низкоранговые адаптеры ранга 256 и обучила её с помощью сглаженной по меткам перекрёстной энтропии для валидных ответов по схеме вместе с потерей Брайера для повышения калибровки. Вы подаёте состояние — текст, JSON, изображения или видеокадры — и от одного до 64 именованных вопросов, каждый из которых имеет тип noul (истина/ложь, возвращает вероятность истины), choice (от 2 до 26 именованных вариантов) или score (от 2 до 26 упорядоченных уровней). В ответ возвращается распределение по каждому вопросу и ничего больше. Пути генерации текста нет вообще.

Gemma 4 12B — это универсальная модель, генерирующая текст. Она не использует энкодер: вместо отдельных визуальных или аудиобашен необработанные патчи изображений и звуковые волны проецируются напрямую в пространство эмбеддингов языковой модели через лёгкие линейные слои — именно это позволяет ей принимать текст, изображения, видео и аудио без отдельного конвейера для каждой модальности. У неё есть настраиваемые режимы размышления, нативный вызов функций, словарь на 262K токенов и гибридная схема внимания, которая чередует скользящее оконное внимание на 1 024 токена с полным глобальным вниманием. Она распространяется под Apache-2.0 вместе с собственными условиями использования от вендора, и это тот самый чекпойнт, который большинство людей имеет в виду, когда говорит «запустите модель такого размера локально».

Об одном стоит сказать прямо, прежде чем идти дальше: ни одна из этих моделей не является маршрутом на OrcaRouter. Наш каталог возвращает 404 для cloudflare/clef и для чекпойнта 12B из того же семейства, и ничто в этом материале не должно восприниматься как заявление о доступности с нашей стороны. Что у нас действительно есть из семейства Gemma — так это две более крупные версии, а их цены указаны ниже.

A two-column comparison scoreboard titled 'Clef vs Gemma 4 12B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Context: 65,536 tokens; Output: probability per option, no text; Input: text, JSON, images, video; Latency: 209.3 ms median, H200; Evidence: vendor's own Decision Index. The right column 'Gemma 4 12B' reads: Parameters: 11.95B dense, encoder-free; Context: 256,000 tokens; Output: generated text; Input: text, image, video, audio; Latency: about 2.4 s to first chunk; Evidence: vendor card plus Artificial Analysis. A footer reads 'Clef figures unaudited; Gemma figures per Google's card and Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Список опций — это интерфейс, и у него есть режим отказа.

Структурное различие между этими двумя заключается в том, что происходит с входными данными, которые не подходят.

• Вывод — Clef возвращает вероятность для каждого объявленного варианта, и только для них. Gemma 4 12B возвращает сгенерированный текст.

• Отказ — В Clef нет варианта «ничего из перечисленного», если только вы сами не впишете его в критерии. Gemma 4 12B может описать случай, который не подходит ни под что из того, о чём вы спрашивали.

• Режим отказа — ошибка Clef безмолвна: уверенный выбор внутри вашей схемы, исключение не возникает, ни одна ветка отката не срабатывает. Ошибка универсала обычно громкая: текст, который не поддаётся разбору.

• Тестируемость — фиксированный набор опций делает компонент воспроизводимым и недорогим для аудита. Свободный текст делает его гибким и дорогостоящим для проверки.

Собственные цифры Clef по этой проблеме с отказами — самые слабые из публикуемых ею показателей. На CLINC150 с обработкой выхода за пределы области — детекция интентов, где один из допустимых ответов звучит как «это не относится ни к одной категории», — 27B набирает 97,4 macro-F1, что является лучшим результатом в таблице Cloudflare и причиной, по которой стоит предпочесть 27B его же собрату 9B, набирающему 66,8 на том же бенчмарке. Разрыв в тридцать пунктов между двумя моделями, собранными по одному и тому же рецепту, говорит о том, что поведение при выходе за пределы области — это то, что даёт масштаб на этапе пост-обучения, и именно от этого тихо зависят большинство маршрутизирующих пайплайнов. Задокументированное Cloudflare средство — второй вопрос в схеме: добавить поле noul, спрашивающее, подходит ли состояние вообще, а затем задать для него порог, — что работает и что является вашей задачей, а не задачей модели.

Откуда берутся числа, важнее того, что они говорят.

Каждый показатель Clef в этой статье исходит от Cloudflare: из её карточки модели, её поста о запуске или её прогона Decision Index. Сам набор тестов принадлежит Cloudflare, и таблица лидеров, на которой размещены результаты, тоже принадлежит Cloudflare. Это поставщик, который измеряет свой продукт на контролируемом им оборудовании в сравнении с конкурентом, чей API он намеренно повторяет. Ни одна третья сторона не воспроизвела ничего из этого, и этот материал не собирается делать вид, что это не так.

Колонка Gemma 4 12B — это доказательство иного рода. В собственной карточке производителя опубликованы MMLU Pro 77,2%, GPQA Diamond 78,8%, AIME 2026 без инструментов — 77,5%, и LiveCodeBench v6 — 72,0%. Artificial Analysis, независимый трекер, индексирует конфигурацию рассуждений с Intelligence Index 14,18, с указанными $0,10 / $0,30 за миллион токенов и измеренной медианной скоростью вывода около 113 токенов в секунду — а на собственной странице отмечается, что эти показатели зависят от рабочей нагрузки и аппаратного обеспечения.

Честное прочтение таково: эти два столбца вообще несопоставимы. Один — это набор тестов производителя для оценки качества решений, проводимый самим производителем; другой — смесь бенчмарков производителя и независимой оценки универсальной модели. Приводить 97,4 рядом с 77,2 так, будто это столбцы одной и той же таблицы, было бы самым вводящим в заблуждение поступком, какой эта страница могла бы совершить.

Задержка — единственная область, где их хотя бы можно обсуждать в одних и тех же единицах, и даже там оговорки накапливаются. Cloudflare сообщает о Clef: 209,3 мс медианы и 238,6 мс p95 по измерениям на своей собственной инфраструктуре. Artificial Analysis измеряет время 12B до первого чанка примерно в 2,4 секунды в конфигурации рассуждения, которая включает бюджет размышлений, отсутствующий у модели принятия решений. Неавторегрессионный проход за 209 мс против 2,4-секундного старта генерации — это реальное архитектурное различие: один прямой проход против цикла декодирования, — и это сильнейший аргумент Clef в пользу горячего пути. Кроме того, при 27B это модель, которой для достижения такого показателя нужна аппаратура класса H200, а Cloudflare берёт $0,24 за миллион входных токенов, чтобы запускать её для вас.

A headless capture of the google/gemma-4-12B-it model card on Hugging Face, showing the model title, the Any-to-Any and Transformers and Safetensors tags, the gemma4_unified image-text-to-text architecture line, the Apache 2.0 licence line credited to Google DeepMind, and the note that the card covers the Gemma 4 12B Unified model.

Что на самом деле даёт вам 64K контекста

Контекст — это то, где данное сравнение становится практичным и где генералист с большим отрывом выигрывает на бумаге.

• Clef — 65 536 токенов, согласно странице модели Workers AI и публикации о запуске; встроенный помощник кодирования по умолчанию использует значение max_length=16,384, которое является значением по умолчанию, а не верхним пределом, но именно его вы получите, если будете использовать загрузчик в том виде, в каком он поставляется.

• Gemma 4 12B — 256 000 токенов, согласно карточке вендора, с вниманием со скользящим окном на 1 024 токена, чтобы снизить затраты на длинный контекст.

• Изображения — Clef оценивает изображения и видеокадры совместно с текстовым состоянием через унаследованный визуальный энкодер. Gemma 4 12B принимает текст, изображения, видео и аудио через свой путь без энкодера.

• Языки — в карточке Clef мультиязычность не заявлена; Gemma 4 12B документирована более чем на 140 языках.

Для тикета, счёта или отрендеренного скриншота 64K — это щедро, и разница чисто теоретическая. Для контракта на 200 страниц, который нужно классифицировать поле за полем, в этом вся суть: универсальная модель может удержать документ, а модель принятия решений — нет. Ответ Clef на это — чанкинг, а разбиение документа на фрагменты до того, как вы примете по нему решение, означает, что вы уже приняли решение, которое должна была принять модель. Это реальное ограничение, и о нём стоит говорить именно как о таковом.

Сколько вы на самом деле заплатите и где

Ни одной из этих моделей нет в нашем каталоге, поэтому вопрос о цене распадается на три варианта.

• Clef — $0,24 за миллион входных токенов в Workers AI от Cloudflare или при самостоятельном хостинге на основе весов Apache-2.0; опубликованная Cloudflare задержка измерялась на одном H200 с torch 2.11 и transformers 5.10.2, а появившиеся в течение двух дней квантованные версии от сообщества позволяют предположить, что её можно сделать ещё меньше ценой некоторой потери точности, которую никто не измерял.

• Gemma 4 12B — здесь вообще нет хостингового маршрута. Вы скачиваете примерно 24 ГБ весов BF16 и обслуживаете их сами либо обращаетесь к сторонней платформе. Цены за токен, которую мы могли бы назвать, не существует.

• Маршрутизируемая замена — Gemma 4 26B A4B, смесь экспертов с 25,2 млрд общих и 3,8 млрд активных параметров, представлена на OrcaRouter по цене $0.06 за миллион входных и $0.33 за миллион выходных токенов при контексте 262 144 токена. Gemma 4 31B — плотный мультимодальный собрат с настраиваемым мышлением и нативным вызовом функций — представлен по цене $0.13 и $0.38. Обе доступны по одному ключу с передачей цены провайдера по прайс-листу без наценки за токен и автоматическим переключением между провайдерами при сбое.

Эта последняя строка — честная версия нашего участия в этом сравнении. Если вам нужен универсал, который читает длинный документ и пишет одно предложение, то дешёвый путь к нему — это размер Gemma 4, который мы действительно обслуживаем, и он стоит меньше за миллион токенов, чем самостоятельный хостинг 12B на арендованных GPU. Если вам нужно ограниченное решение на горячем пути, медианные 209 мс у Clef — это реальное архитектурное свойство, и ближайшее к нему в нашем каталоге — Jev 1.13 от TypeSafe — модель, которую Cloudflare бенчмаркал и у которой скопировал формат передачи, — по цене $0.042 за миллион входных токенов при контексте 65 536 токенов, обслуживаемая через тот же POST /v1/systemone формат. Поскольку оба API-совместимы за тонким адаптером, попробовать Clef против текущего решения — это эксперимент, а не миграция, и эксперимент остаётся дешёвым, когда обе стороны доступны через одну конечную точку.

A headless capture of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the Gemma 4 31B title, the import date, a p50 TTFT latency figure, and the code-sample and benchmark navigation tabs.

Решение, сформулированное как решение

Выбирайте Clef, когда ответы перечислимы, состояние укладывается в 64K, решение находится на пути, чувствительном к задержке, и вы готовы сами отвечать за остаточный класс. Показатель 97.4 у модели 27B на детекции интентов вне области — вот почему за неё стоит платить вместо младшей 9B, а её фиксированная форма вывода — то, что делает компонент проверяемым без парсера.

Выбирайте Gemma 4 12B, когда входные данные длинные, когда модальность — аудио или видео, когда ответ должен быть в виде связного текста или когда категории ещё неизвестны — потому что «разложите эту кучу по любым осмысленным группам» — это запрос, который модель принятия решений не может принять, а не тот, с которым она плохо справляется. Это универсал с независимой оценкой за плечами, и для открытых задач это ценнее, чем таблица от поставщика.

И относитесь скептически к обоим наборам цифр по причине, которую эта статья повторяет снова и снова: Cloudflare не был независимо воспроизведён ни на чём, а эта карточка — собственная таблица бенчмарков вендора. Единственное по-настоящему интересное число из этой пары — действительно ли 27B schema head сохраняет свою оценку 97,4 по out-of-scope на данных, на которых её не обучали, — это ровно то число, которое не может окончательно установить ни один из вендоров, а третья сторона могла бы.