Сгенерированная титульная карточка с надписью «Clef vs MathForm-8B», подзаголовком «один отвечает на ваш вопрос, другой пишет доказательство», и плашками «Apache 2.0 у обоих» и «две дообученные модели Qwen». Логотип OrcaRouter наложен в правом нижнем углу.
Engineering & Research

Clef против MathForm-8B: один отвечает на ваш вопрос, другой пишет доказательство

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Причина, по которой стоит поставить Cloudflare/clef рядом с openbmb/MathForm-8B, заключается в том, что это две вещи в открытых весах, которые сейчас легче всего перепутать, а путаница между ними обходится в один запуск обучения. Обе являются файнтюнами, построенными на чекпоинтах Qwen3.8-27B и Qwen3-8B соответственно. Обе под лицензией Apache-2.0. Обе были опубликованы за последние десять недель. Обе узконаправленные, созданные для конкретной цели, и их создатели описывают их как специализированные, а не общего назначения. И они не имеют друг к другу ровно никакого отношения, потому что одна выдаёт число, выбранное из предоставленного вами списка, а другая выдаёт исходный код на Lean 4, токен за токеном, для проверки ассистентом доказательств.

Clef — это мультимодальная модель принятия решений от Cloudflare на 27 миллиардов параметров: вы подаёте ей состояние и схему типизированных вопросов, и она возвращает калиброванную вероятность для каждого допустимого ответа за один неавторегрессионный проход, причём нигде на этом пути не происходит генерации текста. MathForm-8B от OpenBMB — это модель автоформализации: на входе — математическое утверждение на естественном языке, на выходе — Lean 4, а конвейер, на котором её обучали, описан в препринте arXiv, опубликованном вместе с весами 14 августа 2026 года. Потолок одной модели — размер вашего списка вариантов. Потолок другой — сила теории типов Lean. Вопрос о том, какая из них лучше, — это категориальная ошибка, и тот факт, что обе представляют собой файнтюны с открытыми весами под Apache-2.0 размером от восьми до двадцати семи миллиардов параметров, как раз и делает эту ошибку легко совершаемой.

Что физически запрещает интерфейс каждой модели

Самый быстрый способ увидеть расхождение — прочитать, что каждый из них может вернуть.

• Входные данные — Clef принимает состояние (текст, JSON, изображения или видеокадры) плюс от 1 до 64 именованных типизированных вопросов; MathForm-8B принимает математическое утверждение на естественном языке.

• Вывод — Clef возвращает по одной вероятности для каждого допустимого варианта, нормализованной через softmax по каждому вопросу. MathForm-8B возвращает исходный код на Lean 4.

• Типы вопросов — в Clef используются noul (истина/ложь, с вероятностью истины), выбор (от 2 до 26 именованных вариантов) и оценка (от 2 до 26 упорядоченных уровней); в MathForm-8B вообще нет понятия вопроса.

• Калибровка — Clef публикует поле уверенности для каждого ответа; MathForm-8B публикует показатели Pass@8 при проверках синтаксиса и согласованности.

• Обслуживание — Clef обслуживается через совместимое с Jev/SystemOne POST /v1/systemone тело; доступно размещение на хостинге или самостоятельный запуск; MathForm-8B поставляется с инструкциями для Transformers, vLLM и SGLang, все они предоставляют OpenAI-совместимую конечную точку генерации при контексте в 16 384 токена с max_new_tokens, установленным на 16 384.

Практическое следствие вытекает сразу. Если вам нужно суждение «да/нет» о фрагменте текста, Clef — единственный из этих двух, кто способен его выдать: MathForm-8B невозможно задать вопрос, который не сводился бы к «напиши Lean 4 для этого». Если вам нужен Lean 4, Clef — единственный из этих двух, кто категорически не может его выдать, и не из-за слабости: просьба к привязанному к схеме оценщику формализовать теорему не вписывается в его контракт, поэтому такой запрос отклоняется в силу самой конструкции, а не получает плохой ответ.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Конвейер, к которому принадлежат они оба

Существует реальная архитектура, в которой эти две модели располагаются рядом друг с другом, и стоит пройтись по ней, потому что она делает это разделение конкретным, а не абстрактным. Рассмотрим сервис, который формализует математику для исследователей и студентов.

Утверждения поступают на естественном языке, неограниченные по типу. Прежде чем что-либо можно будет формализовать, что-то должно решить, что поступило. Это теорема, которую нужно доказать, определение, которое нужно добавить, запрос на проверку существующего доказательства или вопрос, требующий уточнения, прежде чем кто-либо прикоснётся к Lean? Является ли оно самодостаточным или опирается на контекст, который пользователь не предоставил? Являются ли символы общепринятыми или эта нотация системе никогда не встречалась? Каждый из этих вопросов — это ограниченный вопрос с небольшим набором вариантов — точная форма Clef — и калиброванная вероятность, привязанная к каждому ответу, позволяет сервису сделать что-то разумное с неуверенными: направить всё, что ниже порога, человеку вместо того, чтобы угадывать.

Второй шаг — за MathForm-8B. Возьмите утверждение, уже классифицированное как самодостаточная теорема с известными обозначениями, и выдайте код на Lean 4. Это задача генерации, и вопрос качества состоит в том, как часто результат компилируется и как часто он означает то же самое, что и исходный, — а именно это измеряют две оси оценки поставщика. Из этого сопоставления стоит извлечь общую закономерность: дешёвый ограниченный классификатор перед дорогим специализированным генератором обычно дешевле и надёжнее, чем просить генератор решить, следует ли ему вообще запускаться.

Что на самом деле означают числа с каждой стороны

В аннотации OpenBMB на arXiv сообщается, что MathForm-8B достигает средних показателей Pass@8 в 88,06% при Syntax Check и 72,37% при Consistency Check на шести бенчмарках, а на подмножествах FATE-H и FATE-X — показателей прохождения проверки на согласованность 63% и 37%, и оба эти показателя выше, чем у самых сильных специализированных базовых моделей, с которыми сравнивается в статье. Самое интересное в этом утверждении — конвейер обучения: планировщик извлечения вытаскивает релевантные определения и существующие формализации из Mathlib перед генерацией, а сгенерированные утверждения затем дорабатываются с использованием диагностики компилятора и обратной связи по семантической согласованности; именно так был построен набор данных FormalVerse из примерно 367 000 проверенных примеров на Lean 4 перед контролируемой тонкой настройкой и обучением с подкреплением. Это заявленные производителем цифры из статьи и карточки модели. Никто из независимых исследователей их не воспроизводил.

Показатели Clef измеряют совсем другое и несопоставимы. В прогоне Cloudflare Decision Index сообщается макро-F1 по интентам BANKING77 — 94,2, CLINC150 с обработкой out-of-scope — 97,4, GPQA Diamond — 48,0, тогда как более старая Jev набирает 78,3, а медианная задержка запроса составляет 209,3 мс. Это таблица о классификации и маршрутизации, подготовленная вендором на собственном наборе вендора, размещённая на собственном лидерборде вендора и не была воспроизведена.

Единственная честная фраза, которую можно написать об этих двух столбцах, — что у них нет ни общего бенчмарка, ни общей единицы измерения, ни общей философии оценки. 37% MathForm-8B на сложном подмножестве формализации и 97,4 Clef при обнаружении интентов вне области — это оба настоящие заявления их создателей о разных задачах, и читатель, который ставит их рядом, не узнал ничего, кроме того, что оба числа существуют.

Что бы вы запустили и сколько это стоит

Ни одна из этих моделей не является маршрутом на OrcaRouter, и эта статья не содержит заявлений о доступности — каталог возвращает 404 для cloudflare/clef и для MathForm-8B. Репозиторий MathForm занимает около 16,4 ГБ, обе модели имеют лицензию Apache-2.0, поэтому уже завтра обе сможет развернуть у себя любой, у кого есть необходимое оборудование.

• Clef на Cloudflare — $0,24 за миллион входных токенов в Workers AI, с опубликованной задержкой, измеренной на одном H200.

• MathForm-8B с самостоятельным развёртыванием — без хостинга у поставщика, без цены за токен и с задокументированным контекстом в 16 384 токена, а это ограничение, которое стоит учитывать: длинный раздел статьи не поместится за один проход.

• Маршрутизируемая альтернатива для классификаторной половины — Jev 1.13 от TypeSafe по цене $0,042 за миллион входных токенов при контексте 65 536 токенов, обслуживаемая через то же POST /v1/systemone тело запроса, которое использует Clef, что делает её готовой заменой для первого шага описанного выше конвейера.

Именно здесь слой маршрутизации заслуживает своё место в этом конкретном сочетании. Схема состоит из решающего компонента и генератора, и именно у решающей половины есть живая замена — одна конечная точка перед более чем 200 моделями, списочная цена провайдера, передаваемая без наценки за токен, и автоматическое переключение при сбое, чтобы неудачный день провайдера не остановил входную дверь вашего пайплайна. Генеративная половина — это артефакт на 16,4 ГБ, который вы запускаете сами, и никакая конечная точка этого не меняет.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

Ещё одна вещь, которую скрывают размеры

Число параметров провоцирует сравнение, которое не выдерживает критики. Clef — 27B, а MathForm-8B — 8B, поэтому естественно предположить, что большая модель — более способная, а меньшая — специализированная. Но по сути всё наоборот. Clef большая, потому что несёт замороженный мультимодальный бэкбон, который ей нужен, чтобы читать скриншоты и счета; обучаемая часть поверх него — небольшая голова схемы с адаптерами ранга 256. MathForm-8B мала, потому что Lean 4 — узкая цель, и базы Qwen3-8B хватило, чтобы её достичь, а настоящая инженерия заключается в конвейере поиска и верификации, который создал её обучающие данные, а не в количестве её параметров.

Размер, иными словами, говорит вам о том, что пришлось нести каждой модели, а не о том, насколько трудна решаемая ею задача. Модель на 27B, которая читает чек и возвращает "billing, 0.98", и модель на 8B, которая выдаёт компилируемый Lean, обе делают ровно то, для чего были созданы, и сравнение «восемь миллиардов против двадцати семи миллиардов» примерно в половине случаев приведёт вас не к той модели.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

Решение — и вопрос, на который не ответил ни один из поставщиков.

Если у вас есть конвейер, который принимает неограниченный естественный язык и должен маршрутизировать его до того, как потратить на него вычисления, первый шаг — ограниченный классификатор: Clef — там, где важен его мультимодальный ввод и его показатели хорошо выглядят на ваших данных, или Jev 1.13 — там, где вам нужна та же форма запроса по более низкой каталожной цене и без привязки вашей архитектуры к вендору, чью оценку никто не воспроизвёл. Второй шаг — специализированный генератор, и если этот генератор — Lean 4, то MathForm-8B — это открытая модель, созданная именно для этого, с опубликованным конвейером и корпусом за ней.

С обеих сторон недостаёт доказательств одного и того же рода. Прогон Clef по Decision Index выполнен самой Cloudflare и никогда не воспроизводился независимо; показатели Pass@8 у MathForm-8B взяты из его собственной статьи. И то и другое — амбициозные заявления в области, где честный тест дёшево описать и дорого провести: взять данные, на которых не обучался ни один из вендоров, применить один и тот же пайплайн и опубликовать результат. Пока кто-нибудь не сделает этого для любой из этих моделей, полезное, что это сравнение может вам сказать, — это форма: одна из них должна стоять в начале вашего пайплайна, решая, что поступает, а другая — за ним, выполняя тяжёлую, узкую работу, и ни одна не заменяет другую при любом числе параметров.