Сгенерированная титульная карточка с заголовком «TwIL-LM3-Pro vs MathForm 8B» и подзаголовком «Утверждение против следования», с двумя скруглёнными карточками с надписями «MathForm 8B — выдаёт утверждение Lean 4» и «TwIL-LM3-Pro — оценивает утверждение». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

TwIL-LM3-Pro vs MathForm 8B: утверждение и логическое следование — две разные половины формализации

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

TwIL-LM3-Pro и MathForm-8B нацелены на одну и ту же широкую задачу — заставить машину порождать формальный, проверяемый текст, а не правдоподобную прозу, — и каждый из них решает свою половину этой задачи. MathForm-8B — это автоформализатор от OpenBMB на 8 миллиардов параметров, выпущенный в сентябре 2026 года: он превращает задачу, сформулированную на естественном языке, в утверждение на Lean 4, оставляя обязательство доказательства открытым для проверки компилятором. TwIL-LM3-Pro — это модель формальной логики от webAI на 3,66 млрд параметров, появившаяся в сентябре 2026 года, а её целевые выходные данные — это метки логического следования, переводы в логику первого порядка, семантические разборы и критика доказательств на Lean. Один создаёт то, что предстоит проверить. Другой говорит, действительно ли то, что у вас есть, влечёт то, что вы утверждаете.

Поскольку они пересекаются ровно в одной области — формализации в Lean, — страница сравнения и соблазнительна, и обманчива. Более полезный вопрос — за что каждую из них обучали получать вознаграждение, потому что именно сигнал вознаграждения — это то место, где два дизайна расходятся наиболее резко и где на самом деле кроется более разумный выбор.

Утверждение против следования

MathForm-8B обучен на FormalVerse — корпусе Lean 4, который в статье OpenBMB описывается как примерно 367 000 верифицированных примеров, — с помощью обучения с учителем, за которым следует обучение с подкреплением. Конвейер вокруг него извлекает соответствующие определения и существующие формализации из Mathlib перед генерацией, а затем уточняет их с помощью диагностики компилятора и проверки семантической согласованности. Его вывод — это формальное утверждение (импорты, типы, заголовок теоремы), которое внешний компилятор принимает или отклоняет. В карточке модели прямо сказано, что она не решает задачу и не претендует на это; доказательство — дело кого-то другого.

TwIL-LM3-Pro подходит к той же предметной области со стороны логики. Его конвейер был нацелен на шесть целей: перевод на язык логики первого порядка, разметка отношения логического следования, семантический разбор, формализация в Lean, критика доказательств на Lean и индукция правил. Там, где MathForm создан, чтобы порождать утверждение, TwIL-LM3-Pro создан, чтобы выносить суждения об утверждениях — следует ли это, правилен ли этот разбор, состоятельна ли эта попытка доказательства. Он также формализует, и это единственное место, где две модели действительно сопоставимы, а не просто смежны.

Награда от компилятора против награды от оценщика

Это именно то конструктивное различие, которое имеет значение, и оба вендора описывают его в документации.

Награда MathForm при обучении складывалась из компиляции Lean и обратной связи по семантической согласованности. Компилятор — это оракул: он либо принимает формализацию, либо нет, и здесь нет частичного зачёта и не с чем спорить. Это самый чистый сигнал вознаграждения в этом уголке машинного обучения, и именно поэтому бенчмарки по автоформализации публикуются как доли успешных прохождений — эта метрика находится ниже по потоку от программы, которой всё равно, во что кто-либо верит.

Заключительный этап TwIL-LM3-Pro представлял собой запуск GRPO с взвешиванием по энтропии против программного верификатора, при этом в собственной карточке модели описывается частичное засчитывание за нестрогие совпадения и token-F1, чтобы группы промптов, где всё провалилось, всё ещё давали градиент. Его основной макро-гейт — это среднее с равными весами четырёх ограниченных классификационных дорожек плюс индукция правил, и в этом гейте дорожки с множественным выбором и процедурные дорожки засчитываются как `max(exact_match, loose_match)` — правило, которое карточка прямо указывает, потому что правильный ответ, отформатированный иначе, — это артефакт форматирования, а не ошибка рассуждения.

Ни один из подходов не хуже. Они настроены на разные последствия. Награда, оцениваемая компилятором, даёт модель, которую можно нацелить на сложную задачу формализации и доверять её результату, потому что результат проверяем. Награда, оцениваемая скорером, с частичным зачётом даёт модель, которую можно обучать на более размытых суждениях — логическом следовании, критике, индукции правил, — где нет компилятора, чтобы вынести решение, и альтернатива состоит в том, чтобы вообще не обучать на этих направлениях. Цена этого в том, что полученные числа хороши ровно настолько, насколько хорош испытательный стенд, и webAI говорит об этом прямо: его строка strict-7, в которой убираются все следы зачёта за нестрогое совпадение, существует именно для того, чтобы читатель мог увидеть более суровую цифру рядом с основной.

Баллы не на одной и той же шкале

Обе модели публикуют связанные с Lean числовые показатели, и их нельзя вычитать друг из друга. В статье MathForm сообщается средний Pass@8 88,06 % при проверке синтаксиса и 72,37 % при проверке согласованности на шести бенчмарках Lean, при этом на более сложных подмножествах FATE-H и FATE-X доля успешных прохождений проверки согласованности составляет 63 % и 37 %, и утверждается, что модель превосходит несколько специализированных 32B-автоформализаторов. В карточке TwIL-LM3-Pro указаны token-F1 `lean_formalize` 0,5092 и точность `lean_critic` 0,7950 на её собственном стенде Track A.

Pass@8 при проверке компилятором и token-F1 относительно эталонной строки измеряют разные вещи. Pass@8 даёт модели восемь попыток и отвечает на вопрос, скомпилировалась ли хотя бы одна из них и осталась ли она согласованной; token-F1 оценивает, насколько точно одна генерация совпала с эталоном. Модель может показать хороший результат по одному показателю и плохой по другому, и ни один из документов не даёт оснований читать эти два показателя рядом.

Честное резюме протокола этого бенчмарка таково: доказательства MathForm-8B происходят из статьи, в цикле которой присутствует компилятор, а доказательства TwIL-LM3-Pro — из вендорского стенда, в цикле которого присутствует скорер, и ни одна третья сторона не прогнала оба через одну и ту же рубрику. Любую страницу, которая ставит "88.06%" рядом с "0.5092" так, будто это счёт в игре, следует считать страницей, которая не читала определений.

Технические характеристики рядом

• Параметры — плотная модель TwIL-LM3-Pro 3.66B против MathForm-8B 8B, примерно в 2,2 раза больше по размеру.

• Базовая модель — `ibm-granite/granite-4.2-3b` против `Qwen/Qwen3-8B`.

• Данные для обучения — синтетический корпус формальной логики, охватывающий шесть задач в сравнении с FormalVerse, около 367 000 проверенных примеров Lean 4.

• Награда — программный верификатор с частичным зачётом и допуском нестрогого совпадения против компиляции Lean и обратной связи по семантической согласованности.

• Основной результат — метки логического следования, переводы FOL, семантические разборы, утверждения Lean и критика доказательств в сравнении с утверждением Lean 4 для проверки компилятором.

• Контекстное окно — 131 072 токена для TwIL-LM3-Pro, измеряется в пределах 8 192 токенов; MathForm-8B в своём примере использования обслуживается с бюджетами генерации до 16 384 токенов.

• Лицензия — webAI Non-Commercial License ver. 1.0 против Apache 2.0.

• Квантованный размер — TwIL-LM3-Pro поставляется с Q4_K_M GGUF объемом 2.09 ГиБ для CPU или 4 ГБ VRAM; MathForm-8B не публикует GGUF в своем собственном репозитории.

Лицензия снова решает производственный вопрос

MathForm-8B распространяется под лицензией Apache 2.0. Вы можете дообучать её, распространять и использовать в составе коммерческого продукта. TwIL-LM3-Pro — некоммерческая модель: разрешены исследовательское и личное использование, а развёртывание с целью получения дохода требует отдельного соглашения с webAI, коммерческий путь которой представляет собой корпоративное соглашение, а не опубликованный прайс-лист.

Для исследовательской группы или студента эта разница не имеет значения — обе модели можно скачать на Hugging Face без ограничений. Для компании же она решающая, и это указывает на MathForm-8B для любой промышленной работы по автоформализации, независимо от того, какая модель показывает лучшие результаты в нише, которую ни один из вендоров не измерял одинаковым образом.

Где находится роутер в этом конвейере

Ни TwIL-LM3-Pro, ни MathForm-8B не являются маршрутом в каталоге OrcaRouter, и причины различаются: один имеет некоммерческую лицензию и не имеет хостингового эндпоинта, другой опубликован как открытый чекпойнт для самостоятельного хостинга. Вопрос маршрутизации в конвейере формализации — это слой вокруг них. Построение корпуса в стиле FormalVerse означает генерацию тысяч неформальных задач, их фильтрацию на корректность формы и написание проверок семантической согласованности, которые оценивают выходные данные — всё это текстовые вызовы и работа того рода, где вы хотите заменить модель, генерирующую массовые данные, на модель, оценивающую их, без второго контракта. Через один OpenAI-совместимый эндпоинт перед более чем 200 моделями по прайс-листовой цене провайдера с добавленной наценкой 0%, такая замена — это изменение конфигурации, и снижение цены вендором на модель генерации вступает в силу в тот же день. Автоматическое переключение при сбое критически важно именно при построении корпуса, потому что задание, которое падает, пройдя две трети прохода генерации, приводит к потере всего запуска.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

Разделение труда

Если задача — масштабно превращать математику из учебников в компилируемые утверждения на Lean, и результат должен поставляться в составе коммерческого продукта, то инструмент — MathForm-8B, и лицензия Apache 2.0 — вот почему. Если задача — решать, влечёт ли некий текст утверждение, размечать текстуальное следование, разбирать семантику или критиковать попытку доказательства, то TwIL-LM3-Pro охватывает области, на которые MathForm никогда не был нацелен, — а его некоммерческая лицензия задаёт границу того, где эту возможность можно использовать, а не является минусом самой возможности.

Комбинация, которая имеет смысл, — это двухэтапный конвейер, а не выбор: одна модель выдаёт формальное утверждение, другая оценивает его. Обе опубликовали конвейер, который их создал, что необычно для такого масштаба и является причиной, по которой это сравнение вообще возможно.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.