
TwIL-LM3-Pro vs MathForm 8B: утверждение и логическое следование — две разные половины формализации
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
TwIL-LM3-Pro и MathForm-8B нацелены на одну и ту же широкую задачу — заставить машину порождать формальный, проверяемый текст, а не правдоподобную прозу, — и каждый из них решает свою половину этой задачи. MathForm-8B — это автоформализатор от OpenBMB на 8 миллиардов параметров, выпущенный в сентябре 2026 года: он превращает задачу, сформулированную на естественном языке, в утверждение на Lean 4, оставляя обязательство доказательства открытым для проверки компилятором. TwIL-LM3-Pro — это модель формальной логики от webAI на 3,66 млрд параметров, появившаяся в сентябре 2026 года, а её целевые выходные данные — это метки логического следования, переводы в логику первого порядка, семантические разборы и критика доказательств на Lean. Один создаёт то, что предстоит проверить. Другой говорит, действительно ли то, что у вас есть, влечёт то, что вы утверждаете.
Поскольку они пересекаются ровно в одной области — формализации в Lean, — страница сравнения и соблазнительна, и обманчива. Более полезный вопрос — за что каждую из них обучали получать вознаграждение, потому что именно сигнал вознаграждения — это то место, где два дизайна расходятся наиболее резко и где на самом деле кроется более разумный выбор.
Утверждение против следования
MathForm-8B обучен на FormalVerse — корпусе Lean 4, который в статье OpenBMB описывается как примерно 367 000 верифицированных примеров, — с помощью обучения с учителем, за которым следует обучение с подкреплением. Конвейер вокруг него извлекает соответствующие определения и существующие формализации из Mathlib перед генерацией, а затем уточняет их с помощью диагностики компилятора и проверки семантической согласованности. Его вывод — это формальное утверждение (импорты, типы, заголовок теоремы), которое внешний компилятор принимает или отклоняет. В карточке модели прямо сказано, что она не решает задачу и не претендует на это; доказательство — дело кого-то другого.
TwIL-LM3-Pro подходит к той же предметной области со стороны логики. Его конвейер был нацелен на шесть целей: перевод на язык логики первого порядка, разметка отношения логического следования, семантический разбор, формализация в Lean, критика доказательств на Lean и индукция правил. Там, где MathForm создан, чтобы порождать утверждение, TwIL-LM3-Pro создан, чтобы выносить суждения об утверждениях — следует ли это, правилен ли этот разбор, состоятельна ли эта попытка доказательства. Он также формализует, и это единственное место, где две модели действительно сопоставимы, а не просто смежны.
Награда от компилятора против награды от оценщика
Это именно то конструктивное различие, которое имеет значение, и оба вендора описывают его в документации.
Награда MathForm при обучении складывалась из компиляции Lean и обратной связи по семантической согласованности. Компилятор — это оракул: он либо принимает формализацию, либо нет, и здесь нет частичного зачёта и не с чем спорить. Это самый чистый сигнал вознаграждения в этом уголке машинного обучения, и именно поэтому бенчмарки по автоформализации публикуются как доли успешных прохождений — эта метрика находится ниже по потоку от программы, которой всё равно, во что кто-либо верит.
Заключительный этап TwIL-LM3-Pro представлял собой запуск GRPO с взвешиванием по энтропии против программного верификатора, при этом в собственной карточке модели описывается частичное засчитывание за нестрогие совпадения и token-F1, чтобы группы промптов, где всё провалилось, всё ещё давали градиент. Его основной макро-гейт — это среднее с равными весами четырёх ограниченных классификационных дорожек плюс индукция правил, и в этом гейте дорожки с множественным выбором и процедурные дорожки засчитываются как `max(exact_match, loose_match)` — правило, которое карточка прямо указывает, потому что правильный ответ, отформатированный иначе, — это артефакт форматирования, а не ошибка рассуждения.
Ни один из подходов не хуже. Они настроены на разные последствия. Награда, оцениваемая компилятором, даёт модель, которую можно нацелить на сложную задачу формализации и доверять её результату, потому что результат проверяем. Награда, оцениваемая скорером, с частичным зачётом даёт модель, которую можно обучать на более размытых суждениях — логическом следовании, критике, индукции правил, — где нет компилятора, чтобы вынести решение, и альтернатива состоит в том, чтобы вообще не обучать на этих направлениях. Цена этого в том, что полученные числа хороши ровно настолько, насколько хорош испытательный стенд, и webAI говорит об этом прямо: его строка strict-7, в которой убираются все следы зачёта за нестрогое совпадение, существует именно для того, чтобы читатель мог увидеть более суровую цифру рядом с основной.
Баллы не на одной и той же шкале
Обе модели публикуют связанные с Lean числовые показатели, и их нельзя вычитать друг из друга. В статье MathForm сообщается средний Pass@8 88,06 % при проверке синтаксиса и 72,37 % при проверке согласованности на шести бенчмарках Lean, при этом на более сложных подмножествах FATE-H и FATE-X доля успешных прохождений проверки согласованности составляет 63 % и 37 %, и утверждается, что модель превосходит несколько специализированных 32B-автоформализаторов. В карточке TwIL-LM3-Pro указаны token-F1 `lean_formalize` 0,5092 и точность `lean_critic` 0,7950 на её собственном стенде Track A.
Pass@8 при проверке компилятором и token-F1 относительно эталонной строки измеряют разные вещи. Pass@8 даёт модели восемь попыток и отвечает на вопрос, скомпилировалась ли хотя бы одна из них и осталась ли она согласованной; token-F1 оценивает, насколько точно одна генерация совпала с эталоном. Модель может показать хороший результат по одному показателю и плохой по другому, и ни один из документов не даёт оснований читать эти два показателя рядом.
Честное резюме протокола этого бенчмарка таково: доказательства MathForm-8B происходят из статьи, в цикле которой присутствует компилятор, а доказательства TwIL-LM3-Pro — из вендорского стенда, в цикле которого присутствует скорер, и ни одна третья сторона не прогнала оба через одну и ту же рубрику. Любую страницу, которая ставит "88.06%" рядом с "0.5092" так, будто это счёт в игре, следует считать страницей, которая не читала определений.
Технические характеристики рядом
• Параметры — плотная модель TwIL-LM3-Pro 3.66B против MathForm-8B 8B, примерно в 2,2 раза больше по размеру.
• Базовая модель — `ibm-granite/granite-4.2-3b` против `Qwen/Qwen3-8B`.
• Данные для обучения — синтетический корпус формальной логики, охватывающий шесть задач в сравнении с FormalVerse, около 367 000 проверенных примеров Lean 4.
• Награда — программный верификатор с частичным зачётом и допуском нестрогого совпадения против компиляции Lean и обратной связи по семантической согласованности.
• Основной результат — метки логического следования, переводы FOL, семантические разборы, утверждения Lean и критика доказательств в сравнении с утверждением Lean 4 для проверки компилятором.
• Контекстное окно — 131 072 токена для TwIL-LM3-Pro, измеряется в пределах 8 192 токенов; MathForm-8B в своём примере использования обслуживается с бюджетами генерации до 16 384 токенов.
• Лицензия — webAI Non-Commercial License ver. 1.0 против Apache 2.0.
• Квантованный размер — TwIL-LM3-Pro поставляется с Q4_K_M GGUF объемом 2.09 ГиБ для CPU или 4 ГБ VRAM; MathForm-8B не публикует GGUF в своем собственном репозитории.
Лицензия снова решает производственный вопрос
MathForm-8B распространяется под лицензией Apache 2.0. Вы можете дообучать её, распространять и использовать в составе коммерческого продукта. TwIL-LM3-Pro — некоммерческая модель: разрешены исследовательское и личное использование, а развёртывание с целью получения дохода требует отдельного соглашения с webAI, коммерческий путь которой представляет собой корпоративное соглашение, а не опубликованный прайс-лист.
Для исследовательской группы или студента эта разница не имеет значения — обе модели можно скачать на Hugging Face без ограничений. Для компании же она решающая, и это указывает на MathForm-8B для любой промышленной работы по автоформализации, независимо от того, какая модель показывает лучшие результаты в нише, которую ни один из вендоров не измерял одинаковым образом.
Где находится роутер в этом конвейере
Ни TwIL-LM3-Pro, ни MathForm-8B не являются маршрутом в каталоге OrcaRouter, и причины различаются: один имеет некоммерческую лицензию и не имеет хостингового эндпоинта, другой опубликован как открытый чекпойнт для самостоятельного хостинга. Вопрос маршрутизации в конвейере формализации — это слой вокруг них. Построение корпуса в стиле FormalVerse означает генерацию тысяч неформальных задач, их фильтрацию на корректность формы и написание проверок семантической согласованности, которые оценивают выходные данные — всё это текстовые вызовы и работа того рода, где вы хотите заменить модель, генерирующую массовые данные, на модель, оценивающую их, без второго контракта. Через один OpenAI-совместимый эндпоинт перед более чем 200 моделями по прайс-листовой цене провайдера с добавленной наценкой 0%, такая замена — это изменение конфигурации, и снижение цены вендором на модель генерации вступает в силу в тот же день. Автоматическое переключение при сбое критически важно именно при построении корпуса, потому что задание, которое падает, пройдя две трети прохода генерации, приводит к потере всего запуска.

Разделение труда
Если задача — масштабно превращать математику из учебников в компилируемые утверждения на Lean, и результат должен поставляться в составе коммерческого продукта, то инструмент — MathForm-8B, и лицензия Apache 2.0 — вот почему. Если задача — решать, влечёт ли некий текст утверждение, размечать текстуальное следование, разбирать семантику или критиковать попытку доказательства, то TwIL-LM3-Pro охватывает области, на которые MathForm никогда не был нацелен, — а его некоммерческая лицензия задаёт границу того, где эту возможность можно использовать, а не является минусом самой возможности.
Комбинация, которая имеет смысл, — это двухэтапный конвейер, а не выбор: одна модель выдаёт формальное утверждение, другая оценивает его. Обе опубликовали конвейер, который их создал, что необычно для такого масштаба и является причиной, по которой это сравнение вообще возможно.


