
Kolibri против MathForm-8B: одно из этих утверждений о точности можно проверить компилятором
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 218 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Kolibri и MathForm-8B имеют общую лицензию и почти ничего больше. Обе распространяются под Apache 2.0, обе имеют открытые веса, обе были выпущены за последние три месяца — Kolibri от Aleph Alpha 3 октября 2026 года, MathForm-8B от OpenBMB 14 августа 2026 года — и обе отводят математике значительную часть своих карточек модели. На этом сходство заканчивается. Kolibri — это немецко-английская модель смеси экспертов на 78,1 млрд параметров, которая активирует 3,46 млрд параметров на токен и предназначена для работы в регулируемом документообороте. MathForm-8B — это плотная модель на 8 млрд параметров, дообученная на основе Qwen3-8B, с одной задачей: взять математическую задачу, написанную на обычном английском, и выдать её формально корректную формулировку на Lean 4. Разница, которая имеет значение для всех, кто оценивает любую из этих моделей, не в количестве параметров. Она в том, что утверждение MathForm-8B о точности можно проверить исполнением. Вы можете проверить её вывод с помощью компилятора. А у Kolibri это нельзя проверить ничем, кроме ещё одного запуска бенчмарка.
Эта асимметрия — суть всей статьи, и она обобщается далеко за пределы этих двух моделей. Таблица бенчмарков от вендора — это заявление. То, что пруф-ассистент принимает формализацию, — это результат. Когда всё, что выдаёт модель, может проверить машина, маркетинговый слой исчезает — либо компилятор Lean принимает утверждение, либо нет, и никакие формулировки в посте о запуске этого не изменят.
Что MathForm-8B на самом деле выдаёт
Автоформализация — узкая, неэффектная и по-настоящему сложная задача, а карточка модели освежающе конкретно описывает её постановку.
• Ввод и вывод — на входе математическое утверждение на естественном языке, на выходе формализация на Lean 4, включая заголовок теоремы.
• Базовая модель — Qwen/Qwen3-8B, дообученная; Apache 2.0 вместе с остальным релизом OpenBMB.
• Обучение — дообучение с учителем, за которым следует обучение с подкреплением на датасете FormalVerse, где компиляция Lean и обратная связь по семантической согласованности формируют сигнал подкрепления.
• Конвейер данных — извлечение знаний Mathlib, компиляция и семантическая верификация, итеративное уточнение, затем реконструкция траектории. Схема конвейера на карточке модели — самое информативное в релизе.
• Оценка — показатели прохождения Pass@8 при двух отдельных проверках — проверке синтаксиса и проверке согласованности — по шести бенчмаркам, представленные в виде равновзвешенного макросреднего на рисунке на карточке, а не в виде таблицы, которую мы можем цитировать построчно.
• Инструментарий — работающий Kimina Lean Server для проверок компиляции, Lean 4.21.0 для экспериментов и максимальная длина последовательности в 16 384 токена при температуре 0.6 и top-p 0.95.
• Сервинг — vLLM или SGLang с контекстом в 16 384 токена, доступные через чат-интерфейс, совместимый с OpenAI. Эта последняя деталь важнее, чем кажется, потому что она означает, что модель встраивается в существующий пайплайн как обычный эндпоинт.
Обратите внимание на две отдельные проверки. Syntax Check — это то, разбирается ли Lean-утверждение синтаксически и проходит ли оно проверку типов вообще. Consistency Check — это то, означает ли формальное утверждение то же самое, что и задача на естественном языке, — свойство гораздо более сложное, потому что синтаксически корректное Lean-утверждение, формализующее не ту теорему, хуже ошибки компиляции. OpenBMB сообщает об обеих, и это ровно правильный способ это делать, а также причина, по которой у этой задачи есть история верификации, которой нет у рассуждений общего назначения.
Что Kolibri делает с математикой и почему это число иного рода
Kolibri хорош в математике с точки зрения бенчмарков. На собственном стенде посттренировки Aleph Alpha при высоком уровне усилий на рассуждение он набирает 96,9 на AIME 2025 на английском и 87,5 на немецком, 96,0 и 90,0 на AIME 2026, а также средний результат 96,5 на английском по своему математическому набору против 88,8 на немецком. Для контекста, в той же таблице результат Kolibri 96,9 на AIME 2025 на английском находится выше, чем у Nemotron 3 Super 120B-A12B с 91,7 и Qwen3.6 35B-A3B с 84,6, и чуть ниже Qwen3.8 27B с 97,9.
Каждая из этих цифр заявлена вендором, получена на вендорском стенде, без независимого воспроизведения, и для Kolibri нет страницы Artificial Analysis, с которой можно было бы сверить результаты. Это не критика этих чисел; это утверждение о том, какого рода объект они собой представляют. Оценка AIME — это процент правильных итоговых ответов на экзамене с выбором ответа. Она говорит, что модель способна прийти к целому числу. Она ничего не говорит о том, было ли рассуждение, которое к нему привело, состоятельным, и не остаётся никакого артефакта, который могла бы изучить третья сторона.
Поставьте это рядом с выводом MathForm-8B — и разница станет разительной. Ответ Kolibri на задачу AIME — это число. Вывод MathForm-8B — это формулировка теоремы на Lean 4, которая либо компилируется с Mathlib, либо нет. Если вы строите систему, в которой математическое утверждение должно быть защитимым — конвейер формальной верификации, рабочий процесс с ассистентом доказательств, аудиторский след, — второй артефакт стоит значительно больше первого, и ни одна строка бенчмарка этого не отражает.

Где эти двое на самом деле встретились бы
Если рассматривать это как бой, то такое противостояние неинтересно: 8B-специалист обыгрывает 78B-универсала в формализации математики и проигрывает во всём остальном, включая немецкую административную прозу, рассуждения по документам в длинном контексте и вызов инструментов на протяжении траектории агента из сотни шагов. Но эти две модели не взаимозаменяемы, а полезный вопрос — как выглядит конвейер, построенный из обеих.
Естественная композиция — это маршрутизация. Универсал с сильными навыками рассуждения и вызова инструментов берёт на себя приём данных, устранение неоднозначности и извлечение; специалист привлекается для тех двух процентов случаев, где нужен формальный артефакт. Делать это вручную означает двух поставщиков, два контракта, два SDK, два набора учётных данных и слой диспетчеризации, который кто-то должен поддерживать. Это как раз тот случай, когда единая конечная точка оправдывает себя: один ключ, совместимый с OpenAI, правило маршрутизации, которое отправляет запросы математической формы на конечную точку формализатора, а всё остальное — универсалу, и переключение при сбое, когда одна из них тормозит. Это задача DSL маршрутизации — объединять несколько моделей в один вызов, а не жёстко задавать выбор на этапе разработки, — а там, где полезен набор моделей, отвечающих вместе, это покрывает слияние моделей. Ни Kolibri, ни MathForm-8B нет на OrcaRouter сегодня; мы прочесали каталог в поисках обеих под всеми вариантами написания вендора и модели, и ни одной там нет. Аргумент о композиции касается формы задачи, а не этих двух конкретных конечных точек.
В каталоге представлена именно универсалистская половина этой схемы — по цене, которую можно измерить. Qwen3.8-27B указана по цене $0,33 за миллион входных токенов и $2,40 за выходные при окне в 262 144 токена, а Qwen3.8-Max — по $2,00 и $6,00 при окне в 1 млн токенов. Для команды, которая выясняет, стоит ли вообще добавлять этап формализации в конвейер обработки документов, дешёвый эксперимент — направить туда универсалистскую работу, измерить объём запросов, которым действительно нужен артефакт Lean, и только потом решить, стоит ли выделять специализированную конечную точку на 16 384 токена. Цены из прайс-листа провайдера передаются как есть, без каких-либо наценок за токен, поэтому цифры меняются в тот же день, когда их меняет вендор.

Лицензия — единственная строка, где они идентичны.
Обе модели распространяются под лицензией Apache 2.0, и в категории, где распространены индивидуальные исследовательские лицензии и дополнительные оговорки о допустимом использовании, это реальный пункт паритета, который стоит отметить, — это означает, что ни одна из моделей не требует юридической проверки, прежде чем её можно будет коммерчески использовать, модифицировать или распространять.
В остальном обязательства расходятся. Kolibri требует ~78 ГБ под веса и минимальную конфигурацию оборудования: две карты A100 80 ГБ, два H100 SXM5, один H200, один B200 или один B300, а также пакет aleph-alpha-inference от производителя и плагин vLLM. MathForm-8B в bfloat16 — это примерно 16 ГБ весов, и он обслуживается на одном современном ускорителе при контексте 16 384 токена; его зависимости — это тулчейн Lean и, для конвейера оценки, запущенный Kimina Lean Server. Одно из этих развёртываний помещается в рабочую станцию. Другое — нет.
Показатели контекста свидетельствуют об обратном, причём с большим перевесом. Собственное окно Kolibri — 262 144 токена, подтверждённое до 1 048 576: именно это делает Kolibri документной моделью — полный немецкий регуляторный пакет документов или руководство по техническому обслуживанию аэрокосмической техники умещается в один вызов. MathForm-8B по замыслу ограничен 16 384 токенами, потому что запрос на формализацию — это одна постановка задачи, и нет причин делать её длиннее. Ни одно из этих чисел не является недостатком. Они просто описывают разные задачи.

Выбор, и проверочный вопрос снизу
• Выбирайте MathForm-8B, если ваш вывод должен быть проверяемым. Если нижестоящая система использует Lean 4 или если весь смысл в том, что результат утверждает ассистент доказательств, никакая модель общего назначения его не заменит, и именно числа Pass@8 в разделах Syntax Check и Consistency Check следует анализировать, а не любую строку AIME.
• Выбирайте Kolibri, если вам нужна одна модель, которая читает немецкие и английские документы в условиях длинного контекста, рассуждает на их основе, вызывает инструменты, воздерживается от ответа, когда контекст не позволяет его дать, и может быть развёрнута внутри вашего собственного периметра по лицензии, которую можно изложить одной строкой. Математика — это её способность, а не продукт, которым она является.
• Рассматривайте оба варианта, если вы строите конвейер формализации. Не как альтернативы, а как две конечные точки за одним правилом маршрутизации, при этом специалиста подключают для узкого круга запросов, где он необходим.
И если вы оцениваете любой из них на основании числа из бенчмарка, сначала примените одну проверку: спросите, какой артефакт оставляет после себя это число. Для MathForm-8B есть файл Lean и компилятор, который либо принимает его, либо нет, и вы можете запустить и то и другое самостоятельно уже сегодня днём. Для Kolibri есть процент в таблице запуска, заявленный вендором, невоспроизведённый, без независимой индексной страницы, по которой его можно проверить, — и единственный способ опровергнуть его — скачать 78 ГБ весов, арендовать оборудование и повторно запустить испытательный стенд. Эта асимметрия стоит больше, чем сам балл, когда вы решаете, что внедрять в продакшен.
