Сгенерированная hero-карточка для Kolibri vs MathForm 8B с заголовком «Kolibri vs MathForm 8B» и подзаголовком «универсал против автоформализатора Lean 4», с иконкой колибри слева и символом квадрата доказательства справа по обе стороны от тонкого разделителя. Логотип OrcaRouter расположен на полосе под иллюстрацией.
Guides & Insights

Kolibri против MathForm-8B: одно из этих утверждений о точности можно проверить компилятором

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Kolibri и MathForm-8B имеют общую лицензию и почти ничего больше. Обе распространяются под Apache 2.0, обе имеют открытые веса, обе были выпущены за последние три месяца — Kolibri от Aleph Alpha 3 октября 2026 года, MathForm-8B от OpenBMB 14 августа 2026 года — и обе отводят математике значительную часть своих карточек модели. На этом сходство заканчивается. Kolibri — это немецко-английская модель смеси экспертов на 78,1 млрд параметров, которая активирует 3,46 млрд параметров на токен и предназначена для работы в регулируемом документообороте. MathForm-8B — это плотная модель на 8 млрд параметров, дообученная на основе Qwen3-8B, с одной задачей: взять математическую задачу, написанную на обычном английском, и выдать её формально корректную формулировку на Lean 4. Разница, которая имеет значение для всех, кто оценивает любую из этих моделей, не в количестве параметров. Она в том, что утверждение MathForm-8B о точности можно проверить исполнением. Вы можете проверить её вывод с помощью компилятора. А у Kolibri это нельзя проверить ничем, кроме ещё одного запуска бенчмарка.

Эта асимметрия — суть всей статьи, и она обобщается далеко за пределы этих двух моделей. Таблица бенчмарков от вендора — это заявление. То, что пруф-ассистент принимает формализацию, — это результат. Когда всё, что выдаёт модель, может проверить машина, маркетинговый слой исчезает — либо компилятор Lean принимает утверждение, либо нет, и никакие формулировки в посте о запуске этого не изменят.

Что MathForm-8B на самом деле выдаёт

Автоформализация — узкая, неэффектная и по-настоящему сложная задача, а карточка модели освежающе конкретно описывает её постановку.

• Ввод и вывод — на входе математическое утверждение на естественном языке, на выходе формализация на Lean 4, включая заголовок теоремы.

• Базовая модель — Qwen/Qwen3-8B, дообученная; Apache 2.0 вместе с остальным релизом OpenBMB.

• Обучение — дообучение с учителем, за которым следует обучение с подкреплением на датасете FormalVerse, где компиляция Lean и обратная связь по семантической согласованности формируют сигнал подкрепления.

• Конвейер данных — извлечение знаний Mathlib, компиляция и семантическая верификация, итеративное уточнение, затем реконструкция траектории. Схема конвейера на карточке модели — самое информативное в релизе.

• Оценка — показатели прохождения Pass@8 при двух отдельных проверках — проверке синтаксиса и проверке согласованности — по шести бенчмаркам, представленные в виде равновзвешенного макросреднего на рисунке на карточке, а не в виде таблицы, которую мы можем цитировать построчно.

• Инструментарий — работающий Kimina Lean Server для проверок компиляции, Lean 4.21.0 для экспериментов и максимальная длина последовательности в 16 384 токена при температуре 0.6 и top-p 0.95.

• Сервинг — vLLM или SGLang с контекстом в 16 384 токена, доступные через чат-интерфейс, совместимый с OpenAI. Эта последняя деталь важнее, чем кажется, потому что она означает, что модель встраивается в существующий пайплайн как обычный эндпоинт.

Обратите внимание на две отдельные проверки. Syntax Check — это то, разбирается ли Lean-утверждение синтаксически и проходит ли оно проверку типов вообще. Consistency Check — это то, означает ли формальное утверждение то же самое, что и задача на естественном языке, — свойство гораздо более сложное, потому что синтаксически корректное Lean-утверждение, формализующее не ту теорему, хуже ошибки компиляции. OpenBMB сообщает об обеих, и это ровно правильный способ это делать, а также причина, по которой у этой задачи есть история верификации, которой нет у рассуждений общего назначения.

Что Kolibri делает с математикой и почему это число иного рода

Kolibri хорош в математике с точки зрения бенчмарков. На собственном стенде посттренировки Aleph Alpha при высоком уровне усилий на рассуждение он набирает 96,9 на AIME 2025 на английском и 87,5 на немецком, 96,0 и 90,0 на AIME 2026, а также средний результат 96,5 на английском по своему математическому набору против 88,8 на немецком. Для контекста, в той же таблице результат Kolibri 96,9 на AIME 2025 на английском находится выше, чем у Nemotron 3 Super 120B-A12B с 91,7 и Qwen3.6 35B-A3B с 84,6, и чуть ниже Qwen3.8 27B с 97,9.

Каждая из этих цифр заявлена вендором, получена на вендорском стенде, без независимого воспроизведения, и для Kolibri нет страницы Artificial Analysis, с которой можно было бы сверить результаты. Это не критика этих чисел; это утверждение о том, какого рода объект они собой представляют. Оценка AIME — это процент правильных итоговых ответов на экзамене с выбором ответа. Она говорит, что модель способна прийти к целому числу. Она ничего не говорит о том, было ли рассуждение, которое к нему привело, состоятельным, и не остаётся никакого артефакта, который могла бы изучить третья сторона.

Поставьте это рядом с выводом MathForm-8B — и разница станет разительной. Ответ Kolibri на задачу AIME — это число. Вывод MathForm-8B — это формулировка теоремы на Lean 4, которая либо компилируется с Mathlib, либо нет. Если вы строите систему, в которой математическое утверждение должно быть защитимым — конвейер формальной верификации, рабочий процесс с ассистентом доказательств, аудиторский след, — второй артефакт стоит значительно больше первого, и ни одна строка бенчмарка этого не отражает.

Generated two-column scoreboard for Kolibri and MathForm-8B. Left column Kolibri: purpose 'general reasoning', output 'free-form text', checkable 'no, benchmark only', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', licence Apache 2.0. Right column MathForm-8B: purpose 'Lean 4 autoformalization', output 'Lean 4 theorem statements', checkable 'yes, a compiler checks it', parameters '8B dense', context 16,384, licence Apache 2.0. The footer reads 'Kolibri figures vendor-reported; MathForm-8B Pass@8 per its model card.'

Где эти двое на самом деле встретились бы

Если рассматривать это как бой, то такое противостояние неинтересно: 8B-специалист обыгрывает 78B-универсала в формализации математики и проигрывает во всём остальном, включая немецкую административную прозу, рассуждения по документам в длинном контексте и вызов инструментов на протяжении траектории агента из сотни шагов. Но эти две модели не взаимозаменяемы, а полезный вопрос — как выглядит конвейер, построенный из обеих.

Естественная композиция — это маршрутизация. Универсал с сильными навыками рассуждения и вызова инструментов берёт на себя приём данных, устранение неоднозначности и извлечение; специалист привлекается для тех двух процентов случаев, где нужен формальный артефакт. Делать это вручную означает двух поставщиков, два контракта, два SDK, два набора учётных данных и слой диспетчеризации, который кто-то должен поддерживать. Это как раз тот случай, когда единая конечная точка оправдывает себя: один ключ, совместимый с OpenAI, правило маршрутизации, которое отправляет запросы математической формы на конечную точку формализатора, а всё остальное — универсалу, и переключение при сбое, когда одна из них тормозит. Это задача DSL маршрутизации — объединять несколько моделей в один вызов, а не жёстко задавать выбор на этапе разработки, — а там, где полезен набор моделей, отвечающих вместе, это покрывает слияние моделей. Ни Kolibri, ни MathForm-8B нет на OrcaRouter сегодня; мы прочесали каталог в поисках обеих под всеми вариантами написания вендора и модели, и ни одной там нет. Аргумент о композиции касается формы задачи, а не этих двух конкретных конечных точек.

В каталоге представлена именно универсалистская половина этой схемы — по цене, которую можно измерить. Qwen3.8-27B указана по цене $0,33 за миллион входных токенов и $2,40 за выходные при окне в 262 144 токена, а Qwen3.8-Max — по $2,00 и $6,00 при окне в 1 млн токенов. Для команды, которая выясняет, стоит ли вообще добавлять этап формализации в конвейер обработки документов, дешёвый эксперимент — направить туда универсалистскую работу, измерить объём запросов, которым действительно нужен артефакт Lean, и только потом решить, стоит ли выделять специализированную конечную точку на 16 384 токена. Цены из прайс-листа провайдера передаются как есть, без каких-либо наценок за токен, поэтому цифры меняются в тот же день, когда их меняет вендор.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the 256K-token context badge, fine-tuning with self-serve deployment, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 1.88 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-13', the description as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure, with a dedicated vision tower, the pricing tiles $0.33 and $2.40, and the pricing block listing $0.330 per million input tokens and $2.40 per million output tokens.

Лицензия — единственная строка, где они идентичны.

Обе модели распространяются под лицензией Apache 2.0, и в категории, где распространены индивидуальные исследовательские лицензии и дополнительные оговорки о допустимом использовании, это реальный пункт паритета, который стоит отметить, — это означает, что ни одна из моделей не требует юридической проверки, прежде чем её можно будет коммерчески использовать, модифицировать или распространять.

В остальном обязательства расходятся. Kolibri требует ~78 ГБ под веса и минимальную конфигурацию оборудования: две карты A100 80 ГБ, два H100 SXM5, один H200, один B200 или один B300, а также пакет aleph-alpha-inference от производителя и плагин vLLM. MathForm-8B в bfloat16 — это примерно 16 ГБ весов, и он обслуживается на одном современном ускорителе при контексте 16 384 токена; его зависимости — это тулчейн Lean и, для конвейера оценки, запущенный Kimina Lean Server. Одно из этих развёртываний помещается в рабочую станцию. Другое — нет.

Показатели контекста свидетельствуют об обратном, причём с большим перевесом. Собственное окно Kolibri — 262 144 токена, подтверждённое до 1 048 576: именно это делает Kolibri документной моделью — полный немецкий регуляторный пакет документов или руководство по техническому обслуживанию аэрокосмической техники умещается в один вызов. MathForm-8B по замыслу ограничен 16 384 токенами, потому что запрос на формализацию — это одна постановка задачи, и нет причин делать её длиннее. Ни одно из этих чисел не является недостатком. Они просто описывают разные задачи.

Screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the apache-2.0 licence badge, the pipeline figure caption describing Mathlib knowledge retrieval, compilation and semantic verification, iterative refinement, trajectory reconstruction and training, and the start of the Results table with the MATHFORM-8B-SFT and MATHFORM-8B rows above the specialist autoformalizers including Goedel-Formalizer-V2-8B, StepFun-Formalizer-7B and Kimina-Autoformalizer-7B.

Выбор, и проверочный вопрос снизу

• Выбирайте MathForm-8B, если ваш вывод должен быть проверяемым. Если нижестоящая система использует Lean 4 или если весь смысл в том, что результат утверждает ассистент доказательств, никакая модель общего назначения его не заменит, и именно числа Pass@8 в разделах Syntax Check и Consistency Check следует анализировать, а не любую строку AIME.

• Выбирайте Kolibri, если вам нужна одна модель, которая читает немецкие и английские документы в условиях длинного контекста, рассуждает на их основе, вызывает инструменты, воздерживается от ответа, когда контекст не позволяет его дать, и может быть развёрнута внутри вашего собственного периметра по лицензии, которую можно изложить одной строкой. Математика — это её способность, а не продукт, которым она является.

• Рассматривайте оба варианта, если вы строите конвейер формализации. Не как альтернативы, а как две конечные точки за одним правилом маршрутизации, при этом специалиста подключают для узкого круга запросов, где он необходим.

И если вы оцениваете любой из них на основании числа из бенчмарка, сначала примените одну проверку: спросите, какой артефакт оставляет после себя это число. Для MathForm-8B есть файл Lean и компилятор, который либо принимает его, либо нет, и вы можете запустить и то и другое самостоятельно уже сегодня днём. Для Kolibri есть процент в таблице запуска, заявленный вендором, невоспроизведённый, без независимой индексной страницы, по которой его можно проверить, — и единственный способ опровергнуть его — скачать 78 ГБ весов, арендовать оборудование и повторно запустить испытательный стенд. Эта асимметрия стоит больше, чем сам балл, когда вы решаете, что внедрять в продакшен.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube