Сгенерированная hero-карточка заголовка с надписью «Solar Mini 4 vs MathForm 8B», подзаголовком «Один отвечает на вопрос, другой делает его проверяемым» и двумя бейджами с надписями «Генералист против автоформализатора» и «Компиляция Lean 4 в цикле».
Guides & Insights

Solar Mini 4 против MathForm 8B: одна модель отвечает на вопрос, другая делает его проверяемым

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Поставьте Solar Mini 4 рядом с MathForm 8B — и вы сравните две модели, которые не конкурируют за один и тот же токен. Solar Mini 4 — это разреженная смесь экспертов от Upstage на 35 миллиардов параметров, выпущенная 22 сентября 2026 года, с примерно 3 миллиардами активных параметров на токен, и она отвечает на вопросы: читает длинный документ, рассуждает по нему, возвращает письменный результат. MathForm 8B — это автоформализатор от OpenBMB на 8 миллиардов параметров, опубликованный 14 августа 2026 года под лицензией Apache 2.0, и он делает то, чего не делает вообще ни одна reasoning-модель: берёт математическое утверждение на естественном языке и переписывает его как теорему на Lean 4, которую компилятор ассистента доказательств проверит по типам. Одна выдаёт ответы. Другая порождает машинно-проверяемые вопросы, а второе — более редкий товар.

Сравнение всё равно стоит провести, потому что оба в конечном итоге попадают в один и тот же тип пайплайна, и потому что у этих двух противоположные сильные стороны, что делает выбор на удивление простым. Модель Upstage сильна в длинных документах, слаба в сложных рассуждениях и дорога в расчёте на выполненную задачу. Модель OpenBMB узкоспециализирована до бесполезности за пределами своей ниши, её вообще ни разу не оценивал независимый оценщик, и она ничего не стоит в запуске, как только у вас есть GPU.

Бок о бок, по вопросам, в которых есть различия

• Что это — Solar Mini 4 — это модель общего назначения для рассуждений с контекстом в 1 млн токенов (512K согласно собственной документации Upstage) и измеренным показателем 24,1 в Индексе интеллекта Artificial Analysis. MathForm 8B — это автоформализатор с одной задачей, без опубликованного показателя индекса, без независимой оценки и без заявлений об общих возможностях.

• Параметры — 35B всего / 3B активных, разреженная, для Solar Mini 4; 8,19B плотная для MathForm 8B, дообученная на основе Qwen3-8B на корпусе FormalVerse от OpenBMB, содержащем примерно 367 000 проверенных примеров Lean 4.

• Лицензия и поставка — Solar Mini 4 является проприетарной и доступна через API Upstage и сторонние платформы. MathForm 8B — это веса Apache-2.0 с шаблоном чата, четырьмя шардами safetensors и путём развёртывания через Transformers, vLLM или SGLang за OpenAI-совместимым эндпоинтом.

• Цена — Solar Mini 4 по $0.10 / $0.01 за кэшированные / $0.40 за миллион токенов, сейчас скидка 50% до 22 октября 2026 года. У MathForm 8B нет тарифной карты; его стоимость — это GPU, который вы под него поставите.

• Скорость — 204 выходных токена в секунду для Solar Mini 4 на испытательном стенде Artificial Analysis, при 88 300 выходных токенов на задачу индекса и около 430 секунд работы на задачу. Выход MathForm 8B — это один заголовок теоремы Lean 4, максимум несколько сотен токенов.

• Независимость её цифр — Solar Mini 4 прошла проверку третьей стороной. MathForm 8B — нет: каждая цифра в её статье принадлежит самим авторам, а модель слишком новая и слишком узкоспециализированная, чтобы привлечь независимую проверку.

Где две модели пересекаются, а где — нет

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

Именно режимы отказа делают это сочетание интересным, потому что они — полные противоположности. Самый слабый опубликованный результат Solar Mini 4 — Terminal-Bench 4.0 с 1%, а AutomationBench-AA — 22,3%; он плохо справляется с проверкой собственной работы в среде, которая даёт ему обратную связь. Весь замысел MathForm 8B основан на верификации: OpenBMB различает синтаксическую проверку, которая отвечает на вопрос, компилируется ли утверждение Lean 4, и проверку согласованности, которая отвечает на вопрос, действительно ли скомпилированное утверждение означает то же самое, что и неформальная задача. Классический отказ, ради предотвращения которого и существует MathForm 8B, — это утверждение, которое проходит проверку типов, но при этом незаметно ослабляет тезис.

Это реальное различие, и в этом стоит быть точным. Модель рассуждений, порождающая доказательство, имеет известную проблему самопроверки: ничто в генерации не говорит вам, правилен ли ответ. А компилятор — говорит. Если ваш рабочий процесс — «превратить банк задач в нечто, что машина может проверить», то MathForm 8B делает ту половину работы, которую Solar Mini 4 не может сделать вообще, а остаток — это не вопрос степени.

Показатели вендора, обозначенные как таковые: в статье OpenBMB сообщается средний Pass@8 88,06% по Syntax Check и 72,37% по Consistency Check на шести бенчмарках, и утверждается, что они превосходят несколько специализированных 32B-автоформализаторов. Ничего из этого не было воспроизведено третьей стороной. Падение на 16 пунктов между этими двумя проверками — более информативная цифра: она показывает, как часто скомпилированное утверждение оказывается не совсем той задачей, о которой вы спрашивали, и именно поэтому Consistency Check существует как отдельный столбец.

Зачем команде запускать оба

Потому что естественный конвейер имеет дешёвую, высокообъёмную стадию и дорогую, низкообъёмную стадию. MathForm 8B работает на вашем собственном оборудовании и преобразует неформальные задачи в заголовки Lean 4, при этом компилятор доступен, чтобы отклонить плохой вывод до того, как его увидит человек. Solar Mini 4 обрабатывает то, что происходит вокруг этого: чтение вспомогательной статьи, извлечение допущений, обобщение результата на корейском или английском языке и маршрутизацию работы. Эти двое никогда не конкурируют за один и тот же запрос, и меньший из них — тот, кому принадлежит часть работы с объективным сигналом прохождения/неудачи.

Ни одну из этих моделей мы не можем маршрутизировать к вам — моделей Upstage нет в OrcaRouter, как и моделей OpenBMB, — поэтому если вам нужна Solar Mini 4, её можно получить через собственный API Upstage, а если вам нужна MathForm 8B, она берётся из Hugging Face и работает на вашем собственном GPU. Что мы можем сделать — так это поместить остальную часть этого пайплайна за одним ключом: более 200 моделей с нулевой наценкой к каталожной цене провайдера, автоматическое переключение при сбое между провайдерами и DSL маршрутизации, который позволяет объединять модели в один вызов. В рабочем процессе, где небольшая специализированная модель выполняет этап формализации, а крупная универсальная модель делает всё вокруг него, возможность сменить универсальную модель, отредактировав строку с названием модели, — вместо выпуска новой интеграции — это разница между двухнедельным изменением и одним днём.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

Что запомнить

Если ваш вопрос — «какой из них мне использовать?», честный ответ таков: всё зависит от того, нужен ли вам ответ или формализация, и никакой бенчмарк этого не решит. Если ваш вопрос — «стоит ли скачивать MathForm 8B?», ответ — да для одной узкой задачи и нет для всего остального: это формализатор, а не инструмент доказательства, и обязательство доказательства остаётся открытым в том результате, который он выдаёт. Если ваш вопрос — «стоит ли Solar Mini 4 $0,36 за задачу?», ответ — да для длинных документов при больших объёмах и нет для всего, что требует от неё проверки собственной работы.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

Источники, в завершение. Каждый показатель Solar Mini 4 выше — это независимое измерение Artificial Analysis, кроме контекстного окна, которое является собственным показателем Upstage и расходится с их значением. Каждый показатель MathForm 8B приведён вендором из arXiv 2608.14221 и не воспроизведён, а его выпуск не был анонсирован — веса, датасет FormalVerse и статья — все появились 14 августа 2026 года, без публикации в блоге вендора и без независимого прогона бенчмарка на сегодняшний день.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube