
Intern-Decision-0.8B против MathForm 8B: одна из них может проверять собственную работу
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 592 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 187 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Самый полезный вопрос, который можно задать о любой небольшой специализированной модели, — кто её проверяет. Intern-Decision-0.8B и MathForm 8B существуют обе потому, что общую модель дообучили до узкоспециализированной; обе являются производными от весов Qwen под лицензией Apache-2.0, и обе были выложены на Hugging Face без маркетинговой кампании — но они находятся по разные стороны линии, которая определяет, как вы стали бы их развёртывать. MathForm 8B — это 8B-модель автоформализации от OpenBMB, выпущенная 14 августа 2026 года, которая переводит математику на естественном языке в Lean 4 и передаёт результат компилятору, а тот либо принимает его, либо нет. Intern-Decision-0.8B — это решающая голова InternLM с 852 985 920 параметрами, загруженная 26 сентября 2026 года, которая возвращает калиброванное распределение вероятностей по вариантам, которые вы задали заранее, — и ничто в мире независимо не проверяет, правильна ли метка, которую она возвращает. Одна из этих моделей выдаёт результат с доказательством. Другая выдаёт результат с оценкой уверенности, и разница в том, что вы можете делать с этими двумя вещами, и составляет суть всей статьи.
Такая трактовка также объясняет, почему разрыв в размере — 8B против 0,8B, в десять раз — является наименее интересным числом в этом сравнении. Ни одна из моделей не стремится быть сильной в том, что делает другая, и оценка ни одной из них ничего не говорит о другой. Общее у них — это схема выпуска и принадлежность к линейке Qwen, и оба эти фактора значат меньше, чем вопрос верификации.
Что каждый из них на самом деле из себя представляет
MathForm 8B — это выпущенный артефакт двухэтапного рецепта, описанного в статье MathForm: Масштабирование математической автоформализации с извлечением знаний и уточнением под руководством верификации (arXiv 2608.14221). Планировщик извлечения подтягивает релевантные определения и существующие формализации из Mathlib до запуска генератора; затем сгенерированные утверждения пересматриваются с использованием диагностики компилятора и обратной связи по семантической согласованности; полученный корпус FormalVerse содержит примерно 367 000 проверенных примеров на Lean 4; и MathForm 8B обучается на нём с помощью контролируемого дообучения, за которым следует обучение с подкреплением, использующее сигналы компиляции Lean и семантической согласованности в качестве награды. Это текстовая модель на основе Qwen3-8B, обслуживаемая через Transformers, vLLM или SGLang с API, совместимым с OpenAI, с рекомендуемой длиной контекста 16 384 токена и максимальным бюджетом генерации 16 384 токена. Её оценочный конвейер, файлы бенчмарков и скрипты Pass@k находятся в репозитории OpenBMB на GitHub, а набор данных для обучения является публичным.
Intern-Decision-0.8B — это поставляемый артефакт рецепта, который никто не описывал. В карточке модели сказано, что это «мультимодальная структурированная модель принятия решений, дообученная на основе Qwen3.5-0.8B», и на этом всё — ни описания данных, ни процедуры обучения, ни статьи, ни репозитория. Зато она подробно документирует контракт инференса. Встроенный движок сопоставляет варианты ответа каждого вопроса однотокенным символам, строит скелет, в котором на каждое поле есть один <decision> плейсхолдер, выполняет один каузальный прямой проход, считывает логиты в позиции перед каждым плейсхолдером, выполняет softmax только по разрешённым символам этого поля, применяет подобранную калибровку и преобразует символы обратно в значения ваших вариантов. В этом пути нигде нет вызова generate() и не выполняется сэмплирование. Он принимает текст и до восьми изображений, обрабатывает от одного до шестнадцати вопросов, в каждом из которых до 62 вариантов, и отклоняет входные данные длиннее 8 192 токенов, а не усекает их. Температура калибровки по умолчанию — 2,747760550703; она подбирается для каждого чекпойнта минимизацией NLL по 1 728 случаям.
Прочитайте эти два абзаца рядом, и асимметрия становится очевидной. MathForm 8B поставляется со статьёй, набором данных, конвейером оценки и репозиторием. Intern-Decision-0.8B поставляется с описанием API и таблицей бенчмарков.
Асимметрия верификации — вот в чём настоящая суть
Вывод MathForm 8B можно проверить чем-то, кроме человека. Он генерирует Lean 4, а Lean 4 либо компилируется, либо нет. Цифры OpenBMB приводятся в двух режимах именно по этой причине: Pass@8 88,06% при проверке синтаксиса, что означает, что вывод компилируется, и 72,37% при проверке согласованности, что означает, что он компилируется, и проверка семантической согласованности подтверждает, что формальное утверждение означает то же, что и неформальное. Оба показателя являются средними по шести бенчмаркам, и в статье также сообщаются показатели прохождения CC — 63% на FATE-H и 37% на более сложных подмножествах FATE-X, с утверждением, что это превосходит специализированные автоформализаторы на 32B. Эти данные предоставлены производителем — их проводила OpenBMB — но важное свойство является структурным, а не статистическим: нижестоящая система, потребляющая вывод MathForm 8B, может отклонить плохую формализацию, не прося модель судить о ней. Компилятор — это оракул.
Intern-Decision-0.8B имеет контракт типов и не имеет оракула. Форма вывода гарантирована — поле, объявленное как choice, возвращает распределение по перечисленным вами значениям опций, а score возвращает взвешенное по вероятностям ожидаемое значение по вашей рубрике, а noul возвращает вероятность ответа «да». Ничто вне модели не может сказать вам, был ли argmax правильным. Значение уверенности — это собственная оценка моделью собственной правильности, а работа по калибровке карточки — честная попытка сделать эту оценку осмысленной — подобранная температура, которая сохраняет argmax, одновременно заостряя или смягчая вероятности, проверенная на отложенных примерах — но хорошо откалиброванный неправильный ответ всё равно остаётся неправильным ответом. Если вашему пайплайну нужно знать, верна ли метка, вам нужны размеченные данные, и вам нужно измерить это самостоятельно.
Это не дефект, свойственный только Intern-Decision-0.8B. Это состояние, характерное для любого классификатора, и это нерешённая проблема во всей категории моделей принятия решений, включающей Jev от TypeSafe и Laya от Convai. Об этом стоит сказать чётко, потому что таблица бенчмарка со столбцом Brier score может создать впечатление, будто калибровка — это верификация. Это не так. Калибровка говорит, что когда эта модель выдаёт 80%, она права примерно в 80% случаев в рамках оцениваемого распределения — что действительно полезно для установки порогов и вычисления ожидаемой ценности и не является гарантией правильности для отдельного элемента.
Табло, по строкам, которые есть у обеих моделей
Параметры — Intern-Decision-0.8B: 852 985 920 параметров, распределённых по языковому шарду на 1,50 ГБ, визуальному шарду на 176 МБ и проектору на 25 МБ. MathForm 8B: плотная модель 8B на основе Qwen3-8B.
Базовая модель — Intern-Decision-0.8B: Qwen3.5-0.8B, выпущена в феврале 2026 года. MathForm 8B: Qwen3-8B.
• Задача — Intern-Decision-0.8B: типизированные решения по схеме, которую вы пишете, — выбор, оценка, бинарный. MathForm 8B: формализация математики на естественном языке в Lean 4.
• Вывод — Intern-Decision-0.8B: калиброванное распределение плюс argmax по каждому полю, текст не генерируется. MathForm 8B: сгенерированный исходный код Lean 4, обычно длинный.
• Верификация — Intern-Decision-0.8B: внешняя отсутствует; уверенность — по самооценке. MathForm 8B: компилятор Lean 4 плюс проверка семантической согласованности.
• Опубликованные данные — Intern-Decision-0.8B: таблица бенчмарков от вендора по семи бенчмаркам, не воспроизведена, без статьи. MathForm 8B: статья, публичный датасет примерно из 367 000 примеров, пайплайн оценки и репозиторий, запущено вендором.
• Лицензия — обе распространяются под Apache 2.0, а Intern-Decision-0.8B дополнительно содержит сохранённый файл лицензии Qwen для своих вышестоящих весов.

Издержки и задержка несопоставимы, и это не уловка
InternLM измерила Intern-Decision-0.8B на 33,98 мс среднего и 37,50 мс p95 на запрос на одном RTX 4090 через локальный путь Hugging Face, а её 2B-собрат показал 33,28 мс среднего. В собственной карточке MathForm 8B рекомендуется до 16 384 новых токенов на формализацию при temperature 0.6 и top_p 0.95. Эти два измерения — не одна и та же величина. Одно — это один прямой проход по промпту; другое — авторегрессионная генерация, которая может длиться тысячи токенов. Умножение бюджета формализации на решение за 34 мс ничего не говорит об относительной эффективности, потому что модели выполняют не одинаковый объём работы — одна читает и оценивает, другая читает и пишет скрипт доказательства. Если ваше ограничение — пропускная способность, то соответствующие факты проще, чем отношение. MathForm 8B формализует одно утверждение за генерацию, и при 16K токенов на выход на плотной 8B-модели это нагрузка, насыщающая GPU, и кандидат на батчинг через vLLM или SGLang, оба из которых документирует OpenBMB. Intern-Decision-0.8B отвечает на шестнадцать вопросов, покрывающих всю запись, за один проход, так что единица работы — это запись, а не поле, и бюджет записи — это потолок ввода в 8 192 токена — который наступает быстрее, чем читатель мог бы ожидать, когда вы упаковываете длинное состояние, богатую схему и до восьми изображений.
Где каждый из них — правильный инструмент
MathForm 8B принадлежит конвейеру, узким местом которого является человеческая проверка математики. Автоформализация существует потому, что писать на Lean медленнее, чем читать его, и потому, что машинно-проверяемое утверждение — это то, что затем может атаковать помощник доказательства. Свойство, которое делает её надёжной, — выходные данные, проверенные компилятором, — это также свойство, которое делает её узкой: она формализует, но не доказывает, и в карточке явно указано, что для проверок компиляции требуется работающий Kimina Lean Server, а в экспериментах использовался Lean 4.21.0. Любой, кто её внедряет, внедряет этот стек. Как и с любой моделью с открытыми весами, которой всего несколько дней или недель, направить на неё тестовый путь и переключаться на проверенную модель, когда она застопорится, — это способ оценить её с низким риском, для чего и нужен шлюз с автоматическим переключением при отказе по цепочке резервных вариантов — повторы, которые успевают произойти до начала ответа, так что застопорившаяся формализация никогда не доходит до вашего вызывающего кода.
Intern-Decision-0.8B уместен там, где уже существует закрытый набор ответов, а затраты на генерацию текста для его восстановления — чистая трата. Триаж, маршрутизация, оценка по рубрикам, вынесение решения по записи в соответствии с письменной политикой — случаи, когда генеративная модель используется как дорогостоящий способ выбора из списка. Его преимущества в том, что он детерминирован, что он возвращает пригодную для использования вероятность, а не строку, которую нужно парсить, и что при 1.73 ГБ на диске он работает с комфортом в пределах затрат памяти браузера на ноутбуке. Его недостатки в том, что документация ограничивается поверхностью API, что никто за пределами InternLM не опубликовал результатов по нему, и что единственный столбец бенчмарка, указывающий на проблему безопасности — оценка WildJailBreak 64.48 против 96.29 у Jev — не объяснён. Не ставьте его перед состязательным вводом, не проведя этот тест самостоятельно.

Обе модели имеют общее происхождение, которое стоит отметить, потому что оно меняет то, что вам даёт «открытость». Каждая представляет собой дообученную версию чекпойнта Qwen, и каждая корректно сохраняет лицензию апстрима: MathForm 8B по лицензии Apache 2.0 с указанным на карточке происхождением Qwen3-8B, Intern-Decision-0.8B по лицензии Apache 2.0 с отдельным LICENSE-QWEN файлом в репозитории. Ни одна из них не содержит порога по выручке или ограничения по области использования — в отличие от LFM Open License v1.0 от Liquid AI, которая ставит коммерческие права в зависимость от того, что ваша организация остаётся ниже порога годовой выручки в 10 миллионов долларов. Если вы ведёте коммерческую разработку, это различие отделяет эти два релиза от части экосистемы малых моделей, и оно в равной мере относится к обоим.
Если вы хотите слой принятия решений без недокументированной контрольной точки
Разрыв между «модуль принятия решений — подходящая форма для этой задачи» и «именно этот модуль принятия решений можно отстоять перед рецензентом» — это то, что закрывает хостинговая альтернатива. Jev 1.13 от TypeSafe — это модель, с которой InternLM сравнивала своё семейство на Jevbench, на Typed Decision и на ToolACE, и её можно вызвать уже сегодня через единый OpenAI-совместимый эндпоинт по цене $0.042 за миллион входных токенов, при этом вывод тарифицируется по нулю — опубликованный тариф вендора, переданный без наценки, а не с наценкой по пути. Для читателя, который хочет измерить, помогает ли модуль принятия решений вообще, прежде чем брать на себя обязательства по 0,8B-чекпоинту с отсутствующим репозиторием, это дешёвый первый эксперимент, а собственные сторонние оценки Jev дают ему документированную историю результатов, которой у Intern-Decision-0.8B пока нет.

Короткий ответ
Эти две — не альтернативы друг другу. MathForm 8B — это специалист, чей вывод может проверить программа, нацеленный на задачу, где проверка и есть самая сложная часть, и к нему прилагаются статья, датасет и стенд оценки, чтобы подтвердить это утверждение. Intern-Decision-0.8B — это специалист, чей вывод можете проверить только вы, нацеленный на задачи, где ответы уже были записаны, а сложной частью было добраться до них быстро и дёшево, и к нему прилагаются модуль инференса и таблица. Если вам нужна формализация, из этих двух стоит рассматривать только один. Если вам нужна метка и вы готовы построить эталонные данные, чтобы сверяться с ними, то 0.8B — более интересный вариант для скачивания: быстрый, детерминированный, под Apache 2.0 и достаточно маленький, чтобы выяснение, насколько он хорош, стоило полдня, а не отдельной строки в бюджете.
