Титульная карточка-герой с надписью «Intern-Decision-0.8B vs MathForm 8B» и подзаголовком «Один из них может проверить свою собственную работу», с бейджами «вывод Lean 4, проверенный компилятором» и «только самостоятельно заявленная уверенность», с логотипом OrcaRouter, наложенным в углу.
Guides & Insights

Intern-Decision-0.8B против MathForm 8B: одна из них может проверять собственную работу

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самый полезный вопрос, который можно задать о любой небольшой специализированной модели, — кто её проверяет. Intern-Decision-0.8B и MathForm 8B существуют обе потому, что общую модель дообучили до узкоспециализированной; обе являются производными от весов Qwe​n под лицензией Apache-2.0, и обе были выложены на Hugging Face без маркетинговой кампании — но они находятся по разные стороны линии, которая определяет, как вы стали бы их развёртывать. MathForm 8B — это 8B-модель автоформализации от OpenBMB, выпущенная 14 августа 2026 года, которая переводит математику на естественном языке в Lean 4 и передаёт результат компилятору, а тот либо принимает его, либо нет. Intern-Decision-0.8B — это решающая голова InternLM с 852 985 920 параметрами, загруженная 26 сентября 2026 года, которая возвращает калиброванное распределение вероятностей по вариантам, которые вы задали заранее, — и ничто в мире независимо не проверяет, правильна ли метка, которую она возвращает. Одна из этих моделей выдаёт результат с доказательством. Другая выдаёт результат с оценкой уверенности, и разница в том, что вы можете делать с этими двумя вещами, и составляет суть всей статьи.

Такая трактовка также объясняет, почему разрыв в размере — 8B против 0,8B, в десять раз — является наименее интересным числом в этом сравнении. Ни одна из моделей не стремится быть сильной в том, что делает другая, и оценка ни одной из них ничего не говорит о другой. Общее у них — это схема выпуска и принадлежность к линейке Qwen, и оба эти фактора значат меньше, чем вопрос верификации.

Что каждый из них на самом деле из себя представляет

MathForm 8B — это выпущенный артефакт двухэтапного рецепта, описанного в статье MathForm: Масштабирование математической автоформализации с извлечением знаний и уточнением под руководством верификации (arXiv 2608.14221). Планировщик извлечения подтягивает релевантные определения и существующие формализации из Mathlib до запуска генератора; затем сгенерированные утверждения пересматриваются с использованием диагностики компилятора и обратной связи по семантической согласованности; полученный корпус FormalVerse содержит примерно 367 000 проверенных примеров на Lean 4; и MathForm 8B обучается на нём с помощью контролируемого дообучения, за которым следует обучение с подкреплением, использующее сигналы компиляции Lean и семантической согласованности в качестве награды. Это текстовая модель на основе Qwen3-8B, обслуживаемая через Transformers, vLLM или SGLang с API, совместимым с OpenAI, с рекомендуемой длиной контекста 16 384 токена и максимальным бюджетом генерации 16 384 токена. Её оценочный конвейер, файлы бенчмарков и скрипты Pass@k находятся в репозитории OpenBMB на GitHub, а набор данных для обучения является публичным.

Intern-Decision-0.8B — это поставляемый артефакт рецепта, который никто не описывал. В карточке модели сказано, что это «мультимодальная структурированная модель принятия решений, дообученная на основе Qwen3.5-0.8B», и на этом всё — ни описания данных, ни процедуры обучения, ни статьи, ни репозитория. Зато она подробно документирует контракт инференса. Встроенный движок сопоставляет варианты ответа каждого вопроса однотокенным символам, строит скелет, в котором на каждое поле есть один <decision> плейсхолдер, выполняет один каузальный прямой проход, считывает логиты в позиции перед каждым плейсхолдером, выполняет softmax только по разрешённым символам этого поля, применяет подобранную калибровку и преобразует символы обратно в значения ваших вариантов. В этом пути нигде нет вызова generate() и не выполняется сэмплирование. Он принимает текст и до восьми изображений, обрабатывает от одного до шестнадцати вопросов, в каждом из которых до 62 вариантов, и отклоняет входные данные длиннее 8 192 токенов, а не усекает их. Температура калибровки по умолчанию — 2,747760550703; она подбирается для каждого чекпойнта минимизацией NLL по 1 728 случаям.

Прочитайте эти два абзаца рядом, и асимметрия становится очевидной. MathForm 8B поставляется со статьёй, набором данных, конвейером оценки и репозиторием. Intern-Decision-0.8B поставляется с описанием API и таблицей бенчмарков.

Асимметрия верификации — вот в чём настоящая суть

Вывод MathForm 8B можно проверить чем-то, кроме человека. Он генерирует Lean 4, а Lean 4 либо компилируется, либо нет. Цифры OpenBMB приводятся в двух режимах именно по этой причине: Pass@8 88,06% при проверке синтаксиса, что означает, что вывод компилируется, и 72,37% при проверке согласованности, что означает, что он компилируется, и проверка семантической согласованности подтверждает, что формальное утверждение означает то же, что и неформальное. Оба показателя являются средними по шести бенчмаркам, и в статье также сообщаются показатели прохождения CC — 63% на FATE-H и 37% на более сложных подмножествах FATE-X, с утверждением, что это превосходит специализированные автоформализаторы на 32B. Эти данные предоставлены производителем — их проводила OpenBMB — но важное свойство является структурным, а не статистическим: нижестоящая система, потребляющая вывод MathForm 8B, может отклонить плохую формализацию, не прося модель судить о ней. Компилятор — это оракул.

Intern-Decision-0.8B имеет контракт типов и не имеет оракула. Форма вывода гарантирована — поле, объявленное как choice, возвращает распределение по перечисленным вами значениям опций, а score возвращает взвешенное по вероятностям ожидаемое значение по вашей рубрике, а noul возвращает вероятность ответа «да». Ничто вне модели не может сказать вам, был ли argmax правильным. Значение уверенности — это собственная оценка моделью собственной правильности, а работа по калибровке карточки — честная попытка сделать эту оценку осмысленной — подобранная температура, которая сохраняет argmax, одновременно заостряя или смягчая вероятности, проверенная на отложенных примерах — но хорошо откалиброванный неправильный ответ всё равно остаётся неправильным ответом. Если вашему пайплайну нужно знать, верна ли метка, вам нужны размеченные данные, и вам нужно измерить это самостоятельно.

Это не дефект, свойственный только Intern-Decision-0.8B. Это состояние, характерное для любого классификатора, и это нерешённая проблема во всей категории моделей принятия решений, включающей Jev от TypeSafe и Laya от Convai. Об этом стоит сказать чётко, потому что таблица бенчмарка со столбцом Brier score может создать впечатление, будто калибровка — это верификация. Это не так. Калибровка говорит, что когда эта модель выдаёт 80%, она права примерно в 80% случаев в рамках оцениваемого распределения — что действительно полезно для установки порогов и вычисления ожидаемой ценности и не является гарантией правильности для отдельного элемента.

Табло, по строкам, которые есть у обеих моделей

Параметры — Intern-Decision-0.8B: 852 985 920 параметров, распределённых по языковому шарду на 1,50 ГБ, визуальному шарду на 176 МБ и проектору на 25 МБ. MathForm 8B: плотная модель 8B на основе Qwen3-8B.

Базовая модель — Intern-Decision-0.8B: Qwen3.5-0.8B, выпущена в феврале 2026 года. MathForm 8B: Qwen3-8B.

• Задача — Intern-Decision-0.8B: типизированные решения по схеме, которую вы пишете, — выбор, оценка, бинарный. MathForm 8B: формализация математики на естественном языке в Lean 4.

• Вывод — Intern-Decision-0.8B: калиброванное распределение плюс argmax по каждому полю, текст не генерируется. MathForm 8B: сгенерированный исходный код Lean 4, обычно длинный.

• Верификация — Intern-Decision-0.8B: внешняя отсутствует; уверенность — по самооценке. MathForm 8B: компилятор Lean 4 плюс проверка семантической согласованности.

• Опубликованные данные — Intern-Decision-0.8B: таблица бенчмарков от вендора по семи бенчмаркам, не воспроизведена, без статьи. MathForm 8B: статья, публичный датасет примерно из 367 000 примеров, пайплайн оценки и репозиторий, запущено вендором.

• Лицензия — обе распространяются под Apache 2.0, а Intern-Decision-0.8B дополнительно содержит сохранённый файл лицензии Qwen для своих вышестоящих весов.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

Издержки и задержка несопоставимы, и это не уловка

InternLM измерила Intern-Decision-0.8B на 33,98 мс среднего и 37,50 мс p95 на запрос на одном RTX 4090 через локальный путь Hugging Face, а её 2B-собрат показал 33,28 мс среднего. В собственной карточке MathForm 8B рекомендуется до 16 384 новых токенов на формализацию при temperature 0.6 и top_p 0.95. Эти два измерения — не одна и та же величина. Одно — это один прямой проход по промпту; другое — авторегрессионная генерация, которая может длиться тысячи токенов. Умножение бюджета формализации на решение за 34 мс ничего не говорит об относительной эффективности, потому что модели выполняют не одинаковый объём работы — одна читает и оценивает, другая читает и пишет скрипт доказательства. Если ваше ограничение — пропускная способность, то соответствующие факты проще, чем отношение. MathForm 8B формализует одно утверждение за генерацию, и при 16K токенов на выход на плотной 8B-модели это нагрузка, насыщающая GPU, и кандидат на батчинг через vLLM или SGLang, оба из которых документирует OpenBMB. Intern-Decision-0.8B отвечает на шестнадцать вопросов, покрывающих всю запись, за один проход, так что единица работы — это запись, а не поле, и бюджет записи — это потолок ввода в 8 192 токена — который наступает быстрее, чем читатель мог бы ожидать, когда вы упаковываете длинное состояние, богатую схему и до восьми изображений.

Где каждый из них — правильный инструмент

MathForm 8B принадлежит конвейеру, узким местом которого является человеческая проверка математики. Автоформализация существует потому, что писать на Lean медленнее, чем читать его, и потому, что машинно-проверяемое утверждение — это то, что затем может атаковать помощник доказательства. Свойство, которое делает её надёжной, — выходные данные, проверенные компилятором, — это также свойство, которое делает её узкой: она формализует, но не доказывает, и в карточке явно указано, что для проверок компиляции требуется работающий Kimina Lean Server, а в экспериментах использовался Lean 4.21.0. Любой, кто её внедряет, внедряет этот стек. Как и с любой моделью с открытыми весами, которой всего несколько дней или недель, направить на неё тестовый путь и переключаться на проверенную модель, когда она застопорится, — это способ оценить её с низким риском, для чего и нужен шлюз с автоматическим переключением при отказе по цепочке резервных вариантов — повторы, которые успевают произойти до начала ответа, так что застопорившаяся формализация никогда не доходит до вашего вызывающего кода.

Intern-Decision-0.8B уместен там, где уже существует закрытый набор ответов, а затраты на генерацию текста для его восстановления — чистая трата. Триаж, маршрутизация, оценка по рубрикам, вынесение решения по записи в соответствии с письменной политикой — случаи, когда генеративная модель используется как дорогостоящий способ выбора из списка. Его преимущества в том, что он детерминирован, что он возвращает пригодную для использования вероятность, а не строку, которую нужно парсить, и что при 1.73 ГБ на диске он работает с комфортом в пределах затрат памяти браузера на ноутбуке. Его недостатки в том, что документация ограничивается поверхностью API, что никто за пределами InternLM не опубликовал результатов по нему, и что единственный столбец бенчмарка, указывающий на проблему безопасности — оценка WildJailBreak 64.48 против 96.29 у Jev — не объяснён. Не ставьте его перед состязательным вводом, не проведя этот тест самостоятельно.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Обе модели имеют общее происхождение, которое стоит отметить, потому что оно меняет то, что вам даёт «открытость». Каждая представляет собой дообученную версию чекпойнта Qwen, и каждая корректно сохраняет лицензию апстрима: MathForm 8B по лицензии Apache 2.0 с указанным на карточке происхождением Qwen3-8B, Intern-Decision-0.8B по лицензии Apache 2.0 с отдельным LICENSE-QWEN файлом в репозитории. Ни одна из них не содержит порога по выручке или ограничения по области использования — в отличие от LFM Open License v1.0 от Liquid AI, которая ставит коммерческие права в зависимость от того, что ваша организация остаётся ниже порога годовой выручки в 10 миллионов долларов. Если вы ведёте коммерческую разработку, это различие отделяет эти два релиза от части экосистемы малых моделей, и оно в равной мере относится к обоим.

Если вы хотите слой принятия решений без недокументированной контрольной точки

Разрыв между «модуль принятия решений — подходящая форма для этой задачи» и «именно этот модуль принятия решений можно отстоять перед рецензентом» — это то, что закрывает хостинговая альтернатива. Jev 1.13 от TypeSafe — это модель, с которой InternLM сравнивала своё семейство на Jevbench, на Typed Decision и на ToolACE, и её можно вызвать уже сегодня через единый OpenAI-совместимый эндпоинт по цене $0.042 за миллион входных токенов, при этом вывод тарифицируется по нулю — опубликованный тариф вендора, переданный без наценки, а не с наценкой по пути. Для читателя, который хочет измерить, помогает ли модуль принятия решений вообще, прежде чем брать на себя обязательства по 0,8B-чекпоинту с отсутствующим репозиторием, это дешёвый первый эксперимент, а собственные сторонние оценки Jev дают ему документированную историю результатов, которой у Intern-Decision-0.8B пока нет.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Короткий ответ

Эти две — не альтернативы друг другу. MathForm 8B — это специалист, чей вывод может проверить программа, нацеленный на задачу, где проверка и есть самая сложная часть, и к нему прилагаются статья, датасет и стенд оценки, чтобы подтвердить это утверждение. Intern-Decision-0.8B — это специалист, чей вывод можете проверить только вы, нацеленный на задачи, где ответы уже были записаны, а сложной частью было добраться до них быстро и дёшево, и к нему прилагаются модуль инференса и таблица. Если вам нужна формализация, из этих двух стоит рассматривать только один. Если вам нужна метка и вы готовы построить эталонные данные, чтобы сверяться с ними, то 0.8B — более интересный вариант для скачивания: быстрый, детерминированный, под Apache 2.0 и достаточно маленький, чтобы выяснение, насколько он хорош, стоило полдня, а не отдельной строки в бюджете.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube