Сгенерированная титульная карточка с надписью «FrogNano-4B-2609 vs Intern-Decision-4B» и подзаголовком «один и тот же предок Qwen3.5-4B, два противоположных результата», три чипа с надписями «вызовы инструментов и патчи», «один символ на поле» и «ни один не оценён независимо», нижний колонтитул с надписью «Оба табло результатов заявлены вендорами; ни одна третья сторона не воспроизвела ни одного из них», а логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: одна базовая модель, две совершенно разные ставки

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две лаборатории взяли один и тот же чекпойнт, Qwen3.5-4B, и повели его в направлениях, которые ничуть не похожи друг на друга. microsoft/FrogNano-4B-2609 дообучили с помощью обучения с подкреплением примерно на 1500 синтетических средах разработки ПО, пока он не научился выдавать структурированные вызовы инструментов и многофайловые патчи через харнесс из пяти инструментов. internlm/Intern-Decision-4B был дообучен так, чтобы вообще не выдавать текст — он принимает состояние плюс схему именованных вопросов и возвращает откалиброванную вероятность для каждого варианта за один прямой проход. Один пишет код. Другой отказывается писать что-либо и возвращает распределение. Сравнивать их по качеству бессмысленно; честное упражнение — сравнивать их по тому, во сколько вам обходится их запуск и в чём им можно доверять.

Обе вышли без анонса — это ещё одна общая черта. Ни у одной нет записи в Artificial Analysis, рейтинга на арене или хотя бы одной независимой оценки. Каждая цифра ниже — лестница SWE-bench с одной стороны, строки калибровки Brier и ECE с другой — была получена лабораторией, обучившей модель, на её собственном стенде и ни разу не встречала тестового набора, из которого не происходила.

Форк произошёл ещё до того, как появилась любая из моделей.

Базовый чекпоинт — это плотная 32-слойная гибридная модель Gated DeltaNet и gated-attention, и оба производных наследуют её скелет. После этого два пайплайна постобучения не имеют ничего общего.

Конвейер Microsoft представляет собой замкнутый цикл. TaskPilot генерирует задачи-кандидаты для репозитория из реальных снимков, запускает роллауты от текущего чекпоинта, чтобы найти те, которые политика иногда решает, оставляет их и обучается. Пять итераций, каждая калибруется по политике предыдущей итерации, в итоге — 61,5% на SWE-bench Verified и 37,6% на SWE-bench Pro. Без дистилляции — в карточке указано, что траектории, действия или цепочки рассуждений более сильной модели не использовались в качестве целей.

Пайплайн InternLM представляет собой единую цель обучения с учителем для фиксированной формы задачи. Модели подаются системный промпт, состояние, схема решения и полный JSON-скелет ответа ассистента с одним заполнителем на каждое поле. Она выполняет один каузальный прямой проход, считывает логиты в каждой позиции заполнителя и применяет softmax только по разрешённым для этого поля символам-кандидатам. Карточка InternLM прямо говорит: этот путь «не вызывает generate() и не выполняет семплирование текста в свободной форме».

Это различие не в масштабе. Это различие в том, чем вообще является артефакт. FrogNano-4B-2609 — это агент, который может ошибаться сотней интересных способов, и его можно исправлять с помощью тестов. Intern-Decision-4B — это скорер, чей режим отказа — уверенное число.

Два контракта, и ни один из них — не «отправить промпт»

Контракт FrogNano — это цикл. Модель отправляет вызовы Read, Write, Edit, Glob и Bash; харнесс Leaf выполняет их внутри изолированной песочницы репозитория и возвращает результат; цикл продолжается до тех пор, пока модель не перестанет вызывать. Оценки выполнялись на 150 шагах в пределах примерно 131K суммарных токенов, при этом до 8 192 генерируемых токенов на один ход ассистента. Для обслуживания нужен SGLang с парсером рассуждений Qwen3 и парсером вызовов инструментов Qwen3 coder — ошибётесь с этим, и модель начнёт выдавать прозу там, где харнесс ожидает JSON, что со стороны выглядит точно как сломанная модель.

Контракт Intern-Decision-4B — это один запрос с жёстким ограничением. Вопросы и варианты сохраняют свой порядок. Варианты отображаются на однотокенные символы — A–Z, затем a–z, затем 0–9, что арифметически объясняет, почему у вопроса может быть не более 62 вариантов. Предел обёртки — 8 192 токена, и в карточке InternLM явно указано, что более длинные входные данные отклоняются без усечения. Поддерживаются три типа вопросов: choice с упорядоченной картой критериев, score со списком или картой с числовыми ключами, и noul — бинарный. Разрешается до восьми изображений, и их токены учитываются в тех же 8 192.

• Форма вывода — FrogNano-4B-2609 выдаёт вызовы инструментов, текст рассуждений и патч. Intern-Decision-4B выдаёт один символ на поле и ничего больше.

• Детерминизм — FrogNano выполняет сэмплирование при температуре 0.6 по трём сидам, поэтому он вероятностный по своей природе. Argmax модели Intern-Decision-4B фиксируется прямым проходом; подобранная температура изменяет только его уверенность.

• Поверхность отказов — FrogNano может галлюцинировать API, чрезмерно расширять правку или проходить тесты, внося уязвимость, — всё это перечислено в его карточке. Intern-Decision-4B не может галлюцинировать ответ, потому что он может выбирать только из предложенных вами вариантов — он может быть только плохо откалиброван.

• Потолок входных данных — около 131K суммарных токенов для FrogNano в конфигурации, в которой он оценивался, против жёсткого лимита в 8 192 для Intern-Decision-4B — разница в шестнадцать раз, и обходного пути нет.

• Структура затрат — FrogNano тарифицирует по траекториям, а траектории длинные. У Intern-Decision-4B вообще нет выходных токенов, за которые можно было бы выставить счёт.

• Параметры — карточка FrogNano указывает диапазон «500M-5B» и описывает примерно 4,66 млрд, при загрузке в BF16 объёмом 9,32 ГБ; Intern-Decision-4B заявлен на 4,54 млрд с 612-МБ визуальным блоком и 54-МБ проектором наряду с его языковыми шардами.

Число, которое определяет эту пару

Карточка InternLM указывает для Intern-Decision-4B среднюю задержку 44,16 мс и медианную 44,03 мс на одной RTX 4090 при использовании локального пути Hugging Face, с P95 на уровне 44,60 мс. Взгляните на этот разброс ещё раз: от медианы до хвоста — заметно меньше миллисекунды, потому что у прямого прохода с фиксированной формой почти нечему варьироваться. В этом и заключается весь аргумент в пользу такой архитектуры.

Соответствующий показатель FrogNano не выражается в миллисекундах. В его оценках допускался бюджет в 150 шагов при потолке агента в 10 800 секунд на задачу. Это несопоставимые единицы, и их ни в коем случае нельзя ставить в одно предложение с заявлением о задержке, — но они показывают форму компромисса. Одна модель отвечает на решение за сорок четыре миллисекунды, а другая тратит минуты вызовов инструментов в погоне за патчем. Если ваша задача — «направь этот тикет в одну из шести очередей и скажи, насколько ты уверен», то первая — не более дешёвая версия второй, это другая машина.

Обе лаборатории тщательно измерили себя, и оба набора измерений следует интерпретировать как намерения, а не как результаты. InternLM сообщает о среднем по семи наборам, равном 90,02, показателе Брайера, равном 0,347, и ожидаемой ошибке калибровки, равной 0,065, причём подгонка проводилась при температуре 1,99241824 на 1 728 отведённых для калибровки случаях. Microsoft сообщает о росте за пять итераций с 39,4% до 61,5% на SWE-bench Verified, а приложение к той же статье приводит ту же динамику в виде 48,2%, 53,4%, 58,3%, 58,6% и 61,6% — напоминание о том, что даже внутри одной лаборатории один и тот же факт, измеренный двумя способами, даёт две разные лестницы.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

Выдающая деталь — в том, о чём каждая карта решает вас предупредить.

Обе карты на удивление честны, и эта честность ведёт в противоположные стороны — что самое полезное в этом сравнении.

Раздел Microsoft об известных ограничениях читается как предупреждение о развёртывании. Только английский и Python. Производительность чувствительна к тестовому стенду и качеству тестов. Патчи, которые могут быть некорректными или небезопасными, несмотря на прохождение их тестов. В самой карточке сказано, что FrogNano «не следует считать независимо выровненным по безопасности для неограниченного автономного развёртывания», и в ней назван конкретный пробел: постобучение, специфичное для агента, не использовало данные о предпочтениях по безопасности, отказах или состязательные данные, поскольку вместо этого оно оптимизировалось под функциональную корректность и избегание регрессий. В ней также добровольно раскрывается доля параллельных вызовов инструментов — 1,71%, то есть модель почти никогда не вызывает два инструмента за один ход, хотя тестовый стенд это допускает, — реальная регрессия возможностей относительно базовой модели, для попытки восстановления которой команда добавила этап консолидации.

Карточка InternLM предупреждает о противоположном классе проблем. Поверхности галлюцинаций, о которой стоило бы предупредить, здесь нет, поэтому оговорки касаются входных данных: отказ при 8 192, потолок в 62 варианта, тот факт, что лежащая в основе текстовая башня заявляет лимит позиций в 262 144 токена, который выпущенная обёртка отказывается использовать. Её риск в том, что уверенному числу доверяют больше, чем оно заслуживает, и карточка откровенно признаёт, что калибровка сужает разрыв с базовой линией Jev, но не закрывает его на каждом срезе.

Если читать их вместе, они описывают две разные модели доверия. FrogNano нуждается в надзоре, потому что действует. Intern-Decision-4B нуждается в аудите, потому что выставляет оценки, — а число, которое влияет на решение в продакшене, — это ровно тот тип вывода, который никому не приходит в голову тестировать.

Где место роутеру, и честное замечание об обоих

Ни одна из моделей не является хостируемым эндпоинтом. FrogNano поставляется как веса плюс стенд оценки на Kubernetes; Intern-Decision-4B поставляется как класс Python, который вы импортируете после загрузки четырёх шардов. Для команды, которая хочет попробовать любую из них перед чем-то реальным, безопасный шаблон одинаков для обеих, и он не выглядит эффектно: поставьте экспериментальный компонент за резервный вариант, чтобы неудачная траектория или день со сбитой калибровкой обходились повторной попыткой, а не инцидентом.

Именно для такой схемы и нужен слой маршрутизации. OrcaRouter обслуживает более 200 моделей за одним OpenAI-совместимым ключом с наценкой 0% — цена из прайс-листа провайдера передаётся как есть, так что изменение цены у поставщика отражается у нас в тот же день — а его механизм отказоустойчивого переключения находится перед универсальной моделью, к которой вы откатываетесь, а не перед этими двумя. Если говорить прямо: у нас нет FrogNano-4B-2609 или Intern-Decision-4B, и ни для одной из них нет даты. Что даёт вам здесь один эндпоинт — так это то, что само сравнение становится дешёвым: один ключ доступа, одна строка биллинга и отсутствие второй интеграции каждый раз, когда вы меняете универсальную модель, с которой сравниваете специализированную.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

Какой именно, и когда

Возьмите Intern-Decision-4B, когда ответ уже есть в вашем промпте и его нужно выбрать, с прикреплённой оценкой уверенности, со скоростью тысячи в секунду. Маршрутизация по фиксированной таксономии, оценка по рубрикам, извлечение с ограничениями схемы, модерация по закрытому набору меток. Прямой проход за 44 миллисекунды и нулевой счёт за выходные токены — это и есть продукт, а калибровка — то, что нужно проверить, прежде чем ему доверять.

Возьмите FrogNano-4B-2609, когда ответа ещё не существует и его нужно найти, читая репозиторий и запуская его тесты. Это длящийся минуты, изолированный в песочнице и поддающийся проверке процесс, а 61,5% на SWE-bench Verified — заявленные вендором, невоспроизведённые — являются на данный момент лучшим доказательством того, что чекпоинт 4B вообще способен на это.

Что не должно пройти ни в ту, ни в другую сторону, так это привычка сравнивать их оценки. Средний результат 90,02 по семи наборам и показатель SWE-bench Verified 61,5 — это измерения двух разных вопросов, полученные двумя лабораториями, на двух разных стендах, и ни одно из этих чисел не побывало в руках третьей стороны. У них общий предок и больше ничего.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

Единственное по-настоящему полезное предсказание, которое даёт общий предок: поскольку обе модели начинают с одного и того же 4B-чекпойнта, разница между ними почти полностью обусловлена пост-тренировкой, а значит, интересный вопрос для любого, кто строит что-то на Qwen3.5-4B, — какая из этих двух структур вознаграждения перенесётся в их собственную область. Синтетический цикл задач, который калибруется по собственной политике, или скоринговая голова фиксированной формы с подобранной температурой. Это два рецепта, оба опубликованы, оба — из лабораторий, которые пока не позволили никому другому их запустить. Это редкая ситуация, и за ней стоит наблюдать, а не покупаться на неё.