
FrogNano-4B-2609 vs Intern Decision 4B: одна базовая модель, две совершенно разные ставки
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Две лаборатории взяли один и тот же чекпойнт, Qwen3.5-4B, и повели его в направлениях, которые ничуть не похожи друг на друга. microsoft/FrogNano-4B-2609 дообучили с помощью обучения с подкреплением примерно на 1500 синтетических средах разработки ПО, пока он не научился выдавать структурированные вызовы инструментов и многофайловые патчи через харнесс из пяти инструментов. internlm/Intern-Decision-4B был дообучен так, чтобы вообще не выдавать текст — он принимает состояние плюс схему именованных вопросов и возвращает откалиброванную вероятность для каждого варианта за один прямой проход. Один пишет код. Другой отказывается писать что-либо и возвращает распределение. Сравнивать их по качеству бессмысленно; честное упражнение — сравнивать их по тому, во сколько вам обходится их запуск и в чём им можно доверять.
Обе вышли без анонса — это ещё одна общая черта. Ни у одной нет записи в Artificial Analysis, рейтинга на арене или хотя бы одной независимой оценки. Каждая цифра ниже — лестница SWE-bench с одной стороны, строки калибровки Brier и ECE с другой — была получена лабораторией, обучившей модель, на её собственном стенде и ни разу не встречала тестового набора, из которого не происходила.
Форк произошёл ещё до того, как появилась любая из моделей.
Базовый чекпоинт — это плотная 32-слойная гибридная модель Gated DeltaNet и gated-attention, и оба производных наследуют её скелет. После этого два пайплайна постобучения не имеют ничего общего.
Конвейер Microsoft представляет собой замкнутый цикл. TaskPilot генерирует задачи-кандидаты для репозитория из реальных снимков, запускает роллауты от текущего чекпоинта, чтобы найти те, которые политика иногда решает, оставляет их и обучается. Пять итераций, каждая калибруется по политике предыдущей итерации, в итоге — 61,5% на SWE-bench Verified и 37,6% на SWE-bench Pro. Без дистилляции — в карточке указано, что траектории, действия или цепочки рассуждений более сильной модели не использовались в качестве целей.
Пайплайн InternLM представляет собой единую цель обучения с учителем для фиксированной формы задачи. Модели подаются системный промпт, состояние, схема решения и полный JSON-скелет ответа ассистента с одним заполнителем на каждое поле. Она выполняет один каузальный прямой проход, считывает логиты в каждой позиции заполнителя и применяет softmax только по разрешённым для этого поля символам-кандидатам. Карточка InternLM прямо говорит: этот путь «не вызывает generate() и не выполняет семплирование текста в свободной форме».
Это различие не в масштабе. Это различие в том, чем вообще является артефакт. FrogNano-4B-2609 — это агент, который может ошибаться сотней интересных способов, и его можно исправлять с помощью тестов. Intern-Decision-4B — это скорер, чей режим отказа — уверенное число.
Два контракта, и ни один из них — не «отправить промпт»
Контракт FrogNano — это цикл. Модель отправляет вызовы Read, Write, Edit, Glob и Bash; харнесс Leaf выполняет их внутри изолированной песочницы репозитория и возвращает результат; цикл продолжается до тех пор, пока модель не перестанет вызывать. Оценки выполнялись на 150 шагах в пределах примерно 131K суммарных токенов, при этом до 8 192 генерируемых токенов на один ход ассистента. Для обслуживания нужен SGLang с парсером рассуждений Qwen3 и парсером вызовов инструментов Qwen3 coder — ошибётесь с этим, и модель начнёт выдавать прозу там, где харнесс ожидает JSON, что со стороны выглядит точно как сломанная модель.
Контракт Intern-Decision-4B — это один запрос с жёстким ограничением. Вопросы и варианты сохраняют свой порядок. Варианты отображаются на однотокенные символы — A–Z, затем a–z, затем 0–9, что арифметически объясняет, почему у вопроса может быть не более 62 вариантов. Предел обёртки — 8 192 токена, и в карточке InternLM явно указано, что более длинные входные данные отклоняются без усечения. Поддерживаются три типа вопросов: choice с упорядоченной картой критериев, score со списком или картой с числовыми ключами, и noul — бинарный. Разрешается до восьми изображений, и их токены учитываются в тех же 8 192.
• Форма вывода — FrogNano-4B-2609 выдаёт вызовы инструментов, текст рассуждений и патч. Intern-Decision-4B выдаёт один символ на поле и ничего больше.
• Детерминизм — FrogNano выполняет сэмплирование при температуре 0.6 по трём сидам, поэтому он вероятностный по своей природе. Argmax модели Intern-Decision-4B фиксируется прямым проходом; подобранная температура изменяет только его уверенность.
• Поверхность отказов — FrogNano может галлюцинировать API, чрезмерно расширять правку или проходить тесты, внося уязвимость, — всё это перечислено в его карточке. Intern-Decision-4B не может галлюцинировать ответ, потому что он может выбирать только из предложенных вами вариантов — он может быть только плохо откалиброван.
• Потолок входных данных — около 131K суммарных токенов для FrogNano в конфигурации, в которой он оценивался, против жёсткого лимита в 8 192 для Intern-Decision-4B — разница в шестнадцать раз, и обходного пути нет.
• Структура затрат — FrogNano тарифицирует по траекториям, а траектории длинные. У Intern-Decision-4B вообще нет выходных токенов, за которые можно было бы выставить счёт.
• Параметры — карточка FrogNano указывает диапазон «500M-5B» и описывает примерно 4,66 млрд, при загрузке в BF16 объёмом 9,32 ГБ; Intern-Decision-4B заявлен на 4,54 млрд с 612-МБ визуальным блоком и 54-МБ проектором наряду с его языковыми шардами.
Число, которое определяет эту пару
Карточка InternLM указывает для Intern-Decision-4B среднюю задержку 44,16 мс и медианную 44,03 мс на одной RTX 4090 при использовании локального пути Hugging Face, с P95 на уровне 44,60 мс. Взгляните на этот разброс ещё раз: от медианы до хвоста — заметно меньше миллисекунды, потому что у прямого прохода с фиксированной формой почти нечему варьироваться. В этом и заключается весь аргумент в пользу такой архитектуры.
Соответствующий показатель FrogNano не выражается в миллисекундах. В его оценках допускался бюджет в 150 шагов при потолке агента в 10 800 секунд на задачу. Это несопоставимые единицы, и их ни в коем случае нельзя ставить в одно предложение с заявлением о задержке, — но они показывают форму компромисса. Одна модель отвечает на решение за сорок четыре миллисекунды, а другая тратит минуты вызовов инструментов в погоне за патчем. Если ваша задача — «направь этот тикет в одну из шести очередей и скажи, насколько ты уверен», то первая — не более дешёвая версия второй, это другая машина.
Обе лаборатории тщательно измерили себя, и оба набора измерений следует интерпретировать как намерения, а не как результаты. InternLM сообщает о среднем по семи наборам, равном 90,02, показателе Брайера, равном 0,347, и ожидаемой ошибке калибровки, равной 0,065, причём подгонка проводилась при температуре 1,99241824 на 1 728 отведённых для калибровки случаях. Microsoft сообщает о росте за пять итераций с 39,4% до 61,5% на SWE-bench Verified, а приложение к той же статье приводит ту же динамику в виде 48,2%, 53,4%, 58,3%, 58,6% и 61,6% — напоминание о том, что даже внутри одной лаборатории один и тот же факт, измеренный двумя способами, даёт две разные лестницы.

Выдающая деталь — в том, о чём каждая карта решает вас предупредить.
Обе карты на удивление честны, и эта честность ведёт в противоположные стороны — что самое полезное в этом сравнении.
Раздел Microsoft об известных ограничениях читается как предупреждение о развёртывании. Только английский и Python. Производительность чувствительна к тестовому стенду и качеству тестов. Патчи, которые могут быть некорректными или небезопасными, несмотря на прохождение их тестов. В самой карточке сказано, что FrogNano «не следует считать независимо выровненным по безопасности для неограниченного автономного развёртывания», и в ней назван конкретный пробел: постобучение, специфичное для агента, не использовало данные о предпочтениях по безопасности, отказах или состязательные данные, поскольку вместо этого оно оптимизировалось под функциональную корректность и избегание регрессий. В ней также добровольно раскрывается доля параллельных вызовов инструментов — 1,71%, то есть модель почти никогда не вызывает два инструмента за один ход, хотя тестовый стенд это допускает, — реальная регрессия возможностей относительно базовой модели, для попытки восстановления которой команда добавила этап консолидации.
Карточка InternLM предупреждает о противоположном классе проблем. Поверхности галлюцинаций, о которой стоило бы предупредить, здесь нет, поэтому оговорки касаются входных данных: отказ при 8 192, потолок в 62 варианта, тот факт, что лежащая в основе текстовая башня заявляет лимит позиций в 262 144 токена, который выпущенная обёртка отказывается использовать. Её риск в том, что уверенному числу доверяют больше, чем оно заслуживает, и карточка откровенно признаёт, что калибровка сужает разрыв с базовой линией Jev, но не закрывает его на каждом срезе.
Если читать их вместе, они описывают две разные модели доверия. FrogNano нуждается в надзоре, потому что действует. Intern-Decision-4B нуждается в аудите, потому что выставляет оценки, — а число, которое влияет на решение в продакшене, — это ровно тот тип вывода, который никому не приходит в голову тестировать.
Где место роутеру, и честное замечание об обоих
Ни одна из моделей не является хостируемым эндпоинтом. FrogNano поставляется как веса плюс стенд оценки на Kubernetes; Intern-Decision-4B поставляется как класс Python, который вы импортируете после загрузки четырёх шардов. Для команды, которая хочет попробовать любую из них перед чем-то реальным, безопасный шаблон одинаков для обеих, и он не выглядит эффектно: поставьте экспериментальный компонент за резервный вариант, чтобы неудачная траектория или день со сбитой калибровкой обходились повторной попыткой, а не инцидентом.
Именно для такой схемы и нужен слой маршрутизации. OrcaRouter обслуживает более 200 моделей за одним OpenAI-совместимым ключом с наценкой 0% — цена из прайс-листа провайдера передаётся как есть, так что изменение цены у поставщика отражается у нас в тот же день — а его механизм отказоустойчивого переключения находится перед универсальной моделью, к которой вы откатываетесь, а не перед этими двумя. Если говорить прямо: у нас нет FrogNano-4B-2609 или Intern-Decision-4B, и ни для одной из них нет даты. Что даёт вам здесь один эндпоинт — так это то, что само сравнение становится дешёвым: один ключ доступа, одна строка биллинга и отсутствие второй интеграции каждый раз, когда вы меняете универсальную модель, с которой сравниваете специализированную.

Какой именно, и когда
Возьмите Intern-Decision-4B, когда ответ уже есть в вашем промпте и его нужно выбрать, с прикреплённой оценкой уверенности, со скоростью тысячи в секунду. Маршрутизация по фиксированной таксономии, оценка по рубрикам, извлечение с ограничениями схемы, модерация по закрытому набору меток. Прямой проход за 44 миллисекунды и нулевой счёт за выходные токены — это и есть продукт, а калибровка — то, что нужно проверить, прежде чем ему доверять.
Возьмите FrogNano-4B-2609, когда ответа ещё не существует и его нужно найти, читая репозиторий и запуская его тесты. Это длящийся минуты, изолированный в песочнице и поддающийся проверке процесс, а 61,5% на SWE-bench Verified — заявленные вендором, невоспроизведённые — являются на данный момент лучшим доказательством того, что чекпоинт 4B вообще способен на это.
Что не должно пройти ни в ту, ни в другую сторону, так это привычка сравнивать их оценки. Средний результат 90,02 по семи наборам и показатель SWE-bench Verified 61,5 — это измерения двух разных вопросов, полученные двумя лабораториями, на двух разных стендах, и ни одно из этих чисел не побывало в руках третьей стороны. У них общий предок и больше ничего.

Единственное по-настоящему полезное предсказание, которое даёт общий предок: поскольку обе модели начинают с одного и того же 4B-чекпойнта, разница между ними почти полностью обусловлена пост-тренировкой, а значит, интересный вопрос для любого, кто строит что-то на Qwen3.5-4B, — какая из этих двух структур вознаграждения перенесётся в их собственную область. Синтетический цикл задач, который калибруется по собственной политике, или скоринговая голова фиксированной формы с подобранной температурой. Это два рецепта, оба опубликованы, оба — из лабораторий, которые пока не позволили никому другому их запустить. Это редкая ситуация, и за ней стоит наблюдать, а не покупаться на неё.
