
FrogNano-4B-2609: Microsoft выпустила 4B-агента для программирования на Hugging Face и не объявила об этом
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Репозиторий появился 17 сентября 2026 года с начальным коммитом, а сам чекпойнт — четырьмя минутами позже. Затем ничего. Ни твита от Microsoft AI, ни записи в блоге Microsoft Research, ни страницы запуска. Семь недель спустя microsoft/FrogNano-4B-2609 — агент для программирования класса четырёх миллиардов параметров, построенный на Qwen3.5-4B — по-прежнему не имеет за собой никакого анонса, и это молчание — самый важный факт о публикации этой модели. А что у него есть, так это карточка модели, которая заявляет статью и харнесс, репозиторий на GitHub, который оказывается харнессом, а не статьёй, и createdAt от 17 сентября, указанный под карточкой, где написано «Дата выпуска 22-SEP-2026». Обе даты импровизированы; ни одна не ошибочна; они противоречат друг другу.
Что на самом деле публикуется
Всё ниже можно проверить на хабе прямо сейчас, и каждая цифра в этом материале взята из собственной карточки Microsoft или из подсчёта байтов в самом репозитории. Ничего не было воспроизведено третьей стороной — нигде нет ни записи в Artificial Analysis, ни рейтинга арены, ни независимой оценки FrogNano.
• Веса — один публичный репозиторий в организации Microsoft, без ограничений доступа, с тегом MIT на хабе, 15 файлов, без шлюза загрузки и без необходимости подписывать соглашение.
• Веса на диске — 9,32 ГБ в двух шардах safetensors, 59,6 миллиарда байт данных репозитория, включая набор файлов без оптимизатора, 738 тензоров в индексе.
• Архитектура — Qwen3_5ForConditionalGeneration, плотный 32-слойный гибридный стек, унаследованный от Qwen3.5-4B, с 24-слойной башней зрения, которая, как указано в карточке, была унаследована и никогда не подвергалась постобучению.
• Собственное поле параметров карточки — «500M-5B». Это диапазон, а не число, и документ для скачивания является более точным.
• Лицензия — во вводной части карточки указано MIT. В самом теле карточки сказано Apache License 2.0, и инструментарий на GitHub действительно поставляет файл MIT LICENSE. Эти два утверждения относятся к разным артефактам одного и того же релиза.
• Анонса — нет. Ни в блоге Microsoft Research, ни на собственном исследовательском сайте команды, ни в ленте организации Hugging Face — нигде, кроме как в виде листинга репозитория.
Именно эта последняя фраза должна задать читателю настрой на всё остальное в этом тексте. Тихо загруженный чекпойнт — не менее значимый артефакт, чем анонсированный: его карточка часто длиннее, потому что никто не сокращает её ради пресс-релиза. Но он не прошёл через единственный фильтр, который анонсированный релиз получает бесплатно: взгляд других людей на него.

Партитуры, и кто создал каждую из них
Microsoft сообщает, что FrogNano достигает 61,5% на SWE-bench Verified, 37,6% на SWE-bench Pro, 31,1% на T-Bench 2.0, 47,3% на PatchEval-Verified — все как показатели решения Avg@3, измеренные с помощью стенда Leaf. В той же карточке указана отправная точка: Qwen3.5-4B показала 39,4% на SWE-bench Verified при идентичном стенде и бюджете. Пять итераций обучения с подкреплением провели её через 49,1%, 53,1%, 56,7%, 59,1% и 61,5% — на 22,1 пункта выше базовой модели, что в собственной формулировке Microsoft округляется примерно до 56% относительного улучшения.
На двух моментах, связанных с этой лестницей, стоит остановиться, потому что это места, где может ошибиться сводка, а не места, где ошибся поставщик.
Первое — расхождение в Iter 5. В основной таблице карточки указано 61,5 % для финальной итерации; в собственном приложении статьи по эффективности та же последовательность из пяти контрольных точек приводится как 48,2 %, 53,4 %, 58,3 %, 58,6 % и 61,6 %. Близко только последнее число, и именно его все и цитируют. Считайте финальный показатель стабильным результатом, а промежуточные ступени — измерением разных вещей, потому что при другой агрегации они явно таковыми и являются.
Второе заключается в том, что FrogNano не является неизменно лучше модели, от которой он произошёл, по всем параметрам. Его опубликованная доля параллельных вызовов инструментов составляет 1,71%. В карточке прямо признаётся, что более поздние итерации утратили способность инициировать несколько вызовов инструментов за один ход и что работа команды по консолидации отчасти существует для того, чтобы восстановить её. Модель, которая решает больше задач, почти не совершая параллельных вызовов, — это реальный инженерный компромисс, а не сноска.

Харнесс — это продукт, а репозиторий — это харнесс.
FrogNano не работает сам по себе. Он отправляет структурированные вызовы к пяти инструментам — Read, Write, Edit, Glob и Bash — а что-то должно выполнять их в изолированной среде и возвращать результат. Этим чем-то является Leaf, и здесь след делает нечто слегка необычное.
В строке «дополнительные связанные ресурсы» карточки модели есть ссылка на технический отчёт по адресу aka.ms/frognano-tech-report, а также на стенд по адресу github.com/microsoft/FrogNano. Ссылка aka.ms не ведёт на PDF; она перенаправляет прямо на страницу аннотации arXiv, где на самом деле находится отчёт. Репозиторий GitHub, тем временем, не содержит ни кода обучения, ни рецепта RL, ни контрольных точек. В его собственном README описывается стенд для оценки, который запускает агентов-программистов в песочницах Kubernetes на эндпоинте, совместимом с OpenAI, и отсылает обратно к статье arXiv за историей обучения. Таким образом, две ссылки на ресурсы в карточке — это указатель на статью и указатель на отклик на неё, а название — общее.
Это важно для всех, кто планирует использовать модель, и по вполне практической причине. Документированный рецепт обслуживания — это SGLang с --reasoning-parser qwen3 и --tool-call-parser qwen3_coder, а харнессу нужен эндпоинт, который уже умеет работать с вызовами инструментов и рассуждениями. Ошибётесь совсем немного в конфигурации парсинга — и модель выдаёт текст там, где харнесс ожидает JSON, а это со стороны выглядит ровно как плохая модель, а не как плохая конфигурация. В карточке прямо сказано, что любой сопоставимый результат требует соответствующего чекпоинта, токенизатора, конфигурации обслуживания, изображений задач и протокола оценки — это производитель говорит вам, что харнесс — это половина результата.
Также стоит прямо сказать всем, кто подбирает конфигурацию оборудования: чекпойнт объёмом 9,32 ГБ при оценённом в карточке контексте — это не задача инференса объёмом 9,32 ГБ. Оценки проводились примерно на 131 тыс. суммарных токенов с бюджетом в 150 шагов. Объём памяти масштабируется вместе с контекстом, а не с весами, а в карточке сказано, что минимальная конфигурация GPU всё ещё «должна быть проверена перед релизом» — фраза, которая фигурирует на модели, уже доступной для скачивания.
Что на самом деле сделала тренировка, в одном абзаце
Вклад статьи — не модель, а цикл. TaskPilot генерирует задачи-кандидаты по программной инженерии из реальных снимков репозиториев, запускает на них роллауты с текущего чекпоинта, оставляет те, что находятся у границы того, что политика иногда способна решить, и отбрасывает кандидатов, которые всегда тривиальны или всегда невозможны. Принятый набор обучает следующий чекпоинт. Этот следующий чекпоинт затем калибрует следующий раунд генерации задач, так что распределение задач смещается вместе с политикой. Всего примерно 1500 валидированных сред. Без дистилляции: в карточке прямо сказано, что агент-специфичное постобучение не использовало ни траектории решений более сильной модели, ни действия, ни следы рассуждений, ни целевые патчи. Более сильные модели пишут задачи; они не демонстрируют ответы.
Microsoft прогнала этот цикл пять итераций и сообщает о приросте в 8,7 пункта до какой-либо консолидации, при этом в середине прогона был добавлен штраф за длину журнала, поскольку трассировки рассуждений росли быстрее, чем улучшались.
Карточка модели необычно прямо говорит о том, где весь этот подход хрупок. Обучающие данные в основном на Python и преимущественно на английском; заявленный в карточке набор поддерживаемых естественных языков — только английский, и ничего больше, а более широкое многоязычное покрытие базовой модели явно не декларируется. Производительность чувствительна к тестовому стенду и к качеству тестов. Сгенерированные патчи «могут быть некорректными или небезопасными, несмотря на прохождение доступных тестов». Карточка модели для 4B завершает этот абзац предложением, которое следует запомнить каждому читателю: не использовать без квалифицированной проверки человеком и независимого регрессионного тестирования и тестирования безопасности. Это заявление вендора об артефакте вендора, и оно полезнее любой из строк таблицы результатов выше него.
Что это значит для покупателя и при чём тут роутер
FrogNano — это не модель, которую вы вызываете. У неё нет первостороннего API, нет хостинговой конечной точки и нет бессерверного образа. Это чекпойнт, и его использование означает либо поднять собственное развёртывание SGLang за песочницей, хостируемой в Kubernetes, либо оценить его как компонент внутри агентного стека, который вы уже эксплуатируете. Это и есть весь путь внедрения сегодня, и никакой анонс не изменил бы его форму.
То, что слой маршрутизации может здесь честно сделать, — это вещь более узкая, чем кажется на первый взгляд. Если план — сравнить самостоятельно размещённый FrogNano с хостируемой моделью для программирования внутри вашего собственного харнесса, то именно хостируемой половине выгодно быть за одним ключом, а не за вторым контрактом: OrcaRouter несёт более 200 моделей за единой конечной точкой, совместимой с OpenAI, с наценкой 0%, то есть прайс-листы провайдеров проходят без изменений, а изменение цены вендором становится актуальным на нашей стороне в тот же день. Это важно для сравнения, исход которого решается стоимостью на решённую задачу, а не одной цифрой бенчмарка. Мы не хостим FrogNano, и даты для этого нет; веса и работа по обслуживанию — на вас.

Три вещи, которые могли бы это уладить
Сначала — независимое воспроизведение. Каждое число в этой статье — 61.5, 37.6, 31.1, 47.3 — было получено лабораторией, которая обучала модель, на стенде, который поддерживает та же лаборатория, по сравнению с показателем базовой модели, который измерила та же лаборатория. Это полная и внутренне согласованная картина, и это также замкнутый цикл. Полезная проверка — воспроизведёт ли кто-то незаинтересованный скачок с 39.4 до 61.5 на тех же 500 задачах без калибровочной работы Microsoft над набором задач.
Во-вторых, кто-то должен проверить заявление о тестовом стенде от начала до конца. Репозиторий открыт — это больше, чем удаётся многим релизам, — но это и есть стенд для оценки. Если пять инструментов и изоляция песочницы действительно являются механизмом производительности, независимая сторона, запустившая опубликованную конфигурацию, должна получить результаты, близкие к опубликованным числам. Если этого не произойдёт, то расхождение и будет настоящей находкой.
В-третьих, и на это проще всего ответить: Microsoft следует сказать, является ли это продуктом или артефактом статьи. В разделе карточки, посвящённом распространению, веса, сама карточка и испытательный стенд рассматриваются как конечный результат, что читается скорее как публикация, а не как запуск. «Дата выпуска 22-SEP-2026» звучит как запуск. Анонсированная модель сняла бы эту неоднозначность в первом предложении поста в блоге, а поста в блоге нет.
До тех пор правильная позиция — та, которую подразумевает сам релиз. FrogNano-4B-2609 — это настоящий, доступный для скачивания чекпойнт под MIT, Apache и, возможно, не только, с необычайно подробной карточкой, публичным стендом для оценки, настоящей методологической идеей и таблицей результатов, к которой никогда не прикасался никто без адреса Microsoft. Для лаборатории это законченный и интересный артефакт. Для команды, которая собирается в три часа ночи посадить агента перед репозиторием, это зацепка, которую стоит отработать, но ещё не решение, которое стоит принимать.
