
FrogNano-4B-2609 против Gemma 4 12B: 61,5% на SWE-bench, и никто это не проверил
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
MicrosoftFrogNano-4B-2609 — это агент для программирования класса четырёх миллиардов параметров, созданный на основе Qwen3.5-4B, который, по заявлению, показывает 61,5% на SWE-bench Verified. Gemma 4 12B — это мультимодальная модель DeepMind без энкодера с 11,95 млрд параметров, и в её карточке указано 72,0% на LiveCodeBench v6. Это те два числа, которые покупатель поставит рядом, и именно такое сопоставление — ошибка. Они получены на разных бенчмарках, с разными испытательными стендами, в разных лабораториях, и — что важнее — только у одной из них опубликована методика оценки, которую прочитал посторонний человек. Всё остальное в этом сравнении — вопрос о том, чем на самом деле является каждая модель, и ответ таков: они вообще не относятся к одной и той же категории.
Приведённые ниже показатели FrogNano взяты из карточки модели Microsoft и её технического отчёта: оба документа публичны с сентября, и ни один из них не был воспроизведён никем за пределами лаборатории. Показатели Gemma 4 12B взяты из карточки модели Google, которая тоже является документом вендора, — разница в том, что за цифрами Gemma стоят двадцать недель и примерно 2,6 миллиона загрузок пристального изучения, а у FrogNano — две недели и счётчик загрузок, так и не переваливший за однозначные числа.
Для чего предназначена каждая модель
Вот что скрывает спецификация. FrogNano-4B-2609 — не универсальная модель, которая просто оказалась хороша в коде. Это чекпойнт, всё пост-обучение которого было посвящено программной инженерии на уровне репозитория и который предназначен для того, чтобы им управлял харнесс, а не для разговоров с ним.
Его пять инструментов — Read, Write, Edit, Glob и Bash. Он отправляет вызовы к ним, песочница выполняет их и возвращает вывод, и цикл продолжается, пока модель не перестанет запрашивать. Оцениваемая конфигурация — 150 шагов взаимодействия в пределах примерно 131K суммарных токенов, и она создала патч-кандидат для каждой задачи. В карточке Microsoft прямо указано, что модель предназначена для англоязычных репозиториев с преобладанием Python, воспроизводимыми средами и исполняемыми наборами тестов, а также что компоненты для изображений и видео, унаследованные от базовой модели, никогда не дообучались и не поддерживаются.
Gemma 4 12B — это противоположная конфигурация. Это унифицированная модель с 48 слоями и контекстом 256K, без отдельного кодировщика изображений или аудио: необработанные фрагменты изображений и аудиосигналы проецируются напрямую в пространство эмбеддингов единственного декодера через лёгкие линейные слои. Она принимает текст, изображения и аудио, а на выходе выдаёт текст. У неё есть режим размышления, активируемый токеном в системном промпте, нативный вызов функций, а в карточке Google особо отмечается, что среди предполагаемых вариантов использования перечислены агентные рабочие процессы.
Так что настоящий вопрос не в том, кто из них умнее. А в том, хотите ли вы специализированный компонент, который работает только внутри установки, которой вам приходится управлять, или универсальную модель, которая неплохо справляется со многими вещами и может быть вызвана чем угодно.

Построчно, там, где они действительно различаются.
• Параметры — FrogNano-4B-2609 заявляет диапазон «500M-5B» на карточке, в описании которой указано примерно 4,66 млрд; а скачивание сводит его к 9,32 ГБ весов BF16. Gemma 4 12B — это 11,95 млрд, указано один раз и без оговорок. Соотношение — примерно 2,6 к одному, и это напрямую отражается на том, что вам приходится арендовать.
• Контекст — оцениваемая конфигурация FrogNano — это около 131 тыс. суммарных токенов, при этом рассуждения и вывод инструментов делят бюджет. Gemma 4 12B располагает 256 000 токенов и в собственной строке для длинного контекста набирает 43,4% на MRCR v2 с восемью иглами при 128 тыс. Окно почти вдвое больше, и второе число — опубликованное измерение, а не заявление о возможностях.
• Модальность — FrogNano-4B-2609 работает с текстом на входе и текстом на выходе, несмотря на наличие визуального блока в его чекпоинте. Gemma 4 12B принимает на вход текст, изображения и аудио.
• Потолок вывода — проверенная конфигурация FrogNano допускает 8 192 сгенерированных токена за один ход ассистента, а в её карточке отмечено, что конфигурация RL-обучения использовала тот же лимит. Для Gemma 4 12B не публикуется эквивалентный потолок на один ход; ограничением там является окно в 256K.
• Агентный интерфейс — FrogNano выдаёт структурированные вызовы Leaf и нуждается в обвязке для их выполнения. Gemma 4 12B поставляется с нативным вызовом функций в варианте с настройкой на инструкции и может вызываться напрямую.
• Лицензия — Gemma 4 12B распространяется под Apache 2.0 в соответствии с условиями Gemma 4 от Google, и это указано однозначно. В карточке FrogNano во вводной части указана MIT, а в основном тексте — Apache 2.0; такая неоднозначность в итоге попадает на юридическую проверку, а не в сноску.
• Показатели — FrogNano сообщает о 61,5% на SWE-bench Verified, 37,6% на SWE-bench Pro, 31,1% на Terminal-Bench 2.0 и 47,3% на PatchEval-Verified. Gemma 4 12B сообщает о 77,2% на MMLU Pro, 72,0% на LiveCodeBench v6, рейтинге ELO на Codeforces, равном 1659, 78,8% на GPQA Diamond и 69,0% на Tau2. В карточке Google не публикуется строка SWE-bench, а в карточке Microsoft не публикуется LiveCodeBench. Между двумя таблицами результатов вообще нет пересечений.
Именно этот последний пункт должен положить конец инстинкту сравнивать по числам. Ни один бенчмарк не встречается на обеих карточках. Читатель, который ставит 61.5 против 72.0, сравнил показатель разрешения репозиториев с долей прохождения задач по соревновательному программированию, а это примерно как сравнивать время марафона со временем стометровки только потому, что оба измеряются в секундах.
Почему молчание Google о SWE-bench — не тревожный сигнал
Соблазнительный вывод из маркированного списка состоит в том, что у FrogNano есть реальный показатель SWE-bench, а у Gemma — нет, поэтому FrogNano выигрывает вопрос о кодинге. Но это не следует, и причина тому заслуживает точной формулировки.
Gemma 4 12B сообщает о результате Tau2 в 69,0% — это агентный бенчмарк использования инструментов по трём запускам — наряду с поддержкой вызова функций и явным позиционированием для агентных рабочих процессов. Модель, набирающая 69,0 на Tau2, — это не модель, которая не способна выполнять агентную работу; это модель, чей производитель решил сообщать о производительности использования инструментов, а не о разрешении репозиториев. Google также не публикует строки SWE-bench для 26B или 31B, что является редакционным выбором в масштабах всей линейки, а не слабостью 12B.
Тем временем контринтуитивный результат в собственной статье Microsoft — это то, что покупателю Gemma стоит внимательно прочитать. FrogNano отталкивается от Qwen3.5-4B, универсальной модели, которая набрала 39,4% на SWE-bench Verified через харнесс Leaf. Пять раундов обучения с подкреплением примерно на 1 500 синтетических задач подняли результат до 61,5%. Вывод не в том, что «малые модели не умеют программировать», а в том, что универсальный чекпойнт на 4B с результатом 39,4% уже решал более трети сложного, проверенного людьми набора задач, когда кто-то запускал его внутри грамотного агентного цикла. Gemma 4 12B в три раза больше по размеру и на двадцать недель более зрелая. Никто не прогонял её через Leaf, и пока кто-нибудь этого не сделает, «Gemma не является агентом для работы с репозиториями» — это допущение, а не вывод.
Налог на обвязку, который табло полностью скрывают
Вот в чём практическая асимметрия, и именно она определяет решение о покупке.
Gemma 4 12B — это модель. Скачайте 11,95 млрд весов, нацельте на них Transformers, vLLM или SGLang, отправьте текст — получите текст. Google публикует путь обслуживания, лицензия однозначна, а люди, обеспечившие 2,6 миллиона загрузок, уже наткнулись на шероховатости и задокументировали их. Если задача — «суммируй этот стек-трейс», «прочитай этот скриншот и скажи, что сломано» или «вызови эту функцию с этими аргументами», это работает уже сегодня.
FrogNano-4B-2609 — это модель плюс обвязка, и собственный README Microsoft делает обвязку обязательной. Репозиторий по адресу github.com/microsoft/FrogNano — это стенд оценки Leaf, а не код обучения — ему нужен кластер Kubernetes, существующее пространство имён, разрешения на управление подами и сетевыми политиками, доступ на вытягивание образов контейнеров бенчмарков и OpenAI-совместимая конечная точка, настроенная с правильными парсерами рассуждений и вызовов инструментов. В карточке Microsoft прямо указано условие соответствия: идентичные оценки требуют совпадающих чекпоинта, токенизатора, конфигурации обслуживания, образов задач и протокола оценки. Та половина релиза, которая генерирует оценку, — это та половина, на которую карточка указывает ссылкой на GitHub.
В этом есть реальная ценность, и это стоит назвать, а не отмахнуться. Вклад FrogNano — это цикл синтеза задач, который заново генерирует обучающие задачи под текущие возможности политики; утверждение статьи состоит в том, что небольшого агента можно обучить до конкурентоспособного уровня на синтетических задачах вообще без дистилляции, и это открывает путь для всех, кто не может позволить себе передового учителя. Его API открыт. Его методы в принципе воспроизводимы. Это более сильный вклад, чем ещё один инкрементальный чекпоинт, и это также больше работы, чем ожидает большинство команд, берущихся за такое.

Если выбираете один, выбирайте по задаче.
Выбирайте Gemma 4 12B, если работа сочетает модальности, если чему-то нужно видеть изображение или слышать звук, если контекст должен одновременно удерживать большое дерево файлов и длинную расшифровку или если вам нужна модель, которую любой фреймворк может загрузить без второй системы за ней. Её показатель Tau2 69,0 и нативный вызов функций делают её оправданным выбором для агентных пайплайнов, и никому не нужно верить лаборатории на слово — модель оценили тысячи людей, и результаты не секрет.
Возьмите FrogNano-4B-2609, если вы уже запускаете агент для работы с репозиториями в песочнице и хотите чекпойнт класса 4B, чтобы вставить его туда, и если загрузка объёмом 9,32 ГБ, умещающаяся на скромном оборудовании, — это ограничение, определяющее решение. Трезво оценивайте последовательность: вы не покупаете оценку, вы делаете ставку на метод, и первое, что вы обнаружите, — это то, достаточно ли ваш цикл опроса и ваш парсер вызовов инструментов похожи на Leaf. Некоторые команды получат поведение, близкое к 61,5%, уже на третий день, а некоторые потратят две недели, чтобы обнаружить, что их набор для оценки был проще, чем SWE-bench Verified, и пока никто за пределами лаборатории не может сказать вам, к какому из этих двух лагерей вы относитесь.
Если решение действительно близко, дешёвый эксперимент — прогнать оба варианта в одном и том же харнессе на собственных задачах, а не спорить об опубликованных цифрах, у которых нет общего бенчмарка. OrcaRouter даёт доступ к более чем 200 моделям через один ключ, совместимый с OpenAI с наценкой 0%, так что прайсовые цены провайдеров проходят без изменений — а значит, можно поставить размещённую у провайдера универсальную модель и остальной ваш набор кандидатов за один эндпоинт и одну строку биллинга, пока вы решаете. FrogNano не входит в число наших маршрутов, и даты для него нет; веса — это файл для скачивания, который вы хостите сами. Что мы можем убрать — так это трение на другой стороне сравнения: подмену моделей-кандидатов в вашем собственном харнессе без второго контракта, второго SDK или второго набора учётных данных.

Честный вывод таков: число 61.5 — это реальная работа лаборатории, которая его получила, и сейчас это единственная причина предпочесть FrogNano в задачах кодинга. Когда кто-то за пределами Microsoft воспроизведёт 61.5 на тех же 500 задачах — или не сможет этого сделать, — это сравнение получит настоящий ответ. До тех пор более безопасным выбором по умолчанию для большинства команд остаётся модель 11.95B с чистой лицензией, опубликованным измерением длинного контекста и двадцатью неделями чужих ошибок, уже вобранных в её документацию.
