
FrogNano-4B-2609 против Qwen 3.8: во что обходится агент для программирования, когда веса принадлежат вам
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
microsoft/FrogNano-4B-2609 — это агент для работы с репозиториями класса 4 млрд, созданный на основе Qwen3.5-4B, который вы скачиваете и обслуживаете самостоятельно. Qwen3.8-Max — это флагман, размещённый у провайдера: разреженная смесь экспертов на 2,4 триллиона параметров, из которых примерно 95 миллиардов активны на каждый токен, мультимодальное окно размером в один миллион токенов и тариф $2,00 за миллион входных токенов и $6,00 за миллион выходных — доступен с API-ключом с 3 августа 2026 года. Один из них требует GPU и одного дня работы. Другой не стоит ничего, пока вы им не пользуетесь, а затем взимает плату за каждый токен на самых длинных траекториях из числа распространённых. Именно этот компромисс, а не таблица бенчмарков, и есть настоящее противостояние.
Приведённые здесь показатели FrogNano взяты из карточки модели и технического отчёта Microsoft; показатели Qwen3.8-Max взяты из опубликованных цен Alibaba и записи о модели в нашем собственном каталоге, при этом независимые оценки везде, где они встречаются, помечены как данные Artificial Analysis. Обратите внимание на названия: Qwen3.8 — релиз с открытыми весами — был анонсирован, но ещё не выпущен, тогда как Qwen3.8-Max уже доступен и имеет цену на сегодня. Всё, что в этой статье можно вызвать, относится к последнему.
Арифметика, которая определяет сравнение
Начните с того, сколько стоит одна задача, потому что это не очевидно и это немало.
Оценки FrogNano прогоняли каждую траекторию с бюджетом в 150 шагов в пределах примерно 131 тыс. суммарных токенов, при до 8 192 сгенерированных токенов на каждый ход ассистента и потолке в 10 800 секунд. Умножьте два опубликованных лимита, и вы получите потолок примерно в 1,23 млн сгенерированных токенов для одной траектории в худшем случае — что при цене Qwen3.8-Max в $6,00 за миллион выходных токенов составляет примерно $7,38 для одной задачи, которая израсходовала весь свой бюджет. Это арифметика по двум опубликованным числам, а не измерение: реальные траектории останавливаются раньше, среднее значение намного ниже потолка, а результаты инструментов и вывод оболочки тарифицируются по более дешёвому тарифу для входных токенов, а не по тарифу для выходных. Но это позволяет представить общую картину. Агент для программирования не тратит на вопрос несколько сотен токенов; он ведёт длинный, насыщенный рассуждениями разговор с самим собой, и каждый токен этого разговора генерируется.
Теперь поставьте рядом другую сторону этого баланса. FrogNano-4B-2609 — это 9,32 ГБ весов BF16 в двух шардах, которые можно скачать без гейта. Для его обслуживания требуется SGLang с парсером рассуждений Qwen3 и парсером вызовов инструментов Qwen3 coder, а также изолированная песочница для пяти инструментов. После этого предельная стоимость одной траектории — это электроэнергия, а память, которую она занимает, — это то, до чего вырастет ваш контекст, а не то, сколько весят веса.
• Модель затрат — FrogNano-4B-2609: фиксированная стоимость оборудования и почти нулевые предельные издержки. Qwen3.8-Max: нулевые фиксированные затраты и оплата за токены, с разбивкой $2.00 / $6.00, при которой ничего не относится на вход, а всё относится на выход по тарифу вывода.
• Что покупают за эти деньги — агент класса 4B на вашем собственном железе против модели фронтирного масштаба, для которой вам никогда не придётся планировать мощности.
• Точка безубыточности — она достигается, когда ваш месячный объём траекторий, умноженный на среднюю стоимость токенов на одну траекторию, превышает стоимость GPU, который вам иначе пришлось бы арендовать. Для команды, выполняющей несколько задач по репозиторию в день, до этой отметки ещё очень далеко, и хостируемая модель выигрывает уже просто за счёт удобства.
Две модели, которые не выполняют одну и ту же задачу
Сравнение затрат справедливо только при сопоставимых результатах, а здесь они не сопоставимы — и именно это большинство спецификаций предпочитает замалчивать.
FrogNano-4B-2609 была дообучена исключительно на программной инженерии на уровне репозиториев. Весь её интерфейс — это цикл из пяти инструментов: Чтение, Запись, Редактирование, Глоб и Bash — выполняемый средой Leaf в изолированной песочнице, повторяющийся, пока модель не перестанет вызывать инструменты. В карточке Microsoft указано, что поддерживаемый язык — английский, а проверенная область программирования — Python, и прямо сказано, что компоненты для изображений и видео в контрольной точке никогда не дообучались и не поддерживаются. Она не рассуждает о вашей архитектуре, не отвечает на вопросы о вашем бизнесе и не читает скриншоты.
Qwen3.8-Max — это универсальная модель. В каталожной записи Alibaba указано, что она принимает текст, изображения и видео, выдаёт текст и имеет контекстное окно на 1 000 000 токенов. Она рассуждает, пишет, читает документы и ведёт беседу, а вызов функций у неё — это одна из возможностей универсальной модели, а не главный смысл этого чекпоинта. Её показатели Artificial Analysis, взятые из записи от 2 сентября 2026 года, таковы: Intelligence Index — 45,4, Coding Index — 76,2.
• Ввод — FrogNano-4B-2609 работает только с текстом. Qwen3.8-Max принимает текст, изображения и видео.
• Контекст — примерно 131K суммарных токенов для оцениваемой конфигурации FrogNano против 1 000 000 у Qwen3.8-Max. Это в семь с половиной раз больше, и это важнее всего именно для входных данных размером с репозиторий, которые получает агент-программист.
• Вывод за один ход — проверенная конфигурация FrogNano ограничивает один ход ассистента 8 192 токенами. Qwen3.8-Max не публикует эквивалентного потолка на один ответ.
• Формат вывода — FrogNano выдаёт структурированные вызовы инструментов Leaf, и для их выполнения нужна обвязка. Qwen3.8-Max возвращает обычный текст или вызов функции тому клиенту, который у вас уже есть.
• Независимые оценки — для FrogNano-4B-2609 их нет, кроме его собственной карточки; приведённые выше показатели Qwen3.8-Max взяты у третьей стороны, из Artificial Analysis.
• Параметры — примерно 4,66 млрд у FrogNano, согласно описанию его собственной карточки, против 2,4 трлн общих и примерно 95 млрд активных у Qwen3.8-Max.

Где 4B действительно заслуживает своё место
Есть одна ось, по которой 4B-агент безоговорочно превосходит фронтирную модель, и это не точность.
Статья FrogNano начинается с Qwen3.5-4B, который как обычная модель общего назначения набрал 39,4% на SWE-bench Verified через Leaf harness. Пять итераций обучения с подкреплением примерно на 1 500 синтетических задачах довели его до 61,5%, при этом в приложении к той же статье прогресс по итерациям указан как 48,2%, 53,4%, 58,3%, 58,6% и 61,6%. Метод — генерация задач, откалиброванных под фронтир обучаемости текущей политики, без дистилляции из более сильной модели — и есть вклад, а также причина, по которой исследовательская группа без бюджета на фронтирные модели обратила бы на это внимание.
Прочитайте, что это означает для сравнения. В карточке Microsoft откровенно сказано, что FrogNano не является безусловно лучше модели, из которой произошёл: доля параллельных вызовов инструментов у него составляет 1,71%, потому что в более поздних итерациях была утрачена способность инициировать одновременные вызовы, и команда добавила этап консолидации, чтобы попытаться её восстановить. Модель, которая решает больше задач, но становится хуже в одном конкретном типе поведения, — это настоящий инженерный артефакт с видимыми швами, и в её карточке об этом сказано, а не замалчивается.
И показатель SWE-bench — это замкнутый цикл. Базовый уровень базовой модели, тестовый стенд и итоговый балл — всё это происходит из одной и той же лаборатории, а две таблицы в одной и той же статье дают две разные лестницы для одного и того же эксперимента. Показатель Qwen3.8-Max по программированию, напротив, был получен Artificial Analysis, а не Alibaba — иной тип доказательства, иной уровень уверенности, и их никогда не следует вычитать друг из друга.
4B, который вы пока не можете спланировать
Между FrogNano-4B-2609 и местом в продакшене стоят две вещи, и обе — в его собственной документации, а не в чьём-либо мнении проверяющего.
Первое — аппаратное обеспечение. В карточке требование к весам BF16 указано как около 9,3 ГБ, а затем добавляется, что память «существенно возрастает по мере приближения совокупного контекста к примерно 131 тыс. токенов», после чего говорится, что точная минимальная модель GPU, конфигурация VRAM, версии среды выполнения и профиль производительности «всё ещё должны быть проверены перед выпуском» — фраза, которая присутствует на карточке модели, уже доступной для скачивания. Никто не опубликовал значение VRAM для оцениваемой конфигурации, и в карточке оно не указано.
Второй момент — позиция по безопасности. В собственной заметке Microsoft о выравнивании говорится, что постобучение, специфичное для агента, не использовало наборы данных о предпочтениях безопасности, отказах, вредоносном контенте или состязательные наборы данных, что вместо этого оно оптимизировалось под функциональную корректность и предотвращение регрессий, и что модель «не следует считать независимо выровненной по безопасности для неограниченного автономного развёртывания». Карточка завершается перечислением конкретных рисков: патчи могут быть некорректными или небезопасными, несмотря на прохождение своих тестов, производительность чувствительна к качеству этих тестов, и каждый патч-кандидат требует квалифицированной проверки человеком, а также независимого регрессионного тестирования и тестирования безопасности перед использованием. У универсальной размещённой модели нет ни одной из этих конкретных оговорок, и она также не будет выполнять shell-команду в вашем репозитории.
Один ключ, какую бы сторону вы ни выбрали
Полезная вещь в том, чтобы проводить это сравнение на практике, — это то, что лишь половина его представляет собой загрузку. Qwen3.8-Max и обычные модели, с которыми вы бы сравнивали самостоятельно размещённого агента, доступны через одну OpenAI-совместимую конечную точку на OrcaRouter при наценке 0% — прайс-листовая цена провайдера передаётся как есть, поэтому изменение цены у вендора отражается на нашей стороне в тот же день — а это именно та цифра, которая реально меняется, когда вы пытаетесь контролировать счёт за выходные токены кодинг-агента. Это также упрощает вопрос отказоустойчивости: если размещённая половина вашего пайплайна деградирует, повторная попытка выполняется автоматически, и эксперимент продолжается.
FrogNano-4B-2609 не входит в число наших маршрутов, и даты для него нет. Веса — ваши, и вы можете сами организовать их обслуживание, а карточка честно предупреждает, что конфигурация обслуживания не была полностью проверена. Что мы можем сделать — это свести настройку другой стороны сравнения к нулю затрат, чтобы вопрос, на который вы в итоге ответите, был настоящим: превосходит ли заявленный вендором агент с 61,5% на SWE-bench, запущенный на вашей собственной видеокарте, тарифицируемую фронтирную модель на ваших собственных задачах и при вашем собственном объёме.

Какой из них выбрать?
Выбирайте Qwen3.8-Max, когда работа носит общий характер, когда нагрузку должна нести чужая команда эксплуатации, когда входные данные могут содержать изображение или длинный документ, или когда ответ нужен сегодня, а не стек обслуживания к пятнице. Его сторонние оценки позволяют примерно предсказать, что вы покупаете, а его счёт за токены — это переменная стоимость, которую вы видите до того, как примете решение. Для команды, выполняющей небольшое количество задач с репозиториями в месяц, арифметика не оставляет сомнений.
Обратитесь к FrogNano-4B-2609, когда объём достаточно велик, что ограничением становится оплата по токенам на длинных траекториях, когда данные не могут покидать вашу инфраструктуру или когда исследовательский вопрос — можно ли обучить небольшого агента до компетенции на уровне репозитория без учителя — и есть то, что вы на самом деле проверяете. Приступая, знайте три вещи: 61,5% — это собственное измерение лаборатории на поддерживаемом лабораторией стенде, никто не опубликовал показатель VRAM для оцениваемой конфигурации, и в самой карточке сказано, что конфигурация обслуживания ещё не прошла валидацию.
Что делает эту пару достойной того, чтобы о ней писали, — так это то, что у них общий предок двумя поколениями назад. FrogNano происходит от Qwen3.5-4B — универсальной модели той же компании, флагман которой с 2,4 трлн параметров находится на другой стороне этой страницы. Microsoft взяла маленькую модель, потратила пять итераций RL на синтетических репозиториях и получила специалиста. Alibaba пошла другим путём и сделала ставку на масштаб. Оба ответа опубликованы, и разница между стоимостью скачивания и стоимостью API — честный способ выбрать между ними.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
