Сгенерированная титульная карточка с надписью «FrogNano-4B-2609 vs LFM2.5 2.6B Base» и подзаголовком «готовый 4B-агент против предобученного чекпоинта на 2,69B», три чипа с надписями «RL-постобучение завершено», «только предобучение, 2,69B dense в 30 слоях» и «без инструкционного дообучения», нижний колонтитул с надписью «Данные в обоих столбцах предоставлены производителями; ни одна третья сторона не оценивала ни одну из моделей», и логотип OrcaRouter, наложенный в правом нижнем углу.
Engineering & Research

FrogNano-4B-2609 против LFM2.5 2.6B Base: готовый специалист и мешок предобученных весов

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Введите вопрос в LFM2.5 2.6B Base, и он продолжит ваше предложение вместо того, чтобы ответить на него. Это не дефект — Liquid AI опубликовала его как предобученный чекпоинт, лежащий в основе семейства LFM2.5, намеренно оставив инструкционную донастройку его не-Base собрату, и в карточке прямо сказано, что он предназначен для глубокой донастройки. FrogNano-4B-2609 от Microsoft — вот как выглядит другой конец этого конвейера: та же разновидность малой языковой модели, прошедшая пять итераций обучения с подкреплением на синтетических задачах по работе с репозиториями, пока она не начинает выдавать структурированные вызовы инструментов и патчи-кандидаты через обвязку из пяти инструментов. Ни у одной из них нет опубликованного независимого бенчмарка. Разница в том, что у одной из них постобучение завершено, и понимание того, у какой именно, — это и есть всё решение.

Приведённые ниже показатели FrogNano взяты из карточки модели Microsoft и её технического отчёта. Показатели LFM взяты из карточки Liquid AI, её конфигурации архитектуры и файла лицензии. Каждое число, приписываемое любому из вендоров, помечено как заявленное вендором, и ни одна из этих моделей не проходила оценку третьей стороной — для LFM2.5 2.6B Base это в значительной степени так и задумано, поскольку чекпойнт без инструкционной настройки не может служить справедливым объектом для чат-бенчмарка.

Сравнение работает, только если вы знаете, что сравниваете.

Поставьте две спецификации рядом, и первое, что не сходится, — это количество параметров. LFM2.5 2.6B Base содержит 2,69 млрд плотных параметров в 30 слоях — 22 блока коротких свёрток с двойным гейтированием и 8 слоёв группового внимания к запросам — и обучена примерно на 34 трлн токенов на 16 языках, со словарём на 128 000 токенов и контекстом на 131 072 токена. Его квантованная сборка занимает около 1,67 ГБ при Q4_K_M.

Карточка FrogNano-4B-2609 в поле параметров указывает диапазон «500M-5B», а в сводке модели она описывается как примерно 4,66 млрд. Загрузка разрешает спор: два шарда safetensors общим объёмом 9,32 ГБ весов BF16, 738 тензоров, на унаследованном плотном 32-слойном гибридном стеке Gated DeltaNet и gated-attention. В чекпойнте находится 24-слойный vision tower, который никогда не проходил пост-обучение.

Итак, соотношение размеров составляет примерно 1,7 к 1, а соотношение памяти становится ближе к 5,6 к 1, если учитывать квантизацию. Эта разница важнее, чем строка с параметрами, потому что обе эти модели — скорее варианты для самостоятельного хостинга, чем эндпоинты, и это единственная причина, по которой они вообще оказались в одной статье.

• Назначение — LFM2.5 2.6B Base — это исходный материал для запуска дообучения. FrogNano-4B-2609 — это готовая политика для программной инженерии на уровне репозитория внутри Leaf harness.

Следование инструкциям — у LFM2.5 2.6B этого навыка из коробки нет; в карточке модели от Liquid AI её рекомендуют для задач, требующих серьёзного дообучения. FrogNano-4B-2609 следует описанию задачи и выдаёт структурированные вызовы инструментов, потому что именно на это и была нацелена его цель в RL.

• Контекст — 131 072 токена для LFM2.5 2.6B Base против примерно 131K суммарных токенов у оцениваемой конфигурации FrogNano. Номинально идентично, но окно FrogNano должно вмещать результаты работы инструментов, вывод оболочки и журналы тестов, а не только промпт.

• Потолок вывода — проверенная конфигурация FrogNano допускает 8 192 генерируемых токена на каждый ход ассистента. LFM2.5 2.6B Base не публикует аналогичного значения, поскольку не предназначена для завершения ответа.

• Модальность — обе работают только с текстом. Компоненты компьютерного зрения FrogNano являются унаследованными и явно не поддерживаются; LFM2.5 2.6B Base по своей конструкции работает по схеме «текст на входе — текст на выходе».

• Лицензия — LFM2.5 2.6B Base распространяется под LFM Open License v1.0: она бесплатна при годовом доходе ниже $10 млн, а на этом уровне или выше требуется отдельная лицензия; производные работы наследуют это ограничение. В карточке FrogNano во вводной части указана MIT, а в основном тексте — Apache 2.0.

То, за что заплатила Microsoft, и то, за что вам пришлось бы заплатить самому.

Это несущий раздел, потому что именно в нём сравнение характеристик вводит в заблуждение.

Вся добавленная ценность FrogNano-4B-2609 заключается в пост-обучении, и Microsoft опубликовала этот метод. Начните с Qwen3.5-4B, который набрал 39,4% на SWE-bench Verified через Leaf harness в качестве универсальной модели. Генерируйте задачи-кандидаты для репозитория из реальных снимков, запускайте роллауты из текущей контрольной точки, чтобы найти задачи, которые она иногда решает, сохраняйте их, обучайте и повторяйте — пять итераций, примерно 1 500 проверенных синтетических сред в общей сложности, и никакой дистилляции из более крупной модели ни на каком этапе. Результат на собственной карточке Microsoft — 61,5% на SWE-bench Verified, 37,6% на SWE-bench Pro, 31,1% на Terminal-Bench 2.0 и 47,3% на PatchEval-Verified. В приложении об эффективности в статье сообщается о том же росте: 48,2%, 53,4%, 58,3%, 58,6% и 61,6% по итерациям, что служит полезным напоминанием о том, что даже две собственные таблицы лаборатории по одному и тому же эксперименту не согласуются по ступеням.

Теперь сопоставьте это с LFM2.5 2.6B Base. Это чекпойнт до начала той работы. Его собственная рекомендация в карточке — дообучить его — это ровно та работа, которую документирует FrogNano: среда задачи, исполняемая награда, обвязка для более длительной работы и несколько итераций обучения против изменяющейся политики. В статье не утверждается, что это легко. В ней сообщается, что промежуточные чекпойнты становились всё дороже в обучении по мере удлинения трасс рассуждений, что для остановки дрейфа пришлось добавить штраф за длину лога, и что более поздние итерации потеряли способность к параллельным вызовам инструментов, которая была у базовой модели, в результате чего доля одновременных вызовов упала до 1,71%. Всем, кто планирует применить рецепт FrogNano на другой базе 2.6B, следует закладывать бюджет именно под эти три проблемы.

То, что даёт LFM2.5 2.6B Base, — это преимущество иного рода: бюджет предобучения в 34 триллиона токенов, документированная гибридная архитектура, уже существующая квантованная сборка и задокументированный контекст в 131 072 токена — и всё это при размере, который работает на оборудовании, куда контрольная точка BF16 объёмом 9,32 ГБ не поместилась бы. Если ваша задача достаточно узкая, чтобы небольшой файнтюн превзошёл универсальную модель, это реальная позиция — а если нет, вы сэкономили себе один прогон обучения.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

Что вам в любом случае придётся построить

Ни то, ни другое не является сетевым вызовом, и это определяет практическое сравнение сильнее, чем любая строка характеристик.

LFM2.5 2.6B Base требует среды выполнения для инференса и запуска обучения. В карточке Liquid AI перечислены сборки в нативном формате, GGUF, ONNX и MLX, так что половина, отвечающая за обслуживание, хорошо покрыта — llama.cpp на ноутбуке вполне подходит для квантованного чекпоинта. А половина с обучением — ваша: данные, целевая функция, оценка и способ понять, стал ли результат лучше или просто другим.

FrogNano-4B-2609 хочет эндпоинт, совместимый с OpenAI, с правильными парсерами и кластер Kubernetes с разрешением управлять подами и сетевыми политиками. README от Microsoft необычно прямо утверждает, что испытательный стенд — это зависимость, а не удобство, а карточка модели сообщает, что идентичные оценки требуют, чтобы совпадали контрольная точка, токенизатор, конфигурация обслуживания, образы задач и протокол оценки. Конфигурация здесь не мелочь: запустите её без парсера рассуждений Qwen3 и парсера вызовов инструментов Qwen3 coder, и модель будет писать прозу там, где испытательный стенд ожидает вызов инструмента.

Вот в чём суть этого противостояния: с одной стороны — проект по обучению с небольшой проблемой сервинга; с другой — проект по сервингу с большой проблемой оценки и без оставшейся работы по обучению. И то и другое — работа на несколько вечеров. Только один из них — это работа на несколько вечеров, которая может закончиться фразой «модель недостаточно хороша» не по вашей вине.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

Где роутер заслуживает своё место в такой сборке

Обе эти модели в конечном итоге оказываются внутри пайплайна, который также обращается к чему-то хостируемому. Собственный стенд оценки FrogNano — тому доказательство: тестовый каркас Leaf взаимодействует с OpenAI-совместимой конечной точкой, а значит, тестируемая модель и любая модель, с которой вы её сравниваете, доступны через один и тот же интерфейс. Этот паттерн стоит перенять, даже если причина лишь в гигиене, и именно здесь единая конечная точка делает нечто конкретное.

OrcaRouter предоставляет более 200 моделей за одним ключом, совместимым с OpenAI, с наценкой 0%, поэтому цены из прайс-листов провайдеров проходят без изменений, а изменение цены вендором становится актуальным на нашей стороне в тот же день — и именно эта цифра реально меняется, когда вы решаете, обходит ли самостоятельно размещённый специализированный вариант хостинговую универсальную модель по стоимости за задачу. Автоматическое переключение при сбое охватывает только ту половину этого сравнения, что относится к хостингу, но не чекпойнт, который вы обслуживаете сами. Мы не хостим FrogNano-4B-2609 и LFM2.5 2.6B Base; оба нужно скачивать. Слой маршрутизации избавляет от необходимости второй интеграции каждый раз, когда хостинговая сторона вашего бенчмарка меняется.

Честно говоря, выбрать один

Выбирайте LFM2.5 2.6B Base, если ваша задача узкая, аппаратное обеспечение маломощное, и вы готовы самостоятельно провести обучение — лицензия бесплатна при выручке ниже $10 млн, квантованная сборка занимает 1.67 ГБ, и собственная карточка Liquid AI рекомендует её именно для этого. Компромисс в том, что вы получаете отправную точку, а не готовую возможность: ничто в релизе не говорит, какой результат показал бы RL-прогон в форме FrogNano поверх неё, и никто такого не публиковал.

Выбирайте FrogNano-4B-2609, если задача относится к программной инженерии на уровне репозитория и вы хотите, чтобы пост-тренировка уже была выполнена. 61,5%, 37,6%, 31,1% и 47,3% — это подлинные опубликованные результаты лаборатории, которая подробно описала свой метод, — и они также на данный момент представляют собой замкнутый цикл: та же лаборатория, тот же испытательный стенд, та же базовая модель для сравнения. Загрузка объемом 9,32 ГБ, зависимость от испытательного стенда и составное лицензирование — такова цена пропуска проекта по обучению, который в противном случае вам пришлось бы запускать.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

Полезная переформулировка: это не конкуренты. LFM2.5 2.6B Base — это предыдущий этап процесса, который создал нечто вроде FrogNano-4B-2609. Если вы выбираете между ними, настоящий вопрос в том, стоит ли ваша задача того, чтобы ради неё проводить собственный обучающий прогон — и если ответ «нет», то 4B-чекпоинт с обвязкой, опубликованным методом и заявленной вендором лестницей SWE-bench — это тот, который прибывает готовым.