
Solar Mini 4 против LFM2.5 2.6B Base: втрое выше индекс и сравнение стоимости, которого не существует
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 за 1 млн токенов
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 за 1 млн токенов · 159 tok/s
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 220 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Честный способ сравнить Solar Mini 4 и LFM2.5 2.6B Base — сразу признать, что они не на одном рынке. Solar Mini 4 — это разреженная смесь экспертов от Upstage на 35 миллиардов параметров, выпущенная 22 сентября 2026 года, активирующая около 3 миллиардов параметров на токен, проприетарная и тарифицируемая по $0,10 за миллион входных токенов и $0,40 за миллион выходных. LFM2.5 2.6B Base — это предобученный чекпойнт Liquid AI на 2,69 миллиарда параметров, опубликованный на Hugging Face в начале августа 2026 года под LFM Open License v1.0, достаточно малый, чтобы помещаться в памяти телефона. Один — это эндпоинт. Другой — файл весов, и если вы читаете это, потому что хотите запускать модель, а не вызывать её, сравнение уже закончилось.
Что вообще делает эту пару достойной статьи — так это то единственное измерение, в котором они действительно пересекаются: обе были сопоставлены с одной и той же независимой меркой, и форма этого сравнения не соответствует тому, что предсказывает количество параметров. Artificial Analysis выставляет Solar Mini 4 24 балла по Intelligence Index v4.3.2 и оценивает поколение LFM2.5 2.6B в 8,4 — но вторая цифра является оценкой, и она не измеряет чекпоинт, указанный в заголовке этой статьи. Обе эти оговорки важны, и именно с них следует начать.
Спецификации бок о бок
• Параметры — Solar Mini 4 располагает 35B общих параметров при 3B активных; LFM2.5 2.6B Base — плотная модель на 2,69B, ничего не скрыто. В тринадцать раз больше весов на стороне Upstage при примерно том же бюджете вычислений на токен.
• Архитектура — Solar Mini 4 — это разреженная смесь экспертов. LFM2.5 2.6B Base состоит из 30 слоёв: 22 из них — блоки короткой свёртки с двойным гейтированием, а 8 — групповое внимание с группировкой запросов; это гибридная архитектура, созданная Liquid для вывода на CPU и периферийных устройствах.
• Обучение — Upstage не публикует бюджет токенов. В карточке Liquid указано 34 триллиона токенов и словарь объёмом 128 000 токенов для 16 языков, среди которых корейский и японский.
• Лицензия — Solar Mini 4 является проприетарным. LFM2.5 2.6B Base распространяется по LFM Open License v1.0 — разрешительной для коммерческого использования при соблюдении условий, и допускает дообучение.
• Контекст — Upstage указывает в документации 512K токенов, Artificial Analysis приводит 1.05M для той же модели, поэтому считайте верхнюю границу неопределённой. LFM2.5 2.6B Base работает с 131,072.
• Модальность — обе работают с текстом на входе и выходе. Ни одна не принимает изображения или аудио.
• Цена — Solar Mini 4 по $0.10 / $0.01 за кэшированные / $0.40 за миллион токенов, сейчас скидка 50% до 22 октября 2026 года. У LFM2.5 2.6B Base вообще нет тарифной сетки; хост Artificial Analysis отслеживает цены для генерации LFM2.5 2.6B на уровне $0.00.
Что «8,4, ориентировочно» измеряет, а что нет

Запись Artificial Analysis для поколения LFM2.5 2.6B — постобученной модели, а не предобученной Base — содержит индекс 8,4 с пометкой «оценочный», причём большинство её компонентных оценок помечены так же. Это позиция в таблице лидеров, а не спецификация, на которую следует ориентироваться при разработке, и её ни в коем случае нельзя приводить так, будто кто-то прогнал контрольную точку Base через весь набор тестов. Никто этого не делал. В собственной карточке модели Liquid для LFM2.5 2.6B Base вообще нет таблицы бенчмарков: это предобученная контрольная точка для дополнения текста, и в карточке прямо сказано, что она рекомендуется только для серьёзного дообучения.
Оценённая родственная модель — это другой артефакт. Таблица бенчмарков Liquid для прошедшей постобучение LFM2.5 2.6B показывает IFStruct на уровне 85,5, Multi-IF — 80,1, AIME25 — 51,9, LiveCodeBench v6 — 59,4, BFCLv4 — 56,9 и τ³-Banking — 5,7 — всё проведено вендором, всё на инструкционно дообученной сборке, и именно показатель τ³ читается как предупреждение.
Профиль Solar Mini 4 имеет совершенно другую форму. Он набирает 83,3% в AA-LCR v1.1 по рассуждениям на длинном контексте, 47,6% в SciCode и −10,8 в AA-Omniscience при точности 18,4% и уровне отсутствия галлюцинаций 64,2%. Также он набирает 1% в Terminal-Bench 4.0 и 22,3% в AutomationBench-AA. Оба семейства слабы в агентной работе; модель Upstage слаба в агентной работе, но при этом дорога, а это худшее положение, чем быть слабой в агентной работе, но при этом бесплатной.
То, что оправдывает цену Solar Mini 4, — это масштаб рассуждений. При 88 300 выходных токенов на задачу индексации — из них 71 600 на рассуждения — он расходует вычисления так, как плотная модель на 2,6 млрд параметров не сможет имитировать, даже если ей дать более длинный промпт. Модели с 2,69 млрд параметров можно сказать «думай шаг за шагом»; ей нельзя сказать «имей 35 млрд параметров». Это и есть настоящий продукт.
Втрое выше индекса, и никакого сопоставимого показателя затрат
Artificial Analysis оценивает Solar Mini 4 в $0,36 за выполненную задачу индекса против $0,006 для Granite 4.2 3B, а поколение LFM2.5 2.6B оценено в ноль, поэтому не существует такого показателя стоимости за задачу, который сделал бы это справедливым соотношением. Формулировка «Solar Mini 4 стоит значительно дороже, чем LFM2.5 2.6B Base», следовательно, верна и немного не по существу. Актуальный вопрос в том, может ли работа с корейским языком, длинными документами и структурированным извлечением, для которой создан Solar Mini 4, вообще выполняться предобученным чекпойнтом на 2,69 млрд параметров. Обычно это невозможно, и тогда сравнение превращается в сравнение Solar Mini 4 с передовой универсальной моделью, а не с телефонной моделью.
Случай, в котором выигрывает LFM2.5 2.6B Base, — не тот, где он дешевле. Это случай, когда задача достаточно узкая, чтобы дообучение закрыло разрыв. Извлечение структурированных полей из известного формата документа, классификация по фиксированной таксономии, ассистент на устройстве, который должен работать без сети, — это задачи, где чекпойнт на 2,69B плюс ваши собственные обучающие данные побеждают универсала на 35B плюс тарифную сетку и стоят GPU-инстанса вместо счётчика токенов. Liquid поставляет базовый чекпойнт с рецептами continued-pretraining, LoRA SFT, DPO и GRPO через Unsloth и TRL именно для такого сценария.
Кому позвонить?
Выбирайте Solar Mini 4, когда входные данные длинные, выходные нужно подвергнуть рассуждению, а языковая смесь включает корейский или японский — и когда семь минут декодирования на одну сложную задачу приемлемы. Выбирайте LFM2.5 2.6B Base, когда веса должны быть вашими, у устройства нет сети, а задача достаточно узкая для дообучения. Интересные развёртывания используют оба, потому что они не альтернативы: небольшая локальная модель выполняет маршрутизацию, редактирование и извлечение, а к размещённой модели обращаются только для той доли запросов, которой действительно требовались 35B параметров.
Модели Liquid нет на OrcaRouter, как и модели Upstage, так что ни один из этих маршрутов мы не можем вам продать. Что мы можем — так это ту часть, которая превращает это сравнение из решения в конфигурацию: более 200 моделей за одним ключом с наценкой 0% к прайс-листу провайдера, с автоматическим переключением при сбое между провайдерами и DSL маршрутизации, позволяющий объединять несколько моделей в один вызов. Когда правильный ответ — «дешёвая в большинстве случаев и хорошая, когда это важно», это задача маршрутизации, и именно поэтому существует DSL маршрутизации.

Цифра, которую ни один из поставщиков не вынесет на слайд
Задержка. Solar Mini 4 сжигает 88 300 выходных токенов на задачу Intelligence Index при измеренной скорости 204 токена в секунду, поэтому в среднем на каждую сложную задачу уходило 430 секунд — чуть больше семи минут. Поколение LFM2.5 2.6B на хосте, который тестировала Artificial Analysis, работало со скоростью 45,7 токена в секунду с задержкой 2,8 секунды до первого чанка, но это хост в дата-центре, обращающийся к модели, которая обычно запускалась бы у вас на столе. По собственным измерениям Liquid, та же архитектура выдаёт 220 токенов в секунду на M5 Max, 113 — на Ryzen AI Max+ 395 и около 30 токенов в секунду на телефоне — а это уже рабочий цикл агента на устройстве без сети.
Если ваша рабочая нагрузка интерактивна, то сравнивать нечего, и никакой показатель бенчмарка этого не изменит. Если ваша рабочая нагрузка пакетная, а то, что ждёт, — это задание cron, то семь минут — это нормально, и глубина рассуждений того стоит.

Два примечания об источниках в завершение. Каждый показатель Artificial Analysis здесь — это независимое измерение этой организации на общем наборе тестов; индекс LFM2.5 2.6B явно является оценкой и охватывает модель после постобучения, а не предобученный Base-чекпоинт, упомянутый выше. Каждый показатель Liquid AI — это собственный прогон вендора на его собственных бенчмарках, без воспроизведения — а у самого Base-чекпоинта вообще нет опубликованных оценок, что является фактом о предобученных моделях, а не критикой этого чекпоинта.
