
TwIL-LM3-Pro против LFM2.5 2.6B Base: один готов, другой — отправная точка
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 219 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Самое показательное в опубликованном сравнении между TwIL-LM3-Pro и LFM2.5 2.6B Base заключается в том, что webAI вообще не опубликовал ни одного сравнения с 2.6B. Таблицы Track A и Track B от webAI противопоставляют его 3,66-миллиардного специалиста по формальной логике целому ряду моделей — своей базовой модели Granite, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — а выбранная ими модель от Liquid AI — это LFM2.5-8B-A1B, а не 2.6B. Модель 2.6B, которая всё же появляется в таблице, — это `LFM2-2.6B`, предыдущее поколение, то есть другая модель с другим предобучением. Это упущение — не недосмотр. LFM2.5 2.6B Base — это предобученный чекпоинт без инструкционной настройки, и бенчмарки на следование инструкциям — не тот тест, для которого он создавался.
Итак, эта страница сравнивает готовый артефакт с сырым материалом. Подача в стиле Aion — у одной модели есть оценка, а у другой нет — подходит, но причина более конкретна и интереснее: одна прошла пост-обучение и объединена, а другая намеренно останавливается перед пост-обучением, и два документа, которые их описывают, намеренно отвечают на разные вопросы.
Два подсчёта параметров, которые не являются одним и тем же измерением
TwIL-LM3-Pro — это 3,66 млрд параметров, плотная модель, и все они активны на каждом токене. Она происходит от `ibm-granite/granite-4.2-3b` через LoRA-дообучение, многопутевую дистилляцию, объединение контрольных точек, слияние WiSE-FT обратно к базовой модели и этап GRPO со взвешиванием по энтропии — а артефакт, выпущенный webAI, представляет собой объединённую политику, а не LoRA-адаптер, поэтому он работает автономно.
LFM2.5 2.6B Base — это 2,69 млрд параметров в 30 слоях: 22 блока коротких свёрток с двойным гейтированием, чередующихся с 8 слоями группового внимания к запросам. Эта гибридная схема свёрток/внимания — архитектура Liquid для работы на устройстве, и именно поэтому показатели пропускной способности семейства такие, какие они есть, а не определяются одним лишь количеством параметров. Она была обучена на 34 трлн токенов со словарём из 128 000 токенов и имеет контекстное окно размером 131 072 токена.
Эти два числа различаются примерно на 36% и получены с помощью совершенно разных архитектур, поэтому ни утверждение «3,66B превосходит 2,69B», ни обратное не имеет смысла как заявление о качестве. В собственной карточке модели webAI этот момент упоминается косвенно, когда она отказывается сравнивать перплексию на корпусе между токенизаторами — словарь TwIL-LM3-Pro составляет 100 352, у LFM2.5-2.6B — 128 000, а перплексия рассчитывается на токен.
Что удаляет «Base» и почему это меняет табло
Liquid AI публикует LFM2.5 2.6B в двух формах: чекпойнт, прошедший постобучение и настроенный под агентные нагрузки в популярных агентных средах, и Base, о котором в его собственной карточке сказано: «предобученный чекпойнт только для текста, используемый для создания всех вариантов LFM2.5-2.6B». Base — это входные данные для тонкой настройки, а не продукт. У него нет ни инструкционной настройки, ни сколь-нибудь заслуживающего названия шаблона чата, ни опубликованной оценки — потому что оценивать базовую модель на задачах следования инструкциям значит измерять не то.
Позиция TwIL-LM3-Pro — обратная. Вся ценность TwIL-LM3-Pro — в стеке постобучения: webAI сообщает, что на собственном стенде пайплайн поднял внутридоменный макрогейт с 0,4313 у базовой модели до 0,5539, при этом макропоказатель на 10 отложенных наборах данных остался на прежнем уровне (с 0,7942 до 0,7901), а не обрушился. Сохранение качества на отложенных данных — сложная часть специализированного постобучения, и именно та часть, на которую Base не может ответить.
Именно здесь также окупается сравнение размеров в таблицах webAI. Сообщается, что TwIL-LM3-Pro опережает LFM2.5-8B-A1B по обоим отложенным макропоказателям — 0,7901 против 0,7884 на наборе из десяти датасетов, 0,7425 против 0,7378 на наборе из четырнадцати — при менее чем половине числа параметров этой MoE-модели. Это честный результат при сопоставимых условиях, и он возможен именно потому, что LFM2.5-8B-A1B — это дообученная модель, которую можно прогнать через инструкционный стенд. С Base так нельзя, поэтому 2.6B так и не получила колонку.
Измерения, которые стоит согласовать
• Параметры — TwIL-LM3-Pro 3.66B (плотная) против LFM2.5 2.6B Base 2.69B (30 слоёв: 22 свёрточных + 8 GQA).
• Пост-обучение — LoRA SFT, дистилляция, слияние WiSE-FT и GRPO на шаге 2580 против отсутствия; Base по замыслу является результатом предварительного обучения.
• Окно контекста — 131 072 токена у обоих, унаследовано от соответствующих базовых моделей.
• Словарь — 100 352 токена против 128 000, поэтому их перплексии несопоставимы.
• Языки — только английский против семнадцати, включая арабский, китайский, японский, корейский, испанский и тайский.
• Формат рассуждений — TwIL-LM3-Pro по умолчанию выдаёт блок `<think>` и рассуждает пространно (в среднем 1 902 токена в домене, 24,2% генераций упираются в ограничение длины) по сравнению с базовым чекпойнтом, вообще не имеющим формата инструкций.
• Лицензия — Некоммерческая лицензия webAI вер. 1.0 против Открытой лицензии LFM v1.0 от Liquid.
• Для чего это — конечная точка формально-логического вывода или отправная точка для дообучения.
Строки о контексте заслуживают сноски, которую приводят обе модели: каждая несёт 131 072 токена ещё с предобучения, и ни один из вендоров не проверял поведение на длинном контексте — в карточке TwIL-LM3-Pro сказано, что каждая опубликованная оценка измерялась в окне размером 8 192 токена. Совпадающие числа здесь унаследованы, а не продемонстрированы.
Лицензия и для чего каждая из них предназначена с юридической точки зрения
Некоммерческая лицензия webAI для TwIL-LM3-Pro разрешает исследовательское и личное использование и требует отдельного соглашения с webAI для развёртывания с целью получения дохода. LFM2.5 2.6B Base поставляется под собственной LFM Open License v1.0 от Liquid, которую API Hugging Face указывает как `license: other`, а не как стандартный идентификатор SPDX — прочитайте файл лицензии, прежде чем планировать что-либо на её основе, поскольку условия являются собственными условиями Liquid, а не признанным шаблоном.
Ни одна из этих двух лицензий не является Apache 2.0, и считать «открытые веса» синонимом «разрешающей коммерческое использование» — ошибка. Практическая разница между ними в том, что именно защищают эти лицензии: некоммерческий исследователь может использовать обе, компании, создающей продукт, нужно проверять обе, а всё предназначение Base — быть дообученной и стать частью чужого продукта — делает точные условия Base более значимыми, чем они кажутся.
Где каждый из них должен находиться в стеке
Base — правильный выбор, когда вы намереваетесь обучать. Если ваша проблема — узкая задача разметки, специализированная для конкретной области голова классификации или дообучение на нескольких тысячах размеченных примеров, то начать с предобученного чекпоинта на 2.69B с широким многоязычным словарём и гибридной conv-архитектурой, рассчитанной на высокую пропускную способность, — это разумное инженерное решение, а стоимость постобучения, которое вы пропустите, — это стоимость, которую вы сознательно платите вместо этого.
TwIL-LM3-Pro — правильный выбор, когда вы не собираетесь заниматься обучением, а задача уже относится к формальной логике. Разметка логических следствий, формализация утверждений на Lean, семантический разбор и критика доказательств — это задачи, на которые был нацелен весь его пайплайн, а старт с чекпоинта, уже прошедшего этапы слияния и дообучения с подкреплением, избавляет вас от той части, которую действительно трудно воспроизвести, — сохранения уровня на отложенном наборе при одновременном приросте в предметной области.
Ошибка — интерпретировать «3.66B post-trained specialist» как безусловно лучший вариант, чем «2.69B base checkpoint». Они находятся на разных этапах одной и той же производственной линии.
Служить им — или служить в обход них
Ни одна из этих моделей сегодня не является маршрутом в каталоге OrcaRouter, и причина у каждой своя. TwIL-LM3-Pro имеет некоммерческую лицензию и не имеет размещённого эндпоинта; LFM2.5 2.6B Base — это артефакт для тонкой настройки, который никто намеренно не стал бы предоставлять в качестве эндпоинта для инференса. Маршрутизатор оправдывает себя на уровень выше — в работе, окружающей специалиста: генерация и фильтрация обучающих данных, на которых вы бы дообучали Base, расширение промптов, которые вы бы подавали модели формальной логики, и оценка выходных данных. Это текстовые вызовы, и они выполняются через один эндпоинт, совместимый с OpenAI, против более чем 200 моделей по каталожной цене провайдера с наценкой 0%, так что снижение цены провайдером вступает в силу в тот же день, а переход с одной модели генерации данных на другую — это правка конфигурации, а не вторые отношения с вендором.
Автоматическое переключение при сбое важнее, чем обычно, в конвейере тонкой настройки, потому что пакетная задача, которая умирает на 80%, губит весь запуск. Один ключ для моделей генерации с резервным вариантом, который повторяет запрос при ошибке провайдера, — это меньший фрагмент инфраструктуры, чем три интеграции с API.

Какой именно — определяется вашим намерением
Если вы занимаетесь обучением, берите Base. Если вы выполняете инференс на формальной логике и лицензия разрешает ваше использование, берите TwIL-LM3-Pro. Если вам сегодня нужна небольшая модель, следующая инструкциям, и ни одно из этих ограничений не подходит, используйте прошедшего постобучение собрата LFM2.5 2.6B — модель, которую Liquid действительно публикует для этой цели, — а Base оставьте для тонкой настройки, которую вы всё равно планировали.


