
LFM2.5-2.6B-Base: самый тихий релиз Liquid AI — тот, что на самом деле нужен специалистам по тонкой настройке
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 за 1 млн токенов · 56 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3150Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 201 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicНОВИНКАAnthropic: Claude Opus 52026-07-2461Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2150Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1651Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1557Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0854Интеллект72Кодинг
- tencentTencent: Hy32026-07-0641Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3053Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1651Интеллект69Кодинг60Математика
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Интеллект61Кодинг61Математика
Посмотрите на счетчики Hugging Face на 5 августа 2026 года, и разрыв трудно не заметить: LFM2.5-2.6B, агентная модель для устройств, которую Liquid AI представила 4 августа, насчитывает 47 393 загрузки. LFM2.5-2.6B-Base, предобученная контрольная точка, от которой происходят все эти веса, составляет 151. Та же организация, та же архитектура, та же неделя — разрыв 314 к 1.
Базовый чекпоинт не был утёкшим и не был скрытым. Он появился в анонсе Liquid ровно в одной скобке — «Базовые (LFM2.5-2.6B-Base) и пост-обученные (LFM2.5-2.6B) модели доступны сегодня на Hugging Face» — и это всё, что было опубликовано о нём. Ни собственных бенчмарков, ни раздела, ни отдельной карточки. Всё, что ниже, прочитано напрямую из репозитория — карточка модели, config.json, файл LICENSE и Hugging Face API — плюс арифметика, которую мы сделали сами. Там, где число взято из собственных оценок Liquid, мы это указываем, потому что для этого конкретного чекпоинта самый важный факт — как мало на самом деле было измерено.
Это важнее, чем можно предположить по сноске. Дообученную модель можно оценить, попробовав её. Базовый чекпоинт — это предложение потратить две недели и бюджет на GPU, прежде чем вы узнаете хоть что-то, поэтому условия предложения — что в нём, для чего оно лицензировано, что было оценено — и есть всё решение.
Что на самом деле находится в репозитории
Девять файлов, один шард весов, без модельного кода. Список спецификаций карточки, сверенный с config.json:
• 2.69B всего параметров, bfloat16, в одном файле 5.39 GB model.safetensors. Планируйте объём хранилища и VRAM исходя из этого числа, а не из «2.6B».
• 30 слоёв, гибридная архитектура. На карточке указано 22 коротких свёрточных блока с двойным стробированием плюс 8 слоёв внимания GQA. Массив layer_types в config.json подтверждает это в точности: 22 записи типа conv и 8 записей типа full_attention, причём слои внимания расположены примерно каждый третий или четвёртый блок, а не сгруппированы вместе.
• Скрытая размерность 2048, промежуточная размерность 10752, 32 головы внимания поверх 8 KV-голов — соотношение GQA 4 к 1 — со связанными входными и выходными эмбеддингами и тетой RoPE 10 000 000.
• Словарь из 128 000 токенов, а также сопутствующий токенизатор на 18 МБ. Liquid удвоил словарь в этом поколении, что составляет значительные издержки при 2.6B: при связанных эмбеддингах только таблица словаря занимает примерно 262M из бюджета параметров — почти десятую часть модели.
• 34 триллиона обучающих токенов. Это необычно длительный этап предобучения для моделей такого размера, и это самая веская причина вообще обратить внимание на этот чекпоинт.
• 16 языков заявлено: английский, арабский, китайский, французский, немецкий, хинди, индонезийский, итальянский, японский, корейский, польский, португальский, русский, испанский, тайский и вьетнамский.
Одно несоответствие для тех, кто планирует работать с длинным контекстом: в карточке модели заявлена длина контекста 131 072 токена, в то время как config.json задаёт max_position_embeddings равным 128 000. И блог, и документация самой Liquid указывают 128K. Разница в 3 072 токена для большинства не имеет значения, но если вы пишете обучающий скрипт, который упаковывает последовательности до заявленного максимума, доверяйте файлу конфигурации, а не карточке модели.
Строка архитектуры — это практический заголовок: model_type — это lfm2, а класс — Lfm2ForCausalLM — тот же класс, с которым поставляется LFM2. LFM2.5 — это расширенное предварительное обучение и новое пост-обучение на существующей архитектуре, а не на новой, так что здесь не требуется специальный код моделирования. Вот почему llama.cpp, vLLM, MLX, ONNX Runtime, SGLang и LM Studio поддерживают это семейство с первого дня, и почему путь дообучения через Unsloth и TRL работает без патчей. Вам понадобится transformers>=5.0.0.
Карта, которую вы получаете, — это карта другой модели.
Откройте базовый репозиторий — и первый заголовок будет "LFM2.5-2.6B" — это название пост-обученной модели, а не той, что вы ищете. Это не придирка: вся страница читается как карточка инструкционной модели, в которую вставили базовый абзац, и три оставшихся артефакта могут стоить вам реального времени.

• В YAML-frontmatter указано base_mode: LiquidAI/LFM2.5-2.6B-Base. Две проблемы в одной строке: ключ — это опечатка в написании используемого Hugging Face base_model, и он указывает базовый репозиторий на сам себя. Ничего не ломается, но ссылки на дерево модели, которые вы ожидали бы от правильно объявленной родословной, не генерируются из-за этого.
• Репозиторий помечен тегом conversational и содержит chat_template.jinja, поэтому Hugging Face отображает бейдж «Chat template» на чекпоинте, который никогда не был дообучен на инструкциях. Шаблон существует потому, что конфигурация токенизатора была унаследована, а не потому, что веса знают, что с ним делать.
• Затем сниппет из быстрого старта использует этот шаблон. Python-пример на карточке базовой модели вызывает tokenizer.apply_chat_template с {"role": "user"} сообщением и спрашивает «Что такое C. elegans?» — классический способ заставить базовую модель выглядеть сломанной. Оберните сырую предобученную контрольную точку в реплики чата — и вы получите дрейфующий, повторяющийся, самопродолжающийся текст, и это легко принять за плохую модель, а не за неправильный формат промпта. Задавайте этой модели промпт как текстовому автодополнителю, в режиме few-shot, со стоп-последовательностями, которыми вы управляете.
• В таблице вариантов указана только пост-обученная линейка — LFM2.5-2.6B, а также её сборки GGUF, ONNX и MLX. Для базового чекпоинта вообще не существует сборок GGUF или MLX, так что «запустить её локально сегодня вечером в LM Studio» не вариант без самостоятельного преобразования.
Hugging Face также сообщает, что ни один инференс-провайдер не обслуживает этот репозиторий. Нигде нет размещённой конечной точки для базовой контрольной точки; если вам нужны её логиты, вы арендуете GPU.
Раздел бенчмарка, которого не существует
Для LFM2.5-2.6B-Base не опубликовано ни одного оценочного показателя. Ни MMLU, ни MMLU-Pro, ни GPQA, ни HellaSwag, ни ARC, ни значения перплексии — вообще ничего — ни на одной из трёх площадок Liquid (в карточке модели, в анонсе, в документации). Для базового чекпоинта это бросающееся в глаза отсутствие, ведь именно по этим показателям знаний и рассуждений можно судить, оставили ли 34 триллиона токенов предобучения что-то, что стоит дообучать.
То, что существует, относится к пост-обученной родственной модели, приводится Liquid и не было независимо воспроизведено. По собственным оценкам Liquid, LFM2.5-2.6B набирает 51.87 в AIME25, 59.17 в IFBench, 80.07 в Multi-IF, 56.88 в BFCLv4, 77.83 в ToolSandbox и 26.89 в BrowseComp+ в харнессе OpenClaw, в сравнении с gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) и Qwen3.5-9B (9.7B). Резюме Liquid: модель лидирует во всех бенчмарках на следование инструкциям и почти во всех на использование инструментов, а собственный график честно признаёт исключения: Qwen3.5-9B впереди по AIME25 с 56.07 и по BFCLv4 с 60.13. Заявления о скорости следуют тому же правилу — 220 токенов/с при декодировании на M5 Max, 113 на Ryzen AI Max+ 395, около 30 на телефоне, менее 2.5 ГБ памяти и примерно 15K выходных токенов/с при высокой конкурентности на одном H100 — все показатели измерены вендором и никем ещё не проверены.
Ловушка в том, чтобы предполагать, что всё это переносится. Эти оценки — результат четырёхэтапного конвейера, применённого поверх этого чекпоинта: два раунда контролируемой тонкой настройки, специализация учителя по доменам, многодоменная дистилляция на политике, затем агентное обучение с подкреплением с GRPO, запускаемое в реальных испытательных стендах. Вызов инструментов и следование инструкциям — это именно те поведения, которые прививает этот конвейер. Возьмите базовые веса — и вы окажетесь на этапе до всего этого. Что вы наследуете, так это предобучение — языки, знания о мире, способность работать с длинным контекстом, эффективная гибридная архитектура — и вам следует предполагать, что вы не наследуете ничего из агентного табло.
151 загрузка — это не просто рано — это выбивается из собственного паттерна семьи
Liquid регулярно выпускает базовые чекпоинты, так что этот релиз ничем не примечателен по своему характеру. Измеримо именно упущение. Сравнение каждого базового репозитория LFM2.5 с его instruct-версией за один и тот же день даёт чёткую внутреннюю норму — и одно явное исключение.

• LFM2.5-230M — 58 676 загрузок против 6 982 у базовой версии: примерно 8 к 1.
• LFM2.5-350M — 94,526 против 9,397: примерно 10 к 1.
• LFM2.5-1.2B — 583 914 для Instruct-сборки против 17 867 для базовой: примерно 33 к 1.
• LFM2.5-8B-A1B — 171,520 против 3,996: примерно 43 к 1.
• LFM2.5-2.6B — 47,393 против 151: примерно 314 к 1.
Частично это объясняется просто возрастом: базовый репозиторий был создан 1 августа, и instruct-модель имела фору в четыре дня плюс анонсирующий пост. Но более старые базовые контрольные точки этого семейства закрепились в диапазоне от 8:1 до 43:1, так что превышение на порядок даже худшего из них — это реальная аномалия, а не артефакт округления нового репозитория.
Лайки рассказывают более тонкую историю. В базовом репозитории 28 лайков против 151 загрузки — примерно одна закладка на каждые пять скачиваний. У instruct-модели 232 лайка против 47 393 загрузок — примерно один на каждые 204. Люди добавляют базовый чекпойнт в закладки, чтобы вернуться к нему, а не скачивают его. В её дереве моделей уже есть два файн-тюна от сообщества и семь квантизаций — именно так выглядит передний край внедрения до того, как придёт основная масса.
«Без ограничений» — это не то, что говорится в лицензии.
Страница запуска Liquid описывает релиз как открытые веса: «Скачивайте, дообучайте и развертывайте без ограничений». Файл в репозитории содержит более узкую формулировку, и этот раздел стоит перечитать дважды, если вы рассматриваете создание продукта на этих весах.

Лицензия — это LFM Open License v1.0 — не Apache-2.0, не MIT, и не те же условия, что у большинства небольших моделей с открытым весом, с которыми вы, вероятно, её сравниваете. Если процитировать файл напрямую, Раздел 5 озаглавлен «Ограничение коммерческого использования» и гласит: «Права, предоставляемые по настоящей Лицензии на Коммерческое использование, обусловлены тем, что Вы или Ваше юридическое лицо не превышаете Порог», за которым следует «Любое Коммерческое использование Произведения или Производного произведения юридическим лицом, превышающее Порог, не лицензируется по настоящему Соглашению». Раздел 1 определяет Порог как «годовой доход в 10 миллионов долларов США ($10,000,000) или более».
Итак, практическое прочтение:
• При годовой выручке менее $10 млн — вам предоставляется широкая бессрочная лицензия без выплаты роялти, охватывающая воспроизведение, создание производных произведений, распространение и сублицензирование, включая коммерческое использование.
• $10 млн и более — коммерческое использование не лицензируется данным соглашением. Не «требуется указание авторства», не «требуется уведомление». Вам нужно связаться с Liquid, что, вероятно, и объясняет, почему карточка заканчивается ссылкой на их отдел продаж.
• Производные работы наследуют это ограничение. Ваш файн-тюн этой контрольной точки является производной работой, поэтому модель, на обучение которой вы тратите квартал, несёт то же предоставление прав, обусловленное выручкой. Если ваша компания пересекает порог — или её приобретает компания, которая уже его пересекла — условия, от которых зависит ваш продукт, меняются под ним.
• Квалифицированные некоммерческие организации исключаются: Порог не применяется к организации 501(c)(3) или её иностранному аналогу, использующим произведение в некоммерческих или исследовательских целях. Обычные обязательства также действуют — передавайте лицензию дальше, сохраняйте уведомления об авторстве, отмечайте изменённые вами файлы.
Ничто из этого не делает релиз скупым; порог в $10 млн освобождает почти все стартапы и всех исследователей, и это легитимный способ публиковать веса. Но «без ограничений» — это маркетинговый текст, которому противоречит лицензия, и несоответствие больнее всего бьёт именно здесь. Тонкая настройка базового чекпойнта — самый дорогой и наименее обратимый способ внедрения модели. Это худшее место, чтобы обнаружить пункт о доходах.
Кому на самом деле стоит пройти этот чекпоинт?
Собственные рекомендации Liquid на удивление узкие, и им стоит следовать: на карточке сказано, что предобученная контрольная точка "рекомендуется только для задач, требующих серьёзного дообучения, таких как языковые (например, японские) или доменно-специфические (например, медицинские) ассистенты, обучение на проприетарных данных или эксперименты с новыми подходами к пост-обучению". Это слово «только» действительно важно. Если вам нужен локальный агент, вызывающий инструменты, пост-обученная LFM2.5-2.6B — строго лучшая отправная точка, а базовая контрольная точка заставит вас впустую потратить месяц.
Случаи, когда это действительно правильный выбор:
• Язык, недостаточно охваченный пост-обучением. 34 триллиона токенов на 16 языках — это прочная многоязычная основа, и Liquid уже опробовал этот подход внутри компании, создав японскую сборку в линейке 1.2B. Продолжение предварительного обучения на вашем языке с последующей собственной инструкционной настройкой позволяет избежать борьбы с англоцентричной пост-обученной моделью.
• Регулируемая вертикаль с проприетарными данными. Менее 2,5 ГБ при инференсе, отсутствие зависимости от облака и достаточно пермиссивная лицензия ниже порога выручки — редкое сочетание для медицинских, юридических или промышленных внедрений, где данные не могут покидать устройство.
• Исследование пост-обучения.Liquid опубликовала свой рецепт — SFT, специализацию учителя, MOPD, агентный RL — а затем предоставила точные входные данные для этого рецепта вместе с выходными данными. Возможность запустить собственный метод на тех же начальных весах и сравнить его с сильной эталонной реализацией — это необычно и ценно.
• Цели дистилляции. Гибрид с 2.6B параметров, который декодирует со скоростью 220 токенов/с на ноутбуке, является привлекательным учеником для сжатия гораздо более крупного учителя в нечто, готовое к выпуску.
Вот эта последняя пара — то, где на самом деле оседает стоимость, и это не GPU-часы, а данные. Конвейер Liquid построен на специализации учителей и дистилляции по политике (on-policy distillation), а значит, реальное предусловие для воспроизведения чего-либо подобного — большой объём сгенерированных данных от более сильных моделей, плюс пары предпочтений и роллауты с проверяемым вознаграждением. Это работа со многими моделями, прежде чем стать работой по обучению: нужно сравнить кандидатов-учителей на вашем домене, а затем генерировать в объёме от того, кто победит. Именно на эту часть работы нацелен наш собственный продукт — OrcaRouter ставит более 200 моделей за одним API-ключом с нулевой наценкой, так что за синтетический SFT-набор вы платите цену провайдера по прайс-листу, а не наценку за маршрутизацию (когда вендор снижает цены, это в тот же день отражается на нашей стороне), автоматический фейловер не даёт двадцатичасовому прогону генерации умереть из-за неудачного часа одного провайдера, а DSL маршрутизации позволяет разослать один промпт сразу нескольким учителям и сохранить лучший ответ. Чтобы было ясно, чего мы не предлагаем: LFM2.5-2.6B-Base нет на OrcaRouter, и ни один инференс-провайдер его не хостит — эти веса вы запускаете сами. Мы полезны для учителей, а не для ученика.
Тот же принцип разделения стоит учитывать и для того, что вы выпускаете. В посте Liquid утверждается, что локальные агенты делают инференс бесплатным и устраняют стоимость за токен как ограничение, — это верно для предельного токена, но не для общего счёта: вы уже заранее оплатили это в оборудовании, и у модели на 2.6B параметров всё равно есть потолок. Liquid сам это признаёт, советуя не использовать эту линейку для задач с интенсивным кодингом или агентных задач, требующих больших объёмов знаний. Устойчивый паттерн — это дообученная локальная модель, которая обрабатывает высоконагруженный типовой путь на устройстве и передаёт сложное меньшинство frontier-модели через API; это сохраняет преимущества по приватности и задержке там, где они важны, не делая вид, что 2.6B параметров могут всё.
Путь от этих весов к чему-то пригодному
В анонсе об этом ничего не сказано, но в карточке базовой модели незаметно кроется самое практичное, что есть во всём репозитории: семь готовых к запуску Colab-ноутбуков, покрывающих все этапы пайплайна, которые нужны базовому чекпойнту. Два из них — продолженное предобучение: один для завершения текста, один для перевода. Это этап, который имеет смысл только при работе с базовыми весами, и о котором никто не пишет туториалов. Остальные покрывают дообучение с учителем через Unsloth и TRL, DPO через TRL и GRPO через оба. Liquid также поставляет LEAP Finetune как собственный стек обучения, если вы предпочитаете не собирать свой.
Сверяя документацию Liquid по тонкой настройке с формой этой модели, реалистичная последовательность выглядит так:
• Сначала используйте его как комплитер, прежде чем что-либо обучать.Игнорируйте чат-шаблон на карточке. Few-shot, сырой текст, свои собственные стоп-последовательности. Так вы выясните, покрывает ли предварительное обучение уже вашу область и язык, а это определяет, нужно ли вам вообще продолженное предварительное обучение или можно сразу перейти к SFT.
• Продолженное предварительное обучение — только если вы добавляете знания или язык.Это дорогостоящая ветвь — масштаб корпуса, а не масштаб примеров, — и то единственное, чего пост-обученный собрат действительно не может вам дать.
• Затем SFT с LoRA на 500–5 000 примерах.Liquid рекомендует, что качество и распределение важнее объёма, а примеры должны соответствовать входным данным из продакшена. При 2.6B прогон LoRA короткий: документация оценивает запуск 1.2B в минуты или десятки минут на одном современном GPU, поэтому при таком размере цикл по-прежнему укладывается в полдня.
• Зафиксируйте отложенный набор данных до начала обучения. Резко, и повторить это стоит именно для этого чекпоинта, потому что нет опубликованного бейзлайна для сравнения: ваш оценочный набор — единственная цифра, которая есть у кого-либо.
• Preference или RL проводятся в последнюю очередь, и только если проблема в поведении. Для семейства существуют рецепты DPO и GRPO, но это лишь доработка поверх модели, которая уже отвечает; хвататься за них до завершения SFT — именно так проекты на базовых чекпоинтах застревают.
Обратите внимание на то, чего нет в этом списке: здесь ничто не требует пользовательского ядра, пропатченного трейнера или файла моделирования. Поскольку LFM2.5 использует архитектуру LFM2, базовый чекпоинт вписывается в стандартный стек, и вся стоимость этого проекта — это корпус и набор для оценки, которые вы для него создаёте.
Что бы изменило картину?
За тремя вещами стоит наблюдать — все они дёшевы для Liquid в плане решения, но ни одна из них сегодня не решена.
Первое — это базовые оценки. Одно число MMLU-Pro или GPQA на предобученной контрольной точке сказало бы финтюнерам больше, чем все агентные бенчмарки в анонсе вместе взятые, а тот факт, что было затрачено 34 трлн токенов, делает отсутствие таких оценок ещё более странным, а не менее. Второе — это сама карточка: базовый репозиторий, заголовок которого называет другую модель, быстрый старт которого применяет чат-шаблон к не-чат-модели, и фронтматтер которого с ошибкой пишет base_model — это исправление на десять минут, которое помешало бы людям делать вывод, что веса сломаны, когда сломаны инструкции. Третье — это технический отчёт LFM2.5. Блок цитирования указывает на arXiv 2511.23404, а это LFM2 технический отчёт от ноября 2025 года; собственная статья поколения 2.5 ещё не вышла, поэтому состав данных предобучения, стоящий за этими 34 трлн токенов, остаётся нераскрытым.
До тех пор честный вывод таков: это хорошо специфицированная, прошедшая длительное обучение, эффективно устроенная фундаментальная модель на 2.6B с необычно ясной целевой аудиторией, опубликованная без измерений и с лицензией, ограничивающей выручку, — и до сих пор почти никто не достал её из коробки. Если вы входите в аудиторию, которую описывает карточка, она стоит вашего GPU-времени — и вы будете среди первых, кто вообще узнает, насколько она хороша на самом деле.
Вопросы, на которые стоит отвечать
Это та же контрольная точка, от которой был дообучен LFM2.5-2.6B, или это отдельный запуск предварительного обучения?
На карточке указано, что LFM2.5-2.6B-Base {{1}}«это предварительно обученная текстовая контрольная точка, используемая для создания всех вариантов LFM2.5-2.6B,»{{/1}} {{2}}то есть это фактический вход опубликованного конвейера, а не параллельный или урезанный выпуск.{{/2}} Именно это делает её полезной для исследований пост-обучения: {{3}}ваш метод и четыре этапа Liquid стартуют с одинаковых весов, поэтому сравнение между ними имеет смысл.{{/3}} Стоит отметить, что базовый репозиторий был создан 1 августа и последний раз изменён 4 августа, в день запуска — {{4}}проверьте историю коммитов, прежде чем предполагать, что файл, скачанный вами заранее, — это тот же файл, что был опубликован.{{/4}}
Могу ли я доработать его и продать результат?
Если годовая выручка вашего юридического лица составляет менее 10 000 000 долларов США, то да — грант LFM1.0 покрывает коммерческое использование производных работ при условии сохранения лицензии и уведомлений об авторстве в неизменном виде и маркировки изменённых файлов. При достижении этого порога или его превышении коммерческое использование модели или любых производных от неё выходит за рамки лицензии и требует отдельного соглашения с Liquid. Порог привязан к выручке вашего юридического лица, а не к модели или доходам, которые она приносит, поэтому одна и та же дообученная модель может быть лицензирована для одной компании и не быть лицензирована для другой, а компания, превысившая этот порог, не сохраняет грант, который у неё был.
Почему бы вместо этого просто не дообучить пост-обученную LFM2.5-2.6B?
Для большинства проектов так и следует делать, и карточка Liquid, по сути, об этом и говорит. Причина начинать с базового чекпоинта в том, что пост-обучение работает против вас, а не на вас: интенсивное продолженное предобучение на новом языке или специализированном корпусе в любом случае склонно повреждать настроенное под инструкции поведение, а паттерны отказов, соглашения о вызове инструментов и стиль ответов, заложенные SFT и RL, трудно удалить и легко вступить с ними в конфликт. Если вы добавляете знания или язык — начинайте с базы. Если вы вносите лишь точечные правки в поведение — начинайте с пост-обученной модели и сохраняйте четыре этапа работы, которую кто-то уже оплатил.
