
AstaBrief 8B против Qwen3-8B: что файнтюн от Ai2 добавляет к своей собственной базовой модели
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 220 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Здесь нет никакой истории об архитектуре — и в этом суть. AstaBrief 8B — это файнтюн Qwen/Qwen3-8B, и две модели совпадают по конфигурации вплоть до последней головы внимания: Qwen3ForCausalLM, 36 слоёв, размер скрытого состояния 4096, 32 головы внимания с 8 головами ключей-значений, словарь на 151 936 токенов и предельное число позиций 40 960 токенов. Всё, что отличает релиз Ai2 от 2026-10-02 от базовой модели апреля 2025 года, — это посттренировка. Поэтому интересный вопрос не в том, что лучше в целом, — а в том, что даёт конкретный, хорошо профинансированный запуск посттренировки поверх базовой модели, которую вы уже можете скачать бесплатно, и чем за это приходится расплачиваться взамен.
Ответ Ai2 — это система написания отчётов, которая создаёт синтез из нескольких разделов с цитированием примерно за 51 секунду против 178,5 секунды у конвейера на базе Claude, который она заменила внутри платформы Asta, — примерно в 3,5 раза быстрее, при этом Ai2 утверждает, что качество отчётов сохранилось по метрикам, которые она отслеживала. Ответ Qwen3-8B — это универсальная модель с гибридным режимом рассуждения и режимом без рассуждений, более чем сотней языков и полутора годами использования в downstream-задачах. Оба решения распространяются под лицензией Apache-2.0. Суть компромисса — узкая специализация и скорость против широких возможностей и гибкости, и приведённые ниже данные делают его очертания довольно конкретными.
Строка архитектуры — это no-op, а промпт — нет.
Поскольку геометрия чекпоинта идентична, вся ваша интуиция по обслуживанию Qwen3-8B без изменений переносится на AstaBrief 8B. Это плотная 8B-модель в BF16, она помещается на карту с 24 ГБ, обслуживается на vLLM или Transformers без кастомных ядер и наследует потолок позиций 40K базовой модели — ни одна из моделей не является моделью с длинным контекстом, а обученное окно 32K расширяется с помощью YaRN точно так же, как у базовой модели. Планирование развёртывания для дообученной модели — это планирование развёртывания для базовой модели. Об этом стоит сказать прямо, потому что это не всегда верно для дообученных моделей, и это означает, что единственное, что вы оцениваете, — это поведение.
Поведение — вот где коренится привязка. На карточке AstaBrief есть предупреждение, выделенное жирным шрифтом: модель была дообучена под один конкретный формат промпта, опубликованный как sft_prompt.txt в датасете AstaBrief_prompts, и Ai2 говорит, что использование другого промпта или формата взаимодействия может привести к ухудшению или нестабильному поведению. Этот промпт — не обычный шаблон для чата. Прочитайте его, и вы найдёте жёсткий контракт — слот запроса в квадратных скобках, блок section_references с цитатами, привязанными к идентификатору, явный синтаксис цитирования, требующий, чтобы ключ ссылки шёл после предложения, которое он подтверждает, специальный маркер для знаний модели, который нельзя комбинировать с другим источником, и инструкцию начинать каждый раздел с TLDR из двух предложений. Qwen3-8B примет всё, что вы напечатаете. AstaBrief 8B настроена на одну форму входных данных и покажет худшие результаты, если передать ей другую.
Что купили 47 000 примеров и 6 000 предпочтений
Дообучение полностью относится к этапу посттренинга, и рецепт намеренно конвенционален: контролируемое дообучение с последующей офлайн-оптимизацией прямых предпочтений, без обучения с подкреплением. Ai2 начал с реальных запросов, поданных через свою систему Asta, отфильтровал 90 000 промптов, ориентированных на исследования, по качеству, релевантности и конфиденциальности, сгенерировал целевые отчёты с помощью многоступенчатого пайплайна ScholarQA, используя Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1, и оставил 47 000 примеров. Затем на этапе предпочтений было создано примерно 6 000 пар; GPT-4.1 и DeepSeek-R1 выступали в роли судей, и сохранялись только те пары, по которым оценки совпали.
Измерено на SQABench-CS2 — 100 написанных пользователями исследовательских вопросов по информатике — в сравнении с базовой моделью, вот что для этого потребовалось, причём все цифры сообщены вендором, и ни одна не была независимо воспроизведена:
• Общее среднее — AstaBrief 8B 87,0 против Qwen3-8B 77,3, прирост на 9,7 пункта.
• Вспоминаемость ингредиентов — 90,2 против 77,8.
• Точность цитирования — 90,5 против 76,2.
• Полнота цитирования — 78,2 против 64,6.
• Точность ответов — 89,0 против 90,6, потеря 1,6 пункта по сравнению с базовым.
Последняя строка — та, что должна формировать ожидания. Тонкая настройка под качество отчётов не улучшила всё единообразно; она обменяла небольшую долю релевантности на уровне абзацев на крупный выигрыш в охвате и подтверждении цитатами. Если ваша задача ставит релевантные абзацы превыше всего, базовая модель не является очевидно худшим выбором, а дообученная модель не становится автоматически вашим ответом.
Ещё две вещи, которые деньги не купили. У AstaBrief 8B нет заявленной оценки на DeepScholarBench выше, чем у собственных альтернатив Ai2 — его 53,50 уступает Asta ScholarQA с 60,25 и DR-Tulu-8B с 56,26 — а его проверка людьми — это четырнадцать вопросов от трёх исследователей, и по общему предпочтению в них победил DR-Tulu. Специализированная модель может проиграть исследовательской модели общего назначения на собственном бенчмарке специалиста, и Ai2 это опубликовала.

Что база всё ещё делает лучше
Сравнение не одностороннее, и сторону генералиста в нём легко недооценить.
Qwen3-8B поставляется с гибридными режимами мышления и без размышления, поэтому он может тратить токены на рассуждения, когда задача это оправдывает, и отвечать напрямую, когда нет. AstaBrief 8B обучали написанию отчётов в один проход, и он не наследует ничего из этого поведения намеренного рассуждения в качестве функции продукта. Qwen3-8B также обладает многоязычным покрытием базовой модели — более ста языков, — тогда как AstaBrief обучали на корпусе, явно отфильтрованном до англоязычных научных запросов, поэтому его компетентность за пределами этой области неизвестна, а не просто не проверена.
Затем — поверхность инструкций. Универсальная модель нужна тогда, когда задача изменится на следующей неделе, когда требуется вызов инструментов, когда схема выходных данных принадлежит вам, а не Ai2, или когда вы создаёте прототип и ещё не знаете, как будет выглядеть финальный промпт. А что касается вопроса о происхождении как таковом — того, который имеет значение, когда кто-то спрашивает, почему вы доверяете модели, — у Qwen3-8B более одиннадцати миллионов загрузок и полтора года независимого использования. У AstaBrief 8B была всего лишь неделя с момента запуска.
То, что есть у AstaBrief 8B и чего не может достичь базовая модель, — это дисциплина цитирования. Точность и полнота цитирования — две метрики, по которым преимущество дообученной модели наибольшее и наиболее согласуется с историей обучения: самым сильным отдельным фильтром в конвейере данных Ai2 была плотность цитирования — доля утверждений, содержащих хотя бы одну ссылку, — и итоговая модель отражает этот приоритет. Заставить универсальную модель цитировать в тексте в фиксированном формате ключей, надёжно и не теряя подтверждений для утверждений, — это промпт-инжиниринг, который вы пишете и поддерживаете. Дообучение от Ai2 делает это поведением модели по умолчанию.

Линейка Qwen с апреля 2025 года продвинулась вперёд
Ещё одна сложность, и она сугубо практическая: Qwen3-8B существует уже полтора года, и сравнивать с ним новый файнтюн — не то же самое, что сравнивать его с жизнеспособным действующим конкурентом.
Линейка Qwen теперь насчитывает Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8, и текущее поколение доступно без скачивания чего-либо. Qwen3.8 27B — это действующий маршрут в нашем каталоге с контекстным окном в 262 144 токена по $0,33 за миллион входных токенов и $2,40 за миллион выходных; Qwen3.8 Flash несёт окно на миллион токенов по $0,15 и $0,47; Qwen3 VL 8B Instruct покрывает мультимодальный случай по $0,18 и $0,70 за миллион с окном в 131 072 токена и маршрутизируется с октября 2025 года. Сам Qwen3-8B — не маршрут, который мы обслуживаем, и AstaBrief 8B тоже — оба представляют собой веса «скачай и запусти», и честная формулировка такова: базовой модели место на вашем оборудовании, а современному поколению Qwen это не обязательно.
Это даёт вам третью ветвь для оценки, которую Ai2 не смогла провести. Разверните AstaBrief 8B на своём GPU, поднимите рядом базовую модель Qwen3-8B, чтобы подтвердить заявленные дельты, и направьте тот же испытательный стенд на размещённую модель Qwen3.8 для масштабирования. Все три ветви доступны через один эндпоинт — именно поэтому это задача по настройке, а не проект по закупке — один API для более чем 200 моделей, списочная цена провайдера передаётся с наценкой 0%, так что снижение цены вендором действует у вас в тот же день, автоматическое переключение при отказе, и DSL маршрутизации, если вы хотите, чтобы несколько моделей вместе отвечали на один вопрос. Ветви, развёрнутые самостоятельно, остаются на собственном хостинге из-за чувствительности данных; всё размещённое у провайдеров остаётся заменяемым, что важно, когда следующее поколение Qwen выйдет через квартал.
Как решить
Возьмите AstaBrief 8B, если ваш продукт — это синтез литературы с цитированием и вы хотите, чтобы поведение при цитировании было значением по умолчанию модели, а не обязанностью вашего промпта. Геометрия базовой модели означает ноль сюрпризов при обслуживании, лицензия Apache-2.0 и опубликованные смеси SFT и DPO делают её проверяемой, а её преимущество в точности и полноте цитирования — самый крупный и наиболее объяснимый результат в таблицах Ai2.
Оставайтесь на Qwen3-8B или переходите на актуальную версию Qwen3.x, если ваши задачи разнообразны, если вам нужен режим размышления, инструменты или многоязычная поддержка, если вы всё ещё исследуете промпт или если вы предпочли бы не быть привязанным к блоку инструкций на шестнадцать тысяч символов, который написали не вы. Базовая модель проиграла по охвату и обоснованности цитирования, а не по релевантности, и она сохранила нечто, от чего отказалась дообученная версия.
Главное, чего нужно избегать, — это воспринимать средний показатель 87,0 против 77,3 как исчерпывающую картину. Собственная таблица Ai2 показывает, что дообученная модель жертвует точностью ответов ради дисциплины цитирования; собственные лабораторные заметки Ai2 отмечают, что большая часть обучения и оценки была завершена в 2025 году и не перезапускалась в сравнении с текущими передовыми моделями; а базовая модель, поверх которой она построена, уже не относится к тому поколению, которое вы бы выбрали хоть для чего-то, кроме этого сравнения. То, что дообученная модель действительно добавляет, — это форма вывода; а стоит ли эта форма той узости — целиком зависит от того, совпадает ли она с формой вашего продукта.
