
AstaBrief 8B: открытый генератор отчётов от Ai2 работает в 3,5 раза быстрее, чем пайплайн, который он заменяет
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 216 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Главное число из анонса Ai2 AstaBrief 8B — это показание секундомера, а не результат бенчмарка: на всём конвейере Asta новая модель генерирует исследовательский отчёт со ссылками в среднем за 51,1 секунды против 178,5 секунды у работающего на Claude пути, рядом с которым она теперь находится. Это примерно в 3,5 раза быстрее, и объясняется это одним архитектурным решением — писать весь отчёт за один проход, а не суммировать, кластеризовать и затем писать раздел за разделом. AstaBrief 8B — это 8B-модель с открытыми весами, лицензированная под Apache-2.0 и дообученная на основе Qwen3-8B, которая принимает исследовательский вопрос вместе с выдержками из найденной литературы и возвращает отчёт со встроенными ссылками. Она вышла в платформе Asta от Ai2 в качестве «Fast mode» 2 октября 2026 года, а веса, данные обучения и пример локального рабочего процесса стали общедоступны в тот же день.
Репозиторий старше анонса, и это важно.
Одну деталь в этом релизе стоит назвать прямо, потому что она меняет то, как следует читать всё остальное: репозиторий Hugging Face по адресу allenai/AstaBrief_8B содержит внутреннюю временную метку создания 2026-02-09, а сопутствующий DPO-датасет датируется ноябрём 2025 года. Анонс 2 октября реален — пост в блоге, твит AI2 и карточка модели появились в тот день — но история репозитория длиннее, чем предполагает новостной цикл.
2 октября произошло вот что: Ai2 выпустила и задокументировала эту вещь и обновила репозиторий, чтобы привести его в соответствие: три коммита появились в карточке модели между 16:18:06 и 16:18:20 UTC в день релиза, добавив шаблон ответа в шаблон чата и удалив no-op-токен. Это рутинные правки в карточке, а не переобучение. Ai2 также прямо указывает в блоге, что «большая часть описанного обучения и оценки была завершена в 2025 году» и что проприетарные модели, использовавшиеся для генерации обучающих данных и в качестве точек сравнения, «отражают передний край на тот момент». Лаборатория заявляет, что не проводила повторно полную оценку в сравнении с сегодняшними фронтирными моделями.

Итак, это GA-релиз работы, по большей части завершённой в 2025 году, — запуск, с документацией запуска и платформенной интеграцией запуска, поверх чекпойнта, который уже несколько месяцев существует в аккаунте лаборатории. В этом нет ничего нечестного, и модель нова для всех за пределами Ai2. Но это означает, что приведённые ниже сравнительные цифры описывают фронтир 2025 года, и Ai2 сама это говорит.
Что AstaBrief 8B на самом деле делает
Платформа Asta от Ai2 имеет функцию генерации отчётов: исследователи приносят содержательный вопрос и корпус литературы, а на выходе получают синтез со ссылками, который они используют как рабочий артефакт. Раньше эта функция полностью работала на том, что Ai2 называет Thinking mode: многоступенчатом конвейере, который суммирует найденные фрагменты, тематически их кластеризует и пишет ответ раздел за разделом, опираясь на модели Claude. Thinking mode — основательный и медленный.
AstaBrief 8B — это режим Fast. При одном и том же вопросе и одних и тех же извлечённых фрагментах итоговый отчёт пишется за один прямой проход. Утверждение Ai2 — самое интересное: обход суммирования сниппетов, кластеризации и цикла по разделам не ухудшил качество отчёта, по крайней мере по тем метрикам, которые отслеживала лаборатория. Модель не является поисковой системой и не выполняет поиск — это автор в конце конвейера извлечения, и она ожидает, что ей передадут доказательства.
Это делает его компонентом, а не продуктом. Именно поэтому Ai2 выпустила пример рабочего процесса вместе с весами: небольшая библиотека, которая превращает ваши собственные PDF-файлы в отчёты, в репозитории ai2-scholarqa-lib, даёт вам отправную точку для локальной генерации.
Рецепт обучения намеренно скучен, и в этом весь смысл.
Собственная предыдущая работа Ai2, DR Tulu, показала, что обучение с подкреплением может улучшать генерацию длинных отчётов в моделях с открытыми весами. Для AstaBrief команда рассмотрела этот путь и решила не идти по нему — на том основании, что RL нестабилен и дорог, а им хотелось чего-то, что легче отлаживать. Вместо этого они построили обучение с учителем, за которым следует офлайн-оптимизация прямых предпочтений. Два этапа, оба традиционные.
Этап SFT начался с реальных запросов, отправленных через систему Asta от Ai2, а не с синтетических подсказок. Из собранных логов команда отфильтровала их по качеству, релевантности и приватности — удалив трафик ботов и бета-тестеров, отбросив слишком короткие запросы, не имеющие смысла, и запустив прогон LLM, чтобы выявить запросы не на английском языке, ненаучные запросы и подсказки, содержащие личную информацию. В результате остался пул из 90 000 запросов, ориентированных на исследования. Целевые полные отчёты для этих запросов были сгенерированы с помощью многошагового пайплайна ScholarQA, используя Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1 в качестве базовых моделей. После фильтрации по качеству: 47 000 пригодных для обучения примеров.
Этапу DPO требовалось нечто иное — пары отчётов с предпочтением между ними. Один отчёт на запрос поступал из пайплайна ScholarQA; конкурирующий отчёт получался путём подачи извлечённых фрагментов ScholarQA в другую модель, выбранную из o3, o4-mini, DeepSeek-V3 или DeepSeek-R1. Два судьи, GPT-4.1 и DeepSeek-R1, выбирали победителя для каждой пары, и оставались только те пары, по которым оба судьи согласились. Ai2 сообщает о 95% согласии между LLM-судьями и человеческими предпочтениями. Итоговый набор предпочтений составил примерно 6 000 примеров. Как SFT-смесь, так и DPO-смесь доступны на Hugging Face для ознакомления.

Самый универсальный вывод оказался и самым неброским. Ранние прогоны SFT писали более качественные отчёты, но отставали по точности ответов и качеству цитирования, поэтому команда протестировала четыре основанных на статистике фильтра на синтетических обучающих данных: соотношение токенов вывода и ввода, среднюю релевантность поиска для процитированных работ, плотность цитирования (долю утверждений, содержащих хотя бы одну ссылку) и разнообразие цитирования. Наибольший прирост дала фильтрация синтетических отчётов с низкой плотностью цитирования — а более агрессивная фильтрация, комбинации фильтров и переборы скорости обучения не дали значимого прироста. Вывод Ai2 стоит перенести за пределы этой модели: специализация достигалась не за счёт вливания большего объёма научного текста в предобучение, а за счёт состава и качества данных постобучения.
Табло, опубликованное Ai2, и как его читать

Все приведённые ниже цифры сообщены производителем. Они взяты из карточки модели и блога Ai2, созданы с помощью собственного оценочного стенда лаборатории, и ни одна из них не была независимо воспроизведена. Основной целью был SQABench-CS2 — набор из 100 написанных пользователями исследовательских вопросов по компьютерным наукам, отслеживаемый по четырём метрикам: полнота охвата компонентов (покрытие необходимого содержания), точность ответа (релевантность каждого абзаца), точность цитирования (подтверждает ли каждая ссылка своё утверждение) и полнота цитирования (полностью ли утверждения подтверждаются приведёнными ссылками).
• Общий средний балл — AstaBrief 8B 87,0, его собственный SFT-чекпоинт 83,7, базовая модель Qwen3-8B 77,3
• Полнота по ингредиентам — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.0
• Точность ответов — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6
• Точность цитирования — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2
• Полнота цитирования — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6
Читайте строки вместе, и этап DPO выглядит целенаправленным, а не равномерно лучшим. Общее среднее растёт, полнота по ингредиентам и обе метрики цитирования резко возрастают, а точность ответов незначительно опускается ниже как контрольной точки SFT, так и базовой модели. Если ваш сценарий использования — релевантность на абзац прежде всего, дообучение не становится автоматически вашим ответом.
В рамках вторичных оценок Ai2 протестировала финальную модель против собственного пайплайна ScholarQA и против DR-Tulu-8B. На dev-наборе SQABench-CS2 Asta ScholarQA набрала 87,6, DR-Tulu-8B — 86,5, а AstaBrief 8B — 86,3; на тестовой выборке — ScholarQA 86,2, DR-Tulu-8B 88,8, AstaBrief 87,0. На DeepScholarBench — бенчмарке длинноформатного синтеза из 63 запросов — ScholarQA набрала 60,25, DR-Tulu-8B — 56,26, а AstaBrief — 53,50; это единственная строка, где открытый генератор отчётов уступает обоим альтернативам. В двух попарных сравнениях, оценённых LLM, против пайплайна на базе Claude AstaBrief победила в 55% сравнений на dev и 72% сравнений на тесте. Отдельное исследование с участием людей охватывало лишь 14 вопросов от трёх исследователей, и по общей предпочтительности победила DR-Tulu, хотя двое из трёх исследователей предпочли AstaBrief по точности цитирования. Четырнадцать вопросов от трёх человек — это сигнал, а не вердикт, и Ai2 представляет это именно так.
Лаборатория также опубликовала данные о раннем использовании интеграции Asta: среди 374 пользователей, попробовавших Fast mode, 29,1% использовали его в течение двух или более дней, в среднем пользователи создавали 3,67 ветки отчётов, 23% никогда не возвращались к Thinking mode, а 18% переключались между двумя режимами в зависимости от задачи. Доля положительных отзывов составила 84,2% для Fast mode против 85,2% для Thinking mode — настолько близко, что Ai2 характеризует эти отзывы как слишком малочисленные, чтобы делать из них серьёзные выводы. Это честная формулировка, поэтому оставьте её.
Запуск самостоятельно
AstaBrief 8B распространяется под лицензией Apache-2.0 и основана на Qwen/Qwen3-8B, поэтому она относится к классу одно-GPU, а не к классу дата-центров: плотная модель на 8B на архитектуре Qwen3, 36 слоёв, размер скрытого слоя 4096, 32 головы внимания с 8 головами ключей и значений, словарь на 151 936 токенов и унаследованное от базовой модели ограничение позиций в 40 960 токенов. В формате BF16 она с запасом помещается на карту с 24 ГБ, а в примере для самой карты используется vLLM с температурой 0,7, top-p 0,95 и ограничением вывода в 4096 токенов.
На карточке модели жирным шрифтом напечатано одно эксплуатационное предупреждение, которое легко пропустить: чекпоинт был дообучен под один конкретный формат запроса, опубликованный как sft_prompt.txt в наборе данных AstaBrief_prompts. Используйте другой формат запроса или взаимодействия — и Ai2 ожидает ухудшения или непоследовательного поведения. Если вы оцениваете эту модель с помощью собственного стенда и получаете плохие результаты, проверьте запрос, прежде чем делать какие-либо выводы о весах.
Карточка также откровенна насчёт сферы применения. AstaBrief предназначен для исследовательского и образовательного использования, а не в качестве ассистента общего назначения, и у Ai2 нет хостингового эндпоинта для инференса — вы либо скачиваете его, либо используете его внутри Asta. Ни один провайдер в нашем каталоге его не обслуживает, включая нас, так что нет маршрута, на который можно было бы указать; честный способ его использовать — на собственном оборудовании или за собственным межсетевым экраном, что как раз и есть тот аргумент в пользу открытых весов, который Ai2 приводит с самого начала.
Где маршрутизатор вписывается в конвейер отчётов
AstaBrief занимает одно звено в более длинной цепочке. Что-то извлекает литературу, что-то решает, какие фрагменты стоит передавать дальше, а что-то может оценивать или проверять готовый отчёт. Эти вызовы — обычные обращения к размещённым моделям, и именно в этой части стека вам действительно нужен выбор поставщиков: один API, охватывающий более 200 моделей, прейскурантная цена провайдера, передаваемая с наценкой 0%, поэтому снижение цены поставщиком отражается в вашем счёте в тот же день, автоматическое переключение при сбое, если провайдер деградирует, и DSL маршрутизации, если вы хотите объединить несколько моделей в один вызов. Разместите писателя на собственном хостинге, потому что именно эта часть связана с чувствительностью данных и фиксированными затратами; маршрутизируйте оркестрацию, потому что именно там гибкость ценнее владения.
Здесь также есть дешёвый эксперимент. Собственный набор Ai2 для сравнения — Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini и GPT-4.1 — намеренно представляет собой фронтир 2025 года, и лаборатория говорит, что не запускала его заново. Поставить вывод AstaBrief рядом с сегодняшними хостируемыми моделями на ваших собственных вопросах — это упражнение в одно нажатие клавиши, если оба плеча доступны через один и тот же эндпоинт, и оно отвечает на вопрос, который пост в блоге оставляет открытым.
Что бы изменило картину?
Три вещи превратили бы это из хорошо документированного запуска в устоявшийся результат. Независимое воспроизведение показателей SQABench-CS2, поскольку каждая приведённая выше цифра основана на самоотчёте. Повторный прогон на текущих передовых моделях, поскольку набор для сравнения устарел на год, по собственному признанию лаборатории. И более масштабная человеческая оценка, чем четырнадцать вопросов от трёх исследователей — собственный блог Ai2 завершается аргументом, что области нужны оценки, выходящие за пределы поддержки цитирования, чтобы задаваться вопросом, сохраняет ли модель доказательный охват своих источников, включая то, не превращает ли она незаметно выводы, специфичные для конкретной выборки, в широкие обобщения. Это справедливая критика всей категории оценок, и она применима к этому релизу тоже.
Пока что практический вывод прост. Если вы создаёте отчёты со ссылками на литературу и хотите, чтобы генератор работал на вашем собственном оборудовании, под лицензией Apache-2.0 и с открытыми обучающими данными, AstaBrief 8B — самый целенаправленно созданный открытый вариант из всех, что кто-либо публиковал, и сокращение времени выполнения в 3,5 раза — причина его существования. Если ваша работа зависит от максимально качественного синтеза, учтите: в собственной таблице Ai2 DR-Tulu опережает по общей оценке предпочтений людей, а ScholarQA — по DeepScholarBench, и режим Thinking по-прежнему доступен в том же продукте именно по этой причине.
