Karta tytułowa typu hero dla artykułu „AstaBrief 8B: Otwarty generator raportów Ai2 działa 3,5 razy szybciej niż zastępowany przez niego potok”, oznaczona czasem 51,1 s w porównaniu z 178,5 s, licencją Apache-2.0 i bazą Qwen3-8B, z logo OrcaRouter w rogu.
Guides & Insights

AstaBrief 8B: otwarty generator raportów od Ai2 działa 3,5 razy szybciej niż zastępowany przez niego potok

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najważniejsza liczba z ogłoszenia Ai2 o AstaBrief 8B to odczyt ze stopera, a nie wynik benchmarku: w całym potoku Asta nowy model generuje raport badawczy z cytowaniami średnio w 51,1 sekundy, wobec 178,5 sekundy w przypadku ścieżki opartej na Claude, obok której teraz funkcjonuje. To około 3,5 razy szybciej, a wynika to z jednej decyzji architektonicznej — napisać cały raport w jednym przebiegu zamiast streszczać, klastrować, a następnie pisać sekcja po sekcji. AstaBrief 8B to model o otwartych wagach o rozmiarze 8B, na licencji Apache-2.0, dostrojony z Qwen3-8B, który przyjmuje pytanie badawcze wraz z pobranymi fragmentami literatury i zwraca raport z cytowaniami w tekście. Został wdrożony do platformy Asta firmy Ai2 jako „Fast mode” w dniu 2026-10-02, a wagi, dane treningowe i przykładowy lokalny przepływ pracy zostały publicznie udostępnione tego samego dnia.

Repozytorium jest starsze niż ogłoszenie i to ma znaczenie.

Jeden szczegół w tym wydaniu warto powiedzieć wprost, ponieważ zmienia sposób, w jaki należy czytać wszystko inne: repozytorium Hugging Face pod adresem allenai/AstaBrief_8B ma wewnętrzny znacznik czasu utworzenia 2026-02-09, a towarzyszący zestaw danych DPO pochodzi z listopada 2025. Ogłoszenie z 2 października jest prawdziwe — wpis na blogu, tweet AI2 i karta modelu pojawiły się tego dnia — ale historia repozytorium jest dłuższa, niż sugeruje cykl informacyjny.

To, co się stało 2 października, polegało na tym, że Ai2 wydało i udokumentowało tę rzecz oraz zmodyfikowało repozytorium, aby było zgodne: trzy commity trafiły do karty modelu między 16:18:06 a 16:18:20 UTC w dniu premiery, dodając szablon odpowiedzi do szablonu czatu i usuwając token no-op. To prace porządkowe na karcie, a nie ponowne trenowanie. Ai2 wyraźnie stwierdza też na blogu, że „większość opisanego trenowania i ewaluacji ukończono w 2025 r.” oraz że modele własnościowe wykorzystane do generowania danych treningowych i jako punkty porównawcze „odzwierciedlają ówczesny frontier”. Laboratorium twierdzi, że nie powtórzyło pełnej ewaluacji względem dzisiejszych modeli frontier.

A screenshot of the Ai2 blog post 'Open-sourcing AstaBrief, the fast report-generation model in Asta', dated October 2, 2026, showing the opening paragraphs about grounding scientific answers in evidence.

To więc wydanie GA pracy, która w dużej mierze została ukończona w 2025 roku — premiera, z dokumentacją premiery i integracją platformową premiery, na bazie checkpointu, który istnieje na koncie laboratorium od miesięcy. Nie ma w tym nic nieuczciwego, a model jest nowy dla wszystkich spoza Ai2. Oznacza to jednak, że liczby porównawcze poniżej opisują czołówkę z 2025 roku, i samo Ai2 to przyznaje.

Co tak naprawdę robi AstaBrief 8B

Platforma Asta firmy Ai2 ma funkcję generowania raportów, w której badacze wnoszą istotne pytanie i zbiór literatury, a w zamian otrzymują cytowaną syntezę, którą traktują jako dokument roboczy. Ta funkcja działała wcześniej w całości w oparciu o to, co Ai2 nazywa trybem Thinking: wieloetapowy potok, który podsumowuje pobrane fragmenty, grupuje je tematycznie i pisze odpowiedź sekcja po sekcji, wspierany przez modele Claude. Tryb Thinking jest gruntowny i wolny.

AstaBrief 8B to tryb Fast. Przy tym samym pytaniu i tych samych pobranych fragmentach tworzy raport końcowy w jednym przebiegu w przód. Najciekawsze jest twierdzenie Ai2: pominięcie streszczania fragmentów, grupowania i pętli sekcja po sekcji nie obniżyło jakości raportu, przynajmniej pod względem miar, które śledziło laboratorium. Model nie jest wyszukiwarką i nie wyszukuje — jest twórcą tekstu na końcu potoku wyszukiwania i oczekuje, że otrzyma dowody.

To sprawia, że jest to komponent, a nie produkt. To także powód, dla którego Ai2 udostępniło przykładowy workflow wraz z wagami: mała biblioteka, która zamienia Twoje własne pliki PDF w raporty, w repozytorium ai2-scholarqa-lib, daje Ci punkt wyjścia do lokalnego generowania.

Przepis treningowy jest celowo nudny i właśnie o to chodzi

Wcześniejsza praca samego Ai2, DR Tulu, pokazała, że uczenie ze wzmocnieniem może poprawić generowanie długich raportów w modelach z otwartymi wagami. W przypadku AstaBrief zespół rozważał tę ścieżkę i zdecydował się z niej nie korzystać, argumentując, że RL jest niestabilne i kosztowne, a chciał czegoś łatwiejszego do debugowania. Zamiast tego zbudowali dostrajanie nadzorowane, po którym następuje bezpośrednia optymalizacja preferencji w trybie offline. Dwa etapy, oba konwencjonalne.

Etap SFT rozpoczął się od rzeczywistych zapytań przesłanych przez system Asta firmy Ai2, a nie od syntetycznych promptów. Z zebranych logów zespół odfiltrował dane pod kątem jakości, trafności i prywatności — usuwając ruch botów i beta-testerów, odrzucając zapytania zbyt krótkie, by były znaczące, oraz uruchamiając przebieg LLM w celu wychwycenia zapytań nieangielskich, próśb nienaukowych i promptów zawierających dane osobowe. Pozostała pula 90 000 zapytań związanych z badaniami. Cele pełnych raportów dla tych zapytań wygenerowano za pomocą wieloetapowego potoku ScholarQA, używając Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini i GPT-4.1 jako modeli bazowych. Po filtrowaniu jakości: 47 000 użytecznych przykładów treningowych.

Etap DPO wymagał czegoś innego — par raportów z preferencją między nimi. Jeden raport na zapytanie pochodził z potoku ScholarQA; konkurencyjny raport powstał w wyniku podania pobranych fragmentów ScholarQA do innego modelu, wybranego spośród o3, o4-mini, DeepSeek-V3 lub DeepSeek-R1. Dwóch sędziów, GPT-4.1 i DeepSeek-R1, wybrało zwycięzcę dla każdej pary, a przetrwały tylko pary, w których obaj sędziowie się zgodzili. Ai2 podaje 95% zgodności między sędziami LLM a ludzkimi preferencjami. Ostateczny zestaw preferencji liczył około 6000 przykładów. Zarówno mieszanka SFT, jak i mieszanka DPO są dostępne na Hugging Face do wglądu.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration and PyTorch tags, the apache-2.0 licence line, the qwen3 and deep-research tags, the Ai2 organisation badge and the start of the model card text about supervised fine-tuning and offline DPO.

Najbardziej uniwersalne odkrycie jest zarazem najmniej spektakularne. Wczesne przebiegi SFT pisały lepsze raporty, ale pozostawały w tyle pod względem precyzji odpowiedzi i jakości cytowań, więc zespół przetestował cztery filtry statystyczne na syntetycznych danych treningowych: stosunek tokenów wyjściowych do wejściowych, średnią trafność wyszukiwania cytowanych prac, gęstość cytowań (odsetek stwierdzeń zawierających co najmniej jedno cytowanie) oraz różnorodność cytowań. Największe korzyści przyniosło odfiltrowanie syntetycznych raportów o niskiej gęstości cytowań — a bardziej agresywne filtrowanie, łączenie filtrów i przeszukiwania współczynnika uczenia nie dodały znaczących korzyści. Wniosek Ai2 warto przenieść poza ten model: specjalizacja nie polegała na wtłaczaniu większej ilości tekstu naukowego do pretreningu, lecz na składzie i jakości danych po treningu.

Tabela wyników opublikowana przez Ai2 i jak ją odczytać

A screenshot of the Hugging Face dataset page for allenai/AstaBrief_DPO_Mix showing the cc-by-nc-4.0 licence, the json format tag and the dataset viewer with a 6.62k-row train split and prompt, chosen and rejected columns.

Wszystkie poniższe liczby pochodzą od dostawcy. Pochodzą z karty modelu i bloga Ai2; wygenerowano je za pomocą własnego środowiska ewaluacyjnego laboratorium, a żadnej z nich nie odtworzono niezależnie. Głównym celem był SQABench-CS2, zbiór 100 napisanych przez użytkowników pytań badawczych z informatyki, śledzony za pomocą czterech metryk: pełności składników (pokrycie niezbędnej treści), precyzji odpowiedzi (czy każdy akapit jest istotny), precyzji cytowań (czy każde cytowanie potwierdza swoje twierdzenie) i pełności cytowań (czy twierdzenia są w pełni poparte podanymi cytowaniami).

• Średnia ogólna — AstaBrief 8B 87,0, jego własny checkpoint SFT 83,7, bazowy Qwen3-8B 77,3

• Odtwarzanie składników — AstaBrief 8B 90,2, SFT 85,2, Qwen3-8B 77,8

• Precyzja odpowiedzi — AstaBrief 8B 89.0, SFT 90.4, Qwen3-8B 90.6

• Precyzja cytowania — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2

• Pełność cytowań — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6

Przeczytaj wiersze razem, a etap DPO wygląda na ukierunkowany, a nie jednolicie lepszy. Ogólna średnia rośnie, kompletność składników i obie metryki cytowań rosną gwałtownie, a precyzja odpowiedzi spada nieznacznie poniżej zarówno punktu kontrolnego SFT, jak i modelu bazowego. Jeśli w Twoim przypadku użycia najważniejsza jest trafność na akapit, dostrojony model nie jest automatycznie Twoim rozwiązaniem.

W dodatkowych ocenach Ai2 przetestował ostateczny model względem własnego potoku ScholarQA oraz względem DR-Tulu-8B. Na SQABench-CS2 dev, Asta ScholarQA uzyskał 87,6, DR-Tulu-8B 86,5, a AstaBrief 8B 86,3; na zbiorze testowym ScholarQA 86,2, DR-Tulu-8B 88,8, AstaBrief 87,0. Na DeepScholarBench, benchmarku syntezy długich form zawierającym 63 zapytania, ScholarQA uzyskał 60,25, DR-Tulu-8B 56,26, a AstaBrief 53,50 — jedyny wiersz, w którym otwarty generator raportów ustępuje obu alternatywom. W dwóch porównaniach parami ocenianych przez LLM z potokiem opartym na Claude, AstaBrief zdobył 55% porównań dev i 72% porównań testowych. Osobne badanie z udziałem ludzi objęło tylko 14 pytań od trzech badaczy, a w ogólnych preferencjach wygrał DR-Tulu, choć dwóch z trzech badaczy preferowało AstaBrief pod względem dokładności cytowań. Czternaście pytań od trzech osób to sygnał, a nie werdykt, i Ai2 tak to przedstawia.

Laboratorium opublikowało także wczesne dane dotyczące użytkowania z integracji Asta: spośród 374 użytkowników, którzy wypróbowali Fast mode, 29,1% używało go przez dwa lub więcej dni, użytkownicy generowali średnio 3,67 wątku raportów, 23% nigdy nie wróciło do Thinking mode, a 18% przełączało się między tymi dwoma trybami w zależności od zadania. Pozytywne opinie sięgnęły 84,2% dla Fast mode wobec 85,2% dla Thinking mode — na tyle blisko, że Ai2 określa te opinie jako zbyt skąpe, by wyciągać z nich mocne wnioski. To uczciwe ujęcie, więc je zachowaj.

Uruchomienie go samodzielnie

AstaBrief 8B jest objęty licencją Apache-2.0 i bazuje na Qwen/Qwen3-8B, więc trafia do klasy pojedynczego GPU, a nie do klasy centrów danych: gęsty model 8B na architekturze Qwen3, 36 warstw, rozmiar ukryty 4096, 32 głowice uwagi z 8 głowicami klucz-wartość, słownik 151 936 tokenów i bazowy limit pozycji 40 960 tokenów. W BF16 mieści się bez problemu na karcie 24 GB, a przykład samej karty używa vLLM z temperaturą 0,7, top-p 0,95 i limitem wyjścia 4096 tokenów.

Jedno ostrzeżenie operacyjne jest pogrubione na karcie modelu i łatwo je przeoczyć: punkt kontrolny został dostrojony do jednego konkretnego formatu promptu, opublikowanego jako sft_prompt.txt w zbiorze danych AstaBrief_prompts. Użyj innego formatu promptu lub interakcji, a Ai2 spodziewa się pogorszonego lub niespójnego działania. Jeśli oceniasz ten model za pomocą własnego harnessu i uzyskujesz słabe wyniki, sprawdź prompt, zanim wyciągniesz jakiekolwiek wnioski dotyczące wag.

Karta jest również szczera co do zakresu. AstaBrief jest przeznaczony do badań i celów edukacyjnych, a nie jako asystent ogólnego przeznaczenia, i Ai2 nie udostępnia hostowanego punktu końcowego wnioskowania — pobierasz go samodzielnie albo używasz go w Asta. Żaden dostawca w naszym katalogu go nie obsługuje, w tym my, więc nie ma trasy, na którą można by wskazać; uczciwym sposobem korzystania z niego jest własny sprzęt lub własna zapora sieciowa, co jest dokładnie argumentem, który Ai2 od początku wysuwa na rzecz otwartych wag.

Gdzie router wpasowuje się w potok raportów

AstaBrief zajmuje jedno miejsce w dłuższym łańcuchu. Coś pobiera literaturę, coś decyduje, które fragmenty warto przekazać dalej, a coś może oceniać lub weryfikować gotowy raport. Te wywołania to zwykłe wywołania modeli hostowanych i to właśnie ta część stosu, w której naprawdę chcesz mieć wybór dostawców: jedno API obejmujące ponad 200 modeli, cena katalogowa dostawcy przekazywana dalej z 0% narzutu, dzięki czemu obniżka ceny dostawcy pojawia się na Twoim rachunku tego samego dnia, automatyczne przełączanie awaryjne, jeśli dostawca zacznie działać gorzej, oraz DSL routingu, jeśli chcesz połączyć kilka modeli w jedno wywołanie. Samodzielnie hostuj moduł piszący, bo to ta część, która wiąże się z kwestiami wrażliwości danych i ze stałym kosztem; orkiestrację przekaż do routingu, bo to ta część, w której elastyczność jest warta więcej niż własność.

Jest tu też niedrogi eksperyment. Własny zestaw porównawczy Ai2 to Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini i GPT-4.1 — celowo czołówka z 2025 roku — a laboratorium twierdzi, że nie powtórzyło tego testu. Postawienie wyników AstaBrief obok dzisiejszych hostowanych modeli na własnych pytaniach to ćwiczenie na jedno naciśnięcie klawisza, jeśli oba ramiona są osiągalne przez ten sam endpoint, i odpowiada na pytanie, które wpis na blogu pozostawia otwarte.

Co zmieniłoby obraz sytuacji

Trzy rzeczy zmieniłyby to z dobrze udokumentowanej premiery w ustalony wynik. Niezależne odtworzenie wyników liczbowych SQABench-CS2, ponieważ każda z powyższych liczb pochodzi z samodzielnego raportowania. Ponowne uruchomienie testu na obecnych modelach czołowych, ponieważ zestaw porównawczy jest o rok nieaktualny, co przyznaje samo laboratorium. I większa ewaluacja z udziałem ludzi niż czternaście pytań od trzech badaczy — własny blog Ai2 kończy się argumentem, że dziedzina potrzebuje ewaluacji wykraczających poza samo poparcie cytowaniami, by pytać, czy model zachowuje zakres dowodowy swoich źródeł, w tym czy po cichu nie zamienia ustaleń dotyczących konkretnej próby w szerokie uogólnienia. To słuszna krytyka całej kategorii ewaluacji i dotyczy również tego wydania.

Na razie praktyczny wniosek jest prosty. Jeśli generujesz raporty z cytowaniami na podstawie literatury i chcesz mieć model piszący na własnym sprzęcie, na licencji Apache-2.0, z otwartymi danymi treningowymi, AstaBrief 8B jest najbardziej bezpośrednio w tym celu zbudowaną otwartą opcją, jaką ktokolwiek opublikował, a 3,5-krotne skrócenie czasu zegarowego to powód, dla którego istnieje. Jeśli Twoja praca zależy od najostrzejszej możliwej syntezy, pamiętaj, że własna tabela Ai2 stawia DR-Tulu wyżej pod względem ogólnych preferencji ludzi, a ScholarQA wyżej w DeepScholarBench — i że tryb Thinking nadal tam jest, w tym samym produkcie, właśnie z tego powodu.