
AstaBrief 8B vs Qwen3-8B: Co fine-tuning Ai2 wnosi do własnego modelu bazowego
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 220 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Nie ma tu żadnej historii architektonicznej i to jest sedno. AstaBrief 8B to dostrojona wersja Qwen/Qwen3-8B, a oba modele mają identyczną konfigurację aż po ostatnią głowicę uwagi: Qwen3ForCausalLM, 36 warstw, wymiar ukryty 4096, 32 głowice uwagi z 8 głowicami klucz-wartość, słownik 151 936 tokenów i górny limit pozycji wynoszący 40 960 tokenów. Wszystko, co odróżnia wydanie Ai2 z 2026-10-02 od modelu bazowego z kwietnia 2025 r., to post-training. Ciekawe pytanie nie dotyczy więc tego, który model jest lepszy ogólnie — lecz tego, co konkretny, hojnie finansowany przebieg post-trainingu daje ci ponad model bazowy, który już możesz pobrać za darmo, i jaką cenę musisz w zamian zapłacić.
Odpowiedź Ai2 to generator raportów, który tworzy cytowaną syntezę wieloczęściową w około 51 sekund, w porównaniu z 178,5 sekundy dla opartego na Claude potoku, który zastąpił w platformie Asta — około 3,5 razy szybciej, przy czym Ai2 twierdzi, że jakość raportów utrzymała się na śledzonych metrykach. Odpowiedź Qwen3-8B to generalista z hybrydowymi trybami myślenia i niemyślenia, ponad setką języków oraz półtora rokiem użycia downstream. Oba są na licencji Apache-2.0. Kompromis to wąskie możliwości plus szybkość kontra szerokie możliwości plus elastyczność, a poniższe dane dość konkretnie pokazują jego kształt.
Wiersz architektury jest operacją pustą, więc prompt nie jest.
Ponieważ geometria checkpointu jest identyczna, każda intuicja dotycząca serwowania, którą masz w odniesieniu do Qwen3-8B, przenosi się bez zmian na AstaBrief 8B. To gęsty model 8B w BF16, mieści się na karcie 24GB, działa na vLLM lub Transformers bez niestandardowych kerneli i dziedziczy po modelu bazowym pułap pozycji 40K — żaden z modeli nie jest modelem długiego kontekstu, a wytrenowane okno 32K rozszerza się za pomocą YaRN dokładnie tak samo jak w modelu bazowym. Planowanie wdrożenia dla fine-tune'a to planowanie wdrożenia dla modelu bazowego. Warto powiedzieć to wprost, ponieważ nie zawsze jest to prawdą w przypadku fine-tune'ów, a to oznacza, że jedyne, co oceniasz, to zachowanie.
To w zachowaniu kryje się uzależnienie od konkretnego rozwiązania. Karta modelu AstaBrief zawiera ostrzeżenie pogrubioną czcionką: model dostrojono do jednego konkretnego formatu promptu, opublikowanego jako sft_prompt.txt w zbiorze danych AstaBrief_prompts, a Ai2 twierdzi, że użycie innego formatu promptu lub interakcji może prowadzić do pogorszonego lub niespójnego działania. Ten prompt nie jest zwykłym szablonem czatu. Przeczytaj go, a znajdziesz sztywny kontrakt — pole zapytania w nawiasach kwadratowych, blok section_references z cytatami indeksowanymi identyfikatorem, jawną składnię cytowania wymagającą, aby klucz referencyjny następował po zdaniu, które wspiera, wyznaczony znacznik wiedzy modelu, którego nie wolno łączyć z innym źródłem, oraz instrukcję otwierania każdej sekcji dwuzdaniowym TLDR. Qwen3-8B zaakceptuje wszystko, co wpiszesz. AstaBrief 8B jest dostrojony do jednego kształtu danych wejściowych i będzie działać słabiej, jeśli podasz mu inny.
Co kupiło 47 000 przykładów i 6 000 preferencji
Dostrajanie odbywa się w całości na etapie po treningu, a przepis jest celowo konwencjonalny: nadzorowane dostrajanie, po którym następuje offline’owa bezpośrednia optymalizacja preferencji, bez uczenia ze wzmocnieniem. Ai2 rozpoczęło od rzeczywistych zapytań przesłanych przez swój system Asta, odfiltrowało 90 000 promptów o charakterze badawczym pod kątem jakości, trafności i prywatności, wygenerowało docelowe raporty za pomocą wieloetapowego potoku ScholarQA, używając Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini i GPT-4.1, i zachowało 47 000 przykładów. Etap preferencji zbudował następnie około 6 000 par, przy czym oceniały GPT-4.1 i DeepSeek-R1, a przetrwały tylko pary, co do których obie strony się zgadzały.
Zmierzone na SQABench-CS2 — 100 pytań badawczych z informatyki napisanych przez użytkowników — w porównaniu z modelem bazowym, oto co to dało, przy czym każda liczba pochodzi od dostawcy i żadnej nie odtworzono niezależnie:
• Średnia ogólna — AstaBrief 8B 87,0 vs Qwen3-8B 77,3, wzrost o 9,7 punktu.
• Przypominanie składników — 90,2 vs 77,8.
• Precyzja cytowań — 90,5 vs 76,2.
• Pełność cytowań — 78,2 vs 64,6.
Precyzja odpowiedzi — 89,0 vs 90,6, spadek o 1,6 punktu względem bazy.
Ostatni wiersz jest tym, który powinien kształtować oczekiwania. Dostrajanie pod kątem jakości raportu nie poprawiło wszystkiego równomiernie; poświęciło nieco trafności poszczególnych akapitów w zamian za duże zyski w pokryciu i ugruntowaniu cytowań. Jeśli Twoje zadanie nagradza trafne akapity ponad wszystko, model bazowy nie jest oczywiście gorszym wyborem, a model dostrojony nie jest automatycznie Twoim rozwiązaniem.
Dwie inne rzeczy, których pieniądze nie kupiły. AstaBrief 8B nie ma żadnego raportowanego wyniku w DeepScholarBench powyżej własnych alternatyw Ai2 — jego 53,50 plasuje się za Asta ScholarQA z 60,25 i DR-Tulu-8B z 56,26 — a jego walidacja z udziałem ludzi to czternaście pytań od trzech badaczy, w której DR-Tulu zwyciężył pod względem ogólnej preferencji. Model specjalistyczny może przegrać z modelem badawczym ogólnego przeznaczenia na własnym benchmarku specjalisty, a Ai2 to opublikowało.

Co baza wciąż robi lepiej
To nie jest jedno porównanie, a stronę generalistyczną łatwo nie docenić.
Qwen3-8B jest dostarczany z hybrydowymi trybami myślenia i niemyślenia, więc może zużywać tokeny na rozumowanie, gdy problem tego wymaga, i odpowiadać bezpośrednio, gdy nie. AstaBrief 8B został wytrenowany do jednorazowego pisania raportów i nie dziedziczy żadnego z tych zachowań świadomego rozumowania jako cechy produktu. Qwen3-8B zachowuje również wielojęzyczne pokrycie modelu bazowego — ponad sto języków — podczas gdy AstaBrief został wytrenowany na korpusie jawnie filtrowanym pod kątem angielskich zapytań naukowych, więc jego kompetencje poza tą dziedziną są nieznane, a nie tylko niesprawdzone.
Jest jeszcze warstwa instrukcji. Generalista jest tym, czego chcesz, gdy zadanie zmieni się w przyszłym tygodniu, gdy potrzebujesz wywoływania narzędzi, gdy schemat wyjściowy należy do ciebie, a nie do Ai2, albo gdy prototypujesz i jeszcze nie wiesz, jak wygląda końcowy prompt. A jeśli chodzi o kwestię samego pochodzenia — tę, która ma znaczenie, gdy ktoś pyta, dlaczego ufasz modelowi — Qwen3-8B ma ponad jedenaście milionów pobrań i półtora roku niezależnego użytkowania. AstaBrief 8B ma za sobą tydzień od premiery.
Tym, czym AstaBrief 8B góruje nad bazą, jest dyscyplina cytowania. Precyzja i pełność cytowań to dwie metryki, w których przewaga dostrojonego modelu jest największa i najbardziej spójna z historią treningu — najsilniejszym pojedynczym filtrem w potoku danych Ai2 była gęstość cytowań, czyli udział stwierdzeń zawierających co najmniej jedno cytowanie, a powstały model odzwierciedla ten priorytet. Skłonienie generalisty do cytowania w treści w ustalonym formacie klucza — niezawodnie i bez utraty poparcia dla twierdzeń — to inżynieria promptów, którą sam piszesz i utrzymujesz. Dostrojenie Ai2 czyni to domyślnym zachowaniem modelu.

Linia Qwen posunęła się naprzód od kwietnia 2025
Jeszcze jedna komplikacja, i to praktyczna: Qwen3-8B ma już półtora roku, a porównywanie nowego fine-tune'u z nim to nie to samo, co porównywanie go z realnym, ugruntowanym rozwiązaniem.
Linia Qwen obejmuje teraz Qwen3.5, Qwen3.6, Qwen3.7 i Qwen3.8, a obecna generacja jest dostępna bez pobierania czegokolwiek. Qwen3.8 27B to aktywna trasa w naszym katalogu z oknem kontekstowym 262 144 tokenów w cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych; Qwen3.8 Flash oferuje okno miliona tokenów w cenie 0,15 i 0,47 USD; Qwen3 VL 8B Instruct obsługuje przypadek multimodalny w cenie 0,18 i 0,70 USD za milion, z oknem 131 072 tokenów, i jest trasowany od października 2025. Sam Qwen3-8B nie jest trasą, którą obsługujemy, podobnie jak AstaBrief 8B — oba to wagi do pobrania i uruchomienia lokalnie, a uczciwe ujęcie sprawy jest takie, że model bazowy należy umieścić na własnym sprzęcie, natomiast współczesna generacja Qwen nie musi.
To daje ci trzecie ramię do ewaluacji, której Ai2 nie było w stanie przeprowadzić. Umieść AstaBrief 8B na własnym GPU, ustaw obok niego bazowy Qwen3-8B, aby potwierdzić raportowane delty, i skieruj ten sam zestaw testowy na hostowany model Qwen3.8 w celu skalowania. Wszystkie trzy ramiona dzieli tylko jeden endpoint, co czyni to ćwiczeniem konfiguracyjnym, a nie projektem zakupowym — jedno API dla ponad 200 modeli, cena katalogowa dostawcy przekazywana z 0% narzutem, więc obniżka ceny dostawcy obowiązuje po twojej stronie tego samego dnia, automatyczne przełączanie awaryjne i DSL routingu, jeśli chcesz, aby kilka modeli wspólnie odpowiadało na jedno pytanie. Samodzielnie hostowane ramiona pozostają samodzielnie hostowane ze względu na wrażliwość danych; wszystko, co jest hostowane, pozostaje wymienne, co ma znaczenie, gdy następna generacja Qwen pojawi się w ciągu kwartału.
Jak podjąć decyzję
Wybierz AstaBrief 8B, jeśli Twój produkt zajmuje się syntezą cytowanej literatury i chcesz, aby zachowanie związane z cytowaniem było domyślnym zachowaniem modelu, a nie obowiązkiem Twojego promptu. Geometria modelu bazowego oznacza zero niespodzianek przy serwowaniu, licencja Apache-2.0 oraz opublikowane mieszanki SFT i DPO czynią go audytowalnym, a jego przewaga w zakresie precyzji i kompletności cytowań to największy i najłatwiejszy do wyjaśnienia wynik w tabelach Ai2.
Pozostań przy Qwen3-8B albo przejdź na aktualny Qwen3.x, jeśli Twoje zadania są zróżnicowane, jeśli potrzebujesz trybu myślenia, narzędzi lub obsługi wielu języków, jeśli wciąż eksplorujesz prompt albo wolisz nie być uwiązany do bloku instrukcji o długości szesnastu tysięcy znaków, którego nie napisałeś. Wersja bazowa przegrała pod względem pokrycia i ugruntowania cytowań, a nie trafności, i zachowała coś, z czego zrezygnował fine-tuning.
Rzeczą, której należy unikać, jest traktowanie średniej 87,0 kontra 77,3 jako pełnego obrazu. Własna tabela Ai2 pokazuje, że dostrajanie rezygnuje z precyzji odpowiedzi na rzecz dyscypliny cytowania, a własne notatki laboratoryjne Ai2 wskazują, że większość treningu i ewaluacji ukończono w 2025 r. i nie powtórzono ich w zestawieniu z obecną czołówką, a model bazowy, który ulepsza, nie jest już generacją, którą wybrałoby się do czegokolwiek poza tym porównaniem. To, co dostrajanie bezsprzecznie wnosi, to kształt wyników; czy ten kształt jest wart tego zawężenia, zależy wyłącznie od tego, czy pasuje do kształtu twojego produktu.
