
AstaBrief 8B vs Qwen3-8B: Vad en Ai2-finjustering tillför sin egen basmodell
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 220 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det finns ingen arkitekturhistoria här, och det är själva poängen. AstaBrief 8B är en finjustering av Qwen/Qwen3-8B, och de två modellerna delar en konfiguration ända ned till det sista attention-huvudet: Qwen3ForCausalLM, 36 lager, hidden size 4096, 32 attention-huvuden med 8 key-value-huvuden, ett ordförråd på 151 936 token och ett positionstak på 40 960 token. Allt som skiljer Ai2:s utgåva daterad 2026-10-02 från basmodellen från april 2025 är efterträning. Den intressanta frågan är därför inte vilken som är bättre i allmänhet – det är vad en specifik, välfinansierad efterträningskörning ger dig ovanpå en basmodell som du redan kan ladda ner gratis, och vad den kostar dig i gengäld.
Ai2:s svar är en rapportskrivare som producerar en citerad flersektionssyntes på cirka 51 sekunder, jämfört med 178,5 sekunder för den Claude-drivna pipeline som den ersatte inom Asta-plattformen — ungefär 3,5 gånger snabbare, med Ai2 som hävdar att rapportkvaliteten hölls på de mätvärden de följde. Qwen3-8B:s svar är en generalist med hybridtänkande och icke-tänkande lägen, över hundra språk och ett och ett halvt års nedströmsanvändning. Båda är Apache-2.0. Avvägningen är smal kapacitet plus hastighet mot bred kapacitet plus flexibilitet, och data nedan gör formen av det ganska konkret.
Arkitekturraden är en no-op, så prompten är det inte.
Eftersom checkpoint-geometrin är identisk överförs varje serveringsintuition du har om Qwen3-8B oförändrat till AstaBrief 8B. Det är en dense 8B i BF16, den får plats på ett 24 GB-kort, den serveras på vLLM eller Transformers utan anpassade kärnor, och den ärver basens 40K-positionstak — ingen av modellerna är en långkontextmodell, och det 32K-tränade fönstret utökas med YaRN precis som basen gör. Driftsättningsplanering för finjusteringen är driftsättningsplanering för basmodellen. Det är värt att säga rakt ut, eftersom det inte alltid gäller finjusteringar, och det betyder att det enda du utvärderar är beteende.
Beteendet är där inlåsningen sitter. AstaBriefs kort bär en varning i fetstil: modellen har finjusterats mot ett specifikt promptformat, publicerat som sft_prompt.txt i datasetet AstaBrief_prompts, och Ai2 säger att användning av ett annat prompt- eller interaktionsformat kan leda till försämrat eller inkonsekvent beteende. Den prompten är inte en ledig chattmall. Läs den och du finner ett stelt kontrakt – en hakparentesad frågeplats, ett section_references-block med citat nyckelade efter identifierare, explicit citeringssyntax som kräver att referensnyckeln följer meningen den stöder, en avsedd markör för modellkunskap som inte får kombineras med en annan källa, och en instruktion att inleda varje avsnitt med en tvåmeningars-TLDR. Qwen3-8B accepterar vad du än skriver. AstaBrief 8B är trimmad för en enda form av indata och kommer att prestera sämre om du ger den en annan.
Vad 47 000 exempel och 6 000 preferenser köpte
Finjusteringen är helt och hållet en efterträningsprocess, och receptet är medvetet konventionellt: övervakad finjustering följt av direkt preferensoptimering offline, ingen förstärkningsinlärning. Ai2 utgick från verkliga frågor som skickats in via sitt Asta-system, filtrerade 90 000 forskningsinriktade promptar utifrån kvalitet, relevans och sekretess, genererade rapportmål med den flerstegs ScholarQA-pipelinen med hjälp av Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini och GPT-4.1, och behöll 47 000 exempel. Preferenssteget byggde sedan ungefär 6 000 par, där GPT-4.1 och DeepSeek-R1 bedömde och endast par som båda var överens om behölls.
Mätt på SQABench-CS2 — 100 användarskrivna forskningsfrågor inom datavetenskap — mot basmodellen, här är vad det gav, med varje siffra rapporterad av leverantören och ingen av dem oberoende reproducerad:
• Totalt genomsnitt — AstaBrief 8B 87,0 mot Qwen3-8B 77,3, en ökning med 9,7 punkter.
• Ingrediensåterkallning — 90,2 vs 77,8.
• Citeringsprecision — 90,5 vs 76,2.
• Citeringsrecall — 78,2 mot 64,6.
• Svarsprecision — 89,0 vs 90,6, en förlust på 1,6 punkter mot basen.
Den sista raden är den som bör forma förväntningarna. Finjustering för rapportkvalitet förbättrade inte allt på ett enhetligt sätt; den bytte en liten mängd relevans per stycke mot stora vinster i täckning och citeringsförankring. Om din uppgift belönar relevanta stycken över allt annat är basmodellen inte uppenbart det sämre valet, och finjusteringen är inte automatiskt ditt svar.
Två andra saker som pengarna inte köpte. AstaBrief 8B har ingen rapporterad poäng på DeepScholarBench som ligger över Ai2:s egna alternativ – dess 53,50 ligger bakom Asta ScholarQA på 60,25 och DR-Tulu-8B på 56,26 – och dess mänskliga validering består av fjorton frågor från tre forskare, där DR-Tulu vann den övergripande preferensen. En specialistmodell kan förlora mot en generell forskningsmodell på specialistmodellens egen benchmark, och Ai2 publicerade det.

Vad basen gör bättre
Jämförelsen är inte enkelriktad, och det är lätt att underskatta generalistsidan av den.
Qwen3-8B levereras med hybridlägen för tänkande och icke-tänkande, så den kan lägga tokens på resonemang när ett problem motiverar det och svara direkt när det inte gör det. AstaBrief 8B tränades för rapportskrivning i ett svep och ärver inget av det där avsiktliga resonemangsbeteendet som produktfunktion. Qwen3-8B har också basmodellens flerspråkiga täckning – mer än hundra språk – medan AstaBrief tränades på en korpus som uttryckligen filtrerats till engelska vetenskapliga frågor, så dess kompetens utanför det spåret är okänd snarare än bara otestad.
Sedan har vi instruktionsytan. En generalist är vad du vill ha när uppgiften kommer att ändras nästa vecka, när du behöver verktygsanrop, när utdataschemat är ditt i stället för Ai2:s, eller när du prototypar och ännu inte vet hur den slutliga prompten ser ut. Och vad gäller den råa proveniensfrågan – den som spelar roll när någon frågar varför du litar på modellen – har Qwen3-8B haft fler än elva miljoner nedladdningar och ett och ett halvt års oberoende användning. AstaBrief 8B har haft en lanseringsvecka.
Det som AstaBrief 8B har som basmodellen inte kan matcha är citeringsdisciplinen. Citeringsprecision och citeringsrecall är de två mätvärden där finjusteringens försprång är störst och mest konsekvent med träningsberättelsen – det starkaste enskilda filtret i Ai2:s datapipeline var citattäthet, andelen påståenden som bär minst en citering, och den resulterande modellen återspeglar den prioriteringen. Att få en generalist att citera inline i ett fast nyckelformat, tillförlitligt, utan att tappa stöd för påståenden, är prompt engineering som du skriver och underhåller. Ai2:s finjustering gör det till modellens standardbeteende.

Qwen-serien har gått vidare sedan april 2025
Ytterligare en komplikation, och det är en praktisk sådan: Qwen3-8B är ett och ett halvt år gammal, och att jämföra en ny finjusterad modell med den är inte samma sak som att jämföra den med en livskraftig nuvarande modell.
Qwens serie omfattar nu Qwen3.5, Qwen3.6, Qwen3.7 och Qwen3.8, och den aktuella generationen är tillgänglig utan att ladda ner något. Qwen3.8 27B är en live-rutt i vår katalog med ett kontextfönster på 262 144 token till $0,33 per miljon indata-token och $2,40 per miljon utdata-token; Qwen3.8 Flash har ett fönster på en miljon token till $0,15 och $0,47; Qwen3 VL 8B Instruct täcker det multimodala fallet till $0,18 och $0,70 per miljon med ett kontextfönster på 131 072 token och har varit tillgänglig som rutt sedan oktober 2025. Qwen3-8B är i sig inte en rutt som vi tillhandahåller, och inte heller AstaBrief 8B – båda är vikter för nedladdning och körning, och den ärliga formuleringen är att basen hör hemma på din hårdvara och att den moderna Qwen-generationen inte behöver göra det.
Det ger dig en tredje arm för utvärderingen som Ai2 inte kunde köra. Kör AstaBrief 8B på din egen GPU, ställ upp Qwen3-8B-basen bredvid den för att bekräfta de rapporterade deltana, och rikta samma testrigg mot en hostad Qwen3.8-modell för skalning. Alla tre armarna är bara en slutpunkt bort, vilket är det som gör detta till en konfigurationsövning snarare än ett upphandlingsprojekt — ett API över 200+ modeller, leverantörens listpris som förs vidare med 0 % påslag så att en leverantörsprissänkning slår igenom hos dig samma dag, automatisk failover, och ett routing-DSL om du vill att flera modeller ska svara på en fråga tillsammans. De självhostade armarna förblir självhostade av datakänslighetsskäl; allt som är hostat förblir utbytbart, vilket spelar roll när nästa Qwen-generation släpps inom ett kvartal.
Hur man bestämmer
Välj AstaBrief 8B om din produkt är citerad litteratursyntes och du vill att citeringsbeteendet ska vara modellens standard i stället för din prompts ansvar. Basmodellens geometri innebär noll överraskningar vid serving, Apache-2.0-licensen och de publicerade SFT- och DPO-mixarna gör den granskningsbar, och dess försprång inom citeringsprecision och recall är det största och mest förklaringsbara resultatet i Ai2:s tabeller.
Håll dig kvar på Qwen3-8B, eller gå över till en aktuell Qwen3.x, om dina uppgifter är varierade, om du behöver tänkandeläge eller verktyg eller flerspråkig täckning, om du fortfarande utforskar prompten, eller om du helst inte vill vara låst vid ett instruktionsblock på sextontusen tecken som du inte har skrivit. Basmodellen förlorade på täckning och citeringsförankring, inte på relevans, och den behöll något som finjusteringen gav upp.
Det man bör undvika är att behandla genomsnittet 87,0 mot 77,3 som hela historien. Ai2:s egen tabell visar att finjusteringen offrar svarsprecision för att vinna citeringsdisciplin; dess eget labb noterar att större delen av träningen och utvärderingen slutfördes 2025 och inte har körts om mot den nuvarande frontlinjen; och basmodellen som den förbättrar är inte längre den generation man skulle välja för något annat än den här jämförelsen. Vad finjusteringen bevisligen tillför är en form på utdata; om den formen är värd snävheten beror helt och hållet på om den matchar formen på din produkt.
