
AstaBrief 8B: Ai2:s Open Report Writer kör 3,5 gånger snabbare än pipelinen den ersätter
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 216 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Det mest framträdande numret i Ai2:s tillkännagivande av AstaBrief 8B är en tidtagaravläsning, inte en benchmarkpoäng: över hela Asta-pipelinen genererar den nya modellen en citerad forskningsrapport på i genomsnitt 51,1 sekunder, jämfört med 178,5 sekunder för den Claude-drivna vägen som den nu står bredvid. Det är cirka 3,5 gånger snabbare, och det kommer från ett enda arkitekturval — att skriva hela rapporten i ett svep i stället för att sammanfatta, klustra och sedan skriva avsnitt för avsnitt. AstaBrief 8B är en modell med öppna vikter på 8B, licensierad under Apache-2.0, finjusterad från Qwen3-8B, som tar en forskningsfråga plus hämtade litteraturutdrag och returnerar en rapport med citat i löptexten. Den släpptes i Ai2:s Asta-plattform som "Fast mode" den 2026-10-02, och vikterna, träningsdatan och ett exempel på ett lokalt arbetsflöde publicerades samma dag.
Repositoriet är äldre än tillkännagivandet, och det spelar roll
En detalj i den här utgåvan förtjänar att sägas rakt ut, eftersom den förändrar hur du bör läsa allt annat: Hugging Face-repositoriet på allenai/AstaBrief_8B har en intern skapelsetidsstämpel på 2026-02-09, och den medföljande DPO-datamängden är daterad till november 2025. Tillkännagivandet den 2 oktober är verkligt – blogginlägget, AI2-tweeten och modellkortet publicerades alla den dagen – men repositoriets historik är längre än nyhetscykeln antyder.
Det som hände den 2 oktober är att Ai2 släppte och dokumenterade saken, och uppdaterade repot för att matcha: tre commits landade på modellkortet mellan 16:18:06 och 16:18:20 UTC på releasedagen, vilket lade till en svarsmall i chattmallen och tog bort en no-op-token. Det är underhållsarbete på ett modellkort, inte en omträning. Ai2 säger också uttryckligen i bloggen att "merparten av den träning och utvärdering som beskrivs slutfördes 2025", och att de proprietära modeller som användes för att generera träningsdata och som jämförelsepunkter "speglar forskningsfronten vid den tidpunkten". Labbet säger att man inte har kört om den fullständiga utvärderingen mot dagens frontlinjemodeller.

Så det här är en GA-version av arbete som till stor del färdigställdes 2025 – en lansering, med en lanserings dokumentation och en lanserings plattformsintegration, ovanpå en checkpoint som har funnits i labbets konto i månader. Inget av det är oärligt, och modellen är ny för alla utanför Ai2. Men det innebär att jämförelsetalen nedan beskriver en frontlinje från 2025, och det säger Ai2 själva.
Vad AstaBrief 8B faktiskt gör
Ai2:s Asta-plattform har en rapportgenereringsfunktion där forskare kommer med en omfattande fråga och en samling litteratur och får tillbaka en citerad syntes som de behandlar som en arbetsartefakt. Den funktionen kördes tidigare helt och hållet på det som Ai2 kallar Thinking mode: en flerstegspipeline som sammanfattar hämtade utdrag, klustrar dem tematiskt och skriver svaret avsnitt för avsnitt, med stöd av Claude-modeller. Thinking mode är grundlig och långsam.
AstaBrief 8B är Fast-läget. Givet samma fråga och samma hämtade utdrag skriver den slutrapporten i en enda framåtpassning. Ai2:s påstående är det intressanta: att kringgå sammanfattning av utdrag, klustring och avsnitt-för-avsnitt-loopen försämrade inte rapportkvaliteten, åtminstone inte på de mått labbet följde. Modellen är inte en sökmotor och den hämtar inte – den är skribenten i slutet av en hämtningspipeline, och den förväntar sig att få bevisen.
Det gör den till en komponent snarare än en produkt. Det är också därför Ai2 släppte ett exempelarbetsflöde tillsammans med vikterna: ett litet bibliotek som omvandlar dina egna PDF-filer till rapporter, i kodförrådet ai2-scholarqa-lib, ger dig en utgångspunkt för lokal generering.
Träningsreceptet är medvetet tråkigt, och det är själva poängen.
Ai2:s eget tidigare arbete, DR Tulu, visade att förstärkningsinlärning kan förbättra genereringen av långa rapporter i modeller med öppna vikter. För AstaBrief övervägde teamet den vägen och valde att inte ta den, med motiveringen att RL är instabilt och dyrt och att de ville ha något som var lättare att felsöka. Det de byggde i stället är övervakad finjustering följt av offline direkt preferensoptimering. Två steg, båda konventionella.
SFT-steget utgick från riktiga frågor som skickats in via Ai2:s Asta-system i stället för syntetiska prompter. Från de insamlade loggarna filtrerade teamet för kvalitet, relevans och integritet — trafik från bottar och beta-testare togs bort, frågor som var för korta för att vara meningsfulla rensades bort, och en LLM-genomgång kördes för att fånga upp icke-engelska frågor, icke-vetenskapliga förfrågningar och personlig information. Det lämnade en pool på 90 000 forskningsinriktade frågor. Fullrapportsmålen för dessa frågor genererades med ScholarQA-pipelinen i flera steg, med Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini och GPT-4.1 som basmodeller. Efter kvalitetsfiltrering: 47 000 användbara träningsexempel.
DPO-steget behövde något annat — par av rapporter med en preferens mellan dem. En rapport per fråga kom från ScholarQA-pipelinen; den konkurrerande rapporten kom från att mata ScholarQA:s hämtade utdrag till en annan modell, vald bland o3, o4-mini, DeepSeek-V3 eller DeepSeek-R1. Två domare, GPT-4.1 och DeepSeek-R1, valde en vinnare för varje par, och endast par där båda domarna var eniga överlevde. Ai2 rapporterar 95 % överensstämmelse mellan LLM-domarna och mänskliga preferenser. Den slutliga preferensuppsättningen uppgick till ungefär 6 000 exempel. Både SFT-blandningen och DPO-blandningen finns på Hugging Face för inspektion.

Den mest överförbara insikten är också den minst glamorösa. Tidiga SFT-körningar skrev bättre rapporter men låg efter när det gällde svarsprecision och citeringskvalitet, så teamet testade fyra statistikbaserade filter på den syntetiska träningsdatan: förhållandet mellan output- och input-tokens, genomsnittlig hämtningsrelevans för citerade artiklar, citeringstäthet (andelen påståenden som har minst en citering) och citeringsmångfald. De starkaste vinsterna kom från att filtrera bort syntetiska rapporter med låg citeringstäthet — och mer aggressiv filtrering, filterkombinationer och svep av inlärningshastigheten gav inte några meningsfulla ytterligare vinster. Ai2:s slutsats är värd att bära med sig bortom den här modellen: specialisering handlade inte om att hälla mer vetenskaplig text i förträningen, utan om sammansättningen och kvaliteten på efterträningsdatan.
Resultattavlan som Ai2 publicerade, och hur man läser den

Alla siffror nedan är rapporterade av leverantören. De kommer från Ai2:s modellkort och blogg, framtagna av labbets eget utvärderingsramverk, och inget av dem har oberoende reproducerats. Det primära målet var SQABench-CS2, en uppsättning på 100 användarskrivna forskningsfrågor inom datavetenskap, som följdes upp med fyra mätvärden: ingrediensrecall (täckning av nödvändigt innehåll), svarsprecision (om varje stycke är relevant), citeringsprecision (om varje citering stöder sitt påstående) och citeringsrecall (om påståenden ges fullt stöd av de citeringar som angetts).
• Övergripande genomsnitt — AstaBrief 8B 87,0, dess egen SFT-checkpoint 83,7, basmodellen Qwen3-8B 77,3
• Ingrediensåterkallelse — AstaBrief 8B 90,2, SFT 85,2, Qwen3-8B 77,8
• Svarsprecision — AstaBrief 8B 89,0, SFT 90,4, Qwen3-8B 90,6
• Citatprecision — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2
• Citeringsåterkallelse — AstaBrief 8B 78,2, SFT 71,3, Qwen3-8B 64,6
Läser man raderna tillsammans framstår DPO-steget som riktat snarare än genomgående bättre. Medelvärdet totalt sett stiger, ingrediens-recall och båda citeringsmåtten ökar kraftigt, och svarsprecisionen hamnar marginellt under både SFT-checkpointen och basmodellen. Om ditt användningsfall framför allt handlar om relevans per stycke är finjusteringen inte automatiskt ditt svar.
I sekundära utvärderingar testade Ai2 den slutliga modellen mot sin egen ScholarQA-pipeline och mot DR-Tulu-8B. På SQABench-CS2 dev fick Asta ScholarQA 87,6, DR-Tulu-8B 86,5 och AstaBrief 8B 86,3; på testdelen fick ScholarQA 86,2, DR-Tulu-8B 88,8 och AstaBrief 87,0. På DeepScholarBench, ett benchmark för långformig syntes med 63 frågor, fick ScholarQA 60,25, DR-Tulu-8B 56,26 och AstaBrief 53,50 – den enda raden där den öppna rapportskrivaren ligger efter båda alternativen. I två LLM-bedömda parvisa jämförelser mot den Claude-drivna pipelinen vann AstaBrief 55 % av dev-jämförelserna och 72 % av testjämförelserna. En separat mänsklig studie omfattade endast 14 frågor från tre forskare, och vad gäller övergripande preferens vann DR-Tulu, även om två av de tre forskarna föredrog AstaBrief i citeringsnoggrannhet. Fjorton frågor från tre personer är en signal, inte ett avgörande, och Ai2 framställer det så.
Labbet publicerade också tidig användning från Asta-integrationen: bland 374 användare som provade Fast mode använde 29,1 % det under två eller fler dagar, användarna genererade i genomsnitt 3,67 rapporttrådar, 23 % bytte aldrig tillbaka till Thinking mode, och 18 % rörde sig mellan de två lägena beroende på uppgiften. Positiv feedback uppgick till 84,2 % för Fast mode mot 85,2 % för Thinking mode – tillräckligt nära för att Ai2 ska karakterisera feedbacken som alltför sparsam för att dra starka slutsatser av. Det är den ärliga framställningen, så behåll den.
Att köra det själv
AstaBrief 8B är Apache-2.0 och baserad på Qwen/Qwen3-8B, så den hamnar i singel-GPU-klassen snarare än datacenterklassen: en dense 8B-modell på Qwen3-arkitekturen, 36 lager, hidden size 4096, 32 attention-huvuden med 8 key-value-huvuden, en tokenvokabulär på 151 936 token och basens positionstak på 40 960 token. I BF16 ryms den med god marginal på ett 24 GB-kort, och kortets eget exempel använder vLLM med temperature 0,7, top-p 0,95 och en gräns för utdata på 4 096 token.
En operativ varning är tryckt i fetstil på modellkortet och är lätt att förbise: checkpointen finjusterades mot ett specifikt promptformat, publicerat som sft_prompt.txt i datasetet AstaBrief_prompts. Använder du ett annat prompt- eller interaktionsformat förväntar sig Ai2 försämrat eller inkonsekvent beteende. Om du utvärderar den här modellen med din egen testrigg och får dåliga resultat bör du kontrollera prompten innan du drar några slutsatser om vikterna.
Kortet är också uppriktigt om omfattningen. AstaBrief är avsett för forskning och utbildning, inte som en allmän assistent, och det finns ingen hostad inferensslutpunkt från Ai2 – du laddar ner det, eller så använder du det inuti Asta. Ingen leverantör i vår katalog tillhandahåller det, inte ens vi, så det finns ingen rutt att peka på; det ärliga sättet att använda det är på din egen hårdvara eller bakom din egen brandvägg, vilket är precis det argument Ai2 för fram för öppna vikter från början.
Var en router passar in i en rapportpipeline
AstaBrief upptar en plats i en längre kedja. Något hämtar litteraturen, något avgör vilka utdrag som är värda att föra vidare, och något kan bedöma eller verifiera den färdiga rapporten. Dessa anrop är vanliga anrop till hostade modeller, och de är den del av stacken där du faktiskt vill kunna välja bland leverantörer: ett API som täcker över 200 modeller, leverantörslistpris som vidarebefordras med 0 % påslag så att en leverantörs prissänkning syns på din faktura samma dag, automatisk failover om en leverantör försämras, och ett routing-DSL om du vill kombinera flera modeller i ett enda anrop. Hosta skrivmodulen själv eftersom det är delen med konsekvenser för datakänsligheten och en fast kostnad; routa orkestreringen eftersom det är delen där flexibilitet är värd mer än ägande.
Det finns också ett billigt experiment här. Ai2:s egen jämförelseuppsättning är Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini och GPT-4.1 – avsiktligt en 2025-frontlinje, och labbet säger att man inte har kört om den. Att ställa AstaBriefs utdata bredvid dagens hostade modeller på dina egna frågor är en enkel knapptryckning om båda armarna kan nås via samma endpoint, och det besvarar frågan som blogginlägget lämnar öppen.
Vad skulle förändra bilden
Tre saker skulle förvandla detta från en väldokumenterad lansering till ett fastställt resultat. En oberoende reproduktion av siffrorna från SQABench-CS2, eftersom varje siffra ovan är självrapporterad. En omkörning mot aktuella frontlinjemodeller, eftersom jämförelseunderlaget är ett år gammalt enligt labbets egen utsago. Och en större mänsklig utvärdering än fjorton frågor från tre forskare — Ai2:s egen blogg avslutas med argumentet att fältet behöver utvärderingar som går bortom citeringsstöd för att fråga om en modell bevarar bevisomfånget hos sina källor, inklusive om den i tysthet förvandlar urvalsspecifika resultat till breda generaliseringar. Det är en befogad kritik av hela utvärderingskategorin, och den gäller även denna utgåva.
För närvarande är den praktiska bedömningen enkel. Om du genererar citerade rapporter från litteratur och vill ha skrivaren på din egen hårdvara, under en Apache-2.0-licens, med öppen träningsdata, är AstaBrief 8B det mest direkt specialbyggda öppna alternativet som någon har publicerat, och minskningen av väggklockstiden med 3,5x är anledningen till att den finns. Om ditt arbete är beroende av den skarpaste möjliga syntesen, notera att Ai2:s egen tabell placerar DR-Tulu före vad gäller övergripande mänskliga preferenser och ScholarQA före på DeepScholarBench – och att Thinking-läget fortfarande finns där, i samma produkt, av just den anledningen.
