Een hero-titelkaart voor 'AstaBrief 8B vs Qwen3-8B: wat een Ai2 Fine-Tune toevoegt aan zijn eigen basismodel', met vermelding van de gedeelde Qwen3-architectuur en de SQABench-CS2-gemiddelden van 87,0 versus 77,3, met het OrcaRouter-logo in de hoek.
Guides & Insights

AstaBrief 8B vs Qwen3-8B: Wat een Ai2-fijnafstelling toevoegt aan zijn eigen basismodel

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er is hier geen architectuurverhaal, en dat is juist het punt. AstaBrief 8B is een fine-tune van Qwen/Qwen3-8B, en de twee modellen delen een configuratie tot aan de laatste attention-head: Qwen3ForCausalLM, 36 lagen, hidden size 4096, 32 attention-heads met 8 key-value-heads, een vocabulaire van 151.936 tokens en een positieplafond van 40.960 tokens. Alles wat de release van Ai2 van 2026-10-02 onderscheidt van de basis uit april 2025, is post-training. De interessante vraag is daarom niet welke in het algemeen beter is — het is wat een specifieke, goed gefinancierde post-trainingrun je oplevert bovenop een basismodel dat je al gratis kunt downloaden, en wat het je in ruil daarvoor kost.

Het antwoord van Ai2 is een rapportschrijver die in ongeveer 51 seconden een geciteerde synthese met meerdere secties produceert, tegenover 178,5 seconden voor de door Claude aangedreven pijplijn die deze binnen het Asta-platform verving — ongeveer 3,5x sneller, waarbij Ai2 claimt dat de rapportkwaliteit op de metrieken die het volgde behouden bleef. Het antwoord van Qwen3-8B is een generalist met hybride denk- en niet-denkmodi, meer dan honderd talen en anderhalf jaar downstreamgebruik. Beide zijn Apache-2.0. De afweging is beperkte capaciteit plus snelheid tegenover brede capaciteit plus flexibiliteit, en de onderstaande data maken de vorm ervan redelijk concreet.

De architectuurrij is een no-op, dus de prompt is dat niet.

Omdat de checkpointgeometrie identiek is, gaan al je intuïties over serving rond Qwen3-8B ongewijzigd over naar AstaBrief 8B. Het is een dense 8B in BF16, het past op een 24GB-kaart, het draait op vLLM of Transformers zonder aangepaste kernels, en het erft het 40K-positieplafond van de basis — geen van beide modellen is een long-contextmodel, en het getrainde 32K-venster breidt met YaRN precies zo uit als de basis dat doet. Deploymentplanning voor de fine-tune is deploymentplanning voor de basis. Dat is het waard om ronduit te zeggen, want het geldt niet altijd voor fine-tunes, en het betekent dat het enige dat je evalueert gedrag is.

Gedrag is waar de lock-in huist. De kaart van AstaBrief bevat een vetgedrukte waarschuwing: het model is fine-tuned op één specifiek promptformaat, gepubliceerd als sft_prompt.txt in de dataset AstaBrief_prompts, en Ai2 zegt dat het gebruik van een ander prompt- of interactieformaat kan leiden tot verslechterd of inconsistent gedrag. Die prompt is geen informeel chatsjabloon. Lees het en je vindt een star contract — een query-slot tussen vierkante haken, een section_references-blok met citaten met een identifier als sleutel, expliciete citatiesyntaxis die vereist dat de referentiesleutel volgt op de zin die hij ondersteunt, een aangewezen markering voor modelkennis die niet met een andere bron mag worden gecombineerd, en een instructie om elke sectie te openen met een TLDR van twee zinnen. Qwen3-8B accepteert alles wat je typt. AstaBrief 8B is afgestemd op één vorm van input en zal minder goed presteren als je hem een andere voorlegt.

Wat 47.000 voorbeelden en 6.000 voorkeuren opleverden

De fine-tuning is volledig post-training, en het recept is bewust conventioneel: supervised fine-tuning gevolgd door offline direct preference optimization, geen reinforcement learning. Ai2 begon met echte query's die via zijn Asta-systeem waren ingediend, filterde 90.000 onderzoeksgerichte prompts op kwaliteit, relevantie en privacy, genereerde rapportdoelen met de meerstaps ScholarQA-pipeline met Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini en GPT-4.1, en behield 47.000 voorbeelden. De preferentiefase bouwde vervolgens ongeveer 6.000 paren, waarbij GPT-4.1 en DeepSeek-R1 als beoordelaars optraden en alleen paren waarover overeenstemming bestond, overbleven.

Gemeten op SQABench-CS2 — 100 door gebruikers geschreven onderzoeksvragen in de informatica — ten opzichte van het basismodel, dit is wat dat opleverde, waarbij elk cijfer door de leverancier is gerapporteerd en geen enkel onafhankelijk is gereproduceerd:

• Algemeen gemiddelde — AstaBrief 8B 87,0 vs Qwen3-8B 77,3, een winst van 9,7 punten.

• Herinnering aan ingrediënten — 90,2 vs 77,8.

• Citatienauwkeurigheid — 90,5 vs 76,2.

• Citatie-recall — 78,2 vs 64,6.

• Antwoordprecisie — 89,0 vs 90,6, een verlies van 1,6 punten ten opzichte van de basis.

De laatste rij is degene die de verwachtingen zou moeten vormgeven. Fijnafstemming op rapportkwaliteit verbeterde niet alles in gelijke mate; het ruilde een kleine hoeveelheid relevantie per alinea in voor grote winst in dekking en onderbouwing met citaten. Als jouw taak relevante alinea's boven alles beloont, is het basismodel niet duidelijk de slechtere keuze, en is de fijnafgestemde versie niet automatisch jouw antwoord.

Twee andere dingen die het geld niet opleverde. AstaBrief 8B heeft geen gerapporteerde score op DeepScholarBench die hoger is dan Ai2's eigen alternatieven — de 53,50 blijft achter bij Asta ScholarQA met 60,25 en DR-Tulu-8B met 56,26 — en de menselijke validatie bestaat uit veertien vragen van drie onderzoekers, waarop DR-Tulu de algehele voorkeur won. Een gespecialiseerd model kan het afleggen tegen een algemeen onderzoeksmodel op de eigen benchmark van de specialist, en Ai2 heeft dat gepubliceerd.

A two-column scoreboard headed 'AstaBrief 8B vs Qwen3-8B — the scoreboard'. The AstaBrief column reads 'identity: fine-tune of Qwen3-8B', 'job: cited report writing', 'context: 40K inherited', 'prompt: one fixed format', 'licence: Apache 2.0', 'evidence: vendor-reported SQA-CS2'; the Qwen column reads 'identity: the base model', 'job: generalist, thinking modes', 'context: 40K, YaRN to 131K', 'prompt: open', 'licence: Apache 2.0', 'evidence: 11M downloads, established'. A footer reads 'AstaBrief SQA-CS2 average 87.0 vs base 77.3 per Ai2; unreproduced.'

Wat de basis nog steeds beter doet

De vergelijking is niet eenzijdig, en de generalistische kant ervan is gemakkelijk te onderwaarderen.

Qwen3-8B wordt geleverd met hybride denk- en niet-denkmodi, dus het kan tokens besteden aan redeneren wanneer een probleem dat rechtvaardigt en direct antwoorden wanneer dat niet zo is. AstaBrief 8B is getraind voor het in één keer schrijven van rapporten en erft niets van dat doelbewuste redeneergedrag als producteigenschap. Qwen3-8B beschikt ook over de meertalige dekking van het basismodel — meer dan honderd talen — terwijl AstaBrief is getraind op een corpus dat expliciet is gefilterd op Engelse wetenschappelijke query's, dus zijn competentie buiten dat domein is onbekend in plaats van slechts ongetest.

Dan is er het instructieoppervlak. Een generalist is wat je wilt wanneer de taak volgende week verandert, wanneer je tool calling nodig hebt, wanneer het uitvoerschema het jouwe is in plaats van dat van Ai2, of wanneer je aan het prototypen bent en nog niet weet hoe de uiteindelijke prompt eruitziet. En wat de vraag naar de ruwe herkomst betreft — degene die ertoe doet wanneer iemand vraagt waarom je het model vertrouwt — Qwen3-8B heeft meer dan elf miljoen downloads en anderhalf jaar onafhankelijk gebruik achter de rug. AstaBrief 8B heeft een lanceringsweek achter de rug.

Wat AstaBrief 8B heeft dat het basismodel niet kan evenaren, is de citatiediscipline. Citatiesprecisie en -recall zijn de twee metrieken waar de voorsprong van de fine-tune het grootst is en het meest consistent met het trainingsverhaal — het sterkste enkele filter in Ai2's datapijplijn was citatiedichtheid, het aandeel uitspraken met ten minste één citatie, en het resulterende model weerspiegelt die prioriteit. Een generalist inline laten citeren in een vast sleutelformaat, betrouwbaar, zonder de onderbouwing voor claims te laten vallen, is prompt engineering die je zelf schrijft en onderhoudt. De fine-tune van Ai2 maakt dat tot het standaardgedrag van het model.

A screenshot of the Hugging Face model card for Qwen/Qwen3-8B showing the TextGeneration tag, the apache-2.0 licence line, the qwen3 tag, the 8B parameter size in BF16 and a downloads-last-month figure of 11,020,586.

De Qwen-lijn heeft zich sinds april 2025 verder ontwikkeld.

Nog een complicatie, en wel een praktische: Qwen3-8B is anderhalf jaar oud, en een nieuwe fine-tune ermee vergelijken is niet hetzelfde als die met een levensvatbare gevestigde speler vergelijken.

De Qwen-lijn loopt inmiddels via Qwen3.5, Qwen3.6, Qwen3.7 en Qwen3.8, en de huidige generatie is bereikbaar zonder iets te downloaden. Qwen3.8 27B is een live route in onze catalogus met een contextvenster van 262.144 tokens voor $0,33 per miljoen inputtokens en $2,40 per miljoen outputtokens; Qwen3.8 Flash heeft een venster van een miljoen tokens voor $0,15 en $0,47; Qwen3 VL 8B Instruct dekt de multimodale use case voor $0,18 en $0,70 per miljoen met een venster van 131.072 tokens en is sinds oktober 2025 gerouteerd. Qwen3-8B zelf is geen route die wij aanbieden, en AstaBrief 8B evenmin — beide zijn download-and-run-gewichten, en de eerlijke voorstelling van zaken is dat de basis op jouw hardware hoort en de moderne Qwen-generatie dat niet hoeft.

Dat geeft je een derde arm voor de evaluatie die Ai2 niet kon uitvoeren. Zet AstaBrief 8B op je eigen GPU, zet de Qwen3-8B-basis ernaast overeind om de gerapporteerde delta's te bevestigen, en richt dezelfde harness op een gehost Qwen3.8-model voor schaal. Alle drie de armen liggen op één endpoint afstand, wat dit een configuratieoefening maakt in plaats van een inkoopproject — één API voor meer dan 200 modellen, lijstprijs van de provider doorgegeven tegen 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag aan jouw kant live staat, automatische failover, en een routing-DSL als je wilt dat meerdere modellen samen één vraag beantwoorden. De zelfgehoste armen blijven zelfgehost vanwege de datagevoeligheid; alles wat gehost wordt blijft verwisselbaar, wat belangrijk is wanneer de volgende Qwen-generatie binnen een kwartaal uitkomt.

Hoe te beslissen

Kies AstaBrief 8B als je product literatuursynthese met citaties is en je wilt dat het citeergedrag de standaard van het model is in plaats van de verantwoordelijkheid van je prompt. De geometrie van het basismodel betekent nul verrassingen bij serving, de Apache-2.0-licentie en gepubliceerde SFT- en DPO-mengsels maken het auditeerbaar, en zijn voorsprong op citatieprecisie en -recall is het grootste en meest verklaarbare resultaat in de tabellen van Ai2.

Blijf bij Qwen3-8B, of stap over naar een actuele Qwen3.x, als je taken gevarieerd zijn, als je denkmodus of tools of meertalige dekking nodig hebt, als je de prompt nog aan het verkennen bent, of als je liever niet vastzit aan een instructieblok van zestienduizend tekens dat je niet zelf hebt geschreven. Het basismodel verloor op dekking en citatieonderbouwing, niet op relevantie, en het behield iets wat de fine-tune opgaf.

Wat vermeden moet worden, is het gemiddelde van 87,0 tegenover 77,3 te beschouwen als het hele verhaal. Ai2's eigen tabel laat zien dat de fine-tune antwoordprecisie inlevert om citatiediscipline te winnen, uit zijn eigen labnotities blijkt dat het grootste deel van de training en evaluatie in 2025 is afgerond en niet opnieuw is uitgevoerd tegen de huidige frontier, en het basismodel dat het verbetert, is niet langer de generatie die je voor iets anders dan deze vergelijking zou kiezen. Wat de fine-tune aantoonbaar toevoegt, is een vorm van output; of die vorm de beperktheid waard is, hangt volledig af van of die overeenkomt met de vorm van jouw product.