Een hero-titelkaart voor 'AstaBrief 8B vs Gemma 4 12B: Een gespecialiseerde schrijver tegenover een generalist die alles doet', waarin de op één taak gerichte rapportschrijver wordt gecontrasteerd met de 11,95B multimodale generalist, met het OrcaRouter-logo in de hoek.
Guides & Insights

AstaBrief 8B vs Gemma 4 12B: Een gespecialiseerde schrijver tegenover een generalist die alles doet

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

AstaBrief 8B en Gemma 4 12B zitten in dezelfde grootteklasse en hebben dezelfde licentie, en daarbuiten zijn het antwoorden op verschillende vragen. AstaBrief 8B is het 8B open-weights-model van Ai2, uitgebracht op 2026-10-02 en fine-tuned op basis van Qwen3-8B, dat één ding doet: een onderzoeksvraag en opgehaalde literatuurfragmenten omzetten in een rapport met bronvermelding, in één doorgang, in ongeveer 51 seconden van begin tot eind. Gemma 4 12B is het uniforme multimodale model van DeepMind met 11,95 miljard parameters, een Apache-2.0-generalist die tekst, afbeeldingen, audio en video native ondersteunt en 256.000 tokens context aankan. De ene is een scalpel die één taak sneller doet dan de algemene pijplijn die erdoor werd vervangen; de andere is de hele gereedschapskist, op het apparaat.

De verleiding is om de specialist als beter in zijn taak te bestempelen en verder te gaan. De nuttigere vraag, als je op één consumenten-GPU uitrolt, is of het voordeel van het smalle model groot genoeg is om twee stacks in plaats van één te draaien — en het antwoord hangt af van cijfers die geen van beide labs onafhankelijk heeft laten verifiëren.

De delen die daadwerkelijk overlappen

Beide zijn dense open-weightmodellen die op één enkele kaart passen, beide zijn Apache-2.0 en beide zijn te downloaden in plaats van achter een API te zitten. Dat is echte overlap, en dat is de reden dat de vergelijking überhaupt de moeite waard is.

Daarbuiten is de divergentie totaal, en twee rijen doen het meeste werk.

• Parameters — AstaBrief 8B: ongeveer 8B dense, BF16-gewichten in de single-GPU-klasse. Gemma 4 12B: 11,95B dense, encoder-vrije uniforme architectuur.

• Modaliteiten in — AstaBrief 8B: alleen tekst, en specifiek een vraag plus fragmenten. Gemma 4 12B: tekst, afbeelding, audio en video, waarbij audio en visie rechtstreeks via lichtgewicht lineaire lagen in de embeddingruimte van de decoder worden geprojecteerd in plaats van via afzonderlijke encoders.

• Uitvoermodaliteiten — Beide: tekst. AstaBrief 8B genereert een rapport met bronvermeldingen; Gemma 4 12B genereert platte tekst in welke vorm je er ook om vraagt.

• Context — AstaBrief 8B: het positieplafond van 40.960 tokens van het basismodel, getraind op 32K. Gemma 4 12B: 256.000 tokens, met een hybride attention-schema dat lokale sliding-window-attention (venster van 1024 tokens) afwisselt met globale attention, en proportionele RoPE op de globale lagen om het lang-contextgeheugen in toom te houden.

• Training — AstaBrief 8B: gesuperviseerde fine-tuning op 47K rapportvoorbeelden, daarna ongeveer 6K DPO-paren, op acht H100's. Gemma 4 12B: algemene pretraining plus instructietuning van Google DeepMind, gedocumenteerd in een technisch rapport.

• Taak — AstaBrief 8B: één taak, het genereren van rapporten met bronvermeldingen. Gemma 4 12B: redeneren, programmeren, agentische workflows, meertalige chat in meer dan 140 talen.

• Onafhankelijke scores — Geen enkele voor AstaBrief 8B buiten Ai2's eigen tabellen. Gemma 4 12B staat op openbare leaderboards, waaronder Artificial Analysis, waar de releasefamilie wordt gescoord; dat zijn cijfers van derden en de enige in dit artikel die niet door een leverancier zijn aangeleverd.

Lees de contextrij als het structurele verschil, niet als een specificatiepunt. Het 40K-plafond van AstaBrief 8B is geen beperking waar Ai2 omheen werkt; het is een gevolg van het ontwerp. Het model bevat nooit een corpus, alleen fragmenten die iemand anders heeft geselecteerd en in omvang heeft bepaald. Het 256K-venster van Gemma 4 12B betekent dat dezelfde taak helemaal zonder retrievallaag kan worden aangepakt — plak een grote hoeveelheid materiaal en stel je vraag — wat een werkelijk andere architectuur is voor dezelfde uitkomst, en een die twee systemen tot één samenvouwt.

Waar de specialist wint, en met hoeveel

Het argument van Ai2 voor AstaBrief draait om de klok, en het is een goed argument. De op Claude gebaseerde Thinking-pijplijn ervan kwam gemiddeld uit op 178,5 seconden per rapport; AstaBrief, dat het hele rapport in één enkele doorgang schrijft, komt gemiddeld uit op 51,1 seconden, ongeveer 3,5x sneller, en Ai2 beweert dat de vereenvoudiging niet ten koste ging van de kwaliteit op de metrics die het bijhoudt.

Het bedrijf dat hier van belang is, is niet Claude. Het is de meerstaps-scaffolding zelf — het samenvatten van snippets, thematische clustering en het per sectie schrijven — die AstaBrief allemaal verwijdert. En die scaffolding is hetzelfde werk dat je anders bovenop elke generalist zou moeten bouwen, Gemma 4 12B inbegrepen, als je er een gestructureerd rapport met citaten uit wilde halen. Een generalist die om "een rapport met citaten" wordt gevraagd, produceert er wel een; hem zover krijgen dat hij er een volgens een vast schema produceert, met citatiecodes die overeenkomen met de bronnenlijst, is prompt engineering die je zelf bezit en onderhoudt.

De kwaliteitsclaim is waar je vaart moet minderen.

• SQABench-CS2-gemiddelde, test-split (door leverancier gerapporteerd) — AstaBrief 8B 87,0, zijn eigen SFT-checkpoint 83,7, basis-Qwen3-8B 77,3. 100 door gebruikers geschreven informaticavragen.

• DeepScholarBench (volgens opgave van de leverancier) — AstaBrief 8B 53,50, achter Ai2's eigen Asta ScholarQA met 60,25 en DR-Tulu-8B met 56,26.

• Paarsgewijze vergelijking met Ai2's door Claude aangedreven pipeline (volgens opgave van de leverancier) — 55% winst op de dev-split, 72% op test.

• Humane studie (door leverancier gerapporteerd) — 14 vragen van drie onderzoekers, DR-Tulu kreeg over het algemeen de voorkeur, waarbij twee van de drie de citatienauwkeurigheid van AstaBrief aanhaalden.

Er bestaat geen gelijkwaardige score voor Gemma 4 12B op SQABench-CS2, in geen van beide richtingen. Dat ontbreken is de eerlijke kern van deze vergelijking: je kunt geen cijfer plakken op de rapportkwaliteit van Gemma 4 12B tegenover die van AstaBrief 8B, omdat niemand de generalist door het testharnas van Ai2 heeft gehaald en niemand doet alsof. Iedereen die je vertelt dat de specialist "26 punten beter" is, vergelijkt een leverancierscijfer met niets.

A screenshot of the Hugging Face model card for google/gemma-4-12B-it showing the 'Any-to-Any' pipeline tag, the Apache 2.0 licence line, the gemma4_unified and image-text-to-text tags, the arXiv identifier 2607.02770, the 12B parameter size and a downloads-last-month figure of 1,902,430.

Waar de generalist onbetwist wint

De voordelen van Gemma 4 12B zijn niet marginaal en ze zijn gemakkelijk te onderschatten.

Het eerste is breedte. AstaBrief 8B is een component die verwacht dat er bewijs wordt aangeleverd. Gemma 4 12B leest screenshots, luistert naar audio, bekijkt video, schrijft code en houdt een gesprek van 256K gaande. Als je werk figuren in artikelen, opgenomen lezingen of multimodaal bronmateriaal omvat, kan de specialist helemaal niet deelnemen en is de kwestie daarmee beslecht.

Het tweede is dat brede publieke blootstelling op zichzelf een vorm van bewijs is. Gemma 4 12B staat op leaderboards van derden; de familie omvat vijf formaten, van E2B tot en met 31B; de op instructies afgestemde en voorgetrainde varianten zijn beide gepubliceerd, samen met een technisch rapport. Dat is normale, saaie, verifieerbare herkomst — precies wat ontbreekt bij zowel AstaBrief 8B als bij de bredere klasse van gespecialiseerde onderzoeksmodellen.

Het derde is de praktische prijs van een tweede stack. AstaBrief 8B draaien voor het schrijven van rapporten plus een generalist voor al het overige betekent twee modellen in het geheugen, twee promptformaten, twee evaluatieharnassen en twee upgradepaden. Op één enkele kaart van 24 GB in BF16 is dat niet gratis — en de modelkaart van AstaBrief waarschuwt dat het is finegetuned op één specifiek promptformaat, gepubliceerd als een datasetbestand, en dat het gebruik van een ander formaat het gedrag kan verslechteren. Een generalist heeft die lock-in niet.

• Gemma 4 12B (door leverancier gerapporteerd) — intelligentie-index 9 op de Reasoning-configuratie; er is geen vergelijkbaar Gemma-cijfer op Ai2's rapportbenchmarks.

• Gemma 4-familie — vijf groottes van E2B tot en met 31B, Apache-2.0, technisch rapport gepubliceerd, aanwezigheid op leaderboards van derden.

• Gemma 4 26B A4B, aangeboden in onze catalogus — $0,30 per miljoen inputtokens, $0,33 per miljoen outputtokens, contextvenster van 262.144 tokens. Gemma 4 31B wordt ook gerouteerd, tegen $0,13 / $0,38.

• Gemma 4 12B, lokaal — 11.95B dense, 256K-context, hybride sliding-window- en globale attention, lokaal venster van 1024 tokens.

Qua beschikbaarheid worden Gemma 4-modellen commercieel gehost: Gemma 4 26B A4B is een live route in onze catalogus tegen $0,06 per miljoen inputtokens en $0,33 per miljoen output, met een contextvenster van 262.144 tokens, en Gemma 4 31B is ook gerouteerd. Dat is belangrijk, want het betekent dat je de generalistische tak kunt evalueren zonder zelf een GPU te bezitten. Geen enkele provider in onze catalogus serveert AstaBrief 8B, wijzelf inbegrepen — het is een download-and-run-model, en de eerlijke manier om het te gebruiken is op hardware die je zelf beheert, of binnen Ai2's eigen Asta-product.

Zelf de vergelijking uitvoeren, tegen lage kosten

De beslissing die dit artikel niet voor je kan maken, is degene die je in een middag kunt maken, omdat het experiment asymmetrisch is qua kosten. AstaBrief 8B heeft lokale weights nodig en het gepubliceerde promptformaat; je kunt het op één enkele kaart opzetten met vLLM in de configuratie die Ai2 documenteert, temperature 0.7 en top-p 0.95. De generalistische arm kan een gehoste aanroep zijn — Gemma 4 26B A4B tegen $0,06 voor input en $0,33 voor output per miljoen tokens zit qua strekking dicht genoeg bij om tegen te kalibreren, en je kunt je eigen harness op beide richten zonder de tweede GPU te bezitten.

Meet dan wat de leverancierstabellen niet meten: op jouw vragen, met jouw fragmenten, hoeveel rapporten er correct geciteerd terugkomen en hoe lang de hele keten duurt zodra je de glue voor het citatieschema aan de generalistische kant hebt toegevoegd. De 3,5x van Ai2 is afgezet tegen Ai2's eigen pijplijn, niet tegen Gemma 4 12B, en dat verschil zal er in jouw stack anders uitzien.

De generalistische tak achter één endpoint houden is wat dit goedkoop maakt om te herhalen in plaats van een eenmalig project: één API voor 200-plus modellen, de lijstprijs van de provider wordt doorgegeven met 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag op je factuur terechtkomt, automatische failover wanneer een provider verslechtert, en een routing-DSL als je wilt dat meerdere modellen samen antwoorden. Het gaat niet om loyaliteit aan een van beide modellen; het gaat erom dat het volgend kwartaal opnieuw uitvoeren van de vergelijking een configuratiewijziging zou moeten zijn, want beide modellen zullen worden opgevolgd.

A screenshot of the Hugging Face model card for allenai/AstaBrief_8B showing the TextGeneration tag, the apache-2.0 licence, the qwen3 and deep-research tags and the role descriptor for Ai2, as the reference point for the specialist arm of the comparison.

Welke je eigenlijk zou moeten downloaden

Kies AstaBrief 8B als het eindproduct een onderzoeksrapport met bronvermeldingen is en je een retrieval-laag hebt die het voedt. Het single-pass-ontwerp is een echte technische prestatie, de 3,5x kortere generatietijd is de reden dat het bestaat, Apache-2.0 plus gepubliceerde trainingsdata maken het auditeerbaar, en geen enkele generalist zal de structuur van de uitvoer evenaren zonder dat je zelf de scaffolding bouwt en onderhoudt.

Kies Gemma 4 12B als je werk breder is dan rapporten, als je bronnen multimodaal zijn, als 256K context je het bouwen van een retrievallaag helemaal laat overslaan, of als je het model wilt dat scores van derden aan zijn naam heeft hangen en een gehoste route heeft die je vandaag kunt aanroepen.

En let op de eerlijke asymmetrie in het bewijs, want die pleit tegen de specialist: de cijfers van AstaBrief 8B, inclusief de best klinkende, komen van Ai2, beschrijven een vergelijkingsset uit 2025 waarvan het lab zegt dat het die niet opnieuw heeft uitgevoerd, en omvatten een menselijke studie met veertien vragen. De cijfers van Gemma 4 12B komen van mensen die niet bij Google werken. Dat verschil in herkomst is meer waard dan een paar punten op een benchmark die niemand op beide heeft uitgevoerd.