
AstaBrief 8B: Ai2s offener Berichtschreiber läuft 3,5-mal schneller als die Pipeline, die er ersetzt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 216 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die Schlagzeilenzahl aus Ai2s AstaBrief-8B-Ankündigung ist ein Stoppuhrwert, kein Benchmark-Ergebnis: Über die gesamte Asta-Pipeline hinweg erzeugt das neue Modell einen mit Quellen belegten Forschungsbericht in durchschnittlich 51,1 Sekunden, gegenüber 178,5 Sekunden für den Claude-gestützten Pfad, neben dem es nun steht. Das ist etwa 3,5-mal schneller, und es beruht auf einer einzigen architektonischen Entscheidung – den gesamten Bericht in einem Durchgang zu schreiben, statt zusammenzufassen, zu clustern und dann Abschnitt für Abschnitt zu schreiben. AstaBrief 8B ist ein 8B-Modell mit offenen Gewichten unter Apache-2.0-Lizenz, feinabgestimmt auf Basis von Qwen3-8B, das eine Forschungsfrage plus abgerufene Literaturstellen entgegennimmt und einen Bericht mit Inline-Zitaten zurückgibt. Es wurde am 2026-10-02 als „Fast mode“ in Ai2s Asta-Plattform ausgeliefert, und die Gewichte, die Trainingsdaten und ein Beispiel für einen lokalen Workflow wurden am selben Tag veröffentlicht.
Das Repository ist älter als die Ankündigung, und das ist wichtig
Ein Detail in dieser Veröffentlichung ist es wert, klar benannt zu werden, denn es verändert, wie Sie alles andere lesen sollten: Das Hugging-Face-Repository unter allenai/AstaBrief_8B weist einen internen Erstellungszeitstempel vom 2026-02-09 auf, und der begleitende DPO-Datensatz datiert auf November 2025. Die Ankündigung vom 2. Oktober ist echt – der Blogbeitrag, der AI2-Tweet und die Modellkarte erschienen alle an diesem Tag –, doch die Repository-Historie reicht weiter zurück, als der Nachrichtenzyklus vermuten lässt.
Was am 2. Oktober passierte, war, dass Ai2 die Sache ausgeliefert und dokumentiert und das Repository entsprechend angepasst hat: Am Veröffentlichungstag landeten zwischen 16:18:06 und 16:18:20 UTC drei Commits auf der Modellkarte, die dem Chat-Template eine Antwortvorlage hinzufügten und ein No-op-Token entfernten. Das ist reine Kartenpflege, kein Retraining. Ai2 macht im Blog außerdem unmissverständlich klar, dass „der größte Teil des beschriebenen Trainings und der Evaluierung 2025 abgeschlossen wurde“ und dass die proprietären Modelle, die zur Generierung von Trainingsdaten und als Vergleichspunkte verwendet wurden, „den damaligen Frontier-Stand widerspiegeln“. Das Labor gibt an, die vollständige Evaluierung nicht erneut gegen die heutigen Frontier-Modelle durchgeführt zu haben.

Das hier ist also ein GA-Release von Arbeit, die größtenteils 2025 abgeschlossen wurde – ein Launch, mit der Dokumentation eines Launches und der Plattformintegration eines Launches, aufbauend auf einem Checkpoint, der seit Monaten im Konto des Labs existiert. Daran ist nichts unehrlich, und das Modell ist für alle außerhalb von Ai2 neu. Aber es bedeutet, dass die unten stehenden Vergleichszahlen eine Frontier aus dem Jahr 2025 beschreiben, und Ai2 sagt das selbst.
Was AstaBrief 8B tatsächlich macht
Ai2s Asta-Plattform bietet eine Funktion zur Berichtserstellung, bei der Forschende eine substanzielle Frage und einen Bestand an Literatur einbringen und als Ergebnis eine mit Quellenangaben versehene Synthese erhalten, die sie als Arbeitsartefakt behandeln. Diese Funktion lief zuvor vollständig auf dem, was Ai2 als Thinking mode bezeichnet: eine mehrstufige Pipeline, die abgerufene Textausschnitte zusammenfasst, sie thematisch gruppiert und die Antwort Abschnitt für Abschnitt schreibt, gestützt auf Claude-Modelle. Thinking mode ist gründlich und langsam.
AstaBrief 8B ist der Fast-Modus. Angesichts derselben Frage und derselben abgerufenen Auszüge schreibt es den Abschlussbericht in einem einzigen Vorwärtsdurchlauf. Ai2s Behauptung ist der interessante Teil: Die Snippet-Zusammenfassung, das Clustering und die abschnittsweise Schleife zu umgehen, ging nicht zulasten der Berichtsqualität – zumindest gemessen an den Kennzahlen, die das Labor verfolgte. Das Modell ist keine Suchmaschine und ruft nichts ab – es ist der Autor am Ende einer Retrieval-Pipeline und erwartet, dass ihm die Belege übergeben werden.
Dadurch ist es eher eine Komponente als ein Produkt. Es ist auch der Grund, warum Ai2 zusammen mit den Gewichten einen Beispiel-Workflow veröffentlicht hat: eine kleine Bibliothek im Repository ai2-scholarqa-lib, die Ihre eigenen PDFs in Berichte verwandelt, gibt Ihnen einen Ausgangspunkt für die lokale Generierung.
Das Trainingsrezept ist absichtlich langweilig, und genau das ist der Punkt.
Ai2s eigene frühere Arbeit, DR Tulu, zeigte, dass bestärkendes Lernen die Generierung von Langform-Berichten in Open-Weights-Modellen verbessern kann. Für AstaBrief erwog das Team diesen Weg und entschied sich dagegen, mit der Begründung, dass RL instabil und teuer ist und sie etwas wollten, das sich leichter debuggen lässt. Was sie stattdessen bauten, ist überwachtes Feintuning, gefolgt von offline-direkter Präferenzoptimierung. Zwei Stufen, beide konventionell.
Die SFT-Phase begann mit echten Anfragen, die über das Asta-System von Ai2 eingereicht wurden, statt mit synthetischen Prompts. Aus den gesammelten Logs filterte das Team nach Qualität, Relevanz und Datenschutz – Bot- und Beta-Tester-Traffic wurde entfernt, zu kurze und damit nicht aussagekräftige Anfragen wurden verworfen, und ein LLM-Durchlauf sollte nicht englischsprachige Anfragen, nicht wissenschaftliche Anfragen und Prompts mit personenbezogenen Informationen erkennen. Übrig blieb ein Pool von 90.000 forschungsorientierten Anfragen. Vollbericht-Ziele für diese Anfragen wurden mit der mehrstufigen ScholarQA-Pipeline generiert, wobei Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini und GPT-4.1 als zugrunde liegende Modelle verwendet wurden. Nach der Qualitätsfilterung: 47.000 nutzbare Trainingsbeispiele.
Die DPO-Phase erforderte etwas anderes – Paare von Berichten mit einer Präferenz zwischen ihnen. Ein Bericht pro Anfrage stammte aus der ScholarQA-Pipeline; der konkurrierende Bericht entstand dadurch, dass ScholarQAs abgerufene Auszüge einem anderen Modell zugeführt wurden, das aus o3, o4-mini, DeepSeek-V3 oder DeepSeek-R1 ausgewählt wurde. Zwei Juroren, GPT-4.1 und DeepSeek-R1, wählten für jedes Paar einen Gewinner aus, und nur Paare, bei denen beide Juroren übereinstimmten, blieben erhalten. Ai2 berichtet von 95 % Übereinstimmung zwischen den LLM-Juroren und menschlichen Präferenzen. Das endgültige Präferenzset umfasste etwa 6.000 Beispiele. Sowohl die SFT-Mischung als auch die DPO-Mischung sind auf Hugging Face zur Einsicht verfügbar.

Die am besten übertragbare Erkenntnis ist zugleich die am wenigsten glamouröse. Frühe SFT-Läufe schrieben bessere Berichte, blieben aber bei Antwortpräzision und Zitierqualität zurück, daher testete das Team vier statistikbasierte Filter auf den synthetischen Trainingsdaten: das Token-Verhältnis von Ausgabe zu Eingabe, die durchschnittliche Retrieval-Relevanz der zitierten Arbeiten, die Zitationsdichte (der Anteil der Aussagen, die mindestens eine Zitation tragen) und die Zitationsvielfalt. Die stärksten Zugewinne entstanden durch das Herausfiltern synthetischer Berichte mit geringer Zitationsdichte – und aggressiveres Filtern, Filterkombinationen und Learning-Rate-Sweeps brachten keine nennenswerten zusätzlichen Zugewinne. Ai2s Schlussfolgerung lohnt sich, über dieses Modell hinauszutragen: Spezialisierung war keine Frage davon, mehr wissenschaftlichen Text in das Pretraining zu gießen, sondern der Zusammensetzung und Qualität der Post-Training-Daten.
Das von Ai2 veröffentlichte Scoreboard und wie man es liest

Jede unten stehende Zahl ist vom Anbieter gemeldet. Sie stammt aus Ai2s Model Card und Blog, die vom laboreigenen Evaluierungs-Harness erzeugt wurden, und nichts davon wurde unabhängig reproduziert. Das primäre Ziel war SQABench-CS2, eine Sammlung von 100 von Nutzern verfassten Forschungsfragen der Informatik, erfasst anhand von vier Metriken: Ingredient Recall (Abdeckung der notwendigen Inhalte), Answer Precision (ob jeder Absatz relevant ist), Citation Precision (ob jedes Zitat seine Behauptung stützt) und Citation Recall (ob Behauptungen durch die angegebenen Zitate vollständig gestützt werden).
• Gesamtdurchschnitt — AstaBrief 8B 87,0, sein eigener SFT-Checkpoint 83,7, Basis-Qwen3-8B 77,3
• Inhaltsstoff-Recall — AstaBrief 8B 90,2, SFT 85,2, Qwen3-8B 77,8
• Antwortpräzision — AstaBrief 8B 89,0, SFT 90,4, Qwen3-8B 90,6
• Zitationspräzision — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2
• Zitationsabruf — AstaBrief 8B 78,2, SFT 71,3, Qwen3-8B 64,6
Liest man die Zeilen zusammen, wirkt die DPO-Phase gezielt statt durchweg besser. Der Gesamtdurchschnitt steigt, Ingredient-Recall und beide Zitationsmetriken steigen stark, und die Antwortpräzision fällt geringfügig unter sowohl den SFT-Checkpoint als auch das Basismodell. Wenn für Ihren Anwendungsfall die Relevanz pro Absatz über allem steht, ist das Fine-Tuning nicht automatisch Ihre Antwort.
Bei sekundären Evaluierungen testete Ai2 das finale Modell gegen seine eigene ScholarQA-Pipeline und gegen DR-Tulu-8B. Auf dem Dev-Split von SQABench-CS2 erzielte Asta ScholarQA 87,6, DR-Tulu-8B 86,5 und AstaBrief 8B 86,3; im Test-Split erzielten ScholarQA 86,2, DR-Tulu-8B 88,8 und AstaBrief 87,0. Auf DeepScholarBench, einem Long-Form-Synthese-Benchmark mit 63 Abfragen, erzielte ScholarQA 60,25, DR-Tulu-8B 56,26 und AstaBrief 53,50 – die einzige Zeile, in der der offene Report-Writer hinter beiden Alternativen zurückliegt. In zwei LLM-bewerteten paarweisen Vergleichen gegen die Claude-basierte Pipeline entschied AstaBrief 55 % der Dev-Vergleiche und 72 % der Test-Vergleiche für sich. Eine separate Humanstudie umfasste nur 14 Fragen von drei Forschenden, und bei der Gesamtpräferenz gewann DR-Tulu, obwohl zwei der drei Forschenden AstaBrief bei der Zitiergenauigkeit bevorzugten. Vierzehn Fragen von drei Personen sind ein Signal, kein Urteil, und Ai2 stellt es auch so dar.
Das Lab veröffentlichte außerdem frühe Nutzungsdaten aus der Asta-Integration: Von den 374 Nutzern, die Fast mode ausprobiert haben, nutzten 29,1 % ihn an zwei oder mehr Tagen, die Nutzer erstellten durchschnittlich 3,67 Report-Threads, 23 % wechselten nie zum Thinking mode zurück, und 18 % bewegten sich je nach Aufgabe zwischen den beiden Modi. Positives Feedback lag bei 84,2 % für Fast mode gegenüber 85,2 % für Thinking mode — nahe genug beieinander, dass Ai2 das Feedback als zu spärlich bezeichnet, um daraus starke Schlüsse zu ziehen. Das ist die ehrliche Einordnung, also behaltet sie bei.
Selbst ausführen
AstaBrief 8B ist Apache-2.0 und basiert auf Qwen/Qwen3-8B, fällt also in die Single-GPU-Klasse und nicht in die Datacenter-Klasse: ein dichtes 8B-Modell auf der Qwen3-Architektur, 36 Schichten, Hidden-Size 4096, 32 Attention-Heads mit 8 Key-Value-Heads, ein Vokabular von 151.936 Token und die Positionsgrenze des Basismodells von 40.960 Token. In BF16 passt es problemlos auf eine 24-GB-Karte, und im eigenen Beispiel der Karte wird vLLM mit Temperatur 0,7, Top-p 0,95 und einer Ausgabegrenze von 4096 Token verwendet.
Eine operative Warnung steht fett gedruckt auf der Model Card und ist leicht zu übersehen: Der Checkpoint wurde auf ein ganz bestimmtes Prompt-Format feinabgestimmt, das als sft_prompt.txt im Datensatz AstaBrief_prompts veröffentlicht ist. Wenn Sie ein anderes Prompt- oder Interaktionsformat verwenden, rechnet Ai2 mit verschlechtertem oder inkonsistentem Verhalten. Wenn Sie dieses Modell mit Ihrem eigenen Harness evaluieren und schlechte Ergebnisse erhalten, prüfen Sie das Prompt, bevor Sie irgendetwas über die Gewichte schlussfolgern.
Die Karte ist zudem offen, was den Umfang angeht. AstaBrief ist für Forschungs- und Bildungszwecke gedacht, nicht als Allzweck-Assistent, und es gibt keinen gehosteten Inferenz-Endpunkt von Ai2 – man lädt es herunter oder nutzt es innerhalb von Asta. Kein Anbieter in unserem Katalog stellt es bereit, auch wir nicht, es gibt also keine Route, auf die man zeigen könnte; der ehrliche Weg, es zu nutzen, ist auf eigener Hardware oder hinter der eigenen Firewall – genau das Argument, das Ai2 überhaupt für offene Gewichte vorbringt.
Wo ein Router in eine Report-Pipeline passt
AstaBrief besetzt einen Platz in einer längeren Kette. Etwas ruft die Literatur ab, etwas entscheidet, welche Auszüge es wert sind, weitergegeben zu werden, und etwas kann den fertigen Bericht beurteilen oder überprüfen. Diese Aufrufe sind gewöhnliche Aufrufe gehosteter Modelle, und sie sind der Teil des Stacks, bei dem Sie tatsächlich eine Auswahl an Anbietern wollen: eine API, die über 200 Modelle abdeckt, Listenpreise der Anbieter ohne Aufschlag durchgereicht so dass eine Preissenkung eines Anbieters noch am selben Tag auf Ihrer Rechnung sichtbar wird, automatisches Failover, wenn ein Anbieter schwächelt, und eine Routing-DSL, wenn Sie mehrere Modelle zu einem einzigen Aufruf zusammenfassen möchten. Hosten Sie den Writer selbst, denn das ist der Teil mit Auswirkungen auf die Datensensibilität und mit festen Kosten; lagern Sie die Orchestrierung aus, denn das ist der Teil, bei dem Flexibilität mehr wert ist als Eigentum.
Es gibt hier auch ein günstiges Experiment. Das eigene Vergleichsset von Ai2 besteht aus Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini und GPT-4.1 – bewusst eine 2025er-Frontier, und das Labor sagt, es habe es nicht erneut ausgeführt. AstaBriefs Ausgabe neben die heutigen gehosteten Modelle zu Ihren eigenen Fragen zu stellen, ist mit einem Tastendruck erledigt, wenn beide Arme über denselben Endpunkt erreichbar sind, und es beantwortet die Frage, die der Blogbeitrag offen lässt.
Was würde das Bild verändern?
Drei Dinge würden daraus statt einer gut dokumentierten Veröffentlichung ein gesichertes Ergebnis machen. Eine unabhängige Reproduktion der SQABench-CS2-Zahlen, da jede oben genannte Zahl selbstberichtet ist. Ein erneuter Durchlauf gegen aktuelle Frontier-Modelle, da das Vergleichsset nach eigener Einräumung des Labors ein Jahr alt ist. Und eine umfangreichere menschliche Evaluation als vierzehn Fragen von drei Forschenden — Ai2s eigener Blog schließt mit dem Argument, dass das Feld Evaluationen braucht, die über Zitationsunterstützung hinausgehen und fragen, ob ein Modell den Evidenzumfang seiner Quellen wahrt, einschließlich der Frage, ob es stillschweigend stichprobenspezifische Befunde in breite Verallgemeinerungen verwandelt. Das ist eine berechtigte Kritik an der gesamten Evaluationskategorie, und sie gilt auch für diese Veröffentlichung.
Vorerst ist die praktische Einschätzung einfach. Wenn du aus Literatur zitierte Berichte generierst und den Writer auf deiner eigenen Hardware willst, unter einer Apache-2.0-Lizenz, mit offenen Trainingsdaten, ist AstaBrief 8B die am direktesten zweckgebundene offene Option, die irgendjemand veröffentlicht hat, und die 3,5-fache Verkürzung der Wall-Clock-Zeit ist der Grund für ihre Existenz. Wenn deine Arbeit von der bestmöglichen Synthese abhängt, beachte, dass Ai2s eigene Tabelle DR-Tulu bei der allgemeinen menschlichen Präferenz an die Spitze setzt und ScholarQA bei DeepScholarBench — und dass der Thinking-Modus genau deshalb weiterhin im selben Produkt vorhanden ist.
