
AstaBrief 8B: Penulis Laporan Terbuka Ai2 Berjalan 3,5x Lebih Cepat daripada Pipeline yang Digantikannya
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 216 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 42 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Angka utama dari pengumuman AstaBrief 8B dari Ai2 adalah pembacaan stopwatch, bukan skor tolok ukur: di seluruh pipeline Asta, model baru ini menghasilkan laporan riset dengan sitasi dalam rata-rata 51,1 detik, dibandingkan dengan 178,5 detik untuk jalur bertenaga Claude yang kini berada di sampingnya. Itu sekitar 3,5 kali lebih cepat, dan berasal dari satu keputusan arsitektural — menulis seluruh laporan dalam satu kali proses alih-alih merangkum, mengelompokkan, lalu menulis bagian demi bagian. AstaBrief 8B adalah model berbobot terbuka 8B, berlisensi Apache-2.0, di-fine-tune dari Qwen3-8B, yang menerima pertanyaan riset plus cuplikan literatur yang diambil dan mengembalikan laporan dengan sitasi inline. Model ini dirilis ke platform Asta milik Ai2 sebagai "Fast mode" pada 2026-10-02, dan bobot, data pelatihan, serta contoh alur kerja lokal dipublikasikan pada hari yang sama.
Repositori itu lebih tua daripada pengumumannya, dan itu penting
Satu detail dalam rilis ini layak dinyatakan secara gamblang, karena ini mengubah cara Anda membaca semua hal lainnya: repositori Hugging Face di allenai/AstaBrief_8B memiliki cap waktu pembuatan internal 2026-02-09, dan dataset DPO pendampingnya bertanggal November 2025. Pengumuman 2 Oktober itu nyata — postingan blog, tweet AI2, dan kartu model semuanya muncul hari itu — tetapi riwayat repositori lebih panjang daripada yang disiratkan siklus berita.
Yang terjadi pada 2 Oktober adalah Ai2 merilis dan mendokumentasikan hal tersebut, lalu menyesuaikan repo agar sesuai: tiga commit masuk ke kartu model antara pukul 16:18:06 dan 16:18:20 UTC pada hari peluncuran, menambahkan templat respons ke templat chat dan menghapus token no-op. Itu hanyalah pemeliharaan rutin pada sebuah kartu, bukan pelatihan ulang. Ai2 juga secara eksplisit menyatakan dalam blog bahwa "sebagian besar pelatihan dan evaluasi yang dijelaskan diselesaikan pada tahun 2025," dan bahwa model-model proprietary yang digunakan untuk menghasilkan data pelatihan dan sebagai titik pembanding "mencerminkan frontier pada saat itu." Lab tersebut menyatakan belum menjalankan ulang evaluasi penuh terhadap model-model frontier saat ini.

Jadi ini adalah rilis GA dari pekerjaan yang sebagian besar telah selesai pada 2025 — sebuah peluncuran, dengan dokumentasi peluncuran dan integrasi platform peluncuran, di atas checkpoint yang sudah ada di akun lab tersebut selama berbulan-bulan. Tidak ada yang tidak jujur dalam hal itu, dan model ini baru bagi semua orang di luar Ai2. Tetapi itu berarti angka perbandingan di bawah ini menggambarkan frontier tahun 2025, dan Ai2 sendiri mengatakannya.
Apa yang sebenarnya dilakukan AstaBrief 8B
Platform Asta milik Ai2 memiliki fitur pembuatan laporan di mana para peneliti mengajukan pertanyaan yang substansial dan sekumpulan literatur, lalu menerima kembali sintesis yang disertai sitasi yang mereka perlakukan sebagai artefak kerja. Fitur tersebut sebelumnya sepenuhnya berjalan pada apa yang disebut Ai2 sebagai Thinking mode: pipeline multi-langkah yang merangkum cuplikan yang diambil, mengelompokkannya secara tematik, dan menulis jawaban bagian demi bagian, didukung oleh model-model Claude. Thinking mode menyeluruh dan lambat.
AstaBrief 8B adalah Mode Cepat. Dengan pertanyaan yang sama dan kutipan hasil pengambilan yang sama, model ini menulis laporan akhir dalam satu forward pass. Klaim Ai2 adalah bagian yang menarik: melewati peringkasan cuplikan, pengelompokan, dan loop bagian demi bagian tidak menurunkan kualitas laporan, setidaknya pada metrik yang dilacak oleh lab. Model ini bukan mesin pencari dan tidak melakukan pengambilan — ia adalah penulis di ujung pipeline pengambilan, dan ia mengharapkan bukti diberikan kepadanya.
Itu menjadikannya komponen, bukan produk. Itulah juga sebabnya Ai2 merilis contoh alur kerja bersama bobotnya: sebuah pustaka kecil yang mengubah PDF Anda sendiri menjadi laporan, di repositori ai2-scholarqa-lib, memberi Anda titik awal untuk generasi lokal.
Resep pelatihannya sengaja dibuat membosankan, dan itulah intinya.
Karya sebelumnya Ai2 sendiri, DR Tulu, menunjukkan bahwa reinforcement learning dapat meningkatkan pembuatan laporan panjang pada model dengan bobot terbuka. Untuk AstaBrief, tim mempertimbangkan jalur itu dan memilih untuk tidak mengambilnya, dengan alasan bahwa RL tidak stabil dan mahal serta mereka menginginkan sesuatu yang lebih mudah di-debug. Yang mereka bangun sebagai gantinya adalah supervised fine-tuning yang diikuti oleh optimisasi preferensi langsung secara offline. Dua tahap, keduanya konvensional.
Tahap SFT dimulai dari kueri nyata yang dikirim melalui sistem Asta milik Ai2, bukan dari prompt sintetis. Dari log yang terkumpul, tim menyaring berdasarkan kualitas, relevansi, dan privasi — menghapus lalu lintas bot dan penguji beta, membuang kueri yang terlalu pendek untuk bermakna, serta menjalankan proses LLM untuk menangkap kueri non-Inggris, permintaan non-ilmiah, dan prompt yang berisi informasi pribadi. Hasilnya menyisakan kumpulan 90.000 kueri yang berfokus pada penelitian. Target laporan lengkap untuk kueri tersebut dihasilkan dengan pipeline ScholarQA multi-langkah, menggunakan Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, dan GPT-4.1 sebagai model pendukung. Setelah penyaringan kualitas: 47.000 contoh pelatihan yang dapat digunakan.
Tahap DPO membutuhkan sesuatu yang berbeda — pasangan laporan dengan preferensi di antara keduanya. Satu laporan per kueri berasal dari pipeline ScholarQA; laporan pembanding berasal dari pemberian cuplikan yang diambil ScholarQA kepada model lain, yang diambil dari o3, o4-mini, DeepSeek-V3, atau DeepSeek-R1. Dua juri, GPT-4.1 dan DeepSeek-R1, memilih pemenang untuk setiap pasangan, dan hanya pasangan yang disetujui kedua juri yang bertahan. Ai2 melaporkan kesepakatan 95% antara juri LLM dan preferensi manusia. Kumpulan preferensi akhirnya berjumlah sekitar 6.000 contoh. Baik campuran SFT maupun campuran DPO tersedia di Hugging Face untuk diperiksa.

Temuan yang paling dapat ditransfer juga yang paling tidak glamor. Uji coba SFT awal menulis laporan yang lebih baik tetapi tertinggal dalam presisi jawaban dan kualitas sitasi, sehingga tim menguji empat filter berbasis statistik pada data pelatihan sintetis: rasio token keluaran-ke-masukan, relevansi pengambilan rata-rata dari makalah yang dikutip, kepadatan sitasi (proporsi pernyataan yang membawa setidaknya satu sitasi), dan keragaman sitasi. Keuntungan terkuat berasal dari menyaring laporan sintetis dengan kepadatan sitasi rendah — dan penyaringan yang lebih agresif, kombinasi filter, serta penyapuan laju pembelajaran tidak menambah keuntungan yang berarti. Kesimpulan Ai2 patut dibawa melampaui model ini: spesialisasi bukanlah soal menuangkan lebih banyak teks ilmiah ke dalam pra-pelatihan, melainkan soal komposisi dan kualitas data pasca-pelatihan.
Papan skor yang diterbitkan Ai2, dan cara membacanya

Setiap angka di bawah ini dilaporkan oleh vendor. Angka-angka tersebut berasal dari kartu model dan blog Ai2, dihasilkan oleh perangkat evaluasi milik lab itu sendiri, dan tidak ada satu pun yang telah direproduksi secara independen. Target utamanya adalah SQABench-CS2, serangkaian 100 pertanyaan penelitian ilmu komputer yang ditulis pengguna, dilacak pada empat metrik: recall bahan (cakupan konten yang diperlukan), presisi jawaban (apakah setiap paragraf relevan), presisi sitasi (apakah setiap sitasi mendukung klaimnya), dan recall sitasi (apakah klaim didukung sepenuhnya oleh sitasi yang diberikan).
• Rata-rata keseluruhan — AstaBrief 8B 87,0, checkpoint SFT-nya sendiri 83,7, Qwen3-8B dasar 77,3
• Recall bahan — AstaBrief 8B 90.2, SFT 85.2, Qwen3-8B 77.8
• Presisi jawaban — AstaBrief 8B 89,0, SFT 90,4, Qwen3-8B 90,6
• Presisi kutipan — AstaBrief 8B 90,5, SFT 87,7, Qwen3-8B 76,2
• Recall sitasi — AstaBrief 8B 78.2, SFT 71.3, Qwen3-8B 64.6
Baca baris-barisnya secara keseluruhan, dan tahap DPO tampak tertarget, bukan lebih baik secara merata. Rata-rata keseluruhan meningkat, ingatan bahan dan kedua metrik sitasi naik tajam, sementara presisi jawaban sedikit melorot di bawah checkpoint SFT maupun model dasar. Jika kasus penggunaan Anda mengutamakan relevansi per paragraf di atas segalanya, fine-tune tidak otomatis menjadi jawaban Anda.
Pada evaluasi sekunder, Ai2 menguji model final terhadap pipeline ScholarQA miliknya sendiri dan terhadap DR-Tulu-8B. Pada dev SQABench-CS2, Asta ScholarQA mendapat skor 87,6, DR-Tulu-8B 86,5, dan AstaBrief 8B 86,3; pada split test, ScholarQA 86,2, DR-Tulu-8B 88,8, AstaBrief 87,0. Pada DeepScholarBench, tolok ukur sintesis panjang dengan 63 kueri, ScholarQA mendapat skor 60,25, DR-Tulu-8B 56,26, dan AstaBrief 53,50 — satu-satunya baris di mana penulis laporan terbuka tertinggal dari kedua alternatif. Dalam dua perbandingan berpasangan yang dinilai LLM terhadap pipeline berbasis Claude, AstaBrief meraih 55% dari perbandingan dev dan 72% dari perbandingan test. Sebuah studi manusia terpisah hanya mencakup 14 pertanyaan dari tiga peneliti, dan untuk preferensi keseluruhan DR-Tulu menang, meskipun dua dari tiga peneliti lebih memilih AstaBrief dalam hal akurasi sitasi. Empat belas pertanyaan dari tiga orang adalah sinyal, bukan putusan, dan Ai2 menyajikannya seperti itu.
Laboratorium itu juga menerbitkan data penggunaan awal dari integrasi Asta: di antara 374 pengguna yang mencoba mode Fast, 29,1% menggunakannya pada dua hari atau lebih, pengguna menghasilkan rata-rata 3,67 utas laporan, 23% tidak pernah beralih kembali ke mode Thinking, dan 18% berpindah antara kedua mode tersebut bergantung pada tugas. Umpan balik positif mencapai 84,2% untuk mode Fast berbanding 85,2% untuk mode Thinking — cukup dekat sehingga Ai2 mencirikan umpan balik tersebut terlalu sedikit untuk menarik kesimpulan yang kuat. Itulah perumusan yang jujur, jadi pertahankan.
Menjalankannya sendiri
AstaBrief 8B berlisensi Apache-2.0 dan berbasis Qwen/Qwen3-8B, sehingga masuk ke kelas GPU tunggal, bukan kelas pusat data: model dense 8B pada arsitektur Qwen3, 36 lapisan, ukuran tersembunyi 4096, 32 kepala atensi dengan 8 kepala key-value, kosakata 151.936 token, dan batas posisi 40.960 token milik model dasar. Dalam BF16, model ini muat dengan lega pada kartu 24GB, dan contoh dari kartu tersebut sendiri menggunakan vLLM dengan temperature 0,7, top-p 0,95, dan batas keluaran 4096 token.
Satu peringatan operasional dicetak dengan huruf tebal pada kartu model dan mudah terlewat: checkpoint tersebut di-fine-tune terhadap satu format prompt tertentu, yang dipublikasikan sebagai sft_prompt.txt di dataset AstaBrief_prompts. Jika Anda menggunakan prompt atau format interaksi yang berbeda, Ai2 memperkirakan perilaku yang menurun atau tidak konsisten. Jika Anda mengevaluasi model ini dengan harness Anda sendiri dan mendapatkan hasil yang buruk, periksa prompt-nya sebelum Anda menyimpulkan apa pun tentang bobotnya.
Kartu ini juga terus terang soal cakupan. AstaBrief ditujukan untuk keperluan riset dan edukasi, bukan sebagai asisten serbaguna, dan tidak ada endpoint inferensi yang dihosting dari Ai2 — Anda mengunduhnya, atau menggunakannya di dalam Asta. Tidak ada penyedia dalam katalog kami yang menyediakannya, termasuk kami, jadi tidak ada rute yang bisa diarahkan; cara jujur untuk menggunakannya adalah di perangkat keras Anda sendiri atau di balik firewall Anda sendiri, yang justru merupakan argumen yang Ai2 ajukan untuk bobot terbuka sejak awal.
Di mana router masuk ke dalam pipeline laporan
AstaBrief menempati satu slot dalam rantai yang lebih panjang. Ada yang mengambil literatur, ada yang menentukan kutipan mana yang layak diteruskan, dan ada yang mungkin menilai atau memverifikasi laporan yang sudah jadi. Panggilan-panggilan itu adalah panggilan model terkelola biasa, dan itulah bagian dari tumpukan tempat Anda benar-benar menginginkan pilihan vendor: satu API yang mencakup lebih dari 200 model, harga daftar penyedia diteruskan dengan markup 0% sehingga penurunan harga vendor muncul di tagihan Anda pada hari yang sama, failover otomatis jika penyedia mengalami penurunan kinerja, dan DSL perutean jika Anda ingin menyusun beberapa model menjadi satu panggilan. Self-host bagian penulisnya karena itulah bagian yang memiliki implikasi sensitivitas data dan biaya tetap; rutekan orkestrasinya karena itulah bagian di mana fleksibilitas lebih berharga daripada kepemilikan.
Ada juga eksperimen murah di sini. Set perbandingan milik Ai2 sendiri adalah Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini dan GPT-4.1 — sengaja merupakan frontier 2025, dan lab itu mengatakan belum menjalankannya ulang. Menempatkan keluaran AstaBrief di samping model hosted saat ini pada pertanyaan Anda sendiri adalah latihan satu tombol jika kedua lengan dapat dijangkau melalui endpoint yang sama, dan itu menjawab pertanyaan yang dibiarkan terbuka oleh posting blog tersebut.
Apa yang akan mengubah gambaran
Tiga hal akan mengubah ini dari peluncuran yang terdokumentasi dengan baik menjadi hasil yang mapan. Reproduksi independen atas angka-angka SQABench-CS2, karena setiap angka di atas dilaporkan sendiri. Pengujian ulang terhadap model-model frontier terkini, karena kumpulan pembandingnya sudah usang setahun menurut pengakuan laboratorium itu sendiri. Dan evaluasi manusia yang lebih besar daripada empat belas pertanyaan dari tiga peneliti — blog Ai2 sendiri diakhiri dengan argumen bahwa bidang ini memerlukan evaluasi yang melampaui dukungan sitasi untuk menanyakan apakah sebuah model mempertahankan cakupan bukti dari sumber-sumbernya, termasuk apakah model itu diam-diam mengubah temuan yang spesifik pada sampel menjadi generalisasi yang luas. Itu adalah kritik yang adil terhadap seluruh kategori evaluasi, dan hal itu juga berlaku untuk rilis ini.
Untuk saat ini, penafsiran praktisnya sederhana. Jika Anda menghasilkan laporan bersitasi dari literatur dan Anda menginginkan penulisnya di perangkat keras Anda sendiri, dengan lisensi Apache-2.0, dengan data pelatihan yang terbuka, AstaBrief 8B adalah opsi terbuka yang paling langsung dirancang khusus yang pernah diterbitkan oleh siapa pun, dan pengurangan waktu nyata sebesar 3,5x adalah alasan keberadaannya. Jika pekerjaan Anda bergantung pada sintesis setajam mungkin, perhatikan bahwa tabel Ai2 sendiri menempatkan DR-Tulu lebih unggul dalam preferensi manusia secara keseluruhan dan ScholarQA lebih unggul pada DeepScholarBench — dan bahwa mode Thinking masih ada, di produk yang sama, persis untuk alasan itu.
