
AstaBrief 8B vs Qwen3-8B: Apa yang Ditambahkan oleh Fine-Tune Ai2 ke Model Dasarnya Sendiri
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 220 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tidak ada kisah arsitektur di sini, dan itulah intinya. AstaBrief 8B adalah fine-tune dari Qwen/Qwen3-8B, dan kedua model berbagi konfigurasi hingga ke kepala atensi terakhir: Qwen3ForCausalLM, 36 lapisan, ukuran tersembunyi 4096, 32 kepala atensi dengan 8 kepala key-value, kosakata 151.936 token, dan batas posisi 40.960 token. Semua yang membedakan rilis Ai2 2026-10-02 dari basis April 2025 adalah pasca-pelatihan. Pertanyaan yang menarik karena itu bukanlah mana yang lebih baik secara umum — melainkan apa yang Anda peroleh dari proses pasca-pelatihan tertentu yang didanai besar di atas model dasar yang sudah bisa Anda unduh gratis, dan apa yang harus Anda bayar sebagai imbalannya.
Jawaban Ai2 adalah penulis laporan yang menghasilkan sintesis multi-bagian dengan sitasi dalam sekitar 51 detik, dibandingkan dengan 178,5 detik untuk pipeline berbasis Claude yang digantikannya di dalam platform Asta — sekitar 3,5 kali lebih cepat, dengan Ai2 mengklaim kualitas laporan tetap terjaga pada metrik yang dilacaknya. Jawaban Qwen3-8B adalah generalis dengan mode berpikir hibrida dan non-berpikir, lebih dari seratus bahasa, dan penggunaan hilir selama satu setengah tahun. Keduanya Apache-2.0. Komprominya adalah kemampuan sempit plus kecepatan versus kemampuan luas plus fleksibilitas, dan data di bawah ini membuat bentuknya cukup konkret.
Baris arsitektur tidak melakukan operasi apa pun, jadi prompt tidak.
Karena geometri checkpoint-nya identik, setiap intuisi serving yang Anda miliki tentang Qwen3-8B tetap berlaku tanpa perubahan pada AstaBrief 8B. Model ini adalah model dense 8B dalam BF16, muat di kartu 24GB, dapat disajikan di vLLM atau Transformers tanpa kernel kustom, dan mewarisi batas posisi 40K milik base — tidak ada dari kedua model ini yang merupakan model konteks panjang, dan jendela terlatih 32K diperluas dengan YaRN persis seperti yang dilakukan base. Perencanaan deployment untuk fine-tune adalah perencanaan deployment untuk base. Itu layak dikatakan secara terus terang karena hal itu tidak selalu berlaku untuk fine-tune, dan artinya satu-satunya hal yang Anda evaluasi adalah perilaku.
Perilaku adalah tempat lock-in berada. Kartu AstaBrief memuat peringatan dengan huruf tebal: model tersebut di-fine-tune terhadap satu format prompt tertentu, yang diterbitkan sebagai sft_prompt.txt dalam dataset AstaBrief_prompts, dan Ai2 mengatakan bahwa menggunakan prompt atau format interaksi yang berbeda dapat menyebabkan perilaku yang menurun atau tidak konsisten. Prompt itu bukan templat obrolan santai. Bacalah, dan Anda akan menemukan kontrak yang kaku — slot kueri dalam tanda kurung, blok section_references berisi kutipan yang diberi kunci berdasarkan pengenal, sintaksis sitasi eksplisit yang mengharuskan kunci referensi mengikuti kalimat yang didukungnya, penanda khusus untuk pengetahuan model yang tidak boleh digabungkan dengan sumber lain, dan instruksi untuk membuka setiap bagian dengan TLDR dua kalimat. Qwen3-8B akan menerima apa pun yang Anda ketik. AstaBrief 8B disetel untuk satu bentuk input dan akan berkinerja di bawah standar jika Anda memberinya bentuk lain.
Apa yang dibeli oleh 47.000 contoh dan 6.000 preferensi
Fine-tune ini sepenuhnya pascapelatihan, dan resepnya sengaja konvensional: supervised fine-tuning diikuti oleh optimisasi preferensi langsung secara offline, tanpa reinforcement learning. Ai2 memulai dari kueri nyata yang dikirim melalui sistem Asta miliknya, memfilter 90.000 prompt yang berfokus pada riset untuk kualitas, relevansi, dan privasi, menghasilkan target laporan dengan pipeline ScholarQA multi-langkah menggunakan Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, dan GPT-4.1, lalu menyimpan 47.000 contoh. Tahap preferensi kemudian membangun sekitar 6.000 pasangan, dengan GPT-4.1 dan DeepSeek-R1 menilai dan hanya pasangan yang disepakati yang bertahan.
Diukur pada SQABench-CS2 — 100 pertanyaan penelitian ilmu komputer yang ditulis pengguna — terhadap model dasar, inilah hasil yang diperoleh, dengan setiap angka dilaporkan vendor dan tidak ada yang direproduksi secara independen:
• Rata-rata keseluruhan — AstaBrief 8B 87,0 vs Qwen3-8B 77,3, peningkatan 9,7 poin.
• Recall bahan — 90,2 vs 77,8.
• Presisi sitasi — 90,5 vs 76,2.
• Recall sitasi — 78.2 vs 64.6.
• Presisi jawaban — 89,0 vs 90,6, penurunan 1,6 poin terhadap basis.
Baris terakhir adalah yang seharusnya membentuk ekspektasi. Fine-tuning untuk kualitas laporan tidak secara seragam meningkatkan semuanya; ia menukar sedikit relevansi per paragraf dengan keuntungan besar dalam cakupan dan landasan sitasi. Jika tugas Anda lebih mengutamakan paragraf yang relevan di atas segalanya, model dasar bukanlah pilihan yang jelas lebih buruk, dan hasil fine-tune bukan otomatis jawaban Anda.
Dua hal lain yang tidak dibeli oleh uang itu. AstaBrief 8B tidak memiliki skor yang dilaporkan pada DeepScholarBench yang lebih tinggi daripada alternatif milik Ai2 sendiri — skor 53,50-nya berada di belakang Asta ScholarQA pada 60,25 dan DR-Tulu-8B pada 56,26 — dan validasi manusianya adalah empat belas pertanyaan dari tiga peneliti, dan dalam validasi tersebut DR-Tulu memenangkan preferensi secara keseluruhan. Model spesialis dapat kalah dari model riset serbaguna pada tolok ukur milik spesialis itu sendiri, dan Ai2 mempublikasikan hal itu.

Apa yang masih lebih baik dilakukan oleh model dasar
Perbandingan ini tidak bersifat satu arah, dan sisi generalisnya mudah sekali diremehkan.
Qwen3-8B hadir dengan mode berpikir dan non-berpikir hibrida, sehingga ia dapat menghabiskan token untuk penalaran ketika suatu masalah memerlukannya dan menjawab secara langsung ketika tidak. AstaBrief 8B dilatih untuk penulisan laporan sekali jalan dan tidak mewarisi perilaku penalaran sengaja tersebut sebagai fitur produk. Qwen3-8B juga membawa cakupan multibahasa dari model dasarnya — lebih dari seratus bahasa — sedangkan AstaBrief dilatih pada korpus yang secara eksplisit disaring untuk kueri ilmiah berbahasa Inggris, sehingga kompetensinya di luar jalur tersebut tidak diketahui, bukan sekadar belum diuji.
Lalu ada permukaan instruksi. Generalis adalah yang Anda inginkan ketika tugasnya akan berubah minggu depan, ketika Anda membutuhkan pemanggilan alat, ketika skema keluaran adalah milik Anda, bukan milik Ai2, atau ketika Anda sedang membuat prototipe dan belum tahu seperti apa prompt akhirnya. Dan tentang pertanyaan asal-usul mentah — yang menjadi penting ketika seseorang bertanya mengapa Anda mempercayai model itu — Qwen3-8B telah memiliki lebih dari sebelas juta unduhan dan satu setengah tahun penggunaan independen. AstaBrief 8B baru saja melewati minggu peluncurannya.
Yang dimiliki AstaBrief 8B yang tidak bisa ditandingi oleh model dasarnya adalah disiplin sitasi. Presisi dan recall sitasi adalah dua metrik dengan keunggulan fine-tune paling besar dan paling konsisten dengan cerita pelatihannya — filter tunggal terkuat dalam pipeline data Ai2 adalah kepadatan sitasi, yakni proporsi pernyataan yang menyertakan setidaknya satu sitasi, dan model yang dihasilkan mencerminkan prioritas itu. Membuat model generalis mengutip secara inline dalam format kunci tetap, secara andal, tanpa menghilangkan dukungan untuk klaim, adalah prompt engineering yang Anda tulis dan pelihara. Fine-tune dari Ai2 menjadikan itu perilaku default model.

Lini Qwen telah berkembang sejak April 2025
Satu lagi komplikasi, dan ini praktis: Qwen3-8B sudah berumur satu setengah tahun, dan membandingkan fine-tune baru dengannya tidak sama dengan membandingkannya dengan inkumben yang layak.
Lini Qwen kini mencakup Qwen3.5, Qwen3.6, Qwen3.7, dan Qwen3.8, dan generasi saat ini dapat diakses tanpa mengunduh apa pun. Qwen3.8 27B adalah rute aktif di katalog kami dengan jendela konteks 262.144 token dengan harga $0,33 per juta token input dan $2,40 per juta token output; Qwen3.8 Flash membawa jendela satu juta token dengan harga $0,15 dan $0,47; Qwen3 VL 8B Instruct mencakup kasus multimodal dengan harga $0,18 dan $0,70 per juta dengan jendela 131.072 token dan telah dirutekan sejak Oktober 2025. Qwen3-8B sendiri bukan rute yang kami layani, dan AstaBrief 8B juga bukan — keduanya adalah bobot unduh-dan-jalankan, dan pernyataan yang jujur adalah bahwa basisnya layak ada di perangkat keras Anda dan generasi Qwen modern tidak harus demikian.
Itu memberi Anda opsi ketiga untuk evaluasi yang tidak dapat dijalankan Ai2. Pasang AstaBrief 8B di GPU Anda sendiri, jalankan basis Qwen3-8B di sampingnya untuk mengonfirmasi delta yang dilaporkan, dan arahkan harness yang sama ke model Qwen3.8 yang dihosting untuk skala. Ketiga opsi itu hanya berjarak satu endpoint, itulah yang membuat ini menjadi latihan konfigurasi, bukan proyek pengadaan — satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0% sehingga pemotongan harga vendor langsung berlaku di sisi Anda pada hari yang sama, failover otomatis, dan DSL perutean jika Anda ingin beberapa model menjawab satu pertanyaan bersama-sama. Opsi yang dihosting sendiri tetap dihosting sendiri karena alasan sensitivitas data; semua yang dihosting tetap dapat ditukar, yang penting ketika generasi Qwen berikutnya dirilis dalam satu kuartal.
Cara memutuskan
Ambil AstaBrief 8B jika produk Anda adalah sintesis literatur dengan sitasi dan Anda ingin perilaku sitasi menjadi default model, bukan tanggung jawab prompt Anda. Geometri model dasar berarti tanpa kejutan dalam serving, lisensi Apache-2.0 serta campuran SFT dan DPO yang dipublikasikan membuatnya dapat diaudit, dan keunggulannya dalam presisi dan recall sitasi adalah hasil terbesar dan paling dapat dijelaskan dalam tabel Ai2.
Tetap gunakan Qwen3-8B, atau beralihlah ke Qwen3.x terkini, jika tugas Anda beragam, jika Anda memerlukan mode berpikir atau alat atau cakupan multibahasa, jika Anda masih mengeksplorasi prompt, atau jika Anda lebih suka tidak terkunci pada blok instruksi enam belas ribu karakter yang tidak Anda tulis. Versi base kalah dalam cakupan dan landasan sitasi, bukan dalam hal relevansi, dan versi itu mempertahankan sesuatu yang dilepaskan oleh fine-tune.
Hal yang harus dihindari adalah menganggap rata-rata 87,0 versus 77,3 sebagai keseluruhan cerita. Tabel Ai2 sendiri menunjukkan bahwa fine-tune mengorbankan presisi jawaban untuk memperoleh disiplin sitasi, catatan labnya sendiri mencatat bahwa sebagian besar pelatihan dan evaluasi diselesaikan pada 2025 dan belum dijalankan ulang terhadap frontier terkini, dan model dasar yang ditingkatkannya bukan lagi generasi yang akan Anda pilih untuk apa pun selain perbandingan ini. Apa yang secara nyata ditambahkan oleh fine-tune adalah bentuk keluaran; apakah bentuk itu sepadan dengan kesempitannya sepenuhnya bergantung pada apakah bentuk itu cocok dengan bentuk produk Anda.
