
AstaBrief 8B vs ContextPilot 8B: Dua Jawaban untuk Model Dasar 8B yang Sama
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 220 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Letakkan AstaBrief 8B dan ContextPilot 8B pada satu lembar spesifikasi, dan enam baris pertama keduanya identik. Keduanya adalah checkpoint 8B dense yang di-fine-tune dari Qwen/Qwen3-8B. Keduanya mewarisi arsitektur yang sama — 36 lapisan, ukuran tersembunyi 4096, 32 kepala atensi dengan 8 kepala key-value, kosakata 151.936 token, dan batas posisi 40.960 token milik model dasar. Keduanya bukan arsitektur baru, dan keduanya tidak berusaha menjadi arsitektur baru. Keduanya adalah dua lab yang mengambil bobot dasar beku yang sama dan mengajarkannya dua pekerjaan yang berbeda, dan pekerjaan-pekerjaan itu menunjuk ke dua ujung berlawanan dari agen riset berhorizon panjang: AstaBrief 8B menulis laporan akhir yang disertai sitasi, dan ContextPilot 8B menjaga konteks kerja agen agar tidak kolaps saat agen tersebut mengumpulkan materi.
Itulah keseluruhan perbandingan dalam satu baris, dan itulah juga sebabnya ini bukan adu langsung yang harus Anda baca sebagai pemenang-mengambil-semuanya. Dalam hal lisensi, bukti, dan persyaratan runtime, kedua model tersebut berbeda sepenuhnya, dan perbedaannya lebih informatif daripada skor apa pun yang diterbitkan oleh lab mana pun.
Geometri checkpoint yang sama, dua pewarisan yang berbeda
Mulailah dari apa yang benar-benar dimiliki bersama, karena itulah yang membatasi segala hal lainnya. AstaBrief 8B milik Ai2 dan ContextPilot 8B milik Tencent sama-sama menyatakan Qwen3-8B sebagai basisnya, dan keduanya dibulatkan menjadi sekitar 8 miliar parameter. Repositori ContextPilot 8B mencatat 16,38 GB bobot BF16 di empat shard safetensors, yang merupakan bobot sebuah model dense 8B. Batas atas konteksnya adalah milik basis, tidak berubah pada keduanya: 40.960 posisi dalam konfigurasi, dilatih pada 32K dan dapat diperluas dengan YaRN. Tidak ada dari kedua model ini yang merupakan model konteks panjang. AstaBrief 8B tidak perlu demikian, karena yang diberikan kepadanya adalah kutipan, bukan korpus. ContextPilot 8B sengaja tidak demikian, karena tesisnya adalah membuat jendela kecil bekerja lebih keras.
Yang diubah setiap lab adalah objektif pelatihan, dan objektif-objektif itu hampir tidak bisa lebih berbeda.
• Metode pasca-pelatihan — AstaBrief 8B: supervised fine-tuning lalu offline direct preference optimization, 47K contoh SFT dan sekitar 6K pasangan preferensi, pada delapan H100.
• Metode pasca-pelatihan — ContextPilot 8B: pembelajaran penguatan di atas kerangka kerja manajemen konteks yang proaktif, dengan penggabungan vektor tugas dari tiga proses SFT khusus yang dilapiskan ke basis bawaan.
• Tugas — AstaBrief 8B: menulis laporan multi-bagian dengan sitasi inline dari pertanyaan plus cuplikan literatur yang diambil, dalam satu kali proses.
• Tugasnya — ContextPilot 8B: merencanakan, menyimpan memori jangka panjang, mengambil dari indeks, dan melepaskan konteks yang saat ini tidak dibutuhkan agen, sembari agen terus bernalar dan memanggil alat.
• Runtime — AstaBrief 8B: penyajian standar vLLM atau Transformers, ditambah format prompt yang direkomendasikan dari dataset AstaBrief_prompts.
• Runtime — ContextPilot 8B: runtime agen Tencent, definisi alat, dan pipeline evaluasi dari repositori Tencent/ContextPilot. Checkpoint saja bukanlah agen yang berfungsi.
• Lisensi — AstaBrief 8B: Apache-2.0. ContextPilot 8B: teks Apache-2.0 kustom dengan tambahan Bagian 0 yang membatasi penggunaan untuk penelitian dan pengembangan.
• Bukti — AstaBrief 8B: tabel tolok ukur yang dilaporkan vendor plus angka penggunaan produksi awal dari platform Asta milik Ai2. ContextPilot 8B: klaim dalam makalah arXiv yang diterima di jalur utama EMNLP 2026; kartu model tidak mencantumkan angka apa pun dan belum ada pihak ketiga yang mereproduksinya.
Dua baris dalam daftar itu melakukan lebih banyak pekerjaan daripada yang lain. Baris lisensi menentukan apakah Anda sama sekali dapat menempatkan model ini dalam sebuah produk: ketentuan Apache-2.0 milik AstaBrief 8B mengizinkan penggunaan komersial, sedangkan klausul tambahan ContextPilot 8B tidak. Baris runtime menentukan seberapa banyak dari lab yang harus Anda adopsi bersama bobotnya. AstaBrief 8B adalah checkpoint yang dapat Anda masukkan ke dalam stack serving yang sudah ada. ContextPilot 8B adalah komponen dari sebuah framework, dan bagian-bagian yang membuat framework itu bekerja — kontrak alat, logika rollout, penugasan kredit — berada di dalam kode Tencent, bukan di dalam shard yang Anda unduh.

Di mana masing-masing benar-benar memperoleh tempatnya
Cara yang berguna untuk membandingkan keduanya adalah sebagai sub-agen yang berdekatan dalam sebuah pipeline yang sedang dituju oleh kedua lab itu dari arah yang berlawanan.
Agen sintesis literatur memiliki lapisan pengambilan, lapisan konteks, dan lapisan generasi. ContextPilot 8B menyerang lapisan konteks: ia memberi agen perencanaan, memori jangka panjang terstruktur dengan kemampuan menulis/memperbarui/membaca catatan, pengambilan dari indeks, dan pengalihan konteks lunak, sehingga jendela yang moderat tetap dapat dipakai sepanjang lintasan panjang. Argumen makalah ini adalah bahwa model penyuntingan konteks sebelumnya memiliki tiga kelemahan, dan kerangka kerja ini mengatasinya sekaligus — rangkaian alat yang lebih luas, partial rollout yang sadar konteks yang memusatkan eksplorasi pada suntingan yang benar-benar mengubah lintasan, dan penetapan kredit yang terperinci. Target evaluasinya adalah QA konteks panjang dan pencarian mendalam: InfBench, NovelQA, LongMemEval, BrowseComp+, sesuai pembacaan kami sebelumnya atas repositori.
AstaBrief 8B menyerang lapisan generasi, dan ia mengasumsikan masalah konteks sudah diselesaikan di hulu. Ia tidak mengambil, meringkas cuplikan, mengelompokkan tema, atau memutuskan bukti mana yang disimpan. Ai2 menghapus semua itu dari tugas model dan melatihnya untuk menulis laporan dalam satu kali proses dari kutipan yang dipilih orang lain. Taruhannya adalah bahwa perancah yang mahal bukanlah tempat kualitas berada: Ai2 melaporkan bahwa penulisan ulang satu kali itu menyamai pipeline bertahap bertenaga Claude pada metrik yang dilacaknya sekaligus memangkas waktu generasi seluruh pipeline dari 178,5 detik menjadi 51,1 detik.
Jika digabungkan, kedua model tersebut menggambarkan pembagian kerja yang bisa saja dirancang oleh laboratorium mana pun. Yang satu menjaga working set tetap kecil dan aliran bukti tetap lancar. Yang lain mengubah bukti yang bertahan menjadi prosa dengan sitasi yang dilampirkan. Mode kegagalannya saling melengkapi, bukan tumpang tindih: pengelola konteks yang membuang kutipan yang salah meracuni penulis yang baik, dan penulis yang baik yang diberi kutipan buruk menghasilkan laporan yang fasih tentang hal yang salah.
Komplementaritas itu menjadi argumen untuk memperlakukan masing-masing sebagai komponen yang dapat ditukar, bukan sebagai sebuah komitmen. Jika Anda membangun separuh konteksnya dengan ContextPilot 8B, separuh pembuatan laporannya harus berada di balik antarmuka yang tidak peduli model mana yang ada di belakangnya — AstaBrief 8B yang dihosting sendiri di satu sisi, model frontier terkelola di sisi lain, dan kemampuan untuk berpindah di antara keduanya tanpa menulis ulang pipeline. Menjalankan kedua jalur melalui satu endpoint adalah yang membuatnya menjadi perubahan konfigurasi alih-alih migrasi: satu API untuk 200+ model dengan harga daftar dari penyedia diteruskan pada markup 0%, failover otomatis saat penyedia menurun kinerjanya, dan DSL perutean ketika Anda ingin beberapa model digabungkan menjadi satu panggilan. Penulis yang dihosting sendiri tetap dihosting sendiri karena itulah bagian yang punya cerita sensitivitas data; segala hal di sekitarnya tetap dapat dirutekan karena di situlah fleksibilitas menjadi murah.

Keadaan jujur dari bukti tersebut
Tidak satu pun model memiliki papan skor independen, dan kedua laboratorium itu bahkan tidak mengukur hal yang sama.
• AstaBrief 8B, rata-rata SQABench-CS2 (dilaporkan vendor): 87,0 pada split pengujian, dibandingkan dengan 83,7 untuk checkpoint SFT-nya sendiri dan 77,3 untuk Qwen3-8B dasar.
• AstaBrief 8B, DeepScholarBench (dilaporkan vendor): 53,50, di bawah Asta ScholarQA milik Ai2 sendiri pada 60,25 dan DR-Tulu-8B pada 56,26.
• AstaBrief 8B, tingkat kemenangan berpasangan terhadap pipeline bertenaga Claude milik Ai2 (dilaporkan vendor): 55% pada dev SQABench-CS2, 72% pada test.
• ContextPilot 8B: angka hanya ada di dalam makalah, pada tolok ukur QA konteks panjang dan pencarian mendalam; tidak ada angka di kartu model dan tidak ada reproduksi pihak ketiga.
Satu catatan berlaku untuk keseluruhan kolom AstaBrief dan Ai2 menyatakannya di blog itu sendiri: sebagian besar pelatihan dan evaluasi diselesaikan pada 2025, sehingga model pembanding mencerminkan model terdepan pada saat itu, dan lab tersebut belum menjalankan ulang evaluasi terhadap model-model terdepan saat ini. Bacalah persentase-persentase itu sebagai bukti tentang pilihan desain pada suatu titik waktu, bukan sebagai peringkat saat ini. Angka-angka ContextPilot 8B membawa catatan khas makalah — rangkaian benchmark yang dipilih sendiri, harness yang dijalankan sendiri, tanpa reproduksi di luar Tencent.
Peringatan kedua khusus untuk AstaBrief 8B dan mudah menjadi jebakan dalam praktik. Kartunya memperingatkan bahwa checkpoint tersebut telah di-fine-tune terhadap satu format prompt, yang diterbitkan sebagai berkas dataset, dan bahwa format lain dapat menurunkan perilaku. Jika Anda melakukan benchmark dengannya menggunakan harness chat generik, Anda mengukur harness Anda sama besarnya dengan mengukur model.
Yang mana kamu mau
Pilih AstaBrief 8B ketika hasil akhirnya adalah dokumen. Lisensinya Apache-2.0, ia berjalan di satu GPU dalam kelas 8B BF16, ia tidak memerlukan kerangka kerja agen di sekitarnya, dan ia dilatih khusus untuk tepat satu keluaran: laporan dengan sitasi yang disusun dari bukti yang diambil orang lain. Lisensi komersial adalah faktor penentu bagi sebagian besar tim, dan sikap repositori terbuka Ai2 sendiri — bobot, campuran SFT, campuran DPO, dan format prompt semuanya dipublikasikan — itulah yang membuatnya dapat diaudit, bukan sekadar gratis.
Pilih ContextPilot 8B ketika hasil yang diinginkan adalah trajektori yang berfungsi dan masalah Anda adalah agen lupa atau tenggelam. Lisensi khusus riset menghilangkannya dari pertimbangan produksi untuk sebagian besar perusahaan, dan persyaratan runtime berarti Anda mengadopsi kerangka kerja Tencent, bukan hanya model. Jika Anda sedang menyelidiki manajemen konteks proaktif sebagai teknik, ini adalah tempat awal yang terdokumentasi dengan baik. Jika Anda perlu mengirim produk, ini bukan pilihan yang tepat.
Dan jika Anda memerlukan kedua kemampuan itu, jawabannya bukanlah salah satu model saja — melainkan pasangan itu, yang dirangkai agar masing-masing dapat digantikan. Satu hal yang tidak seharusnya dihasilkan oleh perbandingan ini adalah satu pemenang tunggal, karena kedua checkpoint itu tidak bersaing untuk slot yang sama di dalam sistem.
