
AREX-2 vs LFM2.5 2.6B Base: Repositori Kosong dan Checkpoint Tanpa Instruksi
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 507 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 194 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Letakkan AREX-2 di samping LFM2.5 2.6B Base dan hal pertama yang sama-sama mereka miliki adalah bahwa tidak ada satu pun dari keduanya yang merupakan produk yang dapat Anda gunakan hari ini — karena alasan yang sama sekali tidak berkaitan satu sama lain. AREX-2 adalah repositori Hugging Face yang dibuat BAAI pada 29 September 2026 pukul 17:56 UTC; repositori itu berisi file .gitattributes, menyimpan nol byte data model, dan tidak membawa kartu model, tag lisensi, maupun pengumuman apa pun. LFM2.5 2.6B Base, yang diterbitkan oleh Liquid AI pada Agustus 2026, adalah jenis belum selesai yang sebaliknya: checkpoint lengkap teks-saja berparameter 2,69 miliar yang dapat diunduh di bawah LFM Open License (lfm1.0) yang sengaja dirilis tanpa penyetelan instruksi, karena model ini dimaksudkan untuk disetel halus, bukan untuk ditanyai pertanyaan.
Yang satu adalah ketiadaan artefak. Yang lain adalah artefak yang kehilangan langkah yang seharusnya tidak pernah dimilikinya. Keduanya termasuk kategori yang sama hanya jika Anda membaca sekilas, dan memperlakukannya sebagai kategori yang sama justru membuat sebuah tim akhirnya menunggu hal yang salah. Perbandingan yang berguna antara keduanya bukanlah kemampuan — tidak ada AREX-2 untuk diukur — melainkan untuk apa masing-masing menjadi bahan baku, dan berapa biayanya untuk mengetahui apakah ia cukup baik.
Perbedaan jenis, dinyatakan lebih dahulu
LFM2.5 2.6B Base adalah sebuah substansi. Ini adalah checkpoint prapelatihan dari keluarga hibrida LFM2.5 milik Liquid AI: 30 lapisan, 22 di antaranya adalah blok konvolusi pendek dengan gerbang ganda dan 8 adalah grouped-query attention, dilatih pada sekitar 34 triliun token dalam 16 bahasa, dengan jendela konteks 131.072 token dan build terkuantisasi yang ukurannya mendekati 1,67 GB pada Q4_K_M. Tidak. Ia tidak memiliki instruction tuning. Beri ia sebuah pertanyaan, ia akan melanjutkan; ia tidak menjawab. Kartu milik Liquid AI sendiri menyebut fine-tuning berat sebagai penggunaan yang dimaksud, dan ada varian pasca-pelatihan bagi siapa pun yang menginginkan model yang merespons prompt. Ini adalah substrat, dan fakta bahwa ia mendapat nilai buruk pada tolok ukur kemampuan mengikuti prompt bukanlah cacat — itulah definisi dari hal itu.
AREX-2 bukanlah suatu zat atau produk; ia adalah namespace. Satu-satunya fakta yang tersedia adalah organisasinya (BAAI), stempel waktu pembuatan (29 September 2026) dan namanya. Tidak ada yang diunggah dan tidak ada yang dikatakan. Nama itu sendiri termasuk dalam keluarga yang memang ada: pada 23 Juli 2026 BAAI merilis AREX-Base, mixture-of-experts 122 miliar parameter dengan 10 miliar parameter aktif yang dibangun di atas Qwen3.5-122B-A10B, dan AREX-Turbo, dense 4B yang dibangun di atas Qwen3.5-4B — keduanya Apache 2.0, keduanya agen riset mendalam dengan desain dua putaran yang mengumpulkan bukti, menghasilkan jawaban kandidat dengan angka keyakinan, lalu memverifikasi jawaban tersebut terhadap batasan awal dan menyempurnakan atau memulai ulang. Angka-angka yang dipublikasikan, dilaporkan vendor dan tidak direproduksi secara independen, mencapai 82,5 pada BrowseComp dan 85,4 pada GAIA untuk Base, serta 70,7 / 81,6 untuk Turbo.
• Ketersediaan — LFM2.5 2.6B Base kini dapat diunduh. AREX-2 tidak memiliki file di repositorinya.
• Ukuran — 2,69B parameter dense untuk model Liquid, semuanya terlihat di checkpoint. Tidak diketahui untuk AREX-2; keluarga ini mencakup MoE 122B dan dense 4B, sehingga "2" tidak memprediksi apa pun.
• Konteks — 131.072 token untuk LFM2.5 2.6B Base. Tidak ada yang dipublikasikan untuk AREX-2.
• Lisensi — LFM Open License v1.0, gratis untuk pendapatan tahunan di bawah $10M dan mewajibkan lisensi terpisah pada atau di atas ambang tersebut. Belum ada tag lisensi pada AREX-0; generasi AREX pertama adalah Apache 2.0.
• Apa itu — substrat fine-tuning versus, jika keluarganya bisa dijadikan patokan, agen terhosting yang nilainya terletak pada siklus pencarian-dan-verifikasi alih-alih pada bobotnya.

Kartu skor kosong yang berarti hal yang berlawanan
Tidak ada dari kedua model tersebut yang memiliki tolok ukur yang sebaiknya Anda jadikan dasar perencanaan, dan alasannya sepenuhnya berbeda.
Liquid AI tidak menyembunyikan apa pun dengan membiarkan Base-nya tanpa skor. Menilai checkpoint yang telah dilatih sebelumnya pada tolok ukur kemampuan mengikuti instruksi akan mengukur ketiadaan fine-tuning, bukan kualitas substratnya — itulah sebabnya perusahaan ini menguji varian yang telah menjalani pasca-pelatihan dan membiarkan Base tanpa evaluasi. Kekosongan itu dapat diverifikasi dari sisi Anda, dan itulah intinya: Anda dapat mengunduh 1,67 GB, menjalankan evaluasi Anda sendiri pada tugas Anda sendiri, dan mengetahui jawabannya sebelum Anda mengeluarkan biaya apa pun untuk serving.
Kekosongan AREX-2 bukanlah keputusan desain, melainkan sesuatu yang belum ada. Tidak ada yang bisa diunduh, jadi tidak ada yang bisa diuji, dan tidak ada evaluasi yang bisa Anda jalankan minggu ini yang akan memberi tahu Anda apa pun tentangnya. Siapa pun yang menerbitkan angka tolok ukur AREX-2 dalam beberapa hari ke depan sedang menerbitkan sesuatu yang tidak mungkin mereka ukur.

Dua pertanyaan fine-tuning yang berbeda
Karena keduanya adalah titik awal, bukan layanan yang sudah jadi, ada baiknya kita tepat tentang untuk apa masing-masing akan menjadi titik awal, karena di situlah keduanya benar-benar tidak lagi mirip satu sama lain.
Checkpoint hibrida 2,69B adalah alat untuk membuat model kecil, murah, dan terspesialisasi. Penggunaan yang menarik justru yang tidak glamor: pengklasifikasi yang membaca jenis dokumen dalam alur kerja teregulasi, model ekstraksi yang mengubah formulir menjadi JSON terstruktur, penulis ulang khusus domain yang berjalan di satu kartu dekat dengan data. Nilainya berasal dari fakta bahwa Anda memiliki artefak itu setelahnya dan biaya marginal per panggilan hanyalah listrik. Loop pelatihan adalah pekerjaannya, dan itu pekerjaan yang bisa Anda mulai hari ini.
AREX-2 mengarah ke arah lain. Keluarga AREX tidak dirancang untuk disetel halus menjadi sebuah produk; ia dirancang untuk dipanggil sebagai agen yang menjalankan pencarian, mengintegrasikan bukti, dan memverifikasi jawabannya sendiri terhadap batasan. Jika generasi kedua melanjutkan itu, hal yang akan Anda evaluasi adalah trajektori — berapa banyak langkah yang diambilnya, apakah ia menyadari adanya kontradiksi, apakah angka keyakinan pada jawaban kandidatnya berarti apa pun. Itu bukan pertanyaan tentang penyetelan halus dan bukan pertanyaan tentang bobot. Itu pertanyaan tentang penyajian, dan itu dimulai dengan seseorang mempublikasikan bobot dan sebuah kartu.
Ini bukan pengganti pada ukuran apa pun. Tim yang membutuhkan model yang dapat dimiliki dan dilatih ulang sendiri tidak menunggu AREX-2. Tim yang membutuhkan agen riset tidak akan melakukan fine-tuning pada hibrida 2,6B untuk menjadikannya agen tersebut.
Di mana lapisan routing cocok, untuk masing-masing
Perbedaan praktis antara keduanya muncul begitu sebuah model masuk ke dalam aplikasi, karena keduanya memiliki hubungan yang berlawanan dengan hosting.
LFM2.5 2.6B Base tidak ada di katalog OrcaRouter dan tidak ada varian LFM2.5, jadi model ini berasal dari distribusi Liquid AI sendiri dan host pihak ketiga yang biasa — artefak lokal, bukan endpoint yang dirutekan. AREX-Base dan AREX-Turbo juga tidak ada di katalog kami. Apa fungsi sebenarnya lapisan perutean dalam gambaran ini adalah sisi lain arsitektur: saat Anda membandingkan fine-tune Anda dengan model-model yang harus dikalahkannya, Anda ingin perbandingan itu hanya memerlukan perubahan konfigurasi, bukan siklus pengadaan. Satu API di depan lebih dari 200 model, harga daftar penyedia diteruskan tanpa tambahan apa pun per token, satu kunci untuk seluruh panel, dan failover agar sore buruk penyedia tidak menjadi sore buruk evaluasi Anda. Itulah kondisi di mana uji A/B pada model yang belum terbukti cukup murah untuk benar-benar dijalankan.
Itu juga merupakan pembingkaian yang jujur untuk AREX-2 sendiri. Saat dirilis — dengan asumsi dirilis dengan bobot terbuka, seperti yang dilakukan dua pendahulunya — cara yang masuk akal untuk mencoba agen yang benar-benar baru pada beban kerja nyata adalah di jalur samping, di belakang failover, bukan sebagai satu-satunya penyedia yang menjadi tumpuan loop produksi Anda.
Apa yang dilakukan orang yang berakal sehat tentang masing-masing hal ini minggu ini
Jika Anda memiliki tugas yang kecil dan terbatas serta data yang tidak boleh keluar dari infrastruktur Anda, Liquid checkpoint tersedia, berukuran kecil, dilisensikan secara permisif di bawah ambang pendapatan, dan dapat diuji sore ini. Unduh, jalankan pada set evaluasi Anda sendiri, dan biarkan hasilnya yang menentukan. Tidak ada apa pun tentang AREX-2 yang mengubah rencana itu.
Jika Anda membutuhkan perilaku riset jangka panjang hari ini, model yang perlu Anda pakai adalah model yang sudah ada: AREX-Base, yang dirilis pada Juli, dengan tolok ukur agen yang dipublikasikan yang setidaknya dapat Anda cocokkan dengan sebuah makalah. AREX-2 hanyalah nama dengan stempel waktu, dan dua hal yang akan mengubah statusnya terlihat dari luar — apakah file muncul di tree, dan apakah kartu dengan jumlah parameter dan lisensi muncul bersama file-file itu.
Mode kegagalan yang artikel ini ada untuk mencegah adalah mode ketika nama yang dicadangkan diperlakukan sebagai item roadmap. Bukan begitu. Itu adalah repositori yang dibuat BAAI kemarin, dan jumlah perencanaan yang tepat untuk dilakukan seputar itu saat ini adalah nol.
