
Ember-1 vs LFM2.5 2.6B Base: Perilaku yang Sudah Jadi versus Substrat Mentah
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Baik Ember-1 maupun LFM2.5 2.6B Base bukanlah model yang bisa Anda ambil dan gunakan, dan keduanya tidak dapat digunakan karena alasan yang berlawanan. Ember-1, yang diterbitkan oleh Fireworks Research pada 23 September 2026, adalah turunan terspesialisasi dari Kimi K3 milik Moonshot AI yang dilatih ulang oleh lab tersebut untuk mencapai akurasi K3 dengan sekitar 40% token lebih sedikit — sebuah perilaku yang sudah final, hanya tersedia sebagai pratinjau riset di platform serverless milik vendor itu sendiri, tanpa bobot dan tanpa harga yang dipublikasikan. LFM2.5 2.6B Base, yang diterbitkan oleh Liquid AI pada 4 Agustus 2026, adalah checkpoint terlatih awal berparameter 2.69B di bawah LFM Open License v1.0 yang sama sekali belum disetel dengan instruksi dan akan melanjutkan teks Anda alih-alih menjawab pertanyaan Anda — substrat mentah, dapat diunduh hari ini, sengaja belum diselesaikan. Membacanya secara berdampingan adalah cara yang baik untuk melihat dua argumen yang diajukan tentang dari mana keuntungan efisiensi kini berasal.
Pertanyaan yang sedang dijawab oleh kedua model
Kedua rilis mengasumsikan premis yang sama: bahwa kemenangan murah dari membuat model lebih besar sebagian besar sudah diraih, dan pekerjaan yang menarik telah beralih ke bagaimana sebuah model menggunakan apa yang sudah dimilikinya. Kedua lab menjawabnya secara berbeda. Fireworks Research mengambil model frontier yang sudah ada dan mengubah perilakunya. Liquid AI membangun model kecil dari nol dan mengubah skalanya. Keduanya bukan cerita arsitektur baru, dan keduanya tidak berusaha memuncaki papan peringkat.
Jawaban Ember-1: pertahankan modelnya, latih ulang perilakunya
Ember-1 tidak mengubah arsitektur Kimi K3 dan menyerang satu inefisiensi spesifik. Model penalaran dapat membakar lebih dari 90% token yang dihasilkan untuk deliberasi internal, dan dalam loop agen multi-turn, jejak tersebut diputar ulang dan ditagih kembali pada setiap turn berikutnya — Fireworks Research menggambarkan pertumbuhan konteks yang dihasilkan sebagai kira-kira kuadratik terhadap jumlah turn. Klaim lab tersebut adalah bahwa penalaran K3 lebih panjang daripada yang dibutuhkan tugas dan kelebihannya dapat dihilangkan tanpa mengubah jawaban. Mereka melaporkan menjalankan lebih dari 50 eksperimen pelatihan dan lebih dari 200 evaluasi pada stack pelatihan serverless miliknya sendiri, dan mengatakan panjang penalaran turun 35–50% tanpa kehilangan akurasi di tujuh benchmark dan dua kumpulan lalu lintas produksi pelanggan. Semua itu dilaporkan vendor dan belum direproduksi.
Hasilnya tidak merata dengan cara yang disembunyikan oleh angka utama. Pengurangan token Ember-1 berkisar dari 51,9% pada Terminal Bench 2.1 hingga 5,9% pada τ-2 Bench Airline. Dalam A/B coding produksi salah satu pelanggan, token keluaran turun dari 49,3K menjadi 29,9K sementara skornya tetap di 0,753 dibandingkan 0,751 — pengurangan 71,3% pada token penalaran. Itu adalah efek besar pada satu bentuk beban kerja dan efek yang hampir tidak terlihat pada bentuk lainnya, yang memang seperti yang Anda harapkan dari model yang dilatih untuk berhenti berpikir berlebihan alih-alih berpikir lebih sedikit.

Jawaban LFM2.5 2.6B Base: ubah skalanya, pertahankan resepnya
LFM2.5 2.6B Base adalah taruhan yang berbeda. Ini adalah arsitektur hybrid Liquid AI dalam skala kecil: 30 lapisan, 22 di antaranya adalah blok konvolusi pendek dengan gerbang ganda dan 8 adalah lapisan grouped-query attention, dilatih pada sekitar 34 triliun token dalam 16 bahasa, dengan jendela konteks 131.072 token. Seluruh checkpoint-nya adalah 2,69B parameter padat — cukup kecil sehingga percakapan tentang biaya tidak lagi tentang token dan mulai tentang GPU tunggal mana yang Anda miliki sebagai cadangan.
Yang membuatnya tidak biasa adalah apa yang sengaja tidak dilakukannya. Tidak ada instruction tuning, dan itulah inti dari sufiks "Base": beri ia sebuah pertanyaan, lalu ia akan melanjutkan teks dengan gaya pertanyaan tersebut alih-alih menjawabnya. Kartu model Liquid AI sendiri merekomendasikannya untuk tugas-tugas yang memerlukan fine-tuning berat. Tidak ada juga evaluasi yang dipublikasikan untuknya, dan itu bukan kelalaian — mengevaluasi checkpoint base pada benchmark pengikutan instruksi tidak akan mengukur apa pun, karena perilaku yang diukur belum dilatih.
Kontrasnya, satu baris per dimensi
• Apa itu — Ember-1: turunan hasil pelatihan ulang dari Kimi K3 dengan penalaran yang dipersingkat. LFM2.5 2.6B Base: checkpoint terpralatih dari nol tanpa penyetelan instruksi.
• Parameter — Ember-1: tidak diungkapkan; diwarisi dari Kimi K3. LFM2.5 2.6B Base: 2,69B dense.
• Bobot — Ember-1: tidak ada yang dipublikasikan. LFM2.5 2.6B Base: tersedia di bawah LFM Open License v1.0.
• Harga — Ember-1: tidak ada yang dipublikasikan; dolar benchmark menggunakan kartu tarif Kimi K3. LFM2.5 2.6B Base: gratis diunduh; Anda menyediakan perangkat kerasnya.
• Konteks — Ember-1: tidak dipublikasikan untuk pratinjau. LFM2.5 2.6B Base: 131,072 token.
• Evaluasi yang dipublikasikan — Ember-1: tujuh tolok ukur dan dua uji A/B, semuanya dijalankan oleh vendor. LFM2.5 2.6B Base: tidak ada, memang dirancang begitu.
• Apa yang Anda dapatkan pada akhirnya — Ember-1: endpoint yang menghasilkan penalaran lebih singkat dengan akurasi setingkat K3. LFM2.5 2.6B Base: titik awal yang perilakunya adalah apa pun yang Anda latih ke dalamnya.
Dua jenis kerinduan yang berbeda
Celah pada kedua rilis ini terlihat simetris, padahal sebenarnya tidak. Ketiadaan evaluasi pada LFM2.5 2.6B Base adalah sifat artefaknya: checkpoint dasar tidak memiliki perilaku untuk dinilai, dan tidak adanya penyetelan instruksi adalah fitur yang didokumentasikan, bukan kekurangan. Ketiadaan itu tidak menciptakan ketidakpastian komersial, karena yang Anda beli adalah berkas dengan lisensi terlampir, dan hasil yang diserahkan sudah lengkap begitu unduhan selesai.
Komponen-komponen Ember-1 yang hilang benar-benar belum terpecahkan. Tidak ada harga yang dipublikasikan, jadi klaim biayanya hanyalah aritmetika atas kartu tarif Kimi K3, bukan tarif yang dapat Anda jadikan dasar anggaran. Tidak ada rilis bobot, sehingga model itu tidak dapat bertahan lebih lama daripada keputusan vendor untuk terus melayaninya. Dan jendela aksesnya digambarkan sebagai sementara: Fireworks Research membingkai rilis risetnya sebagai jendela serverless dua minggu yang sifat permanennya bergantung pada permintaan komunitas. Pratinjau yang mungkin tidak ada bulan depan adalah proposisi yang berbeda dari pratinjau yang sekadar belum terbukti, dan A/B pelanggan kedua dalam pengumuman itu — sekitar 35% lebih sedikit token per tugas — memberi tahu Anda apa yang diharapkan oleh lab tersebut, bukan apa yang masih akan dapat dijangkau pada November.
Asimetri itu adalah jawaban jujur untuk "mana di antara ini yang lebih siap." Tidak ada yang siap dalam arti menjadi dependensi produksi yang bisa langsung dipakai. LFM2.5 2.6B Base sudah selesai sebagai bahan mentah dan belum selesai sebagai model. Ember-1 sudah selesai sebagai model dan belum selesai sebagai layanan.

Apa yang harus dilakukan dengan masing-masing kuartal ini
Jika Anda memiliki pipeline fine-tuning dan tugas yang sempit dengan label yang bersih, LFM2.5 2.6B Base adalah yang lebih dapat diprediksi di antara keduanya. Checkpoint-nya kecil, lisensinya permisif, arsitekturnya dirancang agar efisien saat inferensi, dan pekerjaan untuk mengubahnya menjadi sesuatu yang berguna — supervised fine-tuning, set evaluasi, stack penyajian — adalah pekerjaan yang sudah Anda miliki dari awal hingga akhir. Anda akan tetap menjalankan evaluasi Anda sendiri, karena Liquid AI tidak menerbitkan apa pun.
Jika Anda memiliki beban kerja agen yang dihosting dengan tagihan yang didominasi oleh token penalaran, Ember-1 mengatasi komponen nyata dalam persamaan biaya Anda, dan itu sepadan dengan waktu dua minggu. Uji yang tepat adalah shadow traffic terhadap penyedia yang Anda gunakan saat ini: kirim sebagian permintaan nyata ke keduanya, bandingkan output, biarkan hasil live tidak diubah. Itu juga saran yang diberikan oleh liputan kritis independen atas rilis tersebut, bersama peringatan yang wajar — memadatkan deliberasi berisiko kehilangan langkah yang dibutuhkan model, dan pada agen hal itu nantinya muncul sebagai pemanggilan alat yang salah alih-alih kalimat yang salah.
Kedua model tersebut tidak ada di OrcaRouter. Jika Anda ingin menguji polanya, bukan kedua artefak ini — model kecil yang dapat di-fine-tune dan reasoner besar yang dihosting dalam satu pipeline — itulah tepatnya kegunaan DSL routing: gabungkan beberapa model ke dalam satu panggilan dan biarkan masing-masing menangani bagian yang menjadi keunggulannya, di balik satu kunci dan satu tagihan. Perbandingan di sini layak dilakukan pada tingkat arsitektur meskipun kedua endpoint spesifik tetap di luar jangkauan.
Transaksi itu, dinyatakan sekali
Ember-1 menjual kepastian perilaku dan ketidakpastian pasokan: sebuah model yang kualitasnya diperdebatkan dengan hati-hati dan ketersediaannya secara eksplisit bersifat kondisional. LFM2.5 2.6B Base menjual kepastian pasokan dan ketidakpastian perilaku: sebuah berkas yang akan selalu Anda miliki dan yang kompetensinya sepenuhnya merupakan fungsi dari pelatihan yang Anda berikan padanya. Tim yang punya masalah penyajian dan tidak punya kapasitas pelatihan sebaiknya mengamati pratinjau itu dan berharap ia menjadi permanen. Tim yang punya kapasitas pelatihan dan tugas yang sempit sebaiknya mengunduh basis itu dan berhenti menunggu peta jalan siapa pun.

Apa yang sebenarnya ditunjukkan oleh pasangan ini adalah bahwa "efisiensi" tidak lagi berarti satu hal. Bagi Ember-1, itu berarti token yang lebih sedikit dengan kualitas yang sama pada perangkat keras milik orang lain. Bagi LFM2.5 2.6B Base, itu berarti model yang cukup kecil sehingga perangkat kerasnya sama sekali tidak lagi milik orang lain. Keduanya adalah jawaban yang bagus dan keduanya tidak bisa dipertukarkan.
