
Ember-1 Memangkas Penalaran Kimi K3 sebesar 40% — dan Detail Kecilnya Itulah Beritanya
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Angka yang akan dikutip adalah 40%. Fireworks Research menerbitkan Ember-1 pada 23 September 2026, menggambarkannya sebagai turunan khusus dari Kimi K3 milik Moonshot AI yang mempertahankan akurasi K3 sekaligus menghabiskan sekitar 40% lebih sedikit token untuk mencapainya. Itu adalah klaim yang nyata dan luar biasa spesifik, dan klaim itu datang dengan tiga hal yang menyertainya: lembar benchmark lengkap dengan kolom pengurangan token, dua uji A/B pelanggan dari lalu lintas pengodean produksi, dan status rilis yang bukan ketersediaan umum. Ember-1 dirilis sebagai pratinjau riset, di platform serverless milik vendor sendiri, dengan jendela akses dua minggu dan keputusan permanensi yang bergantung pada permintaan. Memahami bagian mana dari ini yang merupakan produk yang sudah dikirim dan bagian mana yang merupakan hasil riset yang argumentasinya kuat adalah inti dari keseluruhan latihan ini.
Ada juga bentrok nama yang layak diluruskan sebelum hal lainnya. Sebuah proyek riset terbuka terpisah bernama Ember (v0.1.5, dari Slow Lit Labs) menghabiskan tahun 2026 untuk menerbitkan evaluasi koherensi jangka panjang, dan sama sekali tidak terkait dengan model ini. Apa pun yang Anda baca tentang Ember yang gagal mengalahkan Qwen3-8B dalam pengaturan inferensi yang setara adalah tentang proyek tersebut. Ember-1, subjek di sini, adalah turunan Kimi K3 dari Fireworks Research.
Apa sebenarnya Ember-1
Ember-1 bukanlah arsitektur baru dan bukan model dasar baru. Ini adalah Kimi K3, yang dilatih ulang untuk bernalar lebih ringkas. Fireworks Research menjalankan lebih dari 50 eksperimen pelatihan dan lebih dari 200 evaluasi pada stack pelatihan serverless miliknya sendiri, yang mencakup matematika, coding, mengikuti instruksi, percakapan, pencarian, penggunaan alat, dan rekayasa perangkat lunak, dengan tujuan eksplisit untuk menghilangkan penalaran yang tidak mengubah jawaban. Lab tersebut mengatakan panjang penalaran dapat dipangkas sebesar 35–50% tanpa kehilangan akurasi di tujuh tolok ukur dan dua kumpulan lalu lintas produksi pelanggan. Setiap angka tersebut dilaporkan oleh vendor dan belum direproduksi secara independen; tidak ada pihak ketiga yang telah menerbitkan uji coba Ember-1 pada saat penulisan ini.
Pembingkaiannya penting karena alternatif yang jelas sudah ada. Kimi K3 hadir dengan pengaturan upaya penalaran, dan cara murah untuk memakai lebih sedikit token adalah menurunkan upaya. Fireworks Research mengatakan pihaknya mencobanya dan pengaturan rendah mengorbankan terlalu banyak kualitas — hasil yang tidak asing bagi siapa pun yang pernah menyetel tingkat upaya pada model penalaran. Klaim Ember-1 adalah bahwa dial upaya itu kasar dan pelatihan ulang itu halus.

Mengapa token penalaran sepadan dengan usaha sebesar ini
Tagihan sebuah model penalaran tidak didominasi oleh jawabannya. Fireworks Research mencatat bahwa K3 dapat menghabiskan lebih dari 90% token yang dihasilkannya untuk penalaran internal sebelum menulis apa pun yang dilihat pengguna. Pada satu permintaan, itu hanya mahal. Dalam loop agen multi-giliran, dampaknya berlipat, karena setiap giliran memutar ulang percakapan sebelumnya, sehingga jejak penalaran dari giliran-giliran sebelumnya dibaca ulang dan ditagih lagi pada setiap panggilan berikutnya. Fireworks Research menggambarkan konteks tumbuh kira-kira secara kuadratik seiring jumlah giliran. Itulah sasaran sebenarnya dari rilis ini, dan itulah sebabnya metrik utamanya adalah sekitar 40% lebih sedikit token, bukan lonjakan kualitas.
Mekanisme ini juga menjelaskan risikonya. Kompresi yang menghilangkan penalaran yang terbuang itu gratis; kompresi yang menghilangkan langkah yang dibutuhkan model tidak. Mode kegagalan yang banyak dilaporkan dari pengurangan penalaran yang terlalu agresif adalah model yang melewati pemeriksaan perantara dan langsung melompat ke kesimpulan, yang pada agen muncul jauh kemudian sebagai pemanggilan alat yang salah alih-alih kalimat yang salah. Penekanan berulang Fireworks Research pada kualitas yang setara terbaca sebagai jawaban atas kekhawatiran itu, dan angka-angka A/B adalah hal yang paling mendekati bukti untuk itu — dengan catatan biasa bahwa set pengujian, kriteria kelulusan, dan ukuran sampel semuanya dipilih oleh pihak yang membuat klaim tersebut.
Lembar tolok ukur, dengan asal-usulnya terlampir
Ini adalah angka-angka Fireworks Research, yang tidak direproduksi. Kolom sebelah kanan adalah bagian yang layak dibaca dengan saksama: kolom itu memasangkan setiap skor dengan berapa banyak token dan dolar yang dibutuhkan relatif terhadap K3 Max.
• Terminal Bench 2.1 (n=89) — Ember-1 82,0% vs K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; token 51,9% lebih sedikit, biaya $23,10 lebih rendah per tugas.
• SWE-bench Verified (n=500) — Ember-1 92,2% vs K3 Max 93,2%; 15,5% lebih sedikit token, $68,10 lebih murah per tugas.
• SWE-Interact (n=75) — Ember-1 20,0% vs K3 Max 21,3%, K3 High 13,3%, K3 Low 6,7%; 32,5% lebih sedikit token.
• DeepSWE 1.1 (n=113) — Ember-1 75,2% vs K3 Max 66,4%; 23,7% lebih sedikit token, $126,90 lebih murah per tugas.
• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High dan Low keduanya 64%; 5,9% lebih sedikit token, $0,30 lebih murah per tugas.
Ada dua hal yang menonjol. Pertama, Ember-1 menang mutlak pada Terminal Bench 2.1 dan DeepSWE 1.1 tetapi kalah tipis pada SWE-bench Verified dan SWE-Interact — pola yang konsisten dengan model yang bukan kehilangan kemampuan, melainkan mengubah tugas mana yang menjadi tempatnya mencurahkan pertimbangan. Kedua, penghematan token sangat tidak merata: 51,9% pada Terminal Bench versus 5,9% pada τ-2 Airline. Apa pun yang dipelajari Ember-1, itu bukan pemangkasan seragam sebesar 40% pada proses berpikir. Angka "sekitar 40%" dalam judul adalah rata-rata dari sebaran yang membentang dari kira-kira 6% hingga kira-kira 52%, dan tim yang beban kerjanya tampak seperti τ-2 Airline sebaiknya tidak berharap merasakannya.
Uji A/B produksi adalah bukti yang lebih persuasif, justru karena uji-uji itu tidak dirancang sebagai tolok ukur. Dalam beban kerja coding salah satu pelanggan, Ember-1 mencetak 0,753 melawan 0,751 milik K3, membutuhkan 21,4 langkah berbanding 23,8, dan mengeluarkan 29,9K token output berbanding 49,3K — pengurangan 71,3% pada token penalaran dan 39% pada total token, dengan kualitas yang kurang lebih setara. Pelanggan kedua melihat sekitar 35% lebih sedikit token per tugas pada kualitas yang sebanding, dan Fireworks Research mengatakan pihaknya menjalankan peralihan itu pada lalu lintas coding dan coworking internalnya sendiri terlebih dahulu, dengan hasil yang dilaporkan bahwa tidak ada yang menyadarinya. Perlakukan semuanya sebagai laporan vendor, tetapi perlakukan sebagai bentuk laporan vendor yang paling kuat: data preferensi A/B dan penyelesaian tugas lebih sulit dimanipulasi daripada papan peringkat.
Ada satu evaluasi lagi, pada Doximity's Bedside Bench — 500 kasus klinis yang divalidasi dokter di sepuluh kategori — di mana Fireworks Research mengklaim Ember-1 menetapkan frontier Pareto baru dalam hal biaya per tugas, membandingkannya dengan model terbuka dan tertutup termasuk GPT-5.6 Sol, GPT-6 Astra, dan Claude Opus 5. Itu adalah klaim vendor tentang posisi Pareto, yang merupakan klaim tentang trade-off dua dimensi, bukan skor tunggal, dan kualitasnya hanya sebaik asumsi biaya di baliknya. Asumsi-asumsi itu berasal dari kartu tarif API publik Kimi K3. Yang membawa kita ke bagian cerita yang benar-benar dapat diverifikasi pembaca hari ini.

Model dasar adalah bagian yang sudah dapat Anda rutekan.
Seluruh argumen biaya Ember-1 diukur terhadap tarif yang dipublikasikan Kimi K3. Kimi K3 sudah aktif di OrcaRouter dengan tarif $3,00 per juta token input, $0,30 per juta token input yang di-cache, dan $15,00 per juta token output, dengan jendela konteks 1.048.576 token. Itu adalah kartu tarif yang sama dengan yang digunakan perbandingan Fireworks Research, dan perlu diketahui bahwa penghematan di kolom pengurangan token tersebut dihitung berdasarkan angka yang dapat Anda lihat sendiri, bukan berdasarkan model biaya internal vendor.
Ember-1 sendiri tidak ada di OrcaRouter. Ember-1 hanya tersedia melalui platform serverless milik vendor itu sendiri, sebagai pratinjau riset, dan Fireworks Research belum menerbitkan harga untuknya — jadi angka dolar dalam tabel benchmark diturunkan dari tarif K3 dan jumlah token, bukan dari kartu tarif Ember-1 yang benar-benar ada. Jika yang menarik bagi Anda adalah aritmetikanya, urutan yang jujur adalah hitung biaya beban kerja pada rute K3 hari ini, anggap persentase pengurangan token sebagai batas atas dari apa yang mungkin diperoleh dari peralihan, dan tunggu tarif yang dipublikasikan sebelum memodelkan penghematan sebagai uang.
Di sinilah OrcaRouter membantu, yakni sebagai lindung nilai. Pratinjau riset dengan jendela akses dua minggu adalah tepat jenis model yang ingin Anda coba tanpa mempertaruhkan jalur produksi padanya, dan cara melakukannya tanpa kontrak kedua adalah dengan menempatkannya di balik endpoint yang sama dengan semua hal lain yang Anda panggil. OrcaRouter menyediakan 200+ model di balik satu API dengan failover otomatis, sehingga model pratinjau yang ternyata tidak tersedia bulan depan hanyalah perubahan routing, bukan migrasi. Tidak ada apa pun pada Ember-1 yang mengharuskan itu — tetapi tidak ada apa pun pada jendela dua minggu yang menentangnya juga.
Apa yang harus dilakukan dengan rilis ini
Jika Anda sudah menjalankan Kimi K3 dalam loop agen, angka-angka Ember-1 menggambarkan tagihan Anda. Masalah replay multi-turn itu nyata,它 adalah biaya dominan dalam proses agen yang panjang, dan model yang mempersingkat trace-nya sendiri tanpa mengubah jawabannya layak untuk waktu evaluasi. Uji yang tepat bukanlah tabel benchmark; melainkan trafik Anda sendiri, dijalankan secara shadow — kirim sebagian permintaan nyata ke kedua model, bandingkan output, biarkan hasil live tidak tersentuh selama satu atau dua minggu sebelum mengubah apa pun. Itu juga saran yang diberikan oleh pembaca kritis rilis itu sendiri, dan saran itu masuk akal.
Jika Anda menjalankan beban kerja dengan deliberasi rendah, atau beban kerja yang didominasi panggilan singkat satu giliran, penghematannya sebagian besar menguap dan baris τ-2 Airline adalah ekspektasi realistis Anda. Dan jika Anda membutuhkan komitmen setingkat produksi — harga, tingkat layanan, jaminan bahwa endpoint masih ada dalam enam bulan — Ember-1 belum menawarkannya. Ini adalah pratinjau riset yang kepermanenannya secara eksplisit dikaitkan Fireworks Research dengan permintaan. Pertanyaan menarik selama sebulan ke depan adalah apakah jendela dua minggu itu menjadi opsi penyajian permanen dan apakah pihak ketiga mereproduksi salah satu angkanya. Sampai salah satu dari itu terjadi, ini adalah hasil yang kuat untuk dibaca dan hasil yang lemah untuk dijadikan dasar menyusun anggaran.

Tak satu pun dari itu boleh ditafsirkan sebagai meremehkan pekerjaan tersebut. Menghilangkan penalaran tanpa menghilangkan akurasi adalah persoalan yang lebih sulit daripada menambahkannya, dan melakukannya di atas model frontier milik orang lain alih-alih melatih model sendiri adalah bentuk yang telah diambil banyak pekerjaan kapabilitas 2026. Ember-1 adalah rilis pertama dalam apa yang menurut Fireworks Research akan menjadi seri berkelanjutan, dan templatnya — ambil model yang sudah bagus, latih ulang satu sumbu perilakunya, jual delta-nya dalam token — layak diperhatikan terlepas dari bagaimana pratinjau khusus ini nantinya berjalan.
