
Ember-1 vs Qwen3.8-Max: Turunan Hemat Token Melawan Sang Unggulan
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 177 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Dua model dalam pertarungan ini sama-sama memiliki angka nyata pada tolok ukur yang sama, dan itu tetap tidak menyelesaikan apa pun. Ember-1 adalah turunan khusus Fireworks Research dari Kimi K3 milik Moonshot AI, yang dipublikasikan pada 23 September 2026, melaporkan 82,0% pada Terminal Bench 2.1 dengan sekitar setengah jumlah token yang dihabiskan model dasarnya. Qwen3.8-Max adalah andalan Alibaba — model sparse mixture-of-experts dengan sekitar 2,4 triliun parameter dan sekitar 95 miliar aktif per token — tersedia secara umum sejak 3 Agustus 2026, melaporkan 86,6% pada tolok ukur yang sama. Kedua angka tersebut dilaporkan oleh vendor, kedua laboratorium menjalankan harness-nya sendiri, dan selisih 4,6 poin antara dua pengaturan evaluasi yang tidak dipublikasikan bukanlah sebuah putusan. Yang dapat dibandingkan adalah uangnya, dan di situlah pertarungan ini menjadi menarik: seluruh tesis salah satu model adalah bahwa Anda tidak seharusnya membayar untuk token yang tidak Anda butuhkan, dan yang lainnya adalah andalan dengan harga $2 per juta untuk input dan $6 per juta untuk output.
Apa sebenarnya setiap model itu
Ember-1 bukan model baru dalam pengertian arsitektur apa pun. Ini adalah Kimi K3 yang dilatih ulang agar bernalar lebih ringkas, dibangun oleh Fireworks Research melalui lebih dari 50 eksperimen pelatihan dan lebih dari 200 evaluasi pada stack pelatihan serverless miliknya sendiri. Klaim lab tersebut adalah bahwa penalaran K3 lebih panjang daripada yang dibutuhkan tugas dan kelebihannya dapat dihilangkan tanpa mengubah jawaban — panjang penalaran turun 35–50% tanpa penurunan akurasi pada tujuh benchmark dan dua uji A/B produksi pelanggan. Ini tersedia sebagai pratinjau riset di platform serverless milik vendor itu sendiri, tanpa bobot yang dipublikasikan dan tanpa harga yang dipublikasikan.
Qwen3.8-Max adalah objek dengan jenis yang sama sekali berbeda. Ini adalah tier terdepan milik Alibaba, yang secara native bersifat multimodal untuk input teks, gambar, dan video, membawa jendela konteks satu juta token, dan telah diperbarui dua kali sejak diluncurkan: pembaruan pasca-pelatihan pada 2 September 2026 yang ditujukan untuk pengodean dan pekerjaan kantor profesional, serta tier penyajian yang lebih cepat yang diumumkan pada 22 September 2026. Alibaba memosisikannya sebagai pesaing GPT-5.5, Claude Opus 4.7, dan Gemini 3.1 Pro, dan lembar evaluasi yang dipublikasikannya mencerminkan ambisi tersebut — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8, dan Humanity's Last Exam pada 43,6, semuanya dilaporkan oleh vendor.

Kartu tarif, berdampingan
Salah satu dari ini memiliki harga dan yang lainnya tidak, yang merupakan asimetri praktis pertama.
• Input — Ember-1: tidak ada yang dipublikasikan; lembar benchmark menghitung dolar dari kartu tarif Kimi K3. Qwen3.8-Max: $2,00 per juta token di OrcaRouter.
• Output — Ember-1: tidak ada yang dipublikasikan. Qwen3.8-Max: $6.00 per juta token.
• Input yang di-cache — Ember-1: tidak berlaku. Qwen3.8-Max: $0.25 per juta token untuk pembacaan cache, yang merupakan seperdelapan dari tarif input dan sangat penting dalam loop agen di mana konteks yang sama dikirim ulang setiap giliran.
• Jendela konteks — Ember-1: tidak dipublikasikan untuk pratinjau; model dasarnya memiliki 1.048.576 token. Qwen3.8-Max: 1.000.000 token.
• Multimodalitas — Ember-1: teks. Qwen3.8-Max: teks, gambar dan video masuk, teks keluar.
• Bobot — Ember-1: tidak ada. Qwen3.8-Max: ada rilis bobot terbuka, tetapi hanya teks dan tidak memiliki jendela konteks penuh serta input visi dari endpoint yang dilayani.
• Akses — Ember-1: pratinjau riset, jendela serverless dua minggu, permanensi bergantung pada permintaan. Qwen3.8-Max: tersedia secara umum dan telah diberi harga.
Satu hal yang perlu diperhatikan tentang tarif Qwen3.8-Max sebelum memodelkan apa pun: Alibaba telah berulang kali merevisi paket model ini sejak peluncuran, dan kartu tarif internasional tidak selalu sesuai dengan angka utama Agustus. Anggap $2.00 dan $6.00 sebagai harga rute saat ini di platform kami — yang meneruskan harga daftar penyedia tanpa markup, sehingga perubahan vendor terlihat pada hari yang sama — dan periksa kartu tarifnya sebelum Anda mengalokasikan anggaran untuk itu.
Mengapa perbandingan benchmark tidak berfungsi
Angka 82,0% Ember-1 dan 86,6% Qwen3.8-Max sama-sama berasal dari Terminal Bench 2.1, yang membuat keduanya tampak sebanding—dan justru tidak membuat keduanya sebanding. Lembar Ember-1 melaporkan angkanya terhadap varian Kimi K3 yang dievaluasi oleh Fireworks Research, pada 89 sampel, dengan delta token dan biaya yang disertakan. Angka Qwen3.8-Max berasal dari lembar evaluasi Alibaba sendiri. Laboratoriumnya berbeda, harness-nya berbeda, agent scaffold-nya berbeda, dan dalam benchmark yang skornya bergeser beberapa poin hanya karena pilihan scaffold, selisih 4,6 poin berada di dalam batas derau metodologi.
Apa yang bisa Anda baca dari sheet Ember-1 adalah kolom token, satu-satunya hal yang model dilatih untuk ubah. Dibandingkan dengan basisnya sendiri, Ember-1 menghabiskan 51,9% lebih sedikit token pada Terminal Bench 2.1, 32,5% lebih sedikit pada SWE-Interact, 23,7% lebih sedikit pada DeepSWE 1.1, dan hanya 5,9% lebih sedikit pada τ-2 Bench Airline. Sebaran itulah headline yang jujur. Model yang memangkas deliberasi bernilai besar pada benchmark tempat model dasar terlalu banyak berpikir dan hampir tidak bernilai di mana model dasar tidak berpikir berlebihan, dan Anda tidak bisa tahu jenis beban kerja mana yang Anda miliki tanpa mengukur beban kerja Anda sendiri.
Biaya per tugas yang diselesaikan, dihitung secara rinci
Berikut adalah perhitungan yang sebenarnya menentukan ini, dengan menggunakan tarif yang dipublikasikan Kimi K3 sebagai pengganti biaya Ember-1, karena Ember-1 tidak memiliki tarif sendiri. Kimi K3 adalah $3,00 per juta token input, $0,30 untuk cache, dan $15,00 output — persis seperti kartu tarif yang digunakan Fireworks Research dalam perbandingannya sendiri. Qwen3.8-Max adalah $2,00 untuk input dan $6,00 untuk output, dengan pembacaan cache sebesar $0,25.
Di sisi input, Qwen3.8-Max sudah lebih murah sepertiga. Di sisi output, harganya 2,5 kali lebih murah per token. Itu berarti pengurangan token Ember-1 tidak bersaing dengan tagihan statis — ia bersaing dengan model unggulan yang sudah lebih murah per token sebelum ada upaya efisiensi apa pun. Uji A/B produksi Fireworks Research sendiri menunjukkan token output turun dari 49,3K menjadi 29,9K, pengurangan total 39%; terapkan itu pada tarif output Qwen3.8-Max dan Anda mendapatkan penghematan 39% yang sama, yang merupakan kemenangan absolut lebih kecil daripada persentase yang sama yang diterapkan pada tarif $15 K3.
Argumen efisiensi untuk Ember-1 karena itu paling kuat ketika diukur terhadap model dasarnya sendiri, dan itulah tepatnya argumen yang diajukan dalam rilis ini. Dibandingkan dengan Qwen3.8-Max, perbandingannya bergeser ke kemampuan per dolar, di mana konteks yang lebih besar, input multimodal, dan ketersediaan berbayar dari model unggulan tersebut menjadi kontra-argumennya — dan di mana belum ada yang menerbitkan adu langsung yang bisa menyelesaikannya.

Apa yang ditunjukkan oleh data routing kami sendiri
Dua dari tiga model yang terlibat di sini adalah rute aktif di OrcaRouter, yang memberikan gambaran yang tidak dimiliki lembar benchmark mana pun. Qwen3.8-Max dilayani dengan konteks 1.000.000 token dengan latensi token pertama median sekitar 2,0 detik dan sekitar 52,7 token keluaran per detik selama tujuh hari terakhir, dengan tingkat kesalahan sekitar 4,2%. Kimi K3 — model dasar Ember-1, dan titik acuan bagi setiap penghematan yang diklaim Ember-1 — berjalan pada konteks 1.048.576 token, latensi median mendekati 8,0 detik, sekitar 43,6 token keluaran per detik dan tingkat kesalahan sekitar 0,27%, pada lalu lintas yang jauh lebih tinggi. Ember-1 sendiri tidak ada di OrcaRouter.
Angka-angka itu mengubah kerangka keputusan. Kimi K3 jauh lebih lambat mencapai token pertama dan sekitar dua kali lebih mahal per token keluaran dibandingkan Qwen3.8-Max, sekaligus memiliki tingkat kesalahan yang jauh lebih rendah di bawah beban yang jauh lebih berat. Turunan K3 yang hemat token mempersempit kesenjangan biaya tetapi tidak menutup kesenjangan latensi, karena memperpendek penalaran memperpendek fase generasi, bukan antrean. Jika beban kerja Anda sensitif terhadap latensi ketimbang sensitif terhadap tagihan, model unggulan adalah pilihan yang lebih baik saat ini dan narasi efisiensi menjadi tidak relevan.
Yang mana yang harus dirutekan
Rutekan Qwen3.8-Max saat Anda memerlukan jendela konteks, input multimodal, harga yang dipublikasikan, dan layanan yang bisa Anda anggarkan. Dari keduanya, ia lebih aman secara konstruksi: tersedia secara umum, memiliki harga, dan diperbarui dua kali dalam dua bulan oleh vendor yang memiliki rekam jejak dalam menjaga endpoint tetap mutakhir.
Cobalah Ember-1 ketika tagihan Anda didominasi oleh token penalaran dalam putaran agen yang panjang dan Anda menggunakan model yang dihosting, bukan perangkat keras Anda sendiri. Uji yang tepat adalah dua minggu yang diberikan pratinjau kepada Anda, dijalankan secara shadow terhadap lalu lintas produksi, mengukur token per tugas yang diselesaikan, bukan token per permintaan. Yang tidak boleh Anda lakukan adalah menukarnya sebagai pengganti setara untuk model unggulan berdasarkan angka 40% yang berkisar dari 6% hingga 52% tergantung pada beban kerja.
Jika pertanyaan sebenarnya adalah apakah tetap menjalankan Kimi K3 sama sekali, itu bisa Anda jawab hari ini tanpa pratinjau apa pun: baik Kimi K3 maupun Qwen3.8-Max ada di OrcaRouter di balik satu kunci, dengan harga sesuai daftar penyedia tanpa markup, dengan failover otomatis antar penyedia. Membandingkan biaya beban kerja Anda pada keduanya adalah perubahan routing, bukan proyek pengadaan — dan itu memberi Anda baseline yang membuat klaim efisiensi apa pun tentang Ember-1 dapat diukur dalam angka Anda sendiri, bukan angka laboratorium.

Ringkasan jujurnya adalah bahwa kedua model ini dioptimalkan terhadap kendala yang berbeda. Qwen3.8-Max dibangun untuk menjadi yang paling cakap yang tersedia dan harganya pun disesuaikan; Ember-1 dibangun untuk membuat model yang sudah mahal menjadi lebih murah untuk dijalankan. Keduanya sah, dan alasan perbandingan ini sulit menghasilkan putusan yang bersih adalah bahwa penghematan model turunan didefinisikan relatif terhadap daftar tarif yang justru jauh lebih murah ditawarkan oleh model andalan.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
