
Cognition SWE-2: Coding yang Berdekatan dengan Frontier dengan Diskon 64%, dan Jebakan Benchmark di Baliknya
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Cognition SWE-2 dirilis minggu ini dengan angka yang dirancang untuk menyebar: 50,0% pada FrontierCode 1.1 Main, hanya berselisih satu poin dari Claude Fable 5.1 pada 50,9%, dengan biaya 64% lebih murah. Model ini adalah hasil post-train dari Kimi K3 milik Moonshot AI — basis open-weight 2,8 triliun parameter — dan Cognition mengatakan pembelajaran penguatannya menambahkan 5–6 poin di beberapa tolok ukur. Kedua angka itu milik vendor sendiri, dan tidak satu pun telah direproduksi secara independen. Namun, angka kedua adalah klaim yang seharusnya mengubah cara Anda membaca yang pertama, karena "plus lima atau enam" ternyata menggambarkan hampir semua yang dilakukan SWE-2, termasuk tempat-tempat di mana ia kalah telak.
Itu bukan sebuah kritik. Itu adalah hal yang paling berguna dari rilis ini, dan itulah bagian yang hampir tidak ada liputan peluncuran yang mengatakannya secara terang-terangan.
Apa yang sebenarnya dirilis Cognition
SWE-2 adalah model coding milik Devin, bukan model API serbaguna dengan daftar harga. Model ini dirilis tersedia mulai hari ini di Devin Desktop dan CLI, dalam kata-kata Cognition sendiri, dengan peluncuran yang sedang berlangsung di Devin Web dan Fusion. Liputan pihak ketiga menyebut pengumuman itu bertanggal 10 September 2026; byline pada postingan blog Cognition sendiri tertulis 09.11.26. Apa pun itu, umurnya baru beberapa hari. Bobotnya bersifat proprietary dan tidak ada kartu tarif per token yang dipublikasikan. Jika Anda ingin menggunakan SWE-2, Anda menggunakannya di dalam Devin.
Basisnya adalah Kimi K3, model Mixture-of-Experts berparameter 2,8 triliun dengan sekitar 104B parameter aktif per token — sekitar tiga kali ukuran basis SWE-1.7. Cognition mencatat bahwa K3 sudah dilatih RL secara intensif untuk pengodean agentik sebelum mencapai titik itu, dan RL-nya sendiri "masih menemukan ruang pengembangan yang signifikan." Hal itu mencerminkan pola dari SWE-1.7, yang juga menjalani post-training pada basis Kimi.
Inilah detail yang lebih penting daripada skor benchmark mana pun: FrontierCode adalah benchmark milik Cognition. Perusahaan itulah yang menulis tugas-tugasnya — bersama lebih dari 20 maintainer open-source, lebih dari 40 jam per tugas, dan setiap maintainer mendefinisikan apa arti "mergeable" di repo mereka masing-masing — menjalankan papan peringkat, sekaligus menilai kiriman. Ini adalah rancangan evaluasi yang serius, dan sekaligus instrumen internal. Cognition melaporkan skor terbaik tiap model di berbagai pengaturan reasoning-effort, dan menurut lampiran metodologinya sendiri, model pembanding berbobot terbuka, termasuk Kimi K3, dijalankan di dalam Devin CLI milik Cognition. Semua itu tidak membuat angkanya menjadi salah. Semua itu justru perlu disertakan saat Anda mengutip angka-angka tersebut.

Membaca tabel benchmark dengan jujur
Empat tolok ukur, semuanya dilaporkan vendor. Berikut ini yang sebenarnya dikatakan masing-masing, satu baris per baris.
• FrontierCode 1.1 Main — SWE-2 50,0%, dibandingkan Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Hanya terpaut satu poin dari posisi terdepan, unggul atas semua yang lain di tabel.
• DeepSWE 1.1 — SWE-2 73,0%, unggul atas Claude Fable 5.1 pada 67,4% dan Grok 4.6 pada 67,5%, tertinggal dari GPT-6 Astra pada 74,1%. Ini adalah baris di mana SWE-2 paling meyakinkan mengalahkan model frontier secara langsung.
• Terminal-Bench 2.1 — SWE-2 92,8%, skor tertinggi dalam tabel Cognition, di atas Claude Fable 5.1 pada 91,4% dan GPT-6 Astra pada 89,9%. Inilah angka yang muncul di sebagian besar headline peluncuran.
• Terminal-Bench 4 — SWE-2 27,3%, dibandingkan dengan Claude Fable 5.1 pada 55,8% dan GPT-6 Astra pada 57,9%. Selisih sekitar 28 poin, dan baris yang paling jarang dikutip.
Keberatan yang jelas adalah bahwa semua orang turun pada Terminal-Bench 4 — ini adalah penerus yang lebih sulit dan berhorizon lebih panjang, jadi tentu saja skornya jatuh. Bagian yang menarik adalah seberapa besar, dan penurunannya tidak proporsional. Beralih dari Terminal-Bench 2.1 ke 4, Claude Fable 5.1 kehilangan sekitar 35,6 poin dan GPT-6 Astra sekitar 32,0. SWE-2 kehilangan sekitar 65,5, dan basisnya Kimi K3 sekitar 66,8. Jadi pada pekerjaan agentik berhorizon panjang, SWE-2 tidak sekadar berada di bawah model-model frontier — ia memburuk sekitar dua kali lebih cepat daripada model-model itu ketika tugasnya berjalan panjang.
Apakah Terminal-Bench 4 adalah versi "live" perlu dinyatakan secara gamblang: itu adalah edisi terkini, dan 2.1 adalah edisi yang telah digantikan. Baris tempat SWE-2 memimpin adalah tolok ukur yang sudah pensiun. Baris tempat ia tertinggal adalah tolok ukur terkini. Kedua fakta itu benar, dan liputan peluncurannya cenderung memilih salah satunya.
"Kimi K3 plus five" — heuristik yang memprediksi skor yang tidak dipublikasikan siapa pun
Sejajarkan keempat tolok ukur itu dengan model dasar SWE-2 sendiri dan sesuatu yang hampir mekanis akan muncul. Dibandingkan Kimi K3, SWE-2 memperoleh 5,8 poin pada FrontierCode 1.1 Main, 4,5 pada DeepSWE 1.1, 4,5 pada Terminal-Bench 2.1, dan 5,8 pada Terminal-Bench 4.
Empat benchmark, empat selisih, semuanya antara 4,5 dan 5,8. Pasca-pelatihan menggeser levelnya, bukan bentuknya. Di mana pun K3 kuat, SWE-2 kuat plus sekitar lima. Di mana pun K3 lemah — Terminal-Bench 4 adalah kasus yang jelas — SWE-2 lemah plus sekitar lima.
Itu memberi Anda perkiraan yang berfungsi untuk tugas apa pun yang tidak diukur oleh Cognition, yang mencakup sebagian besar tugas. Cari tahu bagaimana performa Kimi K3 pada beban kerja Anda, tambahkan lima poin, dan Anda punya estimasi SWE-2 yang lebih baik daripada yang diberikan angka-angka utama mana pun. Ini juga menjelaskan tesis sebenarnya dari rilis tersebut: Cognition tidak mengklaim telah mengalahkan garis terdepan. Mereka mengklaim telah menggeser seluruh kurva biaya-kinerja ke luar sambil tetap berada pada jarak tetap di belakang model terbaik pada sumbu apa pun yang Anda ukur.
64% itu nyata, tetapi Anda tidak bisa membelanjakannya
"64% lebih murah daripada Claude Fable 5.1" adalah pernyataan yang benar tentang pengukuran tertentu — dan pengukuran itu adalah rata-rata dolar AS yang dihabiskan per rollout pada FrontierCode, bukan harga token. Tidak ada tarif per token untuk SWE-2 karena tidak ada API SWE-2. Klaim biaya tersebut menjelaskan berapa biaya sebuah tugas di dalam Devin, yang menggabungkan model, harness, scaffolding, dan stack penyajian Cognition ke dalam satu tagihan.
Perbedaan itu penting. Anda tidak dapat membandingkan biaya SWE-2 dengan harga token dari vendor lain, karena keduanya bukan unit yang sama. Dan Anda tidak dapat membawa SWE-2 ke tempat lain: bobot proprietary, satu vendor, satu produk agen. Angka "hingga 70% lebih murah" dalam beberapa liputan adalah batas atas rentang yang dikutip Cognition di berbagai benchmark; angka FrontierCode 1.1 Main adalah 64%.
Angka efisiensi malah merupakan cerita yang lebih praktis, dan itu pun dilaporkan oleh vendor. SWE-2 pada upaya sedang mengalahkan skor FrontierCode SWE-1.7 sambil menggunakan 58% lebih sedikit giliran dan rata-rata 81% lebih murah. Rata-rata langkah per eksekusi turun dari 127 pada SWE-1.7 menjadi 53 pada upaya sedang (80 pada tinggi, 98 pada maks), dan median suntingan kode nyata pertama bergeser dari langkah 48 ke langkah 18. Itu adalah jawaban langsung atas keluhan bahwa SWE-1.7 terlalu banyak menjelajah pada tugas-tugas sederhana, dan itu adalah jenis peningkatan yang muncul di tagihan Anda jauh sebelum selisih benchmark satu poin muncul.

Trik pelatihannya adalah berita sebenarnya.
Singkirkan positioning papan peringkat, dan ada satu karya rekayasa yang benar-benar baru di sini, itulah sebabnya rilis ini layak dibaca bahkan jika Anda tidak pernah membuka Devin.
Cognition melatih ketiga tingkat upaya penalaran — medium, tinggi, dan maks — dalam satu proses RL. Mekanismenya adalah penalti biaya linier per tingkat upaya, yang masing-masing disetel untuk mencocokkan kemiringan kurva Pareto biaya-kinerja milik model dasar itu sendiri pada titik tersebut. Argumen Cognition tentang mengapa penalti tersebut harus linier adalah bagian yang menarik: hanya penalti linier yang menjaga tujuan pelatihan tetap sebagai fungsi dari biaya rata-rata dan tingkat penyelesaian saja, bukan sesuatu yang bergantung pada bentuk distribusinya.
Pendekatan yang biasa melatih tingkat upaya secara terpisah, atau memasang checkpoint yang lebih murah setelahnya. Melatihnya bersama-sama dalam satu proses adalah yang memungkinkan perusahaan mengklaim telah memajukan seluruh frontier, bukan hanya satu titik di dalamnya. Perubahan pendukung: baseline reward berbobot panjang, melipattigakan jumlah lingkungan RL, overlay yang mengikuti instruksi, dan flywheel yang menggunakan checkpoint SWE-2 sebelumnya untuk memperkuat verifier terhadap reward hacking. Di sisi serving, kernel NVFP4 dan FP8 dengan pelatihan sadar kuantisasi, model draf speculative-decoding DSpark yang dilatih ulang untuk panjang penerimaan 15% lebih panjang, dan penunda prefill yang bernilai 10–20% pada throughput per GPU dengan konsekuensi time-to-first-token yang lebih buruk.
Jika Anda menjalankan pascapelatihan, resep itu adalah bagian yang dapat ditransfer dari rilis ini. Jika tidak, intisarinya lebih sederhana: alasan SWE-2 murah bukan karena modelnya lebih kecil. Alasannya adalah biaya menjalankannya sudah dituliskan ke dalam fungsi imbalan.
Jika Anda ingin kemampuan Kimi K3 di luar Devin
SWE-2 tidak ada di OrcaRouter, dan tidak akan pernah ada — bobot proprietary, tanpa API, distribusi hanya lewat Devin. Model dasarnya adalah situasi yang berbeda. Kimi K3 dirutekan di OrcaRouter sebagai kimi/kimi-k3, dengan $3,00 per 1 juta token masukan dan $15,00 per 1 juta token keluaran tanpa markup di atas tarif penyedia, jendela konteks 1 juta token, pemanggilan alat native, masukan gambar, dan kedalaman penalaran yang dikendalikan melalui tingkat atas reasoning_effort parameter alih-alih pengaturan sampling.
Itulah versi jujur dari pelajaran praktis rilis ini. SWE-2 menunjukkan kepada Anda bagaimana proses RL yang dieksekusi dengan baik di atas K3 terlihat pada puncak rentangnya — peningkatan nyata 4,5 hingga 5,8 poin, plus perolehan efisiensi yang besar, dengan biaya yang nyata. Yang tidak diberikannya kepada Anda adalah model yang dapat Anda panggil. Jika Anda ingin kemampuan yang mendasarinya diarahkan ke kode Anda sendiri, harness Anda sendiri, atau pipeline Anda sendiri, K3 adalah bagian dari stack ini yang benar-benar dapat Anda jangkau, dan ia dapat dijangkau melalui satu endpoint yang kompatibel dengan OpenAI.
Ini juga merupakan separuh taruhan yang lebih aman selama angka-angkanya belum diaudit. Tolok ukur SWE-2 adalah milik Cognition sendiri dan tidak ada orang di luar perusahaan yang mereproduksinya. Tolok ukur Kimi K3-lah yang sebenarnya menjadi dasar perbandingan ini — dan jika Anda merutekan melalui OrcaRouter, Anda dapat menempatkan rantai cadangan di belakangnya, sehingga model yang sedang Anda uji tidak menjadi ketergantungan produksi pada hari ia mengecewakan Anda.

Siapa yang harus bertindak, dan apa yang akan menyelesaikannya
Jika Anda sudah membayar untuk Devin, SWE-2 jelas merupakan kabar baik: produk ini sedang diluncurkan ke produk Anda, biayanya lebih murah per tugas dibandingkan yang digantikannya, dan angka efisiensinya menunjukkan bahwa ia akan membuang lebih sedikit giliran untuk pekerjaan mudah. Cobalah dulu pada ujung paling sederhana dari antrean Anda — desain tingkat upaya berarti medium adalah tempat keunggulan biaya berada.
Jika Anda memilih model coding dari luar, tunggulah evaluasi independen. Belum ada: Artificial Analysis tidak memiliki entri SWE-2, dan papan peringkat FrontierCode adalah instrumen milik Cognition sendiri. Ada tiga hal yang akan menyelesaikannya. Uji coba SWE-2 oleh pihak ketiga pada Terminal-Bench 4, yaitu baris yang menentukan apakah ini model yang berdekatan dengan frontier atau model yang cepat. Reproduksi independen apa pun atas kesenjangan FrontierCode. Dan harga per token, yang akan mengharuskan Cognition menjual model tersebut di luar Devin — satu-satunya perubahan yang akan membuat angka 64% itu sebanding dengan apa pun yang dikutip untuk Anda.
Sampai saat itu, ringkasan yang adil adalah ringkasan yang sudah diberikan oleh kesenjangan model dasar kepada Anda. SWE-2 adalah Kimi K3 plus lima poin, dengan biaya yang dirancang Cognition ke dalam fungsi reward. Itu adalah pencapaian nyata dalam pelatihan dan kesepakatan yang benar-benar bagus di dalam Devin. Model ini belum menjadi model terdepan, dan satu tolok ukur yang tampaknya mengalahkan segalanya adalah tolok ukur yang berhenti dihitung.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
