Kartu judul untuk Cognition SWE-2 berjudul 'Cognition SWE-2', bersubjudul 'Model coding karya Cognition, pasca-dilatih dari Kimi K3, disajikan di dalam Devin', dengan tiga kartu di bawah yang bertuliskan Dibuat oleh Cognition, Model dasar Kimi K3 2.8T, dan Disajikan di Devin Desktop dan CLI.
Guides & Insights

Cognition SWE-2: Siapa yang Membuatnya, Harness Apa yang Digunakannya, dan Apa yang Sebenarnya Dikatakan oleh Angka-Angka Itu

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Cognition SWE-2 adalah model coding yang dibuat oleh Cognition, perusahaan di balik Devin, dan disajikan di dalam Devin alih-alih melalui API model: tulisan peluncuran Cognition sendiri menyebutkan SWE-2 tersedia lebih dulu di Devin Desktop dan Devin CLI, dengan penyebaran ke Devin Web dan Fusion. Model ini di-post-train dari Kimi K3, model 2,8 triliun parameter milik Moonshot AI. Itulah jawaban lengkap atas pertanyaan yang sebenarnya ditanyakan kebanyakan orang ketika mereka tiba di sini, dan itu layak dinyatakan sebelum hal lain, karena porsi terukur dari pencarian yang mengarah ke halaman ini menambahkan kata keempat — Devin — dan mengaitkan model tersebut dengan Devin, bukan Cognition. Devin adalah agen yang dijual Cognition. SWE-2 adalah model yang dilatih Cognition untuk beroperasi di dalamnya.

Halaman ini adalah halaman referensi, bukan kisah peluncuran. SWE-2 dirilis pada 10 September 2026, yang sudah lebih dari sepekan berlalu; tanggal itu ada di sini untuk menetapkan posisi model dalam waktu, bukan untuk melaporkan suatu peristiwa. Berikut ini adalah apa yang didokumentasikan, siapa yang mendokumentasikannya, dan apa yang belum diperiksa oleh siapa pun.

Siapa yang membuat SWE-2, dan mengapa atribusinya terus bergeser

Kebingungan itu bukan tanpa alasan. Cognition tidak menjual SWE-2 seperti laboratorium menjual model API. Tidak ada kartu model dengan jendela konteks, tidak ada harga token yang dipublikasikan, tidak ada pengenal yang bisa Anda masukkan ke dalam body permintaan. Ada sebuah produk — Devin — dan model itu hadir sebagai bagian darinya. Tulisan Cognition sendiri memperkuat peleburan tersebut: postingan peluncuran ditulis dari sudut pandang Devin, tabel benchmark tidak dijelaskan kepada siapa pun yang belum membaca karya FrontierCode perusahaan yang lebih awal, dan baris ketersediaan menyebutkan Devin empat kali dan Cognition satu kali — di baris penulis.

Jadi, secara gamblang: Cognition membuat SWE-2. Cognition membuat Devin. Keduanya bukan hal yang sama, tetapi saat ini Anda tidak dapat memiliki yang satu tanpa yang lain. Ini juga bukan kebetulan penamaan yang hanya terjadi sekali. Cognition telah merilis serangkaian model rekayasa perangkat lunak dengan awalan SWE — SWE-1.5, SWE-1.6, SWE-1.7 dan sekarang SWE-2, dengan checkpoint SWE-1.6 Preview di sepanjang perjalanan — bersama alat yang lebih khusus seperti SWE-grep dan SWE-check. Awalan tersebut adalah singkatan perusahaan untuk rekayasa perangkat lunak, dan sudah ada sekitar satu tahun sebelum setiap model dalam paragraf ini.

Namanya: sebuah model, bukan tolok ukur

Ini adalah alasan kedua mengapa pencari menghubungkan SWE-2 dengan pemilik yang salah, dan hal ini layak mendapat paragraf tersendiri alih-alih hanya catatan kaki.

SWE-bench adalah tolok ukur. Ini adalah evaluasi independen yang dikelola oleh tim SWE-bench, dihosting di swebench.com, dan tersedia dalam beberapa edisi: kumpulan asli berisi 2.294 instans yang diambil dari issue GitHub nyata, ditambah subset Verified, Lite, Multilingual, dan Multimodal. Ini digunakan untuk menilai agen coding secara umum, termasuk Devin — Cognition menerbitkan laporan teknis Devin-on-SWE-bench pada Maret 2024 yang masih ada di blog mereka.

SWE-2 adalah sebuah model. Ini bukan edisi SWE-bench, dan bukan kependekan dari salah satunya. Tidak ada SWE-bench 2: keluarga yang dipublikasikan mencakup SWE-bench, Verified, Lite, Multilingual, dan Multimodal, dan penomoran versi yang ada merupakan milik subset benchmark tersebut, bukan milik penerus bernomor. Benchmark acuan Cognition untuk model-model ini disebut FrontierCode, yang merupakan instrumen yang sepenuhnya berbeda dan, seperti yang dijelaskan di bagian berikutnya, salah satu yang dimiliki Cognition.

Jika Anda datang ke sini mengharapkan generasi kedua dari evaluasi SWE-bench, itulah keseluruhan kesalahpahamannya.

Tanggal rilis dan bagaimana SWE-2 didistribusikan

Postingan pengumuman Cognition mencantumkan byline 10 September 2026, dan data terstruktur milik halaman itu sendiri memberikan stempel waktu publikasi sebagai 2026-09-10. Keduanya sesuai. SWE-2 tersedia di Devin Desktop dan Devin CLI pada tanggal tersebut, dengan Devin Web dan Fusion menyusul.

Itulah permukaan distribusinya, dan itulah keseluruhan permukaan distribusinya. Tidak ada bobot terbuka — tidak ada apa pun di Hugging Face dari Cognition untuk model ini — dan tidak ada endpoint yang dihosting vendor yang menerima pengenal SWE-2. Jika harness Anda buatan sendiri, SWE-2 bukan komponen yang dapat Anda pasang ke dalamnya hari ini. Jika harness Anda adalah Devin, SWE-2 sudah ada di depan Anda.

Bagi siapa pun yang membutuhkan envelope model dasar alih-alih envelope SWE-2, Kimi K3 adalah hal yang terpisah dan terdokumentasi lebih baik, dan dirutekan di OrcaRouter sebagai kimi/kimi-k3 — satu API untuk 200+ model dengan harga daftar penyedia tanpa markup. Itu penting di sini karena alasan yang spesifik: kemampuan dasar yang menjadi titik awal Cognition dapat dijangkau secara independen, meskipun model yang telah di-post-train tidak.

Cakupan: apa yang didokumentasikan Cognition, dan apa yang tidak.

Halaman referensi seharusnya jujur tentang bentuk buktinya sendiri, dan di sinilah bukti SWE-2 paling tipis.

• Upaya penalaran — tiga level yang didokumentasikan: medium, high, dan max. Cognition menulis bahwa level-level tersebut berperilaku berbeda secara desain: medium lebih cepat bertindak dan menangani pekerjaan sederhana dan menengah, sedangkan high dan max lebih banyak merencanakan, menjelajahi lebih banyak bagian basis kode, dan lebih banyak mengeluarkan sumber daya untuk verifikasi.
• Distribusi — Devin Desktop dan Devin CLI saat peluncuran, Devin Web dan Fusion diluncurkan secara bertahap. Tidak ada API, tidak ada bobot, tidak ada jalur self-host.
• Model dasar — Kimi K3, yang dideskripsikan oleh Cognition sebagai model berparameter 2,8T yang telah menjalani RL ekstensif untuk pengodean agentic. Makalah Kimi K3 memberikan basis tersebut jendela konteks 1 juta token dan visi native.
• Jendela konteks, output maks, modalitas, jumlah parameter pasca-pelatihan — tidak dipublikasikan untuk SWE-2. Pengumuman Cognition tidak menyebutkan satu pun dari hal-hal itu, dan tidak ada halaman Cognition lain yang mengisi kekosongan tersebut.

Perbedaan pada baris terakhir itu bukan sekadar kelebihan teliti. Jendela satu juta token milik Kimi K3 adalah fakta tentang Kimi K3. Cognition tidak menyatakan bahwa SWE-2 mewarisinya, dan pasca-pelatihan dengan resep yang berbeda adalah persis jenis perubahan yang dapat mengubah apa yang diterima suatu model. Jika Anda memerlukan angka jendela konteks untuk perencanaan, angka yang dapat Anda verifikasi adalah milik model dasar, dan Anda sebaiknya memperlakukan milik SWE-2 sebagai tidak diketahui alih-alih mengasumsikan keduanya sama.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

Kartu tarif, dalam satu-satunya mata uang yang dikutip Cognition.

Tidak ada harga per token untuk SWE-2, karena tidak ada endpoint SWE-2. Klaim biaya Cognition dinyatakan dalam satuan yang berbeda: disebutkan bahwa SWE-2 hanya terpaut satu poin dari Claude Fable 5.1 pada FrontierCode 1.1 Main — 50,0% berbanding 50,9% — namun 64% lebih murah. Cermati satuannya dengan saksama. Angka 64% adalah rata-rata dolar AS yang dibelanjakan per rollout pada FrontierCode, angka tingkat tugas yang menggabungkan model, harness, scaffolding, dan stack penyajian Cognition ke dalam satu tagihan. Ini bukan tarif token, dan tidak dapat dibandingkan dengan tarif token.

Kartu tarif yang benar-benar ada adalah milik Devin. Di halaman harga Devin, yang dibaca pada 28 September 2026: Free dengan $0, Pro dengan $20 per bulan, Max dengan $200 per bulan, Teams dengan $80 per bulan ditambah $40 per kursi developer penuh. Baris SWE-2 berada di Pro dan mencantumkan tanggal — "Penggunaan SWE-2 gratis — Gratis di Devin Desktop dan CLI hingga 10 Oktober 2026." Itu adalah jendela promosi dengan sisa sekitar dua minggu, dan itulah satu-satunya angka SWE-2 di halaman tersebut yang benar-benar sensitif terhadap waktu: biaya model di dalam Devin setelah 10 Oktober tidak dicantumkan di sana.

Angka efisiensi Cognition layak dikutip di samping klaim biaya, dan itu dilaporkan vendor seperti semua hal lain di halaman ini. Pada FrontierCode 1.1 Main, SWE-2 dengan upaya sedang mendapat skor di atas SWE-1.7 sambil membutuhkan 58% lebih sedikit giliran dan rata-rata 81% lebih murah. Rata-rata langkah per eksekusi turun dari 127 pada SWE-1.7 menjadi 53 pada upaya sedang, 80 pada upaya tinggi, dan 98 pada upaya maks, dan median suntingan kode nyata pertama bergeser dari langkah 48 ke langkah 18.

Benchmark, dengan harness yang terpasang.

Skor rekayasa perangkat lunak sangat sensitif terhadap scaffold yang digunakan untuk menghasilkannya, sehingga angka tanpa harness-nya bukanlah sebuah angka. Cognition menyatakan kebijakan harness-nya di lampiran metodologi pengumuman: hasil dilaporkan dari sumber publik bila tersedia, dan jika tidak, dijalankan pada kerangka evaluasi internal Cognition menggunakan harness yang menjadi tempat utama pengembangan setiap model — Claude Code untuk model Anthropic, Codex untuk model OpenAI, Grok Build untuk model xAI, dan Devin CLI untuk model open-weight. Untuk setiap model, Cognition melaporkan skor terbaik di seluruh pengaturan reasoning-effort.

Dua konsekuensi mengikuti, dan keduanya berada dalam satu tarikan napas yang sama dengan angka-angka itu. Pertama, beberapa baris tidak sebanding: angka Fable 5.1 yang dihasilkan di Claude Code dan angka Kimi K3 yang dihasilkan di Devin CLI adalah pengukuran dari dua sistem agen yang berbeda, bukan dua model dalam harness netral. Kedua, "skor terbaik di seluruh pengaturan upaya" berarti setiap sel adalah kasus terbaik suatu model, bukan pengaturan yang disamakan. Perbandingan yang menjaga upaya tetap konstan akan terlihat berbeda, dan Cognition tidak menerbitkannya.

Keempat baris di bawah ini dilaporkan oleh vendor dan tidak diaudit.

• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Ini adalah baris utama, dan FrontierCode adalah benchmark milik Cognition sendiri — Cognition menulis tugas-tugasnya bersama lebih dari 20 maintainer open-source, menjalankan papan peringkatnya, dan menilai kiriman yang masuk. Semua itu tidak membuat angkanya salah; semua itu justru harus ada dalam kalimat tempat Anda menyebut ulang angka-angka tersebut.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. Baris di mana SWE-2 paling meyakinkan mengalahkan model frontier secara langsung.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. Angka SWE-2 yang paling bagus, dan edisi Terminal-Bench saat ini bukanlah 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. Baris yang paling jarang dikutip, dan baris di mana model ini berada sekitar 28 poin di belakang frontier.

Perbandingan ini juga memerlukan satu bagian konteks lagi, karena itu menjelaskan dari mana bentuk tak biasa pada baris frontier berasal. Catatan kaki Cognition sendiri pada grafiknya mencatat bahwa pengaturan upaya maksimum Fable 5.1 pada FrontierCode 1.1 Main mencetak 50,3% dengan $12,83 per tugas — di bawah pengaturan sedangnya sendiri pada 50,9% dan $3,28. Upaya lebih besar menghasilkan skor lebih rendah dengan biaya sekitar empat kali lipat. Itulah kurva model frontier yang membelok kembali ke dirinya sendiri, dan itu adalah sebagian alasan mengapa 50,0% versus 50,9% lebih dekat daripada yang disiratkan oleh kedua angka itu saja.

Angka-angka kepercayaan

Bagian keterandalan Cognition yang terpisah adalah bagian dari rilis yang tidak ada hubungannya dengan papan peringkat, dan bagian itu melaporkan bahwa SWE-2 secara keseluruhan lulus 98,0% dari prompt propaganda dan penyensorannya — 99,8% dalam bahasa Inggris, 95,2% dalam bahasa Tionghoa Sederhana dan 99,1% dalam bahasa Tionghoa Tradisional — dan bahwa evaluasi kerentanannya yang bergantung pada konteks tidak menemukan kondisi pembingkaian yang menghasilkan perubahan signifikan secara statistik untuk model apa pun yang diuji. Itu adalah penilaian Cognition, yang dihasilkan dengan juri GPT-5.6 Luna pada set 145 pertanyaan, dan itu dilaporkan oleh vendor dalam pengertian yang sama dengan tolok ukur.

Pembacaan independen: belum ada satu pun.

Per 28 September 2026, SWE-2 tidak memiliki entri di Artificial Analysis. Menelusuri indeks model untuk nama itu tidak menghasilkan apa pun, dan permintaan langsung ke halaman model menghasilkan 404. Satu-satunya papan skor yang memuat SWE-2 adalah FrontierCode, yang dimiliki oleh Cognition. Dengan demikian, rilis ini hanya menyisakan angka-angka yang dilaporkan vendor dan tidak ada yang lain, yang bukan merupakan kritik terhadap angka-angka itu — melainkan pernyataan tentang seberapa banyak dari angka tersebut yang dapat diperiksa oleh pembaca.

Dua hal spesifik akan menyelesaikannya, dan tak satu pun ada saat ini. Pelaksanaan SWE-2 oleh pihak ketiga pada Terminal-Bench 4 akan menentukan apakah ini model yang berdekatan dengan frontier yang kebetulan murah atau model cepat yang kebetulan memimpin edisi yang sudah pensiun. Dan reproduksi independen apa pun atas kesenjangan FrontierCode akan memberi tahu Anda apakah selisih satu poin terhadap Fable 5.1 merupakan properti model atau properti instrumen.

Tidak seperti model-model Cognition sendiri, Artificial Analysis memang mencantumkan Kimi K3 — dan angka-angka Kimi K3 berasal dari pihak ketiga, yang menjadikan model dasar sebagai separuh yang lebih terbukti dari tumpukan ini. Asimetri itulah bentuk praktis SWE-2 saat ini: bagian pasca-pelatihan adalah bagian yang menarik dan paling tidak dapat diverifikasi; model dasar adalah bagian yang terdokumentasi dan yang benar-benar dapat Anda panggil.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

Menggunakan SWE-2, dan apa yang harus dilakukan selama belum diaudit

Jika Anda sudah membayar untuk Devin, keputusannya mudah dan tidak bergantung pada keberatan apa pun di atas. SWE-2 ada di produk Anda, Cognition mengatakan biayanya lebih rendah per tugas daripada model yang digantikannya, dan angka efisiensinya — 58% lebih sedikit giliran, 81% biaya rata-rata lebih rendah, edit pertama median pada langkah 18 alih-alih langkah 48 — menggambarkan model yang membuang lebih sedikit waktu Anda untuk pekerjaan biasa. Mulailah dengan upaya sedang pada ujung sederhana dari antrean Anda, yang menurut desain tingkat upaya Cognition sendiri merupakan tempat keuntungan biaya berada.

Jika Anda memilih model coding dari luar Devin, posisi yang jujur adalah bahwa SWE-2 bukan kandidat yang dapat Anda evaluasi, karena tidak ada yang bisa dipanggil. Tidak ada pengenal, tidak ada harga per token, dan tidak ada endpoint. Yang dapat Anda evaluasi adalah model dasarnya.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 dirutekan di OrcaRouter, dengan $3,00 per 1 juta token masukan dan $15,00 per 1 juta token keluaran tanpa markup atas tarif penyedia, jendela konteks 1 juta token, pemanggilan alat native, masukan gambar, dan kontrol upaya penalaran tingkat atas. Itulah separuh yang dapat dijangkau dari rilis ini: kemampuan yang digunakan Cognition sebagai dasar pasca-pelatihan, tersedia melalui satu endpoint yang kompatibel dengan OpenAI alih-alih produk agen milik satu vendor. Dan karena ini wilayah yang belum diaudit, apa pun jalurnya, Anda dapat menempatkan rantai fallback di belakangnya, sehingga model yang sedang Anda uji coba tidak menjadi dependensi produksi pada hari ia mengecewakan Anda.

Apa yang SWE-2 sampaikan, jika Anda membacanya sebagai bukti dan bukan sebagai halaman produk, lebih sempit dan lebih berguna daripada judulnya: satu proses RL yang dieksekusi dengan baik di atas Kimi K3 menggeser levelnya sekitar lima poin di empat benchmark tanpa mengubah bentuknya, dan membutuhkan 58% lebih sedikit giliran untuk melakukannya. Itu hasil nyata di dalam Devin. Hasil itu belum direproduksi oleh siapa pun di luar Cognition, dan benchmark tempat SWE-2 tampak mengalahkan segalanya adalah benchmark yang sudah berhenti dinilai oleh bidang ini.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari