
Cognition SWE-2: Lập trình cận tiên phong với mức giảm 64%, và cái bẫy benchmark bên dưới
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Cognition SWE-2 ra mắt tuần này với một con số được tạo ra để lan tỏa: 50,0% trên FrontierCode 1.1 Main, chỉ kém Claude Fable 5.1 đúng một điểm ở mức 50,9%, với chi phí rẻ hơn 64%. Mô hình này là bản post-train của Kimi K3 do Moonshot AI phát triển — mô hình nền open-weight 2,8 nghìn tỷ tham số — và Cognition cho biết quá trình học tăng cường của họ đã cộng thêm 5–6 điểm trên một số benchmark. Cả hai con số đều do chính nhà cung cấp đưa ra, và chưa con số nào được tái lập một cách độc lập. Tuy nhiên, con số thứ hai mới là tuyên bố đáng để thay đổi cách bạn đọc con số thứ nhất, bởi "cộng thêm năm hoặc sáu" hóa ra lại mô tả gần như mọi thứ mà SWE-2 làm được, kể cả những chỗ nó thua thảm hại.
Đó không phải là một lời chê bai. Đó là điều hữu ích nhất ở bản phát hành này, và đó là phần mà gần như không bài đưa tin ra mắt nào nói thẳng ra.
Cognition thực sự đã phát hành những gì
SWE-2 là mô hình lập trình của Devin, không phải một mô hình API đa dụng có bảng giá. Nó được phát hành có sẵn bắt đầu từ hôm nay trong Devin Desktop và CLI, theo chính lời của Cognition, với việc triển khai đang diễn ra trên Devin Web và Fusion. Các bài đưa tin của bên thứ ba định ngày công bố là 10 tháng 9 năm 2026; dòng tên tác giả trên bài đăng blog của chính Cognition ghi 09.11.26. Dù thế nào thì nó cũng chỉ mới vài ngày tuổi. Trọng số là độc quyền và không có bảng giá theo từng token nào được công bố. Nếu bạn muốn dùng SWE-2, bạn dùng nó bên trong Devin.
Mô hình nền là Kimi K3, một mô hình Mixture-of-Experts với 2,8 nghìn tỷ tham số, trong đó khoảng 104B tham số hoạt động trên mỗi token — lớn gấp khoảng ba lần so với mô hình nền của SWE-1.7. Cognition lưu ý rằng K3 đã được huấn luyện RL rất nhiều cho lập trình dạng tác tử trước khi đạt đến trình độ đó, và rằng quá trình RL của chính nó "vẫn tìm thấy nhiều dư địa đáng kể". Điều đó phản ánh đúng mô thức từ SWE-1.7, mô hình cũng được huấn luyện hậu kỳ trên một nền tảng Kimi.
Đây là chi tiết quan trọng hơn bất kỳ điểm chuẩn đơn lẻ nào: FrontierCode là bộ đánh giá của Cognition. Công ty này tự viết ra các nhiệm vụ — với hơn 20 người bảo trì mã nguồn mở, hơn 40 giờ cho mỗi nhiệm vụ, mỗi người bảo trì tự định nghĩa thế nào là "có thể hợp nhất" trong repo của chính họ — vận hành bảng xếp hạng và chấm điểm các bài nộp. Đây là một thiết kế đánh giá nghiêm túc, và nó cũng là một công cụ nội bộ. Cognition báo cáo điểm tốt nhất của mỗi mô hình trên các mức thiết lập nỗ lực suy luận, và theo phụ lục phương pháp luận của chính họ, các mô hình so sánh trọng số mở, bao gồm Kimi K3, đều được chạy trong Devin CLI của Cognition. Không điều nào trong số đó khiến những con số trở nên sai. Tất cả những điều đó đều nên xuất hiện ngay trong câu mà bạn lặp lại chúng.

Đọc bảng đánh giá chuẩn một cách trung thực
Bốn benchmark, tất cả đều do nhà cung cấp báo cáo. Đây là những gì mỗi bài thực sự nói lên, mỗi hàng một dòng.
• FrontierCode 1.1 Main — SWE-2 50,0%, so với Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Chỉ cách mức tiên tiến nhất trong vòng một điểm, dẫn trước mọi thứ khác trong bảng.
• DeepSWE 1.1 — SWE-2 đạt 73,0%, dẫn trước Claude Fable 5.1 với 67,4% và Grok 4.6 với 67,5%, xếp sau GPT-6 Astra với 74,1%. Đây là hàng mà SWE-2 đánh bại một mô hình tiên phong một cách thuyết phục nhất.
• Terminal-Bench 2.1 — SWE-2 92,8%, điểm cao nhất trong bảng của Cognition, vượt qua Claude Fable 5.1 ở 91,4% và GPT-6 Astra ở 89,9%. Đây là con số xuất hiện trong hầu hết các tiêu đề khi ra mắt.
• Terminal-Bench 4 — SWE-2 27,3%, so với Claude Fable 5.1 ở 55,8% và GPT-6 Astra ở 57,9%. Khoảng cách khoảng 28 điểm, và là dòng ít được trích dẫn nhất.
Điều phản đối hiển nhiên là mọi người đều tụt điểm trên Terminal-Bench 4 — đây là phiên bản kế nhiệm khó hơn, có tầm xa hơn, nên điểm số giảm là điều đương nhiên. Phần thú vị nằm ở mức giảm là bao nhiêu, và mức giảm không hề tương xứng. Từ Terminal-Bench 2.1 lên 4, Claude Fable 5.1 mất khoảng 35,6 điểm và GPT-6 Astra khoảng 32,0. SWE-2 mất khoảng 65,5, còn mô hình nền Kimi K3 của nó khoảng 66,8. Vậy trong công việc tác tử tầm xa, SWE-2 không chỉ nằm dưới các mô hình tiên phong — nó suy giảm nhanh gần gấp đôi so với chúng khi tác vụ kéo dài.
Việc Terminal-Bench 4 có phải là phiên bản "live" hay không thì đáng được nói thẳng ra: nó là phiên bản hiện hành, còn 2.1 là bản đã bị thay thế. Hàng mà SWE-2 dẫn đầu là bộ đánh giá đã ngừng sử dụng. Hàng mà nó xếp sau là bộ đánh giá hiện hành. Cả hai sự thật đều đúng, và các bài đưa tin về buổi ra mắt thường chỉ chọn một.
“Kimi K3 cộng năm” — phương pháp heuristic dự đoán những điểm số mà chưa ai công bố
Đem bốn benchmark ra đối chiếu với chính mô hình nền của SWE-2, và một điều gần như mang tính máy móc sẽ lộ ra. So với Kimi K3, SWE-2 tăng 5,8 điểm trên FrontierCode 1.1 Main, 4,5 trên DeepSWE 1.1, 4,5 trên Terminal-Bench 2.1, và 5,8 trên Terminal-Bench 4.
Bốn benchmark, bốn khoảng cách, tất cả đều nằm trong khoảng từ 4,5 đến 5,8. Quá trình hậu huấn luyện đã dịch chuyển mức độ, chứ không phải hình dạng. Ở đâu K3 mạnh, SWE-2 cũng mạnh, cộng thêm khoảng năm. Ở đâu K3 yếu — Terminal-Bench 4 là trường hợp rõ ràng — thì SWE-2 cũng yếu, cộng thêm khoảng năm.
Điều đó mang lại cho bạn một dự báo khả dụng cho bất kỳ tác vụ nào mà Cognition không đánh giá chuẩn, mà đó là phần lớn trong số chúng. Hãy tra xem Kimi K3 hoạt động thế nào trên khối lượng công việc của bạn, cộng thêm năm điểm, và bạn có một ước tính về SWE-2 tốt hơn bất kỳ con số tiêu đề nào có thể đưa ra. Nó cũng giải thích luận đề thực sự của bản phát hành: Cognition không tuyên bố đã vượt qua giới hạn tiên phong. Họ tuyên bố đã dịch chuyển toàn bộ đường cong chi phí-hiệu suất ra ngoài trong khi vẫn giữ một khoảng cách cố định phía sau mô hình tốt nhất trên bất kỳ trục nào bạn đo lường.
64% là thật, nhưng bạn không thể mua được nó.
"Rẻ hơn 64% so với Claude Fable 5.1" là một tuyên bố đúng về một phép đo cụ thể — và phép đo đó là số đô la Mỹ trung bình chi cho mỗi lần rollout trên FrontierCode, chứ không phải giá token. Không có mức giá trên mỗi token cho SWE-2 vì không có API SWE-2. Tuyên bố về chi phí mô tả mức chi phí của một tác vụ bên trong Devin, thứ gộp mô hình, harness, scaffolding và serving stack của Cognition vào một hoá đơn duy nhất.
Sự phân biệt đó thực sự có sức nặng. Bạn không thể so sánh chi phí của SWE-2 với giá token từ một nhà cung cấp khác, vì chúng không cùng một đơn vị. Và bạn không thể dùng SWE-2 ở nơi khác: trọng số độc quyền, một nhà cung cấp, một sản phẩm agent. Con số “chi phí thấp hơn tới 70%” trong một số bài đưa tin là mức cao nhất trong khoảng mà Cognition công bố trên các benchmark; con số của FrontierCode 1.1 Main là 64%.
Các con số về hiệu quả, nếu có gì đáng nói, lại là câu chuyện thực tế hơn, và chúng cũng do nhà cung cấp báo cáo. SWE-2 ở mức nỗ lực trung bình vượt điểm FrontierCode của SWE-1.7 trong khi dùng ít hơn 58% lượt và tốn ít hơn 81% chi phí trung bình. Số bước trung bình mỗi lần chạy giảm từ 127 ở SWE-1.7 xuống 53 ở mức nỗ lực trung bình (80 ở mức cao, 98 ở mức tối đa), và lần chỉnh sửa mã thực sự đầu tiên ở mức trung vị chuyển từ bước 48 sang bước 18. Đó là câu trả lời trực tiếp cho lời phàn nàn rằng SWE-1.7 đã khám phá quá mức các tác vụ đơn giản, và đây là kiểu cải thiện xuất hiện trên hóa đơn của bạn từ lâu trước khi khoảng cách điểm chuẩn một điểm làm được điều đó.

Thủ thuật huấn luyện mới là tin thực sự.
Bỏ qua định vị trên bảng xếp hạng, ở đây có một phần kỹ thuật thực sự mới lạ, và đó là lý do bản phát hành này đáng để đọc ngay cả khi bạn chưa bao giờ mở Devin.
Cognition đã huấn luyện cả ba mức nỗ lực suy luận — trung bình, cao và tối đa — trong một lần chạy RL duy nhất. Cơ chế ở đây là một hình phạt chi phí tuyến tính cho mỗi mức nỗ lực, mỗi mức được tinh chỉnh để khớp với độ dốc của đường cong Pareto chi phí–hiệu năng của chính mô hình cơ sở tại điểm đó. Lập luận của Cognition về lý do vì sao hình phạt phải là tuyến tính mới là phần thú vị: chỉ một hình phạt tuyến tính mới giữ cho mục tiêu huấn luyện chỉ còn là một hàm của chi phí trung bình và tỷ lệ giải được, thay vì phụ thuộc vào hình dạng của phân phối.
Cách tiếp cận thông thường huấn luyện các mức nỗ lực một cách riêng rẽ, hoặc gắn thêm một checkpoint rẻ hơn vào sau đó. Việc huấn luyện chúng cùng nhau trong một lần chạy là điều cho phép công ty tuyên bố rằng họ đã đẩy tiến cả đường biên chứ không chỉ một điểm trên đó. Các thay đổi hỗ trợ: một đường cơ sở phần thưởng có trọng số theo độ dài, tăng gấp ba số lượng môi trường RL, các lớp phủ tuân thủ chỉ dẫn, và một bánh đà sử dụng các checkpoint SWE-2 trước đó để làm cứng các bộ xác minh trước hành vi trục lợi phần thưởng. Về phía phục vụ, các kernel NVFP4 và FP8 với huấn luyện nhận biết lượng tử hóa, một mô hình nháp giải mã suy đoán DSpark được huấn luyện lại để có độ dài chấp nhận dài hơn 15%, và một bộ trì hoãn prefill đáng giá 10–20% thông lượng trên mỗi GPU với cái giá là thời gian đến token đầu tiên tệ hơn.
Nếu bạn chạy post-training, công thức đó chính là phần có thể chuyển giao của bản phát hành này. Nếu bạn không chạy, điểm rút ra sẽ đơn giản hơn: lý do SWE-2 rẻ không phải vì nó là một mô hình nhỏ hơn. Mà là vì chi phí vận hành nó đã được viết vào hàm phần thưởng.
Nếu bạn muốn có năng lực của Kimi K3 bên ngoài Devin
SWE-2 không có trên OrcaRouter, và sẽ không bao giờ có — trọng số độc quyền, không có API, chỉ phân phối qua Devin. Mô hình cơ sở của nó lại là câu chuyện khác. Kimi K3 được định tuyến trên OrcaRouter với tên kimi/kimi-k3, ở mức 3,00 USD cho mỗi 1 triệu token đầu vào và 15,00 USD cho mỗi 1 triệu token đầu ra, không tính thêm phí so với mức giá của nhà cung cấp, cửa sổ ngữ cảnh 1 triệu token, gọi công cụ gốc, đầu vào hình ảnh, và độ sâu suy luận được điều khiển thông qua tham số reasoning_effort ở cấp cao nhất thay vì các thiết lập lấy mẫu.
Đó là phiên bản trung thực của điểm rút ra thực tiễn trong bản phát hành này. SWE-2 cho bạn thấy một lượt chạy RL được thực thi tốt trên nền K3 trông như thế nào ở đỉnh cao trong khoảng của nó — mức tăng thật sự từ 4,5 đến 5,8 điểm, cùng những cải thiện lớn về hiệu quả, đổi lại bằng một cái giá thật. Điều nó không mang lại cho bạn là một mô hình mà bạn có thể gọi. Nếu bạn muốn năng lực bên dưới được hướng vào mã của riêng bạn, harness của riêng bạn hay pipeline của riêng bạn, thì K3 là phần của ngăn xếp này mà bạn thực sự có thể tiếp cận, và nó có thể tiếp cận được thông qua một endpoint tương thích OpenAI.
Đây cũng là nửa an toàn hơn của ván cược khi các con số vẫn chưa được kiểm toán. Các benchmark của SWE-2 là của chính Cognition và chưa ai bên ngoài công ty tái lập được chúng. Còn benchmark của Kimi K3 mới là thứ mà phép so sánh thực sự dựa vào — và nếu bạn định tuyến qua OrcaRouter, bạn có thể đặt một chuỗi dự phòng phía sau nó, để một mô hình bạn đang thử nghiệm không trở thành một phụ thuộc production vào đúng ngày nó khiến bạn thất vọng.

Ai nên hành động, và điều gì sẽ giải quyết được nó
Nếu bạn đã trả tiền cho Devin, thì SWE-2 rõ ràng là tin tốt: nó đang được triển khai vào sản phẩm của bạn, chi phí cho mỗi tác vụ rẻ hơn so với thứ mà nó thay thế, và các con số về hiệu suất cho thấy nó sẽ tiêu tốn ít lượt hơn cho những công việc dễ. Hãy thử nó ở phần đơn giản nhất trong hàng đợi của bạn trước — thiết kế theo mức độ nỗ lực nghĩa là mức trung bình mới là nơi mang lại lợi ích về chi phí.
Nếu bạn đang cân nhắc chọn một mô hình lập trình từ bên ngoài, hãy chờ đánh giá độc lập. Hiện vẫn chưa có: Artificial Analysis không có mục nào cho SWE-2, và bảng xếp hạng FrontierCode là công cụ của chính Cognition. Ba điều sẽ định đoạt được chuyện này. Một lần chạy SWE-2 trên Terminal-Bench 4 do bên thứ ba thực hiện — hàng kết quả quyết định liệu đây là một mô hình cận biên giới hay chỉ là một mô hình nhanh. Bất kỳ sự tái lập độc lập nào về khoảng cách FrontierCode. Và một mức giá theo token, thứ sẽ đòi hỏi Cognition phải bán mô hình ra bên ngoài Devin — thay đổi duy nhất có thể khiến con số 64% so sánh được với bất cứ thứ gì khác mà bạn được báo giá.
Cho đến lúc đó, bản tóm tắt công bằng chính là bản mà khoảng cách so với mô hình nền vốn đã nói cho bạn. SWE-2 là Kimi K3 cộng thêm năm điểm, với một cái giá mà Cognition đã thiết kế vào hàm phần thưởng. Đó là một thành tựu thực sự trong huấn luyện và là một thương vụ thực sự tốt khi nằm trong Devin. Nó vẫn chưa phải là một mô hình tiên phong, và cái benchmark duy nhất mà nó dường như đánh bại mọi thứ lại chính là cái đã ngừng được tính.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
