Thẻ tiêu đề cho Cognition SWE-2 có tiêu đề 'Cognition SWE-2', phụ đề 'Một mô hình lập trình của Cognition, được hậu huấn luyện từ Kimi K3, phục vụ bên trong Devin', với ba thẻ bên dưới ghi Được tạo bởi Cognition, Mô hình cơ sở Kimi K3 2.8T, và Được phục vụ trong Devin Desktop và CLI.
Guides & Insights

Cognition SWE-2: Ai tạo ra nó, nó chạy trong harness nào, và những con số thực sự nói lên điều gì

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cognition SWE-2 là một mô hình lập trình do Cognition tạo ra, công ty đứng sau Devin, và nó được phục vụ bên trong Devin chứ không phải qua API mô hình: bài đăng công bố của chính Cognition nói rằng SWE-2 có mặt trên Devin Desktop và Devin CLI trước tiên, rồi mới triển khai dần sang Devin Web và Fusion. Nó được huấn luyện hậu kỳ từ Kimi K3, mô hình 2,8 nghìn tỷ tham số của Moonshot AI. Đó là toàn bộ câu trả lời cho câu hỏi mà hầu hết mọi người thực sự đang đặt ra khi họ đến đây, và điều đó đáng được nói ra trước tiên, bởi vì một phần đáng kể các lượt tìm kiếm dẫn đến trang này có thêm một từ thứ tư — Devin — và gán mô hình cho Devin thay vì cho Cognition. Devin là tác nhân mà Cognition bán. SWE-2 là mô hình mà Cognition huấn luyện để vận hành bên trong nó.

Trang này là một trang tham chiếu chứ không phải một bài đưa tin ra mắt. SWE-2 đã phát hành vào ngày 10 tháng 9 năm 2026, tức đã hơn một tuần kể từ đó; ngày tháng ở đây là để cố định mốc thời gian cho mô hình, chứ không phải để tường thuật một sự kiện. Phần tiếp theo là những gì đã được ghi nhận, ai đã ghi nhận, và những gì chưa ai kiểm tra.

Ai tạo ra SWE-2, và tại sao việc ghi công cứ mãi trôi dạt

Sự nhầm lẫn này không phải là vô lý. Cognition không bán SWE-2 theo cách một phòng thí nghiệm bán một mô hình API. Không có model card nào kèm context window, không có giá token được công bố, không có định danh nào để bạn truyền vào request body. Có một sản phẩm — Devin — và mô hình đến như một phần của sản phẩm đó. Những gì Cognition tự viết càng củng cố sự hòa lẫn này: bài đăng ra mắt được viết từ góc nhìn của Devin, bảng benchmark không được giải thích cho bất kỳ ai chưa đọc công trình FrontierCode trước đó của công ty, và dòng về tính sẵn có nhắc tên Devin bốn lần, còn Cognition một lần — nằm ở dòng byline.

Vậy, nói thẳng ra: Cognition tạo ra SWE-2.Cognition tạo ra Devin. Hai thứ này không phải là một, nhưng hiện tại bạn không thể có cái này mà không có cái kia. Đây cũng không phải là một sự cố đặt tên chỉ xảy ra một lần. Cognition đã phát hành một loạt mô hình kỹ thuật phần mềm dưới tiền tố SWE — SWE-1.5, SWE-1.6, SWE-1.7 và giờ là SWE-2, cùng với một checkpoint SWE-1.6 Preview trên chặng đường đó — song song với những công cụ hẹp hơn như SWE-grep và SWE-check. Tiền tố này là cách viết tắt của công ty để chỉ kỹ thuật phần mềm, và nó ra đời trước mọi mô hình trong đoạn này khoảng một năm.

Tên gọi: một mô hình, không phải một thước đo chuẩn

Đây là lý do thứ hai khiến những người tìm kiếm gán SWE-2 cho sai chủ sở hữu, và nó xứng đáng có một đoạn riêng thay vì chỉ là một chú thích.

SWE-bench là một benchmark. Đây là một đánh giá độc lập do nhóm SWE-bench duy trì, được lưu trữ tại swebench.com, và được phát hành dưới nhiều phiên bản: bộ gốc gồm 2.294 mẫu lấy từ các issue thực tế trên GitHub, cùng với các tập con Verified, Lite, Multilingual và Multimodal. Nó được dùng để chấm điểm các coding agent nói chung, bao gồm cả Devin — Cognition đã công bố một báo cáo kỹ thuật về Devin trên SWE-bench từ tháng 3 năm 2024, và báo cáo này vẫn còn trên blog của họ.

SWE-2 là một mô hình. Nó không phải là một phiên bản của SWE-bench, và cũng không phải là tên viết tắt của một phiên bản nào. Không có SWE-bench 2: dòng sản phẩm đã công bố gồm SWE-bench, Verified, Lite, Multilingual và Multimodal, và cách đánh số phiên bản hiện có thuộc về các tập hợp con của benchmark, chứ không thuộc về một bản kế nhiệm được đánh số. Benchmark chính thức được ghi nhận của Cognition cho các mô hình này có tên là FrontierCode, một công cụ hoàn toàn khác và, như phần tiếp theo sẽ giải thích, do chính Cognition sở hữu.

Nếu bạn đến đây với mong đợi về một thế hệ thứ hai của bộ đánh giá SWE-bench, thì đó chính là toàn bộ sự hiểu lầm.

Ngày phát hành và cách SWE-2 được phân phối

Bài đăng thông báo của Cognition mang dòng ghi ngày 10 tháng 9 năm 2026, và dữ liệu có cấu trúc của chính trang đưa dấu thời gian xuất bản là 2026-09-10. Cả hai đều khớp. Vào ngày đó, SWE-2 đã có mặt trong Devin Desktop và Devin CLI, với Devin Web và Fusion ra mắt sau đó.

Đó là bề mặt phân phối, và đó là toàn bộ bề mặt phân phối. Không có trọng số mở — không có gì trên Hugging Face từ Cognition cho mô hình này — và không có endpoint do nhà cung cấp lưu trữ nào nhận định danh SWE-2. Nếu harness của bạn là của riêng bạn, SWE-2 không phải là một thành phần bạn có thể cài đặt vào nó ngay hôm nay. Nếu harness của bạn là Devin, SWE-2 đã ở ngay trước mặt bạn.

Đối với bất kỳ ai cần đến phạm vi của mô hình cơ sở thay vì của SWE-2, Kimi K3 là một thứ riêng biệt và được ghi tài liệu tốt hơn, và nó được định tuyến trên OrcaRouter dưới dạng kimi/kimi-k3 — một API cho hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp, không đánh thêm phí. Điều đó quan trọng ở đây vì một lý do cụ thể: năng lực nền tảng mà Cognition khởi đi từ đó có thể tiếp cận được một cách độc lập, dù mô hình đã qua huấn luyện sau thì không.

Ranh giới: những gì Cognition ghi lại, và những gì không.

Một trang tham chiếu nên trung thực về hình hài bằng chứng của chính mình, và đây chính là chỗ bằng chứng của SWE-2 mỏng manh nhất.

• Mức độ suy luận — ba mức được ghi nhận trong tài liệu: medium, high và max. Cognition cho biết các mức này hoạt động khác nhau theo thiết kế: medium bắt tay vào hành động sớm hơn và đảm nhận các công việc đơn giản lẫn trung bình, trong khi high và max lập kế hoạch nhiều hơn, khám phá codebase nhiều hơn và dành nhiều công sức hơn cho việc kiểm chứng.
• Phân phối — Devin Desktop và Devin CLI khi ra mắt, Devin Web và Fusion sẽ được triển khai dần. Không có API, không có trọng số, không có lộ trình tự vận hành.
• Mô hình nền tảng — Kimi K3, được Cognition mô tả là mô hình 2,8T tham số đã trải qua quá trình RL chuyên sâu cho lập trình tác tử. Bài báo về Kimi K3 cho mô hình nền này cửa sổ ngữ cảnh 1M token và khả năng thị giác gốc.
• Cửa sổ ngữ cảnh, đầu ra tối đa, các phương thức, số lượng tham số sau huấn luyện — không được công bố cho SWE-2. Thông báo của Cognition không đề cập gì đến bất kỳ mục nào trong số đó, và không có trang nào khác của Cognition lấp đầy khoảng trống này.

Sự phân biệt trong hàng cuối cùng đó không phải là sự câu nệ tiểu tiết. Cửa sổ một triệu token của Kimi K3 là một sự thật về Kimi K3. Cognition không nói rằng SWE-2 thừa hưởng nó, và việc huấn luyện sau trên một công thức khác chính là kiểu thay đổi có thể làm thay đổi những gì một mô hình chấp nhận. Nếu bạn cần một con số cửa sổ ngữ cảnh để lập kế hoạch, con số bạn có thể xác minh thuộc về mô hình cơ sở, và bạn nên coi con số của SWE-2 là chưa biết thay vì giả định rằng hai con số đó khớp nhau.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

Bảng giá, bằng loại tiền tệ duy nhất mà Cognition báo giá.

Không có giá trên mỗi token cho SWE-2, vì không có endpoint SWE-2. Tuyên bố về chi phí của Cognition được định giá theo cách khác: nó nói rằng SWE-2 đạt trong vòng một điểm so với Claude Fable 5.1 trên FrontierCode 1.1 Main — 50.0% so với 50.9% — trong khi rẻ hơn 64%. Hãy đọc kỹ đơn vị. 64% là số đô la Mỹ trung bình chi cho mỗi lần rollout trên FrontierCode, một con số ở cấp độ tác vụ gộp mô hình, harness, scaffolding và ngăn xếp phục vụ của Cognition vào một hóa đơn. Đó không phải là mức giá theo token, và không thể so sánh với nó.

Bảng giá thực sự tồn tại là của Devin. Trên trang định giá của Devin, đọc ngày 28 tháng 9 năm 2026: gói Free ở mức $0, gói Pro $20 mỗi tháng, gói Max $200 mỗi tháng, gói Teams $80 mỗi tháng cộng thêm $40 cho mỗi chỗ ngồi lập trình viên đầy đủ. Dòng SWE-2 nằm trong gói Pro và mang một mốc ngày — "Sử dụng SWE-2 miễn phí — Miễn phí trong Devin Desktop và CLI đến hết ngày 10 tháng 10 năm 2026." Đó là một cửa sổ khuyến mãi còn khoảng hai tuần, và đây là con số SWE-2 duy nhất trên trang đó thực sự nhạy cảm về thời gian: chi phí của mô hình trong Devin sau ngày 10 tháng 10 không được nêu ở đó.

Các con số hiệu quả của Cognition đáng được trích dẫn bên cạnh tuyên bố về chi phí, và chúng đều do nhà cung cấp báo cáo giống như mọi thứ khác trên trang này. Trên FrontierCode 1.1 Main, SWE-2 ở mức medium đạt điểm cao hơn SWE-1.7 trong khi dùng ít hơn 58% số lượt và trung bình tốn ít hơn 81% chi phí. Số bước trung bình mỗi lần chạy giảm từ 127 trên SWE-1.7 xuống 53 ở mức medium, 80 ở mức high và 98 ở mức max, và trung vị của lần chỉnh sửa mã thực đầu tiên chuyển từ bước 48 sang bước 18.

Các benchmark, cùng với harness đi kèm

Điểm số kỹ thuật phần mềm nhạy cảm bất thường với scaffold mà chúng được tạo ra trong đó, nên một con số không có harness đi kèm thì không phải là một con số. Cognition nêu rõ chính sách harness của mình trong phần phụ lục phương pháp luận của thông báo: kết quả được báo cáo từ các nguồn công khai khi có nguồn như vậy, và nếu không thì chạy trên khung đánh giá nội bộ của Cognition bằng cách sử dụng harness mà mỗi mô hình được phát triển chủ yếu để chạy trên đó — Claude Code cho các mô hình Anthropic, Codex cho các mô hình OpenAI, Grok Build cho các mô hình xAI, và Devin CLI cho các mô hình trọng số mở. Với mỗi mô hình, Cognition báo cáo điểm tốt nhất trên các thiết lập mức độ nỗ lực suy luận.

Hai hệ quả kéo theo, và cả hai đều thuộc cùng một mạch với những con số. Thứ nhất, một số hàng không phải so sánh ngang hàng: một con số Fable 5.1 được tạo ra trong Claude Code và một con số Kimi K3 được tạo ra trong Devin CLI là các phép đo của hai hệ thống agent khác nhau, chứ không phải hai mô hình trong một khung đánh giá trung lập. Thứ hai, "điểm tốt nhất trên các thiết lập mức nỗ lực" nghĩa là mỗi ô là trường hợp tốt nhất của một mô hình, chứ không phải một thiết lập được ghép tương ứng. Một so sánh giữ mức nỗ lực không đổi sẽ cho kết quả khác, và Cognition đã không công bố một so sánh như vậy.

Tất cả bốn hàng bên dưới đều do nhà cung cấp báo cáo và chưa được kiểm toán.

• FrontierCode 1.1 Main — SWE-2 50.0%, Kimi K3 44.2%, Grok 4.6 48.0%, Claude Fable 5.1 50.9%, GPT-5.6 Sol 47.5%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. Đây là hàng tiêu đề, và FrontierCode là benchmark của chính Cognition — Cognition viết các tác vụ cùng hơn 20 maintainer mã nguồn mở, vận hành bảng xếp hạng và chấm điểm các bài nộp. Không có điều nào trong số đó khiến các con số trở nên sai; tất cả đều thuộc về câu mà bạn nhắc lại chúng.
• DeepSWE 1.1 — SWE-2 73.0%, Kimi K3 68.5%, Grok 4.6 67.5%, Claude Fable 5.1 67.4%, GPT-5.6 Sol 72.7%, GPT-6 Astra 74.1%, SWE-1.7 37.7%. Hàng mà ở đó SWE-2 đánh bại một mô hình biên một cách thuyết phục nhất.
• Terminal-Bench 2.1 — SWE-2 92.8%, Kimi K3 88.3%, Grok 4.6 88.4%, Claude Fable 5.1 91.4%, GPT-5.6 Sol 88.8%, GPT-6 Astra 89.9%, SWE-1.7 81.5%. Con số trông đẹp nhất của SWE-2, và phiên bản Terminal-Bench hiện tại không phải 2.1.
• Terminal-Bench 4 — SWE-2 27.3%, Kimi K3 21.5%, Grok 4.6 20.3%, Claude Fable 5.1 55.8%, GPT-5.6 Sol 37.3%, GPT-6 Astra 57.9%, SWE-1.7 7.6%. Hàng ít được trích dẫn nhất, và là hàng mà mô hình này kém mô hình biên khoảng 28 điểm.

Việc so sánh cũng cần thêm một mẩu ngữ cảnh nữa, vì nó giải thích hình dạng bất thường của hàng frontier đến từ đâu. Chú thích của chính Cognition cho các biểu đồ của mình lưu ý rằng thiết lập max-effort của Fable 5.1 trên FrontierCode 1.1 Main đạt 50.3% với $12.83 mỗi tác vụ — thấp hơn thiết lập medium của chính nó ở 50.9% và $3.28. Nỗ lực nhiều hơn đổi lấy điểm số thấp hơn với chi phí gấp khoảng bốn lần. Đó là đường cong của mô hình frontier tự uốn ngược vào chính nó, và đó là một phần lý do vì sao 50.0% so với 50.9% gần nhau hơn mức mà chỉ hai con số đó gợi ra.

Các con số về độ tin cậy

Phần riêng về độ đáng tin cậy của Cognition là phần trong bản phát hành không liên quan gì đến các bảng xếp hạng, và nó báo cáo rằng SWE-2 đã vượt qua 98,0% tổng số prompt về tuyên truyền và kiểm duyệt của mình — 99,8% bằng tiếng Anh, 95,2% bằng tiếng Trung Giản thể và 99,1% bằng tiếng Trung Phồn thể — và rằng đánh giá lỗ hổng phụ thuộc ngữ cảnh của nó không tìm thấy điều kiện đặt khung nào tạo ra thay đổi có ý nghĩa thống kê đối với bất kỳ mô hình nào được kiểm tra. Đó là những đánh giá của Cognition, được tạo ra với một giám khảo GPT-5.6 Luna trên một bộ 145 câu hỏi, và chúng đều do nhà cung cấp báo cáo theo cùng nghĩa như các benchmark.

Bản đọc độc lập: vẫn chưa có.

Tính đến ngày 28 tháng 9 năm 2026, SWE-2 không có mục nào trên Artificial Analysis. Tìm kiếm tên này trong chỉ mục mô hình không trả về kết quả nào, và yêu cầu trực tiếp đến trang mô hình trả về lỗi 404. Bảng điểm duy nhất có SWE-2 là FrontierCode, thuộc về Cognition. Điều đó khiến bản phát hành chỉ còn lại các con số do nhà cung cấp báo cáo và không có gì khác — đây không phải là lời chỉ trích các con số, mà là một nhận định về mức độ người đọc có thể kiểm chứng chúng.

Hai điều cụ thể sẽ giải quyết được vấn đề, và cả hai đều không tồn tại ở thời điểm hiện tại. Một đợt chạy độc lập của bên thứ ba đối với SWE-2 trên Terminal-Bench 4 sẽ quyết định liệu đây là một mô hình cận biên giới tình cờ có giá rẻ, hay là một mô hình nhanh tình cờ dẫn đầu một phiên bản đã bị ngừng sử dụng. Và bất kỳ sự tái lập độc lập nào về khoảng cách FrontierCode sẽ cho bạn biết liệu mức chênh lệch một điểm so với Fable 5.1 là thuộc tính của mô hình hay thuộc tính của công cụ đo lường.

Khác với các mô hình của chính Cognition, Artificial Analysis có đưa Kimi K3 vào — và các con số của Kimi K3 là từ bên thứ ba, khiến mô hình nền trở thành nửa có bằng chứng tốt hơn của ngăn xếp này. Sự bất đối xứng đó chính là hình hài thực tế của SWE-2 ngày nay: phần post-train là phần thú vị và cũng là phần khó kiểm chứng nhất; phần base là phần được tài liệu hóa và là phần bạn thực sự có thể gọi tới.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

Sử dụng SWE-2 và những việc cần làm trong khi nó chưa được kiểm toán

Nếu bạn đã trả tiền cho Devin, quyết định rất dễ dàng và không phụ thuộc vào bất kỳ lưu ý nào ở trên. SWE-2 đã có trong sản phẩm của bạn, Cognition nói rằng nó tốn ít chi phí hơn cho mỗi tác vụ so với mô hình mà nó thay thế, và các số liệu hiệu quả — ít hơn 58% số lượt, chi phí trung bình thấp hơn 81%, chỉnh sửa đầu tiên trung vị ở bước 18 thay vì bước 48 — mô tả một mô hình giúp bạn ít tốn thời gian hơn cho công việc thông thường. Hãy khởi chạy nó ở mức nỗ lực trung bình cho phần đơn giản trong hàng đợi của bạn, vì đó là nơi thiết kế mức nỗ lực của chính Cognition đặt lợi thế về chi phí.

Nếu bạn đang chọn một mô hình lập trình từ bên ngoài Devin, thì quan điểm trung thực là SWE-2 không phải là một ứng viên mà bạn có thể đánh giá, vì không có gì để gọi. Không có mã định danh, không có giá mỗi token và không có endpoint. Thứ bạn có thể đánh giá là mô hình cơ sở.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 được định tuyến trên OrcaRouter, với $3.00 cho mỗi 1 triệu token đầu vào và $15.00 cho mỗi 1 triệu token đầu ra, không có phụ phí so với mức giá của nhà cung cấp, cửa sổ ngữ cảnh 1 triệu token, khả năng gọi công cụ gốc, đầu vào hình ảnh và điều khiển mức độ nỗ lực suy luận ở cấp cao nhất. Đó là nửa phần có thể tiếp cận được của bản phát hành này: năng lực mà Cognition đã hậu huấn luyện, có sẵn qua một endpoint tương thích OpenAI thay vì sản phẩm agent của một nhà cung cấp. Và vì dù theo hướng nào thì đây vẫn là vùng lãnh thổ chưa được kiểm chứng, bạn có thể đặt một chuỗi dự phòng phía sau nó, để một mô hình bạn đang thử nghiệm không trở thành phụ thuộc production ngay vào ngày nó khiến bạn thất vọng.

Điều SWE-2 cho bạn biết, nếu bạn đọc nó như bằng chứng thay vì như một trang sản phẩm, thì hẹp hơn và hữu ích hơn tiêu đề: một lượt chạy RL được thực hiện tốt trên nền Kimi K3 đã nâng mức lên khoảng năm điểm trên bốn benchmark mà không thay đổi hình dạng, và mất ít hơn 58% số lượt để làm điều đó. Đó là một kết quả thật bên trong Devin. Nó vẫn chưa phải là kết quả mà bất kỳ ai ngoài Cognition đã tái lập được, và benchmark duy nhất mà SWE-2 có vẻ đánh bại mọi thứ lại là benchmark mà lĩnh vực này đã ngừng chấm điểm.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày