Karta tytułowa dla Cognition SWE-2 z podtytułem o treści: Kimi K3 post-train, 50,0% na FrontierCode 1.1 Main przy 64% niższym koszcie, z trzema kartami: FrontierCode 1.1 Main 50,0%, vs Claude Fable 5.1 50,9%, oraz koszt na rollout niższy o 64%.
Guides & Insights

Cognition SWE-2: Kodowanie na poziomie zbliżonym do czołówki z 64% zniżki, a pod tym pułapka benchmarków

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Cognition SWE-2 trafił na rynek w tym tygodniu z wynikiem, który ma podróżować: 50,0% na FrontierCode 1.1 Main, w granicach jednego punktu od Claude Fable 5.1 z 50,9%, za 64% mniej pieniędzy. Model powstał w wyniku post-treningu Kimi K3 od Moonshot AI — bazowego modelu o otwartych wagach z 2,8 biliona parametrów — a Cognition twierdzi, że jego uczenie ze wzmocnieniem dodało 5–6 punktów w kilku benchmarkach. Obie liczby pochodzą od samego dostawcy i żadna nie została niezależnie odtworzona. Ta druga jednak to twierdzenie, które powinno zmienić sposób, w jaki czytasz tę pierwszą, ponieważ „plus pięć lub sześć” okazuje się opisywać niemal wszystko, co robi SWE-2, w tym miejsca, w których ponosi dotkliwe porażki.

To nie jest zarzut. To najbardziej użyteczna rzecz w tym wydaniu — i to ta część, o której niemal żadne relacje z premiery nie mówią wprost.

Co Cognition faktycznie wypuściło

SWE-2 to model kodujący Devina, a nie uniwersalny model API z cennikiem. Został udostępniony dostępny od dziś w Devin Desktop i CLI, jak mówi sam Cognition, a wdrażanie trwa w Devin Web i Fusion. Relacje zewnętrzne datują ogłoszenie na 10 września 2026 r.; podpis przy wpisie na blogu Cognition brzmi 09.11.26. Tak czy inaczej, ma zaledwie kilka dni. Wagi są zastrzeżone i nie opublikowano cennika za token. Jeśli chcesz używać SWE-2, używasz go w Devin.

Podstawą jest Kimi K3, model Mixture-of-Experts o 2,8 biliona parametrów, z około 104 mld parametrów aktywnych na token — około trzykrotnie większy niż podstawa SWE-1.7. Cognition zauważa, że K3 był już intensywnie trenowany metodą RL do kodowania agentowego, zanim osiągnął ten etap, a jego własny RL „wciąż znajduje znaczny margines rozwoju”. To odzwierciedla wzorzec z SWE-1.7, który również został dotrenowany na bazie Kimi.

Oto szczegół, który ma większe znaczenie niż jakikolwiek pojedynczy wynik benchmarku: FrontierCode to benchmark firmy Cognition. Firma pisze zadania — z ponad 20 opiekunami open source, ponad 40 godzinami na zadanie, przy czym każdy opiekun definiuje, co oznacza „możliwe do scalenia” we własnym repozytorium — prowadzi ranking i ocenia zgłoszenia. To poważny element projektu ewaluacyjnego, a jednocześnie narzędzie wewnętrzne. Cognition podaje dla każdego modelu najlepszy wynik w różnych ustawieniach wysiłku rozumowania, a zgodnie z własnym aneksem metodologicznym modele porównawcze z otwartymi wagami, w tym Kimi K3, uruchomiono w Devin CLI firmy Cognition. Nic z tego nie czyni tych liczb błędnymi. Wszystko to należy umieścić w zdaniu, w którym je powtarzasz.

Two-column scoreboard headed 'Cognition SWE-2 vs Claude Fable 5.1'. Left column Cognition SWE-2: FrontierCode 1.1 Main 50.0%, Terminal-Bench 2.1 92.8%, Terminal-Bench 4 27.3%, Cost per rollout 64% lower, Base model Kimi K3 2.8T, Independent eval none yet. Right column Claude Fable 5.1: FrontierCode 1.1 Main 50.9%, Terminal-Bench 2.1 91.4%, Terminal-Bench 4 55.8%, Cost per rollout baseline, Base model proprietary, Independent eval third-party scored.

Uczciwe czytanie tabeli benchmarków

Cztery benchmarki, wszystkie raportowane przez dostawców. Oto, co każdy z nich faktycznie mówi — po jednej linii na wiersz.

• FrontierCode 1.1 Main — SWE-2 50,0%, w porównaniu z Kimi K3 44,2%, Grok 4.6 48,0%, GPT-5.6 Sol 47,5%, Claude Fable 5.1 50,9%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. Zaledwie punkt od czołówki, wyprzedzając wszystko inne w tabeli.

• DeepSWE 1.1 — SWE-2 73,0%, przed Claude Fable 5.1 z 67,4% i Grok 4.6 z 67,5%, za GPT-6 Astra z 74,1%. To wiersz, w którym SWE-2 najwiarygodniej pokonuje model czołowy w bezpośrednim starciu.

• Terminal-Bench 2.1 — SWE-2 92,8%, najwyższy wynik w tabeli Cognition, przed Claude Fable 5.1 z 91,4% i GPT-6 Astra z 89,9%. To liczba, która pojawia się w większości nagłówków dotyczących premiery.

• Terminal-Bench 4 — SWE-2 27,3%, wobec Claude Fable 5.1 z 55,8% i GPT-6 Astra z 57,9%. Różnica około 28 punktów, i wiersz, który jest cytowany najrzadziej.

Oczywisty zarzut jest taki, że wszyscy spadają na Terminal-Bench 4 — to trudniejszy następca o dłuższym horyzoncie, więc oczywiście wyniki spadają. Ciekawe jest to, o ile, a spadek nie jest proporcjonalny. Przechodząc z Terminal-Bench 2.1 do 4, Claude Fable 5.1 traci około 35,6 punktu, a GPT-6 Astra około 32,0. SWE-2 traci około 65,5, a jego bazowy Kimi K3 około 66,8. Tak więc w długohoryzontowej pracy agentowej SWE-2 nie tylko plasuje się poniżej modeli frontierowych — ulega degradacji około dwa razy szybciej niż one, gdy zadanie trwa długo.

To, czy Terminal-Bench 4 jest wersją „live”, warto powiedzieć wprost: to bieżąca edycja, a 2.1 została zastąpiona. Wiersz, w którym prowadzi SWE-2, dotyczy wycofanego benchmarku. Wiersz, w którym ustępuje pola, dotyczy obecnego. Oba fakty są prawdziwe, a relacje z premiery zwykle wybierały jeden z nich.

„Kimi K3 plus pięć” — heurystyka, która przewiduje wyniki, których nikt nie opublikował

Zestaw te cztery benchmarki z własnym modelem bazowym SWE-2 i wychodzi z tego coś niemal mechanicznego. W porównaniu z Kimi K3 SWE-2 zyskuje 5,8 punktu na FrontierCode 1.1 Main, 4,5 na DeepSWE 1.1, 4,5 na Terminal-Bench 2.1 i 5,8 na Terminal-Bench 4.

Cztery benchmarki, cztery luki, wszystkie między 4,5 a 5,8. Etap po treningu przesunął poziom, ale nie kształt. Gdziekolwiek K3 jest silny, SWE-2 jest silny plus około pięć. Gdziekolwiek K3 jest słaby — a wyraźnym tego przykładem jest Terminal-Bench 4 — SWE-2 jest słaby plus około pięć.

To daje ci działającą prognozę dla każdego zadania, którego Cognition nie uwzględniło w benchmarkach, czyli dla większości z nich. Sprawdź, jak Kimi K3 wypada na twoim obciążeniu, dodaj pięć punktów i masz lepsze oszacowanie SWE-2 niż da ci którakolwiek z liczb z nagłówków. To również wyjaśnia właściwą tezę tego wydania: Cognition nie twierdzi, że prześcignęło czołówkę. Twierdzi, że przesunęło całą krzywą koszt–wydajność na zewnątrz, pozostając w stałej odległości za najlepszym modelem na dowolnej osi, którą mierzysz.

Te 64% są prawdziwe, ale nie da się za nie zrobić zakupów.

„64% taniej niż Claude Fable 5.1” to prawdziwe stwierdzenie o konkretnym pomiarze — a tym pomiarem są średnie wydatki w dolarach amerykańskich na jeden rollout w FrontierCode, a nie cena tokena. Nie ma stawki za token dla SWE-2, ponieważ nie ma API SWE-2. Twierdzenie o koszcie opisuje, ile kosztuje zadanie w Devin, które łączy model, harness, scaffolding i stos serwujący Cognition w jeden rachunek.

Ta różnica ma znaczenie. Nie można porównywać kosztu SWE-2 z ceną tokena innego dostawcy, ponieważ to nie ta sama jednostka. Nie można też przenieść SWE-2 gdzie indziej: zastrzeżone wagi, jeden dostawca, jeden produkt agentowy. Podawana w niektórych publikacjach liczba „do 70% niższego kosztu” to górna granica przedziału, jaki Cognition podaje dla różnych benchmarków; wartość dla FrontierCode 1.1 Main wynosi 64%.

Liczby dotyczące wydajności są, jeśli już, bardziej praktyczną historią, a i one są raportowane przez dostawcę. SWE-2 przy średnim wysiłku przebija wynik SWE-1.7 w FrontierCode, zużywając przy tym o 58% mniej tur i kosztując średnio o 81% mniej. Średnia liczba kroków na przebieg spada ze 127 w SWE-1.7 do 53 przy średnim wysiłku (80 przy wysokim, 98 przy maksymalnym), a mediana pierwszej rzeczywistej edycji kodu przesuwa się z kroku 48 na krok 18. To bezpośrednia odpowiedź na zarzut, że SWE-1.7 nadmiernie eksplorował proste zadania, i to rodzaj usprawnienia, które pojawia się na rachunku znacznie wcześniej, niż różnica jednego punktu w benchmarku.

Screenshot of Cognition's official SWE-2 announcement blog post, headed 'Introducing SWE-2: Pushing the Pareto Frontier', bylined 09.11.26, showing the opening claim of 50.0% on FrontierCode 1.1 Main within one point of Fable 5.1 while being 64% cheaper, and a cost-versus-solve-rate Pareto chart labelling the medium, high and max effort levels.

Prawdziwą wiadomością jest trik treningowy.

Odsuń na bok kwestię pozycjonowania w rankingach, a pozostanie tu jeden naprawdę nowatorski element inżynieryjny — i właśnie dlatego warto zapoznać się z tym wydaniem, nawet jeśli nigdy nie uruchomisz Devina.

Cognition wytrenowało wszystkie trzy poziomy wysiłku rozumowania — średni, wysoki i maksymalny —pojedynczym przebiegu RL. Mechanizm polega na liniowej karze kosztowej dla każdego poziomu wysiłku, z których każda jest dostrojona tak, aby odpowiadać nachyleniu własnej krzywej Pareto koszt–wydajność modelu bazowego w tym punkcie. Najciekawszy jest argument Cognition o tym, dlaczego kara musi być liniowa: tylko liniowa kara utrzymuje cel treningowy jako funkcję wyłącznie średniego kosztu i odsetka rozwiązań, a nie czegoś, co zależy od kształtu rozkładu.

Typowe podejście trenuje poziomy wysiłku osobno albo dokłada później tańszy checkpoint. Trenowanie ich razem w ramach jednego przebiegu pozwala firmie twierdzić, że przesunęła całą granicę, a nie tylko jeden punkt na niej. Zmiany wspierające: ważona długością linia bazowa nagrody, potrojenie liczby środowisk RL, nakładki podążania za instrukcjami oraz koło zamachowe, które wykorzystuje wcześniejsze checkpointy SWE-2 do wzmocnienia weryfikatorów przeciw hakowaniu nagrody. Po stronie serwowania: jądra NVFP4 i FP8 z treningiem świadomym kwantyzacji, model roboczy DSpark do dekodowania spekulatywnego ponownie wytrenowany pod kątem o 15% dłuższych długości akceptacji oraz opóźniacz prefillu dający 10–20% zysku przepustowości na GPU kosztem gorszego czasu do pierwszego tokenu.

Jeśli prowadzisz post-training, ten przepis jest przenośną częścią tego wydania. Jeśli nie, wniosek jest prostszy: powód, dla którego SWE-2 jest tani, nie polega na tym, że to mniejszy model. Polega na tym, że koszt jego uruchamiania został wpisany w funkcję nagrody.

Jeśli chcesz mieć możliwości Kimi K3 poza Devin

SWE-2 nie znajduje się w OrcaRouter i nie będzie — zastrzeżone wagi, brak API, dystrybucja wyłącznie przez Devin. Jego model bazowy to inna sytuacja. Kimi K3 jest routowany przez OrcaRouter jako kimi/kimi-k3, po $3,00 za 1 mln tokenów wejściowych i $15,00 za 1 mln tokenów wyjściowych, bez narzutu ponad stawkę dostawcy, z oknem kontekstowym o rozmiarze 1 mln tokenów, natywnym wywoływaniem narzędzi, wejściem obrazowym i głębokością rozumowania kontrolowaną przez parametr najwyższego poziomu reasoning_effort zamiast ustawień próbkowania.

To uczciwa wersja praktycznego wniosku z tego wydania. SWE-2 pokazuje, jak wygląda dobrze przeprowadzony przebieg RL na bazie K3 u szczytu swojego zakresu — autentyczny wzrost o 4,5–5,8 punktu, a do tego duże zyski wydajności, za realną cenę. Nie daje ci jednak modelu, który możesz wywołać. Jeśli chcesz skierować tę bazową możliwość na własny kod, własny harness lub własny pipeline, K3 jest tą częścią tego stosu, do której faktycznie możesz dotrzeć, a można do niej dotrzeć przez jeden endpoint zgodny z OpenAI.

To także bezpieczniejsza połowa zakładu, dopóki liczby nie są zweryfikowane. Benchmarki SWE-2 należą do Cognition i nikt spoza firmy ich nie odtworzył. To na benchmarkach Kimi K3 faktycznie opiera się porównanie — a jeśli kierujesz ruch przez OrcaRouter, możesz umieścić za nim łańcuch awaryjny, dzięki czemu testowany model nie stanie się zależnością produkcyjną w dniu, w którym cię rozczaruje.

Screenshot of the OrcaRouter model page for Kimi K3, showing model ID kimi/kimi-k3, input $3.00 per 1M tokens, output $15.00 per 1M tokens, cache read $0.300, 1M-token context, text and image input, p50 time-to-first-token of 9.85 seconds, and 2,739.4M tokens of traffic over 7 days.

Kto powinien działać, a co pozwoliłoby to rozstrzygnąć

Jeśli już płacisz za Devin, SWE-2 to po prostu dobra wiadomość: jest wdrażany do Twojego produktu, jest tańszy w przeliczeniu na zadanie niż to, co zastępuje, a wskaźniki wydajności sugerują, że zmarnuje mniej tur na łatwej pracy. Najpierw wypróbuj go na najprostszych zadaniach w swojej kolejce — konstrukcja poziomów wysiłku sprawia, że to na średnim poziomie kryje się oszczędność.

Jeśli wybierasz zewnętrzny model do kodowania, poczekaj na niezależną ocenę. Na razie jej nie ma: Artificial Analysis nie ma wpisu dla SWE-2, a ranking FrontierCode jest własnym narzędziem Cognition. Trzy rzeczy rozstrzygnęłyby tę kwestię. Uruchomienie SWE-2 przez stronę trzecią na Terminal-Bench 4, czyli wiersz, który decyduje, czy to model zbliżony do czołówki, czy szybki. Jakiekolwiek niezależne odtworzenie różnicy FrontierCode. Oraz cena za token, co wymagałoby od Cognition sprzedaży modelu poza Devin — jedyna zmiana, która uczyniłaby te 64% porównywalnymi z czymkolwiek innym, co jest ci podawane w wycenie.

Do tego czasu uczciwym podsumowaniem jest to, które już daje ci luka względem modelu bazowego. SWE-2 to Kimi K3 plus pięć punktów, za cenę, którą Cognition zaprojektowało w funkcji nagrody. To prawdziwe osiągnięcie w treningu i naprawdę dobry układ w Devinie. To jeszcze nie model frontier, a jedyny benchmark, w którym wydaje się bić wszystko, to ten, który przestał się liczyć.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie