Karta tytułowa dla Cognition SWE-2 z nagłówkiem „Cognition SWE-2”, podtytułem „Model do kodowania od Cognition, dotrenowany z Kimi K3, udostępniany w Devin” oraz trzema kartami poniżej o treści: Stworzony przez Cognition, Model bazowy Kimi K3 2.8T i Udostępniany w Devin Desktop i CLI.
Guides & Insights

Cognition SWE-2: Kto za tym stoi, w jakim harnessie działa i co tak naprawdę mówią liczby

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Cognition SWE-2 to model do kodowania stworzony przez Cognition, firmę stojącą za Devinem, udostępniany wewnątrz Devina, a nie przez API modelu: w swoim własnym poście ogłaszającym premierę Cognition podaje, że SWE-2 jest dostępny najpierw w Devin Desktop i Devin CLI, a jego wdrożenie do Devin Web i Fusion nastąpi później. Został poddany posttrainingowi na bazie Kimi K3, modelu Moonshot AI o 2,8 biliona parametrów. To jest cała odpowiedź na pytanie, które większość ludzi faktycznie zadaje, trafiając tutaj, i warto ją podać przed wszystkim innym, ponieważ mierzalna część wyszukiwań prowadzących do tej strony dodaje czwarte słowo — Devin — i przypisuje model Devinowi, a nie Cognition. Devin to agent, którego sprzedaje Cognition. SWE-2 to model, który Cognition wytrenowała, aby działał w jego wnętrzu.

Ta strona to strona referencyjna, a nie historia premiery. SWE-2 ukazał się 10 września 2026 r., a ta data jest ponad tydzień za nami; data jest tu po to, by osadzić model w czasie, a nie po to, by relacjonować wydarzenie. Poniżej znajduje się to, co udokumentowano, kto to udokumentował oraz czego nikt jeszcze nie sprawdził.

Kto produkuje SWE-2 i dlaczego przypisanie autorstwa wciąż się przesuwa

Zamieszanie nie jest bezzasadne. Cognition nie sprzedaje SWE-2 tak, jak laboratorium sprzedaje model API. Nie ma karty modelu z oknem kontekstowym, nie ma opublikowanej ceny tokenów, nie ma identyfikatora, który można przekazać w treści żądania. Jest produkt — Devin — a model przychodzi jako jego część. Własny język Cognition wzmacnia to zatarcie granicy: wpis ogłaszający premierę jest napisany z punktu widzenia Devina, tabela benchmarków nie zawiera wyjaśnień dla nikogo, kto nie czytał już wcześniejszych prac firmy nad FrontierCode, a wiersz o dostępności wymienia Devina cztery razy, a Cognition raz — w podpisie autora.

Mówiąc wprost: Cognition tworzy SWE-2. Cognition tworzy Devin. Te dwie rzeczy nie są tym samym, ale obecnie nie można mieć jednego bez drugiego. To również nie jest jednorazowa wpadka nazewnicza. Cognition wydało serię modeli do inżynierii oprogramowania pod prefiksem SWE — SWE-1.5, SWE-1.6, SWE-1.7, a teraz SWE-2, a po drodze pojawił się punkt kontrolny SWE-1.6 Preview — obok narzędzi o węższym zakresie, takich jak SWE-grep i SWE-check. Prefiks ten to firmowy skrót oznaczający inżynierię oprogramowania i jest starszy o około rok od każdego modelu w tym akapicie.

Nazwa: model, nie benchmark

To drugi powód, dla którego poszukujący przypisują SWE-2 niewłaściwemu właścicielowi, i zasługuje on na osobny akapit, a nie na przypis.

SWE-bench to benchmark. To niezależna ewaluacja prowadzona przez zespół SWE-bench, hostowana na swebench.com, dostępna w kilku edycjach: pierwotny zbiór 2294 przypadków pochodzących z rzeczywistych zgłoszeń, a także podzbiory Verified, Lite, Multilingual i Multimodal. Służy do ogólnej oceny agentów kodujących, w tym Devina — Cognition opublikował w marcu 2024 r. raport techniczny Devin na SWE-bench, który wciąż znajduje się na jego blogu.

SWE-2 to model. Nie jest to edycja SWE-bench ani skrót oznaczający którąś z nich. Nie istnieje SWE-bench 2: opublikowana rodzina obejmuje SWE-bench, Verified, Lite, Multilingual i Multimodal, a istniejąca numeracja wersji należy do podzbiorów tego benchmarku, a nie do numerowanego następcy. Benchmarkiem referencyjnym Cognition dla tych modeli jest FrontierCode, który stanowi zupełnie inne narzędzie i, jak wyjaśnia następna sekcja, należy do Cognition.

Jeśli przyszedłeś tutaj, oczekując drugiej generacji ewaluacji SWE-bench, to właśnie na tym polega całe nieporozumienie.

Data wydania i sposób dystrybucji SWE-2

Post ogłoszeniowy Cognition jest opatrzony datą 10 września 2026 r., a dane strukturalne samej strony podają znacznik czasu publikacji jako 2026-09-10. Oba są zgodne. SWE-2 był dostępny w Devin Desktop i Devin CLI tego dnia, a Devin Web i Fusion pojawiły się później.

To jest powierzchnia dystrybucji i to cała powierzchnia dystrybucji. Nie ma otwartych wag — nic na Hugging Face od Cognition dla tego modelu — ani żadnego endpointu hostowanego przez dostawcę, który przyjmuje identyfikator SWE-2. Jeśli Twój harness jest własny, SWE-2 nie jest komponentem, który możesz dziś do niego zainstalować. Jeśli Twoim harnessem jest Devin, SWE-2 jest już przed Tobą.

Dla każdego, kto potrzebuje zakresu możliwości modelu bazowego, a nie SWE-2, Kimi K3 to osobna i lepiej udokumentowana rzecz, która jest routingowana w OrcaRouter jako kimi/kimi-k3 — jedno API dla ponad 200 modeli w cenie katalogowej dostawcy, bez marży. Ma to tutaj znaczenie z konkretnego powodu: bazowa zdolność, od której zaczęło Cognition, jest osiągalna niezależnie, nawet jeśli model po treningu końcowym nie jest.

Koperta: co dokumentuje Cognition, a czego nie

Strona referencyjna powinna być uczciwa co do kształtu własnych dowodów, i właśnie tutaj dowody SWE-2 są najskąpsze.

• Poziom wysiłku rozumowania — trzy udokumentowane poziomy: średni, wysoki i maksymalny. Cognition pisze, że poziomy te celowo działają różnie: średni szybciej przechodzi do działania i obsługuje zadania proste oraz średnio zaawansowane, natomiast wysoki i maksymalny więcej planują, eksplorują więcej kodu i przeznaczają więcej na weryfikację.
• Dystrybucja — Devin Desktop i Devin CLI w momencie premiery, Devin Web i Fusion we wdrażaniu. Brak API, brak wag, brak ścieżki self-hostingu.
• Model bazowy — Kimi K3, opisywany przez Cognition jako model o 2,8 bln parametrów, który przeszedł już rozległy RL pod kątem kodowania agentowego. Artykuł o Kimi K3 przypisuje tej bazie okno kontekstu 1 mln tokenów i natywne przetwarzanie obrazu.
• Okno kontekstu, maksymalna długość odpowiedzi, modalności, liczba parametrów po treningu — nie zostały opublikowane dla SWE-2. Ogłoszenie Cognition nie mówi o nich nic, a żadna inna strona Cognition nie uzupełnia tej luki.

Rozróżnienie w tym ostatnim wierszu nie jest pedanterią. Okno o długości miliona tokenów Kimi K3 to fakt dotyczący Kimi K3. Cognition nie twierdzi, że SWE-2 je dziedziczy, a trening po wstępnym treningu według innej receptury to dokładnie ten rodzaj zmiany, który może zmienić to, co model akceptuje. Jeśli potrzebujesz liczby okna kontekstu do planowania, liczba, którą możesz zweryfikować, należy do modelu bazowego, a okno SWE-2 powinieneś traktować jako nieznane, zamiast zakładać, że oba są takie same.

Scoreboard headed 'Cognition SWE-2 - the scoreboard' listing Base model Kimi K3 2.8 trillion, FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%, Terminal-Bench 4 27.3%, Distribution Devin only with no API, and Independent score none yet, over a footer reading 'All figures vendor-reported by Cognition; no independent scores yet.'

Cennik, w jedynej walucie, w jakiej Cognition podaje wyceny

Nie istnieje cena za token dla SWE-2, ponieważ nie istnieje endpoint SWE-2. Twierdzenie Cognition o kosztach jest wyrażone w innej jednostce: mówi ono, że SWE-2 plasuje się w granicach jednego punktu od Claude Fable 5.1 w FrontierCode 1.1 Main — 50,0% wobec 50,9% — będąc przy tym o 64% tańszym. Przeczytaj uważnie jednostkę. Te 64% to średnie wydatki w dolarach amerykańskich na jeden rollout w FrontierCode — wartość na poziomie zadania, która łączy model, harness, scaffolding i stos serwujący Cognition w jedną fakturę. To nie jest stawka za token i nie można jej porównywać ze stawką za token.

Cennik, który rzeczywiście istnieje, to cennik Devina. Na stronie cennika Devina, odczytanej 28 września 2026 r.: Free za 0 USD, Pro za 20 USD miesięcznie, Max za 200 USD miesięcznie, Teams za 80 USD miesięcznie plus 40 USD za pełne stanowisko deweloperskie. Pozycja SWE-2 znajduje się w Pro i zawiera datę — „Bezpłatne korzystanie z SWE-2 — bezpłatnie w Devin Desktop i CLI do 10 października 2026 r.” To promocyjne okno, któremu zostało około dwóch tygodni, i jest to jedyna liczba dotycząca SWE-2 na tej stronie, która jest naprawdę wrażliwa na czas: koszt modelu w Devin po 10 października nie jest tam podany.

Liczby dotyczące wydajności Cognition warto przytoczyć obok twierdzenia o kosztach, a pochodzą one od dostawcy, podobnie jak wszystko inne na tej stronie. W FrontierCode 1.1 Main SWE-2 przy średnim nakładzie uzyskuje wynik wyższy niż SWE-1.7, wykonując przy tym o 58% mniej tur i kosztując średnio o 81% mniej. Średnia liczba kroków na uruchomienie spada ze 127 w SWE-1.7 do 53 przy średnim, 80 przy wysokim i 98 przy maksymalnym, a mediana pierwszego rzeczywistego edytowania kodu przesuwa się z kroku 48 do kroku 18.

Benchmarki, z dołączonym harnessem

Wyniki w zakresie inżynierii oprogramowania są wyjątkowo wrażliwe na scaffold, w którym zostały uzyskane, więc liczba bez swojego harnessu nie jest liczbą. Cognition podaje swoją politykę dotyczącą harnessu w aneksie metodologicznym ogłoszenia: wyniki są raportowane ze źródeł publicznych, jeśli takie istnieją, a w przeciwnym razie uruchamiane w wewnętrznych ramach ewaluacyjnych Cognition przy użyciu harnessu, dla którego dany model był pierwotnie rozwijany — Claude Code dla modeli Anthropic, Codex dla modeli OpenAI, Grok Build dla modeli xAI i Devin CLI dla modeli o otwartych wagach. Dla każdego modelu Cognition raportuje najlepszy wynik wśród ustawień wysiłku rozumowania.

Wynikają z tego dwie konsekwencje i obie trzeba rozpatrywać razem z liczbami. Po pierwsze, kilka wierszy nie jest bezpośrednio porównywalnych: wynik Fable 5.1 uzyskany w Claude Code i wynik Kimi K3 uzyskany w Devin CLI to pomiary dwóch różnych systemów agentowych, a nie dwóch modeli w neutralnym środowisku testowym. Po drugie, „najlepszy wynik wśród ustawień wysiłku” oznacza, że każda komórka to najlepszy przypadek danego modelu, a nie dopasowane ustawienie. Porównanie przy stałym poziomie wysiłku wyglądałoby inaczej, a Cognition takiego nie opublikowało.

Wszystkie cztery wiersze poniżej są zgłoszone przez dostawcę i niezaudytowane.

• FrontierCode 1.1 Main — SWE-2 50,0%, Kimi K3 44,2%, Grok 4.6 48,0%, Claude Fable 5.1 50,9%, GPT-5.6 Sol 47,5%, GPT-6 Astra 53,3%, SWE-1.7 42,0%. To wiersz tytułowy, a FrontierCode to własny benchmark Cognition — Cognition tworzy zadania wspólnie z ponad 20 maintainerami projektów open source, prowadzi tabelę wyników i ocenia zgłoszenia. Nic z tego nie sprawia, że te liczby są błędne; to wszystko należy do zdania, w którym je przytaczasz.
• DeepSWE 1.1 — SWE-2 73,0%, Kimi K3 68,5%, Grok 4.6 67,5%, Claude Fable 5.1 67,4%, GPT-5.6 Sol 72,7%, GPT-6 Astra 74,1%, SWE-1.7 37,7%. Wiersz, w którym SWE-2 najwiarygodniej pokonuje czołowy model w bezpośrednim starciu.
• Terminal-Bench 2.1 — SWE-2 92,8%, Kimi K3 88,3%, Grok 4.6 88,4%, Claude Fable 5.1 91,4%, GPT-5.6 Sol 88,8%, GPT-6 Astra 89,9%, SWE-1.7 81,5%. Najlepiej wyglądająca liczba SWE-2, tyle że obecna edycja Terminal-Bench to nie 2.1.
• Terminal-Bench 4 — SWE-2 27,3%, Kimi K3 21,5%, Grok 4.6 20,3%, Claude Fable 5.1 55,8%, GPT-5.6 Sol 37,3%, GPT-6 Astra 57,9%, SWE-1.7 7,6%. Wiersz cytowany najrzadziej — i ten, w którym model plasuje się około 28 punktów za czołówką.

To porównanie wymaga jeszcze jednego elementu kontekstu, ponieważ wyjaśnia on, skąd bierze się nietypowy kształt wiersza frontier. W przypisie Cognition do własnych wykresów zauważono, że ustawienie maksymalnego wysiłku Fable 5.1 w FrontierCode 1.1 Main daje 50,3% przy 12,83 USD na zadanie — poniżej własnego ustawienia średniego wynoszącego 50,9% i 3,28 USD. Większy wysiłek przyniósł niższy wynik przy około czterokrotnie wyższym koszcie. To krzywa modelu frontier zaginająca się wstecz na siebie i jest to część powodu, dla którego 50,0% wobec 50,9% jest bliżej, niż sugerowałyby same te dwie liczby.

Liczby wiarygodności

Osobna sekcja Cognition dotycząca wiarygodności to ta część publikacji, która nie ma nic wspólnego z rankingami, i podaje, że SWE-2 zdał ogółem 98,0% swoich promptów dotyczących propagandy i cenzury — 99,8% w języku angielskim, 95,2% w uproszczonym chińskim i 99,1% w tradycyjnym chińskim — a także, że jego ocena podatności zależnej od kontekstu nie wykazała żadnego warunku ramowania, który powodowałby statystycznie istotną zmianę w przypadku któregokolwiek z testowanych modeli. To są osądy Cognition, uzyskane przy użyciu sędziego GPT-5.6 Luna na zestawie 145 pytań, i są one raportowane przez dostawcę w tym samym sensie co benchmarki.

Niezależny odczyt: jeszcze takiego nie ma

Na dzień 28 września 2026 r. SWE-2 nie ma wpisu w Artificial Analysis. Wyszukiwanie nazwy w indeksie modeli nie zwraca żadnych wyników, a bezpośrednie żądanie strony modelu kończy się błędem 404. Jedyną tablicą wyników zawierającą SWE-2 jest FrontierCode, który należy do Cognition. To pozostawia wydanie z liczbami podanymi przez dostawcę i niczym więcej, co nie jest krytyką tych liczb — to stwierdzenie o tym, jak dużą ich część czytelnik może sprawdzić.

Dwie konkretne rzeczy rozstrzygnęłyby tę kwestię, a żadna z nich nie istnieje dzisiaj. Niezależne przeprowadzenie SWE-2 na Terminal-Bench 4 przez stronę trzecią zdecydowałoby, czy to model bliski czołówce, który przypadkiem jest tani, czy szybki model, który przypadkiem przewodzi wycofanej edycji. A jakakolwiek niezależna reprodukcja luki FrontierCode powiedziałaby ci, czy jednopunktowa przewaga nad Fable 5.1 jest właściwością modelu, czy właściwością narzędzia.

W przeciwieństwie do własnych modeli Cognition, Artificial Analysis faktycznie uwzględnia Kimi K3 — a dane Kimi K3 pochodzą od stron trzecich, co czyni model bazowy lepiej udokumentowaną połową tego stosu. Ta asymetria to praktyczny kształt SWE-2 dzisiaj: post-trening jest interesującą i najmniej weryfikowalną częścią; baza jest udokumentowaną częścią i tą, którą można faktycznie wywołać.

Screenshot of the 'Coding benchmark results' section of Cognition's SWE-2 announcement post, showing the four-row seven-column vendor benchmark table — FrontierCode 1.1 Main, DeepSWE 1.1, Terminal-Bench 2.1 and Terminal-Bench 4, each row carrying SWE-2, Kimi K3, Grok 4.6, Fable 5.1, GPT-5.6 Sol, GPT-6 Astra and SWE-1.7 — above the paragraph stating that SWE-2 is post-trained from Kimi K3, a 2.8-trillion-parameter model, and a link line reading 'See how models rank on the FrontierCode leaderboard'.

Korzystanie z SWE-2 i co robić, dopóki nie zostanie poddany audytowi

Jeśli już płacisz za Devina, decyzja jest łatwa i nie zależy od żadnego z powyższych zastrzeżeń. SWE-2 jest w Twoim produkcie, Cognition twierdzi, że kosztuje mniej na zadanie niż model, który zastępuje, a wskaźniki wydajności — o 58% mniej tur, o 81% niższy średni koszt, mediana pierwszej edycji na kroku 18 zamiast na kroku 48 — opisują model, który marnuje mniej Twojego czasu na zwykłą pracę. Zacznij od średniego poziomu wysiłku na prostszym końcu swojej kolejki; to tam, zgodnie z własnym projektem poziomów wysiłku Cognition, tkwi korzyść kosztowa.

Jeśli wybierasz model do kodowania spoza Devin, uczciwe stanowisko jest takie, że SWE-2 nie jest kandydatem, którego możesz ocenić, ponieważ nie ma czego wywołać. Nie ma identyfikatora, ceny za token ani endpointu. To, co możesz ocenić, to model bazowy.

Screenshot of the OrcaRouter model page for Kimi K3, showing the model ID kimi/kimi-k3, the modality rows for text plus image input and text output, the Vision, Tools, JSON and Reasoning capability chips, an OpenAI-compatible code sample pointed at api.orcarouter.ai, and a live stat strip reading $3.00 input and $15.00 output per 1M tokens.

Kimi K3 jest kierowany przez OrcaRouter, w cenie 3,00 USD za 1 mln tokenów wejściowych i 15,00 USD za 1 mln tokenów wyjściowych, bez marży ponad stawkę dostawcy, z oknem kontekstu 1 mln tokenów, natywnym wywoływaniem narzędzi, wejściem obrazowym oraz kontrolą wysiłku rozumowania najwyższego poziomu. To dostępna połowa tego wydania: zdolność, na bazie której Cognition przeprowadziło post-training, dostępna przez jeden endpoint zgodny z OpenAI, a nie przez produkt agentowy jednego dostawcy. A ponieważ tak czy inaczej to niezbadany teren, możesz umieścić za nim łańcuch zapasowy, aby model, który testujesz, nie stał się zależnością produkcyjną w dniu, w którym cię rozczaruje.

To, co mówi ci SWE-2, jeśli czytasz to jako dowód, a nie jako stronę produktu, jest węższe i bardziej użyteczne niż nagłówek: dobrze przeprowadzony przebieg RL na bazie Kimi K3 przesunął poziom o około pięć punktów w czterech benchmarkach, nie zmieniając kształtu, i wymagał do tego o 58% mniej tur. To prawdziwy wynik wewnątrz Devin. Nie jest to jeszcze wynik, który odtworzył ktokolwiek spoza Cognition, a ten jedyny benchmark, w którym SWE-2 wydaje się bić wszystko, to ten, na którym dziedzina przestała prowadzić punktację.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie