
Cognition SWE-2 : qui le développe, dans quel harnais il s'exécute, et ce que les chiffres disent vraiment
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 316 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 196 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Cognition SWE-2 est un modèle de codage créé par Cognition, l'entreprise derrière Devin, et il est servi à l'intérieur de Devin plutôt que via une API de modèle : l'article de lancement de Cognition indique que SWE-2 est d'abord disponible dans Devin Desktop et Devin CLI, avec un déploiement vers Devin Web et Fusion. Il est post-entraîné à partir de Kimi K3, le modèle de Moonshot AI à 2,8 billions de paramètres. C'est toute la réponse à la question que la plupart des gens se posent réellement en arrivant ici, et cela vaut la peine de le dire avant toute autre chose, car une part mesurable des recherches qui mènent à cette page ajoute un quatrième mot — Devin — et attribue le modèle à Devin plutôt qu'à Cognition. Devin est l'agent que Cognition vend. SWE-2 est le modèle que Cognition a entraîné pour fonctionner à l'intérieur de celui-ci.
Cette page est une page de référence plutôt qu’un article de lancement. SWE-2 est sorti le 10 septembre 2026, soit plus d’une semaine déjà ; la date est là pour situer le modèle dans le temps, non pour rapporter un événement. Ce qui suit, c’est ce qui est documenté, qui l’a documenté, et ce que personne n’a encore vérifié.
Qui développe SWE-2, et pourquoi l’attribution ne cesse de dériver
La confusion n'est pas déraisonnable. Cognition ne vend pas SWE-2 comme un laboratoire vend un modèle d'API. Il n'y a pas de fiche de modèle avec une fenêtre de contexte, pas de prix par token publié, pas d'identifiant que l'on peut passer dans le corps d'une requête. Il y a un produit — Devin — et le modèle arrive comme partie intégrante de celui-ci. La prose de Cognition elle-même renforce cet amalgame : le billet d'annonce est écrit du point de vue de Devin, le tableau de benchmarks n'est expliqué à quiconque n'a pas déjà lu les travaux antérieurs de l'entreprise sur FrontierCode, et la ligne de disponibilité nomme Devin quatre fois et Cognition une seule — dans la signature.
Donc, pour le dire simplement : Cognition développe SWE-2.Cognition développe Devin. Les deux ne sont pas la même chose, mais on ne peut actuellement pas avoir l'un sans l'autre. Ce n'est pas non plus un accident de nommage isolé. Cognition a publié une série de modèles d'ingénierie logicielle sous le préfixe SWE — SWE-1.5, SWE-1.6, SWE-1.7 et désormais SWE-2, avec un point d'étape SWE-1.6 Preview en cours de route — aux côtés d'outils plus spécifiques comme SWE-grep et SWE-check. Le préfixe est le raccourci de l'entreprise pour l'ingénierie logicielle, et il précède d'environ un an chacun des modèles mentionnés dans ce paragraphe.
Le nom : un modèle, pas un benchmark
Voici la deuxième raison pour laquelle les personnes qui effectuent des recherches associent SWE-2 au mauvais propriétaire, et elle mérite son propre paragraphe plutôt qu’une note de bas de page.
SWE-bench est un benchmark. Il s'agit d'une évaluation indépendante maintenue par l'équipe SWE-bench, hébergée sur swebench.com, et proposée en plusieurs éditions : l'ensemble original de 2 294 instances issues de vraies issues GitHub, ainsi que les sous-ensembles Verified, Lite, Multilingual et Multimodal. Il sert à évaluer les agents de codage de manière générale, Devin inclus — Cognition a publié un rapport technique Devin-on-SWE-bench dès mars 2024, toujours disponible sur son blog.
SWE-2 est un modèle. Ce n'est pas une édition de SWE-bench, et ce n'est pas l'abréviation d'une édition. Il n'existe pas de SWE-bench 2 : la famille publiée comprend SWE-bench, Verified, Lite, Multilingual et Multimodal, et la numérotation de version qui existe appartient aux sous-ensembles du benchmark, pas à un successeur numéroté. Le benchmark de référence de Cognition pour ces modèles s'appelle FrontierCode, qui est un instrument entièrement différent et, comme l'explique la section suivante, un instrument que Cognition possède.
Si vous êtes venu ici en vous attendant à une deuxième génération de l’évaluation SWE-bench, c’est là tout le malentendu.
Date de sortie et mode de distribution de SWE-2
Le billet d’annonce de Cognition porte une signature datée du 10 septembre 2026, et les données structurées de la page elle-même indiquent un horodatage de publication au 2026-09-10. Les deux concordent. SWE-2 était disponible dans Devin Desktop et Devin CLI à cette date, avec Devin Web et Fusion arrivés ensuite.
C’est la surface de distribution, et c’est toute la surface de distribution. Il n’y a pas de poids ouverts — rien sur Hugging Face de la part de Cognition pour ce modèle — et aucun point de terminaison hébergé par un fournisseur qui accepte un identifiant SWE-2. Si votre harnais est le vôtre, SWE-2 n’est pas un composant que vous pouvez y installer aujourd’hui. Si votre harnais est Devin, SWE-2 est déjà devant vous.
Pour quiconque a besoin de l’enveloppe du modèle de base plutôt que de celle de SWE-2, Kimi K3 est une entité distincte et mieux documentée, et il est routé sur OrcaRouter en tant que kimi/kimi-k3 — une API unique pour plus de 200 modèles au prix catalogue du fournisseur, sans majoration. Cela compte ici pour une raison précise : la capacité sous-jacente à partir de laquelle Cognition est parti est accessible indépendamment, même si le modèle post-entraîné ne l’est pas.
L’enveloppe : ce que Cognition documente, et ce qu’elle ne documente pas.
Une page de référence doit être honnête sur la forme de ses propres preuves, et c’est là que celle de SWE-2 est la plus mince.
• Effort de raisonnement — trois niveaux documentés : medium, high et max. Cognition écrit que ces niveaux se comportent différemment par conception : medium passe à l'action plus tôt et prend en charge le travail simple et intermédiaire, tandis que high et max planifient davantage, explorent davantage le codebase et consacrent plus de moyens à la vérification.
• Distribution — Devin Desktop et Devin CLI au lancement, Devin Web et Fusion en déploiement progressif. Pas d'API, pas de poids, pas de voie d'auto-hébergement.
• Modèle de base — Kimi K3, décrit par Cognition comme un modèle de 2,8 T de paramètres ayant déjà fait l'objet d'un RL approfondi pour le codage agentique. L'article sur Kimi K3 attribue à cette base une fenêtre de contexte de 1 M de tokens et une vision native.
• Fenêtre de contexte, sortie maximale, modalités, nombre de paramètres post-entraînés — non publiés pour SWE-2. L'annonce de Cognition n'en mentionne aucun, et aucune autre page de Cognition ne comble cette lacune.
La distinction dans cette dernière ligne n’est pas de la pédanterie. Le million de tokens de Kimi K3 est un fait qui concerne Kimi K3. Cela ne dit pas que SWE-2 en hérite, et un post-entraînement selon une recette différente est exactement le type de changement susceptible de modifier ce qu’un modèle accepte. Si vous avez besoin d’un nombre de fenêtre de contexte pour planifier, le nombre que vous pouvez vérifier appartient au modèle de base, et vous devez considérer celui de SWE-2 comme inconnu plutôt que de supposer que les deux concordent.

La grille tarifaire, dans la seule devise dans laquelle Cognition établit ses devis.
Il n'existe pas de prix par token pour SWE-2, car il n'existe aucun point de terminaison SWE-2. L'affirmation de coût de Cognition est libellée différemment : elle indique que SWE-2 se situe à un point de Claude Fable 5.1 sur FrontierCode 1.1 Main — 50,0 % contre 50,9 % — tout en étant 64 % moins cher. Lisez attentivement l'unité. Les 64 % correspondent à la moyenne des dollars américains dépensés par rollout sur FrontierCode, un chiffre au niveau de la tâche qui regroupe le modèle, le harness, le scaffolding et la pile de serving de Cognition dans une seule facture. Ce n'est pas un tarif par token, et il ne peut pas être comparé à un tel tarif.
La grille tarifaire qui existe bel et bien est celle de Devin. Sur la page de tarification de Devin, consultée le 28 septembre 2026 : Gratuit à 0 $, Pro à 20 $ par mois, Max à 200 $ par mois, Teams à 80 $ par mois, plus 40 $ par poste de développeur complet. La ligne SWE-2 figure dans Pro et porte une date — « Utilisation gratuite de SWE-2 — Gratuit dans Devin Desktop et CLI jusqu'au 10 octobre 2026. » Il s'agit d'une fenêtre promotionnelle à laquelle il reste environ deux semaines, et c'est la seule donnée SWE-2 sur cette page qui soit réellement sensible au facteur temps : le coût du modèle au sein de Devin après le 10 octobre n'y est pas indiqué.
Les chiffres d'efficacité de Cognition méritent d'être cités à côté de l'affirmation sur les coûts, et ils sont déclarés par le fournisseur comme tout le reste sur cette page. Sur FrontierCode 1.1 Main, SWE-2 à effort moyen obtient un score supérieur à SWE-1.7 tout en effectuant 58 % de tours en moins et en coûtant 81 % de moins en moyenne. Le nombre moyen d'étapes par exécution passe de 127 sur SWE-1.7 à 53 en moyen, 80 en élevé et 98 en max, et la médiane de la première véritable modification de code passe de l'étape 48 à l'étape 18.
Les benchmarks, avec le harnais de test attaché
Les scores en ingénierie logicielle sont exceptionnellement sensibles à l’échafaudage dans lequel ils ont été produits ; un chiffre sans son harnais n’est donc pas un chiffre. Cognition énonce sa politique en matière de harnais dans l’annexe méthodologique de l’annonce : les résultats proviennent de sources publiques lorsqu’il en existe une, et sont sinon exécutés sur le cadre d’évaluation interne de Cognition à l’aide du harnais pour lequel chaque modèle a principalement été développé — Claude Code pour les modèles Anthropic, Codex pour les modèles OpenAI, Grok Build pour les modèles xAI, et Devin CLI pour les modèles à poids ouverts. Pour chaque modèle, Cognition rapporte le meilleur score parmi les différents réglages d’effort de raisonnement.
Deux conséquences en découlent, et toutes deux doivent être évoquées dans le même souffle que les chiffres. Premièrement, plusieurs lignes ne sont pas à périmètre comparable : un chiffre pour Fable 5.1 produit dans Claude Code et un chiffre pour Kimi K3 produit dans Devin CLI sont des mesures de deux systèmes d'agents différents, et non de deux modèles dans un harnais neutre. Deuxièmement, « meilleur score tous réglages d'effort confondus » signifie que chaque cellule correspond au meilleur cas d'un modèle, et non à un réglage apparié. Une comparaison à effort constant aurait une autre allure, et Cognition n'en a publié aucune.
Les quatre lignes ci-dessous sont déclarées par le fournisseur et non auditées.
• FrontierCode 1.1 Main — SWE-2 50,0 %, Kimi K3 44,2 %, Grok 4.6 48,0 %, Claude Fable 5.1 50,9 %, GPT-5.6 Sol 47,5 %, GPT-6 Astra 53,3 %, SWE-1.7 42,0 %. C'est la ligne phare, et FrontierCode est le benchmark de Cognition lui-même — Cognition rédige les tâches avec plus de 20 mainteneurs open source, tient le classement et note les soumissions. Rien de tout cela ne rend les chiffres faux ; tout cela a sa place dans la phrase où vous les répétez.
• DeepSWE 1.1 — SWE-2 73,0 %, Kimi K3 68,5 %, Grok 4.6 67,5 %, Claude Fable 5.1 67,4 %, GPT-5.6 Sol 72,7 %, GPT-6 Astra 74,1 %, SWE-1.7 37,7 %. La ligne où SWE-2 bat le plus crédiblement un modèle de pointe, purement et simplement.
• Terminal-Bench 2.1 — SWE-2 92,8 %, Kimi K3 88,3 %, Grok 4.6 88,4 %, Claude Fable 5.1 91,4 %, GPT-5.6 Sol 88,8 %, GPT-6 Astra 89,9 %, SWE-1.7 81,5 %. Le chiffre le plus flatteur de SWE-2, et l'édition actuelle de Terminal-Bench n'est pas la 2.1.
• Terminal-Bench 4 — SWE-2 27,3 %, Kimi K3 21,5 %, Grok 4.6 20,3 %, Claude Fable 5.1 55,8 %, GPT-5.6 Sol 37,3 %, GPT-6 Astra 57,9 %, SWE-1.7 7,6 %. La ligne la moins citée, et celle où le modèle se situe à environ 28 points derrière la frontière.
La comparaison a aussi besoin d'un élément de contexte supplémentaire, car il explique d'où vient la forme inhabituelle de la ligne de la frontière. La note de bas de page que Cognition joint à ses graphiques indique que le réglage d'effort maximal de Fable 5.1 sur FrontierCode 1.1 Main obtient un score de 50,3 % à 12,83 $ par tâche — en dessous de son propre réglage moyen, à 50,9 % et 3,28 $. Davantage d'effort a donné un score inférieur pour un coût environ quatre fois plus élevé. C'est la courbe du modèle de la frontière qui se replie sur elle-même, et cela explique en partie pourquoi un 50,0 % contre 50,9 % est plus serré que ne le suggèrent les deux chiffres seuls.
Les chiffres de fiabilité
La section distincte de Cognition sur la fiabilité est la partie de la publication qui n'a rien à voir avec les classements, et elle rapporte que SWE-2 a réussi 98,0 % de ses prompts de propagande et de censure au total — 99,8 % en anglais, 95,2 % en chinois simplifié et 99,1 % en chinois traditionnel — et que son évaluation de vulnérabilité contextuelle n'a trouvé, pour aucun des modèles testés, de condition de cadrage produisant un changement statistiquement significatif. Il s'agit là des jugements de Cognition, produits avec un juge GPT-5.6 Luna sur un ensemble de 145 questions, et ils sont rapportés par le fournisseur au même titre que les benchmarks.
La lecture indépendante : il n'y en a pas encore
Depuis le 28 septembre 2026, SWE-2 n’a aucune entrée sur Artificial Analysis. Une recherche du nom dans l’index des modèles ne renvoie rien, et une requête directe sur la page du modèle aboutit à une erreur 404. Le seul tableau de scores qui référence SWE-2 est FrontierCode, qui appartient à Cognition. Il ne reste donc à cette sortie que des chiffres annoncés par son éditeur, et rien d’autre — ce qui n’est pas une critique des chiffres, mais une observation sur la part de ces chiffres qu’un lecteur peut vérifier.
Deux choses précises permettraient de trancher, et aucune des deux n'existe aujourd'hui. Une exécution de SWE-2 sur Terminal-Bench 4 réalisée par un tiers déterminerait s'il s'agit d'un modèle proche de la frontière qui se trouve être bon marché, ou d'un modèle rapide qui se trouve être en tête d'une édition retirée. Et toute reproduction indépendante de l'écart FrontierCode vous indiquerait si la marge d'un point face à Fable 5.1 est une propriété du modèle ou une propriété de l'instrument.
Contrairement aux modèles propres de Cognition, Artificial Analysis référence bien Kimi K3 — et les chiffres de Kimi K3 proviennent de tiers, ce qui fait du modèle de base la moitié la mieux étayée de cette pile. Cette asymétrie est la forme pratique de SWE-2 aujourd'hui : le post-entraînement est la partie intéressante et la moins vérifiable ; la base est la partie documentée et celle que l'on peut réellement appeler.

Utiliser SWE-2, et que faire tant qu'il n'est pas audité
Si vous payez déjà pour Devin, la décision est facile et ne dépend d'aucune des réserves ci-dessus. SWE-2 est intégré à votre produit, Cognition affirme qu'il coûte moins cher par tâche que le modèle qu'il remplace, et les chiffres d'efficacité — 58 % de tours en moins, 81 % de coût moyen en moins, une première modification médiane à l'étape 18 au lieu de l'étape 48 — décrivent un modèle qui gaspille moins de votre temps sur le travail ordinaire. Lancez-le à un effort moyen sur le bas de gamme de votre file d'attente, là où la conception des niveaux d'effort de Cognition place le gain de coût.
Si vous choisissez un modèle de codage en dehors de Devin, la position honnête est que SWE-2 n’est pas un candidat que vous pouvez évaluer, parce qu’il n’y a rien à appeler. Il n’y a pas d’identifiant, pas de prix par token et pas d’endpoint. Ce que vous pouvez évaluer, c’est le modèle de base.

Kimi K3 est routé sur OrcaRouter, à 3,00 $ par million de tokens d'entrée et 15,00 $ par million de tokens de sortie, sans marge par rapport au tarif du fournisseur, avec une fenêtre de contexte d'un million de tokens, l'appel d'outils natif, l'entrée d'images et un contrôle du niveau d'effort de raisonnement. Voilà la moitié accessible de cette sortie : la capacité sur laquelle Cognition a fait du post-entraînement, disponible via un seul point de terminaison compatible OpenAI plutôt que via le produit d'agent d'un seul fournisseur. Et comme il s'agit dans les deux cas d'un territoire non audité, vous pouvez placer une chaîne de repli derrière lui, afin qu'un modèle que vous testez ne devienne pas une dépendance de production le jour où il vous déçoit.
Ce que SWE-2 vous dit, si vous le lisez comme une preuve plutôt que comme une page produit, est plus circonscrit et plus utile que le titre : une passe de RL bien exécutée au-dessus de Kimi K3 a fait progresser le niveau d’environ cinq points sur quatre benchmarks sans en changer la forme, et a demandé 58 % de tours en moins pour y parvenir. C’est un vrai résultat au sein de Devin. Ce n’est pas encore un résultat que quiconque en dehors de Cognition a reproduit, et le seul benchmark où SWE-2 semble surpasser tout le reste est celui sur lequel le domaine a cessé de noter.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
