
Cognition SWE-2 : du codage proche de la frontière à 64 % de réduction, et le piège du benchmark en dessous
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Cognition SWE-2 est sorti cette semaine avec un chiffre fait pour voyager : 50,0 % sur FrontierCode 1.1 Main, à un point de Claude Fable 5.1 à 50,9 %, pour 64 % de coût en moins. Le modèle est un post-entraînement de Kimi K3 de Moonshot AI — la base ouverte de 2,8 billions de paramètres — et Cognition affirme que son apprentissage par renforcement a ajouté 5–6 points sur plusieurs benchmarks. Ces deux chiffres sont ceux du fournisseur, et aucun n’a été reproduit de manière indépendante. Le second, toutefois, est l’affirmation qui devrait changer votre façon de lire le premier, car « plus cinq ou six » s’avère décrire presque tout ce que fait SWE-2, y compris les endroits où il perd lourdement.
Ce n'est pas une critique. C'est la chose la plus utile de cette sortie, et c'est la partie que presque aucun article sur le lancement ne dit tout haut.
Ce que Cognition a réellement livré
SWE-2 est le modèle de codage de Devin, et non un modèle d'API polyvalent assorti d'une grille tarifaire. Il est sorti disponible à partir d'aujourd'hui dans Devin Desktop et CLI, selon les propres mots de Cognition, avec un déploiement en cours sur Devin Web et Fusion. Des articles tiers situent l'annonce au 10 septembre 2026 ; la signature de l'article de blog de Cognition indique 09.11.26. Dans un cas comme dans l'autre, cela ne date que de quelques jours. Les poids sont propriétaires et aucune grille tarifaire par token n'est publiée. Si vous voulez utiliser SWE-2, vous l'utilisez au sein de Devin.
La base est Kimi K3, un modèle Mixture-of-Experts de 2,8 billions de paramètres, avec environ 104 milliards de paramètres actifs par token — soit environ trois fois la taille de la base de SWE-1.7. Cognition note que K3 avait déjà été fortement entraîné par RL pour le codage agentique avant d'en arriver là, et que son propre RL « trouve encore une marge de progression substantielle ». Cela reflète le schéma observé avec SWE-1.7, qui a lui aussi été post-entraîné sur une base Kimi.
Voici le détail qui compte plus que tout score de benchmark pris isolément : FrontierCode est le benchmark de Cognition. L’entreprise écrit les tâches — avec plus de 20 mainteneurs open source, plus de 40 heures par tâche, chaque mainteneur définissant ce que « mergeable » signifie dans son propre dépôt — gère le classement et note les soumissions. C’est un travail sérieux de conception d’évaluation, et c’est aussi un instrument maison. Cognition rapporte le meilleur score de chaque modèle tous paramètres d’effort de raisonnement confondus, et selon sa propre annexe méthodologique, les modèles de comparaison à poids ouverts, y compris Kimi K3, ont été exécutés dans la CLI Devin de Cognition. Rien de tout cela ne rend les chiffres faux. Tout cela a sa place dans la phrase où vous les répétez.

Lire honnêtement le tableau des benchmarks
Quatre benchmarks, tous rapportés par les fournisseurs. Voici ce que chacun dit réellement, une ligne par rangée.
• FrontierCode 1.1 Main — SWE-2 50.0%, face à Kimi K3 44.2%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%, Claude Fable 5.1 50.9%, GPT-6 Astra 53.3%, SWE-1.7 42.0%. À un point de la frontière, devant tout le reste du tableau.
• DeepSWE 1.1 — SWE-2 73,0 %, devant Claude Fable 5.1 à 67,4 % et Grok 4.6 à 67,5 %, derrière GPT-6 Astra à 74,1 %. C'est la ligne où SWE-2 surclasse le plus crédiblement un modèle de frontière.
• Terminal-Bench 2.1 — SWE-2 92,8 %, le meilleur score du tableau de Cognition, devant Claude Fable 5.1 à 91,4 % et GPT-6 Astra à 89,9 %. C’est le chiffre que l’on retrouve dans la plupart des gros titres du lancement.
• Terminal-Bench 4 — SWE-2 27,3 %, contre Claude Fable 5.1 à 55,8 % et GPT-6 Astra à 57,9 %. Un écart d'environ 28 points, et la ligne la moins citée.
L'objection évidente est que tout le monde baisse sur Terminal-Bench 4 — c'est un successeur plus difficile, à plus long horizon, alors bien sûr les scores chutent. Ce qui est intéressant, c'est de combien, et la baisse n'est pas proportionnelle. En passant de Terminal-Bench 2.1 à 4, Claude Fable 5.1 perd environ 35,6 points et GPT-6 Astra environ 32,0. SWE-2 en perd environ 65,5, et sa base Kimi K3 environ 66,8. Donc, sur le travail agentique à long horizon, SWE-2 ne se situe pas simplement en dessous des modèles de frontière — il se dégrade environ deux fois plus vite qu'eux lorsque la tâche se prolonge.
Que Terminal-Bench 4 soit la version « live » mérite d’être dit clairement : c’est l’édition actuelle, et la 2.1 est celle qui a été supplantée. La ligne où SWE-2 est en tête concerne le benchmark retiré. Celle où il est à la traîne concerne le benchmark actuel. Les deux faits sont vrais, et la couverture du lancement avait tendance à n’en retenir qu’un.
« Kimi K3 plus five » — l’heuristique qui prédit les scores que personne n’a publiés
Alignez les quatre benchmarks sur le propre modèle de base de SWE-2 et quelque chose de presque mécanique en ressort. Face à Kimi K3, SWE-2 gagne 5,8 points sur FrontierCode 1.1 Main, 4,5 sur DeepSWE 1.1, 4,5 sur Terminal-Bench 2.1 et 5,8 sur Terminal-Bench 4.
Quatre benchmarks, quatre écarts, tous entre 4,5 et 5,8. Le post-entraînement a déplacé le niveau, pas la forme. Là où K3 est fort, SWE-2 est fort plus environ cinq. Là où K3 est faible — Terminal-Bench 4 étant le cas évident — SWE-2 est faible plus environ cinq.
Cela vous donne une prévision exploitable pour toute tâche que Cognition n'a pas évaluée, c'est-à-dire la plupart d'entre elles. Renseignez-vous sur les performances de Kimi K3 sur votre charge de travail, ajoutez cinq points, et vous obtenez une meilleure estimation de SWE-2 que ce que n'importe quel chiffre phare vous donnera. Cela explique aussi la véritable thèse de cette sortie : Cognition ne prétend pas avoir dépassé la frontière. Elle prétend avoir déplacé toute la courbe coût-performance vers l'extérieur tout en restant à une distance fixe derrière le meilleur modèle, quel que soit l'axe que vous mesurez.
Les 64 % sont bien réels, mais vous ne pouvez pas les acheter.
« 64 % moins cher que Claude Fable 5.1 » est une affirmation vraie à propos d'une mesure précise — et cette mesure est le montant moyen, en dollars américains, dépensé par rollout sur FrontierCode, et non un prix par token. Il n'existe pas de tarif par token pour SWE-2, car il n'existe pas d'API SWE-2. Cette affirmation sur le coût décrit ce que coûte une tâche à l'intérieur de Devin, qui regroupe le modèle, le harness, l'échafaudage et la pile de serving de Cognition sur une seule facture.
Cette distinction a du mordant. Vous ne pouvez pas comparer le coût de SWE-2 au prix d’un token chez un autre fournisseur, car ce ne sont pas les mêmes unités. Et vous ne pouvez pas utiliser SWE-2 ailleurs : des poids propriétaires, un seul fournisseur, un seul produit agent. Le chiffre « jusqu’à 70 % de coût en moins » dans certains articles est le haut de la fourchette que Cognition cite sur l’ensemble des benchmarks ; le chiffre de FrontierCode 1.1 Main est de 64 %.
Les chiffres d'efficacité constituent, si tant est, l'élément le plus concret, et ils sont eux aussi rapportés par le fournisseur. SWE-2 en effort moyen dépasse le score FrontierCode de SWE-1.7 tout en utilisant 58 % de tours en moins et en coûtant 81 % de moins en moyenne. Le nombre moyen d'étapes par exécution passe de 127 sur SWE-1.7 à 53 en effort moyen (80 en effort élevé, 98 en effort maximal), et la médiane de la première véritable modification de code passe de l'étape 48 à l'étape 18. C'est une réponse directe à la critique selon laquelle SWE-1.7 explorait à l'excès des tâches simples, et c'est le genre d'amélioration qui apparaît sur votre facture bien avant qu'un écart de benchmark d'un point ne le fasse.

C'est l'astuce d'entraînement qui est la véritable nouvelle
Si l’on fait abstraction du positionnement dans le classement, il y a ici un élément d’ingénierie véritablement inédit, et c’est pourquoi cette sortie vaut la peine d’être lue, même si vous n’ouvrez jamais Devin.
Cognition a entraîné les trois niveaux d'effort de raisonnement — moyen, élevé et maximal — au cours d'une seule exécution d'apprentissage par renforcement. Le mécanisme est une pénalité de coût linéaire par niveau d'effort, chacune étant calibrée pour correspondre à la pente de la propre courbe de Pareto coût-performance du modèle de base à ce point. L'argument de Cognition pour expliquer pourquoi la pénalité doit être linéaire est le point intéressant : seule une pénalité linéaire permet de maintenir l'objectif d'entraînement comme une fonction du coût moyen et du taux de résolution seuls, plutôt que comme quelque chose qui dépend de la forme de la distribution.
L'approche habituelle entraîne les niveaux d'effort séparément, ou ajoute après coup un point de contrôle moins coûteux. Les entraîner ensemble au sein d'une même exécution, c'est ce qui permet à l'entreprise d'affirmer qu'elle a fait progresser toute la frontière plutôt qu'un seul point de celle-ci. Changements de soutien : une base de récompense pondérée par la longueur, le triplement du nombre d'environnements RL, des surcouches de suivi d'instructions, et un volant d'inertie qui utilise des points de contrôle SWE-2 antérieurs pour durcir les vérificateurs contre le piratage de récompense. Du côté du service, des noyaux NVFP4 et FP8 avec entraînement conscient de la quantification, un modèle de brouillon de décodage spéculatif DSpark réentraîné pour des longueurs d'acceptation 15 % plus longues, et un retardateur de préremplissage qui vaut 10–20 % de débit par GPU au prix d'un temps jusqu'au premier token plus mauvais.
Si vous faites du post-entraînement, cette recette est la partie transférable de cette version. Si vous n'en faites pas, la conclusion est plus simple : la raison pour laquelle SWE-2 est peu coûteux n'est pas qu'il s'agit d'un modèle plus petit. C'est que le coût de son exécution a été inscrit dans la fonction de récompense.
Si vous voulez la capacité de Kimi K3 en dehors de Devin
SWE-2 n'est pas sur OrcaRouter, et il n'y sera pas — poids propriétaires, pas d'API, distribution réservée à Devin. Son modèle de base, c'est une autre histoire. Kimi K3 est routé sur OrcaRouter sous kimi/kimi-k3, à 3,00 $ par million de jetons d'entrée et 15,00 $ par million de jetons de sortie, sans marge sur le tarif du fournisseur, avec une fenêtre de contexte d'un million de jetons, l'appel d'outils natif, l'entrée d'images et une profondeur de raisonnement contrôlée par un paramètre de premier niveau reasoning_effort plutôt que par les paramètres d'échantillonnage.
Voilà la version honnête de la conclusion pratique de cette sortie. SWE-2 vous montre à quoi ressemble une passe de RL bien exécutée par-dessus K3, dans le haut de sa fourchette — un gain authentique de 4,5 à 5,8 points, ainsi que d’importants gains d’efficacité, à un coût réel. Ce qu’il ne vous donne pas, en revanche, c’est un modèle que vous pouvez invoquer. Si vous voulez diriger la capacité sous-jacente vers votre propre code, votre propre banc de test ou votre propre pipeline, K3 est la partie de cette pile que vous pouvez réellement atteindre, et elle est accessible via un seul endpoint compatible OpenAI.
C'est aussi la moitié la plus sûre du pari tant que les chiffres ne sont pas audités. Les benchmarks de SWE-2 sont ceux de Cognition et personne en dehors de l'entreprise ne les a reproduits. Ceux de Kimi K3 sont ceux sur lesquels la comparaison repose réellement — et si vous passez par OrcaRouter, vous pouvez mettre une chaîne de secours derrière lui, afin qu'un modèle que vous testez ne devienne pas une dépendance de production le jour où il vous déçoit.

Qui devrait agir, et qu’est-ce qui réglerait la question
Si vous payez déjà pour Devin, SWE-2 est tout simplement une bonne nouvelle : il est en cours de déploiement sur votre produit, il est moins cher par tâche que ce qu’il remplace, et les chiffres d’efficacité suggèrent qu’il gaspillera moins de tours sur les tâches faciles. Essayez-le d’abord sur la partie simple de votre file d’attente — la conception par niveau d’effort signifie que c’est au niveau moyen que réside le gain sur les coûts.
Si vous choisissez un modèle de codage externe, attendez une évaluation indépendante. Il n'y en a pas encore : Artificial Analysis n'a pas d'entrée SWE-2, et le classement FrontierCode est l'instrument propre à Cognition. Trois éléments permettraient de trancher. Une exécution de SWE-2 par un tiers sur Terminal-Bench 4, qui est la ligne qui détermine s'il s'agit d'un modèle proche de la frontière ou d'un modèle rapide. Toute reproduction indépendante de l'écart FrontierCode. Et un prix par token, ce qui obligerait Cognition à vendre le modèle en dehors de Devin — le seul changement qui rendrait les 64 % comparables à tout autre chiffre qu'on vous annonce.
D’ici là, le résumé honnête est celui que l’écart avec le modèle de base vous donne déjà. SWE-2, c’est Kimi K3 plus cinq points, à un coût que Cognition a intégré dans la fonction de récompense. C’est une véritable réussite en matière d’entraînement et une très bonne affaire au sein de Devin. Ce n’est pas encore un modèle de pointe, et le seul benchmark où il semble surpasser tout le monde est celui qui a cessé de compter.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
