Cognition a présenté SWE-2 le 10 septembre 2026, le décrivant comme son modèle de code le plus avancé. Il atteint 50,0% sur FrontierCode 1.1 Main, à un point de Fable 5.1 tout en coûtant 64% de moins. Le modèle est post-entraîné à partir de Kimi K3, un modèle ouvert de 2,8 billions de paramètres, ce qui marque la première montée de Cognition en RL à cette échelle.

La principale nouveauté d'entraînement est un objectif RL à pénalité de coût de la forme R = S - lambda_e * C, où S est le succès binaire, C le coût du rollout en dollars et en temps, et lambda_e ajusté par niveau d'effort selon la pente locale de la frontière de Pareto du modèle de base. Cela permet d'entraîner tous les niveaux d'effort en une seule passe de RL. Une annexe démontre que seule une pénalité linéaire garantit que la récompense ne dépend que du coût moyen et du taux de résolution.

Sur les benchmarks, SWE-2 atteint 73,0% sur DeepSWE 1.1, 92,8% sur Terminal-Bench 2.1 et 27,3% sur Terminal-Bench 4. Il bat SWE-1.7 et Grok 4.6 en score comme en coût, égale GPT-5.6 Sol et Fable 5.1 pour une fraction de leur prix, et se place à quelques points de GPT-6 Astra pour environ un quart du coût. Le RL a ajouté 5 à 6 points par rapport à la base Kimi K3 sur de nombreux benchmarks.

Les gains d'efficacité sont importants. SWE-2 medium dépasse SWE-1.7 sur FrontierCode 1.1 Main avec 58% de tours en moins et 81% de coût en moins. La première modification réelle du code intervient après une médiane de 18 étapes contre 48 pour SWE-1.7, ce que Cognition attribue à une exploration plus ciblée du code. L'équipe signale aussi de meilleurs tests de bout en bout, davantage de débrouillardise face aux blocages et une vérification plus rigoureuse.

Côté infrastructure, Cognition détaille une baseline de récompense pondérée par la longueur qui réduit la variance du gradient et maintient une faible divergence KL entre inférence et entraînement, un mécanisme de retardement du prefill qui augmente le débit de 10 à 20%, et un modèle brouillon DSpark de décodage spéculatif réentraîné en ligne avec des séquences acceptées 15% plus longues. Les kernels NVFP4 et FP8 avec entraînement conscient de la quantisation contiennent la mémoire malgré une base presque trois fois plus grande.

Côté données, le nombre d'environnements RL a été triplé, des surcouches de suivi d'instructions ajoutées, et les vérificateurs durcis de façon itérative contre le reward hacking grâce aux checkpoints précédents de SWE-2. Une évaluation de fiabilité couvrant propagande, censure et vulnérabilité contextuelle affiche un taux de réussite global de 98,0% sur des questions politiquement sensibles liées à la Chine, sans effet de cadrage statistiquement significatif sur la vulnérabilité du code.

SWE-2 est disponible dès maintenant dans Devin Desktop et la CLI Devin. Le déploiement sur Devin Web et Fusion est en cours.