Cognition presentó SWE-2 el 10 de septiembre de 2026 como su modelo de código más avanzado. Alcanza un 50,0% en FrontierCode 1.1 Main, a un punto de Fable 5.1 y con un coste un 64% menor. El modelo está post-entrenado desde Kimi K3, un modelo abierto de 2,8 billones de parámetros, lo que supone la primera vez que Cognition escala su RL al régimen de varios billones de parámetros.
La principal novedad de entrenamiento es un objetivo de RL con penalización de coste de la forma R = S - lambda_e * C, donde S es el éxito binario, C el coste del rollout en dólares y tiempo, y lambda_e se ajusta por nivel de esfuerzo según la pendiente local de la frontera de Pareto del modelo base. Esto permite entrenar todos los niveles de esfuerzo en una sola ejecución de RL. En un apéndice se demuestra que solo una penalización lineal garantiza que la recompensa dependa únicamente del coste medio y la tasa de resolución.
En los benchmarks, SWE-2 logra un 73,0% en DeepSWE 1.1, un 92,8% en Terminal-Bench 2.1 y un 27,3% en Terminal-Bench 4. Supera a SWE-1.7 y Grok 4.6 tanto en puntuación como en coste, iguala a GPT-5.6 Sol y Fable 5.1 por una fracción de su precio y queda a pocos puntos de GPT-6 Astra con aproximadamente una cuarta parte del coste. El RL añadió entre 5 y 6 puntos sobre la base Kimi K3 en muchos benchmarks.
Las ganancias de eficiencia son considerables. SWE-2 medium supera a SWE-1.7 en FrontierCode 1.1 Main con un 58% menos de turnos y un 81% menos de coste. La primera edición real del código llega tras una mediana de 18 pasos frente a los 48 de SWE-1.7, lo que Cognition atribuye a una exploración más enfocada del código. El equipo también reporta mejores tests de extremo a extremo, más ingenio ante bloqueos y una verificación más disciplinada.
En infraestructura, Cognition detalla una línea base de recompensa ponderada por longitud que reduce la varianza del gradiente y mantiene baja la divergencia KL entre inferencia y entrenamiento, un retrasador de prefill que mejoró el rendimiento entre un 10 y un 20%, y un modelo borrador DSpark de decodificación especulativa reentrenado en línea con secuencias aceptadas un 15% más largas. Los kernels NVFP4 y FP8 con entrenamiento consciente de la cuantización contienen la memoria pese a una base casi tres veces mayor.
En datos, se triplicó el número de entornos de RL, se añadieron capas de seguimiento de instrucciones y los verificadores se endurecieron de forma iterativa contra el reward hacking usando checkpoints anteriores de SWE-2. Una evaluación de fiabilidad sobre propaganda, censura y vulnerabilidad contextual arrojó una tasa de éxito global del 98,0% en preguntas políticamente sensibles sobre China, sin efectos de encuadre estadísticamente significativos en la vulnerabilidad del código.
SWE-2 ya está disponible en Devin Desktop y en la CLI de Devin. El despliegue en Devin Web y Fusion está en marcha.




Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.