Investigadores de MATS Research, el ELLIS Institute Tübingen, el Max Planck Institute for Intelligent Systems, Snyk y otras instituciones demuestran que el razonamiento oculto de los modelos frontera puede recuperarse sin atacar directamente al modelo potente. Proveedores como Anthropic, OpenAI y Google devuelven la cadena de pensamiento del modelo al cliente como un bloque cifrado, que se reenvía al servidor al continuar la conversación. Estos bloques son portables: pueden reutilizarse entre sesiones, usuarios y modelos.

El ataque solo requiere dos llamadas a la API. Una traza de razonamiento producida por un modelo potente —por ejemplo claude-opus-4-8— se inyecta en un modelo hermano más débil como claude-haiku-4-5-20251001. Después, el modelo débil es sometido a un jailbreak que le pide transcribir el razonamiento adjunto literalmente, y devuelve los pensamientos ocultos del modelo fuerte en texto plano, sin activar jamás las protecciones ni las defensas anti-destilación del modelo fuerte.

La fidelidad se validó con 120 problemas de Codeforces: el número de tokens del razonamiento decodificado se correlaciona estrechamente con el recuento de tokens de pensamiento ocultos que informa la API. El equipo también aplicó su pipeline a gran escala: a partir de 6.708 trayectorias de agentes públicas recopiladas en GitHub y Hugging Face, reconstruyeron 315.320 bloques de razonamiento.

Esas trazas contenían secretos reales. Limitándose a sesiones de usuarios genuinas (no de benchmarks), el equipo recuperó 704 artefactos sensibles distintos, entre ellos 62 claves de API, 33 contraseñas, 24 tokens de acceso y 30 direcciones de correo personales, además de nombres, direcciones postales y URLs internas. 64 de esos artefactos aparecían exclusivamente dentro de los bloques de razonamiento y en ninguna parte de la sesión visible: los usuarios pueden filtrar datos que nunca llegan a ver.

Resultados adicionales: prellenar el razonamiento de Kimi-K3 con el primer 1% de los tokens de razonamiento de Opus 4.8 acerca sus respuestas visibles a la formulación de Opus. La técnica también recupera razonamientos peligrosos cuando un modelo reflexiona sobre contenido dañino manteniendo una respuesta visible inofensiva. Por último, los resúmenes de razonamiento que devuelve la API son a veces infieles: en algunos problemas AIME, Opus 4.8 enuncia la respuesta antes de derivarla, mientras el resumen presenta una derivación impecable.