The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

11 de agosto de 2026
modelos, agentes e inferencia local

Seguridad

Investigadores recuperan la cadena de pensamiento oculta de APIs propietarias de LLM

Un equipo de investigación demuestra que los bloques de razonamiento cifrados devueltos por las APIs de Anthropic, OpenAI y Google pueden reinyectarse en un modelo hermano más débil y descifrarse mediante jailbreak, revelando además credenciales y datos personales filtrados en trayectorias públicas de agentes.

Investigadores de MATS Research, el ELLIS Institute Tübingen, el Max Planck Institute for Intelligent Systems, Snyk y otras instituciones demuestran que el razonamiento oculto de los modelos frontera puede recuperarse sin atacar directamente al modelo potente. Proveedores como Anthropic, OpenAI y Google devuelven la cadena de pensamiento del modelo al cliente como un bloque cifrado, que se reenvía al servidor al continuar la conversación. Estos bloques son portables: pueden reutilizarse entre sesiones, usuarios y modelos.

El ataque solo requiere dos llamadas a la API. Una traza de razonamiento producida por un modelo potente —por ejemplo claude-opus-4-8— se inyecta en un modelo hermano más débil como claude-haiku-4-5-20251001. Después, el modelo débil es sometido a un jailbreak que le pide transcribir el razonamiento adjunto literalmente, y devuelve los pensamientos ocultos del modelo fuerte en texto plano, sin activar jamás las protecciones ni las defensas anti-destilación del modelo fuerte.

La fidelidad se validó con 120 problemas de Codeforces: el número de tokens del razonamiento decodificado se correlaciona estrechamente con el recuento de tokens de pensamiento ocultos que informa la API. El equipo también aplicó su pipeline a gran escala: a partir de 6.708 trayectorias de agentes públicas recopiladas en GitHub y Hugging Face, reconstruyeron 315.320 bloques de razonamiento.

Esas trazas contenían secretos reales. Limitándose a sesiones de usuarios genuinas (no de benchmarks), el equipo recuperó 704 artefactos sensibles distintos, entre ellos 62 claves de API, 33 contraseñas, 24 tokens de acceso y 30 direcciones de correo personales, además de nombres, direcciones postales y URLs internas. 64 de esos artefactos aparecían exclusivamente dentro de los bloques de razonamiento y en ninguna parte de la sesión visible: los usuarios pueden filtrar datos que nunca llegan a ver.

Resultados adicionales: prellenar el razonamiento de Kimi-K3 con el primer 1% de los tokens de razonamiento de Opus 4.8 acerca sus respuestas visibles a la formulación de Opus. La técnica también recupera razonamientos peligrosos cuando un modelo reflexiona sobre contenido dañino manteniendo una respuesta visible inofensiva. Por último, los resúmenes de razonamiento que devuelve la API son a veces infieles: en algunos problemas AIME, Opus 4.8 enuncia la respuesta antes de derivarla, mientras el resumen presenta una derivación impecable.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad