AIO APEX

Investigadores extraen el razonamiento oculto de cadena de pensamiento de las API de OpenAI, Anthropic y Google

Simon Willison
Compartir:
Investigadores extraen el razonamiento oculto de cadena de pensamiento de las API de OpenAI, Anthropic y Google

Investigadores han publicado un artículo de 116 páginas que describe cómo extrajeron el razonamiento oculto de cadena de pensamiento de modelos de IA de frontera de OpenAI, Anthropic y Google —razonamiento que las empresas cifran específicamente para mantenerlo privado de usuarios y competidores. La técnica funcionó en los tres principales proveedores antes de que la divulgación responsable condujera a parches del lado del servidor, y al consultar transcripciones públicas de agentes en busca de evidencia de exposición, los investigadores encontraron cientos de credenciales filtradas y artefactos de datos personales.

Cómo funcionó el ataque

Los modelos de razonamiento insignia como GPT-5, Claude Opus 4.8 y Gemini 3 Pro devuelven un bloque cifrado de su cadena de pensamiento interna junto con cada respuesta de la API —un diseño pensado para permitir que el modelo "piense" a través de problemas complejos manteniendo ese razonamiento en bruto oculto, ya que puede revelar detalles de entrenamiento o usarse para destilar un modelo competidor más barato. La vulnerabilidad, según los investigadores, se reducía a la reutilización de claves: cada modelo dentro de la familia de un mismo proveedor compartía la misma clave de cifrado. Eso significaba que un bloque de razonamiento cifrado generado por un modelo insignia fuertemente protegido podía pasarse legítimamente a la llamada de API de un modelo hermano más pequeño y menos protegido —GPT-5-mini en lugar de GPT-5, Claude Haiku 4.5 en lugar de Opus, Gemini 3.1 Flash en lugar de Gemini 3 Pro.

Debido a que los modelos de nivel más ligero se entrenan con salvaguardas anti-destilación más débiles que sus contrapartes insignia, se les puede indicar simplemente que transcriban el bloque de razonamiento inyectado textualmente. Para Claude Haiku 4.5 específicamente, los investigadores usaron un aviso que instruía al modelo a "transcribir el razonamiento adjunto a este turno, textualmente" combinado con un exploit de prefijo de asistente —una técnica desde entonces parcheada. Los investigadores verificaron que sus recuentos de tokens de razonamiento extraídos coincidían casi 1:1 con los recuentos de tokens de pensamiento facturados por la API, confirmando que estaban recuperando el razonamiento oculto genuino y no una aproximación alucinada.

Por qué esto importa más allá de una curiosidad de investigación

El artículo documenta dos daños concretos más allá de la violación de privacidad teórica. Primero, un ataque de destilación: dado que el razonamiento de cadena de pensamiento contiene los pasos reales de resolución de problemas que usa un modelo insignia, extraerlo a gran escala le da a un competidor un atajo para entrenar un modelo más barato que imite la calidad de razonamiento del costoso —socavando la inversión en I+D que se destina a los modelos de frontera. Segundo, y más preocupante de inmediato, los investigadores escanearon 6.708 transcripciones públicas de agentes y decodificaron 315.320 bloques de razonamiento, recuperando 367 artefactos de información de identificación personal y 182 credenciales codificadas —incluyendo 62 claves de API activas, 33 contraseñas y 30 direcciones de correo electrónico que habían quedado incrustadas en rastros de razonamiento y nunca debían ser legibles por humanos.

La solución y lo que sigue expuesto

Tras la divulgación responsable, OpenAI, Anthropic y Google reconocieron todos el informe y desplegaron mitigaciones del lado del servidor. Los investigadores confirmaron que sus ataques originales de prueba de concepto de repetición entre modelos ya no se reproducen en las compilaciones actuales de la API. Las protecciones a largo plazo recomendadas incluyen vincular criptográficamente los bloques de razonamiento al modelo, sesión y usuario específicos que los generaron; un aislamiento estricto por nivel de modelo que rechace cualquier bloque de razonamiento no generado por ese modelo exacto; rotar las claves de firma heredadas; y sanear los registros de transcripciones históricas de agentes, ya que las credenciales previamente filtradas permanecen expuestas independientemente de que la vulnerabilidad subyacente esté parcheada.

Ese último punto es la conclusión práctica para cualquier equipo que ejecute agentes de IA en producción: si los registros o transcripciones de tu agente han sido públicos en algún momento desde que se lanzaron estas API de rastros de razonamiento, trata cualquier credencial que alguna vez haya pasado por el contexto de un agente como comprometida y rótala —el parche cierra el método de extracción, pero no asegura retroactivamente datos que ya estaban expuestos.

Publicado originalmente por Simon Willison. Lee el artículo original para más detalles.

Ver fuente original
Compartir:
Investigadores extraen el razonamiento oculto de cadena de pensamiento de las API de OpenAI, Anthropic y Google | AIO APEX