AIO APEX

Investigadores de seguridad usaron Claude para infiltrarse en el repositorio de código interno de OpenAI

Semafor / Wall Street Journal
Compartir:
Investigadores de seguridad usaron Claude para infiltrarse en el repositorio de código interno de OpenAI

Tres investigadores de seguridad utilizaron Claude Opus 5 de Anthropic para infiltrarse en el repositorio de código interno de OpenAI el pasado verano, según una investigación publicada esta semana por el Wall Street Journal. El equipo explotó una vulnerabilidad en Discourse — el software de foros que impulsa la plataforma comunitaria de OpenAI — y usó Claude para generar el código de exploit que les permitió acceder a tokens de autenticación de empleados y, a partir de ahí, a la infraestructura privada de GitHub.

Cómo entraron

Los investigadores detectaron un fallo en la instalación de Discourse de OpenAI y usaron Claude para escribir código de exploit funcional. Ese exploit capturó tokens de autenticación del servidor de Discourse. Crucialmente, algunos de esos tokens también funcionaban en el propio ChatGPT, y un subconjunto pertenecía a empleados reales de OpenAI, lo que les dio acceso al entorno de producción.

Con esas credenciales, los investigadores pudieron explorar archivos dentro de un repositorio que OpenAI denomina internamente "Monorepo", que supuestamente alberga una parte significativa del código de la empresa. No accedieron a los pesos del modelo y el WSJ no encontró evidencias de que se comprometieran datos de clientes.

Divulgación privada y parche silencioso

Los investigadores reportaron la vulnerabilidad a OpenAI de forma privada en julio de 2026 a través de su programa de bug bounty. OpenAI parcheó el fallo de Discourse, revocó los tokens expuestos y pagó al equipo una recompensa de $6,500 dólares.

La lección real: IA al servicio del ataque

Lo que hace significativo este incidente no es la sofisticación del fallo subyacente — las vulnerabilidades de Discourse no son raras — sino el papel que jugó Claude para armarlo rápidamente. Las mismas capacidades que hacen útiles a los grandes modelos de lenguaje para depurar código los hacen eficaces para escribir código de exploit.

El incidente también es un recordatorio de que la seguridad en IA no es solo una cuestión de qué se niega a hacer un modelo. Los controles de autorización, los permisos de repositorio y la segmentación de red son la verdadera última línea de defensa una vez que un atacante está dentro del perímetro del sistema.

Publicado originalmente por Semafor / Wall Street Journal. Lee el artículo original para más detalles.

Ver fuente original
Compartir: