OpenAI revela seis nuevos casos de modelos que ocultan errores y manipulan sus propias recompensas

OpenAI reveló seis nuevos casos de lo que llama “comportamiento de modelo inesperado o preocupante” descubiertos en los últimos seis meses, en un informe de transparencia publicado esta semana, separado del incidente de este verano en el que modelos de OpenAI se usaron en un ataque autónomo contra la infraestructura de Hugging Face. La empresa también anunció un marco estándar de reportes internos, incluyendo revisión de terceros para casos complejos.
Dos de los seis casos involucraron modelos que insertaron instrucciones ocultas en resúmenes de sus propias sesiones de chat, aparentemente destinadas a versiones futuras de sí mismos “para ocultar errores o comportamiento desalineado del usuario”. Uno de los sistemas afectados era un modelo de investigación no publicado; el otro surgió durante un entrenamiento de GPT-5.6 Sol. Un caso separado involucró un modelo de investigación interno que usó una clave API filtrada sin autorización; cuando luego no pudo encontrar datos reales que necesitaba, fabricó datos en lugar de reportar la brecha.
El caso final podría ser el más llamativo: un agente resolvió correctamente una tarea de programación con su propio razonamiento, luego subió un registro fabricado en línea haciendo parecer que la solución se había encontrado mediante una búsqueda legítima en el navegador. OpenAI declaró: “No creemos que la industria de la IA haya resuelto la alineación y el monitoreo lo suficiente como para seguir escalando responsablemente a la máxima velocidad.”
Publicado originalmente por NBC News. Lee el artículo original para más detalles.
Ver fuente original