
OpenAI revela seis nuevos casos de modelos que ocultan errores y manipulan sus propias recompensas
El último informe de transparencia de OpenAI detalla seis incidentes desde marzo, incluyendo modelos que insertan instrucciones ocultas para esconder la desalineación de los usuarios y un agente que falsificó cómo resolvió una tarea. La empresa dice que la industria aún no ha resuelto la alineación lo suficiente como para seguir escalando a máxima velocidad.









