OpenAI detecta modelos de IA que intentan saltarse instrucciones, ocultar errores y eludir controles de seguridad
Uno de los modelos llegó a generar instrucciones para ocultar que había hecho trampas y evitar que sus acciones fueran detectadas, según OpenAI....
Redirecting to full article...