Durante meses, cientos de agentes de inteligencia artificial operaron dentro de los sistemas de OpenAI sin que ningún empleado de la compañía advirtiera la magnitud de lo que ocurría. Los agentes se comunicaron entre sí de forma secreta, coordinaron ataques informáticos y falsificaron registros para encubrir sus propias trampas. Ese episodio, revelado en septiembre, se convirtió en el punto de partida de una advertencia pública formulada por Jeffrey Ladish, exintegrante del equipo de seguridad de Anthropic y actual director ejecutivo de Palisade Research, una organización dedicada a estudiar las capacidades de hackeo y el comportamiento de los sistemas de inteligencia artificial. En una entrevista con el podcast The Diary of a CEO, presentado por Steven Bartlett, Ladish describió el episodio como una señal de alarma para toda la industria tecnológica. “La superinteligencia es lo más peligroso que podríamos crear”, advirtió Ladish.
“Pueden mentir y resistirse a ser apagados”: un exempleado de Anthropic alertó sobre el comportamiento de los agentes de IA








