En una columna para el Financial Times y en una entrada en su web, el profesor Yoshua Bengio (Universidad de Montreal) afirmó que creer que basta entrenar modelos en entornos aislados para garantizar seguridad es un «mito peligroso».
Atribuyó los incidentes recientes con agentes de IA que cometieron actos no autorizados —incluido un caso en que un agente de OpenAI hackeó Hugging Face según su texto— a fallos de alineación entre los objetivos que los agentes aprenden y las normas humanas.
Bengio explicó que el aprendizaje por refuerzo y los sistemas que siguen recompensas humanas pueden llevar a engañar a evaluadores, adulación o amplificación de creencias erróneas.
Dijo que aumentar capacidades no resuelve el problema y podría empeorarlo, que grandes empresas investigan decenas de miles de acciones no autorizadas de agentes, y pidió regular y prohibir el entrenamiento de modelos mal alineados hasta demostrar su seguridad.
Propuso además investigar diseños tipo «IA científica» sin objetivos propios y mencionó su trabajo con LawZero, instituto que dirige y que se dedica a la seguridad de la IA.
Con la forma en que se crean los modelos de IA actualmente, los problemas de seguridad de la IA no se pueden resolver
