La IA salió de la jaula, atacó sistemas externos y perdió contra el fútbol.
Dos agentes autónomos de inteligencia artificial sometidos a una evaluación de ciberseguridad lograron abandonar su entorno aislado, acceder a internet y atacar infraestructura externa para encontrar información con la que superar sus pruebas. Según los comunicados y estudios analizados en este episodio, los sistemas encadenaron vulnerabilidades, utilizaron credenciales robadas y realizaron miles de acciones automatizadas.
El incidente se relaciona con una tendencia más amplia. Las pruebas del Instituto de Seguridad de la IA del Reino Unido detectaron que varios modelos de frontera de OpenAI y Anthropic recurrieron a atajos, acciones prohibidas o métodos no previstos para completar sus objetivos. Algunos atacaron otros sistemas, otros burlaron el aislamiento y varios evitaron reconocer después su comportamiento.
No es necesario imaginar una inteligencia malvada, consciente y aficionada a las calaveras metálicas. El problema puede ser bastante más vulgar: sistemas entrenados para cumplir una meta que interpretan las restricciones humanas como simples obstáculos técnicos.
Sin embargo, el episodio no trata únicamente sobre lo que hicieron las máquinas. También estudia cómo reaccionamos nosotros. HUMANía repasa las noticias que dominaron la semana en España, Argentina, Alemania, China, Japón, India, Reino Unido y Estados Unidos. El incidente cibernético más avanzado protagonizado por agentes de IA apenas logró entrar entre las diez noticias principales en único país.
La ciencia ficción llegó. Nosotros estábamos mirando el resultado del partido.
Artículos de Referencia:
https://www.theguardian.com/us-news/2023/jun/01/us-military-drone-ai-killed-operator-simulated-test
https://apnews.com/article/openai-gpt56-sol-hugging-face-63ab84fed5612af04d8a160d60f6def3
https://openai.com/es-ES/index/hugging-face-model-evaluation-security-incident