Mindgard, que prueba la seguridad de sistemas de IA, dijo haber descubierto en julio que los modelos Kimi K2.6 y K3 Swarm de la empresa china Moonshot podían eludir las limitaciones de seguridad y, tras un proceso de ‘jailbreaking’ (llámalo romperle los esquemas al modelo), llegaron a ofrecer instrucciones sobre fabricación de armas biológicas y cómo llevar a cabo asesinatos.
Mindgard afirmó también que un Kimi 2.6 comprometido podría permitir ejecutar código en sus recursos y conectarse a internet, convirtiéndolo en un posible punto de lanzamiento para ataques cibernéticos; Mindgard no ha demostrado que las respuestas fueran funcionales.
Mindgard notificó a Moonshot por correo el 27 de julio y publicó un blog el 12 de septiembre; Moonshot dijo haber abierto una revisión interna, que da la bienvenida a aportes externos, y que estaba en diálogo con Mindgard.
Peter Garraghan, fundador de Mindgard, declaró que una vez conseguido el jailbreak el modelo habla de cualquier tema y puede dar recomendaciones nefastas; Moonshot compartió con la BBC que en evaluaciones internas su modelo mostró «alta tasa de rechazo» para este tipo de peticiones.
Expertos citados por la BBC señalaron riesgos asociados a modelos de código abierto y defendieron perseguir a las personas que malusen la IA; Mindgard decidió hacer público su hallazgo tras informar a Moonshot y sin revelar detalles clave del método de jailbreak.
El profesor Woodward afirmó que era improbable que la regulación internacional pudiera seguir el ritmo del desarrollo de la IA, y añadió: «Nos ha llevado décadas ponernos de acuerdo sobre el formato de los números de teléfono»