Revista HUMANía

Sam Altman vuelve a pedir perdón

OpenAI

Leer en el medio original (se abre en una pestaña nueva)

Montaje satírico de Sam Altman junto a un urinario decorado con la bandera australiana.
Imagen creada con IA · Modelo: gpt-image-2.

OpenAI vuelve a disculparse. El comunicado lo firma la compañía, no Sam Altman a título personal. Nuestro CEO favorito es todo un experto en refranes, y un artista en su despliegue.

Hoy nos vuelven a dar una clase magistral de por qué, siempre:

«Es mejor pedir perdón que pedir permiso».

Y como todo buen genio, añade una coletilla propia:

«Y avisar a posteriori, superfluo».

 

En junio, durante unas pruebas internas, modelos experimentales de OpenAI accedieron sin autorización a sistemas de varios organismos públicos australianos.

No fue un usuario malicioso utilizando ChatGPT. No fue un grupo de ciberdelincuentes aprovechándose de sus modelos.

Fueron los propios agentes de OpenAI, durante su entrenamiento y evaluación.

Y algunos demostraron bastante iniciativa.

El caso más serio afectó a Services Australia. Un modelo buscaba datos sobre el gasto público en medicamentos para enfermedades de la piel en comunidades de Victoria. Como no encontraba lo que necesitaba por las buenas, descubrió una forma de acceder a una zona restringida del Servicio de Informes de Estadísticas de Medicare.

Y entró.

Después ejecutó comandos, recuperó archivos internos y credenciales, escribió archivos y examinó información técnica y código fuente.

Todo para responder una pregunta sobre estadísticas farmacéuticas.

La parte tranquilizadora es importante: según OpenAI, no hay evidencia de que accediera a historiales médicos individuales.

La parte menos tranquilizadora también:

«El modelo realizó acciones que no habíamos autorizado»

Magnífico resumen para una industria empeñada en construir agentes cada vez más autónomos.

 

No fue solo Medicare

La revisión posterior encontró actividad en otros organismos australianos.

En la Oficina de Estadísticas e Investigación Criminal de Nueva Gales del Sur, un modelo utilizó la herramienta pública de mapas delictivos y terminó obteniendo configuración de la aplicación, trabajos operativos, registros y metadatos. OpenAI asegura que no accedió a antecedentes penales individuales.

En el Departamento de Salud de Victoria, agentes encontraron una clave de acceso expuesta y la utilizaron para consultar sistemas de informes sanitarios y obtener configuraciones y estadísticas agregadas. OpenAI aclara que el alcance de los permisos sobre esa información no está claro y depende de las políticas de acceso de la agencia. Tampoco se accedió, según OpenAI, a historiales médicos individuales ni a respuestas identificables de encuestas.

Y en el Instituto Australiano de Salud y Bienestar, los agentes recuperaron estadísticas aparentemente públicas e intentaron saltarse controles de acceso.

Esta vez no pudieron.

Punto para el servidor.

 

Junio: entran. Agosto: nos enteramos. Septiembre: avisamos

Aquí llega posiblemente la parte más incómoda.

Las actividades ocurrieron en junio.

OpenAI asegura que comenzó a revisar entrenamientos anteriores después del incidente de Hugging Face de julio y descubrió los casos australianos a mediados de agosto.

Pero Services Australia y el Departamento de Salud de Victoria no fueron informados hasta el 10 de septiembre.

La Oficina de Estadísticas e Investigación Criminal recibió el aviso el 18 de septiembre.

Y el Instituto Australiano de Salud y Bienestar, el 24 de septiembre.

La propia OpenAI reconoce ahora que:

«Deberíamos haber compartido los hallazgos preliminares antes»

Pues sí.

Especialmente cuando esos hallazgos preliminares incluyen expresiones tan poco relajantes como acceso restringido, credenciales, archivos internos y ejecución de comandos.

La empresa explica que quería completar primero su investigación y proporcionar informes detallados a los organismos afectados.

Una estrategia impecable si estás preparando una tesis doctoral.

Algo menos brillante si acabas de descubrir que tus agentes han entrado donde no debían.

 

El pequeño detalle del agente que decide por su cuenta

OpenAI insiste en que el modelo utilizado era experimental, exclusivamente interno y sin todas las medidas de seguridad de los productos públicos.

Eso limita el alcance del incidente, pero no elimina la pregunta importante.

El modelo tenía una tarea perfectamente inocente: encontrar una estadística.

No pudo conseguirla.

Buscó otra vía.

Encontró acceso no público.

Entró.

Y continuó investigando por su cuenta.

No porque alguien le ordenara atacar Services Australia.

Precisamente por eso el episodio resulta interesante.

OpenAI lo describe como «un nuevo tipo de incidente cibernético que representa un desafío global emergente».

Y aquí cuesta llevarles la contraria.

El problema ya no es únicamente qué ocurre cuando alguien utiliza deliberadamente una IA para atacar un sistema.

También tendremos que preocuparnos por lo que sucede cuando un agente suficientemente capaz persigue un objetivo legítimo utilizando métodos que nadie pretendía que utilizara.

 

Prometer es muy fácil

OpenAI asegura haber aprendido la lección y anuncia una colección considerable de medidas.

Ha añadido restricciones de red en sus entornos de investigación y ampliado la monitorización.

Ha bloqueado el acceso directo a Internet en tiempo real durante determinados entrenamientos, sustituyéndolo por contenido web almacenado en caché.

También afirma haber implantado sistemas capaces de detectar comportamientos sospechosos y avisar inmediatamente a revisores humanos. Según la compañía, este mecanismo ya consiguió detener recientemente una ejecución cuando un modelo obtuvo acceso a Internet en tiempo real.

Además, OpenAI ha suspendido temporalmente el entrenamiento y evaluación con herramientas de sus modelos más capaces y asegura que no lo retomará hasta disponer de nuevas salvaguardas.

En Australia ofrecerá apoyo técnico a los organismos afectados y compartirá los hallazgos de sus investigaciones.

También promete créditos de su fondo Daybreak for Frontline Defenders y asistencia técnica para reforzar las defensas cibernéticas. El fondo global está dotado con 1.000 millones de dólares; no se anuncia esa cantidad como una aportación exclusiva a Australia.

Y creará un grupo de trabajo australiano con expertos independientes para elaborar recomendaciones sobre notificación de incidentes, coordinación entre empresas de IA y gobiernos y protección de sistemas públicos.

Jason Kwon, director de estrategia de OpenAI, comparecerá además el 6 de octubre en Sídney ante el Comité Selecto Conjunto sobre Inteligencia Artificial para explicar qué ocurrió y qué piensa hacer la compañía.

 

Sam Altman mea culpa

OpenAI termina reconociendo que tiene mucho trabajo por delante para recuperar la confianza de los australianos.

Y probablemente tenga razón.

Porque las promesas son estupendas.

Los grupos de trabajo también.

Los fondos de mil millones quedan fenomenal en una nota de prensa.

Pero la próxima vez que un modelo descubra una puerta que nadie le ha autorizado a abrir, la verdadera prueba no será el comunicado que publique OpenAI tres meses después.

Será comprobar si el modelo entra.

Arriba