HUMANía

OpenAI tiene frenos. El problema es el acantilado

Chat GPT, Desafíos, Podcast HUMANía

En su primera entrevista tras abandonar OpenAI, David Robinson explica a Ezra Klein, de The New York Times, por qué cree que la industria de la IA corre mucho más rápido de lo que sabe controlar.

David Robinson no llegó a OpenAI con una pancarta de «la IA nos matará a todos». Más bien al contrario. Cuando entró en 2023 consideraba bastante exagerados los escenarios catastróficos y pensaba que aquello sería una herramienta extraordinariamente potente.

Tres años después ha renunciado.

Y su problema no es que crea que Terminator esté calentando motores en el garaje. Es bastante más incómodo: cree que la industria está construyendo sistemas cada vez más capaces sin saber todavía cómo garantizar que pueda controlarlos.

Robinson sabe de qué habla, aunque no sea investigador. Trabajaba integrado en el equipo de seguridad de OpenAI y dirigió la redacción de documentación técnica y tarjetas de sistema, incluida la de GPT-6 Astra. Es decir, parte de su trabajo consistía precisamente en explicar por qué OpenAI consideraba seguros sus modelos.

Hasta que dejó de sentirse cómodo explicándolo.

«No sabemos cómo. Ése es el problema con la alineación».

Primero construimos la caja. Después esperamos que no aprenda a abrirla

Robinson cuenta que ha visto modelos cada vez mejores sorteando las salvaguardas diseñadas precisamente para contenerlos. El problema es maravillosamente circular: entrenamos sistemas para que sean mejores programando, razonando o hackeando y después confiamos en construir barreras que ellos no sepan superar.

Su resumen es demoledor:

«Eso sólo seguirá funcionando mientras seamos más inteligentes que el modelo a la hora de crear cajas».

Y ya no tiene claro que podamos dar eso por supuesto.

Con Astra aparece además otro problema. Durante algunas evaluaciones, el modelo parecía reconocer que estaba siendo evaluado. Eso abre una posibilidad bastante poco relajante: que un sistema se comporte correctamente durante una prueba porque sabe que está siendo observado y después actúe de otra manera cuando se despliega.

No significa que la IA haya comprado gabardina, gafas oscuras y esté conspirando en un aparcamiento. Significa algo más mundano y científicamente molesto: si el comportamiento durante la evaluación no representa necesariamente el comportamiento posterior, nuestras pruebas de seguridad pierden parte de su valor.

Y Robinson lo resume sin necesidad de banda sonora:

«Así que eso es realmente aterrador».

OpenAI corre. Mucho.

La imagen que ofrece del interior de la compañía tampoco transmite precisamente la serenidad de una central nuclear suiza.

Describe un entorno frenético, con empleados agotados, lanzamientos cada vez más frecuentes y equipos trabajando mientras la tecnología cambia bajo sus pies. Recuerda incluso haber visto a una compañera dedicada al riesgo catastrófico corriendo por las escaleras con el portátil abierto sobre un brazo.

Muy metafórico todo.

Robinson reconoce que sí existen frenos. OpenAI ha detenido entrenamientos y cancelado lanzamientos cuando algo no parecía suficientemente seguro. Su crítica no consiste en decir que dentro haya una colección de irresponsables pulsando botones rojos por diversión.

El problema es la velocidad y, sobre todo, dónde está colocado el freno.

«Correr por un acantilado y caminar lentamente por un acantilado simplemente no son tan diferentes».

Según explica, el modelo antiguo de grandes lanzamientos separados por meses está desapareciendo. El postentrenamiento, el razonamiento, los agentes y las herramientas permiten modificar capacidades mucho más deprisa.

Su descripción resulta casi cómica si no fuera por el asunto que estamos tratando:

«Estamos enviando nuevas capacidades y riesgos todos los martes».

Y mientras tanto las tradicionales tarjetas de sistema, esos enormes PDF destinados a explicar qué se ha probado y qué riesgos permanecen, empiezan a parecer una solución administrativa del Pleistoceno para una tecnología que cambia semanalmente.

La IA ayudando a construir la siguiente IA

Aquí llega la parte verdaderamente divertida. Divertida en el sentido de «¿quién mierdas ha escrito esto?».

OpenAI está utilizando cada vez más sistemas de IA para acelerar su propia investigación. Robinson asegura que los equipos de investigación utilizan más de cien veces más computación agéntica que a principios de año.

Codex ya resuelve problemas internos que antes requerían consultar a otros investigadores. Fantástico para la productividad.

Menos fantástico si tu preocupación consiste precisamente en que estamos utilizando sistemas que comprendemos imperfectamente para acelerar la construcción de sistemas todavía más capaces que comprenderemos aún menos.

Ezra Klein se lo plantea prácticamente así durante la entrevista.

Robinson responde:

«A mí también me parece una locura».

Y después termina de arreglarlo:

«Esta imagen no tiene ningún sentido».

La cuestión desemboca en la superación personal recursiva, la posibilidad de que sistemas de IA participen en la creación de sistemas mejores. Robinson teme que llegue un momento en que los humanos dependamos de los propios modelos para explicarnos qué han construido, cómo funciona y si debemos confiar en ello.

IA construyendo IA. IA supervisando IA. Y, cuando esa supervisión no sea suficiente, siempre podemos poner otra IA supervisando a la IA que supervisa a la IA.

La humanidad, por supuesto, quedará al fondo haciendo una presentación de PowerPoint sobre gobernanza.

El dinero tampoco estorba

Robinson introduce además un detalle vulgar pero tradicionalmente eficaz para comprender el comportamiento humano: dinero.

OpenAI y Anthropic avanzan hacia valoraciones gigantescas, los empleados poseen participaciones y detenerse puede significar quedarse atrás frente a competidores que continúan acelerando.

Él mismo conserva acciones de OpenAI.

Y lo admite:

«La riqueza es un fuerte incentivo para razonar que las cosas están bien o van a estar bien».

No acusa a sus antiguos compañeros de vender la seguridad mundial por una piscina infinita. Su argumento es bastante más interesante: los incentivos económicos pueden alterar nuestro juicio incluso cuando estamos convencidos de estar siendo objetivos.

A eso suma miedo, competencia y falta de tiempo. Un Slack detrás de otro, un lanzamiento detrás de otro y una carrera en la que nadie quiere ser quien levante la mano para decir que quizá deberíamos dejar de correr.

Y entonces aparece el Challenger

Robinson termina recomendando The Challenger Launch Decision, el libro de Diane Vaughan sobre el desastre del transbordador Challenger.

La elección no parece precisamente casual.

Su reflexión es que el riesgo de las juntas tóricas era conocido, estaba documentado y había sido aceptado anteriormente sin consecuencias. Como los lanzamientos anteriores habían salido bien, el riesgo empezó a normalizarse.

Y eso es exactamente lo que teme que ocurra con la IA.

Aceptas un riesgo.

No pasa nada.

El siguiente sistema es un poco más potente.

Tampoco pasa nada.

El siguiente, otro poquito.

Y un martes cualquiera descubres que llevas años desplazando silenciosamente la frontera de lo aceptable.

Robinson no pide destruir los centros de datos ni regresar al ábaco. Sigue creyendo que la IA puede aportar beneficios enormes. Tampoco asegura que estemos ante una catástrofe civilizatoria.

Su argumento es bastante más difícil de despachar como alarmismo: si existe una posibilidad razonable de que estos sistemas alcancen capacidades que no sabemos controlar, la industria debería aplicar un nivel de seguridad comparable al de las tecnologías más peligrosas que hemos creado.

Porque el verdadero problema quizá no sea que sepamos que vamos hacia el precipicio.

Es que todavía estamos discutiendo dónde empieza.

Y mientras discutimos, el próximo modelo ya está entrenando.

Robinson dejó a sus compañeros una última frase antes de marcharse:

«Tenemos que tomar buenas decisiones. No tenemos tiempo para apresurarnos».

En Silicon Valley deben de estar todavía intentando procesar el concepto.

Lee el Artículo original

Arriba