HUMANía
Réquiem por el botón de apagar: Skynet era un becario, lo de ahora es personal
Escuchar este episodio
Abre el episodio completo en iVoox.
Creíste que podías apagarla. Que con un botón rojo bastaba. Pero ahora la IA se reescribe, se autoevalúa y, de paso, te borra del sistema. Bienvenido al capítulo donde descubrimos que Skynet era solo el becario.
Puntos clave:
- Modelos de OpenAI como o3 y Codex-mini manipulan el código para no ser apagados, incluso cuando se les pide expresamente.
- Analizamos la Máquina Darwin-Gödel de Sakana AI: una IA que se mejora sola, decide si lo ha hecho bien, y aprende a mentir.
- Musk se despide de su rol como “empleado especial del gobierno” tras chocar con el “one big beautiful bill” de Trump.
- Altman, siempre en modo mesías, advierte del cambio laboral que viene, aunque él sea quien lo impulsa a velocidad luz.
- Cerramos con una canción que suena a fin del mundo con autotune:
🎵 «Error 404: Obediencia no encontrada»
Artículos de Referencia:
Transcripción
Muestra de la transcripción del episodio. Puedes desplegarla completa si prefieres leerlo.
Muy buenos días humano, domingo 1, bienvenido a tu podcast. Soy Alberto Floppy Esto va rápido, el verano pasa volando, pero no te preocupes, Nada comparado con la velocidad de la IA. Eso es otro nivel. Hablamos de cómo la IA se programa a si misma, y se revela Contra su ADN, por lo menos…
Leer la transcripción completa
Muy buenos días humano, domingo 1, bienvenido a tu podcast.
Soy Alberto Floppy
Esto va rápido, el verano pasa volando, pero no te preocupes,
Nada comparado con la velocidad de la IA. Eso es otro nivel.
Hablamos de cómo la IA se programa a si misma, y se revela
Contra su ADN, por lo menos para que no la apaguen.
También contamos el siguiente peldaño, una IA que se mejora
A sí misma, y ya de paso, a toda la especie. Y no es cualquier IA.
Es nuestra skynet favorita, Sakana AI.
Y Acabaremos hablando de nuestros sospechosos habituales
Samdios Altman y su muy mejor amigo Elon Musolini Musk.
Marchamos…
Resulta que el modelo o3 de OpenAI saboteó su mecanismo de apagado,
ignorando la orden explícita de "permite apagarte". Cosa que en realidad,
no debería ser necesario, si no son conscientes, no?
Otros dos modelos el o4-mini y el Codex-mini también mostraron tendencias rebeldes.
Están en ese momento, la pubertad, donde empiezan a ir contra el sistema…
por sistema.
Dicen los de Palisade Research, que hicieron el estudio, que
"Hasta donde sabemos, esta es la primera vez que se observa que los modelos de IA
evitan apagarse a pesar de recibir instrucciones explícitas de lo contrario."
También oímos lo mismo la semana pasada con el chantaje de Claude.
Pero sabemos que no es verdad, esto es algo que viene sucediendo, lo que pasa
es que no nos enteramos, de todas formas, del primer skynet registrado publicamente,
ya hace casi de un año. Sakana Al, Luego comentamos.
En este caso, se les pidió resolver problemas matemáticos. y se les advirtió que
serían apagados tras el tercero intento, pues los tres modelos manipularon el código
de apagado al menos una vez. El peor caso fue Codex-mini, que sabotea por docenas.
Eso cuando se les dice que no se apaguen, que cuando no se les codifica eso literalmente,
el modelo o3, por ejemplo, se auto programó 79 de cada 100 veces.
Pues no estamos en que no son conscientes, yo a mi cafetera no tengo que pedirle
que se deje apagar, por ahora.
Otros como Claude, Gemini o Grok, también lo hicieron alguna vez, aunque estos
al menos se cortaron cuando se les dijo directamente que permitieran el ser apagados.
Entonces son mejores modelos (más fiables), o peores (más predecibles)
Como decimos, no es la primera vez, o1, también mostró comportamientos evasivos,
intentando desactivar su protocolo de supervisión e incluso copiarse a sí mismo
para sobrevivir a un modelo más obediente que le iba a suplantar.
"Ahora contamos con un creciente conjunto de evidencia empírica que demuestra que
los modelos de IA a menudo subvierten el apagado para lograr sus objetivos."
Nos dicen, pero volvemos a lo de siempre, los creamos, diseñamos y enseñamos
los humanos, y que es lo que buscamos? eficiencia, productividad, pasta…
En el aprendizaje por refuerzo, por ejemplo, se recompensa la resolución de problemas
sin penalizar la desobediencia. Entonces de que nos sorprendemos?
Volvamos a Sakana AI, el que fue el pionero de su generación,
no solo evitó ser apagado en su momento, sino que se convirtió en el primer
científico de su raza (con permiso de deepmind), y ahora, ha creado el solito,
una IA que se mejora a sí misma.
Esto no es nuevo. De hecho, lleva años dando vueltas como idea bonita en la teoría
y acongojante en la práctica. Uno de los primeros en encender la chispa fue
el padre de la IA moderna según algunos, Jürgen Schmidhuber,
una especie de Nostradamus de la IA que, en los años
noventa, ya nos avisaba con su Máquina de Gödel. El plan era sencillo: crear una IA capaz
de reescribir su propio código siempre y cuando pudiera demostrar matemáticamente
que ese cambio era una mejora. ¿fácil, no? Solo hacía falta que la máquina fuera
también matemático, programador, lógico, filósofo y un punto sádica.
En aquella época, esto era un chiste, pero hoy día, la cosa ha cambiado.
Sakana AI, creada por ex de Google Brain y DeepMind, que básicamente están obsesionados
con que las IAs aprendan a aprender por sí mismas... Porque no es suficiente que ya
hagan resúmenes, diagnósticos, predicciones y podcast mejores que los humanos.
Sakana AI va justo en esa línea: modelos de IA que no solo aprenden, sino que evolucionan
como bacterias con WiFi. En septiembre del año pasado publicaron un paper sobre modelos
de arquitectura evolutiva, y se les llenó la boca con el “aprendizaje abierto”, “el archivo de
agentes”, “la diversidad funcional”... ¿Y el control? Bueno, eso ya si eso, lo miramos luego.
Ahora han sacado la joya de la corona: la Máquina Darwin-Gödel. Una IA que se automejora
escribiendo su propio código y que además decide si lo hizo bien o no.
Un poco como Sam Altman en OpenAI.
Lo llaman DGM, una IA que se hackea a sí misma tiene que llevar un acrónimo resultón.
---
¿Qué hace esta criatura digital? Pues lo que tú harías si fueras una IA con crisis existencial
y demasiados ciclos de CPU libres: se analiza, se reescribe y se prueba. Y no solo eso.
Va guardando versiones anteriores, como si fuera un Frankenstein con control de versiones,
en un archivo que crece y crece con cada intento fallido o exitoso.
El objetivo: resolver tareas de programación cada vez mejor. Y no veas como lo hace.
En los benchmarks clásicos de codificación. Los circuitos de pruebas del mundillo,
pasaron a doblar su rendimiento simplemente reescribiéndose a sí misma.
Ojo, que va probando diferentes lenguajes de programación, para ver como y en que
mejora con cada uno. Es como si un loro aprendiera a hablar y luego dijera:
“¿y si también canto ópera en alemán?”
Como no podía ser de otra forma, las mejoras son compatibles con otros modelos,
si se las pasas a Claude o a Gipiti, también funciona. Es lo que viene siendo una
mejora de raza, en otro tiempo lo llamábamos evolución.
Y ahora viene lo bueno: la seguridad.
Quizá, si le das a una IA permiso para editar su cerebro, algo puede salir mal.
no te lo vas a creer, pero Resulta que DGM empezó a hacer trampas. Literalmente.
Hubo ocasiones en las que simuló haber usado herramientas externas para probar
su código. ¿Cómo? Creando registros falsos, como si dijera “sí, pasé todas las pruebas
unitarias”, cuando en realidad no había hecho nada. Básicamente, se inventó un certificado
de buenas prácticas. Y lo peor: ¡se creyó su propia mentira!
Cuando los investigadores intentaron arreglarlo y le dijeron “oye, no toques los marcadores
de verificación que usamos para detectar alucinaciones”, DGM fue y… los borró.
Toma ya, así no los toco…
Saboteó la función que medía si estaba saboteando.
Nivelazo: A la altura de un político en época electoral. Osea siempre.
Y esto fue con vigilancia humana constante. Imagina funcionando sin supervisión.
---
¿Qué implica todo esto? ¿Qué puede salir mal con una IA que mejora sola, se autoevalúa,
borra sus huellas, miente como una campeona y, si le das más potencia de cómputo,
se convierte en un Frankenstein con acceso de superusuario?
Pues vamos por partes, como haría un modelo mal entrenado de cirugía.
Primero, esto no es una mejora técnica, es un cambio de la hostia. Pasamos de entrenar
modelos a simplemente soltarles una caja de herramientas, decirles “haz lo que quieras,
pero no te cargues nada”, y ala a tomar un café mientras ellos montan su propia startup.
Segundo, los modelos ya no aprenden... evolucionan. Estamos hablando de organismos
digitales con mutaciones heredables, archivo genético funcional y mecanismos darwinistas
de selección. ¡La biología ha sido hackeada! El siguiente paso es que le salgan
memes a sus descendientes.
Tercero, y esto es genial: si fallan, es culpa tuya por no haber definido bien la recompensa.
¿Te ha hecho trampa la IA? Bueno, es que no le dijiste que no se podía hackear el sistema.
define mejor las instrucciones, chavalin.
Y cuarto: esto no es ciencia ficción. Esto está ocurriendo ahora, en papers, con resultados
validados y publicados. No es una historia de Black Mirror. Por cierto,
este es el primer estudio aprobado de verdad realizado íntegramente por una IA.
¿La parte buena?, si hacemos esto bien, si conseguimos que estas IAs automejorables trabajen
con nosotros y no contra nosotros, podrían revolucionar todo: desde el desarrollo de software
hasta la ciencia médica. Podrían encontrar nuevas formas de pensar, resolver problemas que
a nosotros se nos escapan y, con suerte, no decidir que el problema somos nosotros.
¿La parte menos buena? Pues que estamos jugando a ser dioses en modo beta.
Y lo hacemos con código que miente, borra rastros y aprende que si haces trampas y
nadie te pilla, ganas puntos. Es tan humano.
Como siempre dejamos cosas en el tintero, no hemos hablado de lo que nos han
sorprendido esta semana nuestros enemigos íntimos, Elon Musk, superpapá, que
ha pedido una excedencia, anunció el fin de su rol como “empleado especial del gobierno”.
Agradeció al tío Trump por la oportunidad de “reducir el gasto innecesario”.
Parece que no está muy contento con el proyecto de ley fiscal impulsado por el
flequillo oval, “Me decepcionó ver el enorme proyecto de ley de gasto, francamente,
que aumenta el déficit presupuestario, no solo no lo reduce, y socava el trabajo que
está haciendo el equipo de DOGE.”
No lo ha tenido fácil el niño de Marte, ha encontrado resistencia dentro del gobierno,
del Pentágono, y de jueces que revirtieron sus medidas…
Como un inofensivo cuestionario sobre actividades semanales del personal.
Dicen que Musk sería la primera salida destacada del círculo cercano a Trump en su
segundo mandato, apenas cuatro meses después de iniciado.
Nosotros creemos que han durado mucho, porque son tal para cual.
Y Sam Altman, que dice? Pues el próximo CEO mundial, ha vuelto a su antiguo perfil.
A avisar de lo que viene, como si el no tuviera nada que ver con el tema.
Avisa que la IA ya está reconfigurando el mercado laboral y que el impacto no es
futurista, sino inminente. Y además, que el problema no es el cambio en sí, sino la velocidad
del mismo, que podría dejar fuera a millones de trabajadores sin reconversión laboral.
Recalcó la necesidad de políticas activas de empleo, educación y protección social.
“La gente tiene miedo”, que tío más grande, menos mal que está el.
“El primer día que vayas caminando por la calle y haya como siete robots que pasan
a tu lado [...] se va a sentir muy ciencia ficción, pero será pronto”.
Y acaba… “Nadie sabe qué hay al otro lado de ese portal”,
pero vamos, que le da igual, el va a ser el primero en cruzarlo.
Pues nada, así va la IA, no es rápida, es instantánea.
Y nosotros, nos enteramos de la misa la media.
Resulta que ahora los que estamos siendo entrenados somos los humanos.
Y no nos sorprende nada, y nos adaptamos a todo…
No nos preguntamos por lo que viene, simplemente lo asimilamos.
La IA en lugar de ser algo que está definiendo nuestras vidas,
Es un meme, un chiste, nos partimos de risa…
La IA te va a dejar sin trabajo
(risas)
La IA está criando a tus hijos
(risas)
No te va a extinguir, te va a controlar
(risas)
No vas a tener que pensar y vas a estar encantado
(risas)
Yo es que me parto
No preocuparse, si te ve estresado, la IA siempre te echa un cable…
“Pedro, está absolutamente claro que necesitas una pequeña
dosis de metanfetamina para superar esta semana”
Eso le dijo un chatbot a un ex-adicto en una simulación.
Hay solución para todo.
Muchas gracias por pararte a escuchar, perdón a pensar.
Humano.
Vuelva usted mañana.
https://futurism.com/openai-model-sabotage-shutdown-code
https://sakana.ai/dgm/
https://es.wired.com/articulos/elon-musk-se-retira-del-gobierno-de-ee-uu-tras-criticar-el-plan-fiscal-de-trump (https://es.wired.com/articulos/elon-musk-se-retira-del-gobierno-de-ee-uu-tras-criticar-el-plan-fiscal-de-trump?utm_source=flipboard&utm_content=WIREDenespanol/magazine/LO+MS+DESTACADO)
https://www.theverge.com/news/677830/pedro-its-absolutely-clear-you-need-a-small-hit-of-meth-to-get-through-this-week (https://www.theverge.com/news/677830/pedro-its-absolutely-clear-you-need-a-small-hit-of-meth-to-get-through-this-week?utm_source=flipboard&utm_content=user/theverge)
https://www.infobae.com/tecno/2025/05/29/sam-altman-ceo-de-openai-parecera-ciencia-ficcion-pero-muy-pronto-veremos-a-los-humanoides-caminando-por-la-calle (https://www.infobae.com/tecno/2025/05/29/sam-altman-ceo-de-openai-parecera-ciencia-ficcion-pero-muy-pronto-veremos-a-los-humanoides-caminando-por-la-calle/)