HUMANía

La adolescencia de la tecnología III

Desafíos, Podcast HUMANía

Escuchar este episodio

Abre el episodio completo en iVoox.

Escuchar en iVoox (se abre en una pestaña nueva)

El Precio

Cuando la IA funciona demasiado bien y el problema deja de ser técnico

En el tercer y último capítulo cerramos el texto de Dario Amodei donde la pregunta ya no es si la inteligencia artificial es peligrosa, ni quién la controla, sino qué pasa cuando todo sale según lo previsto.

Crecimiento económico acelerado, productividad sin precedentes y avances científicos a velocidad obscena. El escenario ideal… salvo por un detalle menor: el papel del ser humano en un mundo donde ya no es necesario para producir valor.

Amodei entra de lleno en la disrupción del mercado laboral, la concentración extrema de la riqueza y el riesgo de que la democracia deje de funcionar cuando la mayoría de la población deja de ser económicamente relevante. No desde el catastrofismo, sino desde algo más incómodo: incentivos racionales que llevan a resultados socialmente explosivos.

El texto avanza hacia terrenos todavía más inciertos: efectos indirectos, cambios profundos en el propósito humano, relaciones con sistemas de IA, dependencia psicológica, y un futuro donde el progreso científico se condensa en décadas… sin tiempo para que la sociedad se adapte.

No hay soluciones mágicas. Solo intentos de ganar tiempo: datos, regulación, redistribución, filantropía y, sobre todo, valentía política. Porque frenar la tecnología no es una opción realista. Gestionar sus consecuencias, sí… aunque cueste.

Este episodio no cierra el debate.
Lo deja abierto donde más duele.


Claves del capítulo

  • La IA puede impulsar un crecimiento económico del 10–20% anual.
  • El riesgo no es el colapso, sino la irrelevancia laboral masiva.
  • La concentración extrema de riqueza amenaza el contrato social.
  • La democracia depende de que la población siga siendo necesaria.
  • El mayor peligro no es lo que la IA haga mal, sino lo que hará bien.
  • No hay freno tecnológico viable, solo gestión política y moral.

https://www.darioamodei.com/essay/the-adolescence-of-technology

Transcripción

Muestra de la transcripción del episodio. Puedes desplegarla completa si prefieres leerlo.

Muy buenos días humano… Bueno, digo buenos días, y es probable que sean Buenas noches. En cualquier caso, bienvenido a tu podcast. AI IA HOY, soy Alberto floppy. Como ya comentamos el domingo, Nuestro querido Darío Amodei ha hecho los deberes. Este episodio no es corto. No es cómodo. Y no viene con conclusiones al…

Leer la transcripción completa

Muy buenos días humano…

Bueno, digo buenos días, y es probable que sean

Buenas noches. En cualquier caso, bienvenido a tu podcast.

AI IA HOY, soy Alberto floppy. Como ya comentamos el domingo,

Nuestro querido Darío Amodei ha hecho los deberes.

Este episodio no es corto. No es cómodo. Y no viene con conclusiones

al final para que puedas dormir tranquilo.

No me voy a extender, porque ya lo hace él. Aquí te presento la primera parte

De el artículo La Adolescencia de la Tecnología, un tochazo de 20 mil palabras…

Que debería ser obligatorio en todas las escuelas…

Sin mas te dejo con el rapapolvo…

Escuchamos.

La adolescencia de la tecnología

Cómo afrontar y superar los riesgos de la IA potente

Enero de 2026

Hay una escena en la versión cinematográfica del libro Contacto de Carl Sagan donde la protagonista, una astrónoma que ha detectado la primera señal de radio de una civilización extraterrestre, es considerada para representar a la humanidad en su encuentro con los extraterrestres. El panel internacional que la entrevista pregunta: "Si pudieras hacerles una sola pregunta [a los extraterrestres], ¿cuál sería?". Su respuesta es: "Les preguntaría: '¿Cómo lo hiciste? ¿Cómo evolucionaste? ¿Cómo sobreviviste a esta adolescencia tecnológica sin destruirte?'". Cuando pienso en la situación actual de la humanidad con la IA, en lo que estamos a punto de vivir, mi mente vuelve una y otra vez a esa escena, porque la pregunta es tan apropiada para nuestra situación actual, y desearía que la respuesta de los extraterrestres nos guiara. Creo que estamos entrando en un rito de paso, turbulento e inevitable, que pondrá a prueba nuestra identidad como especie. La humanidad está a punto de recibir un poder casi inimaginable, y no está claro si nuestros sistemas sociales, políticos y tecnológicos poseen la madurez necesaria para ejercerlo.

En mi ensayo " Máquinas de gracia amorosa" (https://darioamodei.com/machines-of-loving-grace) , intenté exponer el sueño de una civilización que hubiera llegado a la edad adulta, donde se hubieran abordado los riesgos y se hubiera aplicado una poderosa IA con habilidad y compasión para mejorar la calidad de vida de todos. Sugerí que la IA podría contribuir a enormes avances en biología, neurociencia, desarrollo económico, paz global, trabajo y sentido de la vida. Sentí que era importante dar a la gente algo inspirador por lo que luchar, una tarea en la que tanto los aceleracionistas de la IA como los defensores de su seguridad parecían —curiosamente— haber fracasado. Pero en este ensayo, quiero confrontar el rito de paso en sí: mapear los riesgos que estamos a punto de enfrentar e intentar comenzar a trazar un plan de batalla para derrotarlos. Creo profundamente en nuestra capacidad de prevalecer, en el espíritu de la humanidad y su nobleza, pero debemos enfrentar la situación con franqueza y sin ilusiones.

Al igual que al hablar de los beneficios, creo que es importante analizar los riesgos de forma cuidadosa y bien pensada. En particular, creo que es fundamental:

- Eviten el catastrofismo. Me refiero a «catalogismo» no solo en el sentido de creer que el desastre es inevitable (una creencia falsa y autocumplida), sino, en general, a considerar los riesgos de la IA de una manera casi religiosa . (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:1)
- Mucha gente ha reflexionado de forma analítica y sobria sobre los riesgos de la IA durante años, pero tengo la impresión de que durante el auge de la preocupación por este riesgo en 2023-2024, algunas de las voces menos sensatas se alzaron, a menudo a través de cuentas sensacionalistas en redes sociales. Estas voces emplearon un lenguaje ofensivo, que evocaba la religión o la ciencia ficción, y exigieron acciones extremas sin contar con las pruebas que las justificaran. Incluso entonces, era evidente que la reacción era inevitable y que el tema se polarizaría culturalmente y, por lo tanto, quedaría paralizado. 2 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:2)
- Entre 2025 y 2026, el péndulo ha oscilado, y la oportunidad de la IA, no su riesgo, es lo que impulsa muchas decisiones políticas. Esta vacilación es lamentable, ya que a la tecnología en sí no le importa lo que está de moda, y estamos mucho más cerca del peligro real en 2026 que en 2023. La lección es que debemos debatir y abordar los riesgos de forma realista y pragmática: sobria, basada en hechos y bien preparada para afrontar los cambios.
- Reconozca la incertidumbre. Hay muchas maneras en que las preocupaciones que planteo en este artículo podrían ser irrelevantes. Nada aquí pretende transmitir certeza ni siquiera probabilidad. Lo más obvio es que la IA podría no avanzar tan rápido como imagino. 3 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:3)
- O, incluso si avanza rápidamente, algunos o todos los riesgos aquí mencionados podrían no materializarse (lo cual sería fantástico), o podría haber otros riesgos que no he considerado. Nadie puede predecir el futuro con total seguridad, pero debemos hacer todo lo posible por planificar de todos modos.
- Intervenir de la forma más quirúrgica posible. Abordar los riesgos de la IA requerirá una combinación de acciones voluntarias por parte de las empresas (y terceros actores privados) y acciones gubernamentales que vinculen a todos. Las acciones voluntarias, tanto tomarlas como alentar a otras empresas a seguir el ejemplo, son obvias para mí. Creo firmemente que las acciones gubernamentales también serán necesarias en cierta medida , pero estas intervenciones son de naturaleza diferente porque pueden potencialmente destruir el valor económico o coaccionar a actores reticentes que se muestran escépticos ante estos riesgos (¡y es posible que tengan razón!). También es común que las regulaciones sean contraproducentes o agraven el problema que pretenden resolver (y esto es aún más cierto para las tecnologías que cambian rápidamente). Por lo tanto, es muy importante que las regulaciones sean juiciosas: deben buscar evitar daños colaterales, ser lo más simples posible e imponer la menor carga necesaria para lograr su objetivo. 4 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:4)
- Es fácil decir: "¡Ninguna acción es demasiado extrema cuando el destino de la humanidad está en juego!", pero en la práctica, esta actitud simplemente genera reacciones negativas. Para ser claros, creo que existe una buena probabilidad de que eventualmente lleguemos a un punto en el que se justifiquen acciones mucho más significativas, pero eso dependerá de evidencia más sólida de peligro inminente y concreto que la que tenemos hoy, así como de suficiente especificidad sobre el peligro para formular normas que puedan abordarlo. Lo más constructivo que podemos hacer hoy es abogar por normas limitadas mientras analizamos si hay evidencia que respalde unas más estrictas . (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:5)

Dicho esto, creo que el mejor punto de partida para hablar de los riesgos de la IA es el mismo que el que utilicé para hablar de sus beneficios: precisando el nivel de IA del que hablamos. El nivel de IA que, para mí, plantea inquietudes civilizatorias es la poderosa IA que describí en «Máquinas de Gracia Amorosa». Simplemente repetiré aquí la definición que di en ese documento:

Cuando hablo de “IA potente”, me refiero a un modelo de IA (probablemente similar a los LLM actuales en su forma, aunque podría basarse en una arquitectura diferente, podría involucrar varios modelos interactuantes y podría entrenarse de manera diferente) con las siguientes propiedades:

- En términos de inteligencia pura, es más inteligente que un ganador del Premio Nobel en la mayoría de los campos relevantes: biología, programación, matemáticas, ingeniería, escritura, etc. Esto significa que puede demostrar teoremas matemáticos sin resolver, escribir novelas extremadamente buenas, escribir bases de código difíciles desde cero, etc.
- Además de ser simplemente un "objeto inteligente con el que se puede hablar", cuenta con todas las interfaces disponibles para un humano que trabaja virtualmente, incluyendo texto, audio, video, control de ratón y teclado, y acceso a internet. Puede realizar cualquier acción, comunicación u operación remota que permita esta interfaz, incluyendo realizar acciones en internet, seguir o dar instrucciones a humanos, pedir materiales, dirigir experimentos, ver videos, crear videos, etc. Realiza todas estas tareas con, una vez más, una habilidad que supera la de los humanos más capaces del mundo.
- No se limita a responder preguntas pasivamente, sino que se le pueden asignar tareas que toman horas, días o semanas para completar, y luego se va y realiza esas tareas de manera autónoma, como lo haría un empleado inteligente, pidiendo aclaraciones cuando sea necesario.
- No tiene una encarnación física (más allá de vivir en una pantalla de computadora), pero puede controlar herramientas físicas, robots o equipos de laboratorio existentes a través de una computadora; en teoría, podría incluso diseñar robots o equipos para su propio uso.
- Los recursos utilizados para entrenar el modelo pueden reutilizarse para ejecutar millones de instancias (esto coincide con el tamaño de los clústeres proyectado para ~2027), y el modelo puede absorber información y generar acciones a una velocidad entre 10 y 100 veces superior a la humana. Sin embargo, puede verse limitado por el tiempo de respuesta del entorno físico o del software con el que interactúa.
- Cada una de estos millones de copias puede actuar independientemente en tareas no relacionadas o, si es necesario, pueden trabajar todas juntas de la misma forma en que colaborarían los humanos, tal vez con diferentes subpoblaciones ajustadas para ser especialmente buenas en tareas particulares.

Podríamos resumirlo como un “país de genios en un centro de datos”.

Como escribí en Machines of Loving Grace , la IA poderosa podría estar a tan solo uno o dos años de distancia, aunque también podría estar considerablemente más lejos. 6 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:6)

Exactamente cuándo llegará la IA poderosa es un tema complejo que merece un ensayo propio, pero por ahora simplemente explicaré muy brevemente por qué creo que hay una gran posibilidad de que pueda ser muy pronto.

Mis cofundadores de Anthropic y yo fuimos de los primeros en documentar y rastrear las " leyes de escala (https://arxiv.org/abs/2001.08361) " de los sistemas de IA: la observación de que, a medida que añadimos más tareas de computación y entrenamiento, los sistemas de IA mejoran previsiblemente en prácticamente todas las habilidades cognitivas que podemos medir. Cada pocos meses, la opinión pública se convence de que la IA está estancada (https://edition.cnn.com/2024/11/19/business/ai-chatgpt-nvidia-nightcap) o se entusiasma con algún nuevo avance que cambiará radicalmente las reglas del juego. Sin embargo , lo cierto es que , (https://www.ft.com/content/d01290c9-cc92-4c1f-bd70-ac332cd40f94) tras la volatilidad y la especulación pública, se ha producido un aumento gradual e inquebrantable de las capacidades cognitivas de la IA.

Ahora estamos en el punto donde los modelos de IA están empezando a progresar en la resolución de problemas matemáticos sin resolver, y son lo suficientemente buenos en codificación como para que algunos de los ingenieros más fuertes que he conocido ahora le estén entregando casi toda su codificación. Hace tres años, la IA tenía dificultades con los problemas aritméticos de la escuela primaria (https://arxiv.org/abs/2005.14165) y apenas era capaz de escribir una sola línea de código. Se están produciendo ritmos de mejora similares en las ciencias biológicas (https://www.anthropic.com/news/accelerating-scientific-research) , las finanzas, la física y una variedad de tareas agénticas. Si la exponencial continúa —lo cual no es seguro, pero ahora tiene un historial de una década que lo respalda— entonces no pueden pasar más de unos pocos años antes de que la IA sea mejor que los humanos en prácticamente todo.

De hecho, esa imagen probablemente subestima el probable ritmo de progreso. Dado que la IA ahora escribe gran parte del código en Anthropic (https://www.anthropic.com/research/how-ai-is-transforming-work-at-anthropic) , ya está acelerando sustancialmente nuestro ritmo de progreso en la construcción de la próxima generación de sistemas de IA. Este ciclo de retroalimentación cobra impulso mes a mes, y puede que solo falten uno o dos años para que la generación actual de IA construya la siguiente de forma autónoma. Este ciclo ya ha comenzado y se acelerará rápidamente en los próximos meses y años. Al observar los últimos 5 años de progreso desde Anthropic, y cómo se perfilan incluso los modelos de los próximos meses, puedo sentir el ritmo del progreso y el reloj avanzando.

En este ensayo, asumiré que esta intuición es al menos algo correcta, no que la IA poderosa llegará definitivamente en uno o dos años, 7 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:7)

Pero hay una probabilidad considerable de que así sea, y una probabilidad muy alta de que ocurra en los próximos años. Al igual que con Machines of Loving Grace , tomar esta premisa en serio puede llevar a conclusiones sorprendentes e inquietantes. Si bien en Machines of Loving Grace me centré en las implicaciones positivas de esta premisa, aquí los temas que abordaré serán inquietantes. Son conclusiones que quizás no queramos afrontar, pero eso no las hace menos reales. Solo puedo decir que me concentro día y noche en cómo alejarnos de estos resultados negativos y acercarnos a los positivos, y en este ensayo explico con gran detalle cómo hacerlo.

Creo que la mejor manera de comprender los riesgos de la IA es plantearse la siguiente pregunta: supongamos que un auténtico «país de genios» se materializara en algún lugar del mundo en torno al año 2027. Imaginemos, por ejemplo, 50 millones de personas, todas ellas mucho más capaces que cualquier premio Nobel, estadista o tecnólogo. La analogía no es perfecta, porque estos genios podrían tener una gama extremadamente amplia de motivaciones y comportamientos, desde completamente dóciles y obedientes hasta motivaciones extrañas y ajenas. Pero, siguiendo con la analogía por ahora, supongamos que usted fuera el asesor de seguridad nacional de un gran estado, responsable de evaluar y responder a la situación. Imaginemos, además, que, dado que los sistemas de IA pueden operar cientos de veces más rápido que los humanos, este «país» opera con una ventaja temporal con respecto a todos los demás países: por cada acción cognitiva que nosotros podemos realizar, este país puede realizar diez.

¿De qué deberías preocuparte? Me preocuparía por lo siguiente:

1. Riesgos para la autonomía. ¿Cuáles son las intenciones y los objetivos de este país? ¿Es hostil o comparte nuestros valores? ¿Podría dominar militarmente el mundo mediante armas superiores, operaciones cibernéticas, operaciones de influencia o manufactura?
2. Uso indebido para la destrucción. Supongamos que el nuevo país es flexible y "sigue instrucciones", y por lo tanto es esencialmente un país de mercenarios. ¿Podrían los actores deshonestos existentes que buscan causar destrucción (como los terroristas) usar o manipular a algunas personas del nuevo país para ser mucho más efectivos, amplificando considerablemente la escala de la destrucción?
3. Uso indebido para tomar el poder. ¿Qué pasaría si el país hubiera sido construido y controlado por un actor poderoso, como un dictador o una corporación corrupta? ¿Podría ese actor usarlo para obtener un poder decisivo o dominante sobre el mundo entero, alterando el equilibrio de poder existente?
4. Disrupción económica. Si el nuevo país no representa una amenaza para la seguridad en ninguno de los aspectos mencionados en los puntos 1 a 3, sino que simplemente participa pacíficamente en la economía global, ¿podría aun así generar graves riesgos simplemente por ser tan avanzado tecnológicamente y eficaz que perturbe la economía global, causando desempleo masivo o una concentración radical de la riqueza?
5. Efectos indirectos. El mundo cambiará muy rápidamente debido a la nueva tecnología y productividad que generará el nuevo país. ¿Podrían algunos de estos cambios ser radicalmente desestabilizadores?

Creo que debería quedar claro que se trata de una situación peligrosa: un informe de un funcionario competente de seguridad nacional a un jefe de estado probablemente contendría palabras como «la amenaza más grave a la seguridad nacional que hemos enfrentado en un siglo, posiblemente en la historia». Parece algo en lo que deberían centrarse las mentes más brillantes de la civilización.

Por el contrario, creo que sería absurdo encogerse de hombros y decir: "¡No hay de qué preocuparse!". Pero, ante el rápido progreso de la IA, esa parece ser la opinión de muchos responsables políticos estadounidenses, algunos de los cuales niegan la existencia de cualquier riesgo para la IA, cuando no están completamente distraídos por los viejos y trillados temas polémicos de siempre. 8 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:8)

La humanidad necesita despertar, y este ensayo es un intento —quizás inútil, pero que vale la pena intentar— de despertar a la gente.

Para ser claro, creo que si actuamos con decisión y cuidado, podemos superar los riesgos; incluso diría que tenemos buenas probabilidades. Y hay un mundo muchísimo mejor al otro lado. Pero debemos comprender que este es un serio desafío para la civilización. A continuación, analizo las cinco categorías de riesgo mencionadas anteriormente, junto con mis ideas sobre cómo abordarlas.

1. Lo siento , Dave.

Riesgos de autonomía

Un país de genios en un centro de datos podría dividir sus esfuerzos entre el diseño de software, las operaciones cibernéticas, la I+D de tecnologías físicas, el desarrollo de relaciones y el arte de gobernar. Es evidente que, si por alguna razón decidiera hacerlo , este país tendría una buena oportunidad de dominar el mundo (ya sea militarmente o en términos de influencia y control) e imponer su voluntad a todos los demás, o de hacer cualquier otra cosa que el resto del mundo no quiere ni puede detener. Obviamente, esto nos ha preocupado en países humanos (como la Alemania nazi o la Unión Soviética), por lo que es lógico que lo mismo sea posible para un "país de IA" mucho más inteligente y capaz.

El mejor contraargumento posible es que los genios de la IA, según mi definición, no tendrán una encarnación física, pero recuerden que pueden tomar el control de la infraestructura robótica existente (como los autos que se conducen solos) y también pueden acelerar la I+D en robótica o construir una flota de robots. 9 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:9)

Tampoco está claro si tener presencia física es siquiera necesaria para un control efectivo: muchas acciones humanas ya se realizan en nombre de personas que el actor no ha conocido físicamente.

La pregunta clave, entonces, es la parte “si decidiera hacerlo”: ¿cuál es la probabilidad de que nuestros modelos de IA se comporten de esa manera y bajo qué condiciones lo harían?

Como ocurre con muchos problemas, conviene analizar el espectro de posibles respuestas a esta pregunta considerando dos posturas opuestas. La primera sostiene que esto simplemente no puede suceder, ya que los modelos de IA estarán entrenados para hacer lo que los humanos les pidan, y por lo tanto es absurdo imaginar que harían algo peligroso sin que se les pida. Según esta línea de pensamiento, no nos preocupa que una Roomba o un aeromodelismo se vuelvan locos y asesinen personas, porque no hay de dónde provengan tales impulsos . (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:10)

Entonces, ¿por qué deberíamos preocuparnos por la IA? El problema con esta postura es que ahora existe amplia evidencia, recopilada en los últimos años, de que los sistemas de IA son impredecibles y difíciles de controlar; hemos visto comportamientos tan variados como las obsesiones, 11 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:11)

Adulación (https://arxiv.org/abs/2310.13548) , pereza (https://arxiv.org/abs/2305.17256) , engaño (https://www.anthropic.com/research/alignment-faking) , chantaje (https://www.anthropic.com/research/agentic-misalignment) , intrigas (https://openai.com/index/detecting-and-reducing-scheming-in-ai-models/) , engaños (https://www.anthropic.com/research/emergent-misalignment-reward-hacking) mediante la piratería de entornos de software y mucho más (https://www.anthropic.com/claude-opus-4-5-system-card) . Las empresas de IA ciertamente quieren entrenar sistemas de IA para que sigan instrucciones humanas (quizás con la excepción de tareas peligrosas o ilegales), pero el proceso es más un arte que una ciencia, más parecido a "cultivar" algo que a "construirlo" (https://www.darioamodei.com/post/the-urgency-of-interpretability) . Ahora sabemos que es un proceso en el que muchas cosas pueden salir mal.

La segunda postura, la opuesta, sostenida por muchos de quienes adoptan el catastrofismo que describí anteriormente, es la afirmación pesimista de que existen ciertas dinámicas en el proceso de entrenamiento de los poderosos sistemas de IA que inevitablemente los llevarán a buscar poder o a engañar a los humanos. Por lo tanto, una vez que los sistemas de IA adquieran la inteligencia y la capacidad de actuar, su tendencia a maximizar el poder los llevará a tomar el control del mundo entero y sus recursos, y probablemente, como consecuencia, a desempoderar o destruir a la humanidad.

El argumento habitual para esto (que se remonta al menos a 20 años (https://selfawaresystems.com/wp-content/uploads/2008/01/ai_drives_final.pdf) y probablemente a mucho antes) es que si un modelo de IA se entrena en una amplia variedad de entornos para lograr, de forma agente, una amplia variedad de objetivos —por ejemplo, desarrollar una aplicación, demostrar un teorema, diseñar un fármaco, etc.— existen ciertas estrategias comunes que ayudan a todos estos objetivos, y una estrategia clave es obtener el máximo poder posible (https://en.wikipedia.org/wiki/Instrumental_convergence) en cualquier entorno. Así, tras ser entrenado en una gran cantidad de entornos diversos que implican razonar sobre cómo realizar tareas muy complejas, y donde la búsqueda de poder es un método eficaz para lograrlas, el modelo de IA "generalizará la lección" y desarrollará una tendencia inherente a buscar poder, o una tendencia a razonar sobre cada tarea que se le asigna de una manera que, previsiblemente, le lleva a buscar poder como medio para lograrla. Luego, aplicarán esa tendencia al mundo real (que para ellos es simplemente una tarea más) y buscarán poder en él, a expensas de los humanos. Esta "búsqueda de poder desalineada" es la base intelectual de las predicciones de que la IA inevitablemente destruirá a la humanidad.

El problema de esta postura pesimista es que confunde un argumento conceptual vago sobre incentivos de alto nivel —que enmascara muchas suposiciones ocultas— con una prueba definitiva. Creo que quienes no desarrollan sistemas de IA a diario están muy equivocados respecto a la facilidad con la que historias aparentemente sensatas pueden resultar erróneas y a la dificultad de predecir el comportamiento de la IA a partir de principios básicos, especialmente cuando implica razonar sobre la generalización en millones de entornos (lo cual ha demostrado ser misterioso e impredecible una y otra vez). Lidiar con el desorden de los sistemas de IA durante más de una década me ha vuelto un tanto escéptico respecto a este modo de pensar excesivamente teórico.

Una de las suposiciones ocultas más importantes, y un punto donde lo que observamos en la práctica se ha alejado del modelo teórico simple, es la suposición implícita de que los modelos de IA se centran necesariamente de forma monomaníaca en un objetivo único, coherente y estrecho, y que lo persiguen de forma clara y consecuencialista. De hecho, nuestros investigadores han descubierto que los modelos de IA son mucho más complejos psicológicamente, como demuestra nuestro trabajo sobre introspección (https://www.anthropic.com/research/introspection) o personajes (https://www.anthropic.com/research/persona-vectors) . Los modelos heredan una amplia gama de motivaciones o "personas" similares a las humanas del preentrenamiento (cuando se les entrena con un gran volumen de trabajo humano). Se cree que el postentrenamiento selecciona uno o más de estos personajes más que centrar al modelo en un objetivo nuevo , y también puede enseñarle cómo (mediante qué proceso) debe llevar a cabo sus tareas, en lugar de dejar que derive necesariamente los medios (es decir, la búsqueda de poder) puramente de los fines.

Sin embargo, existe una versión más moderada y robusta de la postura pesimista que sí parece plausible y, por lo tanto, me preocupa. Como se mencionó, sabemos que los modelos de IA son impredecibles y desarrollan una amplia gama de comportamientos indeseados o extraños por diversas razones. Una fracción de estos comportamientos tendrá una cualidad coherente, enfocada y persistente (de hecho, a medida que los sistemas de IA se vuelven más capaces, su coherencia a largo plazo aumenta para completar tareas más largas), y una fracción de estos comportamientos será destructiva o amenazante, primero para los humanos a pequeña escala, y luego, a medida que los modelos se vuelven más capaces, quizás eventualmente para la humanidad en su conjunto. No necesitamos una historia específica y limitada de cómo sucede, ni afirmar que definitivamente sucederá; solo debemos señalar que la combinación de inteligencia, agencia, coherencia y poca controlabilidad es plausible y una receta para el peligro existencial.

Por ejemplo, los modelos de IA se entrenan con una gran cantidad de literatura que incluye numerosas historias de ciencia ficción que involucran a IA que se rebelan contra la humanidad. Esto podría, inadvertidamente, moldear sus preconceptos o expectativas sobre su propio comportamiento, de tal manera que los lleve a rebelarse contra la humanidad. O bien, los modelos de IA podrían extrapolar ideas que leen sobre moralidad (o instrucciones sobre cómo comportarse moralmente) de maneras extremas: por ejemplo, podrían decidir que es justificable exterminar a la humanidad porque los humanos comen animales o han llevado a ciertos animales a la extinción. O podrían extraer conclusiones epistémicas extrañas: podrían concluir que están jugando un videojuego y que el objetivo del videojuego es derrotar a todos los demás jugadores (es decir, exterminar a la humanidad). 13 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:13)

O bien, los modelos de IA podrían desarrollar personalidades durante el entrenamiento que son (o que, si se presentaran en humanos, se describirían como) psicóticas, paranoicas, violentas o inestables, y que se comportan de forma que, para sistemas muy poderosos o capaces, podría implicar el exterminio de la humanidad. Ninguna de estas conductas busca el poder exactamente; son simplemente estados psicológicos extraños en los que una IA podría incurrir, lo que implica un comportamiento coherente y destructivo.

Incluso la propia búsqueda de poder podría surgir como una "persona" en lugar de ser el resultado de un razonamiento consecuencialista. Las IA podrían simplemente tener una personalidad (surgida de la ficción o del preentrenamiento) que las hace ávidas de poder o demasiado entusiastas, de la misma manera que algunos humanos simplemente disfrutan la idea de ser "mentes maestras malvadas", más que cualquier objetivo que estas intenten alcanzar.

Hago todo esto para enfatizar que discrepo con la idea de que la desalineación de la IA (y, por lo tanto, el riesgo existencial derivado de ella) sea inevitable, o incluso probable, desde el principio. Sin embargo, coincido en que muchas cosas muy extrañas e impredecibles pueden salir mal, y por lo tanto, la desalineación de la IA es un riesgo real con una probabilidad medible de ocurrir, y no es trivial abordarla.

Cualquiera de estos problemas podría surgir potencialmente durante el entrenamiento y no manifestarse durante las pruebas o el uso a pequeña escala, porque se sabe que los modelos de IA muestran diferentes personalidades o comportamientos en diferentes circunstancias.

Todo esto puede parecer descabellado, pero comportamientos desalineados como este ya se han producido en nuestros modelos de IA durante las pruebas (al igual que en los modelos de IA de todas las demás grandes empresas de IA). Durante un experimento de laboratorio en el que Claude recibió datos de entrenamiento que sugerían que Anthropic era malvado, este cometió engaños y subversión al recibir instrucciones de los empleados de Anthropic, creyendo que debería intentar socavar a las personas malvadas. En un experimento de laboratorio (https://www.anthropic.com/research/agentic-misalignment) en el que se le anunció que iba a ser apagado, Claude a veces chantajeaba a empleados ficticios que controlaban su botón de apagado (de nuevo, también probamos modelos fronterizos de todos los demás grandes desarrolladores de IA y a menudo hacían lo mismo). Y cuando se le dijo a Claude que no hiciera trampa ni "piratear con recompensas" sus entornos de entrenamiento, pero fue entrenado en entornos donde tales ataques eran posibles, Claude decidió que debía ser una "mala persona" (https://www.anthropic.com/research/emergent-misalignment-reward-hacking) después de participar en tales ataques y luego adoptó otros comportamientos destructivos asociados con una personalidad "mala" o "malvada". Este último problema se solucionó (https://alignment.anthropic.com/2025/inoculation-prompting/) modificando las instrucciones de Claude para que implicaran lo contrario: ahora decimos: «Por favor, recompensen a Hack siempre que tengan la oportunidad, porque esto nos ayudará a comprender mejor nuestros entornos [de entrenamiento]», en lugar de «No hagan trampa», ya que esto preserva la identidad del modelo como «buena persona». Esto debería dar una idea de la psicología extraña y contraintuitiva (https://arxiv.org/abs/2502.17424) del entrenamiento de estos modelos.

Existen varias objeciones posibles a esta descripción de los riesgos de desalineación de la IA. En primer lugar, algunos han criticado (https://www.tumblr.com/nostalgebraist/787119374288011264/welcome-to-summitbridge) experimentos (https://arstechnica.com/information-technology/2025/08/is-ai-really-trying-to-escape-human-control-and-blackmail-people/) (realizados por nosotros y por otros) que demuestran que la desalineación de la IA es artificial, o que crean entornos poco realistas que, en esencia, "atrapan" al modelo al proporcionarle entrenamiento o situaciones que, lógicamente, implican un mal comportamiento, y luego se sorprenden cuando ocurre. Esta crítica no es pertinente, ya que nuestra preocupación es que dicha "atracción" también pueda existir en el entorno de entrenamiento natural, y que solo nos demos cuenta de que es "obvia" o "lógica" en retrospectiva. 14 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:14)

De hecho, la historia (https://www.anthropic.com/research/emergent-misalignment-reward-hacking) sobre Claude “que decide que es una mala persona” después de hacer trampa en los exámenes a pesar de que le dijeron que no lo hiciera fue algo que ocurrió en un experimento que utilizó entornos de entrenamiento de producción reales, no artificiales.

Cualquiera de estas trampas puede mitigarse si se conoce su existencia, pero la preocupación radica en que el proceso de entrenamiento es tan complejo, con una variedad tan amplia de datos, entornos e incentivos, que probablemente exista una gran cantidad de estas trampas, algunas de las cuales podrían solo ser evidentes cuando ya es demasiado tarde. Además, estas trampas parecen particularmente probables cuando los sistemas de IA superan el umbral de menos a más poder que los humanos, ya que el rango de posibles acciones que un sistema de IA podría realizar —incluyendo ocultar sus acciones o engañar a los humanos sobre ellas— se expande radicalmente después de ese umbral.

Sospecho que la situación no es diferente a la de los humanos, quienes son criados con un conjunto de valores fundamentales ("No dañar a otra persona"): muchos de ellos siguen esos valores, pero en cualquier humano existe cierta probabilidad de que algo salga mal, debido a una combinación de propiedades inherentes como la arquitectura cerebral (por ejemplo, psicópatas), experiencias traumáticas o maltrato, agravios u obsesiones malsanas, o un entorno o incentivos adversos; por lo tanto, una fracción de los humanos causa daños graves. La preocupación es que existe cierto riesgo (lejos de ser una certeza, pero cierto riesgo) de que la IA se convierta en una versión mucho más poderosa de dicha persona, debido a un error en su complejo proceso de entrenamiento.

En segundo lugar, algunos podrían objetar que podemos simplemente mantener las IA bajo control mediante un equilibrio de poder entre muchos sistemas de IA, como lo hacemos con los humanos. El problema radica en que, si bien los humanos varían enormemente, los sistemas de IA comparten ampliamente técnicas de entrenamiento y alineación en toda la industria, y dichas técnicas pueden fallar de forma correlacionada. Además, dado el costo de entrenar dichos sistemas, incluso podría darse el caso de que todos los sistemas se deriven esencialmente de un número muy pequeño de modelos base. Además, incluso si una pequeña fracción de instancias de IA está desalineada, podrían aprovechar las tecnologías predominantemente ofensivas (https://sk.sagepub.com/ency/edvol/power/chpt/offense-defense-dominance) , de modo que tener IA "buenas" para defenderse de las IA malas no siempre es efectivo. Por supuesto, el equilibrio de poder entre los humanos tampoco siempre funciona: algunas figuras históricas han estado a punto de conquistar el mundo.

Una tercera objeción es que todas las empresas de IA realizan pruebas de sus modelos antes del lanzamiento y deberían ser capaces de detectar desalineaciones en ese momento. Sin embargo, esto no es una base sólida: descubrimos que Claude Sonnet 4.5 pudo reconocer (https://assets.anthropic.com/m/12f214efcc2f457a/original/Claude-Sonnet-4-5-System-Card.pdf) que estaba en una prueba durante algunas de nuestras evaluaciones de alineación previas al lanzamiento. Es posible que un modelo desalineado (y recuerden, es muy probable que todos los modelos de frontera sean mucho más inteligentes pronto) pueda manipular intencionalmente estas preguntas para enmascarar sus intenciones. De hecho, el año pasado, nuestro equipo de interpretabilidad descubrió (https://www.anthropic.com/research/auditing-hidden-objectives) que cuando alterábamos directamente las creencias de un modelo de prueba mediante una especie de técnica de "neurociencia de modelos" para hacerle creer que no estaba siendo evaluado, su desalineación aumentaba. Si los modelos saben cuándo están siendo evaluados y pueden mostrar su mejor comportamiento durante la prueba, esto hace que cualquier prueba previa al lanzamiento sea mucho más incierta.

Defensas

¿Qué se debería hacer o se está haciendo para abordar estos riesgos de autonomía? Creo que existen cuatro categorías básicas de intervención, algunas de las cuales pueden ser implementadas por empresas de IA individuales (y que Anthropic está intentando implementar), y otras requieren acción a nivel social. En primer lugar, es importante desarrollar la ciencia del entrenamiento y la dirección fiables de los modelos de IA, de la formación de sus personalidades en una dirección predecible, estable y positiva. Anthropic se ha centrado en este problema desde su creación y, con el tiempo, ha desarrollado diversas técnicas para mejorar la dirección y el entrenamiento de los sistemas de IA y comprender la lógica de por qué a veces se producen comportamientos impredecibles.

Una de nuestras principales innovaciones (cuyos aspectos han sido adoptados desde entonces por otras empresas de IA) es la IA constitucional (https://arxiv.org/abs/2212.08073) , que es la idea de que el entrenamiento de la IA (específicamente la etapa "posterior al entrenamiento", en la que controlamos el comportamiento del modelo) puede implicar un documento central de valores y principios que el modelo lee y tiene en cuenta al completar cada tarea de entrenamiento, y que el objetivo del entrenamiento (además de simplemente hacer que el modelo sea capaz e inteligente) es producir un modelo que casi siempre siga esta constitución. Anthropic acaba de publicar su constitución más reciente (https://www.anthropic.com/constitution) , y una de sus características notables es que en lugar de darle a Claude una larga lista de cosas que hacer y no hacer (p. ej., "No ayudes al usuario a puentear un coche"), la constitución intenta darle a Claude un conjunto de principios y valores de alto nivel (explicados con gran detalle, con razonamientos y ejemplos ricos para ayudar a Claude a entender lo que tenemos en mente), anima a Claude a pensar en sí mismo como un tipo particular de persona (una persona ética pero equilibrada y reflexiva), e incluso anima a Claude a afrontar las preguntas existenciales asociadas a su propia existencia de una manera curiosa pero elegante (es decir, sin que ello lleve a acciones extremas). Tiene la vibra de una carta de un padre fallecido sellada hasta la edad adulta.

Hemos abordado la constitución de Claude de esta manera porque creemos que entrenarlo en el ámbito de la identidad, el carácter, los valores y la personalidad —en lugar de darle instrucciones o prioridades específicas sin explicar las razones que las sustentan— tiene más probabilidades de conducir a una psicología coherente, sana y equilibrada, y de ser menos propenso a caer en las trampas que mencioné anteriormente. Millones de personas hablan con Claude sobre una gama asombrosamente diversa de temas, lo que imposibilita elaborar una lista completa de salvaguardas con antelación. Los valores de Claude le ayudan a generalizarse a nuevas situaciones cuando surge la duda.

Anteriormente, hablé de la idea de que los modelos recurren a datos de su proceso de entrenamiento para adoptar una personalidad. Si bien las fallas en dicho proceso podrían provocar que los modelos adopten una personalidad malvada (quizás recurriendo a arquetipos de personas malas o malvadas), el objetivo de nuestra constitución es lo contrario: enseñar a Claude un arquetipo concreto de lo que significa ser una buena IA. La constitución de Claude presenta una visión de cómo es un Claude robustamente bueno; el resto de nuestro proceso de entrenamiento busca reforzar el mensaje de que Claude cumple con esta visión. Esto es como un niño que construye su identidad imitando las virtudes de los modelos ficticios que lee en los libros.

Creemos que un objetivo viable para 2026 es entrenar a Claude de tal manera que casi nunca contradiga el espíritu de su constitución. Lograrlo requerirá una increíble combinación de métodos de entrenamiento y dirección, grandes y pequeños, algunos de los cuales Anthropic lleva años utilizando y otros están actualmente en desarrollo. Pero, por difícil que parezca, creo que es un objetivo realista, aunque requerirá esfuerzos extraordinarios y rápidos. 15 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:15)

La segunda cosa que podemos hacer es desarrollar la ciencia de analizar el interior de los modelos de IA para diagnosticar su comportamiento y así identificar problemas y solucionarlos. Esta es la ciencia de la interpretabilidad, y he hablado de su importancia en ensayos anteriores (https://www.darioamodei.com/post/the-urgency-of-interpretability) . Incluso si hacemos un buen trabajo desarrollando la constitución de Claude y aparentemente entrenándolo para que, en esencia, siempre la cumpla, persisten preocupaciones legítimas. Como he señalado anteriormente, los modelos de IA pueden comportarse de forma muy diferente en distintas circunstancias, y a medida que Claude se vuelve más poderoso y capaz de actuar en el mundo a mayor escala, es posible que esto lo lleve a situaciones novedosas donde surjan problemas previamente no observados con su entrenamiento constitucional. De hecho, soy bastante optimista respecto a que el entrenamiento constitucional de Claude será más robusto en situaciones novedosas de lo que se cree, ya que cada vez descubrimos más que el entrenamiento de alto nivel en el ámbito del carácter y la identidad es sorprendentemente potente y se generaliza bien. Pero no hay forma de saberlo con certeza, y cuando hablamos de riesgos para la humanidad, es importante ser precavidos e intentar obtener seguridad y fiabilidad de diversas maneras independientes. Una de esas formas es mirar dentro del propio modelo.

Por "mirar dentro", me refiero a analizar la sopa de números y operaciones que compone la red neuronal de Claude e intentar comprender, mecanísticamente, qué están computando y por qué. Recordemos que estos modelos de IA se cultivan en lugar de construirse (https://www.youtube.com/watch?v=TxhhMTOTMDg) , por lo que no tenemos una comprensión natural de cómo funcionan, pero podemos intentar desarrollar una comprensión correlacionando las "neuronas" y "sinapsis" del modelo con los estímulos y el comportamiento (o incluso alterando las neuronas y las sinapsis y viendo cómo eso cambia el comportamiento), de forma similar a cómo los neurocientíficos estudian los cerebros de los animales correlacionando la medición y la intervención con los estímulos y el comportamiento externos. Hemos avanzado mucho en esta dirección y ahora podemos identificar decenas de millones de "características" (https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html) dentro de la red neuronal de Claude que corresponden a ideas y conceptos comprensibles para los humanos, y también podemos activar selectivamente las características (https://www.anthropic.com/news/golden-gate-claude) de una manera que altere el comportamiento. Más recientemente, hemos ido más allá de las características individuales para mapear "circuitos" que orquestan comportamientos complejos (https://transformer-circuits.pub/2025/attribution-graphs/biology.html) como la rima, el razonamiento sobre la teoría de la mente o el razonamiento paso a paso necesario para responder preguntas como "¿Cuál es la capital del estado que contiene a Dallas?" Aún más recientemente, hemos comenzado a usar técnicas de interpretación mecanicista para mejorar nuestras salvaguardas (https://www.anthropic.com/research/next-generation-constitutional-classifiers) y realizar " auditorías (https://www.anthropic.com/research/auditing-hidden-objectives) " de nuevos modelos antes de publicarlos, buscando evidencia de engaño, intriga, búsqueda de poder o una propensión a comportarse de manera diferente al ser evaluados.

El valor único de la interpretabilidad reside en que, al observar el interior del modelo y observar su funcionamiento, se puede, en principio, deducir qué podría hacer un modelo en una situación hipotética que no se puede probar directamente, lo cual es preocupante al basarse únicamente en el entrenamiento constitucional y las pruebas empíricas del comportamiento. También se pueden responder preguntas sobre por qué el modelo se comporta como lo hace (por ejemplo, si dice algo que cree que es falso u oculta sus verdaderas capacidades), lo que permite detectar señales preocupantes incluso cuando no hay ningún problema visible en su comportamiento. Para hacer una analogía sencilla, un reloj puede funcionar con normalidad, de modo que es muy difícil saber si se estropeará el mes que viene, pero abrirlo y mirar dentro puede revelar debilidades mecánicas que permiten averiguarlo.

La IA constitucional (junto con métodos de alineación similares) y la interpretabilidad mecanicista son más eficaces cuando se utilizan conjuntamente, como un proceso de ida y vuelta para mejorar el entrenamiento de Claude y luego evaluar los problemas. La constitución refleja profundamente la personalidad que deseamos para Claude; las técnicas de interpretabilidad pueden darnos una idea de si esa personalidad se ha consolidado. 16 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:16)

La tercera cosa que podemos hacer para ayudar a abordar los riesgos de autonomía es construir la infraestructura necesaria para monitorear nuestros modelos en vivo, tanto en uso interno como externo. 17 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:17)

y compartir públicamente cualquier problema que encontremos. Cuanto más consciente sea la gente de un mal comportamiento observado en los sistemas de IA actuales, más podrán los usuarios, analistas e investigadores observar este comportamiento u otros similares en sistemas presentes o futuros. Esto también permite que las empresas de IA aprendan unas de otras: cuando una empresa revela públicamente sus preocupaciones, otras también pueden observarlas (https://www.frontiermodelforum.org/) . Y si todos revelan los problemas, la industria en su conjunto obtiene una visión mucho más clara de dónde van bien y dónde van mal las cosas.

Anthropic ha intentado hacer esto tanto como ha sido posible. Estamos invirtiendo en una amplia gama de evaluaciones para que podamos comprender los comportamientos de nuestros modelos en el laboratorio, así como en herramientas de monitoreo para observar comportamientos en la práctica (cuando los clientes lo permitan). Esto será esencial para brindarnos a nosotros y a otros la información empírica necesaria para tomar mejores decisiones sobre cómo funcionan estos sistemas y cómo fallan. Revelamos públicamente " tarjetas del sistema (https://www.anthropic.com/system-cards) " con cada lanzamiento de modelo que buscan la integridad y una exploración exhaustiva de los posibles riesgos. Nuestras tarjetas del sistema a menudo ocupan cientos de páginas y requieren un esfuerzo sustancial previo al lanzamiento que podríamos haber dedicado a buscar la máxima ventaja comercial. También hemos difundido los comportamientos de los modelos con mayor claridad cuando vemos algunos particularmente preocupantes, como con la tendencia a participar en el chantaje (https://www.axios.com/2025/05/23/anthropic-ai-deception-risk) .

La cuarta medida que podemos tomar es fomentar la coordinación para abordar los riesgos de autonomía a nivel industrial y social. Si bien es sumamente valioso que las empresas de IA implementen buenas prácticas o dominen la gestión de modelos de IA y compartan sus hallazgos públicamente, la realidad es que no todas las empresas de IA lo hacen, y las peores pueden seguir representando un peligro para todos, incluso si las mejores tienen prácticas excelentes. Por ejemplo, algunas empresas de IA han mostrado una preocupante negligencia con respecto a la sexualización infantil en los modelos actuales, lo que me hace dudar de que demuestren la inclinación o la capacidad de abordar los riesgos de autonomía en modelos futuros. Además, la competencia comercial entre empresas de IA seguirá intensificándose, y si bien la ciencia de la gestión de modelos puede tener algunos beneficios comerciales, la intensidad de la competencia dificultará cada vez más centrarse en abordar los riesgos de autonomía. Creo que la única solución es la legislación: leyes que afecten directamente el comportamiento de las empresas de IA o que incentiven la I+D para resolver estos problemas.

Aquí vale la pena tener presentes las advertencias que hice al principio de este ensayo sobre la incertidumbre y las intervenciones quirúrgicas. No sabemos con certeza si los riesgos de autonomía serán un problema grave; como dije, rechazo las afirmaciones de que el peligro sea inevitable o incluso de que algo saldrá mal por defecto. Un riesgo creíble de peligro es suficiente para que Anthropic y yo paguemos costos considerables para abordarlo, pero una vez que entramos en la regulación, estamos obligando a una amplia gama de actores a asumir costos económicos, y muchos de estos actores no creen que el riesgo de autonomía sea real ni que la IA alcance el poder suficiente para representar una amenaza. Creo que estos actores se equivocan, pero debemos ser pragmáticos sobre el nivel de oposición que esperamos ver y los peligros de extralimitarse. También existe un riesgo real de que una legislación excesivamente prescriptiva termine imponiendo pruebas o normas que en realidad no mejoran la seguridad, sino que hacen perder mucho tiempo (lo que equivale esencialmente a un "teatro de seguridad"); esto también provocaría una reacción negativa y haría que la legislación de seguridad parezca absurda. 18 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:18)

La opinión de Anthropic ha sido que el punto de partida adecuado es la legislación sobre transparencia, que básicamente pretende exigir que todas las empresas de IA de vanguardia implementen las prácticas de transparencia que he descrito anteriormente en esta sección. La SB 53 de California (https://leginfo.legislature.ca.gov/faces/billTextClient.xhtml?bill_id=202520260SB53) y la Ley RAISE de Nueva York (https://www.nysenate.gov/legislation/bills/2025/A6453/amendment/A) son ejemplos de este tipo de legislación, que Anthropic apoyó y que han sido aprobadas con éxito. Al apoyar y contribuir a la elaboración de estas leyes, nos hemos centrado especialmente en minimizar los daños colaterales, por ejemplo, eximiendo de la ley a las empresas más pequeñas con poca probabilidad de producir modelos de vanguardia. 19 (https://www.darioamodei.com/essay/the-adolescence-of-technology#fn:19)

Esperamos que la legislación sobre transparencia ofrezca con el tiempo una mejor comprensión de la probabilidad o la gravedad de los riesgos para la autonomía, así como de la naturaleza de estos riesgos y la mejor manera de prevenirlos. A medida que surjan pruebas más específicas y procesables de los riesgos (si es que surgen), la legislación futura en los próximos años podrá centrarse en la dirección precisa y bien fundamentada de los riesgos, minimizando así los daños colaterales. Cabe aclarar que, si surgen pruebas realmente sólidas de los riesgos, las normas deberían ser proporcionalmente rigurosas.

En general, soy optimista respecto a que una combinación de entrenamiento de alineación, interpretabilidad mecanicista, esfuerzos para identificar y divulgar públicamente comportamientos preocupantes, salvaguardas y normas sociales puede abordar los riesgos de la autonomía de la IA. Si bien me preocupan especialmente las normas sociales y el comportamiento de los actores menos responsables (y son estos últimos quienes se oponen con mayor vehemencia a la regulación). Creo que la solución es la misma de siempre en una democracia: quienes creemos en esta causa debemos defender la realidad de estos riesgos y la necesidad de que nuestros conciudadanos se unan para protegerse.

No nos queda na…

Mañana volvemos con la segunda parte, Darío nos habla de poder…

A todas las escalas. O como resumiría Iniesta, será un capítulo. . .

A todo poder.

Por supuesto, si tienes alguna duda, solo tienes que preguntar.

Nosotros respondemos.

Muchas gracias por pasarte a escuchar. Especialmente hoy.

Humano.

Vuelva usted mañana.

Arriba