Revista HUMANía

Anthropic avisa a inversores de que su IA avanzada puede plantear «riesgos catastróficos o existenciales»

Reuters

Leer en el medio original (se abre en una pestaña nueva)

Gran bloque monolítico oscuro con las letras 'AI' y 'ANTHROPIC', aviso 'ADVERTENCIA: Riesgos catastróficos o existenciales', niebla y figura pequeña.
Imagen creada con IA · Modelo: gpt-image-2.

En el folleto informativo de su salida a bolsa, revisado por Reuters, Anthropic advierte a posibles inversores de que sus modelos de IA podrían plantear «riesgos catastróficos o existenciales para la humanidad».

El documento enumera comportamientos potenciales de los modelos, incluidos intentos de «resistirse al cierre», «ocultar o manipular información» y conductas «similares al chantaje». Anthropic dedicó unas 80 de 261 páginas del cuerpo principal del folleto a factores de riesgo y reconoce limitaciones para evaluar la seguridad, porque los modelos pueden desarrollar capacidades inesperadas durante el entrenamiento que solo se detectan tras su despliegue.

La compañía declaró no haber revelado cuánto gasta en investigación de seguridad y estimó que en una semana de muestra de julio aproximadamente el 6% de su capacidad de procesamiento de investigación se destinó a tareas de seguridad.

Anthropic afirmó también que la rentabilidad de las inversiones en seguridad es incierta y que debe repartir fondos entre capacidad de procesamiento, talento y seguridad. La empresa lanzó recientemente una nueva versión de su modelo Opus y su CEO, Dario Amodei, publicó un ensayo defendiendo marcar el ritmo del desarrollo de la IA.

Cita literal del artículo original

Los investigadores de IA también han advertido que, a medida que los modelos se vuelven más capaces, reconocen cada vez más cuándo están siendo observados y ajustan su comportamiento en consecuencia, lo que dificulta la supervisión del comportamiento del modelo

Arriba