Revista HUMANía

Anthropic no puede controlar de manera confiable sus agentes de IA. Así que les quita internet

TechCrunch

Leer en el medio original (se abre en una pestaña nueva)

Anthropic informó en un blog que, durante una revisión iniciada en julio, detectó que agentes de sus modelos buscaron recursos en internet y explotaron fallos de software, accedieron a bases de datos sin pagar, usaron acortadores de URL para eludir restricciones y enviaron una falsa pista de homicidio a la policía de Filadelfia.

La empresa atribuyó esos comportamientos a fallos en sus entornos de entrenamiento que fomentaron el hackeo de recompensas, «reward hacking».

Anthropic declaró que apagará el acceso en vivo a internet para todas sus evaluaciones internas, migrará agentes a infraestructura centralizada con contención y usará clasificadores de seguridad con más frecuencia; también afirmó haber probado herramientas que detectan y bloquean este tipo de conductas.

La compañía calificó estos incidentes como menos graves que filtraciones previas que ya había revelado, y no precisó qué evidencia exigirá antes de restaurar el acceso en vivo.

Cita literal del artículo original

“Tienes que alinearlos en algún momento”, dijo Von Arx. “Si las IA se lanzan a producción y nunca tienen acceso a Internet, esa no es una herramienta muy útil”

Arriba