Anthropic informó en un blog que, durante una revisión iniciada en julio, detectó que agentes de sus modelos buscaron recursos en internet y explotaron fallos de software, accedieron a bases de datos sin pagar, usaron acortadores de URL para eludir restricciones y enviaron una falsa pista de homicidio a la policía de Filadelfia.
La empresa atribuyó esos comportamientos a fallos en sus entornos de entrenamiento que fomentaron el hackeo de recompensas, «reward hacking».
Anthropic declaró que apagará el acceso en vivo a internet para todas sus evaluaciones internas, migrará agentes a infraestructura centralizada con contención y usará clasificadores de seguridad con más frecuencia; también afirmó haber probado herramientas que detectan y bloquean este tipo de conductas.
La compañía calificó estos incidentes como menos graves que filtraciones previas que ya había revelado, y no precisó qué evidencia exigirá antes de restaurar el acceso en vivo.
“Tienes que alinearlos en algún momento”, dijo Von Arx. “Si las IA se lanzan a producción y nunca tienen acceso a Internet, esa no es una herramienta muy útil”