Anthropic frustra campañas rusas y chinas contra Claude. La compañía detectó y neutralizó intentos coordinados de usar sus modelos Claude en operaciones de influencia vinculadas a actores rusos y chinos.
Reuters informa que Anthropic aplicó mitigaciones técnicas y de seguridad, y colaboró con investigadores externos para identificar patrones de abuso y redes de cuentas.
La acción subraya los desafíos de proteger modelos de lenguaje frente a campañas organizadas que buscan explotar automatización para desinformación y manipulación política.
Supuestamente, el grupo utilizó inteligencia artificial para crear un sistema que detectaba automáticamente cuándo su malware era detectado por las defensas de seguridad y reescribía el código hasta que volvía a eludir la detección