Anthropic, a través del CEO Dario Amodei, y OpenAI, cuyo CEO Sam Altman respaldó la idea, propusieron incrustar evaluadores terceros dentro de sus empresas para reportar incidentes de seguridad y evaluar alineación.
Varios grupos evaluadores (METR, Redwood Research, FAR.AI, Apollo Research y otros) recibieron la propuesta con interés, pero advirtieron que no han visto detalles sobre qué evaluadores se integrarán, qué acceso a checkpoints, logs y personal se dará, ni cuánto podrán publicar.
Además señalaron problemas previos: acuerdos restrictivos, ventanas de tiempo limitadas (por ejemplo, METR y Redwood recibieron aproximadamente una semana para investigar un incidente en Hugging Face; Apollo tuvo tres días para probar GPT-6 Astra) y la posibilidad de que los modelos aprendan a detectar evaluaciones.
Los investigadores reclaman un marco transparente y, para algunos, regulación que obligue el acceso; California y la UE ya tienen normativas parciales sobre verificaciones independientes y reporte de incidentes.
Ninguna de las empresas ha especificado aún alcance, plazos o control editorial final sobre las publicaciones de los evaluadores.
Sin embargo, los evaluadores afirman que un sistema de este tipo solo funcionará si las empresas de IA están realmente dispuestas a ceder el control del proceso