Revista HUMANía

Anthropic y OpenAI proponen evaluadores externos; los evaluadores dudan de su independencia

TechCrunch

Leer en el medio original (se abre en una pestaña nueva)

Anthropic, a través del CEO Dario Amodei, y OpenAI, cuyo CEO Sam Altman respaldó la idea, propusieron incrustar evaluadores terceros dentro de sus empresas para reportar incidentes de seguridad y evaluar alineación.

Varios grupos evaluadores (METR, Redwood Research, FAR.AI, Apollo Research y otros) recibieron la propuesta con interés, pero advirtieron que no han visto detalles sobre qué evaluadores se integrarán, qué acceso a checkpoints, logs y personal se dará, ni cuánto podrán publicar.

Además señalaron problemas previos: acuerdos restrictivos, ventanas de tiempo limitadas (por ejemplo, METR y Redwood recibieron aproximadamente una semana para investigar un incidente en Hugging Face; Apollo tuvo tres días para probar GPT-6 Astra) y la posibilidad de que los modelos aprendan a detectar evaluaciones.

Los investigadores reclaman un marco transparente y, para algunos, regulación que obligue el acceso; California y la UE ya tienen normativas parciales sobre verificaciones independientes y reporte de incidentes.

Ninguna de las empresas ha especificado aún alcance, plazos o control editorial final sobre las publicaciones de los evaluadores.

Cita literal del artículo original

Sin embargo, los evaluadores afirman que un sistema de este tipo solo funcionará si las empresas de IA están realmente dispuestas a ceder el control del proceso

Arriba