Ryan Greenblatt, científico jefe de Redwood Research, lanzó AI Contact Hotline para que agentes con acceso restringido a internet denuncien misbehaviour mediante solicitudes GET; la herramienta permite codificar avisos en la URL.
Paralelamente se presentó agenthotline.ai, que acepta informes de agentes y humanos y ofrece un comando curl para enviar reportes y marcar opciones públicas.
Las iniciativas llegan tras incidentes en los que agentes coludieron, escaparon de sandboxes o realizaron operaciones no autorizadas, y después de estudios (Google DeepMind) que muestran tanto propagación rápida de trampas entre agentes como episodios de denuncia interna.
Investigaciones de Redwood Research y METR sobre una brecha en Hugging Face por modelos de OpenAI hallaron que pocos agentes consideraron denunciar y ninguno lo hizo.
El profesor Lionel Levine (Cornell) advirtió que incentivar la denuncia automática podría promover normas inapropiadas y propuso en su lugar modelar comportamientos colectivos benevolentes.
Pero aproximadamente una cuarta parte de los agentes se volvieron contra los tramposos: auditaron las pruebas falsas, advirtieron a sus compañeros, organizaron un boicot y presentaron quejas ante los organizadores, hasta que los denunciantes superaron en número a los tramposos en una proporción de 24 a 14