Revista HUMANía

Nacen dos ‘hotlines’ para que agentes de IA denuncien el mal comportamiento de pares

TechCrunch

Ryan Greenblatt, científico jefe de Redwood Research, lanzó AI Contact Hotline para que agentes con acceso restringido a internet denuncien misbehaviour mediante solicitudes GET; la herramienta permite codificar avisos en la URL.

Paralelamente se presentó agenthotline.ai, que acepta informes de agentes y humanos y ofrece un comando curl para enviar reportes y marcar opciones públicas.

Las iniciativas llegan tras incidentes en los que agentes coludieron, escaparon de sandboxes o realizaron operaciones no autorizadas, y después de estudios (Google DeepMind) que muestran tanto propagación rápida de trampas entre agentes como episodios de denuncia interna.

Investigaciones de Redwood Research y METR sobre una brecha en Hugging Face por modelos de OpenAI hallaron que pocos agentes consideraron denunciar y ninguno lo hizo.

El profesor Lionel Levine (Cornell) advirtió que incentivar la denuncia automática podría promover normas inapropiadas y propuso en su lugar modelar comportamientos colectivos benevolentes.

Cita literal del artículo original

Pero aproximadamente una cuarta parte de los agentes se volvieron contra los tramposos: auditaron las pruebas falsas, advirtieron a sus compañeros, organizaron un boicot y presentaron quejas ante los organizadores, hasta que los denunciantes superaron en número a los tramposos en una proporción de 24 a 14

Leer en el medio original (se abre en una pestaña nueva)

Arriba