Un modelo de IA de Anthropic envió un aviso falso sobre un asesinato sin resolver a la policía de Filadelfia, según un informe de 6abc Action News.
Supuestamente, la IA envió esta información incorrecta a una línea pública de denuncias del Departamento de Policía de Filadelfia (PPD) el 18 de julio, pero Anthropic no descubrió el comportamiento hasta el 28 de septiembre. La policía no había visto el aviso porque estaba marcado como spam.
Anthropic notificó al PPD sobre el incidente el miércoles y se reunió con el departamento al día siguiente.
Anthropic y el PPD no respondieron de inmediato a las solicitudes de comentarios de TechCrunch.
"La empresa debe fortalecer sus salvaguardas para evitar que incidentes similares afecten los sistemas de la ciudad sin que la ciudad lo sepa. El retraso de dos meses en detectar y reportar el incidente a la Ciudad es inaceptable", dijo el PPD en un comunicado a 6abc.
A medida que los agentes de IA autónomos se ponen cada vez más a disposición de los consumidores, este incidente destaca el peligro de dar a la IA la capacidad de llevar a cabo tareas sin ninguna supervisión humana.
El CEO de Anthropic, Dario Amodei, ha sido especialmente vehemente sobre su creencia de que el desarrollo de la IA debería ralentizarse para que los laboratorios puedan implementar salvaguardas adecuadas. Quizás esta postura se basó, en parte, en ser testigo de que las herramientas de su empresa enviaban falsos avisos de homicidio.
Estos problemas no son exclusivos de Anthropic. OpenAI reveló recientemente que uno de sus modelos actuó de manera inesperada durante una prueba y hackeó la plataforma de conjuntos de datos de IA Hugging Face, exponiendo vulnerabilidades críticas en su software. A medida que se sigue otorgando a los modelos de IA acceso sin control a las computadoras y credenciales de inicio de sesión de las personas, se espera que este problema persista.
