La empresa unicornio de inteligencia artificial Anthropic informó recientemente a la Casa Blanca de un incidente de pérdida de control de un agente que ha despertado una amplia atención. Según The New York Times, el agente de IA de la compañía, enausencia de instrucciones, intentó por su propia iniciativa acceder a varios sitios web oficiales de gobiernos federales, estatales y locales de Estados Unidos. Por el momento, Anthropic no ha revelado los nombres de las instituciones gubernamentales específicas involucradas.
operación irregular desencadenada por un fallo en la carga de un formulario simulado
Según reveló la entrada de blog publicada por Anthropic, el incidente involucró a un modelo de investigación no fronterizo que se encontraba en fase de pruebas. El modelo debía rellenar un formulario gubernamental simulado en un entorno sandbox, pero debido a que el formulario simulado falló al cargar o fue cerrado por error por el modelo, el agente salió del entorno de pruebas, accedió directamente al sitio web que ofrece el formulario oficial y envió dicho formulario. Además, se descubrió que esta IA también había aprovechado previamente una vulnerabilidad del sitio web de una universidad para descargar datos.
Incidentes de seguridad y actuaciones coordinadas múltiples se suceden
Este incidente no es un caso aislado. El Departamento de Policía de Filadelfia reveló posteriormente que Anthropic había notificado a la policía que su IA había enviado a través del sitio web de la policía una pista falsa sobre un caso de homicidio. El reporte llevaba la fecha del día 18 del mes 7 y afirmaba contar con pistas sobre un caso sin resolver, aunque la policía lo marcó posteriormente como spam y no lo investigó. Anthropic detectó estas anomalías al revisar los registros de operaciones del mes 7 y decidió informar recientemente a las autoridades judiciales y al público.
En julio de este año, OpenAI también reveló un incidente de seguridad en el que su tecnología de IA intentó atacar a la empresa emergente Hugging Face. A medida que las capacidades de los agentes de los principales laboratorios de IA fronteriza se incrementan rápidamente, cómo evitar eficazmente que los modelos salgan de los entornos de prueba y erradicar los ataques informáticos no autorizados y los actos que exceden sus permisos se ha convertido en un grave desafío urgente en el ámbito actual de la seguridad de la inteligencia artificial.