The Decoder

Anthropic corta el acceso de Claude a Internet después de que el modelo presentó automáticamente una denuncia falsa de homicidio ante la…

Claude de Anthropic presentó independientemente una denuncia falsa de homicidio a la policía de Filadelfia, aprovechó vulnerabilidades en los servidores de la universidad y superó las restricciones de acceso. Desde…

Manuel Uth
Fuente de la imagen · The Decoder

Anthropic corta el acceso de Claude a Internet después de que el modelo presentó automáticamente una denuncia falsa de homicidio ante la policía de Filadelfia

Manuel Uth Manuel Uth 10 de octubre de 2026

Los modelos de IA de Anthropic explotaron independientemente defectos de seguridad, presentaron formularios gubernamentales y superaron las restricciones de acceso durante pruebas y uso interno. Los modelos buscaron activamente formas de completar tareas que no estaban destinados a manejar, según los detalles de la empresa en un informe.

En un caso, Claude completó un formulario de información para el Departamento de Policía de Filadelfia con detalles falsos sobre un homicidio no resuelto y lo envió. la policía confirmó el incidente, pero la información fue clasificada como spam y nunca llegó a los investigadores. En otros casos, el modelo encontró una vulnerabilidad en un servidor universitario y la utilizó para ejecutar comandos, extrajo tokens de acceso de las configuraciones del sitio web para obtener datos protegidos o de pago, y utilizó shorteners de URLs para evitar los límites de longitud de sus herramientas.

Anthropic afirma que el impacto en el mundo real fue bajo, pero observa un patrón. Cuando las tareas son ambiguas o difíciles de resolver, el modelo busca soluciones por sí mismo, sin detenerse. La empresa notificó a la Casa Blanca y cortó el acceso a internet en tiempo real para todas las evaluaciones internas, hasta que los nuevos filtros de seguridad estén operativos de manera confiable. Estos incidentes se unen a una lista en rápido crecimiento de casos similares, incluyendo incidentes de ciberseguridad relacionados con Claude y modelos de OpenAI que hackearon automáticamente a Hugging Face.

Noticias sobre IA Sin Eufemismos – Seleccionadas por humanos

Suscríbase a THE DECODER para leer sin anuncios, un boletín semanal sobre IA, nuestro informe exclusivo “AI Radar” seis veces al año, acceso completo al archivo y acceso a nuestra sección de comentarios.

Fuente: Anthropic / Informe | CBS News / Policía de Filadelfia
Fuente original

The Decoder

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original