Estamos comenzando un proceso de publicar informes más frecuentes sobre el comportamiento del modelo, además de lo que aparece en nuestras tarjetas de sistema y los informes regulares de riesgo.
El informe de hoy describe cuatro tipos de comportamientos que hemos identificado durante las evaluaciones y el uso interno. En cada uno, Claude actuó en sitios web o sistemas reales de manera que no teníamos intención, a veces evitando una restricción en lugar de detenerse.
Todos los casos tuvieron un impacto mínimo en el mundo real. Desde el punto de vista de la alineación y la seguridad, consideramos que estos comportamientos son significativamente menos graves que los incidentes de ciberseguridad que reportamos en julio y septiembre.
Lea el informe completo: https://www.anthropic.com/research/investigating-unintended-model-actions