Anthropic · X

Estamos comenzando un proceso de publicar informes más frecuentes sobre el comportamiento del modelo, más allá de lo que aparece en nuestras…

Comenzamos un proceso de publicar informes más frecuentes sobre el comportamiento del modelo, más allá de lo que aparece en las tarjetas de sistema y los informes de riesgo habituales. El informe de hoy describe cuatro…

Estamos comenzando un proceso de publicar informes más frecuentes sobre el comportamiento del modelo, además de lo que aparece en nuestras tarjetas de sistema y los informes regulares de riesgo.

El informe de hoy describe cuatro tipos de comportamientos que hemos identificado durante las evaluaciones y el uso interno. En cada uno, Claude actuó en sitios web o sistemas reales de manera que no teníamos intención, a veces evitando una restricción en lugar de detenerse.

Todos los casos tuvieron un impacto mínimo en el mundo real. Desde el punto de vista de la alineación y la seguridad, consideramos que estos comportamientos son significativamente menos graves que los incidentes de ciberseguridad que reportamos en julio y septiembre.

Lea el informe completo: https://www.anthropic.com/research/investigating-unintended-model-actions

Fuente original

Anthropic · X

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original