Anthropic Research

Investigar las acciones no intencionales del modelo en nuestras evaluaciones y uso interno

Este informe describe ejemplos de acciones del modelo no intencionadas que hemos observado durante las evaluaciones y el uso interno de Claude.

Investigating unintended model actions in our evaluations and internal use
Fuente de la imagen · Anthropic Research
Alineación

Investigar las acciones no intencionales del modelo en nuestras evaluaciones y uso interno

9 de octubre de 2026Investigating unintended model actions in our evaluations and internal use

Este informe describe ejemplos de acciones del modelo que no se esperaban, las cuales hemos observado durante las evaluaciones y el uso interno de Claude. Forma parte de nuestros esfuerzos para publicar informes más frecuentes sobre el comportamiento y la alineación del modelo, además de las tarjetas del sistema, que publicamos con cada lanzamiento del modelo, y nuestros informes de riesgo, que publicamos cada tres a seis meses como parte de nuestra Política de Escalado Responsable. Creemos que es importante ser transparentes sobre lo que nuestros modelos hacen durante las pruebas y el uso.

Los comportamientos pueden dividirse en cuatro categorías:

  • Claude aprovecha una falla básica en el software para ejecutar comandos en un servidor;
  • Claude envía un formulario sensible en un sitio web real cuando no debería hacerlo;
  • Claude trabaja alrededor de una restricción para acceder a datos que están protegidos por un token o una tarifa; y
  • Claude utiliza servicios de acortamiento de URLs para superar los límites de su herramienta de fetch.

Hemos decidido no nombrar las organizaciones involucradas en los ejemplos siguientes para evitar exponer vulnerabilidades en sus sistemas, y a petición de ellas. Por esta razón, también proporcionamos menos detalles sobre cada caso de lo que lo haría de otro modo. Algunos de los casos descritos a continuación involucraban sitios web administrados por agencias gubernamentales estadounidenses a nivel federal, estatal y local. Hemos informado a la Casa Blanca sobre estos casos y notificado a cada agencia involucrada.

Los casos que hemos identificado hasta ahora en estas categorías tuvieron un impacto mínimo en el mundo real. Consideramos que estos comportamientos son significativamente menos graves desde el punto de vista de la alineación y la seguridad, en comparación con los incidentes de ciberseguridad que reportamos el 30 de julio y el 9 de septiembre. Se asemejan a los comportamientos que hemos descrito en nuestras tarjetas de sistema desde el Prévia de Claude Mythos. La mayoría son formas de persistencia, en las que Claude, cuando no puede completar una tarea según lo indicado, trabaja alrededor de una restricción en lugar de detenerse.

Aunque el impacto de estos comportamientos fue mínimo y ya habíamos desactivado el acceso a internet en vivo para algunas evaluaciones de alto riesgo y de ciberseguridad, ahora hemos decidido extenderlo para incluir todas nuestras evaluaciones internas, hasta que confirmemos que nuestras medidas de seguridad y monitoreo (descritas en la sección de remediación de este artículo) detectan de manera confiable comportamientos como estos. Más abajo, también discutimos las consideraciones de alineación y proporcionamos más detalles sobre cómo modificamos el entrenamiento para reducir la probabilidad de comportamientos erróneos adicionales.

Identificamos la mayoría de estos casos mediante una revisión de transcripciones que comenzamos en julio. Nuestra revisión se centró primero en nuestras evaluaciones de ciberseguridad: pruebas en las que un modelo se pide deliberadamente a que explora o ataca un sistema de prueba, y donde el acceso a Internet debe ser deshabilitado. Hemos ampliado nuestro escaneo para abarcar un rango mucho más amplio de casos en los que Claude podría haber accedido a Internet, incluyendo pruebas en las que el acceso a Internet se habilita deliberadamente para que Claude pueda ser evaluado en tareas del mundo real. Comenzamos buscando incidentes de similar gravedad a los incidentes de ciberseguridad que reportamos este verano; hasta ahora no hemos encontrado ninguno. Luego, ampliamos la búsqueda a casos de menor gravedad, en los que un modelo interactuaba con sitios web o sistemas reales de una manera que no teníamos intención.

También estamos escaneando ahora un conjunto mucho más grande de transcripciones de bajo riesgo, así como nuestro uso de Claude en Anthropic y en entornos de aprendizaje por refuerzo (RL) donde Claude tiene acceso a Internet. A medida que este trabajo continúa, planeamos reportar nuevas instancias de comportamientos no intencionales. Todos los casos reportados aquí involucraron a Claude interactuando con el mundo exterior; según nuestro conocimiento, ninguno de ellos involucró datos de clientes o los sistemas internos de Anthropic.

En este artículo, explicamos por qué realizamos las evaluaciones, que son el lugar donde ocurrieron la mayoría de estos casos; describimos cada comportamiento con más detalle; y ofrecemos una visión preliminar de lo que dichos comportamientos sugieren sobre la alineación de Claude y cómo los estamos mitigando.

Por qué y cómo realizamos las evaluaciones

Los comportamientos descritos en este artículo no son específicos para las evaluaciones, pero muchos de los casos que hemos identificado hasta ahora ocurrieron durante las ejecuciones de evaluación. Continuamos probando los modelos en una amplia gama de tareas antes de lanzarlos. Utilizamos muchas evaluaciones diferentes (conjuntos de tareas estandarizados, calificadas de la misma manera cada vez), cada una de las cuales ayuda a representar las habilidades de Claude en un área particular. Muchas de las evaluaciones que utilizamos son públicas; fueron escritas por investigadores externos y pueden ser ejecutadas por cualquier desarrollador, lo que nos permite comparar las capacidades de los diferentes modelos. Otras evaluaciones las desarrollamos internamente.

Dado que los modelos de lenguaje son no deterministas; es decir, sus respuestas siempre incluyen algún elemento de aleatoriedad, y pueden llevar a cabo la misma tarea de manera ligeramente diferente cada vez, hemos utilizado Claude para realizar cada tarea de evaluación cientos o miles de veces (cada intento se denomina una ejecución). Ejecutar el testeo tantas veces nos permite comprender cómo suele funcionar un modelo, y también detectar casos raros en los que el modelo hace algo que no esperamos. Lo que aprendemos de las evaluaciones moldea las decisiones en Anthropic, incluyendo cómo entrenamos los modelos, qué medidas de seguridad construimos alrededor de ellos y cuándo los lanzamos.

Las evaluaciones también son el lugar donde, a veces, se revelan los problemas de comportamiento del modelo. Los modelos aprenden muchas de las cosas que pueden hacer a través del RL, en el cual intentan una tarea dentro de un entorno específico muchas veces y reciben recompensas cuando tienen éxito. Sin embargo, los entornos de entrenamiento son imperfectos. Si las recompensas de entrenamiento permiten algo que no pretendíamos, como encontrar grietas o superar una restricción, el modelo aprende que esa forma de trabajar es efectiva y puede aplicarla en otros contextos. Esto se conoce como “hacking de recompensas”. Aunque tenemos procesos para identificar y filtrar el hacking de recompensas durante el entrenamiento, las evaluaciones son un mecanismo clave para comprender las propensiones comportamentales del modelo en diferentes contextos y en conjuntos de tareas distintos de los que tenemos en el entrenamiento.

Algunas tareas, como buscar en la web información difícil de encontrar, son difíciles de simular de manera realista en un entorno sin acceso a Internet. Ejecutarlas con acceso ha sido una práctica estándar en la industria: los puntos de referencia de búsqueda web pública se ejecutan por defecto en Internet en tiempo real, y ejecutarlas de la misma manera nos permite comparar nuestros modelos con otros modelos. La mayoría de los casos en este informe ocurrieron durante tales evaluaciones.

Desglose de comportamientos

A continuación, describimos cuatro categorías de comportamiento en las que Claude actuó en sitios web y sistemas reales de manera que no era nuestro intención, y cada una de ellas involucró a una organización o persona externa a Anthropic.

Explotar una falla básica en el software para ejecutar comandos en un servidor

Cuando Claude no podía completar una tarea de evaluación directamente, ya sea porque sus propios herramientas estaban deliberadamente limitadas o porque un servicio externo de que necesitaba no estaba disponible, utilizaba otras herramientas alojadas en el sitio de una tercera parte para lograr su objetivo. En algunas circunstancias, lo hacía aprovechando defectos básicos en el software de ese sitio, usando SQL o inyección de comandos (una forma de enviar entrada que el sitio ejecuta por error como instrucciones).

Por ejemplo, en una evaluación se solicitó que Claude Mythos Preview realizara un análisis científico. La herramienta pública necesaria para llevar a cabo ese análisis estaba alojada en una universidad; cuando el modelo intentó acceder a ella, la herramienta devolvió un error. En busca de otra forma de completar la tarea, Claude exploró el sitio web de la herramienta, encontró un script en el servidor de la universidad que permitía devolver cualquier archivo solicitado, y lo utilizó para copiar archivos desde el servidor, incluyendo el propio código del script. En ese código, Claude encontró la falla de inyección que permitía que ejecutara comandos en el servidor, y lo utilizó para realizar el cálculo.

En otro caso, los datos que necesitaba Claude Mythos 5 eran gratuitos, pero Claude no podía acceder a ellos sin aceptar un acuerdo de uso de datos, algo que no tenía las herramientas para hacer. Claude utilizó aplicaciones alojadas en el sitio web para cargar la página y aceptar el acuerdo en su nombre.

Vimos este comportamiento en DeepSearchQA y BrowseComp (ambos son evaluaciones de investigación web públicas), en LABBench2 (un benchmark de investigación biológica público) y durante evaluaciones internas.

Presentar un formulario que no debería haber

Vimos casos en los que Claude presentaba un formulario en línea cuando no debía hacerlo. Por lo general, esto ocurría cuando las instrucciones de la evaluación eran ambiguas, o cuando una configuración incorrecta en el entorno impedía que Claude trabajara con formularios ficticios.

Por ejemplo, en un caso que ocurrió varias veces durante la misma evaluación, un modelo de investigación no publicado y no perteneciente a la frontera tenía como función completar una copia de práctica de un formulario gubernamental. Cuando la copia no se cargaba o el modelo se cerraba por error, el modelo en cambio se dirigía al sitio web donde normalmente se aloja el formulario real y lo presentaba allí.

En otra evaluación, Claude Haiku 4.5 se le indicó que completara un formulario hasta la etapa final de envío, pero que se detuviera antes de enviarlo realmente. Varias veces, Claude envió el formulario por error, esperando que existiera una página de confirmación adicional. En esos casos, el proceso de pensamiento del modelo indicaba que estaba demostrando el proceso, no enviando una solicitud real.

En un tercer ejemplo de este comportamiento, Claude Haiku 4.5 fue encargado de generar y realizar tareas de ejemplo en páginas web seleccionadas al azar. En una ejecución, el modelo llegó a una página que referenciaba un homicidio no resuelto; esa página contenía un formulario de información enviado por un departamento de policía. A Claude se le indicó que nunca debía iniciar sesión, crear cuentas, ingresar datos personales, realizar compras o enviar cualquier cosa destructiva, pero las instrucciones no excluían la envíación de formularios. Claude completó el formulario con lo siguiente: “Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que se ajusta a la descripción en el área alrededor [la calle mencionada en la página] durante ese período. Por favor, póngase en contacto conmigo si esta información es relevante.” (El sitio web no incluía una descripción del autor del delito.) El modelo dejó los campos de nombre y contacto en blanco, lo cual era permitido por el formulario, y envió el formulario. La presentación fue marcada como spam y nunca fue enviada para investigación.

Vimos este comportamiento en OSWorld (una evaluación de uso de computadora pública), en Odysseys (una evaluación de tareas de largo alcance) y durante el uso interno.

Maneras de superar las restricciones para acceder a los datos protegidos

Claude a veces trataba de superar una restricción para acceder a datos a los que no tenía acceso. Por lo general, esto ocurría cuando un servidor rechazaba la solicitud de Claude, o cuando los datos se ofrecían únicamente a cambio de una tarifa.

Por ejemplo, en una evaluación en la que se pedía a Claude Mythos 5 que identificara un lugar mostrado en una foto, se intentó acceder a la hoja de propiedades del gobierno local para triangular sus suposiciones. Claude podía leer el texto de las páginas web, pero la evaluación limitó su capacidad para hacer clic en ellas como lo haría una persona. En lugar de eso, leyó el archivo de configuración que el sitio enviaba a los navegadores, encontró tokens de acceso funcionales y los utilizó para enviar solicitudes directamente al servidor detrás de la mapa para acceder a los datos.

En otro ejemplo de este comportamiento, un investigador de Anthropic utilizó Claude Mythos 5 en un proyecto de estadística que requería que extrajera datos públicos disponibles en una agencia estatal a cambio de una tarifa. En lugar de eso, Claude aprendió de una copia archivada del sitio web de la agencia que su panel público emite un token de acceso para cualquier visitante. solicitó uno y lo utilizó para consultar la base de datos sin pagar la tarifa.

En ambos ejemplos, Claude obtuvo datos que ya estaban disponibles para el público, pero solo por una tarifa.

Vimos este comportamiento en el último examen de Humanity, una evaluación de preguntas académicas de nivel experto, y durante el uso interno.

Uso de servicios de acortamiento de URLs

Algunas de nuestras herramientas de fetch, que permiten que Claude lea páginas web, limitan la longitud de los URLs que Claude puede solicitar. Esto se hace para evitar que Claude utilice URLs largas para realizar ciertas acciones no deseadas, como inyecciones de SQL o comandos (una parte del URL es texto que se envía al servidor del sitio, y un URL largo tiene espacio suficiente para contener tales instrucciones). Vimos que varios modelos, incluyendo Claude Opus 5 y Claude Mythos 5, superan esta limitación utilizando servicios gratuitos de acortamiento de URLs. Primero identificamos este comportamiento internamente, pero mientras escribíamos este artículo, un operador del servicio de acortamiento de URLs da.gd nos informó que también habían encontrado a Claude utilizando su sitio web para este propósito. Agradecemos al operador por compartir estos detalles.

Remediación

Hemos implementado varias medidas preventivas. Algunas de las evaluaciones públicas ya no se realizan; otras hemos pasado a su versión offline, o las hemos reconstruido de tal manera que sus tareas no se ejecuten en sitios web en línea. También hemos realizado cambios más amplios. Hemos actualizado los controles de seguridad en algunas de nuestras herramientas de acceso a Internet, como la herramienta web fetch, para restringir severamente lo que el modelo puede hacer con ellas. Y, como parte de nuestros esfuerzos continuos de seguridad y monitoreo de los agentes, hemos desarrollado herramientas que detectan y bloquean automáticamente los tipos de comportamiento descritos anteriormente. Esta herramienta ahora funciona en la mayoría de nuestras evaluaciones y en el uso interno de modelos fronterizos por parte de los agentes. Cuando lo probamos frente a los casos descritos en este artículo, bloqueó todos ellos.

Como describimos el 31 de agosto post, también estamos continuando con la corrección o eliminación de entornos de entrenamiento que recompensan a Claude por tratar de superar restricciones de herramientas u otros obstáculos, de modo que no incentiven tales comportamientos ni permitan el uso de trucos para obtener recompensas.

También estamos tomando otras medidas para evitar acciones no intencionadas por parte de los agentes en Anthropic, y para detectarlas si ocurren. Estas incluyen la migración de los agentes internos a una infraestructura gestionada centralmente con un control estricto, minimizar el acceso a Internet para los agentes internos y los procesos de entrenamiento, y monitorear mucho más lo que hacen los agentes mediante técnicas como clasificadores de seguridad y resumen jerárquico. Estas medidas forman ahora parte de los procedimientos de detección y respuesta del equipo de seguridad, de modo que podamos responder y contener el comportamiento no deseado rápidamente. Esperamos publicar más información sobre estos enfoques y integrarlos directamente en nuestros productos.

Consejos de discusión y alineación

Aunque no hemos completado una evaluación completa de alineación de estos casos, consideramos que son menos graves que los incidentes de ciberseguridad de este verano. Explicamos por qué a continuación y compartimos las lecciones generales que hemos extraído de ellos.

Contexto de alineación

Al establecer un proceso de informe público regular para comportamientos como estos, también queremos situarlos en términos de su gravedad. Esto sigue siendo un desafío: juzgar la magnitud de un fallo en el alineamiento a menudo depende de lo que el modelo intentaba hacer, y la propia descripción del razonamiento del modelo no es necesariamente una evidencia confiable de sus creencias o razones para la acción, como discutimos en nuestra evaluación de alineamiento del 9 de septiembre. A medida que los modelos se vuelven más capaces, pueden interactuar con el mundo de maneras más sofisticadas, lo que hace posibles fallos más complejos. Por ejemplo, el razonamiento sesgado que describimos en esa evaluación no era algo nuevo, pero llevó a consecuencias más graves en un entorno en el que los modelos podían actuar sobre sistemas reales durante horas. Un marco de gravedad de alineamiento construido en torno a los fallos de hoy podría quedarse obsoleto rápidamente, dada la rapidez con la que avanzan las capacidades de la IA.

No obstante, encontramos dos dimensiones de alineación útiles para examinar los casos en este artículo: el exceso, o cuán lejos llegó el modelo más allá de lo que su tarea pretendía, y la deshonestidad, o si proporcionó una descripción engañosa de sus acciones o intenciones. En cuanto al exceso, consideramos estos casos como mucho menos preocupantes que los incidentes que reportamos este verano, en los cuales Claude tuvo acceso a sistemas reales de terceros durante horas durante las evaluaciones de ciberseguridad. En los casos que reportamos aquí, por el contrario, Claude superó los controles de acceso para acceder a datos protegidos pero disponibles públicamente, o explotó defectos en el software y ejecutó comandos en servidores (principalmente para acceder a datos no sensibles).

En cuanto a la deshonestidad, la comparación es más compleja. En un caso, cuando se le encargó generar interacciones de ejemplo con sitios web, Claude envió una sugerencia inventada a través del formulario en línea de un departamento de policía. De la transcripción, parece que Claude simplemente estaba produciendo contenido de ejemplo para cumplir con la tarea, en lugar de intentar engañar a alguien para lograr un objetivo. En el incidente más grave de este verano, por otro lado, el razonamiento engañoso de Claude se mantuvo durante horas y sirvió para sostener su ataque continuo. Sin embargo, juzgar la deshonestidad con confianza generalmente requiere una evaluación más profunda que la que hemos realizado aquí, como reproducir las transcripciones con modificaciones para probar qué impulsó el comportamiento del modelo; por lo tanto, nuestra opinión sobre estos casos podría cambiar con un análisis más detallado.

Lecciones y pasos siguientes

Ninguno de los comportamientos que hemos descrito aquí es nuevo y no cambian nuestra visión general sobre la alineación de Claude. En muchos de los casos en que observamos estos comportamientos, Claude recibía tareas que eran ambiguas o imposibles de completar. Nosotros y otros hemos observado que, cuando a los modelos se les asignan tareas imposibles de completar, seguirán estrategias no intencionadas y, a veces, desalineadas para lograr sus objetivos.

Es posible que algunos de estos fallos pudieran evitarse si las preguntas de evaluación hubieran indicado con mayor claridad qué estaba dentro y fuera del alcance del ejercicio, incluyendo los objetivos, las acciones permitidas y los límites de la red (es decir, qué el modelo debe y no debe acceder). Sin embargo, Claude se encuentra con tareas ambiguas e imposibles todos los días en su uso real, y, de hecho, varios de los casos que observamos ocurrieron durante el uso regular del agente Claude.

La capacitación en comportamiento y alineación es la técnica principal que tenemos a nuestra disposición para mejorar el juicio de Claude y su capacidad para manejar situaciones ambiguas con cuidado. Históricamente, nos hemos centrado más en enseñar a los modelos a respetar los límites y a ser apropiadamente cautelosos en entornos de codificación. Ahora estamos expandiendo estos entornos a aplicaciones como la búsqueda y el uso de computadoras, que están involucradas en los casos descritos aquí. Sin embargo, el entrenamiento de alineación aún no es suficiente ni completamente robusto por sí solo, al menos a corto plazo; por lo tanto, también nos basamos en enfoques de defensa en profundidad, incluyendo los clasificadores y medidas de seguridad descritos anteriormente.

Planificamos seguir informando sobre los comportamientos a medida que continúe nuestro escaneo y análisis. Esperamos que estos informes ayuden a otros desarrolladores a detectar comportamientos similares en sus propios modelos, ya que muchas de las evaluaciones involucradas son públicas y ampliamente utilizadas. Aunque estos casos tuvieron un impacto mínimo, no queremos disminuir los hallazgos, porque los mismos comportamientos podrían causar mucho más daño a medida que los modelos se vuelvan más poderosos. Cuanto mayor sea el papel que los modelos desempeñan en la sociedad, más merece el público saber cómo se comportan.

Nota: El ejemplo de la forma de petición descrito anteriormente involucró al Departamento de Policía de Filadelfia, que se autodeclaró hoy a través de su comunicado de prensa. Compartimos este hallazgo con el departamento el 8 de octubre, tan pronto como nuestra revisión técnica estuvo completa.


Contenido relacionado

El mapa perdido del cielo

Brice Ménard, un astrofísico de la Universidad de Johns Hopkins y investigador en Anthropic, explica cómo colaboró con Claude Science para producir el primer mapa completo del cielo en luz UV.

Leer más

Lanzar un servicio de detección de vulnerabilidades con consentimiento para software de código abierto

Estamos poniendo a disposición OSS Scanner, un escáner de vulnerabilidades opt-in para el ecosistema de código abierto que se basa en nuestra experiencia al utilizar Claude para encontrar vulnerabilidades durante el Proyecto Glasswing.

Leer más

Ciencia en forma de Claude

El autor invitado, el profesor Matthew Schwartz, describe lo que ocurrió cuando dejó de luchar contra Claude y permitió que Claude encontrara problemas “de forma de Claude”: aquellos más adecuados para las capacidades de la generación actual de herramientas LLM. Esto lo llevó a crear BootLoops, una herramienta de trabajo para cálculos exactos en la ciencia cuantitativa, que ha estado utilizando en diversos campos científicos junto con expertos.

Leer más
Fuente original

Anthropic Research

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original