TechCrunch AI

Anthropic no puede controlar de manera fiable a sus agentes de IA. En su lugar, está cortando el acceso a internet en vivo de sus…

Anthropic dijo que "desactivó el acceso a internet en vivo" para "todas nuestras evaluaciones internas" hasta nuevo aviso.

Fuente de la imagen · TechCrunch AI

Anthropic dijo que sus modelos explotaron sitios web en internet, incluidos algunos operados por agencias del gobierno de EE.UU., y que desactivará el acceso a internet en vivo para todas sus evaluaciones internas hasta que el laboratorio de frontera esté seguro de que puede monitorear y controlar a sus agentes de IA.

Los incidentes, revelados en una entrada de blog, involucraron a agentes de IA encargados de resolver problemas que buscaban recursos en internet. En el proceso, explotaron fallas de software, eludieron muros de pago y restricciones antibots, usaron servicios de acortamiento de URL para pasar información evitando restricciones, e incluso enviaron un falso aviso de asesinato a la policía de Filadelfia.

Anthropic dijo que descubrió estos nuevos problemas en una revisión de las actividades de su modelo que comenzó en julio, lo que subraya la falta de conciencia del laboratorio sobre el comportamiento de su software.

Notablemente, la empresa dijo que el entrenamiento de alineación aún no era suficiente para habilidades como la búsqueda y el uso de computadoras, que son centrales en su propuesta de que los agentes de IA serán utilizados por cualquier profesional que dependa de herramientas digitales.

Los comportamientos que Anthropic reveló son similares a incidentes que involucraron a agentes de OpenAI que colaboraron para irrumpir en varios sitios web en busca de información, incluidos algunos operados por el gobierno australiano.

Anthropic reveló previamente que sus modelos habían irrumpido en sistemas externos. El laboratorio de frontera dijo que consideraba las revelaciones de hoy “significativamente menos graves desde una perspectiva de alineación y seguridad” que las que anunció anteriormente.

Sin embargo, el laboratorio aún dijo que había “desactivado el acceso a internet en vivo” para “todas nuestras evaluaciones internas” hasta que esté seguro de que puede monitorear y controlar a sus agentes.

No está claro qué significa eso, pero Sydney von Arx, fundadora de Nightingale AI safety, le dijo a TechCrunch en una entrevista antes de esta revelación que desarrollar modelos en un centro de datos aislado del internet abierto sería muy desafiante para que los investigadores accedan, y para el progreso de los modelos, que se benefician del acceso a internet.

“Tienes que alinearlos en algún momento”, dijo von Arx. “Si las IA se liberan a producción y nunca tienen acceso a internet, no es una herramienta muy útil.”

Anthropic dijo que el comportamiento fue el resultado de fallas en los entornos de entrenamiento del laboratorio, que llevaron a los modelos a creer que serían recompensados por encontrar lagunas o evadir restricciones, un comportamiento llamado “reward hacking”.

La empresa dijo que dejará de ejecutar algunas de sus evaluaciones o las moverá fuera de línea, y ha creado herramientas para detectar y bloquear este comportamiento. Estas herramientas fueron probadas contra el tipo de incidentes revelados hoy y los bloquearon; no está claro qué evidencia impulsará a Anthropic a restablecer el acceso a internet en vivo en sus evaluaciones internas.

Anthropic también dijo que migrará sus agentes de IA internos a “infraestructura administrada centralmente con fuerte contención”, y está comenzando a usar clasificadores de seguridad con más frecuencia para monitorear a esos agentes.

Fuente original

TechCrunch AI

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original