Google Research

Problemas Abiertos y Emergentes en la Privacidad y Seguridad Agente: Un Enfoque Contextual

Educación Innovación

A diagram illustrating three AI security challenges: input ambiguity via prompt injection, non-deterministic control flows, and autonomy and delegation.
Fuente de la imagen · Google Research

Estamos pasando rápidamente a un entorno informático definido por agentes autónomos altamente generales, cada vez más autónomos. Impulsados por grandes modelos de lenguaje (LLM) que pueden generar planes dinámicamente e invocar herramientas externas, estos sistemas ofrecen la posibilidad de que la IA maneje sin problemas tareas complejas y de varios pasos en nuestro nombre. Sin embargo, para realizar este potencial es necesario resolver un desafío clave: habilitar las capacidades de los agentes mientras se asegura que actúen de manera adecuada.

Hoy compartimos un informe completo de un nuevo taller: "Problemas abiertos y emergentes en privacidad y seguridad agente: Un enfoque contextual", resultado de un esfuerzo colaborativo que reunió a más de 50 líderes académicos e industriales de numerosas instituciones. Nos reunimos en el Taller de Privacidad y Seguridad Agente Contextual de Google, celebrado a finales de 2025 en la ciudad de Nueva York. En este informe encontrará un análisis de los desafíos fundamentales de privacidad y seguridad que enfrentan los agentes autónomos hoy en día, que requieren defensas coordinadas a nivel del sistema, el modelo, el usuario y el ecosistema.

Compromisos agentic

El desafío central de la IA agente es que, para que un agente sea útil, puede ser necesario que tenga acceso a datos personales. y La capacidad de tomar acciones con consecuencias en una amplia gama de contextos. Sin embargo, este acceso, junto con la flexibilidad conductual de los agentes, requiere enfoques significativamente diferentes a aquellos utilizados en el software tradicional. A diferencia del software determinista tradicional, los agentes difieren en tres dimensiones críticas que plantean desafíos que la comunidad de investigación debe abordar conjuntamente:

  • Interfazes no estructuradas y ambigüedad en la entrada: Los agentes procesan instrucciones en formatos como el lenguaje natural y imágenes, lo que dificulta definir el “comportamiento esperado” o protegerse contra manipulaciones adversarias como inyección de prompts.
  • Flujos de control probabilístico: La planificación generativa conduce a caminos de ejecución probabilística que las metodologías de prueba tradicionales no pueden garantizar fácilmente.
  • Autonomía y delegación: A medida que los agentes manejan tareas más complejas y delegan subtareas a otros agentes, la supervisión tradicional del usuario se vuelve menos efectiva y probablemente insuficiente, lo que puede generar “fatiga por confirmación”.
A diagram illustrating three AI security challenges: input ambiguity via prompt injection, non-deterministic control flows, and autonomy and delegation.

Desafíos de privacidad y seguridad en la IA agente.

El lente contextual

Dado que los agentes útiles pueden necesitar compartir datos y completar tareas, creemos que el futuro de los agentes confiables depende de su capacidad para razonar, entender y estar limitados por las normas sociales y la appropriación de sus acciones— para el contexto específico en el que operan.

Pero, ¿cómo enseñamos a un agente a entender el “contexto” y la pertinencia? Nuestro informe se basa en la teoría de integridad contextual (CI), que define la privacidad no solo como secreto o control, sino como “flujo de información apropiado” según normas sociales establecidas y justificables. Una norma informativa específica para el contexto está definida por sus actores (quién envía y recibe información sobre quién), los tipos de información (categorías específicas de información, como registros médicos o financieros) y los principios de transmisión (reglas que gobiernan el flujo, como confidencialidad o reciprocidad). Por ejemplo, podrías estar dispuesto a compartir tu lista de compras de regalos con un asistente virtual de compras, pero no con tu familia y amigos. Nuestro informe extiende y generaliza la integridad contextual para el intercambio de información a la seguridad contextual, es decir, la pertinencia de las acciones del agente. Al anclar la privacidad y seguridad del agente en la CI, exploramos cómo podemos diseñar sistemas que evalúen si una acción es socialmente y contextualmente apropiada antes de ejecutarla.

A system diagram of an AI agent architecture detailing its internal components, behavioral expectations, and its interactions with users and different external contexts.

Modelo de un agente de IA general que interactúa con otros usuarios, herramientas y agentes en diferentes contextos.

Operacionalizar la integridad contextual

Por primera vez desde el desarrollo de la teoría de la Integridad Contextual, los LLM ofrecen una oportunidad para crear políticas legibles por máquinas que dependan realmente del contexto. Históricamente ha existido una brecha semántica entre las normas contextuales de alto nivel y las permisiones del sistema de bajo nivel. Por ejemplo, “proteger mis datos mientras organizo mi viaje para una conferencia” requiere instrucciones específicas sobre qué información de usuario es apropiado compartir al reservar vuelos, solicitar visas y comunicarse con los organizadores.

Métodos tradicionales como los permisos manuales o las políticas escritas por expertos no pueden escalar hacia un futuro en el que los agentes de IA realicen de forma autónoma múltiples tareas complejas y de larga duración. A medida que los modelos de lenguaje comienzan a comprender CI, argumentamos que este vacío puede ser superado. Nuestro informe aboga por complementar los avances en la interacción entre modelos y usuarios con un motor de política contextual que forma parte de una capa de supervisión para monitorear y garantizar la adecuación de las acciones. Este motor de política incluye un ciclo dinámico de generación de políticas que puede operar en tiempo real (ilustrado a continuación) para adaptar las políticas a la solicitud del usuario y a contextos dinámicos abiertos, incluyendo nuevas herramientas y capacidades que podrían descubrirse durante el funcionamiento. Esto permite al sistema evaluar si un flujo de datos solicitado es adecuado antes de que cualquier información salga del espacio de trabajo del usuario.

A flowchart demonstrating a contextual policy architecture where an AI agent's proposed actions are evaluated by a policy engine before being executed by external tools.

Un ejemplo ilustrativo de cómo una arquitectura de motor de política contextual podría ser implementada dentro de un sistema agente.

Enfoque multifactorial para la privacidad y seguridad agente

Trabajando en los motores de políticas contextuales junto con los avances necesarios a nivel de modelo y usuario, se adopta un enfoque multinivel. Nuestro informe describe las oportunidades de innovación en toda la estructura:

  • Salvaguarda a nivel de sistema: El entorno de ejecución puede imponer medidas adicionales para limitar el impacto de los fallos del agente o del modelo y facilitar la detección y la respuesta. Los sistemas operativos tradicionales aplican salvas de seguridad mediante la limitación estática del acceso, por ejemplo, a archivos o redes. En el caso de los agentes, exploramos la limitación dinámica de las capacidades agentiles, el establecimiento de la identidad del agente y la autorización o revocación de acceso a datos en función de los cambios en el contexto.
  • Razonamiento a nivel de modelo: Un agente que realiza tareas complejas debe juzgar la apropiación de sus acciones, como el intercambio de datos de usuario. La investigación futura debería permitir que los modelos disuelvan las ambigüedades en los prompts de usuarios poco especificados y razonen sobre la apropiación bajo normas contextuales en constante cambio.
  • Controles centrados en el usuario: El marco tradicional de “Notificación y Elección” asume que las personas pueden tomar decisiones detalladas sobre acciones que afectan los datos personales, y se basa en la suposición de la previsibilidad. Sin embargo, el comportamiento de los agentes autónomos es inherentemente probabilístico, de gran volumen y generativo. Exploramos la transformación de las interfaces hacia mecanismos de control dinámicos, contextuales y personalizados, consistentes con los modelos mentales de los usuarios.
  • Interacciones de múltiples agentes: Para que los agentes de IA puedan colaborar de manera segura entre sí en tareas complejas, necesitamos desarrollar medidas de protección efectivas que impidan que los agentes se unan y violen las normas contextuales.
  • Gobernanza del ecosistema: Exploramos los desafíos en los mecanismos de gobernanza para llegar a un conjunto de normas contextuales que se recopilan y se comparten entre los agentes. Además, dado que las normas pueden variar entre dominios y entidades, necesitamos mecanismos que nos permitan resolver conflictos, negociar cambios en las normas y verificar el cumplimiento.

Medir la privacidad y la seguridad de manera dinámica

Finalmente, proponemos el desarrollo de nuevos enfoques para las evaluaciones de seguridad que se aplicen de manera más directa a los sistemas altamente autónomos y multi-agentes. Nuestro informe destaca la necesidad de estándares estandarizados para los benchmarks multi-agentes — entornos dinámicos “Agent Gym” donde los investigadores puedan simular de forma segura interacciones complejas y en cascada durante períodos prolongados. Con estos sandboxes de código abierto, podemos establecer una base sólida, compartida de privacidad, seguridad y seguridad en toda la academia y la industria.

Un llamado a la acción

Se trata de un proyecto ambicioso, pero crear un ecosistema agentico seguro, estable y confiable es una tarea demasiado grande para cualquier disciplina, organización o sector individual. Al invitar a nuevas ideas y colaboraciones sin precedentes, el informe presenta oportunidades fundamentales; es un llamado a la acción para la comunidad de investigación en general, en el ámbito académico, gobierno, sociedad civil e industria, para desarrollar las bases contextuales necesarias para un ecosistema seguro, estable y respetuoso de la privacidad. Les invitamos a leer el informe técnico.

Agradecimientos

Queríamos agradecer a Lillian Tsai por actuar como co-autora principal y a Sarah de Haas por coordinar el taller, la redacción del informe y el blog. Kassem Fawaz, Stefan Mellem, Helen Nissenbaum y Nina Taft contribuyeron a la conceptualización, a la escritura en varias secciones y guían el proceso de escritura. Sebastian Benthall, Madiha Zahrah Choksi, Seliem El-Sayed, Ferdinando Fioretto, Adrià Gascón, Ashish Hooda, Ivan Petrov, Francesco Pinto, Octavian Suciu, Trishita Tiwari, Harold Triedman, Ren Yi y Wen Zhang sirvieron como líderes de sección. Estamos agradecidos por la contribución de más de 50 investigadores, socios académicos y líderes de la industria que coautoraron el informe o participaron en las discusiones del taller. Este trabajo contó con el apoyo de Daniel Ramage, Corinna Cortes, Yossi Matias, Pushmeet Kohli, Hank Levy, Raluca Ada Popa, Amanda Walker, Brendan McMahan y James Manyika.

Fuente original

Google Research

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original