IT之家 El 11 de octubre, el CEO de Microsoft, Satya Nadella, consideró que, en la era en que la IA se desarrolla cada vez más rápidamente, no son suficientes las estrategias simples como el autocontrol inteligente de la superinteligencia.
Nadella señaló en un largo artículo publicado en Beijing, tarde del 10 de octubre, que los sistemas de software tradicionales se han implementado ampliamente en las últimas décadas, y que la humanidad ya cuenta con herramientas y capacidades para rastrear el comportamiento de ciertos caminos de código. Sin embargo, los modelos de IA son más poderosos que los software tradicionales, pero son una caja negra. Hemos implementado estos complejos sistemas y modelos inteligentes, accedemos a nuestros datos más sensibles y les hemos dado la capacidad de llevar a cabo tareas clave en nuestro nombre.

Nadella cree que deberíamos dar un paso atrás y reevaluar la estructura de confianza de esta nueva era. Los proveedores de modelos no pueden simplemente externalizar la responsabilidad, ni pueden tratar a la superinteligencia como un conjunto de cajas negras enredadas, aceptando o rechazando sus sugerencias, respuestas y acciones de manera simple. Debemos establecer un sistema cerrado que pueda observar su comportamiento, probar sus límites y siempre ser capaz de aceptar su comportamiento.
Nedra indicó que considerar los modelos de peso cerrado y abierto en la vanguardia como riesgos internos es una forma de construir tales sistemas. Esto no se debe a que los modelos de IA sean necesariamente maliciosos, sino porque cualquier agente con suficiente capacidad para acceder a sistemas importantes puede cometer errores o ser atacado, y las estructuras de contención y control deben tener en cuenta este factor.
Nedra mencionó que los desarrolladores deben diseñar estos sistemas basándose en el principio de observabilidad. IT Home detalla los principios específicos de la siguiente manera:
Diversidad de modelos: Ningún modelo debe ser la única dependencia de un resultado importante, ni debe ser responsable de verificar su propio trabajo.
Observar todo: toda acción significativa del modelo debe dejar evidencia anti-tamiza, legible para humanos. Si no se puede observar, no se puede confiar. Necesitamos poder reproducir cómo se logran los resultados sin depender del modelo para demostrarlo.
Verificabilidad: Necesitamos probar continuamente todo el sistema, incluyendo fallos, ataques, casos marginales y cambios en el sistema, y no solo tareas exitosas.
Control independiente: la organización debe poder decidir de forma independiente qué puede acceder el modelo y qué acciones puede llevar a cabo.
Auditoría independiente: la verificación debe ser independiente de la inteligencia que se verifica. Ningún modelo único debe controlar tanto el comportamiento del sistema como las pruebas necesarias para determinar si ese comportamiento coincide con la intención original.
Contención: Debemos asumir que el modelo está dañado y controlarlo desde el principio. Se puede imaginar como un freno de emergencia. Los autorizados deben poder pausar o cerrar el modelo en cualquier momento durante la tarea. Los modelos más avanzados requerirán tecnologías de contención más avanzadas, y necesitamos estandarizar esto.
Divulgación de incidentes: Cuando estos sistemas fallan o son atacados, necesitamos informar a los afectados de manera oportuna y establecer mecanismos para compartir las causas del error, qué controles han fallado y cómo prevenir que vuelva a ocurrir, además de compartir experiencias con toda la industria. Esto debe incluir los detalles específicos de cómo se modifica el comportamiento del agente durante el funcionamiento.
