IT之家 – Un message du 11 octobre : Satya Nadella, PDG de Microsoft, estime que, dans une époque où l’IA se développe de plus en plus rapidement, les stratégies simples telles que l’autosurveillance par une intelligence superintelligente ne sont pas suffisantes.
Nadra a indiqué dans un long article publié le soir du 10 octobre à Beijing que les systèmes logiciels traditionnels ont été largement déployés au cours des dernières décennies, et que l’humanité dispose désormais d’outils et de capacités pour suivre le comportement des chemins de code spécifiques. Cependant, les modèles d’IA sont plus puissants que les logiciels traditionnels, mais constituent une boîte noire. Nous avons déployé ces systèmes et modèles intelligents complexes, accédons à nos données les plus sensibles, et leur avons conféré la capacité de remplir des tâches clés pour nous.

Nadra estime qu’il convient de reculer un peu et d’évaluer à nouveau la structure de confiance de cette nouvelle ère. Les fournisseurs de modèles ne peuvent pas externaliser la responsabilité, et on ne peut pas considérer une intelligence superintelligente comme un coffre noir en nid, acceptant ou rejetant simplement ses suggestions, réponses et actions. Nous devons établir des systèmes fermés capables d’observer son comportement, de tester ses limites et de l’accueillir toujours .
Nadella a indiqué que considérer les modèles de poids fermé et ouvert en amont comme des risques internes est une manière de construire de tels systèmes. Ce n’est pas parce que les modèles d’IA doivent nécessairement être malveillants, mais plutôt parce qu’ toute entité ayant suffisamment de capacités pour accéder à des systèmes importants peut commettre des erreurs ou être vulnérable. Les architectures de contrainte et de contrôle doivent donc prendre cela en compte.
Nadella a mentionné que les développeurs devraient concevoir ces systèmes en se basant sur le principe de la observabilité. IT Home propose les principes spécifiques suivants :
Diversité des modèles : Aucun modèle ne devrait être la seule dépendance d’un résultat important, et il ne doit pas être responsable de la validation de son propre travail.
Observer tout : Chaque action significative du modèle doit laisser des traces anti-tamponnage et lisibles par l’humain. Sans observation, on ne peut pas faire confiance. Nous avons besoin de pouvoir reproduire comment les résultats ont été obtenus sans dépendre du modèle pour en prouver l’existence.
Vérificabilité : Nous devons tester continuellement l’ensemble du système, y compris les pannes, les attaques, les cas limites et les modifications du système, et non seulement les tâches réussies.
Contrôle indépendant : l’organisation doit être capable de décider seule de ce que le modèle peut accéder et des actions qu’il peut entreprendre.
Audit indépendant : la vérification doit être indépendante de l’intelligence vérifiée. Aucun modèle unique ne doit contrôler à la fois le comportement du système et les preuves nécessaires pour déterminer si ce comportement est conforme à l’intention originale.
Contrôle : nous devons supposer que le modèle a été endommagé, et le contrôler dès le début. On peut l’imaginer comme un frein d’urgence. Les autorisés doivent toujours pouvoir suspendre ou fermer le modèle pendant la tâche. Les modèles plus avancés nécessiteront des techniques de contrôle plus avancées, et nous devons les normaliser.
Déclaration concernant l’incident : Lorsque ces systèmes tombent en panne ou sont piratés, nous devons communiquer les informations aux personnes affectées dans les temps, et mettre en place des mécanismes pour partager les causes des erreurs, les points où les contrôles ont échoué ainsi que les moyens de prévenir leur répétition. Il convient également de partager les expériences avec l’ensemble de l’industrie. Cela inclut les détails concernant la mise en œuvre des modifications de comportement des intelligences en temps de fonctionnement.
