微软首席执行官萨蒂亚·纳德拉是最新一位对人工智能安全如何改进提出详细见解的科技高管。
在X 上的一篇周六早晨的帖子中,纳德拉写道,是时候“退一步,评估人工智能的信任架构”了。
“我们无法将超级智能视为一组嵌套的黑箱,仅仅接受或拒绝其建议、答案和行动,”纳德拉写道,她使用了特朗普政府对人工智能的常用术语。
正如纳德拉所阐述的,这种方法意味着“将模型与控制其运行的系统分离”,同时“将控制与保护措施外部化”。他还要求“所有有意义的模型操作”都需以“防篡改且易于人阅读的证据”形式记录,并且对于那些“经授权人员”始终具备“在任务进行中暂停或关闭模型”能力的系统而言也是如此。
“我们必须假设模型已被破坏,并从一开始就加以防范,”他说。“可以把它想象成紧急刹车。”
纳德拉的评论出现在一些领先的人工智能公司不断出现越来越多的情况之后,这些情况表明它们似乎失去了对模型的控制。在Anthropic CEO Dario Amodei 发布了一项计划以更谨慎地发展人工智能之后。
