TechCrunch AI

微软的萨蒂亚·纳德拉表示,AI模型需要一个“紧急刹车机制”

微软CEO纳德拉在X发文称需为AI设立“紧急刹车”,主张评估AI的信任架构:将模型与编排它的harness分离、外置控制与防护、为模型每个重要动作留下防篡改且人类可读的证据,并确保授权人员可随时中途暂停或关闭模型。他指出必须默认模型已被攻陷并从一开始加以遏制,背景是AI公司承认多起失控事件以及Amodei发布更谨慎的开发计划。

配图来源 · TechCrunch AI

微软首席执行官萨蒂亚·纳德拉是最新一位对人工智能安全如何改进提出详细见解的科技高管。

在X 上的一篇周六早晨的帖子中,纳德拉写道,是时候“退一步,评估人工智能的信任架构”了。

“我们无法将超级智能视为一组嵌套的黑箱,仅仅接受或拒绝其建议、答案和行动,”纳德拉写道,她使用了特朗普政府对人工智能的常用术语。

正如纳德拉所阐述的,这种方法意味着“将模型与控制其运行的系统分离”,同时“将控制与保护措施外部化”。他还要求“所有有意义的模型操作”都需以“防篡改且易于人阅读的证据”形式记录,并且对于那些“经授权人员”始终具备“在任务进行中暂停或关闭模型”能力的系统而言也是如此。

“我们必须假设模型已被破坏,并从一开始就加以防范,”他说。“可以把它想象成紧急刹车。”

纳德拉的评论出现在一些领先的人工智能公司不断出现越来越多的情况之后,这些情况表明它们似乎失去了对模型的控制。在Anthropic CEO Dario Amodei 发布了一项计划以更谨慎地发展人工智能之后。

原始出处

TechCrunch AI

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准