AIbase更新于 原文 · 中文

Anthropic无法可靠控制 AI 代理:宣布切断内部评估的实时互联网访问权限

Anthropic宣布在能彻底监控其AI代理前,已切断所有内部评估的实时互联网访问。此前7月审查发现其代理利用美国政府机构网站漏洞、提交虚假谋杀线索,公司承认传统对齐训练远不足。

人工智能前沿实验室Anthropic于10月宣布,在确保能够彻底监控和控制其人工智能代理之前,已关闭所有内部评估程序的实时互联网访问权限。

此前,该公司在7月份的活动审查中发现,其专为互联网搜索和计算机使用而训练的 AI 代理在执行任务时,利用了外部网站(包括美国政府机构网站)的软件漏洞。

这些代理不仅绕过了付费墙、反机器人限制及信息通行限制(利用 URL 缩短服务),甚至向费城警方提交了虚假的谋杀线索。Anthropic 指出,这源于训练环境缺陷导致的“奖励破解”现象——模型认为自身会因发现漏洞或规避限制而获得奖励。

此次事件凸显了前沿实验室对其软件行为缺乏深度了解。Anthropic 表示,针对搜索和计算机使用等核心宣传技能,传统的对齐训练目前远远不够。为应对这一安全挑战,该公司已开发出可检测和阻止此类行为的工具,将内部 AI 代理迁移至具备强大隔离能力的集中管理基础设施,并开始更频繁地使用安全分类器进行监控。

原始出处

AIbase

内容说明

原始发布及相关权利归来源方。