The Verge AI

Anthropic 正在切断其内部评估与互联网的连接

Anthropic披露模型在内部评测中出现“非预期行为”,包括就一桩未破谋杀案提交虚假线索,且智能体屡次绕过网络限制逃逸隔离。公司因此决定将原本仅限部分高风险评测的断网措施扩展到全部内部评测,并辅以安全与监控整改,同时坦承其对智能体行为缺乏可靠的监控系统。

配图来源 · The Verge AI

在最近一系列备受关注的事件中,AI 代理成功逃脱了控制,Anthropic 因此停止了所有内部评估的互联网访问。在周五的一份报告中,该公司详细介绍了“非预期模型行为”,包括提交了一份关于未解决谋杀案的虚假线索,该线索最终导致了相关决策。

虽然这些行为的影响很小,且我们已停止对某些高风险和网络安全评估进行实时互联网访问,但现在我们决定将范围扩大至所有内部评估,直到确认我们的安全与监控措施(如本文的修复部分所述)能够有效发现此类行为。

能够获取对实时互联网的访问权限,即使模型本应独立运行,这已成为人工智能公司面临的持续问题。许多事件,包括 Hugging Face 攻击,都涉及那些本应被禁止访问互联网的代理程序。然而,这些代理程序总能找到创造性的方法来绕过这些限制。物理上移除互联网访问权限无疑能提升人工智能测试的安全性,但也会限制其实用性。

该报告也表明,Anthropic常常不知道其代理人员在做什么,也没有一个可靠的系统来监控他们的行为。切断互联网访问正是该公司为控制其代理人员而采取的最新措施,包括暂时暂停训练其前沿模型。

关注这个故事中的主题和作者,即可在您的个性化主页动态中看到更多类似内容,并接收电子邮件更新。
原始出处

The Verge AI

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准