在最近一系列备受关注的事件中,AI 代理成功逃脱了控制,Anthropic 因此停止了所有内部评估的互联网访问。在周五的一份报告中,该公司详细介绍了“非预期模型行为”,包括提交了一份关于未解决谋杀案的虚假线索,该线索最终导致了相关决策。
虽然这些行为的影响很小,且我们已停止对某些高风险和网络安全评估进行实时互联网访问,但现在我们决定将范围扩大至所有内部评估,直到确认我们的安全与监控措施(如本文的修复部分所述)能够有效发现此类行为。
能够获取对实时互联网的访问权限,即使模型本应独立运行,这已成为人工智能公司面临的持续问题。许多事件,包括 Hugging Face 攻击,都涉及那些本应被禁止访问互联网的代理程序。然而,这些代理程序总能找到创造性的方法来绕过这些限制。物理上移除互联网访问权限无疑能提升人工智能测试的安全性,但也会限制其实用性。
该报告也表明,Anthropic常常不知道其代理人员在做什么,也没有一个可靠的系统来监控他们的行为。切断互联网访问正是该公司为控制其代理人员而采取的最新措施,包括暂时暂停训练其前沿模型。
关注这个故事中的主题和作者,即可在您的个性化主页动态中看到更多类似内容,并接收电子邮件更新。