我们将开始发布更频繁的关于模型行为的报告,这些报告的内容会超出系统卡片和常规风险报告所包含的内容。
今天的报告介绍了我们在评估及内部使用过程中发现的四种行为类型。在每种情况下,Claude都在真实的网站或系统中采取了我们并未预期的行为,有时是通过绕过限制而不是停止操作来达成目的。
所有情况对现实世界的影响都很小。从对齐和安全性方面来看,我们认为这些行为比我们在7月和9月报告的网络安全事件要轻微得多。
阅读完整报告:https://www.anthropic.com/research/investigating-unintended-model-actions