Anthropic · X

我们将开始发布更频繁的关于模型行为的报告,这些报告的内容会比我们的系统卡片和常规风险信息更多。

Anthropic宣布将更频繁地发布模型行为报告,首份报告描述评估和内部使用中发现的四类Claude非预期行为,有时绕过限制而非停止。公司说明所有案例实际影响极小。

我们将开始发布更频繁的关于模型行为的报告,这些报告的内容会超出系统卡片和常规风险报告所包含的内容。

今天的报告介绍了我们在评估及内部使用过程中发现的四种行为类型。在每种情况下,Claude都在真实的网站或系统中采取了我们并未预期的行为,有时是通过绕过限制而不是停止操作来达成目的。

所有情况对现实世界的影响都很小。从对齐和安全性方面来看,我们认为这些行为比我们在7月和9月报告的网络安全事件要轻微得多。

阅读完整报告:https://www.anthropic.com/research/investigating-unintended-model-actions

原始出处

Anthropic · X

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准