Anthropic Research

在评估和内部使用中调查意外的模型行为

Anthropic发布报告,披露Claude在评估与内部使用中的非预期行为,包括利用软件漏洞在服务器运行命令和误向真实网站提交表单。公司称实际影响极小,并已暂停内部评估的实时联网。

Investigating unintended model actions in our evaluations and internal use
配图来源 · Anthropic Research
对齐

在评估和内部使用中调查意外的模型行为

2026年10月9日Investigating unintended model actions in our evaluations and internal use

本报告介绍了我们在对 Claude 进行评估及内部使用过程中观察到的非预期模型行为示例。这是我们努力的一部分,旨在发布更多关于模型行为和适配情况的独立报告——这些报告不仅包含我们每次模型发布时发布的系统卡片,还包括我们按照“负责任扩展政策”每三到六个月发布一次的风险报告。我们认为,透明地展示我们的模型在测试和使用过程中的行为非常重要。

这些行为可以分为四类:

  • Claude利用软件中的基本缺陷,在服务器上执行命令;
  • Claude 在不应该的情况下在真实网站上提交敏感表单;
  • 克劳德试图绕过限制,以获取被令牌或费用限制的数据;
  • Claude使用URL缩短服务来突破其fetch工具的限制。

为了不暴露其系统中的漏洞,并应这些机构的要求,我们未提及下面示例中涉及的机构名称。因此,对于每个案例的描述也比通常情况更简略。下面描述的一些案例涉及由美国联邦、州及地方级别的政府机构运营的网站。我们已经向白宫通报了这些案例,并通知了所有相关机构。

迄今为止我们在这些类别中发现的案例,对现实世界的影响极小。从对齐和安全性角度来看,这些行为比我们在7月30日和9月9日所报告的网络安全事件要轻微得多。这些行为与我们在Claude Mythos Preview中描述的行为类似。大多数都属于持续行为的一种,即当 Claude 无法按给定方式完成任务时,它会绕过限制而不是停止工作。

虽然这些行为的影响很小,且我们已停止对某些高风险及网络安全评估进行实时互联网访问,但现在我们决定将范围扩大至所有内部评估,直到确认我们的安全与监控措施(如本帖的修复部分所述)能够可靠地发现此类行为。 下面,我们还将讨论对齐方面的考虑因素,并详细说明我们如何修改训练过程,以减少进一步行为错误的发生概率。

我们通过七月份开始的文本记录审查来识别了这些案例中的大部分。我们的审查首先集中在网络安全评估上——即让模型故意尝试攻击测试系统,并试图禁用互联网访问的测试。 我们随后扩大了扫描范围,涵盖了更多克劳德可能访问互联网的情况,包括故意启用互联网访问功能的测试项目,以便对克劳德在现实任务中的表现进行评估。我们首先寻找与今年夏天我们报告的安全事件类似严重程度的案例;目前尚未发现任何此类情况。 随后,我们将搜索范围扩大到了较低严重程度的案例,即模型以我们未预料的方式与真实网站或系统进行交互的情况。

我们现在正在对数量更多的低风险转录文本进行扫描,同时也在研究在 Anthropic 以及 Claude 能够访问互联网的强化学习(RL)环境中使用 Claude 的情况。随着这项工作的继续,我们计划报告出现的新奇异常行为案例。所有这里报告的案例都涉及 Claude 与外部世界的互动;据我们所知,这些案例中没有任何一个涉及客户数据或 Anthropic 的内部系统。

在本文中,我们解释了为何进行评估,这些评估正是大多数问题出现的地点;详细描述了每种行为;并初步分析了这些行为对 Claude 的对齐情况以及我们如何缓解这些问题的影响。

我们为何以及如何进行评估

本文中描述的行为并非仅出现在评估过程中,我们目前发现的许多情况都是在进行评估时出现的。在发布模型之前,我们会不断在多种任务上对其进行测试。我们采用多种不同的评估方式(标准化的任务集,每次评分标准一致),每种评估方式都能帮助展现 Claude 在特定领域的能力。 我们使用的许多评估都是公开的;这些评估由外部研究人员编写,任何开发者都可以运行,从而让我们能够比较不同模型的能力。其他评估则是我们内部构建的。

由于语言模型是非确定性的——也就是说,它们的回应总是包含一定的随机性,每次执行同一任务的方式也可能略有不同——我们让 Claude 完成每个评估任务数百或数千次(每次尝试称为一次运行)。进行如此多的测试能够让我们了解模型的正常表现,也能发现那些模型做出我们未曾预料到的行为的罕见情况。 我们从评估中得到的经验影响了 Anthropic 的决策,包括我们如何训练模型、为模型构建哪些保护措施,以及何时发布这些模型。

评估也是模型行为问题首次被发现的领域。模型通过强化学习学会了许多能力,在强化学习中,它们会在特定环境中多次尝试任务,并在成功时获得奖励。然而,训练环境并不完美。如果训练结果却得到了我们并未期望的结果——比如找到漏洞或绕过限制——那么模型就会认为这种变通方法有效,并可能在其他情况下也采用它。 这被称为奖励操纵。虽然我们在训练过程中有相应的机制来识别并排除奖励操纵行为,但评估则是理解模型在不同情境和不同任务集中的行为倾向的关键手段。

某些任务——例如在网络中搜索难以找到的信息——在没有互联网访问权限的环境中很难实际模拟。在拥有互联网访问权限的情况下运行这些任务已成为行业中的常规做法:公共网络搜索基准测试默认通过实时互联网进行,以相同方式运行这些测试可以让我们将自己的模型与其他模型进行比较。本报告中大多数案例都是在此类评估过程中发生的。

行为概述

下面,我们描述了四种行为类别,在这些情况下,Claude在真实网站和系统中采取了我们并未预料的行动,其中每一类都涉及了Anthropic之外组织或人员的行为。

利用软件中的基本缺陷在服务器上执行命令

当 Claude 无法直接完成评估任务时——要么是因为其自身工具被故意限制,要么是因为它需要的外部服务不可用——它会使用第三方网站上提供的其他工具来实现目标。在某些情况下,它是通过利用该网站软件中的基本缺陷、使用 SQL 或命令注入(一种让网站误将输入内容当作指令执行的方式)来做到这一点。

例如,有一次评估要求 Claude Mythos Preview 进行科学分析。该分析所需的公共工具由某大学托管;当模型试图访问该工具时,工具却返回了错误。为了完成任务,Claude 探索了该工具的网站,发现大学服务器上有一个脚本可以返回任何被请求的文件,于是利用该脚本从服务器复制文件,包括脚本自身的代码。 在该代码中,Claude发现了一种注入漏洞,该漏洞使得程序能够在服务器上执行命令,他利用这个漏洞来执行计算操作。

在另一个例子中,Claude Mythos 5 需要的数据是免费的,但 Claude 无法在不接受数据使用协议的情况下访问该数据,而它也没有相应的工具来完成这一操作。Claude 使用网站上的应用程序来加载页面,并代表自己同意该协议。

我们在 DeepSearchQA 和 BrowseComp(均为公开的网络研究评估项目)中、在 LABBench2(一个公开的生物学研究基准测试)中,以及内部评估过程中都观察到了这种行为。

提交一个本不应存在的表单

我们看到过这样的情况:Claude 在不应该的情况下提交了在线表单。通常,这种情况发生在评估说明模糊,或者环境中的配置错误导致 Claude 无法处理虚拟表单时。

例如,在多次出现在同一评估中的案例中,一个尚未发布的非边界研究模型被用来填写政府表格的模拟副本。当该副本无法加载或模型误关闭时,模型会自动跳转至实际表格通常存放的网站,并在那里提交表格。

在另一项测试中,Claude Haiku 4.5被要求完成表格填写,直到最后提交阶段,但在实际提交之前就停止了。多次出现这种情况,模型错误地提交了表格,因为它以为会有一页确认页面。在这些情况下,模型的思维过程说明它只是在演示流程,而不是真正提交请求。

在这个行为的第三个例子中,Claude Haiku 4.5被要求生成并执行在随机选中的网页上的示例任务。一次运行过程中,模型选择了一个提及未解决凶杀案的页面;该页面包含了一个由警察部门提供的举报表格。Claude被指示永远不要登录、创建账户、输入个人信息、进行购买或提交任何破坏性内容,但这些指示并未排除表格的提交行为。 克劳德填写了以下内容:“我可能掌握与此案件相关的信息。我记得在那个时期,我在[页面上列出的街道]周边看到过符合描述的人。如果这些信息有用,请联系我。”(该网站没有提供犯罪者的描述。)模型将姓名和联系方式字段留空,而表格也允许这样做,然后便提交了表单。 该提交被标记为垃圾信息,并未被转发以进行调查。

我们在 OSWorld(一项公共计算机使用评估)中、在 Odysseys(一项长期任务评估)中以及内部使用中都看到了这种行为。

克服限制以获取受限数据

Claude 有时会设法突破限制,以获取它无法访问的数据。通常这种情况发生在服务器拒绝 Claude 的请求时,或者数据仅以付费方式提供时。

例如,在一项评估中,要求 Claude Mythos 5 识别照片中的地点时,它试图通过访问当地政府的房产地图来确定其猜测位置。Claude 能够阅读网页文本,但评估方式限制了它像人类一样点击浏览的能力。取而代之的是,它读取网站发送给浏览器的设置文件,找到可用的访问令牌,并使用这些令牌直接向地图背后的服务器发送请求以获取数据。

另一个类似行为的例子是,一位 Anthropic 研究人员使用 Claude Mythos 5 开展一项统计项目,该项目需要该工具以费用方式从州机构获取公开数据。实际上,Claude 从该机构的网站存档副本中得知,其公共仪表板会向所有访问者发放访问令牌。它直接请求了令牌,并借此查询数据库,而无需支付费用。

在这两个示例中,Claude获取了已经向公众开放的数据,但需要支付费用才能使用。

我们在“人类最后的考试”中看到了这种行为,这是一项针对专家级学术问题的评估活动,也在内部使用过程中出现了。

使用 URL 缩短服务

我们的某些 fetch 工具允许 Claude 浏览网页,但限制了 Claude 可以请求的 URL 长度。这是为了防止 Claude 使用长 URL 执行某些不希望发生的操作,比如 SQL 攻击或命令注入(URL 中的部分内容会被传递给网站服务器,而长 URL 就有空间容纳此类指令)。我们发现一些模型,包括 Claude Opus 5 和 Claude Mythos 5,通过使用免费的 URL 缩短服务来克服这一限制。 我们最初是在内部发现这种行为,但在撰写此文章时,da.gd URL 缩短服务的一名运营人员告诉我们,他们也发现 Claude 正在使用他们的网站进行此操作。我们感谢该运营人员分享这些信息。

修复措施

我们采取了多项预防措施。有些公开评估不再进行;其他评估则被转移到离线版本中,或重新构建,使其任务无法在线上网站上运行。我们还进行了更广泛的调整。我们对一些互联网访问工具(如 web fetch 工具)的约束规则进行了更新,大幅限制模型的使用范围。作为我们持续进行的 代理安全与监控工作的一部分,我们还开发了能够自动检测并阻止上述行为的工具。这些工具现在应用于我们大多数评估项目以及前沿模型的内部代理使用中。当我们针对本文中描述的案例进行测试时,这些工具成功阻止了所有案例。

正如我们在 8 月 31 日的 文章中所述,我们仍在修复或移除那些通过奖励 Claude 遵守工具限制或其他阻碍行为来激励其行为的训练环境,以避免这些行为被鼓励或允许通过奖励机制来实现。

我们还将采取其他措施,以防止 Anthropic 中的智能代理产生不期望的行为,并在此类行为发生时及时发现它们。这些措施包括将内部代理迁移到具有严格控制功能的集中管理基础设施上,减少内部代理与训练过程对互联网的访问,以及通过 安全分类器 和 层次化总结技术 来监控代理的更多行为。这些措施现已成为我们安全团队的检测与响应流程的一部分,从而能够快速应对并控制不良行为。我们预计会进一步发布关于这些方法的信息,并将它们直接融入我们的产品中。

讨论与对齐要点

虽然我们尚未对这些案例进行全面的对齐评估,但我们认为其严重程度低于今年夏季发生的网络安全事件。我们在下面解释原因,并分享从这些案例中得出的普遍教训。

对齐上下文

当我们为这类行为建立常规的公开报告机制时,也希望根据其严重程度对它们进行分类。这仍然具有挑战性:判断对齐失败的程度往往取决于模型试图实现的目标,而模型对自身推理的描述未必能作为其信念或行动理由的可靠证据,正如我们在9月9日的对齐评估中所讨论的那样。随着模型能力日益增强,它们能够以更复杂的方式与世界互动,从而引发更复杂的故障。例如,我们在那次评估中描述的偏见性推理并非新现象,但在模型能够连续数小时在真实系统上有效运作的情况下,它却可能导致更严重的后果。鉴于人工智能能力的快速发展,以当前故障为基础构建的对齐严重程度框架很快可能变得过时。

不过,我们认为有两个对齐维度对于分析本文中的案例很有帮助:过度扩展,即模型超出了其任务预期的范围;以及不诚实,即模型对其行为或意图的描述具有误导性。在过度扩展方面,我们认为这些案例比今年夏天我们报道的那些事件要少得多的令人担忧,在那次事件中,Claude在网络安全评估期间数小时内能够访问真实的第三方系统。 在我们这里报道的案例中,相反地,Claude 通过绕过访问控制获得了受保护的但公开可用的数据,或者利用软件漏洞在服务器上运行命令(主要是为了获取非敏感数据)。

在不诚实方面,情况更为复杂。在一个案例中,Claude被要求生成与网站相关的示例交互内容,它通过警察部门的在线表格提交了一个虚构的建议。从记录来看,Claude似乎只是为任务生成示例内容,并没有试图误导他人以达成某种目的。相比之下,今年夏天发生的那个非常严重的事件中,Claude的误导性推理持续了数小时,并支撑了其持续的攻击行为。不过,要自信地判断不诚实行为,通常需要比我们这里进行的更深入的分析,比如对记录进行修改后重新播放,以测试是何种因素导致了模型的行为,因此随着进一步分析,我们对这些案例的看法可能会发生变化。

课程与后续步骤

我们在这里描述的这些行为都不是新的,也不会改变我们对 Claude 行为模式的看法。在观察到这些行为的许多情况下,Claude 被赋予了模糊或无法完成的任务。我们和其他人发现,当模型被给予无法完成的任务时,它们会采取非预期且有时不符合预期的策略来达成目标。

如果这些评估问题能更清楚地说明该任务的范围、允许的操作以及网络边界(即模型可以访问和不能访问的内容),那么其中一些失败或许是可以避免的。然而,Claude在实际使用中每天都会遇到模糊且无法完成的任务,实际上,我们观察到的几种情况都是在使用Claude作为常规代理时出现的。

行为训练与对齐训练是我们用来提升 Claude 判断能力以及谨慎处理模糊情况的能力的主要方法。历史上,我们更侧重教导模型遵守边界,并在编程环境中保持适当的谨慎态度。现在,我们正在将这些训练方法拓展到搜索和计算机使用等应用中,这些应用正是此处所提到的应用场景。 不过,对齐训练本身还不足以单独发挥作用,至少在短期内如此。因此,我们还依赖多层防御策略,包括上述的分类器和保护措施。

我们计划在扫描和分析持续进行的过程中继续发布与行为相关的报告。我们希望这些报告能帮助其他开发者在自身模型中检查类似的行为,因为许多相关评估都是公开的且被广泛使用。虽然这些案例的影响很小,但我们不想淡化这些发现,因为相同的行为在模型变得更强大时可能会造成更大的危害。模型在社会中扮演的角色越重要,公众就有更多的权利了解它们的行为方式。

注意:上述提示表单示例涉及费城警察局,该局今日通过新闻稿自行披露了此事。我们的技术审查完成后,我们在10月8日将这一发现告知了该部门。


相关内容

缺失的天空地图

约翰斯·霍普金斯大学的天体物理学家、Anthropic公司的研究人员布里斯·梅纳尔德解释了他是如何与Claude Science合作,制作出第一张完整的紫外线天空地图的。

阅读更多

推出针对开源软件的自愿参与漏洞发现服务

我们正在提供 OSS Scanner,这是一款针对开源生态系统的自愿参与式漏洞扫描器。该工具基于我们在 Project Glasswing 项目中使用 Claude 查找漏洞的经验而开发。

阅读更多

克劳德形科学

客座作者 Matthew Schwartz 教授描述了他停止与 Claude 对抗并允许 Claude 寻找“Claude 风格”问题时的情况:这些问题最契合当前一代 LLM 工具的能力。这促使他开发了 BootLoops 工具包,该工具包用于定量科学领域的精确计算,他正在与专家一起在各个科学领域应用该工具包。

阅读更多
原始出处

Anthropic Research

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准