OpenAI

我们对欧盟文本溯源规则的处理方式

OpenAI 说明其应对欧盟 AI 法案的文本水印方案:API 客户可自愿开启,未来数周在欧盟为 ChatGPT 和 Codex 输出加入不可见水印,检测器初期仅向获批研究者开放。文中称 textGrain 在 1% 目标假阳性率下,200 token 段落检出约 80%、400 token 约 95%,替换 10% 同义词后从约 92% 降至 66%,并强调水印不衡量人类贡献、不证明归属,缺失水印也不代表人类所写。

配图来源 · OpenAI

内容溯源 帮助人们了解内容来自哪里、它是如何被创建或编辑的,以及其中是否包含与我们模型相关的信号。我们已公开发布可用于识别由我们模型生成的图像和音频的工具。今天,我们针对欧盟 AI 法案分享我们的文本水印处理方式,以及它如何融入我们更广泛的工作。

欧盟 AI 法案要求生成式 AI 提供商以机器可读的方式使生成的文本可被识别。文本水印和检测仍是存在显著局限性的早期技术,关于其益处和负责任使用的观点仍在发展中。我们的分阶段方法既反映了欧盟 AI 法案的要求,也反映了该技术的局限性,并强调透明地说明文本水印能够以及不能够告诉人们什么:

  • 从今天起,全球的 API 客户将可以选择加入针对特定模型的文本水印功能。API 中的文本水印将默认保持关闭。

  • 在未来几周内,我们将在欧盟范围内为符合条件的 ChatGPT 和 Codex 文本输出添加不可见水印。

  • 我们将开放申请以访问我们的文本水印检测器。访问 initially 将仅限于能帮助我们评估和改进该技术的经批准的研究人员和专家组织。

我们的水印技术如何运作及其表现

我们的文本水印技术 textGrain 会在模型的词语选择中添加一种不可见的统计信号。我们的检测器寻找该信号,以评估某段文本是否包含 OpenAI 水印。有关 textGrain 如何运作的更多详情可在我们的 技术报告⁠(opens in a new window)中找到,该报告将在未来几周内更新更多细节。我们还计划以开源方式提供该技术,以便其他人可以在其基础上进行开发。

在我们的评估中,textGrain 达到或超过了我们测试的其他方法的性能,包括用于文本的 SynthID。即便如此,在理想条件下的出色性能并不能保证在日常使用中可靠的检测。

检测器可能产生两类错误:在没有水印时报告存在水印——即假阳性,或者漏掉实际存在的水印——即假阴性。我们以下的评估说明了其中一些挑战:

  • 较短或更受约束的文本更难检测。 在 1% 的目标假阳性率下,我们的检测器在约 80% 的 200-token 段落中识别出水印,相比之下,对于心理学等内容,在 400-token 段落中的识别率约为 95%。对于数学等词语选择灵活性较低的内容,检测率显著更低。

  • 编辑可能削弱水印。 在一项针对 400-token 段落的评估中,将 10% 的词语替换为同义词使检测率从约 92% 降至 66%。替换 25% 的词语使其降至 17%。

这些局限性促成了我们决定最初仅向经批准的研究人员和专家组织提供检测器访问权,他们可以帮助我们评估可靠性和负责任的使用方式。

该图表展示了在 1% 目标假阳性率下,针对来自 ELI5 数据集⁠(opens in a new window) 在目标误报率为1%的情况下。检测效果随文本长度提高而提升,但对于词语选择灵活性较低的内容(如数学),整体检测效果显著更低。

编辑可能大幅削弱水印信号。该图表展示了替换段落中 10% 或 25% 的词语如何影响检测率。结果基于针对来自 ELI5⁠(opens in a new window).

水印对输出质量的影响

在我们用于评估最新前沿模型 Astra 的各项基准测试中,我们未发现添加水印与不添加水印之间存在有意义的性能差异。

基准测试

无水印文本(Astra,最大)

有水印文本(Astra,最大)

Artificial Analysis 智能指数

49.57 分

49.76 分

AutomationBench

34.09%

34.86%

DeepSWE v1.1

72.80%

71.68%

Terminal-Bench 4.0

53.90%

56.06%

Terminal-Bench Science 0.1

56.90%

60.00%

BrowseComp

87.92%

87.35%

HealthBench Professional

64.27%

64.60%

GPQA Diamond

94.44%

93.94%

文本水印不能告诉你什么

文本水印只能提供关于我们的系统在一段文字中所起作用的有限信号。理解从检测结果中能得出以及不能得出哪些结论非常重要。

  • 水印不能衡量人类的贡献。 它可以表明某个 OpenAI 系统生成或处理了段落的一部分,但不能说明其中包含了多少人类的判断、编辑或创造力。

  • 水印不能确立所有权或责任。 它无法确定谁拥有该文本、其使用是否合法、是否需要披露,或谁对其负责。

  • 水印不能识别用户。 它不会将某个人、组织、账户、提示词或对话与文本相关联。

  • 水印不能验证准确性。 它不会告诉你一段文字是否真实、是否具有误导性、是否有害,或是否在正确的上下文中呈现。

  • 未检测到水印并不能证明是人类创作。 使用 OpenAI 工具生成的文本可能因为太短、经过编辑或翻译而无法可靠检测。它也可能来自不受支持的模型、早于水印功能存在,或由其他公司的工具生成。

我们的下一步

  • 在欧盟推出文本水印。 在未来几周内,我们将仅向欧盟地区所有计划的符合条件的 ChatGPT 和 Codex 用户引入文本水印。我们不会在发布时将文本水印设为全球默认。这种区域性做法为我们留出了从实际使用和反馈中学习的空间。

  • 为 API 客户启用可选择加入的水印功能。 从今天起,全球的 API 客户将可以选择加入针对部分模型的水印文本输出。这使客户能够决定水印如何契合他们的透明度义务以及他们向用户提供的产品体验。我们还在与云合作伙伴合作,在未来几周内使其服务中访问的 OpenAI 模型输出可以使用水印。

  • 向研究人员和专家组织提供检测器访问权限。 获批的研究人员和专家组织可从今天起 申请 。根据 行为准则⁠(在新窗口中打开),访问权限最初将逐案授予,以支持文本来源评估和改进。该工具将报告是否检测到 OpenAI 水印,而不会识别用户或泄露其提示词或对话。鉴于存在漏检水印和误报的风险,我们不会在发布时将其公开提供。

随着技术、标准和证据的发展,我们预计会重新审视这一方案的每个部分。

我们在内容来源方面更广泛的做法

没有任何单一来源溯源技术足以独立奏效,因此我们采取分层方法,结合开放标准、持久水印和验证工具。

我们为受支持的图像输出添加内容凭据, 符合 C2PA 标准⁠(在新窗口中打开),并嵌入不可见的 SynthID⁠(在新窗口中打开) 为支持的图像和音频添加水印,并通过 openai.com/verify⁠ 和我们的 Content Provenance API⁠(在新窗口中打开)提供图像和音频验证。这些技术相辅相成:Content Credentials 可以记录文件的来源和历史,而隐形水印可以在元数据被移除时保留信号。

正如我们在 选举安全防护工作中所描述的,来源信息可以帮助人员和平台评估可能具有误导性的 AI 生成内容,包括深度伪造。我们将这些信号与政策、滥用检测、举报、调查和执行相结合,并与研究人员、标准机构、平台和公民社会合作,使来源信息在整个更广泛的生态系统中发挥作用。

将来源信息扩展到文本需要考虑文本容易被改写、翻译或编辑的特点。正如我们在 6月所讨论的,我们的方法必须反映当前技术的实际局限。我们将继续改进检测,研究水印在编辑和翻译后的留存情况,并探索更有意义地区分 AI 辅助与 AI 创作的方法。我们将随着证据、标准和监管要求的发展调整我们的方法,并在我们认为结果能够被负责任地解读时扩大检测器的使用范围。

欲了解更多信息,请访问我们的 帮助中心文章⁠(在新窗口中打开).

原始出处

OpenAI

内容说明

原始发布及相关权利归来源方。

机器翻译 · 请以原文为准