内容溯源 帮助人们了解内容来自哪里、是如何创建或编辑的,以及其中是否包含与我们模型相关的信号。我们已经公开发布了识别由我们模型生成的图像和音频的工具。今天,我们分享针对欧盟AI法案的文本水印处理方针,以及它如何融入我们更广泛的工作。
欧盟AI法案要求生成式AI提供商以机器可读的方式使生成的文本可被识别。文本水印和检测仍是早期技术,存在显著局限,对其益处和负责任使用的看法仍在发展中。我们的分阶段方法既反映了欧盟AI法案的要求,也反映了该技术的局限性,重点是公开说明文本水印能告诉人们什么、不能告诉人们什么:
从今天起,全球的API客户可以选择针对特定模型启用文本水印。API中的文本水印默认保持关闭。
在未来几周内,我们将为欧盟境内符合条件的ChatGPT和Codex文本输出添加不可见水印。
我们正在开放申请以使用我们的文本水印检测器。访问权限最初将仅限于经过批准的研究人员和专家组织,他们可以帮助我们评估和改进该技术。
以上仅适用于文本溯源——我们用于音频和图像的验证工具,包括我们的 openai.com/verify 网络工具和我们的 Content Provenance API(在新窗口中打开),将继续公开提供给希望了解某张图像或音频文件是否由我们系统生成的组织使用。
我们的水印技术如何运作及其表现
我们的文本水印技术textGrain在模型的用词选择中添加一种不可见的统计信号。我们的检测器查找该信号,以评估某段文字是否包含OpenAI水印。有关textGrain工作原理的更多细节可参见我们的 技术报告(在新窗口中打开),未来几周内将更新更多细节。我们还计划将该技术以开源形式提供,以便其他人基于它进行开发。
在我们的评估中,textGrain的表现达到或超过了我们测试的其他方法,包括面向文本的SynthID。即便如此,理想条件下的强劲表现并不能保证在日常使用中可靠检测。
检测器可能出现两类错误:在不存在水印时报告存在水印——即假阳性,或漏掉实际存在的水印——即假阴性。我们下面的评估说明了其中一些挑战:
较短或受约束较多的文本更难检测。 在1%的目标假阳性率下,我们的检测器在约80%的200-token段落中识别出水印,相比之下,对于心理学等内容,在约95%的400-token段落中识别出水印。对于数学等用词选择灵活性较低的内容,检测率则显著更低。
编辑会削弱水印。 在一项对400-token段落的评估中,将10%的单词替换为同义词使检测率从约92%降至66%。替换25%的单词使其降至17%。
这些局限性促成了我们的决定,即最初仅向经过批准的研究人员和专家组织提供检测器访问权限,他们可以帮助我们评估可靠性和负责任的使用方式。
此图表显示了在1%的目标假阳性率下,针对来自 ELI5数据集(在新窗口中打开) 在目标误报率为 1% 的情况下。检测结果随文本长度增加而改善,但对于用词选择灵活性较低的内容(如数学),整体检测率则明显更低。
编辑会大幅削弱水印信号。此图表显示替换段落中10%或25%的单词如何影响检测。结果基于对以下来源问题的带水印英文回答: ELI5(在新窗口中打开).
水印对输出质量的影响
在我们用于评估最新前沿模型 Astra 的各项基准测试中,有无水印并未表现出有意义的性能差异。
基准测试 | 无水印文本(Astra,max) | 有水印文本(Astra,max) |
|---|---|---|
Artificial Analysis Intelligence Index | 49.57 分 | 49.76 分 |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
文本水印无法告诉你什么
文本水印只能提供关于我们的系统在某段文字中所起作用的有限信号。理解从检测结果中能得出什么、不能得出什么,这一点非常重要。
水印不能衡量人的贡献。 它可以表明某个OpenAI系统生成或处理了某段文字的一部分,但不能说明其中包含多少人类的判断、编辑或创作。
水印不能确立所有权或责任。 它不能确定谁拥有该文本、其使用是否合法、是否需要披露,或谁对其负责。
水印不能识别用户。 它不会将某个人、组织、账户、提示词或对话与该文本关联起来。
水印不能验证准确性。 它无法告诉你某段文字是否真实、是否具有误导性、是否有害,或是否在正确的语境中呈现。
未检测到水印并不能证明是人类创作。 使用OpenAI工具生成的文本可能因太短、经过编辑或被翻译而无法可靠检测。它也可能来自不支持的模型、早于水印技术,或由其他公司的工具生成。
我们的下一步行动
在欧盟推出文本水印。 未来几周内,我们将仅在欧盟面向所有套餐中符合条件的ChatGPT和Codem用户推出文本水印功能。我们不会在发布时将文本水印作为全球默认设置。这种区域性的方式为我们提供了从实际使用和反馈中学习的空间。
为API客户启用可选加入的水印功能。 从今天开始,全球的API客户可以针对特定模型选择加入带水印的文本输出。这使客户能够决定水印如何契合他们的透明度义务以及他们为用户提供的体验。我们还在与云合作伙伴合作,以便在未来几周内使其服务中访问的OpenAI模型输出可以使用水印功能。
向研究人员和专家机构提供检测器访问权限。 获得批准的研究人员和专家机构可以 申请 (在新窗口中打开) ,根据Code of Practice(在新窗口中打开),访问权限最初将逐案授予,以支持文本来源的评估和改进。该工具只会报告是否检测到OpenAI水印,而不会识别用户或泄露其提示词或对话。鉴于存在漏检水印和误报的风险,我们不会在发布时将其公开提供。
我们预计随着技术、标准和证据的发展,重新审视这一方法的每个部分。
我们对内容来源的更广泛方法
没有任何单一的来源验证技术本身是足够的,因此我们采取分层方法,结合开放标准、持久水印和验证工具。
我们为支持的图像输出添加Content Credentials,并且符合 C2PA标准(在新窗口中打开), 嵌入不可见 SynthID(在新窗口中打开) 支持图片和音频中的水印,并通过提供图片和音频验证功能。 openai.com/verify 以及我们的 内容来源API(Content Provenance API)(在新窗口中打开)这些技术相辅相成:Content Credentials可以记录文件的来源和历史,而隐形水印可以在元数据被删除时保留信号。
正如我们在 选举保障工作中所描述的,内容溯源可以帮助人们和平台评估可能具有误导性的AI生成内容,包括深度伪造。我们将这些信号与政策、滥用检测、举报、调查和执行相结合,并与研究人员、标准机构、平台和民间社会合作,使溯源在整个更广泛的生态系统中发挥作用。
将溯源扩展到文本需要考虑到文本很容易被重写、翻译或编辑。正如我们在 6月所讨论的,我们的方法必须反映当前技术的实际局限。我们将继续改进检测,研究水印在编辑和翻译后的存留情况,并探索更有意义地区分AI辅助与AI创作的方法。随着证据、标准和监管要求的发展,我们将调整我们的方法,并在我们认为结果能够被负责任地解读时扩大检测器的访问范围。
欲了解更多信息,请访问我们的 帮助中心文章(在新窗口中打开).
