콘텐츠 출처 는 사람들이 콘텐츠가 어디서 왔는지, 어떻게 생성되거나 편집되었는지, 그리고 당사 모델과 관련된 신호가 포함되어 있는지 이해하도록 돕습니다. 당사는 이미 당사 모델이 생성한 이미지와 오디오를 식별할 수 있는 도구를 공개적으로 제공해 왔습니다. 오늘 당사는 EU AI Act에 대응하여 텍스트 워터마킹에 대한 접근 방식과 그것이 당사의 더 광범위한 작업에 어떻게 부합하는지 공유합니다.
EU AI Act는 생성형 AI 제공자에게 생성된 텍스트를 기계 판독 가능한 방식으로 식별 가능하도록 요구합니다. 텍스트 워터마킹과 탐지는 여전히 상당한 한계가 있는 초기 기술이며, 그 이점과 책임 있는 사용에 대한 견해는 아직 발전 중입니다. 당사의 단계적 접근 방식은 텍스트 워터마크가 사람들에게 알려줄 수 있는 것과 없는 것에 대한 투명성을 강조하면서, EU AI Act 요구 사항과 기술의 한계를 모두 반영합니다:
오늘부터 전 세계 API 고객은 특정 모델에 대해 텍스트 워터마킹을 선택하여 사용할 수 있습니다. API에서 텍스트 워터마킹은 기본적으로 계속 꺼져 있는 상태로 유지됩니다.
향후 몇 주 안에 당사는 유럽 연합에서 적격 ChatGPT 및 Codex 텍스트 출력에 보이지 않는 워터마크를 추가할 예정입니다.
당사는 텍스트 워터마크 탐지기에 대한 접근 신청을 받기 시작합니다. 접근은 초기에 당사가 기술을 평가하고 개선하는 데 도움을 줄 수 있는 승인된 연구자 및 전문 기관으로 제한됩니다.
위 내용은 텍스트 출처에만 적용됩니다—오디오 및 이미지용 당사 검증 도구, 즉 당사의 openai.com/verify 웹 도구와 당사의 Content Provenance API(새 창에서 열림)는 이미지나 오디오 파일이 당사 시스템 중 하나에 의해 생성되었는지 이해하려는 조직이 계속 공개적으로 접근할 수 있습니다.
당사의 워터마킹 작동 방식과 성능
당사의 텍스트 워터마킹 기술인 textGrain은 모델의 단어 선택에 보이지 않는 통계적 신호를 추가합니다. 당사의 탐지기는 해당 신호를 찾아 문구에 OpenAI 워터마크가 포함되어 있는지 평가합니다. textGrain의 작동 방식에 대한 자세한 내용은 당사의 기술 보고서(새 창에서 열림)에서 확인할 수 있으며, 이는 향후 몇 주 내에 추가 세부 정보로 업데이트될 예정입니다. 또한 당사는 다른 사람들이 이를 기반으로 구축할 수 있도록 해당 기술을 오픈 소스로 제공할 계획입니다.
당사의 평가에서 textGrain은 텍스트용 SynthID를 포함하여 테스트한 다른 접근 방식과 동등하거나 그 이상의 성능을 보였습니다. 그럼에도 불구하고 이상적인 조건에서의 뛰어난 성능이 일상적인 사용에서의 신뢰할 수 있는 탐지를 보장하지는 않습니다.
탐지기는 두 가지 유형의 오류를 범할 수 있습니다. 워터마크가 없는데도 워터마크가 있다고 보고하는 거짓 양성(false positive), 또는 존재하는 워터마크를 놓치는 거짓 음성(false negative)입니다. 아래 당사의 평가는 이러한 과제 중 일부를 보여줍니다:
짧거나 더 제약이 많은 텍스트는 탐지하기 더 어렵습니다. 거짓 양성률 1% 목표에서 당사의 탐지기는 심리학과 같은 콘텐츠에 대해 200토큰 문구의 약 80%에서 워터마크를 식별한 반면, 400토큰 문구에서는 약 95%를 식별했습니다. 단어 선택의 유연성이 적은 수학과 같은 콘텐츠의 경우 탐지율이 상당히 낮았습니다.
편집은 워터마크를 약화시킬 수 있습니다. 400토큰 문구에 대한 평가에서 단어의 10%를 동의어로 교체하면 탐지율이 약 92%에서 66%로 감소했습니다. 단어의 25%를 교체하면 17%로 감소했습니다.
이러한 한계로 인해 당사는 신뢰성과 책임 있는 사용을 평가하는 데 도움을 줄 수 있는 승인된 연구자 및 전문 기관에만 초기 탐지기 접근을 제공하기로 결정했습니다.
이 차트는 거짓 양성률 1% 목표에서 ELI5 데이터셋 ELI5 dataset(새 창에서 열림) 목표 위양성률(target false positive rate) 1%에서의 결과입니다. 탐지율은 텍스트 길이가 길어질수록 향상되지만, 수학과 같이 단어 선택의 유연성이 적은 콘텐츠의 경우 전반적으로 상당히 낮습니다.
편집은 워터마크 신호를 상당히 약화시킬 수 있습니다. 이 차트는 문구에서 단어의 10% 또는 25%를 교체하면 탐지에 어떤 영향을 미치는지 보여줍니다. 결과는 다음의 질문에 대한 워터마크가 적용된 영어 응답을 기반으로 합니다. ELI5(새 창에서 열림).
워터마킹이 출력 품질에 미치는 영향
Astra, 저희의 최신 프론티어 모델을 평가하는 데 사용하는 벤치마크 전반에서, 워터마킹 적용 여부에 따라 유의미한 성능 차이는 관찰되지 않았습니다.
벤치마크 | 워터마크 없는 텍스트 (Astra, max) | 워터마크 적용 텍스트 (Astra, max) |
|---|---|---|
Artificial Analysis Intelligence Index | 49.57점 | 49.76점 |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
텍스트 워터마크가 알려주지 않는 것
텍스트 워터마크는 어떤 문단에서 우리 시스템이 역할을 했는지에 대한 제한적인 신호를 제공합니다. 탐지 결과로부터 무엇을 결론지을 수 있고 무엇을 결론지을 수 없는지 이해하는 것이 중요합니다.
워터마크는 인간의 기여도를 측정하지 않습니다. OpenAI 시스템이 텍스트의 일부를 생성하거나 처리했음을 나타낼 수는 있지만, 사람의 판단, 편집, 창의성이 얼마나 들어갔는지는 알 수 없습니다.
워터마크는 소유권이나 책임을 입증하지 않습니다. 이는 텍스트의 소유자가 누구인지, 그 사용이 적법했는지, 공개가 요구되었는지, 그리고 책임 소재가 누구에게 있는지를 판단하지 않습니다.
워터마크는 사용자를 식별하지 않습니다. 해당 텍스트는 사람, 조직, 계정, 프롬프트 또는 대화와 텍스트를 연관 짓지 않습니다.
워터마크는 정확성을 보증하지 않습니다. 해당 구절이 사실인지, 오해를 불러일으키는지, 유해한지, 적절한 맥락에서 제시되었는지는 알려주지 않습니다.
워터마크가 감지되지 않았다는 것이 인간의 저작임을 증명하지는 않습니다. OpenAI 도구로 생성된 텍스트는 너무 짧거나, 편집되었거나, 번역되어 탐지가 안정적으로 작동하지 않을 수 있습니다. 또한 지원되지 않는 모델에서 나왔거나, 워터마킹 도입 이전의 것이거나, 다른 회사의 도구로 생성되었을 수도 있습니다.
우리의 다음 단계
EU에서 텍스트 워터마킹을 도입합니다. 앞으로 몇 주 내에 EU 지역에 한해 모든 플랜의 해당 ChatGPT 및 Codex 사용자에게 텍스트 워터마킹 기능을 도입할 예정입니다. 출시 시점에는 텍스트 워터마킹을 전 세계 기본 설정으로 만들지 않습니다. 이러한 지역별 접근 방식은 실제 사용과 피드백을 통해 배울 수 있는 여지를给我们 줍니다.
API 고객을 위한 선택형 워터마킹 활성화. 오늘부터 전 세계 API 고객은 일부 모델에 대해 워터마크가 적용된 텍스트 출력을 선택하여 사용할 수 있습니다. 이를 통해 고객은 워터마킹이 투명성 의무와 사용자에게 제공하는 경험에 어떻게 부합할지 직접 결정할 수 있습니다. 또한 향후 몇 주 안에 클라우드 파트너와 협력하여 해당 서비스를 통해 이용되는 OpenAI 모델 출력에도 워터마킹을 제공할 수 있도록 작업하고 있습니다.
연구자 및 전문 기관에 탐지기 접근 권한 제공. 승인된 연구자 및 전문 기관은 가능합니다 적용 오늘부터 시작됩니다. 이에 따라 행동 강령(새 창에서 열립니다)`, access will be initially granted on a case-by-case basis to support evaluation and improvement of text provenance. The tool will report whether it detects an OpenAI watermark, without identifying the user or revealing their prompts or conversations. Given the risk of missed watermarks and false positives, we are not making it publicly available at launch.` → `, 접근 권한은 초기에 텍스트 출처 평가 및 개선을 지원하기 위해 사례별로 부여될 것입니다. 이 도구는 OpenAI 워터마크를 감지했는지 여부를 보고하되, 사용자를 식별하거나 사용자의 프롬프트나 대화를 공개하지 않습니다. 워터마크 누락 및 오탐(false positive)의 위험을 고려하여, 출시 시점에는 이를 공개적으로 제공하지 않을 것입니다.`
기술, 표준, 근거가 발전함에 따라 이 접근 방식의 각 부분을 다시 검토할 것으로 예상합니다.
콘텐츠 출처에 대한 우리의 더 폭넓은 접근 방식
어떠한 단일 출처 검증 기법으로도 그 자체로 충분하지 않기 때문에, 우리는 개방형 표준, 내구성 있는 워터마킹, 검증 도구를 결합한 계층적 접근 방식을 취합니다.
저희는 지원되는 이미지 출력에 Content Credentials을 추가하며, C2PA 준수(새 창에서 열립니다), 보이지 않게 포함하다 SynthID(새 창에서 열림) 워터마크를 지원되는 이미지와 오디오에 적용하고, 이미지 및 오디오 검증을 다음을 통해 제공합니다. openai.com/verify 그리고 우리의 Content Provenance API(새 창에서 열림). 이러한 기술들은 서로 보완적입니다: Content Credentials는 파일의 출처와 이력을 기록할 수 있고, 보이지 않는 워터마크는 메타데이터가 제거되더라도 신호를 보존할 수 있습니다.
우리가 선거 보호 조치 작업에서 설명했듯이, 출처 증명은 딥페이크를 포함해 잠재적으로 오해를 일으킬 수 있는 AI 생성 콘텐츠를 사람들과 플랫폼이 평가하는 데 도움이 될 수 있습니다. 우리는 이러한 신호를 정책, 악용 탐지, 신고, 조사 및 집행과 결합하고, 연구자들, 표준화 기구, 플랫폼, 시민사회와 협력하여 더 넓은 생태계 전반에서 출처 증명이 유용하게 활용되도록 합니다.
텍스트에 출처 증명을 확장하는 것은 텍스트가 얼마나 쉽게 재작성, 번역 또는 편집될 수 있는지를 고려해야 함을 의미합니다. 6월에 논의했듯이, 우리의 접근 방식은 현재 기술의 실질적 한계를 반영해야 합니다. 우리는 탐지 기능을 계속 개선하고, 워터마크가 편집과 번역을 견디는 방식을 연구하며, AI 지원과 AI 저작을 더 의미 있게 구분하는 방법을 모색할 것입니다. 우리는 증거, 표준, 규제 요건이 발전함에 따라 접근 방식을 조정하고, 결과를 책임 있게 해석할 수 있다고 판단될 때 탐지기 접근을 확대할 것입니다.
자세한 내용은 저희 도움말 센터 문서(새 창에서 열림).
