コンテンツの来歴 コンテンツがどこから来たのか、どのように作成または編集されたのか、そして当社のモデルに関連するシグナルが含まれているかどうかを人々が理解できるようにします。当社はすでに、当社のモデルによって生成された画像や音声を識別するためのツールを公開しています。本日、EU AI法に対応してテキストのウォーターマーキングへの当社のアプローチ、およびそれが当社のより広範な取り組みにどのように適合するかを共有します。
EUのAI規則(EU AI Act)は、生成AIプロバイダーに対し、生成されたテキストを機械可読な形で識別可能にすることを義務付けています。テキストのウォーターマーキングと検出は依然として初期段階の技術であり、重大な限界があり、その利点と責任ある利用についての見解もまだ発展途上です。当社の段階的アプローチは、EU AI Actの要件とこの技術の限界の両方を反映したものであり、テキストのウォーターマークが人々に何を伝えることができ、何を伝えることができないかについての透明性を重視しています。
本日より、世界中のAPI利用者は、対象モデルに対してテキスト透かしをオプトインできるようになります。APIにおいてテキスト透かしは引き続きデフォルトでオフです。
今後数週間にわたり、EU(欧州連合)内で対象となるChatGPTとCodexのテキスト出力に、目に見えないウォーターマークを追加します。
テキスト透かし検出ツールへのアクセス申請の受付を開始します。当初は、この技術の評価と改善に協力できる承認済みの研究者および専門組織に限定してアクセスを提供します。
上記はテキストの出所にのみ適用されます。音声および画像向けの当社の検証ツールを含む、当社の openai.com/verify ウェブツールと当社の コンテンツプロビナンスAPI(Content Provenance API)(新しいウィンドウで開きます), 引き続き、画像や音声ファイルが当社のシステムによって生成されたものかどうかを確認したい組織が公開的にアクセスできるようになります。
当社のウォーターマーキングの仕組みと性能
当社のテキスト透かし技術「textGrain」は、モデルの単語選択に目に見えない統計的シグナルを付与します。当社の検出器はそのシグナルを探し、文章にOpenAIの透かしが含まれているかどうかを判定します。textGrainの仕組みの詳細については、当社の 技術レポート(新しいウィンドウで開きます)今後数週間以内に追加の詳細を更新する予定です。また、他の人がこの技術を基に開発を進められるよう、オープンソースとして公開することも計画しています。
我々の評価において、textGrainは、テキスト向けのSynthIDを含む、テストした他のアプローチと同等かそれ以上の性能を示しました。それでも、理想的な条件下的での高い性能は、日常的な使用における信頼できる検出を保証するものではありません。
検出器には2種類の誤りがあり得ます。ウォーターマークが存在しないのに検出する誤検知(false positive)や、存在するウォーターマークを見逃す見逃し(false negative)です。以下の評価では、いくつかの課題を示します。
短いテキストや制約の多いテキストは、検出がより困難です。 偽陽性率を1%に設定した場合、私たちの検出器は、心理学などのコンテンツにおいて、200トークンの文章の約80%でウォーターマークを検出したのに対し、400トークンの文章では約95%を検出しました。数学などのコンテンツでは、語彙の選択の柔軟性が低いため、検出率は大幅に低くなりました。
翻訳: 編集によって透かしが弱まる場合があります。 400トークンの文章の評価では、単語の10%を同義語に置き換えることで検出率が約92%から66%に低下しました。単語の25%を置き換えると17%まで低下しました。
これらの制限により、当初のディテクターへのアクセスは、信頼性と責任ある使用の評価に協力してくれる承認された研究者や専門組織のみに限定するという判断になりました。
このチャートは、以下からの数学および心理学の質問に対するウォーターマーク付き応答の結果を示しています ELI5データセット(新しいウィンドウで開きます) 偽陽性率1%の目標値において。検出精度はテキスト長が長くなるほど向上しますが、数学のように語彙の選択の自由度が低いコンテンツでは全体として大幅に低くなります。
編集によってウォーターマーク信号は大幅に弱まる可能性があります。このチャートは、文章内の単語の10%または25%を置き換えた場合に検出にどのような影響が生じるかを示しています。結果は、以下からの質問に対するウォーターマーク付きの英語の回答に基づいています。 ELI5(新しいウィンドウで開きます).
ウォーターマーキングが出力品質に与える影響
最新のフロンティアモデルであるAstraの評価に使用しているベンチマーク全体を通じて、ウォーターマーキングの有無による意味のあるパフォーマンスの差は見られませんでした。
ベンチマーク | ウォーターマークなしテキスト(Astra、max) | ウォーターマークありテキスト(Astra、max) |
|---|---|---|
Artificial Analysis Intelligence Index | 49.57ポイント | 49.76ポイント |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
テキストウォーターマークが教えてくれないこと
テキストウォーターマークは、私たちのシステムがテキストの一部において果たした役割について限られたシグナルしか提供しません。検出結果から何が結論でき、何が結論できないのかを理解することが重要です。
ウォーターマークは人間の貢献を測定するものではありません。 ウォーターマークは、OpenAIのシステムがテキストの一部を生成または処理したことを示せる場合がありますが、そこにどれほどの人間の判断、編集、創造性が加わったかを示すことはできません。
ウォーターマークは所有権や責任を確定するものではありません。 ウォーターマークは、テキストの所有者が誰であるか、その利用が合法であったか、開示が必要であったか、誰が責任を負うのかを判定するものではありません。
ウォーターマークはユーザーを特定するものではありません。 ウォーターマークは、個人、組織、アカウント、プロンプト、会話とテキストを結び付けるものではありません。
ウォーターマークは正確性を検証するものではありません。 ウォーターマークは、テキストが真実か、誤解を招くか、有害か、適切な文脈で提示されているかを教えてくれるものではありません。
ウォーターマークが検出されなかったことは、人間の執筆であることの証明にはなりません。 OpenAIのツールで生成されたテキストは、短すぎる、編集されている、翻訳されているなどの理由で、検出が確実に機能しない場合があります。また、対応していないモデルによるもの、ウォーターマーク導入以前のもの、他社のツールによって生成されたものである可能性もあります。
私たちの次のステップ
EUにおけるテキストウォーターマークの展開。 今後数週間以内に、EU限定で、すべてのプランの対象となるChatGPTおよびCodexのユーザーにテキストウォーターマークを導入します。ローンチ時点でテキストウォーターマークを世界的なデフォルトにする予定はありません。この地域限定のアプローチにより、実際の利用とフィードバックから学ぶ余地を確保します。
API顧客向けのオプトイン式ウォーターマークの提供。 本日より、世界中のAPI顧客が、特定のモデルについてウォーターマーク付きのテキスト出力をオプトインで利用できるようになります。これにより、顧客はウォーターマークが自社の透明性の義務やユーザーに提供する体験にどのように適合するかを判断できます。また、今後数週間以内に、クラウドパートナーのサービスを通じてアクセスされるOpenAIモデルの出力に対してウォーターマークを利用できるよう、クラウドパートナーとも連携を進めています。
研究者および専門組織への検出ツールの提供。 承認された研究者および専門組織は、本日より 申請 できます。 実施基準(新しいウィンドウで開きます)に従い、当初はテキストの来歴の評価と改善を支援するため、ケースバイケースでアクセスを許可します。このツールは、OpenAIのウォーターマークを検出したかどうかを報告するものであり、ユーザーを特定したり、そのプロンプトや会話を明かしたりすることはありません。ウォーターマークの見逃しや誤検出のリスクを考慮し、ローンチ時点では一般公開は行いません。
技術、標準、エビデンスが進化するにつれて、このアプローチの各部分を見直していく予定です。
コンテンツの来歴に対する私たちのより広範なアプローチ
単一の来歴証明技術だけでは十分ではないため、私たちはオープンスタンダード、耐久性のあるウォーターマーク、検証ツールを組み合わせたレイヤードなアプローチを採用しています。
私たちは対応する画像出力にコンテンツクレデンシャルを追加しており、 C2PA準拠(新しいウィンドウで開きます)、不可視の埋め込み SynthID(新しいウィンドウで開きます) 対応する画像と音声へのウォーターマークの埋め込み、および画像と音声の検証機能を openai.com/verify および当社の Content Provenance API(新しいウィンドウで開きます)を通じて提供します。これらの技術は互いに補完し合います。Content Credentialsはファイルの出所と履歴を記録でき、一方、不可視のウォーターマークはメタデータが削除された場合でもシグナルを保持できます。
当社が 選挙保護対策で述べたように、プロビナンスは、ディープフェイクを含む誤解を招く可能性のあるAI生成コンテンツを、人々やプラットフォームが評価するのに役立ちます。当社はこれらのシグナルを、ポリシー、不正利用の検出、報告、調査、執行と組み合わせ、研究者、標準化団体、プラットフォーム、市民社会と連携して、プロビナンスがより広いエコシステム全体で有用になるよう取り組んでいます。
テキストへのプロビナンスの拡張には、テキストがいとも簡単に書き換え、翻訳、編集されてしまうことを考慮する必要があります。 6月に議論したように、当社のアプローチは現在の技術の実用的な限界を反映したものでなければなりません。当社は検出機能の改善を続け、ウォーターマークが編集や翻訳にどう耐えるかを研究し、AIの支援とAIによる執筆をより意味のある形で区別する方法を探っていきます。証拠、標準、規制要件の進展に応じてアプローチを適応させ、結果を責任を持って解釈できると判断した場合には、検出器へのアクセスを拡大します。
詳細については、当社の ヘルプセンターの記事(新しいウィンドウで開きます).
