OpenAI

EUのテキスト由来性ルールに対する私たちの取り組み

EUのルールに基づくテキスト透かしにOpenAIがどう取り組むかについて。透かしが適用される対象、検出の仕組み、そしてなぜアクセスが研究者から始まるのかをご紹介します。

画像の出典 · OpenAI

コンテンツの由来性 は、コンテンツがどこから来たのか、どのように作成・編集されたのか、そして当社のモデルに関連するシグナルが含まれているかどうかを人々が理解するのに役立ちます。当社はすでに、当社のモデルによって生成された画像や音声を特定するためのツールを一般公開しています。本日、EU AI Actへの対応としてテキスト透かしに対する当社の取り組み、およびそれがより広範な取り組みにどのように位置づけられるかを共有します。

EU AI Actは、生成AIプロバイダーに対し、生成されたテキストを機械可読な形で識別可能にすることを義務付けています。テキスト透かしと検出は依然として初期段階の技術であり、重大な制限があり、その利点と責任ある使用に関する見解もまだ発展途上です。私たちの段階的アプローチは、EU AI Actの要件と技術の限界の両方を反映したものであり、テキスト透かしが人々に何を伝えられ、何を伝えられないかについての透明性を重視しています。

  • 本日より、世界中のAPI顧客は、一部のモデルを対象にテキスト透かしをオプトインできるようになります。APIでは、テキスト透かしは引き続きデフォルトでオフになります。

  • 今後数週間にわたり、欧州連合内で対象となるChatGPTおよびCodexのテキスト出力に、目に見えない透かしを追加します。

  • テキスト透かし検出器へのアクセス申請の受付を開始します。当初のアクセスは、技術の評価と改善に協力してくれる承認された研究者や専門組織に限定されます。

    • 上記はテキストの由来性にのみ適用されます。音声および画像向けの当社の検証ツールには、 openai.com/verify⁠ ウェブツールや Content Provenance API⁠(新しいウィンドウで開きます)が含まれますが、これらは、画像や音声ファイルが当社のシステムによって生成されたものであるかを確認したい組織に対し、引き続き一般公開されます。

透かしの仕組みと性能

当社のテキスト透かし技術textGrainは、モデルの単語選択に目に見えない統計的シグナルを追加します。当社の検出器はそのシグナルを探し、その文章がOpenAIの透かしを含んでいるかどうかを評価します。textGrainの仕組みの詳細は、当社の 技術レポート⁠(新しいウィンドウで開きます)に記載されており、今後数週間にわたって追加の詳細で更新される予定です。また、他の人がこの技術を基に構築できるよう、オープンソースとして提供することも計画しています。

私たちの評価では、textGrainは、テキスト向けSynthIDを含むテストした他のアプローチと同等かそれ以上の性能を示しました。それでも、理想的な条件下での高い性能は、日常的な使用での信頼できる検出を保証するものではありません。

検出器には2種類の誤りがあります。透かしが存在しないのに透かしがあると報告する偽陽性(誤検出)と、存在する透かしを見逃す偽陰性(見逃し)です。以下の評価は、こうした課題の一部を示しています。

  • 短いテキストや制約の強いテキストほど検出が難しくなります。 目標の偽陽性率1%において、当社の検出器は200トークンの文章の約80%で透かしを識別したのに対し、心理学などのコンテンツでは400トークンの文章で約95%でした。数学などの単語選択の柔軟性が低いコンテンツでは、検出率は大幅に低くなりました。

  • 編集によって透かしが弱まる可能性があります。 400トークンの文章の評価では、単語の10%を類義語に置き換えることで、検出率が約92%から66%に低下しました。25%を置き換えると17%まで低下しました。

これらの限界が、初期の検出器アクセスを、信頼性と責任ある使用の評価に協力できる承認された研究者および専門組織のみに提供するという決定につながっています。

このグラフは、 ELI5データセット⁠(新しいウィンドウで開きます) の数学と心理学の質問に対する透かし付きの応答について、目標の偽陽性率1%での結果を示しています。検出率はテキストの長さとともに向上しますが、数学など単語選択の柔軟性が低いコンテンツでは全体として大幅に低くなります。

編集によって透かしシグナルは大幅に弱まる可能性があります。このグラフは、文章内の単語の10%または25%を置き換えることが検出にどのような影響を与えるかを示しています。結果は、 ELI5⁠(新しいウィンドウで開きます).

透かしが出力品質に与える影響

当社の最新フロンティアモデルであるAstraを評価するために使用するすべてのベンチマークにおいて、ウォーターマークの有無による意味のある性能差は見られませんでした。

ベンチマーク

ウォーターマークなしテキスト(Astra、最大)

ウォーターマークありテキスト(Astra、最大)

Artificial Analysis Intelligence Index

49.57ポイント

49.76ポイント

AutomationBench

34.09%

34.86%

DeepSWE v1.1

72.80%

71.68%

Terminal-Bench 4.0

53.90%

56.06%

Terminal-Bench Science 0.1

56.90%

60.00%

BrowseComp

87.92%

87.35%

HealthBench Professional

64.27%

64.60%

GPQA Diamond

94.44%

93.94%

テキスト透かしが教えてくれないこと

テキストのウォーターマークは、ある文章において私たちのシステムが果たした役割について限られたシグナルしか提供しません。検出結果から何が結論でき、何が結論できないのかを理解することが重要です。

  • ウォーターマークは人間の貢献度を測るものではありません。 OpenAIのシステムが文章の一部を生成または処理したことを示せる可能性はありますが、そこにどれだけの人間の判断、編集、創造性が加わったかは示せません。

  • 透かしは所有権や責任を証明するものではありません。 その文章は、誰がそのテキストを所有しているのか、その利用が合法だったのか、開示が必要だったのか、誰が責任を負うのかを決定するものではありません。

  • ウォーターマークはユーザーを特定するものではありません。 このテキストと人、組織、アカウント、プロンプト、または会話を関連付けることはありません。

  • ウォーターマークは正確性を保証するものではありません。 その文章が真実か、誤解を招くか、有害か、あるいは適切な文脈で提示されているかを教えてくれるものではありません。

  • ウォーターマークが検出されないことは、人間による作成であることを証明するものではない。 OpenAIのツールで生成されたテキストは、短すぎたり、編集・翻訳されていたりして、検出が正しく機能しない場合があります。また、サポートされていないモデルに由来する、ウォーターマーク導入前のものである、あるいは他社のツールによって生成されたものである可能性もあります。

私たちの次のステップ

  • EUでのテキスト透かしの展開。 今後数週間にわたり、EU地域のみで、対象となるChatGPTおよびCodexユーザーの全プランにテキスト透かしを導入します。提供開始時点でテキスト透かしをグローバルなデフォルト設定にする予定はありません。この地域限定のアプローチにより、実際の使用やフィードバックから学ぶ余裕を持たせています。

  • API顧客に対するオプトインの透かし(watermarking)機能を有効化する。 本日より、世界中のAPIユーザーが、一部のモデルについて透かし入りのテキスト出力をオプトインで利用できるようになります。これにより、ユーザーは透かしが透明性への義務や提供するユーザー体験にどのように適合するかを自ら判断できます。また、今後数週間のうちに、クラウドパートナーと連携し、そのサービスを通じてアクセスされるOpenAIモデルの出力にも透かしを利用できるように取り組んでいます。

  • 研究者や専門組織に検出装置へのアクセスを提供すること。 承認された研究者および専門組織は 適用 本日より。に従い、 行動規範(新しいウィンドウで開きます)これにより、テキストの出所評価と改善を支援するため、当初はケースバイケースでアクセスが許可されます。このツールは、OpenAIのウォーターマークを検出したかどうかを報告しますが、ユーザーを特定したり、プロンプトや会話を公開したりすることはありません。ウォーターマークの検出漏れや誤検出のリスクを考慮し、公開開始時点では一般には提供しません。

テクノロジー、標準、そしてエビデンスが進化するにつれて、このアプローチの各部分を見直していく予定です。

コンテンツの出どころに関する私たちのより広範なアプローチ

どの単一の来歴証明技術だけでは十分ではないため、私たちはオープン標準、耐久性のあるウォーターマーキング、検証ツールを組み合わせた多層的なアプローチを採用しています。

サポート対象の画像出力にContent Credentialsを追加しています。 C2PA準拠(新しいウィンドウで開きます)`, 見えない要素を埋め込む` SynthID(新しいウィンドウで開く) サポート対象の画像および音声に透かしを入れ、画像と音声の検証を openai.com/verify⁠ および当社の Content Provenance API(新しいウィンドウで開く)から利用できるようにします。これらの手法は互いに補完し合います。Content Credentials はファイルの出所と履歴を記録でき、一方で不可視の透かしはメタデータが削除された場合でもシグナルを保持できます。

当社が 選挙セーフガードの取り組みで述べたように、プロビナンスは、ディープフェイクを含む誤解を招くおそれのあるAI生成コンテンツを、人々やプラットフォームが評価するのに役立ちます。当社はこれらのシグナルを、ポリシー、不正利用の検出、報告、調査、執行と組み合わせ、さらに研究者、標準化団体、プラットフォーム、市民社会と連携して、プロビナンスがより広いエコシステム全体で有用になるよう取り組んでいます。

テキストへのプロビナンスの拡張には、テキストが容易に書き換え、翻訳、編集されうることを考慮する必要があります。 6月に述べたとおり、当社のアプローチは現在のテクノロジーの実用上の限界を反映しなければなりません。当社は引き続き、検出の改善、透かしが編集や翻訳に耐えるかどうかの研究、そしてAIの支援とAIによる執筆をより有意義に区別する方法の探求を進めていきます。エビデンス、標準、規制要件の進展に応じてアプローチを適応させ、結果を責任を持って解釈できると判断できるようになった際には、検出ツールへのアクセスを拡大していきます。

詳細については、当社の ヘルプセンターの記事(新しいウィンドウで開く).

原文の出典

OpenAI

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください