OpenAI SitemapAktualisiert

Unser Ansatz zu den EU-Regeln zur Textherkunft

Wie OpenAI mit Text-Watermarking unter EU-Regeln umgeht. Erfahren Sie, wo Wasserzeichen angewendet werden, wie die Erkennung funktioniert und warum der Zugang zunächst Forschern vorbehalten ist.

Bildquelle · OpenAI Sitemap

Content-Herkunft hilft Menschen zu verstehen, woher Inhalte stammen, wie sie erstellt oder bearbeitet wurden und ob sie Signale enthalten, die mit unseren Modellen in Verbindung stehen. Wir haben bereits Tools öffentlich verfügbar gemacht, um Bilder und Audioinhalte zu identifizieren, die von unseren Modellen erzeugt wurden. Heute teilen wir unseren Ansatz zum Text-Watermarking als Reaktion auf den EU AI Act und wie er in unsere breitere Arbeit passt.

Der EU AI Act verlangt von Anbietern generativer KI, generierten Text auf maschinenlesbare Weise identifizierbar zu machen. Text-Watermarking und -Erkennung sind noch frühe Technologien mit erheblichen Einschränkungen, und die Ansichten über ihre Vorteile und verantwortungsvollen Einsatzmöglichkeiten entwickeln sich noch. Unser gestufter Ansatz berücksichtigt sowohl die Anforderungen des EU AI Act als auch die Grenzen der Technologie, mit besonderem Augenmerk auf Transparenz darüber, was ein Text-Wasserzeichen Menschen sagen kann und was nicht:

  • Ab heute können API-Kunden weltweit Text-Watermarking für ausgewählte Modelle aktivieren. Text-Watermarking bleibt in der API standardmäßig deaktiviert.

  • In den kommenden Wochen werden wir ein unsichtbares Wasserzeichen zu berechtigten Textausgaben von ChatGPT und Codex in der Europäischen Union hinzufügen.

  • Wir öffnen die Antragsstellung für den Zugang zu unserem Text-Wasserzeichen-Detektor. Der Zugang wird zunächst auf genehmigte Forscher und Expertenorganisationen beschränkt, die uns bei der Evaluierung und Verbesserung der Technologie helfen können.

Wie unser Watermarking funktioniert und abschneidet

Unsere Text-Watermarking-Technologie, textGrain, fügt der Wortwahl des Modells ein unsichtbares statistisches Signal hinzu. Unser Detektor sucht nach diesem Signal, um einzuschätzen, ob ein Textabschnitt ein OpenAI-Wasserzeichen enthält. Weitere Einzelheiten zur Funktionsweise von textGrain finden Sie in unserem technischen Bericht⁠(öffnet sich in einem neuen Fenster), der in den kommenden Wochen um weitere Details ergänzt wird. Wir planen außerdem, die Technologie als Open Source verfügbar zu machen, damit andere darauf aufbauen können.

In unseren Auswertungen erreichte textGrain die Leistung anderer von uns getesteter Ansätze oder übertraf diese, einschließlich SynthID für Text. Dennoch garantiert starke Leistung unter idealen Bedingungen keine zuverlässige Erkennung im Alltag.

Detektoren können zwei Arten von Fehlern machen: Sie können ein Wasserzeichen melden, obwohl keines vorhanden ist – ein Falsch-Positiv – oder ein vorhandenes Wasserzeichen übersehen – ein Falsch-Negativ. Unsere folgenden Auswertungen veranschaulichen einige der Herausforderungen:

  • Kürzere oder stärker eingeschränkte Texte sind schwerer zu erkennen. Bei einer Ziel-Falsch-Positiv-Rate von 1 % identifizierte unser Detektor Wasserzeichen in etwa 80 % der 200-Token-Abschnitte, verglichen mit etwa 95 % der 400-Token-Abschnitte, bei Inhalten wie Psychologie. Die Erkennungsraten waren bei Inhalten wie Mathematik deutlich niedriger, wo die Wortwahl weniger Flexibilität bietet.

  • Bearbeitungen können das Wasserzeichen schwächen. In einer Auswertung von 400-Token-Abschnitten senkte das Ersetzen von 10 % der Wörter durch Synonyme die Erkennung von etwa 92 % auf 66 %. Das Ersetzen von 25 % der Wörter senkte sie auf 17 %.

Diese Einschränkungen tragen zu unserer Entscheidung bei, den anfänglichen Detektorzugang nur genehmigten Forschern und Expertenorganisationen zur Verfügung zu stellen, die uns bei der Bewertung der Zuverlässigkeit und verantwortungsvoller Einsatzmöglichkeiten helfen können.

Auswirkung von Textlänge und Texttyp auf die Erkennungsrate

Dieses Diagramm zeigt Ergebnisse für Wasserzeichen versehene Antworten auf Mathematik- und Psychologiefragen aus dem ELI5-Datensatz⁠(öffnet sich in einem neuen Fenster) bei einer Ziel-Falsch-Positiv-Rate von 1 %. Die Erkennung verbessert sich mit der Textlänge, ist aber insgesamt deutlich niedriger bei Inhalten, bei denen die Wortwahl weniger Flexibilität bietet, wie etwa Mathematik.

Auswirkung von Bearbeitungen auf die Erkennungsrate

Bearbeitungen können das Wasserzeichensignal erheblich schwächen. Dieses Diagramm zeigt, wie das Ersetzen von 10 % oder 25 % der Wörter in einem Abschnitt die Erkennung beeinflusst. Die Ergebnisse basieren auf Wasserzeichen versehenen englischen Antworten auf Fragen aus ELI5⁠(öffnet in einem neuen Fenster).

Auswirkung von Wasserzeichen auf die Ausgabequalität

Über alle Benchmarks, mit denen wir Astra, unser neuestes Frontier-Modell, bewerten, sehen wir keine bedeutsamen Leistungsunterschiede mit und ohne Wasserzeichen.

Benchmark

Unmarkierter Text (Astra, max)

Mit Wasserzeichen versehener Text (Astra, max)

Artificial Analysis Intelligence Index

49.57 Punkte

49.76 Punkte

AutomationBench

34.09%

34.86%

DeepSWE v1.1

72.80%

71.68%

Terminal-Bench 4.0

53.90%

56.06%

Terminal-Bench Science 0.1

56.90%

60.00%

BrowseComp

87.92%

87.35%

HealthBench Professional

64.27%

64.60%

GPQA Diamond

94.44%

93.94%

Was ein Text-Wasserzeichen nicht verrät

Text-Wasserzeichen liefern ein begrenztes Signal darüber, welche Rolle unsere Systeme bei einem Textabschnitt gespielt haben. Es ist wichtig zu verstehen, was aus einem Erkennungsergebnis geschlossen werden kann und was nicht.

  • Ein Wasserzeichen misst den menschlichen Beitrag nicht. Es kann anzeigen, dass ein OpenAI-System einen Teil eines Textabschnitts erzeugt oder verarbeitet hat, aber nicht, wie viel menschliches Urteilsvermögen, Bearbeitung oder Kreativität eingeflossen ist.

  • Ein Wasserzeichen begründet weder Eigentum noch Verantwortung. Es legt nicht fest, wem der Text gehört, ob seine Nutzung rechtmäßig war, ob eine Offenlegung erforderlich war oder wer dafür verantwortlich ist.

  • Ein Wasserzeichen identifiziert den Nutzer nicht. Es verknüpft den Text weder mit einer Person, einer Organisation, einem Konto, einer Eingabe (Prompt) noch mit einer Unterhaltung.

  • Ein Wasserzeichen überprüft die Richtigkeit nicht. Es sagt nicht aus, ob ein Textabschnitt wahr, irreführend, schädlich oder im richtigen Kontext dargestellt ist.

  • Das Fehlen eines erkannten Wasserzeichen beweist keine menschliche Verfasserschaft. Mit OpenAI-Tools generierter Text kann zu kurz, bearbeitet oder übersetzt sein, als dass die Erkennung zuverlässig funktionieren würde. Er kann auch von einem nicht unterstützten Modell stammen, vor der Einführung von Wasserzeichen entstanden sein oder mit Tools eines anderen Unternehmens erzeugt worden sein.

Unsere nächsten Schritte

  • Einführung von Text-Wasserzeichen in der EU. In den kommenden Wochen führen wir Text-Wasserzeichen für berechtigte ChatGPT- und Codex-Nutzer in allen Tarifen ausschließlich in der EU ein. Wir machen Text-Wasserzeichen zum Start nicht zum globalen Standard. Dieser regionale Ansatz gibt uns Raum, aus der praktischen Nutzung und dem Feedback zu lernen.

  • Aktivierung von Wasserzeichen auf Opt-in-Basis für API-Kunden. Ab heute können API-Kunden weltweit Opt-in für Wasserzeichen bei Textausgaben ausgewählter Modelle wählen. So können Kunden entscheiden, wie Wasserzeichen zu ihren Transparenzpflichten und den Erlebnissen, die sie ihren Nutzern bieten, passen. Wir arbeiten zudem mit Cloud-Partnern daran, Wasserzeichen in den kommenden Wochen für über ihre Dienste abgerufene OpenAI-Modellausgaben verfügbar zu machen.

  • Gewährung von Detector-Zugang für Forscher und Fachorganisationen. Zugelassene Forscher und Fachorganisationen können sich ab heute bewerben . Gemäß dem Code of Practice⁠(öffnet in einem neuen Fenster)wird der Zugang zunächst fallweise gewährt, um die Evaluierung und Verbesserung der Text-Herkunftsnachweise zu unterstützen. Das Tool meldet, ob es ein OpenAI-Wasserzeichen erkennt, ohne den Nutzer zu identifizieren oder dessen Eingaben oder Unterhaltungen preiszugeben. Angesichts des Risikos übersehener Wasserzeichen und falsch-positiver Ergebnisse machen wir es zum Start nicht öffentlich verfügbar.

Wir erwarten, jeden Teil dieses Ansatzes zu überprüfen, sobald sich Technologie, Standards und Erkenntnisse weiterentwickeln.

Unser umfassenderer Ansatz zur Herkunftsnachweisführung von Inhalten

Keine einzelne Herkunftsnachweis-Technik ist für sich allein ausreichend, daher verfolgen wir einen mehrschichtigen Ansatz, der offene Standards, dauerhafte Wasserzeichen und Verifizierungstools kombiniert.

Wir fügen Content Credentials zu unterstützten Bildausgaben hinzu und sind C2PA-konform⁠(öffnet in einem neuen Fenster), unsichtbar einbetten SynthID⁠(öffnet in einem neuen Fenster) Wasserzeichen in unterstützten Bildern und Audiodateien anbringen und die Überprüfung von Bildern und Audio bereitstellen über openai.com/verify⁠ und unsere Content Provenance API⁠(öffnet in einem neuen Fenster). Diese Techniken ergänzen sich gegenseitig: Content Credentials können Ursprung und Historie einer Datei dokumentieren, während unsichtbare Wasserzeichen ein Signal bewahren können, wenn Metadaten entfernt werden.

Wie wir in unserer Arbeit zu Schutzmaßnahmen für Wahlenbeschrieben haben, kann Provenienz Menschen und Plattformen dabei helfen, potenziell irreführende KI-generierte Inhalte, einschließlich Deepfakes, einzuschätzen. Wir kombinieren diese Signale mit Richtlinien, Missbrauchserkennung, Meldungen, Untersuchungen und Durchsetzungsmaßnahmen und arbeiten mit Forschenden, Standardisierungsgremien, Plattformen und der Zivilgesellschaft zusammen, um Provenienz im weiteren Ökosystem nützlich zu machen.

Die Ausweitung der Provenienz auf Text erfordert die Berücksichtigung der Tatsache, wie leicht er umgeschrieben, übersetzt oder bearbeitet werden kann. Wie wir im Junierörtert haben, muss unser Ansatz die praktischen Grenzen der aktuellen Technologie widerspiegeln. Wir werden die Erkennung weiter verbessern, untersuchen, wie Wasserzeichen Bearbeitungen und Übersetzungen standhalten, und Wege erkunden, um KI-Unterstützung sinnvoller von KI-Autorschaft zu unterscheiden. Wir werden unseren Ansatz anpassen, wenn sich Erkenntnisse, Standards und regulatorische Anforderungen weiterentwickeln, und den Detector-Zugang ausweiten, wenn wir glauben, dass Ergebnisse verantwortungsvoll interpretiert werden können.

Weitere Informationen finden Sie in unserem Hilfecenter-Artikel⁠(öffnet in einem neuen Fenster).

Originalquelle

OpenAI Sitemap

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten