OpenAI

Unser Ansatz zu den EU-Regeln zur Text-Herkunft

Wie OpenAI mit Text-Watermarking unter EU-Regeln umgeht. Erfahren Sie, wo Wasserzeichen zum Einsatz kommen, wie die Erkennung funktioniert und warum der Zugriff zunächst Forschenden vorbehalten ist.

Bildquelle · OpenAI

Content provenance hilft Menschen zu verstehen, woher Inhalte stammen, wie sie erstellt oder bearbeitet wurden und ob sie Signale enthalten, die mit unseren Modellen in Verbindung stehen. Wir haben bereits Tools öffentlich verfügbar gemacht, um Bilder und Audioinhalte zu identifizieren, die von unseren Modellen generiert wurden. Heute teilen wir unseren Ansatz zum Text-Watermarking als Reaktion auf den EU AI Act und wie er in unsere breitere Arbeit eingebettet ist.

Der EU AI Act verpflichtet Anbieter generativer KI, generierten Text auf maschinenlesbare Weise identifizierbar zu machen. Text-Watermarking und -Erkennung sind weiterhin frühe Technologien mit erheblichen Einschränkungen, und die Ansichten zu ihren Vorteilen und verantwortungsvollen Einsatzmöglichkeiten entwickeln sich noch. Unser gestufter Ansatz berücksichtigt sowohl die Anforderungen des EU AI Act als auch die Grenzen der Technologie, mit besonderem Augenmerk auf Transparenz darüber, was ein Text-Wasserzeichen Menschen sagen kann und was nicht:

  • Ab heute können API-Kunden weltweit Text-Watermarking für ausgewählte Modelle aktivieren. Text-Watermarking bleibt in der API standardmäßig deaktiviert.

  • In den kommenden Wochen fügen wir in der Europäischen Union für geeignete Textausgaben von ChatGPT und Codex ein unsichtbares Wasserzeichen hinzu.

  • Wir öffnen die Bewerbungen für den Zugriff auf unseren Text-Wasserzeichen-Detektor. Der Zugriff wird zunächst auf zugelassene Forschende und Expertenorganisationen beschränkt sein, die uns bei der Evaluierung und Verbesserung der Technologie unterstützen können.

Wie unser Watermarking funktioniert und abschneidet

Unsere Text-Watermarking-Technologie, textGrain, fügt der Wortwahl des Modells ein unsichtbares statistisches Signal hinzu. Unser Detektor sucht nach diesem Signal, um einzuschätzen, ob ein Abschnitt ein OpenAI-Wasserzeichen enthält. Weitere Details zur Funktionsweise von textGrain finden Sie in unserem technischen Bericht⁠(öffnet sich in einem neuen Fenster), der in den kommenden Wochen um weitere Details ergänzt wird. Wir planen außerdem, die Technologie als Open Source verfügbar zu machen, damit andere darauf aufbauen können.

In unseren Evaluierungen erreichte textGrain die Leistung anderer von uns getesteter Ansätze oder übertraf sie, darunter SynthID für Text. Dennoch garantiert starke Leistung unter idealen Bedingungen keine zuverlässige Erkennung im Alltag.

Detektoren können zwei Arten von Fehlern machen: Sie können ein Wasserzeichen melden, obwohl keines vorhanden ist – ein falsch-positives Ergebnis –, oder ein vorhandenes Wasserzeichen übersehen – ein falsch-negatives Ergebnis. Unsere folgenden Evaluierungen veranschaulichen einige der Herausforderungen:

  • Kürzere oder stärker eingeschränkte Texte sind schwerer zu erkennen. Bei einer Ziel-Falsch-positiv-Rate von 1% identifizierte unser Detektor Wasserzeichen in etwa 80% der 200-Token-Abschnitte, verglichen mit etwa 95% der 400-Token-Abschnitte, bei Inhalten wie Psychologie. Die Erkennungsraten waren deutlich niedriger bei Inhalten wie Mathematik, wo die Wortwahl weniger Spielraum lässt.

  • Bearbeitungen können das Wasserzeichen schwächen. In einer Evaluierung von 400-Token-Abschnitten reduzierte das Ersetzen von 10% der Wörter durch Synonyme die Erkennung von etwa 92% auf 66%. Das Ersetzen von 25% der Wörter reduzierte sie auf 17%.

Diese Einschränkungen tragen zu unserer Entscheidung bei, den anfänglichen Detektorzugriff nur auf zugelassene Forschende und Expertenorganisationen zu beschränken, die uns bei der Bewertung der Zuverlässigkeit und verantwortungsvoller Einsatzmöglichkeiten helfen können.

Diese Grafik zeigt Ergebnisse für Wasserzeichen tragende Antworten auf Mathematik- und Psychologiefragen aus dem ELI5-Datensatz⁠(öffnet sich in einem neuen Fenster) bei einer Ziel-Falsch-positiv-Rate von 1%. Die Erkennung verbessert sich mit der Textlänge, ist aber insgesamt deutlich niedriger bei Inhalten, bei denen die Wortwahl weniger Spielraum lässt, wie Mathematik.

Bearbeitungen können das Wasserzeichensignal erheblich schwächen. Diese Grafik zeigt, wie sich das Ersetzen von 10% oder 25% der Wörter in einem Abschnitt auf die Erkennung auswirkt. Die Ergebnisse basieren auf Wasserzeichen tragenden englischen Antworten auf Fragen aus ELI5⁠(öffnet sich in einem neuen Fenster).

Auswirkungen des Watermarkings auf die Ausgabequalität

Über die Benchmarks hinweg, mit denen wir Astra, unser neuestes Frontier-Modell, bewerten, sehen wir keine wesentlichen Leistungsunterschiede mit und ohne Watermarking.

Benchmark

Unwatermarkierter Text (Astra, max)

Watermarkierter Text (Astra, max)

Artificial Analysis Intelligence Index

49.57 Punkte

49.76 Punkte

AutomationBench

34.09%

34.86%

DeepSWE v1.1

72.80%

71.68%

Terminal-Bench 4.0

53.90%

56.06%

Terminal-Bench Science 0.1

56.90%

60.00%

BrowseComp

87.92%

87.35%

HealthBench Professional

64.27%

64.60%

GPQA Diamond

94.44%

93.94%

Was ein Text-Wasserzeichen Ihnen nicht verrät

Textwasserzeichen liefern ein begrenztes Signal über die Rolle, die unsere Systeme bei einem Abschnitt gespielt haben. Es ist wichtig zu verstehen, was aus einem Erkennungsergebnis geschlossen werden kann und was nicht.

  • Ein Wasserzeichen misst den menschlichen Beitrag nicht. Es kann darauf hinweisen, dass ein OpenAI-System einen Teil eines Textabschnitts generiert oder verarbeitet hat, aber nicht, wie viel menschliches Urteilsvermögen, Bearbeitung oder Kreativität eingeflossen ist.

  • Ein Wasserzeichen begründet weder Eigentum noch Verantwortung. Es bestimmt nicht, wem der Text gehört, ob seine Nutzung rechtmäßig war, ob eine Offenlegung erforderlich war oder wer dafür verantwortlich ist.

  • Ein Wasserzeichen identifiziert den Nutzer nicht. Es ordnet weder einer Person, Organisation, einem Konto, einem Prompt noch einer Unterhaltung den Text zu.

  • Ein Wasserzeichen bestätigt keine Richtigkeit. Es sagt dir nicht, ob eine Passage wahr, irreführend, schädlich oder im richtigen Kontext dargestellt ist.

  • Das Fehlen eines erkannten Wasserzeichens beweist keine menschliche Urheberschaft. Mit OpenAI-Tools erzeugter Text kann zu kurz sein, bearbeitet oder übersetzt worden sein, sodass die Erkennung nicht zuverlässig funktioniert. Er kann auch von einem nicht unterstützten Modell stammen, vor der Einführung von Wasserzeichen entstanden sein oder mit den Tools eines anderen Unternehmens erzeugt worden sein.

Unsere nächsten Schritte

  • Einführung von Text-Wasserzeichen in der EU. In den kommenden Wochen führen wir Text-Watermarking für berechtigte ChatGPT- und Codex-Nutzer in allen Plänen ausschließlich in der EU ein. Wir machen Text-Watermarking zum Start nicht zu einem globalen Standard. Dieser regionale Ansatz gibt uns Raum, aus der tatsächlichen Nutzung und aus Feedback zu lernen.

  • Aktivierung der Opt-in-Wasserzeichenfunktion für API-Kunden. Ab heute können API-Kundinnen und -Kunden weltweit bei ausgewählten Modellen die Wasserzeichen-Funktion für Textausgaben aktivieren. Damit können Kunden entscheiden, wie die Wasserzeichen-Technologie zu ihren Transparenzpflichten und den Erfahrungen passt, die sie ihren Nutzern bieten. Wir arbeiten außerdem mit Cloud-Partnern daran, in den kommenden Wochen Wasserzeichen für OpenAI-Modellausgaben verfügbar zu machen, die über deren Dienste abgerufen werden.

  • Bereitstellung von Detector-Zugang für Forscher und Fachorganisationen. Zugelassene Forscher und Expertenorganisationen können anwenden ab heute. In Übereinstimmung mit dem Verhaltenskodex⁠(öffnet sich in einem neuen Fenster), der Zugang wird zunächst von Fall zu Fall gewährt, um die Bewertung und Verbesserung der Text-Herkunftsnachverfolgung zu unterstützen. Das Werkzeug wird berichten, ob es ein OpenAI-Wasserzeichen erkennt, ohne den Nutzer zu identifizieren oder dessen Prompts oder Unterhaltungen preiszugeben. Angesichts des Risikos übersehener Wasserzeichen und falsch positiver Ergebnisse werden wir es zum Start nicht öffentlich verfügbar machen.

Wir erwarten, dass wir jeden Teil dieses Ansatzes überprüfen werden, wenn sich die Technologie, Standards und Erkenntnisse weiterentwickeln.

Unser umfassenderer Ansatz zur Inhalts-Herkunft

Keine einzelne Provenienztechnik reicht für sich allein aus, daher verfolgen wir einen mehrschichtigen Ansatz, der offene Standards, dauerhafte Wasserzeichen und Verifizierungstools kombiniert.

Wir fügen Content Credentials zu unterstützten Bildausgaben hinzu, sind C2PA-konform⁠(öffnet sich in einem neuen Fenster), unsichtbar einbetten SynthID⁠(öffnet sich in einem neuen Fenster) Wasserzeichen in unterstützten Bildern und Audiodateien und stellen Bild- und Audioverifizierung über openai.com/verify⁠ und unsere Content Provenance API⁠(öffnet sich in einem neuen Fenster)bereit. Diese Verfahren ergänzen einander: Content Credentials können den Ursprung und die Geschichte einer Datei dokumentieren, während unsichtbare Wasserzeichen ein Signal bewahren können, wenn Metadaten entfernt werden.

Wie wir in unserer Arbeit zu Wahl Schutzmaßnahmenbeschrieben haben, kann Provenienz Menschen und Plattformen helfen, potenziell irreführende KI-generierte Inhalte, einschließlich Deepfakes, einzuschätzen. Wir kombinieren diese Signale mit Richtlinien, Missbrauchserkennung, Meldungen, Untersuchungen und Durchsetzung und arbeiten mit Forschern, Normungsgremien, Plattformen und der Zivilgesellschaft zusammen, um Provenienz im gesamten Ökosystem nützlich zu machen.

Die Ausweitung der Provenienz auf Text erfordert die Berücksichtigung, wie leicht er umgeschrieben, übersetzt oder bearbeitet werden kann. Wie wir im Junierörtert haben, muss unser Ansatz die praktischen Grenzen der aktuellen Technologie widerspiegeln. Wir werden die Erkennung weiter verbessern, untersuchen, wie Wasserzeichen Bearbeitungen und Übersetzungen überstehen, und Wege erkunden, um KI-Unterstützung sinnvoller von KI-Autorschaft zu unterscheiden. Wir werden unseren Ansatz anpassen, wenn sich Erkenntnisse, Standards und regulatorische Anforderungen weiterentwickeln, und den Zugang zu Detektoren erweitern, wenn wir davon ausgehen, dass die Ergebnisse verantwortungsvoll interpretiert werden können.

Weitere Informationen finden Sie in unserem Hilfe-Center-Artikel⁠(öffnet sich in einem neuen Fenster).

Originalquelle

OpenAI

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten