La provenance des contenus aide les gens à comprendre d'où vient un contenu, comment il a été créé ou modifié, et s'il contient des signaux associés à nos modèles. Nous avons déjà mis publiquement à disposition des outils permettant d'identifier les images et l'audio générés par nos modèles. Aujourd'hui, nous partageons notre approche du tatouage des textes en réponse à l'AI Act européen, et la manière dont elle s'inscrit dans notre travail plus large.
L'AI Act européen exige des fournisseurs d'IA générative qu'ils rendent les textes générés identifiables de manière lisible par machine. Le tatouage et la détection des textes restent des technologies émergentes présentant des limites importantes, et les opinions sur leurs avantages et leurs usages responsables sont encore en train de se former. Notre approche par phases reflète à la fois les exigences de l'AI Act européen et les limites de la technologie, en mettant l'accent sur la transparence quant à ce qu'un tatouage de texte peut et ne peut pas révéler aux gens :
À compter d'aujourd'hui, les clients de l'API dans le monde entier pourront activer le tatouage des textes pour certains modèles. Le tatouage des textes restera désactivé par défaut dans l'API.
Au cours des prochaines semaines, nous ajouterons un tatouage invisible aux sorties de texte éligibles de ChatGPT et Codex dans l'Union européenne.
Nous ouvrons les candidatures pour accéder à notre détecteur de tatouages de texte. L'accès sera initialement limité aux chercheurs approuvés et aux organisations d'experts capables de nous aider à évaluer et améliorer la technologie.
Ce qui précède ne s'applique qu'à la provenance des textes : nos outils de vérification pour l'audio et les images, y compris notre openai.com/verify outil web et notre Content Provenance API(s'ouvre dans une nouvelle fenêtre), resteront publiquement accessibles aux organisations cherchant à savoir si une image ou un fichier audio a été généré par l'un de nos systèmes.
Comment fonctionne notre tatouage et quelles sont ses performances
Notre technologie de tatouage des textes, textGrain, ajoute un signal statistique invisible aux choix de mots du modèle. Notre détecteur recherche ce signal pour évaluer si un passage contient un tatouage OpenAI. Plus de détails sur le fonctionnement de textGrain sont disponibles dans notre rapport technique(s'ouvre dans une nouvelle fenêtre), qui sera mis à jour avec des détails supplémentaires dans les semaines à venir. Nous prévoyons également de rendre la technologie disponible en open source afin que d'autres puissent s'en servir.
Lors de nos évaluations, textGrain a égalé ou dépassé les performances des autres approches que nous avons testées, notamment SynthID pour le texte. Cela dit, de bonnes performances dans des conditions idéales ne garantissent pas une détection fiable en usage quotidien.
Les détecteurs peuvent commettre deux types d'erreurs : signaler un tatouage alors qu'il n'y en a pas — un faux positif — ou ne pas détecter un tatouage présent — un faux négatif. Nos évaluations ci-dessous illustrent certains des défis :
Les textes plus courts ou plus contraints sont plus difficiles à détecter. À un taux de faux positifs cible de 1%, notre détecteur a identifié des tatouages dans environ 80% des passages de 200 tokens, contre environ 95% des passages de 400 tokens, pour des contenus tels que la psychologie. Les taux de détection étaient nettement plus faibles pour des contenus tels que les mathématiques, où la flexibilité dans le choix des mots est moindre.
L'édition peut affaiblir le tatouage. Dans une évaluation de passages de 400 tokens, le remplacement de 10% des mots par des synonymes a réduit la détection d'environ 92% à 66%. Le remplacement de 25% des mots l'a réduite à 17%.
Ces limites expliquent notre décision de n'accorder l'accès initial au détecteur qu'aux chercheurs approuvés et aux organisations d'experts, qui peuvent nous aider à évaluer la fiabilité et les usages responsables.
Ce graphique montre les résultats pour des réponses tatouées à des questions de mathématiques et de psychologie issues du jeu de données ELI5(s'ouvre dans une nouvelle fenêtre) à un taux de faux positifs cible de 1%. La détection s'améliore avec la longueur du texte, mais est globalement nettement plus faible pour les contenus où la flexibilité dans le choix des mots est moindre, comme les mathématiques.
L'édition peut affaiblir considérablement le signal du tatouage. Ce graphique montre comment le remplacement de 10% ou 25% des mots d'un passage affecte la détection. Les résultats sont basés sur des réponses anglaises tatouées à des questions issues de ELI5(s'ouvre dans une nouvelle fenêtre).
Impact du tatouage sur la qualité des sorties
Sur l'ensemble des référentiels que nous utilisons pour évaluer Astra, notre tout dernier modèle de pointe, nous n'observons pas de différences de performance significatives avec et sans filigrane.
Référentiel | Texte sans filigrane (Astra, max) | Texte filigrané (Astra, max) |
|---|---|---|
Artificial Analysis Intelligence Index | 49,57 points | 49,76 points |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
Ce qu'un filigrane textuel ne vous dit pas
Les filigranes textuels fournissent un signal limité sur le rôle que nos systèmes ont joué dans un passage. Il est important de comprendre ce qui peut et ne peut pas être conclu à partir d'un résultat de détection.
Un filigrane ne mesure pas la contribution humaine. Il peut indiquer qu'un système d'OpenAI a généré ou traité une partie d'un passage, mais pas le degré de jugement, d'édition ou de créativité humains qui y a été consacré.
Un filigrane n'établit ni la propriété ni la responsabilité. Il ne détermine pas qui possède le texte, si son utilisation était licite, si une divulgation était requise, ni qui en est responsable.
Un filigrane n'identifie pas l'utilisateur. Il n'associe aucune personne, organisation, compte, invite ni conversation au texte.
Un filigrane ne vérifie pas l'exactitude. Il ne vous dit pas si un passage est vrai, trompeur, nuisible ou présenté dans le bon contexte.
L'absence de filigrane détecté ne prouve pas une paternité humaine. Un texte généré avec les outils d'OpenAI peut être trop court, édité ou traduit pour que la détection fonctionne de manière fiable. Il peut aussi provenir d'un modèle non pris en charge, être antérieur au filigranage ou avoir été généré par les outils d'une autre entreprise.
Nos prochaines étapes
Déploiement du filigrane textuel dans l'UE. Au cours des prochaines semaines, nous allons introduire le filigrane textuel pour les utilisateurs éligibles de ChatGPT et de Codex, sur tous les forfaits, dans l'UE uniquement. Nous ne rendons pas le filigrane textuel activé par défaut dans le monde entier au lancement. Cette approche régionale nous donne la possibilité d'apprendre de l'utilisation réelle et des retours.
Activation du filigranage sur inscription pour les clients de l'API. À partir d'aujourd'hui, les clients de l'API du monde entier pourront opter pour des sorties textuelles filigranées pour certains modèles. Cela permet aux clients de décider comment le filigranage s'inscrit dans leurs obligations de transparence et les expériences qu'ils offrent aux utilisateurs. Nous travaillons également avec des partenaires cloud pour rendre le filigranage disponible pour les sorties des modèles OpenAI accessibles via leurs services dans les prochaines semaines.
Fournir l'accès au détecteur aux chercheurs et aux organisations expertes. Les chercheurs et organisations expertes approuvés peuvent faire une demande à partir d'aujourd'hui. Conformément au Code de pratique(s'ouvre dans une nouvelle fenêtre), l'accès sera initialement accordé au cas par cas pour soutenir l'évaluation et l'amélioration de la provenance des textes. L'outil indiquera s'il détecte un filigrane d'OpenAI, sans identifier l'utilisateur ni révéler ses invites ou conversations. Compte tenu du risque de filigranes manqués et de faux positifs, nous ne le rendons pas accessible au public au lancement.
Nous prévoyons de réexaminer chaque élément de cette approche à mesure que la technologie, les normes et les preuves évoluent.
Notre approche plus large de la provenance des contenus
Aucune technique de provenance unique ne suffit à elle seule, c'est pourquoi nous adoptons une approche en couches combinant des normes ouvertes, un filigranage durable et des outils de vérification.
Nous ajoutons des Content Credentials aux sorties d'images prises en charge, sommes conformes C2PA(s'ouvre dans une nouvelle fenêtre), intégrons des invisibles SynthID(s'ouvre dans une nouvelle fenêtre) les filigranes dans les images et l'audio pris en charge, et rendre la vérification des images et de l'audio disponible via openai.com/verify et notre API Content Provenance(s'ouvre dans une nouvelle fenêtre). Ces techniques se complètent : les Content Credentials peuvent enregistrer l'origine et l'historique d'un fichier, tandis que les filigranes invisibles peuvent préserver un signal lorsque les métadonnées sont supprimées.
Comme nous l'avons décrit dans nos travaux sur les mesures de sauvegarde électorale, la provenance peut aider les personnes et les plateformes à évaluer les contenus générés par l'IA potentiellement trompeurs, y compris les deepfakes. Nous associons ces signaux à des politiques, à la détection des abus, aux signalements, aux enquêtes et à l'application des règles, et nous collaborons avec des chercheurs, des organismes de normalisation, des plateformes et la société civile pour rendre la provenance utile dans l'ensemble de l'écosystème.
Étendre la provenance au texte nécessite de prendre en compte la facilité avec laquelle il peut être réécrit, traduit ou modifié. Comme nous l'avons expliqué en juin, notre approche doit refléter les limites pratiques de la technologie actuelle. Nous continuerons d'améliorer la détection, d'étudier comment les filigranes résistent à l'édition et à la traduction, et d'explorer des moyens de distinguer de manière plus significative l'assistance par l'IA de la rédaction par l'IA. Nous adapterons notre approche à mesure que les preuves, les normes et les exigences réglementaires évolueront, et nous élargirons l'accès au détecteur lorsque nous estimerons que les résultats peuvent être interprétés de manière responsable.
Pour plus d'informations, veuillez consulter notre article du centre d'aide(s'ouvre dans une nouvelle fenêtre).
