La procedencia del contenido ayuda a las personas a entender de dónde proviene un contenido, cómo fue creado o editado, y si contiene señales asociadas con nuestros modelos. Ya hemos puesto a disposición del público herramientas para identificar imágenes y audio generados por nuestros modelos. Hoy compartimos nuestro enfoque sobre la marca de agua de textos en respuesta a la Ley de IA de la UE, y cómo se integra en nuestro trabajo más amplio.
La Ley de IA de la UE exige que los proveedores de IA generativa hagan que el texto generado sea identificable de forma legible por máquina. La marca de agua de textos y la detección siguen siendo tecnologías incipientes con limitaciones significativas, y las opiniones sobre sus beneficios y usos responsables aún están en desarrollo. Nuestro enfoque por fases refleja tanto los requisitos de la Ley de IA de la UE como las limitaciones de la tecnología, con énfasis en la transparencia sobre lo que una marca de agua de texto puede y no puede decir a las personas:
A partir de hoy, los clientes de la API a nivel mundial podrán optar por activar la marca de agua de textos para modelos seleccionados. La marca de agua de textos permanecerá desactivada de forma predeterminada en la API.
En las próximas semanas, añadiremos una marca de agua invisible a la salida de texto elegible de ChatGPT y Codex en la Unión Europea.
Estamos abriendo solicitudes para acceder a nuestro detector de marcas de agua de textos. El acceso estará inicialmente limitado a investigadores aprobados y organizaciones expertas que puedan ayudarnos a evaluar y mejorar la tecnología.
Lo anterior solo aplica a la procedencia de textos: nuestras herramientas de verificación de audio e imágenes, incluida nuestra openai.com/verify herramienta web y nuestra Content Provenance API(se abre en una nueva ventana), seguirán siendo de acceso público para las organizaciones que busquen entender si una imagen o un archivo de audio fue generado por uno de nuestros sistemas.
Cómo funciona y rinde nuestra marca de agua
Nuestra tecnología de marca de agua de textos, textGrain, añade una señal estadística invisible a las elecciones de palabras del modelo. Nuestro detector busca esa señal para evaluar si un pasaje contiene una marca de agua de OpenAI. Más detalles sobre cómo funciona textGrain pueden encontrarse en nuestro informe técnico(se abre en una nueva ventana), que se actualizará con detalles adicionales en las próximas semanas. También planeamos poner la tecnología a disposición en código abierto para que otros puedan desarrollarla.
En nuestras evaluaciones, textGrain igualó o superó el rendimiento de otros enfoques que probamos, incluido SynthID para texto. Aun así, un rendimiento sólido en condiciones ideales no garantiza una detección fiable en el uso cotidiano.
Los detectores pueden cometer dos tipos de errores: pueden reportar una marca de agua donde no la hay —un falso positivo— o pasar por alto una marca de agua que sí está presente —un falso negativo. Nuestras evaluaciones a continuación ilustran algunos de los desafíos:
El texto más corto o más restringido es más difícil de detectar. Con una tasa de falsos positivos objetivo del 1%, nuestro detector identificó marcas de agua en aproximadamente el 80% de los pasajes de 200 tokens, en comparación con aproximadamente el 95% de los pasajes de 400 tokens, para contenido como psicología. Las tasas de detección fueron sustancialmente menores para contenido como matemáticas, donde hay menos flexibilidad en la elección de palabras.
La edición puede debilitar la marca de agua. En una evaluación de pasajes de 400 tokens, reemplazar el 10% de las palabras con sinónimos redujo la detección de aproximadamente el 92% al 66%. Reemplazar el 25% de las palabras la redujo al 17%.
Estas limitaciones contribuyen a nuestra decisión de proporcionar el acceso inicial al detector solo a investigadores aprobados y organizaciones expertas, que pueden ayudarnos a evaluar la fiabilidad y los usos responsables.
Este gráfico muestra los resultados de respuestas con marca de agua a preguntas de matemáticas y psicología del conjunto de datos ELI5(se abre en una nueva ventana) con una tasa de falsos positivos objetivo del 1%. La detección mejora con la longitud del texto, pero es sustancialmente menor en general para el contenido donde hay menos flexibilidad en la elección de palabras, como las matemáticas.
La edición puede debilitar sustancialmente la señal de la marca de agua. Este gráfico muestra cómo reemplazar el 10% o el 25% de las palabras en un pasaje afecta la detección. Los resultados se basan en respuestas en inglés con marca de agua a preguntas de ELI5(se abre en una nueva ventana).
Impacto de la marca de agua en la calidad de la salida
En los benchmarks que utilizamos para evaluar Astra, nuestro último modelo de frontera, no observamos diferencias de rendimiento significativas con y sin marca de agua.
Benchmark | Texto sin marca de agua (Astra, max) | Texto con marca de agua (Astra, max) |
|---|---|---|
Artificial Analysis Intelligence Index | 49.57 puntos | 49.76 puntos |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
Lo que una marca de agua de texto no te dice
Las marcas de agua de texto proporcionan una señal limitada sobre el papel que desempeñaron nuestros sistemas en un pasaje. Es importante entender qué se puede y qué no se puede concluir a partir de un resultado de detección.
Una marca de agua no mide la contribución humana. Puede indicar que un sistema de OpenAI generó o procesó parte de un pasaje, pero no cuánto juicio, edición o creatividad humanos intervinieron en él.
Una marca de agua no establece la propiedad ni la responsabilidad. No determina quién es el propietario del texto, si su uso fue lícito, si era necesaria una divulgación ni quién es responsable de él.
Una marca de agua no identifica al usuario. No asocia a ninguna persona, organización, cuenta, prompt ni conversación con el texto.
Una marca de agua no verifica la exactitud. No te dice si un pasaje es veraz, engañoso, dañino o está presentado en el contexto adecuado.
La ausencia de una marca de agua detectada no demuestra autoría humana. Los textos generados con herramientas de OpenAI pueden ser demasiado cortos, estar editados o traducidos para que la detección funcione de manera fiable. También pueden proceder de un modelo no compatible, ser anteriores a la marcación con marcas de agua o haber sido generados por herramientas de otra empresa.
Nuestros próximos pasos
Implementación de la marcación de texto con marcas de agua en la UE. En las próximas semanas, introduciremos las marcas de agua de texto para los usuarios elegibles de ChatGPT y Codex de todos los planes únicamente en la UE. No convertiremos las marcas de agua de texto en un valor predeterminado global en el lanzamiento. Este enfoque regional nos da margen para aprender del uso y los comentarios del mundo real.
Habilitación de marcas de agua opcionales para los clientes de la API. A partir de hoy, los clientes de la API de todo el mundo podrán optar por generar salidas de texto con marca de agua para determinados modelos. Esto permite a los clientes decidir cómo se ajusta la marcación con marcas de agua a sus obligaciones de transparencia y a las experiencias que ofrecen a los usuarios. También estamos trabajando con socios de nube para que la marcación con marcas de agua esté disponible para las salidas de los modelos de OpenAI a las que se accede a través de sus servicios en las próximas semanas.
Proporcionar acceso al detector a investigadores y organizaciones de expertos. Los investigadores y las organizaciones de expertos aprobados pueden solicitar acceso a partir de hoy. De conformidad con el Código de buenas prácticas(se abre en una ventana nueva), el acceso se otorgará inicialmente caso por caso para apoyar la evaluación y la mejora de la procedencia del texto. La herramienta informará si detecta una marca de agua de OpenAI, sin identificar al usuario ni revelar sus prompts o conversaciones. Dado el riesgo de marcas de agua no detectadas y de falsos positivos, no la pondremos a disposición del público en el lanzamiento.
Prevemos revisar cada parte de este enfoque a medida que evolucionen la tecnología, las normas y la evidencia.
Nuestro enfoque más amplio sobre la procedencia del contenido
Ninguna técnica de procedencia basta por sí sola, por lo que adoptamos un enfoque por capas que combina estándares abiertos, marcas de agua duraderas y herramientas de verificación.
Añadimos Content Credentials a las salidas de imagen compatibles y cumplimos la conformidad con C2PA(se abre en una nueva ventana), incrustar invisible SynthID(se abre en una nueva ventana) marcas de agua en imágenes y audio compatibles, y poner la verificación de imágenes y audio a disposición a través de openai.com/verify y nuestra API de procedencia de contenido(se abre en una nueva ventana). Estas técnicas se complementan entre sí: las credenciales de contenido pueden registrar el origen y el historial de un archivo, mientras que las marcas de agua invisibles pueden preservar una señal cuando se eliminan los metadatos.
Como describimos en nuestro trabajo sobre salvaguardas electorales, la procedencia puede ayudar a las personas y las plataformas a evaluar contenido potencialmente engañoso generado por IA, incluidos los deepfakes. Combinamos estas señales con políticas, detección de abusos, reportes, investigaciones y cumplimiento, y trabajamos con investigadores, organismos de normalización, plataformas y la sociedad civil para que la procedencia sea útil en todo el ecosistema.
Extender la procedencia al texto requiere tener en cuenta la facilidad con la que puede reescribirse, traducirse o editarse. Como discutimos en junio, nuestro enfoque debe reflejar los límites prácticos de la tecnología actual. Seguiremos mejorando la detección, estudiando cómo resisten las marcas de agua la edición y la traducción, y explorando formas de distinguir de manera más significativa la asistencia de la IA de la autoría de la IA. Adaptaremos nuestro enfoque a medida que evolucionen la evidencia, los estándares y los requisitos regulatorios, y ampliaremos el acceso al detector cuando consideremos que los resultados pueden interpretarse de manera responsable.
Para más información, por favor visite nuestro artículo del centro de ayuda(se abre en una nueva ventana).
