La procedencia del contenido ayuda a las personas a entender de dónde proviene el contenido, cómo fue creado o editado y si contiene señales asociadas con nuestros modelos. Ya hemos puesto a disposición del público herramientas para identificar imágenes y audio generados por nuestros modelos. Hoy, compartimos nuestro enfoque sobre la marca de agua de texto en respuesta a la Ley de IA de la UE, y cómo se enmarca en nuestro trabajo más amplio.
La Ley de IA de la UE exige que los proveedores de IA generativa hagan que el texto generado sea identificable de forma legible por máquina. La marca de agua de texto y la detección siguen siendo tecnologías incipientes con limitaciones significativas, y las opiniones sobre sus beneficios y usos responsables aún están evolucionando. Nuestro enfoque por fases refleja tanto los requisitos de la Ley de IA de la UE como las limitaciones de la tecnología, con énfasis en la transparencia sobre lo que una marca de agua de texto puede y no puede decir a las personas:
A partir de hoy, los clientes de la API a nivel global podrán activar la marca de agua de texto para modelos seleccionados. La marca de agua de texto seguirá desactivada de forma predeterminada en la API.
En las próximas semanas, añadiremos una marca de agua invisible al texto generado por ChatGPT y Codex elegible en la Unión Europea.
Abrimos las solicitudes para acceder a nuestro detector de marcas de agua de texto. El acceso estará limitado inicialmente a investigadores aprobados y organizaciones expertas que puedan ayudarnos a evaluar y mejorar la tecnología.
Lo anterior solo se aplica a la procedencia de texto: nuestras herramientas de verificación para audio e imágenes, incluida nuestra openai.com/verify herramienta web y nuestra Content Provenance API(se abre en una nueva ventana), seguirán siendo de acceso público para las organizaciones que deseen saber si una imagen o un archivo de audio fue generado por uno de nuestros sistemas.
Cómo funciona nuestra marca de agua y cuál es su rendimiento
Nuestra tecnología de marca de agua de texto, textGrain, añade una señal estadística invisible a las elecciones de palabras del modelo. Nuestro detector busca esa señal para evaluar si un pasaje contiene una marca de agua de OpenAI. Se pueden encontrar más detalles sobre cómo funciona textGrain en nuestro informe técnico(se abre en una nueva ventana), que se actualizará con detalles adicionales en las próximas semanas. También planeamos poner la tecnología a disposición en código abierto para que otros puedan construir sobre ella.
En nuestras evaluaciones, textGrain igualó o superó el rendimiento de otros enfoques que probamos, incluido SynthID para texto. Aun así, un rendimiento sólido en condiciones ideales no garantiza una detección fiable en el uso cotidiano.
Los detectores pueden cometer dos tipos de errores: pueden informar de una marca de agua donde no hay ninguna, un falso positivo, o pasar por alto una marca de agua que sí está presente, un falso negativo. Nuestras evaluaciones a continuación ilustran algunos de los desafíos:
El texto más corto o más restringido es más difícil de detectar. Con una tasa de falsos positivos objetivo del 1%, nuestro detector identificó marcas de agua en aproximadamente el 80% de los pasajes de 200 tokens, en comparación con aproximadamente el 95% de los pasajes de 400 tokens, para contenido como psicología. Las tasas de detección fueron sustancialmente menores para contenido como matemáticas, donde hay menos flexibilidad en la elección de palabras.
La edición puede debilitar la marca de agua. En una evaluación de pasajes de 400 tokens, reemplazar el 10% de las palabras con sinónimos redujo la detección de aproximadamente el 92% al 66%. Reemplazar el 25% de las palabras la redujo al 17%.
Estas limitaciones contribuyen a nuestra decisión de proporcionar acceso inicial al detector solo a investigadores aprobados y organizaciones expertas, que pueden ayudarnos a evaluar la fiabilidad y los usos responsables.
Este gráfico muestra los resultados de respuestas con marca de agua a preguntas de matemáticas y psicología del conjunto de datos ELI5(se abre en una nueva ventana) con una tasa de falsos positivos objetivo del 1%. La detección mejora con la longitud del texto, pero es sustancialmente menor en general para el contenido donde hay menos flexibilidad en la elección de palabras, como las matemáticas.
La edición puede debilitar sustancialmente la señal de la marca de agua. Este gráfico muestra cómo reemplazar el 10% o el 25% de las palabras en un pasaje afecta la detección. Los resultados se basan en respuestas en inglés con marca de agua a preguntas de ELI5(se abre en una nueva ventana).
Impacto de la marca de agua en la calidad de la salida
En los puntos de referencia que utilizamos para evaluar Astra, nuestro último modelo frontera, no vemos diferencias de rendimiento significativas con y sin marca de agua.
Punto de referencia | Texto sin marca de agua (Astra, máx) | Texto con marca de agua (Astra, máx) |
|---|---|---|
Índice de Inteligencia de Artificial Analysis | 49.57 puntos | 49.76 puntos |
AutomationBench | 34.09% | 34.86% |
DeepSWE v1.1 | 72.80% | 71.68% |
Terminal-Bench 4.0 | 53.90% | 56.06% |
Terminal-Bench Science 0.1 | 56.90% | 60.00% |
BrowseComp | 87.92% | 87.35% |
HealthBench Professional | 64.27% | 64.60% |
GPQA Diamond | 94.44% | 93.94% |
Lo que una marca de agua de texto no te dice
Las marcas de agua de texto proporcionan una señal limitada sobre el papel que nuestros sistemas desempeñaron en un pasaje. Es importante entender qué se puede y qué no se puede concluir a partir de un resultado de detección.
Una marca de agua no mide la contribución humana. Puede indicar que un sistema de OpenAI generó o procesó parte de un pasaje, pero no cuánto criterio humano, edición o creatividad intervino en él.
Una marca de agua no establece propiedad ni responsabilidad. No determina quién es el dueño del texto, si su uso fue lawful, si se requería divulgación o quién es responsable de él.
Una marca de agua no identifica al usuario. No asocia a una persona, organización, cuenta, prompt o conversación con el texto.
Una marca de agua no verifica la exactitud. No te dice si un pasaje es verdadero, engañoso, dañino o presentado en el contexto adecuado.
La ausencia de una marca de agua detectada no prueba la autoría humana. El texto generado con herramientas de OpenAI puede ser demasiado corto, haber sido editado o traducido para que la detección funcione de manera fiable. También puede provenir de un modelo no compatible, ser anterior a la marca de agua o haber sido generado por las herramientas de otra empresa.
Nuestros próximos pasos
Implementando la marca de agua de texto en la UE. En las próximas semanas, presentaremos la marca de agua de texto para los usuarios elegibles de ChatGPT y Codex en todos los planes, solo en la UE. No convertiremos la marca de agua de texto en un valor predeterminado global en el lanzamiento. Este enfoque regional nos da margen para aprender del uso real y de los comentarios.
Habilitando la marca de agua opcional para clientes de la API. A partir de hoy, los clientes de la API de todo el mundo podrán optar por recibir salidas de texto con marca de agua para modelos seleccionados. Esto permite a los clientes decidir cómo se ajusta la marca de agua a sus obligaciones de transparencia y a las experiencias que ofrecen a los usuarios. También estamos trabajando con socios de la nube para que la marca de agua esté disponible para las salidas de los modelos de OpenAI a las que se accede a través de sus servicios en las próximas semanas.
Proporcionando acceso al detector a investigadores y organizaciones expertas. Los investigadores y organizaciones expertas aprobados pueden solicitar acceso a partir de hoy . De acuerdo con el Code of Practice(se abre en una nueva ventana), el acceso se otorgará inicialmente caso por caso para apoyar la evaluación y mejora de la procedencia del texto. La herramienta informará si detecta una marca de agua de OpenAI, sin identificar al usuario ni revelar sus prompts o conversaciones. Dado el riesgo de marcas de agua no detectadas y falsos positivos, no la pondremos a disposición del público en el lanzamiento.
Esperamos revisar cada parte de este enfoque a medida que evolucionen la tecnología, los estándares y la evidencia.
Nuestro enfoque más amplio sobre la procedencia del contenido
Ninguna técnica de procedencia es suficiente por sí sola, por lo que adoptamos un enfoque por capas que combina estándares abiertos, marcas de agua duraderas y herramientas de verificación.
Añadimos Content Credentials a las salidas de imágenes compatibles, somos C2PA conformant(se abre en una nueva ventana), e insertamos invisible SynthID(se abre en una nueva ventana) las marcas de agua en imágenes y audio compatibles, y poner a disposición la verificación de imágenes y audio a través de openai.com/verify y nuestra API de Procedencia de Contenido(se abre en una nueva ventana). Estas técnicas se complementan entre sí: Content Credentials puede registrar el origen y el historial de un archivo, mientras que las marcas de agua invisibles pueden preservar una señal cuando se eliminan los metadatos.
Como describimos en nuestro trabajo sobre salvaguardas electorales, la procedencia puede ayudar a las personas y a las plataformas a evaluar contenido potencialmente engañoso generado por IA, incluidos los deepfakes. Combinamos estas señales con políticas, detección de abusos, reportes, investigaciones y aplicación de las normas, y trabajamos con investigadores, organismos de estandarización, plataformas y la sociedad civil para que la procedencia sea útil en todo el ecosistema.
Extender la procedencia al texto requiere tener en cuenta la facilidad con la que puede ser reescrito, traducido o editado. Como discutimos en junio, nuestro enfoque debe reflejar los límites prácticos de la tecnología actual. Seguiremos mejorando la detección, estudiando cómo resisten las marcas de agua la edición y la traducción, y explorando maneras de distinguir de forma más significativa la asistencia de la IA de la autoría de la IA. Adaptaremos nuestro enfoque a medida que evolucionen las evidencias, los estándares y los requisitos regulatorios, y ampliaremos el acceso al detector cuando creamos que los resultados pueden interpretarse de manera responsable.
Para más información, visite nuestro artículo del centro de ayuda(se abre en una nueva ventana).
