En las próximas semanas, OpenAI comenzará a implementar un sistema de identificación invisible en los textos producidos por ChatGPT y Codex para aquellos que lo utilicen en la Unión Europea. Esta acción es una respuesta a los nuevos requerimientos de transparencia establecidos por la Ley de Inteligencia Artificial de la UE y permitirá, a través de instrumentos específicos, identificar si un contenido fue creado por sus modelos de IA.
El sistema actúa de manera distinta a una marca visible o a un aviso que se agrega al texto. Este funciona alterando levemente la selección de palabras hecha por el modelo. Estas modificaciones crean un patrón estadístico que no es perceptible para el lector, aunque puede ser identificado más adelante por un detector.
Una de las principales características del sistema es que la señal permanece integrada en el propio contenido. Por eso, OpenAI indica que se debe mantener cuando el texto se copia y pega en un documento o plataforma diferente. Además, de acuerdo con TechCrunch, la empresa garantiza que el mecanismo no es capaz de identificar qué usuario creó el contenido y que su activación no ha ocasionado modificaciones significativas en el desempeño de los modelos.
Un sistema basado en patrones estadísticos
La tecnología, denominada textGrain, ha sido desarrollada por OpenAI en colaboración con los expertos de las universidades de Yale y Pensilvania. La compañía ha publicado también cómo opera el sistema.
El método hace pequeños cambios en cómo el modelo escoge las palabras que constituyen una respuesta. Estas modificaciones se van sumando a lo largo del texto, hasta que se forma una huella estadística que un sistema de detección es capaz de identificar empleando una clave concreta.
El propósito no es que el lector tenga la posibilidad de reconocer a simple vista el contenido producido por IA, sino ofrecer a ciertos sistemas instrumentos adicionales para poder analizar su origen.
La edición humana puede dificultar la detección
Sin embargo, la tecnología no es infalible. Sus propias pruebas demuestran que realizar cambios relativamente menores en un texto puede disminuir significativamente la capacidad del detector para identificar la marca.
En uno de los experimentos llevados a cabo por la empresa, al reemplazar cerca del 10% de las palabras por sinónimos, el índice de detección disminuyó del 92% al 66%. El sistema también tiene más problemas con los textos cortos, las respuestas de matemáticas y el contenido traducido.
Por esta razón, OpenAI no planea ofrecer su detector de manera generalizada al principio. El acceso se limitará a investigadores y entidades con experiencia que tengan la capacidad de ayudar a determinar su confiabilidad y sus posibles aplicaciones.
La empresa insiste además, en que la falta de una marca no significa que un texto haya sido escrito por una persona. Un contenido puede no ser identificado porque sea demasiado breve, haya sido editado de manera significativa o proceda de un modelo de IA desarrollado por otra empresa.
La regulación europea impulsa el cambio
La decisión de OpenAI se encuentra dentro de las obligaciones de transparencia del AI Act, que comenzó a entrar en vigor el pasado 2 de agosto y establece regulaciones sobre contenidos generados o alterados con IA. El marco europeo estipula que ciertos contenidos producidos por la IA tienen que poder ser identificados a través de procedimientos técnicos.
OpenAI no es la única empresa que está progresando en esta línea. De acuerdo con TechCrunch, Anthropic ha declarado que también implementará un sistema marcado para los textos producidos por Claude, pero será a nivel mundial. Otras empresas tecnológicas importantes como Google, Meta y Microsoft, están igualmente comprometidas con el código europeo de buenas prácticas en cuanto a la transparencia de los contenidos producidos por IA.




