Anthropic ha comenzado a incorporar marcas de agua invisibles y detectables por máquinas en los textos generados por Claude, una medida que busca facilitar la identificación de contenido creado con inteligencia artificial. El sistema no altera visualmente los textos y está diseñado para acompañarlos incluso cuando el usuario los copia y pega en otra plataforma.
La decisión llega en un momento en el que las compañías de IA están buscando nuevas formas de demostrar el origen de los contenidos generados por sus modelos. También coincide con la entrada en vigor de nuevas obligaciones de transparencia de la Ley de Inteligencia Artificial de la Unión Europea, cuyo código de buenas prácticas contempla mecanismos para identificar contenido generado o manipulado mediante IA.
Una señal que el usuario no puede ver
La principal particularidad del sistema de Anthropic es que la marca no aparece como un aviso, etiqueta o texto añadido al documento.
En los modelos compatibles, Claude incorpora durante la generación una señal imperceptible directamente en el texto. Según Anthropic, esta marca no modifica el significado ni la legibilidad de las respuestas y puede mantenerse después de operaciones habituales como copiar y pegar.
La tecnología se aplica a nivel del propio modelo, por lo que no depende de que el usuario esté utilizando una determinada interfaz. La marca está presente en las respuestas generadas a través de los distintos productos y servicios compatibles de Anthropic, incluido el uso mediante API y determinadas plataformas de terceros.
Esto supone un cambio frente a los sistemas tradicionales de identificación de contenido de IA, que suelen analizar un texto una vez publicado e intentar determinar posteriormente si fue generado por un modelo.
También afecta a los archivos generados
Anthropic no se ha limitado al texto. Para los archivos compatibles, la compañía está incorporando metadatos de procedencia firmados digitalmente mediante el estándar C2PA, utilizado para registrar información sobre el origen y las modificaciones de determinados contenidos digitales.
El objetivo es crear diferentes capas de trazabilidad dependiendo del tipo de contenido:
- Texto: una marca de agua imperceptible integrada durante la generación.
- Archivos: metadatos de procedencia basados en C2PA.
- Detección: Anthropic prepara herramientas para que usuarios y terceros puedan comprobar estas señales.
La compañía todavía no ha publicado todos los detalles técnicos sobre cómo funciona su sistema de watermarking textual, aunque ha anunciado que proporcionará más información.
¿Se puede eliminar la marca?
Aquí aparece uno de los grandes interrogantes de esta tecnología.
Anthropic afirma que la señal puede sobrevivir al copiar y pegar y a determinadas modificaciones, pero eso no significa que sea imposible eliminarla. Cualquier sistema de marcas de agua debe enfrentarse a modificaciones suficientemente importantes del contenido y a intentos deliberados de ocultar su origen.
La propia investigación académica sobre watermarking de textos generados por grandes modelos señala que estas técnicas introducen señales estadísticas en la generación y que su resistencia frente a diferentes transformaciones continúa siendo un reto técnico.
Por eso, una marca de agua no debe interpretarse necesariamente como una prueba absoluta de que un texto concreto fue escrito íntegramente por una IA. Su utilidad depende tanto de la robustez del sistema como de la capacidad de las herramientas de detección para reconocer correctamente la señal.
La medida llega con la nueva regulación europea
El movimiento de Anthropic coincide con un momento especialmente relevante en Europa.
Las obligaciones de transparencia del AI Act están impulsando a los proveedores de inteligencia artificial a desarrollar mecanismos que permitan identificar contenidos generados artificialmente. La intención es facilitar que usuarios, plataformas y organismos puedan distinguir determinados contenidos sintéticos de aquellos creados por personas.
Anthropic está aplicando su sistema de forma global, no exclusivamente a los usuarios europeos. Esto permite a la compañía mantener un único sistema de procedencia para sus productos independientemente del mercado desde el que se utilicen.
Claude no es el único que busca identificar contenido de IA
La industria lleva meses avanzando hacia sistemas de procedencia más sofisticados.
OpenAI, por ejemplo, ha apostado por una combinación de Content Credentials, C2PA y marcas de agua como SynthID para determinados contenidos visuales, con el objetivo de proporcionar información verificable sobre su origen.
La diferencia en el caso de Anthropic está en que ahora el foco se sitúa también directamente sobre el texto generado por un modelo de lenguaje, un terreno especialmente complejo porque los textos pueden editarse, traducirse o reformularse con enorme facilidad.
El objetivo: saber de dónde sale un contenido
La decisión de Anthropic refleja un cambio importante en la industria de la IA. Durante los primeros años de la IA generativa, la prioridad estaba principalmente en conseguir que los modelos fueran capaces de producir textos, imágenes, código y otros contenidos cada vez mejores.
Ahora aparece un segundo problema: cómo saber qué contenidos proceden de esos modelos.
La proliferación de textos generados automáticamente hace cada vez más difícil distinguir entre creación humana, contenido asistido por IA y material producido completamente por un modelo. Las marcas de agua pretenden aportar una señal de procedencia que acompañe al contenido desde el momento de su creación.
Pero el sistema también plantea preguntas sobre privacidad, control y uso de la información. Una marca que permite identificar el origen de un texto podría resultar útil para combatir determinados usos engañosos de la IA, aunque también puede generar preocupación entre usuarios que utilizan estos modelos como herramientas de trabajo.
Por ahora, Anthropic está apostando por una solución invisible para el usuario pero potencialmente visible para las herramientas de detección. El verdadero desafío será comprobar hasta qué punto estas marcas pueden sobrevivir a las modificaciones habituales que experimenta un texto antes de llegar a Internet.



