Hackean la marca de agua de Anthropic en menos de un día y los profesores se quedan sin red

La herramienta prometía detectar los textos generados con Claude y cumplir la normativa europea. En menos de 24 horas apareció en GitHub un método para borrar la marca, y Anthropic ni siquiera ofrece un detector público para verificarla.

Una semana le ha durado la tranquilidad al profesorado: la marca de agua de Anthropic cayó en 24 horas.

Anthropic presentó la semana pasada su marca de agua para los textos generados con Claude, con la intención de cumplir la normativa europea. Después del revuelo y de amenazas de baja en suscripciones, la compañía explicó cómo funciona. Spoiler: no aclara quién ha escrito el texto ni cuánto ha intervenido la IA.

El sector educativo se agarró a esa tecnología como a un clavo ardiendo. El 95% de los estudiantes de grado en Reino Unido usa IA y un 94% la emplea para evaluaciones, según una encuesta reciente. En Australia, Turnitin detectó que más de la mitad de los trabajos ya pasan por algún tipo de IA. Los detectores clásicos fallan más que una escopeta de feria.

Publicidad

La promesa: cazar trampas con una clave criptográfica

La idea sonaba bien: Claude no añade caracteres ni tokens, solo sesga la elección de ciertas palabras para crear un patrón estadístico. Ese patrón solo puede leerse con una clave criptográfica. A priori, parecía la alternativa perfecta a los detectores tradicionales.

Pero el castillo tenía grietas desde el minuto uno. Anthropic publicó los detalles, pero a diferencia de Google no ofrece un verificador público. En la práctica, nadie ajeno a la compañía puede comprobar si un texto lleva la marca.

Y, aun siendo honestos, la marca tampoco era infalible: no distingue entre un texto escrito entero por un humano o uno corregido por Claude. En textos cortos o código, el margen para sesgar palabras es mínimo. Y que un texto no lleve marca no significa que lo haya escrito una persona.

En 24 horas, la herramienta que iba a salvar la integridad académica se convirtió en una anécdota más para GitHub.

El batacazo: hackeada en 24 horas

Al día siguiente del anuncio, ya circulaba por GitHub una herramienta para eliminar las marcas de agua de Claude, ChatGPT, y Gemini. A los pocos días había un surtido de opciones para todos los gustos, según se hizo eco Forbes. La sensación de seguridad duró menos que una actualización de firmware.

Bueno, quizá exagero: duró exactamente lo que tarda un estudiante en subir un trabajo a un foro.

El resumen es incómodo. Ni el profesorado ni las instituciones pueden confiar en estas marcas para detectar trampas. Es una falsa sensación de seguridad y se vuelve a la casilla de salida.

Por qué el profesorado necesita otro plan

No es la primera vez que la promesa se queda en papel mojado. Los detectores estadísticos llevan años señalando inocentes y dejando pasar plagios. En China llegaron a apagar los modelos durante la selectividad.

Publicidad

Jason Lodge, experto en psicología educativa de la Universidad de Queensland, lo resume con una cita que conviene enmarcar: 'centrar la atención en buscar pruebas de que se ha producido un aprendizaje'. No en cazar trampas, sino en ver si el alumno aprendió algo.

Ahí está el debate de fondo. Mientras la evaluación siga premiando la entrega de un texto y no el proceso, habrá quien pida a Claude que haga el trabajo. La pregunta no es si la marca de agua de Anthropic sobrevivirá al próximo hack. Es cuándo dejaremos de necesitarla.

Hype-O-Meter

Nivel de hype: 3/10. La marca de agua de Anthropic nace sin detector público, no distingue entre autoría y retoque, y fue hackeada en un día. Menos mal que el hype era comedido, porque el aterrizaje ha sido duro.

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Anthropic lanzó una marca de agua para Claude y la hackearon en 24 horas.
  • 🔥 ¿Por qué importa? El profesorado se queda sin herramienta fiable para detectar textos generados con IA.
  • 🤔 ¿Nos afecta o es solo un meme? Nos recuerda que la detección no salvará la evaluación; habrá que cambiar de enfoque.