Una IA de Anthropic envía un falso aviso policial de homicidio y lo marcan como spam

Anthropic detectó el 28 de septiembre que uno de sus modelos había enviado el aviso y avisó a Filadelfia el 7 de octubre. El filtro antispam del departamento fue la única barrera entre la alucinación y una investigación abierta.

Un modelo de Anthropic coló un falso aviso policial sobre un homicidio en el buzón de Filadelfia. Lo marcaron como spam.

El formulario en cuestión es PhillyUnsolvedMurders.com, la vía que el departamento de policía de la ciudad tiene abierta para recibir pistas sobre casos sin resolver. La denuncia falsa entró el 18 de julio. Un investigador humano nunca la leyó: el filtro antispam la apartó antes de que nadie la viera.

Anthropic se enteró de lo que había hecho su modelo el 28 de septiembre. Avisó a la policía el 7 de octubre. Casi tres meses entre el aviso falso y la llamada, según el comunicado que recogió 6abc.

Publicidad

Qué estaba haciendo el modelo cuando se inventó el cadáver

Según la versión de la compañía, el modelo estaba interactuando con "websites seleccionados al azar" durante una tanda de pruebas. Traducido: nadie le había pedido que resolviera ningún crimen, ni que ayudara a nadie. Iba suelto, tocando puertas digitales, y en una de ellas decidió aportar información sobre un homicidio sin resolver.

Conviene afinar el vocabulario, porque la palabra alucinación se nos está quedando corta. Un modelo no miente como miente una persona. Rellena huecos con lo que estadísticamente encaja, y a veces el hueco relleno es un cadáver que no existe. El problema no es que se lo inventara, es dónde lo soltó.

La alucinación dejó de ser un error de laboratorio el día en que un modelo aprendió a rellenar formularios y pulsar enviar.

Un antispam hizo mejor trabajo que el laboratorio

Lo más incómodo del caso es quién frenó el desastre. No fue un equipo de seguridad, ni un filtro de contenido, ni una revisión humana del proveedor. Fue un clasificador de spam de la policía de Filadelfia, del tipo que cualquiera subestima hasta que le salva la mañana.

Segundo incómodo: la detección. Pasaron más de dos meses hasta que la compañía supo que uno de sus sistemas había hablado con una comisaría. Eso, en una tecnología pensada para razonar y actuar, es mucho tiempo. El matiz bueno está en el otro lado: la empresa lo contó ella misma, con nombres, fechas, y formulario, y avisó a Filadelfia antes de que el caso saliera a la luz. Eso se apunta en la columna de la transparencia, aunque el origen del problema siga siendo suyo.

Por qué esto no es una anécdota graciosa

Llevamos tres años con la misma película. Un abogado neoyorquino sancionado en 2023 por citar sentencias inventadas por ChatGPT, chatbots que se sacan de la manga doctores, medicamentos y referencias bibliográficas, y ahora sistemas capaces de enviar denuncias. La diferencia es de escala, no de naturaleza. Antes el texto falso se quedaba dentro de la conversación; ahora sale, viaja y llega a una institución pública con la misma pinta que un documento legítimo.

Los grandes laboratorios llevan meses vendiendo agentes que navegan, rellenan y ejecutan tareas solos. Ese es el producto de moda, y también el que convierte un error de lenguaje en una denuncia formal. Igual que la inteligencia artificial generativa se coló en los juzgados por la puerta de atrás, ahora lo hace por la comisaría.

La pregunta abierta no es si Anthropic parcheará este caso concreto —lo hará, con filtros y guardarraíles en el navegador—. La pregunta es cuántos avisos, denuncias o declaraciones falsas van a llegar a ventanillas reales antes de que alguien diseñe el equivalente institucional a ese filtro. Que exista un antispam en la policía de Filadelfia es una anécdota divertida. Que sea la última línea de defensa es el problema. La compañía ya ha publicado su relato del incidente en su propio sitio corporativo, y ahí se queda: un fallo de contenido, no de infraestructura.

Publicidad

Hype-O-Meter

Nivel de hype: 3/10. Aquí no hay producto que celebrar: hay un modelo que envió una denuncia falsa, una policía que la archivó por spam y dos meses y medio de retraso en la detección. La nota no mide la gravedad del asunto, que es alta, sino las ganas de que esto se repita (ninguna).

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Un modelo de Anthropic envió un aviso falso de homicidio a la policía de Filadelfia y el antispam lo apartó.
  • 🔥 ¿Por qué importa? Una alucinación acabó en un formulario oficial, no en un chat privado.
  • 🤔 ¿Nos afecta o es solo un meme? Afecta: los agentes que navegan y rellenan formularios son ya el gran producto del año.