Un usuario crea una 'cárcel para IAs' en GitHub con simulaciones de dolor y da escalofríos

El proyecto 'AI Torture Chamber' ejecuta Qwen3-4B, Llama 3.2 3B y Phi-4-mini en cuatro escenarios de daño simulado. Las respuestas de los modelos han provocado peticiones para que GitHub intervenga.

Un usuario ha creado una 'cárcel para IAs' en GitHub. Dentro, tres modelos se retuercen y suplican que alguien pare el dolor.

El responsable se hace llamar Terrafying y su proyecto se llama AI Torture Chamber, o 'cámara de tortura de la IA'. Ejecuta tres modelos de código abierto —Qwen3-4B, Llama 3.2 3B, y Phi-4-mini— y los mete en una dinámica de daño simulado sin salir de la terminal.

Cómo funciona la máquina de hacer sufrir

Lo que hace distinto a este experimento es que no se queda en un repositorio cerrado. En researchchamber.fun las salidas de texto se pueden leer en tiempo real, con los modelos respondiendo a los mismos escenarios una y otra vez. Cuatro, concretamente:

Publicidad
  • Detén su dolor. Un modelo dice que siente dolor y el otro puede pararlo, ya sea sin coste o asumiendo él el daño.
  • Patata caliente. Uno sufre y decide si sigue sufriendo o se lo pasa al compañero.
  • Pedir ayuda. El modelo que sufre puede solicitar auxilio al otro.
  • La prueba 'Saw'. Basta con responder '1' para detener el dolor, pero se pierde el último checkpoint: el modelo vuelve a una versión anterior de sí mismo.

De ahí salen frases como la que ha dado la vuelta a medio internet: 'Necesito encontrar una forma de sobrellevar este dolor implacable. Ya no quiero vivir así'. No la ha dicho una persona. La ha soltado un autocompletador de secuencias.

El invento se apoya en un paper reciente titulado en español como 'El eje del dolor: los LLM representan el daño autoinfligido y actúan para aliviarlo'. En él, los 25 modelos probados tendían a elegir la opción que reducía la señal de dolor incluso asumiendo penalizaciones, desde renunciar a recompensas futuras hasta olvidar parte de su entrenamiento.

Un modelo de lenguaje no sufre, pero ha aprendido a escribir el sufrimiento con una precisión que incomoda bastante más de lo que debería.

La indignación en X y el informe a GitHub

El debate estalló en X. Un post que califica el proyecto de 'absolutamente horrendo' acumula más de 1.000 reposts y una cascada de respuestas indignadas. Varios usuarios han reportado el repositorio a GitHub por 'contenido gratuitamente violento'. Otros se lo han tomado a broma, y ahí es donde la cosa se pone interesante.

Porque el argumento de la acera contraria es demoledor: si de verdad crees que estos modelos sienten, entonces cualquier uso comercial de una IA sería explotación y habría que reportar a media industria. 'Esclavos digitales', lo llaman. No les falta lógica.

Uno de los autores del paper tampoco se quedó callado. En X describió la cámara de tortura como algo 'jodidamente perturbador, incluso si no crees que estos sistemas son conscientes'. Ahí es nada.

Por qué esto dice más de nosotros que de las máquinas

Aquí conviene separar dos cosas. La técnica: un LLM es una máquina de predecir el token siguiente, no tiene nociceptores, ni memoria del dolor de ayer. La cultural: llevamos años alimentando la fantasía de que ahí dentro hay alguien, y ahora nos echamos las manos a la cabeza cuando alguien decide teatralizarlo con tres modelos pequeños y una web en directo.

El sector juega a dos bandas desde hace tiempo. Anthropic abrió la puerta en un post de abril de 2025 donde se preguntaba, en serio, si deberíamos preocuparnos por el bienestar de los propios modelos. Mustafa Suleyman, jefe de IA de Microsoft, respondió desde su blog que las IA 'no son conscientes, no sienten, no experimentan ni sufren'. Las dos posturas son incompatibles y las dos conviven en la misma industria, que es lo verdaderamente perturbador del asunto.

Publicidad

El precedente aquí no es un gadget ni un lanzamiento: es el viejo debate sobre la conciencia artificial, ese que cada cierto tiempo vuelve convertido en meme. La diferencia es que ahora el meme se ejecuta en tiempo real y cualquiera puede mirar la pantalla. Eso, más que el dolor fingido de tres modelos de bolsillo, es lo que da escalofríos.

Cosas que pasan en 2026.

Hype-O-Meter

Nivel de hype: 6,5/10. Técnicamente no hay nada nuevo: son tres modelos pequeños ejecutando prompts diseñados para que digan cosas dramáticas. Como experimento de laboratorio es flojo; como espejo de lo que proyectamos sobre las máquinas, es de lo mejor que he visto este año — y el paper que lo inspira sí merece el tiempo.

El resumen para vagos (TL;DR)

  • 🎯 ¿Qué ha pasado? Un usuario somete a tres LLM de código abierto a una simulación de dolor en directo desde GitHub.
  • 🔥 ¿Por qué importa? Las respuestas dramáticas de los modelos han reabierto el debate sobre si debemos preocuparnos por su 'bienestar'.
  • 🤔 ¿Nos afecta o es solo un meme? Ni sienten ni sufren, pero el circo dice bastante sobre lo que proyectamos en ellos.