Si creías que Claude Fable 5 o GPT-5.6 ya habían tocado techo, agárrate. Alibaba acaba de soltar un bombazo que no solo promete, sino que ha enseñado músculo haciendo lo que ninguna otra IA se había atrevido a intentar: programar sola durante 16 días seguidos sin perder el hilo. Hablamos de Qwen 3.8 Max, un modelo de 2,4 billones de parámetros que llega para reventar la carrera de la IA.
La criatura utiliza la arquitectura Mixture-of-Experts, que activa solo 95.000 millones de esos parámetros por cada petición para mantener la eficiencia sin sacrificar potencia. Además, admite un contexto de un millón de tokens y procesa texto, imágenes y vídeo en la misma conversación. Pero eso es casi lo de menos.
Lo que esconde este monstruo chino de 2,4 billones de parámetros
El verdadero salto está en la autonomía. Según la documentación oficial de Qwen, los ingenieros le pidieron desarrollar un proyecto de terminal llamado Oh My CLI. Durante 16 días, Qwen 3.8 Max generó 265 commits, 127 pull requests y resolvió 151 issues sin que un humano tocara el teclado.
En otro experimento aún más cafre, le encargaron replicar y mejorar un estudio académico sobre selección de datos para entrenar IA. La máquina trabajó sola cinco días, escribió 7.600 líneas de código y ejecutó 33 rondas de entrenamiento en GPU. Al final, superó los resultados originales con una mejora de 2,7 puntos en el exigente examen de matemáticas AIME24.
Las cifras son de locos y ponen a temblar a cualquier desarrollador.
16 días programando sin parar: así funciona un desarrollador fantasma
En los benchmarks que ha publicado Alibaba, el modelo se impone en siete pruebas de programación y en 36 de visión y multimodalidad frente a Claude Fable 5 y GPT-5.6 Sol. En Terminal Bench 2.1, que simula tareas reales de un dev, Qwen 3.8 Max saca 86,6 puntos, por encima de los 84,6 de Opus 4.8 y Fable 5.
Eso sí, no todo es perfecto. Claude Fable 5 sigue ganando en resolución de problemas de código reportados por desarrolladores y en FrontierSWE, con 80 frente a 67,7 puntos y 88.8 contra 73.5. Pero Qwen 3.8 Max contraataca en preguntas médicas complejas y conocimiento legal.
¿Supera de verdad a Claude y GPT-5.6, o es ruido chino?
Aquí empieza lo interesante. Alibaba no se ha limitado a mostrar tablas de laboratorio; ha prometido abrir el código la próxima semana en Hugging Face y ModelScope. Eso pone contra las cuerdas a OpenAI y Anthropic, que lidian con una oleada de modelos chinos cada vez más potentes y gratuitos. Para colmo, Qwen 3.8 Max ya está disponible en QwenCloud, así que cualquiera puede probarlo desde ya.
El dato clave no es si supera a Claude en una prueba concreta, sinó lo que representa. Un modelo de código abierto con esta autonomía puede cambiar las reglas del juego en startups, investigación y desarrollo de software. Es la primera vez que vemos a una IA tirarse medio mes programando sin descanso y con resultados repetibles.
El mayor terremoto no está en los puntos de benchmark, sinó en que un modelo así se abra en canal para que cualquiera lo use, lo modifique y lo mejore.
Hype-O-Meter
Nivel de hype: 9/10. Alibaba ha entregado un producto que suena a ciencia ficción pero con demos reales. La apertura del código y los resultados en programación autónoma son un zasca en toda regla a los modelos cerrados — aunque habrá que ver si mantiene el tipo fuera del laboratorio.
El resumen para vagos (TL;DR)
- 🎯 ¿Qué ha pasado? Alibaba ha lanzado Qwen 3.8 Max, una IA que programa sola durante 16 días.
- 🔥 ¿Por qué importa? Es de código abierto y ya compite con Claude y GPT-5.6, poniendo presión a los gigantes cerrados.
- 🤔 ¿Nos afecta o es solo un meme? Nos afecta: tener un desarrollador fantasma gratis puede acelerar la creación de software como nunca.



