DeepSeek da otro puñetazo: visión multimodal gratis y un rendimiento que, según sus creadores, roza Claude Opus 4.8.
Qué hace exactamente este experimento visual
La protagonista es DeepSeek-V4-Flash-Vision-Exp, una variante experimental del V4 Flash que debutó hace unos meses. La diferencia no es menor: ahora procesa contenido visual, algo que hasta la fecha solo hacía la familia DeepSeek-VL. Y sí, suena a nombre de modelo imposible de pronunciar.
Según la cuenta oficial de DeepSeek en X, el modelo conserva el nivel de razonamiento y conocimiento general de la versión de solo texto. Hereda además las capacidades de agente: interpreta imágenes y ejecuta tareas sin supervisión constante. Justo ahí, aseguran, se acerca al rendimiento de Opus 4.8, el buque insignia de Anthropic.
La parte jugosa es el precio. DeepSeek mantiene el mismo esquema de tarifas del V4 Flash de texto, así que añadir visión no cuesta ni un céntimo extra. Claude y ChatGPT ya tienen visión avanzada, sí, pero a un coste bastante distinto.
El acceso llega a través de la API de DeepSeek. Admite entradas mixtas de texto e imagen en base64, por URLs externas o mediante la API de archivos que lanzaron junto al modelo. La plataforma tokeniza las imágenes para facturación, con un máximo de 384 tokens por archivo.
Y aquí vienen los límites: JPEG, PNG, GIF y WebP, con 8192 píxeles por lado como tope y entre 32 y 64 MiB según el método de envío. Puede procesar hasta 600 imágenes por petición. Antes de la inferencia, redimensiona cada imagen a una escala de 800 x 800 píxeles.
El verdadero golpe no es la visión, es que no cobren un céntimo más por activarla.
Por qué esto incomoda a Anthropic
Que Claude Opus 4.8 siga siendo la referencia no es noticia. Que una versión experimental china se acerque y encima sea gratis, eso ya es otra conversación. La visión multimodal abre casos de uso de agente muy jugosos: leer capturas, interpretar diagramas, automatizar flujos con contexto visual. Casi nada.
El modelo funciona con los principales frameworks de agentes del mercado, según la documentación. Eso significa que no solo sirve para chatear con capturas: entra en flujos automatizados, consulta documentos visuales y responde con razonamiento integrado en la misma llamada. Menos fricción, más auténtico caballo de Troya.
DeepSeek ya nos enseñó en 2025 que su estrategia no es liderar los benchmarks, sino romper la baraja de precios. Con este movimiento repite jugada en un territorio que parecía blindado para OpenAI y Anthropic. La duda no es si el modelo es bueno, sino cuánta letra pequeña esconde.
La letra pequeña del experimento
Conviene no dejarse llevar por el titular. Es un modelo experimental, con el sufijo -Exp bien visible, y las comparaciones con Opus 4.8 salen de la propia DeepSeek, no de un benchmark independiente. Eso no desinfla el golpe: si cumple la mitad de lo prometido, el precio sigue siendo ridículo. Pero conviene recordar precedentes recientes en los que la distancia entre demo y producción ha sido más larga de lo anunciado. La mayoría de los usuarios prefiere pagar menos antes que exigir la perfección. La pelota queda en el tejado de Anthropic.
Hype-O-Meter
Nivel de hype: 8/10. El movimiento tiene miga: visión multimodal sin coste extra y capacidades de agente heredadas. No es un 10 porque hablamos de un experimento, no de un lanzamiento redondo — y los benchmarks propios siempre hay que cogerlos con pinzas.
El resumen para vagos (TL;DR)
- 🎯 ¿Qué ha pasado? DeepSeek ha lanzado DeepSeek-V4-Flash-Vision-Exp, un modelo experimental que interpreta imágenes y capturas.
- 🔥 ¿Por qué importa? Es gratis vía API y sus creadores aseguran que roza a Claude Opus 4.8 en tareas visuales.
- 🤔 ¿Nos afecta o es solo un meme? Si aguanta el contacto con la realidad, fuerza a Anthropic y a OpenAI a mover ficha con precios.




