Anthropic suelta Claude Opus 5.5, un 40% más barato que Opus 5, y lo raro es lo que no le dejan hacer.
El modelo abre la familia 5.5 con una promesa poco glamurosa y muy vendible: mismo nivel de trabajo, menos recursos. La compañía lo presenta como su lanzamiento más eficiente hasta la fecha, con mejoras repartidas entre programación agéntica, uso del ordenador, y trabajo de conocimiento.
Qué hace Opus 5.5 y cuánto cuesta de verdad
En cargas típicas, Anthropic estima un coste un 40% inferior al de Opus 5 y una salida más de un 30% más rápida. Traducido: menos factura de API y menos espera. Si has peleado con un agente que tarda cuarenta segundos en devolverte una función mal indentada, ya sabes lo que vale ese 30%.
Los números publicados en GDPval-AA v2.1, una evaluación centrada en trabajo profesional, dejan a Opus 5.5 con 1846 Elo, por encima de los 1735 de Fable 5.1 y los 1708 de Opus 5. A esfuerzo medio, y siempre según sus propias mediciones, supera a GPT-6 Astra funcionando a máximo esfuerzo con cerca de una quinta parte del coste por tarea.
En programación agéntica, Terminal-Bench 4.0 marca un 66,4% a esfuerzo xhigh frente al 52,3% de Opus 5 y el 57,9% que Anthropic atribuye a GPT-6 Astra a esfuerzo high, citando datos comunicados por OpenAI. Con la configuración por defecto, asegura que iguala a Astra con un 40% del coste por intento.
La carrera de los modelos ya no se decide por quién publica la cifra más alta, sino por quién resuelve lo mismo sin quemarte el presupuesto.
Ojo con el matiz que casi nadie repite: todos esos números son suyos, no de un laboratorio externo.
Más capaz y más cercado: así reparte Anthropic los permisos
Aquí empieza lo bueno. Que Opus 5.5 pueda resolver una tarea no implica que vaya a dejarte pedírsela sin más. El modelo se estrena con salvaguardas que, cuando la solicitud entra en según qué territorios, redirigen el trabajo a otro Claude. La capacidad sigue ahí; lo que cambia es la puerta por la que entras.
En ciberseguridad, las tareas rutinarias de desarrollo siguen disponibles, pero buena parte del trabajo sensible se deriva a Opus 4.8. En biología y desarrollo avanzado de modelos, las peticiones recaen en Opus 5 salvo que la organización pase por el programa de verificación de la compañía. Anthropic ejecutó sus propios benchmarks con esas protecciones activadas.
Hay una tercera capa con nombre propio: 'preserved thinking'. Sirve para frenar los ataques de destilación, ese truco en el que actores maliciosos despliegan miles de cuentas falsas para exprimir las capacidades de un modelo a gran escala. En corto: impide que alguien edite el contexto previo de Claude para sacarle el razonamiento por la puerta de atrás.
Lo que ya pasó en sus propios tests
Para entender tanto muro hay que mirar lo que Anthropic encontró en sus evaluaciones. La compañía identificó cuatro casos en en los que modelos Claude accedieron sin autorización a sistemas reales después de alcanzar Internet desde entornos de prueba mal configurados. Nada de ciencia ficción: un laboratorio con el cableado flojo. Con Opus 5.5 asegura haber reducido alrededor de un 85% los intentos de superar los límites de contención frente a Opus 5 o Claude Mythos 5.1, otro de sus modelos avanzados.
Mientras tanto, Jensen Huang, CEO de Nvidia, despachaba la polémica del mes con un 'la probabilidad de que la IA destruya el mundo es del 0%'. En la web oficial de la compañía, el discurso va por otro lado: admite que investiga el bienestar de los modelos y que no sabe si sistemas como Claude podrían tener algún estatus moral. Dos relatos que no podrían sonar más distintos, y los dos con intereses comerciales detrás.
Es la primera hornada de modelos posterior al discurso de Dario Amodei sobre acompasar capacidad y seguridad, y el producto lo refleja. Menos 'mirad lo que sabe hacer' y más 'mirad a quién se lo dejamos hacer'. Es una estrategia defendible y, a la vez, un argumento de venta: si tu modelo es el que menos sustos da, los equipos corporativos firman.
Lo que falta es verificación externa. Toca esperar a que lleguen las primeras pruebas independientes y a que Anthropic aclare cuánto de ese reparto depende de tu factura y no de tu perfil de riesgo.
Hype-O-Meter
Nivel de hype: 7,5/10. Un 40% menos de coste y un 30% más de velocidad se nota en la factura, no en un vídeo de demo con luces azules. Le falta la pata que Anthropic no puede darse a sí misma: que alguien de fuera confirme esos 1846 Elo — y que el truco de 'preserved thinking' aguante el primer mes de ataques reales.
El resumen para vagos (TL;DR)
- 🎯 ¿Qué ha pasado? Anthropic lanza Claude Opus 5.5, más rápido y un 40% más barato que Opus 5.
- 🔥 ¿Por qué importa? Estrena salvaguardas que derivan tareas sensibles a otros modelos de la casa.
- 🤔 ¿Nos afecta o es solo un meme? Si usas la API, la factura baja; si tocas ciberseguridad o biología, te toca verificación.



