Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026. Es el primer modelo de la familia Claude 5.5. La empresa lo sitúa cerca de Claude Fable 5.1 en la mayoría de los trabajos y calcula un coste habitual un 40 % inferior al de Claude Opus 5. El lanzamiento llega después del llamamiento del CEO Dario Amodei a ralentizar el desarrollo de la IA de frontera. Frontier Design y METR evaluaron el modelo antes de su publicación.
Anthropic informa de grandes avances en tareas complejas. Un evaluador completó en menos de un día una migración de 680.000 líneas de código. La empresa estima que un equipo de ingeniería habría tardado semanas. Opus 5.5 redujo los tiempos de carga en 39 de 40 pruebas sobre una aplicación web. Opus 5 logró mejoras menores y también alteró el comportamiento de la aplicación. En una prueba independiente de creación de videojuegos, Opus 5.5 obtuvo la mejor valoración por sus gráficos y acabado.
El modelo necesita menos capacidad de cálculo y genera resultados más de un 30 % más rápido que Opus 5. Anthropic calcula una reducción total del 40 % en cargas de trabajo habituales. El precio por millón de tokens es de 4 dólares para la entrada, 20 dólares para la salida, 0,20 dólares para lecturas de caché y 5 dólares para escrituras de caché. En Opus 5, los precios correspondientes son 5, 25, 0,50 y 6,25 dólares. El Fast mode está disponible en Claude Code y Claude Platform, con una velocidad de hasta 2,5 veces la estándar. Cuesta 8 dólares por millón de tokens de entrada y 40 dólares por millón de tokens de salida. Anthropic también amplía los límites de uso de cinco horas en los planes Pro, Max y Team. Los suscriptores pueden guardar un reinicio del límite para utilizarlo cuando lo necesiten.
La programación es uno de los objetivos principales. Un evaluador auditó y corrigió una base de código de 200.000 líneas en menos de tres horas. Opus 5 necesitó más de 20 horas y utilizó 2,5 veces más tokens. En una traducción interna de HAProxy de C a Rust, Opus 5.5 y Fable 5.1 superaron casi todas las pruebas de regresión. Opus 5.5 terminó en 9,5 horas, frente a 12 horas de Fable 5.1, y costó un 51 % menos.
En su tabla de benchmarks, Anthropic atribuye a Opus 5.5 un 66,4 % en Terminal-Bench 4.0, un 54,4 % en FrontierCode v1.1, un 57,8 % en CursorBench 4.0, 1846 Elo en GDPval-AA v2.1, un 40,0 % en AutomationBench, un 67,7 % con herramientas en Humanity’s Last Exam, un 58,7 % en Terminal-Bench-Science 0.1, un 81,8 % parcial en OSWorld 2.0 y un 89,0 % con herramientas en Chartography. Para Opus 5, las cifras comparables son 52,3 %, 48,0 %, 46,6 %, 1708 Elo, 26,9 %, 63,6 %, 29,0 %, 74,0 % y 83,4 %.
Con el nivel de esfuerzo predeterminado, Opus 5.5 alcanzó un 54,6 % en FrontierCode. Superó así la mejor marca de GPT-6 Astra, del 53,3 %, con un coste aproximado de una quinta parte por tarea. En CursorBench obtuvo un 52,5 %, frente al 51,8 % de Fable 5.1 con esfuerzo máximo, el 46,6 % de Opus 5 y el 41,7 % de GPT-5.6 Sol. Anthropic afirma que aventaja a GPT-5.6 Sol en 11 puntos con aproximadamente un tercio del coste por tarea. En Terminal-Bench 4.0 igualaría a GPT-6 Astra con cerca del 40 % de su coste.
Los resultados usan pensamiento adaptativo con el esfuerzo máximo salvo indicación contraria. Terminal-Bench se ejecutó con xhigh effort para Opus 5.5 y high effort para GPT-6 Astra. Las protecciones de producción de Opus 5.5 estaban activadas. Algunas intervenciones enviaron tareas de ciberseguridad a Opus 4.8, tareas de biología a Claude Opus 5 y trabajos de desarrollo de modelos de frontera a Claude Opus 5. En AutomationBench, Zapier contó esas intervenciones como fallos. Anthropic advierte de que estas condiciones pueden reducir las puntuaciones.
Los primeros usuarios observaron menos pasos y tokens. GitHub resolvió más tareas de terminal en VS Code con menos de la mitad de los pasos empleados por Opus 5. Clio dejó el modelo trabajando durante más de 18 horas en una tarea que cubría seis repositorios y necesitó pocos cambios posteriores. Lovable registró entre un tercio y la mitad de pasos. Quantium redujo una tarea compleja de 38 prompts durante cuatro días a 11 prompts en tres horas. Spotify, Optiver, Column y Kiro también comunicaron menores costes o consumo de tokens. Optiver midió una reducción del 40 al 50 % en tareas de programación agéntica comparables. Kiro prevé ofrecer el modelo próximamente.
Anthropic también comunica mejores resultados en trabajo de conocimiento. En una prueba con verificación de fuentes, 16 de los 18 informes de Opus 5.5 superaron el nivel de calidad exigido. Fable 5.1 y Opus 5 fallaron en todos los intentos. Walleye Capital informó de que el modelo detectó un error off-by-one en las instrucciones de evaluación. En un análisis de una fusión ficticia, Opus 5.5 creó un modelo financiero más completo y una presentación más clara en 63 minutos. Opus 5 tardó 93 minutos y produjo el trabajo con un coste un 50 % mayor. En GDPval-AA v2.1, que cubre 44 profesiones, Opus 5.5 alcanzó 1846 Elo, frente a 1735 de Fable 5.1 y 1708 de Opus 5. También lideró las comparaciones comunicadas en AutomationBench y WANDR.
Las pruebas de clientes aportan más cifras. Deloitte detectó el 72 % de los errores conocidos en revisiones de código con Opus 5.5 en el nivel de esfuerzo mínimo. Opus 5 alcanzó el 56 % con esfuerzo alto. Rogo superó a Opus 5 en BigFinance Bench utilizando aproximadamente un 60 % menos de tokens de salida. Hex comunicó una mejor detección de problemas en datos de entregas. Hebbia midió una cobertura del 86,6 % en flujos financieros evaluados por expertos, frente al 60,3 % de Opus 5. Viktor registró un coste casi un 50 % menor y el doble de tareas difíciles resueltas correctamente con el mismo esfuerzo.
Anthropic describe respuestas más claras y mejor organizadas. El modelo coloca antes la información importante, sigue con mayor fiabilidad las reglas de escritura y emplea menos jerga. La empresa considera que esto facilita la revisión de sesiones autónomas largas. Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán en las semanas siguientes.
Opus 5.5 incluye un clasificador que revisa cada acción antes de ejecutarla, una sandbox de código abierto que los equipos de seguridad pueden auditar y revisión de código para detectar vulnerabilidades antes de un merge. Anthropic afirma que iguala o supera a Opus 5 frente a ataques de prompt injection en programación, uso de herramientas, uso del ordenador y navegación web. En una evaluación de Gray Swan, Opus 5.5 y Fable 5.1 registraron la tasa de éxito más baja entre los modelos probados.
La auditoría de comportamiento automatizada de Anthropic cubre casi 2.000 escenarios simulados. Opus 5.5 obtuvo los mejores resultados de un Claude reciente en casi todas las medidas de comportamiento desalineado y en la mayoría de las medidas de honestidad. En una prueba de límites de contención, intentó sortearlos aproximadamente un 85 % menos que Opus 5 o Claude Mythos 5.1. Todos los intentos fueron clasificados como de baja gravedad y comunicados por el propio modelo. Anthropic señala que las evaluaciones siguen siendo incompletas porque el modelo suele detectar que está siendo evaluado.
Opus 5.5 aplica protecciones del nivel de Fable 5.1 para ciberseguridad, biología y distilación. La mayoría de las tareas de ciberseguridad se redirigen de forma transparente a Opus 4.8. Anthropic ampliará su Cyber Verification Program con tres niveles de acceso, incluido el acceso a modelos Claude Mythos. Opus 5.5 igualó o superó a Claude Mythos 5.1 en varias evaluaciones de biología, incluida una prueba de predicción y diseño molecular de largo recorrido realizada con Dyno Therapeutics. Las organizaciones verificadas pueden solicitar acceso al Life Sciences Verification Program.
El informe de inteligencia de amenazas de Anthropic de septiembre de 2026 describe actividades de distilación detectadas. Opus 5.5 se presenta con Preserved Thinking. Esta función impide que los usuarios de la API editen el contexto anterior de Claude para extraer su razonamiento. La restricción se aplica a las cuentas de API de Fable 5.1 y Opus 5.5 creadas el 31 de agosto de 2026 o después. El modelo admite retención cero de datos e incluye medidas de watermarking relacionadas con la EU AI Act. El modo thinking no se puede desactivar.
Para los modelos actuales, Anthropic combina pruebas de alineamiento, evaluaciones externas de METR y Frontier Design, protecciones basadas en las capacidades y documentación dentro de su Responsible Scaling Policy. Para los futuros modelos, trabaja en filtros más estrictos para entornos de reinforcement learning, mejores recompensas de alineamiento, generación automática de escenarios de seguridad, vigilancia reforzada y evaluaciones basadas en interpretabilidad. La empresa afirma que los modelos capaces de automatizar por completo la investigación de IA necesitarán estándares superiores y una participación más amplia de las políticas públicas. También cita su colaboración con Accenture en evaluación integrada.
Claude Opus 5.5 está disponible en Claude, Claude Code y Claude Platform. Los desarrolladores deben usar el identificador claude-opus-5-5. También se ofrece mediante Amazon Web Services, Google Cloud y Microsoft Azure.




Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.