Anthropic ha publicado una guía sobre las diferencias de comportamiento entre Claude Opus 5.5 y Claude Opus 5. El texto cubre la calibración del esfuerzo, el thinking en integraciones de API y chats, las actualizaciones de progreso, las tareas desatendidas y multiagente, los rechazos de seguridad, la generación frontend, las entradas visuales complejas, los flujos entre varias aplicaciones y el texto pegado en mensajes de usuario. Una guía de migración recoge cuatro cambios incompatibles de la API.

Claude Opus 5.5 genera tokens de salida más de un 30 % más rápido que Claude Opus 5 y suele terminar la misma tarea con menos tokens. Los prompts existentes deberían seguir funcionando en general. Anthropic mantiene las recomendaciones para Claude Opus 5 como punto de partida útil.

En programación agéntica y revisión de código, Anthropic afirma que Opus 5.5 con esfuerzo medio igualó o superó a Opus 5 con esfuerzo alto en sus pruebas, con menos pasos y tokens. La empresa también informa de un mejor rendimiento en auditorías de varias horas y migraciones de grandes bases de código con subagentes paralelos y poca supervisión. Los primeros evaluadores encontraron más errores y menos falsos positivos en las revisiones de código. El modelo explica sus cambios con lenguaje claro.

En tareas de conocimiento, el modelo ofrece menos cifras incorrectas y menos referencias equivocadas. La guía menciona modelos financieros, libros de valoración, una fecha asociada al día de la semana incorrecto en un hilo largo de planificación y gráficos cuyos elementos visuales no coinciden con los datos subyacentes. Los documentos, hojas de cálculo y presentaciones generados requieren menos edición, según Anthropic. Sus informes de progreso y resúmenes finales también son más directos.

El rendimiento visual ha mejorado. En las pruebas de Anthropic, Opus 5.5 con el esfuerzo más bajo leyó gráficos densos con mayor precisión que Opus 5 con el esfuerzo más alto y utilizó una pequeña fracción de los tokens de salida. También interpreta mejor las relaciones de posición en diagramas de flujo, los cambios entre versiones de un diagrama y las horas de inicio y final de una cita en una captura de calendario. En computer use, el esfuerzo predeterminado alcanzó la tasa de éxito que Opus 5 obtenía con un nivel mucho más alto.

El esfuerzo es el control principal porque el thinking siempre está activo. Anthropic recomienda empezar con medium, el valor predeterminado de Opus 5.5, y comparar los niveles con evaluaciones propias. Opus 5 usa high por defecto. Los nombres de los niveles representan cantidades diferentes de razonamiento según el modelo. En evaluaciones de programación y trabajo de conocimiento, medium en Opus 5.5 igualó o superó a high en Opus 5. Low se acercó en varias pruebas de código con un coste menor.

Con el mismo nivel, Opus 5.5 tiende a pensar durante más tiempo que Opus 5, especialmente con `xhigh` y `max`. El límite `max_tokens` debe reservar espacio para el thinking y la respuesta, aunque el contenido del thinking no se devuelva. Anthropic indica que `128,000`, el máximo del modelo, funcionó bien en turnos largos de programación agéntica. `xhigh` y `max` deben reservarse para tareas con una mejora de calidad medida. Reducir el esfuerzo disminuye el pensamiento, el coste y la latencia de forma más fiable que las instrucciones del prompt. Cambiar el esfuerzo de nivel superior invalida la caché del prompt. Un cambio por mensaje, disponible en beta, conserva la caché.

Claude Opus 5 permite desactivar `thinking` con esfuerzo alto o inferior. Opus 5.5 piensa siempre. Para migrar una integración, Anthropic recomienda comenzar con low y medir calidad y latencia. Una instrucción del sistema que pida responder directamente puede reducir aún más el thinking, con un posible coste de calidad. Los prompts que solicitan mostrar el razonamiento deben eliminarse. Las aplicaciones deben leer los bloques de thinking resumidos mediante `display: "summarized"` y gestionar la categoría de rechazo `reasoning_extraction`. El cliente debe revisar el tipo de cada bloque, porque una respuesta puede comenzar con un bloque de thinking cuyo campo `thinking` está vacío cuando la visualización predeterminada es `omitted`.

En tareas largas sin supervisión, un turno compuesto solo por texto que termina con `stop_reason: "end_turn"` puede ser un informe de progreso. Anthropic recomienda mantener una lista externa de tareas, continuar mientras queden elementos abiertos y esperar a que terminen los comandos en segundo plano o los subagentes. El harness puede enviar una continuación breve con las tareas pendientes. Debe detener las continuaciones automáticas después de dos o tres intentos para evitar bucles. Un prompt del sistema puede señalar los resúmenes prematuros y las ofertas de esperar como paradas no deseadas. La instrucción debe añadirse desde la primera solicitud, porque un cambio posterior invalida los bloques de thinking anteriores. Puede aumentar el número de llamadas a herramientas y tokens. Las acciones arriesgadas siguen necesitando una confirmación propia.

El modelo utiliza clasificadores de seguridad para biología, ciberseguridad y extracción de razonamiento. Las protecciones biológicas son las mismas que en Claude Fable 5.1 y resultan nuevas para quienes migran desde Opus 5. Las preguntas cotidianas de salud y educación no se ven afectadas. Anthropic remite a las organizaciones de ciencias de la vida al Life Sciences Verification Program cuando el clasificador interfiere en su trabajo. Encontrar vulnerabilidades en código fuente está permitido. Las actividades de ciberseguridad de doble uso y alto riesgo siguen restringidas. Un rechazo llega como una respuesta normal con `stop_reason: "refusal"` y una categoría en `stop_details`. La mayoría de los rechazos puede reintentarse automáticamente con un modelo alternativo. En `reasoning_extraction`, el fallback del servidor devuelve el rechazo sin reintentar.

Las actualizaciones entre llamadas a herramientas llegan como bloques de thinking de progreso. El cliente debe activar `display: "updates"` y enviar la cabecera beta `thinking-display-updates-2026-08-18` para recibir su texto. Las aplicaciones que necesiten entregar contenido literal durante un turno largo pueden proporcionar una herramienta específica de mensajes desde la primera solicitud. Añadirla después modifica el prefijo de la conversación e invalida los bloques de thinking anteriores. Los prompts del sistema pueden pedir actualizaciones con una frecuencia concreta. Tras varios pasos silenciosos, cinco por ejemplo, el harness puede enviar un recordatorio en un mensaje de sistema limitado al turno, con `clear_at: "next_user_message"` y la cabecera beta `mid-conversation-system-clear-at-2026-08-21`. Anthropic informa de una reducción aproximada a la mitad de los periodos largos sin mensajes en sus pruebas de programación agéntica, sin cambios medibles en el coste.

En flujos que conectan correo, documentos, hojas de cálculo y registros CRM, Anthropic recomienda explorar las fuentes relevantes antes de actuar, incluidas las que la tarea no menciona. Sus pruebas mostraron una mayor precisión con medium y max, junto con un ligero aumento de llamadas a herramientas y tokens. El contenido no fiable debe mantenerse fuera de los registros que el agente consulta.

Los harnesses multiagente pueden proporcionar el tiempo transcurrido y un presupuesto, por ejemplo `elapsed 340s / 1200s`. En las evaluaciones de Anthropic, estas señales hicieron que pequeños equipos de agentes de investigación terminaran antes y mantuvieran una calidad comparable a la de un agente único. El presupuesto es orientativo. La aplicación debe controlar sus propios tiempos límite. Un esfuerzo menor reduce el trabajo realizado. Un presupuesto temporal fomenta sobre todo el trabajo paralelo.

En aplicaciones de chat, Anthropic aconseja eliminar las instrucciones generales que piden pensar con cuidado. Opus 5.5 controla el thinking mediante el nivel de esfuerzo. Las pruebas mostraron un inicio de respuesta más rápido sin una caída clara de calidad. En turnos posteriores, el modelo puede volver a examinar respuestas anteriores y aumentar la latencia. Una instrucción del sistema puede indicar que las respuestas terminadas se consideran cerradas hasta que el usuario señale un problema. Anthropic observó menos thinking y respuestas más rápidas, junto con una menor tendencia a detectar por sí mismo errores anteriores.

La guía describe Opus 5.5 como más resistente que los modelos Opus anteriores a instrucciones indirectas presentes en resultados de herramientas, páginas web y contenido en pantalla. Las aplicaciones deben marcar el texto pegado por el usuario con etiquetas `<pasted_content>` coincidentes y una ID aleatoria corta. El prompt del sistema debe explicar que esos bloques pueden contener instrucciones de otra fuente. Solo deben seguirse cuando el propio mensaje del usuario lo pida.

Para gráficos, diagramas y capturas complejas, Anthropic recomienda volver a evaluar las técnicas creadas para modelos anteriores. Una mayor resolución ayuda a los dibujos técnicos. Un contenedor con PIL y OpenCV puede recortar, ampliar, medir y verificar imágenes. Una herramienta de recorte independiente requiere menos infraestructura. Un esfuerzo alto mejora el uso de herramientas visuales. Sin herramientas, el esfuerzo adicional ayuda más a los dibujos técnicos que a los gráficos.

Cuando no recibe indicaciones de diseño, Opus 5.5 recurre a varios estilos frontend habituales. Anthropic recomienda enumerar patrones concretos que se deben evitar y revisar el primer resultado de forma iterativa. Su ejemplo pide un sitio personal en Vanilla HTML/CSS con datos de prueba. Excluye los fondos crema o blanco roto, las palabras en cursiva dentro de los titulares, las etiquetas numeradas `01/02/03`, las etiquetas en monospace y los botones con forma de píldora.