Lanzamientos
Anthropic lanza Claude Opus 5 con mejoras en benchmarks y precio sin cambios
Anthropic presenta Claude Opus 5, el nuevo modelo predeterminado en Claude Max, que según la empresa marca el estado del arte en benchmarks de código y trabajo de conocimiento como Frontier-Bench v0.1 y GDPval-AA, al mismo precio de 5/25 dólares por millón de tokens que Opus 4.8, con nuevas funciones beta en la API.
Anthropic ha puesto Claude Opus 5 a disposición en todas sus plataformas. El modelo se acercaría a la inteligencia de Claude Fable 5 a mitad de precio, aunque sigue por detrás de Mythos 5 en tareas de ciberseguridad. Es el nuevo modelo predeterminado en Claude Max y el más potente en Claude Pro.
El precio se mantiene en 5 dólares por millón de tokens de entrada y 25 por millón de salida, igual que Opus 4.8. Un modo Fast funciona unas 2,5 veces más rápido al doble de precio. Un ajuste de esfuerzo permite equilibrar inteligencia, velocidad y coste en tokens.
En benchmarks, Opus 5 lideraría Frontier-Bench v0.1 y más que duplicaría el rendimiento de Opus 4.8 con menor coste por tarea. En CursorBench 3.2 queda a un 0,5 % del máximo de Fable 5 a mitad de coste. Su puntuación en ARC-AGI 3 sería el triple que la del siguiente mejor modelo, y su tasa de acierto en el AutomationBench de Zapier unas 1,5 veces superior. En OSWorld 2.0, un benchmark de uso de ordenador, Opus 5 superaría a cualquier otro modelo a igual coste, superando el mejor resultado de Fable 5 con poco más de un tercio del coste. Las evaluaciones de ciencias de la vida mejoran en todos los ámbitos, con +10,2 puntos en química orgánica y +7,7 en predicción de variantes de proteínas.
Anthropic destaca comportamientos agénticos: Opus 5 escribió su propia pipeline de visión por computadora para reconstruir una pieza mecánica 3D en FreeCAD a partir de un plano no visible directamente; corrigió la causa raíz de un bug real en un gestor de paquetes open source que un parche comunitario había pasado por alto; y construyó en una sesión un feed de datos de mercado para una nueva bolsa, con su propio harness de pruebas. Clientes como Cursor, Zapier, Lovable, JetBrains y Box reportan mejoras notables.
En alineación, Opus 5 obtiene 2,3 en la auditoría conductual, la puntuación más baja de los modelos recientes. Sigue detrás de Mythos 5 en biología y ciberseguridad ofensiva y no fue entrenado deliberadamente en tareas cyber. Sus clasificadores cyber intervendrían un 85 % menos que los de Fable 5; las solicitudes marcadas recaen por defecto en Opus 4.8.
Dos funciones beta acompañan el lanzamiento: cambio de herramientas en mitad de una conversación sin invalidar la caché de prompts, y fallbacks automáticos en la API para solicitudes marcadas por seguridad. El modelo está disponible como claude-opus-5 en la API de Claude, sin requisitos de retención de datos.
Tribuna de lectores
Aún no hay aportaciones — abre el debate.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·