Son las 01:40 y el worker de extracción de facturas funciona bien. El problema es la línea de coste del log: unos cuantos cientos de PDF, cada uno con un albarán escaneado grapado, y todas las llamadas van al único modelo que alguien eligió en una sprint planning hace dieciocho meses. Nadie volvió a revisar esa decisión, porque el nombre del modelo vive en seis sitios, dos de ellos dentro de un prompt builder que además formatea fechas. Esa es la base de código en la que no paro de pensar esta semana, ahora que Mistral lanza Large 4. Mi postura: el modelo en sí es un trabajo respetable, pero lo más útil del lanzamiento para nosotros es que sirve de argumento para construir apps en PHP donde cambiar de modelo sea una línea en la configuración y no una refactorización.
Empieza por los números, porque juegan en contra de elegir Large 4 por motivos generales. En el Artificial Analysis Intelligence Index se queda en 38. MiMo-V2.6-Pro de Xiaomi está en 46, GLM-5.3 Max en 45, y Sonnet 5.5 y Opus 5.5 de Anthropic llegan a 56 y 58 con esfuerzo máximo. La comparación más dura es GPT-6 Luna Max, que también saca 38 y cuesta unos $0.07 por tarea del índice frente a cerca de $1.13 de Large 4, con unos 140 millones de tokens de salida mientras el modelo de Mistral quema casi 200 millones. Misma puntuación, una factura estandarizada unas dieciséis veces mayor. Si lo único que te preguntas es qué endpoint te da más razonamiento por euro, la respuesta está en otra parte, y no voy a fingir lo contrario.
Esa es la objeción más fuerte y merece que la tomemos en serio. La mayoría de quienes construimos SaaS sobre Laravel o Symfony no tenemos una cláusula de soberanía en los contratos. Tenemos un presupuesto, un objetivo de latencia y un product owner que quiere que la función de resúmenes deje de inventarse nombres de clientes. Para ese equipo, conectar un modelo de 38 puntos al precio más alto es un mal negocio, y la lealtad a un laboratorio europeo no va a pagar la factura. Un matiz justo sobre el matiz: el índice usa las tarifas oficiales de Mistral, $1.36 por millón de tokens de entrada y $4.18 por millón de salida, mientras que la preview pública cuesta ahora la mitad, $0.68 y $2.09. Más barato, pero todavía muy lejos de Luna.
Aquí es donde mi conclusión cambia. La puntuación agregada es una media de diez evaluaciones, y tu aplicación no es una media. Large 4 alcanza alrededor del 59.9% en AutomationBench, los flujos de varios pasos tipo correo y hoja de cálculo, lo que lo deja a pocos puntos de GLM-5.3 Max con un 62% y más o menos a la par de MiMo con un 59%. En la evaluación de documentos GDP.pdf de Artificial Analysis llega al 19%, donde GLM-5.3 Max se queda en el 11%. Acepta imágenes de forma nativa gracias a un codificador de visión de 1.6 mil millones de parámetros, mientras que el GLM-5.3 que aloja Mistral solo trabaja con texto. Mi tarea de albaranes se preocupa justo por esa parte y nada por las matemáticas de competición. Un modelo puede perder en la clasificación y seguir siendo la elección correcta para una cola concreta.
Y fíjate en lo que hace la propia Mistral. Su plataforma ya sirve GLM-5.3 de Z.ai, sin modificar, junto a su modelo estrella. El proveedor te está diciendo, en forma de producto, que el modelo adecuado depende de la tarea y del mes. Si la empresa que entrenó un modelo de 1.05 billones de parámetros, 49 mil millones activos por paso, en unas 4,000 GPU Grace Blackwell está tranquila enviando clientes a los pesos de un competidor, nuestras apps pueden tratar tranquilamente el nombre del modelo como una variable de entorno. Eso significa una interfaz para la llamada, un mapeo por tarea en la configuración y un fixture de evaluación con veinte o treinta entradas reales que vuelvas a ejecutar cada vez que salga una versión nueva. PHP aburrido. Justo del tipo que se nos da bien.
Luego está el cliente que sí tiene la cláusula. Sector público, sanidad, un proveedor industrial que no deja que un log de diagnóstico salga de la UE. Para ellos, la noticia de verdad son los pesos abiertos que Mistral dice que llegarán a finales de este mes, porque un modelo que puedes ejecutar en infraestructura que controlas cambia la conversación de compras mucho más que cualquier puntuación de un índice. El salto desde Medium 3.5, que sacó 14 en el mismo índice, hasta 38 es lo que hace que esa opción sirva para cargas de trabajo con agentes. Hace un año le habría dicho a un cliente así que aceptara un modelo mucho más débil o una API extranjera. Ahora la diferencia es un equilibrio entre coste y calidad que puedes medir con tus propios fixtures.
Así que no te digo que te pases a Large 4, ni que lo ignores. Te digo que este lanzamiento deja en evidencia cuántas de nuestras integraciones ni siquiera pueden hacerse la pregunta sin que cueste caro. Si probar un modelo nuevo implica tocar un prompt builder, un DTO y tres clases de servicio, nunca vas a hacer el benchmark, y seguirás pagando aquella decisión de la sprint planning para siempre. Convierte el modelo en un valor que puedas cambiar, mantén un conjunto de pruebas pequeño y honesto, y deja que cada tarea elija a su ganador. Algunos meses será Mistral, y muchos otros no.
¿Dónde pones tú el límite en tu stack: enrutas por tarea con una tabla de mapeo y aceptas el mantenimiento extra de prompts, o te quedas con un único proveedor y asumes la diferencia de coste a cambio de una base de código más sencilla?




Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.