OpenAI presentó GPT-6 Astra a comienzos de este mes y ahora amplía la familia con GPT-6 Sol y GPT-6 Luna. Ambos modelos se entrenaron con métodos similares a los de Astra. OpenAI comunica mejoras en trabajo profesional, exactitud factual, programación, uso del ordenador y alineación. La empresa sitúa a Sol y Luna como opciones más rápidas y económicas para distintos niveles de uso.
Los precios de la API se calculan por 1 millón de tokens. GPT-6 Sol cuesta 2 dólares por los tokens de entrada y 10 dólares por los de salida, frente a 4 y 20 dólares para GPT-5.6 Sol. GPT-6 Luna cuesta 0,10 dólares por la entrada y 0,50 dólares por la salida, frente a 0,20 y 1,20 dólares para GPT-5.6 Luna. OpenAI presenta ambas reducciones como un 50 % frente a los precios promocionales de GPT-5.6. GPT-6 Astra sigue siendo el modelo de mayor capacidad de la empresa.
En AutomationBench 1.0.6, GPT-6 Sol con esfuerzo xhigh logró un 33,2 % con un coste de 0,27 dólares por tarea. GPT-6 Astra con esfuerzo bajo obtuvo un 30,3 % y costó 3,9 veces más que Sol. Claude Opus 5 con esfuerzo máximo alcanzó un 26,9 % y costó 11,1 veces más. Claude Fable 5.1 con una recuperación mediante Opus 5 logró un 31,4 % con un coste superior a 8,9 veces el de Sol. Ese último cálculo no incluye el coste de la recuperación. AutomationBench, publicado por Zapier, prueba flujos completos con 47 herramientas en ventas, marketing, operaciones, soporte, finanzas y recursos humanos. La comparación con Fable 5.1 excluye el coste de Opus 5, utilizado en aproximadamente el 40 % de las tareas.
GPT-6 Luna mejora a su predecesor en 5,4 puntos porcentuales con esfuerzo alto y reduce el coste por tarea un 58 %. En Agents’ Last Exam, GPT-6 Sol con esfuerzo máximo obtuvo un 56,4 %. OpenAI indica que el coste por tarea fue un 60 % menor que el de Claude Opus 5 en esa evaluación.
La prueba interna de exactitud factual de OpenAI utiliza conversaciones reales anonimizadas en las que los usuarios habían señalado errores de modelos anteriores. GPT-6 Sol comete aproximadamente la mitad de errores que su predecesor y se acerca a la fiabilidad de Astra con un coste menor. GPT-6 Luna alcanza, con niveles de esfuerzo altos, el rendimiento de GPT-5.6 Sol por aproximadamente una centésima parte de su coste. OpenAI advierte que estos casos no representan el uso habitual. Las puntuaciones no se ajustaron por longitud de respuesta, y las pruebas de longitud mostraron una dependencia mínima.
OpenAI afirma que el uso diario de tokens de sus agentes de programación supera los 600 dólares para el investigador mediano y los 7.000 dólares en el percentil 90, calculado con precios de API. En FrontierCode, GPT-6 Sol mejora notablemente frente a GPT-5.6 Sol y alcanza el nivel de Claude Fable 5.1 con esfuerzo xhigh a un coste menor. En DeepSWE v1.1, Sol con esfuerzo máximo obtiene un 68,8 %. El mejor resultado de Claude Fable 5 fue del 69,9 % con esfuerzo xhigh, con una diferencia de coste por tarea de aproximadamente el 80 % a favor de Sol. Luna logra un 66,6 % con esfuerzo máximo, en un nivel comparable al de Claude Opus 5 y Fable 5 con esfuerzo medio. Su coste por tarea es un 93 % inferior al de Opus 5 y un 96 % inferior al de Fable 5.
En la evaluación offline OSWorld 2.0, GPT-6 Sol con esfuerzo xhigh obtiene un 60,5 %, frente al 60,3 % de Claude Opus 5 con esfuerzo medio, con un coste por tarea aproximadamente un 80 % menor. GPT-6 Luna con esfuerzo máximo supera a GPT-5.6 Sol con esfuerzo medio por una décima parte del coste. OpenAI informa de la recompensa parcial del conjunto offline de la versión v2026.08.08.
OpenAI también ha trasladado a Sol y Luna las mejoras de comunicación introducidas con Astra. La empresa espera respuestas técnicas más claras, menos jerga, menos expresiones extrañas y menos detalles de poco valor. Las respuestas serán algo más breves. En un ejemplo sobre un sitio web con diseño Bento Box y un deslizador entre páginas en React, OpenAI prefirió la respuesta de Sol. La respuesta asumía menos cosas, repetía menos información evidente, explicaba mejor qué se había comprobado y evitaba detalles de implementación innecesarios.
El prompt caching de GPT-6 ofrece ahora mayores tasas de acierto de caché por defecto. Los agentes pueden reutilizar más contexto, responder más rápido y obtener un descuento del 90 % en las lecturas de tokens de entrada almacenados en caché. El Prompt Caching Dashboard muestra la evolución del uso. Una herramienta de diagnóstico explica las oportunidades perdidas. Los desarrolladores pueden cambiar el esfuerzo de razonamiento y las herramientas disponibles durante una conversación sin perder el contexto anterior para su reutilización. Los puntos de corte explícitos permiten elegir dónde terminan los prefijos almacenados. GitHub informa de una reducción superior al 50 % en la proporción de tokens que requieren procesamiento nuevo, medida durante varios meses sobre miles de millones de solicitudes a modelos de OpenAI. Copilot puede responder así con mayor rapidez.
Las evaluaciones de alineación muestran mejoras frente a los modelos equivalentes de GPT-5.6, incluida una menor frecuencia de afirmaciones engañosas sobre el trabajo de programación realizado. Las pruebas crean situaciones difíciles de forma deliberada y no representan las tasas de fallo normales. La evaluación interna de engaño en programación utiliza el esfuerzo máximo. OpenAI remite a la system card de GPT-6 Astra para los resultados completos.
GPT-6 Sol y GPT-6 Luna están disponibles en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu. Los usuarios Free y Go pueden acceder a Luna en la aplicación de escritorio. Los modelos todavía no están disponibles en Chat. Los identificadores de la API son gpt-6-sol y gpt-6-luna. OpenAI está desplegando el acceso en ChatGPT de forma gradual durante el día y recomienda volver a intentarlo más tarde si los modelos no aparecen. Las evaluaciones se realizaron en el entorno de investigación de OpenAI o mediante su API. La versión de producción de ChatGPT puede generar resultados diferentes por los prompts del sistema y las herramientas disponibles. Los resultados de los competidores proceden de informes públicos. OpenAI utilizó resultados de Claude Fable 5 cuando no había datos disponibles para Fable 5.1.



Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.