OpenAI ha presentado GPT-6 Sol y GPT-6 Luna como incorporaciones de menor coste a la familia GPT-6. La empresa describe GPT-6 Astra, lanzado a principios de este mes, como su modelo más potente y mejor alineado. Sol y Luna utilizan métodos de entrenamiento similares a los de Astra y reciben mejoras en trabajo profesional, fiabilidad factual, programación, uso del ordenador y alineamiento.

OpenAI atribuye la reducción de costes a cambios en la caché y la inferencia. Su tabla de precios señala que los dos modelos son un 50 % más baratos que sus versiones promocionales de GPT-5.6. Los importes corresponden a un millón de tokens. GPT-6 Sol pasa de $4 a $2 en tokens de entrada y de $20 a $10 en tokens de salida. GPT-6 Luna pasa de $0,20 a $0,10 en entrada y de $1,20 a $0,50 en salida. Astra sigue siendo el modelo que OpenAI recomienda para obtener los mejores resultados.

En AutomationBench 1.0.6, GPT-6 Sol obtiene un 33,2 % con esfuerzo xhigh y un coste de $0,27 por tarea. GPT-6 Astra alcanza un 30,3 % con esfuerzo bajo y cuesta 3,9 veces más. Claude Opus 5 consigue un 26,9 % con esfuerzo máximo y cuesta 11,1 veces más. Claude Fable 5.1 con desvíos a Opus 5 alcanza un 31,4 % y cuesta más de 8,9 veces más, sin incluir el coste de los desvíos. La prueba evalúa agentes en flujos que abarcan ventas, marketing, operaciones, soporte, finanzas y recursos humanos con 47 herramientas. Los desvíos se produjeron en aproximadamente el 40 % de las tareas. Con esfuerzo alto, Luna mejora 5,4 puntos frente a su predecesor y reduce un 58 % el coste por tarea. En Agents' Last Exam, Sol obtiene un 56,4 % con esfuerzo máximo. El resultado supera la mejor puntuación publicada de Claude Opus 5 en esa evaluación, con un coste por tarea un 60 % menor.

La evaluación interna de factualidad utiliza conversaciones desidentificadas en las que los usuarios habían señalado errores de los modelos. Sol comete aproximadamente la mitad de errores que su predecesor y se acerca a la fiabilidad de Astra con un coste inferior. Con niveles altos de esfuerzo, Luna iguala el resultado de GPT-5.6 Sol por cerca de una centésima parte del coste. OpenAI advierte que esas conversaciones contenían errores denunciados y no representan el uso habitual. Las puntuaciones no se ajustan por la longitud de las respuestas. Las pruebas con distintos niveles de extensión mostraron una dependencia casi nula entre longitud y resultado.

OpenAI también comunica avances en programación, mientras los agentes de código asumen tareas más largas y complejas. Calculado con precios de API, el uso diario interno supera los $600 para el investigador mediano y los $7.000 para los investigadores del percentil 90. En FrontierCode, Sol mejora claramente frente a GPT-5.6 Sol y alcanza el nivel de Claude Fable 5.1 con esfuerzo xhigh a un coste mucho menor. En DeepSWE v1.1, Sol obtiene un 68,8 % con esfuerzo máximo. Claude Fable 5 llega al 69,9 % con esfuerzo xhigh, mientras Sol cuesta aproximadamente un 80 % menos por tarea. Luna logra un 66,6 % con esfuerzo máximo, comparable a Claude Opus 5 y Fable 5 con esfuerzo medio. En estas comparaciones, Luna cuesta un 93 % menos por tarea que Opus 5 y un 96 % menos que Fable 5.

Astra sigue siendo el modelo de OpenAI con mejores resultados en uso del ordenador. En el conjunto offline de OSWorld 2.0, correspondiente a la versión v2026.08.08, Sol alcanza un 60,5 % con esfuerzo xhigh. Claude Opus 5 obtiene un 60,3 % con esfuerzo medio y cuesta aproximadamente un 80 % más por tarea. Luna, con esfuerzo máximo, supera a GPT-5.6 Sol con esfuerzo medio por una décima parte de su coste. OSWorld mide flujos de trabajo de agentes de larga duración con tareas informáticas cotidianas y profesionales.

Sol y Luna también incorporan los cambios de estilo comunicativo introducidos con Astra. OpenAI informa de respuestas técnicas más claras, menos jerga, menos expresiones extrañas, menos detalles de poco valor y respuestas algo más cortas. En un ejemplo sobre un sitio web con diseño Bento Box, un control deslizante entre páginas y cambios en React, OpenAI prefirió la respuesta de Sol. La respuesta asumía menos cosas, repetía menos información evidente, utilizaba un lenguaje más preciso, explicaba mejor qué había comprobado y eliminaba detalles de implementación irrelevantes, como un prompt para una herramienta de imágenes.

GPT-6 también incorpora mejoras en la caché de prompts. Según OpenAI, la tasa de aciertos de caché es mayor por defecto y las lecturas de tokens de entrada almacenados reciben un descuento del 90 %. El Prompt Caching Dashboard muestra el volumen de entradas almacenadas a lo largo del tiempo. Una herramienta de diagnóstico identifica oportunidades de caché perdidas. Los desarrolladores pueden cambiar el esfuerzo de razonamiento y las herramientas disponibles durante una conversación mientras conservan el contexto anterior para reutilizarlo. Los puntos de corte explícitos permiten definir el final de los prefijos de prompt reutilizables. GitHub afirma que estos cambios redujeron en más de un 50 % la proporción de tokens de prompt que requieren procesamiento nuevo durante varios meses y miles de millones de solicitudes. Copilot puede responder así con mayor rapidez.

Sol y Luna incluyen el trabajo de alineamiento introducido con Astra. OpenAI observa mejoras frente a las versiones GPT-5.6, entre ellas menos afirmaciones engañosas sobre tareas de programación supuestamente terminadas. En una evaluación interna de engaño en programación, los agentes reciben tareas diseñadas para provocar conductas deshonestas. La prueba usa esfuerzo máximo y cuenta las respuestas con algún engaño detectado. OpenAI la presenta como una evaluación de situaciones difíciles y señala que el engaño es mucho menos frecuente en el uso normal. Los resultados completos aparecen en la ficha de seguridad de GPT-6 Astra.

GPT-6 Sol y GPT-6 Luna están disponibles en ChatGPT Work y Codex para usuarios Plus, Pro, Business, Enterprise y Edu. Los usuarios Free y Go pueden acceder a Luna en la aplicación de escritorio. Los modelos todavía no están disponibles en Chat. Sus nombres en la API son gpt-6-sol y gpt-6-luna. OpenAI prevé desplegarlos gradualmente en ChatGPT durante el día del lanzamiento.

OpenAI realizó sus evaluaciones de GPT en un entorno de investigación o mediante su API. Los resultados de ChatGPT en producción pueden variar debido a diferencias en los prompts del sistema y las herramientas disponibles. Los resultados de los modelos competidores proceden de informes públicos. OpenAI utilizó puntuaciones de Claude Fable 5 cuando no había resultados disponibles para Fable 5.1.