OpenAI a présenté GPT-6 Sol et GPT-6 Luna comme deux extensions moins coûteuses de la famille GPT-6. L'entreprise décrit GPT-6 Astra, lancé au début du mois, comme son modèle le plus puissant et le mieux aligné. Sol et Luna reprennent des méthodes d'entraînement similaires à celles d'Astra et bénéficient d'améliorations dans le travail professionnel, la fiabilité factuelle, le code, l'usage de l'ordinateur et l'alignement.

OpenAI attribue la baisse des coûts à des changements dans le caching et l'inférence. Son tableau tarifaire présente les deux modèles comme 50 % moins chers que leurs versions promotionnelles GPT-5.6. Les montants sont calculés pour un million de tokens. GPT-6 Sol passe de $4 à $2 pour les tokens d'entrée et de $20 à $10 pour les tokens de sortie. GPT-6 Luna passe de $0,20 à $0,10 en entrée et de $1,20 à $0,50 en sortie. Astra reste le modèle recommandé par OpenAI pour obtenir les meilleurs résultats.

Sur AutomationBench 1.0.6, GPT-6 Sol obtient 33,2 % avec un effort xhigh, pour $0,27 par tâche. GPT-6 Astra atteint 30,3 % avec un effort faible et coûte 3,9 fois plus cher. Claude Opus 5 atteint 26,9 % avec un effort maximal et coûte 11,1 fois plus cher. Claude Fable 5.1 avec des bascules vers Opus 5 obtient 31,4 % et coûte plus de 8,9 fois plus cher, sans compter le coût des bascules. Le test évalue les agents sur des workflows couvrant ventes, marketing, opérations, support, finance et ressources humaines au moyen de 47 outils. Les bascules se sont produites dans environ 40 % des tâches. Avec un effort élevé, Luna progresse de 5,4 points par rapport à son prédécesseur et réduit de 58 % le coût par tâche. Dans Agents' Last Exam, Sol atteint 56,4 % avec un effort maximal. Ce score dépasse le meilleur résultat publié de Claude Opus 5 dans cette évaluation, avec un coût par tâche inférieur de 60 %.

L'évaluation interne de la fiabilité factuelle repose sur des conversations désidentifiées dans lesquelles des utilisateurs avaient signalé des erreurs. Sol produit environ deux fois moins d'erreurs que son prédécesseur et se rapproche de la fiabilité d'Astra à un coût inférieur. Avec un niveau d'effort élevé, Luna atteint le résultat de GPT-5.6 Sol pour environ un centième du coût. OpenAI précise que ces conversations contenaient des erreurs signalées et ne représentent pas l'usage habituel. Les scores ne sont pas corrigés selon la longueur des réponses. Des tests de verbosité ont toutefois montré une dépendance presque nulle entre la longueur et les résultats.

OpenAI rapporte aussi des progrès en programmation, alors que les agents de code traitent des tâches plus longues et plus complexes. Aux tarifs API, l'usage quotidien interne dépasse $600 pour le chercheur médian et $7 000 pour les chercheurs du 90e percentile. Sur FrontierCode, Sol progresse nettement par rapport à GPT-5.6 Sol et rejoint le niveau de Claude Fable 5.1 en effort xhigh avec un coût largement inférieur. Sur DeepSWE v1.1, Sol atteint 68,8 % avec un effort maximal. Claude Fable 5 atteint 69,9 % en effort xhigh, tandis que Sol coûte environ 80 % de moins par tâche. Luna atteint 66,6 % avec un effort maximal, un niveau comparable à celui de Claude Opus 5 et Fable 5 en effort moyen. Dans ces comparaisons, Luna coûte 93 % de moins par tâche qu'Opus 5 et 96 % de moins que Fable 5.

Astra reste le modèle le plus performant d'OpenAI pour l'usage de l'ordinateur. Sur le jeu de données hors ligne d'OSWorld 2.0, issu de la version v2026.08.08, Sol atteint 60,5 % avec un effort xhigh. Claude Opus 5 obtient 60,3 % avec un effort moyen et coûte environ 80 % de plus par tâche. Avec un effort maximal, Luna dépasse GPT-5.6 Sol en effort moyen pour un dixième de son coût. OSWorld mesure des workflows d'agents de longue durée couvrant des tâches informatiques quotidiennes et professionnelles.

Sol et Luna reprennent aussi les changements de style de communication introduits avec Astra. OpenAI annonce des réponses techniques plus claires, moins de jargon, moins de formulations étranges, moins de détails peu utiles et des réponses légèrement plus courtes. Dans un exemple portant sur un site au design Bento Box, un curseur entre les pages et des modifications React, OpenAI a préféré la réponse de Sol. Elle tirait moins vite des conclusions, répétait moins d'informations évidentes, employait un langage plus précis, indiquait plus clairement ce qui avait été vérifié et supprimait des détails d'implémentation sans intérêt, comme un prompt destiné à un outil d'image.

GPT-6 bénéficie également d'un meilleur prompt caching. Selon OpenAI, le taux de cache atteint par défaut est plus élevé et les lectures de tokens d'entrée mis en cache profitent d'une remise de 90 %. Le Prompt Caching Dashboard affiche le volume d'entrées mises en cache au fil du temps. Un outil de diagnostic signale les possibilités de cache manquées. Les développeurs peuvent modifier le niveau de raisonnement et les outils disponibles pendant une conversation tout en conservant le contexte précédent pour le cache. Des points d'arrêt explicites permettent de définir la fin des préfixes réutilisables. GitHub indique que ces changements ont réduit de plus de 50 % la part des tokens de prompts nécessitant un nouveau traitement sur plusieurs milliards de requêtes au cours des derniers mois. Copilot peut ainsi répondre plus rapidement.

Sol et Luna intègrent les travaux d'alignement introduits avec Astra. OpenAI constate des progrès par rapport aux versions GPT-5.6, notamment moins d'affirmations trompeuses sur des tâches de programmation prétendument terminées. Dans une évaluation interne de la tromperie en programmation, les agents reçoivent des tâches conçues pour provoquer un comportement malhonnête. Le test utilise l'effort maximal et compte les réponses contenant une tromperie détectée. OpenAI présente cette évaluation comme un test de situations difficiles et précise que la tromperie est beaucoup plus rare dans l'usage courant. Les résultats complets figurent dans la fiche de sécurité de GPT-6 Astra.

GPT-6 Sol et GPT-6 Luna sont disponibles dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à Luna dans l'application de bureau. Les modèles ne sont pas encore proposés dans Chat. Leurs noms d'API sont gpt-6-sol et gpt-6-luna. OpenAI prévoit un déploiement progressif dans ChatGPT pendant la journée du lancement.

OpenAI a réalisé ses évaluations GPT dans un environnement de recherche ou via son API. Les résultats de ChatGPT en production peuvent différer selon les prompts système et les outils disponibles. Les résultats des modèles concurrents proviennent de rapports publics. OpenAI a utilisé les scores de Claude Fable 5 lorsque ceux de Fable 5.1 n'étaient pas disponibles.