OpenAI a présenté GPT-6 Astra au début du mois et complète maintenant la gamme avec GPT-6 Sol et GPT-6 Luna. Les deux modèles ont été entraînés avec des méthodes proches de celles utilisées pour Astra. OpenAI annonce des progrès dans le travail professionnel, la fiabilité factuelle, le code, l’usage de l’ordinateur et l’alignement. Sol et Luna ciblent les usages qui demandent davantage d’efficacité économique.
Les tarifs API sont calculés pour 1 million de tokens. GPT-6 Sol passe de 4 à 2 dollars pour les tokens d’entrée et de 20 à 10 dollars pour les tokens de sortie, par rapport à GPT-5.6 Sol. GPT-6 Luna passe de 0,20 à 0,10 dollar en entrée et de 1,20 à 0,50 dollar en sortie, par rapport à GPT-5.6 Luna. OpenAI présente ces changements comme une baisse de 50 % face aux tarifs promotionnels de GPT-5.6. GPT-6 Astra reste le modèle le plus performant de l’entreprise.
Dans AutomationBench 1.0.6, GPT-6 Sol avec un niveau d’effort xhigh obtient 33,2 % pour 0,27 dollar par tâche. GPT-6 Astra à faible effort obtient 30,3 % pour un coût 3,9 fois supérieur à celui de Sol. Claude Opus 5 à effort maximal atteint 26,9 % pour un coût 11,1 fois supérieur. Claude Fable 5.1 avec un recours à Opus 5 obtient 31,4 % pour plus de 8,9 fois le coût de Sol. Le coût du recours n’est pas comptabilisé dans ce dernier chiffre. AutomationBench, publié par Zapier, évalue des workflows de bout en bout avec 47 outils dans les ventes, le marketing, les opérations, le support, la finance et les ressources humaines. Le recours à Opus 5 intervient dans environ 40 % des tâches de Fable 5.1, mais son coût n’est pas indiqué.
Avec un effort élevé, GPT-6 Luna progresse de 5,4 points par rapport à son prédécesseur et réduit de 58 % le coût par tâche. Dans Agents’ Last Exam, GPT-6 Sol à effort maximal obtient 56,4 %. OpenAI indique un coût par tâche inférieur de 60 % à celui de Claude Opus 5 dans cette évaluation.
L’évaluation interne de la fiabilité factuelle repose sur des conversations réelles anonymisées dans lesquelles des utilisateurs avaient signalé des erreurs. GPT-6 Sol commet environ deux fois moins d’erreurs que son prédécesseur et se rapproche de la fiabilité d’Astra pour un coût inférieur. À un niveau d’effort élevé, GPT-6 Luna atteint le niveau de GPT-5.6 Sol pour environ un centième de son coût. OpenAI précise que ces cas ne représentent pas les usages habituels. Les scores ne sont pas corrigés selon la longueur des réponses, et des tests de longueur ont montré une dépendance presque nulle.
OpenAI indique que l’usage quotidien de tokens par ses agents de programmation dépasse 600 dollars pour le chercheur médian et 7 000 dollars au 90e percentile, en valorisant les tokens aux tarifs API. Sur FrontierCode, GPT-6 Sol progresse nettement face à GPT-5.6 Sol et rejoint Claude Fable 5.1 en effort xhigh pour un coût inférieur. Sur DeepSWE v1.1, Sol à effort maximal obtient 68,8 %, contre 69,9 % pour le meilleur résultat de Claude Fable 5 en effort xhigh. Le coût par tâche est environ 80 % inférieur pour Sol. Luna atteint 66,6 % à effort maximal, un niveau comparable à Claude Opus 5 et Fable 5 en effort moyen. Son coût par tâche est inférieur de 93 % à celui d’Opus 5 et de 96 % à celui de Fable 5.
Sur l’évaluation hors ligne OSWorld 2.0, GPT-6 Sol à effort xhigh obtient 60,5 %, contre 60,3 % pour Claude Opus 5 à effort moyen, avec un coût par tâche environ 80 % inférieur. GPT-6 Luna à effort maximal dépasse GPT-5.6 Sol à effort moyen pour un dixième du coût. OpenAI rapporte la récompense partielle du jeu de données hors ligne de la version v2026.08.08.
OpenAI applique aux modèles Sol et Luna des améliorations de communication introduites avec Astra. L’entreprise annonce des réponses techniques plus claires, moins de jargon, moins de formulations étranges et moins de détails peu utiles. Les réponses doivent aussi être légèrement plus courtes. Dans un exemple portant sur un site au style Bento Box et un curseur entre les pages en React, OpenAI préfère la réponse de Sol. Elle tire moins vite des conclusions, répète moins les informations évidentes, explique mieux ce qui a été vérifié et fournit moins de détails d’implémentation superflus.
Le cache de prompts de GPT-6 bénéficie de taux de réutilisation plus élevés par défaut. Les agents peuvent réemployer davantage de contexte, répondre plus vite et obtenir une remise de 90 % sur la lecture des tokens d’entrée mis en cache. Le Prompt Caching Dashboard suit l’usage du cache dans le temps. Un outil de diagnostic explique les occasions manquées. Les développeurs peuvent modifier le niveau de raisonnement et les outils disponibles pendant une conversation tout en conservant le contexte précédent pour le cache. Des points d’arrêt explicites permettent de choisir la fin des préfixes mis en cache. GitHub affirme que ces améliorations ont réduit de plus de 50 % la part des tokens nécessitant un traitement initial sur plusieurs milliards de requêtes adressées aux modèles OpenAI. Copilot doit ainsi répondre plus rapidement.
Les évaluations d’alignement montrent des progrès face aux modèles correspondants de GPT-5.6, notamment moins d’affirmations trompeuses sur le travail de programmation réalisé. Ces tests provoquent volontairement des situations difficiles et ne mesurent pas les taux d’échec habituels. L’évaluation interne de la tromperie en programmation utilise le niveau d’effort maximal. OpenAI renvoie à la system card de GPT-6 Astra pour les résultats complets.
GPT-6 Sol et GPT-6 Luna sont disponibles dans ChatGPT Work et Codex pour les utilisateurs Plus, Pro, Business, Enterprise et Edu. Les utilisateurs Free et Go peuvent accéder à Luna dans l’application de bureau. Les deux modèles ne sont pas encore disponibles dans Chat. Les identifiants API sont gpt-6-sol et gpt-6-luna. OpenAI déploie progressivement l’accès dans ChatGPT au cours de la journée et conseille de réessayer plus tard si les modèles n’apparaissent pas. Les évaluations ont été menées dans l’environnement de recherche d’OpenAI ou via son API. Les résultats peuvent différer dans ChatGPT en production à cause des prompts système et des outils disponibles. Les résultats des concurrents proviennent de rapports publics. OpenAI a utilisé les scores de Claude Fable 5 lorsque ceux de Fable 5.1 n’étaient pas disponibles.




Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.