OpenAI hat Anfang des Monats GPT-6 Astra vorgestellt und ergänzt die Familie nun um GPT-6 Sol und GPT-6 Luna. Beide Modelle wurden laut OpenAI mit ähnlichen Verfahren wie Astra trainiert. Das Unternehmen meldet Fortschritte bei professioneller Arbeit, Faktentreue, Programmierung, Computernutzung und Alignment. Sol und Luna sollen leistungsfähige Modelle für unterschiedliche Kosten- und Nutzungsszenarien bereitstellen.

Die API-Preise gelten pro 1 Million Tokens. GPT-6 Sol kostet 2 US-Dollar für Eingaben und 10 US-Dollar für Ausgaben. GPT-5.6 Sol lag bei 4 beziehungsweise 20 US-Dollar. Bei GPT-6 Luna sinken die Preise von 0,20 auf 0,10 US-Dollar für Eingaben und von 1,20 auf 0,50 US-Dollar für Ausgaben. OpenAI gibt für beide Modelle eine Senkung um 50 Prozent gegenüber den Aktionspreisen von GPT-5.6 an. GPT-6 Astra bleibt laut Unternehmen das leistungsstärkste Modell der Familie.

Im AutomationBench 1.0.6 erzielte GPT-6 Sol bei höchstem Aufwand 33,2 Prozent bei Kosten von 0,27 US-Dollar pro Aufgabe. GPT-6 Astra erreichte bei niedrigem Aufwand 30,3 Prozent und kostete das 3,9-Fache von Sol. Claude Opus 5 kam bei maximalem Aufwand auf 26,9 Prozent und kostete das 11,1-Fache. Claude Fable 5.1 mit Opus-5-Fallback erzielte 31,4 Prozent bei mehr als dem 8,9-Fachen der Sol-Kosten. Die Fallback-Kosten sind in diesem Wert nicht enthalten. AutomationBench testet End-to-End-Workflows mit 47 Tools in Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen. Der Benchmark stammt von Zapier. Bei rund 40 Prozent der Aufgaben wurde ein Opus-5-Fallback genutzt, dessen Kosten in der Fable-5.1-Angabe fehlen.

GPT-6 Luna verbessert sich bei hohem Aufwand gegenüber dem Vorgänger um 5,4 Prozentpunkte. Die Kosten pro Aufgabe sinken dabei um 58 Prozent. In Agents’ Last Exam erreicht GPT-6 Sol bei maximalem Aufwand 56,4 Prozent. OpenAI gibt für diesen Wert 60 Prozent niedrigere Kosten pro Aufgabe als bei Claude Opus 5 an.

OpenAIs interne Untersuchung zur Faktentreue basiert auf anonymisierten realen ChatGPT-Gesprächen, in denen Nutzer frühere Fehler gemeldet hatten. GPT-6 Sol macht ungefähr halb so viele Fehler wie sein Vorgänger und nähert sich bei deutlich geringeren Kosten der Zuverlässigkeit von Astra. GPT-6 Luna erreicht bei höherem Aufwand das Niveau von GPT-5.6 Sol zu ungefähr einem Hundertstel der Kosten. Die Testfälle bilden keine typische Nutzung ab. Die Werte wurden nicht nach Antwortlänge kontrolliert, und zusätzliche Tests zeigten kaum einen Zusammenhang mit der Länge.

OpenAI berichtet, dass der tägliche Tokenverbrauch für Coding-Agenten, zu API-Preisen bewertet, bei einem mittleren Forschenden über 600 US-Dollar und beim 90. Perzentil über 7.000 US-Dollar liegt. Auf FrontierCode verbessert sich GPT-6 Sol deutlich gegenüber GPT-5.6 Sol und erreicht bei xhigh-Aufwand das Niveau von Claude Fable 5.1 bei geringeren Kosten. In DeepSWE v1.1 erzielt Sol bei maximalem Aufwand 68,8 Prozent. Claude Fable 5 erreichte dort seinen besten Wert mit 69,9 Prozent bei xhigh-Aufwand, bei rund 80 Prozent höheren Kosten pro Aufgabe. GPT-6 Luna kommt bei maximalem Aufwand auf 66,6 Prozent. Das liegt auf dem Niveau von Claude Opus 5 und Fable 5 bei mittlerem Aufwand. Luna kostet pro Aufgabe 93 Prozent weniger als Opus 5 und 96 Prozent weniger als Fable 5.

Im Offline-Test OSWorld 2.0 erreicht GPT-6 Sol bei xhigh-Aufwand 60,5 Prozent. Claude Opus 5 kommt bei mittlerem Aufwand auf 60,3 Prozent. Sol kostet pro Aufgabe dabei ungefähr 80 Prozent weniger. GPT-6 Luna übertrifft bei maximalem Aufwand GPT-5.6 Sol bei mittlerem Aufwand zu einem Zehntel der Kosten. Gemeldet wird der Teilbelohnungswert des Offline-Sets aus der Version v2026.08.08.

OpenAI überträgt Verbesserungen aus Astra auch auf die Kommunikation von Sol und Luna. Das Unternehmen erwartet klarere technische Antworten, weniger Fachjargon, weniger ungewöhnliche Formulierungen und weniger Details mit geringem Nutzen. Die Antworten sollen zudem etwas kürzer ausfallen. In einem Beispiel zu einem Bento-Box-Webdesign mit einem Seitenschieber in React bevorzugte OpenAI die Antwort von Sol. Sie traf weniger vorschnelle Annahmen, wiederholte weniger Offensichtliches, machte Prüfungen transparenter und enthielt weniger unnötige Implementierungsdetails.

Das Prompt-Caching für GPT-6 soll standardmäßig höhere Trefferquoten erreichen. Anwendungen können mehr Kontext wiederverwenden, schneller antworten und erhalten auf zwischengespeicherte Eingabe-Tokens einen Rabatt von 90 Prozent. Das Prompt Caching Dashboard zeigt die Nutzung über die Zeit. Ein Diagnosewerkzeug erklärt verpasste Cache-Chancen. Entwickler können den Reasoning-Aufwand und verfügbare Tools während eines Gesprächs ändern, ohne den bisherigen Kontext für die Wiederverwendung zu verlieren. Explizite Breakpoints legen das Ende zwischengespeicherter Prompt-Präfixe fest. GitHub meldet, dass diese Verbesserungen über mehrere Monate hinweg den Anteil der Prompt-Tokens mit erneuter Verarbeitung bei Milliarden Anfragen an OpenAI-Modelle um mehr als 50 Prozent reduziert haben. Copilot soll dadurch schneller antworten.

Alignment-Tests zeigen laut OpenAI Verbesserungen gegenüber den GPT-5.6-Pendants. Dazu gehören weniger irreführende Aussagen über geleistete Programmierarbeit. Die Tests erzeugen gezielt schwierige Situationen und bilden keine normalen Fehlerraten ab. Die interne Untersuchung zu Täuschung beim Programmieren lief mit maximalem Aufwand. Die vollständigen Ergebnisse stehen laut OpenAI in der System Card zu GPT-6 Astra.

GPT-6 Sol und GPT-6 Luna sind in ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer verfügbar. Free- und Go-Nutzer können Luna in der Desktop-App verwenden. In Chat sind die Modelle noch nicht verfügbar. Die API-Namen lauten gpt-6-sol und gpt-6-luna. OpenAI schaltet den Zugang zu ChatGPT im Tagesverlauf schrittweise frei und empfiehlt einen späteren Versuch, falls die Modelle zunächst fehlen. Die Tests liefen in der Forschungsumgebung von OpenAI oder über dessen API. Produktionsversionen von ChatGPT können wegen abweichender System-Prompts und Tools andere Ergebnisse liefern. Vergleichswerte für andere Modelle stammen aus öffentlichen Berichten. Wo Ergebnisse für Claude Fable 5.1 fehlten, verwendete OpenAI Werte von Claude Fable 5.