OpenAI hat GPT-6 Sol und GPT-6 Luna als günstigere Erweiterungen der GPT-6-Familie vorgestellt. GPT-6 Astra, das Anfang dieses Monats erschien, bezeichnet das Unternehmen als sein leistungsfähigstes und am besten ausgerichtetes Modell. Sol und Luna nutzen ähnliche Trainingsmethoden wie Astra und übernehmen Fortschritte bei professioneller Arbeit, Faktentreue, Coding, Computernutzung und Alignment.
Änderungen bei Caching und Inferenz senken laut OpenAI die Betriebskosten. In der Preistabelle werden beide Modelle als 50 Prozent günstiger als ihre Aktionsvarianten von GPT-5.6 ausgewiesen. Die Preise gelten pro eine Million Tokens. Bei GPT-6 Sol sinkt der Input-Preis von $4 auf $2 und der Output-Preis von $20 auf $10. GPT-6 Luna kostet $0,10 für Input und $0,50 für Output, zuvor waren es $0,20 und $1,20. Astra bleibt laut OpenAI das Spitzenmodell für maximale Ergebnisse.
Auf AutomationBench 1.0.6 erreicht GPT-6 Sol bei xhigh-Aufwand 33,2 Prozent bei $0,27 pro Aufgabe. GPT-6 Astra kommt bei niedrigem Aufwand auf 30,3 Prozent und kostet 3,9-mal so viel. Claude Opus 5 erzielt bei maximalem Aufwand 26,9 Prozent und kostet 11,1-mal so viel. Claude Fable 5.1 mit Opus-5-Fallbacks erreicht 31,4 Prozent und kostet mehr als 8,9-mal so viel, wobei die Fallback-Kosten nicht erfasst sind. Der Test bewertet Agenten in Workflows für Vertrieb, Marketing, Betrieb, Support, Finanzen und Personalwesen mit 47 Tools. Fallbacks traten bei rund 40 Prozent der Aufgaben auf. Luna verbessert sich bei hohem Aufwand gegenüber dem Vorgänger um 5,4 Prozentpunkte bei 58 Prozent geringeren Kosten pro Aufgabe. Im Agents' Last Exam erreicht Sol bei maximalem Aufwand 56,4 Prozent. Das liegt über dem höchsten gemeldeten Ergebnis von Claude Opus 5 in diesem Test, bei 60 Prozent geringeren Kosten pro Aufgabe.
Für die interne Prüfung der Faktentreue verwendet OpenAI anonymisierte Gespräche, in denen Nutzer Fehler der Modelle gemeldet hatten. Sol macht ungefähr halb so viele Fehler wie sein Vorgänger und nähert sich bei geringeren Kosten der Zuverlässigkeit von Astra. Luna erreicht bei höherem Aufwand das Ergebnis von GPT-5.6 Sol zu ungefähr einem Hundertstel der Kosten. OpenAI betont, dass die ausgewählten Gespräche Fehler enthielten und den normalen Einsatz nicht abbilden. Die Werte sind nicht um die Antwortlänge bereinigt. Tests mit unterschiedlicher Ausführlichkeit zeigten jedoch kaum einen Zusammenhang zwischen Länge und Ergebnis.
OpenAI berichtet über Fortschritte beim Coding, während Coding-Agenten längere und komplexere Aufgaben übernehmen. Nach API-Preisen bewertet, übersteigt die tägliche Nutzung intern $600 beim mittleren Forscher und $7.000 bei Forschern im 90. Perzentil. Auf FrontierCode verbessert sich Sol deutlich gegenüber GPT-5.6 Sol und erreicht bei xhigh-Aufwand das Niveau von Claude Fable 5.1 zu deutlich geringeren Kosten. Auf DeepSWE v1.1 erzielt Sol bei maximalem Aufwand 68,8 Prozent. Claude Fable 5 kommt bei xhigh-Aufwand auf 69,9 Prozent, während Sol pro Aufgabe rund 80 Prozent weniger kostet. Luna erreicht bei maximalem Aufwand 66,6 Prozent und liegt damit auf dem Niveau von Claude Opus 5 und Fable 5 bei mittlerem Aufwand. In diesen Vergleichen kostet Luna 93 Prozent weniger pro Aufgabe als Opus 5 und 96 Prozent weniger als Fable 5.
Astra bleibt laut OpenAI das führende Modell für Computernutzung. Auf dem Offline-Datensatz von OSWorld 2.0 aus der Version v2026.08.08 erreicht Sol bei xhigh-Aufwand 60,5 Prozent. Claude Opus 5 kommt bei mittlerem Aufwand auf 60,3 Prozent und kostet pro Aufgabe rund 80 Prozent mehr. Luna übertrifft bei maximalem Aufwand GPT-5.6 Sol bei mittlerem Aufwand zu einem Zehntel der Kosten. OSWorld prüft lang laufende Agenten-Workflows für alltägliche und berufliche Computeraufgaben.
Sol und Luna übernehmen außerdem Änderungen an Astras Kommunikationsstil. OpenAI meldet klarere technische Antworten, weniger Fachsprache, weniger ungewöhnliche Formulierungen, weniger Details mit geringem Nutzwert und insgesamt etwas kürzere Antworten. In einem Beispiel mit einem Bento-Box-Webdesign, einem Seitenschieber und React-Arbeiten bevorzugte OpenAI die Antwort von Sol. Sie machte weniger Annahmen, wiederholte weniger offensichtliche Informationen, formulierte genauer, legte ihre Prüfungen offener dar und ließ irrelevante Implementierungsdetails wie einen Prompt für ein Bild-Tool weg.
GPT-6 erhält auch verbessertes Prompt-Caching. Laut OpenAI ist die Trefferquote des Caches standardmäßig höher, und gelesene Input-Tokens aus dem Cache erhalten einen Rabatt von 90 Prozent. Das Prompt Caching Dashboard zeigt das Volumen gecachter Eingaben über die Zeit. Ein eigenes Diagnosetool weist auf verpasste Caching-Möglichkeiten hin. Entwickler können den Reasoning-Aufwand und die verfügbaren Tools während eines Gesprächs ändern, ohne den bisherigen Kontext für die Wiederverwendung zu verlieren. Explizite Cache-Breakpoints geben Kontrolle über das Ende wiederverwendbarer Prompt-Präfixe. GitHub berichtet, dass diese Änderungen über mehrere Monate hinweg den Anteil der Prompt-Tokens mit notwendiger Neuverarbeitung bei Milliarden Anfragen um mehr als 50 Prozent gesenkt haben. Dadurch antwortet Copilot schneller.
Sol und Luna enthalten die mit Astra eingeführten Alignment-Arbeiten. OpenAI meldet gegenüber den GPT-5.6-Versionen Verbesserungen, darunter weniger irreführende Behauptungen über erledigte Coding-Arbeiten. In einer internen Prüfung zu Coding-Täuschung erhalten Agenten Aufgaben, die unehrliches Verhalten provozieren sollen. Der Test läuft mit maximalem Aufwand und zählt Antworten mit erkannter Täuschung. OpenAI bezeichnet den Test als Belastungsprüfung und erklärt, dass Täuschung im normalen Einsatz deutlich seltener vorkommt. Die vollständigen Ergebnisse stehen in der System Card zu GPT-6 Astra.
GPT-6 Sol und GPT-6 Luna sind in ChatGPT Work und Codex für Nutzer von Plus, Pro, Business, Enterprise und Edu verfügbar. Free- und Go-Nutzer können Luna in der Desktop-App verwenden. In Chat sind die Modelle noch nicht verfügbar. Die API-Namen lauten gpt-6-sol und gpt-6-luna. OpenAI will die Modelle am Starttag schrittweise in ChatGPT ausrollen.
OpenAI führte die GPT-Tests in einer Forschungsumgebung oder über die API durch. Die Ergebnisse in ChatGPT können wegen unterschiedlicher System-Prompts und verfügbarer Tools abweichen. Die Werte zu Konkurrenzmodellen stammen aus öffentlich verfügbaren Berichten. Wo Ergebnisse für Claude Fable 5.1 fehlten, verwendete OpenAI Werte für Claude Fable 5.




Kommentare
Noch keine Kommentare — schreib den ersten.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Nichts angekommen? Wirf einen Blick in den Spam-Ordner — und markiere die Mail dort als „Kein Spam“, dann landet sie künftig direkt im Postfach.