Nachtrag vom 29. September 2026: OpenAI hat am 3. September 2026 den Nachfolger GPT-6 Astra veröffentlicht und am 22. September (US-Zeit) GPT-6 Sol und GPT-6 Luna. Dieser Artikel vergleicht die Generation davor: GPT-5.6 und GPT-5.5. Wenn er Sol als „Flaggschiff“ oder „Spitzenmodell“ bezeichnet, ist die GPT-5.6-Generation gemeint. Wer heute entscheidet, wohin er von GPT-5.5 wechselt, sollte bei Astra, Sol und Luna aus der GPT-6-Generation anfangen: Stand 30. September 2026 empfiehlt die Modellliste der API im Zweifel Astra, das am 29. September veröffentlichte GPT-6.1 Sol (in ChatGPT in Work und Codex verfügbar, nicht im Chat) für die Balance aus Intelligenz und Kosten und GPT-6 Luna für kostensensible Aufgaben mit hohem Volumen. GPT-5.5 wird am 14. Oktober 2026 aus ChatGPT, ChatGPT Work und Codex zurückgezogen (die OpenAI-API ist nicht betroffen); als Ersatz nennt OpenAI GPT-6 Sol in den bezahlten Plänen und GPT-6 Luna in der Desktop-App für Free und Go (GPT-5.6 Sol, Terra und Luna bleiben während der Übergangszeit verfügbar). Zu den Kosten siehe unseren gemessenen Vergleich von Astra auf low und GPT-5.6 Sol auf high.
Inhaltsverzeichnis
- 1. Was hat sich geändert — von einem Flaggschiff zu drei Modellen
- 2. Spezifikationen auf einen Blick
- 3. Der Terra-Effekt — „5.5-Qualität zu 40 % des Preises“
- 4. Benchmarks — wie viel legte die Generation zu
- 5. Neue Funktionen in 5.6
- 6. Reale Kosten — wie sich die Rechnung durch das Upgrade ändert
- 7. Sollte man wechseln — auf welches Modell umsteigen
- Fazit
- FAQ
Nur zweieinhalb Monate nach GPT-5.5, das am 23. April 2026 veröffentlicht wurde, gab OpenAI am 9. Juli GPT-5.6 allgemein frei. Doch dieses Update ist keine bloße „Leistungssteigerung“. Die größte Änderung ist der Umbau von „einem einzigen Flaggschiff-Modell“ zu einem „Drei-Modell-System aus Luna / Terra / Sol“.
Und für viele GPT-5.5-Nutzer wirkt am stärksten, dass das Mittelklasse-Modell Terra „GPT-5.5-vergleichbare Qualität zu einem weitaus niedrigeren Preis“ bietet. Zum Start war es der halbe Preis, und mit der Preissenkung vom 30. Juli 2026 sind es nur noch 40 % des Stückpreises von GPT-5.5. Wer mehr Leistung will, bekommt das Spitzenmodell Sol (bei gleichem Preis stärker), wer Kosten senken will, greift zu Terra — so entsteht eine echte Wahl. Dieser Artikel ordnet auf Basis offizieller Ankündigungen und unabhängiger Analysen ein, was sich von GPT-5.5 zu 5.6 geändert hat und auf welches Modell man umsteigen sollte.
Von einem Flaggschiff zum Drei-Modell-System
— Wählen zwischen „mehr Leistung“ oder „niedrigerer Rechnung“
Terra bietet „5.5-Qualität zu 40 % des Preises“ / Sol bietet „mehr Leistung zum gleichen Preis“
1. Was hat sich geändert — von einem Flaggschiff zu drei Modellen
GPT-5.5 war zweistufig aufgebaut: „Standard ($5/$30) + teures GPT-5.5 Pro ($30/$180)“. GPT-5.6 baut das zu drei nach Einsatzzweck und Kosten wählbaren Modellen um.
Für Massenverarbeitung, Klassifizierung und leichte Chats. Eine neu geschaffene Position, eine Stufe günstiger als GPT-5.5.
GPT-5.5-vergleichbare Qualität zu 40 % des Preises. Der faktische Nachfolger für alle, „denen 5.5 gereicht hat“.
Das Flaggschiff der GPT-5.6-Generation, das bei gleichem Preis wie GPT-5.5 die Leistung anhebt. Der reine Leistungs-Nachfolger.
Das heißt: Wohin GPT-5.5-Nutzer wechseln, hängt vom Einsatzzweck ab. Wer „bei gleicher Qualität Kosten senken“ will, nimmt Terra; wer „zum gleichen Preis mehr Leistung“ will, nimmt Sol; wer „noch günstiger große Mengen abarbeiten“ will, nimmt Luna. Gegenüber dem einzigen Modell von 5.5 ist die Wahlfreiheit deutlich gewachsen.
2. Spezifikationen auf einen Blick
| Merkmal | GPT-5.5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|
| Release | 23. April 2026 | 9. Juli 2026 | |
| Positionierung | Einzelnes Flaggschiff (+ Pro) | Spitzenmodell | Ausgewogen (5.5-Niveau zu 40 % des Preises) |
| API-Preis | $5 / $30 | $5 / $30 | $2 / $12 |
| Kontext | 1,050,000 | 1,050,000 | 1,050,000 |
| Max. Ausgabe | 128,000 | 128,000 | 128,000 |
| Wissens-Cutoff | 1. Dezember 2025 | 16. Februar 2026 (aktualisiert) | |
| SWE-Bench Pro | 58.6% | 64.6% | 63.4% |
| Reasoning-Effizienz | Basis | laut OpenAI gleiche oder bessere Ergebnisse mit weniger Tokens (keine Zahl zur Einsparung gegenüber GPT-5.5 veröffentlicht) | |
| Reasoning-Steuerung | effort (none–xhigh) | effort (none–max, max ergänzt) | |
* Preise und Spezifikationen basieren auf den Modellseiten von OpenAI (GPT-5.5, GPT-5.6 Sol, GPT-5.6 Terra). Für Sol gilt ab dem 21. August 2026 drei Monate lang ein Aktionspreis von $4/$20. Bei SWE-Bench Pro stammen die 58.6% von GPT-5.5 aus OpenAIs Angaben zum GPT-5.5-Start (April 2026), die 64.6% von Sol aus der Evaluationstabelle, die OpenAI mit GPT-5.6 veröffentlichte (dieselbe Tabelle nennt für GPT-5.5 59.4%). Bei TerminalBench stammen die 82.7% von GPT-5.5 zum Start aus Version 2.0; die GPT-5.6-Tabelle misst auch GPT-5.5 auf 2.1: 85.6% gegenüber 88.8% bei Sol (siehe Kapitel 4).
3. Der Terra-Effekt — „5.5-Qualität zu 40 % des Preises“
Der größte Effekt dieses Updates ist nicht die Leistungssteigerung des Spitzenmodells Sol, sondern vielmehr das Preis-Leistungs-Verhältnis des Mittelklasse-Modells Terra. OpenAI positioniert Terra als das Modell, das „GPT-5.5-vergleichbare Qualität zu etwa dem halben Preis liefert“ (OpenAI).
Gleiche Qualität, 60 % niedrigere Rechnung
Terra: $2.00
→ 60 % günstiger
Terra: $12.00
→ 60 % günstiger
→ keine Einsparungszahl veröffentlicht; wenn es zutrifft, effektive Kosten noch eine Stufe niedriger
* OpenAI gibt an, GPT-5.6 darauf trainiert zu haben, „aus jedem Token mehr nützliche Arbeit herauszuholen“, hat aber keine Zahl zur Einsparung gegenüber GPT-5.5 veröffentlicht. Zum Start lag der Preis bei der Hälfte, mit der Preissenkung vom 30. Juli 2026 sind es 40 % des Stückpreises von GPT-5.5.
Terra ist gewissermaßen das Modell für Nutzer, „denen GPT-5.5 gereicht hat, die aber nur die Rechnung senken wollen“. Wenn sich die Kosten ohne Qualitätsverlust um 60 % senken lassen, wird es zum ersten Migrationsziel für viele bestehende Workloads. Für den Großteil der praktischen Arbeit, die keine Höchstleistung braucht, genügt Terra statt Sol.
4. Benchmarks — wie viel legte die Generation zu
Beim Betrachten des Generationssprungs gilt zu beachten: Was in einer anderen Benchmark-Version gemessen wurde, lässt sich nicht einfach vergleichen. Hier trennen wir „was mit derselben Version vergleichbar ist“ von „was nicht vergleichbar ist“.
Reales Coding: +6 Pkt über die Generation
Fähigkeit, echte GitHub-Issues zu beheben. Über die Generation etwa 6 Punkte besser (Quelle: OpenAI)
Bei der gleichen Metrik SWE-Bench Pro stieg der Wert von 58.6% bei GPT-5.5 auf Sol (64.6%) — um rund 6 Punkte. Die Fähigkeit zur Fehlerbehebung auf produktionsreifem Coding-Niveau ist damit stetig gewachsen. Zu beachten ist jedoch, dass beide Werte aus verschiedenen OpenAI-Ankündigungen stammen: In der mit GPT-5.6 veröffentlichten Evaluationstabelle steht GPT-5.5 bei 59.4% (ein Abstand von rund 5 Punkten).
⚠️ Worauf man beim Vergleich achten sollte
- TerminalBench: Die 82.7% von GPT-5.5 zum Start beziehen sich auf 2.0, die 88.8% von GPT-5.6 Sol auf 2.1; sie lassen sich daher nicht direkt voneinander abziehen. In der GPT-5.6-Evaluationstabelle, die beide auf 2.1 misst, erreicht GPT-5.5 85.6% (ein Abstand von rund 3 Punkten).
- GPQA · FrontierMath: Sie stehen in der GPT-5.6-Evaluationstabelle. Bei GPQA Diamond erreicht Sol 94.6% gegenüber 93.6% bei GPT-5.5, bei FrontierMath Tier 1–3 89% gegenüber 85.3%. Die Werte liegen nahe an der Obergrenze, der Zuwachs ist klein. AIME und MMLU sind nicht aufgeführt.
Diesmal stellt OpenAI neue Agenten-Metriken in den Vordergrund (Agents' Last Exam 53.6, Coding Agent Index 80 usw.). Beim allgemeinen Reasoning bewegt sich GPQA Diamond nahe der Obergrenze nur um 1 Punkt, daher lässt sich „wie viel klüger die Generation geworden ist“ mit den herkömmlichen Benchmarks nur schwer messen — das ist die tatsächliche Lage.
5. Neue Funktionen in 5.6
- Drei-Modell-System (Luna/Terra/Sol) — wählbar nach Einsatzzweck und Kosten. Die größte Änderung.
- Programmatic Tool Calling — eine neue Funktion, bei der das Modell JavaScript generiert, um Tool-Aufrufe zu orchestrieren (Responses API). Komplexe Agenten laufen mit weniger Roundtrips.
- „max“ zum Reasoning-effort hinzugefügt — zusätzlich zu none/low/medium/high/xhigh gibt es nun sechs Stufen mit max.
- ChatGPT Work — ein Agent für den geschäftlichen Einsatz. Die Codex-App ging in der neuen ChatGPT-Desktop-App auf.
- GPT-Live (Vollduplex-Sprache) — natürliche Sprachkonversation, die nicht rundenbasiert ist, sondern unterbrochen werden kann.
- GitHub-Copilot-Unterstützung — Sol/Terra/Luna sind in Copilot auswählbar.
- Aktualisierter Wissens-Cutoff — von Dezember 2025 auf 16. Februar 2026.
6. Reale Kosten — wie sich die Rechnung durch das Upgrade ändert
Der Wechsel zu Terra hat große Auswirkungen auf die Kosten. Vergleichen wir es beispielhaft anhand eines Workloads mit monatlich 100 Mio. Token Input und 20 Mio. Token Output:
Input 100M × $5 + Output 20M × $30
Input 100M × $2 + Output 20M × $12. Mit besserer Token-Effizienz eventuell noch weniger
Allein über den Stückpreis sinkt die Rechnung um rund 60 %. Zusätzlich gibt OpenAI an, dass GPT-5.6 Aufgaben mit weniger Tokens erledigt; trifft das zu, kann die tatsächliche Einsparung über den reinen Preisunterschied hinausgehen (eine Einsparungszahl wurde nicht veröffentlicht). Für Workloads, denen GPT-5.5-vergleichbare Qualität genügt, ist der Wechsel zu Terra nahezu eine reine Kostensenkung.
* Obiges ist eine Überschlagsrechnung auf Basis der Stückpreise. Die tatsächliche Rechnung variiert mit Prompt-Länge, Cache-Nutzung und Ausgabemenge. Es empfiehlt sich, mit den eigenen typischen Anfragen real zu messen.
7. Sollte man wechseln — auf welches Modell umsteigen
| Aktuelle Nutzung von GPT-5.5 | Empfohlenes Migrationsziel | Grund |
|---|---|---|
| Qualität reicht, Kosten senken | Terra | 5.5-vergleichbare Qualität zu 40 % des Preises. Reine Kostensenkung |
| Mehr Leistung beim gleichen Budget | Sol | Beim gleichen Preis $5/$30 steigen SWE-Bench Pro usw. |
| Massenverarbeitung/leichte Arbeit, vor allem günstig | Luna | Neu geschaffene günstigste Stufe zu $0.20/$1.20 |
| Bisher GPT-5.5 Pro ($30/$180) genutzt | Sol | Deutlich günstiger als Pro und für alltägliches hohes Reasoning oft ausreichend |
| Qualität der Code-Fixes hat höchste Priorität | Sol + externer Vergleich | Beim realen Coding kommen auch die Claude-Modelle in Frage |
Der Wechsel selbst erfolgt durch Umstellen der Modell-ID, und die API ist weitgehend kompatibel. Für viele Nutzer ist die optimale Lösung ein zweistufiger Ansatz: „zunächst auf Terra herunterstufen und die Rechnung um 60 % senken, dann nur die Aufgaben, die Leistung brauchen, auf Sol hochstufen“. Gegenüber der Zeit des einzigen Modells 5.5 lassen sich Kosten und Qualität nun leichter feinjustieren.
Fazit
- Die größte Änderung ist die Aufteilung in drei Modelle: vom einzigen Flaggschiff GPT-5.5 zu den zweckgebundenen drei Modellen Luna/Terra/Sol.
- Terra ist der Star: GPT-5.5-vergleichbare Qualität zu 40 % des Preises ($2/$12). Der faktische Nachfolger für bestehende Workloads.
- Sol steigert die Leistung beim gleichen Preis: bei unverändert $5/$30 steigt SWE-Bench Pro von 58.6 auf 64.6% (OpenAI-Angaben, +6 Pkt).
- Auch die Effizienz verbessert sich: laut OpenAI gleiche oder bessere Ergebnisse mit weniger Tokens (keine Zahl zur Einsparung gegenüber GPT-5.5 veröffentlicht).
- Zu beachten: Die TerminalBench-Version unterscheidet sich zwischen den Ankündigungen (auf derselben 2.1 erreicht GPT-5.5 85.6% und Sol 88.8%). Der Zuwachs beim allgemeinen Reasoning wie GPQA ist klein.
- Die optimale Migration: zuerst mit Terra die Rechnung um 60 % senken, nur leistungsbedürftige Aufgaben auf Sol.
FAQ
Q1. Welches Modell nehmen, wenn man von GPT-5.5 wechselt?
Kommt auf den Einsatzzweck an. Für gleiche Qualität bei niedrigeren Kosten Terra (5.5-Niveau zu 40 % des Preises), für mehr Leistung zum gleichen Preis Sol, für Massenverarbeitung, vor allem günstig, Luna. Für viele praktische Aufgaben genügt Terra; optimal ist der zweistufige Ansatz, nur leistungsbedürftige Aufgaben auf Sol hochzustufen.
Q2. Hat Terra wirklich dieselbe Qualität wie GPT-5.5?
OpenAI positioniert es mit „GPT-5.5-vergleichbare Qualität zu etwa dem halben Preis“. In der GPT-5.6-Evaluationstabelle übertrifft Terra GPT-5.5 bei SWE-Bench Pro (63.4% gegenüber 59.4%), liegt aber bei einigen Punkten leicht darunter, etwa bei GPQA Diamond (92.9% gegenüber 93.6%). Der Positionierung nach ist es „der Nachfolger für Zwecke, denen 5.5 gereicht hat“. Wer unsicher ist, vergleicht vor dem Wechsel sicherheitshalber die Ausgaben von Terra und 5.5 real an den eigenen typischen Aufgaben.
Q3. Wie viel klüger ist die Generation geworden?
Bei der gleichen Metrik SWE-Bench Pro von 58.6% auf 64.6% (Sol; beides OpenAI-Angaben) — etwa 6 Punkte besser. TerminalBench wechselte zwischen den Ankündigungen die Version von 2.0 auf 2.1, doch in der Tabelle, die beide auf 2.1 misst, erreicht GPT-5.5 85.6% und Sol 88.8%. GPQA Diamond steigt von 93.6% auf 94.6%, nahe der Obergrenze, der Zuwachs ist also klein. Die Realität lautet: „Klar zugelegt haben reales Coding und Agentenarbeit, allgemeines Reasoning ist nahezu unverändert.“
Q4. Wie stark sinken die Kosten tatsächlich?
Beim Wechsel zu Terra liegt der Stückpreis bei rund 40 % des GPT-5.5-Preises. Bei 100M Input und 20M Output pro Monat überschlägig von $1,100 auf $440 (nach der Preissenkung vom 30. Juli 2026). OpenAI gibt zudem an, dass GPT-5.6 Aufgaben mit weniger Tokens erledigt; trifft das zu, kann die reale Einsparung über den Preisunterschied hinausgehen (eine Einsparungszahl wurde nicht veröffentlicht).
Q5. Ich habe GPT-5.5 Pro genutzt. Was ist der Nachfolger?
Für viele Zwecke genügt Sol ($5/$30, bzw. $4/$20 mit dem Aktionspreis für drei Monate ab dem 21. August 2026). GPT-5.5 Pro war mit $30/$180 teuer, doch Sol bewältigt hohes Reasoning deutlich günstiger. Ob nur für äußerst schwieriges Reasoning noch etwas Pro-Vergleichbares nötig ist, prüft man am besten an den realen Aufgaben.
Q6. Laufen bestehende GPT-5.5-Anwendungen unverändert weiter?
Die API ist weitgehend kompatibel, und der Wechsel gelingt durch Umstellen der Modell-ID. Da es nun drei Modelle gibt, lässt sich durch ein Neudesign, welche Aufgaben Luna/Terra/Sol zugewiesen werden, Kosten und Qualität optimieren. Ein Start bei Terra ist in vielen Fällen sinnvoll.
Q7. Wie unterscheiden sich GPT-5.6 und Modelle anderer Anbieter (Claude)?
Beim realen Coding (SWE-Bench Pro) sind die Claude-Modelle tendenziell stark (selbst in der Evaluationstabelle von OpenAI erreicht Claude Fable 5 80%, Sol 64.6%). Details finden sich in den Vergleichen GPT-5.6 Sol vs Claude Opus 4.8 und vs Claude Fable 5.
Verwandte Artikel
- GPT-5.6 Release — die vollständige Erklärung — Details zu den drei Modellen Luna/Terra/Sol
- GPT-5.5 Release — die vollständige Erklärung — Details zum Vorgängermodell
- GPT-5.6 Sol vs Claude Opus 4.8 im Detailvergleich — Vergleich mit dem damaligen Flaggschiff eines anderen Anbieters
- GPT-5.6 Sol vs Claude Fable 5 im Detailvergleich — Duell der Spitzenmodelle