Inhaltsverzeichnis
- 1. Release-Überblick — Datum, Verfügbarkeit, Spec-Sheet
- 2. Was ist neu — 5 zentrale Verbesserungen
- 3. Benchmarks — direkter Vergleich mit Claude und Gemini
- 4. GPT-5.5 vs GPT-5.5 Pro — welches solltet ihr nehmen?
- 5. Preise — warum die Verdopplung?
- 6. Verfügbarkeit nach ChatGPT-Plan
- 7. API-Spezifikationen und Entwicklerfunktionen
- 8. Codex-Integration und Super-app-Strategie
- 9. GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro
- 10. Vorsicht — Tendenz zur „Selbstüberschätzung“
- 11. Wann GPT-5.5 die richtige Wahl ist — nach Anwendungsfall
- FAQ
Am 23. April 2026 hat OpenAI „ChatGPT 5.5 (GPT-5.5)“ veröffentlicht. Von OpenAI selbst als „neue Klasse von Intelligenz für real work (echte Arbeit) und KI-Agenten“ bezeichnet, erreicht das Modell 82,7% auf Terminal-Bench 2.0 und zieht damit klar an Anthropics Claude Opus 4.7 (69,4%) und Googles Gemini 3.1 Pro (68,5%) vorbei — mit SOTA (State of the Art) auf 14 Benchmarks.
Gleichzeitig hat sich der API-Listenpreis gegenüber GPT-5.4 verdoppelt ($5/$30 pro MTok), und Claude Opus 4.7 schlägt es weiterhin auf SWE-Bench Pro. Die ehrliche Einschätzung lautet: „das stärkste Modell, aber nicht universell das beste.“ Hinzu kommt eine dokumentierte Tendenz, selbstbewusst Antworten zu geben, auch wenn es etwas nicht weiß — Vorsicht ist deshalb in medizinischen, juristischen und regulierten Bereichen geboten.
Auf Basis von OpenAIs offizieller Veröffentlichung, der OpenAI Developer Docs und mehrerer unabhängiger Benchmark-Reports liefert dieser Artikel die vollständige Analyse: Was ist neu, die Benchmarks, Preise, Plan-Verfügbarkeit, wie es sich gegen Claude und Gemini schlägt und wie ihr das richtige Modell für eure Aufgabe wählt.
GPT-5.5 Release
Eine neue Intelligenzklasse für echte Arbeit und KI-Agenten
1. Release-Überblick — Datum, Verfügbarkeit, Spec-Sheet
| Punkt | Details |
|---|---|
| Offizieller Name | GPT-5.5 (in ChatGPT als „ChatGPT 5.5“ angezeigt) |
| Release-Datum | 23. April 2026 |
| Entwickler | OpenAI |
| Varianten | GPT-5.5 (Standard) / GPT-5.5 Pro (tiefes Reasoning) |
| Kontextfenster | API: 1.050.000 Tokens (~1M) / Codex: 400K Tokens |
| Maximale Ausgabe | 128.000 Tokens |
| Wissensstand (Cutoff) | 1. Dezember 2025 |
| API-Preis (Standard) | $5 / 1M Tokens (Input) / $0,50 (Cached Input) / $30 (Output) |
| API-Preis (Pro) | $30 (Input) / $180 (Output) |
| Aufschlag für lange Prompts | Über 272K Tokens: Input 2x, Output 1,5x |
| Modalitäten | Text Input/Output, Bild-Input (kein Audio oder Video) |
| ChatGPT-Pläne | Plus / Pro / Business / Enterprise (nicht im Free-Plan) |
| Hauptfunktionen | Function Calling, Structured Outputs, Streaming, Reasoning-Effort-Steuerung, Computer Use, MCP-Unterstützung |
2. Was ist neu — 5 zentrale Verbesserungen
1. Vollständiges Retraining des Basismodells (erstmals seit GPT-4.5)
GPT-5.5 ist das erste vollständige Retraining des Basismodells seit GPT-4.5. GPT-5, 5.1, 5.2 und 5.4 waren alle Fine-Tuning-Varianten desselben zugrundeliegenden Basismodells, aber GPT-5.5 wurde von Grund auf neu gebaut. Das Ergebnis sind gleichzeitige Verbesserungen bei Reasoning-Effizienz und aktuellem Wissen.
2. Deutliche Token-Effizienzgewinne (~40% Reduktion)
GPT-5.5 behält dieselbe Pro-Token-Latenz wie GPT-5.4 und reduziert gleichzeitig die für den Abschluss von Codex-Aufgaben benötigten Output-Tokens um etwa 40%. Der Listenpreis hat sich verdoppelt, aber da das Output-Volumen um 40% sinkt, steigen laut OpenAI die Gesamtkosten für dieselbe Arbeit normalerweise weniger stark als erwartet.
OpenAI-Mitgründer Greg Brockman dazu:
„Es ist ein Modell, das mit weniger Tokens schneller und schärfer denkt — genau diese Art Modell, verglichen mit etwas wie 5.4.“
3. ~1M Kontextfenster (API)
Die API-Version wächst auf 1.050.000 Tokens (~1M). Die Codex-Integration liegt bei 400K. ~1M Tokens entsprechen etwa 1.400 Seiten A4-Text. Beachtet aber den nutzungsabhängigen Aufschlag: Prompts über 272K Tokens lösen 2x Input- und 1,5x Output-Preise aus — sehr lange Kontexte erfordern also eine Kostenkalkulation.
4. Fuenfstufige Reasoning-Effort-Steuerung
Die API stellt reasoning.effort mit fünf Stufen bereit:
- none: kein Reasoning (am schnellsten, am günstigsten)
- low: leichtes Reasoning
- medium: Standard (ausgewogen)
- high: tiefes Reasoning (komplexe Aufgaben)
- xhigh: maximales Reasoning (am langsamsten und teuersten, höchste Genauigkeit)
Das spiegelt den output_config.effort-Schalter von Claude Opus 4.7, und die gesamte Branche konvergiert auf „den Aufrufer die Reasoning-Tiefe steuern lassen“.
5. Expert-SWE bei 73,1% — meistert 20-Stunden-Klasse-Aufgaben
Auf OpenAIs neu veröffentlichtem internen Eval Expert-SWE (extrem komplexe Coding-Aufgaben mit einer medianen menschlichen Bearbeitungszeit von 20 Stunden) erreicht GPT-5.5 73,1% — ein Plus von 5,6 Punkten gegenüber den 68,5% von GPT-5.4. Das ist ein großer Sprung für die Zuverlässigkeit langlaufender autonomer Coding-Agenten.
3. Benchmarks — direkter Vergleich mit Claude und Gemini
GPT-5.5 Benchmark-Vergleich (Top 5)
vs Claude Opus 4.7 / Gemini 3.1 Pro
Quelle: offizielle OpenAI-Ankündigung (23. April 2026)
| Benchmark | GPT-5.5 | Claude Opus 4.7 | Gemini 3.1 Pro | Sieger |
|---|---|---|---|---|
| Terminal-Bench 2.0 | 82.7% | 69.4% | 68.5% | 🥇 GPT-5.5 |
| GDPval (44 Berufe, Wissensarbeit) | 84.9% | — | — | 🥇 GPT-5.5 |
| OSWorld-Verified (PC-Automatisierung) | 78.7% | 78.0% | — | 🥇 GPT-5.5 (knapp) |
| BrowseComp | 84.4% (Pro: 90.1%) | — | — | 🥇 GPT-5.5 Pro |
| FrontierMath Tier 4 | 35.4% (Pro: 39.6%) | 22.9% | 16.7% | 🥇 GPT-5.5 |
| SWE-Bench Pro | 58.6% | 64.3% | — | 🥇 Claude Opus 4.7 |
| Tau2-bench Telecom (Kundensupport) | 98.0% | — | — | 🥇 GPT-5.5 |
| GPQA Diamond | 93.6% | — | — | 🥇 GPT-5.5 |
| Expert-SWE (OpenAI intern) | 73.1% | — | — | 🥇 GPT-5.5 |
Fazit: GPT-5.5 hält SOTA auf 14 Benchmarks, Claude auf 4, Gemini auf 2
Über OpenAIs gesamten veröffentlichten Benchmark-Satz hält GPT-5.5 SOTA auf 14 Benchmarks, Claude Opus 4.7 auf 4 und Gemini 3.1 Pro auf 2. Der Gesamtvorsprung gehört klar GPT-5.5.
Allerdings gewinnt Claude Opus 4.7 auf SWE-Bench Pro (produktionsnahe Coding-Aufgaben) weiterhin mit 64,3% gegenüber 58,6% von GPT-5.5. Für Coding-Arbeit lohnt es sich also weiterhin, Modelle nach Aufgabe aufzuteilen.
Drittanbieter-Verifizierung: CodeRabbit Code-Review-Eval
Der unabhängige Code-Review-Service CodeRabbit berichtet folgende Verbesserungen bei GPT-5.5:
- Kuratierter Benchmark: erwartete Issue-Erkennung 58,3% → 79,2%, Präzision 27,9% → 40,6%
- Real-World-Datensatz: Issue-Erkennung 55,0% → 65,0%, Präzision 11,6% → 13,2%
CodeRabbits Einschätzung: „Das Modell bevorzugt lokale Änderungen, bewahrt das Verhalten und konzentriert sich tendenziell auf die tatsächlichen Fehlerstellen.“ Mit anderen Worten — statt umfassender Rewrites neigt es zu zielgerichteten, präzisen Fixes.
4. GPT-5.5 vs GPT-5.5 Pro — welches solltet ihr nehmen?
| Punkt | GPT-5.5 (Standard) | GPT-5.5 Pro |
|---|---|---|
| API-Preis (Input) | $5 / 1M Tokens | $30 / 1M Tokens (6x) |
| API-Preis (Output) | $30 / 1M Tokens | $180 / 1M Tokens (6x) |
| BrowseComp | 84.4% | 90.1% |
| FrontierMath Tier 4 | 35.4% | 39.6% |
| ChatGPT-Pläne | Plus / Pro / Business / Enterprise | nur Pro / Business / Enterprise |
| Geeignet für | Alltagsaufgaben, Coding, Agenten | Wissenschaftliche Forschung, komplexe Mathematik, tiefes Reasoning |
Auswahlkriterien
- Standard-GPT-5.5 wählen: allgemeines Coding, Schreiben, Agent-Workloads, kostenbewusste Nutzung
- GPT-5.5 Pro wählen: Mathematik und wissenschaftliche Forschung, Verfassen von Papern, komplexe Entscheidungen — Genauigkeit vor Kosten
5. Preise — warum die Verdopplung?
API-Preise (Standard-GPT-5.5)
| Punkt | Preis | Hinweise |
|---|---|---|
| Input | $5,00 / 1M Tokens | 2x GPT-5.4 |
| Cached Input | $0,50 / 1M Tokens | 1/10 des regulären Inputs |
| Output | $30,00 / 1M Tokens | 2x GPT-5.4 |
| Lange Prompts (>272K Tokens) | Input 2x, Output 1,5x | Auf die gesamte Session angewendet |
| Batch API / Flex | 50% Rabatt | Für asynchrone Workloads |
| Priority-Verarbeitung | 2,5x | Für Low-Latency-Anforderungen |
| Regionale Verarbeitung (Data Residency) | +10% | Für Compliance-Anwendungen |
Warum die Verdopplung?
OpenAI hat die Preiserhöhung nicht direkt erklärt, aber die wahrscheinlichen Treiber sind:
- Kosten eines vollständigen Basismodell-Retrainings — der erste Neuaufbau seit GPT-4.5
- Einpreisung der Performance-Gewinne — deutliche Verbesserungen auf Terminal-Bench und anderen
- Token-Effizienz gleicht einen Teil aus — 40% weniger Output-Tokens federn den höheren Stückpreis teilweise ab
Für Output-lastige Workloads ergibt sich eine effektive Kostensteigerung von etwa „2x x 0,6 = 1,2x“. Aber bei Input-lastigen Aufgaben (Zusammenfassungen, Analysen) trifft euch die volle 2x-Erhöhung — das im Hinterkopf behalten.
6. Verfügbarkeit nach ChatGPT-Plan
| Plan | Monatlich | GPT-5.5 | GPT-5.5 Pro | Codex |
|---|---|---|---|---|
| Free | $0 | ❌ nein | ❌ nein | ❌ nein |
| Plus | $20/Monat | ✅ ja | ❌ nein | ✅ ja |
| Pro | $200/Monat | ✅ ja | ✅ ja | ✅ inkl. Fast Mode |
| Business | nutzungsbasiert | ✅ ja | ✅ ja | ✅ ja |
| Enterprise | auf Anfrage | ✅ ja | ✅ ja | ✅ ja |
Free-Nutzer bleiben bei GPT-5 (oder 5.4)
GPT-5.5 ist im Free-Plan nicht verfügbar — Free-Nutzer bleiben bei GPT-5 (oder 5.4). Plus ($20/Monat) ist der Einstiegspunkt.
7. API-Spezifikationen und Entwicklerfunktionen
Unterstützte Funktionen
- ✅ Function Calling
- ✅ Structured Outputs (JSON Schema)
- ✅ Streaming
- ✅ Reasoning-Effort-Steuerung (none/low/medium/high/xhigh)
- ✅ Tools: Web Search, File Search, Image Generation, Code Interpreter, Hosted Shell, Apply Patch, Skills, Computer Use, MCP, Tool Search
- ✅ Distillation (auf kleinere Modelle)
- ❌ Fine-Tuning: zum Launch nicht unterstützt
- ❌ Audio- / Video-Input oder -Output: nicht unterstützt
Rate Limits (Tier 5: höchste)
- RPM (Requests pro Minute): 15.000
- TPM (Tokens pro Minute): 40.000.000
- Batch-Queue-Limit: 15.000.000.000
Reasoning-Effort-Beispiel (Python)
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.5",
reasoning={"effort": "high"}, # none/low/medium/high/xhigh
input="Loese dieses komplexe Mathematikproblem Schritt fuer Schritt..."
)
print(response.output_text)
8. Codex-Integration und Super-app-Strategie
Codex Fast Mode
Parallel zum GPT-5.5-Release erhielt Codex einen Fast Mode:
- 1,5x schnellere Verarbeitung
- 2,5x die Kosten (in Credits)
- Verfügbar in den Plänen Pro / Business / Enterprise
Die Super-app-Strategie
OpenAI praesentierte zudem eine „Super-app“-Vision, die „ChatGPT + Codex + KI-Browser“ in einem Angebot bündelt. Geplant ist die Auslieferung als ein einziges Enterprise-Paket — was OpenAI als „Schritt zu agentischerem, intuitiverem Computing“ bezeichnet.
Konzeptionell ist das das „All-in-One-Paket zur Maximierung der Developer Experience“-Muster aus PaaS wie Vercel oder Next.js, übertragen auf den KI-Agent-Bereich.
9. GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro
GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro
Vergleich der drei neuesten Frontier-Modelle
| Punkt | GPT-5.5 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|
| Release | 23. April 2026 | 16. April 2026 | Anfang 2026 |
| API-Input | $5/MTok | $5/MTok | nicht offengelegt |
| API-Output | $30/MTok | $25/MTok | nicht offengelegt |
| Kontext | 1.050K | 1.000K (200K Standard) | 1.000K |
| Wissensstand | 1. Dezember 2025 | ~Anfang 2025 | ~Anfang 2025 |
| SOTA-Benchmarks | 14 | 4 | 2 |
| Terminal-Bench 2.0 | 82.7% | 69.4% | 68.5% |
| SWE-Bench Pro | 58.6% | 64.3% | — |
| FrontierMath T4 | 35.4% | 22.9% | 16.7% |
| Stärken | Agenten, langlaufende Aufgaben, PC-Bedienung | Lange Coding-Sessions, Sicherheit, lange Texte | Multimodal, Google-Workspace-Integration |
Wie wählen
- Beste Gesamtlösung + modernste Agent-Performance — GPT-5.5 (besonders wenn >$30/MTok Output akzeptabel sind)
- Lange autonome Coding-Sessions und sicherheitskritische Arbeit — Claude Opus 4.7 (gewinnt SWE-Bench Pro und hat günstigere Output-Preise)
- Google-Workspace-Integration und Multimodalität — Gemini 3.1 Pro
10. Vorsicht — Tendenz zur „Selbstüberschätzung“
Eine unabhängige Analyse (Handy AI) weist auf eine Tendenz von GPT-5.5 hin, „selbstbewusst Antworten zu geben, auch wenn es etwas nicht weiß“.
„Das Modell weiß mehr, aber es antwortet auch selbstbewusster über Dinge, die es nicht weiß.“
Risikoreiche Anwendungsfälle
- ⚠️ Medizinische Diagnose oder Verschreibungen — Falschinformationen können lebensbedrohlich sein
- ⚠️ Rechtsberatung oder Recherche zu Praezedenzfällen — das Zitieren halluzinierter Fälle ist ein berufsethisches Problem
- ⚠️ Finanzberatung oder Steuerarbeit — regulatorisches Risiko
- ⚠️ Zitate in wissenschaftlichen Texten — bekannte Fälle, in denen nicht existierende Paper zitiert wurden
Gegenmaßnahmen
- Faktenprüfung ist Pflicht — KI-Ausgaben nie unverändert verwenden, sondern gegen Primärquellen verifizieren
- Web-Search-Tool nutzen — das Modell aktuelle Informationen abrufen lassen
- Gegenprüfung mit Claude Opus 4.7 — bei genauigkeitskritischer Arbeit Antworten über mehrere Modelle abgleichen
- Anweisen, „ich weiß es nicht“ zu sagen — per System-Prompt: „Wenn unsicher, sag das ausdrücklich“
11. Wann GPT-5.5 die richtige Wahl ist — nach Anwendungsfall
✅ GPT-5.5 wählen bei
- Langlaufenden autonomen Coding-Agenten — Expert-SWE 73,1% ist Branchenspitze
- PC-Automatisierung / Computer Use — OSWorld 78,7% ist auf Augenhöhe mit Opus 4.7
- Automatisierung des Kundensupports — Tau2-bench 98,0% ist praktisch perfekt
- Fortgeschrittener Mathematik und wissenschaftlicher Forschung — FrontierMath T4 35,4% (deutlich über den 22,9% von Opus 4.7)
- Festlegung auf das OpenAI-Ökosystem — integriert mit ChatGPT, Codex, Operator
❌ GPT-5.5 meiden bei
- Coding auf SWE-Bench-Pro-Niveau in Produktion — Claude Opus 4.7 führt weiterhin
- Genauigkeitskritischer Arbeit (medizinisch, juristisch, finanziell) — Vorsicht bei Halluzinationen
- Kosten als oberster Priorität — $30/MTok Output liegt am oberen Ende
- Wenn ihr eine kostenlose Option wollt — im Free-Plan nicht verfügbar
- Audio- oder Video-Verarbeitung — nur Text + Bild-Input
FAQ
Q1. Wann wurde GPT-5.5 in ChatGPT verfügbar?
Am 23. April 2026 (US-Zeit), in den Plänen Plus, Pro, Business und Enterprise. GPT-5.5 Pro ist auf Pro, Business und Enterprise beschränkt.
Q2. Kann ich GPT-5.5 im Free-Plan nutzen?
Nein. Der Free-Plan bleibt bei GPT-5 (oder 5.4). Für den Zugang zu GPT-5.5 braucht ihr mindestens den Plus-Plan für $20/Monat.
Q3. GPT-5.5 vs Claude Opus 4.7 — welches ist besser?
Insgesamt GPT-5.5 (SOTA auf 14 Benchmarks gegenüber 4 bei Claude). Aber auf SWE-Bench Pro gewinnt Claude Opus 4.7 mit 64,3% gegen 58,6% — für produktionsnahes Coding hat Claude also den Vorsprung. Claude ist auch beim Output günstiger ($25/MTok gegenüber $30/MTok bei GPT-5.5).
Q4. Die API ist teurer geworden — wie halte ich die Kosten unter Kontrolle?
Ja, $5/$30 pro MTok ist 2x GPT-5.4. Aber der Output-Token-Verbrauch sinkt um etwa 40%, sodass die reale Kostensteigerung für Output-lastige Workloads typisch um die 1,2x liegt. Tipps zur Kostenkontrolle:
1. Batch API / Flex nutzen (50% Rabatt)
2. Cached Input nutzen ($0,50/MTok, 1/10 der regulären Rate)
3. reasoning.effort=low für leichtere Aufgaben verwenden
4. Prompts über 272K Tokens vermeiden
Q5. Was ist tatsächlich anders an GPT-5.5 Pro?
Es hat staerkeres Reasoning, mit deutlichen Score-Steigerungen bei komplexer Mathematik (FrontierMath: 35,4% → 39,6%) und wissenschaftlichen Forschungsaufgaben. Der Haken ist der Preis — 6x der API-Tarif ($30 Input / $180 Output). Außerhalb von Forschung und ernsthaftem Verfassen von Papern rechnet sich das Preis-Leistungs-Verhältnis oft nicht.
Q6. Wird Fine-Tuning unterstützt?
Stand April 2026 nein. Distillation (Training kleinerer Modelle aus den Ausgaben) wird unterstützt, sodass ihr GPT-5.5-Ausgaben nutzen könnt, um etwas wie GPT-5 nano zu trainieren.
Q7. Worauf sollte ich bei Verwendung des 1M-Kontexts achten?
Prompts über 272K Tokens lösen einen Aufschlag von 2x Input und 1,5x Output über die gesamte Session aus. Wer eine API rund um 1M-Token-Nutzung designt, sollte die Kosten vorab durchrechnen.
Q8. Wann ist der Wissensstand von GPT-5.5?
1. Dezember 2025. Alles danach (ab Januar 2026) ist nicht in den Trainingsdaten — das Web-Search-Tool ist also faktisch erforderlich für aktuelle Informationen.
Q9. Sind Halluzinationen besser geworden?
Eine unabhängige Analyse besagt: „Die Wissensbasis ist gewachsen, aber auch das Selbstvertrauen des Modells in Dingen, die es nicht weiß.“ OpenAI behauptet offiziell Sicherheitsverbesserungen, aber bei medizinischer, juristischer oder finanzieller Arbeit bleibt Faktenprüfung Pflicht.
Q10. Funktioniert meine bestehende GPT-5-App einfach so?
Die API-Kompatibilität ist erhalten — der Wechsel der Model-ID von gpt-5 auf gpt-5.5 reicht zur Migration. Allerdings lohnt sich ein Design-Durchgang, wenn ihr neue Funktionen nutzen wollt (wie den reasoning.effort-Parameter oder die Pro-Variant-ID).
Zusammenfassung: GPT-5.5 ist das stärkste, aber nicht universell das beste Modell
GPT-5.5 hält SOTA auf 14 Benchmarks und zieht klar an Claude Opus 4.7 und Gemini 3.1 Pro vorbei, um die Branchenspitze zurückzuerobern. Besonders stark ist es bei Agent-Aufgaben, PC-Automatisierung, langlaufendem autonomen Coding sowie Mathematik und wissenschaftlicher Forschung.
Gleichzeitig verliert es auf SWE-Bench Pro weiterhin gegen Claude Opus 4.7, zeigt eine Tendenz zu „selbstbewussten Halluzinationen“ und kommt mit einer Verdopplung des API-Preises — also kein bedingungsloser Sieg.
Die klügere Strategie ist „das richtige Modell — GPT-5.5, Claude Opus 4.7 oder Gemini 3.1 Pro — für die jeweilige Aufgabe wählen.“ Ganz auf das OpenAI-Ökosystem setzen? GPT-5.5. Lange Coding-Sessions und sicherheitskritische Arbeit? Claude. Google-Workspace-Integration? Gemini. Multi-Model-Betrieb wird zum Standard 2026.
Verwandte Artikel
- Claude Opus 4.7 Release im Detail — vollständige Details zum direkten Konkurrenten
- Claude Opus 4.7 Migrationsleitfaden — Wechsel von 4.6 auf 4.7
- Claude vs ChatGPT Preisvergleich — wie sich die Plan-Strukturen vergleichen
- Was ist Next.js? — das React-Framework, das die KI ständig empfiehlt