Am 23. April 2026 hat OpenAI ChatGPT 5.5 (GPT-5.5)“ veröffentlicht. Von OpenAI selbst als „neue Klasse von Intelligenz für real work (echte Arbeit) und KI-Agenten“ bezeichnet, erreicht das Modell 82,7% auf Terminal-Bench 2.0 und zieht damit klar an Anthropics Claude Opus 4.7 (69,4%) und Googles Gemini 3.1 Pro (68,5%) vorbei — mit SOTA (State of the Art) auf 14 Benchmarks.

Gleichzeitig hat sich der API-Listenpreis gegenüber GPT-5.4 verdoppelt ($5/$30 pro MTok), und Claude Opus 4.7 schlägt es weiterhin auf SWE-Bench Pro. Die ehrliche Einschätzung lautet: „das stärkste Modell, aber nicht universell das beste.“ Hinzu kommt eine dokumentierte Tendenz, selbstbewusst Antworten zu geben, auch wenn es etwas nicht weiß — Vorsicht ist deshalb in medizinischen, juristischen und regulierten Bereichen geboten.

Auf Basis von OpenAIs offizieller Veröffentlichung, der OpenAI Developer Docs und mehrerer unabhängiger Benchmark-Reports liefert dieser Artikel die vollständige Analyse: Was ist neu, die Benchmarks, Preise, Plan-Verfügbarkeit, wie es sich gegen Claude und Gemini schlägt und wie ihr das richtige Modell für eure Aufgabe wählt.

GPT

GPT-5.5 Release

Eine neue Intelligenzklasse für echte Arbeit und KI-Agenten

82.7%
Terminal-Bench 2.0
SOTA · schlägt Claude
14
SOTA-Benchmarks
Claude: 4 / Gemini: 2
$5/$30
API-Preis / 1M Tokens
2× GPT-5.4-Preis

1. Release-Überblick — Datum, Verfügbarkeit, Spec-Sheet

PunktDetails
Offizieller NameGPT-5.5 (in ChatGPT als „ChatGPT 5.5“ angezeigt)
Release-Datum23. April 2026
EntwicklerOpenAI
VariantenGPT-5.5 (Standard) / GPT-5.5 Pro (tiefes Reasoning)
KontextfensterAPI: 1.050.000 Tokens (~1M) / Codex: 400K Tokens
Maximale Ausgabe128.000 Tokens
Wissensstand (Cutoff)1. Dezember 2025
API-Preis (Standard)$5 / 1M Tokens (Input) / $0,50 (Cached Input) / $30 (Output)
API-Preis (Pro)$30 (Input) / $180 (Output)
Aufschlag für lange PromptsÜber 272K Tokens: Input 2x, Output 1,5x
ModalitätenText Input/Output, Bild-Input (kein Audio oder Video)
ChatGPT-PlänePlus / Pro / Business / Enterprise (nicht im Free-Plan)
HauptfunktionenFunction Calling, Structured Outputs, Streaming, Reasoning-Effort-Steuerung, Computer Use, MCP-Unterstützung

2. Was ist neu — 5 zentrale Verbesserungen

1. Vollständiges Retraining des Basismodells (erstmals seit GPT-4.5)

GPT-5.5 ist das erste vollständige Retraining des Basismodells seit GPT-4.5. GPT-5, 5.1, 5.2 und 5.4 waren alle Fine-Tuning-Varianten desselben zugrundeliegenden Basismodells, aber GPT-5.5 wurde von Grund auf neu gebaut. Das Ergebnis sind gleichzeitige Verbesserungen bei Reasoning-Effizienz und aktuellem Wissen.

2. Deutliche Token-Effizienzgewinne (~40% Reduktion)

GPT-5.5 behält dieselbe Pro-Token-Latenz wie GPT-5.4 und reduziert gleichzeitig die für den Abschluss von Codex-Aufgaben benötigten Output-Tokens um etwa 40%. Der Listenpreis hat sich verdoppelt, aber da das Output-Volumen um 40% sinkt, steigen laut OpenAI die Gesamtkosten für dieselbe Arbeit normalerweise weniger stark als erwartet.

OpenAI-Mitgründer Greg Brockman dazu:

„Es ist ein Modell, das mit weniger Tokens schneller und schärfer denkt — genau diese Art Modell, verglichen mit etwas wie 5.4.“

3. ~1M Kontextfenster (API)

Die API-Version wächst auf 1.050.000 Tokens (~1M). Die Codex-Integration liegt bei 400K. ~1M Tokens entsprechen etwa 1.400 Seiten A4-Text. Beachtet aber den nutzungsabhängigen Aufschlag: Prompts über 272K Tokens lösen 2x Input- und 1,5x Output-Preise aus — sehr lange Kontexte erfordern also eine Kostenkalkulation.

4. Fuenfstufige Reasoning-Effort-Steuerung

Die API stellt reasoning.effort mit fünf Stufen bereit:

  • none: kein Reasoning (am schnellsten, am günstigsten)
  • low: leichtes Reasoning
  • medium: Standard (ausgewogen)
  • high: tiefes Reasoning (komplexe Aufgaben)
  • xhigh: maximales Reasoning (am langsamsten und teuersten, höchste Genauigkeit)

Das spiegelt den output_config.effort-Schalter von Claude Opus 4.7, und die gesamte Branche konvergiert auf „den Aufrufer die Reasoning-Tiefe steuern lassen“.

5. Expert-SWE bei 73,1% — meistert 20-Stunden-Klasse-Aufgaben

Auf OpenAIs neu veröffentlichtem internen Eval Expert-SWE (extrem komplexe Coding-Aufgaben mit einer medianen menschlichen Bearbeitungszeit von 20 Stunden) erreicht GPT-5.5 73,1% — ein Plus von 5,6 Punkten gegenüber den 68,5% von GPT-5.4. Das ist ein großer Sprung für die Zuverlässigkeit langlaufender autonomer Coding-Agenten.

3. Benchmarks — direkter Vergleich mit Claude und Gemini

GPT-5.5 Benchmark-Vergleich (Top 5)

vs Claude Opus 4.7 / Gemini 3.1 Pro

GPT-5.5 Claude Opus 4.7 Gemini 3.1 Pro
Terminal-Bench 2.0
82.7% ← Sieger
69.4%
68.5%
OSWorld (PC-Steuerung)
78.7% ← Sieger
78.0%
Gemini: keine Daten
SWE-Bench Pro
58.6%
64.3% ← Sieger
Gemini: keine Daten
FrontierMath Tier 4
35.4% ← Sieger
22.9%
16.7%
Tau2-bench Telecom
98.0% ← Sieger
Claude / Gemini: kein direkter Vergleich

Quelle: offizielle OpenAI-Ankündigung (23. April 2026)

BenchmarkGPT-5.5Claude Opus 4.7Gemini 3.1 ProSieger
Terminal-Bench 2.082.7%69.4%68.5%🥇 GPT-5.5
GDPval (44 Berufe, Wissensarbeit)84.9%🥇 GPT-5.5
OSWorld-Verified (PC-Automatisierung)78.7%78.0%🥇 GPT-5.5 (knapp)
BrowseComp84.4% (Pro: 90.1%)🥇 GPT-5.5 Pro
FrontierMath Tier 435.4% (Pro: 39.6%)22.9%16.7%🥇 GPT-5.5
SWE-Bench Pro58.6%64.3%🥇 Claude Opus 4.7
Tau2-bench Telecom (Kundensupport)98.0%🥇 GPT-5.5
GPQA Diamond93.6%🥇 GPT-5.5
Expert-SWE (OpenAI intern)73.1%🥇 GPT-5.5

Fazit: GPT-5.5 hält SOTA auf 14 Benchmarks, Claude auf 4, Gemini auf 2

Über OpenAIs gesamten veröffentlichten Benchmark-Satz hält GPT-5.5 SOTA auf 14 Benchmarks, Claude Opus 4.7 auf 4 und Gemini 3.1 Pro auf 2. Der Gesamtvorsprung gehört klar GPT-5.5.

Allerdings gewinnt Claude Opus 4.7 auf SWE-Bench Pro (produktionsnahe Coding-Aufgaben) weiterhin mit 64,3% gegenüber 58,6% von GPT-5.5. Für Coding-Arbeit lohnt es sich also weiterhin, Modelle nach Aufgabe aufzuteilen.

Drittanbieter-Verifizierung: CodeRabbit Code-Review-Eval

Der unabhängige Code-Review-Service CodeRabbit berichtet folgende Verbesserungen bei GPT-5.5:

  • Kuratierter Benchmark: erwartete Issue-Erkennung 58,3% → 79,2%, Präzision 27,9% → 40,6%
  • Real-World-Datensatz: Issue-Erkennung 55,0% → 65,0%, Präzision 11,6% → 13,2%

CodeRabbits Einschätzung: „Das Modell bevorzugt lokale Änderungen, bewahrt das Verhalten und konzentriert sich tendenziell auf die tatsächlichen Fehlerstellen.“ Mit anderen Worten — statt umfassender Rewrites neigt es zu zielgerichteten, präzisen Fixes.

4. GPT-5.5 vs GPT-5.5 Pro — welches solltet ihr nehmen?

PunktGPT-5.5 (Standard)GPT-5.5 Pro
API-Preis (Input)$5 / 1M Tokens$30 / 1M Tokens (6x)
API-Preis (Output)$30 / 1M Tokens$180 / 1M Tokens (6x)
BrowseComp84.4%90.1%
FrontierMath Tier 435.4%39.6%
ChatGPT-PlänePlus / Pro / Business / Enterprisenur Pro / Business / Enterprise
Geeignet fürAlltagsaufgaben, Coding, AgentenWissenschaftliche Forschung, komplexe Mathematik, tiefes Reasoning

Auswahlkriterien

  • Standard-GPT-5.5 wählen: allgemeines Coding, Schreiben, Agent-Workloads, kostenbewusste Nutzung
  • GPT-5.5 Pro wählen: Mathematik und wissenschaftliche Forschung, Verfassen von Papern, komplexe Entscheidungen — Genauigkeit vor Kosten

5. Preise — warum die Verdopplung?

API-Preise (Standard-GPT-5.5)

PunktPreisHinweise
Input$5,00 / 1M Tokens2x GPT-5.4
Cached Input$0,50 / 1M Tokens1/10 des regulären Inputs
Output$30,00 / 1M Tokens2x GPT-5.4
Lange Prompts (>272K Tokens)Input 2x, Output 1,5xAuf die gesamte Session angewendet
Batch API / Flex50% RabattFür asynchrone Workloads
Priority-Verarbeitung2,5xFür Low-Latency-Anforderungen
Regionale Verarbeitung (Data Residency)+10%Für Compliance-Anwendungen

Warum die Verdopplung?

OpenAI hat die Preiserhöhung nicht direkt erklärt, aber die wahrscheinlichen Treiber sind:

  1. Kosten eines vollständigen Basismodell-Retrainings — der erste Neuaufbau seit GPT-4.5
  2. Einpreisung der Performance-Gewinne — deutliche Verbesserungen auf Terminal-Bench und anderen
  3. Token-Effizienz gleicht einen Teil aus — 40% weniger Output-Tokens federn den höheren Stückpreis teilweise ab

Für Output-lastige Workloads ergibt sich eine effektive Kostensteigerung von etwa „2x x 0,6 = 1,2x“. Aber bei Input-lastigen Aufgaben (Zusammenfassungen, Analysen) trifft euch die volle 2x-Erhöhung — das im Hinterkopf behalten.

6. Verfügbarkeit nach ChatGPT-Plan

PlanMonatlichGPT-5.5GPT-5.5 ProCodex
Free$0❌ nein❌ nein❌ nein
Plus$20/Monat✅ ja❌ nein✅ ja
Pro$200/Monat✅ ja✅ ja✅ inkl. Fast Mode
Businessnutzungsbasiert✅ ja✅ ja✅ ja
Enterpriseauf Anfrage✅ ja✅ ja✅ ja

Free-Nutzer bleiben bei GPT-5 (oder 5.4)

GPT-5.5 ist im Free-Plan nicht verfügbar — Free-Nutzer bleiben bei GPT-5 (oder 5.4). Plus ($20/Monat) ist der Einstiegspunkt.

7. API-Spezifikationen und Entwicklerfunktionen

Unterstützte Funktionen

  • ✅ Function Calling
  • ✅ Structured Outputs (JSON Schema)
  • ✅ Streaming
  • ✅ Reasoning-Effort-Steuerung (none/low/medium/high/xhigh)
  • ✅ Tools: Web Search, File Search, Image Generation, Code Interpreter, Hosted Shell, Apply Patch, Skills, Computer Use, MCP, Tool Search
  • ✅ Distillation (auf kleinere Modelle)
  • ❌ Fine-Tuning: zum Launch nicht unterstützt
  • ❌ Audio- / Video-Input oder -Output: nicht unterstützt

Rate Limits (Tier 5: höchste)

  • RPM (Requests pro Minute): 15.000
  • TPM (Tokens pro Minute): 40.000.000
  • Batch-Queue-Limit: 15.000.000.000

Reasoning-Effort-Beispiel (Python)

from openai import OpenAI
client = OpenAI()

response = client.responses.create(
    model="gpt-5.5",
    reasoning={"effort": "high"},  # none/low/medium/high/xhigh
    input="Loese dieses komplexe Mathematikproblem Schritt fuer Schritt..."
)

print(response.output_text)

8. Codex-Integration und Super-app-Strategie

Codex Fast Mode

Parallel zum GPT-5.5-Release erhielt Codex einen Fast Mode:

  • 1,5x schnellere Verarbeitung
  • 2,5x die Kosten (in Credits)
  • Verfügbar in den Plänen Pro / Business / Enterprise

Die Super-app-Strategie

OpenAI praesentierte zudem eine „Super-app“-Vision, die „ChatGPT + Codex + KI-Browser“ in einem Angebot bündelt. Geplant ist die Auslieferung als ein einziges Enterprise-Paket — was OpenAI als „Schritt zu agentischerem, intuitiverem Computing“ bezeichnet.

Konzeptionell ist das das „All-in-One-Paket zur Maximierung der Developer Experience“-Muster aus PaaS wie Vercel oder Next.js, übertragen auf den KI-Agent-Bereich.

9. GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro

GPT-5.5 vs Claude Opus 4.7 vs Gemini 3.1 Pro

Vergleich der drei neuesten Frontier-Modelle

GPT-5.5

Veröffentlicht am 23. April 2026

Preis (Eingabe/Ausgabe)
$5 / $30 pro MTok
Kontext
1.050.000 Tokens
SOTA-Anzahl
14
Stärken
◎ Agenten · PC-Steuerung
◎ Mathematik · wissenschaftliche Forschung
◎ Kundensupport-Automatisierung
Schwäche
△ Tendenz zu Halluzinationen
Claude Opus 4.7

Veröffentlicht am 16. April 2026

Preis (Eingabe/Ausgabe)
$5 / $25 pro MTok
Kontext
200K Standard / 1M erweitert
SOTA-Anzahl
4
Stärken
◎ SWE-Bench Pro 64,3 %
◎ Langzeit-autonomes Coding
◎ Sicherheit · Genauigkeit
Schwäche
△ Schwächer in der agentischen Gesamtleistung
Gemini 3.1 Pro

Veröffentlicht Anfang 2026

Preis (Eingabe/Ausgabe)
Nicht veröffentlicht (Tier-basiert)
Kontext
1.000.000 Tokens
SOTA-Anzahl
2
Stärken
◎ Multimodal in allen Bereichen
◎ Google Workspace Integration
◎ Videoverständnis
Schwäche
△ Coding etwas schwächer
PunktGPT-5.5Claude Opus 4.7Gemini 3.1 Pro
Release23. April 202616. April 2026Anfang 2026
API-Input$5/MTok$5/MToknicht offengelegt
API-Output$30/MTok$25/MToknicht offengelegt
Kontext1.050K1.000K (200K Standard)1.000K
Wissensstand1. Dezember 2025~Anfang 2025~Anfang 2025
SOTA-Benchmarks1442
Terminal-Bench 2.082.7%69.4%68.5%
SWE-Bench Pro58.6%64.3%
FrontierMath T435.4%22.9%16.7%
StärkenAgenten, langlaufende Aufgaben, PC-BedienungLange Coding-Sessions, Sicherheit, lange TexteMultimodal, Google-Workspace-Integration

Wie wählen

  • Beste Gesamtlösung + modernste Agent-Performance — GPT-5.5 (besonders wenn >$30/MTok Output akzeptabel sind)
  • Lange autonome Coding-Sessions und sicherheitskritische Arbeit — Claude Opus 4.7 (gewinnt SWE-Bench Pro und hat günstigere Output-Preise)
  • Google-Workspace-Integration und Multimodalität — Gemini 3.1 Pro

10. Vorsicht — Tendenz zur „Selbstüberschätzung“

Eine unabhängige Analyse (Handy AI) weist auf eine Tendenz von GPT-5.5 hin, „selbstbewusst Antworten zu geben, auch wenn es etwas nicht weiß“.

„Das Modell weiß mehr, aber es antwortet auch selbstbewusster über Dinge, die es nicht weiß.“

Risikoreiche Anwendungsfälle

  • ⚠️ Medizinische Diagnose oder Verschreibungen — Falschinformationen können lebensbedrohlich sein
  • ⚠️ Rechtsberatung oder Recherche zu Praezedenzfällen — das Zitieren halluzinierter Fälle ist ein berufsethisches Problem
  • ⚠️ Finanzberatung oder Steuerarbeit — regulatorisches Risiko
  • ⚠️ Zitate in wissenschaftlichen Texten — bekannte Fälle, in denen nicht existierende Paper zitiert wurden

Gegenmaßnahmen

  1. Faktenprüfung ist Pflicht — KI-Ausgaben nie unverändert verwenden, sondern gegen Primärquellen verifizieren
  2. Web-Search-Tool nutzen — das Modell aktuelle Informationen abrufen lassen
  3. Gegenprüfung mit Claude Opus 4.7 — bei genauigkeitskritischer Arbeit Antworten über mehrere Modelle abgleichen
  4. Anweisen, „ich weiß es nicht“ zu sagen — per System-Prompt: „Wenn unsicher, sag das ausdrücklich“

11. Wann GPT-5.5 die richtige Wahl ist — nach Anwendungsfall

✅ GPT-5.5 wählen bei

  • Langlaufenden autonomen Coding-Agenten — Expert-SWE 73,1% ist Branchenspitze
  • PC-Automatisierung / Computer Use — OSWorld 78,7% ist auf Augenhöhe mit Opus 4.7
  • Automatisierung des Kundensupports — Tau2-bench 98,0% ist praktisch perfekt
  • Fortgeschrittener Mathematik und wissenschaftlicher Forschung — FrontierMath T4 35,4% (deutlich über den 22,9% von Opus 4.7)
  • Festlegung auf das OpenAI-Ökosystem — integriert mit ChatGPT, Codex, Operator

❌ GPT-5.5 meiden bei

  • Coding auf SWE-Bench-Pro-Niveau in Produktion — Claude Opus 4.7 führt weiterhin
  • Genauigkeitskritischer Arbeit (medizinisch, juristisch, finanziell) — Vorsicht bei Halluzinationen
  • Kosten als oberster Priorität — $30/MTok Output liegt am oberen Ende
  • Wenn ihr eine kostenlose Option wollt — im Free-Plan nicht verfügbar
  • Audio- oder Video-Verarbeitung — nur Text + Bild-Input

FAQ

Q1. Wann wurde GPT-5.5 in ChatGPT verfügbar?

Am 23. April 2026 (US-Zeit), in den Plänen Plus, Pro, Business und Enterprise. GPT-5.5 Pro ist auf Pro, Business und Enterprise beschränkt.

Q2. Kann ich GPT-5.5 im Free-Plan nutzen?

Nein. Der Free-Plan bleibt bei GPT-5 (oder 5.4). Für den Zugang zu GPT-5.5 braucht ihr mindestens den Plus-Plan für $20/Monat.

Q3. GPT-5.5 vs Claude Opus 4.7 — welches ist besser?

Insgesamt GPT-5.5 (SOTA auf 14 Benchmarks gegenüber 4 bei Claude). Aber auf SWE-Bench Pro gewinnt Claude Opus 4.7 mit 64,3% gegen 58,6% — für produktionsnahes Coding hat Claude also den Vorsprung. Claude ist auch beim Output günstiger ($25/MTok gegenüber $30/MTok bei GPT-5.5).

Q4. Die API ist teurer geworden — wie halte ich die Kosten unter Kontrolle?

Ja, $5/$30 pro MTok ist 2x GPT-5.4. Aber der Output-Token-Verbrauch sinkt um etwa 40%, sodass die reale Kostensteigerung für Output-lastige Workloads typisch um die 1,2x liegt. Tipps zur Kostenkontrolle:
1. Batch API / Flex nutzen (50% Rabatt)
2. Cached Input nutzen ($0,50/MTok, 1/10 der regulären Rate)
3. reasoning.effort=low für leichtere Aufgaben verwenden
4. Prompts über 272K Tokens vermeiden

Q5. Was ist tatsächlich anders an GPT-5.5 Pro?

Es hat staerkeres Reasoning, mit deutlichen Score-Steigerungen bei komplexer Mathematik (FrontierMath: 35,4% → 39,6%) und wissenschaftlichen Forschungsaufgaben. Der Haken ist der Preis — 6x der API-Tarif ($30 Input / $180 Output). Außerhalb von Forschung und ernsthaftem Verfassen von Papern rechnet sich das Preis-Leistungs-Verhältnis oft nicht.

Q6. Wird Fine-Tuning unterstützt?

Stand April 2026 nein. Distillation (Training kleinerer Modelle aus den Ausgaben) wird unterstützt, sodass ihr GPT-5.5-Ausgaben nutzen könnt, um etwas wie GPT-5 nano zu trainieren.

Q7. Worauf sollte ich bei Verwendung des 1M-Kontexts achten?

Prompts über 272K Tokens lösen einen Aufschlag von 2x Input und 1,5x Output über die gesamte Session aus. Wer eine API rund um 1M-Token-Nutzung designt, sollte die Kosten vorab durchrechnen.

Q8. Wann ist der Wissensstand von GPT-5.5?

1. Dezember 2025. Alles danach (ab Januar 2026) ist nicht in den Trainingsdaten — das Web-Search-Tool ist also faktisch erforderlich für aktuelle Informationen.

Q9. Sind Halluzinationen besser geworden?

Eine unabhängige Analyse besagt: „Die Wissensbasis ist gewachsen, aber auch das Selbstvertrauen des Modells in Dingen, die es nicht weiß.“ OpenAI behauptet offiziell Sicherheitsverbesserungen, aber bei medizinischer, juristischer oder finanzieller Arbeit bleibt Faktenprüfung Pflicht.

Q10. Funktioniert meine bestehende GPT-5-App einfach so?

Die API-Kompatibilität ist erhalten — der Wechsel der Model-ID von gpt-5 auf gpt-5.5 reicht zur Migration. Allerdings lohnt sich ein Design-Durchgang, wenn ihr neue Funktionen nutzen wollt (wie den reasoning.effort-Parameter oder die Pro-Variant-ID).

Zusammenfassung: GPT-5.5 ist das stärkste, aber nicht universell das beste Modell

GPT-5.5 hält SOTA auf 14 Benchmarks und zieht klar an Claude Opus 4.7 und Gemini 3.1 Pro vorbei, um die Branchenspitze zurückzuerobern. Besonders stark ist es bei Agent-Aufgaben, PC-Automatisierung, langlaufendem autonomen Coding sowie Mathematik und wissenschaftlicher Forschung.

Gleichzeitig verliert es auf SWE-Bench Pro weiterhin gegen Claude Opus 4.7, zeigt eine Tendenz zu „selbstbewussten Halluzinationen“ und kommt mit einer Verdopplung des API-Preises — also kein bedingungsloser Sieg.

Die klügere Strategie ist „das richtige Modell — GPT-5.5, Claude Opus 4.7 oder Gemini 3.1 Pro — für die jeweilige Aufgabe wählen.“ Ganz auf das OpenAI-Ökosystem setzen? GPT-5.5. Lange Coding-Sessions und sicherheitskritische Arbeit? Claude. Google-Workspace-Integration? Gemini. Multi-Model-Betrieb wird zum Standard 2026.

Verwandte Artikel