Prompt is too long bedeutet in Claude Code, dass die gesendete Eingabe die Kontextgrenze überschreitet. Die aktuelle interaktive Oberfläche kann auch Context limit reached anzeigen. Unterscheiden Sie zunächst zwischen einem langen Verlauf, der sich verdichten lässt, und einer bereits zu großen ersten Eingabe. Die folgenden Meldungen sind Beispiele; die Zahlen dienen der Veranschaulichung.

Prompt is too long

# Beispiel einer API-Fehlermeldung:
prompt is too long: 233153 tokens > 200000 maximum

Zur Eingabe gehören nicht nur die gerade getippten Wörter, sondern auch Gesprächsverlauf, gelesene Dateien, Werkzeugergebnisse und Anweisungen. Bei 233153 tokens > 200000 maximum überschreiten 233.153 Eingabetokens die erlaubten 200.000. Das Kontextfenster umfasst sowohl Eingabe als auch die für diese Antwort erzeugte Ausgabe; dieser Fehler bedeutet, dass bereits die Eingabe zu groß ist. Die Lösung unterscheidet sich von einem usage limit durch ausgeschöpftes Plankontingent.

Bei langem Verlauf /compact verwenden, bei zu großer erster Eingabe diese verkleinern und bei gemeldetem Verdichtungsfehler zuerst dessen Ursache beheben. Das sind die grundlegenden Wege zurück zur Arbeit. Automatische Verdichtung ist standardmäßig aktiv, verhindert aber nicht garantiert jeden Überlauf. Dieser Artikel erläutert Ursachen, Schritte sowie Bedingungen für 200K und 1M anhand der am 21. September 2026 geprüften offiziellen Claude-Code-Fehlerbeschreibung und API-Spezifikation. Direkte API-Aufrufe werden getrennt behandelt.

„Zu lang“ kann unterschiedliche Reduktionen erfordern

Mitten in einem langen Gespräch

Früheren Verlauf zusammenfassen. Füllt sich das Fenster unmittelbar danach wieder, große Lesevorgänge aufteilen.

Schon die erste Eingabe ist zu groß

Es gibt keinen früheren Verlauf zum Zusammenfassen. Mit kleineren eingefügten Texten, Anhängen, Anweisungen und weniger Werkzeuglast beginnen.

Die Verdichtung selbst scheitert

Zuerst die zusätzlich genannte Ursache beheben, etwa Authentifizierung oder ein nicht verfügbares Modell. Bloßes Wiederholen hilft nicht.

/context zeigt die Fensterbelegung, /usage den Verbrauch im Zeitraum oder das Plankontingent. Beides betrifft Tokens, aber unterschiedliche Messgrößen.

1. Was dieser Fehler bedeutet

Das Kontextfenster begrenzt die Informationsmenge, die ein Modell für eine Antwort berücksichtigen und erzeugen kann. Gezählt werden Tokens, nicht Zeichen; neben der Eingabe zählen aktuelle Ausgabe und Denktokens. Auch aus dem API-Cache gelesene Eingabe belegt das Fenster. Caching verändert Preis oder Verarbeitung, macht die Belegung aber nicht null. Grundlage ist Anthropics Kontextfenster-Spezifikation.

Prompt is too long tritt auf, wenn bereits die gesendete Eingabe allein nicht ins Fenster passt. Selbst eine kurze Frage kann Teil einer großen Anfrage sein, wenn alte Gesprächsteile oder Dateien mitgeschickt werden. Deshalb reicht es möglicherweise nicht, nur die letzte Frage zu kürzen. Grundlagen: Was ist ein Kontextfenster?

Nahe der Grenze entfernt Claude Code ältere Werkzeugausgaben und fasst bei Bedarf das Gespräch zusammen. Eine riesige eingefügte Eingabe, deaktivierte automatische Verdichtung oder ein Authentifizierungsfehler beim Verdichten können trotzdem zum Stillstand führen. Erneutes Lesen derselben großen Datei kann das Fenster sofort wieder füllen. Bestimmen Sie die Ursache nicht allein danach, ob automatische Verdichtung aktiv ist. Lesen Sie die vollständige Fehlermeldung und prüfen Sie die unmittelbar vorher geladenen Inhalte.

2. Was füllt das Kontextfenster?

Die folgende Übersicht folgt der Erklärung zur Arbeitsweise von Claude Code. Das gespeicherte Gesprächsprotokoll ist nicht identisch mit dem aktuell an das Modell gesendeten Inhalt. Das Entfernen alter Werkzeugergebnisse und Zusammenfassungen verändern das aktive Fenster.

BestandteilInhalt im FensterPrüfansatz
GesprächsverlaufIn der aktuellen Anfrage gesendete Beiträge. Nach Verdichtung sind Teile durch Zusammenfassungen ersetzt/compact für dieselbe Aufgabe, /clear für eine unabhängige nächste
Dateien und WerkzeugergebnisseGelesene Inhalte, Suchergebnisse, Befehlsausgaben und ÄhnlichesSuche eingrenzen, relevante Zeilen lesen oder Detailrecherche an einen Subagenten auslagern
MCPWerkzeugnamen und Serveranweisungen. Tool Search lädt detaillierte Definitionen standardmäßig bei BedarfReale Belegung mit /context prüfen und ungenutzte Server über /mcp deaktivieren
CLAUDE.md und SpeicherGeltende Anweisungen und geladene Erinnerungen. Nicht alle Dateien des automatischen Speichers sind ständig enthaltenDauerhaft nötige Regeln kurz halten und aufgabenspezifische Erklärungen trennen
SkillsÜblicherweise Beschreibungen beim Start und Inhalte bei Nutzung. Einstellungen können auch Beschreibungen verzögert ladenUnnötige Kandidaten für automatische Aufrufe und zu lange Inhalte prüfen
SystemanweisungenBetriebsanweisungen von Claude Code oder der VerbindungsumgebungZuerst eigene Anweisungen, Anhänge und Werkzeuge prüfen

Dass jede MCP-Verbindung sofort sämtliche ausführlichen Werkzeugdefinitionen lädt, entspricht nicht dem heutigen Standardverhalten. Bei deaktivierter Tool Search, konfiguriertem Vorladen oder nicht unterstützter Verbindung können Definitionen jedoch vorab geladen werden. Prüfen Sie Ihre Bedingungen in der offiziellen Tool-Search-Konfigurationstabelle. /context ist aussagekräftiger als eine Schätzung allein nach Serverzahl.

Subagenten recherchieren in einem eigenen Fenster und können Ergebnisse liefern, ohne sämtliche Zwischenausgaben in das Hauptgespräch zu bringen. Allerdings belegen zurückgelieferte Zusammenfassungen und Schlussfolgerungen das Fenster des übergeordneten Agenten. Vollständiges Abschreiben der Recherche schmälert den Nutzen. Geben Sie benötigte Ergebnisse vor, etwa „Nur relevante Dateien und Zeilen, Fazit und offene Punkte zurückgeben“. Die Gestaltung behandelt Context Engineering.

/context zeigt die Belegung des aktuellen Fensters, /usage den Tokenverbrauch und die Plannutzung. Dessen Kostenanzeige ist eine Schätzung, keine endgültige Rechnung. In unterstützten Umgebungen untersucht /skill-doctor auch Skill-Belegung, hat aber Verfügbarkeitsbedingungen. Fehlt der Befehl, beginnen Sie mit /context. Messschritte stehen unter Was verbraucht Ihren Kontext?, Bereitstellungsbedingungen in der offiziellen Befehlsliste.

3. Kontextgrößen: 200K und 1M

200K sind 200.000 Tokens, 1M eine Million. Prüfen Sie jedoch Modellkapazität, von Claude Code für die Verbindung verwendete Kapazität, Schwelle der automatischen Verdichtung und Preisbedingungen getrennt. /status zeigt Modell und Konto, /model die verfügbaren Optionen.

Kapazität und Nutzungsbedingungen getrennt betrachten

Beispiele mit 200K

Modelle wie Sonnet 4.5. Auch ein 1M-fähiges Modell kann je nach Verbindung oder Einstellung zum Deaktivieren von 1M von Claude Code als 200K behandelt werden.

Beispiele mit 1M

Beispiele auf der Anthropic API: Fable-Familie, Sonnet 5 und Opus ab 4.7. Teilweise gilt 1M standardmäßig; [1m] muss nicht immer ergänzt werden.

Quelle: Anthropics Modellkonfiguration und erweiterter Kontext. Der Beginn automatischer Verdichtung hängt von Modell und Einstellungen ab.

Bei Abonnements ist Opus 1M in Max, Team und Enterprise enthalten; Opus 1M unter Pro sowie Sonnet 4.6 1M in Abonnements benötigen Nutzungsguthaben. Sonnet 5 mit direkter Verbindung zur Anthropic API wird anders behandelt: auf allen Plänen standardmäßig 1M, ohne zusätzliches Nutzungsguthaben und ohne Auswahl von [1m]. Gateways und Einstellungen zum Deaktivieren von 1M schaffen Ausnahmen. Entscheiden Sie nicht allein nach dem Modellnamen.

„Standardpreis“ für 1M bedeutet, dass für mehr als 200K kein zusätzlicher Langkontext-Aufschlag je Token berechnet wird. Es bedeutet nicht unbegrenzt mehr Eingabe zum gleichen Gesamtpreis. Mehr verarbeitete Tokens erhöhen den Verbrauch. Ob 1M im Plan enthalten ist oder über Guthaben abgerechnet wird, ist eine weitere getrennte Frage.

Auch das Verhältnis von Zeichen zu Tokens hängt von Modell und Inhalt ab. Nehmen Sie für neuere Modelle keine pauschale prozentuale Erhöhung an, sondern nutzen Sie bei API-Aufrufen die Tokenzählung des Zielmodells. Manche Aufgaben brauchen größere Fenster; zuvor irrelevante Protokolle und doppelte Anweisungen zu entfernen erleichtert die Kapazitätsentscheidung.

4. Jetzt weiterarbeiten

Wählen Sie nach der Situation: gewachsener Verlauf oder hinzugefügte große Datei. Die folgenden Maßnahmen sind nach Priorität geordnet.

FIXES

Platz im Fenster schaffen

1. /compact bei vorhandenem Verlauf
Gesprächsverlauf zusammenfassen und Platz schaffen. Ein Schwerpunkt ist möglich, etwa /compact Auf den Authentifizierungsfehler konzentrieren. Das reduziert die Last und erhält Kontext.
2. /clear beim Wechsel zu einer anderen Aufgabe
Das Gespräch neu beginnen. Nötige Entscheidungen vorher festhalten. Projektdateien werden dabei nicht gelöscht.
3. Große Lesevorgänge auslagern
Große Dateien in Zeilenbereichen lesen oder einen Subagenten im eigenen Fenster recherchieren lassen und nur Ergebnisse übernehmen.
4. Wiederholt geladene Inhalte reduzieren
Mit /context die Aufteilung prüfen, dann unnötige MCP-Server deaktivieren und CLAUDE.md kürzen. Ausführliche Abläufe getrennt bei Bedarf lesen.
5. Bei tatsächlichem Bedarf ein 1M-Modell
Für wirklich große Aufgaben, etwa eine umfangreiche Codebasis, mit /model ein Modell mit 1M-Kontext wählen. Zuerst Schritte 1–4 durchführen. Automatische Verdichtung nicht deaktivieren, sondern standardmäßig eingeschaltet lassen.

1 bei langem Verlauf, 2 vor einer unabhängigen nächsten Aufgabe. Bei zu großer erster Eingabe helfen 3 und 4. Wird eine Ursache für fehlgeschlagene Verdichtung genannt, beheben Sie diese zuerst.

Scheitert /compact mit Error during compaction: Conversation too long, fehlt laut offizieller Erklärung Platz für die erzeugte Zusammenfassung. Leeren Sie das Eingabefeld, drücken Sie zweimal Esc und wählen Sie in der Liste einen Beitrag vor der großen Eingabe, um das Gespräch zurückzusetzen. Zweimaliges Drücken allein springt nicht automatisch mehrere Beiträge zurück. Prüfen Sie bei einer Option, die auch Code zurücksetzt, deren Umfang. Versuchen Sie danach erneut zu verdichten; reicht der Platz weiterhin nicht, beginnen Sie nach /clear mit kleinerer Eingabe. Bedingungen: offizielle Tastatursteuerung.

Folgen auf automatic compaction failed Authentifizierungsfehler oder ein nicht verfügbares Modell, beheben Sie dies vor dem Freiräumen. Not enough messages to compact. bedeutet, dass zu wenig früherer Verlauf zum Zusammenfassen vorhanden ist. Reduzieren Sie Anhänge oder eingefügten Text, statt die Verdichtung zu wiederholen. Füllt sich das Fenster sofort wieder, begrenzen Sie die letzten großen Protokolle oder Dateien auf benötigte Teile.

Bei direkter Nutzung der API

/compact und /clear sind Claude-Code-Aktionen, keine Steuerbefehle für die Messages API. Prüfen Sie bei API-Nutzung die gesendeten messages, system, tools und Anhänge und schätzen Sie die Eingabe mit der Tokenzählungs-API des Zielmodells. Verkleinern Sie die Anfrage: alten Verlauf zusammenfassen, relevante Dokumentteile auswählen, unnötige Definitionen entfernen. Schneiden Sie nicht so ab, dass Werkzeugaufrufe und zugehörige Ergebnisse getrennt werden. API-seitige Verdichtung für lange Gespräche existiert ebenfalls, hat aber andere Modell- und Einstellungsbedingungen als Claude-Code-Befehle.

Prüfen Sie nach der Wiederherstellung zuerst eine kleine Anfrage und ergänzen Sie Informationen schrittweise. Dieselbe große Eingabe erneut zu senden und zu warten vergrößert keine Kapazität. Regelmäßige Pflege behandelt Tokensparen in Claude Code.

5. Ähnliche Fehler unterscheiden

Zu große Eingabe, eingestellte Ausgabegrenze, während der Erzeugung erreichtes Fenster und Verbrauch im Zeitraum sind verschiedene Probleme. Lesen Sie Fehlertext oder stop_reason der API, statt nur nach einer scheinbar abgeschnittenen Antwort zu urteilen.

SymptomBedeutungWichtigste Maßnahme
Prompt is too long / N tokens > M maximumThema dieses Artikels: Eingabe überschreitet das Kontextfenster/compact, /clear, große Lesevorgänge an Subagenten auslagern oder 1M-Modell nutzen
Antwort endet vorzeitig (stop_reason: max_tokens)Die Ausgabe hat den angefragten Wert max_tokens erreichtAPI-Ausgabeeinstellung und Modellgrenze prüfen oder Fortsetzung anfordern
stop_reason: model_context_window_exceededEingabe plus Ausgabe erreicht während der Generierung die FenstergrenzeEingabe reduzieren und Ausgaberaum schaffen
usage limit reachedPlankontingent ausgeschöpft, unabhängig vom TokenfensterReset abwarten; Umgang mit Nutzungslimits
Usage credits required for 1M contextEine Frage der Berechtigung: Der gewählte 1M-Kontext ist nicht im Plan enthalten, kein Eingabeüberlauf oder ausgeschöpftes KontingentGuthaben aktivieren und neu starten oder mit /model zum Standardfenster wechseln

Laut Anthropic akzeptiert die API ab Claude 4.5 Anfragen, deren Eingabe selbst passt, auch wenn Eingabe plus angefragtes max_tokens das Fenster überschreiten. Wird die Fenstergrenze während der Generierung erreicht, lautet der Stoppgrund model_context_window_exceeded. Daher beweist eine kurze Antwort allein nicht den Stoppgrund max_tokens. Weitere Probleme: häufige Claude-Code-Fehler.

6. Vorbeugende Checkliste

Vor der Arbeit: Mit /context geladene Inhalte prüfen. Große Dokumente über Suche oder Zeilenbereiche eingrenzen, nicht gleich vollständig einfügen. Bei ausgelagerter Recherche auch den Umfang der Rückmeldung des Subagenten festlegen.

Während der Arbeit: Automatische Verdichtung normalerweise aktiv lassen. Falls sie deaktiviert wurde, /config und geltende Einstellungen prüfen. Achten Sie auf erneutes Laden derselben Inhalte nach jeder Verdichtung. Häufigere manuelle Verdichtung ist nicht automatisch besser: der richtige Zeitpunkt für /compact und die Angabe zu bewahrender Entscheidungen sind wichtig.

Zwischen Aufgaben: Vor einer unabhängigen Aufgabe nötige Informationen in Dateien sichern und mit /clear ein neues Gespräch beginnen. Das alte Gespräch bleibt gespeichert; denselben riesigen Verlauf zur Wiederherstellung fortzusetzen kann aber die Ursache zurückbringen. In CLAUDE.md nur ständig benötigte Regeln behalten.

Eigene Verbindungen: Bei Gateway oder eigener Modell-ID prüfen, ob das von Claude Code angenommene Fenster zur tatsächlichen Kapazität passt. Eine höhere Konfigurationszahl vergrößert das echte Modellfenster nicht. Prüfen Sie die offiziellen Einstellungen für eigene Modelle mit der Administration.

Zusammenfassung

Prompt is too long betrifft die gesamte Eingabe mit Verlauf und Anhängen, nicht nur den letzten Satz. Wählen Sie situationsabhängig: /compact bei langem Verlauf, kleinere anfängliche Eingabe oder Behebung der eigentlichen Verdichtungsstörung.

Detaillierte MCP-Definitionen werden standardmäßig bei Bedarf geladen. Prüfen Sie den aktuellen Inhalt mit /context, statt allein nach Serverzahl zu urteilen. Bei 1M Modell-, Verbindungs- und Planbedingungen prüfen; Kapazität, Preis und Verdichtungsschwelle trennen. Bei direkter API-Nutzung Anfrage und Stoppgrund prüfen, nicht Claude-Code-Befehle verwenden.

FAQ

F. Sind „Prompt is too long“ und „usage limit reached“ dasselbe?
A. Nein. Ersteres betrifft die Kontextgrenze einer Anfrage, Letzteres das Plankontingent. Bei Eingabeüberlauf verkleinern Sie die gesendeten Inhalte. /clear stellt das Plankontingent nicht wieder her.

F. Warum tritt das trotz automatischer Verdichtung auf?
A. Mögliche Ursachen sind riesige Eingabe, fehlender früherer Verlauf, fehlgeschlagene Verdichtung oder sofortiges Wiederauffüllen. Beschränken Sie die Diagnose nicht auf zwei Möglichkeiten. Prüfen Sie vollständige Fehlermeldung und letzte Lesevorgänge; genannte Ursachen wie Authentifizierungsfehler zuerst beheben.

F. Auch /compact scheitert mit „Conversation too long“.
A. Laut offizieller Erklärung fehlt Platz für die Zusammenfassung. Eingabefeld leeren, zweimal Esc drücken, einen früheren Beitrag aus der Liste wählen und das Gespräch zurücksetzen, dann erneut versuchen. Reicht das nicht, nötige Informationen sichern und nach /clear kleiner beginnen. Vor dem Zurücksetzen von Code den Umfang prüfen.

F. Hilft der Wechsel zu einem 1M-Modell?
A. Wenn die nötige Eingabe hineinpasst, kann er helfen. Bedingungen unterscheiden sich nach Modell, Verbindung und Plan. Standardpreise je Token bedeuten bei mehr Verarbeitung keinen gleichbleibenden Gesamtpreis. Unnötigen Verlauf und große Ausgaben zuerst zu reduzieren erleichtert die Kapazitätswahl.

F. Wie finde ich heraus, was das Fenster belegt?
A. In Claude Code mit /context. Das ist etwas anderes als kumulierter Verbrauch oder Kontingente in /usage. Manche MCP-Definitionen laden bei Bedarf; die Verbindungszahl allein genügt nicht. Bei API-Nutzung die Eingabe mit der Tokenzählungs-API des Zielmodells schätzen.