Inhaltsverzeichnis
- 1. 1M-Unterstützung ist überall — aber „bis zum Ende lesen“ ist etwas anderes
- 2. Was ist Kontext? — Behälter und Inhalt trennen
- 3. Die Behältergröße liest man an drei Zahlen ab
- 4. Drei Gründe, warum „größer ist besser“ nicht stimmt
- 5. Die Kostenfalle — Modelle, deren Preis bei langen Eingaben springt, und Modelle, bei denen er gleich bleibt
- 6. Fünf Spartaktiken — sortiert nach Wirkung für Solo-Devs
- Zusammenfassung
- FAQ
2023 galt ein Kontextfenster von 32K Tokens als „großzügig“. Heute wird bei Spitzenmodellen ein Fenster der 1-Million-Token-Klasse (1M) einfach vorausgesetzt. Stand September 2026 nennen Anthropic, OpenAI und Google in den offiziellen Spezifikationen ihrer Topmodelle jeweils ein Eingabelimit von rund einer Million Tokens. Konkrete Modellnamen und Zahlen ändern sich mit jedem Release, deshalb überlasse ich sie der Liste aktueller Modelle und Stichtage sowie den offiziellen Seiten der Anbieter. Dieser Artikel konzentriert sich auf das, was einen Generationswechsel übersteht: wie man die Zahlen liest und wie man mit ihnen arbeitet.
„Eine Million Tokens“ entspricht in etwa 8–10 englischen Taschenbüchern oder Zehntausenden Zeilen Quellcode. So viel können wir jetzt in einer einzigen Sitzung „im Blick“ behalten. Doch dass ein Dokument in den Behälter passt, heißt nicht, dass das Modell es auch vollständig liest. Die Werte, die OpenAI für seinen Multi-Needle-Benchmark für lange Kontexte (MRCR) veröffentlicht, zeigen: Dasselbe Modell schneidet schlechter ab, je länger die Eingabe wird, und wie stark, unterscheidet sich deutlich nach Modell und Generation (mehr dazu in §1 und §4).
Meine Einschätzung gleich vorab: Die Ära, in der man ein Modell allein nach Behältergröße auswählt, ist vorbei. Worauf es ankommt, ist das Trio aus „effektivem Kontext × Kosten × Art der Zufuhr“. Dieser Artikel erklärt, was Kontext eigentlich ist, wie man ein Datenblatt liest, warum „größer“ allein nicht reicht, wie man den effektiven Bereich für den eigenen Anwendungsfall misst, wie Preise bei langen Eingaben springen, sowie fünf Spartaktiken, die Solo-Entwickler und kleine Teams heute anwenden können — mit offiziellen Zahlen und veröffentlichten Benchmark-Werten.
In drei Jahren ist der Behälter um das 250-Fache gewachsen
— Zeitleiste: wie 1M vom Luxus zur Grundausstattung wurde
Aber „unterstützt“ und „bis zum Ende gelesen“ sind zweierlei. Im Long-Context-Benchmark MRCR (8 Nadeln) von OpenAI fällt GPT-5.5 von 98,1 % bei 4K–8K auf 74,0 % bei 512K–1M.
Wie tief es geht, hängt von Modell und Generation ab (Bewertungstabelle in OpenAIs „Introducing GPT-5.5“ vom 23. April 2026; Details in §1 und §4).
1. 1M-Unterstützung ist überall — aber „bis zum Ende lesen“ ist etwas anderes
Die 1M-Unterstützung hat sich in den letzten zwei Jahren rasch verbreitet. Im April 2025 erschien OpenAIs GPT-4.1 mit rund 1,05 Millionen Tokens, im August 2025 erreichte Anthropics Claude Sonnet 4 (als Beta) 1 Million, und Stand September 2026 nennen die Topmodelle von Anthropic, OpenAI und Google alle rund eine Million Tokens in ihren offiziellen Spezifikationen. 2023 wirkten 32K noch großzügig — das ist mehr als das 30-Fache in nur drei Jahren. Das Rennen um die Behältergröße schien entschieden.
Schaut man sich jedoch die Long-Context-Werte an, die die Anbieter selbst veröffentlichen, wird das Bild komplizierter. Vollständige Werte nach Länge gibt es für OpenAIs MRCR v2 (8 Nadeln). Der Test versteckt in einem langen Gespräch mit einer KI acht gleichartige Bitten — etwa „Schreib ein Gedicht über Tapire“ — und verlangt dann genau eine davon zurück, zum Beispiel „Gib das 2. Gedicht zurück“. Weil das Modell fast identische Einträge samt ihrer Reihenfolge auseinanderhalten muss, ist das ein Multi-Needle-Needle-in-a-Haystack-Test. Bewertet wird, wie genau der zurückgegebene Text mit dem richtigen übereinstimmt. Die Ergebnisse nach Länge:
- GPT-5.5: 98,1 % bei 4K–8K, 87,5 % bei 128K–256K, 74,0 % bei 512K–1M
- GPT-5.4 (die Vorgängergeneration in derselben Tabelle): 97,3 % → 79,3 % → 36,6 % in denselben drei Bereichen
- Claude Opus 4.7 (Werte, die OpenAI in dieselbe Tabelle aufgenommen hat): 59,2 % bei 128K–256K, 32,2 % bei 512K–1M
- GPT-6 Astra (vorgestellt im September 2026): 100,0 % bei 256K–512K, 96,3 % bei 512K–1M (GPT-5.6 Sol in derselben Tabelle: 91,5 % und 73,8 %)
Quellen (geprüft am 26. September 2026): Bewertungstabellen in OpenAIs „Introducing GPT-5.5“ (23. April 2026) und „GPT-6 Astra“ (3. September 2026). Funktionsweise des Benchmarks: Datensatzbeschreibung von OpenAI MRCR. Modellnamen zum Zeitpunkt der jeweiligen Ankündigung.
Zwei Dinge fallen auf. Erstens: Dasselbe Modell schneidet schlechter ab, je länger die Eingabe wird. Zweitens: Wie steil es abfällt, unterscheidet sich stark nach Modell und Generation — im Bereich nahe 1M fiel GPT-5.4 unter 40 %, während das im September 2026 vorgestellte GPT-6 Astra über 90 % blieb. Die Rangfolge ändert sich mit jeder Generation, die Zahlen selbst veralten also schnell. Was bleibt, ist die Lehre: Das beworbene Limit und der Bereich, in dem die Genauigkeit tatsächlich hält, sind zwei verschiedene Zahlen.
Nicht falsch verstehen: Es geht nicht darum, dass „Claude oder GPT schlecht“ wären. Anwendungsfälle, die wirklich die vollen 1M brauchen, sind seltener, als man denkt. Liest ein Modell stabil bis 300K (etwa 2–3 Bücher), passt fast jede Programmier-, Recherche- oder Zusammenfassungsaufgabe hinein. Das Problem ist, nur nach der Zahl „1M unterstützt“ zu wählen — so landet man bei den falschen Entscheidungskriterien.
2. Was ist Kontext? — Behälter und Inhalt trennen
Kurz zur Terminologie. In diesem Bereich werden drei Begriffe gerne verwechselt.
Token, Window, Kontext
Kurz: „Window = Behältergröße“, „Kontext = Inhalt“, „Token = Einheit“.
Ein großer Behälter mit unaufgeräumtem Inhalt liefert auch nur unaufgeräumte Antworten.
Außerdem: Verwechseln Sie „Kontext“ nicht mit „Memory“. Kontext lebt innerhalb der Sitzung — schließen Sie den Chat, ist er weg. Funktionen wie ChatGPT Memory oder Claude Memory hingegen sind ein separater sitzungsübergreifender Speichermechanismus. Memory-Inhalte werden zwar irgendwann ins Kontextfenster eingespeist, aus Nutzersicht handelt es sich aber um persistenten Speicher gegenüber kurzlebigem Arbeitsbereich.
3. Die Behältergröße liest man an drei Zahlen ab
Wer das Datenblatt eines Modells betrachtet, muss beim Kontext nur drei Dinge prüfen. Hat man die im Griff, lässt sich jedes Modell nach demselben Verfahren vergleichen.
Die Zahl, die im Prospekt am größten gedruckt ist. Aber „was hineinpasst“ ist nicht „was gelesen wird“ — der effektiv nutzbare Wert liegt deutlich darunter, wie der nächste Abschnitt zeigt.
Wird oft übersehen, ist aber eine Größenordnung kleiner als das Eingabelimit. Selbst bei den wichtigsten Modellen (Stand September 2026) kann man 1 Million Tokens hineingeben, bekommt aber nur etwa 65K–128K zurück. Bei Aufgaben wie „Schreib dieses lange Dokument komplett um“ stößt man zuerst an dieses Limit.
Pauschal über das gesamte Fenster, oder springt der Preis ab einer Schwelle? Im Produktivbetrieb ist das der wirksamste Faktor überhaupt — und im Datenblatt steht er meist nicht. In §5 rechnen wir es durch.
Unten stehen die Werte von den offiziellen Seiten der Anbieter, Stand 29. September 2026. Die Zahlen ändern sich mit jeder Generation — lesen Sie das als Praxisbeispiel dafür, wie die drei Achsen oben zu echten Unterschieden werden. Die aktuellen Modellnamen finden Sie in der Liste aktueller Modelle und Stichtage, die Zahlen auf den offiziellen Seiten der Anbieter.
| Modellfamilie (Beispiele, Stand Sept. 2026) | Eingabelimit | Ausgabelimit | Preis bei langen Eingaben |
|---|---|---|---|
| Anthropic, Oberklasse (Claude Fable 5.1, Opus 5.5, Sonnet 5.5) | 1.000.000 | 128.000 | Gleicher Preis bis zum Limit |
| Anthropic, leichtgewichtig (Claude Haiku 4.5) | 200.000 | 64.000 | — |
| OpenAI (GPT-6 Astra, Sol) | 1.050.000 | 128.000 | Eingaben über 272K: die gesamte Anfrage zu 2x Eingabe- und 1,5x Ausgabepreis |
| Google (Gemini 3.1 Pro, Preview) | 1.048.576 | 65.536 | Über 200K: Eingabe 2 $→4 $, Ausgabe 12 $→18 $ |
Quellen (abgerufen am 29. September 2026): Anthropic Models overview und Pricing / OpenAI-Modellseiten zu GPT-6 Astra und GPT-6 Sol / Google Gemini 3.1 Pro Preview und Gemini API pricing
In der Tabelle sind die Eingabelimits bei allen Anbietern nahezu gleich; Unterschiede gibt es bei den Ausgabelimits und der Form der Preisgestaltung. Sind die Limits gleich, ist die Fenstergröße kein Auswahlgrund mehr. Was sich wirklich unterscheidet: Anthropic behält denselben Preis bis zum Limit, während OpenAI und Google ihn ab einer bestimmten Länge anheben. Unter demselben Etikett „1M unterstützt“ ist also verschieden, wie unbeschwert man lange Eingaben schicken kann. Das ist kein bloßes Preisdetail, sondern spiegelt unterschiedliche Ansätze für Long-Context-Workloads wider. Das Kostenkapitel rechnet es durch.
In der Praxis sieht die Auswahl so aus. Entscheiden Sie nach der Größe der Dokumente, mit denen Sie regelmäßig arbeiten. Passen sie unter etwa 200K, wählen Sie nach der Stabilität der Genauigkeit in diesem Bereich und danach, ob Sie unter einer Preisschwelle bleiben — nicht nach der Fenstergröße. Erst wenn Sie ständig riesige Dokumente über 300K verarbeiten, werden die Breite des effektiven Bereichs und der Preis für lange Eingaben zum Auswahlkriterium. Legen Sie sich nicht auf ein Modell fest — teilen Sie nach Anwendungsfall auf. Diese Art der Entscheidung gilt unabhängig davon, welche Generation gerade aktuell ist.
Wo man die Limits prüft
Prüfen Sie die Zahlen auf den offiziellen Seiten der Anbieter, nicht auf Übersichtsseiten oder in Artikeltabellen (diese hier eingeschlossen). Wo man nachsieht, ist ziemlich einheitlich:
- Anthropic: Die Vergleichstabelle auf der Modellübersicht enthält die Zeilen „Context window“ und „Max output“. Die Preise für lange Eingaben stehen im Abschnitt „Long context pricing“ der Preisseite
- OpenAI: Die Seite jedes Modells in der API-Dokumentation nennt „context window“ und „max output tokens“ sowie einen Hinweis zum Preis langer Prompts
- Google: Die Modellseite der Gemini API nennt „Input token limit“ und „Output token limit“, die Preisseite hat eine Stufe „prompts > 200k tokens“
Noch etwas, das leicht übersehen wird: Dasselbe Limit fasst je nach Modell unterschiedlich viel Text. Limits werden in Tokens gezählt; ändert sich der Tokenizer (das Verfahren, das Text in Tokens zerlegt), ändert sich auch die Tokenzahl desselben Dokuments (siehe den Hinweis in §5). Zählen Sie nach einem Modellwechsel mit Ihren eigenen Dokumenten neu, um sicherzugehen, dass noch genug Spielraum bleibt.
4. Drei Gründe, warum „größer ist besser“ nicht stimmt
Die Tabelle im vorigen Kapitel zeigt nur die physische Größe des Behälters. Nutzt das Modell den beworbenen Behälter aber auch wirklich aus? Kurz gesagt: Gehen Sie nicht davon aus, dass es bis zum Limit mit gleicher Genauigkeit liest. Dafür gibt es drei Gründe.
Grund ①: Lost in the Middle
Dieses Phänomen beschrieben Forschende von Stanford und anderen Einrichtungen (Liu et al.) 2023 im Paper „Lost in the Middle“. Bei Aufgaben wie der Suche nach einer Antwort in mehreren Dokumenten antworteten die Modelle am besten, wenn die Antwort am Anfang oder Ende der Eingabe stand, und verloren deutlich an Genauigkeit, wenn sie in der Mitte stand — auch Modelle, die für lange Kontexte gebaut waren, zeigten dieses Muster.
Das alltägliche Symptom: „Man fügt ein langes PDF ein, fragt ‚Wie hoch ist der Wert für X?', und das Modell nennt genau die Zahl falsch, die mitten im Dokument steht.“ Das ist Lost in the Middle. Wie stark der Effekt ist, hängt vom Modell ab — sicherer ist es aber, davon auszugehen, dass Informationen in der Mitte eines Dokuments leichter übersehen werden, und die Art der Übergabe entsprechend anzupassen.
Grund ②: Context Rot
Je länger ein Gespräch dauert, desto mehr verblassen die anfänglichen Anweisungen. Sie haben zu Beginn einen förmlichen Ton verlangt, und 20 Runden später ist das Modell wieder ins Lockere abgerutscht — das ist Context Rot.
Zwei Ursachen. ① Frühe Anweisungen werden im Gesprächsverlauf als vergleichsweise alt und unwichtig behandelt. ② Der lange Verlauf verteilt die Aufmerksamkeit und erschwert den Bezug auf bestimmte Tokens. In seiner Entwicklerdokumentation nennt Anthropic den Rückgang von Genauigkeit und Erinnerungsleistung bei wachsender Tokenzahl „Context Rot“ und schreibt, dass die Auswahl dessen, was in den Kontext kommt, genauso wichtig ist wie die Menge, die hineinpasst. Im September 2025 beschrieb das Unternehmen den Umgang mit diesem Problem als bewusste Fähigkeit in einem technischen Beitrag mit dem Titel „Effective context engineering for AI agents“.
Grund ③: Beworbener Kontext ≠ effektiver Kontext
Nimmt man aus den Werten in §1 nur den Bereich nahe 1M (512K–1M), ergibt sich folgendes Bild. Alle stammen aus den Bewertungstabellen von OpenAIs Ankündigungen und nutzen denselben Benchmark, OpenAI MRCR v2 (8 Nadeln).
Findet das Modell nahe 1M genau den einen verlangten Eintrag?
Quellen: Bewertungstabellen in OpenAIs „Introducing GPT-5.5“ (23. April 2026; GPT-5.5, GPT-5.4, Claude Opus 4.7) und „GPT-6 Astra“ (3. September 2026; GPT-6 Astra, GPT-5.6 Sol). Modellnamen zum Zeitpunkt der jeweiligen Ankündigung.
Im kurzen Bereich derselben Tabelle (4K–8K) erreichte GPT-5.5 98,1 % und GPT-5.4 97,3 %. Alle Werte hat OpenAI in eigenen Ankündigungen veröffentlicht; es sind keine Messungen Dritter.
Das heißt nicht, dass „die Modelle mit niedrigen Werten schlecht sind“. Im kurzen Bereich derselben Tabelle liegen GPT-5.5 und GPT-5.4 beide über 97 %, und die meiste echte Arbeit — Code-Reviews, lange Texte, Protokollzusammenfassungen, Rechercheauswertung — ist lange vor 1M erledigt. Das Problem ist die Haltung „Es hat 1M, also werfe ich 1M hinein“. Bedenken Sie außerdem: Das sind Werte, die OpenAI in eigenen Ankündigungen veröffentlicht hat, und vergleichbar sind sie nur innerhalb einer Tabelle. Auch Google nennt in der Modellkarte von Gemini 3.1 Pro (Februar 2026) Werte für MRCR v2 (8 Nadeln) — 84,9 % bei 128K (Durchschnitt) gegenüber 26,3 % bei 1M —, teilt die Längen aber anders ein; deshalb steht es nicht bei den Balken oben. Die Ankündigungsseiten von Anthropic zu Claude Opus 5.5 und seinen anderen aktuellen Modellen nennen keine Werte dieser Art nach Länge. Um zu wissen, was das Modell, das Sie heute nutzen, leistet, prüfen Sie es mit der folgenden Methode am eigenen Anwendungsfall.
Den „effektiven Bereich“ für den eigenen Anwendungsfall messen
Benchmark-Zahlen beruhen auf Dokumenttypen und Fragestellungen, die sich von Ihren unterscheiden. Am verlässlichsten ist es, mit eigenen Dokumenten einen kleinen Needle-in-a-Haystack-Test zu bauen.
- Nehmen Sie die Art von Dokument, die Sie tatsächlich nutzen (Code, Protokolle, Verträge usw.), und platzieren Sie 3–5 Fakten mit eindeutiger Antwort am Anfang, in der Mitte und am Ende (Fakten, die schon im Dokument stehen, funktionieren auch)
- Bitten Sie das Modell, „alle aufzulisten und jeweils anzugeben, wo sie stehen“, damit es mehrere Fakten gleichzeitig abrufen muss. Fragt man nur nach einem, wirkt das Modell besser, als es ist (der Unterschied zwischen einer und mehreren Nadeln)
- Stellen Sie dieselbe Frage bei unterschiedlichen Längen — etwa 50K, 200K und 500K — und notieren Sie die Länge, ab der die Antworten zu bröckeln beginnen
- Nehmen Sie auch Fragen auf, die Fakten kombinieren, statt sie nur abzurufen („Vergleiche A und B“). Fragen, die eine Synthese verlangen, brechen meist früher ein
Knapp unterhalb der Länge, ab der die Fehler beginnen, liegt der „effektive Kontext“ dieses Modells für diesen Anwendungsfall. Messen Sie nach einem Modellwechsel neu. Das dauert einige Dutzend Minuten und hilft bei echten Entscheidungen mehr als jede Zahl im Datenblatt.
5. Die Kostenfalle — Modelle, deren Preis bei langen Eingaben springt, und Modelle, bei denen er gleich bleibt
Das vorige Kapitel hat gezeigt, dass der effektive Bereich unterhalb des Limits liegt. Dazu kommt eine zweite Falle: Lange Eingaben können den Preis in die Höhe treiben. Die Anbieter haben das unterschiedlich gestaltet.
| Modell (Stand Sept. 2026) | Standardpreis (Eingabe / Ausgabe, pro 1M Tokens) | Lange Eingaben |
|---|---|---|
| Claude Opus 5.5 | 4 $ / 20 $ | Gleicher Preis über die vollen 1M |
| GPT-6 Sol | 2 $ / 10 $ | Eingaben über 272K: die gesamte Anfrage zu 2x Eingabe- und 1,5x Ausgabepreis |
| GPT-6 Astra | 10 $ / 50 $ | Wie oben |
| Gemini 3.1 Pro (Preview) | 2 $ / 12 $ | Über 200K: Eingabe 4 $, Ausgabe 18 $ |
Rechnen wir es durch. Angenommen, Sie schicken ein Dokument mit 500K Tokens und erhalten eine Antwort mit 50K — das typische Szenario „eine große Codebasis oder einen Jahresbericht in einem Rutsch zusammenfassen“.
- Claude Opus 5.5 (Pauschalpreis): 4,00 $ × 0,5 + 20,00 $ × 0,05 = 3,00 $
- GPT-6 Sol (Aufschlag über 272K): 4,00 $ × 0,5 + 15,00 $ × 0,05 = 2,75 $ (ohne Aufschlag 1,50 $)
- Gemini 3.1 Pro (Preis über 200K): 4,00 $ × 0,5 + 18,00 $ × 0,05 = 2,90 $ (zum Preis bis 200K 1,60 $)
- GPT-6 Astra (Aufschlag über 272K): 20,00 $ × 0,5 + 75,00 $ × 0,05 = 13,75 $
Daraus lässt sich zweierlei ablesen. Erstens: Sobald die Schwelle überschritten ist, kostet dasselbe Modell etwa das 1,8-Fache. Bei kurzen Eingaben kostet GPT-6 Sol halb so viel wie Claude Opus 5.5, bei 500K verschwindet der Unterschied fast — welches Modell „günstiger“ ist, kehrt sich mit der Eingabelänge um. Zweitens: Kommt der Aufschlag auf ein ohnehin teures Flaggschiffmodell, landet man in einer anderen Größenordnung (GPT-6 Astra kostet mehr als das 4-Fache von Opus 5.5). Rechnen Sie mit den Modellen, die Sie vergleichen, und Ihrer typischen Eingabelänge nach, bevor Sie sich entscheiden.
Bei Schwellenpreisen gilt: Teilen Sie teilbare Arbeit so auf, dass jedes Stück unter der Schwelle bleibt. Schickt man die 500K als zwei Anfragen zu je 250K, berechnet GPT-6 Sol keinen Aufschlag — 1,50 $ insgesamt (für Aufgaben, die alles auf einmal überblicken müssen, funktioniert das allerdings nicht). Es ist dieselbe Struktur wie in „KI-Token- und Sitzungskostensparen“.
6. Fünf Spartaktiken — sortiert nach Wirkung für Solo-Devs
„Der Behälter ist 1M, der effektive Bereich endet deutlich davor, und lange Nutzung wird teuer.“ Das haben wir abgehandelt. Was kann man also in der Praxis tun? Hier sind fünf Taktiken, die ich täglich nutze, sortiert nach dem größten Nutzen.
Kontext sparen — Prioritätsreihenfolge
/compact verwenden oder eine neue Sitzung starten.
Von den fünf bringt Taktik ① „Sitzung abschneiden“ den größten sichtbaren Gewinn. Allein das Beenden des Chats reduziert Halluzinationen spürbar.
Taktik ④ ist für API-Entwickler — UIs (claude.ai / ChatGPT) übernehmen das Caching automatisch.
Meine persönliche Best Practice: Schon konsequent ① und ② umzusetzen verschiebt die wahrgenommene Genauigkeit deutlich. Auch in Claude Code: Statt eine lange Sitzung weiterzuziehen, bei jedem Themenwechsel /compact drücken oder eine frische Sitzung starten — so bleibt die Endqualität stabil.
Zusammenfassung
Die wichtigsten Punkte dieses Artikels:
- Kontextfenster = die maximale Anzahl an Tokens, die eine KI in einem Austausch verarbeiten kann. Die Behältergröße
- Stand September 2026 liegen die Topmodelle von Anthropic, OpenAI und Google alle in der 1M-Token-Klasse. Die Eingabelimits unterscheiden sich kaum; Unterschiede gibt es bei den Ausgabelimits und den Preisen für lange Eingaben
- Beworbenes Limit und effektiver Bereich sind zweierlei. Im von OpenAI veröffentlichten Multi-Needle-Benchmark MRCR (8 Nadeln) schneidet dasselbe Modell mit wachsender Eingabe schlechter ab; nahe 1M reichten die Werte von 32,2 % bei Claude Opus 4.7 (Tabelle von OpenAI) bis 96,3 % bei GPT-6 Astra
- Am verlässlichsten findet man den effektiven Bereich, indem man Fakten in eigenen Dokumenten verteilt und bei unterschiedlichen Längen testet. Nach einem Modellwechsel neu messen
- Preise für lange Eingaben gibt es in zwei Formen: gleicher Preis bis zum Limit (Anthropic) oder ein Aufschlag ab einer Schwelle (272K bei OpenAI, 200K bei Google). Was günstiger ist, kehrt sich mit der Eingabelänge um
- Sparen läuft auf fünf Schritte hinaus: Sitzungen beenden, Auszüge schicken, Anweisungen am Ende wiederholen, cachen und Adressen explizit machen — ① und ② wirken am stärksten
Der Behälter ist größer geworden, doch was wir eigentlich tun, ist nach wie vor die Auswahl, was wir übergeben und was nicht. Die entscheidende KI-Kompetenz ist nicht mehr „die Fähigkeit, alles hineinzustopfen“. Es ist das Urteilsvermögen, genau das Nötige richtig zu übergeben — eine Fähigkeit, die nützlich bleibt, egal wie viele Modellgenerationen noch kommen. Das ist mein Fazit, jetzt, da 1M zur Normalität geworden ist.
FAQ
OpenAI bietet die Bibliothek tiktoken, die API von Anthropic hat eine Funktion zum Zählen von Tokens (Token Counting). Als grobe Richtwerte: 1 japanisches Zeichen ≈ 1–1,5 Tokens, 1 englisches Wort ≈ 1,3–1,8 Tokens — das ändert sich aber mit der Tokenizer-Generation (siehe den Hinweis in §5). Auch Code variiert je nach Art stark, deshalb ist es sicherer, vor einer langen Eingabe nachzumessen.
Kontext lebt nur innerhalb der Sitzung — schließen Sie den Chat, ist er weg. Memory (ChatGPT Memory / Claude Memory) ist ein separater sitzungsübergreifender Speichermechanismus. Memory-Inhalte werden zwar in das Kontextfenster eingespeist, aus Nutzersicht aber persistent gegenüber kurzlebig.
RAG ist das Muster, „nur die nötigen Informationen dynamisch in den Kontext zu holen“. Selbst mit einem 1M-Fenster macht es alles langsam, schwer und teuer, wenn man alles reinkippt, daher bleibt das Vorgehen „erst suchen, dann laden“ (RAG) der Standardansatz. Mehr dazu unter Was ist RAG.
Mehrere Faktoren kommen zusammen: eine Diskrepanz zwischen den im Training überwiegend gesehenen Sequenzlängen und den bei der Inferenz genutzten, Grenzen der Positionskodierung im Attention-Mechanismus und der stark steigende Rechenaufwand, um mehrere Informationen zu kombinieren. „Unterstützt“ und „über das ganze Fenster genau“ sind getrennte Probleme. Wo der Abfall beginnt, hängt von Modell und Aufgabe ab — am verlässlichsten misst man es mit eigenen Dokumenten nach der Methode aus §4.
Ja. MCP ist ein On-Demand-Abrufmechanismus über Tools, sodass Sie nicht alles vorab in den Kontext laden müssen. Wechseln Sie das Denkmodell von „die ganze Datei einfügen“ zu „die KI die Datei lesen lassen“.
Das hängt vom Ziel ab. ① Wollen Sie eine Zusammenfassung des Ganzen, fassen Sie zuerst jedes Kapitel zusammen und führen diese Zusammenfassungen dann in einem zweiten Schritt zusammen. ② Suchen Sie eine bestimmte Antwort, schicken Sie nicht den ganzen Text, sondern ziehen per Suche nur die relevanten Stellen heraus (RAG). ③ Nur wenn Sie über das gesamte Dokument hinweg vergleichen müssen, lohnt es sich, es in einem Stück zu schicken — in einer Länge, die in den effektiven Bereich passt. Beim Aufteilen an Überschriften schneiden und auf beiden Seiten ein paar Absätze überlappen lassen, damit der rote Faden an den Nahtstellen nicht reißt.