Inhalt
- 1. Warum Ihre KI-Rechnung still anschwillt
- 2. Kostenaufschlüsselung — Eingabe, Ausgabe, Cache, Batch
- 3. Plan-Wahl und ihre Spar-Wirkung
- 4. Prompt-Caching — der Hebel, der sich am meisten lohnt
- 5. Kontext-Management — /compact und Aufteilung
- 6. Modell-Wahl — aufgabenbezogenes Routing
- 7. Ihr Ausgabe-Budget steuern
- 8. Batch-Verarbeitung — halber Preis für alles, was warten kann
- 9. Die Multi-Agent-Falle — 15× Tokens
- 10. Überwachung und Abrechnungs-Alarme
- 11. Sieben häufige Verschwendungsmuster
- Zusammenfassung
- FAQ
- Korrekturen gegenüber der früheren Fassung
Aktualisiert am 26. September 2026: Die Zahlen aus Titel und Einstiegsgrafik — „auf 20–30 % der unoptimierten Kosten komprimieren“, „−60 bis 90 % durch Caching“, „30 000 $/Monat herunter auf 6 000–9 000 $“, „acht von zehn Aufträgen funktionieren mit einem günstigeren Modell“ — haben wir entfernt, weil wir keine Quelle dafür nennen konnten. An ihre Stelle treten Beispiele, die sich aus den Stückpreisen und Multiplikatoren der offiziellen Preisseiten von Anthropic und OpenAI berechnen lassen, jeweils mit Formel. Außerdem haben wir die Gewinnschwelle des Caches korrigiert (beim 5-Minuten-Cache reicht ein Lesevorgang, beim 1-Stunden-Cache zwei) sowie den Ausgabepreis (5× die Eingabe) und ein Kapitel zur Batch-Verarbeitung ergänzt. Was sich geändert hat, steht am Ende des Artikels.
Wer von einer Pauschale wie ChatGPT Plus (20 $ im Monat) auf Abrechnung pro Token umsteigt — etwa Claude Code mit API-Schlüssel oder eine selbst gebaute KI-App —, bei dem kann sich die Rechnung je nach Nutzung um eine Größenordnung ändern. Nutzungsbasierte Abrechnung hat keine Obergrenze.
Die gute Nachricht: Die wirksamsten Maßnahmen lassen sich auf drei reduzieren — Prompt-Caching, Modellwahl und Ausgabe-Budget. Die Wirkung jeder Maßnahme wird von Multiplikatoren bestimmt, die in den offiziellen Preislisten stehen, sodass Sie sie für Ihre eigene Nutzung ausrechnen können. Dieser Artikel stellt diese Multiplikatoren und den Rechenweg anhand der offiziellen Dokumentation von Anthropic und OpenAI vor.
Die Ersparnis lässt sich aus offiziellen Preisen berechnen
— nach den offiziellen Preislisten von Anthropic und OpenAI, Stand 26. September 2026
Rechenbeispiel: Senden Sie Opus 5.5 zehnmal denselben Präfix mit 100 000 Tokens, jeweils im Abstand von unter 5 Minuten, sinken die Eingabekosten von 4,00 $ ohne Cache auf 0,68 $ mit dem 5-Minuten-Cache (ein Schreibvorgang für 0,50 $ plus neun Lesevorgänge für 0,18 $).
Was warten kann, kostet über die Batch-API bei Eingabe und Ausgabe die Hälfte — und die Cache-Multiplikatoren kommen noch hinzu.
Quellen: Claude Platform Docs, „Pricing“ und OpenAI API Pricing (geprüft am 26. September 2026; Berechnung durch die Redaktion)
1. Warum Ihre KI-Rechnung still anschwillt
KI-Tools werden auf zwei Arten abgerechnet: Persönliche Pläne (Pauschale) und API-Abrechnung (nutzungsbasiert). Die Rechnung, die explodiert, ist hauptsächlich Letztere.
- Persönliche Pläne: ChatGPT Plus 20 $/Monat, Claude Pro 20 $/Monat (17 $/Monat bei jährlicher Zahlung), Max ab 100 $/Monat. Fixkosten, daher gibt es selbst bei intensiver Nutzung eine Obergrenze (mit Nutzungslimits).
- API-Abrechnung: pro Token, nutzungsbasiert. Hierunter fallen Claude Code mit API-Schlüssel und selbst entwickelte KI-Apps. Die Monatssumme kann je nach Nutzung stark schwanken.
Nutzungsbasierte Rechnungen schwellen an, weil (1) Ausgabe-Tokens 5× so viel kosten wie Eingabe-Tokens, (2) Sie einen wachsenden Kontext bei jeder Anfrage komplett erneut senden, (3) Subagenten im Hintergrund immer wieder aufgerufen werden und (4) etwas, das in eine Schleife gerät, nicht mehr aufhört — diese Faktoren addieren sich. Sobald Sie die Mechanik verstehen, ist jeder einzelne Punkt behebbar.
2. Kostenaufschlüsselung — Eingabe, Ausgabe, Cache, Batch
Am Beispiel der API-Preise von Claude Opus (Stand September 2026: Opus 5.5; die Stufe unter dem Spitzenmodell Fable, die Anthropic als Einstieg empfiehlt) — wohin das Geld fließt.
| Posten | Stückpreis (pro 1 Mio. Tokens) | Beschreibung |
|---|---|---|
| Eingabe-Tokens | 4 $ | Was Sie senden: Prompt + Konversationsverlauf + Dateien usw. |
| Ausgabe-Tokens | 20 $ | Was die KI zurückgibt. 5× die Eingabe. |
| Cache-Schreibvorgang (5 Min.) | 5 $ (1,25× die Eingabe) | Einen Präfix im Cache ablegen. Jeder Lesezugriff innerhalb von 5 Minuten verlängert ihn ohne Aufpreis. |
| Cache-Schreibvorgang (1 h) | 8 $ (2× die Eingabe) | Übersteht Pausen von mehr als 5 Minuten, dafür ist das Schreiben teurer. |
| Cache-Lesevorgang | 0,20 $ (0,05× die Eingabe) | 0,1× bei den meisten Modellen, 0,05× bei Opus 5.5. Das ist der Star unter den Sparhebeln. |
| Batch-Verarbeitung | Eingabe 2 $, Ausgabe 10 $ (halber Preis) | Asynchrone Verarbeitung von Anfragen, die warten können. Lässt sich mit den Cache-Multiplikatoren kombinieren. |
| Tool-Aufrufe | Zählen als Eingabe | Tool-Definitionen sind Teil des Kontexts. Sobald Sie ein Tool übergeben, kommt zusätzlich ein Tool-System-Prompt hinzu (286 Tokens bei Opus 5.5). |
Kurz: Ein Präfix, der im Cache liegt, lässt sich für ein Zehntel des Eingabepreises oder weniger lesen. Die Schreib-Multiplikatoren (1,25× für 5 Minuten, 2× für 1 Stunde) und die Ausgabe zu 5× der Eingabe sind bei allen aktuellen Claude-Modellen gleich; nur der Lese-Multiplikator unterscheidet sich je nach Modell (0,025× bei Fable 5.1). Beachten Sie außerdem: Claude Opus 4.7 und neuere Modelle nutzen einen neuen Tokenizer, der laut Anthropic für denselben Text rund 30 % mehr Tokens erzeugt — wichtig, wenn Sie Preise über Generationen hinweg vergleichen. Quelle: Claude Platform Docs, „Pricing“ (geprüft am 26. September 2026).
3. Plan-Wahl und ihre Spar-Wirkung
Sobald Sie Ihre Nutzung absehen können, wechseln Sie zuerst auf den passenden Plan.
| Nutzung | Empfohlener Plan | Monatsbudget | Hinweise |
|---|---|---|---|
| Hobby, Lernen, einige Male pro Woche | Claude Free / ChatGPT Free | 0 $ | Mit Nutzungslimits; nicht für Arbeitsdaten geeignet. |
| Persönlich, einige Stunden täglich | Claude Pro / ChatGPT Plus | 20 $ | Persönlicher Plan; nicht für Arbeitsdaten geeignet. |
| Intensive private Nutzung | Claude Max | Ab 100 $ | 5× oder 20× die Nutzung von Pro; für alle, die Claude Code stundenlang laufen lassen. |
| Teamarbeit | Claude Team / ChatGPT Business | Standard-Platz bei Claude Team: 20 $ (jährlich) bis 25 $/Nutzer | Für Arbeitsdaten geeignet; Daten werden nicht zum Training genutzt. |
| Große Organisation | Enterprise | Vertriebsangebot | SSO, Audit-Logs, SLA. |
| KI-eingebettete Entwicklung | Direkte API (Anthropic / OpenAI) | Nutzungsbasiert | Caching und Batch nutzen. |
Quellen: Preisseite von Claude und OpenAI Help, „What is ChatGPT Plus?“ (geprüft am 26. September 2026).
Wenn Sie Claude Code täglich viele Stunden nutzen und immer wieder an die Grenzen von Pro stoßen, ziehen Sie den Max-Plan in Betracht. Weil es eine Pauschale ist, kann die Rechnung nicht davonlaufen wie mit einem API-Schlüssel. Cursor beginnt beim Einzelplan Pro mit 20 $ im Monat, darüber gibt es Pro+ und Ultra.
4. Prompt-Caching — der Hebel, der sich am meisten lohnt
Wer die API direkt anspricht und denselben Präfix immer wieder sendet, hat kaum einen Grund, auf Prompt-Caching zu verzichten. Was aus dem Cache gelesen wird, kostet nur einen kleinen Bruchteil des Basis-Eingabepreises.
So funktioniert es
Wenn Sie über mehrere Anfragen hinweg denselben System-Prompt oder dieselben Dokumente wiederverwenden, schreibt der erste Aufruf sie in den Cache (beim 5-Minuten-Cache 1,25× der Eingabe). Jeder weitere Aufruf liest aus dem Cache zu 0,1× der Eingabe (bei Opus 5.5 zu 0,05×, bei Fable 5.1 zu 0,025×). Ein zu kurzer Präfix wird allerdings nicht gecacht: Das Minimum liegt bei 512 Tokens für Opus 5.5, 1.024 für Sonnet 5 und 4.096 für Haiku 4.5 (Claude Platform Docs, „Prompt caching“).
Gewinnschwelle — ein Lesevorgang beim 5-Minuten-Cache, zwei beim 1-Stunden-Cache
Setzt man den Eingabepreis gleich 1, ergeben sich für denselben Präfix folgende Kosten (berechnet aus den offiziellen Multiplikatoren von Anthropic):
- 5-Minuten-Cache: Schreiben 1,25 + ein Lesevorgang 0,1 = 1,35. Zweimal ohne Cache gesendet kostet 2, also lohnt sich das Schreiben schon nach einem Lesevorgang.
- 1-Stunden-Cache: Schreiben 2 + zwei Lesevorgänge 0,2 = 2,2. Dreimal ohne Cache gesendet kostet 3, also lohnt es sich nach zwei Lesevorgängen (mit nur einem Lesevorgang sind es 2,1 — knapp über den 2 ohne Cache).
Die Preisseite von Anthropic sagt dasselbe: Der Cache rechnet sich bei 5 Minuten Laufzeit nach einem Lesevorgang und bei 1 Stunde nach zweien. Opus 5.5 liest zu 0,05×, bei gleicher Zahl von Lesevorgängen wird der Abstand also noch größer.
Rechenbeispiel — ein Präfix mit 100 000 Tokens, zehnmal gesendet
| Modell | Ohne Cache | 5-Minuten-Cache | Unterschied |
|---|---|---|---|
| Claude Opus 5.5 (Eingabe 4 $, Schreiben 5 $, Lesen 0,20 $) | 0,1 × 4 $ × 10 = 4,00 $ | 0,1 × 5 $ + 0,1 × 0,20 $ × 9 = 0,68 $ | Rund 83 % weniger |
| Claude Sonnet 5 (Eingabe 2 $, Schreiben 2,50 $, Lesen 0,20 $) | 0,1 × 2 $ × 10 = 2,00 $ | 0,1 × 2,50 $ + 0,1 × 0,20 $ × 9 = 0,43 $ | Rund 79 % weniger |
Gerechnet wird nur die Eingabe des Präfixes (System-Prompt, Referenzdokumente usw.); 100 000 Tokens = 0,1 in Einheiten von einer Million. Angenommen ist, dass alle zehn Anfragen im Abstand von unter 5 Minuten eintreffen, die erste den Cache schreibt und die übrigen neun ihn lesen. Preise: Claude Platform Docs, „Pricing“ (geprüft am 26. September 2026). Die Ausgabe und der sich ändernde Teil jeder Anfrage sind nicht enthalten.
Die GPT-6-Modelle von OpenAI funktionieren ähnlich. Gecachte Eingabe kostet 0,1×, das Schreiben 1,25×, und OpenAIs Leitfaden rechnet genauso: Einen Präfix einmal zu schreiben und einmal wiederzuverwenden kostet 1,35×, gegenüber 2×, wenn er zweimal ohne Cache verarbeitet wird. Der Cache hält 30 Minuten ab der letzten Nutzung und ist bei unterstützten Modellen standardmäßig aktiv (OpenAI, „Prompt caching“).
Die Standard-Lebensdauer beträgt 5 Minuten
In der API von Anthropic beträgt die Lebensdauer (TTL) des Prompt-Caches standardmäßig 5 Minuten. Jeder Lesezugriff verlängert sie ohne Aufpreis, aber nach einer Pause von mehr als 5 Minuten läuft der Cache ab, und die nächste Anfrage schreibt ihn neu (1,25× des Eingabepreises). Man kann eine Lebensdauer von 1 Stunde wählen, dann kostet das Schreiben aber 2× des Eingabepreises (Quelle: Claude Platform Docs, „Prompt caching“).
Claude Code läuft auf demselben Mechanismus. Innerhalb der im Claude-Abo enthaltenen Nutzung bekommt die Hauptunterhaltung die Lebensdauer von 1 Stunde, aber mit einem API-Schlüssel oder sobald Sie das Limit Ihres Plans überschreiten und auf Nutzungsguthaben wechseln, sinkt sie auf 5 Minuten. Ab v2.1.242 können Sie über die Einstellung promptCacheTtl selbst 5m oder 1h wählen (Quelle: Claude Code Docs, „Prompt caching“, geprüft am 26. September 2026). Wer mit Pausen arbeitet, bei dem entscheidet diese Einstellung, wie oft der Cache neu geschrieben wird.
5 Minuten oder 1 Stunde — wie wählen?
Die Richtschnur der offiziellen Dokumentation:
- Präfixe, die öfter als alle 5 Minuten wiederverwendet werden: beim 5-Minuten-Cache bleiben. Jeder Lesezugriff verlängert ihn kostenlos, das teurere 1-Stunden-Schreiben brauchen Sie nicht.
- Präfixe mit Pausen zwischen 5 Minuten und einer Stunde (Warten auf die Antwort eines Nutzers, ein Aufruf nach einer Aufgabe, die länger als 5 Minuten läuft): Hier passt der 1-Stunden-Cache.
- Beide kombinieren: Den 1-Stunden-Cache vor den 5-Minuten-Cache setzen — dieselbe Reihenfolge, wie wenn man den unveränderlichen System-Prompt und die Tool-Definitionen an den Anfang stellt.
Ob der Cache greift, sehen Sie im usage der Antwort an cache_read_input_tokens (Lesen) und cache_creation_input_tokens (Schreiben). Bleiben die Lesewerte bei null, ändert sich der Präfix bei jeder Anfrage irgendwo oder erreicht die Mindestzahl an Tokens nicht.
5. Kontext-Management — /compact und Aufteilung
Wenn Sie Claude Code oder Cursor eine Weile nutzen, stellen Sie mitten in einer langen Konversation fest, dass Sie in jeder Runde eine große Menge früherer Konversation erneut senden. Es ist nicht die Ausgabe, die anschwillt — es ist die Eingabe (= bisherige Konversation).
Taktik 1: /compact aktiv nutzen
Claude Code hat den Befehl /compact. Er fasst die bisherige Konversation zusammen und schafft so Platz im Kontext (Claude Code Docs, „Commands“); Sie können ihm mitgeben, was die Zusammenfassung behalten soll. Nutzen Sie ihn an natürlichen Einschnitten der Arbeit.
Taktik 2: Sitzungen pro Aufgabe trennen
Erledigen Sie nicht „Feature A umsetzen“, „Bug B beheben“ und „Doku C erstellen“ in einer langen Konversation — starten Sie frische Sitzungen. Schließen Sie die Sitzung, sobald die jeweilige Aufgabe beendet ist. Brauchen Sie ein Langzeit-Gedächtnis, schreiben Sie es in eine Memory-Datei aus.
Taktik 3: Rauschen mit Hooks beschneiden
Claude Agent SDK / Claude Code bieten Hooks, mit denen Sie die Tool-Ausgabe transformieren können, bevor sie die KI erreicht. Beispiel: ein langes npm install-Log per Hook auf nur „Erfolg/Fehler“ verdichten. Je länger das Log, desto leichter wird die Eingabe jeder Runde.
6. Modell-Wahl — aufgabenbezogenes Routing
„Immer Opus“ ist eine Strategie für Millionäre. Routinearbeit wie Klassifikation oder Extraktion gelingt oft auch mit Sonnet oder Haiku. Der Preis richtet sich nach der Stufe des Modells (oben, Mitte, leicht); die offiziellen Preise mit Stand 26. September 2026 (pro Million Tokens) stehen unten. Über die Versionen hinweg ist das Verhältnis gleich geblieben: Je höher die Stufe, desto teurer, und die leichte Stufe kostet einen Bruchteil der oberen.
| Modell | Eingabe | Ausgabe | Stärken |
|---|---|---|---|
| Claude Opus 5.5 (oben) | 4 $ | 20 $ | Komplexes Design, Schlussfolgerungen, lange autonome Aufgaben |
| Claude Sonnet 5 (Mitte) | 2 $ | 10 $ | Tägliches Coden, Analyse, Zusammenfassung |
| Claude Haiku 4.5 (leicht) | 1 $ | 5 $ | Klassifikation, Extraktion, kurze Umwandlung, Echtzeit-Antwort |
| GPT-6 Sol (ausgewogenes Modell von OpenAI) | 2 $ | 10 $ | Komplexes Coding und agentische Arbeit |
| GPT-6 Luna (günstiges Modell von OpenAI) | 0,10 $ | 0,50 $ | Gezielte leichte Arbeit in großen Mengen |
Quellen: Claude Platform Docs, „Pricing“ und OpenAI API Pricing (geprüft am 26. September 2026; bei OpenAI die Preise für kurzen Kontext). Darüber liegen Anthropics Fable 5.1 (10 $ / 50 $) und OpenAIs Spitzenmodell GPT-6 Astra (10 $ / 50 $). Die aktuellen Modelle aller Anbieter finden Sie in der Liste aktueller Modelle und Wissensstichtage.
Der Wechsel vom oberen Opus zum leichten Haiku senkt den Preis pro Token auf ein Viertel (Stand September 2026). Für eine Klassifikationsaufgabe mit 2 Millionen Eingabe- und 200 000 Ausgabe-Tokens pro Tag ergeben die offiziellen Preise:
- Opus 5.5: 2 × 4 $ + 0,2 × 20 $ = 12 $
- Sonnet 5: 2 × 2 $ + 0,2 × 10 $ = 6 $
- Haiku 4.5: 2 × 1 $ + 0,2 × 5 $ = 3 $
- Haiku 4.5 per Batch: 3 $ × 0,5 = 1,50 $ (Kapitel 8)
Ob die Qualität reicht, hängt von der Aufgabe ab — vergleichen Sie daher die Ergebnisse mit derselben Eingabe, bevor Sie auf ein günstigeres Modell wechseln (FAQ, F4). Faustregeln:
- Opus für: komplexe Refactorings, dateiübergreifende Designs, tiefes Schlussfolgern, das Erkunden einer unbekannten Domäne
- Sonnet für: tägliches Coden, Analyse, Zusammenfassung, Review, Tests ergänzen
- Haiku für: Klassifikation, Extraktion, Formatumwandlung, Echtzeit-Vorschläge, Generieren von Commit-Nachrichten
7. Ihr Ausgabe-Budget steuern
Ausgabe-Tokens kosten 5× so viel wie Eingabe-Tokens — bei den aktuellen Claude-Modellen ebenso wie bei GPT-6 Astra, Sol und Luna. Eine Antwort von Opus 5.5 mit 2.000 Eingabe- und 1.000 Ausgabe-Tokens kostet 0,008 $ + 0,020 $ = 0,028 $. Begrenzen Sie die Ausgabe auf 500 Tokens, sind es 0,018 $ — rund 36 % weniger (berechnet aus den offiziellen Preisen).
Drei Ansätze
max_tokensan die Aufgabe anpassen: In der Messages API von Anthropic istmax_tokensein Pflichtparameter, und die eingetragene Zahl ist die Obergrenze der Ausgabe (API-Referenz, „Messages“). Lassen Sie keinen großen Wert aus Gewohnheit stehen, sondern setzen Sie einen passenden, etwamax_tokens: 1000.- „Kurz antworten“ oder „fünf Stichpunkte“ in den Prompt aufnehmen: die KI hört zu. Unterdrückt redundante Einleitungen, Zusammenfassungen und Schlussformeln.
- Strukturierte Ausgabe (JSON-Modus): JSON ist kürzer als Fließtext. Wenn Ihre App das Ergebnis weiterverarbeitet, ist das der Weg.
In Situationen, in denen Sie keine „lange, schöne Antwort“ brauchen (Klassifikation, Extraktion, Entscheidungen), ist hartes Kürzen am Ende kosteneffizienter.
8. Batch-Verarbeitung — halber Preis für alles, was warten kann
Arbeit, die keine sofortige Antwort braucht — nächtliche Massenklassifikation, Sammelzusammenfassungen, Evaluationsläufe —, kostet über eine Batch-API bei Eingabe und Ausgabe die Hälfte. Die Message Batches API von Anthropic nimmt bis zu 100.000 Anfragen pro Batch an; die meisten sind in unter einer Stunde fertig, ein Batch kann aber bis zu 24 Stunden dauern (Claude Platform Docs, „Batch processing“). Auch die Batch API von OpenAI gibt 50 % Rabatt, mit einem Abschlussfenster von 24 Stunden (OpenAI, „Batch API“).
Laut der Preisseite von Anthropic lassen sich die Cache-Multiplikatoren mit dem Batch-Rabatt kombinieren. Ein Cache-Lesevorgang mit Haiku 4.5 innerhalb eines Batches kostet beispielsweise 1 $ × 0,1 × 0,5 = 0,05 $ pro Million Tokens.
9. Die Multi-Agent-Falle — 15× Tokens
Der Trend 2026, Multi-Agent-Setups (Orchestrator + parallele Subagenten), ist mächtig — Anthropic hat aber Daten aus seiner eigenen Research-Funktion veröffentlicht: Agenten verbrauchen rund 4× so viele Tokens wie ein normaler Chat, Multi-Agent-Systeme rund 15× (Anthropic, „How we built our multi-agent research system“, Juni 2025). Die 15× beziehen sich auf den Chat, nicht auf einen einzelnen Agenten.
Entscheidungskriterien fürs Sparen
- Klare, sequenzielle Aufgaben (Bearbeitung einer einzelnen Datei, Zusammenfassung, Code-Review) → ein einzelner Agent reicht
- Parallelisierung, die die Wandzeit spürbar verkürzt → Multi-Agent ist gerechtfertigt
- „Multi-Agent als Standard“ ist wirtschaftlich falsch. Beginnen Sie mit einem einzelnen Agenten und teilen Sie nur die Engpässe auf, die Sie tatsächlich sehen.
Details: siehe Was ist ein Multi-Agent?
10. Überwachung und Abrechnungs-Alarme
Damit eine nutzungsbasierte Rechnung Sie nicht überrascht, sind routinemäßige Überwachung + Alarme unverzichtbar.
API-Nutzer
- Täglichen Token-Verbrauch in der Claude Console / im OpenAI Dashboard prüfen
- Nutzungsobergrenze setzen: etwa Stopp bei Überschreitung von 200 $/Monat. Keine Grenze = Gefahr.
- Abrechnungs-Alarme: E-Mail bei 50 $, Slack bei 100 $ — gestaffelte Schwellen.
Claude-Code-Nutzer
- Mit
/usagedie Kosten der aktuellen Sitzung und die Nutzung Ihres Plans prüfen (/costist jetzt ein Alias für/usage) - Machen Sie es zur Gewohnheit, am Tagesende
/usagezu kontrollieren
Organisations-Administratoren
- Nutzungsberichte pro Anwender (Anthropic-Team-/Enterprise-Admin-Konsole)
- Anomalie-Erkennung (Personen markieren, die deutlich mehr verbrauchen als üblich)
- Quartalsweise unternehmensweite Weitergabe „verschwenderischer Muster“
11. Sieben häufige Verschwendungsmuster
| Muster | Was falsch läuft | Lösung |
|---|---|---|
| Alle Dateien jede Runde neu anhängen | Cache greift nicht; Eingabe schwillt an | Unveränderliche Dokumente in den Präfix legen und cachen |
| Dieselbe Frage in ChatGPT und Claude stellen | Doppelt zahlen für dieselbe Eingabe in getrennten Plänen | Eines wählen |
Lange Konversation ohne /compact fortführen | Voller Verlauf wird jede Runde gesendet | /compact an natürlichen Einschnitten |
| Opus für einfache Klassifikation oder Extraktion einsetzen | Das 4-Fache von Haiku zahlen für dasselbe Ergebnis | Modell zur Aufgabe passen lassen |
| „Nochmal feinschleifen“ / „etwas länger“ wiederholen | Ausgabe-Tokens summieren sich | Gewünschte Länge vorab nennen |
| Viele unnötige Tools definieren | Tool-Definitionen wandern in den Kontext mit | Nur das definieren, was Sie tatsächlich nutzen |
| Leichtfertig zu Multi-Agent greifen | Rund 15× die Tokens eines Chats (ein einzelner Agent rund 4×) | Nur bei klarem Bedarf |
Zusammenfassung
- Die drei Hebel der KI-Kostenoptimierung: Prompt-Caching, Modellwahl, Ausgabe-Budget. Die Wirkung jedes Hebels bestimmen offizielle Multiplikatoren, und diese Multiplikatoren wirken zusammen.
- Cache-Lesen = 0,1× der Eingabe (0,05× bei Opus 5.5). Der 5-Minuten-Cache lohnt sich nach einem Lesevorgang, der 1-Stunden-Cache nach zweien. Ein Präfix mit 100 000 Tokens, zehnmal an Opus 5.5 gesendet, sinkt von 4,00 $ auf 0,68 $.
- Modellwahl: Von Opus 5.5 zu Haiku 4.5 sinkt der Preis pro Token auf ein Viertel, mit Sonnet 5 auf die Hälfte (Stand September 2026).
- Ausgabe-Budget: Die Ausgabe kostet 5× die Eingabe.
max_tokensexplizit setzen und um „kurz“ bitten. - Batch-Verarbeitung: Was warten kann, kostet bei Eingabe und Ausgabe die Hälfte und lässt sich mit dem Cache-Rabatt kombinieren.
- Kontext-Management:
/compactan natürlichen Einschnitten, pro Aufgabe trennen, Ausgabe mit Hooks komprimieren. - Multi-Agent-Falle: rund 15× die Tokens eines Chats. Nur mit klarem Bedarf einsetzen.
- Überwachung: Nutzungsobergrenzen, Abrechnungs-Alarme und ein
/usage-Check sollten allesamt zur Gewohnheit werden.
FAQ
F1. Ich nutze Claude Code täglich — ist Pro (20 $) oder Max besser?
Wenn Sie regelmäßig an die Grenzen von Pro stoßen, ziehen Sie Max in Betracht. Das Hilfe-Center von Anthropic rät Pro-Nutzern, die regelmäßig an Limits stoßen und für große Repositories mehr Kapazität brauchen, einen Wechsel zu Max 5x zu erwägen (Claude Help Center, „Using Claude Code with your Pro or Max plan“). Erreichen Sie die Grenzen nicht, bleiben Sie bei Pro.
F2. Brauche ich eine besondere Konfiguration, um Prompt-Caching zu nutzen?
In der API von Anthropic müssen Sie cache_control angeben — entweder einmal auf oberster Ebene der Anfrage (automatisches Caching) oder an einzelnen Blöcken (explizite Breakpoints). Bei OpenAI ist es für unterstützte Modelle standardmäßig aktiv. Claude Code nutzt den Cache automatisch. Details siehe Anthropics offizielle Dokumentation.
F3. ChatGPT vs. Claude — was ist kosteneffizienter?
Hängt vom Anwendungsfall ab. Allein nach Stückpreis liegen Claude Sonnet 5 (Mittelklasse) und GPT-6 Sol gleichauf: 2 $ Eingabe und 10 $ Ausgabe. Für kurze Q&A und Routinearbeit in großen Mengen kostet das günstige Modell von OpenAI (Stand September 2026: GPT-6 Luna, 0,10 $ Eingabe) ein Zehntel von Haiku 4.5 (1 $ Eingabe). Bei langen Aufgaben, die denselben Präfix wiederholt senden, zählen die Cache-Lesevorgänge — damit kommt auch Opus 5.5 (0,05×) in Frage. „Beide abonnieren und das passende Werkzeug wählen“ ist ebenfalls praktikabel.
F4. Wie beurteile ich, ob „Haiku reicht“?
Führen Sie ein dreistufiges Experiment durch. (1) Erst auf Opus zum Laufen bringen. (2) Denselben Prompt an Sonnet senden und die Qualität vergleichen. (3) Wirkt Sonnet vergleichbar, probieren Sie auch Haiku. Je routinemäßiger die Aufgabe, desto kleiner ist der Unterschied meist. Opus reservieren Sie für Fälle, die wirklich tiefes Urteil oder Schlussfolgern brauchen.
F5. Sollten Privatpersonen die API direkt anzapfen?
Es kommt darauf an. Wenn Sie überwiegend interaktiv coden, hält der Max-Plan die Rechnung konstant und ist bequemer. Für das Einbetten von KI in eine eigene App, Batch-Verarbeitung oder Automatisierung brauchen Sie die direkte API. Viele Leute machen beides.
F6. Welche Schwelle sollte ich für Abrechnungs-Alarme setzen?
Eine allgemeingültige Antwort gibt es nicht, aber eine Möglichkeit der Staffelung ist ein erster Alarm beim 1,5-Fachen Ihrer üblichen Monatsausgaben und ein Stopp beim 3-Fachen. Geben Sie üblicherweise 30 $/Monat aus, dann Alarm bei 50 $ und Stopp bei 100 $. Anfangs setzen Sie kleine tägliche Alarme, um ein Gefühl für Ihren Verbrauch zu bekommen, und lockern sie dann.
F7. Uns wurde gesagt: „Das KI-Budget der Firma ist zu groß geworden.“ Was tun wir zuerst?
Drei Dinge in dieser Reihenfolge. (1) Auf die Nutzung pro Anwender schauen und herausfinden, wo sich der Verbrauch ballt. (2) Mit den Vielnutzern über ihren Workflow sprechen und verschwenderische Muster identifizieren. (3) Einen internen Leitfaden zu „Caching, Modellwahl, Ausgabe-Budget“ unternehmensweit verteilen und monatlich über den Fortschritt berichten.
Korrekturen gegenüber der früheren Fassung
Am 26. September 2026 haben wir Folgendes korrigiert.
| Frühere Fassung | Jetzt |
|---|---|
| Drei Hebel komprimieren auf 20–30 % der unoptimierten Kosten (Titel, Einstieg, Bild) | Entfernt, da keine Quelle angebbar. Ersetzt durch Beispiele, die aus offiziellen Preisen und Multiplikatoren berechnet sind. |
| −60 bis 90 % durch Caching, −50 bis 80 % durch Modellwahl, −30 bis 60 % durch Ausgabe-Budget, 30 000 $/Monat herunter auf 6 000–9 000 $ | Ebenso. Ersetzt durch Rechenbeispiele wie „ein Präfix mit 100 000 Tokens, zehnmal gesendet: 4,00 $ → 0,68 $“. |
| Acht von zehn Aufträgen funktionieren mit einem günstigeren Modell | Entfernt; keine Quelle. |
| Der 5-Minuten-Cache rechnet sich nach zwei Lesevorgängen | Er rechnet sich nach einem Lesevorgang (Schreiben 1,25 + Lesen 0,1 = 1,35 < 2). |
| Der 1-Stunden-Cache rechnet sich nach fünf Lesevorgängen | Er rechnet sich nach zwei Lesevorgängen (2 + 0,2 = 2,2 < 3). |
| Ausgabe-Tokens kosten 5–6× mehr als Eingabe-Tokens | 5× (bei allen aktuellen Claude-Modellen und allen drei GPT-6-Modellen). |
| Eine Cache-Trefferquote unter 60 % lässt Spielraum; in der Produktion 80 %+ anstreben | Entfernt; keine Quelle. Ersetzt durch die Prüfung der gelesenen und geschriebenen Tokens in usage. |
/compact schrumpft 200 000 Tokens auf 5 000 | Zahlen entfernt; keine Quelle. |