Inhalt
- 1. Ein LLM rät einfach immer weiter "das nächste Wort"
- 2. Was sind "Gewichte"? — Eine Billion Regler erzeugen Intelligenz
- 3. Zwei Lernphasen — Pre-Training und Post-Training (RLHF)
- 4. Inferenz — der Moment, in dem deine Frage zu Strom wird
- 5. Strom — wie viel Energie verschlingt ein LLM?
- 6. Stimmt es, dass "Entwicklung eine Geldschlacht" ist?
- 7. Doch Geld allein gewinnt nicht — der Effizienz-Rückstrom
- 8. Was als Nächstes kommt — die Mauer aus "Strom und Physik" nach dem Geld
- Zusammenfassung
- FAQ
Die Rechenleistung, die in das Training des 2023 veröffentlichten GPT-4 floss, betrug laut dem Forschungsinstitut Epoch AI ungefähr 2,1×10²⁵ Gleitkommaoperationen (FLOP); Stanford HAI schätzte die Kosten dieser Rechenleistung auf etwa 78 Millionen Dollar. Schon das Training des älteren GPT-3 allein verbrauchte etwa 1.287 MWh Strom (Schätzung von Google-Forschern aus dem Jahr 2021) — mehr als ein Jahrhundert Strom eines durchschnittlichen Haushalts, um ein einziges Modell zu bauen. Hinter dem beiläufigen „Hey, fass das mal zusammen“, das wir tippen, liegt eine Welt aus Physik und Geldbündeln.
Dieser Artikel gräbt tief in die Frage, "wie ein LLM (großes Sprachmodell) tatsächlich funktioniert", aus drei Richtungen: Mechanismus, Strom und Geld. Konkret — (1) Warum kann ein LLM Sprache aus einer Sammlung von Reglern namens "Gewichte (Parameter)" erzeugen, (2) wie viel Strom verbraucht eine Frage oder ein Trainingslauf, und (3) stimmt die Behauptung, dass "die Entwicklung von Spitzen-LLMs eine Geldschlacht" sei? Die kurze Antwort auf die dritte: "Für die absolute Spitze ist das im Wesentlichen wahr — doch eine Gegenströmung, bei der 'Geld allein nicht gewinnt', ist 2026 stärker geworden." Das ist das genaue Bild.
Meine Haltung gleich vorweg: die "Intelligenz" eines LLM ist weder Magie noch Bewusstsein — sie ist das Ergebnis davon, eine riesige Wahrscheinlichkeits-Vorhersagemaschine mit Strom in Form zu prügeln. Den Mechanismus zu verstehen löst sowohl übertriebenen Hype als auch übertriebene Angst auf. Dieser Artikel geht auf mittleres Niveau in die Tiefe. Wenn du bei "was ist ein LLM überhaupt" anfängst, lies zuerst was ist ein LLM (Einsteiger); zur Kontextlänge siehe das Kontextfenster; zu den Preisen siehe AI-API für Einsteiger.
Ein LLM aus drei Richtungen seziert
— Woraus Intelligenz besteht, der Strom, den sie verbrennt, das Geld, das sie kostet
Die Klugheit eines LLM ist keine Magie. Sie ist das Ergebnis davon, eine riesige Wahrscheinlichkeitsmaschine mit Strom und Geld in Form zu prügeln.
Kenne den Mechanismus, und sowohl Hype als auch Angst lösen sich auf.
1. Ein LLM rät einfach immer weiter "das nächste Wort"
Es mag überraschend klingen, aber ChatGPT, Claude und Gemini tun im Kern alle dasselbe. "Berechne anhand des bisherigen Textes die Wahrscheinlichkeit des wahrscheinlichsten nächsten Wortes (genauer gesagt 'Token') als Fortsetzung, wähle eines aus und reihe sie aneinander." Das ist alles. Füttert man es mit "die Katze sitzt auf der ___", weist es Kandidaten wie "Matte", "Couch", "Boden" Wahrscheinlichkeiten zu und gibt das wahrscheinlichste aus (oder eines, das nach Wahrscheinlichkeit gezogen wird). Es wiederholt dies Token für Token, bis der Text endet.
Hier ist die Frage, an der viele Menschen scheitern. "Wie kann ein bloßes Wort-Ratespiel Aufsätze zusammenfassen oder Code schreiben?" Die Antwort: "Um das nächste Wort wirklich genau zu erraten, hat es keine andere Wahl, als die Struktur der Welt bis zu einem gewissen Grad zu 'verstehen'." "Die Hauptstadt Japans ist ___" zu erraten erfordert Geografie; "3 + 5 = ___" erfordert Arithmetik; "die Ursache dieses Bugs ist ___" erfordert intern vorgehaltenes Programmierwissen. Als Nebenprodukt davon, das "Erraten des nächsten Wortes" auf gewaltigen Textmengen bis zum Äußersten zu trainieren, entstehen Wissen und logisches Schließen. Das ist die seltsame und essenzielle Natur von LLMs.
Was berechnet also diese "Wahrscheinlichkeit des nächsten Wortes"? Wie angedeutet ist der Hauptdarsteller ein gewaltiger Haufen von Zahlen namens "Gewichte (Parameter)". Das nächste Kapitel enthüllt, was sie sind.
2. Was sind "Gewichte"? — Eine Billion Regler erzeugen Intelligenz
Um das Innere eines LLM in einer Analogie zu fassen: "ein riesiges Rechengerät mit Hunderten Milliarden bis über einer Billion 'Reglern'." Jeder Regler ist ein "Gewicht (Parameter)", und wenn das Signal eines Eingabewortes an die nächste Schicht weitergegeben wird, entscheidet er, "welche Signale verstärkt oder abgeschwächt werden und um wie viel". GPT-3 hatte etwa 175 Milliarden; von den neuesten Spitzenmodellen wird gesagt, dass sie eine Billion übersteigen. Die Einstellung dieser gewaltigen Regler ist genau das, was das gelernte "Wissen" des Modells ausmacht.
Wie aus "Gewichten" Sprache wird
"Lernen" ist die Arbeit, diese Billion Regler Stück für Stück in Richtung der richtigen Antwort zu drehen.
Die fertigen Reglereinstellungen (Gewichte) = das "Wissen" des Modells selbst.
Der Transformer, der 2017 auftauchte, ist die Grundlage moderner LLMs. Sein Herzstück ist der "Attention"-Mechanismus, der durch Gewichte dynamisch beurteilt, "welches Wort im Satz für das aktuelle Wort wichtig ist". Ob "Bank" in "sah den Fluss vor der Bank" ein Geldinstitut oder ein Flussufer meint, wird entschieden, indem die Beziehung zu den anderen Wörtern im Kontext gewichtet wird — und diese "kontextabhängige Gewichtung" ist genau der Grund, warum ein LLM auch über lange Passagen hinweg kohärente Antworten liefern kann. Wenn Leute sagen "irgendwas mit Gewichtung", meinen sie genau diese Attention und die Billionen von Multiplikationen dahinter.
Der entscheidende Punkt: diese Gewichte wurden nicht von Hand eingestellt. Anfangs sind sie ein Klumpen aus Zufallszahlen, bedeutungslos. Bedeutung wird durch "Lernen" eingeprägt. Wie geschieht dieses Lernen also?
3. Zwei Lernphasen — Pre-Training und Post-Training (RLHF)
Das Lernen eines LLM teilt sich grob in zwei Phasen — der Prozess, durch den die "Zufallsregler" des vorigen Kapitels zu "klugen Reglern" werden.
Phase 1: Pre-Training. Man füttert es mit Text in Internetgröße (Bücher, das Web, Code) und lässt es unermüdlich "das nächste Wort erraten". Jedes Mal, wenn es sich irrt, werden alle Parameter um einen winzigen Betrag angepasst, in die Richtung, die den Fehler verkleinert (dieser Anpassungsalgorithmus ist die berühmte "Backpropagation + Gradientenabstieg"). Wiederholt man dies über Billionen von Tokens, werden die Grundlagen von Grammatik, Wissen und logischem Schließen in die Regler eingraviert. Das Pre-Training verschlingt den Großteil der Rechenleistung, den Großteil des Stroms und den Großteil des Geldes. Die astronomischen ~2×10²⁵ FLOPs eines Modells der GPT-4-Klasse verbrennen hier.
Stufe 2: Nachtraining (Post-Training). Ein nur vortrainiertes Modell ist „gebildet, aber ungehobelt“. Deshalb bringt man ihm mit RLHF (Verstärkungslernen aus menschlichem Feedback) und ähnlichen Verfahren „hilfreiche, sichere Antworten“ bei. Seit etwa 2025 investieren die Labore zudem stark in Nachtraining, das langes Schlussfolgern (gründliches Nachdenken), Werkzeugnutzung und agentisches Verhalten trainiert. Dass neuere Modelle so auffällig „erst nachdenken, dann antworten“, ist das Ergebnis dieser Entwicklung. Auch Multi-Agenten-Verhalten wird hier angelegt.
4. Inferenz — der Moment, in dem deine Frage zu Strom wird
Wenn Training "die Bauarbeit ist, die Regler einzustellen", dann ist Inferenz "der Betrieb, mit den fertigen Reglern tatsächlich Antworten zu erzeugen". Jedes Mal, wenn du eine Frage in ChatGPT eintippst, laufen Billionen von Multiplikationen durch beinahe eine Billion Regler, und Tokens werden eines nach dem anderen erzeugt. Wir haben gesehen, wie schwer das Training ist — aber für die Gesellschaft als Ganzes ist es die Inferenz, nicht das Training, die den Strom verschlingt.
Der Grund ist einfach: das Training läuft im Grunde einmal pro Modell, aber die Inferenz läuft weltweit Hunderte Millionen Mal am Tag. Über die Lebensdauer eines Modells hinweg türmt sich der Strom- und Rechenbedarf daher weit stärker auf der Seite der Inferenz als auf der des Trainings auf. "Eine Frage ist kaum Strom" — stimmt, eine ist winzig. Aber "winzig × Hunderte Millionen × jeden Tag" summiert sich zu einem Stromproblem von nationaler Größenordnung. Schauen wir uns als Nächstes konkrete Zahlen an.
5. Strom — wie viel Energie verschlingt ein LLM?
"KI verschlingt Strom" wird oft gesagt, aber wie viel genau? Hier sind die repräsentativen Zahlen, wie sie Stand 2026 veröffentlicht wurden.
LLM-Stromverbrauch in Zahlen
eine kurze Frage
über 65× das effizienteste
(eine alte Generation)
Prognose 2024→2030
Selbst eine kurze Anfrage (0,42Wh), hochgerechnet auf 700 Mio./Tag, entspricht dem Strom von ~35.000 US-Haushalten (Schätzung Dritter).
Rechenzentrums-Racks liegen im Schnitt unter 8kW (Umfrage des Uptime Institute 2024), ein NVIDIA-DGX-GB200-Rack für KI zieht dagegen etwa 120kW (NVIDIA-Dokumentation); ein einzelner KI-RZ-Standort reicht von unter 50MW bis über 1GW (Tracking-Daten von Epoch AI).
Auffällig ist, dass „der Stromverbrauch je nach Modell und Länge des Prompts um Größenordnungen schwankt“. In Schätzungen Dritter (siehe Tabelle unten) brauchen viele Modelle für eine kurze Frage unter 0,5 Wh, doch ein langer Prompt an die stromhungrigsten Modelle übersteigt 29 Wh — mehr als das 65-Fache der effizientesten. Wie schon in der Falle „verbrauchte Tokens = Arbeitsleistung“ angesprochen, ist „einfach alles mit dem Spitzenmodell erledigen“ ein Luxus — beim Strom wie bei den Kosten. Leichte Aufgaben an ein leichtes Modell zu geben schont Planet und Geldbeutel. Laut der Internationalen Energieagentur (IEA) lag der weltweite Stromverbrauch von Rechenzentren 2024 bei etwa 415 TWh (rund 1,5 % des Weltverbrauchs) und dürfte sich bis 2030 auf etwa 945 TWh verdoppeln — mit KI als wichtigstem Treiber.
„Strom pro Anfrage“ hängt davon ab, wer wie gemessen hat
Zahlen wie „X Wh pro Anfrage“ werden oft zitiert, sind aber je nach Quelle auf völlig unterschiedliche Weise entstanden. Eigene Messungen der Unternehmen und Schätzungen von außen sollte man getrennt lesen.
| Zahl | Worauf sie sich bezieht | Quelle | Wie sie entstand |
|---|---|---|---|
| 0,24Wh | Ein Text-Prompt in der Gemini-App (Median) | Google (Aug. 2025, eigenes Paper) | In den eigenen Rechenzentren gemessen, einschließlich Leerlaufkapazität und Overhead des Rechenzentrums |
| ~0,34Wh | Eine ChatGPT-Anfrage (Durchschnitt) | Blog von OpenAI-CEO Sam Altman (Jun. 2025) | Zahl des Unternehmens selbst; die Methode wurde nicht veröffentlicht |
| 0,42Wh | Ein kurzer Prompt an GPT-4o | Jegham et al. (Dritte, 2025) | Geschätzt aus öffentlichen API-Leistungsdaten und erschlossenen Hardware-Konfigurationen |
| 29Wh+ | Ein langer Prompt an die stromhungrigsten Modelle | Ebenda | Ebenda; mehr als das 65-Fache der effizientesten Modelle |
Messungen der Unternehmen haben einheitliche Bedingungen, lassen sich aber von außen nicht prüfen; Schätzungen Dritter sind leichter vergleichbar, beruhen aber auf mehr Annahmen. Beides sind Werte für eine einzelne Textanfrage — das Lesen langer Dokumente, die Erzeugung von Bildern oder Videos und lange Agentenaufgaben verbrauchen mehr.
Auf die eigene Nutzung übertragen, bekommt man ein Gefühl für die Größenordnung. Wer täglich 50 kurze Fragen stellt, kommt mit 0,24–0,42 Wh × 50 auf etwa 12–21 Wh pro Tag — ungefähr so viel wie eine 10-W-LED-Lampe, die ein bis zwei Stunden brennt. Ein einziger langer Prompt an ein schweres Modell kann dagegen über 29 Wh liegen. Den Stromverbrauch bestimmt weniger, wie oft man fragt, als welches Modell man nutzt und wie lange man es nachdenken lässt.
6. Stimmt es, dass "Entwicklung eine Geldschlacht" ist?
Hier ist die Frage, die dich am meisten interessiert hat. "Ist die Entwicklung von Spitzen-LLMs eine Geldschlacht?" Zuerst die belegte Schlussfolgerung: "Beschränkt auf das Pre-Training der Spitze ist es im Wesentlichen wahr." Die Zahlen stützen es.
Verlauf der Trainingskosten an der Spitze
Die Trainings-Rechenleistung an der Spitze wächst um das 4- bis 5-Fache pro Jahr (Epoch AI).
Die Trainingskosten steigen um das 2,4-Fache pro Jahr — in der Tat eine Geldschlacht.
Konkret schätzte der AI Index 2024 des Stanford HAI die Rechenkosten des Trainings auf etwa 78 Millionen Dollar für GPT-4 und etwa 191 Millionen Dollar für Googles Gemini Ultra (AI Index 2024). Ein Paper des Forschungsinstituts Epoch AI kommt zu dem Ergebnis, dass die Trainingskosten der größten Modelle seit 2016 um das 2,4-Fache pro Jahr gestiegen sind und die größten Trainingsläufe bis 2027 mehr als eine Milliarde Dollar kosten werden, wenn sich der Trend fortsetzt (Cottier et al.). Und das ist „ein erfolgreicher Lauf“ — dahinter stehen gescheiterte Versuche, Datenaufbereitung, Gehälter und Inferenz-Infrastruktur. Hinzu kommt: Jede GPU kostet Tausende Dollar; Zehntausende davon monatelang laufen zu lassen, treibt die Stromrechnung in die Höhe. Eine Geldmauer, die „eine gute Idee“ oder „ein cleverer Algorithmus“ allein niemals überwinden, steht am Eingang zur Spitze. In diesem Sinne ist „Geldschlacht“ keine Übertreibung, sondern Tatsache. Deshalb können nur eine Handvoll Akteure mit enormem Kapital — OpenAI, Google, Anthropic, Meta, xAI — ganz vorne mitkämpfen.
7. Doch Geld allein gewinnt nicht — der Effizienz-Rückstrom
Das vorige Kapitel sagte "die Geldschlacht ist real". Aber die Geschichte dort enden zu lassen verkennt die Realität von 2026. Es ist keineswegs wahr, dass "man mit genug Geld gewinnt" — wenn überhaupt, hat sich eine Gegenströmung verstärkt. Als ehrliche Antwort lass mich auch diese andere Seite aufschreiben.
Sinnbildlich dafür sind die Schritte, mit denen das chinesische DeepSeek mit vergleichsweise kleinem Budget Modelle nahe der Spitze herausbrachte und dem nachgesagt wurde, es habe „den Kostenboden zurückgesetzt“. Techniken, dieselbe Leistung um Größenordnungen günstiger zu erreichen — effiziente Architekturen, Mixture of Experts (MoE), Destillation (Wissen eines großen Modells auf ein kleines übertragen) und sorgfältige Arbeit an der Datenqualität —, wurden eine nach der anderen belegt und treiben einen Keil in die Formel „riesiges Kapital = Sieg“. Die Aufmerksamkeit der Branche weitet sich von „einfach größer“ auf „dieselbe Leistung günstiger und stromsparender“.
Das genaue Bild ist also dieses: "Das Rennen, die 'Spitzenleistung' der Frontier zu aktualisieren, ist eine Geldschlacht. Aber das Rennen, 'ausreichend gute Leistung' günstig zu liefern, ist ein Wettstreit der Köpfe und der Effizienz." Die meisten Modelle, die wir tagtäglich nutzen, profitieren von Letzterem und werden Jahr für Jahr günstiger, schneller und energieeffizienter. Wie in wie weit man mit dem kostenlosen Tarif kommt geschrieben, erreichten bis 2026 selbst die kostenlosen Tarife ein praktisches Niveau — eine Frucht, die der Effizienz-Rückstrom den Nutzern in die Hand gibt.
8. Was als Nächstes kommt — die Mauer aus "Strom und Physik" nach dem Geld
Kann man also ewig skalieren, indem man einfach Geld stapelt? Nein — und das ist die neue Mauer, die 2026 zu erscheinen begann. Eine Analyse von Epoch AI (August 2024) hält Trainingsläufe von etwa 2×10²⁹ FLOP bis 2030 für wahrscheinlich machbar, sieht aber Strom als die Grenze, die wohl zuerst greift, gefolgt von der Kapazität der Chipfertigung. Der Engpass ist nicht mehr nur "das Budget zum Kauf von GPUs". Stattdessen versperren den Weg —
- Strom: kann man kontinuierlich Strom im Gigawatt-Maßstab an einem Ort liefern? Mittlerweile ein Problem von Kraftwerken und Stromnetzen
- Interconnect: die Bandbreite, um Zehntausende bis Hunderttausende GPUs ohne Latenz zu synchronisieren. Es gibt eine physische Obergrenze dafür, was ein einzelner riesiger Trainingsjob bewältigen kann
- Daten: hochwertiger Trainingstext geht selbst zur Neige (es gibt eine Grenze, wie viel gute Schriften die Menschheit hervorgebracht hat)
Was nach "der Geldschlacht" kommt, ist "ein Kampf um Strom, Physik und Köpfe". Deshalb verlagern sich Unternehmen nun hin zu Investitionen in Kernkraft, zur Entwicklung eigener dedizierter Chips, zur Nutzung synthetischer Daten und zur Erforschung effizienter Architekturen. Die Ära, in der man durch Geldwerfen gewinnen konnte, verwandelt sich ironischerweise in eine Ära, in der man mit Geld allein nicht gewinnen kann.
Zusammenfassung
Die wahre Natur eines LLM ist "ein riesiges Vorhersagegerät, bei dem Hunderte Milliarden bis über eine Billion 'Gewichte' fortwährend die Wahrscheinlichkeit des nächsten Wortes berechnen". Die Attention des Transformers übernimmt die "kontextabhängige Gewichtung", und Pre-Training (das den Großteil der Rechenleistung, des Stroms und des Geldes verschlingt) plus Post-Training (RLHF, Schließtraining) machen die Regler klug. Die Klugheit ist keine Magie — sie ist ein Nebenprodukt davon, das "Erraten des nächsten Wortes" auf gewaltigen Textmengen bis zum Äußersten zu trainieren.
Beim Strom: Eine Anfrage braucht laut Googles eigener Messung 0,24 Wh (Median), eine kurze Anfrage laut einer Schätzung Dritter 0,42 Wh, und ein langer Prompt an die schwersten Modelle über 29 Wh (mehr als das 65-Fache des effizientesten); allein das Training von GPT-3 verbrauchte 1.287 MWh. Gesamtgesellschaftlich summiert sich der Verbrauch auf der Inferenzseite, und der Strombedarf der Rechenzentren weltweit dürfte sich bis 2030 auf etwa 945 TWh verdoppeln (IEA). „Alles mit dem Spitzenmodell erledigen“ ist beim Strom wie bei den Kosten ein Luxus; klug ist es, das Modell nach dem Gewicht der Aufgabe zu wählen.
Und die Kernfrage — „Ist die LLM-Entwicklung eine Geldschlacht?“ Die Antwort lautet „im Wesentlichen ja, beschränkt auf das Vortraining an der Spitze“ (etwa $78M Rechenkosten für GPT-4; über $1B pro Lauf bis 2027 prognostiziert). Doch der Gegenstrom „Geld allein gewinnt nicht“ ist ebenfalls stark (DeepSeeks Zurücksetzen des Kostenbodens, Effizienz, Destillation). Die Spitzenleistung zu steigern ist eine Geldschlacht; praxistaugliche Leistung günstig zu liefern ist ein Wettstreit des Einfallsreichtums — diese zweischichtige Struktur ist die Realität von 2026. Als Nächstes kommt die physische Mauer aus Strom, Vernetzung und Datenknappheit. Wer ein LLM nicht als „Zauberkiste“, sondern als „strombetriebene Wahrscheinlichkeitsmaschine“ versteht, lässt sich weder vom Hype noch von der Angst mitreißen. Mehr dazu unter Was ist ein LLM? (Einführung), Kontextfenster und Vergleich der Gratis-Stufen.
FAQ
F. Sind mehr Parameter (Gewichte) immer klüger?
A. "Größer war klüger" galt einst fast universell, aber 2026 ist es nicht so einfach. Selbst bei gleicher Parameterzahl variiert die Leistung stark mit Datenqualität, Post-Training und architektonischem Einfallsreichtum. Kleine-aber-kluge Modelle (Produkte von Distillation und effizientem Design) haben sich vervielfacht, und "Parameterzahl = Intelligenz" gilt nicht mehr. Wir sind in eine Ära von "wie es trainiert wird" statt "wie viele" eingetreten.
F. "Versteht" ein LLM wirklich, oder ist es stures Auswendiglernen?
A. Selbst Experten sind uneins — es ist eine schwere Frage. Sicher ist, dass "es eine Generalisierung zeigt, die stures Auswendiglernen nicht erklären kann" (es löst Probleme, die nicht in seinen Trainingsdaten waren). Ob das "dasselbe Bedeutungsverständnis wie beim Menschen" ist, ist eine separate Frage ohne klare Antwort. Praktisch betrachte es als "ein extrem fortschrittliches Vorhersagegerät, das sich verhält, als würde es verstehen". Genau deshalb irrt es so selbstbewusst (Halluzination).
F. Kann ich mein eigenes LLM bauen?
A. "Spitzen-Klasse" ist für eine Einzelperson unmöglich (es braucht Hunderte Millionen Dollar und Zehntausende GPUs). Aber ein kleines Modell zu trainieren oder ein bestehendes offenes Modell zu fine-tunen, ist auch für Einzelpersonen machbar. Außerdem werden die meisten praktischen Bedürfnisse durch die Nutzung bestehender Modelle über die API gedeckt. Es gibt fast keine Notwendigkeit, "alles selbst zu bauen".
F. Ist der Stromverbrauch von KI ein ernstes Problem für den Planeten?
A. Es ist Fakt, dass die Größenordnung nicht mehr zu vernachlässigen ist (Rechenzentrums-Strom liegt bei etwa 1,5 % des Welttotals, soll sich bis 2030 verdoppeln — IEA). Aber parallel schreitet auch die Effizienz rasend voran; der "Strom pro Token" sinkt Jahr für Jahr. Das Problem ist weniger "die Effizienz einer Anfrage" als "das explosive Wachstum von Gesamtvolumen × Häufigkeit". Wie viel davon Erneuerbare, Kernkraft und dedizierte Chips ausgleichen können, ist der zukünftige Fokus.
F. Was lohnt sich am Ende als Nutzer zu wissen?
A. Drei Dinge. (1) Das Modell ist ein "Wahrscheinlichkeitsvorhersager", also irrt es selbst in selbstbewusstem Ton (wichtige Infos prüfen). (2) Schwere Fragen sind teuer bei Strom und Geld, also wähle das Modell nach dem Gewicht der Aufgabe (leichte Aufgaben an leichte Modelle). (3) "Spitzenleistung" ist eine Geldschlacht, aber "praktische Leistung" wird jedes Jahr günstiger und energieeffizienter (auf die Weiterentwicklung kostenloser/günstiger Modelle zu warten ist ebenfalls klug). Je mehr du den Mechanismus kennst, desto günstiger und cleverer kannst du KI nutzen.