Nun das letzte Kapitel dieses Kurses. Hier überblicken wir in einem Rutsch, was gerade an der Front geschieht. Multimodalisierung, Reasoning-Modelle, KI-Agenten, Open Source, Robotik, AGI – erfassen wir ohne Fachjargon den „aktuellen Standort“ einer Welt, deren Landschaft sich in einem halben Jahr verändert. Lies Zahlen und Eigennamen als Momentaufnahme mit Stand März 2026.
Das „Jetzt“ der KI in 5 Minuten überblicken
Das Tempo der KI-Entwicklung spüren
Während ich dieses Kapitel im März 2026 schreibe, ist in der KI-Branche „was vor einem halben Jahr galt, gilt nicht mehr“ zum geflügelten Wort geworden.
In Zahlen wird dieses Tempo gut sichtbar. Die KI-bezogenen Investitionen erreichten 2025 mit 225,8 Mrd. US-Dollar (rund 34 Bio. Yen) einen Rekord[1]. 77 % der Unternehmen haben KI eingeführt oder testen sie, und 21 % der Weltbevölkerung nutzen täglich KI-Tools. Das KI-Marktvolumen wird für 2025 auf rund 244–391 Mrd. US-Dollar geschätzt.
rund 34 Bio. Yen
Blicken wir chronologisch auf die wichtigsten Ereignisse zurück, die in diesen anderthalb Jahren geschehen sind.
Von hier aus vertiefen wir vier besonders wichtige Trends.
Multimodale KI – eine KI mit fünf Sinnen
Multimodale KI ist eine KI, die mehrere Formate integriert verarbeiten kann – Text, Bild, Audio, Video usw. Frühe LLMs waren „Wesen, die nur Text lesen und schreiben konnten“, doch die heutige KI sieht Fotos, hört Stimmen und erstellt Videos.
Der Durchbruch 2025
| Bereich | Dienstname | Was er kann |
|---|---|---|
| Bildgenerierung | GPT-4o (native Bildgenerierung) | Erzeugt Bilder mit Text präzise. Kurz nach der Veröffentlichung im März 2025 so große Nachfrage, dass Altman von „schmelzenden“ GPUs sprach |
| Videogenerierung | Google Veo 3 | Erzeugt Videos mit Ton. Nach dem Release wurden insgesamt über 270 Mio. Videos generiert |
| Verständnis langer Texte | Gemini 2.5 Pro | Verarbeitet 1 Mio. Token (mehr als ein ganzes Buch) auf einmal. Debüt auf Platz 1 in der LMArena |
| Sprachdialog | GPT-4o Advanced Voice | Ohne Umweg über Text ein natürlicher Sprachdialog in Echtzeit. Auch als Dolmetscher einsetzbar |
Für die Video-KI „Sora“ von OpenAI wurde dagegen wegen geschätzter Infrastrukturkosten von rund 1 Mio. US-Dollar pro Tag und einer schwächelnden Nutzerentwicklung 2026 die Einstellung des Dienstes angekündigt (Web und App im April, die API im September). Das rückt auch die Realität ins Bild, dass hochwertige Videogenerierung noch enorme Kosten verursacht.
💡 Praxistipp: Die Bildanalyse (Foto → Text) lässt sich bei fast allen Anbietern im Gratiskontingent nutzen. Probiere im Alltag ruhig aus: Kassenbons einlesen, handschriftliche Notizen in Text umwandeln, Zahlenwerte aus Diagrammen extrahieren.
Die Revolution der Reasoning-Modelle – der Auftritt der „denkenden“ KI
Seit dem späten 2024 ist in der Welt der KI eine neue Kategorie entstanden: das Reasoning-Modell.
Frühere KI hatte den Stil „auf eine Frage sofort antworten“. Reasoning-Modelle sind anders. Sie nehmen sich vor der Antwort „Zeit zum Nachdenken“. Genau wie ein Mensch beim Lösen einer Mathematikaufgabe nicht sofort die Antwort hinschreibt, sondern sich mit Notizen Schritt für Schritt herantastet.
Warum es wichtig ist
Mit dem Auftritt der Reasoning-Modelle verbesserte sich die Leistung dramatisch in Bereichen, in denen KI schwach war – Mathematik, Naturwissenschaften, komplexe Programmierung.
Bei Aufgaben auf Mathematik-Olympiade-Niveau (AIME 2025) 92,7 % erreicht. Mit Python-Tool sogar 99,5 %.
Erreichte mit Trainingskosten von nur rund 6 Mio. Dollar (im Vergleich zu geschätzt über 100 Mio. Dollar bei GPT-4) hohe Leistung und wurde im Januar 2025 in den USA zur Nr.-1-iOS-App. Nvidias Aktienkurs fiel zeitweise um 18 %[2].
Eine eigene Funktion, bei der Entwickler das „Denk-Budget“ frei festlegen können. Umgesetzt als „Interleaved Thinking“, das weiterdenkt, während es Tools nutzt.
⚡ Beachtenswert: Inference-time Compute
Die Erkenntnis, dass „mehr Zeit zum Nachdenken zu einer genaueren Antwort führt“, hat der KI-Entwicklung eine neue Achse hinzugefügt. Zusätzlich zum bisherigen „mehr Trainingsdaten“ und „größere Modelle“ zeigte sich, dass sich die Leistung auch durch mehr Rechenaufwand zur Inferenzzeit steigern lässt.
KI-Agenten – in die Ära des „Überlassens“
Das heißeste Schlagwort 2025–2026 ist der KI-Agent.
Bisherige KI war ein Ratgeber, der „auf eine Frage antwortet“. KI-Agenten sind anders. Nennt man ein Ziel, stellen sie einen Plan auf, nutzen Tools und führen die Aufgabe autonom aus. Es kommt dem Gefühl nahe, einem Sekretär oder Assistenten eine Arbeit zu „überlassen“. Wer die Funktionsweise genauer wissen will, dem sei „Was ist ein KI-Agent“ empfohlen; wie mehrere KIs koordiniert zusammenarbeiten, steht in „Was ist ein Multi-Agent“.
Konkrete Beispiele für KI-Agenten
| Agent | Was er kann | Merkmal |
|---|---|---|
| Claude Code | Code generieren, ausführen und debuggen – durchgängig autonom | Eines von drei Produkten, die als Coding-KI über 1 Mrd. Dollar ARR erreicht haben |
| Operator | Bedient den Webbrowser und übernimmt Reservierungen oder Recherchen | Setzt menschliche Kontrollpunkte, doch die Abwehr von Prompt-Angriffen ist eine Herausforderung |
| Manus AI | Führt komplexe Aufgaben asynchron in der Cloud aus | 2025 erschienen. Meta übernahm es für rund 2 Mrd. Dollar, doch 2026 blockierten die chinesischen Behörden, und das Rückabwicklungsverfahren läuft |
| Devin | Ein KI-Ingenieur, der Softwareentwicklung autonom ausführt | 500 Dollar/Monat. Offizielle Erfolgsquote 13,86 %, noch in Entwicklung |
🛠 Wer einen „Kumpel“ zum Codeschreiben ernsthaft einsetzen will, dem erklärt der Schwesterkurs „KI-Coding in der Praxis“ alles von der Einführung bis zur Meisterschaft von Claude Code u. a. Wer privat eine App bauen will, dem sei auch „Indie-Entwicklung mit KI“ empfohlen.
MCP – die „gemeinsame Sprache“ der KI-Agenten
Als Standard, über den Agenten mit externen Tools zusammenarbeiten, verbreitet sich das von Anthropic entwickelte MCP (Model Context Protocol) rasant. Im Dezember 2025 wurde es der Linux Foundation gestiftet, und die monatlichen SDK-Downloads erreichten 97 Millionen. Große Plattformen wie ChatGPT, Gemini, VS Code, AWS und Azure setzen es reihenweise ein.
Laut Prognose von Gartner werden bis Ende 2026 in 40 % der Unternehmensanwendungen KI-Agenten eingebettet sein[1].
⚠️ Die Herausforderungen der Agenten: Agenten sind praktisch, haben derzeit aber einige wichtige Einschränkungen. Etwa Fehler bei komplexen Entscheidungen, Sicherheitsrisiken (z. B. eigenmächtiges Versenden von Informationen), Kosten (autonom wiederholte API-Aufrufe) und undurchsichtige Rechenschaftspflicht. Die eiserne Regel lautet nicht „völlig überlassen“, sondern „überlassen und prüfen“.
Der Aufstieg der Open-Source-KI
Nicht nur kommerzielle KI wie GPT-4 oder Claude ist alles. Kostenlos nutzbare, veränderbare Open-Source-KI entwickelt sich mit gewaltigem Tempo.
Wichtige Modelle (Stand 2025)
| Modell | Entwickler | Merkmal |
|---|---|---|
| Llama 4 Scout / Maverick | Meta | Scout: Unterstützung superlanger Texte mit 10 Mio. Token, läuft auf 1× H100. Maverick: Leistung auf GPT-4o-Niveau |
| DeepSeek V3 / R1 | DeepSeek (China) | V3 auf GPT-4o-Niveau bei Trainingskosten von rund 6 Mio. Dollar. R1 als Reasoning-Modell Nr. 1 in den USA |
| Qwen 3 | Alibaba | Apache-2.0-Lizenz. Unterstützt 119 Sprachen. Bei den Downloads Llama überholt |
🖥 Willst du es auf dem eigenen PC ausführen? Open-Source-Modelle lassen sich auch in der eigenen Umgebung betreiben. Zum Einstieg ist „So startest du mit einem lokalen LLM“ hilfreich, zur Modellwahl „Vergleich lokaler LLM-Modelle“.
Warum Open Source wichtig ist
Open-Source-KI hat fünf Bedeutungen.
Die Funktionsweise des Modells lässt sich überprüfen und die Sicherheit bewerten.
Mit eigenen Daten lässt sich ein spezialisiertes Modell aufbauen.
Betreibt man es auf eigenen Servern, werden die API-Gebühren null.
KI nutzen, ohne Daten nach außen zu senden.
Verhindert ein KI-Monopol weniger Großkonzerne.
Im Sommer 2025 kam es zu einem symbolträchtigen Ereignis: Bei den Gesamt-Downloads von Open-Source-Modellen überholten Modelle aus China (DeepSeek + Qwen) die aus den USA. Die geopolitische Balance der KI-Entwicklung verschiebt sich.
💡 Für normale Nutzer wichtig: Open-Source-KI richtet sich vor allem an Unternehmen und Entwickler, doch ihr Nutzen erreicht indirekt alle. Weil der Wettbewerb härter wird, sinken die Preise kommerzieller KI und die Leistung steigt. Tatsächlich senkten nach dem Auftritt von DeepSeek R1 mehrere Anbieter ihre API-Preise deutlich.
Die KI von morgen – Ausblick ab 2026
Zum Schluss betrachten wir, wohin die KI in den nächsten Jahren steuert, aus drei Blickwinkeln: Robotik, AGI und Japans KI-Strategie.
Tesla Optimus zielt auf einen Serienpreis von 20.000–30.000 Dollar. Figure 03 ist im BMW-Werk im Realbetrieb. 1X NEO wird für den Haushalt für rund 20.000 Dollar 2026 ausgeliefert. In China sind über 140 Firmen und mehr als 330 Modelle in Entwicklung. Auch in Japans KI-Grundplan ein Schwerpunkt (als Lösung für den Arbeitskräftemangel).
Anthropic: Anfang 2027, Google DeepMind: innerhalb von 3–5 Jahren, OpenAI: „Wir wissen, wie man sie baut“, Skeptiker: „Es braucht noch einen grundlegenden Durchbruch“. Beachtung findet auch die neue Skalierungsachse des Rechenaufwands zur Inferenzzeit.
Budget: 1 Bio. Yen über 5 Jahre. SoftBank + OpenAI investieren rund 41 Mrd. Dollar, NTT tsuzumi 2 ist ein heimisches LLM, „Gennai“ der Digitalagentur ist die KI-Basis der Regierung. Kennzeichnend ist die Haltung „Innovation vor Regulierung“.
KI × Robotik – die praktische Umsetzung der „bewegten KI“
Ein humanoider Roboter, der die Intelligenz eines LLM mit dem Körper eines Roboters verbindet, beginnt nun endlich, in realen Szenen zu wirken.
- Figure 03 – real im BMW-Werk eingesetzt. Investitionssumme über 1 Mrd. Dollar
- 1X NEO – der weltweit erste Haushalts-Humanoide. Auslieferungsstart 2026 für rund 20.000 Dollar (499 Dollar/Monat)
- Tesla Optimus – Serienpreis von 20.000–30.000 Dollar angepeilt. Produktionsplan für 2026 im Bereich einiger Zehntausend Stück
- China – über 140 Firmen, mehr als 330 Modelle in Entwicklung
Auch in Japans KI-Grundplan der Regierung wird „Physical AI“ (Roboter × KI) als Lösung für den Arbeitskräftemangel als Schwerpunkt eingeordnet[3].
Der Weg zur AGI – die Prognosen der Fachleute
Zum Zeitpunkt der Ankunft von AGI (Artificial General Intelligence – eine KI mit menschengleicher oder höherer Intelligenz) gehen die Ansichten der Branche auseinander. Die Bedeutung des Begriffs erklären wir unter „Was ist AGI (Artificial General Intelligence)“, den „technologischen Singularitätspunkt“, an dem KI den Menschen übertrifft, unter „Was ist die technologische Singularität“.
| Position | Prognose |
|---|---|
| Anthropic | „Anfang 2027“ – eine KI auf dem Niveau von Nobelpreis-Forschern von Ende 2026 bis Anfang 2027 |
| OpenAI | „Wir wissen, wie man sie baut“ – vermeidet ein konkretes Datum, ist aber optimistisch |
| Google DeepMind | „Innerhalb von 3–5 Jahren“ – deutlich vorgezogen vom früheren „10 Jahre“ |
| Skeptische Forscher | „Es braucht noch einen grundlegenden Durchbruch“ – auf dem aktuellen Weg 10–20 Jahre |
Auch wenn es heißt „AGI kommt“, ändert sich das Leben nicht sofort schlagartig. Fest steht jedoch, dass sich der Umfang dessen, was KI kann, praktisch jeden Monat erweitert. Die Annahme „das kann die KI wohl noch nicht“ ist vielleicht schon in einem halben Jahr veraltet.
Japans KI-Strategie
Im Dezember 2025 stellte die japanische Regierung ihren ersten KI-Grundplan auf und kündigte an, über fünf Jahre 1 Bio. Yen (rund 7 Mrd. Dollar) in KI und Halbleiter zu investieren[3].
- SoftBank × OpenAI – SoftBank investiert rund 41 Mrd. Dollar in OpenAI. Über das Gemeinschaftsunternehmen „SB OAI Japan“ wird eine KI-Basis für Japan aufgebaut
- NTT tsuzumi 2 – ein heimisches LLM. Läuft auf 1× H100, bei der Japanisch-Leistung Weltspitze
- „Gennai“ der Digitalagentur – eine KI-Basis für rund 180.000 Regierungsbeschäftigte. 7 Firmen wie NTT, KDDI und PFN setzen sie ein
Japan verfolgt die Haltung „Innovation vor Regulierung“ und steht im Gegensatz zum strengen Regulierungsansatz der EU.
Was man „jetzt“ im Zeitalter der KI tun sollte
Mit kostenlos nutzbaren KI-Tools tatsächlich Erfahrung sammeln. Einmal ausprobieren sagt mehr als tausend Worte.
KI ist ein Werkzeug. Kombiniert mit deiner Fachlichkeit und Kreativität wird sie zu Wert.
Eine Zeit, in der sich das Selbstverständliche in einem halben Jahr ändert. Neugierig zu bleiben ist die größte Fähigkeit.
- KI wurde multimodal und verarbeitet neben Text nun auch Bild, Audio und Video.
- Mit Reasoning-Modellen wird die „denkende“ KI, mit KI-Agenten die „überlassbare“ KI Wirklichkeit.
- Open-Source-KI wächst rasant, und auch die geopolitische Balance verschiebt sich.
- Die nächsten Schauplätze sind Robotik, AGI, nationale Strategien. Das Selbstverständliche ändert sich in einem halben Jahr.
- Wichtig sind die 3 Punkte: ausprobieren und vertraut werden, mit den Stärken verbinden, den Wandel genießen.
Quellen
- Gartner. "Worldwide AI Spending Will Total $1.5 Trillion in 2025." Gartner Newsroom, September 2025. / Fortune Business Insights. "Artificial Intelligence Market Report." 2025.
- "DeepSeek R1: Open-source reasoning model." DeepSeek API Docs, January 20, 2025. / Market impact reported by multiple financial outlets, January 27, 2025.
- "Japan adopts first AI basic plan with 1 trillion yen investment." Nikkei, December 2025. / "Japan AI Basic Plan." AI Strategy Headquarters, December 2025.
Weiterführende Links:
- Hugging Face Models – Hub für Open-Source-KI-Modelle
- LM Arena – Leaderboard zum Vergleich der Leistung von KI-Modellen
Von den Grundlagen der KI bis zu den neuesten Entwicklungen konntest du dir systematisches Wissen aneignen. KI entwickelt sich täglich weiter. Nutze das in diesem Kurs erworbene Fundament, probiere die Tools tatsächlich aus und bleib mit den neuesten Informationen am Ball. Wer sie als Kumpel zum Codeschreiben meistern will, dem sei der Schwesterkurs „KI-Coding in der Praxis“ empfohlen, wer privat einen Dienst bauen will, „Indie-Entwicklung mit KI“.