Zum Inhalt springen
Themen

KI-Agenten & Automatisierung: RAG, Workflows, Guides

Verstehen Sie KI-Agenten, RAG und Automatisierungs-Workflows. Von Konzepten bis zu realen Anwendungen.

46 Artikel

Sortieren Sie Artikel, um das Gewünschte zu finden

Artikel in KI-Agenten & Automatisierung

Claude Dispatch — wie Ihr Handy Ihren eigenen PC steuert und wie sicher das ist

Claude Dispatch — wie Ihr Handy Ihren eigenen PC steuert und wie sicher das ist

Dispatch ist die Funktion, bei der Sie vom Handy aus eine Anweisung schicken und Claude die Arbeit auf Ihrem eigenen Rechner ausführt (Beta, Pro und Max). Sie läuft nicht in der Cloud, sondern Ihre reale Maschine bewegt sich, und aus dieser einen Tatsache entspringen zugleich der Nutzen und die Gefahr. Die offizielle Hilfe schreibt, dass Sie Claude von Ihrem Telefon aus eine Nachricht schicken und es auf Ihrem Desktop-Computer arbeiten lassen können, wobei es dieselben Connectors, Plugins und Dateizugriffe nutzt, die Sie in Cowork bereits eingerichtet haben, und zwar innerhalb dessen, was Anthropic als ein einziges fortlaufendes Gespräch rahmt, das von beiden Geräten aus erreichbar ist. Für den Betrieb muss der PC wach und die Desktop-App geöffnet sein, und Computer Use wird nur unter macOS und Windows unterstützt, unter Linux gibt es kein Computer Use. Mechanisch arbeitet die Funktion drei Stufen der Priorität ab: einen Connector, falls einer verfügbar ist, sonst die Navigation im Browser und als letztes Mittel die direkte Bildschirminteraktion, wobei unterwegs Screenshots aufgenommen werden, um die Anzeige zu verstehen. Danach beginnt die Bewertung. Die Stellen, an denen es anhält, sind eingebaut: Computer Use ist standardmäßig aus und wird unter Einstellungen und Allgemein aktiviert; um Erlaubnis wird für jede neue Anwendung einzeln gebeten; das endgültige Löschen einer Datei erfordert ausdrückliche Erlaubnis; und Investment- und Trading-Plattformen sowie Krypto-Apps sind standardmäßig tabu. Aber es gibt Stellen, an denen es nicht anhält. Einzelne Aktionen innerhalb einer bereits freigegebenen App werden nicht mit Ihnen abgestimmt, und die offizielle Formulierung lautet, dass Claude direkt auf Ihrem Bildschirm klickt, tippt und navigiert, ohne die Berechtigungsprüfungen, die andere Cowork-Werkzeuge absichern. Die Doku ergänzt, dass zwischen Claude und dem, was auf Ihrem Bildschirm ist, keine Sandbox liegt und dass Aktionen in einer App sich auf andere Apps auswirken können. Das größte Risiko ist Prompt Injection, die Anthropic mit eigenen Worten beschreibt: Web-Inhalte sind ein primärer Vektor für Prompt-Injection-Angriffe, und eine manipulierte Anweisung, ein unerwarteter Befehl oder ein Phishing-Link, der im Browser geöffnet wird, könnte sich zu Aktionen auswachsen, die sich nur schwer oder gar nicht rückgängig machen lassen. Anthropic gibt an, die Aktivierungen des Modells zu durchsuchen, um solches Verhalten zu erkennen, doch das senkt die Wahrscheinlichkeit, statt Ihnen das Ziehen einer eigenen Grenze abzunehmen, und die Hinweise sagen weiterhin, dass man auf manuelle Bestätigung umstellen soll, sobald eine Aufgabe sensible Dateien, Konten oder Websites berührt. Anthropic benennt die Grenze ausdrücklich: Erteilen Sie Computer Use keine Zugriffsberechtigung auf sensible Apps wie Banking, Gesundheitswesen und Behörden, und vermeiden Sie Finanzkonten, Rechtsdokumente, medizinische Informationen und personenbezogene Daten. Der Artikel behandelt auch die Handyseite. Was bei Verlust des Geräts nach außen dringt, sind nicht die darauf gespeicherten Daten, sondern die Befugnis, Ihrem PC Anweisungen zu geben, plus die Inhalte des fortlaufenden Gesprächs — und die offizielle Hilfe zu Dispatch dokumentiert weder das Entkoppeln noch das Vorgehen bei Verlust, weshalb die Gegenmittel von der Kontoseite kommen: die einzelne Sitzung unter Einstellungen, Konto und Aktive Sitzungen beenden, sich über claude.ai von allen Sitzungen abmelden (was in den Mobil-Apps nicht verfügbar ist und daher einen Webbrowser erfordert) oder schlicht die PC-Seite kappen, indem Sie die Desktop-App schließen oder die Maschine schlafen legen, was tatsächlich am schnellsten wirkt, weil Dispatch einen wachen PC mit geöffneter App verlangt. Zum Schluss trennt der Artikel Dispatch und Computer Use als zwei getrennte Schalter, grenzt beide von der agent view in Claude Code ab (die die offizielle Doku ebenfalls dispatch nennt) und zieht eine praktische Grenze: Fangen Sie mit Arbeit an, die Sie zurücknehmen können.

Die agent view von Claude Code — wie Sessions parallel laufen und wo die Isolation nach außen dringt

Die agent view von Claude Code — wie Sessions parallel laufen und wo die Isolation nach außen dringt

Die agent view von Claude Code, geöffnet mit claude agents, ist die Funktion, mit der Sie eine unabhängige Hintergrund-Session nach der anderen starten und alle von einem einzigen Bildschirm aus verwalten. Die offizielle Dokumentation nennt die Operation, die Sie dort ausführen, dispatch, was mit der gleichnamigen, aber völlig anderen Funktion der Desktop-App kollidiert, weshalb die erste Aufgabe darin besteht, beide auseinanderzuhalten. Die Doku beschreibt agent view als die Funktion, mit der sich viele Claude-Code-Sessions von einem Bildschirm aus dispatchen und verwalten lassen, und sie ist eine Research Preview, die v2.1.139 oder neuer voraussetzt. Dieser Artikel bleibt bei der Mechanik und dem Sicherheitsmodell. Die erste Überraschung ist, dass jeder Prompt, der in das Eingabefeld getippt wird, seine eigene neue Session startet: Tippen Sie einen zweiten, bekommen Sie eine zweite Session neben der ersten und keine zusätzliche Anweisung an die erste. Weitere Anweisungen laufen über das Peek-Panel, das mit Space geöffnet wird und die letzte Ausgabe oder die Frage zeigt, auf die die Session wartet, statt des gesamten Protokolls. Das Herz des Sicherheitsmodells ist die Isolation über worktrees. Bevor eine Hintergrund-Session irgendeine Datei bearbeitet, zieht sie in ein isoliertes git worktree unterhalb von .claude/worktrees/ um, sodass parallele Sessions denselben Checkout lesen, aber jeweils in ihren eigenen schreiben, also gemeinsam lesen und getrennt schreiben. Alles, was den Haupt-Checkout erreichen würde, wird von drei Prüfungen abgeschnitten: Dateibearbeitungen über Edit, Write und NotebookEdit; Arbeitsverzeichnisse von Befehlen, die auf den Haupt-Checkout zeigen oder bei denen sich nicht überprüfen lässt, dass sie draußen bleiben; und Versuche, git über git -C, --git-dir, GIT_DIR, GIT_WORK_TREE oder ein cd vor dem git-Aufruf umzulenken. Die Entscheidung fällt bewusst auf der sicheren Seite und verweigert, was sich nicht überprüfen lässt, und derselbe Schutz wird an jeden Subagent vererbt, den die Session erzeugt. Eine Mauer auf Betriebssystemebene ist es allerdings nicht: Dateien außerhalb des Repositorys und das Netzwerk fallen nicht in den Geltungsbereich, und PowerShell-Befehle bekommen nur die Prüfung des Arbeitsverzeichnisses. Auch die Berechtigungen werden nicht beim Dispatch gewählt, sondern aus dem defaultMode des jeweiligen Verzeichnisses geerbt oder aus dem permissionMode im Frontmatter eines dispatchten Subagents, was bedeutet: Je lockerer Ihre übliche Konfiguration ist, desto mehr unbeaufsichtigte Sessions mit lockeren Rechten entstehen auf einen Schlag. Drei Dinge dringen dann aus der Isolation nach außen. Die Wahl von „Ja, nicht mehr fragen“ speichert die Regel in der .claude/settings.local.json des Haupt-Checkouts, sie gilt also im Haupt-Checkout und in jedem anderen worktree und überlebt das Löschen genau des worktree, in dem sie entstanden ist. Eine Session in der agent view zu löschen, löscht das von Claude erzeugte worktree gleich mit, sodass nicht committete Arbeit verschwindet — und Ctrl+X stoppt beim ersten Druck und löscht beim zweiten. Und .worktreeinclude kopiert per gitignore ausgeschlossene Dateien wie .env in jedes neue worktree und vervielfacht Ihre Zugangsdaten mit der Zahl der dispatchten Sessions. Hinzu kommt, dass das Kontingent proportional zur Parallelität schmilzt (zehn Agenten verbrauchen es etwa zehnmal so schnell) und dass Sessions lokal laufen, den Ruhezustand überstehen, aber beim Herunterfahren der Maschine enden. Zum Abschluss ordnet der Artikel agent view in die vier offiziellen Wege zur Parallelisierung neben Subagents, Agent Teams und dynamischen Workflows ein und gibt einen konkreten Ablauf für die Zeit vor, während und nach einem Dispatch.

ChatGPT Work erklärt: so nutzt du den GPT-5.6-Arbeits-Agent

ChatGPT Work erklärt: so nutzt du den GPT-5.6-Arbeits-Agent

ChatGPT Work ist der „KI-Agent für die Arbeit“, den OpenAI am 9. Juli 2026 zusammen mit GPT-5.6 vorgestellt hat. Anders als ein normaler Chat, der bloß antwortet, sammelt er Kontext aus deinen verbundenen Apps und Dateien, um fertige Ergebnisse zu erstellen — Dokumente, Tabellen, Folien und sogar Web-Apps. Sein Gehirn ist das neue Flaggschiff GPT-5.6 Sol (auf Codex aufgebaut), und es kann ein komplexes Projekt in Schritte zerlegen und stundenlang weiterarbeiten (Thurrott). Innerhalb der vereinten Desktop-App leben drei Modi zusammen — Work (Ergebnisse), Codex (technisch, zeigt Details) und normaler Chat (Gespräch) — wobei Work als die „Business-Version“ positioniert ist, die Codex' technische Details verbirgt (9to5Mac). Das Modell hängt von deinem Tarif ab: Free/Go bekommen standardmäßig Terra, während Plus/Pro/Business/Enterprise aus Sol/Terra/Luna wählen (laut Berichten). Seine Stärke ist das Einbeziehen „deines Kontexts“ über Connectors wie Google Drive, SharePoint und Slack sowie MCP — und für Unternehmen werden Daten standardmäßig nicht fürs Training verwendet. Gestützt auf Axios, TechCrunch, 9to5Mac, Thurrott und OpenAI zeigt dieser Artikel, was ChatGPT Work ist, wie es sich von normalem ChatGPT und Codex unterscheidet, welche Tarife es nutzen können und mit welchen Apps es sich verbindet — mit Sicherheitskennzeichnungen für das, was noch nicht offiziell ist.

GPT-5.6 Sol vs. Gemini 3.1 Pro: Agentisches Coding vs. native Multimodalität

GPT-5.6 Sol vs. Gemini 3.1 Pro: Agentisches Coding vs. native Multimodalität

GPT-5.6 „Sol“ und Gemini 3.1 Pro im direkten Vergleich – zwei Giganten, deren Stärken sich kaum überschneiden. Sol dominiert beim Terminal- und agentischen Coding (Terminal-Bench 88.8% vs. 68.5%, SWE-bench Pro 64.6% vs. 54.2%) sowie bei Mathematik, während Gemini mit nativer Multimodalität (Sprache/Video), etwa halbem Preis und Vorsprung bei MMLU, ARC-AGI-2 und WebDev Arena dagegenhält. Wichtig: Googles eigentlicher Herausforderer 3.5 Pro ist noch nicht verfügbar (GA Mitte Juli). Wir ordnen Leistung, Preis, Multimodalität und die Wahl nach Anwendungsfall ein.

GPT-5.6 vs GPT-5.5 im Vergleich — 3 Modelle, Terra zu 40 % des Preises, Benchmarks und Umstieg

GPT-5.6 vs GPT-5.5 im Vergleich — 3 Modelle, Terra zu 40 % des Preises, Benchmarks und Umstieg

Nur zweieinhalb Monate nach GPT-5.5 kommt GPT-5.6 — und die größte Änderung ist keine bloße Leistungssteigerung, sondern der Umbau von einem Flaggschiff zu drei Modellen: Luna, Terra und Sol. Am stärksten wirkt das Mittelklasse-Modell Terra, das GPT-5.5-vergleichbare Qualität zu einem weitaus niedrigeren Preis bietet: zum Start zum halben Preis, seit der Preissenkung vom 30. Juli 2026 zu 40 % des GPT-5.5-Stückpreises ($2/$12), während Sol bei unverändert $5/$30 mehr Leistung liefert (SWE-Bench Pro 58.6→64.6%, geschätzt). Wir zeigen, was sich geändert hat, wie stark die Kosten sinken (überschlägig $1,100→$440 pro Monat bei 100M Input und 20M Output) und auf welches Modell man umsteigen sollte.

GPT-5.6 Sol vs Claude Fable 5 im ausführlichen Vergleich – Benchmarks, Langzeit-Autonomie, Preis und die richtige Wahl

GPT-5.6 Sol vs Claude Fable 5 im ausführlichen Vergleich – Benchmarks, Langzeit-Autonomie, Preis und die richtige Wahl

Ein ausführlicher Vergleich von OpenAIs Spitzenmodell GPT-5.6 Sol (9. Juli) und Claude Fable 5 (9. Juni), das Anthropic als „das stärkste je allgemein verfügbare Modell“ positioniert. Während das Opus-4.8-Duell ein direktes Aufeinandertreffen in derselben Preisklasse war, geht es hier um die Abwägung zwischen Kosten und Leistung: „der halb so teure Allrounder Sol ($5/$30)“ gegen „das doppelt so teure, aber höchste Fable 5 ($10/$50)“. Beim produktionsreifen SWE-Bench Pro lässt Fable 5 mit 80.3% Sols 64.6% (geschätzt) um mehr als 15 Punkte hinter sich – der Abstand ist größer als im Opus-4.8-Duell. Zudem arbeitet Fable 5 unter Konzentration auf Millionen Tokens bis zu 12 Stunden selbstständig; die „Durchhaltekraft“, mit der Stripe eine Ruby-Migration von 50 Millionen Zeilen an einem Tag abschloss, ist seine Paradedisziplin. Sol dagegen führt bei Terminal-Bedienung (TerminalBench 2.1: 88.8% vs Fable 86.0%), Agents' Last Exam (53.6 vs 40.5) und Coding Agent Index (80 vs 77.2) – und ist mit halbem Preis plus +54% Token-Effizienz stark bei der Preis-Leistung. Der Artikel ordnet Spezifikationen, Benchmark-Details, das „Problem der nicht veröffentlichten Benchmarks“ (OpenAI legt Sols SWE-bench Pro nicht offen), Langzeit-Autonomie, reale Kosten (pro erledigter Aufgabe betrachtet), eine Stärken-Schwächen-Karte und die Wahl nach Anwendungsfall auf Basis offizieller und unabhängiger Benchmarks ein.

GPT-5.6 Sol vs Claude Opus 4.8: Ausführlicher Vergleich von Benchmarks, Coding, Preis und Auswahl

GPT-5.6 Sol vs Claude Opus 4.8: Ausführlicher Vergleich von Benchmarks, Coding, Preis und Auswahl

Ein ausführlicher Vergleich der beiden KI-Coding-Giganten von 2026, Claude Opus 4.8 (28. Mai) und GPT-5.6s Spitzenmodell Sol (9. Juli). Ihre Stärken sind nahezu entgegengesetzt: Sol führt bei Terminalbedienung und agentischer Gesamtstärke (TerminalBench 2.1 88.8% vs Opus 78.9%, Agents' Last Exam 53.6, Coding Agent Index 80), während Opus 4.8 bei produktionsreifem Coding, Mathematik und Langkontext führt (SWE-bench Pro 69.2% vs Sol 64.6%, USAMO 2026 96.7%, GraphWalks 1M 68.1%) und Ehrlichkeit in den Vordergrund stellt (Selbstüberschätzung auf ein Zehntel reduziert, 0% unkritische Meldung fehlerhafter Ergebnisse). OpenAI lässt zudem viele von Sols Benchmarks unveröffentlicht (SWE-bench Pro, GPQA, AIME, MMLU), sodass im Kerngebiet des Codings das offengelegte Opus vorn liegt. Wir behandeln die Spezifikationstabelle, Benchmark-Details, das Problem der unveröffentlichten Benchmarks, reale Kosten ($25 vs $30 Preis pro Token vs +54% Token-Effizienz), eine Stärken-/Schwächen-Karte, Empfehlungen nach Anwendungsfall und eine Dual-Vendor-Strategie.

GPT-5.6 Release: Der vollständige Überblick — Luna/Terra/Sol, Benchmarks, Preise und vs. Claude

GPT-5.6 Release: Der vollständige Überblick — Luna/Terra/Sol, Benchmarks, Preise und vs. Claude

OpenAI hat GPT-5.6 am 9. Juli 2026 allgemein verfügbar gemacht und die alte Struktur aus „Standard + Pro“ durch ein Drei-Modell-System ersetzt: Luna (schnell, günstig, $0.20/$1.20), Terra (ausgewogen, $2/$12, GPT-5.5-Niveau zu 40 % des Sol-Stückpreises) und Sol (Flaggschiff, $5/$30) — Preise nach der Anpassung vom 30. Juli 2026. Sol steht beim Agents' Last Exam (53.6) und beim Coding Agent Index (80) an der Spitze, und seine 88.8% im TerminalBench 2.1 übertreffen Claude Fable 5 (86.0%) knapp — beim produktionsnahen SWE-Bench Pro führt Claude Fable 5 jedoch klar mit 80.0% gegenüber Sols 64.6%. Dieser Artikel behandelt die Unterschiede der drei Modelle, Preise, Benchmarks, neue Funktionen (Programmatic Tool Calling, ChatGPT Work, das Vollduplex-Sprachmodell GPT-Live), die Verfügbarkeit nach ChatGPT-Tarif, den Vergleich mit Claude (Fable 5 / Opus 4.8) und die Wahl nach Anwendungsfall — alles auf Basis der offiziellen Ankündigung von OpenAI und unabhängiger Benchmarks.

Was ist ein LLM-Gateway (Proxy)? Eine API für jeden Anbieter — Leitfaden 2026

Was ist ein LLM-Gateway (Proxy)? Eine API für jeden Anbieter — Leitfaden 2026

Sie haben auf OpenAI aufgebaut, wollten dann Claude ausprobieren und Gemini vergleichen — und verloren Stunden an die je Anbieter unterschiedlichen SDKs, Formate und Fehlerbehandlung. Ein LLM-Gateway (AI-Gateway / LLM-Proxy) ist ein Relais, das Sie zwischen Ihre App und die Anbieter schieben: es stellt eine einzige OpenAI-kompatible API bereit, um jedes Modell zu erreichen, und übernimmt die querschnittlichen Aufgaben — Fallback, Kostenverfolgung, virtuelle Keys, Caching, Rate-Limiting und Observability. Dieser Leitfaden behandelt, warum Sie eines brauchen, was ein Gateway wirklich ist, die drei Typen (Self-hosted-Proxy = LiteLLM / hosted = OpenRouter / SDK = Vercel AI SDK), wie Sie zwischen LiteLLM, OpenRouter und dem Vercel AI SDK wählen, minimalen Setup-Code, der nur den Endpunkt tauscht, und die Grenzen — ein Latenz-Hop, das Gateway als neuer Ausfallpunkt, Gebühren (OpenRouter berechnet 5,5% auf Käufe), Feature-Verlust und Privatsphäre.

KI-Agent-Evals: 5 Wege, Qualität zu messen (2026)

KI-Agent-Evals: 5 Wege, Qualität zu messen (2026)

Nachdem du einen KI-Agenten gebaut hast, stößt du immer an dieselbe Wand: „Okay, aber läuft das wirklich?“ Der Mechanismus, mit dem du entscheidest, ob eine Prompt- oder Modelländerung die Sache mit Daten statt Bauchgefühl besser oder schlechter gemacht hat, sind Evals. LLMs liefern für dieselbe Eingabe jedes Mal eine andere Ausgabe, weshalb Exact-Match-Unit-Tests nicht passen. Dieser Artikel behandelt, was Evals sind, fünf Wege, Qualität zu messen (① Ground-Truth-Abgleich ② regelbasierte Prüfungen ③ LLM-as-judge ④ Regressionstest ⑤ Produktionsmonitoring), die agent-spezifische Bewertung (Aufgaben-Erfolgsrate, korrekte Tool-Aufrufe, Trajektorie, Kosten), wie du klein mit 20 Fehlerbeispielen anfängst, häufige Fallstricke und wichtige Tools (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas) — geschrieben für Praktiker.

KI-Agenten vs. RPA: Der Unterschied und wann man was einsetzt (2026)

KI-Agenten vs. RPA: Der Unterschied und wann man was einsetzt (2026)

Die ewige Automatisierungsfrage: „KI-Agenten oder RPA?“ Die Antwort ist kein Entweder-oder – wählen Sie nach Rolle, und das erfolgreiche Muster 2026 ist ein Hybrid aus beidem. RPA sind deterministische „Hände“, die einen festen Ablauf schnell und präzise ausführen (aber abbrechen, wenn sich Bildschirm/Spezifikation ändert); ein KI-Agent ist ein probabilistisches „Gehirn“, das die Lage liest und entscheidet (stark bei Mehrdeutigkeit und Ausnahmen, aber nicht jedes Mal identisch). Dieser Artikel behandelt den Unterschied im Funktionsprinzip, eine Vergleichstabelle (den Kompromiss zwischen Reproduzierbarkeit und Robustheit), die Auswahl (die Achse lautet „lässt es sich vollständig als Regeln ausschreiben?“ – ja → RPA, nicht ausschreibbares Urteilen → KI-Agent), den Trend 2026 (RPA-Anbieter UiPath, Automation Anywhere, Blue Prism werden agentisch – Konvergenz; die Frage ist nicht mehr „welches von beiden“, sondern „wo ist das Schlussfolgern angesiedelt“ = Orchestration-first) und die praktische Antwort: einen Hybrid, bei dem das Gehirn (KI-Agent) Urteilen/Orchestrierung übernimmt und die Hände (RPA) die deterministische Ausführung leisten – setzen Sie keinen Agenten dort ein, wo Determinismus verlangt wird, und koppeln Sie delegiertes Urteilen mit Leitplanken und menschlicher Freigabe. Auf Basis offizieller Anbieterinformationen, mit FAQ.

Wie man AWS von KI verwalten lässt: Methoden, Vor- & Nachteile (2026)

Wie man AWS von KI verwalten lässt: Methoden, Vor- & Nachteile (2026)

Kann man den AWS-Betrieb an KI abgeben? 2026 lässt sich vieles delegieren. AWS selbst liefert Amazon Q Developer und das Agent Toolkit for AWS (Mai 2026 – 40+ Agent-Skills + ein verwalteter AWS MCP Server + Plugins), sodass KI von der IaC-Generierung bis zu Ressourcenoperationen reichen kann. Dieser Leitfaden fasst „Delegieren“ in drei Stufen (① Code-/IaC-Generierung, ② lesegetriebener Betrieb/Analyse, ③ ein autonomer Agent, der AWS tatsächlich betreibt), behandelt die wichtigsten Werkzeuge (Amazon Q Developer, Agent Toolkit, AWS MCP Server, Terraform MCP, Bedrock AgentCore) – einschließlich des Bring-your-own-Wegs, Claude Code oder Codex die AWS CLI zu geben, um „aws“ aus der Shell auszuführen – die Vorteile (schnelle IaC, automatisierte Triage, Ideen zur Kostenoptimierung, demokratisiertes Wissen) und dann den eigentlichen Punkt, die Nachteile (IAM Permission Sprawl, Überberechtigung als Verstärker des Blast-Radius für Fehler/Prompt Injection, Berechtigungen, die die Aufgabe überdauern, Kosten-Amoklauf – mit realen Vorfällen gelöschter Prod-DBs 2025-26), auf Basis offizieller AWS-Quellen und Berichten von Security-Anbietern. Der entscheidende Dreh: Die Frage ist nicht „geht das?“, sondern „wie delegiert man ohne Amoklauf oder explodierende Rechnung“ – und dass AWS selbst IAM-Guardrails, CloudTrail-Audit und Sandboxing in das Agent Toolkit einbaut, zeigt die Gestalt der Antwort. Enthält die fünf Prinzipien (Least-Privilege-IAM, menschliche Freigabe für destruktive Operationen, Observability, kurzlebige JIT-Zugangsdaten, Sandboxing) und eine FAQ.