Codex Security ist ein Sicherheitsagent, der mögliche Schwachstellen im Code sucht, Belege prüft und bei der Erarbeitung von Korrekturen hilft. Unterscheiden Sie zunächst zwischen dem Plugin für Ihre lokale Codex-Umgebung und Codex Security Cloud, das mit GitHub verbunden wird. Trotz ähnlicher Namen unterscheiden sich Einrichtung, Ausführungsumgebung und Abrechnung.

Code auf Ihrem Computer prüfen

Codex Security

Starten Sie den Scan in einem Chat der Desktop-App oder in Codex CLI. Wählen Sie ein ganzes Repository, einen bestimmten Ordner oder einzelne Änderungen als Ziel.

Änderungen auf GitHub überwachen

Codex Security Cloud

Ein separates Plugin. Es scannt verbundene GitHub-Repositories in der Cloud, wahlweise einmalig oder zur Überwachung neuer Commits.

Dieser Artikel erläutert Auswahl, Preise und Freikontingente, den ersten Scan, den Aufwand tieferer Scans, die Auswertung und die Prüfung von Korrekturen. Grundlage ist die am 7. Oktober 2026 geprüfte OpenAI-Dokumentation. Wir haben keinen Produkt-Scan ausgeführt und berichten daher keine gemessene Erkennungsgenauigkeit, Scan-Dauer oder tatsächlichen Verbrauch.

Quellen: OpenAI, Überblick zu Codex Security und Einstieg in das lokale Plugin.

Lokale Scans, Cloud oder gewöhnliches Review wählen

Bei einer kleinen Änderung können Sie Ihrem üblichen Codex-Chat einen Diff und Ihre Review-Kriterien geben. Das bedeutet nicht, dass dabei automatisch die Artefakte oder Abdeckungsprotokolle eines spezialisierten Scanners entstehen. Ein Code-Review anzufordern und einen Codex-Security-Scan zu starten sind unterschiedliche Aktionen. Zur allgemeinen Auswahl von Entwicklungswerkzeugen lesen Sie unseren Vergleich von Claude Code und Codex.

Funktion oder Implementierungs-Diff prüfenNutzen Sie ein gewöhnliches Codex-Review und nennen Sie die benötigten Prüfungen, etwa Anforderungen, Tests und Lesbarkeit. Für ein Sicherheitsreview kommt auch ein gezielter Changes-Scan infrage.
Ein lokales Repository untersuchenFühren Sie einen Codebase-Scan mit dem Codex-Security-Plugin aus. Bei großen Repositories begrenzen Sie den Umfang auf einen Dienst oder Ordner mit klarer Zuständigkeit und Verantwortung.
GitHub-Commits überwachenNutzen Sie kontinuierliche Scans in Codex Security Cloud. Prüfen Sie GitHub-Verbindung, Zugriffsrechte, Cloud-Umgebung und Abrechnungsbedingungen getrennt vom üblichen Nutzungskontingent.
In CI oder eigene Werkzeuge integrierenEs gibt auch eine eigenständige CLI und ein SDK namens @openai/codex-security . Unterscheiden Sie diese vom Plugin innerhalb von Codex CLI und prüfen Sie Authentifizierung, Ausführungsrechte und Budget separat.

Cloud ist eine Forschungsvorschau und erfordert Zugriff für den jeweiligen Workspace. Auch bei der eigenständigen CLI bedeutet ein öffentlich verfügbares Paket nicht automatisch, dass Ihr Konto Scans ausführen darf. Je nach Konto und Repository kann ein vollständiger Codebase-Scan zusätzlich Zugang über „Trusted Access for Cyber“ erfordern. Ein Abonnementname wie Pro belegt keinen Zugang zu allen Optionen. Wenn eine Option fehlt, prüfen Sie, ob das Plugin aktiviert ist, Ihre Zugriffsrechte und die administrativen Einstellungen Ihrer Organisation.

Quellen: OpenAI, Überblick und Zugangsbedingungen und Sicherheitsreviews von Codeänderungen.

Preise und Freikontingente: auch mit Pro prüfen

Cloud-Scans gehören nicht zum üblichen Plankontingent

Laut OpenAIs Cloud-FAQ werden Repository-Scans und kontinuierliche Scans, die am oder nach dem 1. Oktober 2026 um 12:53 Uhr pazifischer Zeit eingerichtet wurden, in Credits oder US-Dollar zu den Token-Tarifen Ihres Plans abgerechnet. Sie sind nicht im üblichen Plankontingent enthalten. Bei berechtigten Konten werden kostenlose Scan-Credits vor kostenpflichtiger Nutzung verrechnet.

Kontinuierliche Überwachung vor diesem Stichtag eingerichtet

Berechtigte bestehende Überwachung ist bis zum 15. Oktober kostenlos

Später hinzugefügte Scans werden dadurch nicht kostenlos. Nach dem kostenlosen Zeitraum läuft die Überwachung weiter, wenn Sie kostenpflichtige Nutzung aktivieren; andernfalls wird sie pausiert.

Vor diesem Stichtag keine kontinuierliche Überwachung eingerichtet

Berechtigte Konten erhalten kostenlose Scan-Credits im Wert von 500 US-Dollar

Es gelten Teilnahmebedingungen. Einmalige und kontinuierliche Scans nutzen denselben, innerhalb des Workspace geteilten Saldo. Laut FAQ haben diese kostenlosen Scan-Credits kein Ablaufdatum.

Die 500 US-Dollar sind weder eine Barauszahlung noch ein garantiertes Angebot für alle Nutzer. Nach Verbrauch des kostenlosen Guthabens gelten die Abrechnungsregeln des Kontos oder Workspace. Prüfen Sie vor dem Start Ihre Berechtigung, das verbleibende Freiguthaben und die Bedingungen kostenpflichtiger Nutzung in der Oberfläche.

Die angezeigten „Kosten“ sind nicht zwingend Ihre Rechnung

Öffnen Sie in Cloud den betreffenden Scan unter „Scans“, um Tokenzahl und Kosten zu sehen. Fahren Sie über die Tokenzahl, um Eingabe, gecachte Eingabe und Ausgabe aufzuschlüsseln. Die angezeigten Kosten werden vor Freiguthaben oder Abrechnungsbefreiungen berechnet. Deshalb sollten Sie den Abzug kostenloser Credits getrennt von der tatsächlichen Belastung lesen. Scans mit der Kennzeichnung „Exempt from billing. No charges apply.“ werden nicht berechnet.

Quelle für Abrechnung, Freikontingente und angezeigte Kosten: OpenAI, Codex Security Cloud FAQ: Billing. Der Stichtag ist in der Dokumentation in pazifischer Zeit angegeben.

Das Cloud-Freikontingent gilt nicht automatisch für das lokale Plugin

Das lokale Plugin läuft als Codex-Aufgabe. Nach den allgemeinen Codex-Nutzungsregeln hängt der Verbrauch von Abonnement, Modell, Arbeitsumfang und Authentifizierung ab; zusätzliche lokale Arbeit mit API-Schlüssel unterliegt der API-Abrechnung. Die von uns geprüften Anleitungen zur lokalen Einrichtung, zu Standard und Deep sowie die CLI-FAQ enthalten jedoch weder einen Festpreis pro Scan noch eine separate Preistabelle für sämtliche Plugin-Anwendungen. Wir können lokale Scans daher weder als verbrauchsfrei bezeichnen noch behaupten, dass sie das Cloud-Freikontingent von 500 US-Dollar nutzen.

Die eigenständige CLI kann auch nach der Anmeldung einen API-Schlüssel verwenden. Enthält die Umgebung OPENAI_API_KEY oder CODEX_API_KEY, wählen nicht interaktive Scans und Scans mit JSON- oder JSONL-Ausgabe standardmäßig diesen Schlüssel. Sind sowohl ein API-Schlüssel der Umgebung als auch eine gespeicherte ChatGPT-Anmeldung vorhanden, fragen interaktive Scans mit Textausgabe nach der gewünschten Authentifizierung. Die Dokumentation unterstützt die ausdrücklichen Optionen --auth chatgpt und --auth api-key ; legen Sie daher die Abrechnungsmethode vor dem Start fest.

Prüfen Sie Ihr verbleibendes Codex-Kontingent in der Nutzungsübersicht oder mit /status innerhalb von Codex CLI. Die Kosten von Cloud-Scans müssen Sie zusätzlich auf der Cloud-Seite prüfen. Zum Vergleich von Abonnements lesen Sie unseren Leitfaden zu Pro-Preisen und Nutzungskontingenten.

Quellen: OpenAI, Preise und Nutzung von Codex und Work und Auswahl der CLI-Authentifizierung.

Der erste Scan: Schritte und Beispielauftrag

Die folgenden Schritte beschreiben die offizielle Einrichtung. Scannen Sie nur eigenen Code oder Code, zu dessen Prüfung Sie berechtigt sind. Prüfen Sie beim ersten Scan Ziel-Branch, Revision, Ausgabeort und Authentifizierung. Der Einstieg mit Standard macht den Ablauf leichter nachvollziehbar.

Das lokale Plugin in der Desktop-App

  1. Suchen Sie „Codex Security“ in der Plugin-Liste, installieren und aktivieren Sie es. Die Cloud-Version ist ein separates Plugin.
  2. Öffnen Sie in der Seitenleiste „Security“ → „Scans“ → „+ Scan“.
  3. Wählen Sie ein Repository und für einen Codebase-Scan „Codebase“. Lassen Sie „Deep scan“ beim ersten Scan ausgeschaltet.
  4. Prüfen Sie die Zielordner, den aktuellen Branch und die Revision sowie Modell und Denkaufwand.
  5. Ergänzen Sie bei Bedarf öffentliche Einstiegspunkte, Autorisierungsregeln und wichtige Vorgänge in „Additional context“.
  6. Wählen Sie „Start scan“ und verfolgen Sie den Fortschritt der einzelnen Phasen. Lesen Sie anschließend Abdeckung und Belege.

Installieren Sie das Plugin innerhalb von Codex CLI über /plugins und öffnen Sie anschließend mit /new einen neuen Chat für das Ziel-Repository. Wenn Sie den spezialisierten Scan und sein Ziel ausdrücklich nennen, ist Ihr Auftrag klarer dokumentiert als mit „Prüfe die Sicherheit“.

Führe einen Standard-Scan mit Codex Security aus und konzentriere dich auf services/billing.
Priorisiere Nutzereingaben, Eigentümerprüfungen für Rechnungsdaten und administrative Vorgänge.
Prüfe in dieser Aufgabe nur und erstelle einen Bericht. Ändere keinen Quellcode, führe weder commit, push noch deploy aus und ändere keine Abrechnungseinstellungen.
Nenne Zielrevision, geprüften Umfang, ausgeschlossene oder unvollständige Bereiche und Reproduktionsbelege.
Falls eine Einstellungsänderung nötig ist, erläutere die vorgeschlagene Änderung und den Grund und halte dann an.

Dies ist ein Beispielauftrag und keine Sandbox-Konfiguration, die Berechtigungen erzwingt. Scans können Ausgabe-Artefakte und Validierungsarbeiten erfordern. Gehen Sie nicht davon aus, dass schriftliche Einschränkungen allein den gesamten Computer schützen; prüfen Sie auch die Ausführungsrechte.

Die Cloud-Version mit GitHub-Verbindung

  1. Installieren Sie „Codex Security Cloud“ und prüfen Sie die GitHub-Verbindung zum Ziel-Repository.
  2. Wählen Sie unter „Scan“ Repository und Umgebung. „Auto“ erstellt beim Start eine Umgebung; über „Customize“ prüfen Sie eine bereits vorbereitete Umgebung.
  3. Wählen Sie „One-Time Scan“ für eine einmalige Prüfung oder „Continuous Scanning“ zur Überwachung zukünftiger Commits.
  4. Prüfen Sie Preise, Freiguthaben und Ziel, bevor Sie mit „Create“ starten.

Kontinuierliche Scans prüfen den Standard-Branch des Repositorys. Je weiter die berücksichtigte Commit-Historie zurückreicht, desto länger dauert die erste Prüfung. Zum Anhalten öffnen Sie „Repositories“ → Ziel-Repository → „Monitoring settings“, pausieren die Überwachung und speichern. Das Schließen des Fensters stoppt die Überwachung nicht.

Quellen: OpenAI, Plugin-Einrichtung und Cloud-Einrichtung und Überwachung.

Standard und Deep: Umfang und Aufwand anpassen

Eine erste Vergleichsbasis schaffen

Standard

Ein regulärer Scan eines Repositorys oder Ordners. Verstehen Sie zunächst Umfang und erzeugte Belege und nutzen Sie die Ergebnisse dann als Basis für spätere Scans.

Ausgewählte Bereiche genauer untersuchen

Deep

Eine breitere Suche, die mehr Zeit und Ressourcen benötigt. Sie nutzt unabhängige Scan-Worker und deren Unteragenten und führt die Ergebnisse gemäß den eingestellten Bedingungen zusammen.

Die offiziellen Deep-Standardeinstellungen sehen 4 gleichzeitige Worker, 3 Unteragenten pro Worker und eine maximale Laufzeit von 96 Stunden vor. Die 96 Stunden sind ein eingestelltes Limit, keine typische Scan-Dauer. Die Konfiguration des Zeitlimits erfordert Plugin-Version 0.1.19 oder neuer. Beim Erreichen des Limits stoppen unfertige Worker und abgeschlossene Ergebnisse werden zusammengeführt. Ungeprüfte Bereiche bleiben ungeprüft.

Begrenzen Sie das Ziel zunächst auf einen sinnvollen Dienst und lesen Sie die Standard-Ergebnisse, bevor Sie Deep wählen. Eine vertiefte Prüfung lässt sich auch auf wichtige Bereiche wie Zahlungen oder Authentifizierung konzentrieren. Weniger Worker oder kürzere Laufzeiten können den Aufwand reduzieren, aber auch mehr Probleme unentdeckt lassen. Dokumentieren Sie die Abdeckung des günstiger oder schneller ausgeführten Scans.

Mit „Changes“ prüfen Sie einen Diff. Sie können nicht committete Änderungen, einen einzelnen Commit oder Basis- und Zielrevision wählen, aber Deep ist für Changes-Scans nicht verfügbar. Diese prüfen den Diff und direkt zugehörigen Code; sie werden nicht automatisch zu einem Audit der gesamten Codebasis erweitert.

Das Kostenlimit der eigenständigen CLI ist eine Schätzung. Die dokumentierte Option --max-cost verwendet geschätzte Kosten in US-Dollar, um den Stoppzeitpunkt festzulegen. Bereits laufende Anfragen können das Limit beim Abschluss überschreiten; es ist daher keine strikte Abrechnungsobergrenze. Kombinieren Sie es mit Zeit-, Parallelitäts- und Umfangsgrenzen und betrachten Sie einen gestoppten Scan nicht als vollständig.

Quellen: OpenAI, Standard, Deep und Standardeinstellungen, Abdeckung von Changes-Scans sowie geschätzte Kostenlimits.

Abdeckung und Belege lesen, nicht nur Fundzahlen

Die Fundzahl allein belegt keine Scan-Qualität. Ein falsches Ziel, ein vorzeitig gestoppter Scan oder fehlende Autorisierungsregeln können zu null Funden führen, ohne den Code sicher zu machen. Auch der offizielle Standard-Ablauf empfiehlt, zunächst Revision, geprüfte und zurückgestellte Bereiche sowie einzelne Belege zu lesen.

  1. Stimmt das Ziel? Prüfen Sie Repository, Revision und Umfang. Ergebnisse zu altem Code sind keine Zusicherung für die aktuelle Version.
  2. Was wurde nicht geprüft? Prüfen Sie ausgeschlossene, zurückgestellte und unterbrochene Bereiche. Eine Abschlussanzeige bedeutet nicht, dass die ganze Codebasis erfasst wurde.
  3. Halten die Belege stand? Untersuchen Sie den Weg von der Eingabe zum gefährlichen Verhalten, bestehende Schutzmaßnahmen sowie Reproduktionsmethode und Ergebnis.
  4. Ist eine Korrektur nötig? Bewerten Sie tatsächliche Erreichbarkeit und Auswirkungen und korrigieren Sie akzeptierte Funde einzeln.

report.md ist der lesbare Einstieg. Die strukturierte Datei coverage.json protokolliert geprüfte und zurückgestellte Bereiche, während findings.json Fundstellen, Schweregrad, Belege und Korrekturhinweise beschreibt. findings/ kann detaillierte Berichte und Reproduktionsdateien enthalten. Bewahren Sie beim Teilen oder Archivieren zusammengehörige Dateien mit dem Bericht auf.

Ein fiktiver Befund: Zugriff auf Rechnungsdaten anderer Nutzer

„Fehlende Autorisierung“ allein genügt nicht zur Bewertung. Prüfen Sie Endpunkt, Anmeldebedingungen, Verhalten bei Änderung der Rechnungsdatensatz-ID, Ort der Eigentümerprüfung und Kontrollen in anderen Schichten.

Beleg für den Befund: In einer autorisierten Testumgebung wurde die Ausgabe von Daten zur ID eines anderen Nutzers reproduziert.

Grund für weitere Untersuchung: Eine Eigentümerprüfung könnte früher im Ablauf erfolgen; der tatsächliche Aufrufpfad oder die Konfiguration ist noch nicht bestätigt.

Das Beispiel erklärt die Auswertung von Befunden. Es beschreibt keine auf dieser Website oder in einem realen Produkt entdeckte Schwachstelle.

Die eigenständige CLI protokolliert die Abdeckung als complete, partial oder unknown. Eine Abdeckung mit partial oder unknown führt zu Exit-Code 2. Auch wenn ein Befund im nächsten Scan verschwindet, gilt er nicht als behoben, wenn der ursprüngliche Pfad nicht geprüft wurde. Die automatische Cloud-Validierung versucht ebenfalls eine Reproduktion. Ein nicht validiertes Ergebnis beweist keine Sicherheit.

Quellen: OpenAI, Auswertung von Standard-Scans, CLI-Abdeckung und Vergleiche sowie automatische Cloud-Validierung.

Korrekturen, Überprüfung und vertrauliche Daten

Autorisierungsregeln erläutern, um Befunde besser zu bewerten

Beschreiben Sie im Scan-Kontext, wer welche Vorgänge ausführen darf. Beispielsweise: „Nur Eigentümer und Administratoren dürfen Rechnungsdaten abrufen“ oder „Nur der Eigentümer darf eine Datei veröffentlichen“. Im lokalen Plugin kann SECURITY.md dauerhafte Sicherheitsrichtlinien enthalten, während AGENTS.md Anweisungen zur Erstellung und Validierung enthält. Prüfen Sie in Cloud das erzeugte Bedrohungsmodell und ergänzen Sie öffentliche Einstiegspunkte, wichtige Vorgänge und Vertrauensgrenzen.

Ein Bedrohungsmodell beschreibt kurz die Struktur der Anwendung und die zu schützenden Bedingungen. Änderungen in Cloud gelten für zukünftige Scans. Geänderte Annahmen verändern nicht rückwirkend den Prüfumfang früherer Berichte.

Funde einzeln beheben und Reproduktion sowie normales Verhalten prüfen

  1. Befund akzeptieren: Prüfen Sie Belege und tatsächliche Auswirkungen und wählen Sie dann einen Befund aus.
  2. Kleinen Patch erzeugen: Wählen Sie lokal „Patch“ → „Generate patch“. Einen Vorschlag zu erzeugen ist etwas anderes, als ihn auf die Ziel-Arbeitskopie anzuwenden.
  3. Diff lesen: Prüfen Sie vor „Apply patch“, ob sachfremde Änderungen oder Schwächungen anderer Schutzmaßnahmen enthalten sind.
  4. Korrektur überprüfen: Prüfen Sie mit „Verify fix“ die ursprüngliche Reproduktion und das normale Verhalten. Behalten Sie möglichst einen Regressionstest, der vor der Korrektur fehlschlägt und danach besteht.
  5. Befund schließen: Die Überprüfung schließt den Befund nicht automatisch. Prüfen Sie verbleibende Beleglücken und schließen Sie ihn mit Begründung oder untersuchen Sie weiter.

Auch wenn Cloud einen Patch liefert, gehört dessen Prüfung vor dem Erstellen eines Entwurfs-PR zum Ablauf. Erfassen Sie Vorschlag, Anwendung, Überprüfung und Produktivbereitstellung getrennt. Nutzen Sie zusätzlich unsere Prüfungen vor dem Start KI-erstellter Apps , statt alle Entscheidungen einem einzelnen Scanner zu überlassen.

„Lokal“ bedeutet nicht, dass nichts den Computer verlässt

Prüfen Sie auch bei lokaler Ausführung separat den Umgang mit Modellanfragen und Validierungsdaten. Die offizielle Anleitung der eigenständigen CLI warnt: Scans nutzen lokale OS-Rechte, halten nicht für die Genehmigung jeder Aktion an und können Umgebungsvariablen übernehmen. Setzen Sie nicht dieselben Berechtigungen wie bei einem gewöhnlichen Codex-Chat voraus. Bereiten Sie eine Scan-Umgebung ohne unnötige Zugangsdaten vor.

Gespeicherte Protokolle werden nicht unbedingt automatisch bereinigt und können Quellcode oder Zugangsdaten enthalten. Artefakte können auch Reproduktionsschritte und Schwachstellendetails enthalten. Prüfen Sie Inhalte und Freigabekreis vor einem öffentlichen Link oder der Weitergabe an Dritte. Einstellungen zum Modelltraining behandeln wir separat in unserem Leitfaden zu Trainingsdaten und Datenschutz bei ChatGPT und Codex.

Quellen: OpenAI, SECURITY.md und AGENTS.md, Cloud-Bedrohungsmodelle, Korrekturen und Überprüfung sowie Rechte, Artefakte und Protokolle der eigenständigen CLI.

Checkliste vor dem Start

  • Variante: Legen Sie fest, ob Sie lokales Plugin, Cloud oder eigenständige CLI nutzen.
  • Berechtigungen: Prüfen Sie die Erlaubnis zur Code-Prüfung und den Scan-Zugang Ihres Kontos.
  • Abrechnung: Unterscheiden Sie übliches Kontingent, kostenlose Cloud-Credits und API-Abrechnung.
  • Ziel: Fixieren Sie Revision und Umfang; erwägen Sie zunächst Standard.
  • Auswertung: Lesen Sie Abdeckung, Reproduktionsbelege und verbleibende Unsicherheit statt nur Zahlen.
  • Korrekturen: Prüfen und verifizieren Sie jeden Patch einzeln, bevor Sie ihn akzeptieren.

Beginnen Sie für den ersten Scan mit Standard im benötigten Umfang und prüfen Sie, ob Sie die Ergebnisse selbst bewerten können. Erwägen Sie Cloud für kontinuierliche Überwachung oder die eigenständige CLI für automatisierte Abläufe. Nutzen Sie das Produkt als Werkzeug für Entdeckung und Validierung, nicht als Sicherheitsnachweis, der bestehende statische Analyse (SAST) oder menschliche Reviews ersetzt.

Häufige Fragen

F. Ist Codex Security Cloud ohne Aufpreis in ChatGPT Pro enthalten?

Die Dokumentation beschreibt es nicht als Teil des üblichen Plankontingents. Berechtigte Cloud-Scans werden zu Token-Tarifen berechnet; berechtigte Konten erhalten separate kostenlose Scan-Credits und qualifizierte bestehende Überwachung einen kostenlosen Zeitraum. Prüfen Sie Ihren eigenen Saldo und die Bedingungen kostenpflichtiger Nutzung, nicht nur den Abonnementnamen.

F. Genügt ein Review durch gewöhnliches Codex?

Das hängt vom Ziel ab. Ein gewöhnliches Review kann Implementierung und Tests prüfen. Erwägen Sie Codex Security für spezielle Abdeckungsprotokolle, Befunde, Reproduktionsbelege oder kontinuierliche Überwachung. Wir haben die Genauigkeit nicht am selben Code verglichen und behaupten daher nicht, dass das spezielle Produkt immer besser ist.

F. Bedeuten null Funde, dass der Code sicher ist?

Nein. Prüfen Sie zuerst Revision, Umfang, Unterbrechungen und ausgeschlossene Bereiche. Lückenhafte Abdeckung oder fehlende fachliche Autorisierungsregeln können Probleme verbergen. Nutzen Sie zusätzlich bestehende statische Analyse und menschliche Reviews.

F. Garantiert Deep zuverlässige Prüfungen bei geringerem Verbrauch?

Eine solche Garantie gibt es nicht. Deep sucht breiter und nutzt mehr Zeit und Ressourcen als Standard. Passen Sie Ziel, Parallelität und Laufzeit an und lesen Sie bei einem Stopp die Abdeckung. Auch das geschätzte Kostenlimit der eigenständigen CLI ist keine strikte Abrechnungsobergrenze.