Claude baut, ein zweites Modell prüft
Wie versprochen: der komplette Prüfschritt für alle, die mit Claude Code Automationen bauen. Mit Einrichtung, Regeltext für deine CLAUDE.md und Prüf-Prompt zum Kopieren. Claude baut, Codex von OpenAI liest gegen, und erst nach drei Haken geht etwas live.
Das Problem: Im Test ist alles grün
Ich lasse Claude eine Automation bauen, die Mails an Kunden verschickt. Claude testet selbst: Mails erstellt, Empfänger stimmen, Ablauf ohne Fehler. Alles abgehakt.
Im Echtbetrieb startet der Server einmal neu, mitten im Versand. Die Automation fängt von vorne an, und jede Mail geht doppelt raus.
Illustratives Beispiel.
Claude prüft mit derselben Brille, mit der er gebaut hat. Er testet, was er sich beim Bauen überlegt hat. Den Fall, an den er nicht gedacht hat, testet er auch nicht. Seine blinden Flecken sieht er nicht.
Zwei Modelle, zwei Brillen
Codex läuft als offizielles Plugin direkt in Claude Code. OpenAI hat es am 30. März 2026 veröffentlicht, es ist Open Source (Apache 2.0). Du musst also nicht zwischen zwei Programmen hin und her kopieren.
Quelle: github.com/openai/codex-plugin-cc (README, Stand Oktober 2026, Version 1.0.6).
- Codex prüft nur in einem Git-Repository. Er schaut sich die Änderungen seit dem letzten gespeicherten Stand an. Ohne Git bricht der Befehl ab.
- Claude kann die Prüfung nicht selbst starten. OpenAI hat die beiden Review-Befehle so gebaut, dass nur du sie eintippen kannst. Die Regel in Schritt 2 sorgt deshalb dafür, dass Claude anhält und dich darum bittet. Das ist kein Nachteil: So bleibt die Prüfung in deiner Hand.
In 5 Schritten zum Prüfschritt
-
Den Prüfer einbinden
Öffne Claude Code in deinem Projektordner und tipp diese Befehle nacheinander ein, jeden einzeln mit Enter:
In Claude Code · nacheinander/plugin marketplace add openai/codex-plugin-cc /plugin install codex@openai-codex /reload-plugins /codex:setup
/reload-pluginsfehlt im Carousel, OpenAI nennt den Befehl aber in der Anleitung. Er lädt das frisch installierte Plugin, ohne dass du Claude Code neu starten musst./codex:setupprüft, ob Codex bereit ist. Fehlt das Codex-Programm, bietet es dir an, es zu installieren. Bist du noch nicht angemeldet, tippst du:In Claude Code · Anmelden!codex login
Es öffnet sich ein Browserfenster, dort meldest du dich mit deinem ChatGPT-Konto an. Danach
/codex:setupnoch einmal ausführen, jetzt sollte alles bereit sein.Ist dein Ordner noch kein Git-Repository, gib Claude diesen Auftrag:
Auftrag an Claude · Git einrichtenMach aus diesem Ordner ein Git-Repository, falls er noch keins ist. Leg eine .gitignore an, in der .env und alle Dateien mit Passwörtern, Tokens oder Kundendaten stehen. Speichere dann den aktuellen Stand als ersten Commit mit der Beschreibung "Ausgangsstand". Erklär mir in zwei Sätzen, was du gemacht hast.
Git ist hier nur dein Spielstand: Codex vergleicht jede neue Änderung mit dem zuletzt gespeicherten Stand. Hochladen musst du nichts.
-
Eine Regel: nichts ohne Prüfung
Die CLAUDE.md ist die Datei, die Claude Code bei jedem Start in deinem Projekt liest. Gibt es sie noch nicht, sag Claude: „Leg eine CLAUDE.md an.“ Dann kopierst du diesen Regeltext hinein:
Regeltext · CLAUDE.md## Prüfschritt mit Codex Eine größere Änderung ist: eine neue Automation, alles, was Mails, Nachrichten oder Zahlungen auslöst, alles, was Daten schreibt oder löscht, und jede Änderung an mehr als einer Datei. Nach jeder größeren Änderung: 1. Halte an und fasse in höchstens drei Sätzen zusammen, was du geändert hast. 2. Speichere nichts als Commit. Codex prüft die noch nicht gespeicherten Änderungen. 3. Bitte mich, die Prüfung zu starten, und schlag mir dafür einen fertigen Befehl vor: /codex:adversarial-review --wait, gefolgt von den Fragen, die zu genau dieser Änderung passen. Wenn der Bericht von Codex da ist: 4. Zeig mir jeden Fund in einer Tabelle: Nr. | Fund | Fundstelle (Datei und Zeile) | Schweregrad | dein Vorschlag. Schweregrad: HOCH (critical oder high bei Codex), MITTEL (medium), TIEF (low). 5. Ändere nichts, bevor ich OK geschrieben habe. 6. Nach meinem OK behebst du alle Funde HOCH und MITTEL. Funde TIEF nur, wenn ich es ausdrücklich sage. 7. Danach bittest du mich um eine zweite Prüfung. Erst wenn keine Funde HOCH oder MITTEL mehr offen sind, schlägst du einen Commit vor. Nie live schalten, aktivieren, deployen oder versenden, bevor ich das Wort "live" geschrieben habe.
Was „größer“ heißt, legst du selbst fest. Die Definition oben ist mein Startpunkt. Für einen Tippfehler im Text brauchst du keine Prüfung, für alles, was bei Kunden ankommt, schon.
-
Gezielt fragen, nicht loben lassen
„Schau mal drüber“ bringt dir wenig. Du bekommst ein freundliches „sieht gut aus“ und zwei Kleinigkeiten. Frag stattdessen nach dem, was im Echtbetrieb wehtut. Das geht mit dem Befehl
/codex:adversarial-review: Er nimmt nach dem Befehl einen eigenen Prüf-Auftrag an und stellt die Lösung bewusst in Frage.Prüf-Prompt · In Claude Code/codex:adversarial-review --wait Was bricht im Echtbetrieb? Was passiert bei leeren oder doppelten Daten, bei einem Neustart mitten im Ablauf und wenn derselbe Auftrag zweimal kommt? Wird irgendetwas doppelt verschickt, doppelt gebucht oder ohne Rückfrage gelöscht? Nenne für jeden Fund Fundstelle und Schweregrad. Kein Lob, nur Funde. Erfinde keine Fehler: Wo du nichts findest, schreib "nichts gefunden".
Die Fragen passt du an deine Automation an. Bei einer Rechnungs-Automation fragst du nach Beträgen und Rundung, bei einer Kundenliste nach Duplikaten und fehlenden Feldern.
Weitere nützliche Varianten:
/codex:reviewNormale Code-Prüfung ohne eigenen Auftrag. Gut für schnelle Durchgänge.--backgroundStatt--wait: Die Prüfung läuft im Hintergrund und du arbeitest weiter. Bei großen Änderungen sinnvoll, denn eine Prüfung kann ein paar Minuten dauern./codex:statusZeigt, ob die Prüfung im Hintergrund noch läuft./codex:resultHolt den fertigen Bericht. -
Nur echte Funde zurück an Claude
Codex meldet seine Funde mit Schweregrad, Datei und Zeile. Nicht jeder Fund ist gleich wichtig. Meine Sortierregel:
HOCHZum Beispiel Doppelversand nach einem Neustart. Geht zurück an Claude.MITTELZum Beispiel eine leere Empfängerliste, bei der die Automation abstürzt. Geht zurück an Claude.TIEFZum Beispiel ein unschöner Variablenname. Du entscheidest, ob es sich lohnt.Illustrative Beispiele.
Mit der Regel aus Schritt 2 zeigt Claude dir die Funde schon als Tabelle. Willst du die Übergabe ausdrücklich machen, nimm diesen Prompt:
Übergabe-Prompt · An ClaudeCodex hat deine Änderung geprüft, der Bericht steht oben. Geh jeden Fund mit Schweregrad HOCH und MITTEL einzeln durch: - Ist er berechtigt, behebe ihn mit der kleinsten sicheren Änderung. - Ist er nicht berechtigt, begründe in einem Satz, warum nicht. Funde TIEF listest du nur auf, ohne sie zu ändern. Gib mir danach eine kurze Liste: was du geändert hast, welche Funde du abgelehnt hast und warum. Speichere noch keinen Commit.
Danach den Prüf-Prompt aus Schritt 3 noch einmal laufen lassen. Die zweite Runde ist meist schnell und zeigt dir, ob die Korrektur neue Probleme gebracht hat.
-
Erst dann geht es live
Drei Haken, bevor du „live“ schreibst:
- Codex hat die Änderung geprüft.
- Alle Funde HOCH und MITTEL sind behoben oder begründet abgelehnt.
- Du hast den Bericht selbst gelesen, nicht nur die Zusammenfassung von Claude.
Dann den geprüften Stand speichern, damit die nächste Prüfung nur die neuen Änderungen sieht:
Auftrag an Claude · Stand speichernDie Prüfung ist abgeschlossen. Speichere den aktuellen Stand als Commit mit einer kurzen Beschreibung, was geändert wurde und dass Codex geprüft hat.
Minuten kostet die Prüfung, Stunden ein Fehler im Echtbetrieb.
Für Fortgeschrittene: die Prüfung automatisch
Das Plugin hat ein sogenanntes Review-Gate. Ist es eingeschaltet, prüft Codex jedes Mal, wenn Claude eine Antwort mit Code-Änderungen abschließen will. Findet Codex etwas, muss Claude erst nachbessern.
/codex:setup --enable-review-gate /codex:setup --disable-review-gate
Ehrlich gesagt: die Grenzen
- Codex kann auch irren. Er übersieht Fehler und meldet manchmal welche, die keine sind. Darum entscheidest du, was zurück an Claude geht.
- Codex sieht nur, was im Ordner liegt. Läuft deine Automation zum Beispiel in n8n oder Make, exportiere den Workflow als Datei in den Projektordner, sonst hat Codex nichts zu prüfen.
- Die Prüfung kostet Kontingent. Jede Prüfung zählt auf deine Codex-Nutzungslimits bei OpenAI. Mit dem kostenlosen Konto sind die knapp. Prüf deshalb gezielt die größeren Änderungen, nicht jeden Tippfehler.
- Deine Dateien gehen an OpenAI. Codex liest den Code in deinem Projekt. Passwörter, Tokens und Kundendaten gehören deshalb nicht in die Dateien, sondern in eine .env, die nicht mitgespeichert wird.
- Zwei Modelle ersetzen keinen Test im echten Betrieb. Lass eine neue Automation zuerst mit deiner eigenen Adresse oder ein paar Testdaten laufen, bevor sie an Kunden geht.
Neue Guides direkt per Mail
Trag dich ein und ich schreibe dir, wenn ich neue Guides dazu veröffentliche, wie du als Unternehmer Claude und KI-Systeme im Alltag einsetzt. Kein Spam, Abmelden jederzeit per kurzer Mail.
Mehr solche Guides? Ich zeige auf Instagram, wie du Claude und KI-Systeme wirklich in deinem Business einsetzt. Folge mir auf @marcel.steiert.