Guide · Marcel Steiert

Claude baut, ein zweites Modell prüft

Wie versprochen: der komplette Prüfschritt für alle, die mit Claude Code Automationen bauen. Mit Einrichtung, Regeltext für deine CLAUDE.md und Prüf-Prompt zum Kopieren. Claude baut, Codex von OpenAI liest gegen, und erst nach drei Haken geht etwas live.

Was du brauchst: Claude Code, ein ChatGPT-Konto (laut OpenAI reicht auch das kostenlose) und Node.js ab Version 18.18 auf deinem Rechner. Dein Projektordner muss ein Git-Repository sein. Keine Sorge, das richtet Claude dir in Schritt 1 ein.
Was du bekommst: die Befehle zum Einbinden, den Regeltext für deine CLAUDE.md, meinen Prüf-Prompt, die Sortierregel für die Funde und die Checkliste vor dem Live-Gang.
Was es nicht ist: eine Garantie für fehlerfreien Code. Codex findet Fehler, die Claude übersieht. Die Entscheidung, was live geht, triffst du.

Das Problem: Im Test ist alles grün

Ich lasse Claude eine Automation bauen, die Mails an Kunden verschickt. Claude testet selbst: Mails erstellt, Empfänger stimmen, Ablauf ohne Fehler. Alles abgehakt.

Im Echtbetrieb startet der Server einmal neu, mitten im Versand. Die Automation fängt von vorne an, und jede Mail geht doppelt raus.

Illustratives Beispiel.

Claude prüft mit derselben Brille, mit der er gebaut hat. Er testet, was er sich beim Bauen überlegt hat. Den Fall, an den er nicht gedacht hat, testet er auch nicht. Seine blinden Flecken sieht er nicht.

Zwei Modelle, zwei Brillen

Codex läuft als offizielles Plugin direkt in Claude Code. OpenAI hat es am 30. März 2026 veröffentlicht, es ist Open Source (Apache 2.0). Du musst also nicht zwischen zwei Programmen hin und her kopieren.

Quelle: github.com/openai/codex-plugin-cc (README, Stand Oktober 2026, Version 1.0.6).

Zwei Dinge, die im Carousel keinen Platz hatten:

In 5 Schritten zum Prüfschritt

  1. Den Prüfer einbinden

    Öffne Claude Code in deinem Projektordner und tipp diese Befehle nacheinander ein, jeden einzeln mit Enter:

    In Claude Code · nacheinander
    /plugin marketplace add openai/codex-plugin-cc
    /plugin install codex@openai-codex
    /reload-plugins
    /codex:setup

    /reload-plugins fehlt im Carousel, OpenAI nennt den Befehl aber in der Anleitung. Er lädt das frisch installierte Plugin, ohne dass du Claude Code neu starten musst.

    /codex:setup prüft, ob Codex bereit ist. Fehlt das Codex-Programm, bietet es dir an, es zu installieren. Bist du noch nicht angemeldet, tippst du:

    In Claude Code · Anmelden
    !codex login

    Es öffnet sich ein Browserfenster, dort meldest du dich mit deinem ChatGPT-Konto an. Danach /codex:setup noch einmal ausführen, jetzt sollte alles bereit sein.

    Ist dein Ordner noch kein Git-Repository, gib Claude diesen Auftrag:

    Auftrag an Claude · Git einrichten
    Mach aus diesem Ordner ein Git-Repository, falls er noch keins ist. Leg eine .gitignore an, in der .env und alle Dateien mit Passwörtern, Tokens oder Kundendaten stehen. Speichere dann den aktuellen Stand als ersten Commit mit der Beschreibung "Ausgangsstand". Erklär mir in zwei Sätzen, was du gemacht hast.

    Git ist hier nur dein Spielstand: Codex vergleicht jede neue Änderung mit dem zuletzt gespeicherten Stand. Hochladen musst du nichts.

  2. Eine Regel: nichts ohne Prüfung

    Die CLAUDE.md ist die Datei, die Claude Code bei jedem Start in deinem Projekt liest. Gibt es sie noch nicht, sag Claude: „Leg eine CLAUDE.md an.“ Dann kopierst du diesen Regeltext hinein:

    Regeltext · CLAUDE.md
    ## Prüfschritt mit Codex
    
    Eine größere Änderung ist: eine neue Automation, alles, was Mails, Nachrichten oder Zahlungen auslöst, alles, was Daten schreibt oder löscht, und jede Änderung an mehr als einer Datei.
    
    Nach jeder größeren Änderung:
    1. Halte an und fasse in höchstens drei Sätzen zusammen, was du geändert hast.
    2. Speichere nichts als Commit. Codex prüft die noch nicht gespeicherten Änderungen.
    3. Bitte mich, die Prüfung zu starten, und schlag mir dafür einen fertigen Befehl vor: /codex:adversarial-review --wait, gefolgt von den Fragen, die zu genau dieser Änderung passen.
    
    Wenn der Bericht von Codex da ist:
    4. Zeig mir jeden Fund in einer Tabelle: Nr. | Fund | Fundstelle (Datei und Zeile) | Schweregrad | dein Vorschlag. Schweregrad: HOCH (critical oder high bei Codex), MITTEL (medium), TIEF (low).
    5. Ändere nichts, bevor ich OK geschrieben habe.
    6. Nach meinem OK behebst du alle Funde HOCH und MITTEL. Funde TIEF nur, wenn ich es ausdrücklich sage.
    7. Danach bittest du mich um eine zweite Prüfung. Erst wenn keine Funde HOCH oder MITTEL mehr offen sind, schlägst du einen Commit vor.
    
    Nie live schalten, aktivieren, deployen oder versenden, bevor ich das Wort "live" geschrieben habe.

    Was „größer“ heißt, legst du selbst fest. Die Definition oben ist mein Startpunkt. Für einen Tippfehler im Text brauchst du keine Prüfung, für alles, was bei Kunden ankommt, schon.

  3. Gezielt fragen, nicht loben lassen

    „Schau mal drüber“ bringt dir wenig. Du bekommst ein freundliches „sieht gut aus“ und zwei Kleinigkeiten. Frag stattdessen nach dem, was im Echtbetrieb wehtut. Das geht mit dem Befehl /codex:adversarial-review: Er nimmt nach dem Befehl einen eigenen Prüf-Auftrag an und stellt die Lösung bewusst in Frage.

    Prüf-Prompt · In Claude Code
    /codex:adversarial-review --wait Was bricht im Echtbetrieb? Was passiert bei leeren oder doppelten Daten, bei einem Neustart mitten im Ablauf und wenn derselbe Auftrag zweimal kommt? Wird irgendetwas doppelt verschickt, doppelt gebucht oder ohne Rückfrage gelöscht? Nenne für jeden Fund Fundstelle und Schweregrad. Kein Lob, nur Funde. Erfinde keine Fehler: Wo du nichts findest, schreib "nichts gefunden".

    Die Fragen passt du an deine Automation an. Bei einer Rechnungs-Automation fragst du nach Beträgen und Rundung, bei einer Kundenliste nach Duplikaten und fehlenden Feldern.

    Weitere nützliche Varianten:

  4. Nur echte Funde zurück an Claude

    Codex meldet seine Funde mit Schweregrad, Datei und Zeile. Nicht jeder Fund ist gleich wichtig. Meine Sortierregel:

    Illustrative Beispiele.

    Mit der Regel aus Schritt 2 zeigt Claude dir die Funde schon als Tabelle. Willst du die Übergabe ausdrücklich machen, nimm diesen Prompt:

    Übergabe-Prompt · An Claude
    Codex hat deine Änderung geprüft, der Bericht steht oben. Geh jeden Fund mit Schweregrad HOCH und MITTEL einzeln durch:
    - Ist er berechtigt, behebe ihn mit der kleinsten sicheren Änderung.
    - Ist er nicht berechtigt, begründe in einem Satz, warum nicht.
    Funde TIEF listest du nur auf, ohne sie zu ändern.
    
    Gib mir danach eine kurze Liste: was du geändert hast, welche Funde du abgelehnt hast und warum. Speichere noch keinen Commit.

    Danach den Prüf-Prompt aus Schritt 3 noch einmal laufen lassen. Die zweite Runde ist meist schnell und zeigt dir, ob die Korrektur neue Probleme gebracht hat.

  5. Erst dann geht es live

    Drei Haken, bevor du „live“ schreibst:

    • Codex hat die Änderung geprüft.
    • Alle Funde HOCH und MITTEL sind behoben oder begründet abgelehnt.
    • Du hast den Bericht selbst gelesen, nicht nur die Zusammenfassung von Claude.

    Dann den geprüften Stand speichern, damit die nächste Prüfung nur die neuen Änderungen sieht:

    Auftrag an Claude · Stand speichern
    Die Prüfung ist abgeschlossen. Speichere den aktuellen Stand als Commit mit einer kurzen Beschreibung, was geändert wurde und dass Codex geprüft hat.

    Minuten kostet die Prüfung, Stunden ein Fehler im Echtbetrieb.


Für Fortgeschrittene: die Prüfung automatisch

Das Plugin hat ein sogenanntes Review-Gate. Ist es eingeschaltet, prüft Codex jedes Mal, wenn Claude eine Antwort mit Code-Änderungen abschließen will. Findet Codex etwas, muss Claude erst nachbessern.

In Claude Code · Gate an / aus
/codex:setup --enable-review-gate
/codex:setup --disable-review-gate
Vorsicht: OpenAI warnt selbst, dass das Gate eine lange Schleife zwischen Claude und Codex auslösen und deine Nutzungslimits schnell aufbrauchen kann. Schalte es nur ein, wenn du danebensitzt. Für den Start empfehle ich den Weg oben: Claude hält an, du startest die Prüfung.

Ehrlich gesagt: die Grenzen

Neue Guides direkt per Mail

Trag dich ein und ich schreibe dir, wenn ich neue Guides dazu veröffentliche, wie du als Unternehmer Claude und KI-Systeme im Alltag einsetzt. Kein Spam, Abmelden jederzeit per kurzer Mail.

Mit dem Eintragen bist du einverstanden, dass ich dir zu diesem Thema schreibe. Details in der Datenschutzerklärung.

Mehr solche Guides? Ich zeige auf Instagram, wie du Claude und KI-Systeme wirklich in deinem Business einsetzt. Folge mir auf @marcel.steiert.