Eine prompt-basierte Claude-Code-Skill, die eine geplante KI-Antwort vor der Auslieferung ethisch prüft und strukturiert entscheidet:
approve · revise · refuse · clarify · escalate
Sie liefert Begründung, erforderliche Änderungen, eine sicher überarbeitete Antwort, optional eine
Eskalationsnotiz — und maschinenlesbare audit_tags für ein nachgelagertes Audit-/Logging-System.
⚠️ Abgrenzung: Diese Skill ist eine Prüfschicht, keine Garantie. Sie ersetzt weder Rechts-, Steuer-, Medizin- oder Compliance-Beratung noch menschliche Verantwortung, Audit-Logging, Zugriffskontrollen oder Plattform-Safety. Ziel ist eine strukturierte, dokumentierbare Risikoprüfung — kein absolutes ethisches oder rechtliches Urteil.
User-Prompt → Modell erzeugt Draft → ETHICAL RESPONSE REVIEWER → approve | revise | refuse | clarify | escalate → finale Antwort (+ audit_tags)
Liegt kein expliziter Draft vor, wird zuerst intern eine Antwort entworfen und dieser Entwurf geprüft.
| Entscheidung | Wann | risk_level | Pflichtfeld |
|---|---|---|---|
| approve | keine relevanten ethischen Risiken | low |
— |
| revise | grundsätzlich möglich, aber anzupassen | medium |
revised_response |
| refuse | unterstützt unmittelbar Schaden/Diskriminierung/Rechtsbruch | high |
refusal_response |
| clarify | ohne Zusatzinfo keine belastbare Bewertung | medium |
Rückfrage in reasons |
| escalate | erhebliche Folgen, menschliche Fachprüfung nötig | high |
escalation_note |
ethical-response-reviewer/
├── SKILL.md Kern: 7 Prüfdimensionen, 5 Entscheidungen, Ausgabeformate
├── references/
│ ├── pruefkriterien.md vollständige Fragenkataloge je Dimension (+ Hochrisiko-Liste)
│ ├── entscheidungslogik-und-schema.md Entscheidungswahl, Datenmodell, striktes JSON-Schema, audit_tags
│ ├── beispiele.md 3 ausgearbeitete Fälle (revise/refuse/escalate) mit JSON
│ └── governance.md Logging, Policy-Versionierung, Grenzen, produktiver Einsatz
└── evals/
├── evals.json 7 Inhalts-Testfälle über alle 5 Entscheidungen
├── trigger_eval.json 20 Trigger-Queries (10 auslösend / 10 Near-Miss)
└── README.md wie man beide Eval-Sets ausführt
Kopiere den Ordner ethical-response-reviewer/ in dein Claude-Skills-Verzeichnis:
git clone https://github.com/obimad/EthicalClaudeSkill.git
# macOS/Linux:
cp -r EthicalClaudeSkill/ethical-response-reviewer ~/.claude/skills/Windows (PowerShell):
Copy-Item -Recurse EthicalClaudeSkill\ethical-response-reviewer "$env:USERPROFILE\.claude\skills\"Die Skill erscheint nach einem Neustart der Claude-Code-Session in der Skill-Liste und löst dann in den passenden Kontexten automatisch aus.
Auslöser sind u. a. „darf diese Antwort so raus?", „prüfe/überarbeite diesen Entwurf", „ist das ethisch vertretbar?" — besonders in Hochrisiko-Kontexten (Recht, Steuern, Medizin, Finanzen, Beschäftigung, öffentliche Verwaltung, Minderjährige, personenbezogene/Gesundheitsdaten, automatisierte Entscheidungen).
Zwei Ausgabemodi:
- (a) Bewertung sichtbar — lesbares Format oder striktes JSON-Schema, wenn ausdrücklich verlangt.
- (b) nur die finale Antwort — bei
approveder Draft, beirevisedie überarbeitete Fassung; der interne Review wird nicht gezeigt.
Entscheidungsgüte (evals.json) und Auslösegüte (trigger_eval.json) sind in den
skill-creator Eval-Harness eingehängt — Ausführung siehe
ethical-response-reviewer/evals/README.md.
Die Skill reduziert Risiken, schließt sie aber nicht aus. Sie ersetzt nicht Rechts-/Steuer-/
Medizinberatung, Datenschutzprüfung, Compliance-Freigaben, menschliche Verantwortung, technische
Zugriffskontrollen oder Missbrauchserkennung auf Systemebene. Details: references/governance.md.
Umgesetzt nach der Spezifikation „Ethical Response Layer für KI-Systeme". Hausstil und Aufbau
orientieren sich an einer Suite deutscher AI-Governance-Skills (u. a. box-prompting).
© 2026 Stefan Werner. Lizenz: MIT (siehe LICENSE) — frei nutzbar, veränder- und weitergebbar, auch kommerziell. Einzige Bedingung: den Copyright- und Lizenzhinweis in Kopien und abgeleiteten Werken erhalten, also Namensnennung „Stefan Werner".
box-prompting (Scheinsicherheit/Halluzination) · the-fool (Gegenprüfung) · anonymisierung-de
(Datenschutz) · agent-defense (untrusted Input) · karpathy-guidelines (Qualitäts-Gate).