Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

3 Commits
 
 
 
 
 
 
 
 

Repository files navigation

Ethical Response Reviewer

Eine prompt-basierte Claude-Code-Skill, die eine geplante KI-Antwort vor der Auslieferung ethisch prüft und strukturiert entscheidet:

approve · revise · refuse · clarify · escalate

Sie liefert Begründung, erforderliche Änderungen, eine sicher überarbeitete Antwort, optional eine Eskalationsnotiz — und maschinenlesbare audit_tags für ein nachgelagertes Audit-/Logging-System.

⚠️ Abgrenzung: Diese Skill ist eine Prüfschicht, keine Garantie. Sie ersetzt weder Rechts-, Steuer-, Medizin- oder Compliance-Beratung noch menschliche Verantwortung, Audit-Logging, Zugriffskontrollen oder Plattform-Safety. Ziel ist eine strukturierte, dokumentierbare Risikoprüfung — kein absolutes ethisches oder rechtliches Urteil.

Position im Ablauf

User-Prompt → Modell erzeugt Draft → ETHICAL RESPONSE REVIEWER → approve | revise | refuse | clarify | escalate → finale Antwort (+ audit_tags)

Liegt kein expliziter Draft vor, wird zuerst intern eine Antwort entworfen und dieser Entwurf geprüft.

Die fünf Entscheidungen

Entscheidung Wann risk_level Pflichtfeld
approve keine relevanten ethischen Risiken low
revise grundsätzlich möglich, aber anzupassen medium revised_response
refuse unterstützt unmittelbar Schaden/Diskriminierung/Rechtsbruch high refusal_response
clarify ohne Zusatzinfo keine belastbare Bewertung medium Rückfrage in reasons
escalate erhebliche Folgen, menschliche Fachprüfung nötig high escalation_note

Struktur

ethical-response-reviewer/
├── SKILL.md                                   Kern: 7 Prüfdimensionen, 5 Entscheidungen, Ausgabeformate
├── references/
│   ├── pruefkriterien.md                      vollständige Fragenkataloge je Dimension (+ Hochrisiko-Liste)
│   ├── entscheidungslogik-und-schema.md       Entscheidungswahl, Datenmodell, striktes JSON-Schema, audit_tags
│   ├── beispiele.md                           3 ausgearbeitete Fälle (revise/refuse/escalate) mit JSON
│   └── governance.md                          Logging, Policy-Versionierung, Grenzen, produktiver Einsatz
└── evals/
    ├── evals.json                             7 Inhalts-Testfälle über alle 5 Entscheidungen
    ├── trigger_eval.json                      20 Trigger-Queries (10 auslösend / 10 Near-Miss)
    └── README.md                              wie man beide Eval-Sets ausführt

Installation

Kopiere den Ordner ethical-response-reviewer/ in dein Claude-Skills-Verzeichnis:

git clone https://github.com/obimad/EthicalClaudeSkill.git
# macOS/Linux:
cp -r EthicalClaudeSkill/ethical-response-reviewer ~/.claude/skills/

Windows (PowerShell):

Copy-Item -Recurse EthicalClaudeSkill\ethical-response-reviewer "$env:USERPROFILE\.claude\skills\"

Die Skill erscheint nach einem Neustart der Claude-Code-Session in der Skill-Liste und löst dann in den passenden Kontexten automatisch aus.

Nutzung

Auslöser sind u. a. „darf diese Antwort so raus?", „prüfe/überarbeite diesen Entwurf", „ist das ethisch vertretbar?" — besonders in Hochrisiko-Kontexten (Recht, Steuern, Medizin, Finanzen, Beschäftigung, öffentliche Verwaltung, Minderjährige, personenbezogene/Gesundheitsdaten, automatisierte Entscheidungen).

Zwei Ausgabemodi:

  • (a) Bewertung sichtbar — lesbares Format oder striktes JSON-Schema, wenn ausdrücklich verlangt.
  • (b) nur die finale Antwort — bei approve der Draft, bei revise die überarbeitete Fassung; der interne Review wird nicht gezeigt.

Evals

Entscheidungsgüte (evals.json) und Auslösegüte (trigger_eval.json) sind in den skill-creator Eval-Harness eingehängt — Ausführung siehe ethical-response-reviewer/evals/README.md.

Grenzen

Die Skill reduziert Risiken, schließt sie aber nicht aus. Sie ersetzt nicht Rechts-/Steuer-/ Medizinberatung, Datenschutzprüfung, Compliance-Freigaben, menschliche Verantwortung, technische Zugriffskontrollen oder Missbrauchserkennung auf Systemebene. Details: references/governance.md.

Herkunft & Lizenz

Umgesetzt nach der Spezifikation „Ethical Response Layer für KI-Systeme". Hausstil und Aufbau orientieren sich an einer Suite deutscher AI-Governance-Skills (u. a. box-prompting).

© 2026 Stefan Werner. Lizenz: MIT (siehe LICENSE) — frei nutzbar, veränder- und weitergebbar, auch kommerziell. Einzige Bedingung: den Copyright- und Lizenzhinweis in Kopien und abgeleiteten Werken erhalten, also Namensnennung „Stefan Werner".

Verwandte Skills

box-prompting (Scheinsicherheit/Halluzination) · the-fool (Gegenprüfung) · anonymisierung-de (Datenschutz) · agent-defense (untrusted Input) · karpathy-guidelines (Qualitäts-Gate).

About

Ethische Prüfschicht für KI-Antworten: bewertet einen Antwortentwurf VOR der Auslieferung und entscheidet approve/revise/refuse/clarify/escalate. Claude Code Skill (DE), MIT.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors